Nomic / nomic-embed-text-v1.5
Milvus Integrated
작업: 임베딩
형태: 텍스트
유사성 측정법: 코사인
라이선스: Apache 2.0
차원: 768
최대 입력 토큰: 8192
가격: 무료
nomic-embed-text-v1.5 소개
nomic-embed-text-v1.5 모델은 8192토큰 입력 창과 가변 임베딩 크기를 지원하는 텍스트 임베딩 모델입니다. Matryoshka Representation Learning으로 학습되어 개발자가 동일한 모델에서 간결한 임베딩 또는 더 높은 용량의 임베딩을 생성할 수 있으며, 권장 크기는 768, 512, 256, 128, 64입니다.
Nomic-embed-text-v1.5는 이제 동일한 임베딩 공간을 공유하는 nomic-embed-vision-v1.5를 통해 멀티모달을 지원하므로, 텍스트 임베딩을 이미지 임베딩과 함께 직접 사용할 수 있습니다.
nomic-embed-text-v1.5로 임베딩을 생성하는 방법
벡터 임베딩을 생성하는 주요 방법은 두 가지입니다:
- PyMilvus:
nomic-embed-text-v1.5모델을 원활하게 통합하는 Milvus용 Python SDK입니다. - Nomic Python SDK의
embed모듈은 Nomic Embedding API를 사용하여 임베딩 기능을 제공합니다.
벡터 임베딩이 생성되면 Zilliz Cloud(Milvus를 기반으로 하는 완전 관리형 벡터 데이터베이스 서비스)에 저장하고 의미적 유사도 검색에 사용할 수 있습니다. 다음은 네 가지 핵심 단계입니다:
- Zilliz Cloud 계정에 무료로 가입합니다.
- 서버리스 클러스터를 설정하고 Public Endpoint 및 API Key를 얻습니다.
- 벡터 컬렉션을 생성하고 벡터 임베딩을 삽입합니다.
- 저장된 임베딩에 대해 의미적 검색을 실행합니다.
PyMilvus를 통해 임베딩을 생성하고 의미적 검색을 위해 Zilliz Cloud에 삽입하기
from pymilvus import MilvusClient
from nomic import embed
# Prepare documents
docs = [
"Artificial intelligence was founded as an academic discipline in 1956.",
"Alan Turing was the first person to conduct substantial research in AI.",
"Born in Maida Vale, London, Turing was raised in southern England.",
]
# Generate embeddings for documents using nomic-embed-text-v1.5
docs_embeddings = embed.text(
texts=docs, model="nomic-embed-text-v1.5", task_type="search_document"
)["embeddings"]
# Prepare queries
queries = ["When was artificial intelligence founded", "Where was Alan Turing born?"]
# Generate embeddings for queries
query_embeddings = embed.text(
texts=queries, model="nomic-embed-text-v1.5", task_type="search_query"
)["embeddings"]
# Connect to Zilliz Cloud with Public Endpoint and API Key
client = MilvusClient(uri=ZILLIZ_PUBLIC_ENDPOINT, token=ZILLIZ_API_KEY)
COLLECTION = "nomic_v1_5_documents"
# Drop collection if it exists
if client.has_collection(collection_name=COLLECTION):
client.drop_collection(collection_name=COLLECTION)
# Create collection with dimension 768 (nomic-embed-text-v1.5 output dimension)
client.create_collection(collection_name=COLLECTION, dimension=768, auto_id=True)
# Insert documents with embeddings
for doc, embedding in zip(docs, docs_embeddings):
client.insert(COLLECTION, {"text": doc, "vector": embedding})
# Search for similar documents
results = client.search(
collection_name=COLLECTION,
data=query_embeddings,
# consistency_level="Strong", # Strong consistency ensures accurate results but may increase latency
output_fields=["text"],
limit=2,
)
# Print search results
for i, query in enumerate(queries):
print(f"\nQuery: {query}")
for result in results[i]:
print(f" - {result['entity']['text']} (distance: {result['distance']:.4f})")
자세한 내용은 PyMilvus Embedding Model 문서를 참조하세요.
원활한 AI 워크플로
임베딩부터 확장 가능한 AI 검색까지—Zilliz Cloud를 사용하면 비교할 수 없는 속도와 효율성으로 임베딩을 저장, 인덱싱 및 검색할 수 있습니다.
Zilliz Cloud를 무료로 사용해 보세요




