Nomic / nomic-embed-text-v1
Milvus Integrated
작업: 임베딩
형태: 텍스트
유사성 측정법: 코사인
라이선스: Apache 2.0
차원: 768
최대 입력 토큰: 8192
가격: 무료
nomic-embed-text-v1 소개
nomic-embed-text-v1 모델은 완전한 재현성과 감사 가능성을 갖추도록 설계된, 공개 학습 코드를 포함한 오픈 소스 오픈 데이터 텍스트 임베딩 모델입니다. 8192토큰 컨텍스트 윈도우를 지원하며 검색, 유사도, 클러스터링, 분류에 특화되어 짧은 컨텍스트와 긴 컨텍스트 작업 모두에서 강력한 성능을 제공합니다.
Nomic-embed-text-v1은 이제 동일한 임베딩 공간을 공유하는 nomic-embed-vision-v1을 통해 멀티모달을 지원하므로, 텍스트 임베딩을 이미지 임베딩과 함께 직접 사용할 수 있습니다.
nomic-embed-text-v1로 임베딩을 생성하는 방법
벡터 임베딩을 생성하는 주요 방법은 두 가지입니다:
- PyMilvus:
nomic-embed-text-v1모델을 원활하게 통합하는 Milvus용 Python SDK입니다. - Nomic Python SDK의
embed모듈은 Nomic Embedding API를 사용하여 임베딩 기능을 제공합니다.
벡터 임베딩이 생성되면 Zilliz Cloud(Milvus 기반의 완전 관리형 벡터 데이터베이스 서비스)에 저장하고 의미적 유사도 검색에 사용할 수 있습니다. 다음은 네 가지 핵심 단계입니다:
- Zilliz Cloud 계정에 무료로 가입합니다.
- 서버리스 클러스터를 설정하고 Public Endpoint 및 API Key를 얻습니다.
- 벡터 컬렉션을 생성하고 벡터 임베딩을 삽입합니다.
- 저장된 임베딩에서 의미적 검색을 실행합니다.
PyMilvus를 통해 임베딩을 생성하고 의미적 검색을 위해 Zilliz Cloud에 삽입하기
from pymilvus import MilvusClient
from nomic import embed
# Prepare documents
docs = [
"Artificial intelligence was founded as an academic discipline in 1956.",
"Alan Turing was the first person to conduct substantial research in AI.",
"Born in Maida Vale, London, Turing was raised in southern England.",
]
# Generate embeddings for documents using nomic-embed-text-v1.5
docs_embeddings = embed.text(
texts=docs, model="nomic-embed-text-v1.5", task_type="search_document"
)["embeddings"]
# Prepare queries
queries = ["When was artificial intelligence founded", "Where was Alan Turing born?"]
# Generate embeddings for queries
query_embeddings = embed.text(
texts=queries, model="nomic-embed-text-v1.5", task_type="search_query"
)["embeddings"]
# Connect to Zilliz Cloud with Public Endpoint and API Key
client = MilvusClient(uri=ZILLIZ_PUBLIC_ENDPOINT, token=ZILLIZ_API_KEY)
COLLECTION = "nomic_v1_5_documents"
# Drop collection if it exists
if client.has_collection(collection_name=COLLECTION):
client.drop_collection(collection_name=COLLECTION)
# Create collection with dimension 768 (nomic-embed-text-v1.5 output dimension)
client.create_collection(collection_name=COLLECTION, dimension=768, auto_id=True)
# Insert documents with embeddings
for doc, embedding in zip(docs, docs_embeddings):
client.insert(COLLECTION, {"text": doc, "vector": embedding})
# Search for similar documents
results = client.search(
collection_name=COLLECTION,
data=query_embeddings,
# consistency_level="Strong", # Strong consistency ensures accurate results but may increase latency
output_fields=["text"],
limit=2,
)
# Print search results
for i, query in enumerate(queries):
print(f"\nQuery: {query}")
for result in results[i]:
print(f" - {result['entity']['text']} (distance: {result['distance']:.4f})")
자세한 내용은 당사의 PyMilvus Embedding Model 문서를 참조하세요.
원활한 AI 워크플로
임베딩부터 확장 가능한 AI 검색까지—Zilliz Cloud를 사용하면 비교할 수 없는 속도와 효율성으로 임베딩을 저장, 인덱싱 및 검색할 수 있습니다.
Zilliz Cloud를 무료로 사용해 보세요




