Nomic / nomic-embed-text-v1.5
Milvus Integrated
Tarefa: Incorporação
Modalidade: Texto
Métrica de Similaridade: Cosseno
Licença: Apache 2.0
Dimensões: 768
Tokens Máximos de Entrada: 8192
Preço: Grátis
Introdução ao nomic-embed-text-v1.5
O modelo nomic-embed-text-v1.5 é um modelo de incorporação de texto com uma janela de entrada de 8192 tokens e suporte a tamanhos variáveis de embeddings. Treinado com Matryoshka Representation Learning, ele permite que desenvolvedores gerem embeddings compactos ou de maior capacidade a partir do mesmo modelo, com tamanhos recomendados de 768, 512, 256, 128 e 64.
Nomic-embed-text-v1.5 agora é multimodal por meio do nomic-embed-vision-v1.5, que compartilha o mesmo espaço de embeddings, portanto embeddings de texto podem ser usados diretamente junto com embeddings de imagem.
Como criar embeddings com nomic-embed-text-v1.5
Há duas formas principais de gerar embeddings vetoriais:
- PyMilvus: o SDK Python para Milvus que integra perfeitamente o modelo
nomic-embed-text-v1.5. - O módulo
embedno SDK Python da Nomic fornece funcionalidade de embeddings usando a Nomic Embedding API.
Depois que os embeddings vetoriais são gerados, eles podem ser armazenados no Zilliz Cloud (um serviço de banco de dados vetorial totalmente gerenciado, desenvolvido com Milvus) e usados para busca por similaridade semântica. Aqui estão quatro etapas principais:
- Cadastre-se gratuitamente para obter uma conta no Zilliz Cloud.
- Configure um cluster sem servidor e obtenha o Public Endpoint e a API Key.
- Crie uma coleção vetorial e insira seus embeddings vetoriais.
- Execute uma busca semântica nos embeddings armazenados.
Crie embeddings via PyMilvus e insira-os no Zilliz Cloud para busca semântica
from pymilvus import MilvusClient
from nomic import embed
# Prepare documents
docs = [
"Artificial intelligence was founded as an academic discipline in 1956.",
"Alan Turing was the first person to conduct substantial research in AI.",
"Born in Maida Vale, London, Turing was raised in southern England.",
]
# Generate embeddings for documents using nomic-embed-text-v1.5
docs_embeddings = embed.text(
texts=docs, model="nomic-embed-text-v1.5", task_type="search_document"
)["embeddings"]
# Prepare queries
queries = ["When was artificial intelligence founded", "Where was Alan Turing born?"]
# Generate embeddings for queries
query_embeddings = embed.text(
texts=queries, model="nomic-embed-text-v1.5", task_type="search_query"
)["embeddings"]
# Connect to Zilliz Cloud with Public Endpoint and API Key
client = MilvusClient(uri=ZILLIZ_PUBLIC_ENDPOINT, token=ZILLIZ_API_KEY)
COLLECTION = "nomic_v1_5_documents"
# Drop collection if it exists
if client.has_collection(collection_name=COLLECTION):
client.drop_collection(collection_name=COLLECTION)
# Create collection with dimension 768 (nomic-embed-text-v1.5 output dimension)
client.create_collection(collection_name=COLLECTION, dimension=768, auto_id=True)
# Insert documents with embeddings
for doc, embedding in zip(docs, docs_embeddings):
client.insert(COLLECTION, {"text": doc, "vector": embedding})
# Search for similar documents
results = client.search(
collection_name=COLLECTION,
data=query_embeddings,
# consistency_level="Strong", # Strong consistency ensures accurate results but may increase latency
output_fields=["text"],
limit=2,
)
# Print search results
for i, query in enumerate(queries):
print(f"\nQuery: {query}")
for result in results[i]:
print(f" - {result['entity']['text']} (distance: {result['distance']:.4f})")
Para mais informações, consulte nossa documentação do PyMilvus Embedding Model.
Fluxos de trabalho de IA sem interrupções
De embeddings a busca escalável de IA—Zilliz Cloud permite armazenar, indexar e recuperar embeddings com velocidade e eficiência incomparáveis.
Experimente o Zilliz Cloud grátis




