Nomic / nomic-embed-text-v1
Milvus Integrated
Compito: Incorporamento
Modalità: Testo
Metrica di Similarità: Coseno
Licenza: Apache 2.0
Dimensioni: 768
Token di Input Massimi: 8192
Prezzo: Gratis
Introduzione a nomic-embed-text-v1
Il modello nomic-embed-text-v1 è un modello di embedding testuale open-source e open-data con codice di addestramento aperto, progettato per essere completamente riproducibile e verificabile. Supporta una finestra di contesto di 8192 token ed è specializzato per recupero, similarità, clustering e classificazione, offrendo prestazioni elevate sia su attività con contesti brevi sia lunghi.
Nomic-embed-text-v1 è ora multimodale tramite nomic-embed-vision-v1, che condivide lo stesso spazio di embedding, quindi gli embedding testuali possono essere utilizzati direttamente insieme agli embedding di immagini.
Come creare embedding con nomic-embed-text-v1
Esistono due modi principali per generare embedding vettoriali:
- PyMilvus: l’SDK Python per Milvus che integra perfettamente il modello
nomic-embed-text-v1. - Il modulo
embednell’SDK Python di Nomic fornisce funzionalità di embedding utilizzando la Nomic Embedding API.
Una volta generati gli embedding vettoriali, possono essere archiviati in Zilliz Cloud (un servizio di database vettoriale completamente gestito basato su Milvus) e utilizzati per la ricerca di similarità semantica. Ecco quattro passaggi chiave:
- Registrati gratuitamente per un account Zilliz Cloud.
- Configura un cluster serverless e ottieni il Public Endpoint e l’API Key.
- Crea una collection vettoriale e inserisci i tuoi embedding vettoriali.
- Esegui una ricerca semantica sugli embedding archiviati.
Crea embedding tramite PyMilvus e inseriscili in Zilliz Cloud per la ricerca semantica
from pymilvus import MilvusClient
from nomic import embed
# Prepare documents
docs = [
"Artificial intelligence was founded as an academic discipline in 1956.",
"Alan Turing was the first person to conduct substantial research in AI.",
"Born in Maida Vale, London, Turing was raised in southern England.",
]
# Generate embeddings for documents using nomic-embed-text-v1.5
docs_embeddings = embed.text(
texts=docs, model="nomic-embed-text-v1.5", task_type="search_document"
)["embeddings"]
# Prepare queries
queries = ["When was artificial intelligence founded", "Where was Alan Turing born?"]
# Generate embeddings for queries
query_embeddings = embed.text(
texts=queries, model="nomic-embed-text-v1.5", task_type="search_query"
)["embeddings"]
# Connect to Zilliz Cloud with Public Endpoint and API Key
client = MilvusClient(uri=ZILLIZ_PUBLIC_ENDPOINT, token=ZILLIZ_API_KEY)
COLLECTION = "nomic_v1_5_documents"
# Drop collection if it exists
if client.has_collection(collection_name=COLLECTION):
client.drop_collection(collection_name=COLLECTION)
# Create collection with dimension 768 (nomic-embed-text-v1.5 output dimension)
client.create_collection(collection_name=COLLECTION, dimension=768, auto_id=True)
# Insert documents with embeddings
for doc, embedding in zip(docs, docs_embeddings):
client.insert(COLLECTION, {"text": doc, "vector": embedding})
# Search for similar documents
results = client.search(
collection_name=COLLECTION,
data=query_embeddings,
# consistency_level="Strong", # Strong consistency ensures accurate results but may increase latency
output_fields=["text"],
limit=2,
)
# Print search results
for i, query in enumerate(queries):
print(f"\nQuery: {query}")
for result in results[i]:
print(f" - {result['entity']['text']} (distance: {result['distance']:.4f})")
Per ulteriori informazioni, consulta la nostra documentazione del Modello di Embedding PyMilvus.
Flussi di lavoro AI senza interruzioni
Dalle embedding alla ricerca AI scalabile—Zilliz Cloud ti consente di memorizzare, indicizzare e recuperare embedding con velocità e efficienza senza pari.
Prova Zilliz Cloud gratuitamente




