Nomic / nomic-embed-text-v1.5
Milvus Integrated
Tâche: Intégration
Modalité: Texte
Métrique de similarité: Cosinus
Licence: Apache 2.0
Dimensions: 768
Tokens d'entrée max: 8192
Prix: Gratuit
Introduction à nomic-embed-text-v1.5
Le modèle nomic-embed-text-v1.5 est un modèle d’embeddings textuels avec une fenêtre d’entrée de 8192 tokens et une prise en charge de tailles d’embeddings variables. Entraîné avec Matryoshka Representation Learning, il permet aux développeurs de générer des embeddings compacts ou à plus grande capacité à partir du même modèle, avec des tailles recommandées de 768, 512, 256, 128 et 64.
Nomic-embed-text-v1.5 est désormais multimodal grâce à nomic-embed-vision-v1.5, qui partage le même espace d’embeddings, de sorte que les embeddings textuels peuvent être utilisés directement aux côtés des embeddings d’images.
Comment créer des embeddings avec nomic-embed-text-v1.5
Il existe deux méthodes principales pour générer des embeddings vectoriels :
- PyMilvus : le SDK Python pour Milvus qui intègre de manière transparente le modèle
nomic-embed-text-v1.5. - Le module
embeddans le SDK Python Nomic fournit une fonctionnalité d’embedding à l’aide de la Nomic Embedding API.
Une fois les embeddings vectoriels générés, ils peuvent être stockés dans Zilliz Cloud (un service de base de données vectorielle entièrement géré et propulsé par Milvus) et utilisés pour la recherche de similarité sémantique. Voici quatre étapes clés :
- Inscrivez-vous gratuitement pour obtenir un compte Zilliz Cloud.
- Configurez un cluster serverless et obtenez le Public Endpoint et l’API Key.
- Créez une collection vectorielle et insérez vos embeddings vectoriels.
- Exécutez une recherche sémantique sur les embeddings stockés.
Créer des embeddings via PyMilvus et les insérer dans Zilliz Cloud pour la recherche sémantique
from pymilvus import MilvusClient
from nomic import embed
# Prepare documents
docs = [
"Artificial intelligence was founded as an academic discipline in 1956.",
"Alan Turing was the first person to conduct substantial research in AI.",
"Born in Maida Vale, London, Turing was raised in southern England.",
]
# Generate embeddings for documents using nomic-embed-text-v1.5
docs_embeddings = embed.text(
texts=docs, model="nomic-embed-text-v1.5", task_type="search_document"
)["embeddings"]
# Prepare queries
queries = ["When was artificial intelligence founded", "Where was Alan Turing born?"]
# Generate embeddings for queries
query_embeddings = embed.text(
texts=queries, model="nomic-embed-text-v1.5", task_type="search_query"
)["embeddings"]
# Connect to Zilliz Cloud with Public Endpoint and API Key
client = MilvusClient(uri=ZILLIZ_PUBLIC_ENDPOINT, token=ZILLIZ_API_KEY)
COLLECTION = "nomic_v1_5_documents"
# Drop collection if it exists
if client.has_collection(collection_name=COLLECTION):
client.drop_collection(collection_name=COLLECTION)
# Create collection with dimension 768 (nomic-embed-text-v1.5 output dimension)
client.create_collection(collection_name=COLLECTION, dimension=768, auto_id=True)
# Insert documents with embeddings
for doc, embedding in zip(docs, docs_embeddings):
client.insert(COLLECTION, {"text": doc, "vector": embedding})
# Search for similar documents
results = client.search(
collection_name=COLLECTION,
data=query_embeddings,
# consistency_level="Strong", # Strong consistency ensures accurate results but may increase latency
output_fields=["text"],
limit=2,
)
# Print search results
for i, query in enumerate(queries):
print(f"\nQuery: {query}")
for result in results[i]:
print(f" - {result['entity']['text']} (distance: {result['distance']:.4f})")
Pour plus d’informations, consultez notre documentation du modèle d’embedding PyMilvus.
Workflows IA fluides
Des embeddings à la recherche IA évolutive - Zilliz Cloud vous permet de stocker, indexer et récupérer des embeddings avec une vitesse et une efficacité inégalées.
Essayer Zilliz Cloud gratuitement




