Snowflake / snowflake-arctic-embed-l-v2.0
Milvus Integrated
Compito: Incorporamento
Modalità: Testo
Metrica di Similarità: IP, L1, L2, Coseno
Licenza: Apache 2.0
Dimensioni: 1024
Token di Input Massimi: 8192
Prezzo: Gratis
Introduzione a snowflake-arctic-embed-l-v2.0
Il modello snowflake-arctic-embed-l-v2.0 è un modello multilingue di embedding del testo che supporta 74 lingue, progettato per offrire retrieval di alta qualità e inferenza efficiente sia per attività in inglese sia in altre lingue. Con 303M parametri non di embedding, offre un'inferenza rapida e scalabile e supporta rappresentazioni compatte tramite Matryoshka Representation Learning e training consapevole della quantizzazione.
Confronta snowflake-arctic-embed-l-v2.0 con i modelli snowflake-arctic-l:
| Modello | parametri | parametri non-emb | dimensioni | Supporto linguistico |
|---|---|---|---|---|
| snowflake-arctic-l-v2.0 | 568M | 303M | 1024 | multilingue |
| snowflake-arctic-l | 335M | 303M | 1024 | solo inglese |
Come creare embedding con snowflake-arctic-embed-l-v2.0
Esistono due modi principali per generare embedding vettoriali:
- PyMilvus: l'SDK Python per Milvus che integra perfettamente il modello
snowflake-arctic-embed-l-v2.0. - La funzione
AI_EMBEDfornita da Snowflake Cortex per testo e immagini.
Una volta generati gli embedding vettoriali, possono essere archiviati in Zilliz Cloud (un servizio di database vettoriale completamente gestito basato su Milvus) e utilizzati per la ricerca per similarità semantica. Ecco quattro passaggi chiave:
- Registrati gratuitamente per un account Zilliz Cloud.
- Configura un cluster serverless e ottieni il Public Endpoint e l'API Key.
- Crea una collection vettoriale e inserisci i tuoi embedding vettoriali.
- Esegui una ricerca semantica sugli embedding archiviati.
Crea embedding tramite PyMilvus e inseriscili in Zilliz Cloud per la ricerca semantica
from pymilvus.model.dense import SentenceTransformerEmbeddingFunction
from pymilvus import MilvusClient
# Load the Snowflake Arctic Embed L v2.0 model
ef = SentenceTransformerEmbeddingFunction(
"Snowflake/snowflake-arctic-embed-l-v2.0", trust_remote_code=True
)
docs = [
"Artificial intelligence was founded as an academic discipline in 1956.",
"Alan Turing was the first person to conduct substantial research in AI.",
"Born in Maida Vale, London, Turing was raised in southern England.",
]
# Generate embeddings for documents
docs_embeddings = ef(docs)
queries = ["When was artificial intelligence founded", "Where was Alan Turing born?"]
# Generate embeddings for queries
query_embeddings = ef(queries)
# Connect to Zilliz Cloud with Public Endpoint and API Key
client = MilvusClient(uri=ZILLIZ_PUBLIC_ENDPOINT, token=ZILLIZ_API_KEY)
COLLECTION = "arctic_embed_l_v2_documents"
# Drop collection if it exists
if client.has_collection(collection_name=COLLECTION):
client.drop_collection(collection_name=COLLECTION)
# Create collection with auto-detected dimension
client.create_collection(collection_name=COLLECTION, dimension=ef.dim, auto_id=True)
# Insert documents with embeddings
for doc, embedding in zip(docs, docs_embeddings):
client.insert(COLLECTION, {"text": doc, "vector": embedding})
# Search for similar documents
results = client.search(
collection_name=COLLECTION,
data=query_embeddings,
# consistency_level="Strong", # Strong consistency ensures accurate results but may increase latency
output_fields=["text"],
limit=2,
)
# Print search results
for i, query in enumerate(queries):
print(f"\nQuery: {query}")
for result in results[i]:
print(f" - {result['entity']['text']} (distance: {result['distance']:.4f})")
Per ulteriori informazioni, consulta la nostra documentazione del modello di embedding PyMilvus.
- Introduzione a snowflake-arctic-embed-l-v2.0
- Come creare embedding con snowflake-arctic-embed-l-v2.0
Contenuto
Flussi di lavoro AI senza interruzioni
Dalle embedding alla ricerca AI scalabile—Zilliz Cloud ti consente di memorizzare, indicizzare e recuperare embedding con velocità e efficienza senza pari.
Prova Zilliz Cloud gratuitamente




