Snowflake / snowflake-arctic-embed-l-v2.0
Milvus Integrated
Tarefa: Incorporação
Modalidade: Texto
Métrica de Similaridade: IP, L1, L2, Cosseno
Licença: Apache 2.0
Dimensões: 1024
Tokens Máximos de Entrada: 8192
Preço: Grátis
Introdução ao snowflake-arctic-embed-l-v2.0
O modelo snowflake-arctic-embed-l-v2.0 é um modelo multilíngue de embeddings de texto com suporte a 74 idiomas, projetado para oferecer recuperação de alta qualidade e inferência eficiente em tarefas tanto em inglês quanto em outros idiomas. Com 303M de parâmetros não relacionados a embeddings, ele fornece inferência rápida e escalável e oferece suporte a representações compactas por meio de Matryoshka Representation Learning e treinamento ciente de quantização.
Compare o snowflake-arctic-embed-l-v2.0 com os modelos snowflake-arctic-l:
| Modelo | params | params não-emb | dimensões | Suporte a idiomas |
|---|---|---|---|---|
| snowflake-arctic-l-v2.0 | 568M | 303M | 1024 | multilíngue |
| snowflake-arctic-l | 335M | 303M | 1024 | apenas inglês |
Como criar embeddings com snowflake-arctic-embed-l-v2.0
Há duas formas principais de gerar embeddings vetoriais:
- PyMilvus: o SDK Python para Milvus que integra perfeitamente o modelo
snowflake-arctic-embed-l-v2.0. - A função
AI_EMBEDfornecida pelo Snowflake Cortex para texto e imagens.
Depois que os embeddings vetoriais são gerados, eles podem ser armazenados no Zilliz Cloud (um serviço de banco de dados vetorial totalmente gerenciado desenvolvido com Milvus) e usados para busca por similaridade semântica. Aqui estão quatro etapas principais:
- Cadastre-se para obter uma conta gratuita no Zilliz Cloud.
- Configure um cluster serverless e obtenha o Public Endpoint and API Key.
- Crie uma coleção vetorial e insira seus embeddings vetoriais.
- Execute uma busca semântica nos embeddings armazenados.
Criar embeddings via PyMilvus e inseri-los no Zilliz Cloud para busca semântica
from pymilvus.model.dense import SentenceTransformerEmbeddingFunction
from pymilvus import MilvusClient
# Load the Snowflake Arctic Embed L v2.0 model
ef = SentenceTransformerEmbeddingFunction(
"Snowflake/snowflake-arctic-embed-l-v2.0", trust_remote_code=True
)
docs = [
"Artificial intelligence was founded as an academic discipline in 1956.",
"Alan Turing was the first person to conduct substantial research in AI.",
"Born in Maida Vale, London, Turing was raised in southern England.",
]
# Generate embeddings for documents
docs_embeddings = ef(docs)
queries = ["When was artificial intelligence founded", "Where was Alan Turing born?"]
# Generate embeddings for queries
query_embeddings = ef(queries)
# Connect to Zilliz Cloud with Public Endpoint and API Key
client = MilvusClient(uri=ZILLIZ_PUBLIC_ENDPOINT, token=ZILLIZ_API_KEY)
COLLECTION = "arctic_embed_l_v2_documents"
# Drop collection if it exists
if client.has_collection(collection_name=COLLECTION):
client.drop_collection(collection_name=COLLECTION)
# Create collection with auto-detected dimension
client.create_collection(collection_name=COLLECTION, dimension=ef.dim, auto_id=True)
# Insert documents with embeddings
for doc, embedding in zip(docs, docs_embeddings):
client.insert(COLLECTION, {"text": doc, "vector": embedding})
# Search for similar documents
results = client.search(
collection_name=COLLECTION,
data=query_embeddings,
# consistency_level="Strong", # Strong consistency ensures accurate results but may increase latency
output_fields=["text"],
limit=2,
)
# Print search results
for i, query in enumerate(queries):
print(f"\nQuery: {query}")
for result in results[i]:
print(f" - {result['entity']['text']} (distance: {result['distance']:.4f})")
Para obter mais informações, consulte nossa documentação do Modelo de Embedding PyMilvus.
- Introdução ao snowflake-arctic-embed-l-v2.0
- Como criar embeddings com snowflake-arctic-embed-l-v2.0
Conteúdo
Fluxos de trabalho de IA sem interrupções
De embeddings a busca escalável de IA—Zilliz Cloud permite armazenar, indexar e recuperar embeddings com velocidade e eficiência incomparáveis.
Experimente o Zilliz Cloud grátis




