BAAI / bge-base-zh-v1.5
Milvus Integrated
Tarefa: Incorporação
Modalidade: Texto
Métrica de Similaridade: Qualquer (Normalizado)
Licença: Apache 2.0
Dimensões: 768
Tokens Máximos de Entrada: 512
Preço: Grátis
Introdução ao bge-base-zh-v1.5
O bge-base-zh-v1.5 é um modelo de incorporação geral do BAAI (BGE) que transforma o texto chinês num vetor compacto. Ele fornece uma distribuição de similaridade mais razoável do que as versões anteriores do modelo de incorporação de texto do BAAI.
Compare bge-base-zh-v1.5 com outros modelos populares de BGE:
| Modelo | Dimensões | Max Tokens | C-MTEB avg |
|---|---|---|---|
| bge-large-zh-v1.5 | 1024 | 512 | 64.53 |
| bge-large-en | 1024 | 512 | 64.20 |
| bge-base-zh-v1.5 | 768 | 512 | 63.13 |
| bge-base-pt | 768 | 512 | 62.96 |
| bge-small-zh-v1.5 | 384 | 512 | 57.82 |
| bge-small-zh | 384 | 512 | 58.27 |
Como criar embeddings com bge-base-zh-v1.5
Existem duas formas principais de criar embeddings vectoriais:
- PyMilvus: o SDK Python para Milvus que integra perfeitamente o
bge-base-zh-v1.5. - FlagEmbedding: o SDK Python oficial oferecido pela BAAI.
Estes métodos permitem aos programadores incorporar facilmente capacidades avançadas de incorporação de texto nas suas aplicações.
Uma vez gerados os embeddings vectoriais, podem ser armazenados em Zilliz Cloud (um serviço de base de dados vetorial totalmente gerido por Milvus) e utilizados para pesquisa de similaridade semântica. Eis quatro passos fundamentais:
- Inscrever-se para obter uma conta Zilliz Cloud gratuitamente.
- Configurar um cluster sem servidor e obter o Ponto de extremidade público e chave de API.
- Crie uma coleção de vectores e insira os seus embeddings vectoriais.
- Execute uma pesquisa semântica nos embeddings armazenados.
Gerar embeddings vectoriais através do PyMilvus e inseri-los no Zilliz Cloud para pesquisa semântica
from pymilvus import model, MilvusClient
ef = model.dense.SentenceTransformerEmbeddingFunction(
nome_do_modelo="BAAI/bge-base-zh-v1.5",
device="cpu",
query_instruction="为这个句子生成表示以用于检索相关文章:"
)
# Gerar embeddings para documentos
docs = [
"人工智能作为一门学术学科成立于1958年。"
"艾伦-图灵是第一个在人工智能领域进行实质性研究的人。"
"图灵出生于伦敦的梅达维尔,并在英格兰南部长大。"
]
docs_embeddings = ef.encode_documents(docs)
# Gerar embeddings para consultas
consultas = ["人工智能是什么时候成立的?",
"艾伦-图灵出生在哪里?"]
query_embeddings = ef.encode_queries(queries)
# Ligar ao Zilliz Cloud com o ponto final público e a chave da API
cliente = MilvusClient(
uri=ZILLIZ_PUBLIC_ENDPOINT,
token=ZILLIZ_API_KEY)
COLLECTION = "documents" (coleção)
if client.has_collection(nome_da_colecção=COLLECTION):
client.drop_collection(nome_da_colecção=COLLECTION)
client.create_collection(
nome_da_colecção=COLLECTION,
dimension=ef.dim,
auto_id=True)
for doc, embedding in zip(docs, docs_embeddings):
client.insert(COLLECTION, {"text": doc, "vetor": embedding})
resultados = cliente.search(
nome_da_colecção=COLLECTION,
data=query_embeddings,
consistency_level="Strong",
output_fields=["text"])
Para mais informações, consulte a nossa PyMilvus Embedding Model documentation.
Gerar embeddings vectoriais através da biblioteca FlagEmbedding Python e inseri-los no Zilliz Cloud para pesquisa semântica
from FlagEmbedding import FlagModel
from pymilvus import MilvusClient
model = FlagModel("BAAI/bge-base-zh-v1.5",
query_instruction_for_retrieval="为这个句子生成表示以用于检索相关文章:",
use_fp16=False)
# Gerar embeddings para documentos
docs = [
"人工智能作为一门学术学科成立于1958年。"
"艾伦-图灵是第一个在人工智能领域进行实质性研究的人。"
"图灵出生于伦敦的梅达维尔,并在英格兰南部长大。"
]
docs_embeddings = model.encode(docs)
# Gerar embeddings para consultas
consultas = ["人工智能是什么时候成立的?",
"艾伦-图灵出生在哪里?"]
query_embeddings = model.encode_queries(queries)
# Ligar ao Zilliz Cloud com o ponto final público e a chave da API
cliente = MilvusClient(
uri=ZILLIZ_PUBLIC_ENDPOINT,
token=ZILLIZ_API_KEY)
COLLECTION = "documents" (coleção)
if client.has_collection(nome_da_colecção=COLLECTION):
client.drop_collection(nome_da_colecção=COLLECTION)
client.create_collection(
nome_da_colecção=COLLECTION,
dimension=768,
auto_id=True)
for doc, embedding in zip(docs, docs_embeddings):
client.insert(COLLECTION, {"text": doc, "vetor": embedding})
resultados = cliente.search(
nome_da_colecção=COLLECTION,
data=query_embeddings,
consistency_level="Strong",
output_fields=["text"])
Para mais informações, consulte a página de modelo sobre HuggingFace.
Fluxos de trabalho de IA sem interrupções
De embeddings a busca escalável de IA—Zilliz Cloud permite armazenar, indexar e recuperar embeddings com velocidade e eficiência incomparáveis.
Experimente o Zilliz Cloud grátis




