BAAI / bge-base-zh-v1.5
Milvus Integrated
Compito: Incorporazione
Modalità: Testo
Metrica di Similarità: Qualsiasi (normalizzato)
Licenza: Apache 2.0
Dimensioni: 768
Token di Input Massimi: 512
Prezzo: Gratuito
Introduzione a bge-base-zh-v1.5
bge-base-zh-v1.5 è un modello di incorporazione generale BAAI (BGE) che trasforma il testo cinese in un vettore compatto. Fornisce una distribuzione della somiglianza più ragionevole rispetto alle precedenti versioni del modello di incorporazione del testo di BAAI.
Confronta bge-base-zh-v1.5 con altri modelli BGE popolari:
| Modello | Dimensioni | Max Tokens | C-MTEB avg |
|---|---|---|---|
| bge-large-zh-v1.5 | 1024 | 512 | 64.53 |
| bge-large-en | 1024 | 512 | 64.20 |
| bge-base-zh-v1.5 | 768 | 512 | 63,13 |
| bge-base-en | 768 | 512 | 62,96 |
| bge-small-zh-v1.5 | 384 | 512 | 57,82 |
| bge-small-zh | 384 | 512 | 58,27 |
Come creare le incorporazioni con bge-base-zh-v1.5
Esistono due modi principali per creare incorporazioni vettoriali:
- PyMilvus: l'SDK Python per Milvus che integra perfettamente la
bge-base-zh-v1.5. - FlagEmbedding: l'SDK Python ufficiale offerto da BAAI.
Questi metodi consentono agli sviluppatori di incorporare facilmente capacità avanzate di incorporazione del testo nelle loro applicazioni.
Una volta generate le incorporazioni vettoriali, queste possono essere archiviate in Zilliz Cloud (un servizio di database vettoriale completamente gestito da Milvus) e utilizzate per la ricerca di similarità semantica. Ecco i quattro passaggi chiave:
- Iscriviti per un account Zilliz Cloud gratuito.
- Configurare un cluster serverless e ottenere il Public Endpoint and API Key.
- Creare una collezione di vettori e inserire gli embeddings vettoriali.
- Eseguire una ricerca semantica sugli embeddings memorizzati.
Generare embeddings vettoriali tramite PyMilvus e inserirli in Zilliz Cloud per la ricerca semantica.
da pymilvus import model, MilvusClient
ef = model.dense.SentenceTransformerEmbeddingFunction(
model_name="BAAI/bge-base-zh-v1.5",
device="cpu",
query_instruction="为这个句子生成表示以用于检索相关文章:"
)
# Generare le incorporazioni per i documenti
docs = [
"人工智能作为一门学术学科成立于1958年。"
"艾伦-图灵是第一个在人工智能领域进行实质性研究的人。"
"图灵出生于伦敦的梅达维尔,并在英格兰南部长大。"
]
docs_embeddings = ef.encode_documents(docs)
# Generare embeddings per le query
query = ["人工智能是什么时候成立的?",
"艾伦-图灵出生在哪里?"]
query_embeddings = ef.encode_queries(queries)
# Connettersi a Zilliz Cloud con l'endpoint pubblico e la chiave API
client = MilvusClient(
uri=ZILLIZ_PUBLIC_ENDPOINT,
token=ZILLIZ_API_KEY)
COLLEZIONE = "documenti"
if client.has_collection(collection_name=COLLECTION):
client.drop_collection(nome_raccolta=COLLEZIONE)
client.create_collection(
nome_collezione=COLLEZIONE,
dimensione=ef.dim,
auto_id=True)
per doc, embedding in zip(docs, docs_embeddings):
client.insert(COLLECTION, {"text": doc, "vector": embedding})
risultati = client.search(
nome_collezione=COLLEZIONE,
dati=query_embeddings,
consistency_level="Strong",
output_fields=["text"])
Per ulteriori informazioni, consultare la nostra [documentazione sul modello di inclusione di PyMilvus] (https://milvus.io/docs/embeddings.md).
Generare embeddings vettoriali tramite la libreria Python FlagEmbedding e inserirli in Zilliz Cloud per la ricerca semantica
da FlagEmbedding import FlagModel
da pymilvus import MilvusClient
model = FlagModel("BAAI/bge-base-zh-v1.5",
query_instruction_for_retrieval="为这个句子生成表示以用于检索相关文章:",
use_fp16=False)
# Generare le incorporazioni per i documenti
docs = [
"人工智能作为一门学术学科成立于1958年。"
"艾伦-图灵是第一个在人工智能领域进行实质性研究的人。"
"图灵出生于伦敦的梅达维尔,并在英格兰南部长大。"
]
docs_embeddings = model.encode(docs)
# Generare le incorporazioni per le query
query = ["人工智能是什么时候成立的?",
"艾伦-图灵出生在哪里?"]
query_embeddings = model.encode_queries(queries)
# Connettersi a Zilliz Cloud con l'endpoint pubblico e la chiave API
client = MilvusClient(
uri=ZILLIZ_PUBLIC_ENDPOINT,
token=ZILLIZ_API_KEY)
COLLEZIONE = "documenti"
if client.has_collection(collection_name=COLLECTION):
client.drop_collection(nome_raccolta=COLLEZIONE)
client.create_collection(
nome_collezione=COLLEZIONE,
dimensione=768,
auto_id=True)
per doc, embedding in zip(docs, docs_embeddings):
client.insert(COLLECTION, {"text": doc, "vector": embedding})
risultati = client.search(
nome_collezione=COLLEZIONE,
dati=query_embeddings,
consistency_level="Strong",
output_fields=["text"])
Per ulteriori informazioni, consultare la pagina del modello su HuggingFace.
Flussi di lavoro AI senza interruzioni
Dalle embedding alla ricerca AI scalabile—Zilliz Cloud ti consente di memorizzare, indicizzare e recuperare embedding con velocità e efficienza senza pari.
Prova Zilliz Cloud gratuitamente




