BAAI / bge-base-zh-v1.5
Milvus Integrated
Aufgabe: Einbettung
Modalität: Text
Ähnlichkeitsmetrik: Beliebig (normalisiert)
Lizenz: Apache 2.0
Dimensionen: 768
Maximale Eingabe-Tokens: 512
Preis: Kostenlos
Einführung in bge-base-zh-v1.5
bge-base-zh-v1.5" ist ein allgemeines BAAI-Einbettungsmodell (BGE), das chinesischen Text in einen kompakten Vektor transformiert. Es bietet eine vernünftigere Ähnlichkeitsverteilung als die früheren Versionen des BAAI-Modells zur Texteinbettung.
Vergleichen Sie bge-base-zh-v1.5 mit anderen populären BGE-Modellen:
| Modell | Dimensionen | Max Tokens | C-MTEB avg |
|---|---|---|---|
| bge-large-zh-v1.5 | 1024 | 512 | 64.53 |
| bge-large-de | 1024 | 512 | 64.20 |
| bge-base-zh-v1.5 | 768 | 512 | 63.13 |
| bge-base-de | 768 | 512 | 62.96 |
| bge-small-zh-v1.5 | 384 | 512 | 57.82 |
| bge-small-zh | 384 | 512 | 58.27 |
Wie man Einbettungen mit bge-base-zh-v1.5 erstellt
Es gibt zwei primäre Möglichkeiten, Vektoreinbettungen zu erstellen:
- PyMilvus: das Python-SDK für Milvus, das die "bge-base-zh-v1.5" nahtlos integriert.
- FlagEmbedding: das offizielle Python-SDK, das vom BAAI angeboten wird.
Diese Methoden ermöglichen es Entwicklern, auf einfache Weise fortgeschrittene Texteinbettungsfunktionen in ihre Anwendungen einzubauen.
Sobald die Vektoreinbettungen generiert sind, können sie in der Zilliz Cloud (ein vollständig verwalteter Vektordatenbankdienst, der von Milvus betrieben wird) gespeichert und für die semantische Ähnlichkeitssuche verwendet werden. Dies sind die vier wichtigsten Schritte:
- Registrieren Sie sich für ein kostenloses Zilliz Cloud-Konto.
- Richten Sie einen serverlosen Cluster ein und erhalten Sie den Public Endpoint and API Key.
- Erstellen Sie eine Vektorsammlung und fügen Sie Ihre Vektoreinbettungen ein.
- Lassen Sie eine semantische Suche auf den gespeicherten Einbettungen laufen.
Vektoreinbettungen über PyMilvus generieren und in die Zilliz Cloud für die semantische Suche einfügen.
von pymilvus importieren Modell, MilvusClient
ef = model.dense.SentenceTransformerEmbeddingFunction(
model_name="BAAI/bge-base-zh-v1.5",
device="cpu",
query_instruction="为这个句子生成表示以用于检索相关文章:"
)
# Einbettungen für Dokumente generieren
docs = [
"人工智能作为一门学术学科成立于1958年。"
"艾伦-图灵是第一个在人工智能领域进行实质性研究的人。"
"图灵出生于伦敦的梅达维尔,并在英格兰南部长大。"
]
docs_embeddings = ef.encode_documents(docs)
# Einbettungen für Abfragen generieren
queries = ["人工智能是什么时候成立的?",
"艾伦-图灵出生在哪里?"]
query_embeddings = ef.encode_queries(queries)
# Verbindung zur Zilliz Cloud mit öffentlichem Endpunkt und API-Schlüssel
client = MilvusClient(
uri=ZILLIZ_PUBLIC_ENDPOINT,
token=ZILLIZ_API_KEY)
COLLECTION = "Dokumente"
if client.has_collection(collection_name=COLLECTION):
client.drop_collection(collection_name=COLLECTION)
client.create_collection(
collection_name=COLLECTION,
dimension=ef.dim,
auto_id=True)
for doc, embedding in zip(docs, docs_embeddings):
client.insert(COLLECTION, {"text": doc, "vector": embedding})
results = client.search(
collection_name=COLLECTION,
data=query_embeddings,
consistency_level="Strong",
output_fields=["text"])
Weitere Informationen finden Sie in unserer PyMilvus Embedding Model Dokumentation.
Generieren Sie Vektoreinbettungen mit der Python-Bibliothek FlagEmbedding und fügen Sie sie in die Zilliz-Cloud für die semantische Suche ein.
von FlagEmbedding importieren FlagModel
von pymilvus importieren MilvusClient
model = FlagModel("BAAI/bge-base-zh-v1.5",
query_instruction_for_retrieval="为这个句子生成表示以用于检索相关文章:",
use_fp16=False)
# Einbettungen für Dokumente generieren
docs = [
"人工智能作为一门学术学科成立于1958年。"
"艾伦-图灵是第一个在人工智能领域进行实质性研究的人。"
"图灵出生于伦敦的梅达维尔,并在英格兰南部长大。"
]
docs_embeddings = model.encode(docs)
# Einbettungen für Abfragen generieren
queries = ["人工智能是什么时候成立的?",
"艾伦-图灵出生在哪里?"]
query_embeddings = model.encode_queries(queries)
# Verbindung zur Zilliz Cloud mit öffentlichem Endpunkt und API-Schlüssel
client = MilvusClient(
uri=ZILLIZ_PUBLIC_ENDPOINT,
token=ZILLIZ_API_KEY)
COLLECTION = "Dokumente"
if client.has_collection(collection_name=COLLECTION):
client.drop_collection(collection_name=COLLECTION)
client.create_collection(
collection_name=COLLECTION,
dimension=768,
auto_id=True)
for doc, embedding in zip(docs, docs_embeddings):
client.insert(COLLECTION, {"text": doc, "vector": embedding})
results = client.search(
collection_name=COLLECTION,
data=query_embeddings,
consistency_level="Strong",
output_fields=["text"])
Weitere Informationen finden Sie auf der Modellseite zu HuggingFace.
Nahtlose KI-Workflows
Von Embeddings bis hin zu skalierbarer KI-Suche – Zilliz Cloud ermöglicht es Ihnen, Embeddings mit beispielloser Geschwindigkeit und Effizienz zu speichern, zu indizieren und abzurufen.
Zilliz Cloud kostenlos ausprobieren




