BAAI / bge-base-zh-v1.5
Milvus Integrated
Tâche: Intégration
Modalité: Texte
Métrique de similarité: Tous (normalisés)
Licence: Apache 2.0
Dimensions: 768
Tokens d'entrée max: 512
Prix: Gratuit
Introduction à bge-base-zh-v1.5
bge-base-zh-v1.5 est un modèle d'intégration générale de BAAI (BGE) qui transforme le texte chinois en un vecteur compact. Il fournit une distribution de similarité plus raisonnable que les versions précédentes du modèle d'intégration de texte de BAAI.
Comparez bge-base-zh-v1.5 avec d'autres modèles BGE populaires :
Modèle | Dimensions | Max Tokens | C-MTEB avg | Max Tokens | Max Tokens | Max Tokens | C-MTEB avg | | ----------------- | -------------- | -------------- | ------------------ | bge-large-zh-v1.5 | 1024 | 512 | 64.53 | bge-large-zh-v1.5 | 1024 | 512 | 64.53 | bge-large-zh-v1.5 | bge-large-fr | 1024 | 512 | 64.20 | | bge-base-zh-v1.5 | 768 | 512 | 63.13 | bge-base-fr | 768 | 512 | 63.13 | bge-base-zh-v1.5 | bge-base-en | 768 | 512 | 62.96 | bge-small-zh-v1.5 bge-small-zh-v1.5 | 384 | 512 | 57.82 | bge-small-zh-v1.5 | 384 | 512 | 57.82 | bge-small-zh-fr | bge-small-zh | 384 | 512 | 58.27 | bge-small-zh-v1.5 | bge-small-zh-v1.5
Comment créer des embeddings avec bge-base-zh-v1.5
Il y a deux façons principales de créer des embeddings vectoriels :
- PyMilvus : le SDK Python pour Milvus qui intègre de manière transparente
bge-base-zh-v1.5. - FlagEmbedding : le SDK Python officiel offert par BAAI.
Ces méthodes permettent aux développeurs d'incorporer facilement des capacités avancées d'incorporation de texte dans leurs applications.
Une fois les encastrements vectoriels générés, ils peuvent être stockés dans Zilliz Cloud (un service de base de données vectorielles entièrement géré par Milvus) et utilisés pour la recherche de similarité sémantique. Voici les quatre étapes clés :
- S'inscrire pour un compte Zilliz Cloud gratuit.
- Configurez un cluster sans serveur et obtenez le Point de terminaison public et la clé API.
- Créer une collection de vecteurs et insérer vos embeddings vectoriels.
- Exécutez une recherche sémantique sur les embeddings stockés.
Générer des embeddings vectoriels via PyMilvus et les insérer dans Zilliz Cloud pour une recherche sémantique.
from pymilvus import model, MilvusClient
ef = model.dense.SentenceTransformerEmbeddingFunction(
nom_du_modèle="BAAI/bge-base-zh-v1.5",
device="cpu",
query_instruction="为这个句子生成表示以用于检索相关文章:"
)
# Générer des embeddings pour les documents
docs = [
"人工智能作为一门学术学科成立于1958年。"
"艾伦-图灵是第一个在人工智能领域进行实质性研究的人。"
"图灵出生于伦敦的梅达维尔,并在英格兰南部长大。"
]
docs_embeddings = ef.encode_documents(docs)
# Générer des embeddings pour les requêtes
queries = ["人工智能是什么时候成立的?",
"艾伦-图灵出生在哪里?"]
query_embeddings = ef.encode_queries(queries)
# Connexion au nuage Zilliz avec le point de terminaison public et la clé API
client = MilvusClient(
uri=ZILLIZ_PUBLIC_ENDPOINT,
token=ZILLIZ_API_KEY)
COLLECTION = "documents"
if client.has_collection(collection_name=COLLECTION) :
client.drop_collection(nom_de_la_collection=COLLECTION)
client.create_collection(
nom_de_la_collection=COLLECTION,
dimension=ef.dim,
auto_id=True)
for doc, embedding in zip(docs, docs_embeddings) :
client.insert(COLLECTION, {"text" : doc, "vector" : embedding})
results = client.search(
nom_de_la_collection=COLLECTION,
data=query_embeddings,
niveau de cohérence="Fort",
output_fields=["text"])
Pour plus d'informations, consultez notre [documentation PyMilvus Embedding Model] (https://milvus.io/docs/embeddings.md).
Générer des embeddings vectoriels via la bibliothèque Python FlagEmbedding et les insérer dans Zilliz Cloud pour la recherche sémantique.
from FlagEmbedding import FlagModel
from pymilvus import MilvusClient
model = FlagModel("BAAI/bge-base-zh-v1.5",
query_instruction_for_retrieval="为这个句子生成表示以用于检索相关文章:",
use_fp16=False)
# Générer des embeddings pour les documents
docs = [
"人工智能作为一门学术学科成立于1958年。"
"艾伦-图灵是第一个在人工智能领域进行实质性研究的人。"
"图灵出生于伦敦的梅达维尔,并在英格兰南部长大。"
]
docs_embeddings = model.encode(docs)
# Générer des embeddings pour les requêtes
queries = ["人工智能是什么时候成立的?",
"艾伦-图灵出生在哪里?"]
query_embeddings = model.encode_queries(queries)
# Connexion au nuage Zilliz avec le point de terminaison public et la clé API
client = MilvusClient(
uri=ZILLIZ_PUBLIC_ENDPOINT,
token=ZILLIZ_API_KEY)
COLLECTION = "documents"
if client.has_collection(collection_name=COLLECTION) :
client.drop_collection(nom_de_la_collection=COLLECTION)
client.create_collection(
nom_de_la_collection=COLLECTION,
dimension=768,
auto_id=True)
pour doc, embedding dans zip(docs, docs_embeddings) :
client.insert(COLLECTION, {"text" : doc, "vector" : embedding})
results = client.search(
nom_de_la_collection=COLLECTION,
data=query_embeddings,
niveau de cohérence="Fort",
output_fields=["text"])
Pour plus d'informations, voir [la page modèle sur HuggingFace] (https://huggingface.co/BAAI/bge-base-zh-v1.5).
Workflows IA fluides
Des embeddings à la recherche IA évolutive - Zilliz Cloud vous permet de stocker, indexer et récupérer des embeddings avec une vitesse et une efficacité inégalées.
Essayer Zilliz Cloud gratuitement




