Nomic / nomic-embed-text-v1
Milvus Integrated
Задача: Встраивание
Модальность: Текст
Метрика сходства: Косинус
Лицензия: Apache 2.0
Размерности: 768
Максимальное количество входных токенов: 8192
Цена: Бесплатно
Введение в nomic-embed-text-v1
Модель nomic-embed-text-v1 — это open-source, open-data модель текстовых эмбеддингов с открытым кодом обучения, разработанная так, чтобы быть полностью воспроизводимой и доступной для аудита. Она поддерживает контекстное окно в 8192 токена и специализирована для поиска, оценки сходства, кластеризации и классификации, обеспечивая высокую производительность как в задачах с коротким, так и с длинным контекстом.
Nomic-embed-text-v1 теперь является мультимодальной благодаря nomic-embed-vision-v1, которая использует то же пространство эмбеддингов, поэтому текстовые эмбеддинги можно использовать напрямую вместе с эмбеддингами изображений.
Как создавать эмбеддинги с помощью nomic-embed-text-v1
Существует два основных способа генерации векторных эмбеддингов:
- PyMilvus: Python SDK для Milvus, который бесшовно интегрирует модель
nomic-embed-text-v1. - Модуль
embedв Nomic Python SDK предоставляет функциональность эмбеддингов с использованием Nomic Embedding API.
После генерации векторных эмбеддингов их можно сохранить в Zilliz Cloud (полностью управляемом сервисе векторной базы данных на базе Milvus) и использовать для семантического поиска по сходству. Вот четыре ключевых шага:
- Зарегистрируйтесь бесплатно, чтобы создать аккаунт Zilliz Cloud.
- Настройте serverless-кластер и получите Public Endpoint и API Key.
- Создайте векторную коллекцию и вставьте свои векторные эмбеддинги.
- Выполните семантический поиск по сохраненным эмбеддингам.
Создание эмбеддингов через PyMilvus и вставка их в Zilliz Cloud для семантического поиска
from pymilvus import MilvusClient
from nomic import embed
# Prepare documents
docs = [
"Artificial intelligence was founded as an academic discipline in 1956.",
"Alan Turing was the first person to conduct substantial research in AI.",
"Born in Maida Vale, London, Turing was raised in southern England.",
]
# Generate embeddings for documents using nomic-embed-text-v1.5
docs_embeddings = embed.text(
texts=docs, model="nomic-embed-text-v1.5", task_type="search_document"
)["embeddings"]
# Prepare queries
queries = ["When was artificial intelligence founded", "Where was Alan Turing born?"]
# Generate embeddings for queries
query_embeddings = embed.text(
texts=queries, model="nomic-embed-text-v1.5", task_type="search_query"
)["embeddings"]
# Connect to Zilliz Cloud with Public Endpoint and API Key
client = MilvusClient(uri=ZILLIZ_PUBLIC_ENDPOINT, token=ZILLIZ_API_KEY)
COLLECTION = "nomic_v1_5_documents"
# Drop collection if it exists
if client.has_collection(collection_name=COLLECTION):
client.drop_collection(collection_name=COLLECTION)
# Create collection with dimension 768 (nomic-embed-text-v1.5 output dimension)
client.create_collection(collection_name=COLLECTION, dimension=768, auto_id=True)
# Insert documents with embeddings
for doc, embedding in zip(docs, docs_embeddings):
client.insert(COLLECTION, {"text": doc, "vector": embedding})
# Search for similar documents
results = client.search(
collection_name=COLLECTION,
data=query_embeddings,
# consistency_level="Strong", # Strong consistency ensures accurate results but may increase latency
output_fields=["text"],
limit=2,
)
# Print search results
for i, query in enumerate(queries):
print(f"\nQuery: {query}")
for result in results[i]:
print(f" - {result['entity']['text']} (distance: {result['distance']:.4f})")
Для получения дополнительной информации обратитесь к нашей документации по PyMilvus Embedding Model.
Беспрерывные AI рабочие процессы
От встраиваний до масштабируемого AI поиска—Zilliz Cloud позволяет вам хранить, индексировать и извлекать встраивания с непревзойденной скоростью и эффективностью.
Попробуйте Zilliz Cloud Бесплатно




