Nomic / nomic-embed-text-v1.5
Milvus Integrated
Задача: Встраивание
Модальность: Текст
Метрика сходства: Косинус
Лицензия: Apache 2.0
Размерности: 768
Максимальное количество входных токенов: 8192
Цена: Бесплатно
Введение в nomic-embed-text-v1.5
Модель nomic-embed-text-v1.5 — это модель текстовых эмбеддингов с входным окном в 8192 токена и поддержкой переменных размеров эмбеддингов. Обученная с помощью Matryoshka Representation Learning, она позволяет разработчикам генерировать компактные или более емкие эмбеддинги из одной и той же модели, с рекомендуемыми размерами 768, 512, 256, 128 и 64.
Nomic-embed-text-v1.5 теперь является мультимодальной благодаря nomic-embed-vision-v1.5, которая использует то же пространство эмбеддингов, поэтому текстовые эмбеддинги можно использовать напрямую вместе с эмбеддингами изображений.
Как создавать эмбеддинги с помощью nomic-embed-text-v1.5
Существует два основных способа генерации векторных эмбеддингов:
- PyMilvus: Python SDK для Milvus, который бесшовно интегрирует модель
nomic-embed-text-v1.5. - Модуль
embedв Nomic Python SDK предоставляет функциональность эмбеддингов с использованием Nomic Embedding API.
После генерации векторных эмбеддингов их можно хранить в Zilliz Cloud (полностью управляемом сервисе векторной базы данных на базе Milvus) и использовать для поиска по семантическому сходству. Вот четыре ключевых шага:
- Зарегистрируйтесь для бесплатного аккаунта Zilliz Cloud.
- Настройте serverless-кластер и получите Public Endpoint и API Key.
- Создайте векторную коллекцию и вставьте свои векторные эмбеддинги.
- Выполните семантический поиск по сохраненным эмбеддингам.
Создание эмбеддингов через PyMilvus и вставка их в Zilliz Cloud для семантического поиска
from pymilvus import MilvusClient
from nomic import embed
# Prepare documents
docs = [
"Artificial intelligence was founded as an academic discipline in 1956.",
"Alan Turing was the first person to conduct substantial research in AI.",
"Born in Maida Vale, London, Turing was raised in southern England.",
]
# Generate embeddings for documents using nomic-embed-text-v1.5
docs_embeddings = embed.text(
texts=docs, model="nomic-embed-text-v1.5", task_type="search_document"
)["embeddings"]
# Prepare queries
queries = ["When was artificial intelligence founded", "Where was Alan Turing born?"]
# Generate embeddings for queries
query_embeddings = embed.text(
texts=queries, model="nomic-embed-text-v1.5", task_type="search_query"
)["embeddings"]
# Connect to Zilliz Cloud with Public Endpoint and API Key
client = MilvusClient(uri=ZILLIZ_PUBLIC_ENDPOINT, token=ZILLIZ_API_KEY)
COLLECTION = "nomic_v1_5_documents"
# Drop collection if it exists
if client.has_collection(collection_name=COLLECTION):
client.drop_collection(collection_name=COLLECTION)
# Create collection with dimension 768 (nomic-embed-text-v1.5 output dimension)
client.create_collection(collection_name=COLLECTION, dimension=768, auto_id=True)
# Insert documents with embeddings
for doc, embedding in zip(docs, docs_embeddings):
client.insert(COLLECTION, {"text": doc, "vector": embedding})
# Search for similar documents
results = client.search(
collection_name=COLLECTION,
data=query_embeddings,
# consistency_level="Strong", # Strong consistency ensures accurate results but may increase latency
output_fields=["text"],
limit=2,
)
# Print search results
for i, query in enumerate(queries):
print(f"\nQuery: {query}")
for result in results[i]:
print(f" - {result['entity']['text']} (distance: {result['distance']:.4f})")
Для получения дополнительной информации обратитесь к нашей документации по PyMilvus Embedding Model.
Беспрерывные AI рабочие процессы
От встраиваний до масштабируемого AI поиска—Zilliz Cloud позволяет вам хранить, индексировать и извлекать встраивания с непревзойденной скоростью и эффективностью.
Попробуйте Zilliz Cloud Бесплатно




