Zilliz x Galileo: Сила векторных вложений
Неструктурированные данные повсюду. IDC оценила, что к 2025 году у нас будет более 175 зеттабайт (21 ноль) данных. 80% из них — это неструктурированные данные. Неструктурированные данные — это данные, которые не вписываются ни в какой заранее определенный формат — они не следуют предустановленной модели данных или схеме. Обычно они представлены в виде текста, изображений, аудио и видео, но могут охватывать и различные другие условия.
Что такое векторное вложение?
На самом базовом уровне векторные вложения — это числовое представление данных. Векторное вложение обычно состоит из сотен или тысяч чисел с плавающей точкой. Высокая размерность позволяет векторным вложениям хранить сложные данные, такие как изображения, аудио и текст. Вы можете извлекать векторные вложения из обученных моделей машинного обучения. Большинство нейронных сетей, используемых в production, имеют много слоев, каждый из которых содержит сотни нейронов. Когда точка данных проходит через функцию прямого распространения нейронной сети, каждый слой создает выход. Обычно эти сети выполняют некоторую классификацию, создаваемую финальным слоем сети. Векторное вложение, представляющее данные, является выходом последнего скрытого слоя, что обычно означает предпоследний слой.
Как можно работать с векторными вложениями?
Векторные вложения — это де-факто способ работы с неструктурированными данными. Если у вас есть данные, которые вы хотите сравнить, мы рекомендуем делать это с помощью векторных вложений. Векторные вложения генерируются из нейронных сетей путем взятия выхода предпоследнего слоя нейронной сети и использования его в качестве векторного вложения входных данных. При генерации векторов вложений необходимо учитывать несколько факторов. Ваши основные соображения — это размер вложений, данные для обучения модели и качество данных. Вы должны убедиться, что ваши векторы имеют размер, который имеет смысл.
Использование векторных вложений для отладки ваших обучающих данных
Найти ошибки в данных
Начальный этап разработки модели в основном связан с решением задач "курирования данных". Основная цель на этом этапе — построить оптимальный набор данных для обучения и оценки модели. Galileo, алгоритмическая платформа LLM Ops для предприятий, использует вложения для обнаружения ошибок в данных посредством кластеризации.
Galileo обладает уникальной способностью показывать ошибки с помощью оценки, называемой Data Error Potential (DEP). DEP предоставляет инструмент для быстрой сортировки и вывода наверх данных, которые являются наиболее сложными и заслуживают изучения при разборе ошибок вашей модели.
Когда дело доходит до отладки ошибок в ваших данных, существуют два типа решений.
Найти образцы, отсутствующие в ваших обучающих данных
После развертывания модели и ее взаимодействия с реальными данными происходит сдвиг в шаблонах трафика. Galileo может обнаруживать дрейф модели, используя вложения для непрерывного мониторинга производительности ML-моделей. Образцы с дрейфом можно аннотировать и добавить в обучающие данные для более надежной производительности.
Найти галлюцинации в данных
Галлюцинация AI относится к ситуациям, когда AI генерирует информацию, которая может звучать правдоподобно, но является неверной или не связанной с контекстом. Эта проблема обычно возникает из-за предвзятостей в проектировании AI, недостаточного понимания реального мира или неполных обучающих данных.
Чтобы решить эту проблему, Galileo активно применяет методы на основе эмбеддингов для выявления случаев галлюцинаций ИИ. Этот подход помогает обнаруживать ошибки в данных и способствует обучению более точных и надежных моделей ИИ.
Поиск ошибок в retrieval augmented generation
(RAG)Retrieval Augmented Generation (RAG) — популярная техника для разработки систем ответов на вопросы и чат-ботов. Однако распространенная проблема этого подхода — плохой retrieval, из-за которого выдаются неверные ответы. Galileo создает оценку context relevance для обнаружения неправильного контекста с использованием методов на основе эмбеддингов, чтобы решить эту проблему. Иногда, даже когда релевантность корректна, генерация может содержать галлюцинации. Galileo предоставит оценку groundedness, измеряющую, был ли ответ модели основан на информации, предоставленной модели в контекстном окне.
Мощные алгоритмы Galileo могут показывать ошибки на уровне токенов, что помогает приложениям перестать создавать галлюцинации.
Индексация, хранение и запрос векторных эмбеддингов
Хотя иметь эмбеддинги — это отлично, необходимо уметь ими пользоваться. Лучше всего иметь что-то, с помощью чего можно индексировать, хранить и запрашивать ваши векторы. В этом и заключается весь смысл векторных баз данных. Векторные базы данных специально созданы для индексации, хранения и выполнения запросов к векторным данным. Возможность индексировать, хранить и запрашивать делает векторные базы данных сильным кандидатом для использования в приложениях LLM. Они идеально подходят для хранения семантического смысла документов и запросов, а также в качестве кэша для FAQ. Прекрасный пример того, как использовать векторные эмбеддинги с приложениями LLM, — OSSChat, приложение, которое позволяет «общаться» с документацией программного обеспечения с открытым исходным кодом.
Один из самых важных аспектов практичного приложения Q/A — использование подходящих векторных эмбеддингов. Чтобы запрашивать документы, нам нужно латентное векторное пространство запросов. Мы используем LLM, такую как ChatGPT, чтобы генерировать вопросы на основе набора документов. Затем мы индексируем и сохраняем эти эмбеддинги, чтобы запрашивать их, когда пользователь задает вопросы.
Краткое изложение возможностей векторных эмбеддингов
Неструктурированные данные — самый распространенный тип данных в мире. Традиционно с неструктурированными данными было сложно работать, потому что они не соответствуют заранее заданной структуре. Глубокое обучение стало более мощным и распространенным, поэтому оно предложило решение для работы с неструктурированными данными, превращая их в векторы.
Векторные эмбеддинги позволяют выполнять математические операции с тем, что изначально не является числами. В этом посте мы представили векторные эмбеддинги, способы работы с ними и четыре конкретных способа использования векторов в текущей парадигме машинного обучения. Вы можете использовать векторные эмбеддинги, чтобы находить ошибки в данных, находить образцы, отсутствующие в ваших обучающих данных, находить галлюцинации и исправлять ошибки в retrieval augmented generation.
Сила векторных эмбеддингов видна по этому широкому спектру вариантов использования. Самый эффективный способ работы с ними — использовать векторную базу данных, такую как Milvus или Zilliz Cloud, для хранения, индексации и запросов к векторам.
Присоединяйтесь к нашему предстоящему вебинару с участием Galileo
Присоединяйтесь к Vikram Chatterji из Galileo и Yujian Tang из Zilliz 12 октября для глубокого погружения в RAG и управление LLM. Этот вебинар предоставит вам практические идеи и методы для улучшения ваших LLM-пайплайнов и качества результатов. Он обещает стать информативной сессией для специалистов по данным и инженеров машинного обучения, которые ищут фреймворки и инструменты для оптимизации производительности RAG и LLM.
Читать далее

Top 10 Context Engineering Techniques You Should Know for Production RAG
A practical guide to context engineering for production LLM systems, covering RAG, context processing, memory, agents, and multimodal context.

Migrating from S3 Vectors to Zilliz Cloud: Unlocking the Power of Tiered Storage
Learn how Zilliz Cloud bridges cost and performance with tiered storage and enterprise-grade features, and how to migrate data from AWS S3 Vectors to Zilliz Cloud.

Announcing the General Availability of Single Sign-On (SSO) on Zilliz Cloud
SSO is GA on Zilliz Cloud, delivering the enterprise-grade identity management capabilities your teams need to deploy vectorDB with confidence.



