Ландшафт экосистемы GenAI: за пределами LLM и векторных баз данных
С момента революционного запуска ChatGPT 20 месяцев назад пространство GenAI пережило значительные изменения и инновации. Изначально наибольшее внимание привлекали Large Language Models (LLMs) и векторные базы данных. Однако экосистема GenAI гораздо шире и сложнее, чем просто эти два компонента. Как разработчик векторной базы данных, важнейшего элемента инфраструктуры, который расширяет возможности приложений GenAI, я с интересом наблюдаю за стремительным технологическим прогрессом и его влиянием на отрасль. В этой статье я хотел бы рассмотреть, что происходило, и поделиться мыслями о ландшафте экосистемы GenAI.
Приложения генеративного ИИ можно в целом разделить на два основных типа: Retrieval-Augmented Generation (RAG) и мультимедийная генерация. RAG объединяет методы поиска информации с генеративными языковыми моделями для создания релевантных и связных результатов. С другой стороны, мультимедийная генерация использует генеративные модели для создания сложного визуального контента, включая креативную рекламу и цифровые двойники.
Генерация с дополнением поиском
Retrieval-Augmented Generation (RAG) в настоящее время является одним из самых популярных сценариев применения генеративного ИИ. Простая система RAG состоит из различных компонентов, включая базовую очистку данных, модель эмбеддингов, vector database и LLM. Более продвинутые RAG-системы производственного уровня обычно включают дополнительные компоненты для повышения качества и улучшения пользовательского опыта. Поскольку RAG-системы напоминают архитектуру традиционных поисковых систем, многие компоненты поисковых систем по-прежнему применимы к RAG сегодня.
Типичную поисковую систему можно разделить на две основные части: офлайн-индексацию и онлайн-обработку запросов. Аналогично RAG состоит из этапа индексации и этапа онлайн-обработки запросов:
Этап индексации: Этап индексации включает получение данных из различных источников, включая базы данных, API и файловые системы. Эти данные проходят разбор файлов и разбиение текста на фрагменты, чтобы подготовить их к анализу. После обработки данные преобразуются в эмбеддинги в подходящем формате и загружаются в векторную базу данных для эффективного поиска. Некоторые RAG-системы даже включают продвинутые методы анализа данных, такие как извлечение меток, построение Knowledge Graph и суммаризация, чтобы обогатить данные и улучшить процесс поиска.
Этап обслуживания: Этап онлайн-обработки запросов сосредоточен на понимании намерения пользовательского запроса и применяет различные методы поиска, включая поиск по векторному сходству, чтобы найти наиболее релевантную информацию. Затем результат поиска отправляется в Large Language Model (LLM) для генерации. На этом шаге LLM генерирует связные и контекстуально релевантные результаты на основе найденных данных. Кроме того, LLM может выступать в роли агента, используя внешние инструменты для расширения своих возможностей и предоставления более полных и точных ответов.
В результате многие проекты оркестрации предоставляют реализации различных компонентов и параметры конфигурации. Сложная природа архитектуры также требует оценивать систему как в режиме белого ящика, так и в режиме черного ящика, что приводит к разработке фреймворков оценки.
Каждый компонент также привлекает разработчиков, которые стремятся создавать более качественные и богатые функции, такие как коннекторы для каждого источника данных и модели эмбеддингов, адаптированные под конкретные сценарии использования. Фреймворки инференса LLM предлагают более гибкие варианты развертывания LLM, помимо одних лишь API-сервисов. Кроме того, агентные фреймворки помогают лучше использовать способности LLM к рассуждению и работе с инструментами.
Кроме того, некоторые проекты подходят к RAG с разных точек зрения, исследуя альтернативные методы извлечения, такие как графы знаний, разрабатывая веб-фронтенд-фреймворки для улучшенного пользовательского интерфейса и создавая готовые решения, которые обеспечивают весь рабочий процесс RAG, включая пользовательские интерфейсы чатботов.
Оркестрация и оптимизация рабочих процессов
Для управления сложными рабочими процессами RAG-приложений широко используются SDK, такие как LangChain, LlamaIndex, Haystack, DSPy и Semantic Kernel. Эти фреймворки оркестрации позволяют разработчикам создавать, настраивать и тестировать RAG-пайплайны, обеспечивая их компоновку для достижения наилучшего качества генеративных ответов для конкретных сценариев использования.
Пример: LlamaIndex
LlamaIndex — это фреймворк для создания приложений с расширенным контекстом с использованием LLM. Он позволяет разработчикам интегрировать LLM с приватными данными, предоставляя инструменты для загрузки, парсинга, индексирования и запросов к данным. Такой подход упрощает использование LLM для конкретных приложений, таких как ответы на вопросы, чатботы и понимание документов, за счет включения контекста из пользовательских источников данных, таких как API, SQL-базы данных и документы. LlamaIndex предлагает удобные программные абстракции часто используемых компонентов, таких как различные стратегии разбиения на фрагменты и гибридные методы поиска.
Оценка качества и наблюдаемость
Поскольку RAG — это сложная система, достижение оптимальных результатов в конкретных сценариях может быть непростой задачей. Для решения этих задач необходима научная методология оценки. Такие проекты, как Ragas, Arize, Langfuse, Relari AI, Giskard и DeepEval, предоставляют необходимые метрики и инструменты для оценки и наблюдаемости. Они позволяют разработчикам количественно измерять, мониторить и устранять неполадки в своих RAG-системах.
Пример: Ragas
Ragas — это комплексный фреймворк для оценки RAG-пайплайнов. Ragas предлагает инструменты для оценки метрик качества ответов, таких как достоверность, релевантность и точность контекста. Он поддерживает генерацию синтетических тестовых наборов данных, мониторинг RAG-приложений в продакшене и интеграцию с AI-инструментами и платформами, такими как LangChain и LlamaIndex. Предоставляя согласованную оценку Ragas, которая охватывает ключевые аспекты производительности, этот фреймворк упрощает и количественно оценивает процесс оценки, в конечном итоге повышая эффективность и надежность RAG-пайплайнов.
Коннектор данных и веб-скрейпинг
Способность бесшовно интегрировать и обрабатывать данные из нескольких источников имеет решающее значение. Такие платформы, как Airbyte, Fivetran, лидируют в предоставлении надежных коннекторов данных, а также Apify и Zyte — в веб-скрейпинге. Они позволяют компаниям эффективно собирать, преобразовывать и интегрировать данные в рабочие процессы RAG, упрощая использование возможностей AI для критически важных задач. Сбор данных и подключаемость были критически важны для традиционных поисковых систем, и они столь же актуальны в современном RAG, который в некоторой степени представляет собой новую форму поиска.
Пример: Airbyte
Airbyte — это платформа с открытым исходным кодом для перемещения данных, предназначенная для создания конвейеров извлечения и загрузки (EL) данных. В отличие от многих платформ конвейеров данных, которые в основном сосредоточены на крупных сервисах, Airbyte также поддерживает интеграцию небольших, часто остающихся без внимания сервисов. Поддерживая обширный набор коннекторов и развивая сообщество для обмена пользовательскими коннекторами, Airbyte позволяет компаниям создавать индивидуальные решения для своих конкретных потребностей. Ее надежные коннекторы данных могут обрабатывать неструктурированные данные в эмбеддинги и загружать их в векторные базы данных, такие как Milvus, для семантического поиска по сходству. Эта возможность помогает компаниям эффективно собирать, преобразовывать и интегрировать данные в рабочие процессы RAG, улучшая принятие решений на основе ИИ и поисковые приложения.
Модели эмбеддингов и реранкеры
Глубокие нейронные сети, такие как модели эмбеддингов, меняют способы обработки и понимания неструктурированных данных. Компании, такие как OpenAI, Cohere, Voyage AI, Jina AI и Twelve Labs, находятся на переднем крае разработки передовых моделей, которые преобразуют текстовые и мультимодальные данные в числовые векторы. Эти эмбеддинги обеспечивают векторный поиск Approximate Nearest Neighbor (ANN), позволяя приложениям предоставлять высокорелевантные результаты и аналитические сведения.
Помимо моделей эмбеддингов общего назначения, такие компании, как Voyage AI, создают специализированные модели, которые повышают качество в конкретных вертикалях, таких как юриспруденция и финансы, в то время как Twelve Labs фокусируется на моделях эмбеддингов для поиска видео. Реранкеры — это специально обученные модели, которые сравнивают семантическую релевантность между запросом и небольшим набором документов-кандидатов; они могут дополнительно повысить точность результатов на начальном этапе извлечения на основе векторов. Такие компании, как Cohere, Voyage AI и Jina AI, предлагают реранкеры для повышения точности извлечения.
Пример: Voyage AI
Voyage AI — это команда исследователей ИИ из Stanford и MIT, специализирующаяся на моделях извлечения, включая модели эмбеддингов и реранкеры. Их ведущая модель, voyage-2, обученная с помощью контрастивного обучения на тексте, обеспечивает более высокую точность извлечения, расширенные контекстные окна и эффективный инференс по сравнению с отраслевыми стандартами, такими как модель текстовых эмбеддингов OpenAI. Voyage AI предоставляет как модели общего назначения, так и доменно-специализированные модели, оптимизированные для таких областей, как финансы, многоязычные контексты, юридическая работа и извлечение кода. Voyage AI также предлагает реранкеры, которые улучшают результаты извлечения.
Инференс и хостинг LLM
С ростом спроса на приложения LLM эффективные решения для хостинга и инференса становятся необходимыми. Такие проекты, как vLLM, Lepton AI, Fireworks AI и Octo AI, предоставляют надежную инфраструктуру для развертывания и масштабирования LLM. Они включают различные оптимизации инференса, чтобы обеспечить эффективную работу моделей во время обслуживания.
Пример: vLLM
vLLM — это библиотека с открытым исходным кодом для оптимизированного инференса и обслуживания LLM. Она использует механизм PagedAttention для эффективного управления памятью и поддерживает непрерывное пакетирование входящих запросов. Библиотека обеспечивает быстрое выполнение моделей с помощью графов CUDA/HIP и включает различные методы квантизации, такие как GPTQ, AWQ, SqueezeLLM и FP8 KV Cache. vLLM бесшовно интегрируется с популярными моделями HuggingFace, предоставляя обслуживание с высокой пропускной способностью и алгоритмами декодирования, такими как параллельная выборка и лучевой поиск. Она поддерживает тензорный и конвейерный параллелизм для распределенного инференса, потоковую выдачу результатов и включает API-сервер, совместимый с OpenAI. Кроме того, она предлагает экспериментальные функции, такие как кэширование префиксов и поддержка multi-Lora, и оптимизирована как для GPU NVIDIA, так и для AMD.
Управление агентами и памятью
Экосистема GenAI развивается в области управления памятью и агентных AI-систем благодаря таким решениям, как MemGPT, Mem0, Camel, AutoGPT и CrewAI. Эти инновации позволяют AI-приложениям запоминать историю разговоров, использовать инструменты и взаимодействовать друг с другом, предлагая более персонализированные и контекстно-ориентированные взаимодействия, которые значительно улучшают пользовательский опыт.
Пример: MemGPT
MemGPT — это проект с открытым исходным кодом, направленный на упрощение разработки и развертывания LLM-агентов с сохранением состояния. Используя иерархию памяти и поток управления, похожие на традиционные операционные системы, MemGPT автоматически и интеллектуально управляет различными уровнями хранения, тем самым обеспечивая расширенный контекст в пределах ограниченного контекстного окна LLM. MemGPT облегчает подключение к внешним источникам данных через RAG и поддерживает определение и вызов пользовательских инструментов или функций, упрощая разработку продвинутых LLM-агентов с сохранением состояния.
Внешние инструменты и API для агентов
Интеграция AI-моделей с различными внешними инструментами и API имеет решающее значение для расширения возможностей агентов. Такие сервисы, как Bing API, Google Search API, Twilio, и фреймворки, такие как OpenAPI, упрощают взаимодействие агентов и инструментов, позволяя приложениям получать доступ к внешним данным, сервисам и функциональности и использовать их.
Пример: Bing API
Набор Bing Search API, включающий такие сервисы, как веб-поиск и поиск изображений, предоставляет безопасные результаты поиска без рекламы и с учетом местоположения. Это позволяет агентам получать доступ к информации из миллиардов веб-документов, изображений, видео и новостных источников через один вызов API.
Frontend и пользовательский опыт Search/Chat UI
Создание интуитивно понятных интерфейсов для взаимодействия с AI-приложениями имеет важное значение для их принятия пользователями. Такие фреймворки, как Streamlit, Vercel и Gradio, упрощают разработку AI-приложений, предоставляя удобный пользовательский UI-опыт. Разработчики могут использовать эти фреймворки для настройки интерфейсов под конкретные потребности AI-взаимодействий, такие как чат-боксы для RAG-приложений и функции вроде выбора изображений, кадрирования и просмотра для визуального поиска.
Пример: Streamlit
Streamlit — это Python-фреймворк с открытым исходным кодом, предназначенный для специалистов по данным и инженеров AI/ML, позволяющий создавать динамические и интерактивные приложения для работы с данными с минимальными усилиями по написанию кода. Благодаря акценту на интуитивном синтаксисе и устранению необходимости в CSS, HTML или JavaScript, Streamlit позволяет пользователям быстро создавать и развертывать проработанные приложения. Он интегрируется с популярными библиотеками данных, такими как Pandas и NumPy, и поддерживает backend-компоненты для разработки приложений на основе AI.
Knowledge Graph (KG)
Knowledge Graphs улучшают Retrieval-Augmented Generation, предоставляя структурированные данные, которые повышают точность и релевантность извлечения информации, что приводит к более точным, контекстно-ориентированным ответам, генерируемым AI. Ведущие проекты, такие как WhyHow, GraphRAG и HippoRAG, объединяют структуры Knowledge Graph с техниками RAG для повышения качества результатов поиска и сгенерированных ответов.
Пример: WhyHow
WhyHow — это платформа, предназначенная для помощи разработчикам в более эффективной организации и извлечении неструктурированных данных с акцентом на улучшение сложных систем Retrieval-Augmented Generation (RAG) с использованием Knowledge Graphs. Она предлагает инструменты для гибкой загрузки данных, поддерживает совместное создание графов несколькими участниками для сотрудничества между разработчиками и нетехническими предметными экспертами, а также позволяет детально управлять схемами, чтобы адаптировать графы к конкретным сценариям использования. Делая акцент на небольших модульных графах и векторных фрагментах, WhyHow повышает точность извлечения информации. Платформа совместима с векторными базами данных и включает функции экспорта в различные форматы. Кроме того, WhyHow предоставляет открытый Rule-based Retrieval Package, помогающий создавать более точные рабочие процессы извлечения с помощью продвинутых методов фильтрации.
Готовые и low-code RAG-сервисы
Также существует значительный спрос на готовые и low-code-решения для RAG. Такие проекты, как AnythingLLM, PrivateGPT, Dify, Shakudo, Vectara, Epsilla и FlowiseAI, предлагают простые в использовании решения и определенную степень кастомизации, которые позволяют компаниям быстро внедрять возможности ИИ без необходимости в обширной разработке и глубокой экспертизе в предметной области конвейеров данных и поисковых инфраструктур.
Пример: AnythingLLM
AnythingLLM — это универсальное AI-приложение, которое предоставляет интерактивные RAG-чатботы и AI Agents без необходимости писать код. Оно предназначено для компаний, ищущих приватное решение с нулевой настройкой или настраиваемое AI-приложение без необходимости в обширной экспертизе в программировании. AnythingLLM поддерживает как коммерческие, так и open-source большие языковые модели (LLMs) и векторные базы данных. Приложение обеспечивает full-stack-опыт благодаря локальному и удаленному хостингу. Ключевые функции включают рабочие пространства для организованного управления документами, поддержку нескольких пользователей с настройками разрешений, агентов для просмотра веб-страниц и выполнения кода, настраиваемый встраиваемый чат-виджет и поддержку множества типов документов. AnythingLLM также предоставляет developer API для пользовательских интеграций.
Генерация изображений и видео
Экосистема GenAI не ограничивается текстовыми приложениями; она также охватывает значительные достижения в генерации изображений и видео:
Креативная генерация и цифровой двойник
Такие инструменты, как Midjourney, Stability AI, Runway, Pika и HeyGen, революционизируют креативные индустрии, предоставляя AI-решения для генерации высококачественных изображений и видео. Эти платформы позволяют художникам, маркетологам и разработчикам создавать выразительный визуальный контент, расширяя границы творчества и инноваций.
Пример: Midjourney
Midjourney — это генеративная AI-программа и сервис, разработанные Midjourney, Inc., независимой исследовательской лабораторией в Сан-Франциско. Она создает высококачественные изображения на основе описаний на естественном языке, или промптов, аналогично OpenAI’s DALL-E и Stability AI’s Stable Diffusion. Пользователи взаимодействуют с Midjourney через Discord-бота, где они могут генерировать изображения, вводя промпты с командой /imagine, в результате получая четыре изображения с вариантами апскейлинга. Этот инструмент подчеркивает достижения в экосистеме GenAI, влияя на креативные индустрии за счет расширения возможностей в создании цифрового контента.
Заключительная мысль
Экосистема GenAI — это динамичная и быстро развивающаяся среда, характеризующаяся разнообразием компонентов и сложностью. От фундаментальных технологий, таких как LLMs и векторные базы данных, до инноваций в загрузке данных, оркестрации и генерации изображений — GenAI переопределяет границы искусственного интеллекта. По мере продолжения исследований и инноваций потенциал трансформационного воздействия на различные отрасли огромен. В Zilliz, как создатели векторной базы данных Milvus, мы сотрудничали со многими партнерами в сфере GenAI. Мы с нетерпением ждем возможности наблюдать за продолжающейся эволюцией GenAI и вносить в нее вклад, а также ожидаем возможностей, которые она принесет.
Читать далее

A Developer's Guide to Exploring Milvus 2.6 Features on Zilliz Cloud
Milvus 2.6 marks a shift from “vector search + glue code” to a more advanced retrieval engine, and it is now Generally Available (GA) on Zilliz Cloud (a managed Milvus service).

Zilliz Cloud Update: Smarter Autoscaling for Cost Savings, Stronger Compliance with Audit Logs, and More
What's new in Zilliz Cloud? Smarter autoscaling with scale-down, audit logs GA, enhanced SSO, and Milvus 2.6 in Private Preview.

DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding
Explore DeepSeek-VL2, the open-source MoE vision-language model. Discover its architecture, efficient training pipeline, and top-tier performance.



