Ландшафт экосистемы GenAI: за пределами LLM и векторных баз данных
С момента революционного запуска ChatGPT 20 месяцев назад пространство GenAI пережило значительные изменения и инновации. Изначально наибольшее внимание привлекали Large Language Models (LLMs) и векторные базы данных. Однако экосистема GenAI гораздо шире и сложнее, чем просто эти два компонента. Как разработчик векторной базы данных, важнейшего элемента инфраструктуры, который расширяет возможности приложений GenAI, я с интересом наблюдаю за стремительным технологическим прогрессом и его влиянием на отрасль. В этой статье я хотел бы рассмотреть, что происходило, и поделиться мыслями о ландшафте экосистемы GenAI.
Приложения генеративного ИИ можно в целом разделить на два основных типа: Retrieval-Augmented Generation (RAG) и мультимедийная генерация. RAG объединяет методы поиска информации с генеративными языковыми моделями для создания релевантных и связных результатов. С другой стороны, мультимедийная генерация использует генеративные модели для создания сложного визуального контента, включая креативную рекламу и цифровые двойники.
Генерация с дополнением поиском
Retrieval-Augmented Generation (RAG) в настоящее время является одним из самых популярных сценариев применения генеративного ИИ. Простая система RAG состоит из различных компонентов, включая базовую очистку данных, модель эмбеддингов, vector database и LLM. Более продвинутые RAG-системы производственного уровня обычно включают дополнительные компоненты для повышения качества и улучшения пользовательского опыта. Поскольку RAG-системы напоминают архитектуру традиционных поисковых систем, многие компоненты поисковых систем по-прежнему применимы к RAG сегодня.
Типичную поисковую систему можно разделить на две основные части: офлайн-индексацию и онлайн-обработку запросов. Аналогично RAG состоит из этапа индексации и этапа онлайн-обработки запросов:
Этап индексации: Этап индексации включает получение данных из различных источников, включая базы данных, API и файловые системы. Эти данные проходят разбор файлов и разбиение текста на фрагменты, чтобы подготовить их к анализу. После обработки данные преобразуются в эмбеддинги в подходящем формате и загружаются в векторную базу данных для эффективного поиска. Некоторые RAG-системы даже включают продвинутые методы анализа данных, такие как извлечение меток, построение Knowledge Graph и суммаризация, чтобы обогатить данные и улучшить процесс поиска.
Этап обслуживания: Этап онлайн-обработки запросов сосредоточен на понимании намерения пользовательского запроса и применяет различные методы поиска, включая поиск по векторному сходству, чтобы найти наиболее релевантную информацию. Затем результат поиска отправляется в Large Language Model (LLM) для генерации. На этом шаге LLM генерирует связные и контекстуально релевантные результаты на основе найденных данных. Кроме того, LLM может выступать в роли агента, используя внешние инструменты для расширения своих возможностей и предоставления более полных и точных ответов.
В результате многие проекты оркестрации предоставляют реализации различных компонентов и параметры конфигурации. Сложная природа архитектуры также требует оценивать систему как в режиме белого ящика, так и в режиме черного ящика, что приводит к разработке фреймворков оценки.
Каждый компонент также привлекает разработчиков, которые стремятся создавать более качественные и богатые функции, такие как коннекторы для каждого источника данных и модели эмбеддингов, адаптированные под конкретные сценарии использования. Фреймворки инференса LLM предлагают более гибкие варианты развертывания LLM, помимо одних лишь API-сервисов. Кроме того, агентные фреймворки помогают лучше использовать способности LLM к рассуждению и работе с инструментами.
Кроме того, некоторые проекты подходят к RAG с разных точек зрения, исследуя альтернативные методы извлечения, такие как графы знаний, разрабатывая веб-фронтенд-фреймворки для улучшенного пользовательского интерфейса и создавая готовые решения, которые обеспечивают весь рабочий процесс RAG, включая пользовательские интерфейсы чатботов.
Оркестрация и оптимизация рабочих процессов
Для управления сложными рабочими процессами RAG-приложений широко используются SDK, такие как LangChain, LlamaIndex, Haystack, DSPy и Semantic Kernel. Эти фреймворки оркестрации позволяют разработчикам создавать, настраивать и тестировать RAG-пайплайны, обеспечивая их компоновку для достижения наилучшего качества генеративных ответов для конкретных сценариев использования.
Пример: LlamaIndex
LlamaIndex — это фреймворк для создания приложений с расширенным контекстом с использованием LLM. Он позволяет разработчикам интегрировать LLM с приватными данными, предоставляя инструменты для загрузки, парсинга, индексирования и запросов к данным. Такой подход упрощает использование LLM для конкретных приложений, таких как ответы на вопросы, чатботы и понимание документов, за счет включения контекста из пользовательских источников данных, таких как API, SQL-базы данных и документы. LlamaIndex предлагает удобные программные абстракции часто используемых компонентов, таких как различные стратегии разбиения на фрагменты и гибридные методы поиска.
Оценка качества и наблюдаемость
Поскольку RAG — это сложная система, достижение оптимальных результатов в конкретных сценариях может быть непростой задачей. Для решения этих задач необходима научная методология оценки. Такие проекты, как Ragas, Arize, Langfuse, Relari AI, Giskard и DeepEval, предоставляют необходимые метрики и инструменты для оценки и наблюдаемости. Они позволяют разработчикам количественно измерять, мониторить и устранять неполадки в своих RAG-системах.
Пример: Ragas
Ragas — это комплексный фреймворк для оценки RAG-пайплайнов. Ragas предлагает инструменты для оценки метрик качества ответов, таких как достоверность, релевантность и точность контекста. Он поддерживает генерацию синтетических тестовых наборов данных, мониторинг RAG-приложений в продакшене и интеграцию с AI-инструментами и платформами, такими как LangChain и LlamaIndex. Предоставляя согласованную оценку Ragas, которая охватывает ключевые аспекты производительности, этот фреймворк упрощает и количественно оценивает процесс оценки, в конечном итоге повышая эффективность и надежность RAG-пайплайнов.
Коннектор данных и веб-скрейпинг
Способность бесшовно интегрировать и обрабатывать данные из нескольких источников имеет решающее значение. Такие платформы, как Airbyte, Fivetran, лидируют в предоставлении надежных коннекторов данных, а также Apify и Zyte — в веб-скрейпинге. Они позволяют компаниям эффективно собирать, преобразовывать и интегрировать данные в рабочие процессы RAG, упрощая использование возможностей AI для критически важных задач. Сбор данных и подключаемость были критически важны для традиционных поисковых систем, и они столь же актуальны в современном RAG, который в некоторой степени представляет собой новую форму поиска.
Пример: Airbyte
Airbyte — это платформа с открытым исходным кодом для перемещения данных, предназначенная для создания конвейеров извлечения и загрузки (EL) данных. В отличие от многих платформ конвейеров данных, которые в основном сосредоточены на крупных сервисах, Airbyte также поддерживает интеграцию небольших, часто остающихся без внимания сервисов. Поддерживая обширный набор коннекторов и развивая сообщество для обмена пользовательскими коннекторами, Airbyte позволяет компаниям создавать индивидуальные решения для своих конкретных потребностей. Ее надежные коннекторы данных могут обрабатывать неструктурированные данные в эмбеддинги и загружать их в векторные базы данных, такие как Milvus, для семантического поиска по сходству. Эта возможность помогает компаниям эффективно собирать, преобразовывать и интегрировать данные в рабочие процессы RAG, улучшая принятие решений на основе ИИ и поисковые приложения.
Модели эмбеддингов и реранкеры
Глубокие нейронные сети, такие как модели эмбеддингов, меняют способы обработки и понимания неструктурированных данных. Компании, такие как OpenAI, Cohere, Voyage AI, Jina AI и Twelve Labs, находятся на переднем крае разработки передовых моделей, которые преобразуют текстовые и мультимодальные данные в числовые векторы. Эти эмбеддинги обеспечивают векторный поиск Approximate Nearest Neighbor (ANN), позволяя приложениям предоставлять высокорелевантные результаты и аналитические сведения.
Помимо моделей эмбеддингов общего назначения, такие компании, как Voyage AI, создают специализированные модели, которые повышают качество в конкретных вертикалях, таких как юриспруденция и финансы, в то время как Twelve Labs фокусируется на моделях эмбеддингов для поиска видео. Реранкеры — это специально обученные модели, которые сравнивают семантическую релевантность между запросом и небольшим набором документов-кандидатов; они могут дополнительно повысить точность результатов на начальном этапе извлечения на основе векторов. Такие компании, как Cohere, Voyage AI и Jina AI, предлагают реранкеры для повышения точности извлечения.
Пример: Voyage AI
Voyage AI — это команда исследователей ИИ из Stanford и MIT, специализирующаяся на моделях извлечения, включая модели эмбеддингов и реранкеры. Их ведущая модель, voyage-2, обученная с помощью контрастивного обучения на тексте, обеспечивает более высокую точность извлечения, расширенные контекстные окна и эффективный инференс по сравнению с отраслевыми стандартами, такими как модель текстовых эмбеддингов OpenAI. Voyage AI предоставляет как модели общего назначения, так и доменно-специализированные модели, оптимизированные для таких областей, как финансы, многоязычные контексты, юридическая работа и извлечение кода. Voyage AI также предлагает реранкеры, которые улучшают результаты извлечения.
Инференс и хостинг LLM
С ростом спроса на приложения LLM эффективные решения для хостинга и инференса становятся необходимыми. Такие проекты, как vLLM, Lepton AI, Fireworks AI и Octo AI, предоставляют надежную инфраструктуру для развертывания и масштабирования LLM. Они включают различные оптимизации инференса, чтобы обеспечить эффективную работу моделей во время обслуживания.
Пример: vLLM
vLLM — это библиотека с открытым исходным кодом для оптимизированного инференса и обслуживания LLM. Она использует механизм PagedAttention для эффективного управления памятью и поддерживает непрерывное пакетирование входящих запросов. Библиотека обеспечивает быстрое выполнение моделей с помощью графов CUDA/HIP и включает различные методы квантизации, такие как GPTQ, AWQ, SqueezeLLM и FP8 KV Cache. vLLM бесшовно интегрируется с популярными моделями HuggingFace, предоставляя обслуживание с высокой пропускной способностью и алгоритмами декодирования, такими как параллельная выборка и лучевой поиск. Она поддерживает тензорный и конвейерный параллелизм для распределенного инференса, потоковую выдачу результатов и включает API-сервер, совместимый с OpenAI. Кроме того, она предлагает экспериментальные функции, такие как кэширование префиксов и поддержка multi-Lora, и оптимизирована как для GPU NVIDIA, так и для AMD.
Управление агентами и памятью
Экосистема GenAI развивается в области управления памятью и агентных AI-систем благодаря таким решениям, как MemGPT, Mem0, Camel, AutoGPT и CrewAI. Эти инновации позволяют AI-приложениям запоминать историю разговоров, использовать инструменты и взаимодействовать друг с другом, предлагая более персонализированные и контекстно-ориентированные взаимодействия, которые значительно улучшают пользовательский опыт.
Пример: MemGPT
MemGPT — это проект с открытым исходным кодом, направленный на упрощение разработки и развертывания LLM-агентов с сохранением состояния. Используя иерархию памяти и поток управления, похожие на традиционные операционные системы, MemGPT автоматически и интеллектуально управляет различными уровнями хранения, тем самым обеспечивая расширенный контекст в пределах ограниченного контекстного окна LLM. MemGPT облегчает подключение к внешним источникам данных через RAG и поддерживает определение и вызов пользовательских инструментов или функций, упрощая разработку продвинутых LLM-агентов с сохранением состояния.
Внешние инструменты и API для агентов
Интеграция AI-моделей с различными внешними инструментами и API имеет решающее значение для расширения возможностей агентов. Такие сервисы, как Bing API, Google Search API, Twilio, и фреймворки, такие как OpenAPI, упрощают взаимодействие агентов и инструментов, позволяя приложениям получать доступ к внешним данным, сервисам и функциональности и использовать их.
Пример: Bing API
Набор Bing Search API, включающий такие сервисы, как веб-поиск и поиск изображений, предоставляет безопасные результаты поиска без рекламы и с учетом местоположения. Это позволяет агентам получать доступ к информации из миллиардов веб-документов, изображений, видео и новостных источников через один вызов API.
Frontend и пользовательский опыт Search/Chat UI
Создание интуитивно понятных интерфейсов для взаимодействия с AI-приложениями имеет важное значение для их принятия пользователями. Такие фреймворки, как Streamlit, Vercel и Gradio, упрощают разработку AI-приложений, предоставляя удобный пользовательский UI-опыт. Разработчики могут использовать эти фреймворки для настройки интерфейсов под конкретные потребности AI-взаимодействий, такие как чат-боксы для RAG-приложений и функции вроде выбора изображений, кадрирования и просмотра для визуального поиска.
Пример: Streamlit
Streamlit — это Python-фреймворк с открытым исходным кодом, предназначенный для специалистов по данным и инженеров AI/ML, позволяющий создавать динамические и интерактивные приложения для работы с данными с минимальными усилиями по написанию кода. Благодаря акценту на интуитивном синтаксисе и устранению необходимости в CSS, HTML или JavaScript, Streamlit позволяет пользователям быстро создавать и развертывать проработанные приложения. Он интегрируется с популярными библиотеками данных, такими как Pandas и NumPy, и поддерживает backend-компоненты для разработки приложений на основе AI.
Knowledge Graph (KG)
Knowledge Graphs улучшают Retrieval-Augmented Generation, предоставляя структурированные данные, которые повышают точность и релевантность извлечения информации, что приводит к более точным, контекстно-ориентированным ответам, генерируемым AI. Ведущие проекты, такие как WhyHow, GraphRAG и HippoRAG, объединяют структуры Knowledge Graph с техниками RAG для повышения качества результатов поиска и сгенерированных ответов.
Пример: WhyHow
WhyHow — это платформа, предназначенная для помощи разработчикам в более эффективной организации и извлечении неструктурированных данных с акцентом на улучшение сложных систем Retrieval-Augmented Generation (RAG) с использованием Knowledge Graphs. Она предлагает инструменты для гибкой загрузки данных, поддерживает совместное создание графов несколькими участниками для сотрудничества между разработчиками и нетехническими предметными экспертами, а также позволяет детально управлять схемами, чтобы адаптировать графы к конкретным сценариям использования. Делая акцент на небольших модульных графах и векторных фрагментах, WhyHow повышает точность извлечения информации. Платформа совместима с векторными базами данных и включает функции экспорта в различные форматы. Кроме того, WhyHow предоставляет открытый Rule-based Retrieval Package, помогающий создавать более точные рабочие процессы извлечения с помощью продвинутых методов фильтрации.
Готовые и low-code RAG-сервисы
Также существует значительный спрос на готовые и low-code-решения для RAG. Такие проекты, как AnythingLLM, PrivateGPT, Dify, Shakudo, Vectara, Epsilla и FlowiseAI, предлагают простые в использовании решения и определенную степень кастомизации, которые позволяют компаниям быстро внедрять возможности ИИ без необходимости в обширной разработке и глубокой экспертизе в предметной области конвейеров данных и поисковых инфраструктур.
Пример: AnythingLLM
AnythingLLM — это универсальное AI-приложение, которое предоставляет интерактивные RAG-чатботы и AI Agents без необходимости писать код. Оно предназначено для компаний, ищущих приватное решение с нулевой настройкой или настраиваемое AI-приложение без необходимости в обширной экспертизе в программировании. AnythingLLM поддерживает как коммерческие, так и open-source большие языковые модели (LLMs) и векторные базы данных. Приложение обеспечивает full-stack-опыт благодаря локальному и удаленному хостингу. Ключевые функции включают рабочие пространства для организованного управления документами, поддержку нескольких пользователей с настройками разрешений, агентов для просмотра веб-страниц и выполнения кода, настраиваемый встраиваемый чат-виджет и поддержку множества типов документов. AnythingLLM также предоставляет developer API для пользовательских интеграций.
Генерация изображений и видео
Экосистема GenAI не ограничивается текстовыми приложениями; она также охватывает значительные достижения в генерации изображений и видео:
Креативная генерация и цифровой двойник
Такие инструменты, как Midjourney, Stability AI, Runway, Pika и HeyGen, революционизируют креативные индустрии, предоставляя AI-решения для генерации высококачественных изображений и видео. Эти платформы позволяют художникам, маркетологам и разработчикам создавать выразительный визуальный контент, расширяя границы творчества и инноваций.
Пример: Midjourney
Midjourney — это генеративная AI-программа и сервис, разработанные Midjourney, Inc., независимой исследовательской лабораторией в Сан-Франциско. Она создает высококачественные изображения на основе описаний на естественном языке, или промптов, аналогично OpenAI’s DALL-E и Stability AI’s Stable Diffusion. Пользователи взаимодействуют с Midjourney через Discord-бота, где они могут генерировать изображения, вводя промпты с командой /imagine, в результате получая четыре изображения с вариантами апскейлинга. Этот инструмент подчеркивает достижения в экосистеме GenAI, влияя на креативные индустрии за счет расширения возможностей в создании цифрового контента.
Заключительная мысль
Экосистема GenAI — это динамичная и быстро развивающаяся среда, характеризующаяся разнообразием компонентов и сложностью. От фундаментальных технологий, таких как LLMs и векторные базы данных, до инноваций в загрузке данных, оркестрации и генерации изображений — GenAI переопределяет границы искусственного интеллекта. По мере продолжения исследований и инноваций потенциал трансформационного воздействия на различные отрасли огромен. В Zilliz, как создатели векторной базы данных Milvus, мы сотрудничали со многими партнерами в сфере GenAI. Мы с нетерпением ждем возможности наблюдать за продолжающейся эволюцией GenAI и вносить в нее вклад, а также ожидаем возможностей, которые она принесет.
Читать далее

Context Engineering Strategies for AI Agents: A Developer’s Guide
Learn practical context engineering strategies for AI agents. Explore frameworks, tools, and techniques to improve reliability, efficiency, and cost.

Expanding Our Global Reach: Zilliz Cloud Launches in Azure Central India
Zilliz Cloud expands to Azure Central India. This new region helps customers meet compliance, reduce latency, and optimize cloud costs when building AI applications.

How to Calculate the Total Cost of Your RAG-Based Solutions
In this guide, we’ll break down the main components of RAG costs and show you how to calculate these expenses using the Zilliz RAG Cost Calculator,



