8 новейших достижений RAG, о которых должен знать каждый разработчик
Большие языковые модели (LLMs) мощны, но их качество зависит от обучающих данных. Когда вы задаете сложный вопрос, вы хотите, чтобы ИИ объединял свои встроенные знания со свежей, релевантной информацией из внешних источников. Именно это и делает Retrieval-Augmented Generation — она устраняет разрыв между статическими обучающими данными и динамической, актуальной информацией.
Традиционный RAG был значимым, но разработчики продолжают расширять границы возможного. В этой статье мы рассмотрим восемь продвинутых вариантов RAG, которые могут решить реальные проблемы, с которыми вы можете сталкиваться: медленное извлечение, плохое понимание контекста, обработка мультимодальных данных и оптимизация ресурсов.
Почему эти новые типы RAG важны
Традиционные системы RAG объединяли два этапа: извлечение релевантных данных в качестве контекста из базы знаний на базе векторной базы данных, такой как Milvus, и генерацию ответов с использованием языковой модели.
Несмотря на эффективность, ранние реализации RAG сталкивались с проблемами эффективности, масштабируемости и управления потоками данных. Они часто полагались на простые меры сходства, которые могли упускать важные нюансы, что приводило к общим ответам на сложные запросы. Чтобы преодолеть эти ограничения, исследователи представили новые стратегии, позволяющие моделям:
Динамически определять этапы извлечения: Вместо того чтобы всегда извлекать данные за один раз, новые методы определяют оптимальные моменты для извлечения внешней информации.
Включать мультимодальные данные: Помимо текста, некоторые системы могут извлекать изображения и видео, чтобы обогащать генерируемый контент.
Оптимизировать использование ресурсов: Продвинутые фреймворки RAG корректируют распределение вычислительных ресурсов в зависимости от сложности запроса.
Именно здесь проявляются захватывающие достижения в RAG. Эти улучшения привели к более точным, контекстно-ориентированным результатам, которые лучше отвечают потребностям как разработчиков, так и бизнеса.
Краткий справочник: какой RAG стоит использовать?
Вот удобный для разработчиков обзор того, что мы рассмотрим:
| Тип RAG | Ключевая инновация | Лучше всего подходит для |
| DeepRAG | Пошаговый процесс принятия решений об извлечении | Юридический или медицинский анализ |
| RealRAG | Обработка данных в реальном времени | Мониторинг соцсетей, новостное приложение |
| CoRAG | Последовательное, адаптивное многоэтапное извлечение | Техническое устранение неполадок |
| VideoRAG | Понимание видео через текст | Резюмирование лекций |
| CFT-RAG | Извлечение на основе деревьев (текст + изображение) | Обнаружение мошенничества |
| CG-RAG | Контекстное рассуждение на основе графов | Академические исследования с цитированием |
| GFM-RAG | Связи знаний с помощью графовых нейронных сетей | Анализ патентов |
| URAG | Унифицированная поддержка (текст + изображение + аудио) | Образовательные чатботы |
DeepRAG
DeepRAG заменяет традиционные конвейеры извлечения единой нейронной сетью, обученной end-to-end. Она моделирует рассуждение с дополнением извлечением как процесс принятия решений. Вместо того чтобы рассматривать извлечение и генерацию как отдельные задачи, она динамически решает, когда полагаться на внешние данные, а когда — на внутреннее рассуждение. Такой пошаговый подход эффективно нацелен на конкретные пробелы в знаниях.
Он повышает глубину и точность, улучшая задачи, требующие интенсивного рассуждения, примерно на 8–15% и сокращает ненужное извлечение данных, экономя вычислительные ресурсы. При этом он может повышать сложность проектирования системы и требовать тонкой настройки для балансировки частоты извлечения. Он идеально подходит для проверки фактов, многоэтапных задач рассуждения, исследовательских областей и создания подробных отчетов (например, анализа юридических документов или поддержки медицинской диагностики).
Ключевые особенности:
Динамическое извлечение: Оценивает каждый шаг, чтобы решить, требуется ли извлечение.
Стратегическое принятие решений: Использует процесс принятия решений, похожий на марковский процесс принятия решений.
GitHub: https://github.com/microsoft/deepRAG
Статья: https://arxiv.org/html/2502.01142v1
RealRAG
RealRAG улучшает генеративные модели text-to-image (например, Flux и Stable Diffusion V3), извлекая реальные изображения. Сравнивая сгенерированные изображения с извлеченными примерами, система заполняет пробелы в знаниях для повышения реалистичности.
Он создает более реалистичные изображения и улучшает качество визуального контента. Однако он требует высоких инфраструктурных затрат для круглосуточной мультимодальной обработки. Он также может испытывать трудности в областях с ограниченным количеством качественных наборов изображений. Он особенно полезен для проектирования продуктов и медицинской визуализации, где точные визуальные представления имеют ключевое значение.
Рисунок — Обзор RealRAG
Рисунок: Обзор RealRAG (Источник).
Ключевые особенности:
Увеличение показателя FID: 16,18% на бенчмарке Stanford Car
Извлечение на основе изображений: Улучшает генерацию с помощью внешних визуальных данных.
Саморефлексивное обучение: Уточняет результаты через обратную связь от сравнений изображений.
Статья: https://arxiv.org/abs/2502.00848
CoRAG: Генерация с дополнением цепочкой извлечений
Вдохновленный подсказками chain-of-thought, CoRAG разбивает запросы на подвопросы и последовательно извлекает информацию. Он регулирует глубину и ширину извлечения в зависимости от сложности запроса и при необходимости переформулирует запросы.
Он обрабатывает многогранные вопросы с точностью до 30% выше и приоритизирует важную информацию посредством последовательного извлечения. Однако несколько раундов извлечения увеличивают задержку. Он идеально подходит для технического устранения неполадок или исследований, где запросы требуют многоуровневой информации.
Ключевые особенности:
Последовательное извлечение: Извлекает данные в несколько шагов для уточнения ответа.
Адаптивное распределение вычислений: Балансирует ресурсы в зависимости от потребностей в данных.
Статья: https://arxiv.org/abs/2501.14342
VideoRAG: Генерация с дополнением извлечением по видеокорпусу
Видеоконтент является богатым источником информации, но традиционный RAG в основном разработан для текстовых документов. VideoRAG расширяет возможности RAG на видеоконтент, используя визуально-языковые модели (VLM), такие как CLIP, а также speech-to-text, анализ кадров и обработку аудио для извлечения информации. Это позволяет LLM понимать, обрабатывать и отвечать на запросы, связанные с видео. Он преобразует видеокадры в текстовые эмбеддинги, чтобы поддерживать запросы вроде «Найдите сцены с эмоциональным конфликтом».
VideoRAG может обрабатывать чрезвычайно длинный видеоконтент без ущерба для точности. Его двухканальная архитектура предоставляет подробные, насыщенные контекстом сводки видеоданных. К сожалению, он требует значительных ресурсов GPU для обработки 4K-видео и сложен в управлении мультимодальными потоками данных. Он подходит для анализа видеоконтента, конспектирования лекций и генерации мультимедийного контента.
Ключевые особенности:
Двухканальная архитектура: Отдельно обрабатывает текстовые и визуальные данные.
Обработка видео неограниченной длины: Сохраняет контекст в длинных видеопоследовательностях.
Ниже приведен простой рабочий процесс того, как это работает:
Разделить видео на кадры.
Сгенерировать эмбеддинги с помощью CLIP.
Сохраняйте эмбеддинги в векторной базе данных (Milvus) для поиска по сходству.
Извлекайте релевантные клипы и генерируйте резюме.
Статья: https://arxiv.org/abs/2501.05874
GitHub: https://github.com/starsuzi/VideoRAG
CFT-RAG: RAG на основе дерева фильтров Cuckoo
CFT-RAG использует метод ускорения на основе дерева с применением улучшенного фильтра Cuckoo со структурированными данными (например, CSV-файлами, SQL-таблицами). Это ускоряет локализацию сущностей во время извлечения, обеспечивая более быстрый доступ к релевантной информации. Он поддерживает как текст, так и изображения. Например, запрос «Покажи мне рецепты здорового питания» возвращает списки ингредиентов и кулинарные видео.
Он значительно ускоряет процесс извлечения и повышает точность, фокусируясь на ключевых сущностях. Хотя он требует чистых, хорошо структурированных данных, а поддержание древовидной структуры требует регулярных обновлений. Он лучше всего подходит для систем поддержки в реальном времени, обнаружения мошенничества или платформ высокочастотной торговли.
Ключевые особенности:
Извлечение и генерация: Milvus для мультимодальных эмбеддингов, GPT-4 с возможностями зрения.
Древовидная структура сущностей: Организует информацию в иерархическое дерево.
Оптимизация фильтра Cuckoo: Повышает скорость и точность извлечения.
Статья: https://arxiv.org/abs/2501.15098
CG-RAG: Контекстуализированный графовый RAG
CG-RAG улучшает контекст с помощью графов знаний для фиксации отношений между сущностями (такими как люди или события). Он использует Lexical-Semantic Graph Retrieval (LeSeGR) для повышения качества ответов, учитывая взаимосвязи между концептами. Например, запрос «Запуски продуктов Apple» извлекает сущности (например, iPhone, генеральных директоров) и их отношения. Инструменты вроде Neo4j используются для хранения графов, а Graph Neural Networks (GNNs) — для обхода.
Эта инновация RAG превосходно работает со сложными темами или исследовательскими вопросами, отображая связи цитирования. Но она также требует предварительного проектирования схемы, а графовые запросы могут быть ресурсоемкими. В целом, она весьма эффективна в академических исследованиях, технической документации и сценариях, где нужны глубокие инсайты о взаимосвязанных данных.
Ключевые особенности:
Графовое извлечение: Структурирует информацию как взаимосвязанные узлы.
Связи цитирования: Фиксирует, как разные фрагменты информации соотносятся друг с другом.
Рисунок — обзор CG-RAG
Рисунок: Обзор CG-RAG (Источник).
Статья: https://arxiv.org/abs/2501.15067
Другие инновации GraphRAG:
GFM-RAG: Графовая фундаментальная модель для RAG
GFM-RAG использует графовую фундаментальную модель с применением GNN для уточнения связей между запросами на нишевых наборах данных (например, академических статьях, патентных заявках) для доменов с большим количеством профессионального жаргона. Этот подход обеспечивает многошаговое рассуждение по структурированному графу знаний, значительно повышая точность в запросах, требующих интенсивной работы со знаниями.
Он повышает точность в запросах, требующих интенсивной работы со знаниями, и способен обрабатывать сложные отношения в больших наборах данных. Однако он требует четко определенных наборов признаков, а сложные запросы могут замедлять ответы. Он эффективен в научных исследованиях, требующих точного сопоставления данных.
Ключевые особенности:
Графовая нейронная сеть (GNN): Семантически обогащает извлеченные данные.
Многошаговое рассуждение: Связывает разрозненную информацию между документами.
Статья: https://arxiv.org/abs/2502.01113
URAG: Унифицированный RAG
URAG объединяет текст, изображения, аудио и видео в рамках одной архитектуры. Он использует методы на основе правил вместе с техниками RAG для поддержки облегченных LLM, предоставляя точные ответы в средах с ограниченными вычислительными ресурсами.
Он обеспечивает точные ответы при сниженных вычислительных затратах. Однако компоненты на основе правил могут ограничивать гибкость. Баланс между поиском и логикой на основе правил может быть сложным. Он идеально подходит для образовательных чат-ботов, отвечающих с помощью текста и диаграмм.
Ключевые особенности:
Модульный дизайн: Заменяйте компоненты поиска/генерации.
Поддержка нескольких форматов: Обрабатывает более 10+ форматов данных.
Гибридная система: Интегрирует логику на основе правил с современными методами RAG.
Поддержка легковесных моделей: Оптимизирует производительность для небольших моделей.
Рисунок — Фреймворк URAG для улучшения производительности LLM в университетских чат-ботах
Рисунок: Фреймворк URAG для улучшения производительности LLM в университетских чат-ботах (Источник).
Статья: https://arxiv.org/abs/2501.16276
Сравнение требований к ресурсам
| Тип RAG | Память GPU | Задержка | Сложность настройки | Лучшая производительность |
|---|---|---|---|---|
| DeepRAG | Средняя | Средняя | Средняя | Задачи рассуждения |
| RealRAG | Высокая | Высокая | Высокая | Потоки данных в реальном времени |
| CoRAG | Средняя | Высокая | Средняя | Многошаговые запросы |
| VideoRAG | Очень высокая | Очень высокая | Высокая | Видеоконтент |
| CFT-RAG | Низкая | Низкая | Средняя | Структурированные данные |
| CG-RAG | Средняя | Средняя | Высокая | Запросы по связям |
| GFM-RAG | Высокая | Средняя | Очень высокая | Сложное рассуждение |
| URAG | Средняя | Средняя | Средняя | Смешанный контент |
Восемь вариантов RAG, которые мы рассмотрели, представляют собой интересные недавние разработки в этой области, большинство из которых появились в исследовательских статьях и ранних реализациях. Хотя эти инновации выглядят очень перспективно и демонстрируют интересные подходы к распространенным проблемам RAG, они всё ещё развиваются, пока сообщество экспериментирует с ними в разных контекстах.
Как и с любой новой технологией, мы рекомендуем начинать с небольших экспериментов, чтобы понять, как эти подходы работают с вашими конкретными данными и сценариями использования. Примеры кода и рекомендации ниже предназначены для того, чтобы помочь вам начать исследование, а не служить производственными шаблонами. Каждый вариант может потребовать некоторой адаптации под ваши конкретные требования и инфраструктуру.
Заключение
Последние достижения в области RAG решают критически важные задачи в ИИ, повышая точность, скорость и осведомлённость о контексте, поэтому всегда найдётся вариант RAG, адаптированный под ваши потребности. Эти инновации позволяют создавать более умные и отзывчивые системы, которые могут открывать новые возможности и расширять применение LLM в различных отраслях.
Используя управляемый сервис Milvus от Zilliz Cloud, разработчики могут легко развертывать эти варианты RAG. По мере дальнейшего развития RAG он будет играть критически важную роль в формировании будущего ИИ, обеспечивая ответы, которые не только беглы, но и глубоко информированы актуальными данными и контекстными сигналами.
Связанные ресурсы
Читать далее

How to Improve Retrieval Quality for Japanese Text with Sudachi, Milvus/Zilliz, and AWS Bedrock
Learn how Sudachi normalization and Milvus/Zilliz hybrid search improve Japanese RAG accuracy with BM25 + vector fusion, AWS Bedrock embeddings, and practical code examples.

Introducing Business Critical Plan: Enterprise-Grade Security and Compliance for Mission-Critical AI Applications
Discover Zilliz Cloud’s Business Critical Plan—offering advanced security, compliance, and uptime for mission-critical AI and vector database workloads.

Demystifying the Milvus Sizing Tool
Explore how to use the Sizing Tool to select the optimal configuration for your Milvus deployment.



