Продвинутые техники RAG: объединение текста и визуальных материалов для более точных ответов
Большие языковые модели (LLM) продемонстрировали исключительные возможности в понимании и генерации различных типов контента, текстового или визуального, что привело к их широкому применению в разных отраслях. Несмотря на свою универсальность, LLM часто создают неточную или вымышленную информацию — известную как галлюцинации, — из-за ограниченных знаний в предметной области и устаревших данных.
Retrieval-Augmented Generation (RAG) — это техника, которая решает эти проблемы, объединяя генеративные возможности LLM с системами поиска, извлекающими релевантную информацию из внешних источников. Привязывая ответы LLM к реальным, актуальным данным, RAG повышает точность и контекстную релевантность ответов, а также улучшает общую эффективность системы. Это сочетание генерации и поиска стимулирует инновации, трансформирует обработку данных и делает LLM более надежными в реальных приложениях.
На недавнем Unstructured Data Meetup, организованном Zilliz, Yi Ding, ранее занимавший должность Head of Typescript and Partnerships в LlamaIndex, поделился идеями о новом подходе к RAG: Small to Slide. Этот метод повышает производительность мультимодальных LLM при работе с визуальными данными, такими как презентации или документы с изображениями. В этом блоге мы рассмотрим, как работает RAG, проблемы RAG и продвинутые техники RAG, такие как Small to Slide RAG.
Понимание RAG
RAG объединяет мощь LLM со способностью извлекать конкретную информацию из базы знаний, работающей на основе векторных баз данных. Когда пользователь задает вопрос, система RAG ищет в базе данных релевантную информацию и использует ее для генерации более точного ответа. Давайте посмотрим, как работает процесс RAG.
Рисунок: как работает RAG
Система RAG состоит из трех ключевых компонентов: модели эмбеддингов, векторной базы данных и LLM.
Модель эмбеддингов преобразует документы в векторные эмбеддинги, которые хранятся в векторной базе данных, такой как Milvus.
Когда пользователь задает вопрос, система преобразует запрос в вектор с помощью той же модели эмбеддингов.
Затем векторная база данных выполняет поиск по сходству, чтобы извлечь наиболее релевантную информацию. Эта извлеченная информация объединяется с исходным вопросом, формируя «вопрос с контекстом», который затем отправляется в LLM.
LLM обрабатывает этот обогащенный ввод, чтобы сгенерировать более точный и контекстно релевантный ответ.
Этот метод особенно ценен для работы со специализированными знаниями или динамической, часто обновляемой информацией, гарантируя, что AI-системы предоставляют точные и надежные ответы.
Например, крупная платформа электронной коммерции могла бы использовать этот подход для работы своей системы рекомендаций товаров. Система могла бы обрабатывать миллионы описаний товаров, отзывов клиентов и данных об использовании и сохранять их в виде векторов. Когда пользователь ищет товар, система быстро извлекает наиболее релевантные позиции, учитывая не только ключевые слова, но и семантический смысл запроса.
Проблемы RAG и продвинутые техники RAG
Хотя RAG предоставляет мощные возможности, он также сталкивается с проблемами, которые могут влиять на его эффективность, особенно по мере того, как данные становятся большими и сложными.
Скорость: Поиск в более крупных базах данных занимает больше времени. Это можно смягчить, используя вычисления с аппаратным ускорением, например оптимизацию для GPU или других высокопроизводительных систем.
Точность: Обеспечить извлечение наиболее релевантной информации непросто. Разработчикам нужны способы балансировать производительность и точность данных в зависимости от их потребностей.
Мультимодальные данные: Базовый RAG с трудом справляется с нетекстовыми данными, такими как изображения или диаграммы. В таких случаях становится критически важной работа с различными типами векторных данных.
В следующих разделах мы рассмотрим несколько продвинутых техник RAG — Small to Big RAG, Small to Slide RAG и ColPali, — которые решают эти проблемы, повышая скорость, точность и универсальность систем RAG.
Small to Big RAG
Small to Big RAG — это метод повышения точности систем RAG. Основная идея состоит в том, чтобы разбивать документы на более мелкие фрагменты, сфокусированные на намерении, для точного поиска, но извлекать более крупные контекстные разделы, а не возвращать только точные совпадающие фрагменты, чтобы LLM могли генерировать осмысленные и полные ответы. Это связано с тем, что, хотя более мелкие фрагменты повышают точность поиска, позволяя сосредоточиться на конкретных деталях, они также могут упускать критически важный контекст, что приводит к неполным или неточным ответам.
Давайте рассмотрим один пример.
Рассмотрим запрос: “Где работает Ms. Churilo?”
При обработке модель эмбеддингов может отдавать приоритет менее распространенному слову “Churilo” перед более важными терминами, такими как “work.” В результате система может извлечь предложения, где упоминается “Churilo”, но не предоставить ключевую информацию: “Chris is currently VP of Marketing at Zilliz.”
Small to Big RAG устраняет это ограничение, извлекая весь абзац, где упоминается ее должность, предоставляя LLM полный контекст, необходимый для правильного и полного ответа.
Рисунок: Некорректное извлечение в традиционном RAG
Small to Big RAG особенно эффективен для работы со сложными или многослойными текстовыми данными. Например, в системе технической поддержки извлечение одного предложения с релевантным ключевым словом может оставить за рамками сопутствующие детали, критически важные для понимания. Вместо этого Small to Big RAG извлекает все разделы, связанные с запросом. Например, когда пользователь спрашивает: “Как мне сбросить пароль?” система может извлечь абзац с прямым ответом и включить дополнительный контекст, такой как рекомендации по безопасности, делая ответ более полным и полезным.
Сочетая точность более мелких эмбеддингов с контекстной глубиной более широкого извлечения, Small to Big RAG обеспечивает баланс между точностью и полнотой. Этот подход позволяет AI-системам предоставлять ответы, которые не только точны, но и богаты контекстом, повышая их надежность в реальных приложениях.
Small to Slide RAG
Хотя Small to Big RAG отлично справляется с обработкой текстовых данных, ему трудно извлекать информацию, встроенную в визуальные материалы, такие как слайды, диаграммы или графики. Small to Slide RAG — это улучшенный метод RAG, который решает эту проблему, встраивая текст из визуальных элементов, таких как слайды, но извлекая всё изображение слайда целиком. Затем этот полученный результат передается в мультимодальную LLM и обрабатывается ею; такая модель способна анализировать как текст, так и изображения.
Вот как это работает:
Встраивание текста: Система извлекает и встраивает текст со слайдов.
Визуальное извлечение: Вместо извлечения только текста она извлекает всё изображение слайда, содержащее релевантную информацию.
Мультимодальная обработка: Извлеченные изображения слайдов передаются в мультимодальную LLM (например, GPT-4 с возможностями vision), которая может одновременно обрабатывать как визуальные, так и текстовые компоненты.
Этот метод особенно полезен для работы со сложными документами, где важнейшая информация передается через визуальные элементы. Например, в квартальных финансовых отчетах ключевые выводы часто содержатся в графиках или диаграммах, которые традиционные текстовые RAG-системы могут пропустить. Извлекая и анализируя всё изображение слайда, Small to Slide RAG гарантирует, что ни одна критически важная деталь не будет упущена, обеспечивая более точный и всесторонний ответ.
Чтобы продемонстрировать возможности Small to Slide RAG, Yi Ding провел демо практического примера с использованием презентации Nvidia. Вы можете посмотреть демо здесь.
Рисунок: сравнение контекста, извлеченного традиционной RAG и Small to Slide RAG
В этом демо Yi Ding сравнил контекст, извлеченный традиционной RAG-системой, с Small to Slide RAG при ответе на один и тот же вопрос: "Какие SaaS-платформы поддерживает NVIDIA AI Enterprise?"
Традиционная RAG: Традиционная текстовая RAG-система с трудом смогла дать полный ответ. Она опиралась исключительно на текст, извлеченный со слайдов, упуская критически важную информацию, встроенную в графики и диаграммы. Это ограничение привело к неполному и менее информативному ответу.
Small to Slide RAG: Напротив, Small to Slide RAG показал гораздо лучшие результаты. Система извлекала фактические изображения слайдов, содержащие релевантную информацию, и передавала их в мультимодальную LLM (например, GPT-4 с возможностями vision). Это позволило модели интерпретировать как текст, так и визуальные элементы, формируя гораздо более полный и точный ответ.
Этот пример иллюстрирует уникальное преимущество Small to Slide RAG: его способность работать со сложными документами, где ключевая информация распределена между текстом и визуальными элементами, что делает его бесценным инструментом для обработки визуально насыщенного контента.
Для бесперебойной работы этих методов RAG им требуется инфраструктура для управления сложными запросами и операциями извлечения.
ColPali: расширяя границы
В конце своего выступления Yi представил новую технику под названием ColPali, новую модель извлечения документов, которая расширяет границы Retrieval-Augmented Generation (RAG). В отличие от традиционных методов, которые преобразуют документы с визуальными данными (например, слайды и PDF) в текст, ColPali работает напрямую с визуальными признаками документов, позволяя индексировать и извлекать информацию без подверженного ошибкам этапа извлечения текста.
Как работает ColPali
Хотя ColPali всё еще находится на ранней стадии развития, он меняет привычный подход к извлечению документов, фокусируясь на визуальных данных:
Документы рассматриваются как изображения, полностью обходя преобразование в текст.
Для каждого изображения генерируется несколько эмбеддингов, аналогично визуальным n-граммам, чтобы захватывать мелкозернистые визуальные признаки.
Поиск выполняется путем сравнения визуальных эмбеддингов с запросом и выявления наиболее релевантных областей документа.
Рисунок: Французский документ о добыче нефти в Казахстане, с выделенными определенными областями
Рассмотрим пример, показанный на изображении выше: французский документ о добыче нефти в Казахстане. При запросе о добыче нефти на шельфе ColPali выделяет конкретные области документа — например, графики и диаграммы, — которые наиболее релевантны запросу. Это гарантирует, что учитываются как текстовые, так и визуальные элементы, обеспечивая всестороннее понимание содержимого.
Почему ColPali вызывает интерес
ColPali предлагает несколько ключевых преимуществ по сравнению с традиционными системами RAG:
Работая напрямую с изображениями, он избегает неточностей, возникающих при преобразовании сложных документов (например, PDF) в текст.
Он захватывает визуальную информацию, такую как макеты, диаграммы и форматирование, которая часто теряется в текстовых методах.
ColPali обеспечивает извлечение и поиск визуальных данных, открывая возможности в таких областях, как техническое проектирование, юридическая документация и других.
Практическим применением ColPali могли бы стать проверки архитектурных проектов. Представьте систему ИИ, которая напрямую анализирует чертежи и технические рисунки. При запросе о конкретных элементах дизайна система могла бы выделять релевантные части чертежей, объединяя как текстовые аннотации, так и визуальные признаки.
Проблемы и ограничения ColPali
Хотя ColPali выглядит многообещающе, он все еще находится на ранней стадии и имеет ряд проблем:
Высокие вычислительные требования: Генерация и сравнение нескольких эмбеддингов на изображение требует значительных вычислительных ресурсов, что делает ускорение на GPU необходимым для практического использования.
Ограниченная экосистема: По сравнению с более устоявшимися методами RAG, для реализации ColPali доступно меньше инструментов и ресурсов.
Модели, специфичные для языка и обучения: Модели ColPali в настоящее время опираются на определенные обучающие наборы данных, что может ограничивать обобщение на разные домены.
Плюсы и минусы каждого метода RAG
Каждый из методов, которые мы обсудили выше, имеет свои преимущества и ограничения.
Рисунок: Сравнение различных методов RAG
Text-based RAG проще всего реализовать, и он выигрывает от широкой поддержки инструментами. Однако ему сложно сохранять мультимодальную информацию, и он не всегда идеально справляется с разбиением на фрагменты. С другой стороны, Small to Slide улучшает захват мультимодальных данных, хотя требует более сложной настройки и лучше всего работает с определенными типами данных. Наконец, ColPali упрощает процесс, устраняя необходимость преобразования в текст и интегрируя встроенную атрибуцию, но требует GPU и пользовательских моделей, что может ограничивать доступность для некоторых проектов.
Реализация продвинутого RAG: практические соображения
Если вы рассматриваете возможность внедрения этих продвинутых методов RAG в своих проектах, вот несколько моментов, которые стоит иметь в виду.
Оценка данных
Посмотрите на типы данных, с которыми вы работаете. Если у вас много документов с графиками, изображениями или сложными макетами, такие подходы, как Small to Slide RAG, могут быть особенно полезны. Например, если вы создаете систему для анализа финансовых отчетов, которые часто содержат смесь текста, таблиц и графиков, Small to Slide RAG может дать более всесторонние выводы, чем подход только на основе текста.
Вычислительные ресурсы
Такие методы, как Small to Slide RAG и ColPali, могут требовать больше вычислительных ресурсов, чем традиционный RAG. Убедитесь, что у вас есть необходимые ресурсы, особенно при работе с большими наборами данных.
Выбор модели
Эти продвинутые техники часто требуют определённых типов моделей. Для Small to Slide RAG вам понадобится мультимодальная LLM, способная обрабатывать текст и изображения. Убедитесь, что вы выбираете модель, которая соответствует вашим потребностям, и что у вас есть ресурсы для её запуска.
Возможности векторной базы данных
Выбор правильной векторной базы данных имеет решающее значение для реализации системы RAG, адаптированной под ваши потребности. Например, если вы внедряете Small to Big RAG, вам понадобится векторная база данных, способная эффективно извлекать более крупные фрагменты текста с использованием эмбеддингов, сгенерированных из более мелких фрагментов. Масштабируемость становится ключевым фактором, если ваше приложение работает с огромными объёмами векторных данных, такими как наборы данных миллиардного масштаба. Решения вроде Milvus и его управляемого сервиса Zilliz Cloud разработаны для таких сценариев, предлагая высокомасштабируемый и эффективный векторный поиск.
Метрики оценки
Разработайте чёткие метрики для оценки производительности вашей системы RAG, включая релевантность извлечённой информации, точность сгенерированных ответов, а также скорость извлечения и генерации.
Итеративная разработка
RAG быстро развивается. Планируйте итеративный процесс разработки, который позволит вам легко тестировать и сравнивать разные подходы. Начните с базовой реализации RAG, затем постепенно внедряйте более продвинутые техники, такие как Small to Big RAG или Small to Slide RAG. Постоянно оценивайте производительность и обратную связь пользователей, чтобы направлять процесс разработки.
Заключение
Техники RAG продолжают развиваться, предлагая различные подходы, такие как текстовый RAG, Small to Slide RAG и ColPali, для решения разных задач. Хотя текстовый RAG служит надёжной отправной точкой для общих приложений, более специализированные случаи, особенно связанные с обработкой визуальных данных, могут выиграть от продвинутых методов, таких как Small to Slide RAG или ColPali.
Выбор правильного метода зависит от ваших данных и имеющихся ресурсов. Каждый подход предоставляет способ повысить эффективность и точность ИИ-систем, обеспечивая лучший баланс между сложностью, скоростью и стоимостью. Согласовав свой подход с конкретными требованиями, вы можете использовать RAG для создания систем, которые предоставляют пользователям нужную информацию в нужное время и в нужном формате.
Дополнительные ресурсы
Читать далее

A Few Notes from Databricks Data + AI Summit 2026: Why the Data Layer Matters Again
James Luan shares notes from Databricks Data + AI Summit 2026 on why production AI is pushing the data layer back to the center of infrastructure.

Notion's Vector Search Is Excellent. Their Next Problem Is Harder.
Notion solved vector search scaling in two years. The next bottleneck — offline context engineering, unified data, and the real-time/offline gap — is harder.

Announcing VDBBench 1.0: Open-Source VectorDB Benchmarking with Your Real-World Production Workloads
Discover VDBBench 1.0, an open-source tool for benchmarking vector databases with real-world production data, streaming ingestion, and concurrent workloads.



