Мультимодальные конвейеры для ИИ-приложений
Успех в приложениях искусственного интеллекта (AI) требует эффективной подготовки и управления данными. Более надежный конвейер данных приводит к более точным, надежным и контекстно-ориентированным результатам. По мере того как рабочие процессы AI становятся всё более сложными, потребность в масштабируемых, интеллектуальных конвейерах для их поддержки стала насущной.
Современные системы AI испытывают трудности с неструктурированными данными, такими как отчеты, изображения и PDF-файлы. Системы, использующие retrieval augmented generation (RAG), требуют точных стратегий для обработки сложных данных при сохранении точности результатов и снижении затрат.
Создание таких систем означает парсинг данных из разных форматов, работу с непредсказуемыми выводами AI и построение конвейеров, которые могут эффективно масштабироваться. Недавно на Unstructured Data Meetup, организованном Zilliz, Sam, CTO Datavolo с более чем 18-летним опытом в инженерии данных и AI, рассмотрел эти вызовы.
Платформа DataVolo, построенная на Apache NiFi, была представлена как способ решения этих проблем. Она упрощает обработку неструктурированных данных и позволяет создавать масштабируемые облачные конвейеры. DataVolo также поддерживает реагирование в реальном времени на метаданные, изменения разрешений и надежные фреймворки оценки для работы с недетерминированными моделями AI.
В этой статье объясняются ключевые выводы из сессии о лучших практиках для мультимодальных конвейеров. Мы рассмотрим управление неструктурированными данными и векторными базами данных, такими как Milvus, для эффективного поиска и практические стратегии для улучшения рабочих процессов AI.
Полное видео встречи можно найти здесь.
Почему мультимодальные конвейеры критически важны для AI
Основная проблема, с которой компании могут столкнуться при внедрении AI в крупных масштабах, — это работа с огромными объемами сложных данных. Традиционные инструменты extract-transform-load (ETL) не могут справляться с задачами, связанными с обработкой различных форматов, таких как текст, изображения, видео и аудио. Вот почему:
Преобладание неструктурированных данных: Более 80% данных предприятия являются неструктурированными, включая документы, изображения и видео. Это создает проблему, которую нельзя решить с помощью традиционных инструментов. Мультимодальные конвейеры предоставляют интегрированный рабочий процесс с продвинутыми алгоритмами AI для преобразования неструктурированных данных в практическую аналитику. Эти конвейеры устраняют разрыв между необработанными данными и моделями AI, позволяя организациям использовать данные для принятия более эффективных решений.
Повышение точности AI: Большие языковые модели (LLM), такие как GPT, надежны, но склонны к ошибкам, например к созданию нерелевантных или некорректных результатов. Точность моделей AI повышается благодаря способности мультимодальных конвейеров обрабатывать различные типы данных в единой структуре, обогащенной метаданными. Затем эти метаданные служат ориентиром, помогающим системам AI извлекать наиболее релевантную информацию, связанную с заданным запросом.
Улучшение Retrieval-Augmented Generation: RAG объединяет извлечение данных с генеративным AI для создания более инновационных, контекстно-связанных результатов. Мультимодальные конвейеры предоставляют эмбеддинги и метаданные для бесшовной оптимизации рабочих процессов. Это гарантирует, что генеративные модели дают релевантные ответы, всегда извлекая соответствующие данные во время поиска.
Масштабирование рабочих процессов ИИ: Современные предприятия работают с растущими объемами данных. Мультимодальные конвейеры автоматизируют такие задачи, как разбиение на фрагменты, создание эмбеддингов и управление метаданными. Это упрощает поддержание производительности по мере масштабирования рабочих процессов. Эти конвейеры обеспечивают масштабируемость, необходимую для удовлетворения растущих требований без потери эффективности.
Обновления в реальном времени: Корпоративные данные постоянно меняются — от обновлений контента до прав доступа. Мультимодальные конвейеры обеспечивают синхронизацию в реальном времени. Это позволяет ИИ-системам работать с самой актуальной и релевантной информацией. Это также поддерживает динамические сценарии использования, где данные в реальном времени критически важны для точных результатов ИИ.
Эти конвейеры закладывают основу для эффективных и инновационных ИИ-систем. Они упрощают интеграцию разнообразных источников данных и повышают производительность ИИ-моделей в реальных условиях.
Проблемы в ландшафте данных для ИИ
ИИ-системам требуются высококачественные данные для обучения. Однако управление различными типами данных связано с определенными трудностями. Сложность возрастает, когда бизнес работает с огромными объемами неструктурированных данных. Давайте рассмотрим некоторые проблемы в ландшафте данных для ИИ:
Сложность типов данных: Форматы данных требуют специальных инструментов или рабочих процессов для извлечения значимой информации. Например, PDF содержит смешанные данные, включая таблицы, текст и изображения. Поэтому его необходимо анализировать, чтобы извлечь важные данные. Модели, такие как обнаружение макета, могут точно обрабатывать и упорядочивать такие данные, чтобы сохранить всю важную информацию.
Метаданные как основа: Метаданные необходимы для повышения продуктивности рабочих процессов ИИ. Они обеспечивают расширенный поиск, извлечение и контроль доступа, чтобы пользователи могли быстро получать доступ к нужным данным. Метаданные критически важны для фильтрации, ранжирования и защиты доступа к извлеченной информации и, следовательно, являются ключевым компонентом успешных ИИ-систем. Обогащение данных метаданными усиливает гибридные подходы к поиску, связывая семантические эмбеддинги с фильтром метаданных. Это повысит точность и релевантность в ИИ-системах.
Управление данными: Данные в крупных предприятиях могут изменяться из-за обновлений, исправлений или добавлений. У них должны быть системы, способные эффективно поддерживать такие динамические потоки в реальном времени. Например, системы активной загрузки обеспечивают синхронизацию исходных файлов с системами рабочих процессов ИИ без сбоев.
Подход, ориентированный на оценку: Непрерывный мониторинг и оценка результатов ИИ-системы критически важны для достижения стабильного и надежного вывода. Перед выводом системы в эксплуатацию предприятия должны создать оценочные наборы и метрики. Это поможет организациям измерять, как их системы обрабатывают сложные данные для достижения бизнес-целей. Синтетические наборы данных можно использовать для тестирования и уточнения стратегий, включая разбиение на фрагменты и создание эмбеддингов.
Масштабируемость и интеграция: По мере постепенного увеличения объема данных масштабируемость становится очень важной. ИИ-системы должны интегрироваться с существующими корпоративными инструментами без снижения производительности и увеличения рабочих нагрузок. Масштабируемые решения повышают эффективность рабочих процессов по мере роста объема и сложности данных. Интеграция продвинутых систем, таких как векторные базы данных, расширяет функциональность, например векторный поиск, обеспечивая бесперебойную работу в реальных сценариях.
Решая эти проблемы, предприятие может раскрыть весь потенциал данных и создать прочную основу для эффективной работы ИИ-систем в динамичных средах. Современные конвейеры дают трансформационные результаты, устраняя разрыв между сырыми данными и операционными рабочими процессами в ИИ.
Место DataVolo в стеке ИИ
DataVolo — это революционная платформа для создания мультимодальных конвейеров данных. Работая на базе Apache NiFi, DataVolo имеет прочную основу для современных ИИ-систем. Ключевые функции включают:
Непрерывные и автоматизированные конвейеры данных: Datavolo создан для непрерывного и событийно-ориентированного приема данных. Он динамически масштабируется в соответствии с колебаниями объема данных, обеспечивая предсказуемую производительность в периоды высокой пропускной способности. Платформа поддерживает различные форматы данных, включая аудио, видео, изображения, сигналы датчиков, структурированные JSON или XML, а также текстовые логи.
Парсинг и разбиение на фрагменты: DataVolo с легкостью обрабатывает неструктурированные данные. В нем есть специализированные процессоры для продвинутого парсинга документов, позволяющие разбивать сложные документы на управляемые разделы. Например, процессор ChunkDocument использует структурную информацию для формирования связных фрагментов, а процессор ChunkText дополнительно уточняет их, разбивая на более мелкие фрагменты на основе семантического смысла.
Облачное развертывание: DataVolo по своей сути является облачно-нативным, а его архитектура позволяет гибко выполнять развертывания у крупных провайдеров, таких как AWS, GCP и Azure. Он позволяет организациям использовать существующие облачные инфраструктуры. Он обеспечивает бесперебойную работу в гибридных облачных средах, гарантируя производительность и управляемость.
Наблюдаемость: DataVolo интегрируется с OpenTelemetry для стандартизированного сбора данных, что обеспечивает его совместимость с различными инструментами мониторинга и аналитики. Кроме того, он также интегрируется с GenAI-based Flow Generator, который преобразует естественный язык в потоки NiFi. Это упрощает создание и управление конвейерами данных.
Фокус на роли инженера данных: Datavolo ориентирован на инженеров данных, предлагая им визуальный low-code интерфейс для проектирования, планирования и поддержки конвейеров. Платформа предлагает широкий набор различных готовых процессоров и коннекторов, тем самым эффективно поддерживая большое разнообразие источников и целевых систем. Она обеспечивает гибкость в быстрой адаптации к изменениям в технологиях ИИ и требованиях к данным. Это позволяет инженерам данных эффективно предоставлять значимые ИИ-решения без этих инфраструктурных сложностей.
Интеграция с векторными базами данных: DataVolo отлично интегрируется как с Zilliz, так и с Milvus для эффективного управления векторными базами данных. Эти две системы работают синергично, расширяя возможности разработки корпоративных ИИ-процессов, которые масштабируются и демонстрируют высокую производительность.
Работа DATAVOLO: Источник
Практический пример: чат-бот для анализа финансовых данных
Обработка неструктурированных документов, таких как финансовые отчеты, требует инновационных подходов для работы с присущей им сложностью. Большинство предприятий сталкиваются с серьезными трудностями при извлечении значимых инсайтов из таких документов. Давайте рассмотрим, как обрабатывать такие документы и создать масштабируемое решение.
Проблема
Обработка финансовых документов, таких как отчеты 10-K, является сложной задачей для предприятия. Эти отчеты обычно насчитывают сотни страниц и содержат таблицы, графики и данные в текстовом виде. При ручной обработке этот процесс требует много времени, подвержен ошибкам и неэффективен.
Решение
Масштабируемый автоматизированный конвейер должен интегрировать продвинутые методы обработки данных с векторными базами данных. Решение включает следующие процессы:
Прием данных: Данные извлекаются из различных источников, включая S3 buckets, посредством автоматизированного приема. Он добавляет важные сведения, такие как тип документа и источник, чтобы каждый документ был релевантным и полезным для принятия решений. При работе с неструктурированными данными с динамическими потоками данных реализуется CDC (Change Data Capture). Это гарантирует, что каждое обновление, исправление или добавление в исходных файлах фиксируется и синхронизируется с целевыми системами в реальном времени.
CDC избегает использования нерелевантной информации и поддерживает целостность данных во всех рабочих процессах. Прием данных дополнительно оптимизируется с помощью этих стратегий листинга, позволяющих избежать повторной обработки более старых:
Листинг на основе временных меток: Он позволяет выводить в список только те файлы, которые были добавлены или изменены после определенной временной метки. Это гарантирует, что прием новых или обновленных данных происходит без избыточности.
Методы хеширования: Они сравнивают содержимое, чтобы выявлять и пропускать ранее обработанные файлы, даже если имена файлов остаются прежними.
Эти возможности обеспечивают надежные и эффективные конвейеры приема данных, которые адаптируются к изменениям, динамически поддерживая AI-системы точной и актуальной информацией.
Предварительная обработка: Предварительная обработка документа включает следующие шаги:
Обнаружение макета: Обнаружение макета играет важную роль в обработке сложных документов, таких как PDF-файлы и финансовые отчеты. Оно применяет дообученную модель YOLO-X для выявления и маркировки компонентов, таких как таблицы, изображения и разделы, с помощью ограничивающих рамок. Таблицы сохраняют структуру, при этом существует контекстная связь повествовательного текста или описаний. Граф документа иерархически объединяет эти элементы для улучшения навигации и извлечения. OCR используется, когда текстовые слои отсутствуют и необходимо захватить все элементы документа. Это гарантирует, что структура и контекст сохраняются для точного и надежного извлечения данных.
Разбиение на фрагменты: Документы делятся на управляемые фрагменты для эффективной обработки. Самый наивный подход — разбиение по фиксированному числу символов, например 400. Однако это может разделять семантически связанную информацию, а значит, не является эффективным. Более совершенный метод — разбиение на основе разделов, где разделы, обнаруженные через определение макета, задают границы. Соответственно, каждый фрагмент сохраняет контекст раздела, включая заголовок и повествовательный текст, который в нем присутствует. Другая стратегия разбиения использует смысл текста путем применения косинусного сходства последовательных предложений. Когда оно меньше заданного порога, выполняется разбиение. Эта стратегия извлечения делает каждый фрагмент семантически согласованным, повышая точность пользовательского запроса.
Извлечение метаданных: Некоторые метаданные, такие как тип документа и исходный URL-адрес, статически задаются через конфигурацию в конвейере. Другие метаданные автоматически выводятся из потока обработки, например детали, извлеченные через обнаружение макета, или обогащаются внешними источниками данных. Например, символы, присутствующие в финансовом документе, будут запрашивать тот же символ в таблице PostgreSQL и добавлять соответствующие метаданные уровня компании. Это позволит реализовать более продвинутые сценарии использования, такие как гибридный поиск, ранжированные результаты и безопасный контроль доступа на основе расширенных метаданных.
Встраивание: Текстовые фрагменты преобразуются в динамические высокоразмерные векторы с помощью передовых embeddings. Эти векторы отражают суть данных и выявляют значимые семантические связи. Это делает поиск информации интуитивно понятным процессом при ответе на пользовательские запросы.
Хранение: Эти embeddings и метаданные хранятся в высокопроизводительной векторной базе данных, такой как Milvus. Это обеспечивает быстрое извлечение даже среди миллионов сохраненных векторов благодаря индексированию. Фильтрация метаданных повышает точность, позволяя запросам учитывать дополнительный контекст, такой как диапазоны дат или разделы документа.
Обновления в реальном времени: Непрерывные конвейеры приема данных автоматически обновляют данные, чтобы поддерживать точность и релевантность системы. Это гарантирует, что пользователи имеют доступ к самым последним данным.
Результат
Это поможет создать чат-бота специально для финансовых аналитиков. Бот может получать длинные запросы вроде: «Какова была чистая прибыль компании X за 2023 год?» или «Какие основные риски определены в разделе оценки рисков?» Он будет предоставлять корректные и контекстуально релевантные ответы за считанные секунды, с надлежащими цитатами из исходных документов.
Ключевые преимущества
Эффективность: Прием данных, предварительная обработка и эмбеддинги автоматизированы, чтобы сэкономить время финансовой команды для задач более высокого уровня.
Масштабируемость: Масштабируемая поддержка хранения и извлечения миллионов векторов в продвинутых векторных базах данных упрощает анализ по мере роста объемов данных.
Инсайты в реальном времени: Непрерывные обновления гарантируют, что у аналитиков есть самая актуальная информация для срочных решений.
Этот пример использования демонстрирует силу мультимодальных конвейеров в упрощении сложных рабочих процессов. Он показывает, как интеграция продвинутой обработки данных с решениями на основе векторных баз данных может приносить значительную ценность.
Milvus: ускорение векторного поиска
Milvus расширяет усиленную поддержку мультимодальных AI-конвейеров, внедряя множество функций для простой интеграции и обработки различных типов данных, таких как тексты, изображения и видео. Некоторые из ключевых улучшений включают:
Гибридный векторно-ключевой поиск: Milvus интегрирует поиск по векторному сходству и полнотекстовый поиск по ключевым словам на единой платформе. Он обеспечивает эффективное извлечение данных из разных модальностей. Это позволяет создавать сложные AI-приложения, требующие семантического понимания и точного сопоставления ключевых слов.
Технология Sparse-BM25: Milvus представил технологию Sparse-BM25, чтобы реализовать разреженную векторную версию алгоритма BM25. Это один из самых популярных алгоритмов, используемых в системах полнотекстового поиска. Эта технология значительно повышает скорость и точность поиска по ключевым словам, дополняя векторный семантический поиск. Это повышает производительность мультимодальных AI-конвейеров.
Интеграция наборов инструментов для разработки AI: Milvus нативно интегрируется с полным набором инструментов для разработки AI, включая LangChain, LlamaIndex, OpenAI и HuggingFace. Эти наборы инструментов делают Milvus предпочтительным векторным хранилищем для приложений генеративного AI, поддерживающих RAG в различных модальностях данных, и снижают сложность разработки мультимодального AI.
Эти улучшения делают Milvus надежным и эффективным для создания и развертывания мультимодального AI-конвейера. Это позволяет организациям обрабатывать и анализировать различные типы неструктурированных данных в одном месте.
Непрерывные и автоматизированные конвейеры данных
Динамичная и постоянно меняющаяся природа корпоративных данных требует автоматизированных рабочих процессов для наборов данных, питающих AI-системы. DataVolo решает эту задачу следующим образом:
Прием данных в реальном времени: DataVolo обеспечивает прием данных в реальном времени, подключаясь к источникам данных, таким как S3 buckets, Google Drive и SharePoint. Он автоматизирует прием с помощью механизмов, управляемых событиями, сокращая вмешательство человека. Он также предоставляет настраиваемые стратегии приема данных для их эффективной обработки. Эти стратегии включают листинг на основе временных меток, чтобы выявлять и обрабатывать только новые или обновленные файлы без создания избыточности, тем самым оптимизируя ресурсы.
Событийно-ориентированная архитектура: Конвейеры DataVolo являются событийно-ориентированными и автоматически реагируют на любые изменения в вышестоящих системах. Такие события, как изменения файлов, обновления метаданных или пользовательских разрешений, запускают автоматическое обновление в конвейере. Даже чувствительные метаданные, такие как ACL, безопасно управляются на протяжении всего этого процесса.
Масштабируемая и отказоустойчивая архитектура: Она обеспечивает масштабируемость и отказоустойчивость, значительно снижая деградацию производительности при высокопроизводительном приеме данных. Горизонтальное масштабирование выполняется с помощью оркестрации на базе Kubernetes. Благодаря встроенной логике повторных попыток, процессам backfill и управлению простоями upstream-систем она обеспечивает надежность и устойчивость при управлении конвейерами данных.
Успех ИИ через оценку
Оценка является важнейшей основой эффективного внедрения ИИ. Она измеряет степень улучшения систем в направлении точности, надежности и удовлетворенности. Следующие метрики могут помочь в оценке моделей ИИ:
Метрики извлечения
Precision: Отношение извлеченных релевантных данных к общему числу результатов, благодаря чему система возвращает только наиболее соответствующую информацию.
Recall: Отношение извлеченных релевантных данных ко всем релевантным данным, гарантирующее, что ценная информация не будет упущена.
F1 Score: Эта метрика объединяет precision и recall в один показатель. Она балансирует компромиссы между этими двумя метриками и дает комплексную оценку.
Метрики языковой модели
Faithfulness: Она проверяет, основаны ли ответы ИИ на полученном контексте, и снижает количество галлюцинаций для поддержания фактической точности.
Correctness: Сравнивает ответы, сгенерированные ИИ, с тестовыми данными для измерения точности результатов.
Сложность заключается в оценке недетерминированных моделей, для которых системы могут выдавать разные результаты на один и тот же ввод из-за их вероятностной природы. Определение и оценка "правильных" ответов по своей сути сложны. Восприятие точности и релевантности часто различается в зависимости от пользователя и конкретного контекста. Для решения этой задачи необходимы динамические циклы обратной связи, итерации, различные тестовые наборы и метрики, чувствительные к контексту.
Настройка гиперпараметров имеет решающее значение для улучшения рабочих процессов ИИ, особенно систем retrieval-augmented generation (RAG). Разные стратегии разбиения на фрагменты требуют тщательной настройки таких параметров, как размер фрагмента, перекрытие и пороги сходства. К ним относятся разбиение на основе разделов для более широкого контекста или семантическое разбиение для более высокой точности.
Итеративное тестирование в сочетании с метриками извлечения помогает определить оптимальный баланс между точностью и контекстной насыщенностью, обеспечивая высококачественное извлечение и генерацию.
Рабочие процессы, ориентированные на оценку, позволяют системам ИИ соответствовать постоянно меняющимся данным и потребностям пользователей. Благодаря итеративным улучшениям и акценту на надежных метриках, результаты остаются достоверными, применимыми и контекстными. Тем самым это устраняет разрыв между экспериментированием и надежным развертыванием в реальном мире, повышая доверие и удовлетворенность результатами приложений ИИ.
Заключение
Надежные мультимодальные конвейеры являются основой масштабирования систем ИИ от экспериментальных этапов до полноценного промышленного внедрения. Эти конвейеры беспрепятственно обрабатывают разнообразные типы данных, позволяя предприятиям создавать более инновационные рабочие процессы.
Она обеспечивает масштабируемое, безопасное и высокопроизводительное управление данными за счет интеграции передовых платформ конвейеров данных и векторных баз данных, таких как Zilliz и Milvus. Кроме того, автоматизация таких задач, как предварительная обработка данных, embedding и обогащение метаданных, снижает ручные усилия без ущерба для точности и масштабируемости.
Преобразования и синхронизация в реальном времени систем ИИ сделают их эффективными. Это упрощает создание рабочих процессов ИИ, обеспечивая непрерывную оценку и улучшение.
Это помогает предприятиям постоянно улучшать производительность приложений, адаптироваться к меняющимся ландшафтам данных и удовлетворять динамические потребности бизнеса. Такие технологии могут помочь компаниям в том, как они обрабатывают данные и развертывают приложения на основе ИИ.
Дополнительные ресурсы
Читать далее

Why We Built Vector Lakebase: Rethinking Unstructured Data Architecture for AI
Vector Lakebase: a unified, lake-native data foundation for AI workloads — and an answer to what happens after vector databases succeed.

How to Build an Enterprise-Ready RAG Pipeline on AWS with Bedrock, Zilliz Cloud, and LangChain
Build production-ready enterprise RAG with AWS Bedrock, Nova models, Zilliz Cloud, and LangChain. Complete tutorial with deployable code.

Bringing AI to Legal Tech: The Role of Vector Databases in Enhancing LLM Guardrails
Discover how vector databases enhance AI reliability in legal tech, ensuring accurate, compliant, and trustworthy AI-powered legal solutions.



