Важность инженерии данных для успешного ИИ с Airbyte и Zilliz
Эта статья была изначально опубликована на DBTA 17 октября 2024 года и перепечатана с разрешения.
Обеспечение сбора и использования данных имеет решающее значение для успешной поддержки AI-проектов в корпоративном масштабе. От интеграции данных до конвейеров данных, производительности AI, управления данными, соответствия нормативным требованиям и многого другого — следование передовым практикам data engineering еще никогда не было столь разумным для обеспечения будущего на базе AI.
В последнем вебинаре DBTA Data Engineering Best Practices for AI Брайан Леонард, директор по инженерии в Airbyte, и Тим Спанн, главный developer advocate, Milvus, Zilliz, поделились своим опытом относительно того, как data engineering может решать распространенные проблемы, связанные с развертыванием и масштабированием эффективного использования AI.
Как компания движения open source data, Airbyte делает данные пригодными к использованию где угодно, позволяя более чем 20 000 специалистам по данным и AI управлять разнообразными данными в multi-cloud средах, по словам Леонарда. Что касается AI-сценария использования Airbyte, многие предприятия используют платформу Airbyte для загрузки собственных данных в AI-приложения путем извлечения записей из неструктурированных источников, таких как Google Drive или Salesforce, и перемещения этих данных в lakehouse-хранилища, где пользователи могут включать retrieval-augmented generation (RAG) и fine-tuning.
Затем Леонард подробнее рассмотрел AI-конвейер данных, изучив путь от извлечения до нормализации, обработки и использования. Каждая фаза конвейера включает следующие процессы:
- Извлечение: Шифрование данных, маскирование PII, pushdown-фильтры, передача файлов, разрешения
- Нормализация: Нормализация схемы, очистка данных, дедупликация
- Обработка: Обогащение, суммаризация, оптимизация сценариев использования, разбиение документов на фрагменты, вычисление embeddings
- Использование: Размещение embeddings в доступном для запросов хранилище данных, таком как Milvus, векторная база данных
Спанн подробно рассказал о преимуществах Milvus от Zilliz — высокопроизводительной open source векторной базы данных, созданной для масштабирования. Векторный поиск, отметил Спанн, — это новая парадигма для AI, поскольку «теперь изображения, текст, видео, документы — всё является данными, и векторный поиск делает это доступным для поиска». Фактически IDC прогнозирует, что 90% новых данных, сгенерированных в 2025 году, будут неструктурированными, что отражает критически важную потребность в векторном поиске.
Векторные базы данных отвечают за обеспечение поиска в различных сценариях использования — от RAG до поиска молекулярного сходства, обнаружения мошенничества и аномалий, мультимодального поиска сходства и многого другого. По своей сути неструктурированные данные — и способность извлекать из них знания — являются фундаментальными для обеспечения успеха AI.
С 2017 года Zilliz помогает организациям осмысливать неструктурированные данные. Будучи созданной первоклассной командой инженеров по алгоритмам и базам данных с сильным опытом в разработке высокопроизводительных, масштабируемых и высокодоступных распределенных систем, уникально адаптированных для векторного поиска, Zilliz была построена с нуля для решения различных задач data engineering, связанных с AI, отметил Спанн.
В результате Milvus — это простая в настройке, функционально богатая векторная база данных, которая предлагает эластичное масштабирование, повторно используемый код и широкие интеграции, поддерживаемые надежным и активным сообществом. Затем Спанн провел зрителей вебинара через то, как работает Milvus, подробно описав ее структуру, функции и многое другое.
Полную подробную запись вебинара, посвященного data engineering для эпохи AI, можно посмотреть в архивной версии вебинара здесь.
Читать далее

Zilliz Cloud Now Available in AWS Europe (Ireland)
Zilliz Cloud launches in AWS eu-west-1 (Ireland) — bringing low-latency vector search, EU data residency, and full GDPR-ready infrastructure to European AI teams. Now live across 30 regions on five cloud providers.

Top 10 Context Engineering Techniques You Should Know for Production RAG
A practical guide to context engineering for production LLM systems, covering RAG, context processing, memory, agents, and multimodal context.

Vector Databases vs. Document Databases
Use a vector database for similarity search and AI-powered applications; use a document database for flexible schema and JSON-like data storage.



