Важность инженерии данных для успешного ИИ с Airbyte и Zilliz
Эта статья была изначально опубликована на DBTA 17 октября 2024 года и перепечатана с разрешения.
Обеспечение сбора и использования данных имеет решающее значение для успешной поддержки AI-проектов в корпоративном масштабе. От интеграции данных до конвейеров данных, производительности AI, управления данными, соответствия нормативным требованиям и многого другого — следование передовым практикам data engineering еще никогда не было столь разумным для обеспечения будущего на базе AI.
В последнем вебинаре DBTA Data Engineering Best Practices for AI Брайан Леонард, директор по инженерии в Airbyte, и Тим Спанн, главный developer advocate, Milvus, Zilliz, поделились своим опытом относительно того, как data engineering может решать распространенные проблемы, связанные с развертыванием и масштабированием эффективного использования AI.
Как компания движения open source data, Airbyte делает данные пригодными к использованию где угодно, позволяя более чем 20 000 специалистам по данным и AI управлять разнообразными данными в multi-cloud средах, по словам Леонарда. Что касается AI-сценария использования Airbyte, многие предприятия используют платформу Airbyte для загрузки собственных данных в AI-приложения путем извлечения записей из неструктурированных источников, таких как Google Drive или Salesforce, и перемещения этих данных в lakehouse-хранилища, где пользователи могут включать retrieval-augmented generation (RAG) и fine-tuning.
Затем Леонард подробнее рассмотрел AI-конвейер данных, изучив путь от извлечения до нормализации, обработки и использования. Каждая фаза конвейера включает следующие процессы:
- Извлечение: Шифрование данных, маскирование PII, pushdown-фильтры, передача файлов, разрешения
- Нормализация: Нормализация схемы, очистка данных, дедупликация
- Обработка: Обогащение, суммаризация, оптимизация сценариев использования, разбиение документов на фрагменты, вычисление embeddings
- Использование: Размещение embeddings в доступном для запросов хранилище данных, таком как Milvus, векторная база данных
Спанн подробно рассказал о преимуществах Milvus от Zilliz — высокопроизводительной open source векторной базы данных, созданной для масштабирования. Векторный поиск, отметил Спанн, — это новая парадигма для AI, поскольку «теперь изображения, текст, видео, документы — всё является данными, и векторный поиск делает это доступным для поиска». Фактически IDC прогнозирует, что 90% новых данных, сгенерированных в 2025 году, будут неструктурированными, что отражает критически важную потребность в векторном поиске.
Векторные базы данных отвечают за обеспечение поиска в различных сценариях использования — от RAG до поиска молекулярного сходства, обнаружения мошенничества и аномалий, мультимодального поиска сходства и многого другого. По своей сути неструктурированные данные — и способность извлекать из них знания — являются фундаментальными для обеспечения успеха AI.
С 2017 года Zilliz помогает организациям осмысливать неструктурированные данные. Будучи созданной первоклассной командой инженеров по алгоритмам и базам данных с сильным опытом в разработке высокопроизводительных, масштабируемых и высокодоступных распределенных систем, уникально адаптированных для векторного поиска, Zilliz была построена с нуля для решения различных задач data engineering, связанных с AI, отметил Спанн.
В результате Milvus — это простая в настройке, функционально богатая векторная база данных, которая предлагает эластичное масштабирование, повторно используемый код и широкие интеграции, поддерживаемые надежным и активным сообществом. Затем Спанн провел зрителей вебинара через то, как работает Milvus, подробно описав ее структуру, функции и многое другое.
Полную подробную запись вебинара, посвященного data engineering для эпохи AI, можно посмотреть в архивной версии вебинара здесь.
Читать далее

Announcing VDBBench 1.0: Open-Source VectorDB Benchmarking with Your Real-World Production Workloads
Discover VDBBench 1.0, an open-source tool for benchmarking vector databases with real-world production data, streaming ingestion, and concurrent workloads.

What Exactly Are AI Agents? Why OpenAI and LangChain Are Fighting Over Their Definition?
AI agents are software programs powered by AI that can perceive their environment, make decisions, and take actions to achieve a goal—often autonomously.

Milvus WebUI: A Visual Management Tool for Your Vector Database
Explore Milvus WebUI to monitor, manage, and optimize your vector database with real-time insights, performance tracking, and system health monitoring.



