Преодоление трудностей управления ML: инструменты и идеи для успеха
Поскольку машинное обучение (ML) продолжает развиваться с головокружительной скоростью, сложность управления и версионирования массивных наборов данных и моделей выросла экспоненциально. Хотя разработчики уже давно полагаются на такие инструменты, как Git, для контроля версий в разработке программного обеспечения, уникальные вызовы машинного обучения требуют более специализированных решений. В отличие от программного обеспечения, где кодовые базы можно версионировать и управлять ими относительно легко, ML models, datasets и артефакты часто не имеют единого отраслевого стандарта для версионирования и управления.
На недавней встрече Unstructured Data Meetup, организованной Zilliz, Rajat Arya, сооснователь XetHub (теперь приобретённого HuggingFace), обсудил, как он и его команда закрыли этот пробел в версионировании и управлении ML. Его команда разработала XetHub — инструмент, который масштабирует Git для работы с данными петабайтного масштаба. Да, вы всё правильно прочитали — данные петабайтного масштаба. Но почему это было необходимо? Какие преимущества это даёт и как это работает? Как это связано с векторными базами данных? Давайте погрузимся в идеи Arya и разберём ключевые моменты.
Посмотрите запись выступления Rajat
Болевые точки в разработке машинного обучения
Одним из основных препятствий в разработке машинного обучения является отсутствие комплексных инструментов, охватывающих весь ML-пайплайн. Хотя существует множество инструментов для конкретных задач, есть значительный пробел, когда речь идёт о решениях, которые эффективно обрабатывают процесс от начала до конца. Вот некоторые ключевые болевые точки:
Масштабируемость
Управление наборами данных, которые могут масштабироваться до 100 петабайт и более, — это огромный вызов, особенно когда традиционные инструменты накладывают ограничения на количество файлов, с которыми можно работать.
Управление данными
Создание неизменяемых снимков репозиториев имеет решающее значение для обеспечения целостности данных и удобного контроля версий. Без этой возможности отслеживание изменений и поддержание согласованности становится сложным.
Совместная работа
Обеспечение бесшовного сотрудничества между data scientists и инженерами крайне важно. Революция, которую принёс контроль исходного кода в разработку программного обеспечения, ещё не полностью распространилась на ML, где совместная работа часто сталкивается с препятствиями из-за отсутствия стандартизированных инструментов.
Наблюдаемость
Понимание того, как и когда происходят изменения в моделях и наборах данных, имеет решающее значение для отладки и улучшения ML-систем. Без видимости этих изменений командам сложно эффективно выполнять итерации.
От исследований к реальным ML-приложениям: всё меняется
На ранних этапах ML и AI были в основном ориентированы на исследования, с академическими целями, которые предполагали работу со статическими, часто structured datasets. Цель заключалась в улучшении таких метрик, как точность или частота ошибок, что хорошо работало в контролируемой исследовательской среде.
Однако по мере перехода ML из академической среды в индустрию ландшафт резко изменился:
Статические vs. динамические наборы данных
Академическое ML часто имеет дело со статическими наборами данных, но промышленное ML включает постоянно меняющиеся данные, иногда обновляемые так часто, как каждый час. Эта динамическая природа требует инструментов, которые могут бесшовно обрабатывать непрерывные обновления.
Структурированные vs. неструктурированные данные
В то время как академические исследования часто сосредоточены на структурированных данных, реальные приложения часто работают с неструктурированными данными. Этот сдвиг требует более сложных методов обработки данных и работы с ними. Нам нужны специализированные векторные базы данных, такие как Milvus и Zilliz Cloud (полностью управляемый Milvus), для хранения, индексации и извлечения данных, чтобы управлять такими неструктурированными данными.
Растущая сложность моделей
ML-модели становятся всё более сложными, с большим числом параметров и более глубокими архитектурами. Управление этими сложными моделями требует инструментов, которые могут масштабироваться вместе с ними.
Интеграция с кодом приложения
В промышленных условиях ML-модели должны плавно интегрироваться с кодом приложения, что требует целостной экосистемы пакетов и фреймворков, которые работают вместе без трения.
Расширение возможностей Git для машинного обучения с помощью XetHub
XetHub решает проблему масштабируемости, расширяя возможности Git для эффективного управления большими наборами данных и моделями. Вот как это меняет ситуацию:
Без ограничений на количество файлов: Традиционный Git испытывает трудности при работе с большим количеством файлов, но XetHub снимает это ограничение, обеспечивая бесшовное масштабирование независимо от количества файлов.
Неизменяемые снимки: XetHub создаёт неизменяемые снимки, обеспечивая согласованность данных и воспроизводимость — что критически важно для надёжной разработки ML.
Эффективное управление данными: Вместо передачи больших наборов данных XetHub управляет метаданными и указателями, делая систему быстрее и эффективнее, экономя как время, так и ресурсы.
Достижение наблюдаемости в проектах машинного обучения
Наблюдаемость критически важна для ML-моделей и систем, обеспечивая видимость, необходимую для отладки, итераций и улучшения моделей. Вот несколько рекомендаций по усилению наблюдаемости в ваших ML-проектах:
Суммаризация данных
Начните с данных. Создайте однопроходную, приблизительную сводку ваших данных и признаков. Это критически важно, потому что позволяет понимать изменения в вашем наборе данных со временем. Например, если набор данных A имеет разные распределения в разные моменты времени, наличие сводок позволяет принимать обоснованные решения на основе этих изменений.
Метрики и поведение модели
Храните не только метрики вашей модели, но и понимайте, как ведёт себя ваша модель. Например, отслеживание важности признаков ваших ML-моделей помогает увидеть, какие признаки определяют предсказания. Изменения в важности признаков могут указывать на сдвиги в ваших обучающих данных или архитектурные модификации. Такое глубокое понимание ваших моделей гарантирует, что вы сможете быстро отлаживать и улучшать их.
Вычисления и операции
Вычисления являются неотъемлемой частью наблюдаемости ML. Каждая операция, будь то с данными, кодом, артефактами или другими ресурсами, должна сохраняться для каждого коммита или изменения. Такое комплексное отслеживание обеспечивает полную наблюдаемость ML, гарантируя эффективность, трассируемость и воспроизводимость в разных запусках одного и того же процесса.
Роль векторных баз данных в современном машинном обучении
Векторные базы данных, такие как Milvus и Zilliz Cloud (полностью управляемый Milvus), — это тип систем управления данными, которые хранят, индексируют и извлекают многомерные данные — числовые представления (также известные как векторные эмбеддинги) неструктурированных данных, таких как текст, видео, аудио и изображения. Они широко используются для поиска по сходству, семантического поиска, рекомендательных систем, генерации с дополненным извлечением (RAG) и многих других сценариев использования.
По мере того как ML-модели и наборы данных становятся всё более сложными, управление и извлечение огромных объёмов многомерных данных становится всё более трудной задачей. Векторные базы данных решают эту проблему, предлагая решения, с которыми традиционные базы данных не могут сравниться.
Retrieval Augmented Generation (RAG)
Одно из самых интересных применений векторных баз данных — Retrieval Augmented Generation (RAG). Этот метод объединяет мощь больших языковых моделей (LLMs) с эффективным извлечением векторных данных. В конфигурации RAG входной запрос преобразуется в вектор с помощью модели машинного обучения, такой как модели текстовых эмбеддингов OpenAI, и сопоставляется с огромной коллекцией векторов, хранящихся в векторной базе данных, такой как Milvus. Наиболее релевантные результаты извлекаются и передаются в LLM, что позволяет ей генерировать более точные, контекстуально релевантные ответы. Такой подход не только снижает проблемы галлюцинаций в LLMs, но и позволяет использовать потенциал частных или проприетарных наборов данных, не беспокоясь о проблемах безопасности данных.
Устранение разрыва между исследованиями и индустрией
Переход от ориентированного на исследования ML к реальным приложениям часто связан с работой с неструктурированными и динамическими данными. Векторные базы данных уникально приспособлены для решения этой задачи, позволяя непрерывно адаптировать ML-модели к самым актуальным данным. Такая адаптивность гарантирует, что модели остаются релевантными и эффективными даже по мере изменения базовых данных.
Например, в e-commerce, где описания товаров и отзывы клиентов постоянно обновляются, векторная база данных, такая как Milvus, может быстро извлекать наиболее значимую информацию, позволяя ML-модели предоставлять актуальные рекомендации и аналитические выводы.
Бесшовная интеграция с инструментами вроде XetHub
Способность XetHub управлять данными петабайтного масштаба дополняет сильные стороны векторных баз данных. Создавая неизменяемые снимки и эффективно управляя метаданными, XetHub гарантирует, что крупномасштабные ML-проекты сохраняют целостность данных и контроль версий даже по мере масштабирования. Векторные базы данных могут интегрироваться с различными моделями машинного обучения и инструментами вроде XetHub, поддерживая разработку и развёртывание ML-моделей, особенно в сценариях вроде RAG, где точность и релевантность извлечения информации имеют первостепенное значение.
Заключение
Обсуждение Раджата Арьи подчеркнуло значительные вызовы в машинном обучении и необходимость более совершенных инструментов для управления моделями и данными и их версионирования. XetHub решает эти потребности, расширяя возможности Git для эффективной работы с массивными наборами данных.
Поскольку машинное обучение продолжает развиваться, наличие надёжных инструментов для наблюдаемости и управления данными становится критически важным. Объединяя такие решения, как XetHub, с векторными базами данных и моделями машинного обучения, мы можем повысить эффективность ML-проектов, обеспечивая их качественное управление и адаптируемость к новым данным. Такие сочетания поддерживают более плавный переход от исследований к реальным приложениям, делая разработку AI более практичной и надёжной.
Дополнительные ресурсы
Запись выступления Раджата Арьи на Meetup на YouTube.
Статья: Git is for Data
Центр обучения по ИИ, векторным базам данных и машинному обучению
Читать далее

Introducing Functions and Model Inference on Zilliz Cloud: Automatic Embedding and Reranking with Hosted Models
Zilliz Cloud Functions auto-generate embeddings via OpenAI, Voyage AI, Cohere, or Zilliz Hosted Models. Built-in reranking — just insert text and search.

How to Choose the Best Embedding Model for RAG in 2026: 10 Models Benchmarked
We benchmarked 10 embedding models on cross-modal, cross-lingual, long-document, and dimension compression tasks. See which one fits your RAG pipeline.

Zilliz Cloud Delivers Better Performance and Lower Costs with Arm Neoverse-based AWS Graviton
Zilliz Cloud adopts Arm-based AWS Graviton3 CPUs to cut costs, speed up AI vector search, and power billion-scale RAG and semantic search workloads.



