Мусор на входе, мусор на выходе: почему плохая подготовка данных убивает ваши модели ИИ
В современном мире данные стали такими же ценными, как нефть. Хотя предприятия традиционно сосредотачивались на сборе огромных объемов данных для построения моделей и получения инсайтов, фокус смещается с количества на качество. Многие организации теперь понимают, что наличие высококачественных данных важнее, чем просто накопление больших наборов данных. Однако этот сдвиг выявляет серьезную проблему: многим компаниям сложно полностью понять и эффективно курировать свои существующие данные.
На Unstructured Data Meetup, организованном Zilliz, Alexandre Bonnet, Lead ML Solutions Engineer в Encord, затронул эту проблему в своем выступлении о ловушках некачественной курации данных и о том, как предприятия могут преодолеть эти трудности. Он подчеркнул важность качества данных и рыночных тенденций, представив дорожную карту, которая поможет организациям выстроить конвейеры производства высококачественных данных. В этом блоге мы кратко изложим ключевые тезисы Alexandre. Вы также можете посмотреть его полное выступление на YouTube.
Спикер Alexandre Bonnet из Encord выступает на июльском Unstructured Data Meetup в SF
Эволюция AI
Alex рассказывает о переходе от традиционных приложений AI к современному generative AI на предприятиях. Примерно десять лет назад модели AI приходилось создавать с нуля для каждого сценария использования, и обычно они были ограничены обработкой только одного типа данных (уни-модальные). Эти ранние модели в основном использовались техническими командами специалистов по данным и инженеров. Однако сегодняшний ландшафт AI значительно развился благодаря foundational models, таким как YOLO, GPT и Claude, которые можно относительно легко донастраивать для конкретных предметных областей. Кроме того, современные архитектуры могут обрабатывать несколько типов данных (мультимодальные), делая AI доступным даже для обычных пользователей, у которых может не быть глубокого технического бэкграунда. Этот сдвиг привел к широкому внедрению AI в различных отраслях, оптимизируя рабочие процессы и операции.
Рисунок — традиционный AI и современный AI
Alex отмечает: «Исследования во всех направлениях Artificial Intelligence стремительно развиваются последние 10 лет». Несмотря на достижения в таких областях, как синтетические данные и generative AI, прогресс в computer vision был сравнительно более медленным. Во многом это связано со сложностями понимания неструктурированных графических данных, что создает уникальные трудности.
Рисунок: разработки в различных областях AI за последнее десятилетие
Алекс выделяет три основных столпа ИИ: данные, модели и вычисления. Хотя в архитектурах моделей произошел стремительный прогресс — таких как трансформеры, механизмы внимания и большие языковые модели (LLM), которые можно дообучать для конкретных задач, — также был достигнут значительный прогресс в аппаратном обеспечении, особенно благодаря разработке высокопроизводительных GPU, предназначенных для обучения сложных моделей. Однако, несмотря на эти достижения в моделях и вычислительных мощностях, качество данных продолжает отставать, оставаясь на ранних стадиях зрелости.
Рисунок: Столпы ИИ
Почему качество данных важно для ИИ
Текстовые модели, обученные на зашумленных или неочищенных наборах данных, часто генерируют результаты с логическими ошибками или даже бессмысленными символами. Аналогично, модели изображений, такие как некоторые основанные на диффузии, как известно, создают визуальные материалы с неожиданными артефактами, например водяными знаками. Первопричина? Плохая курирование данных.
Рисунок: Очистка данных vs курирование данных
Для ясности, курирование данных означает организацию, управление и подготовку данных для разметки или обучения модели, чтобы они были релевантными и структурированными для конкретной задачи. Очистка данных сосредоточена на выявлении и исправлении ошибок или несоответствий в данных, таких как удаление дубликатов, исправление поврежденных образцов или устранение шума. Оба процесса гарантируют, что при обучении модели используются только высококачественные и надежные данные.
Очистка и доработка обучающих данных в масштабе — серьезная задача. Возьмем, например, задачу обучения мультимодальной модели с использованием видео с YouTube. При огромном объеме данных некоторые клипы могут содержать поврежденный звук, неприемлемую лексику или нерелевантный контент. Без тщательного курирования данных эти проблемы могут ухудшить производительность и надежность моделей ИИ.
Эффективное курирование данных предполагает тщательную фильтрацию и анализ наборов данных, чтобы гарантировать, что в модели поступают только высококачественные и подходящие данные. Алекс подчеркивает, что принцип "отличные данные равны отличным моделям" особенно верен в генеративном ИИ. Для предметно-специфических приложений, таких как обнаружение дефектов сварных швов в промышленных условиях или помощь в хирургической робототехнике, обучающие данные должны быть крайне релевантными и точно отражать предполагаемые сценарии использования. Такой уровень курирования помогает модели эффективно обрабатывать пограничные случаи и снижает риск отказа.
Во время своей презентации Алекс привел примеры, иллюстрирующие важность хорошо курированных данных. В одном случае языковая модель на основе зрения (VLM), такая как GPT-4 with vision, не смогла определить, был ли школьный автобус на изображении обращен передом или задом. Этот сбой показывает, что даже сложные модели испытывают трудности без высококачественных курированных данных, подчеркивая необходимость комплексного курирования и очистки данных для повышения точности и производительности модели.
Рисунок: LLM на основе зрения имеют низкую производительность модели из-за зашумленных обучающих данных
Курирование данных для дообучения предметно-специфических моделей
Теперь, когда мы узнали о важности качества данных для производительности ИИ, давайте рассмотрим пример, демонстрирующий, как курирование данных играет жизненно важную роль в дообучении моделей для конкретных предметных областей.
LLaVA — это универсальная большая языковая модель, разработанная Meta AI, которая обладает высокой способностью понимать человеческий язык. Однако ее адаптация к более специализированным областям, таким как медицинская сфера, требует целенаправленных усилий по курированию данных. Этот процесс тонкой настройки привел к созданию LLaVA-Med, специализированного AI-ассистента для медицинских приложений.
Вот ключевые этапы этого процесса:
Рисунок: Тонкая настройка LLM с использованием медицинских знаний
Согласование медицинских понятий
На первом этапе тонкой настройки использовалось всего 4% доступного набора данных — 600 000 пар «изображение-текст», полученных из учебников и научных статей. Значительное время и усилия были вложены в формирование хорошо сбалансированного набора данных, чтобы помочь модели усвоить ключевые медицинские понятия. Этот процесс включал сочетание человеческой экспертизы и полуавтоматизированных методов, гарантируя, что отобранные данные точно отражают нюансы медицинской области.
Настройка медицинских инструкций
На втором этапе модель была донастроена с использованием 60 000 пар «вопрос-ответ», чтобы научиться отвечать на медицинские запросы. Эта фаза позволила модели понимать входные подсказки, извлекать релевантную информацию и генерировать точные ответы на основе медицинского контекста. Акцент на настройке инструкций улучшил способность модели предоставлять контекстно-зависимую помощь в реальных медицинских ситуациях.
Благодаря формированию меньшего по размеру, но высококачественного набора данных для обучения команда смогла эффективно донастроить LLaVA-Med и добиться точных результатов — при одновременном снижении затрат на обучение. Этот кейс подчеркивает важность курирования данных при разработке доменно-специфичных больших языковых моделей (LLMs). Он также показывает, как тщательное курирование и целенаправленная тонкая настройка могут превратить универсальную модель в специализированный инструмент, способный успешно проявить себя в медицинских областях.
Развивающиеся тенденции в качестве и курировании данных
В традиционных конвейерах данных собранные данные обычно проходили ручную разметку или предварительную разметку с использованием моделей под человеческим контролем. Затем размеченные данные использовались для обучения модели, после чего модель развертывалась. Хотя такой линейный подход может работать в некоторых сценариях, он оказывается недостаточным в специализированных случаях использования, особенно при работе с огромными объемами неструктурированных данных.
Чтобы решить эти проблемы, Alex подчеркивает необходимость более гибких и надежных конвейеров данных. Современные конвейеры могут включать дополнительные этапы для улучшенного курирования данных. После того как данные собраны и сохранены в хранилище данных, внешние инструменты могут использоваться для их проверки, очистки и курирования перед тем, как они перейдут к обучению модели. Эти инструменты обеспечивают качество маркировки данных после аннотирования, что является критически важным шагом для уточнения набора данных.
Рисунок- Инструменты курирования и валидации данных в современных конвейерах данных
Кроме того, Alex подчеркивает важность настройки конвейеров мониторинга после развертывания модели. Эти конвейеры позволяют проводить непрерывную оценку и улучшение, гарантируя, что модель адаптируется к новым данным и остается точной. Уточняя конвейер и внедряя эти дополнительные шаги, предприятия могут повысить качество своих данных и улучшить производительность модели.
Распространенные проблемы в курировании и очистке данных
Курирование и очистка данных сопровождаются рядом проблем, которые могут снижать эффективность и точность AI-моделей:
Ручная проверка данных: Ручная проверка больших наборов данных — например, просмотр многочасовых видеоматериалов — не только отнимает много времени, но и подвержена ошибкам.
Ad-Hoc-подходы: Опора на временные решения без надлежащего слоя персистентности часто приводит к несогласованности и трудностям в эффективном управлении процессом курирования данных.
Проблемы качества данных: Наборы данных часто содержат дубликаты, поврежденные образцы или шумную информацию, что может ухудшать производительность модели.
Кросс-модальные взаимодействия: Анализ взаимосвязей между различными модальностями данных (например, текстом, изображениями, видео) может быть сложным и требовать продвинутых инструментов и техник для обеспечения точного представления данных и взаимодействия между ними.
Как организации могут преодолеть проблемы курирования данных
Алекс рассказывает об инновационных подходах, разработанных в Encord для решения распространенных проблем качества данных, таких как дубликаты, поврежденные данные и шумные образцы:
- Подходы на основе эмбеддингов: Неструктурированные данные можно преобразовать в многомерные векторные эмбеддинги с помощью моделей эмбеддингов и хранить в векторной базе данных, такой как Milvus. Организации могут быстро выявлять аномалии и выбросы, визуализируя эмбеддинги в низкоразмерном пространстве. Такой подход упрощает поиск, организацию и курирование неструктурированных данных.
Рисунок: Использование эмбеддингов для визуализации образцов обучающих данных
Метрики качества данных: Такие метрики, как размытость, яркость и сходство эмбеддингов, можно использовать для оценки качества наборов изображений в задачах компьютерного зрения, помогая выявлять и устранять проблемы до обучения модели.
NLP для курирования данных: Обработка естественного языка может фильтровать и отбирать только наиболее релевантные образцы данных для обучения или тестирования, снижая уровень шума и повышая точность модели.
Слои персистентности: Внедрение правильного слоя персистентности имеет решающее значение для управления процессом курирования данных, позволяя последовательно фиксировать и хранить результаты.
Дедупликация данных: Измерения сходства на основе эмбеддингов помогают выявлять и удалять дублирующиеся образцы, повышая качество данных и снижая потребности в хранении. Это также помогает находить похожие точки данных для аугментации.
Валидация метаданных: Автоматизированные инструменты проверяют метаданные, чтобы обеспечить целостность данных и обнаружить поврежденные образцы. Encord предлагает специализированные инструменты, предназначенные для этой задачи, что упрощает процесс.
Очистка данных: Такие техники, как обнаружение выбросов, импутация и нормализация, могут устранять шум в наборах данных, обеспечивая пригодность данных для обучения высокопроизводительных моделей.
Преимущества эффективного курирования и очистки данных
Улучшенная производительность модели: Высококачественные данные приводят к более точным и надежным моделям.
Сокращение времени обучения: Чистые и курированные данные могут ускорить процесс обучения.
Снижение затрат: Избегая необходимости в дополнительном сборе и разметке данных, организации могут экономить деньги.
Повышенная объяснимость модели: Хорошо курированные данные могут повысить интерпретируемость выходных данных модели.
Заключение
Эффективное курирование данных становится все более критически важным по мере усложнения AI-приложений, особенно тех, которые обрабатывают несколько типов данных, таких как видео и текст. В выступлении Алекса мы получаем более глубокое понимание различных проблем, связанных с курированием наборов изображений и текстов, а также того, как эти проблемы напрямую влияют на производительность модели.
Такие техники, как векторные эмбеддинги и запросы на основе NLP, предлагают командам ценные инструменты для лучшей визуализации своих данных, выявления неверно размеченных или дублирующихся образцов и более эффективной очистки наборов данных перед обучением модели. Чтобы обеспечить успех, команды специалистов по данным должны выбирать подходящие модели эмбеддингов, адаптированные к их конкретным типам данных — будь то эмбеддинги изображений или текста — и использовать векторные базы данных, такие как Milvus, для оптимизации процессов хранения и поиска данных.
В конечном счете, инвестиции в высококачественную обработку данных не только улучшают производительность модели, но и снижают риск ошибок и повышают общую эффективность рабочих процессов ИИ.
Дополнительные ресурсы
Читать далее

How Zilliz Ended Up at the Center of NVIDIA’s Unstructured Data Story at GTC 2026
If unstructured data is the context of AI, then the ceiling of AI applications will be set not just by models, but by how mature the infrastructure for unstructured data becomes.

Zilliz Cloud Introduces Advanced BYOC-I Solution for Ultimate Enterprise Data Sovereignty
Explore Zilliz Cloud BYOC-I, the solution that balances AI innovation with data control, enabling secure deployments in finance, healthcare, and education sectors.

Vector Databases vs. Key-Value Databases
Use a vector database for AI-powered similarity search; use a key-value database for high-throughput, low-latency simple data lookups.



