쓰레기가 들어가면 쓰레기가 나온다: 부실한 데이터 큐레이션이 왜 당신의 AI 모델을 망치고 있는가
현대 세계에서 데이터는 석유만큼 가치 있는 것이 되었습니다. 기업들은 전통적으로 모델을 구축하고 인사이트를 얻기 위해 방대한 양의 데이터를 수집하는 데 집중해 왔지만, 이제 초점은 양보다 질로 이동하고 있습니다. 많은 조직은 이제 고품질 데이터를 보유하는 것이 단순히 대규모 데이터셋을 축적하는 것보다 더 중요하다는 사실을 깨닫고 있습니다. 그러나 이러한 변화는 중요한 과제를 드러냅니다. 많은 기업이 기존 데이터를 완전히 이해하고 효과적으로 큐레이션하는 데 어려움을 겪고 있습니다.
Zilliz가 주최한 Unstructured Data Meetup에서 Alexandre Bonnet Encord의 Lead ML Solutions Engineer는 부실한 데이터 큐레이션의 함정과 기업이 이러한 과제를 어떻게 극복할 수 있는지에 대한 발표에서 이 문제를 다루었습니다. 그는 데이터 품질과 시장 동향의 중요성을 강조하며, 조직이 고품질 데이터 생산 파이프라인을 구축하는 데 도움이 되는 로드맵을 제시했습니다. 이 블로그에서는 Alexandre의 핵심 내용을 요약해 보겠습니다. 또한 YouTube에서 그의 전체 발표를 시청할 수도 있습니다.
7월 SF Unstructured Data Meetup에서 발표하는 Encord의 발표자 Alexandre Bonnet
AI의 진화
Alex는 기업에서 전통적인 AI 애플리케이션에서 현대적인 생성형 AI로의 전환에 대해 설명합니다. 약 10년 전에는 각 사용 사례마다 AI 모델을 처음부터 구축해야 했고, 일반적으로 한 가지 유형의 데이터(단일 모달)만 처리하도록 제한되어 있었습니다. 이러한 초기 모델은 주로 데이터 과학자와 엔지니어로 구성된 기술 팀이 사용했습니다. 그러나 오늘날의 AI 환경은 YOLO, GPT, Claude와 같은 기반 모델을 통해 크게 발전했으며, 이러한 모델은 특정 도메인에 비교적 쉽게 파인튜닝할 수 있습니다. 또한 현대 아키텍처는 여러 데이터 유형(멀티모달)을 처리할 수 있어, 깊은 기술적 배경이 없는 일반 사용자도 AI에 접근할 수 있게 해줍니다. 이러한 변화는 다양한 산업 전반에서 AI의 광범위한 도입으로 이어져 워크플로와 프로세스를 간소화하고 있습니다.
그림- 전통적인 AI와 현대 AI
Alex는 "지난 10년 동안 인공지능의 모든 분야에서 연구가 폭발적으로 증가했습니다.”라고 지적합니다. 합성 데이터와 생성형 AI 같은 영역의 발전에도 불구하고, 컴퓨터 비전의 진전은 상대적으로 더딘 편이었습니다. 이는 대체로 고유한 과제를 제기하는 비정형 이미지 데이터를 이해하는 복잡성 때문입니다.
그림: 지난 10년간 AI의 여러 분야에서의 발전
Alex는 AI의 세 가지 주요 축인 데이터, 모델, 컴퓨팅을 강조합니다. 트랜스포머, 어텐션 메커니즘, 특정 작업에 맞게 파인튜닝할 수 있는 대규모 언어 모델 (LLMs) 등 모델 아키텍처에서 빠른 발전이 있었던 한편, 복잡한 모델을 학습하도록 설계된 고성능 GPU의 개발을 중심으로 하드웨어에서도 상당한 진전이 있었습니다. 하지만 모델과 컴퓨팅 성능에서 이러한 진전이 있었음에도 불구하고, 데이터 품질은 여전히 뒤처져 있으며 성숙도 측면에서 초기 단계에 머물러 있습니다.
그림: AI의 축
AI에서 데이터 품질이 중요한 이유
노이즈가 많거나 정제되지 않은 데이터셋으로 학습된 텍스트 기반 모델은 종종 논리적 오류가 있거나 심지어 의미 없는 문자를 포함한 출력을 생성합니다. 마찬가지로, 일부 확산 기반 모델과 같은 이미지 모델은 워터마크처럼 예상치 못한 아티팩트가 있는 시각 자료를 생성하는 것으로 알려져 있습니다. 근본 원인은 무엇일까요? 부실한 데이터 큐레이션입니다.
그림: 데이터 클리닝 vs 데이터 큐레이션
명확히 하자면, 데이터 큐레이션은 라벨링 또는 모델 학습을 위해 데이터를 구성, 관리, 준비하여 특정 작업에 적합하고 구조화되도록 하는 것을 의미합니다. 데이터 클리닝은 중복 제거, 손상된 샘플 수정, 노이즈 처리 등 데이터의 오류나 불일치를 식별하고 수정하는 데 중점을 둡니다. 두 프로세스 모두 모델 학습에 고품질의 신뢰할 수 있는 데이터만 사용되도록 보장합니다.
대규모로 학습 데이터를 정리하고 개선하는 것은 큰 과제입니다. 예를 들어, YouTube 동영상을 사용해 멀티모달 모델 을 학습하는 작업을 생각해 보겠습니다. 데이터의 양이 방대하기 때문에 일부 클립에는 손상된 오디오, 부적절한 언어, 또는 관련 없는 콘텐츠가 포함될 수 있습니다. 엄격한 데이터 큐레이션이 없으면 이러한 문제는 AI 모델의 성능과 신뢰성을 저하시킬 수 있습니다.
효과적인 데이터 큐레이션은 고품질의 적절한 데이터만 모델에 입력되도록 데이터셋을 세심하게 필터링하고 분석하는 것을 포함합니다. Alex는 "훌륭한 데이터는 훌륭한 모델과 같다"라는 원칙이 생성형 AI에서 특히 참이라고 강조합니다. 산업 환경에서 용접 결함을 감지하거나 수술 로봇을 지원하는 것과 같은 도메인 특화 애플리케이션의 경우, 학습 데이터는 매우 관련성이 높아야 하며 의도한 사용 사례를 정확하게 반영해야 합니다. 이러한 수준의 큐레이션은 모델이 엣지 케이스를 효과적으로 처리하도록 돕고 실패 위험을 줄입니다.
발표 중 Alex는 잘 큐레이션된 데이터의 중요성을 보여주는 예를 공유했습니다. 한 사례에서, vision 기능을 갖춘 GPT-4와 같은 비전 기반 언어 모델(VLM)은 이미지 속 스쿨버스가 앞쪽을 향하고 있는지 뒤쪽을 향하고 있는지 식별하지 못했습니다. 이 실패는 정교한 모델조차도 고품질의 큐레이션된 데이터가 없으면 어려움을 겪는다는 점을 보여주며, 모델 정확도와 성능을 개선하기 위해 포괄적인 데이터 큐레이션과 클리닝이 필요하다는 사실을 강조합니다.
그림: 비전 기반 LLM은 노이즈가 많은 학습 데이터로 인해 모델 성능이 저조함
도메인 특화 모델 파인튜닝을 위한 데이터 큐레이션
이제 AI 성능에서 데이터 품질의 중요성을 배웠으니, 특정 도메인에 맞게 모델을 파인튜닝하는 데 데이터 큐레이션이 어떻게 중요한 역할을 하는지 보여주는 예를 살펴보겠습니다.
LLaVA는 Meta AI가 개발한 범용 대규모 언어 모델로, 인간 언어를 이해하는 데 매우 뛰어납니다. 그러나 의료 분야와 같은 더 전문화된 영역에 맞게 조정하려면 목표 지향적인 데이터 큐레이션 노력이 필요합니다. 이 미세 조정 과정은 의료 애플리케이션을 위한 특화 AI 어시스턴트인 LLaVA-Med의 탄생으로 이어졌습니다.
이 과정에 포함된 주요 단계는 다음과 같습니다:
Figure: Fine-tuning LLM with medical knowledge
의료 개념 정렬
첫 번째 미세 조정 단계에서는 사용 가능한 데이터셋의 4%에 불과한 600,000개의 이미지-텍스트 쌍을 사용했으며, 이는 교과서와 연구 논문에서 가져온 것이었습니다. 모델이 핵심 의료 개념을 학습하도록 돕기 위해 균형 잡힌 데이터셋을 큐레이션하는 데 상당한 시간과 노력이 투입되었습니다. 이 과정에는 인간의 전문성과 반자동화 기법이 결합되어, 큐레이션된 데이터가 의료 분야의 미묘한 차이를 정확하게 반영하도록 했습니다.
의료 지시 튜닝
두 번째 단계에서는 모델이 의료 질의에 응답하는 방법을 학습하도록 돕기 위해 60,000개의 질문-답변 쌍으로 미세 조정되었습니다. 이 단계는 모델이 입력 프롬프트를 이해하고, 관련 정보를 검색하며, 의료 맥락을 기반으로 정확한 응답을 생성할 수 있게 했습니다. 지시 튜닝에 중점을 둔 것은 실제 의료 상황에서 맥락을 인식한 지원을 제공하는 모델의 능력을 향상시켰습니다.
훈련을 위해 더 작지만 고품질의 데이터셋을 큐레이션함으로써, 팀은 LLaVA-Med를 효율적으로 미세 조정하고 정확한 결과를 달성할 수 있었으며, 동시에 훈련 비용을 줄일 수 있었습니다. 이 사례 연구는 도메인 특화 대규모 언어 모델(LLMs)을 개발하는 데 있어 데이터 큐레이션의 중요성을 강조합니다. 또한 세심한 큐레이션과 목표 지향적 미세 조정이 범용 모델을 의료 분야에서 빛을 발할 수 있는 전문화된 도구로 어떻게 전환할 수 있는지도 보여줍니다.
데이터 품질 및 큐레이션의 진화하는 트렌드
전통적인 데이터 파이프라인에서는 수집된 데이터가 일반적으로 수동 주석 처리 또는 인간의 감독하에 모델을 사용한 사전 주석 처리를 거치곤 했습니다. 이후 주석 처리된 데이터는 모델을 훈련하는 데 사용되고, 그 모델은 배포되었습니다. 이러한 선형 접근 방식은 일부 시나리오에서는 효과가 있을 수 있지만, 특히 방대한 양의 비정형 데이터를 다룰 때 전문화된 사용 사례에서는 한계가 있습니다.
이러한 과제를 해결하기 위해 Alex는 더 유연하고 견고한 데이터 파이프라인의 필요성을 강조합니다. 현대적인 파이프라인은 향상된 데이터 큐레이션을 위한 추가 단계를 통합할 수 있습니다. 데이터가 수집되어 데이터 웨어하우스에 저장되면, 모델 훈련으로 진행되기 전에 외부 도구를 활용해 이를 검증하고, 정제하며, 큐레이션할 수 있습니다. 이러한 도구는 주석 처리 후 데이터 라벨링 품질을 보장하며, 이는 데이터셋을 개선하기 위한 중요한 단계입니다.
Figure- Data Curation & Validation tools in modern data pipelines
또한 Alex는 모델 배포 후 모니터링 파이프라인을 구축하는 것의 중요성을 강조합니다. 이러한 파이프라인은 지속적인 평가와 개선을 가능하게 하여, 모델이 새로운 데이터에 적응하고 정확성을 유지하도록 보장합니다. 파이프라인을 개선하고 이러한 추가 단계를 구현함으로써, 기업은 데이터의 품질을 향상시키고 모델 성능을 개선할 수 있습니다.
데이터 큐레이션 및 정제의 일반적인 과제
데이터 큐레이션과 정제에는 AI 모델의 효율성과 정확성을 저해할 수 있는 다양한 과제가 따릅니다:
수동 데이터 검토: 몇 시간 분량의 영상 자료를 스크롤하며 살펴보는 것과 같이 대규모 데이터셋을 수동으로 검토하는 것은 시간이 많이 소요될 뿐만 아니라 오류가 발생하기 쉽습니다.
임시방편적 접근 방식: 적절한 지속성 계층 없이 임시방편적 솔루션에 의존하면 종종 불일치가 발생하고 데이터 큐레이션 프로세스를 효과적으로 관리하는 데 어려움이 생깁니다.
데이터 품질 문제: 데이터셋에는 중복, 손상된 샘플 또는 노이즈가 많은 정보가 자주 포함되어 있어 모델 성능을 저하시킬 수 있습니다.
크로스 모달 상호작용: 서로 다른 데이터 모달리티(예: 텍스트, 이미지, 비디오) 간의 관계를 분석하는 것은 복잡할 수 있으며, 정확한 데이터 표현과 상호작용을 보장하기 위해 정교한 도구와 기술이 필요합니다.
조직이 데이터 큐레이션 과제를 극복하는 방법
Alex는 중복, 손상된 데이터, 노이즈가 많은 샘플과 같은 일반적인 데이터 품질 문제를 해결하기 위해 Encord에서 개발한 혁신적인 접근 방식을 공유합니다:
- 임베딩 기반 접근 방식: 비정형 데이터는 embedding models를 통해 고차원 vector embeddings로 변환되어 Milvus와 같은 vector database에 저장될 수 있습니다. 조직은 저차원 공간에서 임베딩을 시각화함으로써 이상치와 특이값을 빠르게 식별할 수 있습니다. 이 접근 방식은 비정형 데이터를 검색, 구성, 큐레이션하기 쉽게 만듭니다.
그림: 임베딩을 사용하여 학습 데이터 샘플 시각화
데이터 품질 지표: 흐릿함, 밝기, 임베딩 유사도와 같은 지표는 컴퓨터 비전 작업에서 이미지 데이터셋의 품질을 평가하는 데 사용될 수 있으며, 모델 학습 전에 문제를 표시하고 수정하는 데 도움이 됩니다.
데이터 큐레이션을 위한 NLP: 자연어 처리는 학습 또는 테스트에 가장 관련성이 높은 데이터 샘플만 필터링하고 선택하여 노이즈를 줄이고 모델 정확도를 향상시킬 수 있습니다.
영속성 계층: 적절한 영속성 계층을 구현하는 것은 데이터 큐레이션 프로세스를 관리하는 데 매우 중요하며, 결과를 일관되게 캡처하고 저장할 수 있게 합니다.
데이터 중복 제거: 임베딩 기반 유사도 측정은 중복 샘플을 식별하고 제거하는 데 도움이 되어 데이터 품질을 향상시키고 저장 공간 요구를 줄입니다. 이는 증강을 위한 유사한 데이터 포인트를 찾는 데도 도움이 됩니다.
메타데이터 검증: 자동화 도구는 데이터 무결성을 보장하고 손상된 샘플을 감지하기 위해 메타데이터를 검증합니다. Encord는 이 작업을 위해 설계된 특정 도구를 제공하여 프로세스를 간소화합니다.
데이터 정제: 이상치 탐지, 대치, 정규화와 같은 기술은 데이터셋의 노이즈를 해결하여 데이터가 고성능 모델 학습에 적합하도록 보장할 수 있습니다.
효과적인 데이터 큐레이션 및 정제의 이점
향상된 모델 성능: 고품질 데이터는 더 정확하고 신뢰할 수 있는 모델로 이어집니다.
단축된 학습 시간: 정제되고 큐레이션된 데이터는 학습 프로세스를 가속화할 수 있습니다.
비용 절감: 추가 데이터 수집 및 라벨링의 필요성을 피함으로써 조직은 비용을 절약할 수 있습니다.
향상된 모델 설명 가능성: 잘 큐레이션된 데이터는 모델 출력의 해석 가능성을 향상시킬 수 있습니다.
결론
AI 애플리케이션이 더욱 복잡해짐에 따라, 특히 비디오와 텍스트처럼 여러 데이터 유형을 처리하는 애플리케이션에서 효과적인 데이터 큐레이션은 점점 더 중요해집니다. Alex의 발표를 통해 우리는 이미지 및 텍스트 데이터셋을 큐레이션하는 것과 관련된 다양한 과제와 이러한 문제가 모델 성능에 직접적으로 어떤 영향을 미치는지 더 깊이 이해하게 됩니다.
vector embeddings 및 NLP 기반 쿼리와 같은 기술은 팀이 데이터를 더 잘 시각화하고, 잘못 라벨링되었거나 중복된 샘플을 식별하며, 모델 학습 전에 데이터셋을 더 효율적으로 정제할 수 있도록 유용한 도구를 제공합니다. 성공을 보장하기 위해 데이터 과학 팀은 이미지 임베딩이든 텍스트 임베딩이든 특정 데이터 유형에 맞춘 적절한 embedding models를 선택하고, 데이터 저장 및 검색 프로세스를 간소화하기 위해 Milvus와 같은 vector databases를 활용해야 합니다.
궁극적으로, 고품질 데이터 큐레이션에 투자하는 것은 모델 성능을 향상시킬 뿐만 아니라 오류 위험을 줄이고 AI 워크플로의 전반적인 효율성을 높입니다.
추가 리소스
계속 읽기

Milvus 2.6.x Now Generally Available on Zilliz Cloud, Making Vector Search Faster, Smarter, and More Cost-Efficient for Production AI
Milvus 2.6.x is now GA on Zilliz Cloud, delivering faster vector search, smarter hybrid queries, and lower costs for production RAG and AI applications.

Zilliz Cloud Now Available in Azure North Europe: Bringing AI-Powered Vector Search Closer to European Customers
The addition of the Azure North Europe (Ireland) region further expands our global footprint to better serve our European customers.

VidTok: Rethinking Video Processing with Compact Tokenization
VidTok tokenizes videos to reduce redundancy while preserving spatial and temporal details for efficient processing.



