Zilliz x Galileo: 벡터 임베딩의 힘
비정형 데이터는 어디에나 있습니다. IDC는 2025년까지 175제타바이트(0이 21개)가 넘는 데이터를 보유하게 될 것이라고 추정했습니다. 그중 80%는 비정형 데이터입니다. 비정형 데이터는 미리 정해진 형식에 맞지 않는 데이터, 즉 사전 설정된 데이터 모델이나 스키마를 따르지 않는 데이터입니다. 일반적으로 텍스트, 이미지, 오디오, 동영상의 형태를 띠지만 다양한 다른 조건도 처리할 수 있습니다.
벡터 임베딩이란 무엇인가요?
가장 기본적인 수준에서 벡터 임베딩은 데이터를 수치로 표현한 것입니다. 벡터 임베딩은 일반적으로 수백 또는 수천 개의 부동소수점 숫자로 구성됩니다. 높은 차원성 덕분에 벡터 임베딩은 이미지, 오디오, 텍스트와 같은 복잡한 데이터를 저장할 수 있습니다. 훈련된 머신러닝 모델에서 벡터 임베딩을 추출할 수 있습니다. 프로덕션에서 사용되는 대부분의 신경망에는 많은 레이어가 있으며, 각 레이어에는 수백 개의 뉴런이 있습니다. 데이터 포인트가 신경망의 피드포워드 함수를 통과하면 각 레이어가 출력을 생성합니다. 일반적으로 이러한 네트워크는 네트워크의 최종 레이어에서 생성되는 어떤 분류를 수행합니다. 데이터를 나타내는 벡터 임베딩은 최종 은닉 레이어의 출력이며, 이는 보통 마지막에서 두 번째 레이어를 의미합니다.
벡터 임베딩으로 어떻게 작업할 수 있나요?
벡터 임베딩은 비정형 데이터를 다루는 사실상의 방법입니다. 비교하고 싶은 데이터가 있다면, 벡터 임베딩을 사용해 비교하는 것을 권장합니다. 벡터 임베딩은 신경망의 마지막에서 두 번째 레이어의 출력을 가져와 이를 입력의 벡터 임베딩으로 사용함으로써 신경망에서 생성됩니다. 임베딩 벡터를 생성할 때 고려해야 할 요소가 몇 가지 있습니다. 주요 고려 사항은 임베딩의 크기, 모델 훈련을 위한 데이터, 데이터 품질입니다. 벡터의 크기가 타당한지 확인해야 합니다.
벡터 임베딩을 사용하여 훈련 데이터 디버깅하기
데이터 오류 찾기
모델 개발의 초기 단계는 주로 "데이터 큐레이션" 과제를 해결하는 데 초점을 맞춥니다. 이 단계의 주요 목표는 모델 훈련 및 평가를 위한 최적의 데이터셋을 구축하는 것입니다. 엔터프라이즈를 위한 알고리즘 기반 LLM Ops 플랫폼인 Galileo는 클러스터링을 통해 데이터 오류를 감지하기 위해 임베딩을 사용합니다.
Galileo는 Data Error Potential (DEP)이라는 점수로 오류를 보여주는 고유한 기능을 갖추고 있습니다. DEP는 모델의 오류를 파고들 때 탐색하기 가장 어렵고 가치 있는 데이터를 빠르게 정렬하고 끌어올리는 도구를 제공합니다.
데이터 오류를 디버깅할 때는 두 가지 유형의 솔루션이 있습니다.
훈련 데이터에 없는 샘플 찾기
모델이 배포되어 실제 데이터와 상호작용하게 되면 트래픽 패턴에 변화가 생깁니다. Galileo는 임베딩을 활용해 ML 모델의 성능을 지속적으로 모니터링함으로써 모델 드리프트를 감지할 수 있습니다. 드리프트된 샘플은 주석 처리되어 더 견고한 성능을 위해 훈련 데이터에 추가될 수 있습니다.
데이터에서 환각 찾기
AI 환각은 AI가 그럴듯하게 들릴 수 있지만 부정확하거나 맥락과 관련 없는 정보를 생성하는 상황을 의미합니다. 이 문제는 일반적으로 AI 설계 편향, 현실 세계에 대한 불충분한 이해, 또는 불완전한 훈련 데이터로 인해 발생합니다.
이 문제를 해결하기 위해 Galileo는 AI 환각 사례를 식별하기 위한 임베딩 기반 기법에 적극적으로 참여하고 있습니다. 이 접근 방식은 데이터의 오류를 발견하는 데 도움이 되며, 더 정확하고 신뢰할 수 있는 AI 모델을 학습시키는 데 기여합니다.
검색 증강 생성에서 오류 찾기
(RAG)검색 증강 생성(RAG)은 질의응답 시스템과 챗봇을 개발하는 데 널리 사용되는 기법입니다. 그러나 이 접근 방식의 일반적인 문제는 부실한 검색이 발생하여 잘못된 답변을 제공하게 된다는 점입니다. Galileo는 이 문제를 해결하기 위해 임베딩 기반 기법을 사용하여 잘못된 컨텍스트를 감지하는 컨텍스트 관련성 점수를 구축하고 있습니다. 때로는 관련성이 올바르더라도 생성 결과에 환각이 포함될 수 있습니다. Galileo는 모델의 응답이 컨텍스트 창에서 모델에 제공된 정보를 기반으로 했는지를 측정하는 근거성 점수를 제공할 예정입니다.
Galileo의 강력한 알고리즘은 토큰 수준의 오류를 보여줄 수 있으며, 이는 애플리케이션이 환각을 생성하지 않도록 돕습니다.
벡터 임베딩 인덱싱, 저장 및 쿼리
임베딩을 갖추는 것은 훌륭하지만, 이를 사용할 수 있어야 합니다. 벡터를 인덱싱하고, 저장하고, 쿼리할 무언가가 있는 것이 가장 좋습니다. 이것이 바로 벡터 데이터베이스의 핵심입니다. 벡터 데이터베이스는 벡터 데이터를 인덱싱, 저장, 쿼리하도록 특별히 설계되었습니다. 인덱싱, 저장, 쿼리가 가능하다는 점은 벡터 데이터베이스를 LLM 애플리케이션에 사용하기에 강력한 후보로 만듭니다. 벡터 데이터베이스는 문서와 쿼리의 의미론적 의미를 저장하고 FAQ의 캐시로 활용하기에 완벽합니다. LLM 앱에서 벡터 임베딩을 사용하는 방법의 완벽한 예는 오픈 소스 소프트웨어 문서와 “채팅”할 수 있게 해주는 애플리케이션인 OSSChat입니다.
실용적인 Q/A 애플리케이션을 갖추는 데 있어 가장 중요한 측면 중 하나는 적합한 벡터 임베딩을 사용하는 것입니다. 문서를 쿼리하려면 쿼리의 잠재 벡터 공간이 필요합니다. 우리는 문서 집합이 주어졌을 때 질문을 생성하기 위해 ChatGPT와 같은 LLM을 사용합니다. 그런 다음 사용자가 질문할 때 쿼리할 수 있도록 이러한 임베딩을 인덱싱하고 저장합니다.
벡터 임베딩의 힘 요약
비정형 데이터는 전 세계에서 가장 흔한 데이터 유형입니다. 전통적으로 비정형 데이터는 미리 정해진 구조를 따르지 않기 때문에 다루기 어려웠습니다. 딥러닝이 더 강력해지고 널리 보급되면서, 비정형 데이터를 벡터로 변환하여 다루는 해결책을 만들어냈습니다.
벡터 임베딩을 사용하면 원래 숫자로 시작하지 않는 것들에 대해 수학 연산을 수행할 수 있습니다. 이 글에서는 벡터 임베딩, 이를 다루는 방법, 그리고 현재 머신러닝 패러다임에서 벡터를 사용하는 네 가지 구체적인 방법을 소개했습니다. 벡터 임베딩을 사용하여 데이터 오류를 찾고, 학습 데이터에 없는 샘플을 찾고, 환각을 찾고, 검색 증강 생성의 오류를 수정할 수 있습니다.
벡터 임베딩의 힘은 이러한 광범위한 사용 사례에서 확인할 수 있습니다. 이를 다루는 가장 효과적인 방법은 Milvus 또는 Zilliz Cloud와 같은 벡터 데이터베이스를 사용하여 벡터를 저장, 인덱싱, 쿼리하는 것입니다.
Galileo가 주최하는 다가오는 웨비나에 참여하세요
10월 12일, Galileo의 Vikram Chatterji와 Zilliz의 Yujian Tang이 함께하는 RAG 및 LLM 관리 심층 탐구에 참여하세요. 이 웨비나는 LLM 파이프라인과 출력 품질을 향상할 수 있는 실행 가능한 인사이트와 방법을 제공할 것입니다. RAG 및 LLM 성능을 최적화하기 위한 프레임워크와 도구를 찾고 있는 모든 데이터 과학자와 머신러닝 엔지니어에게 유익한 세션이 될 것입니다.
계속 읽기

From Vector Database to Vector Lakebase
Zilliz offers a fully managed Vector Lakebase powered by Milvus, unifying real-time vector search, lake-scale discovery, and Al data operations.

VidTok: Rethinking Video Processing with Compact Tokenization
VidTok tokenizes videos to reduce redundancy while preserving spatial and temporal details for efficient processing.

DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding
Explore DeepSeek-VL2, the open-source MoE vision-language model. Discover its architecture, efficient training pipeline, and top-tier performance.



