벡터 검색을 사용하여 컴퓨터 비전 데이터를 더 잘 이해하기
나쁜 데이터가 당신의 AI에 얼마나 해로울 수 있을까요? 직접 확인해 보세요:
데이터 품질 문제
나쁜 데이터는 AI 기반 애플리케이션과 워크플로를 망칠 수 있으며, 단순히 사용자를 좌절시키는 것을 넘어 심각한 영향을 미칠 수 있습니다. 하지만 이는 놀라운 일이 아닙니다.
우리 중 많은 이들이 멀티모달 대규모 언어 모델 (LLMs)의 편리함과 다재다능함을 활용해 이미지와 동영상 속 풍부한 정보에 접근하는 것을 상상해 왔습니다. 흔한 표현처럼 놀라운 일을 만들고, 한 단계 더 끌어올리는 것이죠. 컴퓨터 비전은 새롭고 더 만족스러운 서비스를 위한 그런 무한한 기회를 제공합니다. 하지만 그 과정에는 과제도 있습니다.
중요한 과제 중 하나는 더 나은 결과를 위해 적절한 모델에 더 나은 데이터를 어떻게 선별해 제공할 것인가입니다. 모델의 복잡성과 데이터의 높은 차원성 때문에 많은 파인튜닝과 어둠 속에서의 무작정 시행착오가 필요하며, 이는 혁신에 쓰일 자원을 소모합니다.
시각 AI 워크플로에 투명성과 명확성을 가져와 빠르고 심지어 재미있게 만들 수 있다면 어떨까요? Voxel51은 이를 사명으로 삼고 해냈습니다!
Voxel51의 머신러닝 엔지니어이자 개발자 에반젤리스트인 Jacob Marks가 SF Unstructured Data Meetup.에서 시연한 것처럼 말입니다.
시각 AI를 현실로 만들기
생성형 AI와 머신러닝으로 구동되는 새로운 앱과 서비스의 폭발적 증가는 비정형 데이터를 활용하는 것의 중요성과 벡터 데이터베이스가 게임 체인저로서 수행하는 역할을 드러냈습니다. Jacob Marks는 발표에서 벡터 데이터베이스를 Voxel51 및 그 FiftyOne 오픈 소스 프로젝트 같은 도구와 통합하는 것이, AI 기반 애플리케이션을 더 효율적이고 더 안정적으로 구축하기 위해 시각 데이터를 탐색, 시각화, 선별하는 방식을 어떻게 혁신하고 있는지 보여주었습니다. 이를 통해 필요한 정확한 데이터셋을 모델에 제공하여 강력하고 정확한 결과를 보장하면서 모델을 테스트하고 평가할 수 있습니다.
모든 것은 데이터 품질에서 시작됩니다
왜일까요? 더 나은 데이터가 더 나은 모델로 이어져 성공으로 가는 길을 가속하기 때문입니다.
“머신러닝 시스템의 성공을 저품질 데이터만큼 방해하는 것은 없습니다."라고 Jacob은 말합니다. 올바른 도구가 없으면 데이터를 준비하고 적절한 모델을 찾는 과정은 시간이 많이 걸리고 비효율적일 수 있습니다. 숙련된 ML 엔지니어조차도 고품질 데이터셋과 모델을 구축하려면 좋은 도구가 필요합니다.
FiftyOne은 시각 데이터 처리를 단순화하여 작업, 조정, 결과를 더 쉽고 빠르게 이해할 수 있게 합니다.
복잡한 레이블을 시각화하고, 모델을 평가하고, 관심 있는 시나리오를 탐색하고, 실패 모드를 식별하고, 주석 오류를 찾는 등 다양한 작업을 수행할 수 있습니다. 이는 백그라운드에서 실행되는 LLM 체인을 통해 임베딩을 생성하고 벡터 데이터베이스를 쿼리함으로써 달성됩니다.
이제 본론으로 들어가 보겠습니다!
RAG에서 보물로: 벡터 검색의 힘
RAG는 벡터 데이터베이스가 대중화된 이유 중 하나입니다.
검색 증강 생성 (RAG)은 대규모 언어 모델의 정확도를 향상시켜 벡터 검색을 대중화했습니다. 이는 검색 기반 모델과 생성 모델을 결합하여 생성된 텍스트의 품질과 관련성을 향상시킵니다.
이 기술은 LLM을 사용해 사용자 프롬프트를 임베딩으로 변환하고 이를 벡터 임베딩과 비교하여, 더 정확하고 맥락이 풍부한 응답을 위한 의미적 유사성 검색을 가능하게 합니다.
RAG
데이터 입력과의 유사성을 위해 여러 벡터를 비교할 수 있습니다. 따라서 두 개의 텍스트 입력을 가져와 벡터화하고 임베딩하면, 사용된 메트릭이 유클리드 거리, 코사인 유사도 또는 내적이든 상관없이 이들의 근접성을 살펴볼 수 있습니다.
벡터 유사도
텍스트, 이미지, 비디오와 같은 다양한 유형의 데이터를 같은 유형의 공간에서 함께 처리하기 위해 멀티모달 임베딩을 사용할 수도 있습니다.
벡터 임베딩
컴퓨터 비전을 위한 벡터 검색
Voxel51은 Zilliz Cloud를 사용하여 Milvus를 통합해 시각 데이터셋에서 벡터 검색 기능을 활용할 수 있게 했습니다. 다음은 몇 가지 강력한 사용 사례입니다:
이미지 유사도: 유사도 검색은 일반적인 사용 사례이며 Voxel51을 사용하면 훨씬 더 쉬워집니다.
데이터셋에서 관심 있는 이미지를 선택하고 이를 사용해 유사한 이미지를 검색하기만 하면 됩니다. 모든 임베딩 및 쿼리 단계는 백엔드에서 수행됩니다. 시각적 경험을 매우 직관적이고 클릭 가능하게 유지합니다. 예를 들어, GUI에서 선택하여 metric 및 k-value와 같은 속성을 정의할 수 있습니다.
이미지 유사도 검색
마찬가지로, 외부 이미지를 사용하여 역검색을 수행할 수도 있습니다.
시각 데이터셋에 카네코르소 개가 있는지 찾고 싶다고 해봅시다. 이미지의 URI만 제공하면 자동으로 벡터화되고 벡터 공간에서 시각 데이터셋과 유사도 쿼리가 수행됩니다.
역이미지 검색
객체 검색: 전체 이미지뿐만 아니라, 벡터 데이터베이스는 객체 탐지 패치를 처리할 수 있어 하위 이미지 내에서 더 정밀한 검색을 가능하게 합니다. 이는 얼굴 인식이나 대규모 데이터셋 내 객체 식별과 같은 작업에 유용합니다.
객체 유사도 검색
검색의 객체 초점은 전체 이미지가 아닐 가능성이 높기 때문에, 전체 이미지에 대한 임베딩을 계산하는 것은 항상 객체의 임베딩과 유사하지는 않을 것이므로 효과가 떨어질 수 있습니다.
OCR 검색: 또 다른 사용 사례는 대화형 광학 문자 인식(OCR) 문서입니다. 텍스트 임베딩과 시각적으로 상호작용할 수 있습니다. 문서의 각 페이지에서 이러한 결과가 어디에서 나오는지 확인할 수 있습니다.
강력한 OCR 문서 검색
크로스모달 검색: OpenAI의 CLIP 및 Meta의 ImageBind와 같은 도구는 텍스트와 이미지 임베딩의 조합을 가능하게 합니다. 이를 통해 사용자는 텍스트 설명 임베딩, 오디오 임베딩 등을 사용하여 이미지를 검색하거나 그 반대로도 검색할 수 있는 크로스모달 검색이 가능해집니다. 그의 예시에서는 기차 소리 오디오 클립이 임베딩된 후 데이터셋에서 기차를 찾기 위해 모든 이미지와 비교되었습니다.
크로스모달 검색
지각적 유사도: 지각적 유사도는 벡터 공간에서 모델 표현을 비교함으로써 서로 다른 모델이 세상을 어떻게 인식하는지 이해할 수 있게 해줍니다. 일부 모델은 매우 의미론적이어서 고수준의 세부 사항과 개념을 포착하지만, 아래 그림처럼 픽셀 수준에서 이미지의 팔레트는 포착하지 못합니다:
지각적 유사도 탐색
계산 신경망으로 구현된 보다 전통적인 컴퓨터 비전은 모든 픽셀과 패치를 가져오지만, 아래 이미지에서 볼 수 있듯 의미는 제대로 파악하지 못합니다.
지각적 유사도 탐색-2
벡터 공간에서 결과 분포를 확인함으로써 모델 표현을 벡터 공간에서 비교할 수 있습니다. 일부 모델은 결과가 함께 군집화되어 있는 반면, 다른 모델은 그렇지 않을 수 있습니다. 이들은 세상을 다르게 보며, 이러한 다양한 관점을 언제 적용해야 하는지 이해하는 것은 AI의 품질에 있어 기본적입니다.
시각 벡터 검색에는 더 많은 혁신이 다가오고 있습니다
개념 보간: 개념 보간은 두 텍스트 개념을 가져와 그 사이의 결과를 보간합니다. 예시에서는 허스키와 치와와에 대한 초기 임베딩이 주어졌고, 고양이를 포함하여 그 사이에 들어맞을 수 있는 모든 것을 검색했습니다!
concept interpolation
개념 공간 순회: 개념 공간 순회를 통해 사용자는 임베딩을 결합하고 조작하여 가능한 임베딩의 공간에서 속성을 조절할 수 있습니다. 예를 들어 검색에서 건강함과 다채로움 속성이 조절되는 경우가 있습니다.
Concept space traversal
텍스트, 이미지, 기타 모달리티에 대한 임베딩을 원하는 수준의 올바른 속성과 결합해 검색 공간을 더 동적으로 탐색할 수 있도록 만들기 위해 뒤에서는 많은 일이 일어나고 있으며, 여러분에게 남은 일은 선택 항목을 클릭하거나 슬라이드하는 것뿐입니다. 이렇게 쉽습니다!
결론
벡터 데이터베이스는 컴퓨터 비전에서 필수적이며, 멀티모달 임베딩, 개념 보간, 순회를 사용한 데이터 탐색, 모델 평가, 혁신적인 검색을 위해 시각적 데이터셋 도구에 강력한 엔진을 제공합니다. AI가 계속 발전함에 따라 벡터 데이터베이스의 통합은 비정형 데이터 기반 기술의 미래를 형성하는 데 중요한 역할을 할 것입니다.
Jacob이 말하듯 가능성은 무한합니다. 이 유용한 튜토리얼을 통해 벡터 데이터베이스로 구동되는 시각 AI를 직접 사용해 보고 즐겨 보세요.
더 알아보고 싶거나 컴퓨터 비전 프로젝트를 시작하고 싶다면, 예를 들어 저희 Discord channel에 참여해 주세요. 시작하는 데 도움이 될 풍부한 리소스와 지원적인 커뮤니티를 제공합니다.
계속 읽기

Notion's Vector Search Is Excellent. Their Next Problem Is Harder.
Notion solved vector search scaling in two years. The next bottleneck — offline context engineering, unified data, and the real-time/offline gap — is harder.

Zilliz Cloud Delivers Better Performance and Lower Costs with Arm Neoverse-based AWS Graviton
Zilliz Cloud adopts Arm-based AWS Graviton3 CPUs to cut costs, speed up AI vector search, and power billion-scale RAG and semantic search workloads.

8 Latest RAG Advancements Every Developer Should Know
Explore eight advanced RAG variants that can solve real problems you might be facing: slow retrieval, poor context understanding, multimodal data handling, and resource optimization.



