10억 명의 목소리를 뒷받침하는 인프라: 선도적인 LLM 제공업체와 Zilliz가 인도의 다국어 AI 미래를 실현하는 방법

<300 ms
수천만 개의 벡터 전반에서 40~50 QPS일 때의 엔드투엔드 지연 시간.
3,500개 이상의 차원
다국어 의미 검색을 위해 수천만 개의 고차원 벡터를 효율적으로 제공.
자동 리샤딩
시스템이 확장됨에 따라 노드 전반에서 지속적인 데이터 및 부하 재조정.
균형 잡힌 절충안
성능, 재현율 및 비용 전반에서 균형 잡힌 결과.
회사 소개
고객사는 인도의 풍부한 언어적 다양성을 지원하는 다국어 언어 기술 구축에 주력하는 인도의 선도적인 생성형 AI 기업입니다. 이들의 플랫폼은 대규모 언어 모델, 음성 인식, 음성 합성, 번역, 그리고 공공 및 민간 부문 전반에서 대화형 에이전트와 음성 우선 애플리케이션을 구동하는 개발자 친화적 API를 아우릅니다. 현지에서 학습된 모델과 신뢰할 수 있는 지식 소스에 기반한 검색을 결합함으로써, 이들은 국가적 규모에서 정확하고 문화적으로 정합한 응답을 생성할 수 있는 AI 시스템을 제공합니다.
이들의 다국어 RAG 시스템이 성숙해지면서, 팀은 고차원 임베딩과 불균등한 워크로드 분산부터 증가하는 운영 오버헤드에 이르기까지 점점 커지는 인프라 병목 현상에 직면했습니다. Zilliz Cloud는 자동 확장, 하이브리드 검색, 고성능 검색을 통해 이러한 과제를 해결했으며, 수동 유지보수를 제거하고 대규모 다국어 AI에 필요한 정확도를 회복했습니다. 오늘날 이 파트너십은 전국 사용자에게 근거 있고 신뢰할 수 있는 AI 경험을 제공하려는 회사의 사명에 중요한 기반 역할을 하고 있습니다.
규모에 맞춰 진실을 근거화하는 과제
언어적으로 다양한 인구를 위한 AI를 구축하는 일은 대부분의 대규모 언어 모델이 처리하도록 설계되지 않은 복잡성을 수반합니다. 많은 모델이 영어와 소수의 고자원 언어에서는 뛰어난 성능을 보이지만, 글로벌 학습 데이터셋에서 대표성이 낮은 언어에서는 종종 어려움을 겪습니다. 이러한 불일치는 환각, 오해, 일관성 없는 응답으로 이어질 수 있으며, 특히 사람들이 자신의 현지 언어로 정확하고 근거 있는 답변을 기대할 때 사용자 신뢰에 직접적인 영향을 미칩니다.
이를 해결하기 위해 고객사는 Wikipedia 기반 Retrieval-Augmented Generation (RAG) 시스템을 개발하여 모델에 실시간 사실 기반 맥락을 보강했습니다. 모델 가중치에만 의존하는 대신, 모든 쿼리는 응답을 생성하기 전에 선별된 지식 베이스에서 가장 관련성 높은 정보를 검색합니다. 이는 특히 문화적으로 특수하거나 지역적 뉘앙스가 있는 질문에서 환각을 크게 줄이고 사실 정확도를 향상시킵니다.
그러나 이 시스템을 확장하면서 더 깊은 인프라 과제가 빠르게 드러났습니다. 팀은 전체 Wikipedia 코퍼스를 처리하여 수백만 개의 문서를 고차원 벡터로 변환해야 했습니다. 총 수천만 개에 달하고 각각 수천 차원을 가진 이 벡터들은 300밀리초보다 훨씬 짧은 시간 안에 검색되어야 했습니다. 볼륨, 차원 수, 실시간 지연 시간 요구사항은 기반 벡터 데이터베이스에 엄청난 부담을 주었습니다.
Qdrant와 일부 다른 오픈소스 도구를 기반으로 구축한 초기 설정은 동작했지만 상당한 운영 오버헤드가 수반되었습니다. 확장에는 몇 시간이 걸릴 수 있는 수동 리샤딩이 필요했고, 노드 간 워크로드 분산은 일관되지 않아 한 머신은 과부하 상태인 반면 다른 머신들은 유휴 상태로 남는 경우가 많았습니다. 기초 AI 인프라를 구축하는 빠르게 움직이는 기업에게 이러한 비효율은 단순한 불편을 넘어, 제품 로드맵과 신뢰할 수 있는 AI 서비스를 출시하는 능력을 직접적으로 저해했습니다.
이로 인해 분명해졌습니다: 이들은 지속적인 운영 개입 없이 빠른 성장과 프로덕션급 RAG 시스템을 지원할 수 있는 훨씬 더 확장 가능하고 탄력적인 벡터 데이터베이스가 필요했습니다.
Zilliz Cloud Vector Database로의 여정
기존 벡터 인프라의 한계가 점점 더 명확해지면서, 팀은 확장 가능하고 신뢰할 수 있는 대안을 평가하기 시작했습니다. 이들의 기준은 자동 샤딩, 손쉬운 수평 확장, 다국어 워크로드를 지원하기 위한 하이브리드 검색 기능, 엔터프라이즈 수준의 신뢰성에 초점을 맞추었습니다. 이들은 3,500차원을 초과하는 벡터에 대해 300 ms 미만의 지연 시간으로 40–50 QPS를 처리해야 하는 프로덕션 요구사항을 기준으로 여러 플랫폼을 테스트했습니다.
Zilliz Cloud는 워크로드를 고르게 분산하고, 수동 리샤딩을 제거하며, 운영 오버헤드 없이 빠른 확장을 지원하는 능력으로 두각을 나타냈습니다. 이 플랫폼의 하이브리드 벡터 및 전문 검색 기능은 정확성과 맥락 이해가 다운스트림 모델 성능에 직접적인 영향을 미치는 다국어 검색 시나리오에서 특히 가치가 있었습니다.
팀은 Zilliz Cloud가 기술적 벤치마크를 충족했을 뿐만 아니라, 수백만 명의 사용자에게 서비스를 제공하는 빠르게 성장하는 RAG 시스템을 지원하는 데 필요한 안정성과 확장성도 제공했다고 언급했습니다. 이는 고품질 다국어 AI 경험 구축에 집중하면서 로드맵을 가속화하는 데 필요한 기반을 제공했습니다.
구현 세부 정보
Zilliz Cloud는 고객의 RAG 인프라의 중추가 되어, 고성능 벡터 검색을 통해 다국어 AI를 구동했습니다. 이들의 시스템은 3,500개가 넘는 차원의 임베딩으로 작동하는데, 이는 일반적인 RAG 구현보다 훨씬 높은 수준입니다. 광범위한 실험 결과, 저차원 벡터는 사용 사례에서 요구되는 언어적 복잡성을 포착하기에 충분하지 않은 것으로 나타났기 때문입니다.
이들의 성능 요구 사항은 까다로웠습니다. 비용 효율성을 유지하면서도 엔드투엔드 지연 시간을 300 ms 미만으로 유지하고 40–50 QPS를 지속적으로 처리해야 했습니다. 오픈 소스 벡터 데이터베이스를 기반으로 한 이전 설정은 이러한 벤치마크를 충족하는 데 어려움을 겪었습니다. 다중 노드 클러스터를 실행했음에도 불구하고, 고르지 않은 데이터 분산으로 인해 대부분의 워크로드를 단일 노드만 처리했고, 이로 인해 상당한 운영 병목 현상과 확장 문제가 발생했습니다.
Zilliz Cloud를 도입하자 개선 효과는 즉각적이었습니다. 데이터 세그먼트가 노드 전반에 자동으로 균형 있게 분산되어, 이전에 엔지니어링 운영을 지연시켰던 2–3시간의 수동 리샤딩 프로세스가 제거되었습니다. 이 플랫폼의 하이브리드 검색 기능은 특히 유용했으며, 의미적 유사성과 키워드 기반 매칭을 결합해 더 정확한 검색을 제공할 수 있게 했습니다.
Zilliz Cloud는 성능, 재현율, 비용 간의 더 나은 균형을 달성하는 데도 도움이 되었습니다. 이전 솔루션은 비용 절감을 위해 공격적인 양자화에 의존했지만, 재현율 저하라는 대가로 검색 결과의 품질이 악화되었습니다. 이는 다국어 애플리케이션에는 받아들일 수 없는 타협이었습니다. Zilliz Cloud의 Cardinal search 엔진은 예산 한도 내에서 필요한 재현율 수준을 회복시켜 주었습니다.
앞으로 팀은 재현율을 희생하지 않으면서 뛰어난 성능과 비용 효율성을 제공하도록 설계된 고급 1비트 양자화 기술인 Zilliz Cloud의 RaBitQ 기능을 도입할 준비를 하고 있습니다. 이를 통해 인프라를 반복적으로 재구성하지 않고도 RAG 워크로드를 한층 더 확장할 수 있는 명확한 경로를 확보하게 되었습니다.
무엇보다도 Zilliz Cloud로의 전환은 엔지니어링 팀을 지속적인 데이터베이스 유지 관리에서 해방시켜, 모델 품질과 시스템 역량을 발전시키는 데 노력을 다시 집중할 수 있게 했습니다.
기술을 넘어선 영향: 진정으로 인도적인 AI 만들기
오늘날 고객의 RAG 기반 시스템은 사용자가 음성 또는 메시징 애플리케이션을 통해 접근할 수 있는 다국어 AI 에이전트를 지원합니다. 이들의 API를 통해 개발자는 각 사용 사례의 필요에 따라 사실 기반 근거 제공을 활성화하거나 비활성화할 수 있으며, 간단한 구성 토글로 속도와 정확성의 균형을 맞출 수 있습니다. 근거 제공이 활성화되면 사용자는 신뢰할 수 있는 지식 출처에 의해 뒷받침되는 응답을 받게 되어, 다양한 주제와 언어 전반에서 신뢰성이 향상됩니다.
이 기능은 현실 세계에 의미 있는 영향을 미칩니다. 다양한 지역의 사람들은 자신이 선호하는 언어로 질문하고 몇 초 안에 정확하고 맥락에 적합한 답변을 받을 수 있습니다. 이는 역사적으로 주류 모델의 충분한 지원을 받지 못했던 커뮤니티가 AI에 접근할 수 있도록 만드는 한 걸음이며, 적절한 벡터 데이터베이스 인프라가 AI 시스템이 대규모로 신뢰할 수 있는 결과를 제공하도록 어떻게 지원할 수 있는지를 보여줍니다.
고객에게 Zilliz Cloud는 이러한 비전의 핵심 구성 요소가 되었습니다. 성능이나 민첩성을 저하하지 않으면서 근거 있고 신뢰할 수 있는 AI 경험을 제공할 수 있도록 돕고 있습니다. 운영 부담을 제거하고 검색 정확도를 향상함으로써 Zilliz Cloud는 그들의 팀이 가장 중요한 것, 즉 사용자들의 언어적·문화적 다양성을 진정으로 반영하는 AI 시스템을 구축하는 데 집중할 수 있도록 했습니다.


