Consensus, Zilliz Cloud로 4억 개 이상의 학술 소스를 아우르는 Agentic 학술 검색을 구축하다

4억+
검색 가능한 학술 자료
~45 ms
프로덕션에서의 P99 덴스 리트리벌 지연 시간
14% 더 높음
시맨틱 검색 추가 후 검색 결과의 정밀도
4× 더 큼
클러스터 크기의 단지 2.5배에 불과한 벡터로, 지연 시간 패널티가 없습니다.
1일 → 1시간
일별 대량 가져오기를 통한 400M+ 벡터 컬렉션 전체 재색인
"우리의 임무는 Consensus를 사용하는 모든 사람이 최고의 연구를 찾을 수 있게 하는 것입니다. Zilliz Cloud는 우리의 리서치 에이전트에 빠르고 고품질의 의미론적 검색 기능을 제공하여, 도달할 수 있는 증거의 범위를 직접적으로 확장합니다."
Christian Salem
Consensus 소개
Consensus는 과학 연구를 위한 운영 체제를 구축하고 있습니다: 12,500개 이상의 대학에서 1,000만 명 이상의 연구자, 학생, 임상의가 논문을 선별하고, 증거를 종합하며, 연구의 지루한 부분을 자동화하여 실제 과학에 집중할 수 있도록 하는 에이전트 플랫폼입니다. Consensus는 현재까지 1억 5천만 개 이상의 연구 질문을 처리했으며, 전 세계 차세대 1억 명의 연구자를 지원하기 위해 4,500만 달러를 모금했습니다.
Consensus插图1.png
플랫폼의 기반은 4억 개 이상의 학술 자료를 아우르는 세계적 수준의 에이전트 기반 검색입니다. Consensus는 AI 모델 자체의 지식으로 답변하지 않습니다. 대신 모든 주장은 실제로 검색된 논문에 근거해야 하며, 연구 에이전트는 단일 질문에 답하기 위해 검색을 여러 번 호출할 수 있습니다. 제품의 품질은 결국 찾아낸 논문의 품질에 달려 있으므로, 검색은 Consensus의 핵심입니다. Zilliz Cloud는 가장 중요한 구성 요소 중 하나를 구동합니다: 연구자가 진정으로 묻는 것을 이해하고 그에 대한 답을 제공하는 연구를 찾아내는 시맨틱 검색입니다.
과제
Consensus의 검색 엔진은 이전에 희소 검색과 BM25 키워드 검색이라는 두 가지 검색 방식을 사용했습니다. 이들은 대부분의 쿼리를 잘 처리했습니다. 그러나 기준은 점점 높아지고 있었습니다. Consensus는 문헌 검토를 에이전트 아키텍처로 전환하고 있었고, 이 구조에서는 하나의 질문이 여러 번의 검색 호출로 이어질 수 있으므로, 검색은 매 호출마다 올바른 논문을 찾아 빠르게 반환해야 했습니다. 키워드 및 희소 검색은 같은 내용을 다른 용어로 표현한 논문을 놓칩니다. 연구자들은 질문에 답하는 논문이 같은 개념에 대해 고유한 용어를 사용하는 인접 분야에서 나오는 경우가 많기 때문에 이러한 문제를 끊임없이 겪습니다. 이러한 격차를 해소하는 데는 밀집 벡터 검색이 핵심이므로, 팀은 먼저 Elasticsearch에서 이를 테스트했고 세 가지 추가 문제에 직면했습니다.
- 수억 개의 벡터에서 검색 품질이 저하되었습니다. 그 많은 밀집 벡터를 저장하려면 팀은 이진 양자화로 압축해야 했고, 그 압축으로 인해 측정 가능한 수준의 랭킹 품질이 희생되었습니다. 연구 제품으로서는 잘못된 트레이드오프입니다.
- 전체 컬렉션의 재인덱싱에 24시간 이상이 걸렸습니다. 새로운 연구는 검색 가능해지기까지 하루 이상 기다려야 했고, 각 후보 임베딩 모델을 프로덕션에서 평가하는 데 하루가 소요되어 팀이 더 나은 모델을 도입하는 속도가 느려졌습니다.
- 벡터를 키우면 저장 비용이 훨씬 더 커졌습니다. 수억 개의 벡터 규모에서는 벡터 크기나 적용 범위가 늘어날 때마다 전체 컬렉션에 비용이 발생하므로, 팀은 원하는 것보다 벡터를 작게 유지할 수밖에 없었습니다.
팀은 의미 검색을 위한 전용 엔진을 찾아 나섰습니다: 높은 랭킹 품질, 빠른 컬렉션 갱신, 대규모에서 실현 가능한 비용, 그리고 직접 관리하지 않아도 되는 관리형 프로덕션 환경을 갖춘 엔진 말입니다.
Zilliz Cloud를 선택한 이유
Consensus는 네 가지 옵션을 대상으로 실제 비교 평가를 진행했습니다: 이미 사용 중이던 Elasticsearch 내 밀집 벡터 검색, 프로토타입을 만든 자체 운영 오픈소스 벡터 라이브러리 FAISS, Pinecone, 그리고 Zilliz Cloud. Zilliz Cloud는 네 가지 측면에서 승리했습니다.
- 벡터를 압축하지 않고 더 나은 결과. 팀의 자체 테스트에서 Zilliz Cloud는 이전에 품질을 희생했던 압축 없이도 수억 규모에서 높은 재현율을 유지하면서 더 정확한 검색 결과를 제공했습니다.
- 전체 컬렉션 재구축이 하루 이상에서 약 1시간으로 단축. 전체 컬렉션을 매일 대량 가져오기하면 전체 재구축이 특별 프로젝트에서 야간 작업으로 바뀝니다. 이는 또한 새로운 임베딩 모델을 테스트할 때 훨씬 빠른 반복을 가능하게 합니다.
- 동일한 트래픽과 벡터 수에 대한 더 낮은 저장 비용. 절감된 비용 덕분에 최대 4배 더 큰 벡터를 최대 4배 더 저렴한 비용으로 사용할 수 있어 관련성이 눈에 띄게 향상되었습니다.
- 팀이 좋아한 개발자 경험을 갖춘 관리형 서비스. Consensus는 FAISS로 프로토타입을 만들어 기술적으로 충분하다는 것을 확인했지만, 프로덕션에서 운영하려면 팀이 감당하고 싶지 않은 오케스트레이션과 운영 오버헤드를 떠안아야 했습니다. 팀은 또한 Zilliz Cloud SDK가 문서화가 잘 되어 있고 개발하기 좋으며, 일상적인 컬렉션 운영을 위한 직관적인 콘솔을 제공한다는 점을 발견했습니다.
해결책
Consensus는 적절한 논문이나 논문의 일부를 검색하고 그로부터 답변을 종합하여 모든 주장을 실제 출판물에 인용함으로써 연구 질문에 답합니다. 이러한 논문을 찾기 위해 세 가지 검색 경로가 병렬로 실행되는데, 팀은 이 아키텍처를 tri-brid 검색이라고 부릅니다. 그리고 Zilliz Cloud가 의미론적 검색 계층을 구동합니다. 즉, 질문을 단어가 아닌 의미로 논문과 매칭하고 다른 경로가 놓친 논문을 찾아냅니다. 이는 나머지 스택과 함께 Google Cloud에서 실행됩니다.
Concensus插图2.png
쿼리 시점에 에이전트는 검색을 계획하고 도구로 검색(retrieval)을 호출합니다. 경로는 동시에 실행되고, 그 결과는 단일 증거 집합으로 융합되어 재순위화되며, 모델은 각 주장을 검색된 논문에 연결하여 답변을 작성합니다. 이것이 문헌 검토 에이전트와 주장에 대한 찬반 증거를 평가하는 Consensus Meter 뒤에 있는 메커니즘입니다.
이를 가능하게 하는 세 가지 설계 선택이 있습니다.
매일 처음부터 재구축되는 Zilliz Cloud의 라이브/콜드 컬렉션 쌍
이 정도 크기의 인덱스를 최신 상태로 유지하는 일반적인 방법은 제자리에서 업데이트하는 것입니다. 즉, 변경된 사항을 감지하고, 새 벡터를 쓰고, 이전 벡터를 삭제하고, 장부를 정확히 유지하는 것입니다. Consensus는 이 모든 과정을 건너뜁니다. 대신 Zilliz Cloud에 컬렉션 사본 두 개, 총 4억 개 이상의 벡터를 유지하며, 하나는 쿼리를 처리하고 다른 하나는 유휴 상태입니다. 그리고 매일 대량 가져오기를 통해 유휴 사본을 처음부터 재구축한 뒤 라이브로 전환합니다.
이 설계는 전체 재구축이 매일 실행할 수 있을 정도로 빠르고, 저장소가 두 번째 사본을 보관할 수 있을 정도로 저렴할 때만 합리적입니다. 이전 시스템에서는 두 조건 모두 충족되지 않았습니다. Zilliz Cloud에서는 둘 다 충족됩니다. 전체 컬렉션을 약 1시간 만에 가져오고 인덱싱하여 사용할 준비를 마치며, 저장 비용도 더 낮습니다. 따라서 더 단순한 설계가 승리합니다. 서빙 컬렉션에는 아무것도 직접 쓰이지 않고, 조정해야 할 백로그도 없으며, 새로운 임베딩 모델은 다른 벡터를 사용한 동일한 재구축일 뿐입니다. 코퍼스는 항상 최신 상태로 유지되어 연구자들이 항상 최신 출판물에 접근할 수 있게 합니다.
"팀이 Zilliz에서 발견한 것은 컬렉션 전체를 사실상 처음부터 다시 수집할 수 있다는 것입니다. 너무 빠르기 때문입니다. 인덱스 사본이 두 개 있고, 전체를 한 시간 안에 수집한 다음 스위치를 전환합니다. 현재는 사실상 매일 할 수 있습니다. 이는 또한 새로운 아이디어를 시도하는 데 주저함이 없기 때문에 실험을 크게 촉진했습니다." — Heath Hohwald, 기술 리더 겸 검색 매니저, Consensus
학술 출처당 하나의 1,024차원 벡터
각 소스는 제목과 초록에서 단일 벡터로 임베딩됩니다. 팀은 비용과 지연 시간이 벡터 크기에 비례해 증가할 것으로 가정하고 256차원으로 시작했습니다. Zilliz Cloud에서 차원을 256에서 1,024로 4배 늘리는 데는 팀이 예상한 4배가 아닌 약 2.5배의 클러스터 크기가 필요했으며, 추가 지연 시간은 거의 없었습니다. 팀의 내부 벤치마크에서 1,024차원 임베딩은 더 작은 모델보다 발견된 논문 품질이 27% 향상되었고, Consensus는 1,024를 출시했습니다.
에이전트가 직접 호출하는 도구로서의 시맨틱 검색
Zilliz Cloud는 단일 검색 단계 뒤에 숨겨져 있는 것이 아니라 문헌 검토 에이전트에게 호출 가능한 도구로 노출됩니다. 에이전트는 질문을 재구성하고 여러 각도에서 검색한 다음, 찾은 내용을 읽은 후 추가 검색을 요청할 수 있으므로 하나의 태스크가 여러 번의 호출을 의미할 수 있습니다. 이와 같은 도구 호출은 모든 호출이 빠르고 정확할 때만 작동합니다. 느리거나 부정확한 검색은 에이전트가 수행하는 추가 호출마다 배가되기 때문입니다. 4억 개 이상의 벡터에서 P99 약 45ms로, 시맨틱 검색은 에이전트에게 도구로 제공할 만큼 빠르고 정확하므로 단일 쿼리로는 놓칠 수 있는 마지막으로 찾기 어려운 논문까지 추적할 수 있습니다.
결과 및 이점
- 저장 비용 최대 4배 절감, 절감된 비용은 더 나은 검색에 투자되었습니다. 동일한 트래픽과 벡터 수에서 저장 비용이 낮아져 팀이 품질 개선에 사용할 여유가 생겼습니다.
- 시맨틱 검색 추가 후 검색 결과 정밀도 14% 향상, Consensus 자체 내부 벤치마크에서 측정되었습니다. 이 개선 효과는 연구자가 사용한 적 없는 단어로 질문에 답하는 논문에서 가장 두드러지며, 기존 스택으로는 놓쳤을 논문입니다.
- 4억 개 이상의 벡터에서 P99 검색 약 45ms, 이는 팀이 Zilliz Cloud에 설정한 P90 목표 150ms의 3분의 1에 해당합니다. 연구 에이전트가 단 한 번의 기회만 갖고 때로는 중요한 결과를 놓치는 대신, 단일 요청 내에서 여러 차례 검색하고 숙고하고 반복할 수 있을 만큼 빠릅니다.
- 벡터 차원 4배 확대(256 → 1,024)는 Zilliz Cloud에서 클러스터 비용이 2.5배만 증가했으며, 이는 선형 확장보다 약 40% 적은 비용이고 지연 시간 패널티도 없습니다. Consensus의 내부 벤치마크에서 더 큰 임베딩은 발견된 논문의 품질을 27% 향상시켰습니다.
- 전체 컬렉션의 전체 재구축: 24시간 이상 → 약 1시간, 일일 대량 임포트 형태로 처리됩니다. Consensus는 이제 서비스 중단 없이 매일 전체 컬렉션을 재구축하고 교체합니다. 새로운 연구는 발행된 날 바로 검색할 수 있습니다.
- 반복 루프가 더 빨라집니다. 더 큰 임베딩, 새로운 모델, 새로운 검색 전략은 효과가 있는지 확인하기 위해 더 이상 하루 종일 걸리는 재구축을 감수할 필요가 없습니다.
향후 계획
Consensus가 나아가는 모든 방향은 Zilliz Cloud에 더 많은 비중을 둡니다. 에이전틱 프레임워크를 통해 시맨틱 검색을 더 광범위하게 노출하면 태스크당 더 많은 검색 호출이 발생하고, 고밀도 컬렉션에 대한 트래픽도 증가합니다. 새로운 임베딩 모델은 1시간 재구축이 가능하게 한 일일 주기로 계속 출시될 것입니다. 현재 애플리케이션 계층에서 처리되는 메타데이터 필터링은 Zilliz Cloud로 이전할 후보입니다.
가장 큰 기회는 전문(full-text) 콘텐츠를 더욱 활용하는 것입니다. Consensus는 출판사 파트너십을 통해 라이선스된 전문 콘텐츠를 보유하고 있으며, 이러한 깊이를 Zilliz의 고밀도 컬렉션에 통합하는 것이 자연스러운 다음 단계입니다. 각 논문의 제목과 초록이 아닌 본문을 인덱싱하면 컬렉션이 몇 배로 늘어나고 연구자들에게 훨씬 더 세밀한 매칭을 제공할 수 있습니다.
"Consensus는 진정으로 어려운 일을 해내고 있습니다. 하나의 태스크에서 동일한 코퍼스에 열두 가지 다른 방식으로 질문할 수 있는 에이전트를 위해, 세계의 과학 문헌을 의미 기반으로 검색 가능하게 만드는 일입니다. 그 뒤에서 검색 기반을 제공하는 Zilliz Cloud를 자랑스럽게 생각하며, 에이전틱 리서치가 확장됨에 따라 함께 구축해 나가는 일에 기대하고 있습니다." — James Luan, Zilliz CTO
Zilliz Cloud로 에이전틱 AI 구축하기
에이전틱 시스템은 검색에 새로운 부담을 줍니다. 하나의 사용자 요청이 여러 번의 시맨틱 검색, 재구성, 증거 수집 과정으로 이어질 수 있습니다. RAG를 확장하든 에이전틱 검색을 구축하든, Zilliz Cloud는 Consensus를 구동하는 동일한 검색 기반을 제공합니다.
Zilliz Cloud로 무료로 시작하거나, 저희 팀과 직접 상담하세요.
"우리가 본 가장 큰 성과 중 하나는 텍스트상으로는 관련성이 없지만 의미상으로는 관련성이 있는 쿼리를 더 잘 처리하게 된 것입니다. 더 길고 대화형 스타일의 쿼리도 크게 개선되었습니다."
Heath Hohwald


