Инфраструктура за миллиардом голосов: как ведущий поставщик LLM и Zilliz обеспечивают многоязычное будущее ИИ в Индии

<300 мс
Сквозная задержка при 40–50 QPS на десятках миллионов векторов.
3 500+ измерений
Десятки миллионов многомерных векторов, эффективно обслуживаемых для многоязычного семантического поиска.
Автоматическое решардирование
Непрерывная перебалансировка данных и нагрузки между узлами по мере масштабирования системы.
Сбалансированные компромиссы
Хорошо сбалансированный результат с точки зрения производительности, полноты и стоимости.
О компании
Клиент — ведущая компания в Индии в области генеративного ИИ, специализирующаяся на создании многоязычных языковых технологий, поддерживающих богатое лингвистическое разнообразие страны. Их платформа охватывает большие языковые модели, распознавание речи, синтез речи, перевод и удобные для разработчиков API, которые обеспечивают работу разговорных агентов и приложений, ориентированных прежде всего на голосовое взаимодействие, как в государственном, так и в частном секторах. Объединяя локально обученные модели с поиском, основанным на надежных источниках знаний, они создают ИИ-системы, способные выдавать точные, культурно согласованные ответы в национальном масштабе.
По мере развития их многоязычной RAG-системы команда столкнулась с растущими инфраструктурными узкими местами — от высокоразмерных эмбеддингов и неравномерного распределения рабочей нагрузки до увеличения операционных издержек. Zilliz Cloud решил эти проблемы благодаря автоматическому масштабированию, гибридному поиску и высокопроизводительному извлечению данных, что устранило необходимость ручного обслуживания и восстановило точность, необходимую для крупномасштабного многоязычного ИИ. Сегодня это партнерство служит критически важной основой миссии компании по предоставлению пользователям по всей стране обоснованного и надежного ИИ-опыта.
Задача обеспечения истинности в масштабе
Создание ИИ для лингвистически разнообразного населения порождает сложности, для решения которых большинство больших языковых моделей не предназначены. Хотя многие модели хорошо работают на английском и нескольких языках с большим объемом ресурсов, они часто испытывают трудности с языками, менее представленными в глобальных обучающих наборах данных. Это несоответствие может приводить к галлюцинациям, неверным интерпретациям и непоследовательным ответам — проблемам, которые напрямую влияют на доверие пользователей, особенно когда люди ожидают точных, обоснованных ответов на своем местном языке.
Чтобы решить эту задачу, клиент разработал RAG-систему на основе Wikipedia, которая обогащает их модели фактическим контекстом в реальном времени. Вместо того чтобы полагаться исключительно на веса модели, каждый запрос извлекает наиболее релевантную информацию из тщательно отобранной базы знаний перед генерацией ответа. Это значительно снижает количество галлюцинаций и повышает фактическую точность, особенно для культурно специфичных или регионально нюансированных вопросов.
Однако масштабирование этой системы быстро выявило более глубокие инфраструктурные проблемы. Команде нужно было обработать весь корпус Wikipedia, преобразовав миллионы статей в высокоразмерные векторы — в общей сложности десятки миллионов, каждый с тысячами измерений, — поиск по которым должен был выполняться значительно быстрее чем за 300 миллисекунд. Объем, размерность и требования к задержке в реальном времени создавали огромную нагрузку на лежащую в основе векторную базу данных.
Их первоначальная конфигурация, построенная на Qdrant и некоторых других инструментах с открытым исходным кодом, работала, но сопровождалась значительными операционными издержками. Масштабирование требовало ручного решардинга, который мог занимать часы, а распределение рабочей нагрузки между узлами было непоследовательным — часто одна машина оказывалась перегруженной, тогда как другие простаивали. Для быстроразвивающейся компании, создающей фундаментальную ИИ-инфраструктуру, эти неэффективности были больше чем неудобством; они напрямую замедляли продуктовую дорожную карту и способность выпускать надежные ИИ-сервисы.
Стало ясно: им нужна гораздо более масштабируемая и отказоустойчивая векторная база данных, способная поддерживать быстрый рост и RAG-системы промышленного уровня без постоянного операционного вмешательства.
Путь к векторной базе данных Zilliz Cloud
По мере того как ограничения их существующей векторной инфраструктуры становились все более очевидными, команда начала оценивать масштабируемые и надежные альтернативы. Их критерии были сосредоточены на автоматическом шардинге, простом горизонтальном масштабировании, возможностях гибридного поиска для поддержки многоязычных рабочих нагрузок и надежности корпоративного уровня. Они протестировали несколько платформ на соответствие своим производственным требованиям, включая 40–50 QPS с задержкой менее 300 мс для векторов размерностью более 3 500.
Zilliz Cloud выделялась своей способностью равномерно распределять рабочие нагрузки, устранять необходимость в ручном решардинге и поддерживать быстрое масштабирование без операционных накладных расходов. Возможности платформы по гибридному векторному и полнотекстовому поиску были особенно ценны для их сценариев многоязычного поиска, где точность и понимание контекста напрямую влияют на производительность последующих моделей.
Команда отметила, что Zilliz Cloud не только соответствовала их техническим контрольным показателям, но и обеспечивала надежность и масштабируемость, необходимые для поддержки быстрорастущей RAG-системы, обслуживающей миллионы пользователей. Она предоставила основу, необходимую им для ускорения дорожной карты, сохраняя при этом фокус на создании высококачественных многоязычных AI-возможностей.
Детали реализации
Zilliz Cloud стала основой RAG-инфраструктуры заказчика, обеспечивая работу многоязычного AI за счет высокопроизводительного векторного поиска. Их система работает с эмбеддингами размерностью более 3 500 измерений — значительно выше, чем в типичных реализациях RAG, — после обширных экспериментов, показавших, что векторы меньшей размерности недостаточны для охвата лингвистической сложности, необходимой в их сценариях использования.
Их требования к производительности были высокими: поддерживать 40–50 QPS со сквозной задержкой менее 300 мс, одновременно сохраняя экономическую эффективность. Предыдущая конфигурация, основанная на open-source векторной базе данных, с трудом соответствовала этим контрольным показателям. Несмотря на работу многоузлового кластера, только один узел обрабатывал большую часть нагрузки из-за неравномерного распределения данных, что создавало значительные операционные узкие места и проблемы масштабирования.
С Zilliz Cloud улучшение было немедленным. Сегменты данных автоматически балансируются между узлами, устраняя ручной процесс решардинга длительностью 2–3 часа, который ранее замедлял инженерные операции. Возможности платформы по гибридному поиску оказались особенно полезными, позволяя объединять семантическое сходство с сопоставлением на основе ключевых слов для более точного поиска.
Zilliz Cloud также помогла им достичь лучшего баланса между производительностью, полнотой и стоимостью. Их более раннее решение полагалось на агрессивную квантизацию для снижения затрат, но компромисс в полноте ухудшал качество результатов поиска — неприемлемая уступка для их многоязычных приложений. Поисковый движок Cardinal search от Zilliz Cloud восстановил необходимые им уровни полноты, оставаясь в рамках бюджетных ограничений.
Заглядывая вперед, команда готовится внедрить функцию RaBitQ от Zilliz Cloud — передовую технологию 1-битной квантизации, разработанную для обеспечения превосходной производительности и экономической эффективности без ущерба для полноты. Это дает им четкий путь к дальнейшему масштабированию RAG-нагрузок без необходимости снова и снова перестраивать инфраструктуру.
Самое важное, что переход на Zilliz Cloud освободил их инженерную команду от постоянного обслуживания базы данных, позволив перенаправить усилия на улучшение качества моделей и возможностей системы.
Влияние за пределами технологий: сделать AI по-настоящему индийским
Сегодня RAG-система заказчика поддерживает многоязычных AI-агентов, к которым пользователи могут обращаться через голосовые или мессенджер-приложения. Их API позволяет разработчикам включать или отключать фактологическое обоснование в зависимости от потребностей каждого сценария использования — балансируя скорость и точность с помощью простого переключателя конфигурации. Когда обоснование включено, пользователи получают ответы, подкрепленные надежным источником знаний, что повышает надежность по широкому кругу тем и языков.
Эта возможность имеет значимое влияние в реальном мире. Люди в разных регионах могут задавать вопросы на предпочитаемом ими языке и получать точные, контекстуально уместные ответы за считанные секунды. Это представляет собой шаг к тому, чтобы сделать ИИ доступным для сообществ, которые исторически недостаточно обслуживались основными моделями, и показывает, как правильная инфраструктура векторной базы данных может дать ИИ-системам возможность предоставлять надежные результаты в масштабе.
Для клиента Zilliz Cloud стал ключевым компонентом этого видения, помогая им предоставлять обоснованный и надежный опыт взаимодействия с ИИ без компромиссов в производительности или гибкости. Устранив операционные нагрузки и повысив точность поиска, Zilliz Cloud позволил их команде сосредоточиться на самом важном: создании ИИ-систем, которые действительно отражают языковое и культурное разнообразие их пользователей.


