Наш путь к 35K+ звёзд GitHub: реальная история создания Milvus с нуля
Последние несколько лет мы были сосредоточены на одном: создании векторной базы данных, готовой для корпоративного использования в эпоху ИИ. Сложность не в том, чтобы создать какую-то базу данных, а в том, чтобы создать такую, которая масштабируема, проста в использовании и действительно решает реальные проблемы в production.
В июне мы достигли новой вехи: Milvus набрал 35 000 звёзд на GitHub (на момент написания у него уже 35,5K+ звёзд). Мы не собираемся делать вид, что это просто очередное число — для нас это очень много значит.
Каждая звезда представляет разработчика, который нашёл время посмотреть на то, что мы создали, счёл это достаточно полезным, чтобы добавить в закладки, а во многих случаях решил использовать. Некоторые из вас пошли дальше: создавали issues, вносили код, отвечали на вопросы на наших форумах и помогали другим разработчикам, когда они застревали.
Мы хотели воспользоваться моментом, чтобы поделиться нашей историей — настоящей, со всеми её непростыми моментами.
Мы начали создавать Milvus, потому что ничто другое не работало
В 2017 году мы начали с простого вопроса: поскольку AI-приложения только начинали появляться, а объёмы неструктурированных данных стремительно росли, как эффективно хранить и искать векторные эмбеддинги, которые обеспечивают семантическое понимание?
Традиционные базы данных для этого не создавались. Они оптимизированы для строк и столбцов, а не для высокоразмерных векторов. Существующие технологии и инструменты были либо невозможны для применения, либо болезненно медленны для наших задач.
Мы перепробовали всё доступное. Собирали решения на коленке с Elasticsearch. Строили пользовательские индексы поверх MySQL. Даже экспериментировали с FAISS, но он был спроектирован как исследовательская библиотека, а не как производственная инфраструктура баз данных. Ничто не давало полного решения, которое мы представляли для корпоративных AI-нагрузок.
Поэтому мы начали создавать своё. Не потому, что думали, будто это будет легко — базы данных, как известно, чрезвычайно сложно сделать правильно, — а потому, что мы видели, куда движется ИИ, и знали, что для этого ему нужна специально созданная инфраструктура.
К 2018 году мы уже глубоко погрузились в разработку того, что станет Milvus. Термина "векторная база данных" тогда ещё даже не существовало. По сути, мы создавали новую категорию инфраструктурного программного обеспечения, что было одновременно захватывающе и пугающе.
Open-Sourcing Milvus: разработка на виду у всех
В ноябре 2019 года мы решили открыть исходный код Milvus версии 0.10.
Open-sourcing означает выставить все свои недостатки на всеобщее обозрение. Каждый хак, каждый комментарий TODO, каждое архитектурное решение, в котором ты не до конца уверен. Но мы верили: если векторные базы данных должны стать критически важной инфраструктурой для ИИ, они должны быть открытыми и доступными для всех.
Реакция была ошеломляющей. Разработчики не просто использовали Milvus — они улучшали его. Они находили ошибки, которые мы пропустили, предлагали функции, о которых мы не думали, и задавали вопросы, заставлявшие нас глубже переосмысливать наши проектные решения.
В 2020 году мы присоединились к LF AI & Data Foundation. Это было не только ради доверия — это научило нас поддерживать устойчивый open-source-проект. Как выстраивать управление, обеспечивать обратную совместимость и создавать ПО, которое живёт годами, а не месяцами.
К 2021 году мы выпустили Milvus 1.0 и вышли на уровень graduated в LF AI & Data Foundation. В том же году мы выиграли глобальный конкурс BigANN по векторному поиску миллиардного масштаба. Эта победа была приятной, но, что важнее, она подтвердила: мы решаем реальные проблемы правильным способом.
Самое трудное решение: начать заново
Вот здесь всё усложняется. К 2021 году Milvus 1.0 хорошо работал для многих сценариев использования, но корпоративные клиенты постоянно просили об одном и том же: более продуманной cloud-native-архитектуре, более простом горизонтальном масштабировании, большей операционной простоте.
У нас был выбор: продолжать латать существующее решение или перестроить всё с нуля. Мы выбрали перестройку.
Milvus 2.0 по сути был полной переработкой с нуля. Мы внедрили полностью разделённую архитектуру хранения и вычислений с динамической масштабируемостью. Это заняло у нас два года и, честно говоря, было одним из самых напряжённых периодов в истории нашей компании. Мы отказывались от работающей системы, которой пользовались тысячи людей, чтобы создать что-то ещё не доказавшее свою состоятельность.
Но когда мы выпустили Milvus 2.0 в 2022 году, он превратил Milvus из мощной векторной базы данных в готовую к продакшену инфраструктуру, способную масштабироваться под корпоративные нагрузки. В том же году мы также завершили раунд финансирования Series B+ — не для того, чтобы сжигать деньги, а чтобы ещё больше сосредоточиться на качестве продукта и поддержке глобальных клиентов. Мы знали, что этот путь займёт время, но каждый шаг должен был строиться на прочном фундаменте.
Когда всё ускорилось благодаря AI
2023 год стал годом RAG (retrieval-augmented generation). Внезапно семантический поиск превратился из интересной AI-техники в важнейшую инфраструктуру для чат-ботов, систем вопросов и ответов по документам и AI-агентов.
Количество звёзд Milvus на GitHub резко выросло. Запросы в поддержку умножились. Разработчики, которые никогда не слышали о векторных базах данных, внезапно начали задавать сложные вопросы о стратегиях индексирования и оптимизации запросов.
Этот рост был воодушевляющим, но и ошеломляющим. Мы поняли, что нам нужно масштабировать не только нашу технологию, но и весь наш подход к поддержке сообщества. Мы наняли больше девелопер-адвокатов, полностью переписали нашу документацию и начали создавать образовательный контент для разработчиков, впервые сталкивающихся с векторными базами данных.
Мы также запустили Zilliz Cloud — нашу полностью управляемую версию Milvus. Некоторые спрашивали, почему мы «коммерциализируем» наш open-source-проект. Честный ответ заключается в том, что поддерживать инфраструктуру корпоративного уровня дорого и сложно. Zilliz Cloud позволяет нам поддерживать и ускорять разработку Milvus, сохраняя при этом основной проект полностью открытым.
Затем наступил 2024 год. Forrester назвала нас лидером в категории векторных баз данных. Milvus преодолел отметку в 30 000 звёзд на GitHub. И мы поняли: дорога, которую мы прокладывали семь лет, наконец стала магистралью. По мере того как всё больше компаний принимали векторные базы данных в качестве критически важной инфраструктуры, рост нашего бизнеса резко ускорился — подтвердив, что построенный нами фундамент способен масштабироваться как технически, так и коммерчески.
Команда, стоящая за Milvus: Zilliz
Вот интересный факт: многие знают Milvus, но не Zilliz. Нас это вполне устраивает. Zilliz — это команда, стоящая за Milvus: мы создаём его, поддерживаем и сопровождаем.
Больше всего нас волнуют не самые гламурные вещи, которые и отличают классную демонстрацию от готовой к продакшену инфраструктуры: оптимизация производительности, патчи безопасности, документация, которая действительно помогает новичкам, и вдумчивые ответы на issues в GitHub.
Мы создали глобальную команду поддержки 24/7 в США, Европе и Азии, потому что разработчикам нужна помощь в их часовых поясах, а не в наших. У нас есть участники сообщества, которых мы называем "Milvus Ambassadors", которые организуют мероприятия, отвечают на вопросы на форумах и зачастую объясняют концепции лучше, чем мы сами.
Мы также приветствовали интеграции с AWS, GCP и другими облачными провайдерами — даже когда они предлагают собственные управляемые версии Milvus. Больше вариантов развертывания — это хорошо для пользователей. Хотя мы заметили, что, когда команды сталкиваются со сложными техническими вызовами, они часто в итоге обращаются напрямую к нам, потому что мы понимаем систему на самом глубоком уровне.
Многие думают, что open source — это просто «ящик с инструментами», но на самом деле это «эволюционный процесс» — коллективное усилие бесчисленного множества людей, которые любят его и верят в него. Только те, кто действительно понимает архитектуру, могут объяснить «почему», стоящее за исправлениями ошибок, анализом узких мест производительности, интеграцией систем данных и архитектурными изменениями.
Поэтому, если вы используете open-source Milvus или рассматриваете векторные базы данных как ключевой компонент вашей AI-системы, мы рекомендуем обращаться напрямую к нам за самой профессиональной и своевременной поддержкой.
Реальное влияние в продакшене: доверие пользователей
Сценарии использования Milvus выросли далеко за пределы того, что мы изначально представляли. Мы обеспечиваем AI-инфраструктуру для одних из самых требовательных предприятий мира в самых разных отраслях.
Bosch, мировой лидер в области автомобильных технологий и пионер автономного вождения, революционизировала анализ данных с помощью Milvus, добившись сокращения затрат на сбор данных на 80% и ежегодной экономии в размере $1,4 млн, выполняя поиск по миллиардам сценариев вождения за миллисекунды для критически важных пограничных случаев.
Read AI, одна из самых быстрорастущих AI-компаний в сфере продуктивности, обслуживающая миллионы ежемесячно активных пользователей, использует Milvus для достижения задержки извлечения данных менее 20–50 мс по миллиардам записей и 5-кратного ускорения агентного поиска. Их CTO говорит: «Milvus служит центральным репозиторием и обеспечивает наш поиск информации среди миллиардов записей».
Глобальный лидер в сфере финтеха, одна из крупнейших в мире платформ цифровых платежей, обрабатывающая десятки миллиардов транзакций в более чем 200 странах и 25+ валютах, выбрала Milvus за пакетную загрузку в 5–10 раз быстрее, чем у конкурентов, завершая задания менее чем за 1 час, тогда как у других на это уходило 8+ часов.
Filevine, ведущая платформа для юридической работы, которой доверяют тысячи юридических фирм по всей территории США, управляет 3 миллиардами векторов по миллионам юридических документов, экономя юристам 60–80% времени на анализе документов и обеспечивая «истинное осознание данных» для управления судебными делами.
Мы также поддерживаем NVIDIA, OpenAI, Microsoft, Salesforce, Walmart, и многих других почти во всех отраслях. Более 10 000 организаций выбрали Milvus или Zilliz Cloud в качестве своей векторной базы данных.
Это не просто истории технического успеха — это примеры того, как векторные базы данных незаметно становятся критически важной инфраструктурой, которая обеспечивает работу AI-приложений, которыми люди пользуются каждый день.
Почему мы создали Zilliz Cloud: векторная база данных корпоративного уровня как сервис
Milvus — open-source и бесплатен для использования. Но эффективная эксплуатация Milvus в корпоративном масштабе требует глубоких экспертных знаний и значительных ресурсов. Выбор индекса, управление памятью, стратегии масштабирования, конфигурации безопасности — это не тривиальные решения. Многие команды хотят мощь Milvus без операционной сложности и с корпоративной поддержкой, гарантиями SLA и т. д.
Именно поэтому мы создали Zilliz Cloud — полностью управляемую версию Milvus, развернутую в 25 глобальных регионах и 5 крупнейших облаках, включая AWS, GCP и Azure, разработанную специально для AI-нагрузок корпоративного масштаба, которым требуются производительность, безопасность и надежность.
Вот что отличает Zilliz Cloud:
Огромный масштаб и высокая производительность: Наш проприетарный AI-powered AutoIndex engine обеспечивает скорость запросов в 3–5 раз выше, чем open-source Milvus, без необходимости настройки индексов. Cloud-native архитектура поддерживает миллиарды векторов и десятки тысяч одновременных запросов, сохраняя время отклика менее секунды.
Встроенная безопасность и соответствие требованиям: Шифрование данных при хранении и передаче, детализированный RBAC, комплексное ведение журналов аудита, интеграция SAML/OAuth2.0 и развертывания BYOC (bring your own cloud). Мы соответствуем GDPR, HIPAA и другим глобальным стандартам, которые действительно нужны предприятиям.
Оптимизировано для экономической эффективности: Многоуровневое хранение «горячих»/«холодных» данных, эластичное масштабирование, реагирующее на реальные рабочие нагрузки, и модель оплаты pay-as-you-go могут снизить совокупную стоимость владения на 50% или более по сравнению с самостоятельными развертываниями.
По-настоящему независимая от облака без привязки к поставщику: Развертывайте в AWS, Azure, GCP, Alibaba Cloud или Tencent Cloud без привязки к поставщику. Мы обеспечиваем глобальную согласованность и масштабируемость независимо от того, где вы запускаете систему.
Эти возможности могут звучать не слишком эффектно, но они решают реальные повседневные проблемы, с которыми сталкиваются корпоративные команды при создании AI-приложений в масштабе. И самое главное: под капотом это всё еще Milvus, поэтому нет проприетарной привязки или проблем совместимости.
Что дальше: Vector Data Lake
Мы ввели термин "vector database" и первыми создали такую базу, но мы не останавливаемся на этом. Сейчас мы создаем следующую эволюцию: Vector Data Lake.
Вот проблему, которую мы решаем: не каждому векторному поиску нужна миллисекундная задержка. У многих предприятий есть массивные наборы данных, к которым обращаются лишь время от времени, включая анализ исторических документов, пакетные вычисления сходства и долгосрочный анализ трендов. Для таких сценариев традиционная векторная база данных реального времени является одновременно избыточной и дорогой.
Vector Data Lake использует архитектуру с разделением хранения и вычислений, специально оптимизированную для векторов огромного масштаба, к которым обращаются редко, при этом сохраняя затраты значительно ниже, чем у систем реального времени.
Ключевые возможности включают:
Единый стек данных: Бесшовно соединяет онлайн- и офлайн-слои данных с согласованными форматами и эффективным хранением, чтобы вы могли перемещать данные между «горячими» и «холодными» уровнями без переформатирования или сложных миграций.
Совместимая вычислительная экосистема: Нативно работает с такими фреймворками, как Spark и Ray, поддерживая всё — от векторного поиска до традиционных ETL и аналитики. Это означает, что ваши существующие команды по данным могут работать с векторными данными, используя инструменты, которые они уже знают.
Архитектура, оптимизированная по стоимости: «Горячие» данные остаются на SSD или NVMe для быстрого доступа; «холодные» данные автоматически перемещаются в объектное хранилище, такое как S3. Умные стратегии индексирования и хранения поддерживают быстрый I/O, когда это нужно, делая при этом расходы на хранение предсказуемыми и доступными.
Речь не о замене векторных баз данных — речь о том, чтобы дать предприятиям правильный инструмент для каждой рабочей нагрузки. Поиск в реальном времени для пользовательских приложений, экономичные озера векторных данных для аналитики и исторической обработки.
Мы по-прежнему верим в логику, лежащую в основе закона Мура и парадокса Джевонса: по мере снижения удельной стоимости вычислений масштабируется внедрение. То же самое относится и к векторной инфраструктуре.
Улучшая индексы, структуры хранения, кэширование и модели развертывания — изо дня в день — мы надеемся сделать AI-инфраструктуру более доступной и экономичной для всех, а также помочь перенести неструктурированные данные в AI-native будущее.
Большое спасибо всем вам!
Эти 35K+ звезд представляют собой то, чем мы искренне гордимся: сообщество разработчиков, которые считают Milvus достаточно полезным, чтобы рекомендовать его и вносить в него вклад.
Но мы еще не закончили. В Milvus есть ошибки, которые нужно исправить, улучшения производительности, которые нужно реализовать, и функции, о которых просит наше сообщество. Наша дорожная карта публична, и мы искренне хотим узнать ваше мнение о том, чему отдать приоритет.
Важно не само число — важно доверие, которое представляют эти звезды. Доверие к тому, что мы продолжим строить открыто, прислушиваться к обратной связи и делать Milvus лучше.
Нашим контрибьюторам: ваши PR, сообщения об ошибках и улучшения документации каждый день делают Milvus лучше. Огромное спасибо.
Нашим пользователям: спасибо за то, что доверяете нам свои производственные рабочие нагрузки, и за обратную связь, которая помогает нам оставаться честными.
Нашему сообществу: спасибо за то, что отвечаете на вопросы, организуете мероприятия и помогаете новичкам сделать первые шаги.
Если вы новичок в векторных базах данных, мы будем рады помочь вам начать. Если вы уже используете Milvus или Zilliz Cloud, мы будем рады узнать о вашем опыте. А если вам просто любопытно, что мы создаем, наши каналы сообщества всегда открыты.
Давайте продолжать вместе создавать инфраструктуру, которая делает приложения ИИ возможными.
Найдите нас здесь: Milvus on GitHub | Zilliz Cloud | Discord | LinkedIn | X | YouTube
Читать далее

How Zilliz Saw the Future of Vector Databases—and Built for Production
An inside look at how Zilliz built vector databases for real-world use, focusing on scalability, stability, and running them reliably at scale.

Zilliz Cloud Update: Smarter Autoscaling for Cost Savings, Stronger Compliance with Audit Logs, and More
What's new in Zilliz Cloud? Smarter autoscaling with scale-down, audit logs GA, enhanced SSO, and Milvus 2.6 in Private Preview.

Cosmos World Foundation Model Platform for Physical AI
NVIDIA's Cosmos platform enables safe, digital twin training of GenAI models for physical applications, overcoming data scarcity and safety challenges.



