Наш путь к 35K+ звёзд GitHub: реальная история создания Milvus с нуля
Последние несколько лет мы были сосредоточены на одном: создании векторной базы данных, готовой для корпоративного использования в эпоху ИИ. Сложность не в том, чтобы создать какую-то базу данных, а в том, чтобы создать такую, которая масштабируема, проста в использовании и действительно решает реальные проблемы в production.
В июне мы достигли новой вехи: Milvus набрал 35 000 звёзд на GitHub (на момент написания у него уже 35,5K+ звёзд). Мы не собираемся делать вид, что это просто очередное число — для нас это очень много значит.
Каждая звезда представляет разработчика, который нашёл время посмотреть на то, что мы создали, счёл это достаточно полезным, чтобы добавить в закладки, а во многих случаях решил использовать. Некоторые из вас пошли дальше: создавали issues, вносили код, отвечали на вопросы на наших форумах и помогали другим разработчикам, когда они застревали.
Мы хотели воспользоваться моментом, чтобы поделиться нашей историей — настоящей, со всеми её непростыми моментами.
Мы начали создавать Milvus, потому что ничто другое не работало
В 2017 году мы начали с простого вопроса: поскольку AI-приложения только начинали появляться, а объёмы неструктурированных данных стремительно росли, как эффективно хранить и искать векторные эмбеддинги, которые обеспечивают семантическое понимание?
Традиционные базы данных для этого не создавались. Они оптимизированы для строк и столбцов, а не для высокоразмерных векторов. Существующие технологии и инструменты были либо невозможны для применения, либо болезненно медленны для наших задач.
Мы перепробовали всё доступное. Собирали решения на коленке с Elasticsearch. Строили пользовательские индексы поверх MySQL. Даже экспериментировали с FAISS, но он был спроектирован как исследовательская библиотека, а не как производственная инфраструктура баз данных. Ничто не давало полного решения, которое мы представляли для корпоративных AI-нагрузок.
Поэтому мы начали создавать своё. Не потому, что думали, будто это будет легко — базы данных, как известно, чрезвычайно сложно сделать правильно, — а потому, что мы видели, куда движется ИИ, и знали, что для этого ему нужна специально созданная инфраструктура.
К 2018 году мы уже глубоко погрузились в разработку того, что станет Milvus. Термина "векторная база данных" тогда ещё даже не существовало. По сути, мы создавали новую категорию инфраструктурного программного обеспечения, что было одновременно захватывающе и пугающе.
Open-Sourcing Milvus: разработка на виду у всех
В ноябре 2019 года мы решили открыть исходный код Milvus версии 0.10.
Open-sourcing означает выставить все свои недостатки на всеобщее обозрение. Каждый хак, каждый комментарий TODO, каждое архитектурное решение, в котором ты не до конца уверен. Но мы верили: если векторные базы данных должны стать критически важной инфраструктурой для ИИ, они должны быть открытыми и доступными для всех.
Реакция была ошеломляющей. Разработчики не просто использовали Milvus — они улучшали его. Они находили ошибки, которые мы пропустили, предлагали функции, о которых мы не думали, и задавали вопросы, заставлявшие нас глубже переосмысливать наши проектные решения.
В 2020 году мы присоединились к LF AI & Data Foundation. Это было не только ради доверия — это научило нас поддерживать устойчивый open-source-проект. Как выстраивать управление, обеспечивать обратную совместимость и создавать ПО, которое живёт годами, а не месяцами.
К 2021 году мы выпустили Milvus 1.0 и вышли на уровень graduated в LF AI & Data Foundation. В том же году мы выиграли глобальный конкурс BigANN по векторному поиску миллиардного масштаба. Эта победа была приятной, но, что важнее, она подтвердила: мы решаем реальные проблемы правильным способом.
Самое трудное решение: начать заново
Вот здесь всё усложняется. К 2021 году Milvus 1.0 хорошо работал для многих сценариев использования, но корпоративные клиенты постоянно просили об одном и том же: более продуманной cloud-native-архитектуре, более простом горизонтальном масштабировании, большей операционной простоте.
У нас был выбор: продолжать латать существующее решение или перестроить всё с нуля. Мы выбрали перестройку.
Milvus 2.0 по сути был полной переработкой с нуля. Мы внедрили полностью разделённую архитектуру хранения и вычислений с динамической масштабируемостью. Это заняло у нас два года и, честно говоря, было одним из самых напряжённых периодов в истории нашей компании. Мы отказывались от работающей системы, которой пользовались тысячи людей, чтобы создать что-то ещё не доказавшее свою состоятельность.
Но когда мы выпустили Milvus 2.0 в 2022 году, он превратил Milvus из мощной векторной базы данных в готовую к продакшену инфраструктуру, способную масштабироваться под корпоративные нагрузки. В том же году мы также завершили раунд финансирования Series B+ — не для того, чтобы сжигать деньги, а чтобы ещё больше сосредоточиться на качестве продукта и поддержке глобальных клиентов. Мы знали, что этот путь займёт время, но каждый шаг должен был строиться на прочном фундаменте.
Когда всё ускорилось благодаря AI
2023 год стал годом RAG (retrieval-augmented generation). Внезапно семантический поиск превратился из интересной AI-техники в важнейшую инфраструктуру для чат-ботов, систем вопросов и ответов по документам и AI-агентов.
Количество звёзд Milvus на GitHub резко выросло. Запросы в поддержку умножились. Разработчики, которые никогда не слышали о векторных базах данных, внезапно начали задавать сложные вопросы о стратегиях индексирования и оптимизации запросов.
Этот рост был воодушевляющим, но и ошеломляющим. Мы поняли, что нам нужно масштабировать не только нашу технологию, но и весь наш подход к поддержке сообщества. Мы наняли больше девелопер-адвокатов, полностью переписали нашу документацию и начали создавать образовательный контент для разработчиков, впервые сталкивающихся с векторными базами данных.
Мы также запустили Zilliz Cloud — нашу полностью управляемую версию Milvus. Некоторые спрашивали, почему мы «коммерциализируем» наш open-source-проект. Честный ответ заключается в том, что поддерживать инфраструктуру корпоративного уровня дорого и сложно. Zilliz Cloud позволяет нам поддерживать и ускорять разработку Milvus, сохраняя при этом основной проект полностью открытым.
Затем наступил 2024 год. Forrester назвала нас лидером в категории векторных баз данных. Milvus преодолел отметку в 30 000 звёзд на GitHub. И мы поняли: дорога, которую мы прокладывали семь лет, наконец стала магистралью. По мере того как всё больше компаний принимали векторные базы данных в качестве критически важной инфраструктуры, рост нашего бизнеса резко ускорился — подтвердив, что построенный нами фундамент способен масштабироваться как технически, так и коммерчески.
Команда, стоящая за Milvus: Zilliz
Вот интересный факт: многие знают Milvus, но не Zilliz. Нас это вполне устраивает. Zilliz — это команда, стоящая за Milvus: мы создаём его, поддерживаем и сопровождаем.
Больше всего нас волнуют не самые гламурные вещи, которые и отличают классную демонстрацию от готовой к продакшену инфраструктуры: оптимизация производительности, патчи безопасности, документация, которая действительно помогает новичкам, и вдумчивые ответы на issues в GitHub.
Мы создали глобальную команду поддержки 24/7 в США, Европе и Азии, потому что разработчикам нужна помощь в их часовых поясах, а не в наших. У нас есть участники сообщества, которых мы называем "Milvus Ambassadors", которые организуют мероприятия, отвечают на вопросы на форумах и зачастую объясняют концепции лучше, чем мы сами.
Мы также приветствовали интеграции с AWS, GCP и другими облачными провайдерами — даже когда они предлагают собственные управляемые версии Milvus. Больше вариантов развертывания — это хорошо для пользователей. Хотя мы заметили, что, когда команды сталкиваются со сложными техническими вызовами, они часто в итоге обращаются напрямую к нам, потому что мы понимаем систему на самом глубоком уровне.
Многие думают, что open source — это просто «ящик с инструментами», но на самом деле это «эволюционный процесс» — коллективное усилие бесчисленного множества людей, которые любят его и верят в него. Только те, кто действительно понимает архитектуру, могут объяснить «почему», стоящее за исправлениями ошибок, анализом узких мест производительности, интеграцией систем данных и архитектурными изменениями.
Поэтому, если вы используете open-source Milvus или рассматриваете векторные базы данных как ключевой компонент вашей AI-системы, мы рекомендуем обращаться напрямую к нам за самой профессиональной и своевременной поддержкой.
Реальное влияние в продакшене: доверие пользователей
Сценарии использования Milvus выросли далеко за пределы того, что мы изначально представляли. Мы обеспечиваем AI-инфраструктуру для одних из самых требовательных предприятий мира в самых разных отраслях.
Bosch, мировой лидер в области автомобильных технологий и пионер автономного вождения, революционизировала анализ данных с помощью Milvus, добившись сокращения затрат на сбор данных на 80% и ежегодной экономии в размере $1,4 млн, выполняя поиск по миллиардам сценариев вождения за миллисекунды для критически важных пограничных случаев.
Read AI, одна из самых быстрорастущих AI-компаний в сфере продуктивности, обслуживающая миллионы ежемесячно активных пользователей, использует Milvus для достижения задержки извлечения данных менее 20–50 мс по миллиардам записей и 5-кратного ускорения агентного поиска. Их CTO говорит: «Milvus служит центральным репозиторием и обеспечивает наш поиск информации среди миллиардов записей».
Глобальный лидер в сфере финтеха, одна из крупнейших в мире платформ цифровых платежей, обрабатывающая десятки миллиардов транзакций в более чем 200 странах и 25+ валютах, выбрала Milvus за пакетную загрузку в 5–10 раз быстрее, чем у конкурентов, завершая задания менее чем за 1 час, тогда как у других на это уходило 8+ часов.
Filevine, ведущая платформа для юридической работы, которой доверяют тысячи юридических фирм по всей территории США, управляет 3 миллиардами векторов по миллионам юридических документов, экономя юристам 60–80% времени на анализе документов и обеспечивая «истинное осознание данных» для управления судебными делами.
Мы также поддерживаем NVIDIA, OpenAI, Microsoft, Salesforce, Walmart, и многих других почти во всех отраслях. Более 10 000 организаций выбрали Milvus или Zilliz Cloud в качестве своей векторной базы данных.
Это не просто истории технического успеха — это примеры того, как векторные базы данных незаметно становятся критически важной инфраструктурой, которая обеспечивает работу AI-приложений, которыми люди пользуются каждый день.
Почему мы создали Zilliz Cloud: векторная база данных корпоративного уровня как сервис
Milvus — open-source и бесплатен для использования. Но эффективная эксплуатация Milvus в корпоративном масштабе требует глубоких экспертных знаний и значительных ресурсов. Выбор индекса, управление памятью, стратегии масштабирования, конфигурации безопасности — это не тривиальные решения. Многие команды хотят мощь Milvus без операционной сложности и с корпоративной поддержкой, гарантиями SLA и т. д.
Именно поэтому мы создали Zilliz Cloud — полностью управляемую версию Milvus, развернутую в 25 глобальных регионах и 5 крупнейших облаках, включая AWS, GCP и Azure, разработанную специально для AI-нагрузок корпоративного масштаба, которым требуются производительность, безопасность и надежность.
Вот что отличает Zilliz Cloud:
Огромный масштаб и высокая производительность: Наш проприетарный AI-powered AutoIndex engine обеспечивает скорость запросов в 3–5 раз выше, чем open-source Milvus, без необходимости настройки индексов. Cloud-native архитектура поддерживает миллиарды векторов и десятки тысяч одновременных запросов, сохраняя время отклика менее секунды.
Встроенная безопасность и соответствие требованиям: Шифрование данных при хранении и передаче, детализированный RBAC, комплексное ведение журналов аудита, интеграция SAML/OAuth2.0 и развертывания BYOC (bring your own cloud). Мы соответствуем GDPR, HIPAA и другим глобальным стандартам, которые действительно нужны предприятиям.
Оптимизировано для экономической эффективности: Многоуровневое хранение «горячих»/«холодных» данных, эластичное масштабирование, реагирующее на реальные рабочие нагрузки, и модель оплаты pay-as-you-go могут снизить совокупную стоимость владения на 50% или более по сравнению с самостоятельными развертываниями.
По-настоящему независимая от облака без привязки к поставщику: Развертывайте в AWS, Azure, GCP, Alibaba Cloud или Tencent Cloud без привязки к поставщику. Мы обеспечиваем глобальную согласованность и масштабируемость независимо от того, где вы запускаете систему.
Эти возможности могут звучать не слишком эффектно, но они решают реальные повседневные проблемы, с которыми сталкиваются корпоративные команды при создании AI-приложений в масштабе. И самое главное: под капотом это всё еще Milvus, поэтому нет проприетарной привязки или проблем совместимости.
Что дальше: Vector Data Lake
Мы ввели термин "vector database" и первыми создали такую базу, но мы не останавливаемся на этом. Сейчас мы создаем следующую эволюцию: Vector Data Lake.
Вот проблему, которую мы решаем: не каждому векторному поиску нужна миллисекундная задержка. У многих предприятий есть массивные наборы данных, к которым обращаются лишь время от времени, включая анализ исторических документов, пакетные вычисления сходства и долгосрочный анализ трендов. Для таких сценариев традиционная векторная база данных реального времени является одновременно избыточной и дорогой.
Vector Data Lake использует архитектуру с разделением хранения и вычислений, специально оптимизированную для векторов огромного масштаба, к которым обращаются редко, при этом сохраняя затраты значительно ниже, чем у систем реального времени.
Ключевые возможности включают:
Единый стек данных: Бесшовно соединяет онлайн- и офлайн-слои данных с согласованными форматами и эффективным хранением, чтобы вы могли перемещать данные между «горячими» и «холодными» уровнями без переформатирования или сложных миграций.
Совместимая вычислительная экосистема: Нативно работает с такими фреймворками, как Spark и Ray, поддерживая всё — от векторного поиска до традиционных ETL и аналитики. Это означает, что ваши существующие команды по данным могут работать с векторными данными, используя инструменты, которые они уже знают.
Архитектура, оптимизированная по стоимости: «Горячие» данные остаются на SSD или NVMe для быстрого доступа; «холодные» данные автоматически перемещаются в объектное хранилище, такое как S3. Умные стратегии индексирования и хранения поддерживают быстрый I/O, когда это нужно, делая при этом расходы на хранение предсказуемыми и доступными.
Речь не о замене векторных баз данных — речь о том, чтобы дать предприятиям правильный инструмент для каждой рабочей нагрузки. Поиск в реальном времени для пользовательских приложений, экономичные озера векторных данных для аналитики и исторической обработки.
Мы по-прежнему верим в логику, лежащую в основе закона Мура и парадокса Джевонса: по мере снижения удельной стоимости вычислений масштабируется внедрение. То же самое относится и к векторной инфраструктуре.
Улучшая индексы, структуры хранения, кэширование и модели развертывания — изо дня в день — мы надеемся сделать AI-инфраструктуру более доступной и экономичной для всех, а также помочь перенести неструктурированные данные в AI-native будущее.
Большое спасибо всем вам!
Эти 35K+ звезд представляют собой то, чем мы искренне гордимся: сообщество разработчиков, которые считают Milvus достаточно полезным, чтобы рекомендовать его и вносить в него вклад.
Но мы еще не закончили. В Milvus есть ошибки, которые нужно исправить, улучшения производительности, которые нужно реализовать, и функции, о которых просит наше сообщество. Наша дорожная карта публична, и мы искренне хотим узнать ваше мнение о том, чему отдать приоритет.
Важно не само число — важно доверие, которое представляют эти звезды. Доверие к тому, что мы продолжим строить открыто, прислушиваться к обратной связи и делать Milvus лучше.
Нашим контрибьюторам: ваши PR, сообщения об ошибках и улучшения документации каждый день делают Milvus лучше. Огромное спасибо.
Нашим пользователям: спасибо за то, что доверяете нам свои производственные рабочие нагрузки, и за обратную связь, которая помогает нам оставаться честными.
Нашему сообществу: спасибо за то, что отвечаете на вопросы, организуете мероприятия и помогаете новичкам сделать первые шаги.
Если вы новичок в векторных базах данных, мы будем рады помочь вам начать. Если вы уже используете Milvus или Zilliz Cloud, мы будем рады узнать о вашем опыте. А если вам просто любопытно, что мы создаем, наши каналы сообщества всегда открыты.
Давайте продолжать вместе создавать инфраструктуру, которая делает приложения ИИ возможными.
Найдите нас здесь: Milvus on GitHub | Zilliz Cloud | Discord | LinkedIn | X | YouTube
Читать далее

How to Improve Retrieval Quality for Japanese Text with Sudachi, Milvus/Zilliz, and AWS Bedrock
Learn how Sudachi normalization and Milvus/Zilliz hybrid search improve Japanese RAG accuracy with BM25 + vector fusion, AWS Bedrock embeddings, and practical code examples.

Context Engineering Strategies for AI Agents: A Developer’s Guide
Learn practical context engineering strategies for AI agents. Explore frameworks, tools, and techniques to improve reliability, efficiency, and cost.

Vector Databases vs. Object-Relational Databases
Use a vector database for AI-powered similarity search; use an object-relational database for complex data modeling with both relational integrity and object-oriented features.



