Более умное автомасштабирование в Zilliz Cloud: всегда оптимизировано для каждой рабочей нагрузки
Рабочие нагрузки ИИ не следуют плавным, предсказуемым кривым. В один момент ваша векторная база данных спокойно обслуживает запросы; в следующий — вирусная кампания, новая загрузка данных или обычный всплеск входов в 9 утра выводит использование в красную зону. Команды вынуждены выбирать между избыточным выделением ресурсов и растратой бюджета либо недостаточным выделением ресурсов и риском узких мест.
С последним обновлением Zilliz Cloud представляет более умное автомасштабирование — полностью автоматизированную, более оптимизированную, эластичную систему управления ресурсами. Она мгновенно масштабируется вверх для поддержания производительности и автоматически масштабируется вниз для сокращения потерь, устраняя догадки и поддерживая вашу базу данных в нужном размере при любой рабочей нагрузке.
Что нового в автомасштабировании и как это работает?
Zilliz Cloud уже давно поддерживает автоматическое масштабирование вверх, обеспечивая производительность во время внезапных всплесков трафика. Теперь, с этим релизом, масштабирование вниз тоже автоматическое — замыкая цикл оптимизации затрат. Вместо настройки пороговых значений или угадывания, когда нужно внести изменения, вы просто задаете минимальный и максимальный диапазон CU, а Zilliz Cloud непрерывно оптимизирует емкость в реальном времени. Это означает:
Более низкие затраты – ресурсы автоматически сокращаются, когда спрос падает.
Стабильная производительность – ресурсы мгновенно расширяются, когда спрос резко возрастает.
Более простые операции – больше никакого ручного управления порогами или постоянной перенастройки.
Под капотом автомасштабирование работает на основе двух взаимодополняющих режимов, охватывающих весь спектр реальных шаблонов рабочих нагрузок:
Dynamic Scaling – Это реактивный интеллект системы. Непрерывно отслеживая использование CU (Compute Unit) в реальном времени, Zilliz Cloud автоматически масштабирует ресурсы вверх во время непредсказуемых всплесков, таких как интенсивная загрузка данных или сложные нагрузки запросов, и масштабирует их обратно вниз, когда спрос снижается. Результат — стабильная производительность без потерь от постоянного избыточного выделения ресурсов.
Scheduled Scaling – Это проактивный аналог. Многие рабочие нагрузки следуют предсказуемым шаблонам, таким как утренние всплески входов или часы пиковой деловой активности. С помощью scheduled scaling вы можете заранее определить корректировки как для CU, так и для Replicas на основе временных окон. Это гарантирует, что ваша система полностью готова к ожидаемому трафику, избегая ненужных затрат в непиковые часы.
Примечание: Вы по-прежнему можете масштабировать вручную в любое время.
Вместе эти возможности гарантируют, что ваша векторная база данных всегда имеет нужные ресурсы в нужное время — без напрасных расходов или рисков для производительности.
Практические сценарии использования автомасштабирования
Чтобы сделать эту функцию более конкретной, рассмотрим три распространенных сценария использования, в которых автомасштабирование приносит измеримую бизнес-ценность.
1. Ажиотаж во время флеш-распродажи
Платформа электронной коммерции запускает двухчасовую флеш-распродажу в полдень. Трафик резко возрастает, создавая сильную нагрузку на API «похожих товаров» и рекомендаций на базе векторов. Без масштабирования система может дать сбой именно в тот момент, когда от нее зависит выручка.
Решение: С помощью Scheduled Replica Scaling количество реплик можно увеличить в 4 раза в 11:50 AM — прямо перед началом события — и вернуть к базовому уровню в 2:05 PM. Это обеспечивает плавную производительность в пиковое окно, при этом гарантируя, что вы платите за емкость только тогда, когда она нужна.
2. Утренний всплеск входов
В базе знаний ИИ компании сотни сотрудников входят в систему в 9 AM каждый будний день. Всплеск перегружает пропускную способность запросов, замедляя ответы чат-бота RAG и создавая неприятное начало рабочего дня.
Решение: Scheduled Scaling позволяет репликам узлов запросов автоматически расширяться в 8:50 AM и снова сокращаться после rush. Это похоже на открытие дополнительных полос на шоссе перед часом пик — поддерживая быстрое время отклика без растраты ресурсов после того, как трафик рассеивается.
3. Полуночное обновление каталога
Конвейер данных запускает крупное, незапланированное задание переиндексации ночью. Процесс потребляет память и конкурирует с live traffic, замедляя поиски и даже создавая риск тайм-аутов.
Решение: Благодаря Dynamic CU Scaling Zilliz Cloud реагирует в реальном времени по мере роста потребности в ресурсах, автоматически масштабируя CU, чтобы справиться с рабочей нагрузкой. После завершения индексации ресурсы снова масштабируются вниз. Активные запросы остаются быстрыми, загрузка данных выполняется плавно, и ручное вмешательство не требуется.
Что дальше?
Этот релиз — важный шаг вперед, но также и основа для чего-то большего: векторной базы данных, которая управляет ресурсами полностью самостоятельно.
В настоящее время мы активно исследуем более детализированные стратегии масштабирования в Zilliz Cloud. Разные рабочие нагрузки требуют разных компромиссов. Одни отдают приоритет экономической эффективности, другим постоянно необходим запас производительности. Мы представляем себе «профили» масштабирования, которые позволяют задать предпочтительную стратегию — консервативную для фоновых задач, сбалансированную для общих рабочих нагрузок или агрессивную для критически важных запусков. Это даст командам тонкий контроль и одновременно снизит операционную неопределенность.
Наша долгосрочная цель — разработать фреймворк управления ресурсами, который будет одновременно автономным и адаптивным, обеспечивая вам уверенность в том, что ваша векторная база данных всегда будет соотносить ресурсы со спросом без каких-либо ручных усилий.
Начало работы с автомасштабированием в Zilliz Cloud
Автомасштабирование уже доступно в Zilliz Cloud, и вы можете начать использовать его прямо сейчас. Вот как попробовать его самостоятельно:
Войдите в консоль Zilliz Cloud. Перейдите в свой проект и выберите кластер, которым хотите управлять.
Задайте диапазон CU. Определите минимальное и максимальное количество Compute Units (CU) для своей рабочей нагрузки. Автомасштабирование будет автоматически расширять и сокращать ресурсы в пределах этого диапазона.
Выберите режим масштабирования.
- Используйте Dynamic Scaling для непредсказуемых рабочих нагрузок (например, загрузка данных, внезапные всплески запросов).
Используйте Scheduled Scaling для предсказуемых циклов (например, утренние всплески входов в систему, флеш-распродажи).
Вы по-прежнему можете масштабировать вручную в любое время, если вам нужны немедленные корректировки.
- Посмотрите это в действии. Отслеживайте, как ваш кластер масштабируется вверх и вниз в реальном времени, и подстраивайте параметры по мере того, как лучше узнаете свою рабочую нагрузку.
Всего за несколько кликов ваша база данных будет оставаться оптимально подобранной по размеру без постоянной настройки. Вы получите более высокую производительность во время пиков, более низкие затраты в периоды затишья и меньше операционных проблем в процессе.
Совет: Начните с более широкого диапазона CU, чтобы посмотреть, как работает автомасштабирование, а затем точно настройте ограничения по мере более глубокого понимания своей рабочей нагрузки.
👉 Для получения дополнительной информации ознакомьтесь с нашей документацией по автомасштабированию.
👉 Есть вопросы? Наша команда поддержки готова помочь.
Больше, чем автомасштабирование: возможности Zilliz Cloud, готовые для enterprise
Автомасштабирование — лишь одна из составляющих того, что делает Zilliz Cloud самым полным и готовым к production сервисом векторных баз данных. В недавних релизах мы также представили SSO GA, журналы аудита, private preview Milvus 2.6 и растущий набор функций корпоративного уровня, разработанных для удовлетворения потребностей команд, создающих ИИ в масштабе. (Подробности см. в нашем блоге о запуске.)
Созданный на базе Milvus, Zilliz Cloud предоставляет полностью управляемый опыт с:
Эластичное масштабирование и экономическая эффективность – Развертывание в один клик, бессерверное автомасштабирование и тарификация по модели pay-as-you-go.
Продвинутый AI-поиск – Векторный, полнотекстовый и гибридный (sparse + dense) поиск с фильтрацией по метаданным, динамической схемой и мультитенантностью.
Запросы на естественном языке – Поддержка MCP server для интуитивных запросов без сложных API.
Надежность и безопасность корпоративного уровня – SLA 99,95%, сертификации SOC 2 Type II и ISO 27001, соответствие GDPR, готовность к HIPAA, RBAC, BYOC, а теперь и журналы аудита.
Глобальная доступность – Развертывания в AWS, GCP и Azure с задержкой менее 100 мс по всему миру.
Бесшовная миграция – Встроенные инструменты для перехода с Pinecone, Qdrant, Elasticsearch, PostgreSQL, OpenSearch или локального Milvus.
В совокупности эти возможности гарантируют, что Zilliz Cloud — это не просто сервис векторной базы данных, а готовая к промышленной эксплуатации основа для корпоративных AI-приложений.
Читать далее
Stop Building AI Data Infra for the Wrong Stage
Learn how AI data infrastructure should evolve from prototype to enterprise scale, and when Vector Lakebase becomes the right architecture for AI apps.

Zilliz Cloud On-Demand Compute: Pay Only for What You Use
The customer case behind Zilliz Cloud On-Demand: how a $10K vector search bill came down to under $500, and the engineering changes that made it possible.

Vector Databases vs. Time Series Databases
Use a vector database for similarity search and semantic relationships; use a time series database for tracking value changes over time.



