TiDB против MyScale: выбор подходящей векторной базы данных для ваших ИИ-приложений
Что такое векторная база данных?
Прежде чем сравнивать TiDB и MyScale, давайте сначала рассмотрим концепцию векторных баз данных.
Векторная база данных специально предназначена для хранения и запроса многомерных векторов, которые являются числовыми представлениями неструктурированных данных. Эти векторы кодируют сложную информацию, такую как семантическое значение текста, визуальные признаки изображений или атрибуты продуктов. Обеспечивая эффективный поиск по сходству, векторные базы данных играют ключевую роль в приложениях ИИ, позволяя выполнять более продвинутый анализ и извлечение данных.
Распространенные сценарии использования векторных баз данных включают рекомендации товаров в электронной коммерции, платформы обнаружения контента, обнаружение аномалий в кибербезопасности, анализ медицинских изображений и задачи обработки естественного языка (NLP). Они также играют важную роль в Retrieval Augmented Generation (RAG), методе, который повышает производительность больших языковых моделей (LLMs), предоставляя внешние знания для снижения таких проблем, как галлюцинации ИИ.
На рынке доступно множество типов векторных баз данных, включая:
- Специализированные векторные базы данных, такие как Milvus, Zilliz Cloud (полностью управляемый Milvus)
- Библиотеки векторного поиска, такие как Faiss и Annoy.
- Легковесные векторные базы данных, такие как Chroma и Milvus Lite.
- Традиционные базы данных с надстройками для векторного поиска, способные выполнять векторный поиск небольшого масштаба.
TiDB — это традиционная база данных, а MyScale — база данных, построенная на ClickHouse, которая объединяет векторный поиск и SQL-аналитику. Обе используют векторный поиск как надстройку. В этом посте сравниваются их возможности векторного поиска.
TiDB: обзор и базовая технология
TiDB, разработанная PingCAP, — это распределенная SQL-база данных с открытым исходным кодом, предлагающая возможности гибридной транзакционной и аналитической обработки (HTAP). Она совместима с MySQL, что упрощает внедрение для команд, уже знакомых с экосистемой MySQL. Распределенная SQL-архитектура TiDB обеспечивает горизонтальную масштабируемость, как у NoSQL-баз данных, сохраняя при этом реляционную модель SQL-баз данных, что делает ее весьма гибкой для обработки как транзакционных, так и аналитических рабочих нагрузок.
Одной из ключевых сильных сторон TiDB является ее HTAP-архитектура, которая позволяет обрабатывать транзакционные (OLTP) и аналитические (OLAP) рабочие нагрузки в одной базе данных, уменьшая потребность в отдельных системах. Кроме того, совместимость TiDB с MySQL упрощает интеграцию в существующие среды, которые полагаются на MySQL, без существенных изменений в коде приложения. База данных также поддерживает автоматическое шардингование, автоматически распределяя данные по узлам для повышения производительности чтения и записи при сохранении строгой согласованности.
TiDB поддерживает векторный поиск за счет интеграции с внешними библиотеками и плагинами, обеспечивая эффективное управление векторизованными данными и выполнение запросов к ним. Эта функция в сочетании с HTAP-архитектурой TiDB делает ее универсальным вариантом для компаний, которым нужны возможности векторного поиска наряду с транзакционными и аналитическими рабочими нагрузками. Распределенная архитектура TiDB позволяет ей обрабатывать крупномасштабные векторные запросы после выполнения необходимых настроек.
Хотя включение функциональности векторного поиска в TiDB требует дополнительной конфигурации, совместимость системы с SQL позволяет разработчикам объединять векторный поиск с традиционными реляционными запросами. Эта гибкость делает TiDB подходящей для сложных приложений, которым требуются как возможности векторного поиска, так и реляционной базы данных, предлагая комплексное решение для разнообразных потребностей управления данными.
Что такое MyScale? Обзор и базовая технология
MyScale — это облачная база данных, построенная поверх базы данных с открытым исходным кодом ClickHouse и предназначенная для рабочих нагрузок AI и машинного обучения. Она может обрабатывать структурированные и векторные данные, а также аналитику в реальном времени и машинное обучение. MyScale ориентирована на временные ряды, векторный поиск и полнотекстовый поиск, поэтому она хорошо подходит для обработки в реальном времени и аналитических выводов на основе AI. Используя архитектуру ClickHouse, MyScale обеспечивает высокую производительность и масштабируемость для AI.
Одна из ключевых особенностей MyScale — встроенная поддержка SQL, которая упрощает запросы на основе AI за счет интеграции векторного поиска, полнотекстового поиска и традиционных SQL-запросов в одной системе. Это снижает необходимость в нескольких инструментах и делает ее масштабируемой для AI. MyScale поддерживает и управляет аналитической обработкой как структурированных, так и векторизованных данных на одной платформе, используя архитектуру базы данных OLAP для работы с векторизованными данными. Разработчики могут взаимодействовать с MyScale с помощью SQL, поэтому она доступна всем программистам, знакомым с реляционными базами данных.
MyScale имеет несколько типов векторных индексов и метрик сходства для поддержки разных сценариев использования. Она поддерживает распространенные метрики расстояния, такие как евклидово расстояние (L2), скалярное произведение (IP) и косинусное сходство. База данных имеет несколько алгоритмов индексирования: MSTG (Multi-Scale Tree Graph), ScaNN, IVFFLAT, IVFPQ, IVFSQ и HNSW, каждый со своим набором параметров для настройки. Проприетарный векторный движок MSTG от MyScale использует NVMe SSD для увеличения плотности данных, поэтому он превосходит специализированные векторные базы данных как по производительности, так и по стоимости.
Объединяя функциональность SQL-базы данных, векторной базы данных и полнотекстовой поисковой системы в одной системе, MyScale снижает затраты на инфраструктуру и обслуживание. Такая унификация позволяет выполнять совместные запросы к данным и аналитику, а также обеспечивает единую основу данных для AI-приложений. MyScale также имеет MyScale Telemetry для полной наблюдаемости систем LLM, чтобы вы могли эффективно выполнять мониторинг и отладку. По мере усложнения данных MyScale является перспективным решением, способным обрабатывать новые модальности данных и размеры баз данных, сохраняя вычислительную производительность и интеграцию между различными типами данных.
Ключевые различия
Реализация векторного поиска
TiDB интегрирует векторный поиск через внешние библиотеки, тогда как MyScale имеет встроенные возможности векторного поиска с несколькими типами индексов (MSTG, ScaNN, IVFFLAT, IVFPQ, IVFSQ, HNSW). Проприетарный векторный движок MSTG от MyScale использует NVMe SSD для повышения плотности данных и производительности.
Архитектура и обработка данных
TiDB использует гибридную архитектуру транзакционной/аналитической обработки (HTAP), обрабатывая как рабочие нагрузки OLTP, так и OLAP. Она совместима с MySQL и включает auto-sharding для распределения данных.
MyScale построена на OLAP-архитектуре ClickHouse и ориентирована на временные ряды, векторный поиск и полнотекстовый поиск. Она обрабатывает структурированные и векторные данные в единой системе.
Производительность и масштабируемость
TiDB масштабируется горизонтально, сохраняя строгую согласованность, распределяя данные по узлам с помощью auto-sharding.
MyScale использует высокопроизводительную архитектуру ClickHouse и заявляет о превосходной производительности и экономической эффективности по сравнению со специализированными векторными базами данных благодаря своему векторному движку MSTG.
Интеграция
TiDB предлагает совместимость с MySQL, что делает ее подходящей для существующих сред MySQL с минимальными изменениями кода.
MyScale объединяет возможности SQL-базы данных, векторной базы данных и полнотекстового поиска на одной платформе. Она включает MyScale Telemetry для мониторинга систем LLM.
Стоимость и обслуживание
TiDB может потребовать дополнительной конфигурации и ресурсов для реализации векторного поиска.
Единая платформа MyScale потенциально снижает затраты на инфраструктуру и обслуживание, устраняя необходимость в отдельных системах.
Выбирайте TiDB
Когда вам нужна совместимость с MySQL и вы можете обрабатывать как транзакционные, так и аналитические рабочие нагрузки. Особенно когда вам нужна строгая согласованность в распределенных средах, автошардинг и вы планируете интегрировать векторный поиск в существующую экосистему MySQL без серьезных изменений кода.
Выбирайте MyScale
Когда у вас есть приложения на базе ИИ, которым нужна тесная интеграция между векторным поиском, анализом временных рядов и полнотекстовым поиском. Когда вам нужен нативный векторный поиск с несколькими вариантами индексирования, MyScale Telemetry для мониторинга вашей LLM-системы и единая платформа для снижения сложности инфраструктуры.
Заключение
TiDB отлично справляется с предоставлением MySQL-совместимого распределенного SQL с возможностями HTAP, что делает его идеальным для организаций, которые ставят во главу угла согласованность данных и привычные рабочие процессы MySQL. MyScale выделяется своей нативной реализацией векторного поиска и единым подходом к работе со структурированными и векторными данными. Ваш выбор должен соответствовать вашим конкретным требованиям: выбирайте TiDB для распределенного SQL корпоративного уровня с возможностями векторного поиска или MyScale для специализированного векторного поиска и аналитики с комплексным мониторингом LLM-систем.
Прочитайте это, чтобы получить обзор TiDB и MyScale, но для их оценки необходимо исходить из вашего сценария использования. Один инструмент, который может помочь в этом, — VectorDBBench, open-source инструмент для бенчмаркинга и сравнения векторных баз данных. В конечном итоге тщательное бенчмаркинг-тестирование на ваших собственных наборах данных и шаблонах запросов будет ключом к принятию решения между этими двумя мощными, но разными подходами к векторному поиску в распределенных системах баз данных.
Использование open-source VectorDBBench для оценки и сравнения векторных баз данных самостоятельно
VectorDBBench — это open-source инструмент для бенчмаркинга для пользователей, которым нужны высокопроизводительные системы хранения и извлечения данных, особенно векторные базы данных. Этот инструмент позволяет пользователям тестировать и сравнивать различные системы векторных баз данных, такие как Milvus и Zilliz Cloud (управляемый Milvus), используя собственные наборы данных, и находить ту, которая подходит для их сценариев использования. С VectorDBBench пользователи могут принимать решения на основе фактической производительности векторных баз данных, а не маркетинговых заявлений или слухов.
VectorDBBench написан на Python и распространяется под open-source лицензией MIT, что означает, что любой может свободно использовать, изменять и распространять его. Инструмент активно поддерживается сообществом разработчиков, стремящихся улучшать его функции и производительность.
Загрузите VectorDBBench из его репозитория GitHub, чтобы воспроизвести наши результаты бенчмаркинга или получить результаты производительности на ваших собственных наборах данных.
Быстро ознакомьтесь с производительностью популярных векторных баз данных на VectorDBBench Leaderboard.
Прочитайте следующие блоги, чтобы узнать больше об оценке векторных баз данных.
Дополнительные ресурсы о VectorDB, GenAI и ML
Читать далее

The AWS Outage Was a Wake-Up Call for Vector Database Cross-Region Disaster Recovery
Zilliz Cloud Had the Answer Before the Crisis. Zilliz Cloud is the world's first vector database with native cross-region disaster recovery.

DeepSeek-OCR Explained: Optical Compression for Scalable Long-Context and RAG Systems
Discover how DeepSeek-OCR uses visual tokens and Contexts Optical Compression to boost long-context LLM efficiency and reshape RAG performance.

Zilliz Cloud Update: Tiered Storage, Business Critical Plan, Cross-Region Backup, and Pricing Changes
This release offers a rebuilt tiered storage with lower costs, a new Business Critical plan for enhanced security, and pricing updates, among other features.
The Definitive Guide to Choosing a Vector Database
Overwhelmed by all the options? Learn key features to look for & how to evaluate with your own data. Choose with confidence.


