La próxima parada para las bases de datos vectoriales: 8 predicciones para 2023
2022 marcó un año significativo para las bases de datos vectoriales. Cabe destacar que la comunidad de Milvus lanzó la base de datos vectorial nativa de la nube Milvus 2.0. Más de diez productos de bases de datos vectoriales de código abierto, como Vald, Weaviate, Qdrant, Vespa, Vearch, AquilaDB y Marqo, surgieron en GitHub. Fabricantes de bases de datos como Elastic y Redis se unieron a la contienda, introduciendo capacidades de recuperación vectorial. En el frente de la nube, Zilliz, el equipo detrás de la comunidad de Milvus, lanzó un servicio DBaaS completamente gestionado, Zilliz Cloud, compitiendo con empresas como Pinecone y Google Vertex AI.
El mercado de capitales fue igualmente dinámico, con varias empresas de bases de datos vectoriales obteniendo financiación significativa, sentando las bases para un mayor crecimiento. Esta afluencia de capital e interés en las bases de datos vectoriales en 2022 allana el camino para mis predicciones para 2023, un año en el que espero presenciar el desarrollo y la maduración continuos de esta tecnología emergente.
| Empresa | Recaudado | Fecha |
|---|---|---|
| Zilliz | $60M (Ronda B+) | Ago 2022 |
| Pinecone | $28M (Ronda A) | Mar 2022 |
| Weaviate | $16M (Ronda A) | Feb 2022 |
| Qdrant | €2M (Ronda Pre-Seed) | Ene 2022 |
Situaciones de financiación de las empresas de bases de datos vectoriales en 2022
Predicciones para 2023 sobre bases de datos vectoriales
Predicción #1: Diferenciación y especialización en bases de datos vectoriales
En 2023, las bases de datos vectoriales evolucionarán de manera distintiva debido a la afluencia de capital y al rápido desarrollo de casos de uso, lo que conducirá a la diferenciación y especialización:
Servicio en línea frente a procesamiento fuera de línea: Las bases de datos vectoriales tradicionales, diseñadas para altas demandas en línea y en tiempo real con escalas de datos más pequeñas, ahora se adaptarán para manejar conjuntos de datos masivos de áreas como el procesamiento de imágenes y el NLP, lo que requerirá capacidades mejoradas de procesamiento por lotes y fuera de línea.
Instancias lógicas frente a instancias físicas: El sector verá una división entre instancias lógicas, centradas en la facilidad de uso y despliegues simples, e instancias físicas como Milvus, que ofrecen almacenamiento flexible y soluciones de recuperación eficientes. Esta divergencia atiende a necesidades variadas, desde el procesamiento vectorial simple hasta la generación vectorial compleja.
Sistemas independientes frente a sistemas distribuidos nativos de la nube: La elección entre sistemas independientes y sistemas distribuidos nativos de la nube será crucial. Mientras que los sistemas independientes ofrecen estabilidad, los diseños distribuidos nativos de la nube como Milvus 2.0 están preparados para la escalabilidad y las eficiencias basadas en la nube.
Diferentes implementaciones de indexación: Las metodologías de indexación se están diversificando. Con nuevos desarrollos como la tecnología ScaNN de Google, las bases de datos vectoriales están evolucionando en rendimiento y funcionalidad, adaptándose a casos de uso específicos y requisitos de eficiencia.
Estas tendencias indican un movimiento hacia bases de datos vectoriales más adaptadas y especializadas, alineadas con las necesidades específicas de diversas aplicaciones y escalas de datos.
Predicción #2: Avance hacia una interfaz de consulta unificada
Actualmente, las bases de datos vectoriales carecen de una interfaz de consulta unificada, y utilizan predominantemente SDKs personalizados de Python o APIs Restful. Sin embargo, desarrollos como BigLake de Big Query en Google Next 2022, que impulsa SQL como lenguaje principal para datos no estructurados y procesamiento vectorial, sugieren un cambio significativo. A pesar de que la base de usuarios tradicional de SQL difiere de los desarrolladores de aprendizaje profundo y de su éxito desigual en el aprendizaje automático, su potencial como lenguaje de consulta para bases de datos vectoriales merece atención.
Más allá de SQL, hay experimentos con lenguajes de consulta basados en GraphQL y DSL personalizados. Independientemente de qué interfaz obtenga una aceptación más amplia, la predicción para 2023 es la aparición de una interfaz estándar de facto en el dominio de las bases de datos vectoriales, con múltiples productos adoptando un enfoque similar para su implementación.
Predicción #3: Mayor integración de las bases de datos vectoriales con las bases de datos tradicionales
Las bases de datos vectoriales han evolucionado considerablemente durante los últimos dos años, superando su fase inicial como simples envoltorios alrededor de FAISS. Ahora suelen incluir capacidades para filtrar e indexar campos escalares y gestionar operaciones CRUD sobre datos en streaming, integrando elementos como analizadores, optimizadores, memoria y gestión de concurrencia de las bases de datos tradicionales. Muchas bases de datos OLAP y NoSQL incorporan capacidades de recuperación vectorial, convirtiéndose en actores importantes en este campo.
A pesar de la creencia de que "una solución única no sirve para todo", con las bases de datos tradicionales teniendo dificultades en la recuperación vectorial debido a limitaciones humanas y arquitectónicas, es probable que en 2023 más fabricantes de bases de datos tradicionales entren en el espacio de la recuperación vectorial, atraídos por su potencial. Las bases de datos vectoriales, por otro lado, están aprendiendo cada vez más de los ámbitos de las bases de datos tradicionales, haciendo que su núcleo pase de la infraestructura de IA a funcionalidades más orientadas a bases de datos. Este cambio está impulsado por la necesidad de soluciones de recuperación vectorial más generales y estables. En consecuencia, esperamos ver una afluencia de talento con experiencia en bases de datos tradicionales (incluyendo procesamiento de transacciones, procesamiento de aplicaciones, búsqueda y caché) al sector de las bases de datos vectoriales en 2023.
Predicción #4: Reducción significativa de costes en las bases de datos vectoriales
En 2023, se predice que las bases de datos vectoriales experimentarán una reducción de costes de 3 a 5 veces. Este cambio es crucial, ya que el coste y el rendimiento han sido barreras importantes para que la recuperación vectorial supere a la búsqueda tradicional por palabras clave. Actualmente, la mayoría de las bases de datos vectoriales dependen únicamente de la memoria. Para almacenar datos vectoriales en el rango de decenas de miles de millones, necesitan capacidad de memoria del orden de decenas de terabytes.
Varios factores contribuyen a esta reducción de costes:
Uso generalizado de la arquitectura ARM en la nube: El rendimiento computacional simple de ARM ofrece una eficiencia de costes 2-3 veces mejor que X86.
Crecimiento del hardware heterogéneo: Estos sistemas superan las capacidades de memoria/almacenamiento y ancho de banda de las GPU.
Avances en técnicas de cuantización: Especialmente la aplicación de cuantización de 4 bits en la recuperación vectorial.
Enfoque en la investigación de índices Disk Anns: Emergiendo como una dirección de investigación principal.
Rendimiento de discos NVMe: Utilizando tecnologías como AIO e IO_URING, logrando IOPs de nivel millón.
Comprensión más profunda de las bases de datos vectoriales: Aprovechando metadatos y técnicas de poda similares a las de las bases de datos tradicionales, reduciendo la necesidad de consultar todos los shards cada vez.
Selección de índices y parámetros de modelo basada en aprendizaje automático: Este enfoque se implementará en producción por primera vez.
Características de temperatura de los datos vectoriales: Al igual que los datos escalares tradicionales, los datos vectoriales presentan características calientes y frías.
Estos desarrollos indican un año prometedor para las bases de datos vectoriales, haciéndolas más rentables y eficientes.
Predicción #5: Aparición de la primera base de datos vectorial serverless
En 2023, anticipamos la introducción de la primera base de datos vectorial serverless. La arquitectura serverless ofrece flexibilidad y facturación bajo demanda, lo que resulta especialmente atractivo para los servicios de bases de datos vectoriales alojados en la nube. Esta tecnología se adapta a la naturaleza compleja de las recuperaciones vectoriales, que incluyen procesos offline y online y a menudo enfrentan cargas fluctuantes en entornos multiinquilino. Serverless simplifica la evaluación de capacidad y el aislamiento empresarial para los usuarios.
Aunque las bases de datos vectoriales serverless aún están evolucionando y tienen camino por recorrer antes de alcanzar la madurez, existe potencial para desarrollos iniciales similares a los sistemas independientes basados en contenedores y escalables dinámicamente de AWS Aurora. Sin embargo, la plena realización de una base de datos vectorial serverless verdaderamente distribuida podría estar todavía algo lejos.
Predicción #6: Auge de las herramientas de código abierto para bases de datos vectoriales
En 2023, podemos esperar ver el auge de herramientas de código abierto diseñadas para bases de datos vectoriales. Las características únicas de los datos vectoriales requieren la creación de herramientas innovadoras que vayan más allá de los métodos tradicionales de representación de datos. Estas herramientas proporcionarán formas más intuitivas y visuales de mostrar datos vectoriales, incluida su distribución y las rutas de consulta.
El desarrollo de herramientas de transferencia de datos también será un foco clave. Estas herramientas mejorarán las capacidades de copia de seguridad, migración e importación de datos, abordando la creciente diversidad de bases de datos vectoriales. Desempeñarán un papel crucial al vincular diferentes tipos de datos y gestionar el flujo de datos vectoriales a gran escala generados desde plataformas como Spark, PyTorch y TensorFlow, facilitando una integración fluida entre varias nubes y centros de datos.
Predicción #7: Adopción temprana de AI for Database (AI4DB) en bases de datos vectoriales
En 2023, las bases de datos vectoriales liderarán el camino hacia una implementación práctica de las tecnologías de AI for Database (AI4DB). Aunque AI4DB ha sido un concepto en el campo de las bases de datos durante muchos años, su adopción generalizada ha sido un desafío. El principal obstáculo han sido las altas exigencias de precisión y explicabilidad de las bases de datos relacionales, donde incluso un porcentaje minúsculo de imprecisiones puede obstaculizar las aplicaciones de IA en casos de uso del mundo real.
Las bases de datos vectoriales, sin embargo, operan inherentemente sobre optimización probabilística, centrándose más en las tasas de recuperación que en la precisión absoluta. Esta característica permite una aplicación más agresiva de AI4DB, como el ajuste automático de parámetros, la reescritura de sentencias de consulta y el uso de índices aprendidos. Las pruebas han demostrado que usar predicciones de modelos para parámetros de consulta puede más que duplicar el rendimiento en grandes conjuntos de datos. Es probable que optimizar índices y parámetros de consulta en función de conjuntos de datos y un pequeño conjunto de consultas produzca mejoras aún más significativas.
Predicción #8: Segunda empresa comercial surgida de Milvus de código abierto
En 2023, podemos esperar ver el lanzamiento de nuevas iniciativas comerciales que aprovechen la base de datos vectorial de código abierto Milvus. Milvus es una de las bases de datos vectoriales cloud-native líderes y más avanzadas a nivel mundial. Al igual que proyectos de código abierto exitosos como Hadoop, Presto y Clickhouse, Milvus inspirará a entidades comerciales a contribuir y construir sobre su base. Aunque iniciar un proyecto de base de datos vectorial desde cero se vuelve cada vez más desafiante, el potencial para desarrollar SaaS (Software as a Service) basado en bases de datos vectoriales como Milvus sigue siendo significativo. Es probable que esta tendencia continúe con más colaboradores uniéndose a la comunidad de código abierto, colaborando en el proyecto Milvus y explorando oportunidades comerciales.
Reflexiones finales
En los últimos años se ha visto una expansión significativa en las capacidades y los casos de uso de las bases de datos vectoriales, ayudada en gran medida por los avances en potencia computacional, incluidas las GPU y el hardware especializado. De cara a 2023, se perfila como un año muy esperado para la industria y la comunidad de código abierto. Promete ser una época de innovación, crecimiento y colaboración continuos.
Esta serie de predicciones, aunque breve, busca ofrecer un vistazo al futuro de las bases de datos vectoriales, destacando los emocionantes desarrollos y oportunidades en el horizonte. A medida que avanzamos hacia 2023, las perspectivas para este campo son prometedoras e indicativas de la naturaleza dinámica y evolutiva de la tecnología. Esperemos con interés lo que el próximo año nos traerá en bases de datos vectoriales. ¡Nos vemos en 2023!
Sigue leyendo

Why I’m Against Claude Code’s Grep-Only Retrieval? It Just Burns Too Many Tokens
Learn how vector-based code retrieval cuts Claude Code token consumption by 40%. Open-source solution with easy MCP integration. Try claude-context today.

OpenAI o1: What Developers Need to Know
In this article, we will talk about the o1 series from a developer's perspective, exploring how these models can be implemented for sophisticated use cases.

Why Deepseek is Waking up AI Giants Like OpenAI And Why You Should Care
Discover how DeepSeek R1's open-source AI model with superior reasoning capabilities and lower costs is disrupting the AI landscape and challenging tech giants like OpenAI.



