Creación de RAG superior para textos intensivos en código con Zilliz Cloud Pipelines y Voyage AI
El modelo de embeddings está en el corazón de Retrieval Augmented Generation (RAG), que afecta principalmente a la capacidad de recuperación y es crucial para la calidad general de las respuestas. Entrenados con enormes cantidades de corpus de datos, los modelos de embeddings pueden extraer las representaciones numéricas del significado de cualquier texto, lo que los hace adecuados para diversas tareas de recuperación de información. Sin embargo, entrenar un modelo de embeddings que destaque en cualquier tarea sigue siendo muy desafiante. Hay varios modelos de embeddings disponibles, cada uno con fortalezas y debilidades únicas y propiedades variables.
Zilliz Cloud Pipelines integra los mejores modelos de embeddings disponibles como una solución integral para la recuperación. Estas opciones flexibles permiten a los desarrolladores explorar y elegir los mejores modelos adaptados a sus casos de uso específicos.
Hoy, nos complace anunciar que los modelos de embeddings de Voyage AI están disponibles en Zilliz Cloud Pipelines. Los modelos recién lanzados voyage-2 y voyage-code-2 han demostrado una calidad sobresaliente en tareas de recuperación relacionadas con código fuente, documentación técnica y tareas generales. Por ejemplo, voyage-code-2 es según se informa un 14,52% mejor que el embedding de OpenAI en conjuntos de datos intensivos en código y un 3,03% mejor para fines generales.
También colaboramos con Voyage AI para evaluar la eficacia de un sistema RAG implementado con varios modelos de embeddings para tareas relacionadas con código. El modelo de lenguaje utilizado es GPT4. Probamos el sistema en un subconjunto de los conjuntos de datos APPS y Codechef, que contienen preguntas sobre programación, y cada pregunta tiene exactamente una respuesta correcta del corpus. Medimos la calidad de recuperación mediante "recall@k", que es la probabilidad de capturar el resultado correcto entre los k documentos recuperados principales. Además, también evaluamos la calidad de extremo a extremo con Ragas, un popular marco de evaluación para pipelines de RAG. Tiene seis métricas que describen diversos aspectos de RAG, desde la relevancia y precisión de los textos recuperados hasta la corrección y calidad de la respuesta final. La media armónica de las seis métricas, llamada "Ragas Score", mide el rendimiento general del sistema. Puedes obtener más información sobre cada métrica en la página de documentación de Milvus.
Comparación de las puntuaciones de recuperación y generales entre modelos de embeddings populares en conjuntos de datos de código.
Las dos figuras superiores muestran que los modelos voyages-2 y voyage-code-2 tienen una capacidad de recuperación significativamente mejor que los otros modelos. La puntuación “Recall@k” indica que, al recuperar los k resultados principales, existe una probabilidad de que la verdad fundamental esté incluida en los k resultados devueltos. Por ejemplo, con el conjunto de datos apps_1solution, en el 62% de los casos, voyage-code-2 obtiene la verdad fundamental entre los 4 resultados principales, mientras que bge-base-en-v1.5 solo lo logra en el 2% de los casos. Estas pruebas muestran que voyage-code-2 funciona muchísimo mejor en tareas relacionadas con código que los modelos de embeddings no optimizados para ello.
En cuanto a las respuestas RAG de extremo a extremo, la mejora en la recuperación conduce a un aumento de más de diez puntos porcentuales en Answer Correctness y Ragas Score, en comparación con la alternativa de mejor rendimiento. Específicamente, Context Precision y Context Recall miden el efecto de la fase de recuperación. Los modelos Voyage superan significativamente a las otras opciones, especialmente en Context Precision. En Faithfulness y Answer Relevancy, que miden la calidad de las respuestas generadas, Voyage supera a diferentes modelos por más de cinco puntos porcentuales. Los resultados muestran que una mejor calidad de recuperación conduce a una mejor generación del pipeline RAG. Answer Similarity y Answer Correctness se relacionan con la evaluación de la semejanza semántica entre la respuesta generada y la verdad de referencia. En Answer Correctness, RAG basado en Voyage vuelve a tener ventajas evidentes, superando a los demás por más de cinco puntos.
RAG se ha convertido en el enfoque predominante para los bots de preguntas y respuestas sobre problemas de programación y desarrollo de software. Estas aplicaciones pueden beneficiarse aún más de los modelos Voyage de alta calidad que destacan en tareas de recuperación relacionadas con código. Una mejor calidad de recuperación se traduce en una mejor localización de información relevante en código o documentación técnica, lo que genera respuestas más precisas y una mejor experiencia de usuario.
En Zilliz Cloud Pipelines, ahora puedes elegir voyages-2 y voyage-code-2 como modelos de embedding para lograr la máxima calidad de recuperación en tareas relacionadas con código sin preocuparte por DevOps ni por gestionar tu infraestructura de ML. Lo mejor es que puedes empezar gratis registrándote en https://cloud.zilliz.com/signup para crear tu aplicación RAG con facilidad y precisión.
Sigue leyendo

VDBBench Adds Cost-Aware Benchmarking for Vector Databases
Compare Zilliz Cloud, Pinecone, and turbopuffer with VDBBench cost-aware vector database benchmarks across latency, freshness, multitenancy, and cold starts.

Will Amazon S3 Vectors Kill Vector Databases—or Save Them?
AWS S3 Vectors aims for 90% cost savings for vector storage. But will it kill vectordbs like Milvus? A deep dive into costs, limits, and the future of tiered storage.

Balancing Precision and Performance: How Zilliz Cloud's New Parameters Help You Optimize Vector Search
Optimize vector search with Zilliz Cloud’s level and recall features to tune accuracy, balance performance, and power AI applications.



