Creación de RAG superior para textos intensivos en código con Zilliz Cloud Pipelines y Voyage AI
El modelo de embeddings está en el corazón de Retrieval Augmented Generation (RAG), que afecta principalmente a la capacidad de recuperación y es crucial para la calidad general de las respuestas. Entrenados con enormes cantidades de corpus de datos, los modelos de embeddings pueden extraer las representaciones numéricas del significado de cualquier texto, lo que los hace adecuados para diversas tareas de recuperación de información. Sin embargo, entrenar un modelo de embeddings que destaque en cualquier tarea sigue siendo muy desafiante. Hay varios modelos de embeddings disponibles, cada uno con fortalezas y debilidades únicas y propiedades variables.
Zilliz Cloud Pipelines integra los mejores modelos de embeddings disponibles como una solución integral para la recuperación. Estas opciones flexibles permiten a los desarrolladores explorar y elegir los mejores modelos adaptados a sus casos de uso específicos.
Hoy, nos complace anunciar que los modelos de embeddings de Voyage AI están disponibles en Zilliz Cloud Pipelines. Los modelos recién lanzados voyage-2 y voyage-code-2 han demostrado una calidad sobresaliente en tareas de recuperación relacionadas con código fuente, documentación técnica y tareas generales. Por ejemplo, voyage-code-2 es según se informa un 14,52% mejor que el embedding de OpenAI en conjuntos de datos intensivos en código y un 3,03% mejor para fines generales.
También colaboramos con Voyage AI para evaluar la eficacia de un sistema RAG implementado con varios modelos de embeddings para tareas relacionadas con código. El modelo de lenguaje utilizado es GPT4. Probamos el sistema en un subconjunto de los conjuntos de datos APPS y Codechef, que contienen preguntas sobre programación, y cada pregunta tiene exactamente una respuesta correcta del corpus. Medimos la calidad de recuperación mediante "recall@k", que es la probabilidad de capturar el resultado correcto entre los k documentos recuperados principales. Además, también evaluamos la calidad de extremo a extremo con Ragas, un popular marco de evaluación para pipelines de RAG. Tiene seis métricas que describen diversos aspectos de RAG, desde la relevancia y precisión de los textos recuperados hasta la corrección y calidad de la respuesta final. La media armónica de las seis métricas, llamada "Ragas Score", mide el rendimiento general del sistema. Puedes obtener más información sobre cada métrica en la página de documentación de Milvus.
Comparación de las puntuaciones de recuperación y generales entre modelos de embeddings populares en conjuntos de datos de código.
Las dos figuras superiores muestran que los modelos voyages-2 y voyage-code-2 tienen una capacidad de recuperación significativamente mejor que los otros modelos. La puntuación “Recall@k” indica que, al recuperar los k resultados principales, existe una probabilidad de que la verdad fundamental esté incluida en los k resultados devueltos. Por ejemplo, con el conjunto de datos apps_1solution, en el 62% de los casos, voyage-code-2 obtiene la verdad fundamental entre los 4 resultados principales, mientras que bge-base-en-v1.5 solo lo logra en el 2% de los casos. Estas pruebas muestran que voyage-code-2 funciona muchísimo mejor en tareas relacionadas con código que los modelos de embeddings no optimizados para ello.
En cuanto a las respuestas RAG de extremo a extremo, la mejora en la recuperación conduce a un aumento de más de diez puntos porcentuales en Answer Correctness y Ragas Score, en comparación con la alternativa de mejor rendimiento. Específicamente, Context Precision y Context Recall miden el efecto de la fase de recuperación. Los modelos Voyage superan significativamente a las otras opciones, especialmente en Context Precision. En Faithfulness y Answer Relevancy, que miden la calidad de las respuestas generadas, Voyage supera a diferentes modelos por más de cinco puntos porcentuales. Los resultados muestran que una mejor calidad de recuperación conduce a una mejor generación del pipeline RAG. Answer Similarity y Answer Correctness se relacionan con la evaluación de la semejanza semántica entre la respuesta generada y la verdad de referencia. En Answer Correctness, RAG basado en Voyage vuelve a tener ventajas evidentes, superando a los demás por más de cinco puntos.
RAG se ha convertido en el enfoque predominante para los bots de preguntas y respuestas sobre problemas de programación y desarrollo de software. Estas aplicaciones pueden beneficiarse aún más de los modelos Voyage de alta calidad que destacan en tareas de recuperación relacionadas con código. Una mejor calidad de recuperación se traduce en una mejor localización de información relevante en código o documentación técnica, lo que genera respuestas más precisas y una mejor experiencia de usuario.
En Zilliz Cloud Pipelines, ahora puedes elegir voyages-2 y voyage-code-2 como modelos de embedding para lograr la máxima calidad de recuperación en tareas relacionadas con código sin preocuparte por DevOps ni por gestionar tu infraestructura de ML. Lo mejor es que puedes empezar gratis registrándote en https://cloud.zilliz.com/signup para crear tu aplicación RAG con facilidad y precisión.
Sigue leyendo

DeepSeek-OCR Explained: Optical Compression for Scalable Long-Context and RAG Systems
Discover how DeepSeek-OCR uses visual tokens and Contexts Optical Compression to boost long-context LLM efficiency and reshape RAG performance.

Context Engineering Strategies for AI Agents: A Developer’s Guide
Learn practical context engineering strategies for AI agents. Explore frameworks, tools, and techniques to improve reliability, efficiency, and cost.
Milvus/Zilliz + Surveillance: How Vector Databases Transform Multi-Camera Tracking
See how Milvus vector database enhances multi-camera tracking with similarity-based matching for better surveillance in retail, warehouses and transport hubs.



