Mezcla de Agentes (MoA): Cómo la inteligencia colectiva eleva el rendimiento de los LLM
El rápido avance de los modelos de lenguaje grandes (LLMs) es como un arma de doble filo. Por un lado, contar con numerosos LLMs de última generación nos ofrece muchas opciones para resolver nuestros casos de uso. Por otro lado, esta abundancia de opciones puede resultar abrumadora.
Además, dado que diferentes organizaciones y empresas desarrollan estos LLMs, se entrenan con distintos conjuntos de datos, lo que da como resultado LLMs con especialidades variadas. Algunos LLMs destacan en la resolución de problemas matemáticos, mientras que otros son más adecuados para tareas de programación. Esta diversidad dificulta la selección del LLM más apropiado para nuestras necesidades, especialmente al tratar con casos de uso multidominio.
En este artículo, exploraremos un método para abordar este desafío: el enfoque Mixture-of-Agents (MoA), que combina varios LLMs con diferentes especialidades en un único sistema. Así que, sin más preámbulos, empecemos con algunas motivaciones detrás de MoA.
La motivación detrás de Mixture-of-Agents (MoA)
El rápido avance de los LLMs nos ha brindado numerosas opciones al elegir el mejor modelo para nuestro caso de uso. Sin embargo, el teorema no-free-lunch todavía se aplica a los LLMs: ningún modelo individual funciona igual de bien en todas las tareas. Diferentes LLMs destacan en diferentes tareas debido a sus datos de entrenamiento variados. Por lo tanto, seleccionar un LLM que se adapte mejor al problema específico que intentamos resolver es crucial.
Surge un desafío cuando tratamos con casos de uso multidominio que requieren experiencia de múltiples LLMs. Esto plantea una pregunta importante: ¿Podemos usar colectivamente múltiples LLMs para aprovechar sus fortalezas individuales y crear un sistema más capaz y robusto? El método Mixture-of-Agents (MoA) intenta responder a esta pregunta.
¿Qué es MoA?
En resumen, Mixture-of-Agents (MoA) es un marco en el que múltiples LLMs especializados, o "agentes", colaboran para resolver tareas aprovechando sus fortalezas únicas.
El concepto detrás de MoA es sencillo: combinamos varios LLMs con diferentes fortalezas y capacidades en un único sistema. Cuando un usuario envía una consulta, cada LLM del sistema genera una respuesta. Luego, un LLM designado al final sintetiza todas estas respuestas en una respuesta coherente para el usuario, como se muestra en la visualización a continuación:
Figura: concepto de Mixture-of-Agents
Figura: concepto de Mixture-of-Agents.
Aunque el concepto de MoA es simple, es sorprendentemente eficaz. Los autores del artículo de MoA descubrieron que los LLMs tienden a generar resultados de mayor calidad cuando se les presentan respuestas de otros LLMs.
Este fenómeno se demostró mediante pruebas comparativas en el conjunto de datos AlpacaEval 2.0 usando seis LLMs diferentes, incluidos Qwen, Wizard, Mixtral, Llama 3 y dbrx. Los autores compararon la calidad de las respuestas de los LLMs bajo dos condiciones: usando prompts de entrada directos frente a usando respuestas de otros modelos. Midieron la calidad utilizando la métrica de tasa de victorias Length Controlled (LC), que evalúa la calidad de la salida independientemente de factores como la longitud de la respuesta, que pueden influir significativamente en los resultados de la evaluación.
Figura: comparación de las tasas de victoria LC de AlpacaEval 2.0 de cada LLM a partir de dos entradas diferentes: directamente desde el prompt del usuario y desde la salida de otros modelos
Figura: comparación de las tasas de victoria LC de AlpacaEval 2.0 de cada LLM a partir de dos entradas diferentes: directamente desde el prompt del usuario y desde la salida de otros modelos. Fuente.
Los resultados fueron consistentes en los seis LLM: lograron mejores puntuaciones de tasa de victoria LC al trabajar con salidas de otros LLM en comparación con procesar directamente los prompts de entrada. Basándose en estos hallazgos, los autores desarrollaron el concepto de MoA, que exploraremos en detalle en la siguiente sección.
El fundamento de Mixture-of-Agents (MoA)
MoA integra varios LLM en un sistema para mejorar iterativamente la calidad de la generación de respuestas.
El sistema consta de múltiples capas, cada una de las cuales contiene varios LLM de diferentes tamaños y capacidades. Los LLM de la primera capa generan respuestas de forma independiente al prompt de entrada. Estas respuestas se presentan luego a los LLM de la segunda capa como entradas, que generan sus propias respuestas independientes. Este ciclo continúa a través de las capas posteriores hasta llegar a la capa final. Al final, un único LLM sintetiza las respuestas de la última capa en una respuesta final para el usuario.
Figura: Ilustración de la estructura de Mixture-of-Agents
Figura: Ilustración de la estructura de Mixture-of-Agents. Fuente.
Basándose en este concepto, los LLM utilizados en MoA pueden clasificarse en dos categorías: propositores y agregadores.
Los propositores generan respuestas dentro de cada capa del sistema MoA, contribuyendo a la calidad de la respuesta final.
Los agregadores recopilan todas las respuestas de los LLM en la última capa y las sintetizan en una respuesta de alta calidad para el usuario.
Dadas las diferentes capacidades y especialidades de los distintos LLM, debemos prestar atención al seleccionar qué modelos usar como propositores y agregadores. Algunos LLM destacan como propositores, mientras que otros funcionan mejor como agregadores, y algunos pueden desempeñar eficazmente ambos roles. Analizaremos los resultados detallados en la siguiente sección.
Dado que MoA puede constar de muchas capas, el mismo LLM puede reutilizarse como propositor ya sea dentro de la misma capa o en diferentes capas. Por ejemplo, podemos construir un sistema MoA con 5 capas, cada una con 5 LLM, y usar el modelo Llama3 70B en todas ellas como propositor único.
Una vez que los propositores de la última capa generan sus respuestas, todas las salidas se estructuran en un único prompt coherente para que el agregador genere la respuesta final.
Aquí tienes un ejemplo de dicho prompt:
Figura: Ejemplo de prompt para sintetizar y agregar respuestas de varios LLM
Figura: Ejemplo de prompt para sintetizar y agregar respuestas de varios LLM. Fuente.
Aunque este concepto es similar al enfoque Mixture-of-Experts (MoE) utilizado en las redes neuronales tradicionales, hay una diferencia clave. En las redes neuronales tradicionales, las capas MoE se implementan como varias subredes dentro de la arquitectura de un único modelo. Por lo tanto, una vez que tenemos nuevos datos que se desvían mucho de los datos de entrenamiento, necesitamos ajustar finamente los pesos de cada capa MoE para optimizar el rendimiento.
Mientras tanto, MoA depende por completo del prompting. Por lo tanto, no es necesario ajustar finamente los LLM para mejorar el rendimiento general del sistema. Esto ofrece una mayor flexibilidad, ya que podemos elegir libremente diferentes LLM como propositores o agregadores, independientemente de su tamaño y arquitectura. Esto también significa que, si en el futuro tenemos un nuevo modelo de última generación, podemos implementar este modelo directamente en nuestro sistema MoA como propositor o agregador.
MoA también ofrece un rendimiento competitivo y sirve como una alternativa eficaz a otros métodos multiagente diseñados para aprovechar diversas capacidades de los LLM, tales como:
Clasificador LLM: este método utiliza múltiples LLM como proponentes para generar de forma independiente respuestas a consultas de entrada. Luego, un LLM independiente selecciona la mejor respuesta entre estos proponentes.
RouteLLM: este método utiliza una función de enrutador entrenada para analizar la complejidad de la consulta y determinar qué LLM deben procesar la entrada.
Resultados de evaluación en conjuntos de datos de referencia
MoA ha sido evaluado en tres conjuntos de datos de referencia: AlpacaEval 2.0, MT-Bench y FLASK.
Se probaron tres variantes diferentes de MoA:
MoA: un sistema de tres capas con seis proponentes por capa (Qwen1.5-110B-Chat, Qwen1.5-72B-Chat, WizardLM-8x22B, LLaMA-3-70B-Instruct, Mixtral-8x22B-v0.1, dbrx-instruct) y Qwen1.5-110B-Chat como agregador.
MoA con GPT-4o: la misma configuración anterior, pero usando GPT-4o como agregador.
MoA-lite: un sistema de dos capas que utiliza los mismos seis proponentes y agregador que el MoA estándar.
Figura: MoA de 2 capas (izquierda) frente a MoA de 3 capas (derecha)
Figura: MoA de 2 capas (izquierda) frente a MoA de 3 capas (derecha). Fuente.
En el conjunto de datos AlpacaEval 2.0, las tres variantes de MoA superaron al modelo de vanguardia, GPT-4 Omni, por hasta un 8,2 %. La configuración de MoA con GPT-4o como agregador logró la tasa de victoria LC más alta entre las variantes.
Las tres variantes de MoA también demostraron un rendimiento competitivo en el conjunto de datos MT-Bench. Si bien el modelo de vanguardia actual, GPT-4 Turbo, tuvo un rendimiento excepcional, MoA con GPT-4o como agregador lo superó. La comparación de rendimiento entre las variantes de MoA y otros modelos de vanguardia se muestra a continuación:
Figura: Resultados en AlpacaEval 2.0 (izquierda) y MT-Bench (derecha)
Figura: Resultados en AlpacaEval 2.0 (izquierda) y MT-Bench (derecha). Fuente.
El conjunto de datos FLASK proporciona una evaluación más granular que AlpacaEval 2.0 y MT-Bench, evaluando 12 aspectos: robustez, corrección, eficiencia, factualidad, sentido común, comprensión, perspicacia, completitud, metacognición, legibilidad, concisión e inocuidad.
La configuración de MoA con Qwen1.5-110B-Chat como agregador superó a GPT-4 Omni en cinco aspectos: corrección, factualidad, perspicacia, completitud y metacognición. Mientras tanto, el rendimiento de otras métricas es bastante comparable al de GPT-4 Omni, aparte de la concisión. La configuración de MoA mostró una disminución notable en concisión, como se ilustra a continuación:
Figura: Resultados en FLASK
Figura: Resultados en FLASK. Fuente.
Ahora que conocemos su rendimiento frente a modelos de vanguardia como la familia GPT-4, también es interesante ver su rendimiento frente a otros métodos relacionados de mezcla de agentes.
Como se mencionó en la sección anterior, un ejemplo de otro método similar a mezcla de agentes es el clasificador LLM, que utiliza múltiples LLM (proponentes) para generar respuestas independientes a un prompt de entrada. En lugar de usar un agregador, el clasificador LLM selecciona la mejor respuesta entre los proponentes.
Para la evaluación, tanto MoA como el clasificador LLM utilizaron los mismos seis proponentes: Qwen1.5-110B-Chat, Qwen1.5-72B-Chat, WizardLM-8x22B, LLaMA-3-70B-Instruct, Mixtral-8x22B-v0.1 y dbrx-instruct. Cada proponente fue probado como agregador para MoA, mientras que el clasificador LLM utilizó únicamente Qwen1.5-110B-Chat para seleccionar la mejor respuesta.
En evaluaciones en el conjunto de datos AlpacaEval 2.0, MoA superó consistentemente a los clasificadores LLM independientemente del agregador utilizado. Esto muestra el potencial del método MoA, donde el agregador al final no simplemente elige una de las respuestas de los proponentes, sino que genera una agregación sobre todas las respuestas de los proponentes para crear una respuesta final más capaz y robusta.
Figura: tasa de victorias LC en AlpacaEval 2.0 con diferentes agregadores en una configuración MoA con 6 proponentes
Figura: tasa de victorias LC en AlpacaEval 2.0 con diferentes agregadores en una configuración MoA con 6 proponentes. Fuente.
Recomendaciones de configuración de Mixture-of-Agents (MoA)
Ahora que hemos visto el rendimiento de MoA frente a la familia GPT-4 utilizando tres variantes con seis proponentes diferentes cada una, surgen dos preguntas clave: ¿Cómo impacta el número de proponentes en el rendimiento general de MoA? ¿Y qué sucede si usamos múltiples LLM idénticos como proponentes en lugar de diferentes?
Para determinar el impacto del número de proponentes, el autor del artículo de MoA evaluó MoA en AlpacaEval 2.0 con números variables de proponentes. Midieron la tasa de victorias LC de configuraciones MoA de 2 capas utilizando 6, 3, 2 y 1 proponentes diferentes. Los resultados indican que más proponentes ayudan al agregador a generar respuestas más robustas.
Además, las configuraciones MoA que utilizan un solo proponente (LLM idénticos como proponentes) tuvieron un peor rendimiento que las configuraciones con múltiples proponentes. Esto sugiere que MoA se beneficia de tener un conjunto diverso de LLM con diferentes especialidades en lugar de usar un único LLM idéntico.
Figura: Efectos del número de proponentes en AlpacaEval 2.0.
Figura: Efectos del número de proponentes en AlpacaEval 2.0. Fuente.
Dadas las ventajas de las configuraciones con múltiples proponentes, también es importante entender qué LLM funcionan mejor en estas configuraciones. Las pruebas de seis LLM diferentes en AlpacaEval 2.0 revelaron que modelos como GPT-4o, Qwen y Llama 3 son lo suficientemente versátiles como para servir tanto como proponentes como agregadores. Sin embargo, modelos como WizardLM funcionan notablemente mejor como proponentes que como agregadores.
Impacto de diferentes LLM utilizados como proponentes frente a agregadores
Impacto de diferentes LLM utilizados como proponentes frente a agregadores. Fuente.
En cuanto a los costos, la dependencia de MoA de múltiples LLM hace que su relación costo-rendimiento sea particularmente interesante en comparación con modelos de última generación como GPT-4o y GPT-4 Turbo. Los experimentos muestran que MoA-Lite puede superar a GPT-4 Turbo en aproximadamente un 4% en AlpacaEval 2.0 mientras reduce los costos en más de la mitad. El costo de MoA-Lite aquí se calcula con base en la información de precios disponible de TogetherAI. Sin embargo, si no tenemos problema en gastar más para maximizar el rendimiento, entonces MoA de 3 capas sería una mejor opción.
Figura: Compensación entre rendimiento y costo (izquierda) y compensación entre rendimiento y TFLOPS (derecha).
Figura: Compensación entre rendimiento y costo (izquierda) y compensación entre rendimiento y TFLOPS (derecha). Fuente.
Para la evaluación de latencia, los autores utilizaron TFLOPS como métrica. TFLOPS se refiere a la capacidad del sistema para realizar un billón de operaciones de punto flotante en un segundo. Aunque TFLOPS no es exactamente comparable con la latencia, el autor utilizó TFLOP como aproximación de la latencia porque la latencia puede variar según los sistemas de inferencia. El resultado de la experimentación mostró que la configuración MoA de 3 capas optimiza sus TFLOPS para maximizar la tasa de victorias LC, como se muestra mediante la línea discontinua de Pareto en la visualización anterior.
Sin embargo, la familia GPT-4 demuestra TFLOPS más altos en comparación con las configuraciones MoA. Esto es esperable, ya que MoA debe procesar múltiples respuestas de LLM antes de generar su salida final. Esto conduce a su principal limitación: Time to First Token (TTFT), que puede afectar negativamente la experiencia del usuario. El trabajo futuro busca abordar esto implementando agregación de respuestas por fragmentos en lugar de agregación de respuestas completas, lo que potencialmente reduciría el TTFT mientras mantiene su rendimiento.
Conclusión
El método Mixture-of-Agents (MoA) ofrece una solución prometedora para aprovechar la diversidad y especialización de los LLM modernos. Al utilizar múltiples LLM con diversas fortalezas mediante un sistema de proponentes y agregadores, MoA crea una respuesta final más capaz y robusta. Su flexibilidad y dependencia de la ingeniería de prompts, en lugar del fine-tuning, lo convierten en un enfoque rentable y adaptable, especialmente para casos de uso multidominio.
Las evaluaciones de referencia en conjuntos de datos como AlpacaEval 2.0 y MT-Bench muestran un rendimiento superior de MoA frente a modelos de última generación como la familia GPT-4. Para optimizar aún más el rendimiento, se recomienda utilizar una configuración de múltiples proponentes en lugar de una de un solo proponente. Sin embargo, MoA no está exento de limitaciones. La dependencia de múltiples LLM aumenta la latencia, lo que afecta la experiencia del usuario debido a un Time to First Token (TTFT) más alto. Por lo tanto, se necesitan mejoras adicionales, como la agregación de respuestas por fragmentos, para optimizar su eficiencia.
Recursos relacionados
Repositorio de MoA en GitHub: https://github.com/togethercomputer/MoA
Artículo de MoA: Mixture-of-Agents mejora las capacidades de los modelos de lenguaje grandes
RouteLLM: Equilibrar costo y calidad en implementaciones de LLM
Implementación de un sistema RAG multimodal con vLLM y Milvus
Evaluación de la seguridad y alineación de LLM en dominios específicos
Sigue leyendo

Why and How to Migrate from Self-Hosted Milvus to Zilliz Cloud
A simple, step-by-step guide to migrating from Milvus to Zilliz Cloud. Learn both endpoint and backup methods for a smooth, scalable vector database migration.

Zilliz Cloud Introduces Advanced BYOC-I Solution for Ultimate Enterprise Data Sovereignty
Explore Zilliz Cloud BYOC-I, the solution that balances AI innovation with data control, enabling secure deployments in finance, healthcare, and education sectors.

How to Use Anthropic MCP Server with Milvus
MCP + Milvus: Streamline AI agent development with standardized data access, eliminating integration hassles while enhancing context and flexibility.


