Le paysage de l’écosystème de la GenAI : au-delà des LLM et des bases de données vectorielles
Depuis le lancement révolutionnaire de ChatGPT il y a 20 mois, l’espace GenAI a connu des développements et des innovations significatifs. Initialement, les grands modèles de langage (LLM) et les bases de données vectorielles ont retenu le plus d’attention. Cependant, l’écosystème GenAI est beaucoup plus vaste et plus complexe que ces deux seuls composants. En tant que créateur de la base de données vectorielle, une pièce d’infrastructure cruciale qui alimente les applications GenAI, je suis ravi d’observer les avancées technologiques rapides et leur impact sur l’industrie. Dans cet article, j’aimerais passer en revue ce qui s’est passé et partager des perspectives sur le paysage de l’écosystème GenAI.
Les applications d’IA générative peuvent être largement classées en deux grands types : la génération augmentée par récupération (RAG) et la génération multimédia. La RAG combine des techniques de recherche d’informations avec des modèles de langage génératifs pour produire des résultats pertinents et cohérents. D’autre part, la génération multimédia exploite des modèles génératifs pour créer du contenu visuel complexe, notamment des publicités créatives et des jumeaux numériques.
Génération augmentée par récupération
La génération augmentée par récupération (RAG) est actuellement l’un des cas d’utilisation les plus populaires de l’IA générative. Un système RAG simple se compose de divers composants, notamment le nettoyage de données de base, un modèle d’embedding, une base de données vectorielle et un LLM. Les systèmes RAG plus avancés, de niveau production, incluent généralement des composants supplémentaires pour améliorer la qualité et l’expérience utilisateur. Comme les systèmes RAG ressemblent à l’architecture des systèmes de recherche traditionnels, de nombreux composants des systèmes de recherche restent aujourd’hui applicables à la RAG.
Un système de recherche typique peut être divisé en deux parties principales : la partie d’indexation hors ligne et la partie de service des requêtes en ligne. De même, la RAG se compose d’une phase d’indexation et d’une phase de service des requêtes en ligne :
Phase d’indexation : La phase d’indexation implique l’acquisition de données à partir de diverses sources, notamment des bases de données, des API et des systèmes de fichiers. Ces données font l’objet d’une analyse de fichiers et d’un découpage du texte pour les préparer à l’analyse. Après traitement, les données sont intégrées dans un format approprié et chargées dans une base de données vectorielle pour une récupération efficace. Certains systèmes RAG intègrent même des techniques avancées d’exploration de données, telles que l’extraction d’étiquettes, la construction de graphes de connaissances et la synthèse, afin d’enrichir les données et d’améliorer le processus de récupération.
Phase de service : La phase de service des requêtes en ligne se concentre sur la compréhension de l’intention de la requête de l’utilisateur et emploie diverses méthodes de récupération, notamment la recherche par similarité vectorielle, pour trouver les informations les plus pertinentes. Le résultat de la récupération est ensuite envoyé à un grand modèle de langage (LLM) pour la génération. Au cours de cette étape, le LLM génère des sorties cohérentes et contextuellement pertinentes à partir des données récupérées. De plus, le LLM peut agir comme un agent, en exploitant des outils externes pour renforcer ses capacités et fournir des réponses plus complètes et plus précises.
Par conséquent, de nombreux projets d’orchestration fournissent des implémentations de divers composants et des paramètres de configuration. La nature complexe de l’architecture nécessite également d’évaluer le système à la fois comme une boîte blanche et comme une boîte noire, ce qui conduit au développement de cadres d’évaluation.
Chaque composant attire également des développeurs qui visent à créer des fonctionnalités meilleures et plus riches, telles que des connecteurs pour chaque source de données et des modèles d’embedding adaptés à des cas d’utilisation spécifiques. Les frameworks d’inférence LLM offrent des options de déploiement plus flexibles pour les LLM au-delà des seuls services API. De plus, les frameworks agentiques aident à mieux exploiter les capacités de raisonnement et d’utilisation d’outils des LLM.
En outre, certains projets abordent le RAG sous différents angles, en explorant des méthodes de récupération alternatives comme les graphes de connaissances, en développant des frameworks frontend web pour des expériences d’interface utilisateur améliorées, et en créant des solutions prêtes à l’emploi qui fournissent l’ensemble du flux de travail RAG, y compris les interfaces utilisateur de chatbot.
Orchestration et optimisation des flux de travail
Pour gérer les flux de travail complexes des applications RAG, des SDK tels que LangChain, LlamaIndex, Haystack, DSPy et Semantic Kernel sont largement utilisés. Ces frameworks d’orchestration permettent aux développeurs de créer, personnaliser et tester des pipelines RAG, en veillant à ce que les pipelines soient composés de manière à obtenir la meilleure qualité de réponse générative pour des cas d’utilisation spécifiques.
Exemple : LlamaIndex
LlamaIndex est un framework permettant de créer des applications enrichies par le contexte à l’aide de LLM. Il permet aux développeurs d’intégrer des LLM avec des données privées en fournissant des outils pour l’ingestion, l’analyse, l’indexation et l’interrogation des données. Cette approche facilite l’utilisation des LLM pour des applications spécifiques, telles que les questions-réponses, les chatbots et la compréhension de documents, en incorporant le contexte provenant de sources de données propres à l’utilisateur, comme les API, les bases de données SQL et les documents. LlamaIndex offre des abstractions programmatiques pratiques de composants couramment utilisés, tels que diverses stratégies de découpage et méthodes de recherche hybride.
Évaluation de la qualité et observabilité
Étant donné que le RAG est un système complexe, obtenir des résultats optimaux dans des scénarios spécifiques peut être difficile. Une méthodologie d’évaluation scientifique est essentielle pour relever ces défis. Des projets tels que Ragas, Arize, Langfuse, Relari AI, Giskard et DeepEval fournissent les métriques et les outils nécessaires à l’évaluation et à l’observabilité. Ils permettent aux développeurs de mesurer quantitativement, de surveiller et de dépanner leurs systèmes RAG.
Exemple : Ragas
Ragas est un framework complet pour évaluer les pipelines RAG. Ragas propose des outils pour évaluer les métriques de qualité des réponses, telles que la fidélité, la pertinence et la précision du contexte. Il prend en charge la génération de jeux de données de test synthétiques, la surveillance des applications RAG en production et l’intégration avec des outils et plateformes d’IA comme LangChain et LlamaIndex. En fournissant un score Ragas harmonisé qui englobe les principaux aspects de performance, ce framework simplifie et quantifie le processus d’évaluation, améliorant ainsi l’efficacité et la fiabilité des pipelines RAG.
Connecteur de données et web scraping
La capacité à intégrer et à traiter de manière fluide des données provenant de multiples sources est cruciale. Des plateformes comme Airbyte, Fivetran sont à la pointe dans la fourniture de connecteurs de données robustes, ainsi que Apify et Zyte pour le web scraping. Elles permettent aux entreprises de collecter, transformer et intégrer efficacement des données dans les flux de travail RAG, facilitant ainsi l’exploitation de la puissance de l’IA pour des missions critiques. L’acquisition de données et la connectivité étaient essentielles pour les systèmes de recherche traditionnels, et elles restent tout aussi pertinentes dans le RAG d’aujourd’hui, qui constitue dans une certaine mesure une nouvelle forme de recherche.
Exemple : Airbyte
Airbyte est une plateforme open source de mouvement de données conçue pour créer des pipelines de données d’extraction et de chargement (EL). Contrairement à de nombreuses plateformes de pipelines de données qui se concentrent principalement sur les grands services, Airbyte prend également en charge l’intégration de services plus petits, souvent négligés. En maintenant une vaste gamme de connecteurs et en favorisant une communauté pour partager des connecteurs personnalisés, Airbyte permet aux entreprises de créer des solutions adaptées à leurs besoins spécifiques. Ses connecteurs de données robustes peuvent traiter des données non structurées en embeddings et les charger dans des bases de données vectorielles comme Milvus pour des recherches de similarité sémantique. Cette capacité aide les entreprises à collecter, transformer et intégrer efficacement des données dans des workflows RAG, améliorant ainsi la prise de décision et les applications de recherche pilotées par l’IA.
Modèles d’embedding et de reranking
Les réseaux neuronaux profonds, tels que les modèles d’embedding, transforment la manière dont les données non structurées sont traitées et comprises. Des entreprises comme OpenAI, Cohere, Voyage AI, Jina AI et Twelve Labs sont à l’avant-garde du développement de modèles avancés qui convertissent les données textuelles et multimodales en vecteurs numériques. Ces embeddings permettent des recherches vectorielles de plus proches voisins approximatifs (ANN), permettant aux applications de fournir des résultats et des insights très pertinents.
Au-delà des modèles d’embedding à usage général, des entreprises comme Voyage AI créent des modèles spécialisés qui améliorent la qualité dans des secteurs spécifiques tels que le juridique et la finance, tandis que Twelve Labs se concentre sur les modèles d’embedding pour la récupération vidéo. Les rerankers, qui sont des modèles entraînés spécialement pour comparer la pertinence sémantique entre une requête et un petit ensemble de documents candidats, peuvent encore améliorer la précision des résultats issus de l’étape initiale de récupération basée sur les vecteurs. Des entreprises comme Cohere, Voyage AI et Jina AI proposent des rerankers pour améliorer la précision de la récupération.
Exemple : Voyage AI
Voyage AI est une équipe de chercheurs en IA issus de Stanford et du MIT, spécialisés dans les modèles de récupération, notamment les modèles d’embedding et les rerankers. Leur modèle phare, voyage-2, entraîné par apprentissage contrastif sur du texte, offre une précision de récupération plus élevée, des fenêtres de contexte étendues et une inférence efficace par rapport aux standards du secteur comme le modèle d’embedding de texte d’OpenAI. Voyage AI fournit à la fois des modèles à usage général et des modèles spécifiques à des domaines, optimisés pour des secteurs tels que la finance, les contextes multilingues, le travail juridique et la récupération de code. Voyage AI propose également des rerankers qui améliorent les résultats de récupération.
Inférence et hébergement des LLM
Avec la demande croissante pour les applications LLM, des solutions efficaces d’hébergement et d’inférence sont essentielles. Des projets comme vLLM, Lepton AI, Fireworks AI et Octo AI fournissent une infrastructure robuste pour déployer et faire évoluer les LLM. Ils intègrent diverses optimisations d’inférence afin de garantir que les modèles fonctionnent efficacement au moment du service.
Exemple : vLLM
vLLM est une bibliothèque open source pour l’inférence et le service optimisés des LLM. Elle utilise le mécanisme PagedAttention pour gérer efficacement la mémoire et prend en charge le traitement par lots continu des requêtes entrantes. La bibliothèque exploite une exécution rapide des modèles grâce aux graphes CUDA/HIP et inclut diverses techniques de quantification telles que GPTQ, AWQ, SqueezeLLM et FP8 KV Cache. vLLM s’intègre parfaitement aux modèles HuggingFace populaires, offrant un service à haut débit avec des algorithmes de décodage comme l’échantillonnage parallèle et la recherche par faisceau. Elle prend en charge le parallélisme tensoriel et de pipeline pour l’inférence distribuée, les sorties en streaming, et inclut un serveur d’API compatible avec OpenAI. De plus, elle propose des fonctionnalités expérimentales comme la mise en cache de préfixes et la prise en charge multi-Lora, et est optimisée pour les GPU NVIDIA et AMD.
Gestion des agents et de la mémoire
L’écosystème GenAI progresse dans la gestion de la mémoire et les systèmes d’IA fondés sur des agents avec des solutions comme MemGPT, Mem0, Camel, AutoGPT et CrewAI. Ces innovations permettent aux applications d’IA de mémoriser l’historique des conversations, d’exploiter des outils et d’interagir entre elles, offrant des interactions plus personnalisées et contextuelles qui améliorent considérablement l’expérience utilisateur.
Exemple : MemGPT
MemGPT est un projet open source visant à simplifier le développement et le déploiement d’agents LLM avec état. En utilisant une hiérarchie de mémoire et un flux de contrôle similaires à ceux des systèmes d’exploitation traditionnels, MemGPT gère automatiquement et intelligemment différents niveaux de stockage, fournissant ainsi un contexte étendu dans la fenêtre de contexte limitée du LLM. MemGPT facilite les connexions à des sources de données externes via RAG et prend en charge la définition et l’appel d’outils ou de fonctions personnalisés, facilitant le développement d’agents LLM avancés avec état.
Outils externes et API pour les agents
L’intégration de modèles d’IA avec divers outils externes et API est cruciale pour étendre les capacités des agents. Des services comme Bing API, Google Search API, Twilio, ainsi que des frameworks tels que OpenAPI, facilitent l’interaction entre agents et outils, permettant aux applications d’accéder à des données, services et fonctionnalités externes et de les exploiter.
Exemple : Bing API
La suite Bing Search API, qui inclut des services comme la recherche web et d’images, fournit des résultats de recherche sûrs, sans publicité et sensibles à la localisation. Cela permet aux agents d’accéder à des informations provenant de milliards de documents web, d’images, de vidéos et de sources d’actualité au moyen d’un seul appel d’API.
Expérience frontend et interface de recherche/chat
La création d’interfaces intuitives pour interagir avec les applications d’IA est essentielle à l’adoption par les utilisateurs. Des frameworks comme Streamlit, Vercel et Gradio simplifient le développement d’applications d’IA en offrant des expériences d’interface utilisateur conviviales. Les développeurs peuvent exploiter ces frameworks pour personnaliser les interfaces afin de répondre aux besoins spécifiques des interactions avec l’IA, comme des boîtes de discussion pour les applications RAG et des fonctionnalités telles que la sélection, le recadrage et la navigation d’images pour la recherche visuelle.
Exemple : Streamlit
Streamlit est un framework Python open source conçu pour permettre aux data scientists et aux ingénieurs IA/ML de créer des applications de données dynamiques et interactives avec un effort de codage minimal. En mettant l’accent sur une syntaxe intuitive et en éliminant le besoin de CSS, HTML ou JavaScript, Streamlit permet aux utilisateurs de créer et de déployer rapidement des applications soignées. Il s’intègre à des bibliothèques de données populaires comme Pandas et NumPy et prend en charge des composants backend pour développer des applications pilotées par l’IA.
Graphe de connaissances (KG)
Les graphes de connaissances améliorent la génération augmentée par récupération en fournissant des données structurées qui améliorent la précision et la pertinence de la récupération d’informations, ce qui se traduit par des réponses générées par l’IA plus précises et contextuelles. Des projets de premier plan comme WhyHow, GraphRAG, and HippoRAG combinent des structures de graphes de connaissances avec des techniques RAG pour améliorer la qualité des résultats de récupération et des réponses générées.
Exemple : WhyHow
WhyHow est une plateforme conçue pour aider les développeurs à organiser et à récupérer plus efficacement des données non structurées, avec un accent sur l’amélioration des systèmes complexes de génération augmentée par récupération (RAG) à l’aide de graphes de connaissances. Elle offre des outils pour l’ingestion flexible de données, prend en charge la création collaborative de graphes en mode multijoueur entre développeurs et experts métier non techniques, et permet une manipulation granulaire des schémas afin d’adapter les graphes à des cas d’utilisation spécifiques. En mettant l’accent sur de petits graphes modulaires et des segments vectoriels, WhyHow améliore la précision de la récupération d’informations. La plateforme est compatible avec les bases de données vectorielles et inclut des fonctionnalités d’exportation vers divers formats. De plus, WhyHow fournit un package open source de récupération fondée sur des règles pour aider à créer des flux de récupération plus précis grâce à des techniques de filtrage avancées.
Services RAG prêts à l’emploi et low-code
Il existe également une demande importante pour des solutions RAG prêtes à l’emploi et low-code. Des projets tels que AnythingLLM, PrivateGPT, Dify, Shakudo, Vectara, Epsilla et FlowiseAI offrent des solutions faciles à utiliser et un certain degré de personnalisation qui permettent aux entreprises de déployer rapidement des capacités d’IA sans nécessiter un développement approfondi ni une expertise métier dans les pipelines de données et les infrastructures de recherche.
Exemple : AnythingLLM
AnythingLLM est une application d’IA tout-en-un qui fournit des chatbots RAG interactifs et des agents IA sans nécessiter de codage. Elle est conçue pour les entreprises à la recherche d’une solution privée, sans configuration, ou d’une application d’IA personnalisable sans exiger une expertise approfondie en codage. AnythingLLM prend en charge à la fois les grands modèles de langage (LLMs) commerciaux et open source ainsi que les bases de données vectorielles. L’application facilite une expérience full-stack grâce à l’hébergement local et distant. Les fonctionnalités clés incluent des espaces de travail pour une gestion organisée des documents, la prise en charge multi-utilisateur avec des paramètres d’autorisation, des agents pour la navigation web et l’exécution de code, un widget de chat intégrable personnalisé, ainsi que la prise en charge de plusieurs types de documents. AnythingLLM fournit également une API développeur pour les intégrations personnalisées.
Génération d’images et de vidéos
L’écosystème GenAI ne se limite pas aux applications basées sur le texte ; il englobe également des avancées significatives dans la génération d’images et de vidéos :
Génération créative et jumeau numérique
Des outils comme Midjourney, Stability AI, Runway, Pika et HeyGen révolutionnent les industries créatives en fournissant des solutions alimentées par l’IA pour générer des images et des vidéos de haute qualité. Ces plateformes permettent aux artistes, aux marketeurs et aux développeurs de créer du contenu visuel captivant, repoussant les limites de la créativité et de l’innovation.
Exemple : Midjourney
Midjourney est un programme et service d’IA générative développé par Midjourney, Inc., un laboratoire de recherche indépendant basé à San Francisco. Il crée des images de haute qualité à partir de descriptions en langage naturel, ou prompts, de manière similaire à DALL-E d’OpenAI et à Stable Diffusion de Stability AI. Les utilisateurs interagissent avec Midjourney via un bot Discord, où ils peuvent générer des images en saisissant des prompts avec la commande /imagine, ce qui produit quatre images avec des options d’agrandissement. Cet outil met en évidence les avancées de l’écosystème GenAI, influençant les industries créatives en élargissant les possibilités de création de contenu numérique.
Réflexion finale
L’écosystème GenAI est un paysage dynamique et en évolution rapide, caractérisé par la diversité de ses composants et sa complexité. Des technologies fondamentales comme les LLMs et les bases de données vectorielles aux innovations en matière d’ingestion de données, d’orchestration et de génération d’images, GenAI redéfinit les frontières de l’intelligence artificielle. À mesure que l’exploration et l’innovation se poursuivent, le potentiel d’impact transformateur dans tous les secteurs est immense. Chez Zilliz, en tant que créateurs de la base de données vectorielle Milvus, nous avons collaboré avec de nombreux partenaires dans le paysage GenAI. Nous sommes impatients d’assister à l’évolution continue de GenAI et d’y contribuer, et nous attendons avec intérêt les possibilités qu’elle apportera.
Continuer à lire

3 Easiest Ways to Use Claude Code on Your Mobile Phone
Run Claude Code from your phone with Remote Control, Happy Coder, or SSH + Tailscale. Comparison table, setup steps, and tools for typing, memory, and parallel tasks.

Smarter Autoscaling in Zilliz Cloud: Always Optimized for Every Workload
With the latest upgrade, Zilliz Cloud introduces smarter autoscaling—a fully automated, more streamlined, elastic resource management system.

Why AI Databases Don't Need SQL
Whether you like it or not, here's the truth: SQL is destined for decline in the era of AI.



