Créer des applications augmentées par LLM avec Zilliz Cloud
Au cours des derniers mois, la sortie de GPT-3.5 en nov. 2022 et de GPT-4 en mars 2023 a déclenché un bouleversement sismique dans la manière dont les utilisateurs interagissent avec les données et les applications. Le pouvoir transformateur de ChatGPT ne réside pas seulement dans sa capacité à générer du texte, mais dans sa compréhension stupéfiante et son adaptabilité au contexte. Il fournit une interface de communication plus naturelle et intuitive, forgeant un lien intime entre les humains et les machines et transformant des tâches ardues en échanges de dialogue sans effort. Ce domaine en plein essor des grands modèles de langage (LLMs) a changé nos attentes et nos désirs à l’égard des applications logicielles, poussant les développeurs vers un avenir où les applications sont utilisées et avec lesquelles on interagit.
Défis actuels des LLMs dans les applications
Malgré leur potentiel, les développeurs doivent relever les défis que les LLMs apportent lorsqu’ils implémentent des LLMs comme ChatGPT dans leurs applications.
Tout d’abord, les LLMs sont principalement entraînés sur des données accessibles au public, de sorte qu’ils manquent parfois de nuance et de contexte concernant des informations propres à un domaine, propriétaires ou privées. Ce manque d’accès aux données privées entrave la capacité du modèle à fournir des solutions ou des réponses adaptées à certaines industries ou applications spécialisées.
Le deuxième défi est connu sous le nom d’hallucination. Ce terme désigne la tendance des LLMs à générer des réponses basées sur des données incomplètes ou inexactes. Comme les LLMs fondent leurs réponses uniquement sur les données sur lesquelles ils ont été entraînés, ils peuvent parfois créer des réponses trompeuses, incorrectes ou entièrement fabriquées lorsqu’ils ont besoin de plus d’informations.
En outre, les LLMs peuvent avoir du mal à rester à jour. Les données d’entraînement deviennent souvent rapidement obsolètes et, en raison des coûts importants associés au réentraînement de ces modèles — de l’ordre de 1,4 million de dollars pour des modèles comme GPT-3 — leur base de connaissances n’est pas mise à jour régulièrement. Cette limitation peut les amener à fournir des informations obsolètes dans leurs réponses.
Du point de vue des performances, utiliser des LLMs pour des applications peut être coûteux et lent. Ils fonctionnent avec un système de facturation basé sur les tokens, où les LLMs comme Chat GPT facturent chaque token utilisé dans une requête. Le coût peut vite s’accumuler, en particulier lorsqu’il s’agit de grands volumes de demandes ou de questions répétitives. De plus, des problèmes de performance peuvent survenir pendant les heures de pointe, entraînant des retards frustrants. De plus, les LLMs imposent une limite stricte au nombre de tokens dans les invites de requête, ce qui restreint la complexité et la longueur des interactions. Par exemple, ChatGPT-3 a une limite de 4 096 tokens, tandis que GPT-4 a une limite de 8 192 tokens.
Enfin, les données de pré-entraînement utilisées par les LLMs sont immuables. Toute information incorrecte ou obsolète incluse pendant la phase d’entraînement persistera, car il n’existe actuellement pas de moyen de modifier, corriger ou supprimer de telles données après l’entraînement.
À mesure que nous nous aventurons davantage dans le monde des applications augmentées par les LLMs, il est crucial de relever ces défis. Surmonter ces défis est là où des solutions innovantes comme Zilliz Cloud et GPTCache entrent en jeu, que nous explorerons dans les sections à venir.
Augmenter les applications LLM avec Zilliz Cloud et GPTCache
Exploiter tout le potentiel des grands LLMs comme ChatGPT dans les applications implique de surmonter des défis critiques en matière de précision, d’actualité de l’information, de rentabilité et de performance, comme indiqué ci-dessus. Des solutions innovantes telles que Zilliz Cloud et GPTCache apportent des réponses robustes à ces problèmes.
Améliorer la précision et l’actualité
Zilliz Cloud apporte des solutions transformatrices qui améliorent considérablement la précision des réponses générées par les LLMs et maintiennent leur base de connaissances à jour.
En permettant aux développeurs et aux entreprises de stocker en toute sécurité des données privées propres à un domaine, contemporaines et confidentielles en dehors des LLM, Zilliz Cloud garantit que les réponses sont exactes et pertinentes. Lorsqu’un utilisateur pose une question, les applications LLM utilisent des modèles d’embedding pour convertir la question en vecteurs. Ensuite, Zilliz Cloud effectue une recherche de similarité afin de proposer les résultats top-k pertinents pour la requête. Ces résultats et la question d’origine forment un contexte complet permettant au LLM de générer des réponses plus précises. Cette approche atténue le problème d’hallucination, où les LLM peuvent produire des informations incorrectes ou inventées en raison de données insuffisantes ou obsolètes.
Fonctionnement de Zilliz Cloud pour la génération augmentée par récupération
De plus, l’intégration de Zilliz Cloud permet des mises à jour régulières de la base de connaissances, garantissant que les LLM peuvent toujours accéder aux informations les plus récentes et exactes. Cette fonctionnalité répond au problème des LLM entraînés sur des données obsolètes, en fournissant aux utilisateurs des réponses qui reflètent les informations les plus récentes.
Maximiser la rentabilité et les performances
Combiner Zilliz Cloud avec GPTCache crée un écosystème qui réduit les coûts opérationnels et améliore les performances des applications LLM.
GPTCache est un cache sémantique open source qui stocke les réponses des LLM. Cette fonctionnalité de stockage est particulièrement bénéfique pour traiter les requêtes répétitives ou similaires, en réduisant les invocations inutiles des LLM qui entraînent une augmentation des coûts et un ralentissement des réponses, en particulier pendant les pics d’utilisation. Lorsqu’un utilisateur pose une question dans cet écosystème, Zilliz Cloud vérifie d’abord GPTCache pour détecter toute réponse préexistante. Si Zilliz Cloud trouve une réponse, il la renvoie rapidement à l’utilisateur. Zilliz Cloud envoie la requête au LLM pour obtenir une réponse s’il ne trouve aucun résultat. Cette réponse est ensuite stockée dans GPTCache pour une utilisation future, optimisant ainsi l’utilisation des ressources.
Fonctionnement de Zilliz Cloud et GPTCache
En travaillant de concert, Zilliz Cloud et GPTCache offrent une solution puissante pour surmonter les défis liés à la mise en œuvre des LLM dans les applications. Cette synergie crée un environnement dans lequel les applications d’IA peuvent générer des réponses plus exactes, opportunes, économiques et performantes, améliorant considérablement l’expérience et l’interaction des utilisateurs.
Démarrer avec la stack CVP pour créer vos applications LLM
Après avoir exploré les solutions robustes que Zilliz Cloud et GPTCache fournissent pour améliorer les applications LLM, l’étape suivante consiste à découvrir comment appliquer ces outils et commencer à créer vos propres applications. Une évolution passionnante de la technologie de l’IA, la stack CVP (ChatGPT/LLMs + une base de données vectorielle + prompt-as-code), offre un cadre robuste pour atteindre cet objectif. Explorons cela plus en détail dans la section suivante.
Pour les personnes qui découvrent ce domaine, OSS Chat est une excellente vitrine de la puissante stack CVP. OSS Chat est un chatbot d’IA qui utilise des informations ancrées provenant de sources telles que GitHub pour répondre à des questions sur des logiciels open source populaires. En arrière-plan, OSS Chat est construit avec Akcio, une stack CVP open source pour la génération augmentée par récupération (RAG). La logique de récupération d’informations est exprimée dans Ackio pour transformer les dépôts GitHub et les pages de documentation en vecteurs d’embedding et stocker les données vectorielles dans Zilliz Cloud. Lorsqu’un utilisateur pose une question sur un projet open source, Zilliz Cloud effectue une recherche de similarité afin de trouver les résultats top-k les plus pertinents. Ces résultats et la question d’origine de l’utilisateur sont recomposés en une invite complète permettant au LLM de renvoyer une réponse de haute qualité.
Pour offrir une expérience d’apprentissage plus interactive, nous vous invitons à participer à un webinaire avec OriginTrail et nous le 7 septembre. Cette session approfondira le processus de création d’applications LLM, vous permettant d’échanger directement avec des développeurs expérimentés et des experts dans le domaine du développement d’applications LLM. La combinaison innovante de Zilliz Cloud, GPTCache et des LLM ouvre de nouvelles possibilités dans le paysage du développement d’applications d’IA. Il n’y a pas de meilleur moment pour explorer ces technologies révolutionnaires et commencer votre parcours.
Premiers pas avec Zilliz Cloud
- Commencez gratuitement avec le nouveau Starter Plan ! Un excellent forfait pour démarrer sans souci d’installation et qui ne nécessite pas de carte de crédit !
- Ou commencez votre essai gratuit de 30 jours du forfait Standard avec $100 de crédits à l’inscription et la possibilité de gagner jusqu’à $200 de crédits au total.
- Approfondissez vos connaissances grâce à la documentation de Zilliz Cloud.
- Consultez le guide de migration de Milvus vers Zilliz Cloud.
Continuer à lire

3 Easiest Ways to Use Claude Code on Your Mobile Phone
Run Claude Code from your phone with Remote Control, Happy Coder, or SSH + Tailscale. Comparison table, setup steps, and tools for typing, memory, and parallel tasks.

Smarter Autoscaling in Zilliz Cloud: Always Optimized for Every Workload
With the latest upgrade, Zilliz Cloud introduces smarter autoscaling—a fully automated, more streamlined, elastic resource management system.

Expanding Our Global Reach: Zilliz Cloud Launches in Azure Central India
Zilliz Cloud expands to Azure Central India. This new region helps customers meet compliance, reduce latency, and optimize cloud costs when building AI applications.


