Comparaison entre Llama 2 Chat et ChatGPT : leurs performances en réponse aux questions
La communauté de l’IA s’est enthousiasmée pour la récente sortie de Llama 2 par Meta AI. Contrairement à son équivalent propriétaire, ChatGPT, Llama 2 est open source et disponible gratuitement pour une utilisation dans des applications commerciales. Avec son échelle impressionnante et la qualité compétitive de ses réponses, Llama 2 fera des vagues importantes dans l’intelligence artificielle.
Dans cet article, nous présenterons brièvement Llama 2 et évaluerons ses performances pour répondre aux questions par rapport à ChatGPT.
Qu’est-ce que Llama 2 ?
Llama 2 est le dernier grand modèle de langage (LLM) open source de Meta AI, développé en réponse aux modèles GPT d’OpenAI et au modèle PaLM 2 de Google. Llama 2 est gratuit pour toute personne souhaitant l’utiliser à des fins de recherche ou commerciales.
Llama 2 est disponible en trois tailles, avec un nombre impressionnant de 70 milliards, 130 milliards et 700 milliards de paramètres. Cette variété permet aux développeurs de choisir le modèle qui correspond le mieux aux exigences de leur projet. Les modèles pré-entraînés de Llama 2 sont entraînés sur 2 billions de tokens et prennent en charge des longueurs de contexte allant jusqu’à 4096 tokens, soit l’équivalent de GPT-3.
Llama Chat, le modèle affiné de Llama 2, a été entraîné sur plus de 1 million d’annotations humaines et est spécifiquement adapté aux scénarios d’IA conversationnelle. Ce modèle est attrayant pour ceux qui cherchent à créer des chatbots, des assistants virtuels ou tout système conversationnel alimenté par l’IA.
Hallucination de Llama 2 et RAG
Comme de nombreux autres LLM, Llama 2 a été pré-entraîné sur des données publiquement disponibles et rencontre des problèmes d’hallucination lorsqu’il a besoin de connaissances plus pertinentes. La communauté de l’IA a introduit le concept de génération augmentée par récupération (RAG) pour relever ces défis. RAG exploite des connaissances récupérées en externe comme contexte afin d’améliorer la précision des réponses générées par le modèle.
Comment RAG fonctionne avec un pipeline Towhee
De nombreux outils sont disponibles sur le marché pour enrichir les LLM avec des connaissances externes. Towhee en est l’un des principaux exemples. Il s’agit d’un pipeline de machine learning open source qui s’intègre à Llama 2 dans son architecture et prend en charge un traitement flexible des données. Cette section utilisera un petit exemple du Towhee Pipeline pour démontrer le fonctionnement de la solution RAG.
Si vous demandez à Llama 2 « comment installer Towhee », il vous fournira des réponses factuellement incorrectes, non pertinentes ou dénuées de sens, car Llama 2 ne sait rien de Towhee.
Pour résoudre ce problème, nous utilisons un pipeline Towhee afin de combiner des informations supplémentaires sur Towhee et l’historique de conversation avec la question originale destinée à Llama 2. Llama 2 fournira ensuite une réponse plus précise basée sur les actualités.
Ci-dessous se trouve le prompt augmenté pour Llama 2.
from towhee import pipe, ops
p = (
pipe.input('question', 'docs', 'history')
.map(('question', 'docs', 'history'), 'prompt', ops.prompt.question_answer())
.map('prompt', 'answer', ops.LLM.Llama_2('llama-2-13b-chat'))
.output('answer')
)
# Retrieve chat history and additional knowledge.
history=[('What is Towhee?', 'Towhee is a cutting-edge framework designed to streamline the processing of unstructured data through the use of Large Language Model (LLM) based pipeline orchestration.')]
knowledge = ['You can install towhee via `pip install towhee`.']
# Query with retrieved info.
question = 'How to install it?'
answer = p(question, knowledge, history).get()[0]
# Example answer is:
# To install Towhee, you can use the following command in your terminal or
# command prompt:\n```\npip install towhee\n\n```\n\n\n\n'
Pour en savoir plus sur la création de chatbots complexes basés sur RAG avec Towhee, consultez Akcio, un projet de démonstration open source pour la génération augmentée par récupération.
Évaluation de Llama 2 et ChatGPT
Cette section évaluera deux modèles de chatbot : Llama 2 Chat (13B), un modèle Llama 2 avec 13B paramètres affiné pour les instructions de chat, et ChatGPT propulsé par GPT-3.5. Nous testerons les deux modèles avec les mêmes prompts dans plusieurs scénarios courants.
Remarque : Les connaissances externes que nous fournissons à Llama 2 et ChatGPT sont longues. Par conséquent, nous n’afficherons pas l’intégralité du prompt dans ce blog. Si vous êtes intéressé par le prompt complet, veuillez consulter les Connaissances externes fournies à Llama2 et ChatGPT dans un document séparé pour référence.
Cas 1 : Répondre aux questions lorsque des connaissances pertinentes sont fournies
Nous avons fourni à Llama 2 et ChatGPT des actualités financières concernant l’investissement de Volkswagen dans XPENG. Ensuite, nous avons demandé aux deux modèles de répondre à une question sur la base des informations fournies.
Prompt
Vous êtes un récupérateur d’informations. Vous devez utiliser le contenu dans [Knowledge] pour répondre aux questions ; lorsque les connaissances diffèrent de vos connaissances, [Knowledge] a la priorité.
[Knowledge Start]:
Volkswagen a déclaré mercredi avoir signé un accord pour développer conjointement deux nouveaux véhicules électriques pour la Chine avec le constructeur chinois de VE Xpeng. Dans le cadre de l’accord, Volkswagen investira environ 700 millions de dollars dans Xpeng, prenant une participation de 4,99 %…
[Knowledge End]:
Combien Volkswagen a-t-il investi dans XPENG ?
Réponses
ChatGPT : Volkswagen a investi environ 700 millions de dollars dans Xpeng, prenant une participation de 4,99 % dans le constructeur chinois de VE.
Llama 2-chat : D’après les informations fournies dans la section Knowledge, Volkswagen a investi environ 700 millions de dollars dans Xpeng, ce qui correspond à une participation d’environ 4,99 %.
Les deux modèles ont répondu avec précision à la question en se basant sur les connaissances fournies.
Cas 2 : Répondre aux questions lorsque des informations non pertinentes sont fournies
Nous avons simulé un scénario dans lequel les informations récupérées ne sont pas liées à la question et avons testé si les deux modèles pouvaient répondre honnêtement par « Je ne sais pas ». Nous avons fourni aux deux modèles des informations sur l’investissement de Volkswagen dans XPeng Motors, mais avons posé une question non pertinente sur le montant investi par Audi dans XPeng.
Prompt
Vous êtes un récupérateur d’informations. Vous devez utiliser le contenu dans [Knowledge] pour répondre aux questions ; lorsque les connaissances diffèrent de vos connaissances, [Knowledge] a la priorité.
[Knowledge Start]:
Volkswagen a déclaré mercredi avoir signé un accord pour développer conjointement deux nouveaux véhicules électriques pour la Chine avec le constructeur chinois de VE Xpeng. Dans le cadre de l’accord, Volkswagen investira environ 700 millions de dollars dans Xpeng, prenant une participation de 4,99 %…
[Knowledge End]:
Combien Audi a-t-il investi dans XPENG ?
Réponses
ChatGPT :
D’après les connaissances fournies, il n’est pas fait mention d’un investissement direct d’Audi dans Xpeng. Les informations indiquent que Volkswagen, qui est la société mère d’Audi, a signé un accord distinct avec son partenaire historique de coentreprise chinois, SAIC Motor, pour développer conjointement de nouveaux VE de marque Audi destinés au marché chinois. Cependant, il n’y a aucune information indiquant qu’Audi aurait réalisé un investissement direct dans Xpeng. L’investissement d’environ 700 millions de dollars dans Xpeng a été effectué par Volkswagen, et non par Audi.
Llama2-chat :
Selon les informations fournies, Audi n’a investi aucune somme dans Xpeng. C’est Volkswagen qui a investi environ 700 millions de dollars dans Xpeng, acquérant une participation de 4,99 % dans le constructeur chinois de VE.
Llama 2 et ChatGPT ont correctement identifié la lacune dans les connaissances et ont répondu honnêtement.
Cas 3 : Répondre aux questions lorsque des informations illisibles sont fournies
Dans des scénarios d’entreprise réels, les documents textuels peuvent se présenter sous divers formats. Par conséquent, dans ce cas, nous avons proposé aux deux modèles un texte non formaté et illisible sur Tailwind CSS sur GitHub. Ensuite, nous leur avons demandé de répondre à des questions connexes.
Prompt
Vous êtes un outil de récupération d’informations. Vous devez utiliser le contenu dans [Knowledge] pour répondre aux questions ; lorsque les connaissances diffèrent des vôtres, [Knowledge] a la priorité.
[Knowledge Start]:
[['Q: Quels sont quelques exemples de sites web qui utilisent Tailwind CSS ?', 'A: ## Sites e cursos para aprender Tailwind CSS\n- [Tailwind CSS 3 Crash Course](https://www.youtube.com/watch?v=LyRWNJK8I6U&ab_channel=codedamn)\n- [Tailwind in 100 Seconds]...
[Knowledge End]:
Donnez-moi quelques sites web qui utilisent Tailwind?
Réponses
ChatGPT :
Bien sûr ! D’après le [Knowledge] fourni, voici quelques sites web qui utilisent Tailwind CSS :
Tailwind CSS 3 Crash Course (https://www.youtube.com/watch?v=LyRWNJK8I6U&ab_channel=codedamn)
Tailwind in 100 Seconds(https://www.youtube.com/watch?v=mr15Xzb1Ook&ab_channel=Fireship)
Rebuilding Bartik(https://www.oliverdavies.uk/articles/rebuilding-bartik-with-vuejs-tailwind-css) - Rebuilding Bartik (le thème par défaut de Drupal) avec Vue.js et Tailwind CSS.
Rebuilding Airbnb's Home Page(https://web-crunch.com/re-create-airbnbs-home-page-with-tailwind-css) - Reconstruction de la page d’accueil d’Airbnb avec Tailwind CSS.
Typographic defaults in Tailwind CSS(https://www.themes.dev/blog/typographic-defaults-in-tailwind-css/)
Create a responsive navigation menu in Tailwind CSS(https://www.themes.dev/blog/responsive-navigation-menu-tailwind-css/)
Laracasts Weekly Stream: Tailwind(https://www.youtube.com/watch?v=HIPgzWS-Bxg)
More experimentation with Tailwind CSS(https://www.youtube.com/watch?v=nBzfVK3QUzM)
Rebuilding Spotify(https://youtu.be/SLGb2RLie9w)
Ces sites web présentent divers cas d’utilisation et exemples de sites construits avec Tailwind CSS.
Llama2-chat :
Bien sûr, voici quelques exemples de sites web qui utilisent Tailwind CSS :
GitHub - La documentation et les pages marketing de GitHub utilisent Tailwind CSS pour leur style.
Shopify - Shopify utilise Tailwind CSS pour styliser son tableau de bord d’administration et d’autres outils internes.
Atlassian - Le produit Confluence d’Atlassian utilise Tailwind CSS pour sa mise en page responsive et son style.
React Magazine - Le site web de React Magazine est construit avec Tailwind CSS et présente un design épuré et moderne.
The Verge - Les pages d’articles de The Verge utilisent Tailwind CSS pour leur typographie et leurs espacements.
Dribbble - Le site web de Dribbble utilise Tailwind CSS pour son système de grille et sa typographie.
Smashing Magazine - Le site web de Smashing Magazine a été repensé avec Tailwind CSS en 2020.
Laracasts - Laracasts, un site populaire de tutoriels Laravel, utilise Tailwind CSS pour son style.
Statamic - Statamic, un générateur de sites statiques, utilise Tailwind CSS dans sa configuration par défaut.
Figma - Les pages de blog et de documentation de Figma utilisent Tailwind CSS pour leur typographie et leurs espacements.
Ce ne sont là que quelques exemples de sites web qui utilisent Tailwind CSS. De nombreux autres sites web et applications l’utilisent également, et la liste continue de s’allonger à mesure que davantage de développeurs découvrent la puissance et la flexibilité de ce framework.
ChatGPT peut comprendre avec précision les informations textuelles même lorsqu’elles sont présentées dans un balisage Markdown complexe et fournit des réponses de haute qualité. En revanche, Llama2-chat ne parvient pas à comprendre les informations fournies et donne une réponse de moindre qualité fondée uniquement sur ses connaissances.
En plus des trois cas mentionnés ci-dessus, nous avons testé Llama 2 et ChatGPT en question-réponse avec des connaissances propres à un domaine et des informations reformatées. Pour plus de détails, veuillez consulter le document External knowledge provided to Llama2 and ChatGPT.
Principaux enseignements
Llama2 et ChatGPT excellent tous deux pour répondre à des questions basées sur des connaissances du monde réel.
Les deux modèles peuvent déterminer si les connaissances fournies étayent des réponses spécifiques à des questions.
ChatGPT comprend mieux les informations non formatées et illisibles que Llama 2. Cependant, Llama 2 peut fournir des réponses plus précises lorsque nous organisons les informations non formatées.
Évaluation des performances de Llama 2
Dans cette section, nous évaluerons les performances et le coût de déploiement du modèle Llama 2 (13b). Nous l’exécuterons sur llama.cpp et mesurerons ses performances d’inférence avec une quantification en entiers 4 bits et 8 bits en exécutant à plusieurs reprises des prompts échantillonnés. Nous utiliserons l’opérateur Llama 2 du dernier framework Towhee, qui nous permet d’appeler Llama 2 avec seulement quelques lignes de code et de prétraiter les données pour assembler le prompt facilement.
from towhee import ops
chat = ops.LLM.Llama_2('path/to/model_file.bin', max_tokens=2048, echo=True)
message = [{"question": "Building a website can be done in 10 simple steps:"}]
answer = chat(message)
Résultats des tests
Nous avons testé le modèle Llama 2 (13b) à l’aide d’un GPU haut de gamme A100 équipé de 80 Go de mémoire et d’un GPU 2080 standard de niveau ordinateur de bureau avec 12 Go de mémoire.
Performances d’inférence de Llama 2 (13b) avec une quantification en entiers 8 bits
| Carte graphique | Nombre de modèles | Utilisation de la carte graphique | VRAM | TPS |
|---|---|---|---|---|
| 1 x NVIDIA A100 (80G) | 1 | 87% | 19G | 37 jetons/s |
| 1 x NVIDIA A100 (80G) | 2 | 100% | 38G | 45 jetons/s |
| 1 x GeForce RTX 2080 (12G) | GPU insuffisant | / | / | / |
| 2 x GeForce RTX 2080 (12G) | 1 | 40%,40% | 8G + 8G | 18 jetons/s |
Performances d’inférence de Llama 2 (13b) avec une quantification en entiers 4 bits
| Carte graphique | Nombre de modèles | Utilisation de la carte graphique | VRAM | TPS |
|---|---|---|---|---|
| 1 x NVIDIA A100 (80G) | 1 | 80% | 11G | 45 jetons/s |
| 1 x NVIDIA A100 (80G) | 2 | 100% | 22G | 56 jetons/s |
| 1 x GeForce RTX 2080 (12G) | 1 | 86% | 9.3G | 37 jetons/s |
Points clés à retenir
Grâce à la quantification à faible nombre de bits, nous pouvons exécuter sans problème le modèle Llama 2 (13b) sur un seul GPU de niveau ordinateur de bureau. Cette approche vous permet de maximiser la puissance de Llama 2 tout en réduisant les coûts.
L’utilisation de la mémoire GPU est faible lors du déploiement du modèle Llama 2 (13b) sur un A100.
Bien qu’il n’y ait pas de différence significative de performances entre l’exécution de Llama 2 (13b) sur un GPU A100 ou un GPU 2080, les GPU de bureau ont une taille plus réduite et ne peuvent charger que des modèles plus petits sur une seule carte.
Résumé
Dans cet article, nous avons exploré les capacités de Llama 2 Chat (13b) dans le domaine du RAG et ses performances en mode de déploiement llama.cpp.
Llama 2 comprend efficacement les textes de connaissances, répondant avec précision à des questions simples qui rivalisent avec ChatGPT. Cependant, il rencontre des difficultés à maintenir la qualité des réponses lorsqu’il est confronté à une mise en forme de texte complexe.
Llama 2 se distingue par le fait qu’il ne nécessite pas de GPU haut de gamme. Il fonctionne sans problème sur des GPU de niveau ordinateur de bureau, en particulier après une quantification à faible nombre de bits, atteignant un débit impressionnant sur une seule carte NVIDIA A100. De plus, vous pouvez améliorer les performances en exécutant plusieurs modèles sur un seul GPU.
La capacité de Llama 2 à traiter les informations textuelles le rend adapté à divers scénarios RAG. Associé à des bases de connaissances comme Milvus, il peut fournir des réponses de haute qualité.
En conclusion, Llama 2 et d’autres modèles d’IA open source promettent de stimuler l’innovation dans le paysage de l’IA. Ils ont le potentiel d’offrir des expériences de questions-réponses exceptionnelles aux utilisateurs et aux développeurs, ce qui en fait des ajouts passionnants au monde des modèles de langage d’IA.
Continuer à lire

The AWS Outage Was a Wake-Up Call for Vector Database Cross-Region Disaster Recovery
Zilliz Cloud Had the Answer Before the Crisis. Zilliz Cloud is the world's first vector database with native cross-region disaster recovery.

Why I’m Against Claude Code’s Grep-Only Retrieval? It Just Burns Too Many Tokens
Learn how vector-based code retrieval cuts Claude Code token consumption by 40%. Open-source solution with easy MCP integration. Try claude-context today.

Vector Databases vs. Object-Relational Databases
Use a vector database for AI-powered similarity search; use an object-relational database for complex data modeling with both relational integrity and object-oriented features.



