Sécuriser l’IA : stratégies avancées de confidentialité avec PrivateGPT et Milvus
Introduction
À mesure que les organisations intègrent les Large Language Models (LLMs) et d’autres outils d’IA dans leurs opérations, les préoccupations liées à la sécurité des données augmentent. Par exemple, des secteurs clés comme la finance, la banque, la santé et l’e-commerce adoptent l’IA pour alimenter toute une série de fonctions, de la création de contenu et la synthèse de documents au support client et aux questions-réponses basées sur des prompts. Cependant, cette adoption généralisée de l’IA introduit également des risques substantiels, tels que de potentielles violations de la confidentialité des données et des infractions aux normes de conformité.
Pour atténuer ces risques, les entreprises recherchent des solutions qui leur permettent d’exploiter la puissance de l’IA sans compromettre la sécurité de leurs données sensibles. Lors d’un récent webinar organisé par Zilliz, Daniel Gallego Vico, fondateur de PrivateGPT et de Zylon, a offert des perspectives précieuses sur diverses infrastructures de données conçues pour renforcer la confidentialité des données dans les environnements d’entreprise. Dans cet article de blog, nous résumerons les points clés de la présentation de Daniel et proposerons notre point de vue sur ces évolutions. Si vous souhaitez en savoir plus, regardez le replay de son intervention sur YouTube.
Comment les outils d’IA menacent la confidentialité des données : risques et impacts
Figure- L’adoption de l’IA est inarrêtable. .png
Figure : L’adoption de l’IA est inarrêtable.
Daniel met en avant une statistique frappante tirée du rapport 2024 Work Trend Index : “75 % des travailleurs du savoir dans le monde utilisent désormais l’IA dans leurs tâches professionnelles.” Cette adoption généralisée souligne l’inévitabilité de l’intégration de l’IA sur les lieux de travail, mais elle met également en lumière des défis importants pour la protection des données privées :
Fuite de données dans les sorties des modèles : Lorsque les employés utilisent des LLMs comme ChatGPT pour analyser les données de l’entreprise, ces modèles, entraînés sur de vastes ensembles de données, peuvent inclure par inadvertance des fragments de leurs données d’entraînement dans leurs sorties. Cela peut entraîner la fuite involontaire d’informations sensibles, exposant potentiellement des détails issus des prompts et des documents utilisés pendant la session.
Rétro-ingénierie de données anonymisées : Malgré les efforts visant à chiffrer ou anonymiser les informations permettant d’identifier une personne (PII), telles que les noms, adresses et numéros de carte de crédit, ces protections ne sont pas impénétrables. Des hackers expérimentés ont réussi à employer des techniques de rétro-ingénierie pour décoder des données chiffrées, ce qui représente une menace importante pour la confidentialité des données.
Attaques par inférence de modèle : Dans ces attaques, un adversaire soumet diverses entrées à un modèle d’IA et analyse les réponses afin de déduire si des données spécifiques étaient incluses dans l’ensemble d’entraînement. Par exemple, cette méthode pourrait révéler si les dossiers médicaux d’un patient particulier ont été utilisés pour entraîner un système d’IA destiné au secteur de la santé, compromettant ainsi la confidentialité du patient.
Figure- L’IA brise la confidentialité. .png
Figure : L’IA brise la confidentialité.
Au-delà de ces risques spécifiques, les menaces pesant sur la confidentialité des données proviennent également du scraping de données, de violations dues à des mesures de sécurité inadéquates et de la possibilité que les modèles d’IA mémorisent des données sensibles pendant l’entraînement. Toute exposition de données client peut entraîner de graves problèmes juridiques pour les organisations qui ne respectent pas les normes réglementaires.
Différents niveaux de confidentialité de l’IA
Le développement d’applications d’IA, telles que des chatbots ou la génération augmentée par récupération (RAG), nécessite souvent l’intégration de divers services tiers, notamment des LLM, des fournisseurs cloud, des modèles d’embedding et des bases de données vectorielles comme Milvus. S’assurer que tous ces services respectent des normes strictes en matière de confidentialité et de sécurité des données est essentiel, mais difficile.
Une gamme de solutions de confidentialité pour l’IA est disponible afin de répondre à ces préoccupations en matière de confidentialité, chacune offrant différents niveaux de sécurité des données selon son infrastructure. Il est crucial pour les organisations de bien comprendre chaque option afin de choisir la solution qui répond le mieux à leurs besoins.
Daniel a partagé cinq stratégies distinctes de confidentialité pour l’IA : SaaS conforme, anonymisation des données, exécution locale, développement interne et infrastructure sur site agnostique. Dans les sections suivantes, nous aborderons ces solutions, leurs avantages et leurs limites afin d’éclairer votre processus de prise de décision.
SaaS conforme
Le SaaS conforme représente le niveau fondamental de confidentialité des données, où une organisation respecte des normes réglementaires telles que le GDPR ou HIPAA. Initialement, les données sont stockées au sein de l’infrastructure de l’entreprise, puis partagées avec un fournisseur d’AI Software as a Service (SaaS). Ce fournisseur peut, à son tour, partager les données avec divers vendeurs tiers pour des tâches telles que la création de vector embeddings (avec des outils comme Milvus), l’entraînement de LLM (comme OpenAI) et la gestion de l’ingestion des données.
Figure- AI Solutions by Privacy Level - Compliant SaaS .png
Figure : Solutions d’IA par niveau de confidentialité - SaaS conforme
Cependant, cette stratégie comporte des risques importants. Une violation chez n’importe quel vendeur tiers pourrait entraîner un accès non autorisé aux données de votre organisation. De plus, ces tiers ont un accès complet aux données téléversées et pourraient potentiellement les utiliser pour entraîner leurs propres modèles, ce qui pose des risques supplémentaires de mauvaise utilisation des données.
Anonymisation des données
L’anonymisation des données est une solution d’infrastructure renforçant la confidentialité, conçue pour sécuriser les données dans des pipelines SaaS ou basés sur le cloud. Une couche d’anonymisation supplémentaire est appliquée avant le partage des données avec un fournisseur SaaS. Au cours de ce processus, les informations personnellement identifiables (PII)—telles que les noms, adresses et numéros de carte de crédit—sont masquées ou remplacées par du chiffrement. Cette anonymisation devrait idéalement avoir lieu sur site, au sein de l’infrastructure sécurisée de l’entreprise.
Figure- AI Solutions by Privacy Level - Data Anonymization .png
Figure : Solutions d’IA par niveau de confidentialité - Anonymisation des données
Bien que l’anonymisation puisse réduire considérablement les risques que des données sensibles soient réidentifiées ou utilisées abusivement par des tiers, elle présente des inconvénients. L’entraînement de LLM sur des données anonymisées peut entraîner une diminution de la précision des résultats ou des inférences. De plus, malgré la couche de protection supplémentaire, des attaquants peuvent encore être en mesure de réidentifier des informations partielles en les corrélant avec d’autres ensembles de données.
Exécution locale
L’exécution locale fait fonctionner l’ensemble du pipeline d’IA sur un appareil isolé, tel qu’un ordinateur personnel ou un serveur. Cette méthode offre une grande confidentialité des données, car les données restent dans votre système et les LLM peuvent fonctionner hors ligne. Elle est particulièrement adaptée aux chercheurs individuels travaillant avec des ensembles de données plus petits.
Figure- AI Solutions by Privacy Level - Local Execution.png
Figure : Solutions d’IA par niveau de confidentialité - Exécution locale
Cependant, la faisabilité de l’exécution locale peut être limitée en raison de coûts de configuration élevés. Fonctionner entièrement sur des systèmes locaux nécessite des GPU à forte capacité de calcul et des appareils puissants pour obtenir des résultats de haute qualité. En outre, l’exécution locale peut ne pas être la meilleure option pour les projets collaboratifs impliquant plusieurs personnes ou équipes, car elle restreint l’accessibilité aux données et la collaboration en temps réel.
Développement en interne
Le développement en interne crée un pipeline d’IA complet de bout en bout au sein de l’infrastructure sécurisée d’une entreprise. Cette approche garantit que les performances des LLM ne sont pas compromises tout en réduisant considérablement le risque de fuite de données. Elle facilite également l’accès aux données et la collaboration entre les équipes au sein d’une entreprise.
Figure- AI Solutions by Privacy Level - In-House Development.png
Figure : Solutions d’IA par niveau de confidentialité - Développement en interne
Cependant, la mise en œuvre d’une solution en interne nécessite un investissement initial substantiel, tant en argent qu’en temps, ce qui la rend réalisable principalement pour les grandes entreprises. Les entreprises doivent tout mettre en place à partir de zéro, y compris la base de données vectorielle, les modèles d’embedding, les GPU et l’interface front-end. De plus, des équipes techniques doivent être recrutées et formées pour construire et maintenir le système, ce qui s’ajoute aux coûts à long terme et aux exigences opérationnelles.
Indépendant de l’infrastructure sur site
Pour les petites entreprises et les startups qui ne peuvent pas se permettre de construire une infrastructure à grande échelle à partir de zéro, les espaces de travail d’IA tout-en-un comme Zylon offrent une solution viable. Dans ce modèle, les données restent au sein de l’infrastructure de l’entreprise tandis que l’espace de travail fournit les composants nécessaires pour exécuter des LLM et effectuer des tâches d’inférence localement. Zylon intègre des outils de confidentialité tels que PrivateGPT, qui permet aux utilisateurs d’exécuter des modèles d’IA générative entièrement sur du matériel local ou au sein de leur infrastructure sécurisée.
Figure- AI Solutions by Privacy Level - On-prem Infra Agnostic.png
Figure : Solutions d’IA par niveau de confidentialité - Indépendant de l’infrastructure sur site
Avec cette approche, Zylon n’a pas accès aux données de l’entreprise, ce qui permet aux entreprises de tirer parti des capacités de l’IA sans compromettre la confidentialité. Cependant, une limite importante de cette solution est la nécessité pour les organisations de mettre en place leurs centres de données afin de conserver le contrôle de leurs données, ce qui peut être coûteux. Cette exigence peut imposer des contraintes aux petites entreprises disposant de ressources en capital limitées.
Qu’est-ce que PrivateGPT et comment renforce-t-il la confidentialité de l’IA ?
PrivateGPT est un framework conçu pour développer des LLM sensibles au contexte avec des contrôles renforcés de confidentialité des données. Il met à la disposition des utilisateurs une suite d’outils et d’API d’IA pour diverses tâches, telles que la création d’embeddings avec des modèles d’embedding, la réalisation de recherches de similarité à l’aide de bases de données vectorielles comme Milvus, ou l’utilisation de LLM préentraînés pour l’inférence.
Le diagramme ci-dessous illustre le pipeline PrivateGPT, qui comprend généralement un LLM que les utilisateurs finaux peuvent interroger, un modèle d’embedding qui transforme du texte ou des images en embeddings vectoriels, et une base de données vectorielle pour stocker ces embeddings.
Figure- PrivateGPT Architecture and Components.png
Figure : Architecture et composants de PrivateGPT
PrivateGPT offre une flexibilité considérable, permettant aux utilisateurs de personnaliser les configurations et de sélectionner les API ou les modèles qui répondent le mieux à leurs besoins. Par exemple, les utilisateurs peuvent choisir parmi divers LLM comme Llama ou Mistral, selon la complexité requise et la rapidité de l’application. Il est également crucial pour les utilisateurs de sélectionner une base de données vectorielle robuste et capable d’offrir des vitesses de récupération rapides, comme Milvus. En outre, plusieurs options sont disponibles pour les modèles d’embedding, y compris ceux de Hugging Face et NOMIC, offrant un large éventail de choix pour répondre aux différentes exigences des projets et améliorer les performances globales du système.
Pour construire des applications d’IA à l’aide de PrivateGPT, les développeurs ont accès à deux grandes catégories d’API REST : Primitives API et Recipes API. Ces API sont conçues pour faciliter la création d’applications d’IA privées et sensibles au contexte, tout en maintenant une confidentialité stricte des données.
Primitives API
Cette catégorie d’API permet aux équipes de développer des applications d’IA avec différents niveaux de personnalisation :
High-Level API : Adaptée aux utilisateurs qui préfèrent une approche simple sans besoins de personnalisation approfondie, cette API propose un pipeline RAG prêt à l’emploi. Les équipes peuvent téléverser des documents, et l’API gère de nombreuses tâches de traitement des données, telles que l’analyse, le découpage, la création d’embeddings de métadonnées et leur stockage. Elle permet également le prompt engineering afin de fournir des réponses fondées sur le contexte aux requêtes des utilisateurs.
Low-Level API : Cette API permet aux utilisateurs recherchant davantage de contrôle sur leurs applications d’IA de créer et de personnaliser des composants individuels du pipeline RAG. De la logique derrière les embeddings vectoriels aux procédures d’ingestion de documents, les utilisateurs peuvent expérimenter pour découvrir les stratégies les plus efficaces en matière de récupération de données.
Recipes API
API avancée de haut niveau récemment introduite, la Recipes API permet aux utilisateurs de construire des workflows structurés, ou « recettes », pour des tâches d’IA spécifiques telles que la synthèse. Cette API est précieuse pour les entreprises souhaitant développer des workflows personnalisés qui s’alignent sur leurs exigences métier uniques. Elle peut s’intégrer de manière transparente à des bases de données locales ou à des systèmes de gestion de contenu, permettant aux entreprises d’automatiser et d’optimiser leurs processus internes sans transmettre de données à des serveurs externes.
Configurations PrivateGPT pour une exécution locale
Daniel fournit des informations sur la configuration de PrivateGPT pour une exécution locale, idéale pour maintenir une confidentialité des données à 100 % et fonctionner hors ligne. Daniel recommande d’utiliser Ollama pour les tâches d’inférence dans cette configuration, qui prend en charge les configurations GPU et s’intègre de manière transparente à divers modèles LLM. Cette flexibilité est cruciale pour s’adapter à différents types de données — texte, audio ou images — et à des tâches computationnelles spécifiques. Les choix de LLM populaires sont Llama et Mistral AI, connus pour leurs performances robustes dans divers cas d’utilisation.
Pour la base de données vectorielle, Daniel conseille d’utiliser Milvus Lite, une version simplifiée de la base de données vectorielle Milvus largement reconnue, réputée pour ses capacités de recherche de similarité à grande échelle. Grâce à sa faible consommation de ressources, Milvus Lite est idéal pour les environnements disposant de ressources limitées. Il facilite les recherches rapides de similarité et la récupération de données, ce qui en fait un excellent choix pour les applications à petite échelle qui ne nécessitent pas d’infrastructure étendue.
De plus, Daniel suggère de sélectionner un modèle d’embedding qui prend en charge un large éventail de langues. Cela garantit que les embeddings vectoriels créés s’appliquent à divers contextes internationaux et besoins linguistiques, améliorant ainsi l’utilité globale et la portée de l’application d’IA.
Figure- The Recommended PrivateGPT Setups for Local Deployment .png
Figure : Les configurations PrivateGPT recommandées pour un déploiement local
Configurations PrivateGPT pour une exécution dans le cloud
Lors du développement d’applications d’IA à grande échelle, il est recommandé de configurer PrivateGPT pour une exécution dans le cloud, permettant aux utilisateurs d’accéder à leurs instances depuis n’importe où dans le monde. Cette configuration implique des exigences d’infrastructure plus complexes et plus élevées que l’exécution locale. Daniel présente une stratégie efficace pour établir une architecture cloud qui maximise l’efficacité tout en protégeant la confidentialité des données.
Pour commencer, les utilisateurs auront besoin d’une instance cloud auprès de fournisseurs de services tels qu’AWS. Daniel recommande d’installer Milvus Standalone comme base de données vectorielle sur cette instance cloud à l’aide de Docker. Milvus Standalone propose un déploiement à nœud unique qui, malgré sa simplicité, fournit tout de même des capacités complètes de recherche vectorielle, d’indexation et de stockage, ce qui le rend idéal pour les applications PrivateGPT.
De plus, la mise en place d’un serveur NodeJS sur l’instance cloud permet un accès et une interaction fluides avec l’application d’IA. Ce serveur agit comme un intermédiaire, gérant les requêtes vers et depuis le modèle PrivateGPT, garantissant des opérations transparentes et efficaces sur le réseau.
Figure- The Recommended PrivateGPT Setups for Cloud Deployment.png
Figure : Les configurations PrivateGPT recommandées pour un déploiement dans le cloud
Résumé
Dans cet article, nous avons abordé la confidentialité des données dans le développement d’applications d’IA, en particulier lors du traitement d’informations client sensibles. Nous avons appris que le simple respect des normes réglementaires ne protège pas vraiment les données contre des attaques sophistiquées comme la rétro-ingénierie et l’inférence de modèle.
Nous avons également examiné de près diverses stratégies de confidentialité des données, en évaluant les investissements et les risques associés à chacune. Daniel a partagé des observations sur la manière dont l’intégration d’outils comme PrivateGPT avec des bases de données vectorielles telles que Milvus améliore la précision des sorties des LLM et protège la confidentialité. Nous avons également proposé des conseils pratiques pour mettre en place des architectures sécurisées pour des déploiements locaux et basés sur le cloud, afin de garantir que les entreprises puissent créer des systèmes d’IA robustes et efficaces tout en respectant des normes strictes de protection des données.
Ressources complémentaires
Garantir la confidentialité des données dans la recherche IA avec Langchain et Zilliz Cloud
Le paysage de l’écosystème GenAI : au-delà des LLM et des bases de données vectorielles
Créer des applications d’IA avec Milvus : tutoriels et notebooks
Modèles d’IA les plus performants pour vos applications GenAI | Zilliz
Continuer à lire

Introducing Zilliz CLI and Agent Skills for Zilliz Cloud
Manage your vector database from your terminal or AI coding agent. Zilliz CLI and Agent Skills work with Claude Code, Cursor, Codex, and Copilot.

Zilliz Cloud Update: Smarter Autoscaling for Cost Savings, Stronger Compliance with Audit Logs, and More
What's new in Zilliz Cloud? Smarter autoscaling with scale-down, audit logs GA, enhanced SSO, and Milvus 2.6 in Private Preview.

The Real Bottlenecks in Autonomous Driving — And How AI Infrastructure Can Solve Them
Autonomous driving faces a data bottleneck. Learn how AI-native vector databases like Zilliz solve scale, cost, and insight challenges across AV pipelines.



