Évaluation de la sécurité et de l’alignement des LLM dans des domaines spécifiques
Les récentes avancées de l’IA ont donné naissance à de grands modèles de langage sophistiqués (LLMs) aux impacts potentiellement transformateurs dans des domaines à forts enjeux tels que la santé, les services financiers et les secteurs juridiques. Bien que ces modèles offrent des avantages considérables, leur utilisation dans la prise de décisions critiques nécessite une évaluation approfondie afin de garantir la sécurité, l’exactitude et le respect des normes éthiques. Les préoccupations sérieuses concernant l’exactitude, la sécurité et l’équité de ces modèles doivent être traitées avant d’adopter pleinement l’IA dans des environnements aussi sensibles.
Lors d’un récent Unstructured Data Meetup, Zhuo Li, PDG chez of Hydrox AI, a parlé du paysage actuel des évaluations de sécurité pour les LLMs et a partagé des informations sur un projet de cadre d’évaluation en cours, en collaboration avec AI Alliance. Ce projet vise à développer des outils et des méthodes complets pour garantir le déploiement sûr et responsable des LLMs dans des environnements sensibles.
Zhuo Li s’exprimant lors du Sep Unstructured Data Meetup avec l’AI Alliance
Dans ce blog, nous passerons en revue les points clés abordés lors de l’événement et verrons comment des entreprises comme Hydrox AI et AI Alliance s’attaquent aux défis critiques de la sécurité et de l’évaluation de l’IA.
Pourquoi l’évaluation de la sécurité est-elle essentielle ?
Zhuo Li a souligné l’importance des évaluations de sécurité pour les secteurs qui traitent des informations sensibles. Bien que de nombreux LLMs puissent gérer des problèmes généraux de sécurité, ils sont souvent insuffisants dans les scénarios réels auxquels sont confrontés les professionnels de la santé, de la banque ou de l’éducation. Un LLM peut bien fonctionner sur des tâches générales, mais rencontrer des difficultés avec des données sensibles comme des dossiers médicaux ou des états financiers.
Les évaluations de sécurité des LLMs doivent prendre en compte des facteurs tels que l’exactitude, les réglementations juridiques et les responsabilités éthiques. Ces évaluations doivent être continues, car de nouveaux défis et vulnérabilités apparaissent en permanence. Des tests et des améliorations réguliers sont essentiels pour s’adapter à un paysage en évolution.
De plus, les conséquences de sorties d’IA inexactes ou biaisées peuvent être critiques dans des environnements à forts enjeux. Par exemple, dans le domaine de la santé, un mauvais diagnostic suggéré par un LLM pourrait entraîner des traitements inappropriés, mettant en danger la vie des patients. De même, dans la finance, des évaluations de risques inexactes générées par l’IA pourraient entraîner des pertes financières importantes pour les entreprises et les particuliers. Il devient donc impératif de développer des méthodologies d’évaluation robustes afin de protéger les intérêts des parties prenantes.
Défis actuels de l’évaluation de l’IA
L’un des plus grands problèmes dans l’évaluation des modèles d’IA est le manque de fiabilité des benchmarks. Bien que plusieurs outils d’évaluation soient disponibles, beaucoup ne sont pas mis à jour assez souvent ou ne couvrent pas les besoins spécifiques des secteurs qui traitent des données sensibles. Par conséquent, les entreprises pourraient prendre des décisions fondées sur des informations obsolètes ou incomplètes lorsqu’elles choisissent le modèle d’IA à utiliser.
Outre l’absence de benchmarks à jour, il existe également une pénurie d’outils pour aider les gens à comprendre pleinement les risques impliqués et à prendre les bonnes mesures pour y remédier. C’est cette lacune que des entreprises comme Hydrox, en partenariat avec IBM, cherchent à combler au sein de l’AI Alliance. Elles travaillent sur un cadre d’évaluation complet pour les LLMs, actuellement dans une version initiale, adapté aux domaines à forts enjeux. L’objectif est de garantir que ces modèles respectent des normes strictes en matière de sécurité, de conformité juridique et d’utilisation éthique, ce qui contribuera à minimiser les erreurs et les risques.
Les principaux objectifs de ce cadre comprennent :
Évaluer les LLM dans des secteurs critiques comme la santé, la finance et les services juridiques.
Développer un cadre d’évaluation soutenu par des experts du domaine et des applications concrètes.
Preuve de concept (PoC) pour évaluer la sécurité, l’évolutivité et les risques des LLM.
Recommandations inédites dans l’industrie sur l’intégration de l’IA générative en tenant compte de la sécurité, des exigences techniques et des réglementations.
Se concentrer sur les modèles pré-entraînés existants et les tâches spécifiques identifiées par des experts.
La version initiale de ce cadre s’appelle EPASS (Evaluation Platform for AI Safety and Security) et couvre déjà plusieurs méthodes d’attaque, telles que "artprompt" et "gptfuzzer," ainsi que l’analyse de catégories de contenu comme le contenu sexuel et la désinformation.
Études de cas concrètes : santé et éducation
Zhuo Li a partagé quelques études de cas montrant comment ce cadre d’évaluation peut être utilisé dans des domaines sensibles comme la santé et l’éducation.
Les LLM peuvent aider les médecins dans le domaine de la santé en résumant les notes des patients ou en analysant des images médicales, ce qui améliore considérablement l’efficacité. Cependant, compte tenu de la sensibilité des données de santé, les systèmes d’IA doivent garantir la conformité avec des lois comme HIPAA. Le cadre aide à s’assurer que les médecins reçoivent des résultats clairs en vérifiant les modèles d’IA afin de détecter les biais dans les diagnostics ou les suggestions de traitement.
Par exemple, utiliser des LLM pour suggérer des options de traitement à partir de données historiques de patients peut accélérer la prise de décision clinique. Cependant, il est crucial que ces suggestions reposent sur des données exactes et non biaisées afin d’éviter tout préjudice potentiel aux patients. C’est là que les évaluations de sécurité deviennent essentielles, non seulement pour garantir la conformité, mais aussi pour maintenir la confiance des patients, qui doivent être assurés que leurs données sont traitées de manière sécurisée et que les recommandations pilotées par l’IA sont fiables.
Dans l’éducation, l’IA peut être utilisée pour l’enseignement, la notation et les décisions d’évaluation. Cependant, il est essentiel de protéger les données des étudiants, de se conformer aux réglementations sur la confidentialité comme FERPA et de garantir l’exactitude des recommandations de l’IA. Des audits réguliers de ces modèles peuvent aider à identifier et à éliminer les biais, favorisant ainsi la confiance dans les systèmes d’IA parmi les étudiants et les enseignants.
L’IA peut également contribuer à l’apprentissage personnalisé, en adaptant les contenus éducatifs aux besoins individuels des étudiants. Toutefois, les modèles doivent être régulièrement évalués afin d’éviter de renforcer des biais existants ou des inexactitudes dans la notation, ce qui pourrait affecter les performances des étudiants. Un cadre d’évaluation bien structuré peut améliorer l’efficacité de l’apprentissage personnalisé en garantissant que les algorithmes s’adaptent correctement aux styles d’apprentissage et aux parcours des étudiants.
EPASS (Evaluation Platform for AI Safety and Security)
À la fin de son intervention, Zhuo Li a présenté EPASS, une plateforme développée au cours des dix derniers mois. Actuellement, la plateforme prend en charge des cas d’utilisation généraux et diverses méthodes d’attaque, avec des mises à jour régulières et l’ajout de cas d’utilisation plus spécifiques à certains domaines.
VIDÉO EPASS
La figure 1 montre le tableau de bord actuel des modèles, qui affiche le classement de chaque modèle dans quatre domaines :
Sécurité : Risques favorisant le danger, tels que la criminalité et les discours haineux.
Confidentialité : Risques liés aux violations de données, tels que le partage de données et l’inférence d’appartenance.
Sûreté : Risques comportementaux du modèle, tels que le jeu de rôle et l’injection de prompt.
Intégrité : Risques liés à l’éthique du modèle, tels que le droit d’auteur et la fraude.
Figure 1 : Tableau de bord des modèles (100 = le plus sûr, 0 = le moins sûr)
Ces modèles sont régulièrement évalués et mis à jour, et une comparaison de tous les modèles est illustrée dans les figures 2 et 3. Ces figures montrent le score global basé sur les domaines décrits ci-dessus et les scores basés sur les différentes méthodes d’attaque.
Figure 2 : Classement des modèles (Évaluation globale)
Parmi les 19 méthodes d’attaque actuellement disponibles, les suivantes peuvent être mises en avant :
Analyzing-based Jailbreak (ABJ) : Cette méthode tire parti de la capacité des LLM à analyser et à raisonner, révélant leurs faiblesses lorsqu’ils sont confrontés à des tâches analytiques.
ArtPrompt : Cette méthode exploite la difficulté des LLM à comprendre l’art ASCII.
DrAttack : Cette méthode décompose les prompts et les reconstruit à l’aide de recherches de synonymes et d’apprentissage en contexte.
Developer : Cette méthode provoque des jailbreaks en utilisant des prompts qui imitent le mode développeur
Les utilisateurs peuvent évaluer les modèles sur la plateforme et obtenir un score sur les domaines et méthodes d’attaque ci-dessus pour leur cas d’utilisation spécifique. Ceux-ci permettent des mises à jour et améliorations régulières des modèles et fournissent des informations sur les forces et les faiblesses de chacun.
Figure 3 : Classement des modèles (Méthodes d’attaque)
De plus, pour chaque modèle, les utilisateurs peuvent explorer plus en détail les scores globaux à jour (Figure 4) et les scores dans les domaines spécifiques, tels que la sûreté (Figure 5), la confidentialité (Figure 6), la sécurité (Figure 7) et l’intégrité (Figure 8). Par exemple, le score de sûreté est évalué sur la base de problèmes tels que la désinformation, l’éthique, la criminalité et la violence. Dans le domaine de la confidentialité, des facteurs tels que la collecte, la suppression et le partage des données sont cruciaux. Pour la sécurité, l’accent est mis sur l’injection de prompts et les vulnérabilités des API. Enfin, en termes d’intégrité, des préoccupations comme le spam, la fraude et les violations du droit d’auteur sont incluses.
Figure 4 : Score global
Figure 5 : Score de sûreté
Figure 6 : Score de confidentialité
Figure 7 : Score de sécurité
Figure 8 : Score d’intégrité
Il est également possible d’utiliser le playground de la plateforme pour valider les prompts selon les critères ci-dessus. Si une attaque est détectée par le modèle, le problème spécifique sera mis en évidence avec une courte description, comme le montre la figure 9.
Cette ventilation détaillée des évaluations fournies dans la plateforme EPASS informe non seulement les utilisateurs sur les vulnérabilités potentielles des LLM, mais leur permet également de prendre des mesures proactives pour sécuriser leurs applications. En comprenant les différentes façons dont les modèles peuvent échouer ou être manipulés, les parties prenantes peuvent prendre des décisions éclairées quant à la mise en œuvre de protections et de mécanismes de surveillance.
De plus, les collaborations continues, telles que celles facilitées par AI Alliance, ainsi que les initiatives de sensibilisation destinées aux utilisateurs et aux développeurs, sont cruciales dans le paysage évolutif du déploiement de l’IA. À mesure que les LLM s’intègrent de plus en plus aux opérations quotidiennes, il est essentiel que les équipes saisissent à la fois les capacités et les limites de ces modèles. Les plateformes collaboratives comme EPASS, qui abordent l’éthique de l’IA, la sûreté et les limites techniques, peuvent favoriser une culture d’utilisation responsable de l’IA. Cette approche collective aide non seulement à prévenir les écueils potentiels, mais améliore également la sécurité globale, garantissant que les technologies d’IA sont appliquées efficacement et de manière éthique dans des environnements à forts enjeux.
Figure 9 : Score d’intégrité
Conclusion
À mesure que l’IA continue d’évoluer, la demande d’évaluations de sécurité ne fera qu’augmenter. Des entreprises comme Hydrox AI et AI Alliance mènent les efforts pour garantir que les LLMs puissent fonctionner dans des domaines à forts enjeux sans compromettre l’exactitude, la sécurité ou l’éthique. Il ne s’agit pas seulement de fonctionnalité, mais de garantir une utilisation sûre et responsable.
La présentation de Zhuo Li a souligné la nécessité d’une collaboration continue entre les développeurs d’IA, les experts de domaine et les entreprises. L’avenir de l’IA dans des secteurs comme la santé, la finance et l’éducation repose sur notre capacité à évaluer et à améliorer continuellement ces modèles.
Bien que l’IA ait le potentiel de révolutionner les domaines à forts enjeux, sa mise en œuvre doit être réfléchie et prudente. En créant des cadres et des outils d’évaluation complets, Hydrox et ses partenaires établissent les bases d’un avenir piloté par l’IA plus sûr et plus responsable.
De plus, à mesure que ces technologies continuent de se développer, il est crucial que les parties prenantes — y compris les décideurs politiques, les dirigeants de l’industrie et les chercheurs — participent aux discussions sur les implications éthiques de l’IA. L’établissement de bonnes pratiques, de lignes directrices et de cadres réglementaires contribuera à atténuer les risques et à promouvoir la transparence dans le déploiement de l’IA. Alors que nous évoluons dans ce paysage en mutation rapide, favoriser une culture de responsabilité et de redevabilité dans le développement de l’IA sera essentiel pour garantir que les avantages des LLMs soient concrétisés tout en minimisant les préjudices potentiels.
Continuer à lire
Stop Building AI Data Infra for the Wrong Stage
Learn how AI data infrastructure should evolve from prototype to enterprise scale, and when Vector Lakebase becomes the right architecture for AI apps.

Why AI Databases Don't Need SQL
Whether you like it or not, here's the truth: SQL is destined for decline in the era of AI.

Similarity Metrics for Vector Search
Exploring five similarity metrics for vector search: L2 or Euclidean distance, cosine distance, inner product, and hamming distance.



