Défis de l’extraction de données de documents structurés à grande échelle avec les LLMs
L’un des principaux défis dans l’application des grands modèles de langage (LLMs) réside dans la phase de traitement des données, en particulier lorsqu’il s’agit de gérer divers formats de données. Vous pouvez généralement classer les données en trois types : structurées, semi-structurées ou non structurées. Étant donné que les LLMs fonctionnent principalement avec du texte, ils sont souvent appliqués à des données non structurées, sauf si les données sont déjà organisées dans une table relationnelle.
Lors d’un récent webinaire, Tim Spann, Principal Developer Advocate chez Zilliz, a présenté Unstract, une plateforme open source conçue pour rationaliser l’extraction de données non structurées et les transformer en formats structurés. Cet outil vise à simplifier la gestion des données en automatisant le processus de structuration.
Dans cet article de blog, nous allons nous pencher sur les principaux défis de l’extraction de données documentaires structurées, tels que décrits par Shuveb Hussain, cofondateur et CEO d’Unstract. Nous explorerons également la manière dont Unstract aborde différents scénarios, notamment son intégration avec des bases de données vectorielles comme Milvus, afin d’apporter de la structure à des données auparavant ingérables.
Limites actuelles
La structuration des données est depuis longtemps complexe et chronophage, d’autant plus que les modèles de machine learning exigent des quantités de données toujours plus importantes. Historiquement, une part importante de ce travail d’extraction a été effectuée manuellement — comme dans le cas de documents manuscrits numérisés — parce que l’automatisation ne pouvait pas répondre pleinement aux besoins variés des modèles.
Bien que les grands modèles de langage (LLMs) aient amélioré la capacité à analyser et à extraire des informations à partir de documents, ils présentent des limites notables. Les documents apparaissent souvent dans divers formats, tels que des tableaux, des formulaires, des graphiques et des scans, où la qualité et la cohérence des données jouent un rôle crucial dans la réussite de l’extraction. En outre, de nombreuses applications nécessitent le traitement de vastes quantités de documents, et tous n’adhèrent pas à une structure uniforme. Cela peut exiger une personnalisation supplémentaire dans le processus d’extraction, car les LLMs peuvent avoir du mal à gérer des mises en page très variables ou complexes sans intervention humaine.
Figure 1 : Défis de structuration des données
La Figure 1 illustre un graphique à bulles des défis présentant le paysage des développements actuels dans l’extraction de données documentaires structurées. Le graphique met en évidence trois domaines clés :
Un petit ensemble de cas d’utilisation qui ont été résolus avec succès par la technologie actuelle.
Une part importante du marché est activement traitée par les grands modèles de langage (LLMs).
Un vaste potentiel de cas d’affaires non résolus qui restent ouverts. Ces cas pourraient être traités à l’avenir, selon les avancées de diverses technologies.
Cette visualisation souligne l’écart entre ce qui est actuellement réalisable et les percées potentielles dans un avenir proche, comme le développement d’applications d’agents IA.
Extraction de documents
Quiconque a tenté d’extraire du texte de documents à l’aide de LLMs sait à quel point il peut être difficile d’obtenir toutes les informations nécessaires avec seulement quelques lignes de code. Bien que des outils comme les Co-pilots puissent aider dans ce processus, ils ne parviennent souvent pas à fournir une solution entièrement automatisée. Les données extraites peuvent ne pas toujours avoir la structure souhaitée, et une étape d’intervention humaine est fréquemment requise pour organiser les informations dans le bon format.
C’est là qu’Unstract fournit une solution entièrement automatisée permettant de transformer des documents non structurés en données structurées sans nécessiter de supervision humaine. Unstract utilise une technologie basée sur les LLM pour extraire les informations.
Figure 2 : Extraction de documents
Unstract Cloud
Unstract est une plateforme LLM no-code qui relève de la catégorie du traitement intelligent des documents (IDP). Elle rationalise l’extraction de documents en divisant le processus en deux étapes principales :
Prompt Engineering : Le Prompt Studio d’Unstract permet aux utilisateurs de développer des prompts génériques pour des types de documents spécifiques, qui peuvent ensuite être réutilisés pour extraire des données structurées d’autres documents du même type.
Phase de déploiement : Une fois les prompts créés, ils peuvent être déployés de différentes manières, notamment sous forme de pipeline ETL, de point de terminaison API, ou dans le cadre d’une file d’attente de révision manuelle pour une inspection plus approfondie.
Unstract propose deux approches pour obtenir une extraction de données précise :
Précision améliorée (LLM Challenge) : Cette méthode consiste à traiter le document avec un LLM et à utiliser un second LLM pour remettre en question la sortie du premier. Si les deux modèles ne parviennent pas à un consensus, le champ spécifique en cours d’extraction est défini sur null, évitant ainsi le risque de renseigner des données incorrectes. Cela réduit considérablement le risque d’hallucinations, car il est peu probable que deux modèles de fournisseurs différents produisent la même sortie erronée.
Coûts réduits
Extraction SinglePass : Au lieu d’envoyer plusieurs prompts pour des champs individuels, cette approche regroupe tous les prompts en une seule requête. Le LLM renvoie une sortie JSON contenant tous les champs requis en un seul passage, réduisant ainsi l’utilisation des tokens et la latence.
Extraction résumée : Cette méthode crée un résumé du document d’entrée à l’aide du LLM sur la base des prompts de l’utilisateur. Le résumé est ensuite utilisé pour extraire les champs nécessaires, optimisant l’utilisation des tokens et réduisant davantage la latence.
Figure 3 : Stratégies d’extraction d’Unstract
Les figures 4 et 5 montrent un exemple de projet d’extraction en un seul passage, où l’on peut voir que plusieurs prompts sont combinés afin d’obtenir une seule sortie JSON.
Figure 4 : Unstract Prompt Studio (Analyseur de documents)
Figure 5 : Unstract Prompt Studio (Sortie combinée)
De plus, les utilisateurs peuvent configurer diverses options afin d’adapter le processus d’extraction. Celles-ci incluent la sélection d’une base de données vectorielle comme Milvus ou Zilliz Cloud pour stocker et récupérer des vector embeddings, le choix d’un second modèle LLM pour comparer les sorties, comme les coûts ou la latence, ou la sélection de l’option LLM Challenge si la précision est prioritaire par rapport aux coûts.
Figure 6 : Unstract Prompt Studio : Paramètres
Une fois les paramètres définis et les résultats de l’extraction de texte satisfaisants, vous pouvez exporter le workflow en tant qu’outil (Figure 7), sélectionner le workflow à déployer (Figure 8) et obtenir le point de terminaison API (Figure 9).
Figure 7 : Exporter le workflow en tant qu’outil
Figure 8 : Exporter le workflow en tant qu’outil
Figure 9 : Déployer le point de terminaison API
Stratégies de récupération d’Unstract
Dans les paramètres, les utilisateurs peuvent choisir entre deux stratégies de récupération :
Simple : Cette stratégie utilise une seule requête pour récupérer des fragments d’information pertinents, en employant une combinaison de correspondance par mots-clés et de recherche vectorielle afin de garantir l’exactitude.
Subquestion : Cette approche consiste à décomposer une requête complexe en sous-questions plus simples. Chaque sous-question récupère des informations pertinentes, qui sont ensuite agrégées pour fournir une réponse complète à la requête complexe d’origine.
Bien que l’approche de récupération simple offre rapidité et rentabilité, elle peut ne pas saisir la compréhension nuancée que des modèles plus sophistiqués peuvent fournir.
Le récupérateur de sous-questions est particulièrement précieux pour traiter des questions complexes qui nécessitent d’intégrer des informations provenant de divers contextes ou domaines. En se concentrant sur les besoins d’information spécifiques de chaque sous-question, cette approche améliore la capacité du modèle à traiter efficacement des requêtes détaillées.
Conclusion
Le domaine de l’extraction de données à partir de documents structurés évolue rapidement, grâce aux progrès des grands modèles de langage et d’outils innovants comme Unstract. Unstract offre un moyen efficace de transformer des données non structurées en formats structurés en combinaison avec des bases de données vectorielles comme Zilliz Cloud, tout en mettant l’accent à la fois sur l’exactitude et les économies de coûts. Grâce à différentes stratégies de récupération, il aide les utilisateurs à traiter des questions complexes de manière conviviale.
À l’avenir, le potentiel d’améliorations supplémentaires dans le traitement intelligent des documents est immense, comme l’a souligné Shuveb Hussain lors du webinaire. À mesure que le besoin d’une extraction efficace des données augmente, des plateformes comme Unstract sont prêtes à ouvrir la voie. En améliorant ces technologies, elles aident les organisations à transformer des données non structurées en informations exploitables.
Cette transition vers un traitement entièrement automatisé des documents ne concerne pas seulement la technologie ; elle vise à changer la manière dont les données sont gérées dans différents secteurs. En adoptant ces avancées, les organisations peuvent découvrir de nouvelles opportunités de croissance dans un monde de plus en plus axé sur les données.
Continuer à lire

How to Improve Retrieval Quality for Japanese Text with Sudachi, Milvus/Zilliz, and AWS Bedrock
Learn how Sudachi normalization and Milvus/Zilliz hybrid search improve Japanese RAG accuracy with BM25 + vector fusion, AWS Bedrock embeddings, and practical code examples.

Announcing the General Availability of Single Sign-On (SSO) on Zilliz Cloud
SSO is GA on Zilliz Cloud, delivering the enterprise-grade identity management capabilities your teams need to deploy vectorDB with confidence.
Milvus/Zilliz + Surveillance: How Vector Databases Transform Multi-Camera Tracking
See how Milvus vector database enhances multi-camera tracking with similarity-based matching for better surveillance in retail, warehouses and transport hubs.



