Desafíos en la extracción de datos de documentos estructurados a escala con LLMs
Uno de los desafíos principales al aplicar modelos de lenguaje grandes (LLMs) reside en la fase de procesamiento de datos, especialmente al manejar diversos formatos de datos. Normalmente puedes clasificar los datos en tres tipos: estructurados, semiestructurados o no estructurados. Dado que los LLMs trabajan principalmente con texto, a menudo se aplican a datos no estructurados, a menos que los datos ya estén organizados en una tabla relacional.
En un webinar reciente, Tim Spann, Principal Developer Advocate en Zilliz, presentó Unstract, una plataforma de código abierto diseñada para optimizar la extracción de datos no estructurados y transformarlos en formatos estructurados. Esta herramienta busca simplificar la gestión de datos automatizando el proceso de estructuración.
En este blog, profundizaremos en los principales desafíos de la extracción de datos de documentos estructurados, tal como los describe Shuveb Hussain, cofundador y CEO de Unstract. También exploraremos cómo Unstract aborda diversos escenarios, incluida su integración con bases de datos vectoriales como Milvus, para aportar estructura a datos que antes eran inmanejables.
Limitaciones actuales
Estructurar datos ha sido durante mucho tiempo algo complejo y lento, especialmente a medida que los modelos de aprendizaje automático demandan cantidades de datos cada vez mayores. Históricamente, una parte significativa de este trabajo de extracción se ha realizado manualmente —como en el caso de documentos manuscritos escaneados— porque la automatización no podía satisfacer por completo las necesidades variadas de los modelos.
Aunque los modelos de lenguaje grandes (LLMs) han avanzado en la capacidad de analizar y extraer información de documentos, tienen limitaciones notables. Los documentos suelen aparecer en varios formatos, como tablas, formularios, gráficos y escaneos, donde la calidad y la consistencia de los datos desempeñan un papel crucial en una extracción exitosa. Además, muchas aplicaciones requieren procesar grandes cantidades de documentos, y no todos se ajustan a una estructura uniforme. Esto puede requerir personalización adicional en el proceso de extracción, ya que los LLMs pueden tener dificultades para manejar diseños muy variables o complejos sin intervención humana.
Figura 1: Desafíos de estructuración de datos
La Figura 1 ilustra un gráfico de burbujas de desafíos que muestra el panorama de los desarrollos actuales en la extracción de datos de documentos estructurados. El gráfico destaca tres áreas clave:
Un pequeño conjunto de casos de uso que han sido resueltos con éxito por la tecnología actual.
Una parte significativa del mercado está siendo abordada activamente por los modelos de lenguaje grandes (LLMs).
Un enorme potencial de casos de negocio no resueltos que siguen abiertos. Estos casos podrían abordarse en el futuro, dependiendo de los avances en diversas tecnologías.
Esta visualización enfatiza la brecha entre lo que actualmente es alcanzable y los posibles avances en el futuro cercano, como el desarrollo de aplicaciones de agentes de IA.
Extracción de documentos
Cualquiera que haya intentado extraer texto de documentos usando LLMs sabe lo difícil que puede ser obtener toda la información necesaria con solo unas pocas líneas de código. Aunque herramientas como Co-pilots pueden ayudar en este proceso, a menudo no llegan a proporcionar una solución completamente automatizada. Los datos extraídos no siempre tienen la estructura deseada, y con frecuencia se requiere un paso de intervención humana para organizar la información en el formato correcto.
Aquí es donde Unstract proporciona una solución totalmente automatizada en la que los documentos no estructurados pueden transformarse en datos estructurados sin necesidad de supervisión humana. Unstract utiliza una tecnología basada en LLM para extraer la información.
Figura 2: Extracción de documentos
Unstract Cloud
Unstract es una plataforma LLM sin código que entra en la categoría de Procesamiento Inteligente de Documentos (IDP). Agiliza la extracción de documentos dividiendo el proceso en dos pasos principales:
Ingeniería de prompts: Prompt Studio de Unstract permite a los usuarios desarrollar prompts genéricos para tipos de documentos específicos, que luego pueden reutilizarse para extraer datos estructurados de otros documentos del mismo tipo.
Fase de implementación: Una vez creados los prompts, pueden implementarse de varias maneras, incluso como una canalización ETL, un endpoint de API o como parte de una cola de revisión manual para una inspección adicional.
Unstract ofrece dos enfoques para lograr una extracción de datos precisa:
Precisión mejorada (desafío LLM): Este método implica procesar el documento con un LLM y usar un segundo LLM para cuestionar la salida del primero. Si los dos modelos no llegan a un consenso, el campo específico que se está extrayendo se establece en null, evitando el riesgo de que se completen datos incorrectos. Esto reduce significativamente el riesgo de alucinaciones, ya que es poco probable que dos modelos de diferentes proveedores produzcan la misma salida incorrecta.
Costes reducidos
Extracción SinglePass: En lugar de enviar múltiples prompts para campos individuales, este enfoque consolida todos los prompts en una sola solicitud. El LLM devuelve una salida JSON que contiene todos los campos requeridos en una sola pasada, lo que reduce el uso de tokens y la latencia.
Extracción resumida: Este método crea un resumen del documento de entrada utilizando el LLM en función de los prompts del usuario. Luego, el resumen se utiliza para extraer los campos necesarios, optimizando el uso de tokens y reduciendo aún más la latencia.
Figura 3: Estrategias de extracción de Unstract
Las Figuras 4 y 5 muestran un ejemplo de un proyecto de extracción Single Pass, donde podemos ver que se combinan varios prompts para obtener una única salida JSON.
Figura 4: Unstract Prompt Studio (Analizador de documentos)
Figura 5: Unstract Prompt Studio (Salida combinada)
Además, los usuarios pueden configurar varias opciones para adaptar el proceso de extracción. Estas incluyen seleccionar una base de datos vectorial como Milvus o Zilliz Cloud para almacenar y recuperar embeddings vectoriales, elegir un segundo modelo LLM para comparar resultados como costes o latencia, o seleccionar la opción de LLM de desafío si la precisión tiene prioridad sobre los costes.
Figura 6: Unstract Prompt Studio: Configuración
Una vez que se definen los ajustes y los resultados de la extracción de texto son satisfactorios, puedes exportar el flujo de trabajo como una herramienta (Figura 7), seleccionar el flujo de trabajo que se va a implementar (Figura 8) y obtener el endpoint de API (Figura 9).
Figura 7: Exportar el flujo de trabajo como una herramienta
Figura 8: Exportar el flujo de trabajo como una herramienta
Figura 9: Implementar endpoint de API
Estrategias de recuperación de Unstract
En Settings, los usuarios pueden elegir entre dos estrategias de recuperación:
Simple: Esta estrategia utiliza una sola consulta para recuperar fragmentos de información relevantes, empleando una combinación de coincidencia de palabras clave y búsqueda vectorial para garantizar la precisión.
Subquestion: Este enfoque implica descomponer una consulta compleja en subpreguntas más simples. Cada subpregunta recupera información relevante, que luego se agrega para proporcionar una respuesta integral a la consulta compleja original.
Aunque el enfoque de recuperación simple ofrece rapidez y eficiencia de costes, puede no captar la comprensión matizada que pueden proporcionar modelos más sofisticados.
El recuperador de subpreguntas es especialmente valioso para abordar preguntas complejas que necesitan integrar información de diversos contextos o dominios. Al centrarse en los requisitos de información específicos de cada subpregunta, este enfoque mejora la capacidad del modelo para gestionar consultas detalladas de manera efectiva.
Conclusión
El campo de la extracción de datos de documentos estructurados está cambiando rápidamente, gracias a los avances en los modelos de lenguaje grandes y a herramientas innovadoras como Unstract. Unstract ofrece una forma eficaz de convertir datos no estructurados en formatos estructurados en combinación con bases de datos vectoriales como Zilliz Cloud, al tiempo que se centra tanto en la precisión como en el ahorro de costes. Con diferentes estrategias de recuperación, ayuda a los usuarios a gestionar preguntas complejas de una forma fácil de usar.
De cara al futuro, el potencial de nuevas mejoras en el procesamiento inteligente de documentos es enorme, como destacó Shuveb Hussain durante el seminario web. A medida que crece la necesidad de una extracción de datos eficiente, plataformas como Unstract están listas para liderar el camino. Al mejorar estas tecnologías, ayudan a las organizaciones a convertir datos no estructurados en información útil.
Este cambio hacia el procesamiento de documentos totalmente automatizado no se trata solo de tecnología; se trata de cambiar cómo se gestionan los datos en diferentes sectores. Al adoptar estos avances, las organizaciones pueden descubrir nuevas oportunidades de crecimiento en un mundo cada vez más impulsado por los datos.
Sigue leyendo

Why I’m Against Claude Code’s Grep-Only Retrieval? It Just Burns Too Many Tokens
Learn how vector-based code retrieval cuts Claude Code token consumption by 40%. Open-source solution with easy MCP integration. Try claude-context today.

How to Use Anthropic MCP Server with Milvus
MCP + Milvus: Streamline AI agent development with standardized data access, eliminating integration hassles while enhancing context and flexibility.

Vector Databases vs. Hierarchical Databases
Use a vector database for AI-powered similarity search; use a hierarchical database for organizing data in parent-child relationships with efficient top-down access patterns.



