Desafios na Extração de Dados de Documentos Estruturados em Escala com LLMs
Um dos principais desafios na aplicação de grandes modelos de linguagem (LLMs) está na fase de processamento de dados, particularmente ao lidar com diversos formatos de dados. Normalmente, você pode classificar os dados em três tipos: estruturados, semiestruturados ou não estruturados. Como os LLMs trabalham principalmente com texto, eles são frequentemente aplicados a dados não estruturados, a menos que os dados já estejam organizados em uma tabela relacional.
Em um webinar recente, Tim Spann, Principal Developer Advocate na Zilliz, apresentou o Unstract, uma plataforma de código aberto projetada para simplificar a extração de dados não estruturados e transformá-los em formatos estruturados. Esta ferramenta visa simplificar o gerenciamento de dados automatizando o processo de estruturação.
Neste blog, vamos nos aprofundar nos principais desafios da extração de dados de documentos estruturados, conforme descrito por Shuveb Hussain, cofundador e CEO da Unstract. Também exploraremos como a Unstract lida com vários cenários, incluindo sua integração com bancos de dados vetoriais como o Milvus, para trazer estrutura a dados anteriormente ingerenciáveis.
Limitações atuais
Estruturar dados há muito tempo é algo complexo e demorado, especialmente à medida que os modelos de machine learning exigem quantidades cada vez maiores de dados. Historicamente, uma parte significativa desse trabalho de extração foi feita manualmente — como no caso de documentos manuscritos digitalizados — porque a automação não conseguia atender plenamente às necessidades variadas dos modelos.
Embora os grandes modelos de linguagem (LLMs) tenham avançado a capacidade de analisar e extrair informações de documentos, eles têm limitações notáveis. Os documentos frequentemente aparecem em vários formatos, como tabelas, formulários, gráficos e digitalizações, nos quais a qualidade e a consistência dos dados desempenham um papel crucial para uma extração bem-sucedida. Além disso, muitas aplicações exigem o processamento de grandes quantidades de documentos, e nem todos seguem uma estrutura uniforme. Isso pode exigir personalização adicional no processo de extração, pois os LLMs podem ter dificuldade para lidar com layouts altamente variáveis ou complexos sem intervenção humana.
Figura 1: Desafios de estruturação de dados
A Figura 1 ilustra um gráfico de bolhas de desafios que mostra o panorama dos desenvolvimentos atuais na extração de dados de documentos estruturados. O gráfico destaca três áreas principais:
Um pequeno conjunto de casos de uso que foram resolvidos com sucesso pela tecnologia atual.
Uma parte significativa do mercado está sendo ativamente abordada por grandes modelos de linguagem (LLMs).
Um vasto potencial de casos de negócios não resolvidos que permanecem em aberto. Esses casos podem ser abordados no futuro, dependendo dos avanços em várias tecnologias.
Esta visualização enfatiza a lacuna entre o que é atualmente alcançável e os possíveis avanços em um futuro próximo, como o desenvolvimento de aplicações de agentes de IA.
Extração de documentos
Qualquer pessoa que tenha tentado extrair texto de documentos usando LLMs sabe o quanto pode ser desafiador obter todas as informações necessárias com apenas algumas linhas de código. Embora ferramentas como Co-pilots possam ajudar nesse processo, muitas vezes elas ficam aquém de fornecer uma solução totalmente automatizada. Os dados extraídos nem sempre têm a estrutura desejada, e uma etapa de intervenção humana é frequentemente necessária para organizar as informações no formato correto.
É aqui que a Unstract fornece uma solução totalmente automatizada em que documentos não estruturados podem ser transformados em dados estruturados sem a necessidade de supervisão humana. A Unstract usa uma tecnologia baseada em LLM para extrair as informações.
Figura 2: Extração de Documentos
Unstract Cloud
A Unstract é uma plataforma LLM sem código que se enquadra na categoria de Processamento Inteligente de Documentos (IDP). Ela simplifica a extração de documentos dividindo o processo em duas etapas principais:
Engenharia de Prompts: O Prompt Studio da Unstract permite que os usuários desenvolvam prompts genéricos para tipos específicos de documentos, que podem então ser reutilizados para extrair dados estruturados de outros documentos do mesmo tipo.
Fase de Implantação: Depois que os prompts são criados, eles podem ser implantados de várias maneiras, incluindo como um pipeline ETL, um endpoint de API ou como parte de uma fila de revisão manual para inspeção adicional.
A Unstract oferece duas abordagens para obter extração de dados precisa:
Precisão Aprimorada (Desafio LLM): Este método envolve processar o documento com um LLM e usar um segundo LLM para desafiar a saída do primeiro. Se os dois modelos não chegarem a um consenso, o campo específico que está sendo extraído é definido como null, evitando o risco de dados incorretos serem preenchidos. Isso reduz significativamente o risco de alucinações, pois é improvável que dois modelos de fornecedores diferentes produzam a mesma saída incorreta.
Custos reduzidos
Extração SinglePass: Em vez de enviar vários prompts para campos individuais, esta abordagem consolida todos os prompts em uma única solicitação. O LLM retorna uma saída JSON contendo todos os campos obrigatórios de uma só vez, reduzindo o uso de tokens e a latência.
Extração Resumida: Este método cria um resumo do documento de entrada usando o LLM com base nos prompts do usuário. O resumo é então usado para extrair os campos necessários, otimizando o uso de tokens e reduzindo ainda mais a latência.
Figura 3: Estratégias de Extração da Unstract
As Figuras 4 e 5 mostram um exemplo de um projeto de Extração Single Pass, onde podemos ver que vários prompts são combinados para obter uma única saída JSON.
Figura 4: Unstract Prompt Studio (Analisador de Documentos)
Figura 5: Unstract Prompt Studio (Saída Combinada)
Além disso, os usuários podem configurar várias opções para personalizar o processo de extração. Isso inclui selecionar um banco de dados vetorial como Milvus ou Zilliz Cloud para armazenar e recuperar embeddings vetoriais, escolher um segundo modelo LLM para comparar saídas como custos ou latência, ou selecionar a opção de LLM desafiador se a precisão tiver prioridade sobre os custos.
Figura 6: Unstract Prompt Studio: Configurações
Depois que as configurações forem definidas e os resultados da extração de texto forem satisfatórios, você poderá exportar o workflow como uma ferramenta (Figura 7), selecionar o workflow a ser implantado (Figura 8) e obter o endpoint da API (Figura 9).
Figura 7: Exportar o Workflow como uma Ferramenta
Figura 8: Exportar o Workflow como uma Ferramenta
Figura 9: Implantar Endpoint de API
Estratégias de Recuperação da Unstract
Em Configurações, os usuários podem escolher entre duas estratégias de recuperação:
Simples: Esta estratégia usa uma única consulta para recuperar trechos relevantes de informação, empregando uma combinação de correspondência por palavras-chave e busca vetorial para garantir precisão.
Subpergunta: Esta abordagem envolve decompor uma consulta complexa em subperguntas mais simples. Cada subpergunta recupera informações relevantes, que são então agregadas para fornecer uma resposta abrangente à consulta complexa original.
Embora a abordagem de recuperação simples ofereça velocidade e eficiência de custos, ela pode não captar a compreensão matizada que modelos mais sofisticados podem fornecer.
O recuperador de subperguntas é especialmente valioso para abordar perguntas complexas que precisam integrar informações de vários contextos ou domínios. Ao focar nos requisitos específicos de informação de cada subpergunta, essa abordagem melhora a capacidade do modelo de lidar efetivamente com consultas detalhadas.
Conclusão
O campo da extração de dados de documentos estruturados está mudando rapidamente, graças aos avanços em grandes modelos de linguagem e ferramentas inovadoras como o Unstract. O Unstract oferece uma maneira eficaz de transformar dados não estruturados em formatos estruturados em combinação com bancos de dados vetoriais como o Zilliz Cloud, enquanto se concentra tanto na precisão quanto na economia de custos. Com diferentes estratégias de recuperação, ele ajuda os usuários a lidar com perguntas complexas de uma forma fácil de usar.
Olhando para o futuro, o potencial para melhorias adicionais no processamento inteligente de documentos é enorme, como destacado por Shuveb Hussain durante o webinar. À medida que cresce a necessidade de extração eficiente de dados, plataformas como o Unstract estão prontas para liderar o caminho. Ao aprimorar essas tecnologias, elas ajudam as organizações a transformar dados não estruturados em insights úteis.
Essa mudança rumo ao processamento de documentos totalmente automatizado não se trata apenas de tecnologia; trata-se de mudar como os dados são gerenciados em diferentes setores. Ao adotar esses avanços, as organizações podem descobrir novas oportunidades de crescimento em um mundo cada vez mais orientado por dados.
Continue lendo

Why We Built Vector Lakebase: Rethinking Unstructured Data Architecture for AI
Vector Lakebase: a unified, lake-native data foundation for AI workloads — and an answer to what happens after vector databases succeed.

DeepSeek-OCR Explained: Optical Compression for Scalable Long-Context and RAG Systems
Discover how DeepSeek-OCR uses visual tokens and Contexts Optical Compression to boost long-context LLM efficiency and reshape RAG performance.

The Great AI Agent Protocol Race: Function Calling vs. MCP vs. A2A
Compare Function Calling, MCP, and A2A protocols for AI agents. Learn which standard best fits your development needs and future-proof your applications.



