Extração de tabelas e layouts complexos
Tabelas de várias páginas, células unidas, layouts aninhados — extraídos com a estrutura intacta.
O problema: a estrutura é a primeira vítima
Os documentos com tabelas e layouts complexos são onde a maioria das ferramentas de extração falha. O OCR padrão lê carateres, mas perde as relações espaciais. Os LLM processam texto, mas não conseguem reconstruir com fiabilidade a estrutura das tabelas a partir do input visual. Mesmo as ferramentas especializadas convertem muitas vezes as tabelas para Markdown, o que aplana as células unidas, destrói as células que atravessam linhas e elimina a estrutura relacional que dá significado aos dados.
Os documentos do mundo real que mais importam — demonstrações financeiras com sub-tabelas aninhadas, registos clínicos com resultados de análises em várias páginas, apólices de seguros com matrizes de coberturas, especificações de engenharia com tabelas de parâmetros — são exatamente os que quebram.
Uma tabela que atravessa três páginas, com células de cabeçalho unidas e grupos hierárquicos de linhas, não é um caso-limite. É uma terça-feira qualquer.
Pipeline multi-fase: do layout à estrutura e à extração
A anyformat processa documentos complexos através de um pipeline multi-fase que separa a análise de layout, o reconhecimento de estrutura e a extração de dados em fases distintas:
Fase 1 — Análise de layout: o sistema identifica as regiões do documento: blocos de texto, tabelas, figuras, cabeçalhos, rodapés e elementos de página. Cada região é classificada e ancorada espacialmente.
Fase 2 — Reconhecimento de estrutura: para as tabelas, o sistema reconstrói a estrutura completa da grelha: limites de linhas e colunas, células unidas, hierarquias de cabeçalhos e relações de células que atravessam várias posições. Nas tabelas de várias páginas, a estrutura é cosida através das quebras de página, com a continuidade preservada.
Fase 3 — Extração de dados: com a estrutura compreendida, o sistema extrai os valores para as suas posições corretas dentro da estrutura reconhecida. O resultado é JSON estruturado que preserva todas as relações — não texto aplanado.
Esta separação importa. Quando a análise de layout, o reconhecimento de estrutura e a extração são fundidos num único passo (como fazem a maioria das ferramentas baseadas em LLM), o sistema tem de resolver três problemas em simultâneo. Os erros acumulam-se. A anyformat resolve-os em sequência, com cada fase a validar a anterior.
Preservação da estrutura das tabelas nas quebras de página
Quando uma tabela começa na página 4 e termina na página 7, a maioria das ferramentas trata cada fragmento de página de forma independente. O resultado são quatro tabelas parciais separadas, com cabeçalhos perdidos, linhas duplicadas e relações quebradas.
A anyformat deteta as continuações de tabelas nas quebras de página e reconstrói a tabela completa como uma única estrutura. Os cabeçalhos são associados a todas as linhas que governam, mesmo quando a linha de cabeçalho está a páginas de distância dos dados. Os grupos de linhas e os subtotais mantêm as suas relações hierárquicas do princípio ao fim.
Células unidas e layouts aninhados
As células unidas — tanto na horizontal como na vertical — são uma fonte persistente de erros de extração. Uma célula que atravessa três linhas cria ambiguidade: a que linha pertence o valor? Um cabeçalho que atravessa cinco colunas agrupa essas colunas semanticamente, mas a maioria das ferramentas perde esse agrupamento.
A anyformat modela explicitamente as células unidas na sua estrutura de saída. Uma célula unida é representada com as suas coordenadas de extensão, não duplicada por linhas nem colapsada na primeira célula. As tabelas aninhadas (tabelas dentro de células de tabelas) são extraídas recursivamente como sub-objetos estruturados.
Deteção e classificação de figuras
Os documentos complexos contêm mais do que texto e tabelas. Gráficos, diagramas, fotografias, assinaturas, carimbos e imagens incorporadas transportam informação que a extração de texto ignora por completo.
A anyformat deteta as figuras nos documentos, classifica-as por tipo (gráfico, diagrama, fotografia, assinatura) e gera descrições estruturadas que captam o que o elemento visual representa no contexto. Isto é particularmente valioso em documentos técnicos, relatórios de inspeção e artigos científicos, onde as figuras são conteúdo estrutural.
Pontuação de confiança por célula
Nem todas as células de uma tabela complexa são igualmente fáceis de extrair. Um valor numérico bem impresso numa tabela bem estruturada pode merecer 99% de confiança. Uma anotação manuscrita numa célula unida que atravessa uma quebra de página pode merecer 60%.
A anyformat atribui pontuações de confiança calibradas ao nível da célula, não apenas do documento ou do campo. Assim, os sistemas a jusante e os revisores humanos sabem exatamente em que valores confiar e quais verificar. O custo de um valor errado numa tabela financeira ou num registo clínico não é abstrato — a confiança por célula torna a revisão eficiente e direcionada.
Sem conversão com perdas para Markdown
Muitas ferramentas de extração — incluindo o LlamaParse e outros parsers orientados para RAG — convertem os documentos para Markdown como representação intermédia. O Markdown é um formato de texto. Não foi desenhado para representar a estrutura de tabelas.
Quando uma tabela com células unidas, cabeçalhos hierárquicos e extensão por várias páginas é convertida para Markdown, o resultado é uma grelha delimitada por barras verticais que perdeu a maior parte da sua informação estrutural. Essa perda é normalmente irrecuperável — a extração a jusante não consegue reconstruir o que a conversão destruiu.
A anyformat produz JSON estruturado que preserva a estrutura completa da tabela. Células que atravessam linhas e colunas, hierarquias de cabeçalhos, tipos de células e relações posicionais são todos mantidos. Sem passo intermédio em Markdown. Sem conversão com perdas.
O benchmark RD-TableBench da Reducto demonstra o quão exigente é a extração de tabelas complexas. A anyformat responde a esse desafio preservando a estrutura ao longo de todo o pipeline, da análise de layout ao JSON final.
Visual grounding: veja o que o sistema vê
Cada valor extraído na anyformat tem visual grounding — está ligado à sua posição exata no documento de origem. Quando um revisor questiona um valor, pode ver a bounding box no documento original, verificando não só o texto extraído mas também onde o sistema o encontrou.
Em layouts complexos, onde o mesmo número pode aparecer em várias células de uma tabela, o visual grounding elimina a ambiguidade sobre que célula foi extraída.
Construída para os documentos que quebram tudo o resto
Se os seus documentos são formulários simples de uma página, com layouts consistentes, a maioria das ferramentas serve. Se os seus documentos contêm tabelas de várias páginas com células unidas, estruturas aninhadas, figuras e anotações manuscritas, precisa de um pipeline construído para a complexidade.
Experimente a anyformat nos seus documentos mais complexos →
A anyformat é a plataforma de inteligência documental criada para empresas que processam documentos complexos e críticos. Certificada ISO 27001, em conformidade com o RGPD, com processamento com retenção zero e instalação on-premise. Saiba mais em anyformat.ai
