Estrazione di tabelle e layout complessi
Tabelle multipagina, celle unite, layout annidati — estratti con la struttura intatta.
Il problema: la struttura è la prima vittima
I documenti con tabelle e layout complessi sono il punto in cui la maggior parte degli strumenti di estrazione fallisce. L'OCR standard legge i caratteri ma perde le relazioni spaziali. Gli LLM elaborano il testo ma non riescono a ricostruire in modo affidabile la struttura delle tabelle dall'input visivo. Anche gli strumenti specializzati spesso convertono le tabelle in Markdown, che appiattisce le celle unite, distrugge i row span ed elimina la struttura relazionale che rende significativi i dati.
I documenti del mondo reale che contano di più — bilanci con sotto-tabelle annidate, cartelle cliniche con risultati di laboratorio su più pagine, polizze assicurative con matrici di copertura, specifiche di ingegneria con tabelle di parametri — sono esattamente quelli che si rompono.
Una tabella che si estende su tre pagine con celle di intestazione unite e gruppi di righe gerarchici non è un caso limite. È un martedì qualsiasi.
Pipeline multi-stadio: dal layout alla struttura all'estrazione
anyformat elabora i documenti complessi attraverso una pipeline multi-stadio che separa analisi del layout, riconoscimento della struttura ed estrazione dei dati in fasi distinte:
Fase 1 — Analisi del layout: il sistema identifica le regioni del documento: blocchi di testo, tabelle, figure, intestazioni, piè di pagina ed elementi di corredo della pagina. Ogni regione viene classificata e ancorata spazialmente.
Fase 2 — Riconoscimento della struttura: per le tabelle, il sistema ricostruisce la struttura completa della griglia: confini di righe e colonne, celle unite, gerarchie di intestazioni e relazioni di span. Per le tabelle multipagina, la struttura viene ricucita attraverso le interruzioni di pagina preservando la continuità.
Fase 3 — Estrazione dei dati: compresa la struttura, il sistema estrae i valori nelle loro posizioni corrette dentro la struttura riconosciuta. L'output è JSON strutturato che preserva ogni relazione — non testo appiattito.
Questa separazione conta. Quando analisi del layout, riconoscimento della struttura ed estrazione vengono compressi in un unico passaggio (come fa la maggior parte degli strumenti basati su LLM), il sistema deve risolvere tre problemi contemporaneamente. Gli errori si accumulano. anyformat li risolve in sequenza, con ogni fase che valida la precedente.
Preservazione della struttura delle tabelle attraverso le interruzioni di pagina
Quando una tabella inizia a pagina 4 e finisce a pagina 7, la maggior parte degli strumenti tratta ogni frammento di pagina in modo indipendente. Il risultato sono quattro tabelle parziali separate con intestazioni perse, righe duplicate e relazioni spezzate.
anyformat rileva le continuazioni delle tabelle attraverso le interruzioni di pagina e ricostruisce la tabella completa come un'unica struttura. Le intestazioni vengono associate a tutte le righe che governano, anche quando la riga di intestazione è a pagine di distanza dai dati. I gruppi di righe e i subtotali mantengono le loro relazioni gerarchiche dall'inizio alla fine.
Gestione di celle unite e layout annidati
Le celle unite — con span sia orizzontali sia verticali — sono una fonte persistente di errori di estrazione. Una cella che si estende su tre righe crea ambiguità: a quale riga appartiene il valore? Un'intestazione che si estende su cinque colonne raggruppa semanticamente quelle colonne, ma la maggior parte degli strumenti perde quel raggruppamento.
anyformat modella esplicitamente gli span delle celle nella sua struttura di output. Una cella unita è rappresentata con le sue coordinate di span, non duplicata sulle righe né compressa nella prima cella. Le tabelle annidate (tabelle dentro celle di tabella) vengono estratte ricorsivamente come sotto-oggetti strutturati.
Rilevamento e classificazione delle figure
I documenti complessi contengono più di testo e tabelle. Grafici, diagrammi, fotografie, firme, timbri e immagini incorporate portano informazioni che l'estrazione del testo perde del tutto.
anyformat rileva le figure nei documenti, le classifica per tipo (grafico, diagramma, fotografia, firma) e genera descrizioni strutturate che catturano cosa rappresenta l'elemento visivo nel contesto. È particolarmente prezioso per documenti tecnici, verbali di ispezione e articoli scientifici in cui le figure sono contenuto portante.
Punteggi di confidenza per cella
Non tutte le celle di una tabella complessa sono ugualmente facili da estrarre. Un valore numerico stampato chiaramente in una tabella ben strutturata può meritare il 99% di confidenza. Un'annotazione a mano in una cella unita a cavallo di un'interruzione di pagina può meritare il 60%.
anyformat assegna punteggi di confidenza calibrati a livello di cella, non solo di documento o di campo. Questo significa che i sistemi a valle e i revisori umani sanno esattamente di quali valori fidarsi e quali verificare. Il costo di un valore sbagliato in una tabella finanziaria o in una cartella clinica non è astratto — la confidenza per cella rende la revisione efficiente e mirata.
Nessuna conversione Markdown con perdita
Molti strumenti di estrazione — inclusi LlamaParse e altri parser orientati al RAG — convertono i documenti in Markdown come rappresentazione intermedia. Markdown è un formato di testo. Non è stato progettato per rappresentare la struttura delle tabelle.
Quando una tabella con celle unite, intestazioni gerarchiche e span multipagina viene convertita in Markdown, il risultato è una griglia delimitata da pipe che ha perso la maggior parte delle sue informazioni strutturali. Quella perdita è di solito irrecuperabile — l'estrazione a valle non può ricostruire ciò che la conversione ha distrutto.
anyformat produce JSON strutturato che preserva la struttura completa della tabella. Row span, column span, gerarchie di intestazioni, tipi di cella e relazioni posizionali vengono tutti mantenuti. Nessun passaggio intermedio in Markdown. Nessuna conversione con perdita.
Il benchmark RD-TableBench di Reducto dimostra quanto sia difficile l'estrazione di tabelle complesse. anyformat affronta quella sfida preservando la struttura lungo tutta la pipeline, dall'analisi del layout all'output JSON finale.
Visual grounding: vedi ciò che vede il sistema
Ogni valore estratto in anyformat è visivamente ancorato — collegato alla sua posizione esatta nel documento sorgente. Quando un revisore mette in dubbio un valore, può vedere il bounding box sul documento originale, verificando non solo il testo estratto ma dove il sistema lo ha trovato.
Per i layout complessi in cui lo stesso numero può apparire in più celle di tabella, il visual grounding elimina l'ambiguità su quale cella sia stata estratta.
Costruito per i documenti che rompono tutto il resto
Se i tuoi documenti sono semplici moduli di una pagina con layout coerenti, la maggior parte degli strumenti funzionerà. Se i tuoi documenti contengono tabelle multipagina con celle unite, strutture annidate, figure e annotazioni a mano, ti serve una pipeline costruita per la complessità.
Prova anyformat sui tuoi documenti più complessi →
anyformat è la piattaforma di intelligenza documentale costruita per le imprese che elaborano documenti complessi e ad alto rischio. Certificata ISO 27001, conforme al GDPR, con elaborazione zero-retention e deployment on-premise. Scopri di più su anyformat.ai
