LlamaParse è una API di parsing documentale sviluppata da LlamaIndex, lanciata a febbraio 2024, progettata per convertire documenti in formati pronti per gli LLM nei workflow di retrieval-augmented generation (RAG). Ha la certificazione SOC 2 Type 2 e LlamaCloud dichiara conformità al GDPR.
È davvero veloce: un benchmark di terze parti pubblicato da Procycons a marzo 2025 ha misurato circa 6 secondi sia per 1 pagina sia per 50 pagine in modalità batch. L'uso a pagamento funziona a crediti, 1,25 $ ogni 1.000 crediti, il che equivale a circa 0,00125 $ per pagina in modalità Fast e fino a circa 0,11 $ per pagina nella modalità agentica più costosa (listino LlamaIndex, 2026).
anyformat risolve un problema adiacente: estrazione validata su schema, avvolta in orchestrazione dei workflow, revisione umana e sovranità dei dati europea.
Personalizzazione e approccio all'estrazione
Entrambe le piattaforme fanno estrazione guidata da schema. LlamaParse produce output in Markdown, testo, JSON o XLSX, e LlamaExtract accetta uno schema JSON e restituisce valori tipizzati con un punteggio di confidenza per campo e citazioni che rimandano al passaggio di origine. L'estrazione su schema non è una lacuna.
Quello che cambia è il valore predefinito. Markdown è la strada usata dalla maggior parte dei tutorial LlamaIndex, e Markdown non può rappresentare celle unite, row span o relazioni annidate: sceglierlo scarta la geometria della tabella senza avvisare. La modalità JSON di layout la conserva, bounding box per cella incluse.
anyformat estrae contro uno schema che definisci tu, in zero-shot, e restituisce JSON validato, con i campi a livello di documento e a livello di tabella dichiarati insieme e restituiti in una sola chiamata. Ogni campo porta con sé un punteggio di confidenza calibrato e una citazione visiva che punta alla sua posizione esatta sulla pagina.
LlamaIndex ha la SOC 2 Type 2 e LlamaCloud dichiara conformità al GDPR, con condizioni da responsabile del trattamento disponibili per i clienti enterprise. Il suo trust center non elenca pubblicamente la ISO 27001, lo standard che gli uffici acquisti europei chiedono più spesso. L'assenza da un trust center pubblico non dimostra che i controlli manchino, ma gli acquisti trattano di norma una certificazione non elencata come una certificazione assente.
anyformat è certificato ISO 27001 e conforme al GDPR, con SLA enterprise e supporto dedicato.
Sovranità europea e residenza dei dati
LlamaIndex è una società statunitense, quindi i dati di LlamaCloud restano sotto giurisdizione USA qualunque sia la regione che li elabora. Il deployment bring-your-own-cloud sposta l'elaborazione nella tua VPC, il che risponde alla residenza ma non alla giurisdizione del fornitore che opera il software.
anyformat è nativo UE. Società europea, infrastruttura europea, conformità al GDPR come vincolo architetturale e non come allegato contrattuale. Quando la sovranità è un obbligo di legge e non una preferenza, è questa la distinzione che gli acquisti verificano.
Retention zero dei dati
La offrono entrambi. LlamaParse accetta do_not_cache=True per singola richiesta, così il contenuto elaborato non viene messo in cache. anyformat esegue l'elaborazione a retention zero come modalità a livello di account: né i file di origine né l'output estratto vengono conservati oltre la finestra di elaborazione. La differenza pratica è se l'impostazione sicura è quella predefinita o qualcosa che uno sviluppatore deve ricordarsi a ogni chiamata.
Workflow builder e orchestrazione
Questa è la lacuna più netta. LlamaParse è una API di parsing ed estrazione, e l'orchestrazione vive nel framework LlamaIndex come codice che il tuo team scrive e mantiene. Classificazione, splitting, routing, logica condizionale, gestione dei retry e revisione umana sono tutto lavoro di ingegneria.
anyformat include Studio, una canvas no-code per i workflow: branching, condizioni, splitting, routing, operatori di estrazione, incrocio con fonti dati interne e revisione human-in-the-loop posizionata dove il processo la richiede. I team operativi cambiano il flusso senza un deploy di codice.
Capacità di parsing ed estrazione
LlamaParse gestisce bene i documenti standard e offre modalità costo/accuratezza dalla Fast fino al parsing agentico. Test di terze parti riportano fusione di parole nei layout multicolonna, dati di colonna fuori posto nelle tabelle complesse e nessuna differenziazione strutturale tra i livelli di intestazione (Procycons, 2025). Il riconoscimento della scrittura a mano è parziale e la copertura multilingue è limitata.
anyformat supporta oltre 100 formati senza template e ha ottenuto 78,1% nel punteggio combinato di parsing su oltre 1.000 documenti reali distribuiti su più di 30 tipi documentali (benchmark anyformat, 2026).
Deployment on-premise
LlamaIndex offre deployment self-hosted e bring-your-own-cloud in VPC privata sui principali cloud provider nei piani enterprise; i piani self-service sono solo cloud.
anyformat offre deployment on-premise su tutti i piani, ambienti air-gapped inclusi, senza una soglia enterprise da superare.
Confidenza e revisione umana
LlamaExtract restituisce un punteggio di confidenza per campo insieme alle citazioni, quindi i valori incerti si possono segnalare. Quello che LlamaIndex non pubblica è un dato di calibrazione: se un punteggio di 0,8 corrisponda ad avere ragione circa l'80% delle volte. I punteggi non calibrati non possono reggere una soglia di routing, perché nessun numero della scala è noto come sicuro per l'approvazione automatica.
anyformat misura la calibrazione e la pubblica: 99,1% di accuratezza di calibrazione con un Adaptive ECE di 0,009 (benchmark anyformat, 2026). È questo a rendere operative le soglie: i campi ad alta confidenza passano da soli, quelli incerti vanno a un revisore dentro lo stesso flusso. anyformat include anche una suite di evals con cui i team misurano quel comportamento sui propri documenti prima di andare in produzione.
Tabelle lunghe e layout complessi
La modalità JSON di layout di LlamaParse restituisce bounding box per cella, quindi la geometria della tabella sopravvive se la scegli. Sulla strada Markdown, no.
Per le tabelle lunghe in particolare, la risposta architetturale di LlamaParse è l'estrazione a livello di riga: trattare ogni riga come un target di estrazione indipendente, eseguirle in parallelo, riassemblare. È una risposta ragionata al bias posizionale a U sui contesti lunghi: ottieni copertura esaustiva delle righe su tabelle che altrimenti perderebbero righe a metà. Il compromesso è che il contesto a livello di documento vive altrove nella pipeline. La chiamata a livello di riga e quella a livello di documento non sono la stessa chiamata, quindi uno schema che ha bisogno di entrambi (nome del fornitore in copertina, righe di dettaglio dalla pagina 40 alla 80) richiede due job separati e una join a valle.
La pipeline multi-stadio di anyformat preserva nativamente la struttura delle tabelle e ha mantenuto ~99% di recupero righe su tabelle fino a 50 pagine e circa 2.400 righe (benchmark anyformat, 2026). Un solo schema dichiara insieme i campi a livello di documento e di tabella. Una sola chiamata restituisce entrambi, senza una seconda passata di estrazione e senza join a valle.
Le modalità multimodale e agentica di LlamaParse rilevano e trascrivono le figure. Quello che non è documentato è la descrizione strutturata e legata allo schema di ciò che un grafico dice davvero. anyformat rileva le figure, le classifica nel contesto e restituisce descrizioni di grafici, diagrammi e immagini come campi dello schema.
Dipende da qual è la lacuna. LlamaParse fa già estrazione su schema, restituisce confidenza per campo e citazioni, supporta la retention zero e offre deployment in VPC privata nei piani enterprise: la ragione per cambiare non è che non sappia estrarre. La ragione è operativa e giurisdizionale: LlamaParse non ha un workflow builder no-code, né una coda di revisione, né un dato di calibrazione pubblicato per i suoi punteggi di confidenza, né una ISO 27001 pubblica, e LlamaIndex è una società statunitense. anyformat copre proprio questo: entità e infrastruttura europee, certificazione ISO 27001, una canvas no-code per i workflow con revisione umana, confidenza calibrata per campo con citazioni visive e una suite di evals per misurare la qualità dell'estrazione sui tuoi documenti. Se il lavoro è ingestione RAG dentro l'ecosistema LlamaIndex, LlamaParse resta la scelta naturale.
Quando scegliere LlamaParse
Ingestione RAG rapida ed economica dentro l'ecosistema LlamaIndex, quando la pipeline attorno al parser è codice che accetti di mantenere.
Quando l'estrazione deve funzionare come processo e non come chiamata: giurisdizione UE, confidenza calibrata con citazioni visive, orchestrazione no-code, revisione umana ed evals. Inizia su anyformat.ai.