ChatGPT è un large language model generalista sviluppato da OpenAI (San Francisco). Claude è un LLM generalista sviluppato da Anthropic (San Francisco). Gemini è un LLM generalista sviluppato da Google (Mountain View). Tutti e tre leggono documenti tramite modelli multimodali, e tutti e tre possono restituire output vincolato a uno schema JSON che definisci tu.
La versione onesta di questo confronto è più stretta di due anni fa. Questi modelli estraggono bene, e anyformat usa LLM sotto il cofano. La domanda non è se un modello sappia leggere una fattura. È che cosa circonda il modello quando un valore sbagliato costa soldi: da dove viene quel valore, quanto è probabile che sia corretto, chi lo rivede quando non lo è e sotto quale giurisdizione è stato elaborato il documento.
Livello consumer e livello API sono prodotti diversi
Quasi tutta la confusione in questo confronto nasce dal trattare «ChatGPT» e «l'API di OpenAI» come la stessa cosa. Non lo sono, e la differenza è di governance del dato.
Le app consumer — ChatGPT, Claude.ai, l'app Gemini — conservano le conversazioni per impostazione predefinita e, a seconda del piano e delle impostazioni, quel contenuto può essere usato per migliorare i modelli. Caricarci documenti dei clienti è una decisione di governance, non tecnica.
I livelli API ed enterprise agiscono da responsabili del trattamento con un DPA e clausole contrattuali tipo, non addestrano sui contenuti inviati per impostazione predefinita e offrono modalità a retention zero soggette ad approvazione. Le piattaforme di tutti e tre i fornitori hanno la certificazione ISO 27001.
Quindi l'affermazione generica che gli LLM non siano conformi è falsa. Quella più stretta — che i chatbot consumer siano il posto sbagliato per i documenti di produzione — regge.
Il divario di provenienza
Quando un modello restituisce il totale di una fattura, restituisce un numero. Non restituisce le coordinate da cui quel numero è stato letto. Alcuni fornitori restituiscono citazioni a un passaggio di testo di origine; nessuno lega un campo estratto a un bounding box sull'immagine della pagina.
L'elaborazione documentale in produzione richiede auditabilità. Quando un valore estratto entra nel tuo ERP e genera un pagamento, revisori, responsabili della conformità e sistemi a valle devono poter verificare da dove arriva.
anyformat allega una citazione visiva a ogni campo estratto: clicchi sul campo e atterri sulla posizione esatta nel documento di origine. È ciò che rende auditabili le decisioni dell'IA sotto normative europee come ViDA, DORA e gli obblighi nazionali di fatturazione elettronica.
Scorrevolezza non è calibrazione
Gli LLM sono scorrevoli. Danno risposte dal suono sicuro anche quando non lo sono. Un modello può estrarre un numero d'ordine e presentarlo con la stessa apparente certezza del totale di una fattura, pur tirando a indovinare da una scansione sfocata.
Le log-probabilità dei token non sono un sostituto. Descrivono quanto il modello fosse sicuro del token successivo, non quanto sia probabile che un campo sia corretto, e non sono calibrate sugli esiti. Quindi non c'è soglia che tu possa fissare né campo che tu possa approvare automaticamente su quella base. È il problema dei fallimenti silenziosi: un valore sbagliato presentato con sicurezza supera ogni controllo a valle finché non salta la riconciliazione.
anyformat assegna un punteggio di confidenza calibrato a ogni campo estratto, misurato al 99,1% di accuratezza di calibrazione con un Adaptive ECE di 0,009 (benchmark anyformat, 2026). La calibrazione è ciò che dà un significato alla soglia: il campo al 98% passa da solo, quello al 62% va a un revisore.
La decodifica vincolata ha chiuso questo divario. Structured Outputs, gli schemi degli strumenti e i response schema rendono l'output strutturalmente deterministico: stessi nomi di campo, stesso annidamento, stessi tipi, a ogni esecuzione. Chi descrive ancora l'output di un LLM come strutturalmente imprevedibile sta descrivendo il 2023.
Quello che la validità strutturale non ti dice è se il valore è giusto. Un campo ben tipizzato può essere sbagliato con tutta sicurezza, e uno schema non lo intercetterà. È per questo che servono la valutazione e la confidenza calibrata, e nessuna delle due arriva insieme all'API di un modello.
anyformat include una suite di evals: lanci un set etichettato, ottieni accuratezza per campo, intercetti le regressioni prima che arrivino in produzione e confronti le modifiche alla pipeline con una baseline fissa invece che a sensazione.
Costo su scala
Il prezzo a token degli LLM rende l'estrazione ad hoc economica. Sui volumi di produzione i conti cambiano: il costo scala con il numero di pagine, con i retry e con ogni nuovo prompt speso per convincere un documento ostinato. La voce più pesante di solito è l'ingegneria: manutenzione dei prompt, validazione degli output, logica di retry e gli strumenti di revisione che finisci comunque per costruire.
anyformat fattura a crediti, per pagina e per operatore: 10 crediti costano 0,01 €, quindi Parse è 25 crediti per pagina (0,025 €) ed Extract 35 crediti per pagina (listino anyformat, 2026). Il numero da confrontare è il costo per output corretto, non il costo per token.
Sovranità europea e giurisdizione
È la dimensione dove nulla è cambiato. OpenAI, Anthropic e Google hanno sede negli USA. Esistono regioni di elaborazione europee e opzioni di residenza dei dati, ma il fornitore che opera il servizio resta sotto giurisdizione statunitense, ed è questo che i requisiti europei di sovranità verificano, non dove si trova il data center. Nella tabella comparativa qui sopra, la sovranità UE è la riga in cui tutti i concorrenti segnano «no».
anyformat è nativo UE. Entità europea, infrastruttura europea, certificazione ISO 27001, conformità al GDPR per architettura, con elaborazione a retention zero e deployment on-premise o air-gapped su ogni piano.
Orchestrazione dei workflow e revisione umana
Le API dei modelli elaborano un documento alla volta, una chiamata alla volta. Classificazione, splitting, routing, validazione, code di revisione, logica condizionale e integrazione a valle sono ingegneria su misura che costruisci e mantieni tu, e l'interfaccia di revisione, la parte che nessuno dimensiona, è di solito il pezzo più grosso.
anyformat include Studio, una canvas no-code per i workflow con branching, condizioni, splitting, routing, operatori di estrazione, incrocio con fonti dati interne e revisione human-in-the-loop integrata. I team operativi cambiano il processo senza un deploy di codice.
I modelli multimodali leggono tabelle e grafici con competenza e, abbinati a un response schema, restituiscono le righe come JSON tipizzato. I modi di fallimento che restano sono quelli operativi: tabelle che attraversano decine di pagine, dove il bias posizionale perde righe a metà; celle unite e tabelle su più pagine; e l'assenza di qualsiasi provenienza per cella con cui verificare una riga sospetta.
La pipeline multi-stadio di anyformat ha mantenuto ~99% di recupero righe su tabelle fino a 50 pagine e circa 2.400 righe (benchmark anyformat, 2026), e restituisce le figure come descrizioni classificate e legate allo schema, con citazioni. Sono problemi di ingegneria che non si risolvono solo con i prompt.
Il modello mentale giusto
Gli LLM sono il motore dentro le moderne piattaforme di elaborazione documentale, anyformat compreso. Usare l'API di un modello grezzo per l'estrazione in produzione è come comprare un motore diesel e chiamarlo trasporto. Il motore è eccellente. Non è un veicolo.
anyformat è il veicolo: il modello avvolto in confidenza calibrata, citazioni visive, orchestrazione dei workflow, revisione umana, evals e controlli di conformità nativi UE.
Per la produzione sì, ma non per le ragioni che questo confronto dava un tempo. Le API dei modelli oggi gestiscono la validazione degli schemi, la lettura delle tabelle e l'interpretazione dei grafici, girano su piattaforme certificate ISO 27001, firmano DPA da responsabile del trattamento e offrono retention zero sul livello API. Quello che non forniscono è un punteggio di confidenza calibrato per campo, una citazione visiva che leghi ogni valore alla sua posizione sulla pagina, uno strato di workflow con revisione umana, un'infrastruttura di evals per misurare l'accuratezza sui tuoi documenti o un'opzione di giurisdizione UE. anyformat usa gli LLM come motore di estrazione e fornisce esattamente queste cinque cose. Se rispondi a domande ad hoc su una manciata di documenti, un modello grezzo è lo strumento giusto. Se ne elabori migliaia al giorno con obblighi di conformità europei, l'infrastruttura attorno è il prodotto.
Quando usare un LLM grezzo
Prototipazione, domande ad hoc, analisi una tantum. Usa un modello grezzo quando stai esplorando, non quando stai operando.
Quando i documenti arrivano in produzione: ogni valore tracciabile fino alla sua posizione sulla pagina, ogni campo incerto instradato a un revisore, l'accuratezza misurata invece che presunta, e il tutto sotto giurisdizione UE.
anyformat è la piattaforma di document intelligence agentica costruita per le aziende europee. Certificata ISO 27001, conforme al GDPR, con elaborazione a retention zero e deployment on-premise. Inizia su anyformat.ai