AWS Textract è l'API OCR con machine learning di Amazon, lanciata a maggio 2019, che estrae testo, moduli, tabelle e firme da file JPEG, PNG, PDF e TIFF. Confronti di terze parti collocano il suo rilevamento di tabelle e righe di dettaglio tra i più solidi dei servizi OCR cloud, e si integra in modo nativo con S3, Lambda, SNS e SQS, con API precostruite per le note spese (AnalyzeExpense), i documenti d'identità statunitensi (AnalyzeID) e le pratiche ipotecarie (AnalyzeLending). Valgono limiti rigidi: le chiamate sincrone accettano file da 10 MB e PDF di una sola pagina, i job asincroni 500 MB e 3.000 pagine; il rilevamento del testo copre sei lingue, con scrittura a mano e query solo in inglese (documentazione AWS, 2026).
Output di estrazione e schemi
Textract restituisce OCR grezzo, cioè blocchi di testo, bounding box, coppie chiave-valore e celle di tabella, e non impone alcuno schema di output. La funzione Queries è limitata a 15 query per pagina nelle chiamate sincrone e 30 in quelle asincrone (documentazione AWS, 2026). Trasformare quell'output in dati pronti per la tua applicazione richiede una pipeline di post-elaborazione personalizzata: mappatura dei campi, regole di validazione, gestione degli errori e normalizzazione dei formati. anyformat estrae rispetto a uno schema definito dall'utente in zero-shot: definisci i campi, carichi un documento, ricevi JSON validato. Accetta oltre 100 formati di documento senza template, combinando LLM e regole deterministiche, e le modifiche allo schema si applicano all'istante senza deploy di codice.
Orchestrazione dei workflow
Textract non ha un livello di workflow: classificazione, suddivisione, instradamento, validazione, revisione umana e gestione dei retry si assemblano con Lambda, Step Functions, SNS, SQS e codice personalizzato. Quello sforzo di ingegneria, non la tariffa per pagina, è il costo dominante di Textract in produzione. anyformat include un costruttore visuale di workflow (Studio) con ramificazioni, condizioni, suddivisione, instradamento, operatori di estrazione e revisione human-in-the-loop integrata, così i team di operations e di ingegneria aggiornano i workflow senza deploy di codice.
Prezzi
Textract fattura per pagina e per funzionalità: 1,50 $ per 1.000 pagine per il rilevamento del testo, 15 $ per le tabelle, 50 $ per i moduli, 10 $ per le note spese e 70 $ per le pratiche ipotecarie (prezzi AWS, US West, 2026). anyformat fattura in crediti, per pagina e per operatore, senza dipendenza da AWS: 10 crediti costano 0,01 €, quindi Parse è 25 crediti per pagina (0,025 €, pubblicato come 25 $ per 1.000 pagine), Extract 35 crediti per pagina, Classify 10, Split 25 e Validate 25 crediti per regola (prezzi anyformat, 2026). Pay As You Go è gratuito per iniziare, con un'assegnazione una tantum di 50.000 crediti; Business costa 499 € al mese (399 € con fatturazione annuale) con 500.000 crediti, 5 utenti e 10 workflow; Enterprise ha prezzo su misura, con utenti e workflow illimitati, deployment in VPC o on-premise e conservazione zero dei dati. Combinare le funzionalità di Textract moltiplica la tariffa per pagina, e la pipeline di Lambda e Step Functions intorno aggiunge un costo di ingegneria che il prezzo per pagina non mostra mai; la metrica che conta è il costo per output corretto, dove anyformat ha ottenuto il 78,1% contro il 65,4% di Textract nel benchmark di parsing 2026 (benchmark anyformat, 2026).
Accuratezza su documenti reali
anyformat ha ottenuto il 78,1% e AWS Textract il 65,4% in un parse score combinato su oltre 1.000 documenti reali di oltre 30 tipi (benchmark anyformat, 2026). Textract resta solido su moduli e tabelle standard, ma appiattisce i layout a più colonne, si degrada su tabelle che si estendono su più pagine o contengono celle unite e non sa interpretare figure, grafici o diagrammi; anyformat rileva gli elementi visivi e restituisce descrizioni strutturate. Su tabelle che crescono fino a 50 pagine e circa 2.400 righe, anyformat ha mantenuto un recupero delle righe di ~99%, e ha estratto il 94% delle fatture in formati misti con tutti i campi e le righe di dettaglio corretti (benchmark anyformat, 2026). In produzione, L'Oréal riporta il 99% di accuratezza di estrazione e una riduzione del 60% del tempo di elaborazione su oltre 1.500 fatture mensili.
Confidenza e revisione umana
I punteggi di confidenza di Textract non sono calibrati, quindi un punteggio riportato non corrisponde a una probabilità reale di correttezza (benchmark anyformat, 2026). anyformat calibra la confidenza per campo, misurata al 99,1% di accuratezza di calibrazione con un Adaptive ECE di 0,009 (benchmark anyformat, 2026), e allega citazioni visive che collegano ogni valore estratto alla sua posizione esatta sulla pagina. La calibrazione è ciò che fa funzionare le soglie: i campi ad alta confidenza fluiscono in automatico, quelli incerti vengono instradati ai revisori.
Textract gira soltanto su AWS sotto giurisdizione statunitense, indipendentemente dalla regione selezionata; per le organizzazioni soggette a GDPR o DORA, la scelta della regione è un dettaglio di configurazione, non una garanzia di sovranità. La sua postura di conformità eredita certificazioni di piattaforma AWS come SOC 2 e idoneità HIPAA, che coprono l'infrastruttura e non la pipeline di estrazione costruita sopra. anyformat è nativo UE, ha la certificazione ISO 27001 sull'intera pipeline documentale, offre l'elaborazione a ritenzione zero con un singolo interruttore (l'equivalente in Textract richiede di mantenere policy di ciclo di vita S3 e di retention CloudWatch) e si distribuisce in cloud, cloud privato o ambienti on-premise air-gapped. Textract non ha un'opzione on-premise (documentazione AWS, 2026).
Una suite di valutazioni e la pipeline di produzione attorno all'estrazione. La qualità dell'estrazione è una variabile; mantenerla corretta dopo il go-live è dove i progetti documentali spendono la maggior parte del budget di ingegneria.
Valutazioni, disponibili oggi. Ogni workflow di Extract e Classify di anyformat ha una scheda Health. Costruisci un dataset con ground truth verificata, promuovendo un documento che il workflow ha già elaborato e confermandone i valori nell'interfaccia di revisione, oppure caricando documenti etichettati con il JSON atteso. I file si taggano in sub-dataset, così l'accuratezza si legge per fornitore, per tipo di documento o per livello di difficoltà invece che come un'unica media. Una valutazione riestrae ogni documento in scope su una versione scelta del workflow e lo valuta campo per campo, con una vista risultato contro atteso su ogni errore; le esecuzioni sono numerate e immutabili, quindi l'effetto di una modifica si misura invece di supporlo. Health Overview affianca poi il benchmark del dataset all'accuratezza di produzione in tempo reale, alla confidenza e al through rate, e riporta la differenza tra i due (Evals). AWS riporta precisione, recall e F1 per un adapter Custom Queries addestrato su un test set etichettato (documentazione AWS, 2026); quella misura è circoscritta a un adapter sulla funzione Queries e non a una pipeline end-to-end, senza segmentazione per sub-dataset, senza storico immutabile delle esecuzioni e senza confronto tra benchmark e produzione.
Optimizer, annunciato e non ancora disponibile. anyformat ha annunciato Optimizer, un workflow che si ottimizza da solo sul proprio dataset usando le tue valutazioni come obiettivo. È in roadmap, non nel prodotto di oggi (Evals).
La pipeline che non devi costruire. Textract restituisce blocchi di testo, bounding box, coppie chiave-valore e celle di tabella. In produzione servono anche post-elaborazione, validazione dello schema, logica di retry e instradamento, un'interfaccia di revisione umana, monitoraggio dell'accuratezza e ritarature ogni volta che cambia un layout o un modello sottostante; la stessa guida di AWS lo assembla con Lambda e Step Functions. Amazon A2I, il ciclo gestito di revisione umana collegato all'operazione AnalyzeDocument di Textract, chiude l'accesso ai nuovi clienti il 30 luglio 2026 e non riceverà nuove funzionalità (documentazione AWS, 2026). anyformat consegna quel livello come prodotto: workflow no-code nello Studio, confidenza calibrata per campo con instradamento alla revisione, citazioni visive per l'audit e il ciclo di valutazioni descritto sopra. Configurare un workflow di produzione con l'assistente Annie richiede circa 5 minuti contro circa 4 ore di configurazione manuale (benchmark interno anyformat, 2026).
Quando scegliere AWS Textract
Scegli Textract quando il tuo stack è nativo AWS, i tuoi documenti corrispondono alle sue API precostruite (moduli, tabelle, ricevute, documenti d'identità statunitensi, pratiche ipotecarie) e il tuo team può costruire e mantenere la pipeline circostante. Il pagamento a consumo scala da zero senza impegni minimi, e l'integrazione nativa con S3, Lambda e Step Functions tiene l'intero flusso dentro un solo cloud.
Scegli anyformat quando ti serve un'estrazione validata su schema, orchestrazione dei workflow e revisione umana senza assemblare infrastruttura; quando i tuoi documenti vanno oltre i moduli standard, con tabelle lunghe, oltre 100 formati o figure incorporate; o quando residenza europea dei dati, deployment on-premise e confidenza calibrata per lo straight-through processing sono requisiti non negoziabili.
I team che sostituiscono Textract citano con costanza il livello di workflow assente, il costo della post-elaborazione e la giurisdizione statunitense come fattori decisivi. Per una visione più ampia del mercato, consulta la nostra guida alle migliori alternative ad AWS Textract.