Cos'è LlamaIndex: il framework, LlamaCloud e LlamaParse
LlamaIndex è tre cose diverse vendute sotto un unico nome, e la distinzione determina che cosa stai comprando davvero. llama_index è un framework Python open source pubblicato con licenza MIT, copyright di Jerry Liu, con oltre 300 pacchetti di integrazione per provider di LLM, embedding e database vettoriali. LlamaCloud è la piattaforma commerciale gestita, e LlamaParse, LlamaExtract, LlamaSplit e LlamaAgents sono servizi commerciali chiusi erogati attraverso di essa: LlamaParse è l'API di parsing di proprietà di LlamaIndex, non un progetto della community costruito sopra il framework. L'azienda è LlamaIndex Inc., costituita nell'aprile 2023 e con sede a San Francisco, fondata da Jerry Liu (CEO) e Simon Suo (CTO), con 27,5 milioni di dollari di finanziamenti dichiarati: un seed da 8,5 milioni guidato da Greylock nel giugno 2023 e un Serie A da 19 milioni guidato da Norwest Venture Partners nel marzo 2025, oltre a investimenti strategici di minoranza da Databricks e KPMG nel maggio 2025. Per il confronto a livello di parsing (formati di output, geometria delle tabelle, costo per pagina) vedi anyformat vs LlamaParse; questa pagina confronta le piattaforme.
LlamaExtract è genuinamente zero-shot: fornisci uno schema JSON o Pydantic ed estrae rispetto a quello senza dati di addestramento etichettati, e la sua documentazione è esplicita nel dire che a guidare il modello sono le descrizioni dei campi, non gli esempi (documentazione LlamaIndex, 2026). Offre tre livelli di qualità (cost_effective, agentic, agentic_plus), tre target di estrazione (per_doc, per_page, per_table_row), schemi fino a 3.200 campi nel livello più alto e due opzioni rilevanti per l'audit: cite_sources, che risale dal valore alla sua origine nel documento, e confidence_scores, che restituisce segnali di confidenza per campo. L'estrazione guidata da schema non è una lacuna in nessuno dei due prodotti. anyformat estrae rispetto a uno schema definito dall'utente in zero-shot su oltre 100 formati senza template, dichiara in un unico schema i campi a livello di documento e a livello di tabella e restituisce entrambi in una sola chiamata, e ha ottenuto il 78,1% in un punteggio di parsing combinato su oltre 1.000 documenti reali di più di 30 tipologie (benchmark anyformat, 2026).
Questa è la decisione vera, e non riguarda la qualità dell'estrazione. L'orchestrazione di LlamaIndex è codice: Agent Workflows è un framework Python event-driven con ramificazione, parallelismo, punti di intervento umano, durabilità e osservabilità, e LlamaAgents (in open preview da novembre 2025) lo confeziona con una CLI llamactl che scarica repository template di file Python che modifichi in locale (documentazione LlamaIndex, 2026). LlamaCloud include effettivamente un Agent Builder, un'interfaccia in linguaggio naturale in cui descrivi un flusso e un agente di coding lo genera, ma ciò che ottieni è un vero progetto Python nel tuo repository GitHub, quindi cambiare il flusso in seguito significa cambiare codice e rifare il deploy. anyformat include Studio, un canvas no-code per i workflow con ramificazione, condizioni, suddivisione, instradamento, classificazione, operatori di estrazione, incrocio con fonti dati interne e passaggi di revisione collocati dove il processo li richiede, e un utente delle operations cambia il flusso senza un deploy. La domanda in una valutazione non è se esista un builder, ma chi può cambiare la logica di estrazione un martedì pomeriggio.
Deployment e giurisdizione
LlamaCloud funziona come SaaS in due regioni (Nord America su AWS us-east-1 su cloud.llamaindex.ai ed Europa su AWS eu-central-1 su cloud.eu.llamaindex.ai), con i dati archiviati nella regione in cui sono stati caricati, e la sua stessa documentazione segnala che NA è la regione primaria dove le nuove funzionalità escono per prime, per cui la regione europea può riceverle più tardi (documentazione LlamaIndex, 2026). Self-hosting e bring-your-own-cloud sono disponibili: l'intera piattaforma si distribuisce su Kubernetes tramite chart Helm su AWS, Azure o GCP dentro la tua VPC, ma è una funzionalità riservata a Enterprise che richiede una chiave di licenza, e non è air-gapped: LlamaIndex documenta che tutte le chiamate agli LLM escono direttamente dal tuo cluster verso i provider usando le tue chiavi API. LlamaIndex Inc. è un'azienda statunitense, quindi un endpoint europeo risponde alla residenza del dato senza cambiare la giurisdizione del fornitore che opera il software. anyformat è europeo per origine, un'azienda europea su infrastruttura europea, e si distribuisce in cloud, cloud privato o ambienti on-premise air-gapped.
LlamaIndex pubblica SOC 2 Type II, conformità GDPR e HIPAA sulle sue pagine enterprise, con BAA personalizzati disponibili per i clienti enterprise. Il suo trust center su security.llamaindex.ai è renderizzato in JavaScript e non restituisce contenuto leggibile ai fetcher automatici, e la ISO 27001 (la certificazione che gli uffici acquisti europei trattano più spesso come requisito vincolante) non risulta elencata pubblicamente nelle pagine leggibili. L'assenza da un trust center pubblico non prova che i controlli manchino, ma gli acquisti tendono a trattare una certificazione non elencata come una certificazione assente. anyformat è certificato ISO 27001 con un perimetro di certificazione che copre la pipeline documentale end-to-end, e la conformità GDPR è un vincolo architetturale anziché un allegato contrattuale.
Retention zero e trattamento dei dati
Entrambi la supportano, con impostazioni predefinite diverse. LlamaParse mette in cache i documenti processati per 48 ore prima di eliminarli in modo permanente, e impostare do_not_cache=True disattiva la cache per una singola richiesta (documentazione LlamaIndex, 2026). anyformat esegue l'elaborazione senza retention come modalità a livello di account, così i file di origine e l'output estratto non persistono oltre la finestra di elaborazione. La differenza pratica è se l'impostazione sicura sia la postura predefinita oppure un parametro che uno sviluppatore deve ricordarsi a ogni chiamata.
Confidenza e revisione
LlamaExtract restituisce segnali di confidenza per campo e citazioni della fonte quando confidence_scores e cite_sources sono attivi, così i valori incerti possono essere portati in superficie. Ciò che LlamaIndex non pubblica è una cifra di calibrazione (se uno 0,8 dichiarato corrisponda ad avere ragione circa l'80% delle volte), e un punteggio non calibrato non può reggere una soglia di instradamento, perché nessun punto della scala è noto come sicuro per l'approvazione automatica. anyformat misura la calibrazione e la pubblica: 99,1% di accuratezza di calibrazione con un Adaptive ECE di 0,009 (benchmark anyformat, 2026). È questo a rendere difendibile davanti a un auditor l'elaborazione diretta: i campi ad alta confidenza passano, quelli incerti vengono instradati a un revisore dentro lo stesso workflow, e ogni valore porta con sé una citazione visiva che punta alla sua posizione esatta nella pagina. In produzione, L'Oréal riporta il 99% di accuratezza di estrazione e una riduzione del 60% del tempo di elaborazione su oltre 1.500 fatture al mese.
Prezzi
LlamaCloud fattura a crediti, 1.000 crediti per 1,25 dollari, con un piano Free a 0 dollari che include 10.000 crediti, Starter a 50 dollari al mese per 40.000 crediti, Pro a 500 dollari al mese per 400.000 crediti ed Enterprise a prezzo personalizzato con sconti sui volumi, limiti di frequenza 5 volte superiori, SSO e deployment self-hosted (prezzi LlamaIndex, 2026). anyformat fattura a crediti addebitati per pagina e per operatore, dove 10 crediti costano 0,01 €: Parse sono 25 crediti per pagina (0,025 €, pubblicato come 25 dollari per 1.000 pagine), Extract 35 crediti per pagina, Classify 10, Split 25 e Validate 25 crediti per regola (prezzi anyformat, 2026). Pay As You Go è gratuito per iniziare con una concessione una tantum di 50.000 crediti, Business costa 499 € al mese (399 € con fatturazione annuale) per 500.000 crediti, ed Enterprise ha prezzo personalizzato con deployment in VPC o on-premise e retention zero dei dati. Su entrambe le piattaforme la tariffa per pagina è il numero piccolo; il costo ingegneristico della pipeline che la circonda è quello grande.
Valutazione e monitoraggio
Il framework open source include moduli di valutazione (correttezza, fedeltà, rilevanza del contesto, rilevanza della risposta e metriche di retrieval come hit-rate e MRR), ma sono librerie che uno sviluppatore importa ed esegue, orientate alla qualità di una pipeline RAG più che all'accuratezza di estrazione per campo rispetto a una ground truth mantenuta nel tempo. LlamaCloud non documenta pubblicamente un gestore di dataset di ground truth, una suite di regressione o un monitor di accuratezza in produzione come superficie di prodotto. Misurare se una modifica di schema abbia migliorato l'estrazione, e accorgersi quando l'accuratezza in produzione si allontana dal tuo benchmark, è quindi lavoro che il tuo team costruisce e mantiene in funzione.
Cosa offre anyformat che LlamaIndex lascia al tuo team
Valutazioni, disponibili oggi. Ogni workflow Extract e Classify di anyformat ha una scheda Health. Costruisci un dataset con ground truth verificata, promuovendo un documento che il workflow ha già elaborato e confermandone i valori nell'interfaccia di revisione, oppure caricando documenti etichettati con il loro JSON atteso. I file si possono taggare in sottodataset, così l'accuratezza si legge per fornitore, per tipo di documento o per fascia di difficoltà invece che come una media unica. Una valutazione riestrae tutti i documenti inclusi rispetto a una versione scelta del workflow e li valuta campo per campo, con una vista risultato-contro-atteso su ogni errore; le esecuzioni sono numerate e immutabili, così l'effetto di una modifica si misura anziché presumerlo. Health Overview affianca poi il benchmark del dataset all'accuratezza, alla confidenza e al tasso di passaggio in produzione, e riporta lo scarto tra i due (Evals).
Optimizer, annunciato e non ancora disponibile. anyformat ha annunciato Optimizer, un workflow che si ottimizza da solo rispetto al proprio dataset usando le tue valutazioni come obiettivo. È nella roadmap, non nel prodotto di oggi (Evals).
La pipeline che non devi costruire. LlamaCloud restituisce contenuto processato e campi validati rispetto allo schema. La produzione richiede anche classificazione e instradamento, regole di validazione, gestione dei retry, un'interfaccia di revisione, monitoraggio dell'accuratezza e ritaratura ogni volta che cambia un layout o un modello sottostante. Con LlamaIndex quel livello è codice Python tuo: Agent Workflows ti dà le primitive, e il resto è il tuo repository, il tuo deployment e la tua reperibilità. anyformat lo offre come superficie di prodotto: workflow no-code in Studio, confidenza calibrata per campo con instradamento alla revisione, citazioni visive per l'audit e il ciclo di valutazione descritto sopra. Su tabelle fino a 50 pagine e circa 2.400 righe anyformat ha mantenuto un recupero delle righe vicino al 99%, e ha estratto il 94% delle fatture complesse con ogni campo e ogni riga corretti (benchmark anyformat, 2026). Impostare un workflow di produzione con l'assistente Annie richiede circa 5 minuti contro circa 4 ore di configurazione manuale (benchmark interno anyformat, 2026).
Quando scegliere LlamaIndex
Scegli LlamaIndex quando sei un team di ingegneria che costruisce un'applicazione RAG o ad agenti su misura e vuoi un framework anziché una piattaforma. Il nucleo open source ha licenza MIT e più di 300 pacchetti di integrazione, così puoi sostituire liberamente provider di LLM, embedding e database vettoriali e tenere l'orchestrazione nel tuo repository; la portata dell'ecosistema, l'ampiezza dei connettori e la diffusione tra gli sviluppatori sono tra le maggiori della categoria, e il piano gratuito di LlamaCloud più uno Starter da 50 dollari rendono economico iniziare. Se retrieval e indicizzazione contano quanto l'estrazione, se vuoi controllare in codice ogni passaggio della pipeline, o se il requisito è l'ingestione per RAG e non le operations documentali, quel controllo è esattamente il punto. Per la domanda più circoscritta su qualità di parsing e costo per pagina, vedi anyformat vs LlamaParse.
Scegli anyformat quando la pipeline documentale deve funzionare come un processo aziendale supervisionato e non come un'applicazione che il tuo team mantiene: quando la giurisdizione europea e la ISO 27001 sono requisiti vincolanti e non preferenze, quando la confidenza calibrata e le citazioni visive sono ciò che giustifica l'elaborazione diretta davanti a un auditor, quando devono essere le operations e non l'ingegneria a possedere schemi e logica dei workflow, oppure quando le modifiche ai workflow devono essere misurate rispetto a un dataset di ground truth prima di arrivare in produzione. I team che passano da un framework a una piattaforma citano in genere gli stessi tre costi: il codice di orchestrazione che hanno dovuto scrivere, il livello di revisione e monitoraggio che nessuno aveva messo a budget, e la giurisdizione statunitense. Inizia su anyformat.ai.