Was LlamaIndex ist: das Framework, LlamaCloud und LlamaParse
LlamaIndex sind drei verschiedene Dinge unter einem Namen, und diese Unterscheidung entscheidet darüber, was Sie tatsächlich kaufen. llama_index ist ein quelloffenes Python-Framework unter der MIT-Lizenz, Copyright Jerry Liu, mit mehr als 300 Integrationspaketen für Anbieter von LLMs, Embeddings und Vektordatenbanken. LlamaCloud ist die kommerzielle, verwaltete Plattform, und LlamaParse, LlamaExtract, LlamaSplit sowie LlamaAgents sind geschlossene kommerzielle Dienste, die darüber bereitgestellt werden: LlamaParse ist die eigene Parsing-API von LlamaIndex und kein Community-Projekt, das auf dem Framework aufsetzt. Das Unternehmen ist LlamaIndex Inc., gegründet im April 2023 mit Sitz in San Francisco, von Jerry Liu (CEO) und Simon Suo (CTO), mit 27,5 Millionen US-Dollar an offengelegter Finanzierung: eine Seed-Runde über 8,5 Millionen unter Führung von Greylock im Juni 2023 und eine Serie A über 19 Millionen unter Führung von Norwest Venture Partners im März 2025, dazu strategische Minderheitsbeteiligungen von Databricks und KPMG im Mai 2025. Für den Vergleich auf Parsing-Ebene (Ausgabeformate, Tabellengeometrie, Kosten pro Seite) siehe anyformat vs LlamaParse; diese Seite vergleicht die Plattformen.
LlamaExtract arbeitet tatsächlich zero-shot: Sie liefern ein JSON- oder Pydantic-Schema, und es extrahiert dagegen ohne gelabelte Trainingsdaten. Die Dokumentation stellt ausdrücklich klar, dass Feldbeschreibungen und nicht Beispiele das Modell steuern (LlamaIndex-Dokumentation, 2026). Es bietet drei Qualitätsstufen (cost_effective, agentic, agentic_plus), drei Extraktionsziele (per_doc, per_page, per_table_row), Schemata mit bis zu 3.200 Feldern in der höchsten Stufe und zwei für Audits relevante Optionen: cite_sources, das einen Wert bis zu seinem Ursprung im Dokument zurückverfolgt, und confidence_scores, das Konfidenzsignale pro Feld zurückgibt. Schemagesteuerte Extraktion ist bei keinem der beiden Produkte eine Lücke. anyformat extrahiert zero-shot gegen ein benutzerdefiniertes Schema über mehr als 100 Formate ohne Vorlagen, deklariert Felder auf Dokument- und auf Tabellenebene in einem Schema und gibt beide in einem einzigen Aufruf zurück, und erreichte 78,1 % bei einem kombinierten Parsing-Score über mehr als 1.000 reale Dokumente aus über 30 Dokumenttypen (anyformat-Benchmark, 2026).
Das ist die eigentliche Entscheidung, und sie betrifft nicht die Extraktionsqualität. Die Orchestrierung von LlamaIndex ist Code: Agent Workflows ist ein ereignisgesteuertes Python-Framework mit Verzweigung, Parallelität, Eingriffspunkten für Menschen, Dauerhaftigkeit und Observability, und LlamaAgents — seit November 2025 in Open Preview — verpackt es mit einer llamactl-CLI, die Template-Repositories aus Python-Dateien lädt, die Sie lokal anpassen (LlamaIndex-Dokumentation, 2026). LlamaCloud enthält durchaus einen Agent Builder, eine Oberfläche in natürlicher Sprache, in der Sie einen Ablauf beschreiben und ein Coding-Agent ihn erzeugt, aber das Ergebnis ist ein echtes Python-Projekt in Ihrem GitHub-Repository: Den Ablauf später zu ändern bedeutet also, Code zu ändern und neu auszurollen. anyformat enthält Studio, eine No-Code-Arbeitsfläche für Workflows mit Verzweigung, Bedingungen, Aufteilung, Routing, Klassifizierung, Extraktionsoperatoren, Abgleich gegen interne Datenquellen und Prüfschritten an genau den Stellen, an denen der Prozess sie braucht; eine Fachanwenderin aus dem Betrieb ändert den Ablauf ohne Deployment. Die Frage in einer Evaluierung lautet nicht, ob es einen Builder gibt, sondern wer die Extraktionslogik an einem Dienstagnachmittag ändern darf.
Betrieb und Rechtsraum
LlamaCloud läuft als SaaS in zwei Regionen — Nordamerika auf AWS us-east-1 unter cloud.llamaindex.ai und Europa auf AWS eu-central-1 unter cloud.eu.llamaindex.ai — wobei Daten in der Region gespeichert werden, in der sie hochgeladen wurden. Die eigene Dokumentation weist darauf hin, dass NA die primäre Region ist, in der neue Funktionen zuerst erscheinen, sodass die europäische Region sie später erhalten kann (LlamaIndex-Dokumentation, 2026). Self-Hosting und Bring-your-own-Cloud sind verfügbar: Die vollständige Plattform lässt sich über Helm-Charts auf Kubernetes bei AWS, Azure oder GCP in Ihrer eigenen VPC ausrollen, ist aber eine reine Enterprise-Funktion, die einen Lizenzschlüssel voraussetzt, und sie ist nicht air-gapped — LlamaIndex dokumentiert, dass alle LLM-Aufrufe direkt aus Ihrem Cluster mit Ihren eigenen API-Schlüsseln an die Anbieter gehen. LlamaIndex Inc. ist ein US-Unternehmen, sodass ein europäischer Endpunkt die Datenresidenz beantwortet, ohne den Rechtsraum des Anbieters zu ändern, der die Software betreibt. anyformat ist europäisch von Grund auf, ein europäisches Unternehmen auf europäischer Infrastruktur, und lässt sich in der Cloud, in einer Private Cloud oder in air-gapped On-Premise-Umgebungen betreiben.
Compliance
LlamaIndex veröffentlicht SOC 2 Type II, DSGVO-Konformität und HIPAA auf seinen Enterprise-Seiten, mit individuellen BAAs für Enterprise-Kunden. Das Trust Center unter security.llamaindex.ai wird per JavaScript gerendert und liefert automatisierten Abrufen keinen lesbaren Inhalt, und ISO 27001 — die Zertifizierung, die europäische Einkaufsabteilungen am häufigsten als harte Anforderung behandeln — ist auf den lesbaren Seiten nicht öffentlich gelistet. Das Fehlen in einem öffentlichen Trust Center ist kein Beweis dafür, dass die Kontrollen fehlen, aber der Einkauf behandelt eine nicht gelistete Zertifizierung in der Regel wie eine fehlende. anyformat ist ISO 27001 zertifiziert, mit einem Zertifizierungsumfang, der die Dokumentenpipeline durchgängig abdeckt, und DSGVO-Konformität ist dort eine architektonische Randbedingung statt eines Vertragsanhangs.
Zero Retention und Datenverarbeitung
Beide unterstützen sie, mit unterschiedlichen Voreinstellungen. LlamaParse cacht geparste Dokumente 48 Stunden lang und löscht sie danach dauerhaft; do_not_cache=True deaktiviert das Caching für eine einzelne Anfrage (LlamaIndex-Dokumentation, 2026). anyformat führt die Verarbeitung ohne Speicherung als Modus auf Kontoebene aus, sodass weder Quelldateien noch extrahierte Ausgaben über das Verarbeitungsfenster hinaus bestehen bleiben. Der praktische Unterschied liegt darin, ob die sichere Einstellung die Grundhaltung ist oder ein Parameter, an den ein Entwickler bei jedem Aufruf denken muss.
Konfidenz und Prüfung
LlamaExtract gibt Konfidenzsignale pro Feld und Quellenverweise zurück, wenn confidence_scores und cite_sources aktiviert sind, sodass unsichere Werte sichtbar gemacht werden können. Was LlamaIndex nicht veröffentlicht, ist eine Kalibrierungskennzahl — ob ein gemeldeter Wert von 0,8 bedeutet, in etwa 80 % der Fälle richtig zu liegen. Ein unkalibrierter Wert kann keinen Routing-Schwellenwert tragen, weil kein Punkt der Skala nachweislich sicher für eine automatische Freigabe ist. anyformat misst die Kalibrierung und veröffentlicht sie: 99,1 % Kalibrierungsgenauigkeit bei einem Adaptive ECE von 0,009 (anyformat-Benchmark, 2026). Genau das macht die Dunkelverarbeitung gegenüber einer Prüferin belastbar: Felder mit hoher Konfidenz laufen durch, unsichere werden innerhalb desselben Workflows an eine prüfende Person geleitet, und jeder Wert trägt einen visuellen Beleg, der auf seine genaue Position auf der Seite zeigt. Im Produktivbetrieb berichtet L'Oréal von 99 % Extraktionsgenauigkeit und einer Reduktion der Bearbeitungszeit um 60 % bei mehr als 1.500 Rechnungen pro Monat.
Preise
LlamaCloud rechnet in Credits ab, 1.000 Credits für 1,25 US-Dollar, mit einem Free-Plan für 0 US-Dollar inklusive 10.000 Credits, Starter für 50 US-Dollar im Monat mit 40.000 Credits, Pro für 500 US-Dollar im Monat mit 400.000 Credits und Enterprise zu individuellen Preisen mit Mengenrabatten, fünffach höheren Rate Limits, SSO und selbst gehostetem Betrieb (LlamaIndex-Preise, 2026). anyformat rechnet in Credits pro Seite und pro Operator ab, wobei 10 Credits 0,01 € kosten: Parse kostet 25 Credits pro Seite (0,025 €, veröffentlicht als 25 US-Dollar pro 1.000 Seiten), Extract 35 Credits pro Seite, Classify 10, Split 25 und Validate 25 Credits pro Regel (anyformat-Preise, 2026). Pay As You Go ist kostenlos im Einstieg mit einer einmaligen Zuteilung von 50.000 Credits, Business kostet 499 € im Monat (399 € bei jährlicher Abrechnung) für 500.000 Credits, und Enterprise wird individuell bepreist, mit VPC- oder On-Premise-Betrieb und Zero Data Retention. Auf beiden Plattformen ist der Seitenpreis die kleine Zahl; die Entwicklungskosten der Pipeline darum herum sind die große.
Evaluierung und Monitoring
Das quelloffene Framework bringt Evaluierungsmodule mit — Korrektheit, Faithfulness, Kontextrelevanz, Antwortrelevanz sowie Retrieval-Metriken wie Hit-Rate und MRR — doch das sind Bibliotheken, die eine Entwicklerin importiert und ausführt, ausgerichtet auf die Qualität einer RAG-Pipeline und nicht auf feldgenaue Extraktionsgenauigkeit gegenüber einer gepflegten Ground Truth. LlamaCloud dokumentiert öffentlich weder eine Verwaltung von Ground-Truth-Datensätzen noch eine Regressionssuite oder ein Monitoring der Produktivgenauigkeit als Produktfunktion. Zu messen, ob eine Schemaänderung die Extraktion verbessert hat, und zu bemerken, wann die Genauigkeit im Betrieb von Ihrem Benchmark abweicht, ist damit Arbeit, die Ihr Team selbst baut und dauerhaft betreibt.
Was anyformat liefert und LlamaIndex Ihrem Team überlässt
Evaluierungen, heute verfügbar. Jeder Extract- und Classify-Workflow in anyformat hat einen Health-Tab. Sie bauen einen Datensatz mit geprüfter Ground Truth auf, entweder indem Sie ein bereits verarbeitetes Dokument übernehmen und seine Werte in der Prüfoberfläche bestätigen, oder indem Sie gelabelte Dokumente mit dem erwarteten JSON hochladen. Dateien lassen sich in Teildatensätze taggen, sodass sich die Genauigkeit pro Lieferant, pro Dokumenttyp oder pro Schwierigkeitsgrad lesen lässt statt als ein einziger Durchschnitt. Eine Evaluierung extrahiert jedes einbezogene Dokument gegen eine gewählte Workflow-Version neu und bewertet es Feld für Feld, mit einer Ansicht Ergebnis gegen Erwartung bei jedem Fehler; Durchläufe sind nummeriert und unveränderlich, sodass die Wirkung einer Änderung gemessen und nicht angenommen wird. Die Health-Übersicht stellt anschließend den Datensatz-Benchmark neben Genauigkeit, Konfidenz und Durchlaufquote im Produktivbetrieb und weist die Differenz aus (Evals).
Optimizer, angekündigt und noch nicht verfügbar. anyformat hat Optimizer angekündigt, einen Workflow, der sich anhand seines eigenen Datensatzes selbst optimiert und Ihre Evaluierungen als Zielgröße nutzt. Er steht auf der Roadmap, nicht im heutigen Produkt (Evals).
Die Pipeline, die Sie nicht bauen müssen. LlamaCloud liefert geparsten Inhalt und schemavalidierte Felder. Der Produktivbetrieb braucht darüber hinaus Klassifizierung und Routing, Validierungsregeln, Wiederholungslogik, eine Prüfoberfläche, Genauigkeitsmonitoring und Nachjustierung, sobald sich ein Layout oder ein zugrunde liegendes Modell ändert. Bei LlamaIndex ist diese Schicht Python-Code, der Ihnen gehört: Agent Workflows liefert die Primitive, der Rest sind Ihr Repository, Ihr Deployment und Ihre Rufbereitschaft. anyformat liefert sie als Produktfunktion — No-Code-Workflows in Studio, kalibrierte Konfidenz pro Feld mit Routing zur Prüfung, visuelle Belege für das Audit und die oben beschriebene Evaluierungsschleife. Bei Tabellen von bis zu 50 Seiten und rund 2.400 Zeilen hielt anyformat eine Zeilenerfassung von etwa 99 %, und es extrahierte 94 % der komplexen Rechnungen mit jedem Feld und jeder Position korrekt (anyformat-Benchmark, 2026). Einen Produktiv-Workflow mit dem Annie-Assistenten aufzusetzen dauert rund 5 Minuten gegenüber etwa 4 Stunden manueller Konfiguration (interner anyformat-Benchmark, 2026).
Wann Sie LlamaIndex wählen sollten
Wählen Sie LlamaIndex, wenn Sie ein Entwicklungsteam sind, das eine maßgeschneiderte RAG- oder Agentenanwendung baut, und wenn Sie ein Framework statt einer Plattform wollen. Der quelloffene Kern steht unter MIT-Lizenz mit mehr als 300 Integrationspaketen, sodass Sie Anbieter für LLMs, Embeddings und Vektordatenbanken frei tauschen und die Orchestrierung in Ihrem eigenen Repository behalten können; Reichweite des Ökosystems, Breite der Konnektoren und Bekanntheit unter Entwicklern gehören zu den größten der Kategorie, und der kostenlose Tarif von LlamaCloud plus ein Starter-Plan für 50 US-Dollar machen den Einstieg günstig. Wenn Retrieval und Indexierung ebenso wichtig sind wie Extraktion, wenn Sie jeden Schritt der Pipeline im Code kontrollieren wollen oder wenn die Anforderung RAG-Ingestion und nicht Dokumentenbetrieb lautet, ist genau diese Kontrolle der Punkt. Für die engere Frage nach Parsing-Qualität und Kosten pro Seite siehe anyformat vs LlamaParse.
Wählen Sie anyformat, wenn die Dokumentenpipeline als überwachter Geschäftsprozess laufen muss und nicht als Anwendung, die Ihr Team pflegt: wenn europäischer Rechtsraum und ISO 27001 harte Anforderungen sind und keine Präferenzen, wenn kalibrierte Konfidenz und visuelle Belege das sind, was die Dunkelverarbeitung gegenüber einer Prüferin rechtfertigt, wenn der Fachbereich und nicht die Entwicklung Schemata und Workflow-Logik verantworten soll, oder wenn Workflow-Änderungen gegen einen Ground-Truth-Datensatz gemessen werden müssen, bevor sie in Produktion gehen. Teams, die von einem Framework auf eine Plattform wechseln, nennen in der Regel dieselben drei Kosten: den Orchestrierungscode, den sie schreiben mussten, die Prüf- und Monitoringschicht, die niemand eingeplant hatte, und den US-Rechtsraum. Jetzt starten auf anyformat.ai.