Ce qu'est LlamaIndex : le framework, LlamaCloud et LlamaParse
LlamaIndex, ce sont trois choses différentes vendues sous un même nom, et la distinction détermine ce que vous achetez réellement. llama_index est un framework Python open source publié sous licence MIT, copyright Jerry Liu, avec plus de 300 paquets d'intégration pour les fournisseurs de LLM, d'embeddings et de bases vectorielles. LlamaCloud est la plateforme commerciale managée, et LlamaParse, LlamaExtract, LlamaSplit et LlamaAgents sont des services commerciaux fermés servis à travers elle : LlamaParse est l'API de parsing propriétaire de LlamaIndex, et non un projet communautaire bâti par-dessus le framework. La société est LlamaIndex Inc., constituée en avril 2023 et basée à San Francisco, fondée par Jerry Liu (CEO) et Simon Suo (CTO), avec 27,5 millions de dollars de financement déclaré : une amorce de 8,5 millions menée par Greylock en juin 2023 et une série A de 19 millions menée par Norwest Venture Partners en mars 2025, plus des investissements minoritaires stratégiques de Databricks et KPMG en mai 2025. Pour la comparaison au niveau du parsing (formats de sortie, géométrie des tableaux, coût par page), voir anyformat vs LlamaParse ; cette page compare les plateformes.
LlamaExtract est véritablement zero-shot : vous fournissez un schéma JSON ou Pydantic et il extrait par rapport à celui-ci sans données d'entraînement annotées, et sa documentation indique explicitement que ce sont les descriptions de champs, et non des exemples, qui guident le modèle (documentation LlamaIndex, 2026). Il propose trois niveaux de qualité (cost_effective, agentic, agentic_plus), trois cibles d'extraction (per_doc, per_page, per_table_row), des schémas jusqu'à 3 200 champs au niveau le plus élevé, et deux options qui comptent pour l'audit : cite_sources, qui relie une valeur à son origine dans le document, et confidence_scores, qui renvoie des signaux de confiance par champ. L'extraction pilotée par schéma n'est une lacune ni chez l'un ni chez l'autre. anyformat extrait par rapport à un schéma défini par l'utilisateur en zero-shot sur plus de 100 formats sans modèles, déclare dans un même schéma les champs au niveau document et au niveau tableau et renvoie les deux en un seul appel, et a obtenu 78,1 % à un score de parsing combiné sur plus de 1 000 documents réels couvrant plus de 30 types (benchmark anyformat, 2026).
C'est la vraie décision, et elle ne porte pas sur la qualité d'extraction. L'orchestration de LlamaIndex, c'est du code : Agent Workflows est un framework Python événementiel avec branchements, parallélisme, points d'intervention humaine, durabilité et observabilité, et LlamaAgents (en open preview depuis novembre 2025) l'accompagne d'une CLI llamactl qui récupère des dépôts modèles de fichiers Python que vous modifiez en local (documentation LlamaIndex, 2026). LlamaCloud propose bien un Agent Builder, une interface en langage naturel où vous décrivez un flux et où un agent de codage le génère, mais ce que vous obtenez est un véritable projet Python dans votre dépôt GitHub : modifier le flux ensuite revient donc à modifier du code et à redéployer. anyformat inclut Studio, un canevas de workflows no-code avec branchements, conditions, découpage, routage, classification, opérateurs d'extraction, croisement avec des sources de données internes et étapes de revue placées là où le processus l'exige, et un utilisateur métier modifie le flux sans déploiement. La question, dans une évaluation, n'est pas de savoir s'il existe un constructeur, mais qui peut modifier la logique d'extraction un mardi après-midi.
Déploiement et juridiction
LlamaCloud fonctionne en SaaS dans deux régions — Amérique du Nord sur AWS us-east-1 à cloud.llamaindex.ai et Europe sur AWS eu-central-1 à cloud.eu.llamaindex.ai — les données étant stockées dans la région où elles ont été déposées, et sa propre documentation précise que NA est la région primaire où les nouveautés sortent en premier, la région européenne pouvant les recevoir plus tard (documentation LlamaIndex, 2026). L'auto-hébergement et le bring-your-own-cloud existent : la plateforme complète se déploie sur Kubernetes via des charts Helm sur AWS, Azure ou GCP dans votre propre VPC, mais c'est une fonctionnalité réservée à Enterprise qui exige une clé de licence, et elle n'est pas air-gapped — LlamaIndex documente que tous les appels aux LLM partent directement de votre cluster vers les fournisseurs avec vos propres clés d'API. LlamaIndex Inc. est une société américaine : un point d'accès européen répond donc à la résidence des données sans changer la juridiction de l'éditeur qui exploite le logiciel. anyformat est européen par construction, une société européenne sur une infrastructure européenne, et se déploie en cloud, cloud privé ou environnements on-premise air-gapped.
LlamaIndex publie SOC 2 Type II, la conformité RGPD et HIPAA sur ses pages entreprise, avec des BAA personnalisés pour les clients enterprise. Son trust center à l'adresse security.llamaindex.ai est rendu en JavaScript et ne renvoie aucun contenu lisible aux robots de récupération, et l'ISO 27001 — la certification que les services achats européens traitent le plus souvent comme une exigence ferme — n'est pas listée publiquement sur les pages qui sont lisibles. L'absence d'un trust center public ne prouve pas que les contrôles manquent, mais les achats traitent généralement une certification non listée comme une certification absente. anyformat est certifié ISO 27001, avec un périmètre de certification couvrant le pipeline documentaire de bout en bout, et la conformité RGPD y est une contrainte architecturale plutôt qu'une annexe contractuelle.
Rétention zéro et traitement des données
Les deux la prennent en charge, avec des réglages par défaut différents. LlamaParse met les documents analysés en cache pendant 48 heures avant de les supprimer définitivement, et do_not_cache=True désactive la mise en cache pour une requête donnée (documentation LlamaIndex, 2026). anyformat exécute le traitement sans rétention comme un mode au niveau du compte : ni les fichiers source ni la sortie extraite ne persistent au-delà de la fenêtre de traitement. La différence pratique tient à ceci : le réglage sûr est-il la posture par défaut, ou un paramètre qu'un développeur doit penser à passer à chaque appel ?
Confiance et revue
LlamaExtract renvoie des signaux de confiance par champ et des citations de source lorsque confidence_scores et cite_sources sont activés, ce qui permet de faire remonter les valeurs incertaines. Ce que LlamaIndex ne publie pas, c'est un chiffre de calibration — un 0,8 annoncé correspond-il à avoir raison environ 80 % du temps ? Un score non calibré ne peut pas porter un seuil de routage, car aucun point de l'échelle n'est connu comme sûr pour une approbation automatique. anyformat mesure la calibration et la publie : 99,1 % de précision de calibration avec un Adaptive ECE de 0,009 (benchmark anyformat, 2026). C'est ce qui rend le traitement direct défendable devant un auditeur : les champs à haute confiance passent, les champs incertains sont routés vers un relecteur dans le même workflow, et chaque valeur porte une citation visuelle pointant sa position exacte sur la page. En production, L'Oréal rapporte 99 % de précision d'extraction et une réduction de 60 % du temps de traitement sur plus de 1 500 factures par mois.
Tarifs
LlamaCloud facture en crédits, à 1,25 dollar les 1 000 crédits, avec un plan Free à 0 dollar incluant 10 000 crédits, Starter à 50 dollars par mois pour 40 000 crédits, Pro à 500 dollars par mois pour 400 000 crédits, et Enterprise sur devis avec remises au volume, limites de débit 5 fois supérieures, SSO et déploiement auto-hébergé (tarifs LlamaIndex, 2026). anyformat facture en crédits décomptés par page et par opérateur, 10 crédits valant 0,01 € : Parse coûte 25 crédits par page (0,025 €, publié comme 25 dollars les 1 000 pages), Extract 35 crédits par page, Classify 10, Split 25 et Validate 25 crédits par règle (tarifs anyformat, 2026). Pay As You Go est gratuit au démarrage avec une dotation unique de 50 000 crédits, Business coûte 499 € par mois (399 € en facturation annuelle) pour 500 000 crédits, et Enterprise est sur devis avec déploiement VPC ou on-premise et rétention zéro. Sur les deux plateformes, le tarif à la page est le petit chiffre ; le coût d'ingénierie du pipeline qui l'entoure est le grand.
Évaluation et supervision
Le framework open source embarque des modules d'évaluation — exactitude, fidélité, pertinence du contexte, pertinence de la réponse, et métriques de recherche comme le hit-rate et le MRR — mais ce sont des bibliothèques qu'un développeur importe et exécute, orientées vers la qualité d'un pipeline RAG plutôt que vers la précision d'extraction champ par champ face à une vérité terrain entretenue. LlamaCloud ne documente publiquement ni gestionnaire de jeux de données de vérité terrain, ni suite de régression, ni supervision de la précision en production en tant que fonctionnalité produit. Mesurer si un changement de schéma a amélioré l'extraction, et repérer le moment où la précision en production s'écarte de votre benchmark, reste donc un travail que votre équipe construit et maintient.
Ce qu'anyformat livre et que LlamaIndex laisse à votre équipe
Les évaluations, disponibles aujourd'hui. Chaque workflow Extract et Classify d'anyformat dispose d'un onglet Health. Vous constituez un jeu de données avec une vérité terrain vérifiée, soit en promouvant un document que le workflow a déjà traité et en confirmant ses valeurs dans l'interface de revue, soit en téléversant des documents annotés avec le JSON attendu. Les fichiers peuvent être étiquetés en sous-ensembles, si bien que la précision se lit par fournisseur, par type de document ou par tranche de difficulté plutôt qu'en une moyenne unique. Une évaluation ré-extrait tous les documents concernés face à une version choisie du workflow et les note champ par champ, avec une vue résultat contre attendu sur chaque échec ; les exécutions sont numérotées et immuables, de sorte que l'effet d'un changement est mesuré et non supposé. Health Overview place ensuite le benchmark du jeu de données à côté de la précision, de la confiance et du taux de passage en production, et rapporte l'écart entre les deux (Evals).
Optimizer, annoncé et pas encore disponible. anyformat a annoncé Optimizer, un workflow qui s'ajuste lui-même face à son propre jeu de données en prenant vos évaluations comme cible. Il figure sur la feuille de route, pas dans le produit d'aujourd'hui (Evals).
Le pipeline que vous n'avez pas à construire. LlamaCloud renvoie du contenu analysé et des champs validés par schéma. La production exige en plus de la classification et du routage, des règles de validation, la gestion des reprises, une interface de revue, une supervision de la précision et un réajustage chaque fois qu'une mise en page ou un modèle sous-jacent change. Avec LlamaIndex, cette couche est du Python qui vous appartient : Agent Workflows fournit les primitives, le reste est votre dépôt, votre déploiement et votre astreinte. anyformat la livre comme surface produit : workflows no-code dans Studio, confiance calibrée par champ avec routage vers la revue, citations visuelles pour l'audit, et la boucle d'évaluation ci-dessus. Sur des tableaux allant jusqu'à 50 pages et environ 2 400 lignes, anyformat a maintenu une récupération de lignes proche de 99 %, et a extrait 94 % des factures complexes avec tous les champs et toutes les lignes corrects (benchmark anyformat, 2026). Mettre en place un workflow de production avec l'assistant Annie prend environ 5 minutes contre environ 4 heures de configuration manuelle (benchmark interne anyformat, 2026).
Quand choisir LlamaIndex
Choisissez LlamaIndex lorsque vous êtes une équipe d'ingénierie qui construit une application RAG ou agentique sur mesure et que vous voulez un framework plutôt qu'une plateforme. Le cœur open source est sous licence MIT avec plus de 300 paquets d'intégration : vous pouvez changer librement de fournisseur de LLM, d'embeddings et de base vectorielle et garder l'orchestration dans votre propre dépôt ; la portée de l'écosystème, l'étendue des connecteurs et la notoriété auprès des développeurs comptent parmi les plus larges de la catégorie, et l'offre gratuite de LlamaCloud plus un plan Starter à 50 dollars rendent le démarrage peu coûteux. Si la recherche et l'indexation comptent autant que l'extraction, si vous voulez maîtriser chaque étape du pipeline en code, ou si le besoin est l'ingestion pour du RAG plutôt que des opérations documentaires, ce contrôle est précisément l'objectif. Pour la question plus étroite de la qualité de parsing et du coût par page, voir anyformat vs LlamaParse.
Choisissez anyformat lorsque le pipeline documentaire doit fonctionner comme un processus métier supervisé et non comme une application que votre équipe maintient : lorsque la juridiction européenne et l'ISO 27001 sont des exigences fermes et non des préférences, lorsque la confiance calibrée et les citations visuelles sont ce qui justifie le traitement direct devant un auditeur, lorsque les opérations plutôt que l'ingénierie doivent être propriétaires des schémas et de la logique de workflow, ou lorsque les changements de workflow doivent être mesurés face à un jeu de données de vérité terrain avant d'atteindre la production. Les équipes qui passent d'un framework à une plateforme citent généralement les trois mêmes coûts : le code d'orchestration qu'il a fallu écrire, la couche de revue et de supervision que personne n'avait budgétée, et la juridiction américaine. Commencez sur anyformat.ai.