LlamaParse est une API de parsing documentaire développée par LlamaIndex, lancée en février 2024, conçue pour convertir les documents en formats prêts pour les LLM dans des workflows de génération augmentée par récupération (RAG). Elle détient la certification SOC 2 Type 2 et LlamaCloud déclare la conformité au RGPD.
Elle est réellement rapide : un benchmark tiers publié par Procycons en mars 2025 a mesuré environ 6 secondes aussi bien pour 1 page que pour 50 pages en mode batch. L’usage payant fonctionne en crédits, à 1,25 $ pour 1 000 crédits, soit environ 0,00125 $ par page en mode Fast et jusqu’à environ 0,11 $ par page dans le mode agentique le plus coûteux (tarifs LlamaIndex, 2026).
anyformat résout un problème voisin : de l’extraction validée par schéma, enveloppée dans de l’orchestration de workflows, de la revue humaine et de la souveraineté des données européenne.
Les deux plateformes font de l’extraction pilotée par schéma. LlamaParse produit du Markdown, du texte, du JSON ou du XLSX, et LlamaExtract accepte un schéma JSON et renvoie des valeurs typées avec un score de confiance par champ et des citations pointant vers le passage source. L’extraction par schéma n’est pas une lacune.
Ce qui diffère, c’est la valeur par défaut. Markdown est la voie qu’empruntent la plupart des tutoriels LlamaIndex, et Markdown ne peut représenter ni cellules fusionnées, ni fusions de lignes, ni relations imbriquées : le choisir écarte la géométrie du tableau sans avertissement. Le mode JSON de mise en page la conserve, bounding boxes par cellule comprises.
anyformat extrait contre un schéma que vous définissez, en zero-shot, et renvoie du JSON validé, avec les champs au niveau document et au niveau tableau déclarés ensemble et renvoyés en un seul appel. Chaque champ porte un score de confiance calibré et une citation visuelle pointant vers sa position exacte sur la page.
LlamaIndex détient SOC 2 Type 2 et LlamaCloud déclare la conformité au RGPD, avec des conditions de sous-traitant disponibles pour les clients entreprise. Son trust center ne mentionne pas publiquement ISO 27001, la norme que les services achats européens réclament le plus souvent. L’absence d’un trust center public ne prouve pas que les contrôles manquent, mais les achats traitent en général une certification non listée comme une certification absente.
anyformat est certifié ISO 27001 et conforme au RGPD, avec des SLA entreprise et un support dédié.
Souveraineté européenne et résidence des données
LlamaIndex est une société américaine : les données de LlamaCloud relèvent donc de la juridiction américaine quelle que soit la région qui les traite. Le déploiement bring-your-own-cloud déplace le traitement dans votre propre VPC, ce qui répond à la résidence mais pas à la juridiction du fournisseur qui exploite le logiciel.
anyformat est natif de l’UE. Société européenne, infrastructure européenne, conformité au RGPD comme contrainte d’architecture plutôt que comme annexe contractuelle. Quand la souveraineté est une obligation légale et non une préférence, c’est cette distinction que les achats vérifient.
Rétention zéro des données
Les deux la proposent. LlamaParse accepte do_not_cache=True par requête, de sorte que le contenu traité n’est pas mis en cache. anyformat exécute le traitement en rétention zéro comme mode au niveau du compte : ni les fichiers sources ni les sorties extraites ne sont conservés au-delà de la fenêtre de traitement. La différence pratique tient à savoir si le réglage sûr est celui par défaut ou quelque chose qu’un développeur doit penser à activer à chaque appel.
Constructeur de workflows et orchestration
C’est la lacune la plus nette. LlamaParse est une API de parsing et d’extraction, et l’orchestration vit dans le framework LlamaIndex sous forme de code que votre équipe écrit et maintient. Classification, découpage, routage, logique conditionnelle, gestion des reprises et revue humaine relèvent entièrement de l’ingénierie.
anyformat inclut Studio, un canevas de workflows sans code : branchements, conditions, découpage, routage, opérateurs d’extraction, recoupement avec des sources de données internes et revue humaine placée là où le processus l’exige. Les équipes opérationnelles modifient le flux sans déploiement de code.
LlamaParse traite bien les documents standards et propose des modes coût/précision de Fast jusqu’au parsing agentique. Des tests tiers signalent des fusions de mots dans les mises en page multicolonnes, des données de colonne mal placées dans les tableaux complexes et aucune différenciation structurelle entre niveaux de titre (Procycons, 2025). La reconnaissance de l’écriture manuscrite est partielle et la couverture multilingue limitée.
anyformat prend en charge plus de 100 formats sans modèles et a obtenu 78,1 % au score combiné de parsing sur plus de 1 000 documents réels répartis sur plus de 30 types documentaires (benchmark anyformat, 2026).
Déploiement on-premise
LlamaIndex propose un déploiement auto-hébergé et bring-your-own-cloud en VPC privé chez les principaux fournisseurs cloud sur les offres entreprise ; les offres en libre-service sont uniquement cloud.
anyformat propose un déploiement on-premise sur toutes les offres, environnements air-gapped compris, sans palier entreprise à franchir.
Confiance et revue humaine
LlamaExtract renvoie un score de confiance par champ accompagné de citations : les valeurs incertaines peuvent donc être signalées. Ce que LlamaIndex ne publie pas, c’est une mesure de calibration, à savoir si un score de 0,8 correspond à avoir raison environ 80 % du temps. Des scores non calibrés ne peuvent pas soutenir un seuil de routage, car aucun nombre de l’échelle n’est connu comme sûr pour une approbation automatique.
anyformat mesure la calibration et la publie : 99,1 % de précision de calibration avec un Adaptive ECE de 0,009 (benchmark anyformat, 2026). C’est ce qui rend les seuils opérationnels : les champs à confiance élevée passent seuls, les champs incertains partent vers un relecteur dans le même flux. anyformat livre aussi une suite d’évaluations pour que les équipes mesurent ce comportement sur leurs propres documents avant la mise en production.
Tableaux longs et mises en page complexes
Le mode JSON de mise en page de LlamaParse renvoie des bounding boxes par cellule : la géométrie du tableau survit si vous le choisissez. Sur la voie Markdown, non.
Pour les tableaux longs en particulier, la réponse architecturale de LlamaParse est l’extraction ligne par ligne : traiter chaque ligne comme une cible d’extraction indépendante, les lancer en parallèle, réassembler. C’est une réponse réfléchie au biais positionnel en U sur les contextes longs : vous obtenez une couverture exhaustive des lignes sur des tableaux qui, autrement, en perdraient au milieu. Le compromis, c’est que le contexte au niveau document vit ailleurs dans le pipeline. L’appel au niveau ligne et l’appel au niveau document ne sont pas le même appel : un schéma qui a besoin des deux (nom du fournisseur en page de garde, lignes de détail des pages 40 à 80) demande donc deux jobs distincts et une jointure en aval.
Le pipeline multi-étapes d’anyformat préserve nativement la structure des tableaux et a maintenu ~99 % de récupération de lignes sur des tableaux allant jusqu’à 50 pages et environ 2 400 lignes (benchmark anyformat, 2026). Un seul schéma déclare ensemble les champs au niveau document et au niveau tableau. Un seul appel renvoie les deux, sans seconde passe d’extraction ni jointure en aval.
Les modes multimodal et agentique de LlamaParse détectent et transcrivent les figures. Ce qui n’est pas documenté, c’est la description structurée et liée au schéma de ce qu’un graphique dit réellement. anyformat détecte les figures, les classe en contexte et renvoie des descriptions de graphiques, schémas et images comme champs du schéma.
Cela dépend de la lacune visée. LlamaParse fait déjà de l’extraction par schéma, renvoie une confiance par champ et des citations, prend en charge la rétention zéro et propose un déploiement en VPC privé sur les offres entreprise : l’argument du changement n’est pas qu’il ne sait pas extraire. L’argument est opérationnel et juridictionnel : LlamaParse n’a pas de constructeur de workflows sans code, pas de file de revue, pas de mesure de calibration publiée pour ses scores de confiance, pas d’ISO 27001 publique, et LlamaIndex est une société américaine. anyformat couvre exactement cela : entité et infrastructure européennes, certification ISO 27001, un canevas de workflows sans code avec revue humaine, une confiance calibrée par champ avec citations visuelles et une suite d’évaluations pour mesurer la qualité d’extraction sur vos propres documents. Si le travail est de l’ingestion RAG dans l’écosystème LlamaIndex, LlamaParse reste le choix naturel.
Quand choisir LlamaParse
De l’ingestion RAG rapide et économique dans l’écosystème LlamaIndex, quand le pipeline autour du parser est du code que vous acceptez de maintenir.
Quand l’extraction doit fonctionner comme un processus et non comme un appel : juridiction européenne, confiance calibrée avec citations visuelles, orchestration sans code, revue humaine et évaluations. Commencez sur anyformat.ai.