Reducto est une entreprise de parsing documentaire basée aux États-Unis, fondée vers 2023, qui propose un OCR agentique et une architecture VLM multi-passes pour l'extraction structurée. Elle est bien financée (108 M$, série B menée par a16z) et bien conçue, et son benchmark ouvert RD-TableBench démontre une vraie profondeur technique. Le produit dépasse le simple endpoint de parsing : aux côtés de Parse, Split, Extract et Edit, il livre une API Classify et Studio, un constructeur sans code pour enchaîner ces étapes en un pipeline.
Pour les entreprises européennes, les questions qui restent sont juridictionnelles et opérationnelles : qui régit les données, quel certificat l'équipe achats exige, et ce qu'il advient d'un champ sur lequel le modèle avait un doute.
Constructeur de workflows et gestion des schémas
Le Studio de Reducto est un constructeur sans code pour enchaîner les étapes d'un pipeline, et Classify gère le typage des documents. Décrire Reducto comme un simple endpoint de parsing qui vous laisse l'orchestration n'est plus à jour.
Ce que sa documentation ne décrit pas, c'est une file de revue humaine : un endroit où un relecteur voit les champs sur lesquels le système avait un doute, les corrige, et où la correction revient dans l'exécution puis part vers les systèmes en aval. anyformat associe au pipeline cette couche de revue, ainsi qu'une gestion des schémas pensée pour les équipes non techniques : un utilisateur métier charge un document d'exemple, voit les résultats d'extraction et modifie les champs sans développeur et sans cycle de déploiement.
La question à poser dans une évaluation n'est pas de savoir si un constructeur existe, mais qui peut modifier la logique d'extraction et ce qu'il advient des valeurs que personne n'a vérifiées.
Souveraineté européenne et résidence des données
Reducto est une entreprise américaine déployée sur AWS, avec des endpoints régionaux pour l'UE et l'Australie, et elle propose un déploiement en VPC et on-premise. C'est une flexibilité d'infrastructure significative, mais l'entreprise, sa gouvernance et son cadre juridique sont tous américains.
anyformat est natif de l'UE : construit par une équipe européenne, soumis à une gouvernance européenne, conforme au RGPD par architecture. Sélectionner un endpoint européen sur une plateforme régie par le droit américain ne place pas les données sous gouvernance européenne, et pour les acheteurs régulés cette distinction est l'essentiel.
Reducto détient SOC 2 Type II et propose un BAA HIPAA. Ce sont des certifications solides pour le marché américain. L'ISO 27001, le standard que les équipes achats européennes exigent généralement, n'y figure pas publiquement.
anyformat est certifié ISO 27001 et conforme au RGPD, avec un périmètre de certification qui couvre le pipeline de traitement documentaire de bout en bout. Pour les appels d'offres européens, l'ISO 27001 est souvent une exigence incontournable que SOC 2 seul ne satisfait pas.
Rétention zéro des données
Reducto prend en charge la rétention zéro des données à l'échelle du compte : les documents ne sont donc pas stockés après traitement. Sur ce contrôle, les deux produits sont à égalité.
anyformat propose le traitement sans rétention comme interrupteur natif, avec le même résultat. Ce qui ne s'égalise pas, c'est la juridiction sous laquelle les données, conservées ou non, ont été traitées, et c'est là que la discussion sur la conformité aboutit réellement.
Le parsing de Reducto est réellement solide. Son architecture d'OCR agentique multi-passes combine vision par ordinateur, VLM et détection d'erreurs, conçue pour les documents complexes, et elle rapporte jusqu'à 20 % de précision en plus qu'AWS, Google et Azure sur ses propres benchmarks, le RD-TableBench ouvert ajoutant de la crédibilité.
anyformat combine LLM, règles déterministes et scores de confiance calibrés sur tout le pipeline plutôt que sur la seule étape de parsing, en s'adaptant à plus de 100 formats et à n'importe quelle mise en page sans gabarits. La métrique que nous optimisons n'est pas la qualité de parsing en benchmark, mais la fréquence à laquelle le système se trompe sans le savoir.
Déploiement on-premise
Reducto propose des déploiements cloud, VPC et entièrement on-premise ou air-gapped. anyformat propose un déploiement en cloud privé et on-premise, y compris en environnements air-gapped. Les deux peuvent satisfaire une exigence de périmètre de données, et ni l'un ni l'autre ne devrait emporter une évaluation sur ce point.
Précision, confiance et évaluation
Reducto rapporte 99,24 % de précision sur des charges cliniques (étude de cas Anterior), publie RD-TableBench en accès ouvert et renvoie une valeur de confiance granulaire par champ extrait. Sa transparence sur les benchmarks dépasse celle de la plupart du marché.
La différence tient à la calibration et à ce qui se trouve derrière le chiffre. anyformat calibre la confiance champ par champ, mesurée à 99,1 % de précision de calibration avec un Adaptive ECE de 0,009 (benchmark anyformat, 2026) : un seuil fixé pour le straight-through processing se comporte donc comme le chiffre le laisse entendre. Chaque valeur porte en outre une citation visuelle qui la relie à sa position exacte sur la page, et les champs à faible confiance sont routés vers une file de revue plutôt que vers votre base de données. En production, L'Oréal rapporte 99 % de précision d'extraction et une réduction de 60 % du temps de traitement sur plus de 1 500 factures mensuelles.
L'évaluation boucle la boucle. Chaque workflow Extract et Classify d'anyformat dispose d'un onglet Health où vous constituez un jeu de données avec une vérité terrain vérifiée, lancez une évaluation qui réextrait chaque document concerné sur une version choisie du workflow et le note champ par champ. Les exécutions sont numérotées et immuables, et Health Overview place le benchmark du jeu de données à côté de la précision de production en temps réel et rapporte l'écart (Evals).
Tableaux longs et mises en page complexes
Reducto excelle ici. RD-TableBench cible spécifiquement l'extraction de tableaux complexes, et son architecture multi-passes gère bien les tableaux denses, les cellules fusionnées et les mises en page multi-colonnes.
Le pipeline multi-étapes d'anyformat gère lui aussi nativement la complexité des tableaux : cellules fusionnées, tableaux s'étendant sur plusieurs pages, ruptures structurelles et structures imbriquées. Sur des tableaux atteignant 50 pages et environ 2 400 lignes, il a maintenu une récupération des lignes de ~99 % (benchmark anyformat, 2026).
Sur la qualité brute du parsing de tableaux, les deux plateformes sont solides. La différence est ce qui se passe après le parsing : validation, confiance calibrée, routage vers la revue et audit par les citations visuelles.
Reducto résume les figures par défaut et renvoie une description des graphiques et diagrammes à côté du texte parsé. anyformat détecte les figures, les classe dans leur contexte et produit des descriptions structurées. Il y a parité, et aucun des deux produits ne devrait être choisi sur ce point.
Pour les acheteurs européens, oui, et les écarts décisifs sont juridictionnels : Reducto est une entreprise américaine qui n'affiche pas publiquement l'ISO 27001, là où anyformat est natif de l'UE et certifié. Côté produit, anyformat ajoute une file de revue humaine où les corrections reviennent dans l'exécution, une confiance calibrée avec citations visuelles pour l'audit, une gestion des schémas que les équipes non techniques peuvent opérer, et une suite d'évaluations qui mesure une version de workflow face à une vérité terrain avant sa mise en service.
Quand choisir Reducto
Reducto convient quand votre équipe veut une primitive de parsing pilotée par le code, avec de solides benchmarks ouverts sur les tableaux, quand la juridiction américaine et SOC 2 Type II satisfont votre cadre de conformité, et quand votre pipeline n'a pas besoin d'une étape de revue supervisée sur les champs incertains.
Choisissez anyformat quand la juridiction européenne et l'ISO 27001 sont des exigences incontournables, quand vous avez besoin d'une confiance calibrée et de citations visuelles pour justifier le straight-through processing auprès d'un auditeur, quand les équipes opérationnelles plutôt que les développeurs doivent posséder les schémas, ou quand vous voulez que les changements de workflow soient mesurés face à un jeu de données de vérité terrain avant d'arriver en production.
anyformat est la plateforme d'intelligence documentaire agentique conçue pour les entreprises européennes. Certifiée ISO 27001, conforme au RGPD, avec traitement à rétention zéro et déploiement on-premise. Commencez sur anyformat.ai