Una API de parsing de documentos convierte un PDF, un escaneo o una imagen en texto estructurado que puedes usar en código: markdown o JSON con los encabezados, las tablas y el orden de lectura conservados, y a veces la posición de cada bloque en la página. Es el primer paso antes de que la extracción, la recuperación o un agente lean el documento, y las diferencias entre proveedores están en el precio, en dónde se pueden ejecutar los datos y en qué devuelven además del texto.
Esta página compara siete API según cuatro cosas que puedes comprobar en las páginas públicas de cada proveedor: el precio inicial publicado y el plan gratuito, dónde se puede desplegar, el cumplimiento normativo que lista y qué lleva la salida además del markdown. Los precios son los que cada proveedor publicó el 30 de septiembre de 2026, en la moneda en que los publica, y no los hemos convertido. Las herramientas van en orden alfabético. No las clasificamos, porque ningún benchmark cubre las siete y los que existen los dirige un proveedor con interés en el resultado.
anyformat es una de las siete. La hemos construido nosotros, así que lee su apartado con eso en mente; se describe con los mismos criterios y los mismos límites que las demás.
| Herramienta | Precio publicado de parsing | Plan gratuito | Despliegue | Salida además del markdown |
|---|---|---|---|---|
| anyformat | Parse: 25 créditos por página, 10 créditos = 0,01 € (0,025 € por página, 25 € por 1.000 páginas) | 50.000 créditos al registrarte, una sola vez | Nube nativa de la UE, nube privada, on-premise incluido air-gapped | Diseño por bloques; confianza por campo y evidencia en la extracción |
| Extend | 2 créditos por página en el nivel de rendimiento, 0,0125 $ por crédito de pago por uso | Bolsa de créditos gratuita | Regiones US1, US2 y EU1, VPC e híbrido | Cola de revisión y evals |
| LandingAI ADE | Unos 1,5 créditos por página, 100 créditos = 1 $ | 1.000 créditos | Alojamiento en EE. UU. y la UE, VPC y on-premise en Enterprise | Cajas delimitadoras mediante su API Ground |
| LlamaParse | De 1 a 45 créditos por página según el nivel, 1.000 créditos = 1,25 $ | 10.000 créditos | Nube en EE. UU. y una región de la UE, VPC empresarial | Diseño y confianza en algunos niveles |
| Mistral OCR | Por 1.000 páginas; la cifra no aparecía en las páginas que comprobamos | No aparece en las páginas que comprobamos | Empresa europea, API | Cajas por párrafo, etiquetas de bloque y confianza por bloque (OCR 4.1) |
| Reducto | 10 $ por 1.000 páginas con su modelo r-1 | 150 $ en créditos | Regiones UE y AU en Growth, VPC y on-premise en Enterprise | Diseño y cajas delimitadoras |
| Unstructured | 15 $ por 1.000 páginas tras 10.000 páginas gratuitas | 10.000 páginas | SaaS, instancia dedicada, en VPC, bare metal en Business | Matrices de elementos y fragmentos |
Fuentes de la tabla, todas leídas el 30 de septiembre de 2026: Extend, LandingAI, LlamaParse, Mistral (precios y modelos), Reducto, Unstructured y la propia página de precios de anyformat. Donde una cifra no estaba en esas páginas, la tabla lo dice en lugar de adivinar.
1. anyformat
anyformat es una plataforma de extracción de documentos construida alrededor de un esquema: defines los campos y la plataforma analiza, extrae, clasifica, divide y valida, con un paso de revisión para lo que queda por debajo de un umbral de confianza. El parsing está disponible por separado mediante la API v3, que devuelve markdown, y mediante un servidor MCP para agentes.
Parse cuesta 25 créditos por página, y 10 créditos son 0,01 €, o sea 0,025 € por página o 25 € por 1.000 páginas; algunas páginas de anyformat citan esa misma cifra como 25 $ por 1.000 páginas, pero el precio del crédito está fijado en euros. Extract son 35 créditos por página. El plan gratuito concede 50.000 créditos al registrarte, una sola vez. anyformat es nativa de la UE y se despliega como nube, nube privada u on-premise, incluido air-gapped, que funciona en producción en un cliente del sector público; hay más detalle en extracción de documentos on-premise y air-gapped. Indica ISO 27001 y RGPD, y hay un modo de retención cero disponible bajo petición.
Lo que la distingue es lo que ocurre después del parsing: los campos extraídos llegan con una puntuación de confianza calibrada y con el texto original y la página de donde se leyeron, lo que alimenta el ciclo de revisión. Las contrapartidas son reales. El parsing a 25 € por 1.000 páginas cuesta más que el modelo r-1 de Reducto y el operador Edit sigue en beta. El detalle de benchmarks está en la entrada de benchmarks de anyformat, que publicamos nosotros, y los precios están en la página de precios. Para una comparación directa con cada herramienta de abajo, consulta las páginas /vs enlazadas en los apartados siguientes.
2. Extend
Extend ofrece API de parse, extract, split, classify y edit con un Studio visual, y añade herramientas de revisión con persona en el circuito y de evaluación.
Cobra en créditos: el pago por uso es de 0,0125 $ por crédito, con un plan Scale de 500 $ al mes que incluye 50.000 créditos a 0,01 $, y el nivel de parsing de rendimiento usa 2 créditos por página. Las regiones son US1, US2 y EU1, con opciones de traer tu propia nube, VPC e híbrido, y no encontramos una opción totalmente air-gapped en su documentación. Indica SOC 2 Tipo II, HIPAA (un acuerdo de asociado comercial en el plan Scale) y RGPD. Es una empresa estadounidense. Algunas opciones multiplican el coste en créditos, por ejemplo el procesamiento prioritario, así que revisa el multiplicador del nivel que usarías. Consulta anyformat vs Extend. Fuente: página de precios de Extend, leída el 30 de septiembre de 2026.
3. LandingAI ADE
Agentic Document Extraction de LandingAI es un parser basado en visión que devuelve markdown y campos estructurados, con operaciones de división y extracción encima.
Un dólar compra 100 créditos, una página típica son unos 1,5 créditos y la bolsa gratuita es de 1.000 créditos. El plan Team empieza en 250 $ al mes. El alojamiento en la UE figura en todos los niveles al mismo precio que en EE. UU., VPC y on-premise son opciones de Enterprise, e indica SOC 2 Tipo II y HIPAA para Team y superiores. Su API Ground devuelve cajas delimitadoras del contenido extraído. Dos matices de su documentación pública: el parser DPT-3 Pro por defecto no devuelve puntuación de confianza y, con la retención cero de datos activada, la API Ground no está disponible. Consulta anyformat vs LandingAI. Fuente: página de precios de LandingAI, leída el 30 de septiembre de 2026.
4. LlamaParse
LlamaParse, de LlamaIndex, cubre parse, extract, classify y split con una misma cartera de créditos. LlamaIndex publica además LiteParse, un parser local de código abierto que devuelve texto plano.
Mil créditos cuestan 1,25 $ y una página cuesta desde 1 crédito en el nivel Fast hasta 45 en Agentic Plus, es decir, de 1,25 $ a 56,25 $ por 1.000 páginas, con créditos adicionales para las páginas con formularios. El plan gratuito es de 10.000 créditos. Funciona en EE. UU. y en una región de la UE disponible desde julio de 2026, con VPC para empresas. Las entradas de LlamaParse lideran ParseBench, un benchmark de parsing que dirige la propia LlamaIndex (clasificación del 21 de septiembre de 2026), así que lee ese ranking sabiendo quién lo publica. Su foco es el parsing más que los flujos de revisión. Consulta anyformat vs LlamaParse y alternativas a LlamaParse. Fuentes: la página de precios y la documentación de LlamaIndex, leídas el 30 de septiembre de 2026.
5. Mistral OCR
Mistral OCR es un único modelo de OCR detrás de una API y no una plataforma: envías un documento y recibes markdown. El modelo actual es OCR 4.1, que devuelve cajas delimitadoras a nivel de párrafo, etiquetas estructurales de bloque y puntuaciones de confianza por bloque; OCR 4.0 quedó obsoleto el 29 de septiembre de 2026 y se retira el 30 de septiembre de 2026, así que usa la 4.1.
Mistral es una empresa francesa y su API se cobra por 1.000 páginas según su página de precios; la documentación y la página de precios no mostraban la cifra cuando lo comprobamos, así que no citamos ninguna, y no encontramos certificaciones de cumplimiento listadas en las páginas que comprobamos. El alcance es más estrecho que el de las demás: no hay constructor de flujos, ni extracción de campos, ni paso de revisión, y eso lo construyes tú alrededor. Para documentos en español, consulta las mejores API de OCR para documentos en español. Fuentes: la página de modelos y la página de precios de Mistral, leídas el 30 de septiembre de 2026.
6. Reducto
Reducto es una API de parse y extract orientada al código, con un Studio para probar. Su modelo r-1, lanzado en septiembre de 2026 y todavía en versión preliminar, cuesta 10 $ por 1.000 páginas para parsing y 20 $ para extracción en su página pública de precios.
Los créditos gratuitos empiezan en 150 $. Ofrece regiones de la UE y AU en el plan Growth y despliegue en VPC u on-premise en Enterprise, e indica SOC 2, HIPAA y retención cero de datos. Publica además RD-TableBench, un benchmark abierto de extracción de tablas. El modelo r-1 es opcional y está en versión preliminar, así que comprueba la facturación del modelo que llames. Consulta anyformat vs Reducto. Fuente: página de precios de Reducto, leída el 30 de septiembre de 2026.
7. Unstructured
Unstructured es una plataforma de ingesta con un núcleo en parte de código abierto: convierte los documentos en elementos tipados y fragmentos listos para un almacén vectorial, con un paso de extracción que admite un esquema JSON.
Tras 10.000 páginas gratuitas cobra 0,015 $ por página, o sea 15 $ por 1.000, con precio a medida en Business. Las opciones de despliegue incluyen SaaS, instancia dedicada, en VPC y bare metal en Business. Indica HIPAA, SOC 2 Tipo 2, RGPD e ISO 27001, y FedRAMP High como disponible. Su salida son matrices de elementos y no valores por campo con confianza, lo que encaja mejor con pipelines de ingesta que con flujos de revisión. Consulta anyformat vs Unstructured. Fuente: página de precios de Unstructured, leída el 30 de septiembre de 2026.
Cómo elegir
- Necesitas on-premise o VPC: anyformat, o Reducto, LandingAI o Unstructured en sus niveles superiores.
- Necesitas air-gapped en concreto: anyformat lo indica y funciona en producción en un cliente del sector público. No lo encontramos indicado para las demás en las páginas que comprobamos, así que pregunta directamente a cada proveedor.
- Necesitas residencia de datos en la UE: anyformat es nativa de la UE, y Extend, LandingAI, LlamaParse y Reducto ofrecen una región de la UE.
- Alimentas un índice de RAG y quieres la menor fricción: LlamaParse o Unstructured.
- Quieres un modelo y no una plataforma, y construirás el resto: Mistral OCR o Reducto.
- Necesitas colas de revisión y confianza por campo, no solo texto: anyformat o Extend.
- Quieres cajas delimitadoras desde un único endpoint: la API Ground de LandingAI o Mistral OCR 4.1.
Elijas lo que elijas, pruébalo con tus documentos más difíciles antes de comprometerte. Una muestra de veinte archivos reales te dirá más que cualquier comparativa, incluida esta, y te mostrará cómo trata cada opción las tablas y los escaneos que rompen los parsers. La misma prueba sirve para todas las herramientas de arriba.
Preguntas frecuentes
¿Qué es una API de parsing de documentos?
Una API que convierte un documento en texto estructurado: markdown o JSON con los encabezados, las tablas y el orden de lectura conservados, y a menudo la posición de cada bloque. La extracción, que saca campos con nombre, suele ejecutarse encima del parsing.
¿Qué diferencia hay entre parsing y extracción?
El parsing lee el documento y devuelve su contenido y su estructura. La extracción toma ese contenido y devuelve los campos concretos que definiste en un esquema, como un número de factura o un total.
¿Qué API de parsing de documentos es la más precisa?
Ningún benchmark cubre las siete herramientas, y los públicos principales los dirige un proveedor. Por eso no las clasificamos. Prueba con tus propios documentos.
¿Qué API de parsing de documentos pueden funcionar on-premise?
De estas siete, anyformat ofrece on-premise incluido air-gapped. Reducto y LandingAI ofrecen on-premise en los planes Enterprise y Unstructured ofrece en VPC y bare metal en Business, pero no encontramos que indiquen operación air-gapped. Extend ofrece VPC e híbrido y no encontramos una opción air-gapped en su documentación. Confírmalo con cada proveedor, porque estas opciones cambian.
¿Hay alguna API de parsing de documentos gratuita?
La mayoría tiene una bolsa gratuita. anyformat concede 50.000 créditos al registrarte, LlamaParse 10.000 créditos, Unstructured 10.000 páginas, LandingAI 1.000 créditos y Reducto 150 $ en créditos. Las condiciones gratuitas de Mistral no aparecían en las páginas que comprobamos.

