Para leer texto en español, casi cualquier motor moderno funciona: Google, Azure o Tesseract lo reconocen sin problema. La diferencia real llega después: extraer campos personalizados sin entrenar modelos, entender facturas con IVA e IRPF, manejar NIF y CIF, y procesar los datos con residencia en la UE bajo el RGPD. Ahí es donde se decide esta comparativa.
Hemos evaluado siete herramientas con esos criterios. Esta es la foto completa:
Comparativa rápida
| Herramienta | Ideal para | Campos personalizados sin entrenamiento | Residencia de datos UE | On-premise | Modelo de precios |
|---|---|---|---|---|---|
| anyformat | Esquemas propios sobre facturas, nóminas y contratos en español, con precisión que puedes medir | Sí, zero-shot | Sí, nativa de la UE | Sí, incluidos entornos air-gapped | Por página y por operador (25 $/1.000 páginas de parsing) |
| Google Document AI | OCR bruto multilingüe a gran escala | Sí (modelo fundacional del Custom Extractor) | Parcial (región configurable, jurisdicción EE. UU.) | No | Por página |
| Azure Document Intelligence | Equipos del ecosistema Microsoft | No (5+ documentos etiquetados en Document Studio) | Parcial (región configurable, jurisdicción EE. UU.) | Parcial (contenedores con funciones limitadas) | Por página |
| AWS Textract | Tablas y formularios en pipelines AWS | No (devuelve OCR bruto) | Parcial (región configurable, jurisdicción EE. UU.) | No | Por página (65 $/1.000 con formularios + tablas) |
| ABBYY | Grandes despliegues IDP tradicionales | No (Skills preentrenadas + entrenamiento) | Según despliegue | Sí (FlexiCapture) | Licencia + servicios profesionales |
| Tesseract | OCR gratuito y autoalojado | No extrae campos | Sí (lo alojas tú) | Sí | Gratuito (Apache 2.0) |
| Nanonets | Automatización sencilla en pymes | Parcial (anotación HITL en casos no estándar) | No (multi-tenant en EE. UU.) | Solo con contrato enterprise | Por bloque ejecutado (0,02–0,30 $) |
Vamos herramienta por herramienta.
anyformat
anyformat es una plataforma europea de inteligencia documental para equipos que procesan facturas, nóminas y contratos, y el único proveedor de esta comparativa con producto y documentación completos en español. Extrae campos personalizados zero-shot: defines el esquema (proveedor, base imponible, IVA, retención de IRPF, NIF) y funciona desde el primer documento, sin etiquetar ni entrenar nada. Cada valor devuelto lleva una cita visual que enlaza con su posición exacta en la página y una confianza calibrada que decide qué pasa a revisión humana. En un benchmark público con más de 1.000 documentos reales alcanza un 78,1% de Parse Score. Nativo de la UE, certificado ISO 27001, con despliegue on-premise y un Studio de workflows sin código.
La otra mitad del producto es la medición. Cada flujo de Extract y Classify tiene una pestaña Health: construyes un dataset con verdad de referencia verificada (promocionada desde archivos de producción ya revisados o subida como datos etiquetados), etiquetas sub-datasets para leer la precisión por proveedor, tipo de documento o dificultad, y lanzas evaluaciones numeradas e inmutables que puntúan cualquier versión del flujo campo a campo contra esa verdad de referencia, con comparaciones de resultado frente a esperado. El Overview de Health pone el benchmark del dataset junto a la precisión, la confianza y el through rate de producción en vivo. Eso importa en procesos del mercado español donde un proveedor cambia el formato de su factura y nadie se entera hasta que falla la conciliación en el ERP. anyformat también ha anunciado Optimizer, un flujo que se ajusta a sí mismo contra su propio dataset usando tus evaluaciones como objetivo; todavía no está disponible.
El precio se basa en créditos y se cobra por página y por operador (10 créditos = 0,01 €): Parse 25 créditos por página, Extract 35, Classify 10, Split 25, con las variantes agénticas en 100 y 150. Los 25 $ por 1.000 páginas que cita el benchmark son la tarifa de parsing.
Ideal para: extraer campos propios de facturas, nóminas y contratos en español sin proyecto de etiquetado, con revisión humana y medición de precisión en la misma plataforma.
Google Document AI
Google Document AI es la plataforma de procesamiento documental de Google Cloud, orientada a OCR de gran volumen dentro del ecosistema GCP. Su Enterprise Document OCR reconoce texto en más de 200 idiomas según la documentación oficial, español incluido, y es de los motores más baratos por página. Los campos personalizados ya no exigen un proyecto de etiquetado: el Custom Extractor funciona sobre un modelo fundacional que extrae a partir del esquema, con un modo few-shot que acepta hasta 5 ejemplos etiquetados y un fine-tuning que exige 50 documentos de entrenamiento más 50 de test para alcanzar precisión de producción. Los límites están en otro sitio: muchas peticiones de procesamiento online se topan en 15 páginas, cada versión de procesador personalizado desplegada añade coste de hosting y los datos residen en regiones GCP configurables, bajo jurisdicción estadounidense.
Ideal para: OCR bruto multilingüe a gran escala en stacks que ya viven en GCP.
Azure Document Intelligence
Azure Document Intelligence (antes Form Recognizer) es la apuesta de Microsoft, con modelos preentrenados sólidos y buena integración con el resto de Azure. Es de las pocas opciones americanas con soporte explícito del español en facturas: la documentación oficial lista el español de España entre los idiomas de su modelo prebuilt-invoice. Para campos que ese modelo no cubre (una retención de IRPF, una referencia interna) hay que etiquetar documentos en Document Studio, cinco ejemplos como mínimo según la documentación de Microsoft y normalmente más, y entrenar un modelo propio, con un ciclo por cada cambio de esquema. El despliegue en contenedores existe, pero cubre solo una parte de las funciones.
Ideal para: equipos del ecosistema Microsoft cuyos campos encajan con los modelos preentrenados.
AWS Textract
AWS Textract es el servicio de OCR de Amazon, con buena reputación en extracción de tablas y formularios. Con documentos en español hay que leer la letra pequeña: según su propia FAQ, Textract extrae texto impreso, formularios y tablas en inglés, alemán, francés, español, italiano y portugués, pero el reconocimiento de manuscrito, el análisis de facturas y recibos (AnalyzeExpense), los documentos de identidad y las Queries funcionan solo en inglés. Es decir: la función pensada precisamente para facturas no sirve con una factura española. Devuelve OCR bruto (texto y coordenadas), así que la estructura la construye tu equipo con post-procesado. El análisis combinado de formularios y tablas cuesta 65 $ por 1.000 páginas, y 70 $ si añades queries (precios de AWS, 2026).
Ideal para: pipelines AWS que necesitan tablas de documentos impresos y pueden construir la capa de extracción.
ABBYY
ABBYY es el veterano del sector: proveedor de IDP fundado en 1989, con el clásico FineReader como motor OCR multilingüe (español incluido) y dos productos principales, Vantage (cloud) y FlexiCapture (on-premise). Su biblioteca de más de 150 Skills preentrenadas cubre muchos tipos de documento; los que quedan fuera requieren entrenamiento a medida y, con frecuencia, servicios profesionales. Como recogemos en nuestra comparativa detallada, el modelo de entrega pesa más que la tecnología: implantaciones de semanas o meses con integradores externos, presupuestos de servicios de entre 15.000 $ y más de 200.000 $ y contratos plurianuales.
Ideal para: grandes corporaciones con tipos de documento estables y presupuesto y calendario para un despliegue tradicional.
Tesseract
Tesseract es el motor de OCR open source de referencia, con licencia Apache 2.0 y, según su documentación oficial, datos de entrenamiento para más de 100 idiomas y 35 escrituras, con un paquete de español (spa) que funciona bien sobre texto impreso limpio. Es gratuito y se ejecuta donde tú decidas, así que la residencia de datos queda resuelta por definición: los documentos no salen de tu servidor. Seamos claros con lo que es: OCR bruto. Devuelve texto plano, no campos; la calidad cae con escaneos torcidos, fotos de móvil o manuscrito, y todo lo demás (clasificación, extracción, validación, revisión, seguimiento de la precisión) lo construye tu equipo.
Ideal para: proyectos con equipo técnico y presupuesto cero que solo necesitan convertir imagen en texto.
Nanonets
Nanonets es una plataforma de IDP de gama media fundada en 2017, con un constructor visual de workflows sin código y extracción sin plantillas. Su propia documentación reconoce que los modelos de serie pueden requerir anotación con revisión humana (HITL) para alcanzar precisión de producción en documentos no estándar, lo que en la práctica significa etiquetar datos. El precio es por bloque ejecutado (0,02–0,30 $) y se acumula cuando el workflow encadena varios bloques; su propia página de precios sitúa un flujo típico de facturas en cuatro a seis bloques por documento. Los datos residen por defecto en infraestructura multi-tenant en EE. UU.; el on-premise existe, pero solo con contrato enterprise.
Ideal para: pymes sin requisitos estrictos de soberanía que buscan automatización sencilla.
Qué mirar al elegir OCR para documentos en español
Leer bien el texto es la parte fácil. Estos seis criterios son los que separan un piloto de un sistema en producción:
-
RGPD y residencia de datos en la UE. Una región europea configurable en un hyperscaler americano no es lo mismo que un proveedor europeo: la jurisdicción sigue siendo estadounidense. Si vuestro sector (banca, sanidad, administración pública) exige soberanía real, filtra por proveedor UE o despliegue on-premise antes de mirar precios.
-
Tipos de documento del mercado español. Facturas con IVA desglosado, retención de IRPF o recargo de equivalencia; nóminas con bases de cotización; escrituras y contratos; modelos tributarios. Comprueba que el sistema maneja NIF, CIF y NIE, fechas en formato DD/MM/AAAA e importes con coma decimal (1.234,56 €) sin normalizarlos al formato americano.
-
Campos personalizados sin entrenamiento. Los modelos preentrenados cubren los campos estándar de una factura, no los tuyos. Si cada cambio de esquema exige etiquetar documentos y reentrenar, el coste real del proyecto está ahí. La extracción zero-shot elimina ese ciclo: defines el campo y funciona desde el primer documento. anyformat y el Custom Extractor de Google trabajan así; Azure, ABBYY y Nanonets siguen pasando por etiquetado.
-
Revisión humana y confianza. Ningún sistema acierta siempre. La pregunta es si te avisa cuando duda: una confianza calibrada por campo permite aprobar automáticamente lo seguro y enviar a revisión solo lo incierto, y las citas visuales dejan que el revisor (o el auditor) compruebe cada dato contra la página original.
-
Una forma de medir la precisión en el tiempo. La confianza te dice qué revisar hoy; no te dice si el cambio que hiciste la semana pasada empeoró las cosas. Un dataset con verdad de referencia verificada y evaluaciones repetibles y versionadas sí. Pregunta a cada proveedor cómo comparas dos versiones de un flujo campo a campo, y cómo ves el benchmark del dataset junto a la precisión real de producción.
-
El pipeline que tendrías que construir. Una API de OCR en bruto devuelve texto y coordenadas. El posprocesado, la validación del esquema, la lógica de reintentos y enrutamiento, la interfaz de revisión, el seguimiento de la precisión y el reajuste cada vez que un proveedor cambia el formato de su factura los construyes y los mantienes tú. Pesa esa ingeniería frente a una plataforma que ya la incluye, porque el precio por página rara vez es la cifra que decide.
Preguntas frecuentes
¿Qué API de OCR gratuita funciona bien en español?
Tesseract. Es open source (Apache 2.0), tiene un modelo de español mantenido oficialmente y sobre texto impreso limpio da resultados sólidos. Sus límites: devuelve texto plano en lugar de campos estructurados y la calidad cae con escaneos degradados o manuscrito. Si solo necesitas digitalizar texto y tienes equipo técnico, es la mejor opción gratuita; si necesitas extraer campos de facturas, te quedarás corto.
¿Cumplen el RGPD las APIs de OCR americanas?
Pueden operar conforme al RGPD: Google, Microsoft y AWS ofrecen regiones europeas y cláusulas contractuales tipo. Lo que no cambia es la jurisdicción: siguen siendo empresas sujetas a la legislación de EE. UU., con las obligaciones de acceso que esta impone. Para muchos casos es suficiente; en sectores regulados, o cuando la soberanía del dato es un requisito de consejo, se suele exigir proveedor europeo o despliegue on-premise.
¿Puedo extraer campos de facturas españolas sin entrenar un modelo?
Sí, por tres vías. Los modelos preentrenados de facturas (como el prebuilt-invoice de Azure, que soporta español) extraen los campos estándar: emisor, fechas, totales, IVA. El modelo fundacional del Custom Extractor de Google extrae campos definidos por ti a partir del esquema, aunque el fine-tuning con 50 o más documentos etiquetados es lo que lo lleva a precisión de producción. Y las plataformas de extracción zero-shot como anyformat te dejan definir el esquema (incluida una retención de IRPF o un número de pedido interno) y funcionan desde el primer documento.
¿Qué diferencia hay entre OCR y extracción de datos?
El OCR convierte una imagen en texto: te dice qué pone en el documento. La extracción de datos convierte el documento en campos estructurados y tipados (JSON) listos para un ERP o una base de datos: te dice que la base imponible es 1.200,00 €, que el CIF del emisor es B12345678 y en qué parte de la página aparece cada dato. Todos los motores de esta comparativa hacen OCR en español; solo algunos hacen extracción estructurada, y menos aún sin entrenamiento.
Si estás evaluando proveedores concretos para documentos en español, hemos publicado comparativas dimensión a dimensión: empieza por anyformat vs Google Document AI.

