Cómo automatizar la extracción de datos de documentos PDF
La extracción de datos de documentos en PDF se automatiza definiendo un esquema: los campos que quieres obtener, con su nombre y su descripción, en lugar de construir una plantilla distinta para cada proveedor, cliente o formato de documento. Un motor de extracción por schema lee el documento (un contrato, un formulario, un informe, un documento de identidad, una factura), localiza los campos que definiste y devuelve cada valor con su nivel de confianza y la evidencia de dónde salió.
Y el punto que la mayoría de guías sobre "extracción con IA" pasan por alto: el esquema no cambia aunque cambie el formato del documento. Un contrato en Word, un formulario escaneado y un informe en PDF nativo pueden compartir el mismo esquema de campos si lo que buscas es la misma información (nombre, fecha, importe, referencia); lo que cambia es solo cómo se lee cada documento, no lo que le pides.
Las facturas son el caso más habitual de este problema, y tienen guías propias con el detalle fiscal español: automatizar la extracción de facturas (el hub) y extraer datos de facturas automáticamente (paso a paso). Esta página cubre el problema general, con cualquier documento, no solo facturas.
¿Qué es la extracción por schema?
Extracción por schema significa definir la salida antes de leer el documento, no al revés.
Defines cada campo con un nombre y una descripción en lenguaje natural (fecha_emision, importe_total, nif_proveedor...); esa descripción es literalmente el texto que ve el modelo de extracción para saber qué buscar en el documento. No hace falta entrenar el sistema con documentos etiquetados de antemano ni mantener una plantilla de coordenadas por cada diseño distinto: el mismo schema se aplica al contrato de un proveedor, al formulario de otro y a la factura de un tercero, aunque el diseño de cada uno sea distinto.
anyformat sugiere campos automáticamente al definir el schema, apoyado en IA, así que no se parte de una hoja en blanco.
¿Cómo se valida cada dato extraído?
Cada dato extraído lleva un número de confianza calibrado y la evidencia de dónde salió, no una etiqueta binaria de correcto o incorrecto.
Con anyformat, cada valor extraído lleva confianza calibrada y evidencia apuntando al lugar exacto del documento de donde salió: lo que supera el umbral se procesa solo, y lo dudoso va a revisión humana con la prueba al lado. La confianza es calibrada (Platt) de 0 a 100 por campo, y por celda cuando el dato viene de una tabla: un 90 se comporta como un 90% de aciertos, que es lo que necesitas para fijar un umbral de revisión y defenderlo delante de tu equipo, no solo para enseñar un número.
En la práctica esto se ve así: al revisar un dato dudoso no ves solo el valor extraído suelto, ves el documento original al lado con un recuadro marcando el sitio exacto de la página de donde salió ese dato, para confirmarlo o corregirlo de un vistazo en vez de releer el documento entero buscando dónde estaba. Por API, cada valor lleva además el texto y el número de página de donde se extrajo, como evidencia consultable desde tu propio sistema.
Este marcado visual campo a campo se conoce como visual grounding — el eslabón que falta cuando una herramienta te da un número de confianza pero no te dice dónde mirar para comprobarlo tú mismo.
Además del schema de extracción, puedes añadir reglas de validación en lenguaje natural sobre los campos ya extraídos (por ejemplo, que una fecha de vencimiento sea posterior a la de emisión), con severidad de error o de aviso.
¿Por qué esto escala mejor que las reglas o plantillas hechas a mano?
Una plantilla o un conjunto de reglas se rompe en cuanto cambia el formato del documento; un schema no.
Un sistema basado en reglas o en plantillas de coordenadas necesita una versión distinta por cada proveedor, cliente o diseño de documento: en cuanto una aseguradora cambia el formulario de siniestros o un proveedor cambia de ERP, la plantilla deja de funcionar y hay que rehacerla. La extracción por schema separa qué quieres (el campo) de cómo está escrito en la página, así que el mismo schema sigue funcionando cuando cambia el formato, porque quien interpreta el diseño es el modelo de extracción, no una coordenada fija.
Esto importa sobre todo fuera de finanzas: legal (contratos de proveedores distintos), operaciones (albaranes y pedidos de cada cliente), seguros (formularios de siniestros de cada compañía) o identidad (documentos de países distintos) son casos donde el número de formatos de origen crece más rápido que el equipo que mantiene plantillas.
¿Qué tipos de documentos y formatos admite?
El mismo flujo procesa PDFs nativos, escaneados, documentos de Office, imágenes, correos electrónicos y XML.
anyformat procesa PDFs, escaneos, archivos de Office (Word, Excel, PowerPoint), imágenes, correos electrónicos y XML como entrada. El documento se normaliza primero a un formato común y pasa por el mismo flujo de trabajo tipado (parse → clasificación/división → extracción → validación), sea cual sea el tipo de documento de origen.
Para documentos con datos sensibles (identidad, historiales, contratos con cláusulas de confidencialidad), anyformat se despliega en la nube (SaaS), en la infraestructura del cliente o de forma completamente aislada (air-gapped, sin llamadas a servicios externos), con sede y entidad legal en la UE y certificación ISO 27001:2022.
Preguntas frecuentes
¿Necesito plantillas o ejemplos etiquetados para cada tipo de documento?
No. Defines el schema una vez (los campos y su descripción) y se aplica a cualquier documento que encaje en ese schema, aunque el diseño varíe.
¿Qué pasa si un dato extraído tiene poca confianza?
Se envía a revisión humana junto con la evidencia de dónde salió en el documento, en lugar de contabilizarse sin comprobar.
¿Funciona con documentos escaneados o solo con PDF nativo?
Con ambos: el mismo flujo procesa PDFs nativos, escaneados, imágenes y otros formatos de Office.
¿anyformat solo sirve para facturas?
No. El schema y el flujo de extracción son los mismos para cualquier documento; las facturas son solo el caso más frecuente, con guías propias por el detalle fiscal español: hub de facturas y extracción paso a paso.
¿Cómo empiezo a definir un schema para mis documentos?
Con el listado de campos que necesitas y una descripción de cada uno; anyformat sugiere campos automáticamente al definirlo, apoyado en IA.
