Cómo reducir las alucinaciones de los LLM en la extracción de documentos
Una alucinación en la extracción de documentos con LLM es un valor que el modelo devuelve y que no aparece en el documento: un importe de factura inventado, una fecha sacada del campo equivocado, el nombre de un proveedor completado con la memoria del modelo en vez de leído de la página. En un pipeline de extracción esto es peor que un valor ausente. Un valor ausente se marca. Uno alucinado se paga.
Las alucinaciones en este contexto suelen caer en unos pocos patrones reconocibles:
- Fabricación — un valor sin ninguna base en el documento (un total inventado).
- Atribución incorrecta — un valor real del documento, colocado en el campo o la fila equivocada (una fecha sacada de un campo que no le corresponde).
- Completado por memoria — un valor plausible que el modelo ya "sabe" por su entrenamiento, sustituyendo lo que la página dice realmente (el nombre de un proveedor rellenado en vez de leído de la página).
- Alucinación de formato — un valor inventado con una forma lo bastante parecida a una real (una fecha bien formada, un identificador de aspecto válido) como para pasar una revisión superficial.
Las siete técnicas de abajo reducen la frecuencia con la que esto pasa. El cambio más importante es conceptual, así que va primero: no puedes llevar las alucinaciones a cero, pero sí puedes hacer que cada una sea detectable, y una alucinación detectable es una tarea de revisión con un coste, ya no un riesgo que asumes a ciegas. Ese principio separa los sistemas de extracción en producción de las demos.
| Técnica | Qué detecta | Qué no detecta |
|---|---|---|
| 1. Grounding | Valores sin ubicación en el documento | Un valor incorrecto que sí existe en otra parte de la página |
| 2. Confianza calibrada | Extracciones inciertas, marcadas para revisión | Errores confiados (para eso hace falta la 6) |
| 3. Restricciones de esquema | Tipos y formas incorrectas (texto libre en un campo de fecha) | Valores plausibles del tipo correcto |
| 4. Parseo consciente del layout | Errores por orden de lectura desordenado y tablas rotas | Errores en texto limpio |
| 5. Enrutado por umbral | Convierte la 2 en una decisión operativa | Nada por sí sola; es el bucle de control |
| 6. Validación determinista | Errores confiados que rompen la aritmética o los checksums | Errores en campos de texto libre |
| 7. Medición continua | Deriva tras cambios de modelo o prompt | Nada en tiempo real; es el bucle de feedback |
1. Ancla cada valor extraído en el documento fuente
Grounding significa que cada campo extraído lleva un puntero al lugar exacto del documento donde se leyó el valor: página, fragmento de texto y, cuando el sistema lo soporta, la región de la página. Si un valor no se puede trazar hasta la página, no debería sobrevivir en el pipeline. El grounding convierte "confía en el modelo" en "haz clic y comprueba": un revisor verifica un importe de factura marcado en segundos porque la extracción muestra de dónde salió.
En anyformat, cada campo extraído se devuelve con su evidencia en la misma respuesta de la API: el texto fuente y el número de página del que se leyó. En la interfaz de revisión, la evidencia se resalta sobre la página misma, así que quien comprueba un campo ve la ubicación, no solo el texto. También funciona al revés: hacer clic en un valor de la página muestra a qué campo se extrajo, así que un revisor puede empezar por la extracción o por el documento y llegar al mismo sitio.
2. Usa scores de confianza calibrados, no la confianza cruda del modelo
Un score de confianza es el número que un sistema de extracción asigna a un valor para decir cuán seguro está de que ese valor es correcto; está calibrado cuando ese número coincide con la precisión empírica, de modo que un campo con score 95 acierta el 95% de las veces, medido sobre documentos reales. Las probabilidades crudas de un LLM no están calibradas, y suelen ser más altas justo donde el modelo está rellenando un hueco. Calibrar significa evaluar el sistema de extracción contra un ground truth en un conjunto grande de documentos, y ajustar los scores hasta que signifiquen lo que dicen.
La confianza por campo de anyformat está calibrada: el score se deriva de las probabilidades del modelo de extracción y se ajusta contra ground truth (Platt scaling), así que un 90 significa lo mismo en una factura de proveedor que en un extracto bancario.
La confianza se mide en cada etapa por separado, no solo una vez al final: el parseo tiene su propio score de cuán bien se leyó la estructura y el texto del documento, la extracción tiene su propio score por campo, y un resumen a nivel de documento combina ambos. Esa separación es lo que permite saber si un mal resultado viene de un problema de parseo o de extracción, en vez de un único número opaco que cubre todo el pipeline.
Dos cosas que esta página no afirma: que la calibración sea exclusiva de anyformat, y que la calibración de cualquier proveedor quede probada solo con la palabra. La prueba de una afirmación de calibración es una evaluación publicada, que es para lo que sirve el número de arriba.
3. Restringe la extracción con un esquema explícito
La extracción con esquema obliga al modelo a devolver valores de un tipo y una forma declarados: un campo de fecha no puede devolver texto libre, un campo de moneda no puede devolver una frase. Un campo tipado como fecha o bien devuelve una fecha válida como 2026-03-15, o nada: no puede devolver "algo de marzo", ni un "xxx" suelto que el modelo produjo cuando la página no estaba clara. La extracción libre invita al modelo a escribir. Un esquema le obliga a leer. La definición de esquema zero-shot significa que el mismo esquema funciona en layouts que el sistema nunca ha visto, sin entrenar una plantilla por proveedor. Los esquemas no evitan un valor plausible pero incorrecto del tipo correcto; para eso están las técnicas 2 y 6.
4. Parsea el layout antes de extraer: el orden de lectura es una fuente de alucinaciones
Muchas alucinaciones de extracción son fallos de parseo disfrazados: celdas de tabla fusionadas, orden de lectura multi-columna, cabeceras pegadas a la sección equivocada. Si el parser le da al modelo texto desordenado, el modelo rellena los huecos inventando. El parseo consciente del layout (tablas reconstruidas como tablas, orden de lectura preservado, estructura de página explícita) elimina la ambigüedad que el modelo, si no, alucinaría. El efecto es mayor en tablas complejas y en documentos largos, donde la degradación de contexto se acumula página a página.
anyformat publica la calidad de su parseo: un Parse Score de 78,1% sobre un conjunto de más de 1.000 documentos reales, por delante de Gemini 3.5 Flash (77,9%) y GPT-5.6 (74,2%) en la misma tabla. En ParseBench, el benchmark independiente de LlamaIndex sobre unas 2.000 páginas verificadas por humanos, anyformat puntúa 80,83, en 4º puesto de los 35 motores evaluados.
5. Enruta por umbral de confianza: automatiza lo seguro, revisa lo incierto
El enrutado por umbral hace pasar directamente cada extracción por encima de un umbral de confianza calibrado, y manda a una persona todo lo que quede por debajo. Este es el rendimiento operativo de la calibración: como el score es fiable, el umbral se convierte en un dial de negocio. Ajústalo más estricto para pagos, más laxo para archivo. En anyformat el umbral se define por workflow, y la cola de revisión le muestra al revisor cada campo incierto junto a su evidencia en la página.
Pruébalo con tus propios documentos: el plan gratuito da 50.000 créditos sin tarjeta, suficiente para correr una muestra real por un workflow con umbrales de confianza activados. Empieza gratis.
6. Valida entre campos con reglas deterministas
Los LLM no deberían ser la última línea de defensa. La validación determinista detecta alucinaciones que parecen seguras: las líneas de una factura deben sumar el total, los identificadores fiscales deben pasar la validación de checksum (un NIF español tiene un carácter de control verificable), las fechas deben caer en rangos plausibles, las monedas deben coincidir con el país del proveedor. Un valor alucinado que pasa el propio check de confianza del modelo rara vez sobrevive a la aritmética.
7. Mide tu tasa de alucinación sobre tus propios documentos, de forma continua
El benchmark de un proveedor dice cómo rinde el sistema sobre los documentos del proveedor. Tu tasa de alucinación sobre tus documentos es el único número que importa. Reserva un conjunto de evaluación etiquetado, vuelve a correrlo con cada cambio de modelo o de prompt, y sigue tres métricas por separado: precisión de campo, tasa de alucinación (un valor incorrecto devuelto con confianza) y tasa de abstención (el sistema dice correctamente "no encontrado"). Un sistema que nunca se abstiene está alucinando en algún sitio. El Monitoring de anyformat corre estas evaluaciones por versión de workflow, así que un cambio de modelo aparece como un número antes de aparecer como un pago.
Qué significa "reducir" las alucinaciones en producción
La mayoría de las guías se quedan en trucos de prompting y estrategias de chunking. Ayudan al margen. La respuesta estructural es que el riesgo de alucinación nunca llega a cero, así que los sistemas en producción se diseñan alrededor de la detección y el enrutado. El pipeline que aguanta es aquel en el que un valor alucinado tiene que superar un score de confianza calibrado, una comprobación de grounding, una restricción de esquema y una regla de validación, y en el que el raro caso que lo consigue cuesta una revisión humana en vez de un pago equivocado. Nada de esto debería costarte tus datos: toda la cadena corre sin retención de documentos y, cuando se requiere, totalmente air-gapped.
Más lecturas en anyformat.ai: qué significa un score de confianza y cómo lo calibramos · anyformat vs LlamaParse · alternativas a AWS Textract · alternativas a Google Document AI · integración por API · seguridad y cumplimiento en trust.anyformat.ai.
Preguntas frecuentes
¿Se pueden eliminar por completo las alucinaciones de los LLM en la extracción de documentos?
No. Se pueden hacer poco frecuentes mediante grounding, restricciones de esquema y parseo consciente del layout, y se pueden hacer detectables mediante confianza calibrada y validación determinista, de modo que los errores no detectados se acercan a cero aunque los errores del modelo no lo hagan.
¿Cuál es la diferencia entre confianza y confianza calibrada?
La confianza es un número que emite el modelo. La confianza calibrada es un número que se ha verificado contra un ground truth, de modo que 95 significa 95% de acierto. Solo la segunda puede guiar con seguridad decisiones de automatización.
¿Los modelos de razonamiento o los LLM más nuevos resuelven las alucinaciones en extracción?
Cada generación de modelo desplaza el perfil de error; ninguna lo elimina. La consecuencia práctica es la técnica 7: vuelve a correr tu conjunto de evaluación con cada cambio de modelo.
¿Qué tasa de alucinación es aceptable para procesar facturas?
El objetivo operativo es la tasa de error no detectado tras el enrutado por confianza y la validación, no la tasa de error bruta del modelo. Los equipos que procesan pagos fijan el umbral de modo que los errores no detectados se midan en fracciones de un punto porcentual, y aceptan la correspondiente proporción de documentos que van a revisión.
¿Cómo sé si el score de confianza de un proveedor está realmente calibrado?
Pide la evaluación: el conjunto de documentos, su tamaño, y la precisión observada dentro de cada banda de confianza. Una afirmación de calibración sin una evaluación publicada es solo una etiqueta.
¿Listo para medirlo con tus documentos? Haz un bake-off con anyformat: tus archivos, tu esquema, la confianza y la evidencia en cada campo.

