ChatGPT es un modelo de lenguaje de gran tamaño de propósito general desarrollado por OpenAI (San Francisco). Claude es un LLM de propósito general desarrollado por Anthropic (San Francisco). Gemini es un LLM de propósito general desarrollado por Google (Mountain View). Los tres leen documentos mediante modelos multimodales, y los tres pueden devolver salidas restringidas a un esquema JSON que definas.
La versión honesta de esta comparativa es más estrecha que hace dos años. Estos modelos extraen bien, y anyformat utiliza LLM internamente. La pregunta no es si un modelo sabe leer una factura. Es qué rodea al modelo cuando un valor erróneo cuesta dinero: de dónde salió el valor, qué probabilidad hay de que sea correcto, quién lo revisa cuando no lo es y bajo qué jurisdicción se procesó el documento.
El nivel de consumo y el de API son productos distintos
Casi toda la confusión de esta comparativa viene de tratar «ChatGPT» y «la API de OpenAI» como si fueran lo mismo. No lo son, y la diferencia es de gobierno del dato.
Las aplicaciones de consumo —ChatGPT, Claude.ai, la app de Gemini— conservan las conversaciones por defecto y, según el plan y los ajustes, ese contenido puede usarse para mejorar modelos. Subir ahí documentos de clientes es una decisión de gobierno del dato, no una decisión técnica.
Los niveles de API y empresa actúan como encargados del tratamiento bajo un DPA con cláusulas contractuales tipo, no entrenan con el contenido enviado por defecto y ofrecen modos de retención cero sujetos a aprobación. Las plataformas de los tres proveedores cuentan con certificación ISO 27001.
Así que la afirmación general de que los LLM no cumplen es falsa. La afirmación más estrecha —que los chatbots de consumo son el sitio equivocado para documentos de producción— se sostiene.
La brecha de trazabilidad
Cuando un modelo devuelve el total de una factura, devuelve un número. No devuelve las coordenadas de las que leyó ese número. Algunos proveedores devuelven citas a un pasaje de texto de origen; ninguno vincula un campo extraído a un cuadro delimitador sobre la imagen de la página.
El procesamiento documental en producción exige auditabilidad. Cuando un valor extraído entra en tu ERP y genera un pago, los auditores, los responsables de cumplimiento y los sistemas posteriores necesitan verificar de dónde provino.
anyformat adjunta una cita visual a cada campo extraído: haces clic en el campo y aterrizas en la posición exacta del documento de origen. Es lo que hace que las decisiones de la IA sean auditables bajo regulaciones europeas como ViDA, DORA y los mandatos de facturación electrónica de cada país.
Fluidez no es calibración
Los LLM son fluidos. Dan respuestas que suenan seguras incluso cuando no lo están. Un modelo puede extraer un número de pedido y presentarlo con la misma aparente certeza que un total de factura, aunque esté adivinando a partir de un escaneo borroso.
Las log-probabilidades de los tokens no sirven de sustituto. Describen lo seguro que estaba el modelo del siguiente token, no la probabilidad de que un campo sea correcto, y no están calibradas contra resultados reales. Así que no hay umbral que puedas fijar ni campo que puedas aprobar automáticamente sobre esa base. Este es el problema de los fallos silenciosos: un valor erróneo presentado con seguridad pasa todas las comprobaciones posteriores hasta que falla la conciliación.
anyformat asigna una puntuación de confianza calibrada a cada campo extraído, medida en un 99,1 % de precisión de calibración con un Adaptive ECE de 0,009 (benchmark de anyformat, 2026). La calibración es lo que hace que un umbral signifique algo: el campo al 98 % pasa solo, el campo al 62 % se deriva a un revisor.
La decodificación restringida cerró esta brecha. Structured Outputs, los esquemas de herramientas y los response schemas hacen que la salida sea estructuralmente determinista: los mismos nombres de campo, el mismo anidamiento, los mismos tipos, en cada ejecución. Quien siga describiendo la salida de un LLM como estructuralmente impredecible está describiendo 2023.
Lo que la validez estructural no te dice es si el valor es correcto. Un campo bien tipado puede estar equivocado con toda seguridad, y un esquema no lo detectará. Para eso están la evaluación y la confianza calibrada, y ninguna de las dos viene con la API de un modelo.
anyformat incluye una suite de evals: lanzas un conjunto etiquetado, obtienes precisión por campo, detectas regresiones antes de que lleguen a producción y comparas cambios del pipeline contra una línea base fija en lugar de contra una impresión.
Coste a escala
Los precios por token de los LLM hacen que la extracción puntual sea barata. A volúmenes de producción, las cuentas cambian: el coste escala con el número de páginas, con los reintentos y con cada nuevo prompt gastado en convencer a un documento difícil. La partida más grande suele ser la ingeniería: mantenimiento de prompts, validación de salidas, lógica de reintentos y las herramientas de revisión que acabas construyendo igualmente.
anyformat factura en créditos, por página y por operador: 10 créditos cuestan 0,01 €, así que Parse son 25 créditos por página (0,025 €) y Extract 35 créditos por página (precios de anyformat, 2026). La cifra que hay que comparar es el coste por salida correcta, no el coste por token.
Soberanía europea y jurisdicción
Esta es la dimensión donde nada ha cambiado. OpenAI, Anthropic y Google tienen su sede en EE. UU. Existen regiones de procesamiento europeas y opciones de residencia de datos, pero el proveedor que opera el servicio sigue bajo jurisdicción estadounidense, y eso es lo que examinan los requisitos europeos de soberanía, no dónde está el centro de datos. En la tabla comparativa de arriba, la soberanía europea es la fila donde todos los competidores puntúan «no».
anyformat es nativo europeo. Entidad europea, infraestructura europea, certificación ISO 27001, cumplimiento del GDPR por arquitectura, con procesamiento con retención cero y despliegue on-premise o aislado (air-gapped) en todos los planes.
Orquestación de flujos de trabajo y revisión humana
Las API de modelos procesan un documento cada vez, una llamada cada vez. Clasificación, división, enrutamiento, validación, colas de revisión, lógica condicional e integración con sistemas posteriores son ingeniería a medida que construyes y mantienes tú, y la interfaz de revisión, la parte que nadie dimensiona, suele ser la pieza más grande.
anyformat incluye Studio, un lienzo de flujos de trabajo sin código con ramificaciones, condiciones, divisiones, enrutamiento, operadores de extracción, cruce con fuentes de datos internas y revisión humana integrada. Los equipos de operaciones cambian el proceso sin un despliegue de código.
Tablas, figuras y diseños complejos
Los modelos multimodales leen tablas y gráficas con solvencia y, combinados con un response schema, devuelven las filas como JSON tipado. Los modos de fallo que quedan son los operativos: tablas que abarcan decenas de páginas, donde el sesgo posicional pierde filas por el medio; celdas combinadas y tablas que cruzan páginas; y la ausencia de trazabilidad por celda con la que contrastar una fila sospechosa.
El pipeline multietapa de anyformat mantuvo ~99 % de recuperación de filas en tablas de hasta 50 páginas y unas 2.400 filas (benchmark de anyformat, 2026), y devuelve las figuras como descripciones clasificadas y ligadas al esquema, con citas. Son problemas de ingeniería que no se resuelven solo con prompts.
El modelo mental adecuado
Los LLM son el motor dentro de las plataformas modernas de procesamiento de documentos, incluido anyformat. Usar la API de un modelo en bruto para extracción en producción es como comprar un motor diésel y llamarlo transporte. El motor es excelente. No es un vehículo.
anyformat es el vehículo: el modelo envuelto en confianza calibrada, citas visuales, orquestación de flujos de trabajo, revisión humana, evals y controles de cumplimiento nativos europeos.
Para producción, sí, pero no por las razones que esta comparativa daba antes. Las API de modelos ya resuelven la validación de esquemas, la lectura de tablas y la interpretación de gráficas, corren sobre plataformas certificadas en ISO 27001, firman DPA de encargado del tratamiento y ofrecen retención cero de datos en el nivel de API. Lo que no proporcionan es una puntuación de confianza calibrada por campo, una cita visual que ate cada valor a su posición en la página, una capa de flujos con revisión humana, un arnés de evals para medir precisión con tus propios documentos ni una opción de jurisdicción europea. anyformat usa LLM como motor de extracción y aporta exactamente esas cinco cosas. Si respondes preguntas puntuales sobre un puñado de documentos, un modelo en bruto es la herramienta correcta. Si procesas miles al día con obligaciones de cumplimiento europeas, la infraestructura que lo rodea es el producto.
Cuándo usar un LLM en bruto
Prototipado, consultas puntuales, análisis aislados. Usa un modelo en bruto cuando estés explorando, no operando.
Cuando los documentos llegan a producción: cada valor rastreable hasta su posición en la página, cada campo dudoso derivado a un revisor, la precisión medida en lugar de supuesta y todo bajo jurisdicción europea.
anyformat es la plataforma de inteligencia documental agéntica diseñada para empresas europeas. Con certificación ISO 27001, cumplimiento del GDPR, procesamiento con retención cero y despliegue on-premise. Empieza en anyformat.ai