El parsing de documentos para agentes de IA consiste en darle al agente una herramienta que convierta un PDF, un escaneo o una imagen en texto que pueda leer, conservando la estructura: encabezados, tablas y orden de lectura. Un agente no puede mirar un archivo como lo hace una persona. Lee lo que devuelve una herramienta, así que si puede trabajar con tus documentos depende de lo que esa herramienta le envíe de vuelta.
MCP, el Model Context Protocol, es la forma estándar de que un agente llame a esas herramientas. Un servidor anuncia herramientas, el agente elige cuándo llamarlas y los resultados vuelven como contenido que el modelo lee. Esta página explica qué significa eso para los documentos, describe cómo lo exponen los proveedores y recorre la conexión de un agente de código a un servidor de parsing y el parsing de un PDF.
Por qué un agente necesita una herramienta de parsing
Una llamada de herramienta lleva JSON, no archivos. Según la especificación de MCP, los resultados de una herramienta son texto, imágenes, audio, enlaces a recursos o recursos incrustados, y el modelo los lee como contenido. Por tanto, un PDF tiene que llegar al servidor de otra forma, mediante una URL o una subida, y volver como texto. La guía de MCP de anyformat describe la misma restricción: el agente prepara el archivo o pasa una URL, y el resultado del parsing vuelve como markdown.
De ahí se derivan dos costes. El primero es el tamaño de la respuesta. En el ejemplo de la documentación de anyformat para la ejecución de una factura real, la sección de parsing supone alrededor del 90 % de la carga, y por eso la API permite pedir que no se devuelva el resultado del parsing cuando solo importan los campos; es un ejemplo, no una media medida. El segundo es la propia lista de herramientas. Cada herramienta que ve un agente ocupa espacio en su contexto, así que algunos proveedores permiten filtrar herramientas o dividirlas en servidores más pequeños.
Cómo exponen el acceso de agentes los demás proveedores
Los proveedores siguen dos patrones, a 30 de septiembre de 2026. Un servidor remoto alojado se añade al agente por URL y se autentica con OAuth, donde el cliente abre un navegador para iniciar sesión, o con una clave de API enviada como cabecera; Reducto, Extend y LlamaIndex publican servidores así. Un servidor local se ejecuta en tu máquina y lo arranca el cliente mediante entrada y salida estándar; según el proveedor necesita una clave de API o ninguna, como ocurre con el servidor de código abierto de Docling. No todos los proveedores tienen uno: de Mistral encontramos una API y un marco de agentes que puede llamar a herramientas MCP, pero ningún servidor propio para parsear documentos.
Configurar cualquiera de ellos sigue los mismos pasos. Consigue credenciales si el servidor las necesita, añade el servidor a tu cliente con las instrucciones del propio proveedor, pide al cliente que liste las herramientas y prueba con un documento sintético pequeño. Lo que cambia es lo que importa al elegir: OAuth o clave de API, alojado o local, y cuántas herramientas pone el servidor delante del agente. Consulta la documentación de cada proveedor para los detalles actuales, porque estos servidores cambian con rapidez.
Conectar un agente a anyformat
anyformat expone un servidor MCP remoto en https://api.anyformat.ai/mcp. Usa el transporte Streamable HTTP y se autentica con tu clave de API como token Bearer, la misma clave que la API REST. Hoy no hay flujo OAuth, así que el panel de conectores personalizados de las apps web y de escritorio de Claude, que espera OAuth, no es el camino. Usa un cliente que pueda enviar una cabecera, como Claude Code, Cursor, Codex u OpenCode, o un puente mcp-remote. La documentación describe el servidor en una línea: anyformat habla MCP y conectas tu agente con un único bloque de configuración.
Crea una clave en app.anyformat.ai, expórtala y añade el servidor. Para Claude Code, desde la documentación:
export ANYFORMAT_API_KEY="af_..."
claude mcp add --transport http anyformat https://api.anyformat.ai/mcp \
--header "Authorization: Bearer $ANYFORMAT_API_KEY" --scope user
claude mcp listPara Cursor, añade esto a ~/.cursor/mcp.json o .cursor/mcp.json:
{
"mcpServers": {
"anyformat": {
"url": "https://api.anyformat.ai/mcp",
"headers": { "Authorization": "Bearer ${env:ANYFORMAT_API_KEY}" }
}
}
}La documentación incluye los bloques equivalentes para Codex y OpenCode. Las claves tienen permisos: las herramientas de lectura necesitan acceso de lectura, las que crean, ejecutan, actualizan o eliminan necesitan acceso de escritura, y una herramienta que la clave no puede llamar no aparece en la lista. Las herramientas de eliminación están marcadas como destructivas y piden al agente que solicite aprobación antes.
Parsear un PDF con un agente
Usa un PDF sintético para esto, no un documento de un cliente: el agente guarda el resultado en disco y la llamada se factura.
Con el servidor conectado, lo pides en lenguaje natural:
Parse invoice.pdf with anyformat and save the markdown to invoice.md.Detrás de esa petición, el agente sigue la ruta de parsing rápido de la documentación. Prepara el archivo, lo que devuelve un espacio de subida con un identificador de objeto corto, y envía los bytes a ese espacio con un comando de shell, porque ninguna herramienta de MCP lleva bytes de archivo. Si el PDF ya está en una URL HTTPS pública, se salta la preparación y pasa la URL. Después llama a parse_document con el identificador del objeto, un parsing rápido de un documento, y a get_run para esperar el resultado. El markdown vuelve en el resultado de parsing de la ejecución, y la documentación dice que esa salida no se conserva, así que el agente tiene que escribirla en un archivo, y por eso la petición dice que lo guarde. La factura de ejemplo de la documentación tarda unos 13 segundos.
A partir de ahí, el markdown es un archivo normal que el agente puede leer, buscar y citar. Si necesitas campos en lugar de texto, el mismo servidor puede crear un workflow con un nodo de parsing y uno de extracción y pasar documentos por él, lo que devuelve cada campo con una puntuación de confianza y el texto original y la página. Eso se explica en la guía de MCP, junto con la vía Knowledge para hacer preguntas sobre varios documentos, que está en alfa.
Qué vigilar
- Créditos. El parsing mediante un workflow o
parse_documentes una llamada facturada. Consulta la tabla de créditos en la página de precios y usa una clave de prueba con límite para los experimentos. - Permiso de escritura. Una clave con permiso de escritura puede crear, ejecutar y eliminar. Da a los agentes el permiso mínimo que haga el trabajo.
- Documentos reales. Todo lo que parsea el agente acaba en su contexto y posiblemente en sus registros. Mantén los documentos de clientes fuera de las primeras pruebas.
- Volumen. MCP sirve para un agente que trabaja con un puñado de documentos. Un lote de miles pertenece a la API REST o a un SDK, llamados desde código.
Preguntas frecuentes
¿Qué es un servidor MCP para el parsing de documentos?
Un servidor que anuncia herramientas que un agente de IA puede llamar para convertir documentos en texto o datos estructurados. El agente decide cuándo llamarlas y los resultados vuelven como contenido que el modelo lee.
¿Puede un agente de IA leer un PDF directamente?
No solo con una llamada de herramienta, porque una llamada lleva JSON y no bytes de archivo. El PDF tiene que llegar a un servidor como URL o como subida, y el texto parseado vuelve como resultado.
¿Necesito OAuth para conectar un agente a anyformat?
No. anyformat usa una clave de API como cabecera Bearer y hoy no tiene flujo OAuth. Eso significa que lo conectas desde clientes que pueden enviar una cabecera, o mediante un puente, y no desde un panel de conectores que exige OAuth.
¿Cómo evito que un agente elimine workflows?
Usa una clave con permiso de solo lectura, o reserva el permiso de escritura para el agente que lo necesite. Las herramientas de eliminación están marcadas como destructivas y piden al agente que solicite aprobación antes.
¿Es MCP mejor que la API REST para el parsing?
Para un agente que decide qué hacer a continuación, MCP. Para pipelines fijos y lotes grandes, la API REST o un SDK llamados desde tu propio código.







