Inteligência documental para pipelines de RAG e LLM
Extração estruturada para os sistemas que consomem os seus documentos — não conversão com perdas.
O problema: Markdown não é dados estruturados
O ecossistema de RAG convergiu num padrão comum: fazer o parsing dos documentos para Markdown, dividir o texto em fragmentos, gerar embeddings e fazer retrieval. Ferramentas como o LlamaParse e a Unstructured estão otimizadas para este pipeline. São rápidas, bem integradas com bases de dados vetoriais e eficazes em tarefas de retrieval centradas em texto.
Mas o Markdown é um formato de apresentação, não um formato de dados. Quando um documento com tabelas financeiras, estruturas aninhadas e campos tipados é convertido para Markdown, o resultado é texto legível que perdeu o seu esquema. Os cabeçalhos de colunas tornam-se strings delimitadas por barras verticais. As células unidas desaparecem. Os campos numéricos perdem os tipos. As relações hierárquicas aplanam-se.
Para workflows apenas de retrieval — "encontra o parágrafo que responde a esta pergunta" — o Markdown pode ser suficiente. Para workflows que precisam de extrair, validar e agir sobre dados estruturados dos documentos, o passo intermédio em Markdown destrói a informação de que precisa.
JSON estruturado com imposição de esquemas
A anyformat não converte documentos para Markdown. Extrai dados estruturados diretamente para JSON com esquema imposto.
Define os campos, os seus tipos e as suas relações. O sistema extrai valores que respeitam o seu esquema, com cada campo validado contra o tipo e as restrições esperados. O resultado é determinístico: o mesmo esquema produz a mesma estrutura JSON, sempre, independentemente do layout do documento.
Isto torna o output da anyformat diretamente consumível por sistemas a jusante, bases de dados, API e workflows de LLM, sem parsing, transformação ou pós-processamento. Os dados chegam estruturados porque foram extraídos estruturados — não convertidos a partir de um intermédio não estruturado.
Casos de uso: para lá do retrieval em RAG
Input para workflows de LLM: quando os LLM precisam de raciocinar sobre dados de documentos — não apenas de recuperar texto — precisam de input estruturado. Um modelo financeiro que processa resultados trimestrais precisa dos campos de receita, EBITDA e margem num esquema previsível, não de uma tabela em Markdown que o LLM tem de voltar a interpretar. A anyformat entrega campos que o LLM pode usar diretamente.
Construção de bases de conhecimento: construir uma base de conhecimento a partir de milhares de documentos exige estrutura consistente. Se cada documento produz uma forma de JSON diferente consoante o parsing do Markdown, a sua base de conhecimento não é fiável. A imposição de esquemas significa que cada documento de um dado tipo produz a mesma estrutura de campos, tornando a agregação e as consultas fiáveis.
Sistemas agênticos: os agentes autónomos que processam documentos como parte de workflows de vários passos precisam de dados previsíveis e tipados. Um agente que recebe Markdown tem de o interpretar. Um agente que recebe JSON com esquema imposto pode agir de imediato. A diferença entre interpretação e ação é a diferença entre um sistema frágil e um sistema robusto.
Cruzamento e validação: quando os dados extraídos dos documentos precisam de ser cruzados com bases de dados internas — faturas com ordens de compra, sinistros com apólices, candidaturas com registos — os campos estruturados com metadados de confiança tornam o cruzamento fiável. O Markdown transforma o cruzamento num problema de parsing de strings.
Esquemas determinísticos, output previsível
Um dos requisitos mais subestimados em pipelines de inteligência documental é o determinismo. Quando o mesmo tipo de documento produz estruturas de saída diferentes consoante os artefactos do parsing, os sistemas a jusante quebram de forma imprevisível.
Os esquemas da anyformat são determinísticos. Defina um esquema uma vez, e cada documento processado contra esse esquema produz a mesma estrutura JSON. Os campos que não podem ser extraídos são explicitamente marcados como nulos, com uma pontuação de confiança, não omitidos em silêncio. O seu código de integração pode confiar na forma dos dados.
Pontuação de confiança em cada campo
Nem todos os valores extraídos merecem a mesma confiança. Um número de fatura bem impresso, extraído de uma posição consistente, tem uma fiabilidade diferente de uma nota manuscrita interpretada a partir de uma digitalização degradada.
A anyformat atribui pontuações de confiança calibradas a cada campo extraído. Estas pontuações são calibradas contra julgamentos humanos, não probabilidades brutas do modelo. Os sistemas a jusante podem aplicar limiares: aceitar automaticamente acima de 95%, encaminhar para revisão entre 80% e 95%, marcar para introdução manual abaixo de 80%.
Para pipelines de LLM, as pontuações de confiança permitem grounding seletivo — o LLM pode ser informado de que campos são fiáveis e quais são incertos, melhorando a qualidade do raciocínio a jusante.
Mais de 100 formatos, uma API
Os documentos chegam como PDF, digitalizações, ficheiros Word, folhas de Excel, apresentações PowerPoint, páginas HTML, imagens e anexos de email. A anyformat processa mais de 100 formatos através do mesmo pipeline de extração, com o mesmo esquema, a mesma pontuação de confiança e o mesmo output JSON.
Sem pré-processamento específico por formato. Sem parsers separados para tipos de ficheiro diferentes. Uma API, um esquema, JSON estruturado à saída.
API e webhooks para integração em pipelines
A anyformat fornece uma API REST para extração síncrona e webhooks para integração assíncrona em pipelines. Submeta documentos por API, receba respostas JSON estruturadas. Configure webhooks para enviar os resultados para os seus sistemas quando o processamento termina.
Para pipelines de alto volume, os endpoints de processamento em batch lidam com milhares de documentos com débito consistente. Rate limits, lógica de retries e tratamento de erros estão integrados na camada da API, não deixados ao seu código de integração.
A diferença: extração vs. conversão
O LlamaParse converte documentos para ingestão em RAG. A Unstructured divide documentos para pesquisa vetorial. Ambas são ferramentas de conversão — transformam documentos em formatos orientados para texto, otimizados para retrieval.
A anyformat é uma ferramenta de extração — tira dos documentos dados estruturados, tipados e pontuados por confiança, para esquemas que define. O output não é texto para pesquisar. São dados para usar.
Se o seu pipeline precisa de encontrar passagens relevantes em documentos, as ferramentas de RAG funcionam. Se o seu pipeline precisa de extrair campos específicos, validá-los e alimentá-los a sistemas que esperam dados estruturados, a anyformat foi construída para isso.
Construa pipelines de inteligência sobre dados estruturados
Os seus documentos contêm informação estruturada. Os seus sistemas a jusante esperam input estruturado. O passo intermédio não deve envolver converter estrutura em texto e esperar reconstruí-la mais tarde.
Comece a extrair dados estruturados dos seus documentos →
A anyformat é a plataforma de inteligência documental criada para empresas que processam documentos complexos e críticos. Certificada ISO 27001, em conformidade com o RGPD, com processamento com retenção zero e instalação on-premise. Saiba mais em anyformat.ai
