O LlamaParse é uma API de parsing de documentos desenvolvida pela LlamaIndex, lançada em fevereiro de 2024, concebida para converter documentos em formatos prontos para LLM em workflows de retrieval-augmented generation (RAG). Tem certificação SOC 2 Type 2 e o LlamaCloud declara conformidade com o RGPD.
É genuinamente rápido: um benchmark de terceiros publicado pela Procycons em março de 2025 mediu cerca de 6 segundos tanto para 1 página como para 50 páginas em modo batch. A utilização paga funciona a créditos, 1,25 $ por cada 1.000 créditos, o que corresponde a cerca de 0,00125 $ por página em modo Fast e até cerca de 0,11 $ por página no modo agêntico mais caro (preçário LlamaIndex, 2026).
A anyformat resolve um problema adjacente: extração validada contra esquema, envolvida em orquestração de workflows, revisão humana e soberania de dados europeia.
Ambas as plataformas fazem extração guiada por esquemas. O LlamaParse produz Markdown, texto, JSON ou XLSX, e o LlamaExtract aceita um esquema JSON e devolve valores tipados com uma pontuação de confiança por campo e citações que apontam para a passagem de origem. A extração por esquema não é uma lacuna.
O que difere é o valor por omissão. O Markdown é o caminho que a maioria dos tutoriais do LlamaIndex usa, e o Markdown não consegue representar células unidas, células que atravessam linhas ou relações aninhadas: escolhê-lo descarta a geometria da tabela sem aviso. O modo JSON de layout preserva-a, incluindo as bounding boxes por célula.
A anyformat extrai contra um esquema definido por si, em zero-shot, e devolve JSON validado, com os campos ao nível do documento e ao nível da tabela declarados em conjunto e devolvidos numa única chamada. Cada campo traz uma pontuação de confiança calibrada e uma citação visual que aponta para a sua posição exata na página.
A LlamaIndex tem SOC 2 Type 2 e o LlamaCloud declara conformidade com o RGPD, com condições de subcontratante disponíveis para clientes enterprise. O seu trust center não lista publicamente a ISO 27001, a norma que as equipas de compras europeias pedem com mais frequência. A ausência de um trust center público não prova que os controlos faltem, mas as compras tratam normalmente uma certificação não listada como uma certificação ausente.
A anyformat tem certificação ISO 27001 e conformidade com o RGPD, com SLA empresariais e suporte dedicado.
Soberania europeia e residência dos dados
A LlamaIndex é uma empresa norte-americana, pelo que os dados do LlamaCloud ficam sob jurisdição dos EUA, seja qual for a região que os processa. A implementação bring-your-own-cloud move o processamento para a sua própria VPC, o que responde à residência mas não à jurisdição do fornecedor que opera o software.
A anyformat é nativa da UE. Empresa europeia, infraestrutura europeia, conformidade com o RGPD como restrição arquitetural e não como anexo contratual. Quando a soberania é uma obrigação legal e não uma preferência, é essa a distinção que as compras verificam.
Retenção zero de dados
Ambos a oferecem. O LlamaParse aceita do_not_cache=True por pedido, pelo que o conteúdo processado não fica em cache. A anyformat executa o processamento com retenção zero como modo ao nível da conta: nem os ficheiros de origem nem o output extraído são conservados para além da janela de processamento. A diferença prática está em saber se a definição segura vem por omissão ou se é algo que um programador tem de recordar em cada chamada.
Construtor de workflows e orquestração
Esta é a lacuna mais clara. O LlamaParse é uma API de parsing e extração, e a orquestração vive no framework LlamaIndex como código que a sua equipa escreve e mantém. Classificação, divisão, encaminhamento, lógica condicional, gestão de retentativas e revisão humana são tudo trabalho de engenharia.
A anyformat inclui o Studio, uma tela de workflows sem código: ramificações, condições, divisão, encaminhamento, operadores de extração, cruzamento com fontes de dados internas e revisão humana colocada onde o processo a exigir. As equipas de operações alteram o fluxo sem um deploy de código.
O LlamaParse lida bem com documentos padrão e oferece modos de custo/precisão desde o Fast até ao parsing agêntico. Testes de terceiros reportam fusão de palavras em layouts multicoluna, dados de coluna mal colocados em tabelas complexas e nenhuma diferenciação estrutural entre níveis de título (Procycons, 2025). O reconhecimento de escrita manual é parcial e a cobertura multilingue é limitada.
A anyformat suporta mais de 100 formatos sem templates e obteve 78,1% na pontuação combinada de parsing em mais de 1.000 documentos reais distribuídos por mais de 30 tipos documentais (benchmark anyformat, 2026).
Implementação on-premise
A LlamaIndex oferece implementação self-hosted e bring-your-own-cloud em VPC privadas nos principais fornecedores cloud, nos planos enterprise; os planos self-service são exclusivamente cloud.
A anyformat oferece implementação on-premise em todos os planos, incluindo ambientes air-gapped, sem barreira enterprise para a desbloquear.
Confiança e revisão humana
O LlamaExtract devolve uma pontuação de confiança por campo juntamente com citações, pelo que os valores incertos podem ser sinalizados. O que a LlamaIndex não publica é um valor de calibração: se uma pontuação de 0,8 corresponde a acertar cerca de 80% das vezes. Pontuações não calibradas não sustentam um limiar de encaminhamento, porque nenhum número da escala é conhecido como seguro para aprovação automática.
A anyformat mede a calibração e publica-a: 99,1% de precisão de calibração com um Adaptive ECE de 0,009 (benchmark anyformat, 2026). É isso que torna os limiares operacionais: os campos de confiança alta passam sozinhos, os incertos seguem para um revisor dentro do mesmo fluxo. A anyformat inclui também uma suite de evals para que as equipas meçam esse comportamento nos seus próprios documentos antes de irem para produção.
Tabelas longas e layouts complexos
O modo JSON de layout do LlamaParse devolve bounding boxes por célula, pelo que a geometria da tabela sobrevive se o escolher. Pelo caminho Markdown, não.
Para tabelas longas em concreto, a resposta arquitetural do LlamaParse é a extração ao nível da linha: tratar cada linha como um alvo de extração independente, executá-las em paralelo e voltar a montar. É uma resposta ponderada ao enviesamento posicional em U em contextos longos: obtém cobertura exaustiva das linhas em tabelas que de outro modo perderiam linhas a meio. O compromisso é que o contexto ao nível do documento vive noutro ponto do pipeline. A chamada ao nível da linha e a chamada ao nível do documento não são a mesma chamada, pelo que um esquema que precisa de ambos (nome do fornecedor na capa, linhas de detalhe da página 40 à 80) exige dois jobs separados e um join a jusante.
O pipeline multietapa da anyformat preserva nativamente a estrutura das tabelas e manteve ~99% de recuperação de linhas em tabelas até 50 páginas e cerca de 2.400 linhas (benchmark anyformat, 2026). Um único esquema declara em conjunto os campos ao nível do documento e ao nível da tabela. Uma única chamada devolve ambos, sem segunda passagem de extração nem join a jusante.
Deteção e explicação de figuras
Os modos multimodal e agêntico do LlamaParse detetam e transcrevem figuras. O que não está documentado é a descrição estruturada e ligada ao esquema daquilo que um gráfico realmente diz. A anyformat deteta figuras, classifica-as em contexto e devolve descrições de gráficos, diagramas e imagens como campos do esquema.
Depende de qual seja a lacuna. O LlamaParse já faz extração por esquema, devolve confiança por campo e citações, suporta retenção zero e oferece implementação em VPC privada nos planos enterprise: o argumento para mudar não é que não saiba extrair. O argumento é operacional e jurisdicional: o LlamaParse não tem construtor de workflows sem código, nem fila de revisão, nem valor de calibração publicado para as suas pontuações de confiança, nem ISO 27001 pública, e a LlamaIndex é uma empresa norte-americana. A anyformat cobre isso: entidade e infraestrutura europeias, certificação ISO 27001, uma tela de workflows sem código com revisão humana, confiança calibrada por campo com citações visuais e uma suite de evals para medir a qualidade da extração nos seus próprios documentos. Se o trabalho é ingestão RAG dentro do ecossistema LlamaIndex, o LlamaParse continua a ser a escolha natural.
Quando escolher o LlamaParse
Ingestão RAG rápida e económica dentro do ecossistema LlamaIndex, quando o pipeline em torno do parser é código que aceita manter.
Quando a extração tem de funcionar como processo e não como chamada: jurisdição da UE, confiança calibrada com citações visuais, orquestração sem código, revisão humana e evals. Comece em anyformat.ai.