A Unstructured é uma plataforma de ingestão documental parcialmente open-source, otimizada para pipelines de RAG, com mais de 71 conectores (Databricks, Elasticsearch, S3, Google Drive e outros). As certificações SOC 2 Type II, ISO 27001 e HIPAA cobrem a plataforma comercial, não a biblioteca open-source.
A Unstructured converte documentos em arrays de elementos que alimentam workflows de LLM, e o seu nó Extract produz também JSON com a forma de um esquema. Com o ecossistema de conectores mais amplo do mercado, é uma escolha forte para equipas de IA que constroem sistemas de retrieval.
Os dois produtos convergiram o suficiente para que "qual deles extrai campos" já não seja a pergunta que separa. O que os distingue é o que acompanha o valor extraído e onde termina o pipeline.
A Unstructured faz extração estruturada de campos. O seu nó Extract aceita um esquema JSON que define num construtor visual e devolve os valores extraídos dentro do pipeline de ingestão. Essa capacidade é real e recente, e qualquer comparação que diga o contrário está desatualizada.
A anyformat foi construída para extração estruturada como produto inteiro. Defina o seu esquema para quaisquer campos e qualquer tipo de documento, e obtenha JSON estruturado logo no primeiro documento.
A diferença está no que volta com cada valor. A Unstructured devolve o valor; a anyformat devolve o valor, uma pontuação de confiança calibrada e uma citação visual que aponta para a região exata da página de onde foi lido. Sem uma pontuação por campo não há limiar a fixar, pelo que cada campo é aceite às cegas ou revisto à mão.
Soberania europeia e residência dos dados
A Unstructured é uma empresa norte-americana. As opções de instalação incluem API na cloud e self-hosted. A residência dos dados depende da opção de instalação, mas a governação e o quadro legal da plataforma são norte-americanos.
A anyformat é nativa da UE. Construída por uma equipa europeia, em conformidade com o RGPD por arquitetura e implementada com controlos de residência de dados concebidos para os requisitos regulamentares europeus. Aqui, a soberania é uma obrigação legal, não uma opção de configuração.
A Unstructured tem certificações SOC 2 Type II, HIPAA e ISO 27001. É um portefólio de conformidade sólido, com uma distinção que vale a pena levar para a revisão de compras: essas certificações cobrem a plataforma comercial e a sua API. A biblioteca open-source fica fora do âmbito, pelo que uma instalação autogerida do código open-source de particionamento não herda nenhuma delas.
A anyformat também tem certificação ISO 27001 e está em conformidade com o RGPD, com a certificação a cobrir o pipeline de processamento de ponta a ponta. A diferença não é o certificado, mas a jurisdição: a anyformat é nativa da UE por conceção, não uma plataforma norte-americana com opções de região.
Retenção zero de dados
A Unstructured documenta retenção zero de dados para a sua plataforma: os documentos submetidos são processados e não conservados.
A anyformat oferece processamento com retenção zero como opção nativa: documentos processados, dados devolvidos, ficheiros de origem eliminados. Ambas as plataformas passam esta linha, e a pergunta que resta é que jurisdição rege o subcontratante.
Construtor de workflows e orquestração
A Unstructured tem um desenhador visual de workflows. Monta-se um DAG de nós: conector de origem, particionador, chunker, enriquecimento, embedder, Extract, conector de destino. É um construtor a sério, e foi feito para ETL.
A anyformat inclui um construtor visual de workflows dirigido a outro trabalho: ramificações, condições, divisão de documentos, encaminhamento, operadores de extração, portas de validação e revisão human-in-the-loop. O vocabulário dos nós é de processo de negócio e não de pipeline de dados, pelo que uma linha de fatura com confiança baixa vai para um revisor concreto e a correção fica registada na execução.
Escolha pelo destino. Se o pipeline termina numa base de dados vetorial, um DAG de ETL é a abstração certa. Se termina num ERP com um passo de aprovação à frente, não é.
A Unstructured publica o seu próprio benchmark SCORE, com números fortes: 0,917 de Adjusted CCT, a taxa de alucinação mais baixa (0,027) e 0,844 de pontuação em tabelas. São números publicados pelo fabricante.
Um benchmark de terceiros publicado pela Procycons em março de 2025 mediu a velocidade de outra forma: a Unstructured em 51,06 segundos para uma única página, contra 6,28 segundos do Docling e cerca de 6 segundos do LlamaParse. São os números de uma equipa sobre um conjunto de documentos específico, não uma alegação do fabricante, e vale a pena reproduzi-los nos seus próprios documentos antes de os tomar como decisivos.
A anyformat suporta mais de 100 formatos, com pontuação de confiança calibrada em cada campo extraído, alcançando 99% de precisão em produção. A arquitetura minimiza as falhas silenciosas através de revisão humana condicionada pela confiança.
Instalação on-premise
A Unstructured oferece instalação self-hosted, que dá controlo total dos dados.
A anyformat oferece cloud privada e instalação on-premise, incluindo ambientes air-gapped. Ambas as plataformas podem satisfazer requisitos de perímetro de dados.
Precisão em produção
O benchmark SCORE da Unstructured mede a qualidade do parsing: alinhamento de elementos, precisão de carateres, taxas de alucinação. É uma métrica de parsing e nada diz sobre se um campo extraído concreto está certo, porque a plataforma não devolve confiança por campo contra a qual o pontuar.
A anyformat mede o que importa para as operações documentais: precisão de extração ao nível do campo, com pontuações de confiança calibradas. Alcançamos 99% de precisão em produção, validada por clientes empresariais, com cada campo pontuado quanto à sua fiabilidade. Cada workflow de Extract e Classify tem ainda um separador Health onde avaliações numeradas e imutáveis pontuam campo a campo uma versão do workflow contra ground truth verificada, com o benchmark do dataset ao lado da precisão de produção em tempo real (Evals).
Tabelas longas e layouts complexos
A Unstructured devolve as tabelas em HTML, pelo que a estrutura de linhas e colunas sobrevive à conversão em vez de ser achatada em texto. No benchmark da Procycons citado acima registou boa precisão numérica em tabelas simples, à velocidade de processamento aí reportada.
O pipeline multi-fase da anyformat lida nativamente com a complexidade das tabelas: células unidas, tabelas que atravessam várias páginas, quebras estruturais. O resultado é estruturado e pronto para consumo a jusante, com cada célula a trazer a sua própria confiança e posição na página.
Deteção e explicação de figuras
A Unstructured gera descrições de imagens, incluindo os valores mostrados num gráfico, como parte do seu passo de enriquecimento. A anyformat deteta figuras, classifica-as no contexto e produz descrições estruturadas de gráficos, diagramas e imagens incorporadas.
Ambas descrevem figuras. Só uma anexa à descrição uma pontuação de confiança e uma citação visual, que é a diferença entre um resumo que pode citar numa auditoria e um resumo que tem de voltar a verificar à mão.
Depende de onde termina o seu pipeline. Os dois produtos sobrepõem-se mais do que antes: ambos fazem parsing de documentos complexos, ambos aceitam um esquema JSON, ambos têm um construtor visual, ambos oferecem retenção zero e self-hosting.
Se o seu objetivo é dividir documentos em arrays de elementos para ingestão por LLM, a Unstructured foi construída de raiz para isso. Os seus mais de 71 conectores e a base open-source tornam-na a escolha por omissão para equipas de pipelines de RAG.
Se o seu objetivo é levar campos específicos — totais de faturas, números de apólices, datas de contratos — para sistemas por que alguém responde, o que falta é confiança por campo, uma fila de revisão que registe as correções na execução e avaliações contra a sua própria ground truth. A Unstructured devolve valores extraídos sem confiança anexada, e a sua tela de workflows modela um job de ETL em vez de um processo de aprovação.
A anyformat preenche exatamente essa lacuna: extração zero-shot definida por esquema, pontuações de confiança calibradas e citações visuais em cada campo, um Studio construído para revisão e aprovação, e arquitetura nativa da UE com processamento com retenção zero.
Algumas equipas usam ambas: a Unstructured para ingestão em RAG e a anyformat para extração estruturada. São mais complementares do que concorrentes.
Quando escolher a Unstructured
Está a construir pipelines de RAG e precisa do ecossistema de conectores mais amplo. O seu pipeline termina numa base de dados vetorial e ninguém tem de dar o aval a um campo em concreto.
Precisa de campos específicos fora dos documentos e dentro dos seus sistemas — com confiança calibrada, citações visuais, revisão humana e soberania europeia. Comprovada à escala empresarial, com 99% de precisão em produção.
A anyformat é a plataforma agêntica de inteligência documental para empresas europeias. Certificada ISO 27001, em conformidade com o RGPD, com processamento com retenção zero. Comece em anyformat.ai