Serviços
Contate-nos

Benchmark de OCR para Faturas: Precisão de Extração de LLMs vs OCRs

Cem Dilmegani
Cem Dilmegani
atualizado em 4 ago. 2026

O processamento de faturas é uma operação empresarial crítica, mas trabalhosa, que tradicionalmente requer a extração de dados manual e a sua inserção em sistemas de contabilidade. Esta abordagem manual é demorada e suscetível a erros humanos. Para avaliar alternativas automatizadas, realizámos uma análise comparativa das principais soluções de processamento de documentos e LLMs:

  • Amazon Textract API
  • Claude Sonnet 3.5
  • Docsumo
  • Google Document AI
  • Microsoft Azure Document Intelligence
  • Rossum

O nosso estudo avaliou a capacidade destas ferramentas de extrair dados com precisão a partir de diversos formatos e qualidades de faturas, com o objetivo de quantificar a sua eficácia como alternativas ao processamento manual.

Resultados do benchmark

Loading Chart

Avaliámos o desempenho do processamento de faturas em faturas de qualidade e níveis de contraste variados. Embora todas as ferramentas tenham demonstrado um bom desempenho com imagens de alta qualidade, a sua precisão diminuiu significativamente ao processar documentos de qualidade inferior. Entre as ferramentas testadas, o Claude Sonnet 3.5 exibiu a maior precisão e resiliência geral em todo o espectro de qualidades de documentos.

Metodologia

Medição: A nossa metodologia de avaliação focou-se na precisão da extração de pares chave-valor. Cada campo extraído foi avaliado usando uma classificação binária: extração correta ou extração incorreta/em falta. A métrica de precisão foi calculada usando a seguinte fórmula:

Precisão = (Número de Pares Chave-Valor Extraídos Corretamente) / (Número Total de Pares Chave-Valor)

Esta metodologia permitiu uma comparação objetiva do desempenho de extração entre diferentes ferramentas e tipos de documentos.

Tamanho da amostra: Encontrar dados de faturas é um desafio, uma vez que envolvem informações pessoais como e-mails e nomes. Utilizámos mais de 400 pares chave-valor de 20 amostras de faturas publicamente disponíveis.

Amostras: Embora todas as soluções tenham processado corretamente imagens de alta qualidade, a qualidade da extração diminuiu em imagens como estas:

Figura 2: Detalhes de preços de uma fatura do conjunto de dados utilizado neste benchmark. A maioria dos fornecedores falhou na extração correta destes valores.

Ajuste fino: Embora os produtos que experimentámos tenham tido sucesso em encontrar os montantes totais, tiveram problemas na extração de detalhes de preços. É possível obter melhores resultados ajustando finamente alguns produtos. Em alguns produtos, os utilizadores podem clicar num valor na imagem para corrigir a saída do modelo.

Para sermos justos com todos os fornecedores, não realizámos qualquer ajuste fino. Com o ajuste fino, todos os fornecedores deverão conseguir alcançar taxas de sucesso mais elevadas na segunda vez que processarem estes documentos. No entanto, o nosso foco neste benchmark está nas operações autónomas, que exigem que os modelos produzam resultados corretos e fiáveis a partir de documentos que nunca viram antes.

Cronologia: Todos os testes foram concluídos em dezembro de 2024.

Próximos passos

Aumentar os participantes: Uma vez que este estudo fornece informações sobre as capacidades atuais de processamento de faturas em Modelos de Linguagem de Grande Escala (LLMs), tecnologias de OCR e ferramentas especializadas de processamento de faturas, planeamos expandir a nossa análise incorporando LLMs adicionais de última geração para fornecer um benchmark mais abrangente das soluções de processamento automatizado de faturas.

Aumentar o tamanho e a diversidade da amostra.

O que é OCR de faturas?

A análise de faturas utiliza ferramentas automatizadas como PLN, NLU, OCR e outras tecnologias de extração de dados para extrair dados de faturas em vários formatos, tais como PDFs e imagens.

Um analisador de faturas é um programa de software que extrai informações como

  • Nome do fornecedor

  • Número da fatura

  • Valor a pagar

e introdu-las num formato legível por máquina. Estes dados podem ser utilizados para múltiplas funções, tais como a automação de contas a pagar, a conclusão de fechos contabilísticos de fim de mês e a gestão de faturas.

O software de análise é normalmente integrado num sistema de processamento de faturas que automatiza todo o processo, desde a receção de uma fatura até ao pagamento.

Deixe nossa equipe automatizar um dos seus processos de negócio com agentes de IA, gratuitamente.
Automatizar um processo

Como funcionam as ferramentas de OCR de faturas?

Os documentos escritos numa determinada linguagem de marcação são lidos e tratados por analisadores. Estes dividem o documento em partes mais pequenas, chamadas tokens, e examinam cada token para determinar o que significa e onde se encaixa na estrutura do documento.

Para o fazer, os analisadores precisam de conhecer bem a gramática da linguagem de marcação em questão. Isto permite-lhes reconhecer cada token e determinar as ligações exatas entre eles.

O processo inclui 5 passos:

1. Entrada

Figura 3: Amostra de entrada de fatura Fonte: Stack Overflow

As faturas podem ser recebidas em vários formatos, incluindo papel, email ou formatos eletrónicos como PDF ou XML. O software de análise de faturas aceitará normalmente estas faturas como entrada.

2. Reconhecimento Ótico de Caracteres (OCR)

Se a fatura estiver em formato de papel digitalizado ou imagem, o analisador utilizará a tecnologia de OCR para extrair o texto da imagem. Isto permite que o analisador aceda aos dados contidos na fatura.

Algumas soluções de análise de faturas utilizam ferramentas de OCR com IA ou LLMs que extraem automaticamente informações de PDFs, fotos e documentos digitalizados sem necessidade de novas regras ou modelos. Isto acontece porque a IA pode lidar com documentos semiestruturados e desconhecidos e melhorar ao longo do tempo. A informação extraída pode ser personalizada para incluir apenas tabelas ou entradas de dados específicas.

3. Extração de dados

O analisador extrairá então informações específicas da fatura, como o nome do fornecedor, número da fatura, data e detalhes dos itens. Isto é normalmente conseguido através de uma combinação de reconhecimento de padrões e algoritmos de aprendizagem automática.

Alguns softwares de análise de faturas têm a capacidade de extrair informações-chave, como a data da fatura, número, números de identificação fiscal e vários totais, utilizando filtros predefinidos:

Algumas ferramentas de análise oferecem a capacidade de extrair informações de itens de linha de faturas com um formato consistente, criando um analisador de documentos separado para cada layout específico de fornecedor ou parceiro comercial:

4. Validação de dados

Uma vez extraídos os dados, o analisador validará a informação para garantir que é precisa e completa. Isto pode incluir a verificação de que a data está no formato correto, que o nome do fornecedor corresponde a uma lista predefinida de fornecedores ou que os detalhes dos itens correspondem ao formato esperado.

5. Saída de dados

Figura 4: Amostra de saída de fatura Fonte: Stack Overflow

Os dados extraídos e validados são depois emitidos num formato que pode ser facilmente importado para o sistema de contabilidade ou ERP do utilizador. Isto pode ser na forma de um ficheiro CSV, registo de base de dados, ou diretamente para um software de contabilidade.

Desafios na extração manual de dados de faturas

Extrair manualmente dados de faturas e introduzi-los num sistema pode ser um desafio para as empresas, uma vez que existem várias complexidades:

Erro humano

As faturas podem conter uma grande quantidade de dados, e a inserção manual aumenta o risco de erros, tais como erros de digitação, transposição de números e introdução de dados incorretos. As imprecisões na inserção de dados são responsáveis por cerca de $600 mil milhões de dólares em perdas anuais.1 Processos como as contas a pagar necessitam de uma exportação correta de dados de documentos financeiros.

Demorado

Em média, são necessários 17 dias, ou aproximadamente 75% de um mês, para processar manualmente uma única fatura.2

Muitas informações importantes estão incluídas nas faturas, e são todas apresentadas num estilo chave-valor, onde cada item serve simultaneamente como chave e valor. O processo de extrair manualmente estes pares é demorado e requer múltiplas inspeções para garantir a precisão. Mesmo alguns algoritmos de OCR têm dificuldade em detetar valores extraídos sem contexto. O processamento automatizado de faturas pode ajudar os funcionários a concentrarem-se em tarefas mais complexas.

Falta de padronização

Faturas de diferentes fornecedores podem ter formatos diferentes. Cada fatura é gerada com um formato único que pode representar dificuldades no processamento e interpretação destes padrões. Os documentos, tais como emails, papel e PDFs, podem passar por muitos registos digitais e em papel antes de serem aprovados para pagamento, tornando a extração manual de dados desafiante e propensa a erros.

Ineficiência de processos

O tratamento manual de faturas, que incorre num custo médio de quase $23 por fatura2 , pode ser simultaneamente demorado e dispendioso, conduzindo a um processo ineficiente e repetitivo.

Potencial de perda de dados

Existe o risco de perda de dados se as faturas forem perdidas ou danificadas ou se os dados não forem introduzidos corretamente no sistema.

Figura 5: OCR de linhas de fatura Fonte: Klippa

O software de OCR enfrenta frequentemente dificuldades em extrair itens de linha de faturas. Isto acontece porque as tabelas de transações podem carecer de linhas horizontais ou verticais, dificultando o processamento de OCR de faturas no estabelecimento de contexto para os itens extraídos. As faturas digitais recolhidas ou imagens de faturas podem ser utilizadas neste processo.

Não perca os nossos benchmarks e insights baseados em dados. O botão abre o Google; selecionar a AIMultiple confirma que deseja ver a AIMultiple com mais frequência nos resultados de pesquisa do Google.
GoogleAdicionar como fonte preferencial

Como escolher o seu fornecedor de processamento de faturas?

1. Fornece uma solução em conformidade com as políticas de privacidade de dados da sua empresa.

A política de privacidade de dados da sua empresa pode ser um fator impeditivo para a utilização de APIs externas, como a Amazon AWS Textract. A maioria dos fornecedores oferece soluções on-premise, pelo que as políticas de privacidade de dados não impediriam necessariamente a sua empresa de utilizar uma solução de captura de faturas. O fluxo de trabalho de contas a pagar deve ser tratado com especial cuidado, uma vez que envolve frequentemente informações empresariais e financeiras confidenciais.

2. Fornece uma estrutura de dados consistente independentemente do texto nos documentos.

Existem duas formas de funcionamento das empresas de captura de faturas baseadas em aprendizagem profunda. Empresas como a Textract devolvem pares chave-valor. Assim, por exemplo, se uma fatura designar o montante total como “Montante bruto”, outra como “Montante total”, e uma fatura alemã designar como “Summe”, a Textract fornece-lhe os dados em 3 estruturas diferentes para estes 3 documentos.

Num, tem um par chave-valor com a chave “Montante bruto”, noutro “Montante total” e no alemão, obtém “Summe”. Outros fornecedores conceberam estruturas de dados consistentes que funcionam para todas as faturas. Nos 3 cenários, obteria “Montante total”, que é a chave que utilizam no seu ficheiro de saída. Isto facilita a análise e o processamento, pois não precisa de lidar com muitos formatos de dados estruturados diferentes.

3. Pergunte pelas taxas de falsos positivos e de extração manual de dados

Em seguida, execute um projeto de Prova de Conceito (PoC) para ver as taxas reais nas faturas recebidas pela sua empresa.

  • Falsos positivos são faturas que são processadas auto-maticamente, mas apresentam erros na extração de dados. Estes são difíceis de identificar e podem perturbar as operações. Por exemplo, a extração incorreta dos montantes de pagamento seria problemática. Minimizar este aspeto deve ser o foco absoluto.

  • A extração manual de dados é necessária quando o sistema automatizado de extração de dados tem uma confiança limitada no seu resultado. Isto pode dever-se a um formato de fatura diferente, má qualidade de imagem ou um erro de impressão do fornecedor. Isto também é importante minimizar, mas existe um compromisso entre falsos positivos e extração manual de dados. Ter mais extração manual de dados pode ser preferível a ter falsos positivos.

Este é o primeiro benchmark quantitativo que vemos neste espaço e seguiremos uma metodologia semelhante para preparar o nosso próprio benchmark.

4. Aproveite uma PoC para medir a taxa de automatização potencial

Isto depende do número de campos que espera capturar dos documentos. Um conjunto típico de ~10 campos, incluindo itens como ID do pedido de compra, nome do fornecedor, etc., pode permitir a introdução de dados no ERP e pagamentos.

Os fornecedores com melhores práticas alcançam uma taxa de STP de ~80% extraindo todos estes ~10 campos praticamente sem erros em ~80% das vezes. Embora possam ocorrer erros pontuais, a verificação manual dos maiores pagamentos pode garantir que nenhum pagamento errado significativo passe despercebido.

5. Pergunte pelas opções de processamento avançado fornecidas pelo fornecedor

A extração é o primeiro passo na recolha de dados; na maioria dos casos, precisa de ser seguida pelo processamento de dados. Por exemplo, as faturas precisam de ser verificadas quanto à conformidade com o IVA (por exemplo, faturas nacionais sem IVA precisam de explicar por que o IVA está excluído), e a não conformidade pode resultar em multas significativas para a empresa, dependendo do país.

6. Pergunte como a solução aprende sobre novas faturas

As melhores soluções têm uma interface para permitir que a sua equipa ajude a orientar a solução. À medida que o funcionário da sua empresa seleciona os pares chave-valor, a solução de captura de faturas toma nota para poder ter mais confiança numa fatura semelhante na próxima vez.

7. Avalie a facilidade de utilização da sua solução de introdução manual de dados

Será utilizada pelo pessoal de retaguarda da sua empresa para processar manualmente faturas que não podem ser processadas automaticamente com confiança.

Para além disto, fazem sentido as questões de procurement de melhores práticas. Por exemplo:

  • Quão amplamente adotada é a sua solução? Têm clientes da Fortune 500?
  • Os seus clientes estão satisfeitos com a sua solução e suporte? Poderá ser bom perguntar a um conhecido de uma empresa que já esteja a utilizar a sua solução. Uma vez que a automação de faturas não é uma solução que melhore o marketing ou as vendas de uma empresa, até os concorrentes poderiam partilhar entre si a sua opinião sobre soluções de automação de faturas.
  • Quais são as opções para integrar a solução nos sistemas da sua empresa (por exemplo, ERP)? O departamento de TI está de acordo com a abordagem de integração?
  • Qual é o seu Custo Total de Propriedade (TCO)? Diferentes soluções utilizam diferentes unidades de preço (por exemplo, preço por página ou preço por documento), o que dificulta esta comparação. No entanto, utilizando uma amostra do seu arquivo, poderá ter uma estimativa do custo.

Leitura adicional

Cite este benchmark

Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.

Cem Dilmegani (2026) - "Benchmark de OCR para Faturas: Precisão de Extração de LLMs vs OCRs". Publicado on-line em AIMultiple.com. Acessado em 4 Agosto 2026, em: https://aimultiple.com/invoice-ocr [Recurso on-line]

Dilmegani, C. (2026, 4 Agosto). Benchmark de OCR para Faturas: Precisão de Extração de LLMs vs OCRs. AIMultiple. https://aimultiple.com/invoice-ocr

@misc{dilmegani2026,
  author = {Dilmegani, Cem},
  title  = {{Benchmark de OCR para Faturas: Precisão de Extração de LLMs vs OCRs}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/invoice-ocr}},
  note   = {AIMultiple. Acessado em 4 Agosto 2026}
}
Cem Dilmegani
Cem Dilmegani
Analista Principal
Cem tem sido o analista principal do AIMultiple desde 2017. O AIMultiple informa centenas de milhares de empresas (de acordo com o similarWeb), incluindo 60% das empresas da Fortune 500 todos os meses.

O trabalho de Cem foi citado por publicações globais de destaque, incluindo Business Insider, Forbes, Washington Post, empresas globais como Deloitte, HPE e ONGs como o Fórum Econômico Mundial e organizações supranacionais como a Comissão Europeia.

Ao longo de sua carreira, Cem atuou como consultor de tecnologia, comprador de tecnologia e empreendedor de tecnologia. Ele aconselhou empresas em suas decisões de tecnologia na McKinsey & Company e na Altman Solon por mais de uma década. Ele também publicou um relatório da McKinsey sobre digitalização.

Ele liderou a estratégia de tecnologia e aquisições de uma empresa de telecomunicações, reportando-se ao CEO. Ele também liderou o crescimento comercial da empresa de tecnologia profunda Hypatos, que alcançou uma receita recorrente anual de 7 dígitos e uma avaliação de 9 dígitos partindo do zero em 2 anos. O trabalho de Cem na Hypatos foi coberto por publicações de tecnologia de destaque como TechCrunch e Business Insider.

Cem fala regularmente em conferências internacionais de tecnologia. Ele se formou na Universidade Bogazici como engenheiro de computação e possui um MBA pela Columbia Business School.
Ver perfil completo

Seja o primeiro a comentar

Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.

0/450