Serviços
Contate-nos

OCR Benchmark: Precisão na Extração/Captura de Texto

Şevval Alper
Şevval Alper
atualizado em 29 jul. 2026
Loading Chart

A precisão do OCR é crítica para muitas tarefas de processamento de documentos, e os LLMs multimodais de última geração estão agora a oferecer uma alternativa ao OCR. Comparámos os principais serviços de OCR no DeltOCR Bench para identificar os seus níveis de precisão em diferentes tipos de documentos:

  • Manuscritos: GPT-5 (95%) destaca-se como o mais forte, seguido de perto por olmOCR-2-7B (94%) e Gemini 2.5 Pro (93%).
  • Medias impressas: Gemini 2.5 Pro, Google Vision e Claude Sonnet 4.5 lideram esta categoria com a pontuação mais alta (85%)
  • Texto impresso: Microsoft Azure Document Intelligence API lidera com uma pontuação de 96%.

OCR Benchmark: DeltOCR Bench

Os nomes completos dos produtos acima e as suas versões em uso em novembro de 2025 estão listados abaixo. O nosso estudo abrange tanto serviços de API de fácil acesso como soluções que requerem infraestrutura local (on-premises), comparando modelos-chave do mercado num ambiente de teste aprofundado.

  • Manuscritos:
    • Intervalo de precisão: Uma ampla variação de 46% a 95%.
    • Destaques: GPT-5 (95%), olmOCR-2-7B (94%) e Gemini 2.5 Pro (93%) exibem o desempenho mais elevado. Estas pontuações elevadas demonstram o extraordinário potencial de precisão dos LLMs multimodais, como o GPT-5 e o Gemini 2.5 Pro, neste domínio.
    • Recomendação: Para reconhecer manuscritos altamente complexos, as melhores soluções de LLM, como o GPT-5 ou o Gemini 2.5 Pro, são recomendadas devido à sua acessibilidade via API e facilidade de integração.
  • Medias impressas:
    • Intervalo de precisão: Variação de 54% a 85%.
    • Destaques: Soluções como Gemini 2.5 Pro, Google Vision e Claude Sonnet 4.5 partilham a pontuação mais alta (85%). Esta categoria é altamente competitiva entre os LLMs e os serviços de OCR tradicionais baseados na nuvem (Azure, Dots OCR, Amazon Textract). O GPT-5 fica atrás de outros LLMs líderes nesta categoria (77%).
    • Recomendação: Para documentos com layouts visuais complexos (várias fontes, baixa resolução, etc.), recomendam-se LLMs como o Gemini 2.5 Pro, ou serviços baseados na nuvem como Google Vision, ou a Microsoft Azure Document Intelligence API.
  • Texto impresso:
    • Intervalo de precisão: Um intervalo elevado de 55% a 96%, embora a maioria das soluções líderes tenham alcançado pontuações de 94% ou superiores.
    • Destaques: Microsoft Azure Document Intelligence API (96%) assume a liderança, seguida de perto por soluções como GPT-5, Gemini 2.5 Pro, Gemini 3 Pro Preview, Google Vision e Amazon Textract, todas com 95%. Esta é uma área onde todas as soluções de última geração alcançam níveis extremamente elevados de precisão.
    • Recomendação: Para textos impressos simples que exijam alta precisão, podem ser utilizadas com confiança soluções estabelecidas na nuvem, como Microsoft Azure Document Intelligence API ou Google Vision, ou LLMs de elevada pontuação (Gemini/GPT-5).

Soluções de API

Os seguintes modelos foram incluídos na nossa lista de benchmark devido à sua facilidade de acesso e desempenho.

  • Claude Sonnet 4.5
  • OpenAI GPT-5
  • Gemini 2.5 Pro
  • Gemini 3 Pro Preview
  • Amazon Textract API
  • Google Cloud Vision API
  • Microsoft Azure Document Intelligence API
  • Moondream OCR
  • Mistral OCR 3
  • Mistral OCR 2

A Microsoft Azure Document Intelligence API faz parte da família Azure Cognitive Services.

Modelos Implementados Localmente (On-Premise)

Testar estes modelos é mais desafiante do que as soluções de API, devido à instalação, gestão de dependências e requisitos de hardware. Todos os testes locais foram realizados num ambiente de servidor dedicado.

  • olmOCR-2-7B
  • PaddleOCR-VL
  • Nanonets-OCR2-3B
  • Deepseek-OCR
  • Dots-OCR

Calculámos a precisão dos resultados como a pontuação de semelhança de cosseno para texto impresso, medias impressas e manuscritos. Cada pontuação visível no gráfico representa o desempenho do modelo correspondente dentro dessa categoria.

Durante os nossos testes, observámos que o modelo Nanonets-OCR2-3B apresentou o desempenho mais fraco no benchmark, alcançando as pontuações mais baixas. De um modo geral, verificámos que alguns modelos tiveram dificuldades particulares com a escrita cursiva e com layouts de texto desorganizados (ordenação mista de linhas, uso inconsistente de maiúsculas). Problemas de desempenho semelhantes surgiram também na categoria de medias impressas, especialmente com imagens de baixa resolução e as que continham vários estilos de fonte.

Conjunto de dados

Utilizámos um total de 300 documentos neste benchmark, com 100 documentos por categoria, num total de 3 categorias:

Texto impresso inclui cartas, capturas de ecrã de websites, e-mails, relatórios, etc.

Medias impressas inclui cartazes, capas de livros, anúncios, etc. O objetivo era ver o sucesso das ferramentas de OCR em diferentes fontes de texto e disposições.

Os ficheiros destas 2 categorias foram obtidos a partir da Industry Documents Library (IDL).1

Manuscritos: Na categoria de manuscritos, como alguns documentos IDL não eram fáceis de ler, a nossa equipa gerou documentos semelhantes aos documentos IDL. Preparámos manualmente amostras de escrita legível por humanos. Todas as amostras estavam em estilo de letra cursiva.

Figura 1: Amostras do nosso conjunto de dados.

Metodologia do DeltOCR Bench

Este benchmark foca-se na precisão da extração de texto dos produtos.

O pré-processamento é realizado apenas para a categoria de manuscritos. Tirámos fotografias de documentos manuscritos com os nossos smartphones e utilizámos uma aplicação de digitalização móvel:

  • As imagens foram convertidas para preto e branco
  • O contraste foi aumentado e o fundo foi removido.

OCR: Executámos todos os produtos no mesmo conjunto de dados e gerámos resultados de texto como ficheiros de texto simples (.txt). Em seguida, preparámos manualmente a verdade fundamental (ground truth) incluindo o texto correto em todos estes ficheiros. A verdade fundamental foi verificada duas vezes por humanos.

Comparação: Medimos a precisão das soluções de OCR comparando os seus resultados com os textos originais. Para este efeito, utilizámos o framework Sentence-BERT (SBERT) para calcular pontuações de semelhança de cosseno. No benchmark, utilizámos o modelo multilingue de paráfrase de elevado desempenho, MiniLM-L12-v2, para calcular a pontuação de semelhança entre o resultado de cada produto e os textos de verdade fundamental. Esta pontuação representa o nível de precisão do texto.

A função de semelhança utiliza uma métrica de distância de cosseno para calcular a semelhança entre dois textos. Não utilizámos a distância de Levenshtein para este benchmark porque diferentes produtos geram textos com ordens diferentes.2

Enquanto a distância de Levenshtein tem em conta estas diferenças, nós procuramos apenas a precisão com que o texto é detetado, e não a sua localização. A distância de cosseno apresenta penalizações insignificantes para esses casos, pelo que decidimos utilizá-la neste benchmark.

Seleção de produtos

Existem muitos produtos de OCR no mercado. Precisamos de nos concentrar naqueles que conseguem gerar resultados de texto em bruto. Os produtos para este benchmark foram escolhidos com base:

  • Na capacidade de extrair texto. Não incluímos soluções que apenas extraem dados legíveis por máquina (ou seja, dados estruturados) nesta comparação
  • Na sua popularidade no mercado

Esta não é uma análise de mercado abrangente, e podemos ter excluído alguns produtos com capacidades significativas. Se for o caso, por favor deixe um comentário, e teremos todo o gosto em expandir o benchmark.

Limitações

Capacidades avançadas, como a deteção da localização do texto, o emparelhamento chave-valor e a classificação de documentos, não foram avaliadas neste benchmark.

O tamanho da amostra será aumentado na próxima iteração. Se procura OCR para manuscritos, consulte o nosso manuscritos OCR benchmark com 50 amostras.

Também pode consultar o nosso fatura OCR benchmark e recibo OCR benchmark se tiver interesse.

Perguntas frequentes

Reconhecimento Ótico de Caracteres (OCR) é um campo da aprendizagem automática que se especializa em distinguir caracteres dentro de imagens como documentos digitalizados, livros impressos ou fotografias. Embora seja uma tecnologia madura, ainda não existem produtos de OCR que consigam reconhecer todos os tipos de texto com 100% de precisão. Entre os produtos que comparámos, apenas alguns conseguiram produzir resultados bem-sucedidos a partir do nosso conjunto de teste.
As ferramentas de OCR são utilizadas pelas empresas para identificar textos e as suas posições em imagens, classificar documentos empresariais de acordo com os assuntos ou realizar o emparelhamento chave-valor dentro de documentos. Com base nos resultados de OCR, outras empresas de tecnologia criam aplicações como a automação de documentos. Para todos estes casos de negócio, o reconhecimento preciso de texto é crítico para um produto de OCR.

Deixe nossa equipe automatizar um dos seus processos de negócio com agentes de IA, gratuitamente.
Automatizar um processo

Cite este benchmark

Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.

Şevval Alper (2026) - "OCR Benchmark: Precisão na Extração/Captura de Texto". Publicado on-line em AIMultiple.com. Acessado em 29 Julho 2026, em: https://aimultiple.com/ocr-accuracy [Recurso on-line]

Alper, Ş. (2026, 29 Julho). OCR Benchmark: Precisão na Extração/Captura de Texto. AIMultiple. https://aimultiple.com/ocr-accuracy

@misc{alper2026,
  author = {Alper, Şevval},
  title  = {{OCR Benchmark: Precisão na Extração/Captura de Texto}},
  year   = {2026},
  month  = jul,
  howpublished    = {\url{https://aimultiple.com/ocr-accuracy}},
  note   = {AIMultiple. Acessado em 29 Julho 2026}
}
Şevval Alper
Şevval Alper
Pesquisador de IA
Şevval é analista da AIMultiple, especializada em ferramentas de codificação de IA, agentes de IA e tecnologias quânticas.
Ver perfil completo

Comentários 8

Compartilhe suas ideias

Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.

0/450
Serhat Cinar
Serhat Cinar
Feb 28, 2025 at 09:34

Did you ever think of oncluding multimodal llms in your comparison, like gpt4o, llama 3.2. gemini, claude etc.?

Cem Dilmegani
Cem Dilmegani
Mar 17, 2025 at 02:59

Hi Serhat and thank you for your comment, Yes, we added those for which we have API access like Claude and GPT-4o.

DLJ
DLJ
Oct 17, 2024 at 11:14

Just stumbled on this milestone assessment update. Could you kindly elaborate further on the three revised datasets: Thanks for this work. Character Sets When someone refers to 'handriting', that can mean many things: 'handwriting style' typefaces (per Docusign, etc.), and hand-printed (block printing and mixed-case printing) as often found in combs and box delineators, and finally, cursive or longhand writing (exclusive of signatures). Character Context Structured content, semi-structured content, and unstructured content. Image Qualities (bitonal, greyscale, full colour, spatial dpi, from a scanner/cell-phone/native rendering, image 'enhancements' prior to OCR (thickening, local gamma, background dropout, sharpening, smoothing, noise removal, etc.) These can have significant impacts, and some don't realize the importance of including these benchmark differentiators.

Cem Dilmegani
Cem Dilmegani
Oct 22, 2024 at 03:15

Hi there, thank you for the detailed comment, we are updating the article to include these details.

Webster
Webster
Feb 05, 2023 at 07:24

Hello, great work! Just curious, did you use a trained Tesseract when making these testing?

Bardia Eshghi
Bardia Eshghi
Feb 06, 2023 at 12:29

Hi, Webster. Glad you enjoyed the article. The tools we tested were: ABBYY FineReader 15 Amazon Textract Google Cloud Platform Vision API Microsoft Azure Computer Vision API Tesseract OCR Engine Hope this answers your question.

Bobby
Bobby
Aug 14, 2022 at 23:54

The graph images are not working for me at the moment. Otherwise great

Cem Dilmegani
Cem Dilmegani
Aug 15, 2022 at 14:48

Thank you Bobby! We have a glitch in the CMS and we are fixing it. Apologies for the issue, it should be fixed next week.

samsun
samsun
Jun 07, 2022 at 14:10

Thanks for sharing, can you add a free OCR for everyone to use? https://www.geekersoft.com/ocr-online.html

Cem Dilmegani
Cem Dilmegani
Aug 17, 2022 at 07:46

Hi Samsun, unfortunately, we don't share all OCR providers on this page, there are thousands of them. We tried to put together the largest ones in terms of market presence. If you have evidence that your solution is one of the top 10 globally, please share it with us at info@aimultiple.com so we can consider it.

Scott
Scott
Jan 20, 2022 at 20:42

What version of Tesseract did you test with? They recently released v5.

Cem Dilmegani
Cem Dilmegani
Aug 23, 2022 at 12:01

Hi Scott, we did the benchmarking before Tesseract 5. We will redo it soon and include the versions in the methodology section as well.

Bob
Bob
Jan 12, 2022 at 15:09

This is very informative, nice work. I assume your tests used documents/images in English? I've been experimenting with OCR tools on other languages and finding relatively poor accuracy.

Cem Dilmegani
Cem Dilmegani
Jan 15, 2022 at 13:52

Exactly, all text were in English. I hear similar things about OCR on non-Latin characters. We have an Arabic speaker in the team who claims that accuracy in Arabic is much lower compared to English. We can do a benchmark on non-Latin characters if there is demand for it.

kin
kin
Jun 21, 2021 at 02:22

interesting post!!! do you have any suggestion about improving accuracy on scanned image ? i'm using tesseract right now. anyway , great work!

Cem Dilmegani
Cem Dilmegani
Jun 22, 2021 at 07:50

Thank you for the comment. There are pre-processing approaches that can be implemented to improve image quality. But such approaches may already be used in Tesseract. A detailed research into Tesseract image processing would be helpful in your case.