Services
Contactez-nous

OCR Benchmark: Précision de l'extraction / capture de texte

Cem Dilmegani
Cem Dilmegani
mis à jour le 29 juin 2026

La précision de l'OCR est cruciale pour de nombreuses tâches de traitement de documents, et les LLMs multimodaux de pointe offrent désormais une alternative à l'OCR. Nous avons évalué les principaux services d'OCR dans DeltOCR Bench afin d'identifier leurs niveaux de précision pour différents types de documents :

  • Écriture manuscrite : GPT-5 (%95) se distingue comme le plus performant, suivi de près par olmOCR-2-7B (%94) et Gemini 2.5 Pro (%93).
  • Médias imprimés : Gemini 2.5 Pro, Google Vision et Claude Sonnet 4.5 dominent cette catégorie avec le score le plus élevé (%85)
  • Texte imprimé : L'API Microsoft Azure Document Intelligence est en tête avec un score de %96.

OCR Benchmark : DeltOCR Bench

Loading Chart

Les noms complets des produits ci-dessus et leurs versions utilisées en novembre 2025 sont listés ci-dessous. Notre étude couvre à la fois les services API facilement accessibles et les solutions nécessitant une infrastructure sur site, en comparant les principaux modèles du marché dans un environnement de test approfondi.

  • Écriture manuscrite :
    • Plage de précision : Une large plage allant de %46 à %95.
    • Points forts : GPT-5 (%95), olmOCR-2-7B (%94) et Gemini 2.5 Pro (%93) affichent les meilleures performances. Ces scores élevés démontrent le potentiel de précision extraordinaire des LLMs multimodaux, tels que GPT-5 et Gemini 2.5 Pro, dans ce domaine.
    • Recommandation : Pour reconnaître une écriture manuscrite très complexe, les meilleures solutions LLM comme GPT-5 ou Gemini 2.5 Pro sont recommandées en raison de leur accessibilité via API et de leur facilité d'intégration.
  • Médias imprimés :
    • Plage de précision : Une plage allant de %54 à %85.
    • Points forts : Des solutions telles que Gemini 2.5 Pro, Google Vision et Claude Sonnet 4.5 partagent le score le plus élevé (%85). Cette catégorie est très compétitive entre les LLMs et les services d'OCR cloud traditionnels (Azure, Dots OCR, Amazon Textract). GPT-5 est en retrait par rapport aux autres LLMs leaders dans cette catégorie (%77).
    • Recommandation : Pour les documents avec des mises en page visuelles complexes (polices multiples, basse résolution, etc.), les LLMs comme Gemini 2.5 Pro, ou les services cloud comme Google Vision, ou l'API Microsoft Azure Document Intelligence sont recommandés.
  • Texte imprimé :
    • Plage de précision : Une plage élevée allant de %55 à %96, bien que la plupart des solutions leaders aient atteint des scores de %94 et plus.
    • Points forts : L'API Microsoft Azure Document Intelligence (%96) prend la tête, suivie de près par des solutions comme GPT-5, Gemini 2.5 Pro, Gemini 3 Pro Preview, Google Vision et Amazon Textract, toutes obtenant un score de %95. Cette catégorie est un domaine où toutes les solutions de pointe atteignent des niveaux de précision extrêmement élevés.
    • Recommandation : Pour les textes imprimés simples nécessitant une haute précision, les solutions cloud établies comme l'API Microsoft Azure Document Intelligence ou Google Vision, ou les LLMs à score élevé (Gemini/GPT-5), peuvent être utilisés en toute confiance.

Solutions API

Les modèles suivants ont été inclus dans notre liste d'évaluation en raison de leur facilité d'accès et de leurs performances.

  • Claude Sonnet 4.5
  • OpenAI GPT-5
  • Gemini 2.5 Pro
  • Gemini 3 Pro Preview
  • Amazon Textract API
  • Google Cloud Vision API
  • Microsoft Azure Document Intelligence API
  • Moondream OCR
  • Mistral OCR 3
  • Mistral OCR 2

L'API Microsoft Azure Document Intelligence fait partie de la famille Azure Cognitive Services.

Modèles déployés localement (sur site)

Tester ces modèles est plus difficile que les solutions API en raison de l'installation, de la gestion des dépendances et des exigences matérielles. Tous les tests locaux ont été effectués dans un environnement serveur dédié.

  • olmOCR-2-7B
  • PaddleOCR-VL
  • Nanonets-OCR2-3B
  • Deepseek-OCR
  • Dots-OCR

Nous avons calculé la précision des résultats en tant que score de similarité cosinus pour le texte imprimé, les médias imprimés et l'écriture manuscrite. Chaque score visible dans le graphique représente la performance du modèle correspondant dans cette catégorie.

Au cours de nos tests, nous avons observé que le modèle Nanonets-OCR2-3B a fourni les performances les plus faibles du benchmark, obtenant les scores les plus bas. De manière générale, nous avons constaté que certains modèles éprouvaient des difficultés particulières avec l'écriture cursive et les mises en page de texte désorganisées (ordre des lignes mélangé, capitalisation incohérente). Des problèmes de performance similaires sont également apparus dans la catégorie des médias imprimés, en particulier avec les images à basse résolution et celles contenant plusieurs styles de police.

Dataset

Nous avons utilisé un total de 300 documents dans ce benchmark, avec 100 documents par catégorie répartis sur 3 catégories :

Texte imprimé inclut des lettres, des captures d'écran de sites web, des emails, des rapports, etc.

Médias imprimés inclut des affiches, des couvertures de livres, des publicités, etc. Nous avons cherché à évaluer le succès des outils d'OCR face à différentes polices de texte et à différents emplacements de texte.

Les fichiers de ces 2 catégories proviennent de l'Industry Documents Library (IDL).1

Écriture manuscrite : Dans la catégorie manuscrite, comme certains documents IDL n'étaient pas faciles à lire, notre équipe a généré des documents similaires aux documents IDL. Nous avons préparé manuellement des échantillons d'écriture manuscrite lisible par l'humain. Tous les échantillons étaient dans un style d'écriture cursive.

Figure 1 : Échantillons de notre dataset.

Méthodologie du DeltOCR Bench

Ce benchmark se concentre sur la précision de l'extraction de texte des produits.

Le prétraitement est effectué uniquement pour la catégorie écriture manuscrite. Nous avons pris des photos de documents manuscrits avec nos smartphones et utilisé une application de scanner mobile :

  • Les photos ont été converties en noir et blanc
  • Le contraste a été augmenté et l'arrière-plan a été supprimé.

OCR : Nous avons exécuté tous les produits sur le même dataset et généré les sorties de texte sous forme de fichiers texte brut (.txt). Ensuite, nous avons préparé manuellement la vérité terrain incluant le texte correct dans tous ces fichiers. La vérité terrain a été vérifiée deux fois par des humains.

Comparaison : Nous avons mesuré la précision des solutions d'OCR en comparant leurs sorties avec les textes originaux. À cette fin, nous avons utilisé le framework Sentence-BERT (SBERT) pour calculer les scores de similarité cosinus. Dans le benchmark, nous avons utilisé le modèle de paraphrase multilingue haute performance, MiniLM-L12-v2, pour calculer le score de similarité entre la sortie de chaque produit et les textes de vérité terrain. Ce score représente le niveau de précision du texte.

La fonction de similarité utilise une métrique de distance cosinus pour calculer la similarité entre deux textes. Nous n'avons pas utilisé la distance de Levenshtein pour ce benchmark car différents produits produisent des textes dans des ordres différents.2

Alors que la distance de Levenshtein prend en compte ces différences, nous recherchons uniquement la précision avec laquelle le texte est détecté, et non son emplacement. La distance cosinus entraîne des pénalités négligeables pour de tels cas, nous avons donc décidé de l'utiliser dans ce benchmark.

Sélection des produits

Il existe de nombreux produits d'OCR sur le marché. Nous devons nous concentrer sur ceux capables de produire des résultats en texte brut. Les produits de ce benchmark sont choisis en fonction de :

  • La capacité à extraire du texte. Nous n'avons pas inclus les solutions qui extraient uniquement des données lisibles par machine (c'est-à-dire des données structurées) dans cette comparaison
  • Leur popularité sur le marché

Il ne s'agit pas d'une étude de marché exhaustive, et nous avons peut-être exclu certains produits aux capacités significatives. Si c'est le cas, n'hésitez pas à laisser un commentaire, et nous serons heureux d'élargir le benchmark.

Limites

Les capacités avancées telles que la détection de l'emplacement du texte, l'association clé-valeur et la classification de documents n'ont pas été évaluées dans ce benchmark.

La taille de l'échantillon sera augmentée lors de la prochaine itération. Si vous recherchez de l'OCR pour l'écriture manuscrite, consultez notre benchmark OCR pour l'écriture manuscrite avec 50 échantillons.

Vous pouvez également consulter notre benchmark OCR pour factures et notre benchmark OCR pour reçus si cela vous intéresse.

Résultats précédents du benchmark OCR

Résultats globaux de la précision du texte OCR avec des intervalles de confiance de 90 %
  • Google Cloud Vision et AWS Textract sont les technologies leaders sur le marché pour tous les cas
  • Abbyy a également des performances élevées pour les documents non manuscrits
  • Tous les OCRs évalués, y compris l'open source Tesseract, ont bien performé sur les captures d'écran numériques.

L'outil Vision OCR de Google Cloud Platform atteint la plus haute précision de texte de 98,0 % lorsque l'ensemble du dataset est testé. Alors que tous les produits performent au-dessus de 99,2 % avec la catégorie 1, où les textes dactylographiés sont inclus, les images manuscrites des catégories 2 et 3 créent la véritable différence entre les produits.

Les résultats globaux montrent que GCP Vision et AWS Textract sont les produits d'OCR dominants, avec la plus haute précision dans la reconnaissance du texte donné.

Notes des résultats globaux :

  • Il y a une seule fois où AWS Textract n'a pas réussi à reconnaître le texte manuscrit. Cette situation réduit significativement les performances par catégorie et totales d'AWS Textract. Cela augmente également la déviation au sein de la catégorie et globalement, car AWS Textract performe très bien dans toutes les autres instances.
  • Azure est le produit leader dans la catégorie 1 avec une précision de 99,8 %. Cependant, le produit échoue souvent à reconnaître le texte manuscrit, comme le montrent les résultats de la deuxième catégorie. C'est la raison pour laquelle Azure est en retrait dans la troisième catégorie et globalement.
  • Tesseract OCR est un produit open source qui peut être utilisé gratuitement. Comparé à Azure et ABBYY, il performe mieux dans les instances manuscrites et peut être envisagé pour la reconnaissance de l'écriture manuscrite si l'utilisateur ne peut pas obtenir les produits AWS ou GCP. Cependant, il peut mal performer sur les images scannées.
  • Contrairement aux autres produits, ABBYY produit un fichier .txt plus structuré. ABBYY prend également en compte l'emplacement du texte dans l'image lors de la génération du fichier de sortie. Bien que le produit ait des capacités supplémentaires utiles, nous concentrons uniquement sur la précision du texte dans ce benchmark. Et il a mal performé dans la reconnaissance de l'écriture manuscrite.

Suppression de l'image « fauteur de troubles »

Comme mentionné dans les résultats globaux, il y a eu une seule image « aberrante » où AWS Textract n'a pu reconnaître aucun texte. Alors que le produit affiche plus de 95 % de précision de texte dans toutes les autres images, cette instance a réduit la performance d'AWS et élargi son intervalle de confiance.

Comme cette instance pourrait être une exception, nous avons également voulu comparer les produits sans elle. Nous avons appelé cette image le « fauteur de troubles » et avons réexécuté nos résultats pour voir s'ils faisaient une différence.
Voici les nouveaux résultats après exclusion du « fauteur de troubles » du dataset.

Résultats de précision du texte OCR lorsque le « fauteur de troubles » est exclu. L'intervalle de confiance de 90 % est affiché

Lorsque le « fauteur de troubles » est exclu, AWS Textract devient le plus performant avec un niveau de précision de texte presque parfait (99,3 %) et un intervalle de confiance étroit. Bien que les scores ne changent pas beaucoup, GCP Vision et AWS Textract restent les 2 meilleurs produits, avec une meilleure précision de texte que les autres.

Résultats sans la reconnaissance de l'écriture manuscrite

Le principal facteur réduisant la précision du texte de certains produits est la présence d'écriture manuscrite dans les images. Ainsi, nous avons exclu toutes les images manuscrites (toute la catégorie 2 et 6 images de la catégorie 3) et réévalué la performance de précision du texte, à nouveau.

Précision du texte OCR sans les cas de reconnaissance de l'écriture manuscrite

Les résultats sont plus serrés lorsque les images manuscrites sont exclues. AWS Textract et GCP Vision restent les 2 meilleurs produits du benchmark, mais ABBYY FineReader performe également très bien (99,3 %) cette fois. Bien que tous les produits atteignent plus de 95 % de précision lorsque l'écriture manuscrite est exclue, Azure Computer Vision et Tesseract OCR peinent encore avec les documents scannés, ce qui les place en retrait dans cette comparaison.

Produits évalués

Nous avons testé cinq produits d'OCR pour mesurer leur performance de précision de texte. Nous avons utilisé les versions disponibles en mai 2021. Les produits utilisés sont :

  • ABBYY FineReader 15
  • Amazon Textract
  • Google Cloud Platform Vision API
  • Microsoft Azure Computer Vision API
  • Tesseract OCR Engine

Dataset

Bien qu'il existe de nombreux datasets d'images pour l'OCR, ceux-ci sont

  • principalement au niveau des caractères et ne correspondent pas aux cas d'usage métier réels
  • ou se concentrent sur l'emplacement du texte plutôt que sur le texte lui-même.

Ainsi, nous avons décidé de créer notre propre dataset selon trois catégories principales :

  1. Catégorie 1 – Captures d'écran de pages web incluant du texte : Cette catégorie inclut des captures d'écran de pages Wikipedia aléatoires et de résultats de recherche Google avec des requêtes aléatoires.
  2. Catégorie 2 – Écriture manuscrite : Cette catégorie inclut des photos aléatoires présentant différents styles d'écriture manuscrite.
  3. Catégorie 3 – Reçus, factures et contrats scannés : Cette catégorie inclut une collection aléatoire de reçus, de factures manuscrites et de contrats d'assurance scannés collectés sur internet.

Tous les fichiers d'entrée sont au format .jpg ou .png.

Limites

  • Dataset limité : À l'origine, nous avions une quatrième catégorie composée de photos de journaux pour évaluer la performance des produits sur des documents imprimés. Cependant, ces photos contiennent trop de texte, rendant difficile la génération de la vérité terrain. Nous avons donc décidé de ne pas les utiliser.
  • Incohérences dans les formats de sortie : De nombreuses images incluent des instances de texte séparé sur les côtés gauche et droit. Les produits extraient ces textes dans des ordres différents, ce qui rend les fichiers de sortie différents, bien que les textes soient détectés avec précision. Cette situation nous a empêchés d'utiliser d'autres mesures de distance (comme la distance de Levenshtein) et a limité nos options pour calculer la précision du texte.
  • Problème possible avec la distance cosinus : La distance cosinus utilise des embeddings pour calculer la similarité. Par exemple, comparer les phrases « I like tea » et « I like coffee » donnerait un score de similarité plus élevé qu'il ne le devrait. Cependant, les cas de confusion entre le mot « tea » et « coffee » seraient rares, nous n'avons donc pas considéré cette possibilité dans cet exercice.

Nous utilisons d'autres données de marché (par exemple, des avis sur les logiciels, des études de cas clients) pour classer les fournisseurs de logiciels. Cependant, étant donné que la plupart des entreprises utilisent le terme « OCR » lorsqu'elles recherchent des solutions d'extraction de données (c'est-à-dire, y compris celles qui génèrent des données lisibles par machine), notre liste a une portée plus large et plus d'entreprises que celles présentées dans cet exercice de benchmarking.

Laissez notre équipe automatiser l'un de vos processus métier avec des agents IA, gratuitement.
Automatiser un processus

FAQ

La reconnaissance optique de caractères (OCR) est un domaine du machine learning spécialisé dans la distinction des caractères dans des images telles que des documents scannés, des livres imprimés ou des photos. Bien qu'il s'agisse d'une technologie mature, il n'existe toujours pas de produits d'OCR capables de reconnaître tous les types de texte avec une précision de 100 %. Parmi les produits que nous avons évalués, seuls quelques-uns ont pu produire des résultats satisfaisants à partir de notre ensemble de test.
Les outils d'OCR sont utilisés par les entreprises pour identifier les textes et leurs positions dans les images, classer les documents professionnels selon les sujets ou effectuer des associations clé-valeur dans les documents. Sur la base des résultats de l'OCR, d'autres entreprises technologiques construisent des applications comme l'automatisation des documents. Pour tous ces cas d'usage métier, une reconnaissance précise du texte est cruciale pour un produit d'OCR.

Citez ce benchmark

Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.

Cem Dilmegani and Şevval Alper (2026) - "OCR Benchmark: Précision de l'extraction / capture de texte". Publié en ligne sur AIMultiple.com. Consulté le 29 Juin 2026, à : https://aimultiple.com/ocr-accuracy [Ressource en ligne]

Dilmegani, C., & Alper, Ş. (2026, 29 Juin). OCR Benchmark: Précision de l'extraction / capture de texte. AIMultiple. https://aimultiple.com/ocr-accuracy

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Alper, Şevval},
  title  = {{OCR Benchmark: Précision de l'extraction / capture de texte}},
  year   = {2026},
  month  = jun,
  howpublished    = {\url{https://aimultiple.com/ocr-accuracy}},
  note   = {AIMultiple. Consulté le 29 Juin 2026}
}
Cem Dilmegani
Cem Dilmegani
Analyste principal
Cem est analyste principal chez AIMultiple depuis 2017. AIMultiple informe chaque mois des centaines de milliers d'entreprises (selon similarWeb), dont 55 % des entreprises du classement Fortune 500. Les travaux de Cem ont été cités par des publications internationales de premier plan telles que Business Insider, Forbes et le Washington Post, ainsi que par des entreprises mondiales comme Deloitte et HPE, des ONG comme le Forum économique mondial et des organisations supranationales comme la Commission européenne. Vous trouverez d'autres entreprises et ressources réputées ayant fait référence à AIMultiple. Tout au long de sa carrière, Cem a exercé les fonctions de consultant, d'acheteur et d'entrepreneur dans le secteur des technologies. Il a conseillé des entreprises sur leurs décisions technologiques chez McKinsey & Company et Altman Solon pendant plus de dix ans. Il a également publié un rapport McKinsey sur la numérisation. Il a dirigé la stratégie technologique et les achats d'un opérateur télécom, sous la responsabilité directe du PDG. Il a également piloté la croissance commerciale de la société de deep tech Hypatos, qui a atteint un chiffre d'affaires annuel récurrent à sept chiffres et une valorisation à neuf chiffres en seulement deux ans. Les travaux de Cem chez Hypatos ont été présentés dans des publications technologiques de référence telles que TechCrunch et Business Insider. Cem intervient régulièrement lors de conférences internationales sur les technologies. Diplômé en génie informatique de l'université de Bogazici, il est également titulaire d'un MBA de la Columbia Business School.
Voir le profil complet
Recherche effectuée par
Şevval Alper
Şevval Alper
Chercheur en IA
Şevval est analyste chez AIMultiple, spécialisé dans les outils de codage IA, les agents IA et les technologies quantiques.
Voir le profil complet

Commentaires 8

Partagez vos idées

Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.

0/450
Serhat Cinar
Serhat Cinar
Feb 28, 2025 at 09:34

Did you ever think of oncluding multimodal llms in your comparison, like gpt4o, llama 3.2. gemini, claude etc.?

Cem Dilmegani
Cem Dilmegani
Mar 17, 2025 at 02:59

Hi Serhat and thank you for your comment, Yes, we added those for which we have API access like Claude and GPT-4o.

DLJ
DLJ
Oct 17, 2024 at 11:14

Just stumbled on this milestone assessment update. Could you kindly elaborate further on the three revised datasets: Thanks for this work. Character Sets When someone refers to 'handriting', that can mean many things: 'handwriting style' typefaces (per Docusign, etc.), and hand-printed (block printing and mixed-case printing) as often found in combs and box delineators, and finally, cursive or longhand writing (exclusive of signatures). Character Context Structured content, semi-structured content, and unstructured content. Image Qualities (bitonal, greyscale, full colour, spatial dpi, from a scanner/cell-phone/native rendering, image 'enhancements' prior to OCR (thickening, local gamma, background dropout, sharpening, smoothing, noise removal, etc.) These can have significant impacts, and some don't realize the importance of including these benchmark differentiators.

Cem Dilmegani
Cem Dilmegani
Oct 22, 2024 at 03:15

Hi there, thank you for the detailed comment, we are updating the article to include these details.

Webster
Webster
Feb 05, 2023 at 07:24

Hello, great work! Just curious, did you use a trained Tesseract when making these testing?

Bardia Eshghi
Bardia Eshghi
Feb 06, 2023 at 12:29

Hi, Webster. Glad you enjoyed the article. The tools we tested were: ABBYY FineReader 15 Amazon Textract Google Cloud Platform Vision API Microsoft Azure Computer Vision API Tesseract OCR Engine Hope this answers your question.

Bobby
Bobby
Aug 14, 2022 at 23:54

The graph images are not working for me at the moment. Otherwise great

Cem Dilmegani
Cem Dilmegani
Aug 15, 2022 at 14:48

Thank you Bobby! We have a glitch in the CMS and we are fixing it. Apologies for the issue, it should be fixed next week.

samsun
samsun
Jun 07, 2022 at 14:10

Thanks for sharing, can you add a free OCR for everyone to use? https://www.geekersoft.com/ocr-online.html

Cem Dilmegani
Cem Dilmegani
Aug 17, 2022 at 07:46

Hi Samsun, unfortunately, we don't share all OCR providers on this page, there are thousands of them. We tried to put together the largest ones in terms of market presence. If you have evidence that your solution is one of the top 10 globally, please share it with us at info@aimultiple.com so we can consider it.

Scott
Scott
Jan 20, 2022 at 20:42

What version of Tesseract did you test with? They recently released v5.

Cem Dilmegani
Cem Dilmegani
Aug 23, 2022 at 12:01

Hi Scott, we did the benchmarking before Tesseract 5. We will redo it soon and include the versions in the methodology section as well.

Bob
Bob
Jan 12, 2022 at 15:09

This is very informative, nice work. I assume your tests used documents/images in English? I've been experimenting with OCR tools on other languages and finding relatively poor accuracy.

Cem Dilmegani
Cem Dilmegani
Jan 15, 2022 at 13:52

Exactly, all text were in English. I hear similar things about OCR on non-Latin characters. We have an Arabic speaker in the team who claims that accuracy in Arabic is much lower compared to English. We can do a benchmark on non-Latin characters if there is demand for it.

kin
kin
Jun 21, 2021 at 02:22

interesting post!!! do you have any suggestion about improving accuracy on scanned image ? i'm using tesseract right now. anyway , great work!

Cem Dilmegani
Cem Dilmegani
Jun 22, 2021 at 07:50

Thank you for the comment. There are pre-processing approaches that can be implemented to improve image quality. But such approaches may already be used in Tesseract. A detailed research into Tesseract image processing would be helpful in your case.