Services
Contactez-nous

OCR Benchmark: Précision de l'extraction / capture de texte

Şevval Alper
Şevval Alper
mis à jour le 29 juil. 2026
Loading Chart

La précision de l'OCR est essentielle pour de nombreuses tâches de traitement de documents, et les LLMs multimodaux SOTA offrent désormais une alternative à l'OCR. Nous avons benchmarké les principaux services d'OCR dans DeltOCR Bench pour identifier leurs niveaux de précision sur différents types de documents :

  • Écriture manuscrite : GPT-5 (95 %) se distingue comme le plus performant, suivi de près par olmOCR-2-7B (94 %) et Gemini 2.5 Pro (93 %).
  • Médias imprimés : Gemini 2.5 Pro, Google Vision et Claude Sonnet 4.5 dominent cette catégorie avec le score le plus élevé (85 %)
  • Texte imprimé : Microsoft Azure Document Intelligence API est en tête avec un score de 96 %.

OCR Benchmark : DeltOCR Bench

Les noms complets des produits ci-dessus et leurs versions utilisées en novembre 2025 sont répertoriés ci-dessous. Notre étude couvre à la fois les services API facilement accessibles et les solutions nécessitant une infrastructure sur site, en comparant les principaux modèles du marché dans un environnement de test approfondi.

  • Écriture manuscrite :
    • Plage de précision : Une large plage allant de 46 % à 95 %.
    • Points forts : GPT-5 (95 %), olmOCR-2-7B (94 %) et Gemini 2.5 Pro (93 %) affichent les performances les plus élevées. Ces scores élevés démontrent le potentiel de précision extraordinaire des LLMs multimodaux, tels que GPT-5 et Gemini 2.5 Pro, dans ce domaine.
    • Recommandation : Pour reconnaître une écriture manuscrite très complexe, les meilleures solutions LLM comme GPT-5 ou Gemini 2.5 Pro sont recommandées en raison de leur accessibilité via API et de leur facilité d'intégration.
  • Médias imprimés :
    • Plage de précision : Une plage allant de 54 % à 85 %.
    • Points forts : Des solutions telles que Gemini 2.5 Pro, Google Vision et Claude Sonnet 4.5 partagent le score le plus élevé (85 %). Cette catégorie est très compétitive parmi les LLMs et les services d'OCR traditionnels basés sur le cloud (Azure, Dots OCR, Amazon Textract). GPT-5 est en retrait par rapport aux autres LLMs leaders dans cette catégorie (77 %).
    • Recommandation : Pour les documents avec des mises en page visuelles complexes (polices multiples, basse résolution, etc.), les LLMs comme Gemini 2.5 Pro, ou les services cloud comme Google Vision, ou Microsoft Azure Document Intelligence API sont recommandés.
  • Texte imprimé :
    • Plage de précision : Une plage élevée allant de 55 % à 96 %, bien que la plupart des solutions leaders aient atteint des scores de 94 % et plus.
    • Points forts : Microsoft Azure Document Intelligence API (96 %) prend la tête, suivi de près par des solutions comme GPT-5, Gemini 2.5 Pro, Gemini 3 Pro Preview, Google Vision et Amazon Textract, toutes obtenant 95 %. Cette catégorie est un domaine où toutes les solutions SOTA atteignent des niveaux de précision extrêmement élevés.
    • Recommandation : Pour les textes imprimés simples nécessitant une haute précision, les solutions cloud établies comme Microsoft Azure Document Intelligence API ou Google Vision, ou les LLMs obtenant des scores élevés (Gemini/GPT-5), peuvent être utilisés en toute confiance.

Solutions API

Les modèles suivants ont été inclus dans notre liste de benchmarking en raison de leur facilité d'accès et de leurs performances.

  • Claude Sonnet 4.5
  • OpenAI GPT-5
  • Gemini 2.5 Pro
  • Gemini 3 Pro Preview
  • Amazon Textract API
  • Google Cloud Vision API
  • Microsoft Azure Document Intelligence API
  • Moondream OCR
  • Mistral OCR 3
  • Mistral OCR 2

Microsoft Azure Document Intelligence API fait partie de la famille Azure Cognitive Services.

Modèles déployés localement (sur site)

Tester ces modèles est plus difficile que les solutions API en raison de l'installation, de la gestion des dépendances et des exigences matérielles. Tous les tests locaux ont été effectués dans un environnement serveur dédié.

  • olmOCR-2-7B
  • PaddleOCR-VL
  • Nanonets-OCR2-3B
  • Deepseek-OCR
  • Dots-OCR

Nous avons calculé la précision des résultats sous forme de score de similarité cosinus pour le texte imprimé, les médias imprimés et l'écriture manuscrite. Chaque score visible dans le graphique représente la performance du modèle correspondant dans cette catégorie.

Lors de nos tests, nous avons observé que le modèle Nanonets-OCR2-3B a fourni les performances les plus faibles du benchmark, obtenant les scores les plus bas. En général, nous avons constaté que certains modèles rencontraient des difficultés particulières avec l'écriture cursive et les mises en page de texte désorganisées (ordre des lignes mélangé, capitalisation incohérente). Des problèmes de performance similaires sont également apparus dans la catégorie des médias imprimés, en particulier avec les images à basse résolution et celles contenant plusieurs styles de police.

Dataset

Nous avons utilisé un total de 300 documents dans ce benchmark, avec 100 documents par catégorie répartis sur 3 catégories :

Texte imprimé comprend des lettres, des captures d'écran de sites web, des e-mails, des rapports, etc.

Médias imprimés comprend des affiches, des couvertures de livres, des publicités, etc. Nous avons cherché à évaluer le succès des outils d'OCR sur différentes polices de texte et emplacements.

Les Files de ces 2 catégories proviennent de l'Industry Documents Library (IDL).1

Écriture manuscrite : Dans la catégorie manuscrite, comme certains documents IDL n'étaient pas faciles à lire, notre équipe a généré des documents similaires aux documents IDL. Nous avons préparé manuellement des échantillons d'écriture manuscrite lisible par un humain. Tous les échantillons étaient dans un style d'écriture cursive.

Figure 1 : Échantillons de notre dataset.

Méthodologie de DeltOCR Bench

Ce benchmark se concentre sur la précision de l'extraction de texte des produits.

Le prétraitement est effectué uniquement pour la catégorie d'écriture manuscrite. Nous avons pris des photos de documents manuscrits avec nos smartphones et utilisé une application de scanner mobile :

  • Les photos ont été converties en noir et blanc
  • Le contraste a été augmenté et l'arrière-plan a été supprimé.

OCR : Nous avons exécuté tous les produits sur le même dataset et généré des sorties texte sous forme de fichiers texte brut (.txt). Ensuite, nous avons préparé manuellement la vérité de terrain incluant le texte correct dans tous ces fichiers. La vérité de terrain a été vérifiée deux fois par des humains.

Comparaison : Nous avons mesuré la précision des solutions d'OCR en comparant leurs sorties avec les textes originaux. À cette fin, nous avons utilisé le framework Sentence-BERT (SBERT) pour calculer les scores de similarité cosinus. Dans le benchmark, nous avons utilisé le modèle de paraphrase multilingue haute performance MiniLM-L12-v2 pour calculer le score de similarité entre la sortie de chaque produit et les textes de vérité de terrain. Ce score représente le niveau de précision du texte.

La fonction de similarité utilise une métrique de distance cosinus pour calculer la similarité entre deux textes. Nous n'avons pas utilisé la distance de Levenshtein pour ce benchmark car différents produits produisent des textes dans des ordres différents.2

Bien que la distance de Levenshtein prenne en compte ces différences, nous cherchons uniquement à savoir avec quelle précision le texte est détecté, et non où il se trouve. La distance cosinus a des pénalités négligeables pour de tels cas, nous avons donc décidé de l'utiliser dans ce benchmark.

Sélection des produits

Il existe de nombreux produits d'OCR sur le marché. Nous devons nous concentrer sur ceux qui peuvent produire des résultats en texte brut. Les produits de ce benchmark sont choisis en fonction de :

  • La capacité à extraire du texte. Nous n'avons pas inclus les solutions qui extraient uniquement des données lisibles par machine (c'est-à-dire des données structurées) dans cette comparaison
  • Leur popularité sur le marché

Il ne s'agit pas d'une revue de marché exhaustive et nous avons peut-être exclu certains produits ayant des capacités significatives. Si c'est le cas, veuillez laisser un commentaire et nous serons heureux d'élargir le benchmark.

Limitations

Les capacités avancées telles que la détection de l'emplacement du texte, l'appariement clé-valeur et la classification de documents n'ont pas été évaluées dans ce benchmark.

La taille de l'échantillon sera augmentée lors de la prochaine itération. Si vous recherchez de l'OCR pour l'écriture manuscrite, consultez notre benchmark d'OCR pour l'écriture manuscrite avec 50 échantillons.

Vous pouvez également consulter notre benchmark d'OCR pour les factures et notre benchmark d'OCR pour les reçus si cela vous intéresse.

FAQ

La reconnaissance optique de caractères (OCR) est un domaine de l'apprentissage automatique spécialisé dans la distinction des caractères dans des images comme les documents numérisés, les livres imprimés ou les photos. Bien qu'il s'agisse d'une technologie mature, il n'existe toujours pas de produits d'OCR capables de reconnaître tous les types de texte avec une précision de 100 %. Parmi les produits que nous avons benchmarkés, seuls quelques-uns ont pu produire des résultats satisfaisants à partir de notre ensemble de test.
Les outils d'OCR sont utilisés par les entreprises pour identifier les textes et leurs positions dans les images, classer les documents professionnels par sujet ou effectuer un appariement clé-valeur dans les documents. Sur la base des résultats de l'OCR, d'autres entreprises technologiques créent des applications comme l'automatisation documentaire. Pour tous ces cas d'usage professionnels, une reconnaissance précise du texte est essentielle pour un produit d'OCR.

Laissez notre équipe automatiser l'un de vos processus métier avec des agents IA, gratuitement.
Automatiser un processus

Citez ce benchmark

Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.

Şevval Alper (2026) - "OCR Benchmark: Précision de l'extraction / capture de texte". Publié en ligne sur AIMultiple.com. Consulté le 29 Juillet 2026, à : https://aimultiple.com/ocr-accuracy [Ressource en ligne]

Alper, Ş. (2026, 29 Juillet). OCR Benchmark: Précision de l'extraction / capture de texte. AIMultiple. https://aimultiple.com/ocr-accuracy

@misc{alper2026,
  author = {Alper, Şevval},
  title  = {{OCR Benchmark: Précision de l'extraction / capture de texte}},
  year   = {2026},
  month  = jul,
  howpublished    = {\url{https://aimultiple.com/ocr-accuracy}},
  note   = {AIMultiple. Consulté le 29 Juillet 2026}
}
Şevval Alper
Şevval Alper
Chercheur en IA
Şevval est analyste chez AIMultiple, spécialisé dans les outils de codage IA, les agents IA et les technologies quantiques.
Voir le profil complet

Commentaires 8

Partagez vos idées

Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.

0/450
Serhat Cinar
Serhat Cinar
Feb 28, 2025 at 09:34

Did you ever think of oncluding multimodal llms in your comparison, like gpt4o, llama 3.2. gemini, claude etc.?

Cem Dilmegani
Cem Dilmegani
Mar 17, 2025 at 02:59

Hi Serhat and thank you for your comment, Yes, we added those for which we have API access like Claude and GPT-4o.

DLJ
DLJ
Oct 17, 2024 at 11:14

Just stumbled on this milestone assessment update. Could you kindly elaborate further on the three revised datasets: Thanks for this work. Character Sets When someone refers to 'handriting', that can mean many things: 'handwriting style' typefaces (per Docusign, etc.), and hand-printed (block printing and mixed-case printing) as often found in combs and box delineators, and finally, cursive or longhand writing (exclusive of signatures). Character Context Structured content, semi-structured content, and unstructured content. Image Qualities (bitonal, greyscale, full colour, spatial dpi, from a scanner/cell-phone/native rendering, image 'enhancements' prior to OCR (thickening, local gamma, background dropout, sharpening, smoothing, noise removal, etc.) These can have significant impacts, and some don't realize the importance of including these benchmark differentiators.

Cem Dilmegani
Cem Dilmegani
Oct 22, 2024 at 03:15

Hi there, thank you for the detailed comment, we are updating the article to include these details.

Webster
Webster
Feb 05, 2023 at 07:24

Hello, great work! Just curious, did you use a trained Tesseract when making these testing?

Bardia Eshghi
Bardia Eshghi
Feb 06, 2023 at 12:29

Hi, Webster. Glad you enjoyed the article. The tools we tested were: ABBYY FineReader 15 Amazon Textract Google Cloud Platform Vision API Microsoft Azure Computer Vision API Tesseract OCR Engine Hope this answers your question.

Bobby
Bobby
Aug 14, 2022 at 23:54

The graph images are not working for me at the moment. Otherwise great

Cem Dilmegani
Cem Dilmegani
Aug 15, 2022 at 14:48

Thank you Bobby! We have a glitch in the CMS and we are fixing it. Apologies for the issue, it should be fixed next week.

samsun
samsun
Jun 07, 2022 at 14:10

Thanks for sharing, can you add a free OCR for everyone to use? https://www.geekersoft.com/ocr-online.html

Cem Dilmegani
Cem Dilmegani
Aug 17, 2022 at 07:46

Hi Samsun, unfortunately, we don't share all OCR providers on this page, there are thousands of them. We tried to put together the largest ones in terms of market presence. If you have evidence that your solution is one of the top 10 globally, please share it with us at info@aimultiple.com so we can consider it.

Scott
Scott
Jan 20, 2022 at 20:42

What version of Tesseract did you test with? They recently released v5.

Cem Dilmegani
Cem Dilmegani
Aug 23, 2022 at 12:01

Hi Scott, we did the benchmarking before Tesseract 5. We will redo it soon and include the versions in the methodology section as well.

Bob
Bob
Jan 12, 2022 at 15:09

This is very informative, nice work. I assume your tests used documents/images in English? I've been experimenting with OCR tools on other languages and finding relatively poor accuracy.

Cem Dilmegani
Cem Dilmegani
Jan 15, 2022 at 13:52

Exactly, all text were in English. I hear similar things about OCR on non-Latin characters. We have an Arabic speaker in the team who claims that accuracy in Arabic is much lower compared to English. We can do a benchmark on non-Latin characters if there is demand for it.

kin
kin
Jun 21, 2021 at 02:22

interesting post!!! do you have any suggestion about improving accuracy on scanned image ? i'm using tesseract right now. anyway , great work!

Cem Dilmegani
Cem Dilmegani
Jun 22, 2021 at 07:50

Thank you for the comment. There are pre-processing approaches that can be implemented to improve image quality. But such approaches may already be used in Tesseract. A detailed research into Tesseract image processing would be helpful in your case.