La précision de l'OCR est essentielle pour de nombreuses tâches de traitement de documents, et les LLMs multimodaux SOTA offrent désormais une alternative à l'OCR. Nous avons benchmarké les principaux services d'OCR dans DeltOCR Bench pour identifier leurs niveaux de précision sur différents types de documents :
- Écriture manuscrite : GPT-5 (95 %) se distingue comme le plus performant, suivi de près par olmOCR-2-7B (94 %) et Gemini 2.5 Pro (93 %).
- Médias imprimés : Gemini 2.5 Pro, Google Vision et Claude Sonnet 4.5 dominent cette catégorie avec le score le plus élevé (85 %)
- Texte imprimé : Microsoft Azure Document Intelligence API est en tête avec un score de 96 %.
OCR Benchmark : DeltOCR Bench
Les noms complets des produits ci-dessus et leurs versions utilisées en novembre 2025 sont répertoriés ci-dessous. Notre étude couvre à la fois les services API facilement accessibles et les solutions nécessitant une infrastructure sur site, en comparant les principaux modèles du marché dans un environnement de test approfondi.
- Écriture manuscrite :
- Plage de précision : Une large plage allant de 46 % à 95 %.
- Points forts : GPT-5 (95 %), olmOCR-2-7B (94 %) et Gemini 2.5 Pro (93 %) affichent les performances les plus élevées. Ces scores élevés démontrent le potentiel de précision extraordinaire des LLMs multimodaux, tels que GPT-5 et Gemini 2.5 Pro, dans ce domaine.
- Recommandation : Pour reconnaître une écriture manuscrite très complexe, les meilleures solutions LLM comme GPT-5 ou Gemini 2.5 Pro sont recommandées en raison de leur accessibilité via API et de leur facilité d'intégration.
- Médias imprimés :
- Plage de précision : Une plage allant de 54 % à 85 %.
- Points forts : Des solutions telles que Gemini 2.5 Pro, Google Vision et Claude Sonnet 4.5 partagent le score le plus élevé (85 %). Cette catégorie est très compétitive parmi les LLMs et les services d'OCR traditionnels basés sur le cloud (Azure, Dots OCR, Amazon Textract). GPT-5 est en retrait par rapport aux autres LLMs leaders dans cette catégorie (77 %).
- Recommandation : Pour les documents avec des mises en page visuelles complexes (polices multiples, basse résolution, etc.), les LLMs comme Gemini 2.5 Pro, ou les services cloud comme Google Vision, ou Microsoft Azure Document Intelligence API sont recommandés.
- Texte imprimé :
- Plage de précision : Une plage élevée allant de 55 % à 96 %, bien que la plupart des solutions leaders aient atteint des scores de 94 % et plus.
- Points forts : Microsoft Azure Document Intelligence API (96 %) prend la tête, suivi de près par des solutions comme GPT-5, Gemini 2.5 Pro, Gemini 3 Pro Preview, Google Vision et Amazon Textract, toutes obtenant 95 %. Cette catégorie est un domaine où toutes les solutions SOTA atteignent des niveaux de précision extrêmement élevés.
- Recommandation : Pour les textes imprimés simples nécessitant une haute précision, les solutions cloud établies comme Microsoft Azure Document Intelligence API ou Google Vision, ou les LLMs obtenant des scores élevés (Gemini/GPT-5), peuvent être utilisés en toute confiance.
Solutions API
Les modèles suivants ont été inclus dans notre liste de benchmarking en raison de leur facilité d'accès et de leurs performances.
- Claude Sonnet 4.5
- OpenAI GPT-5
- Gemini 2.5 Pro
- Gemini 3 Pro Preview
- Amazon Textract API
- Google Cloud Vision API
- Microsoft Azure Document Intelligence API
- Moondream OCR
- Mistral OCR 3
- Mistral OCR 2
Microsoft Azure Document Intelligence API fait partie de la famille Azure Cognitive Services.
Modèles déployés localement (sur site)
Tester ces modèles est plus difficile que les solutions API en raison de l'installation, de la gestion des dépendances et des exigences matérielles. Tous les tests locaux ont été effectués dans un environnement serveur dédié.
- olmOCR-2-7B
- PaddleOCR-VL
- Nanonets-OCR2-3B
- Deepseek-OCR
- Dots-OCR
Nous avons calculé la précision des résultats sous forme de score de similarité cosinus pour le texte imprimé, les médias imprimés et l'écriture manuscrite. Chaque score visible dans le graphique représente la performance du modèle correspondant dans cette catégorie.
Lors de nos tests, nous avons observé que le modèle Nanonets-OCR2-3B a fourni les performances les plus faibles du benchmark, obtenant les scores les plus bas. En général, nous avons constaté que certains modèles rencontraient des difficultés particulières avec l'écriture cursive et les mises en page de texte désorganisées (ordre des lignes mélangé, capitalisation incohérente). Des problèmes de performance similaires sont également apparus dans la catégorie des médias imprimés, en particulier avec les images à basse résolution et celles contenant plusieurs styles de police.
Dataset
Nous avons utilisé un total de 300 documents dans ce benchmark, avec 100 documents par catégorie répartis sur 3 catégories :
Texte imprimé comprend des lettres, des captures d'écran de sites web, des e-mails, des rapports, etc.
Médias imprimés comprend des affiches, des couvertures de livres, des publicités, etc. Nous avons cherché à évaluer le succès des outils d'OCR sur différentes polices de texte et emplacements.
Les Files de ces 2 catégories proviennent de l'Industry Documents Library (IDL).1
Écriture manuscrite : Dans la catégorie manuscrite, comme certains documents IDL n'étaient pas faciles à lire, notre équipe a généré des documents similaires aux documents IDL. Nous avons préparé manuellement des échantillons d'écriture manuscrite lisible par un humain. Tous les échantillons étaient dans un style d'écriture cursive.
Méthodologie de DeltOCR Bench
Ce benchmark se concentre sur la précision de l'extraction de texte des produits.
Le prétraitement est effectué uniquement pour la catégorie d'écriture manuscrite. Nous avons pris des photos de documents manuscrits avec nos smartphones et utilisé une application de scanner mobile :
- Les photos ont été converties en noir et blanc
- Le contraste a été augmenté et l'arrière-plan a été supprimé.
OCR : Nous avons exécuté tous les produits sur le même dataset et généré des sorties texte sous forme de fichiers texte brut (.txt). Ensuite, nous avons préparé manuellement la vérité de terrain incluant le texte correct dans tous ces fichiers. La vérité de terrain a été vérifiée deux fois par des humains.
Comparaison : Nous avons mesuré la précision des solutions d'OCR en comparant leurs sorties avec les textes originaux. À cette fin, nous avons utilisé le framework Sentence-BERT (SBERT) pour calculer les scores de similarité cosinus. Dans le benchmark, nous avons utilisé le modèle de paraphrase multilingue haute performance MiniLM-L12-v2 pour calculer le score de similarité entre la sortie de chaque produit et les textes de vérité de terrain. Ce score représente le niveau de précision du texte.
La fonction de similarité utilise une métrique de distance cosinus pour calculer la similarité entre deux textes. Nous n'avons pas utilisé la distance de Levenshtein pour ce benchmark car différents produits produisent des textes dans des ordres différents.2
Bien que la distance de Levenshtein prenne en compte ces différences, nous cherchons uniquement à savoir avec quelle précision le texte est détecté, et non où il se trouve. La distance cosinus a des pénalités négligeables pour de tels cas, nous avons donc décidé de l'utiliser dans ce benchmark.
Sélection des produits
Il existe de nombreux produits d'OCR sur le marché. Nous devons nous concentrer sur ceux qui peuvent produire des résultats en texte brut. Les produits de ce benchmark sont choisis en fonction de :
- La capacité à extraire du texte. Nous n'avons pas inclus les solutions qui extraient uniquement des données lisibles par machine (c'est-à-dire des données structurées) dans cette comparaison
- Leur popularité sur le marché
Il ne s'agit pas d'une revue de marché exhaustive et nous avons peut-être exclu certains produits ayant des capacités significatives. Si c'est le cas, veuillez laisser un commentaire et nous serons heureux d'élargir le benchmark.
Limitations
Les capacités avancées telles que la détection de l'emplacement du texte, l'appariement clé-valeur et la classification de documents n'ont pas été évaluées dans ce benchmark.
La taille de l'échantillon sera augmentée lors de la prochaine itération. Si vous recherchez de l'OCR pour l'écriture manuscrite, consultez notre benchmark d'OCR pour l'écriture manuscrite avec 50 échantillons.
Vous pouvez également consulter notre benchmark d'OCR pour les factures et notre benchmark d'OCR pour les reçus si cela vous intéresse.
FAQ
La reconnaissance optique de caractères (OCR) est un domaine de l'apprentissage automatique spécialisé dans la distinction des caractères dans des images comme les documents numérisés, les livres imprimés ou les photos. Bien qu'il s'agisse d'une technologie mature, il n'existe toujours pas de produits d'OCR capables de reconnaître tous les types de texte avec une précision de 100 %. Parmi les produits que nous avons benchmarkés, seuls quelques-uns ont pu produire des résultats satisfaisants à partir de notre ensemble de test.
Les outils d'OCR sont utilisés par les entreprises pour identifier les textes et leurs positions dans les images, classer les documents professionnels par sujet ou effectuer un appariement clé-valeur dans les documents. Sur la base des résultats de l'OCR, d'autres entreprises technologiques créent des applications comme l'automatisation documentaire. Pour tous ces cas d'usage professionnels, une reconnaissance précise du texte est essentielle pour un produit d'OCR.
Citez ce benchmark
Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.
@misc{alper2026,
author = {Alper, Şevval},
title = {{OCR Benchmark: Précision de l'extraction / capture de texte}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/ocr-accuracy}},
note = {AIMultiple. Consulté le 29 Juillet 2026}
}
Commentaires 8
Partagez vos idées
Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.
Did you ever think of oncluding multimodal llms in your comparison, like gpt4o, llama 3.2. gemini, claude etc.?
Hi Serhat and thank you for your comment, Yes, we added those for which we have API access like Claude and GPT-4o.
Just stumbled on this milestone assessment update. Could you kindly elaborate further on the three revised datasets: Thanks for this work. Character Sets When someone refers to 'handriting', that can mean many things: 'handwriting style' typefaces (per Docusign, etc.), and hand-printed (block printing and mixed-case printing) as often found in combs and box delineators, and finally, cursive or longhand writing (exclusive of signatures). Character Context Structured content, semi-structured content, and unstructured content. Image Qualities (bitonal, greyscale, full colour, spatial dpi, from a scanner/cell-phone/native rendering, image 'enhancements' prior to OCR (thickening, local gamma, background dropout, sharpening, smoothing, noise removal, etc.) These can have significant impacts, and some don't realize the importance of including these benchmark differentiators.
Hi there, thank you for the detailed comment, we are updating the article to include these details.
Hello, great work! Just curious, did you use a trained Tesseract when making these testing?
Hi, Webster. Glad you enjoyed the article. The tools we tested were: ABBYY FineReader 15 Amazon Textract Google Cloud Platform Vision API Microsoft Azure Computer Vision API Tesseract OCR Engine Hope this answers your question.
The graph images are not working for me at the moment. Otherwise great
Thank you Bobby! We have a glitch in the CMS and we are fixing it. Apologies for the issue, it should be fixed next week.
Thanks for sharing, can you add a free OCR for everyone to use? https://www.geekersoft.com/ocr-online.html
Hi Samsun, unfortunately, we don't share all OCR providers on this page, there are thousands of them. We tried to put together the largest ones in terms of market presence. If you have evidence that your solution is one of the top 10 globally, please share it with us at info@aimultiple.com so we can consider it.
What version of Tesseract did you test with? They recently released v5.
Hi Scott, we did the benchmarking before Tesseract 5. We will redo it soon and include the versions in the methodology section as well.
This is very informative, nice work. I assume your tests used documents/images in English? I've been experimenting with OCR tools on other languages and finding relatively poor accuracy.
Exactly, all text were in English. I hear similar things about OCR on non-Latin characters. We have an Arabic speaker in the team who claims that accuracy in Arabic is much lower compared to English. We can do a benchmark on non-Latin characters if there is demand for it.
interesting post!!! do you have any suggestion about improving accuracy on scanned image ? i'm using tesseract right now. anyway , great work!
Thank you for the comment. There are pre-processing approaches that can be implemented to improve image quality. But such approaches may already be used in Tesseract. A detailed research into Tesseract image processing would be helpful in your case.