Die Genauigkeit von OCR ist für viele Dokumentenverarbeitungsaufgaben entscheidend, und multimodale SOTA-LLMs bieten jetzt eine Alternative zu OCR. Wir haben führende OCR-Dienste im DeltOCR-Benchmark getestet, um ihre Genauigkeitsstufen bei verschiedenen Dokumententypen zu ermitteln:
- Handschrift: GPT-5 (95 %) sticht als bester Performer hervor, dicht gefolgt von olmOCR-2-7B (94 %) und Gemini 2.5 Pro (93 %).
- Gedruckte Medien: Gemini 2.5 Pro, Google Vision und Claude Sonnet 4.5 führen diese Kategorie mit der höchsten Punktzahl an (85 %).
- Gedruckter Text: Microsoft Azure Document Intelligence API führt mit einer Punktzahl von 96 %.
OCR-Benchmark: DeltOCR-Bench
Die vollständigen Namen der oben genannten Produkte und ihre zum Stand November 2025 verwendeten Versionen sind unten aufgeführt. Unsere Studie umfasst sowohl leicht zugängliche API-Dienste als auch Lösungen, die eine lokale Infrastruktur erfordern, und vergleicht wichtige Modelle auf dem Markt in einer tiefgehenden Testumgebung.
- Handschrift:
- Genauigkeitsbereich: Eine große Spanne von 46 % bis 95 %.
- Highlights: GPT-5 (95 %), olmOCR-2-7B (94 %) und Gemini 2.5 Pro (93 %) zeigen die höchste Leistung. Diese hohen Werte demonstrieren das außergewöhnliche Genauigkeitspotenzial multimodaler LLMs wie GPT-5 und Gemini 2.5 Pro in diesem Bereich.
- Empfehlung: Für die Erkennung hochkomplexer Handschriften werden die besten LLM-Lösungen wie GPT-5 oder Gemini 2.5 Pro aufgrund ihrer API-Zugänglichkeit und einfachen Integration empfohlen.
- Gedruckte Medien:
- Genauigkeitsbereich: Eine Spanne von 54 % bis 85 %.
- Highlights: Lösungen wie Gemini 2.5 Pro, Google Vision und Claude Sonnet 4.5 teilen sich die höchste Punktzahl (85 %). Diese Kategorie ist stark umkämpft unter LLMs und traditionellen cloudbasierten OCR-Diensten (Azure, Dots OCR, Amazon Textract). GPT-5 hinkt anderen führenden LLMs in dieser Kategorie hinterher (77 %).
- Empfehlung: Für Dokumente mit komplexen visuellen Layouts (mehrere Schriftarten, niedrige Auflösung usw.) werden LLMs wie Gemini 2.5 Pro oder cloudbasierte Dienste wie Google Vision oder Microsoft Azure Document Intelligence API empfohlen.
- Gedruckter Text:
- Genauigkeitsbereich: Ein hoher Bereich von 55 % bis 96 %, wobei die meisten führenden Lösungen Werte von 94 % und darüber erzielten.
- Highlights: Microsoft Azure Document Intelligence API (96 %) liegt an der Spitze, dicht gefolgt von Lösungen wie GPT-5, Gemini 2.5 Pro, Gemini 3 Pro Preview, Google Vision und Amazon Textract, die alle 95 % erreichen. In dieser Kategorie erzielen alle SOTA-Lösungen ein extrem hohes Maß an Genauigkeit.
- Empfehlung: Für einfache gedruckte Texte, die hohe Genauigkeit erfordern, können etablierte Cloud-Lösungen wie Microsoft Azure Document Intelligence API oder Google Vision oder hoch bewertete LLMs (Gemini/GPT-5) bedenkenlos verwendet werden.
API-Lösungen
Die folgenden Modelle wurden aufgrund ihrer einfachen Zugänglichkeit und Leistung in unsere Benchmarking-Liste aufgenommen.
- Claude Sonnet 4.5
- OpenAI GPT-5
- Gemini 2.5 Pro
- Gemini 3 Pro Preview
- Amazon Textract API
- Google Cloud Vision API
- Microsoft Azure Document Intelligence API
- Moondream OCR
- Mistral OCR 3
- Mistral OCR 2
Microsoft Azure Document Intelligence API ist Teil der Azure Cognitive Services-Familie.
Lokal (On-Premise) bereitgestellte Modelle
Das Testen dieser Modelle ist aufgrund von Installation, Abhängigkeitsverwaltung und Hardwareanforderungen anspruchsvoller als bei API-Lösungen. Alle lokalen Tests wurden in einer dedizierten Serverumgebung durchgeführt.
- olmOCR-2-7B
- PaddleOCR-VL
- Nanonets-OCR2-3B
- Deepseek-OCR
- Dots-OCR
Wir haben die Genauigkeit der Ergebnisse als Cosinus-Ähnlichkeitswert für gedruckten Text, gedruckte Medien und Handschrift berechnet. Jeder im Diagramm sichtbare Wert repräsentiert die Leistung des entsprechenden Modells in dieser Kategorie.
Während unserer Tests stellten wir fest, dass das Nanonets-OCR2-3B-Modell die schwächste Leistung im Benchmark erbrachte und die niedrigsten Werte erzielte. Generell stellten wir fest, dass einige Modelle besonders mit kursiver Handschrift und unstrukturierten Textlayouts (gemischte Zeilenanordnung, inkonsistente Großschreibung) zu kämpfen hatten. Ähnliche Leistungsprobleme traten auch in der Kategorie gedruckte Medien auf, insbesondere bei Bildern mit niedriger Auflösung und solchen mit mehreren Schriftarten.
Datensatz
Wir verwendeten in diesem Benchmark insgesamt 300 Dokumente, mit 100 Dokumenten pro Kategorie über 3 Kategorien hinweg:
Gedruckter Text umfasst Briefe, Website-Screenshots, E-Mails, Berichte usw.
Gedruckte Medien umfassen Poster, Buchumschläge, Werbung usw. Wir wollten den Erfolg der OCR-Tools bei verschiedenen Textschriftarten und -platzierungen untersuchen.
Die Dateien in diesen 2 Kategorien stammten aus der Industry Documents Library (IDL).1
Handschrift: In der Handschriftkategorie haben wir, da einige IDL-Dokumente nicht leicht lesbar waren, von unserem Team Dokumente erstellen lassen, die den IDL-Dokumenten ähneln. Wir haben manuell Proben von für Menschen lesbarer Handschrift vorbereitet. Alle Proben waren in einem kursiven Handschriftstil gehalten.
Methodik des DeltOCR-Benchmarks
Dieser Benchmark konzentriert sich auf die Textextraktionsgenauigkeit der Produkte.
Eine Vorverarbeitung wird nur für die Handschriftkategorie durchgeführt. Wir haben Bilder von handschriftlichen Dokumenten mit unseren Smartphones aufgenommen und eine mobile Scanner-App verwendet:
- Bilder wurden in Schwarz-Weiß konvertiert
- Der Kontrast wurde erhöht und der Hintergrund entfernt.
OCR: Wir haben alle Produkte auf demselben Datensatz ausgeführt und Textausgaben als Rohtextdateien (.txt) generiert. Anschließend haben wir manuell die Ground Truth mit dem korrekten Text in all diesen Dateien erstellt. Die Ground Truth wurde zweimal von Menschen überprüft.
Vergleich: Wir haben die Genauigkeit der OCR-Lösungen gemessen, indem wir ihre Ausgaben mit den Originaltexten verglichen haben. Zu diesem Zweck verwendeten wir das Sentence-BERT (SBERT) Framework, um Cosinus-Ähnlichkeitswerte zu berechnen. Im Benchmark verwendeten wir das leistungsstarke mehrsprachige Paraphrasenmodell MiniLM-L12-v2, um den Ähnlichkeitswert zwischen der Ausgabe jedes Produkts und den Ground-Truth-Texten zu berechnen. Dieser Wert repräsentiert das Textgenauigkeitsniveau.
Die Ähnlichkeitsfunktion verwendet eine Cosinus-Distanzmetrik, um die Ähnlichkeit zwischen zwei Texten zu berechnen. Wir haben für diesen Benchmark nicht die Levenshtein-Distanz verwendet, da verschiedene Produkte Texte in unterschiedlicher Reihenfolge ausgeben.2
Während die Levenshtein-Distanz diese Unterschiede berücksichtigt, suchen wir nur danach, wie genau der Text erkannt wird, aber nicht, wo er sich befindet. Die Cosinus-Distanz hat vernachlässigbare Strafen für solche Fälle, daher haben wir uns entschieden, sie in diesem Benchmark zu verwenden.
Produktauswahl
Es gibt viele OCR-Produkte auf dem Markt. Wir müssen uns auf diejenigen konzentrieren, die Rohtextergebnisse ausgeben können. Die Produkte für diesen Benchmark wurden basierend auf folgenden Kriterien ausgewählt:
- Fähigkeit, Text zu extrahieren. Wir haben Lösungen, die nur maschinenlesbare (d. h. strukturierte Daten) extrahieren, nicht in diesen Vergleich einbezogen
- Ihre Popularität auf dem Markt
Dies ist keine umfassende Marktübersicht, und wir haben möglicherweise einige Produkte mit bedeutenden Fähigkeiten ausgeschlossen. Sollte dies der Fall sein, hinterlassen Sie bitte einen Kommentar, und wir werden den Benchmark gerne erweitern.
Einschränkungen
Fortgeschrittene Fähigkeiten wie Texterkennung, Schlüssel-Wert-Paarung und Dokumentenklassifizierung wurden in diesem Benchmark nicht bewertet.
Die Stichprobengröße wird in der nächsten Iteration erhöht. Wenn Sie OCR für Handschrift suchen, sehen Sie sich unseren Handschrifterkennungs-OCR-Benchmark mit 50 Proben an.
Sie können sich auch unseren Rechnungs-OCR-Benchmark und Beleg-OCR-Benchmark ansehen, falls Sie interessiert sind.
FAQs
Optische Zeichenerkennung (OCR) ist ein Bereich des maschinellen Lernens, der sich auf die Unterscheidung von Zeichen in Bildern wie gescannten Dokumenten, gedruckten Büchern oder Fotos spezialisiert hat. Obwohl es sich um eine ausgereifte Technologie handelt, gibt es noch keine OCR-Produkte, die alle Arten von Text mit 100%iger Genauigkeit erkennen können. Unter den von uns getesteten Produkten konnten nur wenige erfolgreiche Ergebnisse aus unserem Testsatz liefern.
OCR-Tools werden von Unternehmen verwendet, um Texte und ihre Positionen in Bildern zu identifizieren, Geschäftsdokumente nach Themen zu klassifizieren oder Schlüssel-Wert-Paarungen innerhalb von Dokumenten durchzuführen. Basierend auf OCR-Ergebnissen entwickeln andere Technologieunternehmen Anwendungen wie Dokumentenautomatisierung. Für all diese Geschäftsfälle ist eine genaue Texterkennung für ein OCR-Produkt entscheidend.
Zitieren Sie diesen Benchmark
Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.
@misc{alper2026,
author = {Alper, Şevval},
title = {{OCR-Benchmark: Textextraktion / Erfassungsgenauigkeit}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/ocr-accuracy}},
note = {AIMultiple. Abgerufen am 29. Juli 2026}
}
Kommentare 8
Teilen Sie Ihre Gedanken
Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.
Did you ever think of oncluding multimodal llms in your comparison, like gpt4o, llama 3.2. gemini, claude etc.?
Hi Serhat and thank you for your comment, Yes, we added those for which we have API access like Claude and GPT-4o.
Just stumbled on this milestone assessment update. Could you kindly elaborate further on the three revised datasets: Thanks for this work. Character Sets When someone refers to 'handriting', that can mean many things: 'handwriting style' typefaces (per Docusign, etc.), and hand-printed (block printing and mixed-case printing) as often found in combs and box delineators, and finally, cursive or longhand writing (exclusive of signatures). Character Context Structured content, semi-structured content, and unstructured content. Image Qualities (bitonal, greyscale, full colour, spatial dpi, from a scanner/cell-phone/native rendering, image 'enhancements' prior to OCR (thickening, local gamma, background dropout, sharpening, smoothing, noise removal, etc.) These can have significant impacts, and some don't realize the importance of including these benchmark differentiators.
Hi there, thank you for the detailed comment, we are updating the article to include these details.
Hello, great work! Just curious, did you use a trained Tesseract when making these testing?
Hi, Webster. Glad you enjoyed the article. The tools we tested were: ABBYY FineReader 15 Amazon Textract Google Cloud Platform Vision API Microsoft Azure Computer Vision API Tesseract OCR Engine Hope this answers your question.
The graph images are not working for me at the moment. Otherwise great
Thank you Bobby! We have a glitch in the CMS and we are fixing it. Apologies for the issue, it should be fixed next week.
Thanks for sharing, can you add a free OCR for everyone to use? https://www.geekersoft.com/ocr-online.html
Hi Samsun, unfortunately, we don't share all OCR providers on this page, there are thousands of them. We tried to put together the largest ones in terms of market presence. If you have evidence that your solution is one of the top 10 globally, please share it with us at info@aimultiple.com so we can consider it.
What version of Tesseract did you test with? They recently released v5.
Hi Scott, we did the benchmarking before Tesseract 5. We will redo it soon and include the versions in the methodology section as well.
This is very informative, nice work. I assume your tests used documents/images in English? I've been experimenting with OCR tools on other languages and finding relatively poor accuracy.
Exactly, all text were in English. I hear similar things about OCR on non-Latin characters. We have an Arabic speaker in the team who claims that accuracy in Arabic is much lower compared to English. We can do a benchmark on non-Latin characters if there is demand for it.
interesting post!!! do you have any suggestion about improving accuracy on scanned image ? i'm using tesseract right now. anyway , great work!
Thank you for the comment. There are pre-processing approaches that can be implemented to improve image quality. But such approaches may already be used in Tesseract. A detailed research into Tesseract image processing would be helpful in your case.