Die Genauigkeit von OCR ist für viele Dokumentenverarbeitungsaufgaben entscheidend, und multimodale SOTA-LLMs bieten nun eine Alternative zur OCR. Wir haben führende OCR-Dienste im DeltOCR Bench bewertet, um ihre Genauigkeitsniveaus bei verschiedenen Dokumenttypen zu ermitteln:
- Handschrift: GPT-5 (%95) sticht als stärkster Performer hervor, dicht gefolgt von olmOCR-2-7B (%94) und Gemini 2.5 Pro (%93).
- Gedruckte Medien: Gemini 2.5 Pro, Google Vision und Claude Sonnet 4.5 führen diese Kategorie mit der höchsten Punktzahl an (%85)
- Gedruckter Text: Microsoft Azure Document Intelligence API führt mit einer Punktzahl von %96.
OCR-Benchmark: DeltOCR Bench
Die vollständigen Namen der oben genannten Produkte und ihre Versionen mit Stand November 2025 sind unten aufgeführt. Unsere Studie umfasst sowohl leicht zugängliche API-Dienste als auch Lösungen, die eine On-Premises-Infrastruktur erfordern, und vergleicht wichtige Modelle auf dem Markt in einer tiefgehenden Testumgebung.
- Handschrift:
- Genauigkeitsbereich: Eine große Spanne von %46 bis %95.
- Highlights: GPT-5 (%95), olmOCR-2-7B (%94) und Gemini 2.5 Pro (%93) zeigen die höchste Leistung. Diese hohen Werte demonstrieren das außergewöhnliche Genauigkeitspotenzial multimodaler LLMs wie GPT-5 und Gemini 2.5 Pro in diesem Bereich.
- Empfehlung: Für die Erkennung hochkomplexer Handschriften werden die führenden LLM-Lösungen wie GPT-5 oder Gemini 2.5 Pro aufgrund ihrer API-Zugänglichkeit und einfachen Integration empfohlen.
- Gedruckte Medien:
- Genauigkeitsbereich: Eine Spanne von %54 bis %85.
- Highlights: Lösungen wie Gemini 2.5 Pro, Google Vision und Claude Sonnet 4.5 teilen sich die höchste Punktzahl (%85). Diese Kategorie ist hart umkämpft zwischen LLMs und traditionellen cloudbasierten OCR-Diensten (Azure, Dots OCR, Amazon Textract). GPT-5 hinkt anderen führenden LLMs in dieser Kategorie hinterher (%77).
- Empfehlung: Für Dokumente mit komplexen visuellen Layouts (mehrere Schriftarten, niedrige Auflösung usw.) werden LLMs wie Gemini 2.5 Pro oder cloudbasierte Dienste wie Google Vision oder Microsoft Azure Document Intelligence API empfohlen.
- Gedruckter Text:
- Genauigkeitsbereich: Ein hoher Bereich von %55 bis %96, wobei die meisten führenden Lösungen Werte von %94 und darüber erreichten.
- Highlights: Microsoft Azure Document Intelligence API (%96) liegt an der Spitze, dicht gefolgt von Lösungen wie GPT-5, Gemini 2.5 Pro, Gemini 3 Pro Preview, Google Vision und Amazon Textract, die alle %95 erreichen. In dieser Kategorie erreichen alle SOTA-Lösungen ein extrem hohes Genauigkeitsniveau.
- Empfehlung: Für einfache gedruckte Texte, die eine hohe Genauigkeit erfordern, können etablierte Cloud-Lösungen wie Microsoft Azure Document Intelligence API oder Google Vision oder leistungsstarke LLMs (Gemini/GPT-5) bedenkenlos eingesetzt werden.
API-Lösungen
Die folgenden Modelle wurden aufgrund ihrer einfachen Zugänglichkeit und Leistung in unsere Benchmarking-Liste aufgenommen.
- Claude Sonnet 4.5
- OpenAI GPT-5
- Gemini 2.5 Pro
- Gemini 3 Pro Preview
- Amazon Textract API
- Google Cloud Vision API
- Microsoft Azure Document Intelligence API
- Moondream OCR
- Mistral OCR 3
- Mistral OCR 2
Microsoft Azure Document Intelligence API ist Teil der Azure Cognitive Services-Familie.
Lokal (On-Premise) bereitgestellte Modelle
Das Testen dieser Modelle ist aufgrund von Installation, Abhängigkeitsverwaltung und Hardwareanforderungen anspruchsvoller als bei API-Lösungen. Alle lokalen Tests wurden in einer dedizierten Serverumgebung durchgeführt.
- olmOCR-2-7B
- PaddleOCR-VL
- Nanonets-OCR2-3B
- Deepseek-OCR
- Dots-OCR
Wir haben die Genauigkeit der Ergebnisse als Kosinus-Ähnlichkeitswert für gedruckten Text, gedruckte Medien und Handschrift berechnet. Jeder im Diagramm sichtbare Wert repräsentiert die Leistung des entsprechenden Modells in dieser Kategorie.
Während unserer Tests beobachteten wir, dass das Nanonets-OCR2-3B-Modell die schwächste Leistung im Benchmark lieferte und die niedrigsten Werte erzielte. Generell stellten wir fest, dass einige Modelle besonders mit Schreibschrift und unübersichtlichen Textlayouts (gemischte Zeilenanordnung, inkonsistente Großschreibung) zu kämpfen hatten. Ähnliche Leistungsprobleme traten auch in der Kategorie der gedruckten Medien auf, insbesondere bei Bildern mit niedriger Auflösung und solchen mit mehreren Schriftarten.
Datensatz
Wir verwendeten insgesamt 300 Dokumente in diesem Benchmark, mit 100 Dokumenten pro Kategorie über 3 Kategorien hinweg:
Gedruckter Text umfasst Briefe, Website-Screenshots, E-Mails, Berichte usw.
Gedruckte Medien umfasst Poster, Buchcover, Werbung usw. Wir wollten den Erfolg der OCR-Tools bei verschiedenen Textschriftarten und -platzierungen ermitteln.
Files in diesen 2 Kategorien stammen aus der Industry Documents Library (IDL).1
Handschrift: In der Kategorie Handschrift waren einige IDL-Dokumente nicht leicht lesbar, daher hat unser Team Dokumente ähnlich den IDL-Dokumenten erstellt. Wir haben manuell Proben von menschenlesbarer Handschrift vorbereitet. Alle Proben waren im Schreibschrift-Stil.
Methodik des DeltOCR Bench
Dieser Benchmark konzentriert sich auf die Textextraktionsgenauigkeit der Produkte.
Eine Vorverarbeitung wird nur für die Handschrift-Kategorie durchgeführt. Wir haben handschriftliche Dokumente mit unseren Smartphones fotografiert und eine mobile Scanner-App verwendet:
- Bilder wurden in Schwarz-Weiß konvertiert
- Der Kontrast wurde erhöht und der Hintergrund entfernt.
OCR: Wir haben alle Produkte auf demselben Datensatz ausgeführt und Textausgaben als Rohtextdateien (.txt) generiert. Anschließend haben wir manuell die Ground Truth einschließlich des korrekten Textes in all diesen Dateien erstellt. Die Ground Truth wurde zweimal von Menschen überprüft.
Vergleich: Wir haben die Genauigkeit der OCR-Lösungen gemessen, indem wir ihre Ausgaben mit den Originaltexten verglichen haben. Zu diesem Zweck verwendeten wir das Sentence-BERT (SBERT)-Framework, um Kosinus-Ähnlichkeitswerte zu berechnen. Im Benchmark haben wir das leistungsstarke mehrsprachige Paraphrasenmodell MiniLM-L12-v2 verwendet, um den Ähnlichkeitswert zwischen der Ausgabe jedes Produkts und den Ground-Truth-Texten zu berechnen. Dieser Wert repräsentiert das Textgenauigkeitsniveau.
Die Ähnlichkeitsfunktion verwendet eine Kosinus-Distanzmetrik, um die Ähnlichkeit zwischen zwei Texten zu berechnen. Wir haben für diesen Benchmark nicht die Levenshtein-Distanz verwendet, da verschiedene Produkte Texte in unterschiedlicher Reihenfolge ausgeben.2
Während die Levenshtein-Distanz diese Unterschiede berücksichtigt, suchen wir nur danach, wie genau der Text erkannt wird, aber nicht, wo er sich befindet. Die Kosinus-Distanz hat für solche Fälle vernachlässigbare Abzüge, daher haben wir uns entschieden, sie in diesem Benchmark zu verwenden.
Produktauswahl
Es gibt viele OCR-Produkte auf dem Markt. Wir müssen uns auf diejenigen konzentrieren, die Rohtextergebnisse ausgeben können. Die Produkte für diesen Benchmark wurden basierend auf folgenden Kriterien ausgewählt:
- Fähigkeit zur Textextraktion. Wir haben Lösungen, die nur maschinenlesbare (d.h. strukturierte Daten) extrahieren, nicht in diesen Vergleich einbezogen
- Ihre Popularität auf dem Markt
Dies ist keine umfassende Marktbewertung, und wir haben möglicherweise einige Produkte mit bedeutenden Fähigkeiten ausgeschlossen. Sollte dies der Fall sein, hinterlassen Sie bitte einen Kommentar, und wir werden den Benchmark gerne erweitern.
Einschränkungen
Erweiterte Fähigkeiten wie Texterkennung der Position, Schlüssel-Wert-Paarung und Dokumentenklassifizierung wurden in diesem Benchmark nicht bewertet.
Die Stichprobengröße wird in der nächsten Iteration erhöht. Wenn Sie OCR für Handschrift suchen, sehen Sie sich unseren Handschrift-OCR-Benchmark mit 50 Proben an.
Sie können auch unseren Rechnungs-OCR-Benchmark und Beleg-OCR-Benchmark einsehen, wenn Sie interessiert sind.
Frühere OCR-Benchmark-Ergebnisse
- Google Cloud Vision und AWS Textract sind die führenden Technologien auf dem Markt für alle Fälle
- Abbyy hat ebenfalls eine hohe Leistung für nicht-handschriftliche Dokumente
- Alle bewerteten OCRs, einschließlich des Open-Source-Tesseract, schnitten bei digitalen Screenshots gut ab.
Das Vision-OCR-Tool von Google Cloud Platform erreicht mit 98,0% die höchste Textgenauigkeit, wenn der gesamte Datensatz getestet wird. Während alle Produkte bei Kategorie 1, wo getippte Texte enthalten sind, über 99,2% liegen, machen die handgeschriebenen Bilder in den Kategorien 2 und 3 den wirklichen Unterschied zwischen den Produkten aus.
Die Gesamtergebnisse zeigen, dass GCP Vision und AWS Textract die dominanten OCR-Produkte sind, mit der höchsten Genauigkeit bei der Erkennung des vorgegebenen Textes.
Anmerkungen zu den Gesamtergebnissen:
- Es gibt einen einzigen Fall, in dem AWS Textract den handschriftlichen Text nicht erkennen konnte. Diese Situation reduziert die Kategorie- und Gesamtleistung von AWS Textract erheblich. Sie erhöht auch die Abweichung innerhalb der Kategorie und insgesamt, da AWS Textract in allen anderen Fällen sehr gut abschneidet.
- Azure ist mit 99,8% Genauigkeit das führende Produkt in Kategorie 1. Allerdings kann das Produkt handschriftliche Texte oft nicht erkennen, wie die Ergebnisse der zweiten Kategorie zeigen. Dies ist der Grund, warum Azure in der dritten Kategorie und insgesamt zurückfällt.
- Tesseract OCR ist ein Open-Source-Produkt, das kostenlos genutzt werden kann. Im Vergleich zu Azure und ABBYY schneidet es bei handschriftlichen Fällen besser ab und kann für die Handschrifterkennung in Betracht gezogen werden, wenn der Nutzer keine AWS- oder GCP-Produkte erhalten kann. Bei gescannten Bildern kann es jedoch schlecht abschneiden.
- Im Gegensatz zu anderen Produkten gibt ABBYY eine strukturiertere .txt-Datei aus. ABBYY berücksichtigt auch die Position des Textes im Bild bei der Erstellung der Ausgabedatei. Obwohl das Produkt über zusätzliche nützliche Fähigkeiten verfügt, konzentrieren wir uns in diesem Benchmark ausschließlich auf die Textgenauigkeit. Und es schnitt bei der Handschrifterkennung schlecht ab.
Entfernen des „Trouble-Maker“-Bildes
Wie in den Gesamtergebnissen erwähnt, gab es ein einzelnes „Ausreißer“-Bild, bei dem AWS Textract keinen Text erkennen konnte. Während das Produkt bei allen anderen Bildern eine Textgenauigkeit von über 95% zeigt, reduzierte dieser Fall die Leistung von AWS und vergrößerte sein Konfidenzintervall.
Da dieser Fall eine Ausnahme sein könnte, wollten wir die Produkte auch ohne ihn vergleichen. Wir nannten dieses Bild den „Troublemaker“ und führten unsere Ergebnisse erneut aus, um zu sehen, ob sie einen Unterschied machten.
Hier sind die neuen Ergebnisse nach dem Ausschluss des „Trouble-Maker“ aus dem Datensatz.
Wenn der „Trouble-Maker“ ausgeschlossen wird, wird AWS Textract zum Spitzenreiter mit einem nahezu perfekten (99,3%) Textgenauigkeitsniveau und einem schmalen Konfidenzintervall. Während sich die Werte nicht wesentlich ändern, bleiben GCP Vision und AWS Textract die beiden führenden Produkte, mit besserer Textgenauigkeit als die anderen.
Ergebnisse ohne Handschrifterkennung
Der Hauptfaktor, der die Textgenauigkeit bestimmter Produkte reduziert, ist das Vorhandensein von Handschrift in Bildern. Daher haben wir alle Bilder ausgeschlossen (alle aus Kategorie 2 und 6 Bilder aus Kategorie 3) und die Textgenauigkeitsleistung erneut bewertet.
Die Ergebnisse sind ausgeglichener, wenn handgeschriebene Bilder ausgeschlossen werden. AWS Textract und GCP Vision bleiben die beiden führenden Produkte im Benchmark, aber ABBYY FineReader schneidet dieses Mal ebenfalls sehr gut ab (99,3%). Obwohl alle Produkte bei Ausschluss von Handschrift eine Genauigkeit von über 95% erreichen, haben Azure Computer Vision und Tesseract OCR immer noch Probleme mit gescannten Dokumenten, was sie in diesem Vergleich zurückfallen lässt.
Benchmark-Produkte
Wir haben fünf OCR-Produkte getestet, um ihre Textgenauigkeitsleistung zu messen. Wir verwendeten die Versionen, die ab Mai 2021 verfügbar waren. Die verwendeten Produkte sind:
- ABBYY FineReader 15
- Amazon Textract
- Google Cloud Platform Vision API
- Microsoft Azure Computer Vision API
- Tesseract OCR Engine
Datensatz
Obwohl es viele Bilddatensätze für OCR gibt, sind diese
- meist auf Zeichenebene und entsprechen nicht den realen Geschäftsanwendungsfällen
- oder konzentrieren sich auf die Textposition statt auf den Text selbst.
Daher haben wir uns entschieden, unseren eigenen Datensatz unter drei Hauptkategorien zu erstellen:
- Kategorie 1 – Webseiten-Screenshots, die Texte enthalten: Diese Kategorie umfasst Screenshots von zufälligen Wikipedia-Seiten und Google-Suchergebnissen mit zufälligen Suchanfragen.
- Kategorie 2 – Handschrift: Diese Kategorie umfasst zufällige Fotos, die verschiedene Handschriftstile enthalten.
- Kategorie 3 – Quittungen, Rechnungen und gescannte Verträge: Diese Kategorie umfasst eine zufällige Sammlung von Quittungen, handschriftlichen Rechnungen und gescannten Versicherungsverträgen, die aus dem Internet gesammelt wurden.
Alle Eingabedateien liegen im .jpg- oder .png-Format vor.
Einschränkungen
- Begrenzter Datensatz: Ursprünglich hatten wir eine vierte Kategorie mit Fotos von Zeitungen, um die Leistung der Produkte bei gedruckten Dokumenten zu bewerten. Diese Fotos enthalten jedoch zu viel Text, was die Erstellung einer Ground Truth erschwert. Daher haben wir uns entschieden, sie nicht zu verwenden.
- Inkonsistenzen in den Ausgabeformaten: Viele Bilder enthalten Text auf der linken und rechten Seite. Die Produkte extrahieren diese Texte in unterschiedlicher Reihenfolge, was zu unterschiedlichen Ausgabedateien führt, obwohl die Texte korrekt erkannt werden. Diese Situation hinderte uns daran, andere Distanzmaße (wie die Levenshtein-Distanz) zu verwenden und schränkte unsere Möglichkeiten zur Berechnung der Textgenauigkeit ein.
- Mögliches Problem mit der Kosinus-Distanz: Die Kosinus-Distanz verwendet Embeddings bei der Berechnung der Ähnlichkeit. Zum Beispiel würde der Vergleich der Sätze „I like tea“ und „I like coffee“ einen höheren Ähnlichkeitswert ergeben als angemessen. Fälle, in denen das Wort „tea“ mit „coffee“ verwechselt wird, wären jedoch selten, daher haben wir diese Möglichkeit in dieser Untersuchung nicht berücksichtigt.
Wir verwenden andere Marktdaten (z.B. Software-Bewertungen, Kundenfallstudien), um Softwareanbieter zu bewerten. Da jedoch die meisten Unternehmen den Begriff „OCR“ bei der Suche nach Datenextraktionslösungen verwenden (d.h. einschließlich solcher, die maschinenlesbare Daten generieren), hat unsere Liste einen größeren Umfang und mehr Unternehmen als die in dieser Benchmarking-Übung vorgestellten.
FAQs
Optical Character Recognition (OCR) ist ein Bereich des maschinellen Lernens, der sich auf die Unterscheidung von Zeichen in Bildern wie gescannten Dokumenten, gedruckten Büchern oder Fotos spezialisiert hat. Obwohl es sich um eine ausgereifte Technologie handelt, gibt es noch keine OCR-Produkte, die alle Arten von Text mit 100% Genauigkeit erkennen können. Unter den von uns bewerteten Produkten konnten nur wenige erfolgreiche Ergebnisse aus unserem Testsatz ausgeben.
OCR-Tools werden von Unternehmen verwendet, um Texte und ihre Positionen in Bildern zu identifizieren, Geschäftsdokumente nach Themen zu klassifizieren oder Schlüssel-Wert-Paarungen innerhalb von Dokumenten durchzuführen. Basierend auf OCR-Ergebnissen entwickeln andere Technologieunternehmen Anwendungen wie Dokumentenautomatisierung. Für all diese Geschäftsfälle ist eine genaue Texterkennung entscheidend für ein OCR-Produkt.
Zitieren Sie diesen Benchmark
Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Alper, Şevval},
title = {{OCR-Benchmark: Textextraktions- / Erfassungsgenauigkeit}},
year = {2026},
month = jun,
howpublished = {\url{https://aimultiple.com/ocr-accuracy}},
note = {AIMultiple. Abgerufen am 29. Juni 2026}
}



Kommentare 8
Teilen Sie Ihre Gedanken
Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.
Did you ever think of oncluding multimodal llms in your comparison, like gpt4o, llama 3.2. gemini, claude etc.?
Hi Serhat and thank you for your comment, Yes, we added those for which we have API access like Claude and GPT-4o.
Just stumbled on this milestone assessment update. Could you kindly elaborate further on the three revised datasets: Thanks for this work. Character Sets When someone refers to 'handriting', that can mean many things: 'handwriting style' typefaces (per Docusign, etc.), and hand-printed (block printing and mixed-case printing) as often found in combs and box delineators, and finally, cursive or longhand writing (exclusive of signatures). Character Context Structured content, semi-structured content, and unstructured content. Image Qualities (bitonal, greyscale, full colour, spatial dpi, from a scanner/cell-phone/native rendering, image 'enhancements' prior to OCR (thickening, local gamma, background dropout, sharpening, smoothing, noise removal, etc.) These can have significant impacts, and some don't realize the importance of including these benchmark differentiators.
Hi there, thank you for the detailed comment, we are updating the article to include these details.
Hello, great work! Just curious, did you use a trained Tesseract when making these testing?
Hi, Webster. Glad you enjoyed the article. The tools we tested were: ABBYY FineReader 15 Amazon Textract Google Cloud Platform Vision API Microsoft Azure Computer Vision API Tesseract OCR Engine Hope this answers your question.
The graph images are not working for me at the moment. Otherwise great
Thank you Bobby! We have a glitch in the CMS and we are fixing it. Apologies for the issue, it should be fixed next week.
Thanks for sharing, can you add a free OCR for everyone to use? https://www.geekersoft.com/ocr-online.html
Hi Samsun, unfortunately, we don't share all OCR providers on this page, there are thousands of them. We tried to put together the largest ones in terms of market presence. If you have evidence that your solution is one of the top 10 globally, please share it with us at info@aimultiple.com so we can consider it.
What version of Tesseract did you test with? They recently released v5.
Hi Scott, we did the benchmarking before Tesseract 5. We will redo it soon and include the versions in the methodology section as well.
This is very informative, nice work. I assume your tests used documents/images in English? I've been experimenting with OCR tools on other languages and finding relatively poor accuracy.
Exactly, all text were in English. I hear similar things about OCR on non-Latin characters. We have an Arabic speaker in the team who claims that accuracy in Arabic is much lower compared to English. We can do a benchmark on non-Latin characters if there is demand for it.
interesting post!!! do you have any suggestion about improving accuracy on scanned image ? i'm using tesseract right now. anyway , great work!
Thank you for the comment. There are pre-processing approaches that can be implemented to improve image quality. But such approaches may already be used in Tesseract. A detailed research into Tesseract image processing would be helpful in your case.