Dienstleistungen
Kontaktieren

OCR-Benchmark: Textextraktions- / Erfassungsgenauigkeit

Cem Dilmegani
Cem Dilmegani
aktualisiert am 29. Juni 2026

Die Genauigkeit von OCR ist für viele Dokumentenverarbeitungsaufgaben entscheidend, und multimodale SOTA-LLMs bieten nun eine Alternative zur OCR. Wir haben führende OCR-Dienste im DeltOCR Bench bewertet, um ihre Genauigkeitsniveaus bei verschiedenen Dokumenttypen zu ermitteln:

  • Handschrift: GPT-5 (%95) sticht als stärkster Performer hervor, dicht gefolgt von olmOCR-2-7B (%94) und Gemini 2.5 Pro (%93).
  • Gedruckte Medien: Gemini 2.5 Pro, Google Vision und Claude Sonnet 4.5 führen diese Kategorie mit der höchsten Punktzahl an (%85)
  • Gedruckter Text: Microsoft Azure Document Intelligence API führt mit einer Punktzahl von %96.

OCR-Benchmark: DeltOCR Bench

Loading Chart

Die vollständigen Namen der oben genannten Produkte und ihre Versionen mit Stand November 2025 sind unten aufgeführt. Unsere Studie umfasst sowohl leicht zugängliche API-Dienste als auch Lösungen, die eine On-Premises-Infrastruktur erfordern, und vergleicht wichtige Modelle auf dem Markt in einer tiefgehenden Testumgebung.

  • Handschrift:
    • Genauigkeitsbereich: Eine große Spanne von %46 bis %95.
    • Highlights: GPT-5 (%95), olmOCR-2-7B (%94) und Gemini 2.5 Pro (%93) zeigen die höchste Leistung. Diese hohen Werte demonstrieren das außergewöhnliche Genauigkeitspotenzial multimodaler LLMs wie GPT-5 und Gemini 2.5 Pro in diesem Bereich.
    • Empfehlung: Für die Erkennung hochkomplexer Handschriften werden die führenden LLM-Lösungen wie GPT-5 oder Gemini 2.5 Pro aufgrund ihrer API-Zugänglichkeit und einfachen Integration empfohlen.
  • Gedruckte Medien:
    • Genauigkeitsbereich: Eine Spanne von %54 bis %85.
    • Highlights: Lösungen wie Gemini 2.5 Pro, Google Vision und Claude Sonnet 4.5 teilen sich die höchste Punktzahl (%85). Diese Kategorie ist hart umkämpft zwischen LLMs und traditionellen cloudbasierten OCR-Diensten (Azure, Dots OCR, Amazon Textract). GPT-5 hinkt anderen führenden LLMs in dieser Kategorie hinterher (%77).
    • Empfehlung: Für Dokumente mit komplexen visuellen Layouts (mehrere Schriftarten, niedrige Auflösung usw.) werden LLMs wie Gemini 2.5 Pro oder cloudbasierte Dienste wie Google Vision oder Microsoft Azure Document Intelligence API empfohlen.
  • Gedruckter Text:
    • Genauigkeitsbereich: Ein hoher Bereich von %55 bis %96, wobei die meisten führenden Lösungen Werte von %94 und darüber erreichten.
    • Highlights: Microsoft Azure Document Intelligence API (%96) liegt an der Spitze, dicht gefolgt von Lösungen wie GPT-5, Gemini 2.5 Pro, Gemini 3 Pro Preview, Google Vision und Amazon Textract, die alle %95 erreichen. In dieser Kategorie erreichen alle SOTA-Lösungen ein extrem hohes Genauigkeitsniveau.
    • Empfehlung: Für einfache gedruckte Texte, die eine hohe Genauigkeit erfordern, können etablierte Cloud-Lösungen wie Microsoft Azure Document Intelligence API oder Google Vision oder leistungsstarke LLMs (Gemini/GPT-5) bedenkenlos eingesetzt werden.

API-Lösungen

Die folgenden Modelle wurden aufgrund ihrer einfachen Zugänglichkeit und Leistung in unsere Benchmarking-Liste aufgenommen.

  • Claude Sonnet 4.5
  • OpenAI GPT-5
  • Gemini 2.5 Pro
  • Gemini 3 Pro Preview
  • Amazon Textract API
  • Google Cloud Vision API
  • Microsoft Azure Document Intelligence API
  • Moondream OCR
  • Mistral OCR 3
  • Mistral OCR 2

Microsoft Azure Document Intelligence API ist Teil der Azure Cognitive Services-Familie.

Lokal (On-Premise) bereitgestellte Modelle

Das Testen dieser Modelle ist aufgrund von Installation, Abhängigkeitsverwaltung und Hardwareanforderungen anspruchsvoller als bei API-Lösungen. Alle lokalen Tests wurden in einer dedizierten Serverumgebung durchgeführt.

  • olmOCR-2-7B
  • PaddleOCR-VL
  • Nanonets-OCR2-3B
  • Deepseek-OCR
  • Dots-OCR

Wir haben die Genauigkeit der Ergebnisse als Kosinus-Ähnlichkeitswert für gedruckten Text, gedruckte Medien und Handschrift berechnet. Jeder im Diagramm sichtbare Wert repräsentiert die Leistung des entsprechenden Modells in dieser Kategorie.

Während unserer Tests beobachteten wir, dass das Nanonets-OCR2-3B-Modell die schwächste Leistung im Benchmark lieferte und die niedrigsten Werte erzielte. Generell stellten wir fest, dass einige Modelle besonders mit Schreibschrift und unübersichtlichen Textlayouts (gemischte Zeilenanordnung, inkonsistente Großschreibung) zu kämpfen hatten. Ähnliche Leistungsprobleme traten auch in der Kategorie der gedruckten Medien auf, insbesondere bei Bildern mit niedriger Auflösung und solchen mit mehreren Schriftarten.

Datensatz

Wir verwendeten insgesamt 300 Dokumente in diesem Benchmark, mit 100 Dokumenten pro Kategorie über 3 Kategorien hinweg:

Gedruckter Text umfasst Briefe, Website-Screenshots, E-Mails, Berichte usw.

Gedruckte Medien umfasst Poster, Buchcover, Werbung usw. Wir wollten den Erfolg der OCR-Tools bei verschiedenen Textschriftarten und -platzierungen ermitteln.

Files in diesen 2 Kategorien stammen aus der Industry Documents Library (IDL).1

Handschrift: In der Kategorie Handschrift waren einige IDL-Dokumente nicht leicht lesbar, daher hat unser Team Dokumente ähnlich den IDL-Dokumenten erstellt. Wir haben manuell Proben von menschenlesbarer Handschrift vorbereitet. Alle Proben waren im Schreibschrift-Stil.

Abbildung 1: Proben aus unserem Datensatz.

Methodik des DeltOCR Bench

Dieser Benchmark konzentriert sich auf die Textextraktionsgenauigkeit der Produkte.

Eine Vorverarbeitung wird nur für die Handschrift-Kategorie durchgeführt. Wir haben handschriftliche Dokumente mit unseren Smartphones fotografiert und eine mobile Scanner-App verwendet:

  • Bilder wurden in Schwarz-Weiß konvertiert
  • Der Kontrast wurde erhöht und der Hintergrund entfernt.

OCR: Wir haben alle Produkte auf demselben Datensatz ausgeführt und Textausgaben als Rohtextdateien (.txt) generiert. Anschließend haben wir manuell die Ground Truth einschließlich des korrekten Textes in all diesen Dateien erstellt. Die Ground Truth wurde zweimal von Menschen überprüft.

Vergleich: Wir haben die Genauigkeit der OCR-Lösungen gemessen, indem wir ihre Ausgaben mit den Originaltexten verglichen haben. Zu diesem Zweck verwendeten wir das Sentence-BERT (SBERT)-Framework, um Kosinus-Ähnlichkeitswerte zu berechnen. Im Benchmark haben wir das leistungsstarke mehrsprachige Paraphrasenmodell MiniLM-L12-v2 verwendet, um den Ähnlichkeitswert zwischen der Ausgabe jedes Produkts und den Ground-Truth-Texten zu berechnen. Dieser Wert repräsentiert das Textgenauigkeitsniveau.

Die Ähnlichkeitsfunktion verwendet eine Kosinus-Distanzmetrik, um die Ähnlichkeit zwischen zwei Texten zu berechnen. Wir haben für diesen Benchmark nicht die Levenshtein-Distanz verwendet, da verschiedene Produkte Texte in unterschiedlicher Reihenfolge ausgeben.2

Während die Levenshtein-Distanz diese Unterschiede berücksichtigt, suchen wir nur danach, wie genau der Text erkannt wird, aber nicht, wo er sich befindet. Die Kosinus-Distanz hat für solche Fälle vernachlässigbare Abzüge, daher haben wir uns entschieden, sie in diesem Benchmark zu verwenden.

Produktauswahl

Es gibt viele OCR-Produkte auf dem Markt. Wir müssen uns auf diejenigen konzentrieren, die Rohtextergebnisse ausgeben können. Die Produkte für diesen Benchmark wurden basierend auf folgenden Kriterien ausgewählt:

  • Fähigkeit zur Textextraktion. Wir haben Lösungen, die nur maschinenlesbare (d.h. strukturierte Daten) extrahieren, nicht in diesen Vergleich einbezogen
  • Ihre Popularität auf dem Markt

Dies ist keine umfassende Marktbewertung, und wir haben möglicherweise einige Produkte mit bedeutenden Fähigkeiten ausgeschlossen. Sollte dies der Fall sein, hinterlassen Sie bitte einen Kommentar, und wir werden den Benchmark gerne erweitern.

Einschränkungen

Erweiterte Fähigkeiten wie Texterkennung der Position, Schlüssel-Wert-Paarung und Dokumentenklassifizierung wurden in diesem Benchmark nicht bewertet.

Die Stichprobengröße wird in der nächsten Iteration erhöht. Wenn Sie OCR für Handschrift suchen, sehen Sie sich unseren Handschrift-OCR-Benchmark mit 50 Proben an.

Sie können auch unseren Rechnungs-OCR-Benchmark und Beleg-OCR-Benchmark einsehen, wenn Sie interessiert sind.

Frühere OCR-Benchmark-Ergebnisse

Gesamtergebnisse der OCR-Textgenauigkeit mit 90%-Konfidenzintervallen
  • Google Cloud Vision und AWS Textract sind die führenden Technologien auf dem Markt für alle Fälle
  • Abbyy hat ebenfalls eine hohe Leistung für nicht-handschriftliche Dokumente
  • Alle bewerteten OCRs, einschließlich des Open-Source-Tesseract, schnitten bei digitalen Screenshots gut ab.

Das Vision-OCR-Tool von Google Cloud Platform erreicht mit 98,0% die höchste Textgenauigkeit, wenn der gesamte Datensatz getestet wird. Während alle Produkte bei Kategorie 1, wo getippte Texte enthalten sind, über 99,2% liegen, machen die handgeschriebenen Bilder in den Kategorien 2 und 3 den wirklichen Unterschied zwischen den Produkten aus.

Die Gesamtergebnisse zeigen, dass GCP Vision und AWS Textract die dominanten OCR-Produkte sind, mit der höchsten Genauigkeit bei der Erkennung des vorgegebenen Textes.

Anmerkungen zu den Gesamtergebnissen:

  • Es gibt einen einzigen Fall, in dem AWS Textract den handschriftlichen Text nicht erkennen konnte. Diese Situation reduziert die Kategorie- und Gesamtleistung von AWS Textract erheblich. Sie erhöht auch die Abweichung innerhalb der Kategorie und insgesamt, da AWS Textract in allen anderen Fällen sehr gut abschneidet.  
  • Azure ist mit 99,8% Genauigkeit das führende Produkt in Kategorie 1. Allerdings kann das Produkt handschriftliche Texte oft nicht erkennen, wie die Ergebnisse der zweiten Kategorie zeigen. Dies ist der Grund, warum Azure in der dritten Kategorie und insgesamt zurückfällt.
  • Tesseract OCR ist ein Open-Source-Produkt, das kostenlos genutzt werden kann. Im Vergleich zu Azure und ABBYY schneidet es bei handschriftlichen Fällen besser ab und kann für die Handschrifterkennung in Betracht gezogen werden, wenn der Nutzer keine AWS- oder GCP-Produkte erhalten kann. Bei gescannten Bildern kann es jedoch schlecht abschneiden.
  • Im Gegensatz zu anderen Produkten gibt ABBYY eine strukturiertere .txt-Datei aus. ABBYY berücksichtigt auch die Position des Textes im Bild bei der Erstellung der Ausgabedatei. Obwohl das Produkt über zusätzliche nützliche Fähigkeiten verfügt, konzentrieren wir uns in diesem Benchmark ausschließlich auf die Textgenauigkeit. Und es schnitt bei der Handschrifterkennung schlecht ab.

Entfernen des „Trouble-Maker“-Bildes

Wie in den Gesamtergebnissen erwähnt, gab es ein einzelnes „Ausreißer“-Bild, bei dem AWS Textract keinen Text erkennen konnte. Während das Produkt bei allen anderen Bildern eine Textgenauigkeit von über 95% zeigt, reduzierte dieser Fall die Leistung von AWS und vergrößerte sein Konfidenzintervall.

Da dieser Fall eine Ausnahme sein könnte, wollten wir die Produkte auch ohne ihn vergleichen. Wir nannten dieses Bild den „Troublemaker“ und führten unsere Ergebnisse erneut aus, um zu sehen, ob sie einen Unterschied machten.
Hier sind die neuen Ergebnisse nach dem Ausschluss des „Trouble-Maker“ aus dem Datensatz.

OCR-Textgenauigkeitsergebnisse, wenn der „Trouble-Maker“ ausgeschlossen wird. 90%-Konfidenzintervall wird angezeigt

Wenn der „Trouble-Maker“ ausgeschlossen wird, wird AWS Textract zum Spitzenreiter mit einem nahezu perfekten (99,3%) Textgenauigkeitsniveau und einem schmalen Konfidenzintervall. Während sich die Werte nicht wesentlich ändern, bleiben GCP Vision und AWS Textract die beiden führenden Produkte, mit besserer Textgenauigkeit als die anderen.

Ergebnisse ohne Handschrifterkennung

Der Hauptfaktor, der die Textgenauigkeit bestimmter Produkte reduziert, ist das Vorhandensein von Handschrift in Bildern. Daher haben wir alle Bilder ausgeschlossen (alle aus Kategorie 2 und 6 Bilder aus Kategorie 3) und die Textgenauigkeitsleistung erneut bewertet.

OCR-Textgenauigkeit ohne Handschrifterkennungsfälle

Die Ergebnisse sind ausgeglichener, wenn handgeschriebene Bilder ausgeschlossen werden. AWS Textract und GCP Vision bleiben die beiden führenden Produkte im Benchmark, aber ABBYY FineReader schneidet dieses Mal ebenfalls sehr gut ab (99,3%). Obwohl alle Produkte bei Ausschluss von Handschrift eine Genauigkeit von über 95% erreichen, haben Azure Computer Vision und Tesseract OCR immer noch Probleme mit gescannten Dokumenten, was sie in diesem Vergleich zurückfallen lässt.

Benchmark-Produkte

Wir haben fünf OCR-Produkte getestet, um ihre Textgenauigkeitsleistung zu messen. Wir verwendeten die Versionen, die ab Mai 2021 verfügbar waren. Die verwendeten Produkte sind:

  • ABBYY FineReader 15
  • Amazon Textract
  • Google Cloud Platform Vision API
  • Microsoft Azure Computer Vision API
  • Tesseract OCR Engine

Datensatz

Obwohl es viele Bilddatensätze für OCR gibt, sind diese

  • meist auf Zeichenebene und entsprechen nicht den realen Geschäftsanwendungsfällen
  • oder konzentrieren sich auf die Textposition statt auf den Text selbst.

Daher haben wir uns entschieden, unseren eigenen Datensatz unter drei Hauptkategorien zu erstellen:

  1. Kategorie 1 – Webseiten-Screenshots, die Texte enthalten: Diese Kategorie umfasst Screenshots von zufälligen Wikipedia-Seiten und Google-Suchergebnissen mit zufälligen Suchanfragen.
  2. Kategorie 2 – Handschrift: Diese Kategorie umfasst zufällige Fotos, die verschiedene Handschriftstile enthalten.
  3. Kategorie 3 – Quittungen, Rechnungen und gescannte Verträge: Diese Kategorie umfasst eine zufällige Sammlung von Quittungen, handschriftlichen Rechnungen und gescannten Versicherungsverträgen, die aus dem Internet gesammelt wurden.

Alle Eingabedateien liegen im .jpg- oder .png-Format vor.

Einschränkungen

  • Begrenzter Datensatz: Ursprünglich hatten wir eine vierte Kategorie mit Fotos von Zeitungen, um die Leistung der Produkte bei gedruckten Dokumenten zu bewerten. Diese Fotos enthalten jedoch zu viel Text, was die Erstellung einer Ground Truth erschwert. Daher haben wir uns entschieden, sie nicht zu verwenden.
  • Inkonsistenzen in den Ausgabeformaten: Viele Bilder enthalten Text auf der linken und rechten Seite. Die Produkte extrahieren diese Texte in unterschiedlicher Reihenfolge, was zu unterschiedlichen Ausgabedateien führt, obwohl die Texte korrekt erkannt werden. Diese Situation hinderte uns daran, andere Distanzmaße (wie die Levenshtein-Distanz) zu verwenden und schränkte unsere Möglichkeiten zur Berechnung der Textgenauigkeit ein.
  • Mögliches Problem mit der Kosinus-Distanz: Die Kosinus-Distanz verwendet Embeddings bei der Berechnung der Ähnlichkeit. Zum Beispiel würde der Vergleich der Sätze „I like tea“ und „I like coffee“ einen höheren Ähnlichkeitswert ergeben als angemessen. Fälle, in denen das Wort „tea“ mit „coffee“ verwechselt wird, wären jedoch selten, daher haben wir diese Möglichkeit in dieser Untersuchung nicht berücksichtigt.

Wir verwenden andere Marktdaten (z.B. Software-Bewertungen, Kundenfallstudien), um Softwareanbieter zu bewerten. Da jedoch die meisten Unternehmen den Begriff „OCR“ bei der Suche nach Datenextraktionslösungen verwenden (d.h. einschließlich solcher, die maschinenlesbare Daten generieren), hat unsere Liste einen größeren Umfang und mehr Unternehmen als die in dieser Benchmarking-Übung vorgestellten.

Lassen Sie unser Team einen Ihrer Geschäftsprozesse kostenlos mit KI-Agenten automatisieren.
Einen Prozess automatisieren

FAQs

Optical Character Recognition (OCR) ist ein Bereich des maschinellen Lernens, der sich auf die Unterscheidung von Zeichen in Bildern wie gescannten Dokumenten, gedruckten Büchern oder Fotos spezialisiert hat. Obwohl es sich um eine ausgereifte Technologie handelt, gibt es noch keine OCR-Produkte, die alle Arten von Text mit 100% Genauigkeit erkennen können. Unter den von uns bewerteten Produkten konnten nur wenige erfolgreiche Ergebnisse aus unserem Testsatz ausgeben.
OCR-Tools werden von Unternehmen verwendet, um Texte und ihre Positionen in Bildern zu identifizieren, Geschäftsdokumente nach Themen zu klassifizieren oder Schlüssel-Wert-Paarungen innerhalb von Dokumenten durchzuführen. Basierend auf OCR-Ergebnissen entwickeln andere Technologieunternehmen Anwendungen wie Dokumentenautomatisierung. Für all diese Geschäftsfälle ist eine genaue Texterkennung entscheidend für ein OCR-Produkt.

Zitieren Sie diesen Benchmark

Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.

Cem Dilmegani and Şevval Alper (2026) - "OCR-Benchmark: Textextraktions- / Erfassungsgenauigkeit". Online veröffentlicht auf AIMultiple.com. Abgerufen am 29. Juni 2026, von: https://aimultiple.com/ocr-accuracy [Online-Ressource]

Dilmegani, C., & Alper, Ş. (2026, 29. Juni). OCR-Benchmark: Textextraktions- / Erfassungsgenauigkeit. AIMultiple. https://aimultiple.com/ocr-accuracy

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Alper, Şevval},
  title  = {{OCR-Benchmark: Textextraktions- / Erfassungsgenauigkeit}},
  year   = {2026},
  month  = jun,
  howpublished    = {\url{https://aimultiple.com/ocr-accuracy}},
  note   = {AIMultiple. Abgerufen am 29. Juni 2026}
}
Cem Dilmegani
Cem Dilmegani
Leitender Analyst
Cem ist seit 2017 leitender Analyst bei AIMultiple. AIMultiple informiert monatlich Hunderttausende von Unternehmen (laut similarWeb), darunter 55 % der Fortune 500. Cems Arbeit wurde von führenden globalen Publikationen wie Business Insider, Forbes und der Washington Post, von globalen Unternehmen wie Deloitte und HPE sowie von NGOs wie dem Weltwirtschaftsforum und supranationalen Organisationen wie der Europäischen Kommission zitiert. Weitere namhafte Unternehmen und Ressourcen, die AIMultiple referenziert haben, finden Sie hier. Im Laufe seiner Karriere war Cem als Technologieberater, Technologieeinkäufer und Technologieunternehmer tätig. Über ein Jahrzehnt lang beriet er Unternehmen bei McKinsey & Company und Altman Solon in ihren Technologieentscheidungen. Er veröffentlichte außerdem einen McKinsey-Bericht zur Digitalisierung. Bei einem Telekommunikationsunternehmen leitete er die Technologiestrategie und -beschaffung und berichtete direkt an den CEO. Darüber hinaus verantwortete er das kommerzielle Wachstum des Deep-Tech-Unternehmens Hypatos, das innerhalb von zwei Jahren von null auf einen siebenstelligen jährlichen wiederkehrenden Umsatz und eine neunstellige Unternehmensbewertung kam. Cems Arbeit bei Hypatos wurde von führenden Technologiepublikationen wie TechCrunch und Business Insider gewürdigt. Er ist ein gefragter Redner auf internationalen Technologiekonferenzen. Cem absolvierte sein Studium der Informatik an der Bogazici-Universität und besitzt einen MBA der Columbia Business School.
Vollständiges Profil anzeigen
Recherchiert von
Şevval Alper
Şevval Alper
KI-Forscher
Şevval ist Branchenanalystin bei AIMultiple und spezialisiert auf KI-Codierungswerkzeuge, KI-Agenten und Quantentechnologien.
Vollständiges Profil anzeigen

Kommentare 8

Teilen Sie Ihre Gedanken

Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.

0/450
Serhat Cinar
Serhat Cinar
Feb 28, 2025 at 09:34

Did you ever think of oncluding multimodal llms in your comparison, like gpt4o, llama 3.2. gemini, claude etc.?

Cem Dilmegani
Cem Dilmegani
Mar 17, 2025 at 02:59

Hi Serhat and thank you for your comment, Yes, we added those for which we have API access like Claude and GPT-4o.

DLJ
DLJ
Oct 17, 2024 at 11:14

Just stumbled on this milestone assessment update. Could you kindly elaborate further on the three revised datasets: Thanks for this work. Character Sets When someone refers to 'handriting', that can mean many things: 'handwriting style' typefaces (per Docusign, etc.), and hand-printed (block printing and mixed-case printing) as often found in combs and box delineators, and finally, cursive or longhand writing (exclusive of signatures). Character Context Structured content, semi-structured content, and unstructured content. Image Qualities (bitonal, greyscale, full colour, spatial dpi, from a scanner/cell-phone/native rendering, image 'enhancements' prior to OCR (thickening, local gamma, background dropout, sharpening, smoothing, noise removal, etc.) These can have significant impacts, and some don't realize the importance of including these benchmark differentiators.

Cem Dilmegani
Cem Dilmegani
Oct 22, 2024 at 03:15

Hi there, thank you for the detailed comment, we are updating the article to include these details.

Webster
Webster
Feb 05, 2023 at 07:24

Hello, great work! Just curious, did you use a trained Tesseract when making these testing?

Bardia Eshghi
Bardia Eshghi
Feb 06, 2023 at 12:29

Hi, Webster. Glad you enjoyed the article. The tools we tested were: ABBYY FineReader 15 Amazon Textract Google Cloud Platform Vision API Microsoft Azure Computer Vision API Tesseract OCR Engine Hope this answers your question.

Bobby
Bobby
Aug 14, 2022 at 23:54

The graph images are not working for me at the moment. Otherwise great

Cem Dilmegani
Cem Dilmegani
Aug 15, 2022 at 14:48

Thank you Bobby! We have a glitch in the CMS and we are fixing it. Apologies for the issue, it should be fixed next week.

samsun
samsun
Jun 07, 2022 at 14:10

Thanks for sharing, can you add a free OCR for everyone to use? https://www.geekersoft.com/ocr-online.html

Cem Dilmegani
Cem Dilmegani
Aug 17, 2022 at 07:46

Hi Samsun, unfortunately, we don't share all OCR providers on this page, there are thousands of them. We tried to put together the largest ones in terms of market presence. If you have evidence that your solution is one of the top 10 globally, please share it with us at info@aimultiple.com so we can consider it.

Scott
Scott
Jan 20, 2022 at 20:42

What version of Tesseract did you test with? They recently released v5.

Cem Dilmegani
Cem Dilmegani
Aug 23, 2022 at 12:01

Hi Scott, we did the benchmarking before Tesseract 5. We will redo it soon and include the versions in the methodology section as well.

Bob
Bob
Jan 12, 2022 at 15:09

This is very informative, nice work. I assume your tests used documents/images in English? I've been experimenting with OCR tools on other languages and finding relatively poor accuracy.

Cem Dilmegani
Cem Dilmegani
Jan 15, 2022 at 13:52

Exactly, all text were in English. I hear similar things about OCR on non-Latin characters. We have an Arabic speaker in the team who claims that accuracy in Arabic is much lower compared to English. We can do a benchmark on non-Latin characters if there is demand for it.

kin
kin
Jun 21, 2021 at 02:22

interesting post!!! do you have any suggestion about improving accuracy on scanned image ? i'm using tesseract right now. anyway , great work!

Cem Dilmegani
Cem Dilmegani
Jun 22, 2021 at 07:50

Thank you for the comment. There are pre-processing approaches that can be implemented to improve image quality. But such approaches may already be used in Tesseract. A detailed research into Tesseract image processing would be helpful in your case.