Hizmetler
Bize Ulaşın

OCR Karşılaştırması: Metin Çıkarma / Yakalama Doğruluğu

Cem Dilmegani
Cem Dilmegani
Güncellenme tarihi: 29 Haz 2026

OCR doğruluğu birçok belge işleme görevi için kritiktir ve SOTA çok modlu LLM'ler artık OCR'a bir alternatif sunuyor. Farklı belge türlerindeki doğruluk seviyelerini belirlemek için DeltOCR Bench'te önde gelen OCR hizmetlerini karşılaştırdık:

  • El Yazısı: GPT-5 (%95) en güçlü performansı sergilerken, onu yakından olmOCR-2-7B (%94) ve Gemini 2.5 Pro (%93) takip ediyor.
  • Basılı medya: Gemini 2.5 Pro, Google Vision ve Claude Sonnet 4.5 en yüksek puanla (%85) bu kategoride liderdir.
  • Basılı metin: Microsoft Azure Document Intelligence API %96'lık bir puanla liderdir.

OCR Karşılaştırması: DeltOCR Bench

Loading Chart

Yukarıdaki ürünlerin tam adları ve Kasım 2025 itibarıyla kullanılan sürümleri aşağıda listelenmiştir. Çalışmamız, hem kolay erişilebilir API hizmetlerini hem de şirket içi altyapı gerektiren çözümleri kapsamakta ve derin bir test ortamında pazardaki kilit modelleri karşılaştırmaktadır.

  • El Yazısı:
    • Doğruluk Aralığı: %46 ile %95 arasında geniş bir aralık.
    • Öne Çıkanlar: GPT-5 (%95), olmOCR-2-7B (%94) ve Gemini 2.5 Pro (%93) en yüksek performansı sergiliyor. Bu yüksek puanlar, GPT-5 ve Gemini 2.5 Pro gibi çok modlu LLM'lerin bu alandaki olağanüstü doğruluk potansiyelini göstermektedir.
    • Tavsiye: Son derece karmaşık el yazısını tanımak için, API erişilebilirliği ve entegrasyon kolaylığı nedeniyle GPT-5 veya Gemini 2.5 Pro gibi en iyi LLM çözümleri önerilir.
  • Basılı medya:
    • Doğruluk Aralığı: %54 ile %85 arasında bir aralık.
    • Öne Çıkanlar: Gemini 2.5 Pro, Google Vision ve Claude Sonnet 4.5 gibi çözümler en yüksek puanı (%85) paylaşıyor. Bu kategori, LLM'ler ve geleneksel bulut tabanlı OCR hizmetleri (Azure, Dots OCR, Amazon Textract) arasında oldukça rekabetçidir. Bu kategoride GPT-5 diğer lider LLM'lerin gerisinde kalıyor (%77).
    • Tavsiye: Karmaşık görsel düzenlere sahip belgeler için (birden çok yazı tipi, düşük çözünürlük vb.), Gemini 2.5 Pro gibi LLM'ler veya Google Vision veya Microsoft Azure Document Intelligence API gibi bulut tabanlı hizmetler önerilir.
  • Basılı metin:
    • Doğruluk Aralığı: %55 ile %96 arasında yüksek bir aralık, ancak önde gelen çözümlerin çoğu %94 ve üzeri puanlar elde etti.
    • Öne Çıkanlar: Microsoft Azure Document Intelligence API (%96) liderliği alırken, onu %95 puan alan GPT-5, Gemini 2.5 Pro, Gemini 3 Pro Preview, Google Vision ve Amazon Textract gibi çözümler yakından takip ediyor. Bu kategori, tüm SOTA çözümlerinin son derece yüksek doğruluk seviyelerine ulaştığı bir alandır.
    • Tavsiye: Yüksek doğruluk gerektiren basit basılı metinler için, Microsoft Azure Document Intelligence API veya Google Vision gibi köklü bulut çözümleri ya da yüksek puanlı LLM'ler (Gemini/GPT-5) güvenle kullanılabilir.

API Çözümleri

Aşağıdaki modeller, hem erişim kolaylığı hem de performansları nedeniyle karşılaştırma listemize dahil edilmiştir.

  • Claude Sonnet 4.5
  • OpenAI GPT-5
  • Gemini 2.5 Pro
  • Gemini 3 Pro Preview
  • Amazon Textract API
  • Google Cloud Vision API
  • Microsoft Azure Document Intelligence API
  • Moondream OCR
  • Mistral OCR 3
  • Mistral OCR 2

Microsoft Azure Document Intelligence API, Azure Cognitive Services ailesinin bir parçasıdır.

Yerel (Şirket İçi) Dağıtılan Modeller

Bu modelleri test etmek, kurulum, bağımlılık yönetimi ve donanım gereksinimleri nedeniyle API çözümlerine göre daha zordur. Tüm yerel testler özel bir sunucu ortamında gerçekleştirilmiştir.

  • olmOCR-2-7B
  • PaddleOCR-VL
  • Nanonets-OCR2-3B
  • Deepseek-OCR
  • Dots-OCR

Sonuçların doğruluğunu, basılı metin, basılı medya ve el yazısı için kosinüs benzerliği puanı olarak hesapladık. Grafikte görünen her puan, ilgili modelin o kategori içindeki performansını temsil eder.

Testlerimiz sırasında, Nanonets-OCR2-3B modelinin karşılaştırmada en zayıf performansı göstererek en düşük puanları aldığını gözlemledik. Genel olarak, bazı modellerin özellikle bitişik el yazısı ve düzensiz metin düzenleriyle (karışık satır sıralaması, tutarsız büyük/küçük harf kullanımı) zorlandığını gördük. Benzer performans sorunları, özellikle düşük çözünürlüklü ve birden fazla yazı tipi stili içeren görsellerde basılı medya kategorisinde de ortaya çıktı.

Veri Seti

Bu karşılaştırmada, 3 kategoride kategori başına 100 belge olmak üzere toplam 300 belge kullandık:

Basılı metin mektupları, web sitesi ekran görüntülerini, e-postaları, raporları vb. içerir.

Basılı medya posterleri, kitap kapaklarını, reklamları vb. içerir. OCR araçlarının farklı metin yazı tipleri ve yerleşimlerindeki başarısını görmeyi amaçladık.

Bu 2 kategorideki Dosyalar, Industry Documents Library (IDL)'den alınmıştır.1

El yazısı: El yazısı kategorisinde, bazı IDL belgelerinin okunması kolay olmadığından, ekibimiz IDL belgelerine benzer belgeler oluşturdu. İnsan tarafından okunabilir el yazısı örneklerini manuel olarak hazırladık. Tüm örnekler bitişik el yazısı stilindeydi.

Şekil 1: Veri setimizden örnekler.

DeltOCR Bench'in Metodolojisi

Bu karşılaştırma, ürünlerin metin çıkarma doğruluğuna odaklanmaktadır.

Ön işleme yalnızca el yazısı kategorisi için yapılır. El yazısı belgelerin fotoğraflarını akıllı telefonlarımızla çektik ve bir mobil tarayıcı uygulaması kullandık:

  • Fotoğraflar siyah beyaza dönüştürüldü
  • Kontrast artırıldı ve arka plan kaldırıldı.

OCR: Tüm ürünleri aynı veri seti üzerinde çalıştırdık ve metin çıktılarını ham metin (.txt) dosyaları olarak oluşturduk. Daha sonra, tüm bu dosyalardaki doğru metni içeren referans gerçekliği manuel olarak hazırladık. Referans gerçeklik insanlar tarafından iki kez doğrulandı.

Karşılaştırma: OCR çözümlerinin doğruluğunu, çıktılarını orijinal metinlerle karşılaştırarak ölçtük. Bu amaçla, kosinüs benzerlik puanlarını hesaplamak için Sentence-BERT (SBERT) çerçevesini kullandık. Karşılaştırmada, her ürünün çıktısı ile referans gerçeklik metinleri arasındaki benzerlik puanını hesaplamak için yüksek performanslı çok dilli açıklama modeli MiniLM-L12-v2'yi kullandık. Bu puan, metin doğruluğu seviyesini temsil eder.

Benzerlik işlevi, iki metin arasındaki benzerliği hesaplamak için bir kosinüs mesafesi metriği kullanır. Bu karşılaştırma için Levenshtein mesafesini kullanmadık çünkü farklı ürünler metinleri farklı sıralarda çıktı olarak veriyor.2

Levenshtein mesafesi bu farklılıkları dikkate alırken, biz yalnızca metnin ne kadar doğru tespit edildiğine bakıyoruz, nerede bulunduğuna değil. Kosinüs mesafesinin bu tür durumlar için ihmal edilebilir cezaları vardır, bu nedenle bu karşılaştırmada onu kullanmaya karar verdik.

Ürün seçimi

Piyasada birçok OCR ürünü bulunmaktadır. Ham metin sonuçları verebilenlere odaklanmamız gerekiyor. Bu karşılaştırma için ürünler şunlara göre seçilmiştir:

  • Metin çıkarma yeteneği. Bu karşılaştırmaya yalnızca makine tarafından okunabilir (yani yapılandırılmış veri) çıkaran çözümleri dahil etmedik
  • Pazardaki popülerlikleri

Bu kapsamlı bir pazar incelemesi değildir ve önemli yeteneklere sahip bazı ürünleri hariç tutmuş olabiliriz. Eğer durum buysa, lütfen bir yorum bırakın, karşılaştırmayı genişletmekten memnuniyet duyarız.

Sınırlamalar

Gelişmiş yetenekler, metin konumu tespiti, anahtar-değer eşleştirme ve belge sınıflandırma gibi, bu karşılaştırmada değerlendirilmemiştir.

Örneklem büyüklüğü bir sonraki iterasyonda artırılacaktır. El yazısı için OCR arıyorsanız, 50 örnek içeren el yazısı OCR karşılaştırmamıza bakın.

İlgileniyorsanız fatura OCR karşılaştırmamıza ve fiş OCR karşılaştırmamıza da bakabilirsiniz.

Önceki OCR karşılaştırma sonuçları

%90 güven aralıklarıyla OCR Metin Doğruluğunun Genel Sonuçları
  • Google Cloud Vision ve AWS Textract, tüm durumlar için pazardaki lider teknolojilerdir
  • Abbyy ayrıca el yazısı olmayan belgeler için yüksek performansa sahiptir
  • Açık kaynak Tesseract da dahil olmak üzere karşılaştırılan tüm OCR'lar, dijital ekran görüntülerinde iyi performans gösterdi.

Google Cloud Platform'un Vision OCR aracı, tüm veri seti test edildiğinde %98,0 ile en yüksek metin doğruluğuna ulaşıyor. Yazılı metinlerin yer aldığı Kategori 1'de tüm ürünler %99,2'nin üzerinde performans gösterirken, Kategori 2 ve 3'teki el yazısı görseller ürünler arasındaki asıl farkı yaratıyor.

Genel sonuçlar, GCP Vision ve AWS Textract'ın, verilen metni tanımada en yüksek doğrulukla baskın OCR ürünleri olduğunu gösteriyor.

Genel sonuçlardan notlar:

  • AWS Textract'ın el yazısı metni tanıyamadığı tek bir durum var. Bu durum, AWS Textract'ın kategori ve toplam performansını önemli ölçüde düşürüyor. Ayrıca, AWS Textract diğer tüm örneklerde çok iyi performans gösterdiği için, kategori içindeki ve genel sapmayı da artırıyor.  
  • Azure, %99,8 doğrulukla Kategori 1'de lider üründür. Ancak, ikinci kategori sonuçlarında görüldüğü gibi, ürün genellikle el yazısı metni tanımakta başarısız oluyor. Azure'un üçüncü kategoride ve genelde geride kalmasının nedeni budur.
  • Tesseract OCR, ücretsiz olarak kullanılabilen açık kaynaklı bir üründür. Azure ve ABBYY'ye kıyasla, el yazısı örneklerinde daha iyi performans gösterir ve kullanıcı AWS veya GCP ürünlerini edinemezse el yazısı tanıma için düşünülebilir. Ancak, taranmış görsellerde düşük performans gösterebilir.
  • Diğer ürünlerin aksine, ABBYY daha yapılandırılmış bir .txt dosyası çıkarır. ABBYY, çıktı dosyasını oluştururken metnin görsel içindeki konumunu da dikkate alır. Ürünün ek kullanışlı yetenekleri olsa da, bu karşılaştırmada yalnızca metin doğruluğuna odaklanıyoruz. Ve el yazısı tanımada düşük performans gösterdi.

"Sorun Çıkaran" Görselin Kaldırılması

Genel sonuçlarda belirtildiği gibi, AWS Textract'ın hiçbir metni tanıyamadığı tek bir "aykırı" görsel vardı. Ürün diğer tüm görsellerde %95'in üzerinde metin doğruluğu gösterirken, bu örnek AWS'nin performansını düşürdü ve güven aralığını genişletti.

Bu örnek bir istisna olabileceğinden, ürünleri onsuz da karşılaştırmak istedik. Bu görsele "sorun çıkaran" adını verdik ve bir fark yaratıp yaratmadığını görmek için sonuçlarımızı yeniden çalıştırdık.
İşte "sorun çıkaran"ı veri setinden çıkardıktan sonraki yeni sonuçlar.

"Sorun çıkaran" hariç tutulduğunda OCR Metin Doğruluğu Sonuçları. %90 güven aralığı gösterilmiştir

"Sorun çıkaran" hariç tutulduğunda, AWS Textract dar bir güven aralığıyla neredeyse mükemmel (%99,3) bir metin doğruluğu seviyesiyle en iyi performansı gösteren ürün haline geliyor. Puanlar çok fazla değişmese de, GCP Vision ve AWS Textract diğerlerinden daha iyi metin doğruluğuyla en iyi 2 ürün olmaya devam ediyor.

El Yazısı Tanıma Olmadan Sonuçlar

Bazı ürünlerin metin doğruluğunu azaltan ana faktör, görsellerde el yazısının bulunmasıdır. Bu nedenle, tüm el yazısı görsellerini (kategori 2'nin tamamı ve kategori 3'ten 6 görsel) hariç tuttuk ve metin doğruluğu performansını yeniden değerlendirdik.

El yazısı tanıma durumları olmadan OCR Metin Doğruluğu

El yazısı görseller hariç tutulduğunda sonuçlar daha başa baş. AWS Textract ve GCP Vision karşılaştırmada en iyi 2 ürün olmaya devam ediyor, ancak ABBYY FineReader da bu sefer çok iyi performans gösteriyor (%99,3). El yazısı hariç tutulduğunda tüm ürünler %95'in üzerinde doğruluk elde etse de, Azure Computer Vision ve Tesseract OCR taranmış belgelerde hala zorlanıyor ve bu da onları bu karşılaştırmada geride bırakıyor.

Karşılaştırılan ürünler

Metin doğruluğu performanslarını ölçmek için beş OCR ürününü test ettik. Mayıs/2021 itibarıyla mevcut sürümleri kullandık. Kullanılan ürünler şunlardır:

  • ABBYY FineReader 15
  • Amazon Textract
  • Google Cloud Platform Vision API
  • Microsoft Azure Computer Vision API
  • Tesseract OCR Engine

Veri Seti

OCR için birçok görsel veri seti olmasına rağmen, bunlar

  • çoğunlukla karakter düzeyindedir ve gerçek iş kullanım durumlarına uymaz
  • veya metnin kendisinden ziyade metin konumuna odaklanır.

Bu nedenle, üç ana kategori altında kendi veri setimizi oluşturmaya karar verdik:

  1. Kategori 1 – Metin içeren web sayfası ekran görüntüleri: Bu kategori, rastgele Wikipedia sayfalarından alınan ekran görüntülerini ve rastgele sorgularla yapılan Google arama sonuçlarını içerir.
  2. Kategori 2 – El yazısı: Bu kategori, farklı el yazısı stillerini içeren rastgele fotoğrafları içerir.
  3. Kategori 3 – Fişler, faturalar ve taranmış sözleşmeler: Bu kategori, internetten toplanan rastgele fişler, el yazısı faturalar ve taranmış sigorta sözleşmelerinden oluşan bir koleksiyonu içerir.

Tüm girdi dosyaları .jpg veya .png formatındadır.

Sınırlamalar

  • Sınırlı Veri Seti: Başlangıçta, ürünlerin basılı belgelerdeki performansını değerlendirmek için gazete fotoğraflarından oluşan dördüncü bir kategorimiz vardı. Ancak, bu fotoğraflar çok fazla metin içerdiğinden, referans gerçeklik oluşturmayı zorlaştırdı. Bu nedenle, bunları kullanmamaya karar verdik.
  • Çıktı formatlarındaki tutarsızlıklar: Birçok görsel, sol ve sağ tarafta ayrı metin örnekleri içerir. Ürünler bu metinleri farklı sıralarda çıkarır ve bu da metinler doğru tespit edilse bile çıktı dosyalarının farklı olmasına neden olur. Bu durum, diğer mesafe ölçütlerini (Levenshtein mesafesi gibi) kullanmamızı engelledi ve metin doğruluğunu hesaplama seçeneklerimizi sınırladı.
  • Kosinüs Mesafesiyle İlgili Olası Sorun: Kosinüs mesafesi, benzerliği hesaplarken gömme vektörleri kullanır. Örneğin, "Çay severim" ve "Kahve severim" cümlelerini karşılaştırmak, olması gerekenden daha yüksek bir benzerlik puanı verir. Ancak, "çay" kelimesini "kahve" ile karıştırmak gibi durumlar nadir olacağından, bu alıştırmada bu olasılığı dikkate almadık.

Yazılım sağlayıcılarını sıralamak için diğer pazar verilerini (örn. yazılım incelemeleri, müşteri vaka çalışmaları) kullanıyoruz. Ancak, çoğu kurumsal şirket veri çıkarma çözümleri (yani makine tarafından okunabilir veri üretenler dahil) ararken "OCR" terimini kullandığından, listemiz bu karşılaştırma çalışmasında sunulanlardan daha geniş bir kapsama ve daha fazla şirkete sahiptir.

Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

SSS'ler

Optik Karakter Tanıma (OCR), taranmış belgeler, basılı kitaplar veya fotoğraflar gibi görseller içindeki karakterleri ayırt etmede uzmanlaşmış bir makine öğrenimi alanıdır. Olgun bir teknoloji olmasına rağmen, tüm metin türlerini %100 doğrulukla tanıyabilen hiçbir OCR ürünü hala yoktur. Karşılaştırdığımız ürünler arasında, yalnızca birkaç ürün test setimizden başarılı sonuçlar çıkarabildi.
OCR araçları, şirketler tarafından görsellerdeki metinleri ve konumlarını belirlemek, iş belgelerini konularına göre sınıflandırmak veya belgeler içinde anahtar-değer eşleştirmesi yapmak için kullanılır. OCR sonuçlarına dayanarak, diğer teknoloji şirketleri belge otomasyonu gibi uygulamalar geliştirir. Tüm bu iş durumları için, doğru metin tanıma bir OCR ürünü için kritiktir.

Bu benchmarkı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Cem Dilmegani and Şevval Alper (2026) - "OCR Karşılaştırması: Metin Çıkarma / Yakalama Doğruluğu". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 29 Haziran 2026, kaynak: https://aimultiple.com/ocr-accuracy [Çevrimiçi Kaynak]

Dilmegani, C., & Alper, Ş. (2026, 29 Haziran). OCR Karşılaştırması: Metin Çıkarma / Yakalama Doğruluğu. AIMultiple. https://aimultiple.com/ocr-accuracy

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Alper, Şevval},
  title  = {{OCR Karşılaştırması: Metin Çıkarma / Yakalama Doğruluğu}},
  year   = {2026},
  month  = jun,
  howpublished    = {\url{https://aimultiple.com/ocr-accuracy}},
  note   = {AIMultiple. Erişim tarihi: 29 Haziran 2026}
}
Cem Dilmegani
Cem Dilmegani
Baş Analist
Cem, 2017'den beri AIMultiple'da baş analist olarak görev yapmaktadır. AIMultiple, her ay Fortune 500 şirketlerinin %55'i de dahil olmak üzere yüz binlerce işletmeye (benzer Web'e göre) bilgi sağlamaktadır. Cem'in çalışmaları, Business Insider, Forbes, Washington Post gibi önde gelen küresel yayınlar, Deloitte, HPE gibi küresel firmalar, Dünya Ekonomik Forumu gibi STK'lar ve Avrupa Komisyonu gibi uluslararası kuruluşlar tarafından alıntılanmıştır. AIMultiple'ı referans gösteren daha fazla saygın şirket ve kaynağı görebilirsiniz. Kariyeri boyunca Cem, teknoloji danışmanı, teknoloji alıcısı ve teknoloji girişimcisi olarak görev yapmıştır. On yıldan fazla bir süre McKinsey & Company ve Altman Solon'da işletmelere teknoloji kararları konusunda danışmanlık yapmıştır. Ayrıca dijitalleşme üzerine bir McKinsey raporu yayınlamıştır. Bir telekom şirketinin CEO'suna bağlı olarak teknoloji stratejisi ve tedarikini yönetmiştir. Ayrıca, 2 yıl içinde sıfırdan 7 haneli yıllık yinelenen gelire ve 9 haneli değerlemeye ulaşan derin teknoloji şirketi Hypatos'un ticari büyümesini yönetmiştir. Cem'in Hypatos'taki çalışmaları TechCrunch ve Business Insider gibi önde gelen teknoloji yayınlarında yer aldı. Cem düzenli olarak uluslararası teknoloji konferanslarında konuşmacı olarak yer almaktadır. Boğaziçi Üniversitesi'nden bilgisayar mühendisliği diplomasına ve Columbia Business School'dan MBA derecesine sahiptir.
Tam Profili Görüntüle
Araştıran
Şevval Alper
Şevval Alper
Yapay Zeka Araştırmacısı
Şevval, AIMultiple'da yapay zeka kodlama araçları, yapay zeka ajanları ve kuantum teknolojileri konusunda uzmanlaşmış bir sektör analistidir.
Tam Profili Görüntüle

Yorumlar 8

Düşüncelerinizi Paylaşın

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450
Serhat Cinar
Serhat Cinar
Feb 28, 2025 at 09:34

Did you ever think of oncluding multimodal llms in your comparison, like gpt4o, llama 3.2. gemini, claude etc.?

Cem Dilmegani
Cem Dilmegani
Mar 17, 2025 at 02:59

Hi Serhat and thank you for your comment, Yes, we added those for which we have API access like Claude and GPT-4o.

DLJ
DLJ
Oct 17, 2024 at 11:14

Just stumbled on this milestone assessment update. Could you kindly elaborate further on the three revised datasets: Thanks for this work. Character Sets When someone refers to 'handriting', that can mean many things: 'handwriting style' typefaces (per Docusign, etc.), and hand-printed (block printing and mixed-case printing) as often found in combs and box delineators, and finally, cursive or longhand writing (exclusive of signatures). Character Context Structured content, semi-structured content, and unstructured content. Image Qualities (bitonal, greyscale, full colour, spatial dpi, from a scanner/cell-phone/native rendering, image 'enhancements' prior to OCR (thickening, local gamma, background dropout, sharpening, smoothing, noise removal, etc.) These can have significant impacts, and some don't realize the importance of including these benchmark differentiators.

Cem Dilmegani
Cem Dilmegani
Oct 22, 2024 at 03:15

Hi there, thank you for the detailed comment, we are updating the article to include these details.

Webster
Webster
Feb 05, 2023 at 07:24

Hello, great work! Just curious, did you use a trained Tesseract when making these testing?

Bardia Eshghi
Bardia Eshghi
Feb 06, 2023 at 12:29

Hi, Webster. Glad you enjoyed the article. The tools we tested were: ABBYY FineReader 15 Amazon Textract Google Cloud Platform Vision API Microsoft Azure Computer Vision API Tesseract OCR Engine Hope this answers your question.

Bobby
Bobby
Aug 14, 2022 at 23:54

The graph images are not working for me at the moment. Otherwise great

Cem Dilmegani
Cem Dilmegani
Aug 15, 2022 at 14:48

Thank you Bobby! We have a glitch in the CMS and we are fixing it. Apologies for the issue, it should be fixed next week.

samsun
samsun
Jun 07, 2022 at 14:10

Thanks for sharing, can you add a free OCR for everyone to use? https://www.geekersoft.com/ocr-online.html

Cem Dilmegani
Cem Dilmegani
Aug 17, 2022 at 07:46

Hi Samsun, unfortunately, we don't share all OCR providers on this page, there are thousands of them. We tried to put together the largest ones in terms of market presence. If you have evidence that your solution is one of the top 10 globally, please share it with us at info@aimultiple.com so we can consider it.

Scott
Scott
Jan 20, 2022 at 20:42

What version of Tesseract did you test with? They recently released v5.

Cem Dilmegani
Cem Dilmegani
Aug 23, 2022 at 12:01

Hi Scott, we did the benchmarking before Tesseract 5. We will redo it soon and include the versions in the methodology section as well.

Bob
Bob
Jan 12, 2022 at 15:09

This is very informative, nice work. I assume your tests used documents/images in English? I've been experimenting with OCR tools on other languages and finding relatively poor accuracy.

Cem Dilmegani
Cem Dilmegani
Jan 15, 2022 at 13:52

Exactly, all text were in English. I hear similar things about OCR on non-Latin characters. We have an Arabic speaker in the team who claims that accuracy in Arabic is much lower compared to English. We can do a benchmark on non-Latin characters if there is demand for it.

kin
kin
Jun 21, 2021 at 02:22

interesting post!!! do you have any suggestion about improving accuracy on scanned image ? i'm using tesseract right now. anyway , great work!

Cem Dilmegani
Cem Dilmegani
Jun 22, 2021 at 07:50

Thank you for the comment. There are pre-processing approaches that can be implemented to improve image quality. But such approaches may already be used in Tesseract. A detailed research into Tesseract image processing would be helpful in your case.