OCR doğruluğu birçok belge işleme görevi için kritik öneme sahiptir ve en gelişmiş çok modlu LLM'ler artık OCR'a bir alternatif sunmaktadır. Farklı belge türlerindeki doğruluk seviyelerini belirlemek için DeltOCR Bench'te önde gelen OCR hizmetlerini karşılaştırdık:
- El yazısı: GPT-5 (%95) en güçlü performans olarak öne çıkıyor, onu olmOCR-2-7B (%94) ve Gemini 2.5 Pro (%93) yakından takip ediyor.
- Basılı medya: Gemini 2.5 Pro, Google Vision ve Claude Sonnet 4.5 en yüksek skorla (%85) bu kategoride liderlik ediyor
- Basılı metin: Microsoft Azure Document Intelligence API %96 skorla liderlik ediyor.
OCR Karşılaştırması: DeltOCR Bench
Yukarıdaki ürünlerin tam adları ve Kasım 2025 itibarıyla kullanılan sürümleri aşağıda listelenmiştir. Çalışmamız, hem kolay erişilebilir API hizmetlerini hem de şirket içi altyapı gerektiren çözümleri kapsamakta olup, pazardaki kilit modelleri derinlemesine bir test ortamında karşılaştırmaktadır.
- El yazısı:
- Doğruluk Aralığı: %46 ile %95 arasında geniş bir aralık.
- Öne Çıkanlar: GPT-5 (%95), olmOCR-2-7B (%94) ve Gemini 2.5 Pro (%93) en yüksek performansı sergiliyor. Bu yüksek skorlar, GPT-5 ve Gemini 2.5 Pro gibi çok modlu LLM'lerin bu alandaki olağanüstü doğruluk potansiyelini göstermektedir.
- Öneri: Son derece karmaşık el yazılarını tanımak için, API erişilebilirliği ve entegrasyon kolaylığı nedeniyle GPT-5 veya Gemini 2.5 Pro gibi en iyi LLM çözümleri önerilir.
- Basılı medya:
- Doğruluk Aralığı: %54 ile %85 arasında bir aralık.
- Öne Çıkanlar: Gemini 2.5 Pro, Google Vision ve Claude Sonnet 4.5 gibi çözümler en yüksek skoru (%85) paylaşıyor. Bu kategori, LLM'ler ile geleneksel bulut tabanlı OCR hizmetleri (Azure, Dots OCR, Amazon Textract) arasında oldukça rekabetçi. GPT-5 bu kategoride diğer lider LLM'lerin gerisinde kalıyor (%77).
- Öneri: Karmaşık görsel düzenlere sahip belgeler için (birden çok yazı tipi, düşük çözünürlük vb.), Gemini 2.5 Pro gibi LLM'ler veya Google Vision ya da Microsoft Azure Document Intelligence API gibi bulut tabanlı hizmetler önerilir.
- Basılı metin:
- Doğruluk Aralığı: %55 ile %96 arasında yüksek bir aralık, ancak önde gelen çözümlerin çoğu %94 ve üzeri skorlar elde etti.
- Öne Çıkanlar: Microsoft Azure Document Intelligence API (%96) liderliği alırken, onu GPT-5, Gemini 2.5 Pro, Gemini 3 Pro Preview, Google Vision ve Amazon Textract gibi hepsi %95 skor alan çözümler yakından takip ediyor. Bu kategori, tüm SOTA çözümlerinin son derece yüksek doğruluk seviyelerine ulaştığı bir alandır.
- Öneri: Yüksek doğruluk gerektiren basit basılı metinler için, Microsoft Azure Document Intelligence API veya Google Vision gibi köklü bulut çözümleri ya da yüksek skorlu LLM'ler (Gemini/GPT-5) güvenle kullanılabilir.
API Çözümleri
Aşağıdaki modeller, hem erişim kolaylığı hem de performansları nedeniyle karşılaştırma listemize dahil edilmiştir.
- Claude Sonnet 4.5
- OpenAI GPT-5
- Gemini 2.5 Pro
- Gemini 3 Pro Preview
- Amazon Textract API
- Google Cloud Vision API
- Microsoft Azure Document Intelligence API
- Moondream OCR
- Mistral OCR 3
- Mistral OCR 2
Microsoft Azure Document Intelligence API, Azure Bilişsel Hizmetler ailesinin bir parçasıdır.
Yerel (Şirket İçi) Dağıtılan Modeller
Bu modelleri test etmek, kurulum, bağımlılık yönetimi ve donanım gereksinimleri nedeniyle API çözümlerine göre daha zordur. Tüm yerel testler özel bir sunucu ortamında gerçekleştirilmiştir.
- olmOCR-2-7B
- PaddleOCR-VL
- Nanonets-OCR2-3B
- Deepseek-OCR
- Dots-OCR
Sonuçların doğruluğunu basılı metin, basılı medya ve el yazısı için kosinüs benzerlik skoru olarak hesapladık. Grafikte görünen her skor, ilgili modelin o kategorideki performansını temsil etmektedir.
Testlerimiz sırasında, Nanonets-OCR2-3B modelinin karşılaştırmada en zayıf performansı gösterdiğini ve en düşük skorları elde ettiğini gözlemledik. Genel olarak, bazı modellerin özellikle bitişik el yazısı ve düzensiz metin düzenleriyle (karışık satır sıralaması, tutarsız büyük harf kullanımı) zorlandığını tespit ettik. Benzer performans sorunları, özellikle düşük çözünürlüklü görüntülerde ve birden çok yazı tipi stili içerenlerde olmak üzere basılı medya kategorisinde de ortaya çıktı.
Veri Seti
Bu karşılaştırmada toplam 300 belge kullandık, 3 kategori genelinde kategori başına 100 belge:
Basılı metin; mektuplar, web sitesi ekran görüntüleri, e-postalar, raporlar vb. içerir.
Basılı medya; posterler, kitap kapakları, reklamlar vb. içerir. OCR araçlarının farklı yazı tipleri ve yerleşimlerdeki başarısını görmeyi amaçladık.
Bu 2 kategorideki dosyalar, Industry Documents Library (IDL) kaynağından alınmıştır.1
El yazısı: El yazısı kategorisinde, bazı IDL belgelerinin okunması kolay olmadığından, ekibimiz IDL belgelerine benzer belgeler oluşturdu. İnsan tarafından okunabilir el yazısı örneklerini manuel olarak hazırladık. Tüm örnekler bitişik el yazısı tarzındaydı.
DeltOCR Bench Metodolojisi
Bu karşılaştırma, ürünlerin metin çıkarma doğruluğuna odaklanmaktadır.
Ön işleme yalnızca el yazısı kategorisi için uygulanmıştır. El yazısı belgelerin fotoğraflarını akıllı telefonlarımızla çektik ve bir mobil tarayıcı uygulaması kullandık:
- Fotoğraflar siyah-beyaza dönüştürüldü
- Kontrast artırıldı ve arka plan kaldırıldı.
OCR: Tüm ürünleri aynı veri seti üzerinde çalıştırdık ve metin çıktılarını ham metin (.txt) dosyaları olarak oluşturduk. Ardından, tüm bu dosyalardaki doğru metni içeren referans metinleri manuel olarak hazırladık. Referans metinler insanlar tarafından iki kez doğrulandı.
Karşılaştırma: OCR çözümlerinin doğruluğunu, çıktılarını orijinal metinlerle karşılaştırarak ölçtük. Bu amaçla, kosinüs benzerlik skorlarını hesaplamak için Sentence-BERT (SBERT) çerçevesini kullandık. Karşılaştırmada, her ürünün çıktısı ile referans metinler arasındaki benzerlik skorunu hesaplamak için yüksek performanslı çok dilli paraphrase modeli MiniLM-L12-v2'yi kullandık. Bu skor, metin doğruluğu seviyesini temsil etmektedir.
Benzerlik fonksiyonu, iki metin arasındaki benzerliği hesaplamak için kosinüs mesafe metriğini kullanır. Bu karşılaştırma için Levenshtein mesafesini kullanmadık çünkü farklı ürünler metinleri farklı sıralarda çıktı olarak vermektedir.2
Levenshtein mesafesi bu farklılıkları dikkate alırken, biz yalnızca metnin ne kadar doğru tespit edildiğine bakıyoruz, nerede konumlandığına değil. Kosinüs mesafesi bu tür durumlar için ihmal edilebilir cezalar uyguladığından, bu karşılaştırmada kullanmaya karar verdik.
Ürün seçimi
Piyasada birçok OCR ürünü bulunmaktadır. Ham metin sonuçları çıktısı verebilenlere odaklanmamız gerekiyor. Bu karşılaştırma için ürünler şu kriterlere göre seçilmiştir:
- Metin çıkarma yeteneği. Bu karşılaştırmaya yalnızca makine tarafından okunabilir (yani yapılandırılmış veri) çıktı veren çözümleri dahil etmedik
- Pazardaki popülerlikleri
Bu kapsamlı bir pazar incelemesi değildir ve önemli yeteneklere sahip bazı ürünleri hariç tutmuş olabiliriz. Eğer durum buysa, lütfen yorum bırakın, karşılaştırmayı genişletmekten memnuniyet duyarız.
Sınırlamalar
Metin konumu tespiti, anahtar-değer eşleştirme ve belge sınıflandırma gibi gelişmiş yetenekler bu karşılaştırmada değerlendirilmemiştir.
Örneklem büyüklüğü bir sonraki yinelemede artırılacaktır. El yazısı için OCR arıyorsanız, 50 örnekli el yazısı OCR karşılaştırmamıza bakın.
İlgileniyorsanız fatura OCR karşılaştırmamıza ve fiş OCR karşılaştırmamıza da göz atabilirsiniz.
SSS'ler
Optik Karakter Tanıma (OCR), taranmış belgeler, basılı kitaplar veya fotoğraflar gibi görüntülerdeki karakterleri ayırt etme konusunda uzmanlaşmış bir makine öğrenimi alanıdır. Olgun bir teknoloji olmasına rağmen, her türlü metni %100 doğrulukla tanıyabilen bir OCR ürünü hâlâ bulunmamaktadır. Karşılaştırdığımız ürünler arasında yalnızca birkaç ürün test setimizden başarılı sonuçlar çıkarabilmiştir.
OCR araçları, şirketler tarafından görüntülerdeki metinleri ve konumlarını tanımlamak, iş belgelerini konularına göre sınıflandırmak veya belgeler içinde anahtar-değer eşleştirmesi yapmak için kullanılır. OCR sonuçlarına dayanarak, diğer teknoloji şirketleri belge otomasyonu gibi uygulamalar geliştirir. Tüm bu iş senaryoları için, doğru metin tanıma bir OCR ürünü için kritik öneme sahiptir.
Bu benchmarkı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{alper2026,
author = {Alper, Şevval},
title = {{OCR Karşılaştırması: Metin Çıkarma / Yakalama Doğruluğu}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/ocr-accuracy}},
note = {AIMultiple. Erişim tarihi: 29 Temmuz 2026}
}
Yorumlar 8
Düşüncelerinizi Paylaşın
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.
Did you ever think of oncluding multimodal llms in your comparison, like gpt4o, llama 3.2. gemini, claude etc.?
Hi Serhat and thank you for your comment, Yes, we added those for which we have API access like Claude and GPT-4o.
Just stumbled on this milestone assessment update. Could you kindly elaborate further on the three revised datasets: Thanks for this work. Character Sets When someone refers to 'handriting', that can mean many things: 'handwriting style' typefaces (per Docusign, etc.), and hand-printed (block printing and mixed-case printing) as often found in combs and box delineators, and finally, cursive or longhand writing (exclusive of signatures). Character Context Structured content, semi-structured content, and unstructured content. Image Qualities (bitonal, greyscale, full colour, spatial dpi, from a scanner/cell-phone/native rendering, image 'enhancements' prior to OCR (thickening, local gamma, background dropout, sharpening, smoothing, noise removal, etc.) These can have significant impacts, and some don't realize the importance of including these benchmark differentiators.
Hi there, thank you for the detailed comment, we are updating the article to include these details.
Hello, great work! Just curious, did you use a trained Tesseract when making these testing?
Hi, Webster. Glad you enjoyed the article. The tools we tested were: ABBYY FineReader 15 Amazon Textract Google Cloud Platform Vision API Microsoft Azure Computer Vision API Tesseract OCR Engine Hope this answers your question.
The graph images are not working for me at the moment. Otherwise great
Thank you Bobby! We have a glitch in the CMS and we are fixing it. Apologies for the issue, it should be fixed next week.
Thanks for sharing, can you add a free OCR for everyone to use? https://www.geekersoft.com/ocr-online.html
Hi Samsun, unfortunately, we don't share all OCR providers on this page, there are thousands of them. We tried to put together the largest ones in terms of market presence. If you have evidence that your solution is one of the top 10 globally, please share it with us at info@aimultiple.com so we can consider it.
What version of Tesseract did you test with? They recently released v5.
Hi Scott, we did the benchmarking before Tesseract 5. We will redo it soon and include the versions in the methodology section as well.
This is very informative, nice work. I assume your tests used documents/images in English? I've been experimenting with OCR tools on other languages and finding relatively poor accuracy.
Exactly, all text were in English. I hear similar things about OCR on non-Latin characters. We have an Arabic speaker in the team who claims that accuracy in Arabic is much lower compared to English. We can do a benchmark on non-Latin characters if there is demand for it.
interesting post!!! do you have any suggestion about improving accuracy on scanned image ? i'm using tesseract right now. anyway , great work!
Thank you for the comment. There are pre-processing approaches that can be implemented to improve image quality. But such approaches may already be used in Tesseract. A detailed research into Tesseract image processing would be helpful in your case.