Hizmetler
Bize Ulaşın

OCR Karşılaştırması: Metin Çıkarma / Yakalama Doğruluğu

Şevval Alper
Şevval Alper
Güncellenme tarihi: 29 Tem 2026
Loading Chart

OCR doğruluğu birçok belge işleme görevi için kritik öneme sahiptir ve en gelişmiş çok modlu LLM'ler artık OCR'a bir alternatif sunmaktadır. Farklı belge türlerindeki doğruluk seviyelerini belirlemek için DeltOCR Bench'te önde gelen OCR hizmetlerini karşılaştırdık:

  • El yazısı: GPT-5 (%95) en güçlü performans olarak öne çıkıyor, onu olmOCR-2-7B (%94) ve Gemini 2.5 Pro (%93) yakından takip ediyor.
  • Basılı medya: Gemini 2.5 Pro, Google Vision ve Claude Sonnet 4.5 en yüksek skorla (%85) bu kategoride liderlik ediyor
  • Basılı metin: Microsoft Azure Document Intelligence API %96 skorla liderlik ediyor.

OCR Karşılaştırması: DeltOCR Bench

Yukarıdaki ürünlerin tam adları ve Kasım 2025 itibarıyla kullanılan sürümleri aşağıda listelenmiştir. Çalışmamız, hem kolay erişilebilir API hizmetlerini hem de şirket içi altyapı gerektiren çözümleri kapsamakta olup, pazardaki kilit modelleri derinlemesine bir test ortamında karşılaştırmaktadır.

  • El yazısı:
    • Doğruluk Aralığı: %46 ile %95 arasında geniş bir aralık.
    • Öne Çıkanlar: GPT-5 (%95), olmOCR-2-7B (%94) ve Gemini 2.5 Pro (%93) en yüksek performansı sergiliyor. Bu yüksek skorlar, GPT-5 ve Gemini 2.5 Pro gibi çok modlu LLM'lerin bu alandaki olağanüstü doğruluk potansiyelini göstermektedir.
    • Öneri: Son derece karmaşık el yazılarını tanımak için, API erişilebilirliği ve entegrasyon kolaylığı nedeniyle GPT-5 veya Gemini 2.5 Pro gibi en iyi LLM çözümleri önerilir.
  • Basılı medya:
    • Doğruluk Aralığı: %54 ile %85 arasında bir aralık.
    • Öne Çıkanlar: Gemini 2.5 Pro, Google Vision ve Claude Sonnet 4.5 gibi çözümler en yüksek skoru (%85) paylaşıyor. Bu kategori, LLM'ler ile geleneksel bulut tabanlı OCR hizmetleri (Azure, Dots OCR, Amazon Textract) arasında oldukça rekabetçi. GPT-5 bu kategoride diğer lider LLM'lerin gerisinde kalıyor (%77).
    • Öneri: Karmaşık görsel düzenlere sahip belgeler için (birden çok yazı tipi, düşük çözünürlük vb.), Gemini 2.5 Pro gibi LLM'ler veya Google Vision ya da Microsoft Azure Document Intelligence API gibi bulut tabanlı hizmetler önerilir.
  • Basılı metin:
    • Doğruluk Aralığı: %55 ile %96 arasında yüksek bir aralık, ancak önde gelen çözümlerin çoğu %94 ve üzeri skorlar elde etti.
    • Öne Çıkanlar: Microsoft Azure Document Intelligence API (%96) liderliği alırken, onu GPT-5, Gemini 2.5 Pro, Gemini 3 Pro Preview, Google Vision ve Amazon Textract gibi hepsi %95 skor alan çözümler yakından takip ediyor. Bu kategori, tüm SOTA çözümlerinin son derece yüksek doğruluk seviyelerine ulaştığı bir alandır.
    • Öneri: Yüksek doğruluk gerektiren basit basılı metinler için, Microsoft Azure Document Intelligence API veya Google Vision gibi köklü bulut çözümleri ya da yüksek skorlu LLM'ler (Gemini/GPT-5) güvenle kullanılabilir.

API Çözümleri

Aşağıdaki modeller, hem erişim kolaylığı hem de performansları nedeniyle karşılaştırma listemize dahil edilmiştir.

  • Claude Sonnet 4.5
  • OpenAI GPT-5
  • Gemini 2.5 Pro
  • Gemini 3 Pro Preview
  • Amazon Textract API
  • Google Cloud Vision API
  • Microsoft Azure Document Intelligence API
  • Moondream OCR
  • Mistral OCR 3
  • Mistral OCR 2

Microsoft Azure Document Intelligence API, Azure Bilişsel Hizmetler ailesinin bir parçasıdır.

Yerel (Şirket İçi) Dağıtılan Modeller

Bu modelleri test etmek, kurulum, bağımlılık yönetimi ve donanım gereksinimleri nedeniyle API çözümlerine göre daha zordur. Tüm yerel testler özel bir sunucu ortamında gerçekleştirilmiştir.

  • olmOCR-2-7B
  • PaddleOCR-VL
  • Nanonets-OCR2-3B
  • Deepseek-OCR
  • Dots-OCR

Sonuçların doğruluğunu basılı metin, basılı medya ve el yazısı için kosinüs benzerlik skoru olarak hesapladık. Grafikte görünen her skor, ilgili modelin o kategorideki performansını temsil etmektedir.

Testlerimiz sırasında, Nanonets-OCR2-3B modelinin karşılaştırmada en zayıf performansı gösterdiğini ve en düşük skorları elde ettiğini gözlemledik. Genel olarak, bazı modellerin özellikle bitişik el yazısı ve düzensiz metin düzenleriyle (karışık satır sıralaması, tutarsız büyük harf kullanımı) zorlandığını tespit ettik. Benzer performans sorunları, özellikle düşük çözünürlüklü görüntülerde ve birden çok yazı tipi stili içerenlerde olmak üzere basılı medya kategorisinde de ortaya çıktı.

Veri Seti

Bu karşılaştırmada toplam 300 belge kullandık, 3 kategori genelinde kategori başına 100 belge:

Basılı metin; mektuplar, web sitesi ekran görüntüleri, e-postalar, raporlar vb. içerir.

Basılı medya; posterler, kitap kapakları, reklamlar vb. içerir. OCR araçlarının farklı yazı tipleri ve yerleşimlerdeki başarısını görmeyi amaçladık.

Bu 2 kategorideki dosyalar, Industry Documents Library (IDL) kaynağından alınmıştır.1

El yazısı: El yazısı kategorisinde, bazı IDL belgelerinin okunması kolay olmadığından, ekibimiz IDL belgelerine benzer belgeler oluşturdu. İnsan tarafından okunabilir el yazısı örneklerini manuel olarak hazırladık. Tüm örnekler bitişik el yazısı tarzındaydı.

Şekil 1: Veri setimizden örnekler.

DeltOCR Bench Metodolojisi

Bu karşılaştırma, ürünlerin metin çıkarma doğruluğuna odaklanmaktadır.

Ön işleme yalnızca el yazısı kategorisi için uygulanmıştır. El yazısı belgelerin fotoğraflarını akıllı telefonlarımızla çektik ve bir mobil tarayıcı uygulaması kullandık:

  • Fotoğraflar siyah-beyaza dönüştürüldü
  • Kontrast artırıldı ve arka plan kaldırıldı.

OCR: Tüm ürünleri aynı veri seti üzerinde çalıştırdık ve metin çıktılarını ham metin (.txt) dosyaları olarak oluşturduk. Ardından, tüm bu dosyalardaki doğru metni içeren referans metinleri manuel olarak hazırladık. Referans metinler insanlar tarafından iki kez doğrulandı.

Karşılaştırma: OCR çözümlerinin doğruluğunu, çıktılarını orijinal metinlerle karşılaştırarak ölçtük. Bu amaçla, kosinüs benzerlik skorlarını hesaplamak için Sentence-BERT (SBERT) çerçevesini kullandık. Karşılaştırmada, her ürünün çıktısı ile referans metinler arasındaki benzerlik skorunu hesaplamak için yüksek performanslı çok dilli paraphrase modeli MiniLM-L12-v2'yi kullandık. Bu skor, metin doğruluğu seviyesini temsil etmektedir.

Benzerlik fonksiyonu, iki metin arasındaki benzerliği hesaplamak için kosinüs mesafe metriğini kullanır. Bu karşılaştırma için Levenshtein mesafesini kullanmadık çünkü farklı ürünler metinleri farklı sıralarda çıktı olarak vermektedir.2

Levenshtein mesafesi bu farklılıkları dikkate alırken, biz yalnızca metnin ne kadar doğru tespit edildiğine bakıyoruz, nerede konumlandığına değil. Kosinüs mesafesi bu tür durumlar için ihmal edilebilir cezalar uyguladığından, bu karşılaştırmada kullanmaya karar verdik.

Ürün seçimi

Piyasada birçok OCR ürünü bulunmaktadır. Ham metin sonuçları çıktısı verebilenlere odaklanmamız gerekiyor. Bu karşılaştırma için ürünler şu kriterlere göre seçilmiştir:

  • Metin çıkarma yeteneği. Bu karşılaştırmaya yalnızca makine tarafından okunabilir (yani yapılandırılmış veri) çıktı veren çözümleri dahil etmedik
  • Pazardaki popülerlikleri

Bu kapsamlı bir pazar incelemesi değildir ve önemli yeteneklere sahip bazı ürünleri hariç tutmuş olabiliriz. Eğer durum buysa, lütfen yorum bırakın, karşılaştırmayı genişletmekten memnuniyet duyarız.

Sınırlamalar

Metin konumu tespiti, anahtar-değer eşleştirme ve belge sınıflandırma gibi gelişmiş yetenekler bu karşılaştırmada değerlendirilmemiştir.

Örneklem büyüklüğü bir sonraki yinelemede artırılacaktır. El yazısı için OCR arıyorsanız, 50 örnekli el yazısı OCR karşılaştırmamıza bakın.

İlgileniyorsanız fatura OCR karşılaştırmamıza ve fiş OCR karşılaştırmamıza da göz atabilirsiniz.

SSS'ler

Optik Karakter Tanıma (OCR), taranmış belgeler, basılı kitaplar veya fotoğraflar gibi görüntülerdeki karakterleri ayırt etme konusunda uzmanlaşmış bir makine öğrenimi alanıdır. Olgun bir teknoloji olmasına rağmen, her türlü metni %100 doğrulukla tanıyabilen bir OCR ürünü hâlâ bulunmamaktadır. Karşılaştırdığımız ürünler arasında yalnızca birkaç ürün test setimizden başarılı sonuçlar çıkarabilmiştir.
OCR araçları, şirketler tarafından görüntülerdeki metinleri ve konumlarını tanımlamak, iş belgelerini konularına göre sınıflandırmak veya belgeler içinde anahtar-değer eşleştirmesi yapmak için kullanılır. OCR sonuçlarına dayanarak, diğer teknoloji şirketleri belge otomasyonu gibi uygulamalar geliştirir. Tüm bu iş senaryoları için, doğru metin tanıma bir OCR ürünü için kritik öneme sahiptir.

Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

Bu benchmarkı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Şevval Alper (2026) - "OCR Karşılaştırması: Metin Çıkarma / Yakalama Doğruluğu". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 29 Temmuz 2026, kaynak: https://aimultiple.com/ocr-accuracy [Çevrimiçi Kaynak]

Alper, Ş. (2026, 29 Temmuz). OCR Karşılaştırması: Metin Çıkarma / Yakalama Doğruluğu. AIMultiple. https://aimultiple.com/ocr-accuracy

@misc{alper2026,
  author = {Alper, Şevval},
  title  = {{OCR Karşılaştırması: Metin Çıkarma / Yakalama Doğruluğu}},
  year   = {2026},
  month  = jul,
  howpublished    = {\url{https://aimultiple.com/ocr-accuracy}},
  note   = {AIMultiple. Erişim tarihi: 29 Temmuz 2026}
}
Şevval Alper
Şevval Alper
Yapay Zeka Araştırmacısı
Şevval, AIMultiple'da yapay zeka kodlama araçları, yapay zeka ajanları ve kuantum teknolojileri konusunda uzmanlaşmış bir sektör analistidir.
Tam Profili Görüntüle

Yorumlar 8

Düşüncelerinizi Paylaşın

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450
Serhat Cinar
Serhat Cinar
Feb 28, 2025 at 09:34

Did you ever think of oncluding multimodal llms in your comparison, like gpt4o, llama 3.2. gemini, claude etc.?

Cem Dilmegani
Cem Dilmegani
Mar 17, 2025 at 02:59

Hi Serhat and thank you for your comment, Yes, we added those for which we have API access like Claude and GPT-4o.

DLJ
DLJ
Oct 17, 2024 at 11:14

Just stumbled on this milestone assessment update. Could you kindly elaborate further on the three revised datasets: Thanks for this work. Character Sets When someone refers to 'handriting', that can mean many things: 'handwriting style' typefaces (per Docusign, etc.), and hand-printed (block printing and mixed-case printing) as often found in combs and box delineators, and finally, cursive or longhand writing (exclusive of signatures). Character Context Structured content, semi-structured content, and unstructured content. Image Qualities (bitonal, greyscale, full colour, spatial dpi, from a scanner/cell-phone/native rendering, image 'enhancements' prior to OCR (thickening, local gamma, background dropout, sharpening, smoothing, noise removal, etc.) These can have significant impacts, and some don't realize the importance of including these benchmark differentiators.

Cem Dilmegani
Cem Dilmegani
Oct 22, 2024 at 03:15

Hi there, thank you for the detailed comment, we are updating the article to include these details.

Webster
Webster
Feb 05, 2023 at 07:24

Hello, great work! Just curious, did you use a trained Tesseract when making these testing?

Bardia Eshghi
Bardia Eshghi
Feb 06, 2023 at 12:29

Hi, Webster. Glad you enjoyed the article. The tools we tested were: ABBYY FineReader 15 Amazon Textract Google Cloud Platform Vision API Microsoft Azure Computer Vision API Tesseract OCR Engine Hope this answers your question.

Bobby
Bobby
Aug 14, 2022 at 23:54

The graph images are not working for me at the moment. Otherwise great

Cem Dilmegani
Cem Dilmegani
Aug 15, 2022 at 14:48

Thank you Bobby! We have a glitch in the CMS and we are fixing it. Apologies for the issue, it should be fixed next week.

samsun
samsun
Jun 07, 2022 at 14:10

Thanks for sharing, can you add a free OCR for everyone to use? https://www.geekersoft.com/ocr-online.html

Cem Dilmegani
Cem Dilmegani
Aug 17, 2022 at 07:46

Hi Samsun, unfortunately, we don't share all OCR providers on this page, there are thousands of them. We tried to put together the largest ones in terms of market presence. If you have evidence that your solution is one of the top 10 globally, please share it with us at info@aimultiple.com so we can consider it.

Scott
Scott
Jan 20, 2022 at 20:42

What version of Tesseract did you test with? They recently released v5.

Cem Dilmegani
Cem Dilmegani
Aug 23, 2022 at 12:01

Hi Scott, we did the benchmarking before Tesseract 5. We will redo it soon and include the versions in the methodology section as well.

Bob
Bob
Jan 12, 2022 at 15:09

This is very informative, nice work. I assume your tests used documents/images in English? I've been experimenting with OCR tools on other languages and finding relatively poor accuracy.

Cem Dilmegani
Cem Dilmegani
Jan 15, 2022 at 13:52

Exactly, all text were in English. I hear similar things about OCR on non-Latin characters. We have an Arabic speaker in the team who claims that accuracy in Arabic is much lower compared to English. We can do a benchmark on non-Latin characters if there is demand for it.

kin
kin
Jun 21, 2021 at 02:22

interesting post!!! do you have any suggestion about improving accuracy on scanned image ? i'm using tesseract right now. anyway , great work!

Cem Dilmegani
Cem Dilmegani
Jun 22, 2021 at 07:50

Thank you for the comment. There are pre-processing approaches that can be implemented to improve image quality. But such approaches may already be used in Tesseract. A detailed research into Tesseract image processing would be helpful in your case.