Optik Karakter Tanıma (OCR), yapay zeka araştırmasının en eski alanlarından biridir. Günümüzde OCR teknolojisi nispeten olgunlaşmıştır ve artık yapay zeka olarak adlandırılmamaktadır; bu, Pulitzer Ödülü sahibi Douglas Hofstadter'ın şu sözüne iyi bir örnektir: Yapay zeka, henüz yapılmamış olan şeydir.1
OCR benchmark'ımızda, büyük dil model'i DeltOCR, basılı metindeki karakterlerin %95'inden fazlasını doğru okur.
OCR araçları zorlu girdilerde hâlâ insanların gerisindedir: düşük kaliteli taramalar, Nastaliq gibi bitişik Arap yazıları ve el yazısı.
OCR nedir?
OCR, basılı kitaplardan, el yazısı belgelerden veya görüntülerden karakterleri tanıyan bir teknolojidir. Bu teknoloji sayesinde işletmeler belgeleri dijital sistemlerine hızla aktarabilir ve veri analizi araçları ilgili verileri işleyebilir.
Hangi teknolojik gelişmeler günümüzün OCR'sini sağlıyor?
Bilgisayarla görme
Bilgisayarla görmede, OCR önce karakterleri tek algılar. Ardından, her karakteri tanımlamak için görüntü sınıflandırması kullanır. Bu iki adım başarılı şekilde çalışırsa OCR doğru sonuçlar üretir. Ancak karakterler bazen birbirine çok yakın olabilir ve tanınmayabilir. Bu nedenle OCR, bilgisayarla görme teknolojilerinden daha fazlasını gerektirir.
Doğal dil işleme (NLP)
OCR karakterleri tanısa da bu karakterler kelimeleri, cümleleri ve paragrafları oluşturur. NLP alanındaki araştırmalar, olasılıksal yöntemler kullanarak karakter tanıma hatalarını düzeltmeye yönelik çok sayıda algoritmanın geliştirilmesini sağlamıştır. Örneğin eksik karakterler bağlam kullanılarak tahmin edilebilir.
Denetimli derin öğrenme
OCR, performansını artırmak için derin öğrenme algoritmalarını kullanır. OCR model'leri etiketli eğitim örneklerinden öğrenir. Yeterli örnekle şunları yapabilirler:
- Farklı yazı tiplerine sahip karakterleri tanır. Her karakter çok çeşitli biçimlerde yazılabilir ve büyük etiketli bir data set, yazı tipi farklılıklarına rağmen OCR yazılımının karakterleri tanımlamasına yardımcı olur.
- Hataları algılar ve düzeltir. OCR araçları tanımlanamayan karakterleri atlayabilir. Eğitim örneklerindeki kalıpları tanıyarak OCR bu hataları algılayabilir ve hatalarını düzeltebilir.
Görüntü-dil model'leri (VLM'ler)
OCR, çok adımlı pipeline'lardan görüntü-dil model'lerine (VLM'lere) geçiyor. Geleneksel OCR sistemleri metin algılama, metin tanıma, yerleşim analizi ve tablo çıkarma için genellikle ayrı araçlar kullanır. VLM'ler bu görevleri tek bir model'de birleştirir.
Bu geçiş, aşağıdakilere sahip belgelerde performansı artırmıştır:
- Tablolar
- Formlar
- Matematiksel formüller
- Karmaşık yerleşimler
- Karışık metin ve görüntüler
2025 ve 2026'da dots.ocr, GOT-OCR 2.0, DeepSeek-OCR, PaddleOCR-VL, olmOCR ve GLM-OCR dahil olmak üzere birçok açık kaynaklı VLM ortaya çıktı. Birçoğu, belge anlama benchmark'larında güçlü sonuçlar elde ederken tek bir GPU üzerinde çalışabilir.
Mistral OCR, Gemini ve GPT model'leri gibi ticari seçenekler de belge ayrıştırma ve bilgi çıkarma için kullanılır.
Dikkate değer bir eğilim, daha küçük OCR odaklı model'lerin yükselişidir. GLM-OCR ve PaddleOCR-VL gibi model'ler, birçok genel amaçlı görüntü-dil model'ine kıyasla önemli ölçüde daha az parametre gerektirirken rekabetçi benchmark sonuçları elde eder.
OCR araçlarının sınırlamaları nelerdir?
OCR tek başına yapılandırılmış veri üretmez
OCR düzenli alanlar değil, düz metin döndürür. Bir belgeyi, örneğin faturadaki kalemler gibi yapılandırılmış verilere dönüştürmek için OCR başka araçlarla eşleştirilmelidir.
OCR'ler çoğu uygulamada hâlâ insan düzeyindeki doğruluğa ulaşamıyor.
Hatalar arasında harflerin yanlış okunması, okunamayan harflerin atlanması veya bitişik sütunlardaki ya da görsel alt yazılarındaki metinlerin birleştirilmesi yer alır. Birçok faktör OCR araçlarının performansını etkilerken hata sayısı, kullanılan yazı tipi dahil olmak üzere metnin kalitesine ve biçimine bağlıdır.
Ancak yüksek kaliteli belgelerde bile, her karakter için çeşitli belge formatları, yazı tipleri ve stiller bulunduğundan OCR araçları hata yapabilir. OCR araçlarının %100 doğruluğa ulaşmasını engelleyen sınırlamalar şu şekilde sıralanabilir:
Belgeye dayalı sınırlamalar
- Renkli arka planlar: Renkli arka plan desenleri, metin tanımayı azaltabildiği için sorun yaratabilir.
- Bulanık veya parlamalı metinler: Bulanık veya parlamalı görüntüler insanlar için olduğu kadar bilgisayarlar için de okunması zordur.
- Eğik veya yönlendirilmemiş belgeler: Görüntünün eğik olabileceği durumlarda metin hizalı olmadığı için OCR karakterleri tanımlamakta daha çok zorlanır.
Metne dayalı sınırlamalar
- Harf çeşitliliği: Bazı alfabelerdeki harf biçimlerinin tanınması daha zordur. Örneğin basılı Arapça karakterler bile bitişik biçimde olduğundan karakter tanıma zorlu hale gelir.
- Yazı tipi türlerinin ve boyutlarının çeşitliliği: Tüm farklı yazı tipi türlerini tanımak zor olsa da çok küçük/büyük karakterlerin tanımlanması da güçtür.
- Benzer görünen karakterler: Bazı karakterler o kadar benzer görünür ki OCR araçları bunları ayırt edemeyebilir. Örneğin “0” sayısı ile “O” harfini ayırt etmek zordur.
- El yazısı metin: Herkesin karakterleri yazma biçimi farklı olduğundan OCR araçları farklı stillere sahip tüm karakterleri tanımayabilir.
OCR doğruluğu nasıl ölçülür?
Doğruluk genellikle karakter hata oranı veya kelime hata oranı ile ölçülür; bu oranlar aracın kaç karakteri veya kelimeyi yanlış okuduğunu sayar. Bazı benchmark'lar ayrıca, doğru metni eşleştirmek için gereken değişiklik sayısını ölçen düzenleme mesafesini kullanır.2
OCR doğruluğu, bir metindeki karakterlerin OCR aracının hatasız şekilde çıkarabildiği kısmıyla ölçülebilir. Örneğin %99 doğruluk, 1000 karakterden 990 tanesinin doğru tanındığı anlamına gelir.
Bu sınırlamaları aşmak için devam eden araştırmalar var mı?
İlk ortaya atıldığından bu yana OCR gelişti ve artık neredeyse her büyük sektörde kullanılıyor. Hâlâ iyileştirilecek alanları olduğundan OCR alanındaki araştırmalar devam etmektedir. Bilgisayarla görme ve derin öğrenme algoritmalarındaki ilerlemeler bu teknolojinin doğruluğunun artmasına katkıda bulunmaktadır.
Şu anda OCR araçları daktilo edilmiş metinlerde %99 doğruluğun üzerine çıkabilir. Ancak şirketler olası hataları kontrol etmek için hâlâ insan müdahalesinden yararlandığından daha yüksek doğruluk düzeyleri istenmektedir.
OCR teknolojisindeki araştırmaların mevcut odağı çoğunlukla el yazısı tanıma ve bitişik metin tanıma üzerinedir.
2026'nın başında yeni açık kaynaklı OCR model'leri tanıtıldı:
PaddleOCR-VL-1.5, Ocak 2026'da tanıtıldı ve yetkili belge ayrıştırma benchmark'ında %95 doğruluğa ulaşarak en iyi model'leri geride bıraktığını iddia etti.3
RapidOCR v3.6.0, ONNX Runtime ve OpenVINO gibi yaygın çalışma zamanlarında çalışmak üzere (PaddleOCR dahil) OCR model'lerini paketler ve kolay, hızlı yerel dağıtıma odaklanır.4
El yazısı tanıma
El yazısı tanıma üzerine araştırmalar, karakterleri tanımlamak için el yazısı sürecinde oluşan dinamik hareketten de yararlanır. El yazısı tanımadaki temel sorun karakter stillerinin çeşitliliği olsa da bu alandaki OCR doğruluğu sürekli ancak yavaş şekilde iyileşmektedir.
İlgileniyorsanız el yazısı tanıma benchmark'ımızı okuyabilirsiniz.
Bitişik metin tanıma
Bitişik harflerin tanınması basılı metinlere göre açıkça daha zordur. Bu durum OCR araçlarında daha fazla hataya yol açar ve harflerin şekilleri yazılımın bunları doğru algılamasına yetecek kadar bilgi sağlamaz.
Halüsinasyon
Eski OCR karakterleri yanlış okuyabilir veya atlayabilir. VLM tabanlı OCR farklı bir şey yapabilir: sayfada hiç bulunmayan metni uydurabilir. Bu durum daha çok uzun veya yoğun belgelerde ve karmaşık şekillerde görülür. Uydurulan metin akıcı okunduğundan hataları fark etmek klasik bir yanlış okumaya göre daha zor olabilir.
İleri okuma
Bu araştırmayı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{dilmegani2026,
author = {Dilmegani, Cem and PhD., Ezgi Arslan,},
title = {{OCR teknolojisinin durumu: Öldü mü yoksa çözülmüş bir sorun mu?}},
year = {2026},
month = jun,
howpublished = {\url{https://aimultiple.com/ocr-technology}},
note = {AIMultiple. Erişim tarihi: 17 Haziran 2026}
}Değişiklik günlüğü
4 güncelleme- 2026
Araştırma odağı bölümüne PaddleOCR-VL-1.5 ve RapidOCR v3.6.0 eklendi.
Yeni bağlantılarla "Daha fazla okuma" bölümü değiştirildi.
Girişteki sonuçlar güncellendi.
- 2025
Girişe büyük dil modelleri hakkında bir cümle eklendi.
Yorum yapan ilk kişi olun
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.