Sentetik belge üreticileri, büyük, elle etiketlenmiş veri kümelerine güvenmeden makine öğrenmesi modellerini eğitmeye ve değerlendirmeye yardımcı olan açıklamalı, gerçekçi belge görüntüleri oluşturur.
Üç sentetik belge üreticisi olan Genalog, DocCreator ve Tonic Textual'ı, 2.500'den fazla sentetik belge oluşturarak kıyasladık; gerçekçi düzenler, doğru sayısal veriler ve belge analizi görevleri için eğitim veri kümeleri açısından etkinliklerini karşılaştırdık.
Belge üretimi karşılaştırma sonuçları
Sonuçlar şunu gösteriyor:
- Genalog ve DocCreator, kullanışlılık ve aslına uygunluk açısından güçlü performans gösterirken, Genalog sayısal doğrulukta biraz daha iyidir.
- Tonic Textual görsel düzen gerçekçiliğinde üstündür ancak diğer alanlarda geride kalır, bu da onu gerçekçi belgeler gerektiren görevler için daha uygun hale getirir.
Metrikler hakkında daha fazla bilgi için, karşılaştırma metodolojisini okuyun.
- Kullanışlılık, sentetik veri üzerinde eğitilen modellerin gerçek belgeler üzerinde ne kadar iyi performans gösterdiğini ölçer.
- Düzen aslına uygunluğu, sentetik belgelerdeki öğelerin mekansal düzeninin gerçek belgelerle ne kadar uyuştuğunu ölçer.
- Sayısal aslına uygunluk, sentetik belgelerdeki sayısal değerlerin gerçek verilere benzer olup olmadığını kontrol eder.
Sonuçlar hakkında yorum: Performans farklılıklarını daha iyi anlamak için, karşılaştırma ayrı bir test kümesi yerine eğitim kümesi kullanılarak da yapıldı. Bu ikincil değerlendirme, modellere eğitim materyali sağlamanın yapılandırılmış ve sayısal olarak doğru çıktılar üretme becerilerini artırıp artırmayacağını belirlemeyi amaçladı.
Sonuçlar, eğitim verileri üzerinde değerlendirildiğinde bile modellerin biraz daha yüksek puanlar aldığını göstermektedir. Bu, sonuçların araçların görevin kendisini ne kadar iyi ele aldığını yansıttığını gösterir. Orta düzeydeki sonuçlar, muhtemelen kıyaslama prosedürünün kendisinden ziyade OCR kalitesindeki sınırlamalar ve eğitilmiş modelin kapasitesi tarafından etkilenmektedir.
Genalog

Genalog genel olarak en güçlü performansı gösterdi. Sentetik belgeleri model eğitimi için etkiliydi ve gerçekçi düzen öğeleri ile sayısal doğruluk arasında iyi bir denge sağladı. Oluşturulan belgeler, gerçek formların ve fişlerin yapısını ve aralığını yakından yansıtarak, onları çeşitli belge analizi görevleri için uygun hale getirdi.
DocCreator

DocCreator da yüksek kaliteli çıktılar üretti. Bu belge üreticisinin belgeleri, eğitim için neredeyse Genalog'unkiler kadar kullanışlıydı. Düzenler gerçekçiydi ve sentetik belgeler sayıların istatistiksel özelliklerini korudu. DocCreator'ın gücü, çeşitli düzen oluşturma ile bozulma modellerini bir araya getirerek çıktıları taranmış gerçek dünya belgelerine görsel olarak benzer hale getirmesinde yatmaktadır.
Tonic Textual

Tonic Textual'ın sonuçları karışıktı. Bu sentetik belge üreticisi temiz ve tutarlı düzenler üretirken, belgeler model eğitimi için daha az etkiliydi. Ayrıca, sentetik sayılar her zaman gerçek verilere istatistiksel olarak benzemiyordu. Bu, Tonic Textual'ın, düzen yapısı ve bilgi çıkarma görevleri için tam ölçekli eğitim yerine daha çok belge görünümüne veya gizliliği koruyan PII değiştirmeye odaklanan görevler için en uygun olduğunu göstermektedir.
Mart 2026'da Tonic Textual, verimliliği artırmak için varlık bağlama bileşenini LLM tabanlı bir modelden BERT tabanlı bir modele değiştirdi.1 Aynı sürüm (v391) ayrıca Veri Kümeleri sayfasında gelişmiş filtreleme ve sıralama ekledi.1
Genel İçgörü
Genalog, hem gerçekçi düzenler hem de doğru sayılar sağlayan en dengeli araçtır.
DocCreator, karmaşık ve çeşitli düzenler ile belge bozulması için güçlüdür, küçük sayısal yanlışlıklar vardır.
Tonic Textual, düzen odaklı görevler için idealdir ancak hassas sayısal veri gerektiren görevler için uygun değildir.
Metodolojiye Genel Bakış
Değerlendirme metrikleri
Oluşturulan her veri kümesi, aşağıdaki metrikler kullanılarak orijinal verilere göre puanlandı:
Kullanışlılık puanı
(KIE F1 Puanı): 0 ile 1 arasında bir puandır, yüksek olması daha iyidir. Sentetik veri üzerinde eğitilen LayoutLMv3 modelinin gerçek test kümesinde değerlendirildiğinde aldığı F1 puanı olarak tanımlanır. Yüksek bir puan, sentetik verinin gerçek veriler için oldukça etkili bir ikame olduğunu gösterir.
Aslına uygunluk puanları
Bu metrikler, sentetik belgelerin gerçek belgelere ne kadar benzediğini ölçer.
- Düzen Aslına Uygunluğu (EMD Puanı): Earth Mover’s Distance (dEMD), gerçek ve sentetik belgelerdeki sınırlayıcı kutu merkez noktalarının dağılımları arasındaki farkı ölçer. Değer 0 ile 1 arasındadır, düşük olması daha iyidir. Düşük bir puan, mekansal düzen öğelerinin iyi korunduğunu gösterir.
- Sayısal Aslına Uygunluk (K-S Mesafesi): Kolmogorov-Smirnov Mesafesi (DKS), gerçek ve sentetik verilerdeki sayısal değerlerin (örn. fiyatlar, miktarlar) kümülatif dağılım fonksiyonları (CDF'ler) arasındaki maksimum farkı ölçer. 0 ile 1 arasında değişir, düşük olması daha iyidir. Düşük bir puan, üreticinin sayıların istatistiksel özelliklerini doğru bir şekilde yeniden ürettiği anlamına gelir.
Tüm metrikler hesaplama sırasında normalleştirildi.
Veri Kümeleri
FUNSD: Gürültülü metin, karmaşık ve çeşitli düzenler ve el yazısı ek açıklamaları ile karakterize edilen 199 taranmış formdan oluşan bir koleksiyon. Geçen ay 1.500'den fazla kez indirildi. Bu, bir üreticinin yapılandırılmamış ve kusurlu verileri işleme yeteneğini test eder. 2
- Örneği ikiye ayırıyoruz: verilerin %80'i modeli eğitmek için kullanılırken, kalan %20'si eğitimden sonra test için ayrılır.
- Her araç, her orijinal belge için üç ila altı arasında sentetik belge üretti ve toplamda 2.500'den fazla sentetik belge elde edildi.
Görev değerlendirmesi
Kullanışlılığı ölçmek için, 22K GitHub yıldızı ve 750K'dan fazla indirmeye sahip popüler bir LayoutLMv3 modeli, her sentetik belge üreticisi aracı tarafından oluşturulan sentetik veriler üzerinde eğitildi.3
Ardından, bu modelin performansı, orijinal veri kümelerinden ayrılmış bir gerçek belge test kümesi üzerinde değerlendirildi. Bu, sentetik verinin gerçek dünya görevi için ne kadar yararlı olduğunu doğrudan ölçer.
Sentetik üretim araçları
Genalog
Microsoft tarafından sentetik belge görüntüleri sentetik gürültü ile oluşturmak için açık kaynaklı bir Python kütüphanesi. Metin + düzen şablonlarını (HTML + CSS ile yazılmış) alıp WeasyPrint aracılığıyla işleyerek, ardından bozulma efektleri (bulanıklık, arka taraf sızıntısı, tuz-biber gürültüsü, morfolojik işlemler) uygulayarak çalışır.4
DocCreator
İlgili referans verilerle birlikte sentetik belge görüntüleri oluşturmak için çok platformlu, açık kaynaklı bir araç. Belge Görüntüsü Analizi ve Tanıma (DIAR) araştırmalarında yaygın olarak kullanılmaktadır.5 ,6
Tonic Textual
Gerçek dünya belge formatlarında (PDF, Word) redaksiyon ve sentez için bir çözüm. Yapılandırılmamış belgeleri taradığını, adlandırılmış varlıkları (örn. PII) tanımladığını, bunları redakte ettiğini veya sentetik değerlerle değiştirdiğini ve benzer formatlarda kimliksizleştirilmiş belgeler çıkardığını iddia eder.
8 Sentetik belge bozulma yöntemi
Sentetik belge oluşturma, genellikle yapay verileri gerçek dünya belgelerine benzetmek için gerçekçi kusurlar eklemeyi içerir. Bu kusurlar veya bozulma modelleri, gürültülü, eski veya taranmış belgelerde daha iyi performans gösteren modellerin eğitilmesine yardımcı olur. Bu araçlar, yaygın belge kusurlarını simüle etmek için çeşitli fiziksel ve görsel dönüşümler uygular.6
1. Mürekkep bozulması
Bu model, eskime veya düşük kaliteli baskıdan kaynaklanan solma, leke veya çizgileri simüle eder. Gerçek mürekkep bozulmasını taklit etmek için küçük mürekkep lekeleri ekler veya harflerin bir kısmını kaldırır.
2. Hayalet karakterler
Eski baskı araçları genellikle harflerin etrafında soluk ana hatlar veya “hayalet” izleri bırakırdı. Hayalet karakter modeli, gerçek taramalardan çıkarılan kusurları basılı karakterler arasına yerleştirerek bunları yeniden oluşturur.
3. Kağıt delikleri
Yıpranmış kağıtlarda görülen yırtıklar veya delgeç izlerini taklit etmek için belgelere rastgele farklı şekil ve boyutlarda delikler eklenir.
4. Arka taraf sızıntısı
Bu efekt, mürekkebin sayfanın diğer tarafından sızmasını taklit eder. Mürekkebin kağıt üzerinden kısmen nasıl geçtiğini yeniden oluşturmak için bir belgenin hem ön hem de arka görüntülerini kullanır.
5. Uyarlanabilir bulanıklık
Belgeleri taramak veya fotoğraflamak genellikle hafif bulanıklık oluşturur. Bu model, gerçek bulanık örneklerle karşılaştırır ve Gauss filtreleri kullanarak benzer bir bulanıklık uygulayarak sonucu hafif ve gerçekçi tutar.
6. 3D kağıt deformasyonu
Belgeler tarandığında veya fotoğraflandığında bükülebilir, katlanabilir veya kıvrılabilir. Gerçek kağıtlardan alınan 3D ağlar kullanılarak, bu model bu şekilleri ve aydınlatma efektlerini yeniden oluşturarak kamera tabanlı belge analizi için modellerin eğitilmesine yardımcı olur.
7. Doğrusal olmayan aydınlatma
Tarama sırasında eşit olmayan aydınlatma, belgenin bir tarafının daha koyu görünmesine neden olabilir. Bu model, simüle edilmiş ışık açılarına ve sayfa eğriliğine göre parlaklığı ayarlayarak zayıf aydınlatmanın etkisini yeniden üretir.
8. Tuz-biber gürültüsü
Toz, kağıt dokusu veya tarama sensörü gürültüsünü simüle etmek için rastgele siyah ve beyaz pikseller ekler. Bu “tuz-biber” efekti, eski veya düşük kaliteli dijital taramaların grenli görünümünü oluşturmaya yardımcı olur.
Düzen analizi zorluklarına çözüm olarak sentetik belge üretimi
Düzen analizinin zorluğu
Belgelerin yapısını anlamak, metni okumaktan daha zordur. OCR araçları kelimeleri çıkarabilir, ancak başlıklar, tablolar veya şekiller gibi her bloğun rolünü açıklamazlar.
Bu zorlukla başa çıkmak için yöntemler geliştirilmiştir:
İlk yöntemler düzen analizi için kural tabanlıydı. Sayfaları bloklara ayırmak için geometrik kurallara ve doku analizine dayanıyorlardı. Yararlı olsalar da, bu yaklaşımlar yoğun manuel ayarlama gerektiriyordu ve iyi genelleme yapmıyordu.
Makine öğrenmesi yaklaşımları olan Destek Vektör Makineleri (SVM) ve Gauss Karışım Modelleri (GMM), verilerden öğrenerek bunu geliştirdi.7 Ancak, hala el yapımı özelliklere bağımlıydılar ve gerçek dünya belgelerinin çeşitliliğiyle başa çıkmakta zorlanıyorlardı.
Derin öğrenme alanı dönüştürdü. Evrişimli sinir ağları (CNN'ler), düzen tanımayı nesne tespiti gibi ele almayı mümkün kıldı; tabloları, şekilleri veya formülleri, modellerin doğal görüntülerde nesneleri tespit ettiği şekilde tanımladı.8 Bazı modeller ayrıca daha doğru sonuçlar için hem metin hem de görüntü özelliklerini birleştirir.
Derin öğrenmenin zorluğu: eğitmek için büyük, etiketli veri kümeleri gerektirir.
Çözüm olarak sentetik veri: Sentetik belge üretim süreci, manuel etiketleme maliyeti olmadan açıklamalı eğitim verileri oluşturmak için ölçeklenebilir bir yol sunar.
Üretken modeller artık daha gelişmiş olanaklar sunuyor. Varyasyonel otokodlayıcılar (VAE'ler), dikkat tabanlı modeller ve GAN'lar, belgelerin yapısal kalıplarını öğrenebilir ve gerçekçi yeni düzenler üretebilir.9
Sentetik Belge Üreticileri Arasındaki Temel Farklar
Karşılaştırılan üç sentetik belge üreticisi odak, çıktı kalitesi ve kullanılabilirlik açısından farklılık gösterir:
- Genalog: Hem gerçekçi düzenler hem de sayısal doğruluk için en dengeli olanıdır. HTML/CSS şablonları ve bozulma modelleri içeren Python tabanlı iş akışı, onu çeşitli belge analizi görevlerinde makine öğrenmesi modellerini eğitmek için ideal kılar.
- DocCreator: Görsel olarak karmaşık ve bozulmuş belgeler üretmede, düzen çeşitliliğini korumada güçlüdür. Sayısal olarak Genalog'dan biraz daha az doğrudur, ancak gerçekçi taranmış belge simülasyonu gerektiren görevler için etkilidir.
- Tonic Textual: Temiz, görsel olarak tutarlı düzenler ve gizliliği koruyan veri sentezinde üstündür. Sayısal doğruluk veya tam eğitim veri kümeleri için daha az uygundur, bu da onu düzen odaklı görevler veya PII değiştirme için daha iyi hale getirir.
Bu farklılıklar, birincil yaklaşımlarını yansıtır: Genalog gerçekçilik ve veri aslına uygunluğunu dengeler, DocCreator düzen çeşitliliğini ve belge bozulmasını vurgular ve Tonic Textual, görünüm ve gizliliğe öncelik verir. Bu, kullanıcıların önceliğin eğitim etkinliği, düzen gerçekçiliği veya veri kimliksizleştirme olmasına göre doğru aracı seçmelerine yardımcı olur.
Yaygın olarak kullanılan diğer sentetik belge üreticileri
YData SDK: PDF, DOCX veya HTML formatlarında yüksek kaliteli sentetik belgeler üretebilen bir sentetik belge üreticisi sunar; genellikle gizlilik uyumluluğu engellerini aşmak için kullanılır.10
DoGe: Belge YZ eğitimi için anlamlı metin, başlıklar ve tablolar içeren gerçekçi belge taramaları sentezlemek üzere özel olarak tasarlanmış açık kaynaklı bir araç.11
DocXPand: ISO standartlarına dayalı kimlik belgeleri (pasaportlar, kimlik kartları) oluşturma konusunda uzmanlaşmıştır; şablonları sahte bilgilerle ve yapay zeka tarafından oluşturulan yüzlerle doldurur.12
Daha fazla okuma
- Sentetik Veri Üretimi Karşılaştırması & En İyi Uygulamalar
- En İyi 25 Sentetik Veri Kullanım Durumu
- Sentetik Kullanıcılar Açıklandı: En İyi 7 Yapay Zeka Kullanıcı Araştırma Aracı
Bu benchmarkı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{phd2026,
author = {PhD., Ezgi Arslan,},
title = {{En İyi 3 Sentetik Belge Üreticisi Karşılaştırması}},
year = {2026},
month = mar,
howpublished = {\url{https://aimultiple.com/synthetic-document-generator}},
note = {AIMultiple. Erişim tarihi: 18 Mart 2026}
}
Yorum yapan ilk kişi olun
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.