Gelişmiş Görsel Dil Modelleri (VLM'ler) geleneksel görüntü tanıma modellerinin yerini alabilir mi? Bunu öğrenmek için, üç paradigmada önde gelen 16 modeli benchmark'ladık: geleneksel CNN'ler (ResNet, EfficientNet), VLM'ler ( GPT-4.1, Gemini 2.5 gibi) ve Bulut API'leri (AWS, Google, Azure).
Ortalama Hassasiyet (mAP), birincil doğruluk metriğimiz olarak kullanıldı ve gecikme süresi, maliyet ve sınıfa özgü performans analizi ile desteklendi.
Benchmark metodolojisini buradan görebilirsiniz.
Doğruluk ve gecikme süresi benchmark'ı
Benchmark'ımızda, modelleri dört boyutta değerlendirdik: gecikme süresi, ortalama hassasiyet (mAP), fiyat ve başarı oranı. Gecikme süresi, bir modelin tek bir görüntüyü işlemesi için geçen süreyi ölçerken, mAP genel sınıflandırma doğruluğunu yansıtır. Başarı oranı ise, özellikle görüntüleri yapılandırılmış veri yerine doğal dilde yorumlayan görsel dil modelleri için geçerli olmak üzere, bir modelin geçerli bir JSON çıktısı döndürüp döndürmediğini takip eder.
EfficientNet, ResNet18, ResNet50, ResNet101 ve DenseNet121 gibi geleneksel görüntü tanıma modelleri, sürekli olarak hem düşük gecikme süresi (0.03–0.2 saniye) hem de rekabetçi doğruluk (mAP 0.75–0.81) gösterir. Bunlar arasında, DenseNet121 ve ResNet18 en yüksek mAP puanlarını elde eder (sırasıyla 0.81 ve 0.80), EfficientNet ise yakından takip eder (0.78). ResNet50 ve ResNet101 bu grup içinde orta düzeyde performans gösterir (0.75 ve 0.77), ancak tüm geleneksel modeller, orta düzeyde doğruluk (mAP 0.61–0.64) ve 2–3.5 saniye arasında gecikme süreleri ile AWS Rekognition, Google Cloud Vision ve Azure Vision gibi bulut tabanlı görüntü tanıma araçlarından önemli ölçüde daha iyi performans gösterir. Bu, geleneksel modellerin hem hız hem de hassasiyette üstün olduğunu göstermektedir.
OpenAI GPT-4.1, Claude Opus 4.1, X-AI Grok 2 Vision, Meta-Llama/LLama-3.2-11B Vision Instruct ve Google Gemini 2.5 Flash dahil olmak üzere görsel dil modelleri için gecikme süreleri belirgin şekilde daha yüksektir ve 0.60 ile 0.75 arasında değişen mAP değerleriyle 1 ila 12 saniye arasında değişmektedir. Google Gemini 2.5 Flash 0.75 mAP elde ederek testimizdeki en doğru VLM olmuştur. Diğer VLM'ler arasında, GPT-4.1 0.73 mAP ile güçlü bir performans sergilerken, onu Claude Opus 4.1 (0.71) ve X-AI Grok 2 Vision (0.70) takip etmiştir. GPT-4o-mini orta düzeyde performans gösterirken (0.66 mAP), Meta-Llama Vision Instruct belirgin şekilde geride kalmıştır (0.60 mAP).
Çoğu görsel dil modeli, yalnızca %36 oranında başarılı olan Meta-Llama Vision Instruct ve sürekli olarak başarısız olan (%0 başarı) Gemini 2.5 Pro hariç, neredeyse %100 başarı ile güvenilir bir şekilde JSON çıktıları döndürür ve bu da otomatik pipeline'lardaki pratik uygulanabilirliklerini ciddi şekilde sınırlamaktadır.
Görsel dil modelleri ham hızda genellikle geleneksel görüntü tanıma modellerinin gerisinde kalsa da, Google Gemini 2.5 Flash (0.75 mAP) ve GPT-4.1 (0.73 mAP) gibi en iyi performans gösteren VLM'ler, geleneksel CNN performansına yaklaşan ve AWS Rekognition ile Azure Vision gibi bulut API'lerini önemli ölçüde aşan sınıflandırma doğruluğu elde eder. Gecikme süresi açısından, çoğu görsel dil modeli 3-4 saniye civarında kümelenir; ancak Meta-Llama, 12 saniye ile belirgin şekilde daha yavaştır ve bu da model mimarisi ile optimizasyonun etkisini vurgulamaktadır.
Genel olarak, geleneksel görüntü tanıma modelleri hem hız hem de doğrulukta hala üstündür. Bununla birlikte, VLM'ler çok modlu muhakeme ve yapılandırılmış çıktılar için umut vaat etmektedir; gecikme süresi sürekli olarak daha yüksek olmakla birlikte, en iyi modeller geleneksel CNN'lere yaklaşan ve bulut tabanlı görüntü tanıma hizmetlerini aşan bir doğruluk elde etmektedir.
Sınıfa özgü performans: modellerin başarılı olduğu ve zorlandığı yerler
Değerlendirmemiz, nesne algılamanın farklı yönlerini test eden yedi örtüşen sınıf kullandı:
- yüz: Yalnızca yüz bölgesini temsil eder. Modelin bir kişinin yüzünü algılaması gerekir; bu, küçük boyutu ve ince detayları nedeniyle zor olabilir.
- baş: Yüz hariç tüm başı kapsar. Başın şeklini ve yapısını algılamaya odaklanır.
- kasklı_baş: Kask takan başı temsil eder. Modelin hem başı hem de kaskı birlikte algılaması gerekir, bu da aralarındaki ilişkiyi tanıma yeteneğini test eder.
- kask: Bir kişi veya başın varlığına bakılmaksızın yalnızca kaskı temsil eder. Ekipman algılama için önemlidir.
- kişi: Kasklı veya kasksız bir kişinin varlığını algılar. Genel bir insan algılama sınıfı olarak hizmet eder.
- kasksız_kişi: Kask takmayan bir kişiyi temsil eder. Modelin hem insan varlığını hem de kask yokluğunu tanımlaması gerekir.
- kasklı_kişi: Kask takan bir kişiyi temsil eder. Hem insan varlığını hem de kask kullanımını ayırt etmeyi gerektirir; kasksız_kişi ile yakından ilişkilidir.
Bu örtüşen ve yakından ilişkili sınıflar, ince taneli piksel düzeyindeki farklılıkları doğrudan yakalamak yerine görsel bilgiyi doğal dil aracılığıyla yorumladıkları için görsel dil modelleri için zorlayıcı olabilir.
Geleneksel CNN performansı
- Yüz sınıfı
- En iyi performans: EfficientNet ve DenseNet121 (%100)
- En düşük: ResNet101 (%95)Yüz algılama CNN'ler genelinde oldukça doğrudur ve çoğu VLM'den daha iyi performans gösterir.
- Baş sınıfı
- En iyi: ResNet18 ve DenseNet121 (%69)
- En düşük: ResNet50 (%50)Orta düzeyde performans; CNN'ler baş algılamada yüz ve kask sınıflarına göre daha fazla zorlanır.
- Baş ve Kasklı_baş
- En iyi performans: EfficientNet ve ResNet18 (Kasklı_baş %98, Baş 65–%69)
- En düşük: ResNet50 (Baş %50, Kasklı_baş %96)CNN'ler kasklı başlarda çok iyi performans gösterir ve tüm modellerde 96–%98 doğruluk elde eder. Çıplak başların algılanması daha zordur ve daha düşük doğrulukla (50–%69), CNN'lerin kask gibi belirgin nesneleri, kasksız başlar gibi daha az belirgin bölgelere göre daha iyi ayırt ettiğini gösterir.
- Kişi sınıfı
- Tüm modeller: %0 doğruluk
- Kasksız_kişi
- En iyi: DenseNet121 (%72)
- En düşük: ResNet50 (%53)CNN'ler bu zorlu sınıfı VLM'lerden daha iyi işler ve ince taneli detayları yakalama yeteneklerini vurgular.
- Kasklı_kişi
- En iyi: EfficientNet (%98)
- En düşük: DenseNet121 (%96)Tüm modellerde yüksek doğruluk; kasklı kişiler sürekli olarak tanınır.
Görsel dil modeli performansı
- Yüz sınıfı (yüz algılama)
- En iyi performans: Claude Opus 4.1 (%83)
- En zayıf: Meta-Llama Vision Instruct (%4) ve GPT-4o-mini (%12)VLM'ler genellikle yüzler gibi küçük ve detaylı nesnelerde daha kötü performans gösterir; Meta-Llama ve GPT-4o-mini ince detaylarla zorlanır.
- Baş ve Kasklı_baş
- Baş: Claude Opus 4.1 (%96) en yüksek, Meta-Llama (%30) en düşük
- Kasklı_baş: GPT-4.1 (%99) ve Gemini 2.5 Flash (%98) en yüksek, Meta-Llama (%50) en düşükModel'ler kasklı veya kasksız baş algılamada iyi performans gösterir; Meta-Llama hariç çoğu %90+ doğruluğa ulaşır.
- Kask sınıfı
- En yüksek: Grok 2 Vision (%100), GPT-4.1 (%99), Gemini 2.5 Flash (%98)
- En düşük: Meta-Llama (%52)Kasklı ve kasksız nesneleri ayırt etmek genellikle daha kolaydır, ancak Meta-Llama düşük performans gösterir.
- Kişi sınıfı
- Tüm modeller %100 elde eder, muhtemelen büyük ve net nesneler nedeniyle.
- Kasksız_kişi
- En iyi: GPT-4.1 ve Gemini 2.5 Flash (%58)
- En düşük: Meta-Llama (%18) ve GPT-4o-mini (%29)Kask yokluğu gibi ince detayları algılamak zordur; bazı modeller belirgin nesnelerde mükemmeldir ancak nüanslı sınıflarda geride kalır.
- Kasklı_kişi
- En yüksek: GPT-4.1 (%98) ve Gemini 2.5 Flash (%98)
- En düşük: Meta-Llama (%55)Çoğu model burada çok iyi performans gösterir.
Bulut API performansı
- Yüz sınıfı
- En iyi: AWS Rekognition (%22)
- En düşük: Google Cloud Vision (%0)Yüz algılama Bulut API'leri genelinde genellikle kötüdür; yüzler gibi ince taneli ayrımlar zordur.
- Baş ve Kasklı_baş
- Baş: AWS Rekognition (%24) en iyi, Azure Vision en düşük (%0)
- Kasklı_baş: AWS Rekognition (%10) en iyi, Azure Vision (%1) en düşük Başların, özellikle kasklı veya kasksız olanların algılanması sınırlıdır; Bulut API'leri ince detaylardan ziyade daha geniş nesnelere odaklanır.
- Kask sınıfı
- En iyi: AWS Rekognition (%94)
- En düşük: Azure Vision (%37)Kask algılama bazı API'ler (AWS) için orta derecede başarılıdır, ancak sağlayıcılar arasında tutarsızdır.
- Kişi sınıfı
- Tüm modeller: %100 Tam kişi gibi büyük ve net nesneler, tüm Bulut API'leri tarafından güvenilir bir şekilde algılanır.
- Kasksız_kişi
- En iyi: Azure Vision (%78)
- En düşük: Google Cloud Vision (%26)Performans büyük ölçüdeğişir; bazı API'ler zorlu sınıfları orta derecede iyi işleyebilir.
- Kasklı_kişi
- En iyi: AWS Rekognition (%94)
- En düşük: Azure Vision (%37) Kasklı kişiler AWS tarafından güvenilir bir şekilde algılanır ancak diğer sağlayıcılar tarafından tutarsız bir şekilde algılanır.
Yüzler için, CNN'ler en yüksek doğruluğu elde eder, bunu VLM'ler takip ederken, Bulut API'leri düşük performans gösterir. Baş ve kasklı_baş sınıflarında, CNN'ler güçlü kalmaya devam eder, VLM'ler kasklı başlarda iyi ancak çıplak başlarda daha az tutarlı performans gösterir ve Bulut API'leri her ikisinde de zorlanır. Kasklar için, CNN'ler ve VLM'ler genellikle çok iyi performans gösterirken, Bulut API'leri değişken başarı gösterir. Kişi sınıfında, tüm paradigmalar tam kişileri güvenilir bir şekilde algılar. Kasksız_kişi için, CNN'ler hem VLM'lerden hem de Bulut API'lerinden daha iyi performans gösterir ve ince taneli detayları üstün şekilde işlediklerini gösterir. Son olarak, kasklı_kişi için, CNN'ler ve VLM'ler yüksek doğruluğu korurken, Bulut API'leri sağlayıcıya bağlı olarak tutarsız performans gösterir.
Hassasiyet, duyarlılık ve F1-skoru
Hassasiyet, bir modelin pozitif tahminlerinin ne kadarının gerçekten doğru olduğunu ölçer. Başka bir deyişle, şu soruyu yanıtlar: "Modelin pozitif olarak etiketlediği tahminlerin kaçı gerçekten doğru?"
Duyarlılık, modelin gerçek pozitif örneklerin ne kadarını başarıyla tanımladığını ölçer. Şu soruyu yanıtlar: "Tüm gerçek pozitif vakaların kaçını model tespit etti?"
F1-Skoru, hassasiyet ve duyarlılığın dengeli bir özetidir. Özellikle hassasiyet ve duyarlılığı dengelemek istediğinizde, hem doğruluğu hem de kapsamı yansıtan tek bir metrik sağlar.
CNN tabanlı modeller (ResNet50, ResNet101, DenseNet121), hem hassasiyette (0.93–0.95) hem de duyarlılıkta (0.91–0.94) yüksek performans gösterir ve bu da yüksek F1-skorlarıyla (0.92–0.93) sonuçlanır. Bu, hem tahminlerinde oldukça doğru olduklarını hem de gerçek pozitif örneklerin çoğunu yakalayabildiklerini gösterir. EfficientNet de yüksek bir F1-skoru (0.92) göstererek tutarlı ve güvenilir performans sunar.
Bulut API'leri (AWS Rekognition, Google Cloud Vision, Azure Vision), 0.32 ila 0.58 arasında değişen F1-skorları ile daha düşük hassasiyet ve duyarlılığa sahiptir. Bu, bulut hizmetlerinin genel amaçlı görevler için optimize edilmiş olmasına rağmen, ince taneli sınıf ayrımlarındaki doğruluklarının sınırlı olduğunu göstermektedir.
Görsel dil modelleri daha değişken performans gösterir. GPT-4.1, X-AI Grok 2 Vision ve Claude Opus 4.1 tam olarak 0.76 F1-skoru elde ederken, Google Gemini 2.5 Flash 0.80 F1-skoru ile biraz daha iyi performans gösterir. Bu modeller bazı sınıflarda güçlü performans gösterse de, genel doğrulukta genellikle CNN'lerin gerisinde kalırlar. Meta-Llama Vision Instruct, hem düşük hassasiyet hem de düşük duyarlılıkla 0.47 F1-skoruna sahiptir, bu da modelin hem doğru tahminler yapmakta hem de gerçek pozitifleri yakalamakta zorlandığı anlamına gelir.
Performans farklılıklarının olası nedenleri
CNN mimarisi avantajı
Geleneksel CNN'ler piksel düzeyinde özellik çıkarımı için özelleşmiştir ve ince taneli nesnelerin hızlı, doğru algılanmasını sağlar. Optimize edilmiş evrişimli katmanları ve hiyerarşik özellik haritaları, standart görüntü tanıma görevlerinde düşük gecikme süresi ve yüksek mAP sağlar.
VLM'lerde çok modlu ek yük
Görsel Dil Modelleri hem görüntüleri hem de metni işler, buna çapraz dikkat ve embedding hizalama adımları ekler. Bu, muhakeme ve bağlamsal çıktılar sağlar ancak inference süresini artırarak CNN'lere kıyasla daha yüksek gecikme süresine yol açar.
İnce taneli sınıf algılama
Örtüşen veya ince sınıflar (örn. kasksız_kişi ile kasklı_kişi karşılaştırması) model farklılıklarını vurgular. CNN'ler bu detayları sürekli olarak yakalar, VLM'ler belirgin nesnelerde iyi performans gösterir ancak ince ayrımlarla zorlanır ve Bulut API'leri geniş sınıflara odaklanarak doğruluğu sınırlar.
Yapılandırılmış çıktı güvenilirliği
Tutarsız JSON oluşturma VLM performansını etkiler. Düşük başarı oranlarına sahip modeller pipeline'larda daha az etkili görünürken, CNN'ler ve Bulut API'leri öngörülebilir, deterministik çıktılar üretir.
Peki hangisini seçmelisiniz?
Geleneksel CNN'ler, gerçek zamanlı video işleme, otonom araçlar veya endüstriyel güvenlik sistemleri gibi milisaniyelik yanıt sürelerinin önemli olduğu hız açısından kritik uygulamalar için idealdir. Üstün doğrulukları (mAP 0.75–0.81) ve yıldırım hızında inference'ları (0.03–0.2s) ile bu geleneksel yapay zeka modelleri, doğal dil işlemenin veya model karmaşıklığının ek yükü olmadan güvenilir, tutarlı performansa ihtiyaç duyduğunuzda mükemmeldir. CNN'ler, çok modlu modeller arasında fine-tuning'e ihtiyaç duymadan hem görüntü doğruluğu hem de verimlilik sunarak, nesne algılama gibi görsel veri ve görüntü sınıflandırma görevlerine odaklanır.
Görsel Dil Modelleri (VLM'ler), bağlamsal anlayış ve esnek çıktılar gerektiğinde parlarlar. Bu görsel dil modelleri, hem görsel hem de metinsel modalitelerde çalışarak büyük dil modellerinin görüntü girdisini metin açıklamalarıyla birlikte işlemesine olanak tanır. Doğal dil açıklamaları, görüntü alt yazısı oluşturma, görsel muhakeme görevleri ve hatta görsel soru cevaplama gerektiren uygulamalar için mükemmeldirler; görüntü metin çiftlerini aynı boyutlu uzaya hizalamak için görüntü kodlayıcılardan ve çapraz dikkat katmanlarından yararlanırlar. Daha yüksek gecikme süresini (3–12s) kabul etseniz de, görüntü anlama, görsel öğeler ve görsel talimatlara getirdikleri muhakeme yetenekleri, onları akıllı içerik denetimi, görüntü oluşturma, görsel matematiksel muhakeme veya etkileşimli görüntü asistanları gibi daha spesifik alt görevler için ideal kılar. Yüksek kaliteli eğitim verileriyle parametre verimli fine-tuning kullanarak, görsel dil modelleri (VLM'ler), görsel ve metinsel bilgileri paylaşılan bir embedding uzayı altında birleştiren güçlü makine öğrenimi modelleri haline gelir.
Bulut API'leri, zengin meta veriler ve güven puanları ile ayrıntılı, kapsamlı yanıtlar sağlar; bu da onları basit sınıflandırmanın ötesinde kapsamlı bilgiye ihtiyaç duyduğunuzda ideal kılar. Bu API'ler genellikle, kavramsal başlıklar ve ilgili fotoğraflardan oluşan büyük ölçekli genel model dataset'leri üzerinde eğitilmiş önceden eğitilmiş görüntü kodlayıcı bileşenlerine ve görsel kodlayıcılara dayanır. Yapılandırılmış JSON çıktıları, sınırlayıcı kutular, nesne yerelleştirme veya uzun video anlama gerektiren uygulamalar için en iyisidir; sağlam model eğitimi veya altyapı yönetimine ihtiyaç duymadan kullanıma hazır çözümlerdir. Doğrulukları orta düzeyde olsa da (mAP 0.61–0.66), teknik detayları ve altyapı maliyetlerini azaltarak, otomatik rapor oluşturma, anlamsal anlam çıkarma ve mevcut üretken modellerle birleşik çerçeve entegrasyonu gibi görevleri mümkün kılar.
Fiyatlandırma hesaplayıcı
Görsel dil modelleri (VLM'ler) – Temel özellikler ve avantajlar
Çok modlu muhakeme
Görsel Dil Modelleri (VLM'ler), hem görsel hem de metinsel modaliteleri aynı anda işleyebilen güçlü çok modlu modellerdir; bu da onların görsel ve metinsel bilgileri daha zengin, bağlama duyarlı bir şekilde yorumlamasına olanak tanır. Görüntü girdisini doğal dil prompt'larıyla hizalayarak, otomatik görüntü alt yazısı oluşturma, güvenlik görüntülerinde kask algılama, görsel muhakeme görevleri, görsel soru cevaplama ve hatta görsel içeriği doğal dilde açıklama gibi gelişmiş görevleri mümkün kılarlar. Yalnızca görsel verilere odaklanan geleneksel yapay zeka modellerinin aksine, VLM'ler görsel yetenekleri büyük dil modeli muhakemesi ile birleştirir ve bu da onları karmaşık alt görevler için ideal kılar.
Yapılandırılmış çıktı ve JSON oluşturma
Birçok görsel dil modeli, otomatik pipeline'lar ve görüntü özelliklerinin yanı sıra metin açıklamaları gerektiren uygulamalar için değerli olan JSON gibi yapılandırılmış çıktılar üretebilir. Benchmark'ımızda, ChatGPT-5 ve Gemini 2.5 Pro sürekli olarak başarısız olurken, Meta-Llama Vision Instruct yalnızca yaklaşık %36 oranında başarılı olmuştur. Yapılandırılmış çıktılar, özellikle görüntü asistanları için faydalıdır ve kapsamlı fine-tuning olmadan nesne algılama, nesne yerelleştirme ve makine öğrenimi modelleri için güvenilir veriler üretme gibi görevleri mümkün kılar.
İnce ayar yetenekleri
VLM'ler, nispeten küçük eğitim verileriyle parametre verimli fine-tuning'i destekler ve alana özgü görsel muhakeme görevlerine hızlı adaptasyon sağlar. Örneğin, görüntü girdisi senaryolarında kasklı ve kasksız bireyleri veya özel güvenlik ekipmanlarını ayırt etmek için fine-tune edilebilirler. Önceden eğitilmiş görüntü kodlayıcı mimarilerinden ve sağlam model eğitimi tekniklerinden yararlanarak, daha az kavramsal başlık veya görüntü metin çifti ile daha iyi genelleme yapabilirler.
Görsel dil modellerinin sınırlamaları
Gecikme süresi ve hız
Geleneksel CNN'ler veya daha basit görüntü modelleriyle karşılaştırıldığında, görsel dil modelleri tipik olarak daha yüksek gecikme süresine sahiptir; bu da uzun video anlama gibi gerçek zamanlı uygulamaları sınırlayabilir. X-AI Grok 2 Vision ve Google Gemini 2.5 Flash gibi bazı çok modlu modeller hız açısından bulut API'lerine daha yakındır, ancak Meta-Llama belirgin şekilde daha yavaştır. Bu denge, muhakeme yeteneklerini geliştiren ancak inference süresini artıran uçtan uca model tasarımları ve çapraz dikkat katmanlarından kaynaklanmaktadır.
Sınıf bazında zorluklar
Görsel dil modelleri bazen örtüşen sınıflar ve ince taneli nesne tanıma ile zorlanır; örneğin bir “baş” ile bir “kasklı_baş” veya “kasksız_kişi” ile “kasklı_kişi” arasında ayrım yapmak gibi. Bazı modeller kasklı sınıflarda iyi performans gösterirken, yüzler veya ince görsel öğeleri algılama gibi diğer görsel muhakeme görevlerinde düşük performans gösterirler. Bu, daha spesifik alt görevleri hedeflerken yüksek kaliteli eğitim verilerinin ve dikkatli fine-tuning'in önemini vurgulamaktadır.
Yapılandırılmış çıktı güvenilirliği
JSON gibi yapılandırılmış çıktıların tutarlılığı büyük ölçüdeğişir. Bazı VLM'ler güvenilir bir şekilde geçerli çıktılar üretirken, diğerleri belirli kullanım durumlarında başarısız olur ve tam otomatik pipeline'lardaki kullanışlılıklarını sınırlar. Önceden eğitilmiş görüntü kodlayıcı omurgaları ve paylaşılan embedding uzayı yaklaşımlarıyla bile, bazı modeller yapılandırılmış çıktıda anlamsal anlamı korumakta hala başarısız olur. Bu tutarsızlık, sağlam model eğitimi, dataset'teki ilgili fotoğraflar ve görsel ile dil modaliteleri için üretken modellerdeki sürekli iyileştirmelere olan ihtiyacı vurgulamaktadır.
Benchmark metodolojisi
Kapsamlı değerlendirmemizi, tüm model mimarilerinde tutarlı bir karşılaştırma sağlamak için özellikle ilk 500 görüntüyü kullanarak SHEL5K güvenlik kaskı algılama dataset'i ile gerçekleştirdik. Dataset, ince taneli nesne algılama yeteneklerini test etmek için tasarlanmış yedi örtüşen sınıf içerir: yüz, baş, kasklı_baş, kask, kişi, kasksız_kişi ve kasklı_kişi.
Veri ön işleme
Orijinal SHEL5K dataset'i ek açıklamaları XML formatında sağlandı. Bu ek açıklamaları sistematik değerlendirme için uygun çok etiketli bir CSV formatına dönüştürmek üzere bir ön işleme pipeline'ı geliştirdik:
Her görüntü, standart bir değerlendirme çerçevesi oluşturarak karşılık gelen gerçek etiketlerine eşlendi. Geleneksel CNN'ler için görüntüler, standart normalleştirme ile 224×224 çözünürlüğe ön işlendi. Görsel dil modelleri ve bulut API'leri, bağlamsal bilgiyi korumak için görüntüleri orijinal formatlarında aldı.
Geleneksel CNN değerlendirme protokolü
Geleneksel evrişimli sinir ağları (EfficientNet, ResNet varyantları, DenseNet121), yerleşik en iyi uygulamalar kullanılarak denetimli fine-tuning'den geçirildi:
Eğitim yapılandırması:
- Mimari: Değiştirilmiş sınıflandırma başlıklarına sahip önceden eğitilmiş modeller
- Kayıp fonksiyonu: Çok etiketli sınıflandırma için BCEWithLogitsLoss
- Optimize edici: 1e-4 öğrenme oranına sahip Adam
- Eğitim epoch'u: 5
- Veri bölme: %80 eğitim, %20 doğrulama
- Parti boyutu: 16
Görsel dil modeli test çerçevesi
VLM'ler, tutarlı, makine tarafından okunabilir yanıtlar ortaya çıkarmak için tasarlanmış dikkatlice yapılandırılmış prompt'lar aracılığıyla değerlendirildi. Prompt engineering yaklaşımımız, her sınıf için JSON formatında güven puanları talep etti.
API yapılandırması:
- Sıcaklık: 0.1 (tutarlılık için düşük sıcaklık)
- Maks. token: 800
- OpenRouter API entegrasyonu aracılığıyla test edilen modeller
- Hata işleme ve format doğrulama ile JSON ayrıştırma
Başarı oranı takibi: Geçerli JSON yanıtlarının yüzdesini izledik, çünkü VLM'ler bazen yapılandırılmış çıktı yerine doğal dil açıklamaları üretir. Bu metrik, pratik dağıtım fizibilitesini değerlendirmek için çok önemli olduğunu kanıtladı.
Bulut API entegrasyonu ve etiket eşleme
Bulut API'leri, genel amaçlı yapıları ve farklı taksonomileri nedeniyle benzersiz zorluklar sundu. Her hizmet için kapsamlı eşleme stratejileri geliştirdik:
Etiket eşleme stratejisi:
Bulut API'leri temel bir zorluk sunar: yedi sınıflı özel taksonomimiz için tasarlanmamışlardır. Bu hizmetler, değerlendirmemiz gereken kesin kombinasyonlar (“kasklı_kişi” veya “kasklı_baş” gibi) yerine “kişi”, “kask”, “inşaat işçisi” veya “güvenlik ekipmanı” gibi genel amaçlı etiketler döndürür.
Bu sınırlamayı ele almak için, her bulut hizmeti için çıktılarına dayalı kapsamlı eşleme sözlükleri geliştirdik. Azure Bilgisayarlı Görü eşlemesi, API'nin insanları (kişi, adam, kadın, işçi, birey), kaskları (kask, baret, güvenlik kaskı, şapka) ve yüz özelliklerini (yüz, insan yüzü, portre) tanımlayabileceği farklı yolları kapsayan 50+ etiket varyantını içeriyordu. AWS Rekognition ve Google Cloud Vision için de her birinin kendine özgü kelime dağarcığına ve etiketleme modellerine göre uyarlanmış benzer kapsamlı eşlemeler oluşturuldu.
Birleşik sınıf çıkarım mantığı:
Bulut API değerlendirmemizin en karmaşık yönü, API'lerin açıkça tanımadığı birleşik sınıfları çıkarmayı içeriyordu. Birden fazla temel öğenin bir arada ne zaman göründüğünü algılamak için kural tabanlı mantık uyguladık:
Aynı görüntüde hem “kişi” hem de “kask” yeterli güvenle algılandığında, sistem iki algılama arasındaki minimum güven puanını kullanarak (muhafazakar yaklaşım) “kasklı_kişi” sınıfını çıkarır. Benzer şekilde, “baş” ve “kask”ın aynı anda algılanması “kasklı_baş” sınıflandırmasını tetikler.
Negatif sınıflandırmalar için, bir kişi algılandığında ancak kask bulunmadığında, sistem negatif çıkarımın doğasında bulunan belirsizliği hesaba katmak için orijinal kişi güveninin %90'ı gibi hafifçe azaltılmış bir güvenle “kasksız_kişi” sınıfını çıkarır.
Bu yaklaşım, bulut API'lerinin bireysel nesneleri algılamada üstün olduğunu ancak nesne kombinasyonları hakkında ilişkisel muhakeme ile zorlandığını kabul eder; bu, ince taneli, bağlama bağlı sınıflandırma görevlerini değerlendirirken önemli bir sınırlamadır.
Değerlendirme metrikleri ve istatistiksel analiz
Birincil metrikler:
- Ortalama Hassasiyet (mAP): Sınıflar arasında makro ortalama kullanılan birincil doğruluk ölçüsü
- Hassasiyet, Duyarlılık, F1-Skoru: Genel performans değerlendirmesi için mikro ortalama alındı
- Sınıf Bazında Doğruluk: Ayrıntılı analiz için bireysel sınıf performansı
- Gecikme Süresi: Görüntü başına uçtan uca işlem süresi
- Başarı Oranı: Geçerli çıktıların yüzdesi (özellikle VLM'ler için önemlidir)
Eşik seçimi: VLM'lerin güven puanlarını ve geleneksel modellerin sigmoid ile etkinleştirilmiş logit'leri kullanmasıyla, tüm modellerde 0.5'lik bir sınıflandırma eşiği tutarlı bir şekilde uygulandı.
İstatistiksel sağlamlık: Adil bir karşılaştırma sağlamak için her model aynı görüntü setleri üzerinde tutarlı ön işleme ile değerlendirildi. Sistem varyansını hesaba katmak için gecikme ölçümlerinin birden fazla çalıştırma üzerinden ortalaması alındı.
Deneysel kontroller ve sınırlamalar
Uygulanan kontroller:
- Tüm modellerde aynı 500 görüntülük test seti
- Tutarlı değerlendirme metrikleri ve eşikler
- Standartlaştırılmış hata işleme ve zaman aşımı prosedürleri
- Hız sınırlarını yönetmek için çoklu API anahtarı rotasyonu
Bu benchmarkı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Şipi, Nazlı},
title = {{Görsel Dil Modelleri ve Görüntü Tanıma Karşılaştırması}},
year = {2026},
month = jun,
howpublished = {\url{https://aimultiple.com/vision-language-models}},
note = {AIMultiple. Erişim tarihi: 30 Haziran 2026}
}
Yorum yapan ilk kişi olun
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.