Hizmetler
Bize Ulaşın

Çok Modlu Yapay Zeka Modellerini Görsel Muhakeme Konusunda Karşılaştırın

Sıla Ermut
Sıla Ermut
Güncellenme tarihi: 20 Şub 2026

Önde gelen 15 çok modlu yapay zeka modelini 200 görsel tabanlı soru kullanarak görsel muhakeme konusunda kıyasladık. Değerlendirme iki parkurdan oluşuyordu: veri görselleştirme yorumlamasını test eden 100 grafik anlama sorusu ve örüntü tanıma ile uzamsal muhakemeyi değerlendiren 100 görsel mantık sorusu. Tutarlı ve güvenilir sonuçlar sağlamak için her soru 5 kez çalıştırıldı.

Görsel muhakeme kıyaslaması

Loading Chart

Test prosedürlerimizi öğrenmek için kıyaslama metodolojimize bakın.

gemini-3.1-pro-preview ve gemini-3-pro-preview liderlik tablosunun başında yer alıyor. Onları, bir sonraki model grubuna liderlik eden gpt-5.2, kimi-k2.5 ve gpt-5.2-pro takip ediyor. Çoğu model veri odaklı görevlerde iyi performans gösterse de, llama-4-maverick için görsel girdileri mantıksal adımlarla birleştirmede bir boşluk devam ediyor.

Görsel mantık

Görsel mantık, örüntü tanıma ve uzamsal muhakeme gerektirir. gemini-3.1-pro-preview görsel mantık testinde liderdir ve soyut muhakeme görevlerinde en yüksek performansı gösterir. Birçok model, grafik analizindeki sonuçlara kıyasla performans düşüşü gösterir. llama-4-maverick bu görevlerde bir sınırlılık göstermektedir.

Grafik anlama

Modeller, grafik yorumlamada görsel mantığa göre daha iyi yeterlilik göstermektedir. gemini-3.1-pro-preview grafik anlama testlerinde en yüksek puana sahiptir, onu yakından gemini-3-pro-preview ve gemini-2.5-pro takip ederek yapılandırılmış verileri ve görselleştirmeleri çözümlemede güçlü bir yetenek sergiler. claude-opus-4.6 ve claude-sonnet-4.6, grafikleri yorumlarken mantık puanlarına kıyasla daha yüksek sonuçlar gösterir. Veri odaklı görsel görevler, mevcut çok modlu modeller için örüntü tanımaya göre daha erişilebilirdir.

Görsel muhakeme performansının istatistiksel güvenilirliği (%95 GA)

Her model için hata payını tanımlamak ve gerçek performanslarının muhtemelen düştüğü aralığı göstermek amacıyla %95 Güven Aralıklarını (GA) 10.000 bootstrap yeniden örneklemesi yoluyla hesapladık.

LLM'lerin en başarılı olduğu ve en çok zorlandığı yerleri gösteren kıyaslama soruları

En düşük LLM başarı oranına sahip grafik sorusu

Şekil 1: 12 ay boyunca Yıldız Satış Hacimlerini gösteren, her ay için dört kümelenmiş çubuk içeren çubuk grafik (1998-2000 verileri). Her ay, yakın gruplama halinde dolu, beyaz ve çizgili çubuklar gösterir.

Not: Tüm grafikler Hitbullseye'dan alınmıştır.1

Soru: Eğer ardışık üç yılın satışları istikrarlı bir şekilde artıyor veya istikrarlı bir şekilde azalıyorsa, buna istikrarlı trend denir. Hangi aylar ardışık üç yıl boyunca istikrarlı bir artış trendi gösterir?

Örneğin, Haziran 1999'da, Gerçekleşen 1998'e göre daha düşüktü, bu bir azalış gösterir, ancak model bunu yanlışlıkla istikrarlı bir artış olarak yorumladı. Çoğu model bu soruda aynı hatayı yapıyor.

Her ay için 4 çubuk bir arada kümelendiğinde, modeller çubuktan yıla eşleme ve göreli yükseklik algısında zorlandı. Hangi çizgili/dolu/beyaz çubuğun hangi yıla ait olduğunu doğru bir şekilde ayırt edemediler, bu da çubukların yanlış sırada okunmasına veya yüksekliklerinin karıştırılmasına yol açtı.

Bu, görsel-uzamsal muhakemede temel bir sınırlılığı ortaya çıkardı: mevcut modeller, yoğun şekilde paketlenmiş çubukları doğru bir şekilde ölçmek ve sıralamak için gereken piksel hassasiyetinde algıdan yoksundu, bu da trendlerin sistematik olarak yanlış tanımlanmasına yol açtı.

En yüksek LLM başarı oranına sahip grafik sorusu

Şekil 2: 1952'den 1998'e kadar Hindistan genel seçimlerindeki seçmen katılım oranlarını gösteren çubuk grafik. Her seçim yılı için bir çubuk, çubuklar arasında net boşluk var.

Soru: Şimdiye kadarki en yüksek ve en düşük seçmen katılımı (yüzde olarak) sırasıyla hangi yıllarda olmuştur?

Tüm modeller bu soruyu doğru yanıtladı. Bu başarı, modellerin basit minimum-maksimum belirlemede, en uzun ve en kısa çubukları bulmada üstün olduğunu gösteriyor.

Kafa karıştırıcı olan kümelenmiş 4 çubuklu grupların aksine, bu grafik yıl başına net boşluklu tek bir çubuk içeriyor, bu da doğrudan görsel karşılaştırmayı basit hale getiriyor. Modeller, karmaşık çubuktan kategoriye eşleme gerektirmeyen tamamen gözlemsel görevlerde iyi performans gösterir.

En yüksek LLM başarı oranına sahip görsel mantık sorusu

Cebirsel örüntü eşleştirme gösteren iki hizalı 3x3 ızgara. Üst ızgara değişkenleri ve işlemlerini (çarpma, bölme, üsler) içerir. Alt ızgara, bazı hücreleri dolu (6, 36, 3/4) ve iki bilinmeyeni (A, B) olan sayısal değerleri gösterir. Soru B-A'yı bulmayı ister.

Şekil 3: Cebirsel örüntü eşleştirme gösteren iki hizalı 3×3 ızgara. Üst ızgara değişkenleri ve işlemlerini (çarpma, bölme, üsler) içerir. Alt ızgara, bazı hücreleri dolu (6, 36, 3/4) ve iki bilinmeyeni (A, B) olan sayısal değerleri gösterir. Soru B-A'yı bulmayı ister.

Başarı, tablo yapısında görünen net matematiksel örüntüden (a×b, c×d gibi cebirsel ilişkiler) geldi. Görsel karmaşıklık içermeyen basit ızgara düzeni, modellerin yalnızca sayısal çıkarım ve mantıksal tümdengelime odaklanmasına izin verdi.

Modeller, problemler adım adım muhakeme yoluyla çözülebilen açık matematiksel örüntüler içerdiğinde üstünlük gösterir, bu da görsel dikkat dağıtıcılar minimum olduğunda sembolik mantık ve örüntü tanımadaki güçlerini ortaya koyar.

En düşük LLM başarı oranına sahip görsel mantık sorusu

Farklı iç çizgi desenleri ve geometrik şekiller içeren dairelerden oluşan örüntü tanıma bulmacası. Üstte oklarla gösterilen iki örnek dizi, ardından beş çoktan seçmeli seçenek arasından üçüncü diziyi tamamlamayı isteyen bir soru.

Şekil 4: Farklı iç çizgi desenleri ve geometrik şekiller içeren dairelerden oluşan örüntü tanıma bulmacası. Üstte oklarla gösterilen iki örnek dizi, ardından beş çoktan seçmeli seçenek arasından üçüncü diziyi tamamlamayı isteyen bir soru.

Zorluk, soyut görsel örüntü tanıma, birden fazla örnek üzerinden geometrik dönüşüm kurallarını belirleme gerekliliğinden kaynaklanır.

Bu, şekillerin nasıl döndüğünü, dönüştüğünü ve birbirleriyle nasıl ilişki kurduğunu anlamak için saf uzamsal muhakeme gerektirir. Modeller, açık sayısal veya metinsel rehberlik mevcut olmadığında, yalnızca uzamsal örüntüler söz konusu olduğunda görsel dizilerden kural çıkarımında zorlanır.

Görsel muhakeme nedir?

Görsel muhakeme, bir modelin görüntüleri yorumlama, görsel öğeleri birbirine bağlama ve hem görsel hem de metinsel bilgilerin anlaşılmasını gerektiren soruları yanıtlama yeteneğidir. Bu yetenek, basit nesne tanımanın ötesine geçerek veri görselleştirmelerini analiz etme, uzamsal örüntüleri belirleme ve görsel öğeler arasındaki ilişkileri anlama gibi görevlere uzanır.

Kıyaslamamız, farklı bilişsel yönleri test etmek için bunu iki ayrı parkur üzerinden değerlendirdi: modellerin veri görselleştirmelerinden yapılandırılmış bilgi çıkarma yeteneklerini değerlendirmek için çubuk grafikleri, çizgi grafikleri ve dağılım grafiklerini yorumladığı grafik anlama; ve açık sayısal rehberlik olmadan soyut muhakemeyi ölçmek için örüntü tanıma bulmacaları ve uzamsal muhakeme problemleriyle uğraştığı görsel mantık. Bu ayrım, modellerin açık verileri örtük örüntülere karşı nasıl işlediğindeki temel farklılığı yansıtır.

Modeller, görsel muhakemeyi farklı mimari yaklaşımlarla gerçekleştirir. Örneğin, Cola framework'ü, her birinin altyazılar ve olası yanıtlar sağladığı birden fazla görüntü-dil modelini koordine eder, ardından merkezi bir LLM bu seçenekleri değerlendirir ve en doğru yanıtı seçer.

Şekil 5: Cola'nın görsel muhakeme için koordinatif bir dil modelinden nasıl yararlandığını gösteren grafik.2

Başka bir örnek ise, CaID yöntemini kullanarak görüntüleri bağlam farkında açıklamalara dönüştüren ve CVR-ICL prosedürü ile ilgili örnekleri seçen CVR-LLM framework'üdür. Bu framework, görüntü bilgisini metin tabanlı temsiller olarak ele alır ve LLM'nin çeşitli çok modlu görevlerde ilişkileri daha etkili bir şekilde analiz etmesini sağlar.3

LLM'lerde görsel muhakeme nasıl çalışır

LLM'ler görüntüleri doğrudan algılamaz. Görüntüleri dil modelleri için uyarlanmış yapılandırılmış temsillere dönüştüren görüntü kodlayıcılara güvenirler. Kodlayıcı nesneleri, dokuları, uzamsal ilişkileri ve görsel örüntüleri tanımlar. LLM daha sonra bir muhakeme zinciri oluşturmak için bu temsili metin sorgusuyla birleştirir.

Koordinasyon veya iyileştirme

Karmaşık görsel senaryolar için iki ana mekanizma mevcuttur: bir LLM'nin yorumları çapraz kontrol etmek için birden fazla görüntü modelinden gelen çıktıları entegre ettiği koordinasyon; ve LLM'nin eksik bilgileri belirleyen geri bildirim döngüleri aracılığıyla görüntü açıklamalarını yinelemeli olarak iyileştirdiği iyileştirme. Her ikisi de tek modellerin karmaşık senaryoları analiz edemediği sınırlılıkları ele alır.

Çok modlu muhakeme için bağlam içi öğrenme

Bazı framework'ler eğitim verilerinden benzer örnekleri getirerek modele görsel girdileri yorumlamak için şablonlar sağlar. Bu gösterimler, modelin öğrenilmiş muhakeme örüntülerini yeni problemlere uygulamasına yardımcı olur.

Nihai açıklamanın üretilmesi

LLM, görüntüyü nasıl yorumladığını, hangi görsel öğelere dayandığını ve yaptığı mantıksal bağlantıları açıklayan bir muhakeme süreciyle desteklenen bir yanıt üretir.

Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

Görsel görevlerde Zincirleme Düşünce muhakemesi

Zincirleme Düşünce (CoT) muhakemesi, görsel muhakemede önemli bir yaklaşım olarak ortaya çıkmıştır. Modeller artık bir görüntüyü bir kerede analiz etmek yerine, görsel problemleri, insanların karmaşık problemleri adım adım düşünerek çözme biçimine benzer şekilde daha küçük, sıralı adımlara bölerler.

Görsel CoT, modellerin dikkati bir görüntünün farklı uzamsal bölgelerine dinamik olarak ayarlamasını sağlar ve daha önce modellerin sabit ayrıntı düzeyinde görüntü işlemeye dayandığı önemli bir sınırlılığı ele alır. Örneğin, karmaşık bir grafiği analiz ederken, model her şeyi aynı anda anlamaya çalışmak yerine, önce eksenleri belirleyebilir, sonra bireysel veri noktalarını inceleyebilir ve son olarak trendleri karşılaştırabilir.

Bu yaklaşım, modelleri insan muhakeme örüntüleriyle daha yakından hizalamak için pekiştirmeli öğrenme ve taklit öğrenmeyi entegre eder. Bu, modellerin gördükleri hakkında aktif olarak keşfettikleri ve muhakeme yürüttükleri, pasif örüntü tanımadan aktif görsel problem çözmeye doğru temel bir değişimi temsil eder. 4

LLM'lerde görsel muhakemenin iş uygulamaları

Görsel yeteneklere sahip LLM'ler birden fazla iş senaryosunu destekleyebilir. Bu uygulamalar, modelin görüntüleri analiz etme, bunları metin verileriyle ilişkilendirme ve güvenilir içgörüler üretme yeteneğine bağlıdır.

Belge ve içerik analizi

İşletmeler diyagramlar, mühendislik çizimleri, bilimsel dergi şekilleri ve çeşitli görsel veri biçimleriyle uğraşır. Bir görsel muhakeme modeli şunları yapabilir:

  • Eksik veya yanlış öğeleri tespit etme.
  • Diyagramların alt kısmındaki veya köşelerindeki nesneleri veya işaretleri belirleme.
  • Kalite kontrolleri için metin ve görüntü bölümlerini birleştirme.
  • Daha ileri dağıtım veya raporlama için yapılandırılmış bilgi çıkarma.

Örneğin, Intuit, yaygın ABD vergi formlarında vergi beyannamelerini otomatik doldurmak için Google Cloud'un Doc YZ ve Gemini modellerini entegre ederek belge işlemede hem hızı hem de doğruluğu artırdı.5

Kalite denetimi ve operasyonlar

Üretim ve lojistikte, modeller ürünleri veya paketleri denetleyebilir. Görsel muhakeme, kusurları, hizalama bozukluklarını veya olağandışı örüntüleri tespit etmeye yardımcı olur. Model, görüntüleri bir referansla karşılaştırabilir ve neyin değiştiğine veya neyin eksik olduğuna dair bir açıklama üretebilir.

Örneğin Intel, yılda 2 milyon dolar tasarruf sağlayan yapay zeka görüntü denetim sistemleri kullanır; üreticiler azalan hurda ve daha az müşteri iadesi yoluyla tipik olarak 6-12 ay içinde ROI elde eder. 6

Perakende ve e-Ticaret

Modeller ürün görsellerini analiz eder, temel özellikleri belirler ve bunları katalog verileriyle eşleştirir. Görsel arama yetenekleri, müşterilerin bilgisayarlı görü kullanarak benzer ürünleri bulmak için görsel yüklemesine olanak tanırken, yapay zeka destekli beden öneri motorları iade oranlarını %20-%30 azaltmıştır. Bu sistemler ayrıca ürün açıklamaları ile görseller arasındaki tutarsızlıkları da tespit eder.7

Güvenlik ve izleme

Görsel muhakeme, kare dizilerini analiz ederek ve olağandışı örüntüleri tespit ederek video ve görüntü inceleme görevlerini destekler. Cambridge Industries, şantiyeler için acil onarım maliyetlerini neredeyse %50 azaltan yapay zeka destekli bir güvenlik sistemi uyguladı. 8

Pazarlama ve kullanıcı deneyimi

Görsel muhakeme, ekiplerin kullanıcıların dijital içerikle nasıl etkileşim kurduğunu anlamasına yardımcı olur. Bir model, ekran görüntülerini veya yaratıcıları değerlendirebilir ve düzen, nesne yerleşimi ve potansiyel sorunlar hakkında içgörüler sağlayabilir. Bu, özellikle farklı görsel varlık kategorilerini değerlendirirken geçerlidir.

Örneğin Comeen, daha önce içeriğin yayınlanmadan önce güncelliğini yitirmesine neden olan çok günlü, çok satıcılı süreci ortadan kaldırarak, iş yeri videoları için 40 dilde çok dilli altyazılar oluşturmak üzere tek tıklamayla Gemini YZ kullanır. 5

Kıyaslamalarımızı ve veri odaklı içgörülerimizi kaçırmayın. Düğme Google'ı açar; AIMultiple'ı seçmeniz, Google arama sonuçlarında AIMultiple'ı daha sık görmek istediğinizi onaylar.
GoogleTercih edilen kaynak olarak ekle

Karşılaştırmalı manzara: başlıca oyuncular ve yaklaşımları

Chance YZ

Chance YZ, önce görüntü anlama etrafında inşa edilen ilk ticari araçlar arasındadır. Görsel muhakeme sistemi, görüntüleri kültürel, tarihsel, işlevsel ve estetik merceklerle analiz eder. Basit etiketler atamak yerine, bir nesnenin, figürün veya sahnenin neden önemli olduğunu açıklayan yapılandırılmış içgörüler sunar; örneğin, sanat eserinin stili, sembolizmi ve tarihsel bağlamı ile konusu gibi.

Tasarım, yazılı sorgular olmadan görüntüler aracılığıyla anlam odaklı keşfi mümkün kılarak kullanıcı deneyimine öncelik verir. Bu, geleneksel bilgisayarlı görünün ötesine geçerek yorumlama, hikaye anlatımı ve insan benzeri açıklamaya doğru ilerler, bu da onu bağlamın tanımanın ötesinde değer kattığı yaratıcı endüstriler, eğitim ve turizm için özellikle ilgili kılar.9

Meta YZ

Meta'nın UniBench framework'ü, uzamsal anlama, bileşimsel muhakeme ve sayma için elliden fazla kıyaslamayı birleştirerek görsel muhakemeyi değerlendirmek için birleşik bir yaklaşım sundu. Yaklaşık altmış görüntü-dil modelini test eden Meta, veri ve model boyutunu ölçeklendirmenin algıyı iyileştirdiğini ancak muhakemeyi iyileştirmediğini, gelişmiş modellerin bile basamak tanıma ve nesne sayma gibi basit görevlerde başarısız olduğunu buldu.

Bu bulgular, görsel muhakeme ilerlemesinin nasıl ölçüldüğünü değiştirdi ve yalnızca daha büyük modellere güvenmek yerine daha yüksek kaliteli veri, hedefli hedefler ve yapılandırılmış öğrenme ihtiyacını vurguladı. İşletmeler için UniBench, dağıtımdan önce çok modlu görevler arasında muhakeme performansını karşılaştırmanın şeffaf bir yolunu sunar.10

Şekil 6: Grafik, 59 VLM'nin 53 kıyaslamadaki medyan performansını göstermekte ve ilerlemeye rağmen birçok modelin, özellikle Winoground, iNaturalist, DSPR ve diğerleri gibi görevlerde hala şans seviyesine yakın performans gösterdiğini ortaya koymaktadır (mavi: sıfır atışlı medyan; gri: şans seviyesi).11

OpenAI

OpenAI, görüntü manipülasyonunu muhakemelerine entegre ederek görüntülerle düşünebilen o3 ve o4-mini modelleriyle görsel muhakemeyi ilerletti. Analiz sırasında, insanların diyagramları veya çizimleri yorumlarken görsel dikkatlerini nasıl ayarladığını yansıtarak, ilgili ayrıntılara odaklanmak için görüntüleri yakınlaştırır, kırpar veya döndürürler.

Grafik yorumlama, görsel problem çözme ve matematiksel muhakeme gibi çok modlu kıyaslamalarda test edilen modeller, doğruluk ve bağlamsal anlamada net kazanımlar gösterdi. Ancak sonuçlar, tutarsız muhakeme ve ara sıra algısal hatalar da dahil olmak üzere sınırlılıkları da ortaya çıkardı ve görsel muhakeme sistemlerinde güvenilirliğin devam eden zorluğunun altını çizdi.

Şekil 7: Grafik, yüksek “muhakeme çabası” ayarları altında değerlendirilen tüm modellerin sonuçlarını göstermektedir.12

Akademik ve açık araştırma çabaları

VisuLogic: Çok Modlu Büyük Dil Modellerinde Görsel Muhakemeyi Değerlendirmek için Bir Kıyaslama

Bu makale, çok modlu modellerin görsel muhakeme görevlerindeki performansını değerlendirmek için bir kıyaslama olan VisuLogic'i tanıtmaktadır. Uzamsal ilişkiler, bileşimsel mantık ve nesne sayma dahil olmak üzere çeşitli muhakeme türlerini kapsayan elliden fazla veri kümesini birleştirir.

Yazarlar düzinelerce mevcut modeli analiz eder ve boyut veya veri ölçeğini artırmanın görüntü tanımayı iyileştirdiğini ancak muhakemeyi iyileştirmediğini bulur. Modeller genellikle nesneler arasındaki ilişkileri anlamadan örüntüleri tespit eder. Makale, anlamlı ilerleme için muhakemeye özgü eğitimin, daha iyi veri kalitesinin ve ayrıntılı değerlendirmenin gerekli olduğunu vurgular.

VisuLogic, araştırmacıların ve işletmelerin yalnızca algı metriklerine güvenmek yerine muhakeme yeteneklerini analiz etmelerine yardımcı olan birleşik bir framework sunar ve bu da onu çok modlu muhakeme sistemlerini değerlendirmek için değerli bir kaynak haline getirir.13

Yanıtlamadan Önce Açıkla: Bileşimsel Görsel Muhakeme Üzerine Bir İnceleme

Bu inceleme, modellerin doğru bir yanıta ulaşmak için görsel ve metinsel ipuçlarını nasıl birleştirdiğine odaklanarak bileşimsel görsel muhakemeye yönelik mevcut yaklaşımları gözden geçirir. Yapılandırılmış muhakeme yerine tanımaya dayanan mevcut yöntemlerdeki zayıflıkları belirler.

Yazarlar, modellerin yanıtlamadan önce açıklama yapması için eğitmeyi, her muhakeme sürecinin şeffaf ve yorumlanabilir olmasını sağlamayı önerir. Modellerin diyagramları, şekilleri ve nesne ilişkilerini daha iyi anlayabilmesi için görsel ve dilsel temsilleri hizalamaya yönelik teknikleri tartışırlar.

Makale, hizalanmış ve açıklanabilir muhakemenin çok modlu görevlerde güvenilirliği ve yorumlanabilirliği artırdığı sonucuna varır. Görsel muhakeme araştırmasının geleceğinin, açıklama tabanlı öğrenmeyi model tasarımına entegre etmeye bağlı olduğunu vurgular.14

LLM görsel muhakeme yeteneklerindeki zorluklar

Görsel muhakemedeki ilerleme, aynı zamanda dikkate alınması gereken teknik ve etik zorlukları da beraberinde getirir.

Güvenilirlik önemli bir endişe kaynağı olmaya devam ediyor. Kıyaslamamızda görüldüğü gibi, modeller yoğun şekilde paketlenmiş görselleştirmelerde zorlanmakta, karmaşık grafiklerde çubuktan yıla eşleme ve göreli yükseklik algısında başarısız olarak trend tanımlamada sistematik hatalara yol açmaktadır. Gelişmiş modeller bile basamak tanıma ve nesne sayma gibi basit görevlerde başarısız olmakta ve veriyi ölçeklendirmek algıyı iyileştirirken muhakemeyi iyileştirmemektedir.

Önyargı ve yorumlama sorunları yaygındır. Görsel muhakeme modelleri, görüntüleri yorumlarken eğitim verilerinde mevcut olan önyargıları öğrenir ve yansıtır. Modeller, cinsiyet, ırk, yaş ve engellilik önyargıları da dahil olmak üzere eğitim verilerindeki kültürel varsayımları ve stereotipleri yansıtır. Örneğin, bir görüntüdeki kişilerin mesleklerini tahmin ederken veya senaryoları yorumlarken, bu önyargılar sonuçları çarpıtabilir.

Güven için açıklanabilirlik kritiktir. Modeller, özellikle önyargılı çıktıların zarara yol açtığı sağlık hizmetleri, işe alım ve ceza adaleti gibi yüksek riskli uygulamalarda, muhakeme süreçlerini şeffaf bir şekilde açıklamalıdır.

Kıyaslama metodolojisi

Tüm modeller, standartlaştırılmış parametrelerle OpenRouter API'si aracılığıyla değerlendirildi: sıcaklık 0,8 olarak ayarlandı ve muhakeme yeteneklerini sınırlamamak için maksimum token parametresi ayarlanmadı. Modellere yalnızca tek bir harfle (A-E) açıklama yapmadan yanıt vermeleri talimatı verildi, ancak bazı modeller yine de ayrıntılı muhakeme sağladı, biz de nihai yanıtları çıkarmak için bunları ayrıştırdık. Değerlendirme tüm modellerde aynı anda paralel olarak yürütüldü. Tutarlı ve güvenilir sonuçlar sağlamak için her soru 5 kez çalıştırıldı.

Kıyaslama, iki kategoriye ayrılmış 200 sorudan oluşuyordu: Çubuk grafikleri, çizgi grafikleri, dağılım grafiklerini ve karmaşık veri görselleştirmelerini kapsayan Grafik Anlama (100 soru) ve örüntü tanıma, uzamsal muhakeme ve matematiksel görsel mantığı test eden Görsel Mantık (10 soru). Tüm sorular, modellerin görüntüleri analiz etmesini ve doğru yanıtı seçmesini gerektiren, beş seçenekli (A-E) çoktan seçmeli formatta sunuldu.

Questions:

1. Grafik anlama Modelleri, çeşitli veri görselleştirmelerinden bilgi çıkarma, yorumlama ve analiz etme yetenekleri konusunda değerlendirdik:

  • Çubuk grafikler: Yatay ve dikey konfigürasyonlar, yığılmış ve gruplandırılmış formatlar
  • Çizgi grafikleri: Tekli ve çok serili trendler, zaman serisi verileri
  • Dağılım grafikleri: Korelasyon analizi, etiketli eksenlerle örüntü tanımlama
  • Pasta grafikler: Yüzde dağılımları ve orantısal muhakeme
  • Karmaşık görselleştirmeler: Kombinasyon grafikleri, çift eksenli grafikler ve çok panelli gösterimler

2. Görsel mantık Soyut muhakeme ve uzamsal zekayı şu yollarla değerlendirdik:

  • Örüntü tanıma: Dizileri belirleme ve görsel örüntüleri tamamlama
  • Uzamsal muhakeme: 3B görselleştirme, küp açılımları ve geometrik dönüşümler
  • Matematiksel mantık: Sayısal örüntüler, cebirsel muhakeme ve kombinatorik
  • Soyut düşünme: Sembol manipülasyonu, mantıksal tümdengelim ve kural çıkarımı

Soru formatı

  • Yanıt formatı: Çoktan seçmeli (A, B, C, D, E)

Bu benchmarkı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Sıla Ermut and Nazlı Şipi (2026) - "Çok Modlu Yapay Zeka Modellerini Görsel Muhakeme Konusunda Karşılaştırın". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 20 Şubat 2026, kaynak: https://aimultiple.com/visual-reasoning [Çevrimiçi Kaynak]

Ermut, S., & Şipi, N. (2026, 20 Şubat). Çok Modlu Yapay Zeka Modellerini Görsel Muhakeme Konusunda Karşılaştırın. AIMultiple. https://aimultiple.com/visual-reasoning

@misc{ermut2026,
  author = {Ermut, Sıla and Şipi, Nazlı},
  title  = {{Çok Modlu Yapay Zeka Modellerini Görsel Muhakeme Konusunda Karşılaştırın}},
  year   = {2026},
  month  = feb,
  howpublished    = {\url{https://aimultiple.com/visual-reasoning}},
  note   = {AIMultiple. Erişim tarihi: 20 Şubat 2026}
}
Sıla Ermut
Sıla Ermut
Endüstri Analisti
Sıla Ermut, AIMultiple'da yapay zeka model'leri, yapay zeka altyapısı, yapay zeka yönetişimi ve kurumsal yapay zeka uygulamalarını kapsayan bir endüstri analistidir. Araştırmaları çoğunlukla yapay zekanın pazarlama, sağlık hizmetleri, tedarik zincirleri ve sürdürülebilirlik alanlarındaki kullanımına odaklanmaktadır. Daha önce proje yönetimi ve danışmanlık firmalarında işe alım uzmanı olarak çalışmıştır. Sıla, Sosyal Psikoloji alanında Yüksek Lisans ve Uluslararası İlişkiler alanında Lisans derecesine sahiptir.
Tam Profili Görüntüle
Araştıran
Nazlı Şipi
Nazlı Şipi
Yapay Zeka Araştırmacısı
Nazlı, AIMultiple'da veri analistidir. Çeşitli sektörlerde veri analizi konusunda önceden deneyime sahip olup, karmaşık dataset'leri eyleme dönüştürülebilir içgörülere dönüştürme üzerine çalışmıştır.
Tam Profili Görüntüle

Yorum yapan ilk kişi olun

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450