Finansal muhakeme görevlerinde Büyük Çok Modlu Modellerin (LMM'ler) performansını, özenle seçilmiş bir veri kümesi kullanarak değerlendirdik. Yüksek kaliteli finansal örneklerin bir alt kümesini analiz ederek, modellerin finansal alanda çok modlu verileri işleme ve muhakeme yeteneklerini değerlendiriyoruz.
Metodoloji bölümü, kullanılan veri kümesi ve değerlendirme çerçevesi hakkında ayrıntılı bilgiler sunmaktadır.
Büyük çok modlu modelleri keşfedin ve onları büyük dil modelleriyle karşılaştırın.
Modeller neden farklı performans gösterdi?
Başarı oranlarındaki farklılık, her modelin çok modlu finansal görevleri nasıl işlediğindeki farklılıkları yansıtır. Kıyaslama, metin ile grafikler ve yapılandırılmış belgeler gibi finansal görsellerin entegrasyonunu gerektiren FinMME veri kümesindeki örnekleri kullandığı için, performans büyük ölçüde bir modelin mimarisine, eğitim kalitesine ve çok modlu uyumuna bağlıdır.
Model mimarisi ve parametre tasarımı
Modeller, metin ve görüntü kodlayıcılarını nasıl birleştirdikleri, aktif parametre sayısı ve uzman yönlendirme karmaşıklığı açısından farklılık gösterir.
- Llama 4 Maverick, örneğin, daha büyük bir uzman tabanlı tasarım kullanarak daha güçlü muhakeme sağlar.
- Daha küçük veya verimlilik odaklı modeller, çok modlu muhakeme için hizalanmış daha az parametreye sahiptir, bu da performansı sınırlar.
Bu mimari farklılıklar, her modelin sayısal ilişkileri, grafik yapılarını ve alana özgü görselleri ne kadar iyi yorumlayabildiğini etkiler.
Eğitim verisi kapsamı
Bazı modeller kapsamlı çok modlu veri kümeleri üzerinde eğitilirken, diğerleri öncelikle genel amaçlı verilere dayanır.
- Claude 4 ve Qwen 2.5 ailelerindeki modeller, büyük ölçekli görsel ve metin verilerini bünyelerine katarak sayısal ve görsel ipuçlarını hizalama yeteneklerini geliştirir.
- Daha sınırlı çok modlu derlemler üzerinde eğitilen modeller, finansal grafikler ve yapılandırılmış diyagramlarla zorlanır.
Eğitim verisi, bir modelin çapraz modlu finansal kavramları ne kadar güvenilir bir şekilde ele aldığını doğrudan etkiler.
Çapraz modlu muhakeme için ince ayar
Kıyaslama, görüntü yorumlama ile metin tabanlı muhakeme arasında koordinasyon gerektirir.
- Claude 4 modelleri, grafikler ve diyagramlar içeren görevlerde güçlü olarak tanımlanmaktadır.
- Özel çapraz modlu ince ayara sahip olmayan modeller, görsel özellikleri doğru bir şekilde tespit edebilir ancak bunları finansal dil veya mantıkla ilişkilendirmede yetersiz kalabilir.
Bir modelin ince ayar stratejisi, analiz sırasında metinsel ve görsel sinyalleri birleştirme yeteneğini etkiler.
Bağlam işleme kapasitesi
Finansal örnekler genellikle, çok parçalı grafikler veya uzun açıklamalar gibi birlikte okunması gereken birden çok öğe içerir.
- Daha geniş bağlam pencerelerine sahip modeller, uzun girdiler boyunca ilişkileri koruyabilir.
- Daha kısıtlı modeller bağımlılıkları kaçırabilir, bu da birden çok görsel ve metinsel bileşeni izlemeyi gerektiren görevlerde doğruluğu azaltır.
Bağlam penceresi boyutu, bir modelin nicel ve görsel ayrıntılar arasındaki hizalamayı ne kadar iyi koruduğunu etkiler.
Model boyutu ve verimlilik öncelikleri
Bazı modeller, yüksek karmaşıklıktaki muhakeme yerine hafif dağıtım için kasıtlı olarak tasarlanmıştır.
- Phi-4 multimodal ve benzeri modeller verimliliğe öncelik verir, bu da çok modlu işlem derinliğini sınırlar.
- Daha büyük modeller, ince taneli grafik anlayışı içeren muhakeme görevleri için daha yüksek kapasiteyi korur.
Bu ödünleşim, daha küçük modeller için daha düşük puanlara yol açar.
Görsel anlayıştaki farklılıklar
Değerlendirme, doğru grafik okuma, finansal belgelerde nesne tanımlama ve görsel ayrıntıların çıkarılmasını gerektiren görevleri içerir.
- Qwen 2.5-VL varyantları gibi gelişmiş görsel işlem hatlarına sahip modeller, bu görevleri daha etkili bir şekilde yönetir.
- Diğerleri genel görüntüleri iyi işleyebilir ancak yapılandırılmış finansal görsellerle tutarsız performans gösterir.
Görsel muhakeme gücü, FinMME tarzı örneklerdeki sonuçları güçlü bir şekilde etkiler.
Değerlendirme veri kümesinin özellikleri
Veri kümesi, genel amaçlı görevler yerine çok modlu finansal muhakemeye odaklanmaktadır.
- Finansal, sayısal veya grafik tabanlı görevler için eğitilmiş veya ince ayar yapılmış modeller daha iyi performans gösterir.
- Alan maruziyeti olmayan genelci modeller, finansal veri kümelerinde daha düşük hassasiyet sergiler.
Veri kümesi uzmanlaşması, performansı çapraz modlu muhakemenin kalitesine karşı daha hassas hale getirir.
Açık kaynaklı büyük çok modlu modeller nelerdir?
Açık kaynak LMM'ler ve GitHub yıldız sayıları:
Grafik, çeşitli açık kaynaklı LMM'lerin GitHub popülerliğinin arttığını ve bazı modellerin piyasaya sürüldükten kısa bir süre sonra hızlı bir şekilde benimsendiğini göstermektedir.
DeepSeek tarafından geliştirilen Janus-Serisi, Janus-Pro'nun 27 Ocak 2025'te piyasaya sürülmesinden sonraki günlerde binlerce GitHub yıldızı kazandı ve benzer sayılara aylar içinde ulaşan rakiplerini geride bıraktı. Bu hızlı yükseliş, Janus-Pro'nun başarısından kaynaklandı ve DeepSeek-R1 tarafından yaratılan ivmeden etkilendi.
- Gemma 3, Google tarafından: Gemma 3, Gemini 2.0 teknolojisinden türetilen, hafif, son teknoloji açık modellerden oluşan bir ailedir. Bu modeller, gelişmiş metin ve görsel muhakeme yetenekleri, 128k-token'lik bağlam penceresi, işlev çağrı desteği ve optimize edilmiş performans için nicelenmiş sürümler sunar. Görüntü güvenliği için ShieldGemma 2'yi içerir ve çeşitli araçlar ile dağıtım seçeneklerini destekler.1
- Janus-Pro , DeepSeek tarafından: Janus-Pro, hem metin hem de görüntü anlama ve üretme amacıyla tasarlanmış Janus modelinin gelişmiş bir sürümüdür. Optimize edilmiş bir eğitim stratejisi, genişletilmiş eğitim verisi ve daha büyük model boyutu sunarak çok modlu yeteneklerini geliştirir.2
- Qwen2.5-VL, Alibaba tarafından: Qwen2.5-VL, Alibaba'nın Qwen2.5 dil modelinin çok modlu bir uzantısıdır ve hem metin hem de görüntü anlama için tasarlanmıştır. Büyük ölçekli ön eğitim (18T token'a kadar), genişletilmiş bağlam penceresi (128K token'a kadar), iyileştirilmiş talimat takibi ve sağlam çok dilli destek sunarak görüntü altyazılama ve görsel soru yanıtlama gibi görevler için uygundur. 3
- Qwen2.5-VL serisine dayanarak Alibaba, ince taneli görüntü anlama ve muhakeme yeteneklerini geliştiren 32B parametreli bir VL modeli olan Qwen2.5-VL-32B-Instruct'i optimize etti ve açık kaynaklı hale getirdi. Bu, görüntü ayrıştırma, içerik tanıma ve görsel mantık çıkarımı gibi görevlerde iyileştirilmiş performans ve ayrıntılı analiz sağlar.4
- CLIP (Contrastive Language–Image Pretraining), OpenAI tarafından: CLIP, görüntüleri doğal dil bağlamında anlamak için tasarlanmıştır. Sıfır atışlı görüntü sınıflandırması gibi görevleri yerine getirebilir; bu sayede metin açıklamalarını anlayarak, açıkça eğitilmemiş olduğu kategorilerde bile görüntüleri doğru bir şekilde sınıflandırabilir.5
- Qwen2.5-VL serisine dayanarak Alibaba, ince taneli görüntü anlama ve muhakeme yeteneklerini geliştiren 32B parametreli bir VL modeli olan Qwen2.5-VL-32B-Instruct'i optimize etti ve açık kaynaklı hale getirdi. Bu, görüntü ayrıştırma, içerik tanıma ve görsel mantık çıkarımı gibi görevlerde iyileştirilmiş performans ve ayrıntılı analiz sağlar.6
- Flamingo, DeepMind tarafından: Flamingo, hem dil hem de görsel anlayışın güçlü yanlarından yararlanmak üzere tasarlanmış olup, hem metin hem de görüntülerden bilgi yorumlamayı ve entegre etmeyi gerektiren görevleri yerine getirme yeteneğine sahiptir.7
Şekil 1: Chip Huyen'den alınmış bir örnek8
Önde gelen LMM'ler nelerdir?
Genel amaçlı LLM'ler UI & API özellikleri
Satıcılar, karşılaştırılabilirlik, veri mevcudiyeti ve güncellik temelinde en popüler çok modlu LLM'ler arasından seçilmiştir.
Token başına fiyatlarıyla LMM'ler:
En uygun modeli seçmek için bütçeniz, gerekli yetenekler ve performans seviyesi ve özel kullanım durumunuz için gereken girdi/çıktı token'ları hacmi gibi faktörleri göz önünde bulundurun.
LLM fiyatlandırması hakkında daha fazla bilgi edinin.
Çok modlu modellerdeki en son gelişmeler nelerdir?
Çok modlu modellerdeki son gelişmeler, yapay zeka geliştirmede yeni yetenekler ve verimlilikler getirmiştir.
Video öncelikli çok modlu temel modeller
Video öncelikli çok modlu temel modeller, üst düzey altyazılar veya özetler üretmenin ötesine geçerek videolar içindeki kanıtları açıkça konumlandırmayı öğrenmektedir.
Ne olduğunu söylemek yerine, ne zaman olduğunu (zaman damgaları) ve nerede olduğunu (nesneler veya bölgeler etrafındaki sınırlayıcı kutular) belirleyebilirler.
Uzamsal-zamansal temellendirmeye doğru olan bu geçiş, video anlayışını daha kesin ve doğrulanabilir hale getirir. Ayrıca, kesin anları bulma, nesneleri izleme, doğal dil kullanarak videoları düzenleme ve robotik ile güvenlik açısından kritik sistemleri destekleme gibi görevleri mümkün kılar.
Örneğin, Vidi9 , video anlama ve düzenleme için büyük çok modlu modellere odaklanan ByteDance tarafından geliştirilen açık kaynaklı bir projedir.
Repo, görüntü, ses ve metni girdi olarak alarak aşağıdaki gibi görevleri gerçekleştiren bir model ailesinin (ör. Vidi-7B, Vidi1.5-9B, Vidi2 ve Vidi2.5) kodunu ve kaynaklarını barındırır:
- Zamansal getirme (bir metin sorgusuyla eşleşen video zaman dilimlerini bulma)
- Uzamsal-zamansal temellendirme (sınırlayıcı kutularla nesneleri belirleme)
- Video soru yanıtlama
Mistral 3 çok modlu öncü sürüm
Mistral AI, Mistral 3 adlı yeni bir açık kaynaklı yapay zeka modeli ailesi geliştirdi. Mistral 3 paketi, hem öncü düzeyde çok modlu/çok dilli modelleri hem de buluttan uç noktaya kadar çeşitli cihazlarda ve hatta tek bir GPU'da çalışacak şekilde tasarlanmış daha küçük, verimli modelleri içerir.
İzin verici bir açık kaynak lisansı (Apache 2.0) altında yayınlanan bu modeller, gelişmiş yapay zekaya erişimi demokratikleştirmeyi, özelleştirme ve dağıtım esnekliği sağlamayı ve ABD ile Çin'in en son teknolojilerde gerisinde kalma endişelerinin olduğu Avrupa'nın yapay zeka geliştirmedeki konumunu güçlendirmeyi amaçlamaktadır.10
Açık kaynaklı MoE görü-dil modelleri
Kimi-VL (Moonshot AI tarafından), Mixture-of-Experts (MoE) mimarisiyle oluşturulmuş, metin, görüntü ve videoyu birleştiren görevlerde hesaplamayı verimli tutarak performans gösteren açık kaynaklı çok modlu bir görü-dil modelidir.
16 milyar toplam parametre omurgasına sahiptir ancak çıkarım sırasında genellikle ~2.8 milyar parametre etkinleştirir, bu da yetenek ile maliyeti dengelemeye yardımcı olur.
Kimi-VL, gelişmiş çok modlu muhakeme, uzun bağlam anlayışı (~128 K token'a kadar) ve ajan tarzı etkileşimler için tasarlanmıştır ve video anlama, optik karakter tanıma (OCR), matematiksel muhakeme ve çoklu görüntü görevleri gibi kıyaslamalarda daha büyük modellerle iyi rekabet eder.
Kimi-VL-A3B-Thinking gibi varyantlar, zincirleme düşünce ve muhakeme görevleri için daha da ince ayarlanmıştır; MoonViT görsel kodlayıcı ise yüksek çözünürlüklü girdi anlayışını destekler.
Şekil 2: Kimi-VL mimari tasarımı.11
Anthropic'in Claude 4 Serisi
Anthropic'in Claude 4 serisi, gelişmiş görsel anlayışı metin tabanlı muhakeme motoruyla entegre ederek görüntüyü doğrudan problem çözme iş akışlarına yerleştirir.
Claude 4 modelleri, MMMU gibi çok modlu muhakeme kıyaslamalarında, özellikle grafikler, diyagramlar ve karmaşık görsel verilerin yorumlanmasında güçlü performans gösterir. Claude Opus 4.1'in ayırt edici bir özelliği, görüntülerdeki estetik nitelikleri değerlendirme yeteneğidir; bu, tanımanın ötesine geçerek daha incelikli değerlendirmelere uzanır.
Bu yetenekler, Claude'un ajansal işlevleriyle birleşerek, seriyi karışık metin ve görsellerle raporlardan araştırma sentezleme veya görsel maketlerin analizi yoluyla arayüz tasarımına yardımcı olma gibi görevler için etkili kılar.
Google'ın Gemini 3
Google, Gemini 3'ü Kasım 2025'te yayınladı; Gemini 3 Pro hemen kullanıma sunulurken, Gemini 3 Deep Think modu kısa süre sonra Google AI Ultra abonelerine sunuldu. Gemini 3, Google tarafından en zeki ve en yetenekli çok modlu modeli olarak konumlandırılmış olup, tek bir mimari içinde metin, görüntü, video, ses ve kod için yerel destek sunar.
Gemini 3 Pro, 1 milyon token'lık bağlam penceresiyle gelir ve MMMU-Pro'da %81 ve Video-MMMU'da %87,6 dahil olmak üzere çok modlu kıyaslamalarda güçlü sonuçlar elde eder. Piyasaya sürüldüğünde LMArena Liderlik Tablosu'nda 1501 Elo puanıyla zirveye yerleşti ve yüksek lisans düzeyinde muhakeme için GPQA Diamond'da %91,9 ve ajansal kodlama görevleri için SWE-bench Verified'da %76,2 puan aldı.
Gemini 3 Deep Think, en zorlu görevlerde performansı daha da artıran gelişmiş bir muhakeme modudur; İnsanlığın Son Sınavı'nda (araçlar olmadan) %41,0 ve ARC-AGI-2'de %45,1 puan almıştır. Gemini 3'ün yanı sıra Google, tarayıcı kontrolü için Gemini 3 ile Gemini 2.5 Computer Use modelini ve görüntü düzenleme modeli Nano Banana'yı eşleştiren, modelin görevleri otonom olarak planlamasına, kodlamasına ve doğrulamasına olanak tanıyan uçtan uca yazılım geliştirme iş akışları sağlayan ajansal bir geliştirme platformu olan Google Antigravity'yi de piyasaya sürdü.12
GPT-5, OpenAI tarafından
GPT-5, metin, ses, görüntü ve video genelinde gelişmiş yerel çok modluluk sunar. Büyük ölçüde eklentilere dayanan önceki sistemlerin aksine, GPT-5 bu modaliteleri birleşik bir mimari içinde entegre ederek daha pürüzsüz etkileşim sağlar. Model, çeşitli girdi türlerine esnek bir şekilde uyum sağlar ve bunlar arasında geçiş yapabilir.
Dikkate değer bir özellik, kullanıcı talimatlarına göre ton, hız ve stili ayarlayabilen Gerçek Zamanlı Ses Modu'dur. Bu, daha doğal ve uyarlanabilir bir sohbet deneyimi yaratır. Görsel işleme de iyileştirilmiş olup, görüntüler, diyagramlar ve grafiklerin yorumlanması veya oluşturulmasındaki halüsinasyonları azaltmıştır. Bir diğer ilerleme ise, sistemin önceki girdileri hatırlamasını ve uzun etkileşimler boyunca bağlamı korumasını sağlayan bellek yetenekleridir.
Bu geliştirmeler, GPT-5'i özellikle duyusal engelleri olan bireyler için erişilebilir çok modlu arayüzler açısından değerli kılmaktadır.
Google DeepMind'ın robotik odaklı çok modlu modelleri
Google DeepMind, robotik sistemlerde görüntü, dil ve eylemi entegre etmek üzere uyarlanmış modeller olan Gemini Robotics ve Gemini Robotics-ER'yi geliştirdi. Bu modeller, robotların kağıt katlama veya şişe kapaklarını sökme gibi yapılandırılmamış ortamlarda görevler gerçekleştirmesini sağlar.
Bu modellerin önemli bir özelliği güvenlik mekanizmalarıdır. Eylemleri gerçekleştirmeden önce sistem, riskleri en aza indirmek ve görevlerin uygun şekilde ele alınmasını sağlamak için yerleşik kontroller gerçekleştirir. Bu yaklaşım, robotikteki önemli zorluklardan birini ele alır: gelişmiş yapay zeka muhakemesini güvenli ve güvenilir gerçek dünya uygulamasıyla birleştirmek.
Llama 4 Scout ve Llama 4 Maverick, Meta AI tarafından
Llama 4 Scout, 17 milyar aktif parametreye ve 16 uzmana sahip çok modlu bir modeldir. Bu model, önceki nesil Llama modellerinden daha iyi performans gösterir ve tek bir H100 GPU üzerinde çalışmak üzere tasarlanmıştır. Büyük miktarda bilgiyi işlemek için 10 milyon token'lık bağlam penceresi sunar. Kıyaslama sonuçları, Llama 4 Scout'un, geniş çapta raporlanan bir dizi kıyaslamada Gemma 3, Gemini 2.0 Flash-Lite ve Mistral 3.1'den daha iyi sonuçlar elde ettiğini göstermektedir.
Llama 4 Maverick, 17 milyar aktif parametreye ve 128 uzmana sahip çok modlu bir modeldir. Bu model, bir dizi kıyaslamada GPT-4o ve Gemini 2.0 Flash'ı geride bırakarak kendi sınıfında en iyi performans gösteren model olarak sunulmaktadır. Daha az aktif parametre kullanırken muhakeme ve kodlamada DeepSeek v3 ile karşılaştırılabilir performans elde eder. Llama 4 Maverick'in deneysel bir sohbet sürümü, LMArena platformunda 1417 ELO puanına ulaşmıştır.
4o Görüntü Üretimi, OpenAI tarafından
OpenAI'nin GPT-4o'ya yerleştirilmiş en yeni görüntü üretme modeli, metin ve görsel oluşturmayı birleşik bir sistemde entegre eder. Bu çok modlu yetenek, GPT-4'ün metin tabanlı bilgi ve sohbet bağlamından yararlanırken görüntüler oluşturmasını sağlayarak dil ve görseller arasında bir etkileşim yaratır.
Çok turlu üretim sayesinde, kullanıcılar aşağıdaki şekillerde gösterildiği gibi görüntüleri sohbet yoluyla iyileştirebilir. Model, tutarlılığı korumak için önceki metin girdileri ve yüklenen görüntüler üzerine inşa edilir. Kullanıcı tarafından sağlanan görselleri analiz ederek ve bağlam içinde öğrenerek, GPT-4o belirli ayrıntılara uyum sağlar ve bağlama duyarlı görüntüler üretme yeteneğini geliştirir.
Şekil 3: Referanslar kullanarak bir çizimin oluşturulmasını istemek ve görüntü için metin özellikleri hakkında talimat vermek.
Şekil 4: Çizimden bir fotoğraf oluşturulmasını istemek ve onu bir sahneye yerleştirmek.13
Qwen3-VL, Alibaba tarafından
Alibaba'nın Qwen3-VL serisi, Eylül 2025'ten itibaren piyasaya sürülen, Qwen3 dil modeline daha derin görsel algı ve muhakeme yetenekleri ekleyerek inşa edilmiştir. Bu aile, 2B ile 32B parametre arasında yoğun varyantlar ve 235B toplam parametreye (22B aktif) kadar Mixture-of-Experts varyantları içerir; tümü Apache 2.0 lisansı altında yayınlanmıştır.
Temel özellikler arasında 256K yerel bağlam penceresi (1 milyon token'a genişletilebilir), 32 dilde genişletilmiş çok dilli OCR, uzamsal muhakeme ve somut yapay zeka için 2B ve 3B nesne temellendirme, saniye düzeyinde indeksleme ile saatlerce video anlama ve GUI kontrolü için görsel ajan yetenekleri bulunur.
Thinking varyantları STEM ve çok modlu muhakeme için ayarlanmışken, Instruct varyantları belge ayrıştırma, grafik çıkarma ve görsel soru yanıtlama gibi genel görü-dil görevlerini hedefler.
Gemma 3, Google tarafından
Google'ın Gemma 3'ü, Gemini 2.0 modellerinden gelen teknolojiye dayanmaktadır. Farklı donanım gereksinimleri için dört boyutta (1B, 4B, 12B ve 27B) gelir ve 128k-token'lık bağlam penceresi sunar. Gemma 3, tek hızlandırıcılı kurulumlarda iyi performans gösterir ve metin ve görsel muhakeme, işlev çağrı ve 35'ten fazla dil desteği içerir; 140'tan fazla dil için ön eğitim yapılmıştır. Nicelenmiş sürümler model boyutunu ve hesaplama ihtiyaçlarını azaltır. ShieldGemma 2 sistemi, içerik güvenliği sınıflandırması sağlar.
Phi-4-multimodal, Microsoft tarafından
Microsoft'ın Phi-4-multimodal'i, konuşma, görüntü ve metni birleşik bir mimaride işleyen 5.6B parametreli bir modeldir. Farklı girdi türleri arasında bağlama duyarlı etkileşimler için çapraz modlu öğrenmeyi kullanır. Model, ayrı işlem sistemleri gerektirmeden birden çok girdi biçimini işler ve cihaz dağıtımı ve uç bilişim için tasarlanmıştır. Uygulamalar arasında akıllı telefon yapay zekası, otomotiv sistemleri ve çok dilli hizmetler bulunur.
Büyük çok modlu model (LMM) nedir?
Büyük çok modlu model, birden çok veri modalitesini işleyebilen ve anlayabilen gelişmiş bir yapay zeka modeli türüdür. Bu çok modlu veriler, metin, görüntü, ses, video ve potansiyel olarak diğerlerini içerebilir. Çok modlu bir modelin temel özelliği, bu farklı veri kaynaklarından gelen bilgileri, genellikle eş zamanlı olarak entegre etme ve yorumlama yeteneğidir.
Bunlar, metinle ve aynı zamanda çeşitli veri türleriyle çalışabilen büyük dil modellerinin (LLM'ler) daha gelişmiş sürümleri olarak anlaşılabilir. Ayrıca, çok modlu dil modeli çıktıları metinsel, görsel, işitsel ve benzeri olacak şekilde tasarlanmıştır.
Çok modlu dil modelleri, yapay genel zekaya ulaşma yolunda bir sonraki adım olarak kabul edilmektedir.
Çok modlu yapay zeka ajanı nedir?
Çok modlu yapay zeka ajanları, görüntüler, videolar ve metin dahil olmak üzere çeşitli veri türlerini kullanarak dünya ile etkileşime girecek şekilde tasarlanmış sistemlerdir; bu sayede hem dijital hem de fiziksel ortamlarda çalışabilirler. Çok modlu modeller, bu ajanların temel bileşenidir ve onlara çeşitli kaynaklardan bilgi algılama ve anlama yeteneği kazandırır.
Örneğin, Magma gibi modeller, çok modlu veri kümeleri üzerinde ön eğitim sırasında Set-of-Mark ve Trace-of-Mark gibi tekniklerle elde edilen görü-dil anlayışı ve uzamsal zeka kullanır.
Bu, ajanın video içeriğini anlamaktan ve soruları yanıtlamaktan, kullanıcı arayüzlerinde gezinmeye ve robotları kontrol etmeye kadar çeşitli görevleri yerine getirmesini sağlar ve farklı veri modalitelerinden yararlanarak çok modlu modellerin yapay zeka ajanlarına kazandırdığı çok yönlü yetenekleri gösterir. Aşağıdaki çizim, Magma'nın görevleri yerine getirmek için robot yörüngelerini planlamasını ve uzamsal zekasını eylem halinde sergilemesini göstermektedir.14
LMM'ler ve LLM'ler arasındaki fark nedir?
1. Veri modaliteleri
- LMM'ler: Birden çok türde veri girdisini veya modaliteyi anlamak ve işlemek üzere tasarlanmışlardır. Buna metin, görüntü, ses, video ve bazen duyusal veriler gibi diğer veri türleri dahildir. LMM'lerin temel yeteneği, bu farklı veri biçimlerini, genellikle eş zamanlı olarak entegre edebilme ve anlamlandırabilme yetenekleridir.
- LLM'ler: Bu modeller, metinsel verileri işleme ve üretme konusunda uzmanlaşmıştır. Öncelikle büyük metin derlemleri üzerinde eğitilirler ve çeşitli bağlamlarda insan dilini anlama ve üretme konusunda ustadırlar. Görüntü veya ses gibi metin dışı verileri doğası gereği işlemezler.
2. Uygulamalar ve görevler
- LMM'ler: Çok modlu yapıları sayesinde, bu modeller farklı veri türleri arasında bilgi anlamayı ve entegre etmeyi gerektiren görevlere uygulanabilir. Örneğin, bir LMM kapsamlı bir anlayış kazanmak için bir haber makalesini (metin), beraberindeki fotoğrafları (görüntüler) ve ilgili video klipleri analiz edebilir.
- LLM'ler: Uygulamaları, makale yazma, dil çevirme, soru yanıtlama, belge özetleme ve metin tabanlı içerik oluşturma gibi metin içeren görevler etrafında yoğunlaşmıştır.
Büyük çok modlu modellerin veri modaliteleri nelerdir?
Metin
Bu, kitaplar, makaleler, web sayfaları ve sosyal medya gönderileri gibi her türlü yazılı içeriği içerir. Model, çeviri, özetleme ve soru yanıtlama gibi doğal dil işleme görevleri de dahil olmak üzere metinsel içeriği anlayabilir, yorumlayabilir ve üretebilir.
Görüntüler
Bu modeller görsel verileri analiz edebilir ve üretebilir. Buna fotoğrafların, illüstrasyonların ve diğer grafik temsillerin içeriğini ve bağlamını anlamak dahildir. Görüntü sınıflandırma, nesne tespiti gibi görevler ve metinsel açıklamalardan görüntü üretme bu kategoriye girer.
Ses
Bu, ses kayıtlarını, müziği ve konuşulan dili kapsar. Modeller, konuşmayı tanımak, müzik, ortam sesleri ve diğer işitsel girdileri anlamak üzere eğitilebilir. Konuşmayı yazıya dökebilir, sözlü komutları anlayabilir ve hatta yapay konuşma veya müzik üretebilirler.
Video
Hem görsel hem de işitsel öğeleri birleştiren video işleme, hareketli görüntüleri ve onlara eşlik eden sesleri anlamayı içerir. Bu, video içeriğini analiz etmeyi, videolardaki eylemleri veya olayları tanımayı ve video klipler oluşturmayı içerebilir.
Mevcut büyük çok modlu dil modellerinin çoğu metin ve görüntü işleyebilirken, gelecekteki araştırmalar ses ve video veri girdilerini de dahil etmeyi amaçlamaktadır.
Büyük çok modlu modeller nasıl eğitilir?
Büyük çok modlu modellerin (LMM'ler) eğitimi, büyük dil modellerinin (LLM'ler) eğitiminden birkaç önemli açıdan önemli ölçüde farklılık gösterir:
1. Veri toplama ve hazırlama
- LLM'ler: LLM eğitim veri kaynakları için dilsel çeşitliliğe vurgu yaparak kitaplar, web siteleri ve yazılı kaynaklardan gelen metin verilerine odaklanır.
- LMM'ler: Metin, görüntü, ses ve video verileri gerektirir. Farklı biçimler nedeniyle toplama daha karmaşıktır. Veri etiketleme ve modaliteler arası hizalama esastır.
2. Model mimarisi tasarımı
- LLM'ler: Sıralı metin işleme için optimize edilmiş transformatör mimarileri kullanır.
- LMM'ler: Birden çok sinir ağı türünü (görüntüler için CNN'ler, metin için transformatörler) bu modaliteleri bağlamak için mekanizmalarla entegre eden daha karmaşık mimariler kullanır.
3. Ön eğitim
- LLM'ler: Maskelenmiş dil modelleme gibi teknikler kullanarak metin derlemleri üzerinde ön eğitim yapar.
- LMM'ler: Birden çok veri türünde ön eğitim yapar, metni görüntülerle ilişkilendirmeyi veya video dizilerini anlamayı öğrenir.
4. İnce ayar
- LLM'ler: Belirli görevler için özelleştirilmiş metin veri kümelerinde ince ayar yapılır.
- LMM'ler: Farklı veri türleri arasındaki ilişkileri kurmak için hem modüle özgü veri kümelerinde hem de çapraz modlu veri kümelerinde ince ayar gerektirir.
5. Değerlendirme ve yineleme
- LLM'ler: Değerlendirme metrikleri, akıcılık, tutarlılık ve ilgililik dahil olmak üzere dil anlama ve üretme görevlerine odaklanır.
- LMM'ler: Görüntü tanıma, ses işleme ve çapraz modlu entegrasyon yeteneklerini kapsayan daha geniş metriklerle değerlendirilir.
LMM'ler nasıl çalışır?
Büyük çok modlu modeller, eğitim süreçleri, tasarımları ve işleyişleri bakımından büyük dil modelleriyle benzerlikler taşır. Aynı transformatör mimarisini ve eğitim stratejilerini kullanırlar. Büyük çok modlu modeller şunlar üzerinde eğitilir:
- Metin verileri
- Metin açıklamalarıyla milyonlarca veya milyarlarca görüntü
- Video klipler
- Ses parçacıkları
- Kod gibi diğer girdi verileri
Bu eğitim, birden çok veri modalitesinin eşzamanlı öğrenilmesini içerir ve modelin şunları yapabilmesini sağlar:
- Bir kedi fotoğrafını tanımak
- Bir ses klibindeki bir kelimeyi belirlemek
- Metnin ötesindeki kavramları ve duyusal ayrıntıları anlamak
Bu sayede kullanıcılar şunları yükleyebilir:
- Bir görüntü yükleyerek:
- Neler olduğuna dair bir açıklama almak
- Görüntüyü, metin veya görüntü oluşturmak için bir prompt'lar parçası olarak kullanmak
- Görüntünün belirli öğeleri hakkında takip soruları sormak
- Görüntüdeki metni farklı bir dile çevirmek (örneğin, Menü)
Şekil 5: Tanımlaması için ChatGPT'ye bir kedi görüntüsü yükleme.
- Grafikler ve çizelgeler yükleyerek:
- Ne gösterdikleri hakkında karmaşık takip soruları sormak
- Tasarım maketi yükleyerek:
- Onu oluşturmak için gerekli HTML ve CSS kodunu almak.
Şekil 6: Görüntüyü Wes Anderson film tarzında istemek. ChatGPT, prompt'lar bir görüntü üretme modeline (DALL·E gibi) besler; model isteği yorumlar ve stilize edilmiş görüntüyü üretir.
Eğitim sürecinden sonra, modeller sağlıksız stereotipleri ve toksik fikirleri bünyelerine katabilir. Bunları iyileştirmek için şu teknikler kullanılabilir:
- İnsan geri bildirimi ile pekiştirmeli öğrenme (RLHF)
- Denetleyici yapay zeka modelleri
- Kırmızı takım (modelin dayanıklılığını test etme) kullanılabilir.
Ayrıca, yapay zeka yönetişim araçları ve yapay zeka uyumluluk çözümleri olarak işlev gören sorumlu yapay zeka araçları, yapay zeka envanter optimizasyonuna da olanak tanıyarak yapay zeka önyargısı ve diğer etik ikilemleri önlemeye yardımcı olabilir. İşte bu araçların üretken yapay zeka telif hakkı endişelerini nasıl ele aldığına dair bir örnek:
Şekil 7: ChatGPT, telif haklarını korumak için içerik politikası yönergeleri nedeniyle isteğimi reddediyor.
Amaç, şunları işleyebilen işlevsel bir çok modlu sistem geliştirmektir:
- Metinden görüntüye sentez
- Görüntü altyazılama
- Metin tabanlı görüntü getirme
- Görsel soru yanıtlama.
Bu şekilde, çok modlu yapay zeka çeşitli modaliteleri entegre ederek hem dil hem de görüntü içeren görevler için gelişmiş yetenekler sunar.
Büyük dil modellerinin sınırlamaları nelerdir?
- Veri gereksinimleri ve önyargı: Bu modeller eğitim için devasa, çeşitli veri kümelerine ihtiyaç duyar. Ancak, bu tür veri kümelerinin mevcudiyeti ve kalitesi bir zorluk olabilir. Ayrıca, eğitim verisi önyargılar içeriyorsa, modelin bu önyargıları miras alması ve muhtemelen güçlendirerek adaletsiz veya etik olmayan sonuçlara yol açması olasıdır.
- Hesaplama kaynakları: Büyük çok modlu modellerin eğitilmesi ve çalıştırılması önemli hesaplama kaynakları gerektirir, bu da onları pahalı hale getirir ve daha küçük kuruluşlar veya bağımsız araştırmacılar için daha az erişilebilir kılar.
- Yorumlanabilirlik ve açıklanabilirlik: Karmaşık yapay zeka modellerinde olduğu gibi, nasıl karar verdiklerini anlamak zor olabilir. Bu şeffaflık eksikliği, özellikle sağlık hizmetleri veya kolluk kuvvetleri gibi hassas uygulamalarda kritik bir sorun olabilir.
- Modalitelerin entegrasyonu: Farklı veri türlerini (metin, görüntü ve ses gibi) her bir modalitenin nüanslarını gerçekten anlayacak şekilde etkili bir biçimde entegre etmek son derece zordur. Model, bu modaliteleri birleştirmekten kaynaklanan bağlamı veya insan iletişiminin inceliklerini her zaman doğru bir şekilde kavrayamayabilir.
- Genelleme ve aşırı uyum: Bu modeller geniş veri kümeleri üzerinde eğitilirken, eğitim verilerinden önemli ölçüde farklılık gösteren yeni, görülmemiş verilere veya senaryolara genelleme yapmakta zorlanabilirler. Tersine, eğitim verilerine aşırı uyum sağlayarak gürültü ve anormallikleri örüntü olarak yakalayabilirler.
Daha fazla bilgi edinmek için, üretken ve dil modelleriyle ilişkili zorluklar ve riskleri keşfedin.
LMM'ler için kıyaslama metodolojisi
Finansal çok modlu muhakeme yeteneklerini değerlendirmek için tasarlanmış kapsamlı bir kıyaslama olan FinMME veri kümesinin15 bir alt kümesini kullanarak Büyük Çok Modlu Modellerin (LMM'ler) performansını değerlendirdik. FinMME, 18 finansal alan ve 6 varlık sınıfında 11.000'den fazla yüksek kaliteli finansal örnek içermekte olup, LMM'leri finansal alanda değerlendirmek için sağlam bir çerçeve sunmaktadır.
Bu kıyaslama için, modellerin çok modlu finansal verileri işleme ve muhakeme yeteneklerini analiz etmek üzere FinMME veri kümesinden özenle seçilmiş 100 örnek kullandık.
Yasal Uyarı
Bu değerlendirme, LMM'leri kıyaslamak için daha büyük bir veri kümesinden özenle seçilmiş 100 örnekten oluşan bir alt küme kullanmıştır. Model performansının kapsamlı bir değerlendirmesi için, tam kıyaslama veri kümesindeki tüm örneklerin dikkate alınması gerekir.
Sonuç
Büyük çok modlu modeller (LMM'ler), metin, görüntü, ses ve video gibi farklı veri türlerini entegre ederek büyük dil modellerinin (LLM'ler) yalnızca metin yeteneklerini aşmaktadır. Meta AI'nin Llama 4'ü, OpenAI'nin GPT-4o'u ve Alibaba'nın Qwen2.5-VL'si gibi gelişmelerle LMM'ler, görsel muhakemeden bağlama duyarlı görüntü üretimine kadar daha zengin uygulamalar sağlamaktadır.
Ancak, karmaşıklıkları, yüksek hesaplama talepleri ve veri entegrasyonu ile önyargı azaltmayla ilgili zorluklar engel olmaya devam etmektedir. LMM'ler evrimleştikçe, daha çok yönlü yapay zeka ajanlarının yolunu açarak yapay genel zekaya bizi bir adım daha yaklaştırmaktadır. Kuruluşlar ve araştırmacılar için doğru modeli seçmek, performans, maliyet ve kullanım durumunun özel ihtiyaçları arasında bir denge kurmayı içerir.
Bu benchmarkı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{dilmegani2026,
author = {Dilmegani, Cem},
title = {{Büyük Çok Modlu Modeller (LMM'ler) ve LLM'ler}},
year = {2026},
month = may,
howpublished = {\url{https://aimultiple.com/large-multimodal-models}},
note = {AIMultiple. Erişim tarihi: 22 Mayıs 2026}
}







Yorum yapan ilk kişi olun
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.