Finansal akıl yürütme görevlerinde Büyük Multimodal Model'lerin (LMM'lerin) performansını özenle seçilmiş bir dataset kullanarak değerlendirdik. Yüksek kaliteli finansal örneklerin bir alt kümesini analiz ederek, model'lerin finans alanındaki multimodal verileri işleme ve bu verilerle akıl yürütme yeteneklerini değerlendiriyoruz.
metodoloji bölümü kullanılan dataset ve değerlendirme framework'ü hakkında ayrıntılı bilgiler sunar.
Büyük multimodal model'leri keşfedin ve bunları büyük dil model'leriyle karşılaştırın.
Model'ler neden farklı performans gösterdi?
Başarı oranlarındaki farklılık, her model'in çok modlu finansal görevleri işleme biçimindeki farklılıkları yansıtır. Benchmark, FinMME dataset'indeki, metin ile grafikler ve yapılandırılmış belgeler gibi finansal görsellerin bütünleştirilmesini gerektiren örnekleri kullandığından, performans büyük ölçüde model'in mimarisine, eğitim kalitesine ve multimodal hizalamasına bağlıdır.
Model mimarisi ve parametre tasarımı
Model'ler metin ve görüntü encoder'larını birleştirme biçimleri, etkin parametre sayıları ve uzman yönlendirmelerinin karmaşıklığı bakımından farklılık gösterir.
- Llama 4 Maverick, örneğin, daha güçlü akıl yürütme sağlayan daha büyük uzman tabanlı bir tasarım kullanır.
- Daha küçük veya verimlilik odaklı model'ler, multimodal akıl yürütmeye hizalanmış daha az parametreye sahiptir ve bu da performansı sınırlar.
Bu mimari farklılıklar, her model'in sayısal ilişkileri, grafik yapılarını ve alana özgü görselleri ne kadar iyi yorumlayabildiğini etkiler.
Eğitim verisi kapsamı
Bazı model'ler kapsamlı multimodal dataset'ler üzerinde eğitilirken, diğerleri öncelikle genel amaçlı verilere dayanır.
- Claude 4 ve Qwen 2.5 ailelerindeki model'ler büyük ölçekli görsel ve metin verilerini içerir; bu da sayısal ve görsel ipuçlarını hizalama yeteneklerini geliştirir.
- Daha sınırlı multimodal külliyat üzerinde eğitilen model'ler finansal grafikler ve yapılandırılmış diyagramlarda zorlanır.
Eğitim verisi, bir model'in çapraz-modlu finansal kavramları ne kadar güvenilir şekilde ele aldığını doğrudan etkiler.
Çapraz-modlu akıl yürütme için fine-tuning
Benchmark, görüntü yorumlama ile metin tabanlı akıl yürütme arasında koordinasyon gerektirir.
- Claude 4 model'leri, grafikler ve diyagramlar içeren görevlerde güçlü olarak tanımlanmaktadır.
- Özel çapraz-modlu fine-tuning'i olmayan model'ler görsel özellikleri doğru tespit edebilir ancak bunları finansal dile veya mantığa bağlamada yetersiz kalır.
Bir model'in fine-tuning stratejisi, analiz sırasında metinsel ve görsel sinyalleri birleştirme yeteneğini etkiler.
Bağlam işleme kapasitesi
Finansal örnekler genellikle çok parçalı grafikler veya uzun açıklamalar gibi birlikte okunması gereken birden çok öğe içerir.
- Daha geniş bağlam penceresine sahip model'ler uzun girdiler arasındaki ilişkileri koruyabilir.
- Daha kısıtlı model'ler bağımlılıkları kaçırabilir; bu da birden çok görsel ve metinsel bileşenin izlenmesini gerektiren görevlerde doğruluğu azaltır.
Bağlam penceresi boyutu, bir model'in niceliksel ve görsel ayrıntılar arasındaki hizalamayı ne kadar iyi sürdürdüğünü etkiler.
Model boyutu ve verimlilik öncelikleri
Bazı model'ler yüksek karmaşıklıkta akıl yürütme yerine hafif dağıtım için bilinçli olarak tasarlanmıştır.
- Phi-4 multimodal ve benzer model'ler verimliliğe öncelik verir ve multimodal işleme derinliğini sınırlar.
- Daha büyük model'ler, ince ayrıntılı grafik anlayışı gerektiren akıl yürütme görevleri için daha yüksek kapasiteye sahiptir.
Bu ödünleşim, daha küçük model'ler için daha düşük puanlarla sonuçlanır.
Görsel anlamadaki farklılıklar
Değerlendirme, doğru grafik okuma, finansal belgelerde nesne tanımlama ve görsel ayrıntıların çıkarılmasını gerektiren görevleri içerir.
- Qwen 2.5-VL varyantları gibi gelişmiş görsel pipeline'lara sahip model'ler bu görevleri daha etkili şekilde yönetir.
- Diğerleri genel görüntüleri iyi ele alabilir ancak yapılandırılmış finansal görsellerde tutarsız performans gösterir.
Görsel akıl yürütme gücü, FinMME tarzı örneklerdeki sonuçları güçlü şekilde etkiler.
Değerlendirme dataset'inin özellikleri
Dataset, genel amaçlı görevlerden ziyade multimodal finansal akıl yürütmeye odaklanır.
- Finansal, sayısal veya grafik tabanlı görevler için eğitilen veya fine-tune edilen model'ler daha iyi performans gösterir.
- Alan deneyimi olmayan genel model'ler finansal dataset'lerde daha düşük hassasiyet sergiler.
Dataset uzmanlaşması, performansı çapraz-modlu akıl yürütmenin kalitesine karşı daha duyarlı hale getirir.
Açık kaynaklı büyük multimodal model'ler nedir?
Açık kaynak LMM'ler ve GitHub yıldız sayıları:
Grafik, çeşitli açık kaynak LMM'lerin GitHub popülaritesinin arttığını ve bazı model'lerin piyasaya sürüldükten kısa süre sonra hızla benimsendiğini göstermektedir.
DeepSeek tarafından geliştirilen Janus-Series, Janus-Pro'nun 27 Ocak 2025'te piyasaya sürülmesinden sonraki günlerde binlerce GitHub yıldızı kazandı; rakiplerinin benzer sayılara ulaşması aylar sürdü. Bu hızlı yükseliş Janus-Pro'nun başarısından kaynaklandı ve DeepSeek-R1 tarafından yaratılan ivmeden etkilendi.
- Gemma 3 by Google: Gemma 3, Gemini 2.0 teknolojisinden türetilen hafif, son teknoloji açık model'lerden oluşan bir ailedir. Bu model'ler gelişmiş metin ve görsel akıl yürütme yetenekleri, 128k token'lık bağlam penceresi, işlev çağırma desteği ve optimize edilmiş performans için nicemlenmiş sürümler sunar. ShieldGemma 2'yi içerir ve çeşitli araçları ve dağıtım seçeneklerini destekler.1
- Janus-Pro by DeepSeek: Janus-Pro, hem metni hem de görüntüleri anlamak ve üretmek üzere tasarlanmış Janus model'inin gelişmiş bir sürümüdür. Optimize edilmiş bir eğitim stratejisine, genişletilmiş eğitim verilerine ve daha büyük model boyutuna sahiptir; bu da multimodal yeteneklerini artırır.2
- Qwen2.5-VL by Alibaba: Qwen2.5-VL by Alibaba, Qwen2.5 dil modelinin hem metin hem de görüntü anlayışı için tasarlanmış multimodal bir uzantısıdır. Büyük ölçekli ön eğitim (18T token'a kadar), genişletilmiş bağlam penceresi (128K token'a kadar), geliştirilmiş talimat takibi ve güçlü çok dilli destek sunar; bu da onu görüntü altyazılama ve görsel soru yanıtlama gibi görevler için uygun hale getirir. 3
- Qwen2.5-VL serisinin üzerine inşa edilen Alibaba, Qwen2.5-VL-32B-Instruct'ı optimize etti ve açık kaynak olarak yayımladı; bu, gelişmiş ince ayrıntılı görüntü anlayışı ve akıl yürütme içeren 32B'lik bir VL modelidir. Bu, görüntü ayrıştırma, içerik tanıma ve görsel mantık çıkarımı gibi görevlerde daha iyi performans ve ayrıntılı analiz sağlar.4
- CLIP (Contrastive Language–Image Pretraining) by OpenAI: CLIP, görüntüleri doğal dil bağlamında anlamak için tasarlanmıştır. Sıfır atışlı görüntü sınıflandırma gibi görevleri gerçekleştirebilir; bu sayede metin açıklamalarını anlayarak açıkça eğitilmediği kategorilerde bile görüntüleri doğru şekilde sınıflandırabilir.5
- Qwen2.5-VL serisinin üzerine inşa edilen Alibaba, Qwen2.5-VL-32B-Instruct'ı optimize etti ve açık kaynak olarak yayımladı; bu, gelişmiş ince ayrıntılı görüntü anlayışı ve akıl yürütme içeren 32B'lik bir VL modelidir. Bu, görüntü ayrıştırma, içerik tanıma ve görsel mantık çıkarımı gibi görevlerde daha iyi performans ve ayrıntılı analiz sağlar.4
- Flamingo by DeepMind: Flamingo, hem dil hem de görsel anlayışın güçlü yönlerinden yararlanmak üzere tasarlanmıştır; bu sayede hem metin hem de görüntülerden gelen bilgileri yorumlamayı ve bütünleştirmeyi gerektiren görevleri yerine getirebilir.6
Şekil 1: Chip Huyen'den alınan bir örnek7
Önde gelen LMM'ler nelerdir?
Genel amaçlı LLM'lerin arayüz ve API özellikleri
Sağlayıcılar, karşılaştırılabilirlik, veri kullanılabilirliği ve güncellik temelinde en popüler multimodal LLM'ler arasından seçilir.
Token başına fiyatlarıyla LMM'ler:
En uygun model'i seçmek için bütçeniz, gereken yetenekler ve performans düzeyi ile özel kullanım durumunuz için beklenen girdi/çıktı token hacmi gibi faktörleri göz önünde bulundurun.
LLM fiyatlandırması hakkında daha fazla bilgi edinin.
Multimodal model'lerdeki son gelişmeler nelerdir?
Multimodal model'lerdeki son gelişmeler, yapay zeka geliştirmede yeni yetenekler ve verimlilikler sunmuştur.
Video öncelikli multimodal temel model'leri
Video öncelikli multimodal temel model'leri, üst düzey altyazılar veya özetler üretmenin ötesine geçiyor; bunun yerine videolar içindeki kanıtları açıkça konumlandırmayı öğreniyor.
Yalnızca ne olduğunu söylemek yerine, ne zaman olduğunu (zaman damgaları) ve nerede olduğunu (nesnelerin veya bölgelerin çevresindeki sınırlayıcı kutular) belirleyebilirler.
Uzay-zamansal temellendirmeye doğru bu kayma, video anlayışını daha kesin ve doğrulanabilir hale getirir. Ayrıca tam anları bulma, nesneleri izleme, doğal dil kullanarak video düzenleme ve robotik ile güvenlik açısından kritik sistemleri destekleme gibi görevleri mümkün kılar.
Örneğin, Vidi8 video anlama ve düzenleme için büyük multimodal model'lere odaklanan ByteDance kaynaklı açık kaynaklı bir projedir.
Depo; görme, ses ve metni girdi olarak alan bir model ailesinin (ör. Vidi-7B, Vidi1.5-9B, Vidi2 ve Vidi2.5) kodunu ve kaynaklarını barındırır ve aşağıdaki gibi görevleri gerçekleştirir:
- Zamansal getirme (video içinde metin sorgusuyla eşleşen zaman dilimlerini bulma)
- Uzay-zamansal temellendirme (sınırlayıcı kutularla nesneleri belirleme)
- Video soru yanıtlama
Mistral 3 multimodal öncü sürümü
Mistral AI, Mistral 3 adlı yeni bir açık kaynaklı yapay zeka model ailesi geliştirdi. Mistral 3 paketi; buluttan uca ve hatta tek GPU'lara kadar çeşitli cihazlarda çalışmak üzere tasarlanmış hem öncü düzeyde multimodal/çok dilli model'lerden hem de daha küçük, verimli model'lerden oluşur.
İzin veren bir açık kaynak lisansı (Apache 2.0) altında yayımlanan bu model'ler; gelişmiş yapay zekaya erişimi demokratikleştirmeyi, özelleştirme ve dağıtım esnekliği sağlamayı ve ABD ile Çin'in öncü teknolojilerde gerisinde kalma endişelerinin bulunduğu Avrupa'nın yapay zeka geliştirmedeki konumunu güçlendirmeyi amaçlıyor.9
Açık kaynak MoE görsel-dil model'leri
Kimi-VL (Moonshot AI tarafından), Mixture-of-Experts (MoE) mimarisiyle oluşturulmuş; metin, görüntü ve videoyu birleştiren görevlerde performans gösterirken hesaplamayı verimli tutan açık kaynaklı bir multimodal görsel-dil modelidir.
16'B toplam parametreli bir omurgaya sahiptir ancak inference sırasında genellikle yaklaşık 2.8'B parametre etkinleştirir; bu da yetenek ile maliyeti dengelemeye yardımcı olur.
Kimi-VL; gelişmiş multimodal akıl yürütme, uzun bağlam anlayışı (yaklaşık 128'K token'a kadar) ve ajan tarzı etkileşimler için tasarlanmıştır; video anlama, optik karakter tanıma (OCR), matematiksel akıl yürütme ve çoklu görüntü görevleri gibi benchmark'larda daha büyük model'lerle iyi rekabet eder.
Kimi-VL-A3B-Thinking gibi varyantlar, chain-of-thought ve akıl yürütme görevleri için ayrıca fine-tune edilirken; MoonViT görsel encoder'ı yüksek çözünürlüklü girdi anlayışını destekler.
Şekil 2: Kimi-VL mimari tasarımı.10
Anthropic'in Claude 4 Serisi
Anthropic'in Claude 4 serisi, gelişmiş görsel anlayışı metin tabanlı akıl yürütme motoruyla bütünleştirir ve görüşü doğrudan problem çözme iş akışlarına gömer.
Claude 4 model'leri, MMMU gibi multimodal akıl yürütme benchmark'larında, özellikle grafikler, diyagramlar ve karmaşık görsel verileri yorumlamada güçlü performans gösterir. Claude Opus 4.1'in ayırt edici bir özelliği, görüntülerdeki estetik nitelikleri değerlendirebilmesidir; bu, tanımanın ötesine geçerek daha incelikli değerlendirmelere uzanır.
Bu yetenekler, Claude'un agentic işlevleriyle birleşerek seriyi; karışık metin ve görsel içeren raporlardan araştırma sentezleme veya görsel maketlerin analizi yoluyla arayüz tasarımına yardımcı olma gibi görevler için etkili kılar.
Google'ın Gemini 3'ü
Google, Gemini 3'ü Kasım 2025'te yayımladı; Gemini 3 Pro hemen kullanıma sunuldu ve Gemini 3 Deep Think modu kısa süre sonra Google AI Ultra abonelerine açıldı. Gemini 3, Google tarafından tek bir mimaride metin, görüntü, video, ses ve kod için yerel destek sunan en zeki ve en yetenekli multimodal modeli olarak konumlandırılıyor.
Gemini 3 Pro, 1 milyon token'lık bağlam penceresiyle gelir ve multimodal benchmark'larda güçlü sonuçlar elde eder; bunlar arasında MMMU-Pro'da %81, Video-MMMU'da %87,6 yer alır. Piyasaya sürüldüğünde LMArena Liderlik Tablosu'nda 1501 Elo puanıyla zirveye yerleşti; lisansüstü düzeyde akıl yürütme için GPQA Diamond'da %91,9 ve ajan destekli kodlama görevleri için SWE-bench Verified'da %76,2 puan aldı.
Gemini 3 Deep Think, en zorlu görevlerde performansı daha da artıran gelişmiş bir akıl yürütme modudur; Humanity's Last Exam'de (araçsız) %41,0 ve ARC-AGI-2'de %45,1 puan alır. Gemini 3 ile birlikte Google, tarayıcı kontrolü için Gemini 3'ü Gemini 2.5 Computer Use modeliyle ve görüntü düzenleme modeli Nano Banana ile eşleştiren ajan destekli bir geliştirme platformu olan Google Antigravity'yi de yayımladı; bu, model'in görevleri otonom şekilde planlayabildiği, kodlayabildiği ve doğrulayabildiği uçtan uca yazılım geliştirme iş akışlarını mümkün kılıyor.11
GPT-5 OpenAI tarafından
GPT-5, metin, ses, görüntü ve videoda gelişmiş yerel multimodality sunar. Önceki sistemlerin büyük ölçüde eklentilere dayanmasının aksine, GPT-5 bu modaliteleri birleşik bir mimari içinde bütünleştirir ve daha akıcı bir etkileşim sağlar. Model, çeşitli girdi türlerine esnek şekilde uyum sağlar ve bunlar arasında geçiş yapabilir.
Öne çıkan özelliklerden biri, kullanıcı talimatlarına göre tonu, hızı ve tarzı ayarlayabilen Gerçek Zamanlı Ses Modu'dur. Bu, daha doğal ve uyarlanabilir bir konuşma deneyimi yaratır. Görsel işleme de iyileştirildi; görüntü, diyagram ve grafik yorumlama veya üretmede halüsinasyonlar azaltıldı. Bir diğer ilerleme, sistemin önceki girdileri hatırlamasını ve uzun etkileşimler boyunca bağlamı korumasını sağlayan bellek yeteneklerinde yatmaktadır.
Bu iyileştirmeler, GPT-5'i özellikle duyusal bozuklukları olan bireyler için erişilebilir multimodal arayüzler açısından değerli kılar.
Google DeepMind'ın robotik odaklı multimodal model'leri
Google DeepMind, görüşü, dili ve eylemi robotik sistemler içinde bütünleştirmek üzere tasarlanmış Gemini Robotics ve Gemini Robotics-ER model'lerini geliştirdi. Bu model'ler, robotların kağıt katlama veya şişe kapağı açma gibi yapılandırılmamış ortamlarda görevleri yerine getirmesini sağlar.
Bu model'lerin önemli bir özelliği güvenlik mekanizmalarıdır. Sistem, eylemleri gerçekleştirmeden önce riskleri en aza indirmek ve görevlerin uygun şekilde ele alınmasını sağlamak için yerleşik kontroller yapar. Bu yaklaşım, robotikteki önemli zorluklardan birini ele alır: gelişmiş yapay zeka akıl yürütmesini güvenli ve güvenilir gerçek dünya uygulamasıyla birleştirmek.
Llama 4 Scout ve Llama 4 Maverick, Meta AI tarafından
Llama 4 Scout, 17 milyar etkin parametreye ve 16 uzmana sahip multimodal bir modeldir. Bu model, önceki nesil Llama model'lerinden daha iyi performans gösterir ve tek bir H100 GPU'da çalışacak şekilde tasarlanmıştır. Büyük miktarda bilgiyi işlemek için 10 milyon token'lık bağlam penceresine sahiptir. Benchmark sonuçları, Llama 4 Scout'un geniş bir yelpazedeki yaygın olarak raporlanan benchmark'larda Gemma 3, Gemini 2.0 Flash-Lite ve Mistral 3.1'den daha iyi sonuçlar elde ettiğini göstermektedir.
Llama 4 Maverick, 17 milyar etkin parametreye ve 128 uzmana sahip multimodal bir modeldir. Bu model, sınıfında en iyi performans gösterenlerden biri olarak sunulur; bir dizi benchmark'ta GPT-4o ve Gemini 2.0 Flash'ı geride bırakır. Daha az etkin parametre kullanırken akıl yürütme ve kodlamada DeepSeek v3 ile karşılaştırılabilir performans elde eder. Llama 4 Maverick'in deneysel bir sohbet sürümü, LMArena platformunda 1417 ELO puanı elde etti.
ChatGPT Images 2.0 OpenAI tarafından
OpenAI'nin ChatGPT Images 2.0'ı, daha yüksek hassasiyet, kontrol ve görsel akıl yürütme ile görüntü üretimini geliştirir. Model; talimat takibini, metin oluşturmayı ve çok dilli desteği iyileştirir. Fotoğrafçılık, illüstrasyon, manga, infografik, poster ve diğer tarzlarda daha sofistike ve gerçekçi görseller üretebilir. Ayrıca esnek en boy oranlarını destekler; bu da üretilen içeriği mobil ekranlardan afişlere ve baskı malzemelerine kadar çeşitli formatlara uygun hale getirir.
ChatGPT'nin akıl yürütme yetenekleriyle birleştirildiğinde ChatGPT Images 2.0; kaynak materyalleri yorumlayabilir ve bağlamsal ile gerçek dünya bilgilerini dahil edebilir. Bu, kullanıcıların daha karmaşık, bilgi açısından zengin grafikler geliştirmesini ve yaratıcı kavramları konuşma yoluyla iyileştirmesini sağlarken kompozisyon, tipografi ve görsel yönde daha güçlü tutarlılık sağlar.
Alibaba'nın Qwen3-VL'si
Alibaba'nın Eylül 2025'te yayımlanmaya başlayan Qwen3-VL serisi, Qwen3 dil modelinin üzerine inşa edilerek daha derin görsel algı ve akıl yürütme yetenekleri ekler. Aile; 2B ile 32B parametre arasında yoğun varyantlar ve toplam 235B parametreye kadar (22B etkin) Mixture-of-Experts varyantları içerir; tümü Apache 2.0 lisansı altında yayımlanmıştır.
Öne çıkan özellikler arasında 256K yerel bağlam penceresi (1 milyon token'a genişletilebilir), 32 dilde genişletilmiş çok dilli OCR, uzamsal akıl yürütme ve somutlaştırılmış yapay zeka için 2D ve 3D nesne temellendirme, saniye düzeyinde dizinleme ile saatlerce video anlama ve GUI kontrolü için görsel ajan yetenekleri bulunur.
Thinking varyantları STEM ve multimodal akıl yürütme için ayarlanmıştır; Instruct varyantları ise belge ayrıştırma, grafik çıkarma ve görsel soru yanıtlama gibi genel görsel-dil görevlerini hedefler.
Gemma 3, Google tarafından
Google'ın Gemma 3'ü, Gemini 2.0 model'lerinden gelen teknoloji üzerine inşa edilmiştir. Farklı donanım gereksinimleri için dört boyutta (1B, 4B, 12B ve 27B) gelir ve 128k token'lık bağlam penceresi sunar. Gemma 3, tek hızlandırıcılı kurulumlarda iyi performans gösterir; metin ve görsel akıl yürütme, işlev çağırma ve 35'ten fazla dil desteği içerir; 140'tan fazlası için ön eğitim yapılmıştır. Nicemlenmiş sürümler model boyutunu ve hesaplama gereksinimlerini azaltır. ShieldGemma 2 sistemi içerik güvenliği sınıflandırması sağlar.
Phi-4-multimodal, Microsoft tarafından
Microsoft'un Phi-4-multimodal'ı; konuşma, görüş ve metni birleşik bir mimaride işleyen 5.6B parametreli bir modeldir. Farklı girdi türleri arasında bağlam farkındalıklı etkileşimler için çapraz-modlu öğrenme kullanır. Model, ayrı işleme sistemleri gerektirmeden birden çok girdi biçimini ele alır ve cihaz dağıtımı ile uç bilişim için tasarlanmıştır. Uygulamalar arasında akıllı telefon yapay zekası, otomotiv sistemleri ve çok dilli hizmetler bulunur.
Büyük multimodal model (LMM) nedir?
Büyük multimodal model; metin, görüntü, ses, video ve potansiyel olarak başka türler dahil olmak üzere birden çok veri modalitesini işleyebilen ve anlayabilen gelişmiş bir yapay zeka modeli türüdür. Bu multimodal veriler; metin, görüntü, ses, video ve potansiyel olarak diğerlerini içerebilir. Multimodal bir modelin temel özelliği, bu farklı veri kaynaklarından gelen bilgileri çoğu zaman eş zamanlı olarak bütünleştirme ve yorumlama yeteneğidir.
Bunlar, metinle ve ayrıca çeşitli veri türleriyle çalışabilen büyük dil model'lerinin (LLM'ler) daha gelişmiş sürümleri olarak anlaşılabilir. Ayrıca, multimodal dil modeli çıktıları metinsel, görsel, işitsel vb. olacak şekilde tasarlanmıştır.
Multimodal dil model'leri, yapay genel zekaya ulaşma yolunda bir sonraki adım olarak kabul edilir.
Multimodal yapay zeka ajanı nedir?
Multimodal yapay zeka ajanları; görüntü, video ve metin gibi çeşitli veri türlerini kullanarak dünyayla etkileşime girmek üzere tasarlanmış sistemlerdir ve hem dijital hem de fiziksel ortamlarda çalışmalarına olanak tanır. Multimodal model'ler, bu ajanların çeşitli kaynaklardan bilgi algılamasını ve anlamasını sağlayan temel bileşenidir.
Örneğin, Magma gibi model'ler; multimodal dataset'ler üzerinde ön eğitim sırasında Set-of-Mark ve Trace-of-Mark gibi tekniklerle elde edilen görsel-dil anlayışından ve uzamsal zekadan yararlanır.
Bu, ajanın video içeriğini anlama ve soruları yanıtlamadan kullanıcı arayüzlerinde gezinmeye ve robotları kontrol etmeye kadar çeşitli görevleri yerine getirmesini sağlar; multimodal model'lerin farklı veri modalitelerinden yararlanarak yapay zeka ajanlarına kazandırdığı çok yönlü yetenekleri gösterir. Aşağıdaki görsel, Magma'nın görevleri yerine getirmek için robot yörüngelerini planlamasını ve uzamsal zekasını eylem halinde sergilemesini göstermektedir.12
LMM'ler ile LLM'ler arasındaki fark nedir?
1. Veri modaliteleri
- LMM'ler: Birden çok veri girdisi türünü veya modaliteyi anlamak ve işlemek üzere tasarlanmıştır. Buna metin, görüntü, ses, video ve bazen duyusal veriler gibi diğer veri türleri dahildir. LMM'lerin temel yeteneği, bu farklı veri formatlarını çoğu zaman eş zamanlı olarak bütünleştirme ve anlamlandırma becerisidir.
- LLM'ler: Bu model'ler metinsel verileri işleme ve üretme konusunda uzmanlaşmıştır. Öncelikle büyük metin külliyatları üzerinde eğitilirler ve insan dilini çeşitli bağlamlarda anlama ve üretmede ustadırlar. Görüntü veya ses gibi metinsel olmayan verileri doğal olarak işlemezler.
2. Uygulamalar ve görevler
- LMM'ler: Multimodal doğaları nedeniyle, farklı veri türleri arasındaki bilgileri anlamayı ve bütünleştirmeyi gerektiren görevlere uygulanabilirler. Örneğin bir LMM; kapsamlı bir anlayış elde etmek için bir haber makalesini (metin), eşlik eden fotoğrafları (görüntüler) ve ilgili video klipleri analiz edebilir.
- LLM'ler: Uygulamaları; makale yazma, dil çevirisi, soru yanıtlama, belgeleri özetleme ve metin tabanlı içerik oluşturma gibi metin içeren görevler etrafında yoğunlaşır.
Büyük multimodal model'lerin veri modaliteleri nelerdir?
Metin
Bu; kitaplar, makaleler, web sayfaları ve sosyal medya gönderileri gibi her türlü yazılı içeriği kapsar. Model; çeviri, özetleme ve soru yanıtlama gibi doğal dil işleme görevleri de dahil olmak üzere metinsel içeriği anlayabilir, yorumlayabilir ve üretebilir.
Görüntüler
Bu model'ler görsel verileri analiz edebilir ve üretebilir. Bu; fotoğrafların, illüstrasyonların ve diğer grafik temsillerin içeriğini ve bağlamını anlamayı içerir. Görüntü sınıflandırma, nesne tespiti ve metinsel açıklamalardan görüntü oluşturma gibi görevler bu kategoriye girer.
Ses
Bu; ses kayıtlarını, müziği ve konuşulan dili kapsar. Model'ler konuşmayı tanımak, müzik, ortam sesleri ve diğer işitsel girdileri tanımak üzere eğitilebilir. Konuşmayı yazıya dökebilir, sözlü komutları anlayabilir ve hatta sentetik konuşma veya müzik üretebilir.
Video
Hem görsel hem de işitsel öğeleri birleştiren video işleme, hareketli görüntüleri ve bunlara eşlik eden sesleri anlamayı içerir. Bu; video içeriğini analiz etmeyi, videolardaki eylemleri veya olayları tanımayı ve video klipleri üretmeyi kapsayabilir.
Mevcut büyük multimodal dil model'lerinin çoğu metin ve görüntüleri işleyebilirken, gelecekteki araştırmalar ses ve video veri girdilerini de dahil etmeyi amaçlamaktadır.
Büyük multimodal model'ler nasıl eğitilir?
Büyük multimodal model'lerin (LMM'ler) eğitilmesi, büyük dil model'lerinin (LLM'ler) eğitilmesinden birkaç temel açıdan önemli ölçüde farklıdır:
1. Veri toplama ve hazırlama
- LLM'ler: Kitaplardan, web sitelerinden ve yazılı kaynaklardan gelen metin verilerine odaklanır; LLM eğitim verisi kaynakları için dilsel çeşitliliğe vurgu yapılır.
- LMM'ler: Metin, görüntü, ses ve video verileri gerektirir. Koleksiyon, farklı formatlar nedeniyle daha karmaşıktır. Verilerin etiketlenmesi ve modaliteler arasında hizalanması esastır.
2. Model mimarisi tasarımı
- LLM'ler: Sıralı metin işleme için optimize edilmiş transformer mimarilerini kullanır.
- LMM'ler: Birden çok sinir ağı türünü (görüntüler için CNN'ler, metin için transformer'lar) bütünleştiren ve bu modaliteleri birbirine bağlayan mekanizmalara sahip daha karmaşık mimariler kullanır.
3. Ön eğitim
- LLM'ler: Maskelenmiş dil modelleme gibi tekniklerle metin külliyatları üzerinde ön eğitilir.
- LMM'ler: Birden çok veri türü üzerinde ön eğitilir; metni görüntülerle ilişkilendirmeyi veya video dizilerini anlamayı öğrenir.
4. Fine-tuning
- LLM'ler: Belirli görevler için özel metin dataset'leri üzerinde fine-tune edilir.
- LMM'ler: Farklı veri türleri arasındaki ilişkileri kurmak için hem modaliteye özgü dataset'lerde hem de çapraz-modlu dataset'lerde fine-tuning gerektirir.
5. Değerlendirme ve yineleme
- LLM'ler: Değerlendirme metrikleri; akıcılık, tutarlılık ve ilgililik dahil olmak üzere dil anlama ve üretme görevlerine odaklanır.
- LMM'ler: Görüntü tanıma, ses işleme ve çapraz-modlu bütünleştirme yeteneklerini kapsayan daha geniş metriklerle değerlendirilir.
LMM'ler nasıl çalışır?
Büyük multimodal model'ler eğitim süreçleri, tasarımları ve çalışma biçimleri bakımından büyük dil model'leriyle benzerlikler taşır. Aynı transformer mimarisini ve eğitim stratejilerini kullanırlar. Büyük multimodal model'ler şunlar üzerinde eğitilir:
- Metin verileri
- Metin açıklamalı milyonlarca veya milyarlarca görüntü
- Video klipleri
- Ses parçacıkları
- Kod gibi diğer girdi verileri
Bu eğitim, birden çok veri modalitesinin eş zamanlı öğrenilmesini içerir; bu da model'in şunları yapmasını sağlar:
- Bir kedi fotoğrafını tanıma
- Bir ses klibindeki kelimeyi tanımlama
- Metnin ötesindeki kavramları ve duyusal ayrıntıları anlama
Bu şekilde kullanıcılar şunları yükleyebilir:
- Bir görüntü; şunları yapmak için:
- Neler olduğuna dair bir açıklama alma
- Metin veya görüntü üretmek için görüntüyü bir prompt'un parçası olarak kullanma
- Görüntünün belirli öğeleri hakkında takip soruları sorma
- Görüntüdeki metni farklı bir dile çevirme (örn. menü)
Şekil 3: ChatGPT'ye tanımlaması için bir kedi görüntüsü yükleme.
- Grafikler ve çizelgeler; şunları yapmak için:
- Gösterdikleri şey hakkında karmaşık takip soruları sorma
- Tasarım maketi; şunları yapmak için:
- Oluşturmak için gerekli HTML ve CSS kodunu alma.
Şekil 4: Görüntüyü Wes Anderson film tarzında promptlama. ChatGPT, prompt'u bir görüntü üretim modeline (DALL·E gibi) besler; model de isteği yorumlar ve stilize edilmiş görüntüyü üretir.
Eğitim sürecinden sonra model'ler sağlıksız stereotipleri ve toksik fikirleri barındırabilir. Bunları iyileştirmek için şu teknikler kullanılabilir:
- İnsan geri bildirimli pekiştirmeli öğrenme (RLHF)
- Denetleyici yapay zeka model'leri
- Red teaming (modelin sağlamlığını test etme) kullanılabilir.
Ayrıca, yapay zeka yönetişim araçları ve sorumlu yapay zeka araçları; yapay zeka uyumluluğu çözümleri olarak işlev görerek yapay zeka envanter optimizasyonunu da sağlayabilir ve yapay zeka önyargısını ve diğer etik ikilemleri önlemeye yardımcı olabilir. Bu araçların üretken yapay zeka telif hakkı endişelerini nasıl ele aldığına dair bir örnek aşağıdadır:
Şekil 5: ChatGPT, telif haklarını korumak için içerik politikası yönergeleri nedeniyle isteğimi reddediyor.
Amaç, şunları yapabilen işlevsel bir multimodal sistem geliştirmektir:
- Metinden görüntü sentezleme
- Görüntü altyazılama
- Metin tabanlı görüntü getirme
- Görsel soru yanıtlama.
Bu şekilde multimodal yapay zeka, hem dil hem de görüş içeren görevler için gelişmiş yetenekler sağlayarak çeşitli modaliteleri bütünleştirebilir.
Büyük dil model'lerinin sınırlamaları nelerdir?
- Veri gereksinimleri ve önyargı: Bu model'ler eğitim için devasa, çeşitli dataset'ler gerektirir. Ancak bu tür dataset'lerin bulunabilirliği ve kalitesi zorluk yaratabilir. Ayrıca, eğitim verileri önyargılar içeriyorsa model'in bu önyargıları miras alması ve muhtemelen güçlendirmesi olasıdır; bu da adil olmayan veya etik olmayan sonuçlara yol açabilir.
- Hesaplama kaynakları: Büyük multimodal model'lerin eğitilmesi ve çalıştırılması önemli hesaplama kaynakları gerektirir; bu da onları pahalı hale getirir ve daha küçük kuruluşlar veya bağımsız araştırmacılar için daha az erişilebilir kılar.
- Yorumlanabilirlik ve açıklanabilirlik: Karmaşık yapay zeka model'lerinde olduğu gibi, nasıl karar verdiklerini anlamak zor olabilir. Bu şeffaflık eksikliği, özellikle sağlık hizmetleri veya kolluk kuvvetleri gibi hassas uygulamalarda kritik bir sorun olabilir.
- Modalitelerin bütünleştirilmesi: Farklı veri türlerini (metin, görüntü ve ses gibi) her bir modalitenin nüanslarını gerçekten anlayacak şekilde etkili biçimde bütünleştirmek son derece zordur. Model, bu modalitelerin birleşiminden gelen insan iletişiminin bağlamını veya inceliklerini her zaman doğru şekilde kavrayamayabilir.
- Genelleme ve aşırı öğrenme: Bu model'ler çok geniş dataset'ler üzerinde eğitilse de eğitim verilerinden önemli ölçüde farklılık gösteren yeni, görülmemiş verilere veya senaryolara genelleme yapmakta zorlanabilir. Tersine, eğitim verilerine aşırı uyum sağlayarak gürültüyü ve anormallikleri örüntü olarak yakalayabilirler.
Daha fazla bilgi edinmek için üretken ve dil model'leriyle ilişkili zorlukları ve riskleri inceleyin.
LMM'ler için benchmark metodolojisi
Büyük Multimodal Model'lerin (LMM'ler) performansını, finansal multimodal akıl yürütme yeteneklerini değerlendirmek üzere tasarlanmış kapsamlı bir benchmark olan FinMME dataset'inin bir alt kümesini kullanarak değerlendirdik13. FinMME; 18 finansal alan ve 6 varlık sınıfında 11.000'den fazla yüksek kaliteli finansal örnek içerir ve finans alanındaki LMM'leri değerlendirmek için sağlam bir framework sağlar.
Bu benchmark için, model'lerin multimodal finansal verilerle işleme ve akıl yürütme becerisini analiz etmek amacıyla FinMME dataset'inden özenle seçilmiş 100 örnekten oluşan bir seçki kullandık.
Sorumluluk reddi
Bu değerlendirme, LMM'leri benchmarklamak için daha büyük bir dataset'ten özenle seçilmiş 100 örnekten oluşan bir alt küme kullanmıştır. Model performansının kapsamlı bir değerlendirmesi için tam benchmark dataset'indeki tüm örnekler dikkate alınmalıdır.
Sonuç
Büyük multimodal model'ler (LMM'ler); metin, görüntü, ses ve video gibi çeşitli veri türlerini bütünleştirerek büyük dil model'lerinin (LLM'ler) metin tabanlı yeteneklerini aşmaktadır. Meta AI'ın Llama 4'ü, OpenAI'nin GPT-4o'su ve Alibaba'nın Qwen2.5-VL'si gibi gelişmelerle LMM'ler, görsel akıl yürütmeden bağlama duyarlı görüntü üretimine kadar daha zengin uygulamalar sağlar.
Ancak karmaşıklıkları, yüksek hesaplama talepleri ve veri bütünleştirme ile önyargı azaltma ile ilgili zorluklar engel olmaya devam etmektedir. LMM'ler geliştikçe, daha çok yönlü yapay zeka ajanlarının önünü açarak bizi yapay genel zekaya yaklaştırıyorlar. Kuruluşlar ve araştırmacılar için doğru modeli seçmek; performans, maliyet ve kullanım senaryosunun özel ihtiyaçları arasında bir denge kurmayı gerektirir.
Bu araştırmayı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{dilmegani2026,
author = {Dilmegani, Cem},
title = {{Büyük Multimodal Model'ler (LMM'ler) vs LLM'ler}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/large-multimodal-models}},
note = {AIMultiple. Erişim tarihi: 17 Ağustos 2026}
}30 veri noktasının sonuçları ve zaman damgaları. Bu makalede kullanılan verileri, 3 CSV dosyası içeren ZIP dosyası olarak indirin.
Değişiklik günlüğü
20 güncelleme- 2026
Çok modlu modellerdeki son gelişmeler bölümüne Video-first çok modlu temel modeller, Mistral 3 çok modlu sınır sürümü ve Açık kaynaklı MoE görme-dil modelleri eklendi.
- 2025
Girişe modellerin neden farklı performans gösterdiğine dair bir bölüm eklendi.
Çok modlu modeller listesine Anthropic'in Claude 4 Serisi eklendi.
Çok modlu modellerdeki en son gelişmeler bölümüne OpenAI'dan GPT-5 eklendi.
Giriş, finansal muhakeme görevlerinde LMM'lerin değerlendirilmesinin bir açıklamasıyla güncellendi.
Metodoloji bölümü eklendi.
Önde gelen LMM'ler bölümüne açık kaynaklı büyük çok modlu modeller eklendi.
Meta AI tarafından Llama 4 Scout ve Llama 4 Maverick eklendi.
En son gelişmeler bölümüne OpenAI tarafından 4o Görüntü Oluşturma eklendi.
Yeni bir bölüm olan "Çok modlu bir yapay zeka ajanı nedir?", "LMM'ler ve LLM'ler arasındaki fark nedir?" bölümüne eklendi.
Alibaba'dan Qwen2.5-VL-32B-Instruct modellere eklendi.
Google'dan Gemma 3, 'Çok modlu modellerdeki en son gelişmeler nelerdir?' bölümüne eklendi.
Microsoft'un Phi-4-multimodal modelini açıklayan bir bölüm eklendi.
Açık kaynaklı LMM'ler listesine Alibaba'dan Qwen2.5-VL eklendi.
Girişe o3-mini ve DeepSeek-R1 modelleri eklendi.
“Önde gelen LMM'ler nelerdir?” bölümüne bir tablo eklendi.
- 2024
LMM'lerin lansman tarihleri, önde gelen LMM'ler bölümünden kaldırıldı.
Makaleye Şekil 1, Şekil 2, Şekil 3 ve Şekil 4 eklendi.
“LLM'ler nasıl çalışır?” bölümü eklendi.
Önde gelen BMM'lere OpenAI GPT-4o, Gemini 1.5 ve Qwen-VL-Plus/Max eklendi.






Yorum yapan ilk kişi olun
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.