Şubat 2023 ile Mayıs 2026 arasında yayımlanan 71 LLM'yi izledik ve zeka yoğunluğunu ölçmek için 10 halka açık benchmark topladık. Yetkinlik puanını, modelin tükettiği kaynağa (aktif parametreler, eğitim hesaplama gücü ve inference fiyatı) böldük.
LLM zeka yoğunluğuna genel bakış
Zeka yoğunluğunu hesaplamak için şu adımları uyguladık:
- Kaynak verimliliği: Her modelin yetkinliğini iki kaynak metriğine böldük:
- Aktif parametreler: Bellek ve sunum maliyeti için bir proxy (açık ağırlıklı modeller için).
- Inference fiyatı: Milyon token başına harmanlanmış API fiyatlandırmasına dayalı piyasa maliyet verimliliği.
- Eğitim hesaplama gücü (FLOP) hakkında not: Başlangıçta üçüncü bir eksen olan eğitim hesaplama gücünü (FLOP) dahil ettik, ancak doymuş Standart benchmark'lardaki negatif eğimi 2023–2024 bileşik değerini mantığa aykırı bir düşüşe sürüklediği için çıkardık.
- Benchmark gruplaması: Puan doygunluğunun verimlilik kazanımlarını gizlemesini önlemek için yetenekleri iki farklı benchmark döneminde değerlendirdik:
- Standart benchmark'lar (2023–2024): MMLU (5-shot), GSM8K (8-shot CoT), HellaSwag (10-shot), ARC Challenge (25-shot), HumanEval (0-shot pass@1).
- İleri düzey benchmark'lar (2024–2026): MMLU-Pro, GPQA Diamond, AIME 2025, LiveCodeBench, SWE-bench Verified.
- Zincirleme endeksleme: Eşleşen benchmark grupları içinde yıldan yıla büyümeyi hesapladık ve kümülatif eğilimi çizmek için bunları 2023 temel değeri olan 100'den itibaren çarpımsal olarak zincirledik.
Puanlama yaklaşımı ve kaynak bazında dağılımlar için metodoloji bölümüne bakın.
LLM zeka yoğunluğu sonuçları
2026 ortasına gelindiğinde yapay zeka ekosistemi, 2023 temel değerine kıyasla kaynak birimi (parametre ve dolar) başına yaklaşık 15 kat daha fazla zeka sundu. Eğilimi okurken dikkat edilmesi gereken iki nokta var:
- 2024–2025 sıçraması (+%362) gerçek kazancı abartıyor: İleri düzey benchmark'lar 2024'te yeniydi ve üzerlerinde puanı olan az sayıda model vardı; bu yüzden 2024 temel değeri yapay olarak düşük kalıyor. "Yükselişin" çoğu panelin dolmasından kaynaklanıyor, tek yıllık bir verimlilik sıçramasından değil.
- 2025–2026 kazancı (+%105) asıl hikayenin bulunduğu yer: Çok daha fazla modelle ölçülüyor ve Qwen 3.6-35B-A3B ve DeepSeek V4 Flash gibi küçük açık ağırlıklı sürümlerin, çok daha küçük boyut ve maliyetle sınır kapalı model yeteneğini yakalamasıyla sağlanıyor.
LLM yeteneği
Yoğunluk grafiği verimliliği gösterir. Bunu bağlama oturtmak için aynı dönemde ham yeteneği de ölçtük: Herhangi bir kaynak düzeltmesi yapılmadan önce bu modeller gerçekte ne kadar akıllı hale geldi?
Yetenek, 2023'te 100 olarak endekslendi ve her yıl piyasaya sürülen tüm modellerin ortalaması alındı.
Eksenler ve araç ipucu yoğunluk grafiğiyle aynı şekilde çalışır; Y ekseni yoğunluk yerine ham benchmark performansını izler.
2023'te 100 olan yetenek puanı 2026'ya kadar 468'e yükseldi; bu yaklaşık 4.7× iyileşme anlamına geliyor. Yıllara göre:
- 2024 (+%88): Standart benchmark'lar doymadan önce hızlı ilerleme kaydedildi.
- 2025 (+%105): Aynı hızlı ilerleme, standartların yerini alan daha zor ileri düzey benchmark'larla ölçüldü.
- 2026 (+%22): Yavaşlama, ileri düzey benchmark'ların da doymaya başladığının erken bir işareti.
İki grafiği yan yana koyduğumuzda:
- Yetenek 4.7× büyürken zeka yoğunluğu 8.9× büyüdü.
- Modeller aynı anda hem daha akıllı hem de daha verimli hale geldi. Çalışmak için orantılı olarak daha fazla parametreye, eğitim hesaplama gücüne veya paraya ihtiyaç duymuyorlar.
Şunu unutmayın: 4.7× yetenek rakamı güvenilir bir büyüklüktür. 8.9× yoğunluk rakamı ise daha kırılgandır (2024 ileri düzey grubunda daha az veri noktası vardır ve bu, o yılın büyüme oranını olduğundan büyük gösterir); bu nedenle onu kesin bir çarpan değil, yön gösteren bir sinyal olarak ele alın.
Hangi LLM en yüksek zeka yoğunluğuna sahip?
Zeka yoğunluğu, hangi kaynağı ölçtüğümüze ve hangi benchmark grubunda puanladığımıza bağlıdır. Lider her kombinasyon için değişir.
Aktif parametre başına yoğunluk (açık ağırlıklı)
Bu görünüm, bir modelin yeteneği ağırlıklarına ne kadar verimli sığdırdığını ölçer. Aktif parametreler önemlidir çünkü Mixture-of-Experts (MoE) modelleri her token'ı toplam ağırlıkların bir kısmından geçirir. DeepSeek V3 toplam 671B parametreye sahiptir ancak token başına 37B aktif parametre kullanır ve 37B rakamı etkin sunum maliyetini yansıtır.
Standart benchmark liderleri
- LLaMA 3.1 8B (Tem 2024): 100.0
- LLaMA 3 8B (Nis 2024): 85.0
- LLaMA 4 Maverick (Nis 2025): 55.9
- Mixtral 8x7B (Ara 2023): 47.4
- Mistral 7B (Eyl 2023): 46.3
İleri düzey benchmark liderleri
- Qwen 3.6-35B-A3B (Nis 2026): 100.0 (3B aktif parametre; puan tek bir benchmark'a, SWE-bench Verified'ta %73,4 olan tek bir benchmark'a dayanır, bu yüzden buna göre okuyun)
- GPT-OSS 20B (Ağu 2025): 85.2 (3.6B aktif parametre)
- GPT-OSS 120B (Ağu 2025): 64.4 (5.1B aktif parametre)
- Qwen 3.5 9B (Mar 2026): 35.2 (9B yoğun parametre)
- DeepSeek V4 Flash (Nis 2026): 26.0
Standart benchmark sıralaması 2024'ün sonlarından beri durmuştur; bunun nedeni ilerlemenin durması değil, benchmark'ların doymuş olmasıdır. GPT-4 2023 başında standart benchmark'larda 90.2 puan alırken ileri düzey benchmark'larda 17.3 puan aldı.
Eğitim FLOP'u başına yoğunluk (açık ağırlıklı)
Bu görünüm, ham harcama yerine veri seçimini, mimari tercihleri ve eğitim tariflerini ödüllendirir.
Not: Standart benchmark'larda FLOP başına yoğunluk zamana göre düşüyormuş gibi görünüyor. Bu bir doygunluk yapaylığıdır, azalan eğitim verimliliği değil. Eski benchmark'lar artık son kazanımları ölçmez; bu nedenle yetenek puanları sıkışırken eğitim hesaplama gücü büyümeye devam eder.
Standart benchmark liderleri
- Mistral 7B (Eyl 2023): 100.0 (iki yıldan uzun süre sonra hâlâ panelin referans noktası)
- LLaMA 3 8B (Nis 2024): 40.8
- LLaMA 1 (Şub 2023): 37.0
- DeepSeek V2 (May 2024): 32.6
- Mixtral 8x7B (Ara 2023): 27.1
İleri düzey benchmark liderleri
- Qwen 3.5 9B (Mar 2026): 100.0
- Qwen 3.6-35B-A3B (Nis 2026): 28.4
- DeepSeek V4 Flash (Nis 2026): 6.4
Qwen 3.5 (9B) sonucu dikkat çekicidir: Yaklaşık 1.5 × 10²³ FLOP ile eğitilen 9B yoğun bir model, ileri düzey benchmark'larda 81.2 yetenek puanı alıyor. Eğitim hesaplama gücü DeepSeek V4 Pro'dan kabaca bir mertebe daha düşük, ancak yetenek farkı daha küçük.
Dolar başına inference yoğunluğu
Dolar başına yoğunluk, açık ağırlıklı ve kapalı sınır modellerinin doğrudan karşılaştırılabildiği eksendir; çünkü API fiyatlandırması kamuya açık olarak doğrulanabilir. Başlıkta lansman sonrası indirimler yansıtılsın diye yerleşik fiyatları kullanıyoruz.
Standart benchmark liderleri
- Mistral Small 3 24B (Oca 2025): Milyon token başına $0,10 / $0,30 fiyatla Mistral'ın birinci taraf API'si üzerinden 100.0
- Gemini 1.5 Flash (May 2024): 99.3 (Ağustos 2024 fiyat indirimi sonrası en yüksek puan alan kapalı ağırlıklı model)
- DeepSeek V2 (May 2024): Milyon token başına $0,27 / $1,10 fiyatla 66.0
- DeepSeek V3 (Ara 2024): 30.9
- DeepSeek R1 (Oca 2025): 17.8
İleri düzey benchmark liderleri
- GPT-OSS 120B (Ağu 2025): 100.0 (fiyat referansı OpenRouter sağlayıcılar arası medyandır, çünkü OpenAI modeli birinci taraf API'de barındırmadı)
- GPT-OSS 20B (Ağu 2025): 80.0
- DeepSeek V4 Flash (Nis 2026): 44.0, milyon token başına $0,06 / $0,42 fiyatla, DeepSeek'in birinci taraf API'si üzerinden
- DeepSeek V3.2 (Ara 2025): 22.5
- Mistral Small 3 24B (Oca 2025): 20.9
- DeepSeek V4 Pro (Nis 2026): 16.0 $0,54 harmanlanmış fiyatla, 97.8 ileri düzey benchmark yetenek puanıyla. Bu, V4 Pro'yu Claude Opus 4.7'nin 2.2 yetenek puanı yakınına, yaklaşık 1/18th harmanlanmış fiyatla koyar ($0,54 vs $10,00).
Kapalı sınır farkı kapanmadı
Anthropic, OpenAI ve Google'ın kapalı akıl yürütme modelleri, panel dönemi boyunca ileri düzey benchmark'larda dolar başına yoğunlukta 0 ile 6 arasında kümeleniyor. Mart 2023'te GPT-4 0.0 puan aldı. Nisan 2026'da Claude Opus 4.7 0.9 puan aldı.
Kapalı laboratuvarlar mutlak fiyatları düşürdü:
- Claude Opus, Opus 4 ile Opus 4.5 arasında milyon token başına $30'dan $10'a düştü.
- OpenAI'nin o3 modeli, lansmanda $10/$40 iken yerleşik olarak $2/$8'e düştü.
- Gemini 1.5 Flash yaklaşık %78 düştü.
Ancak açık ağırlık yoğunluk liderlerine göreli fark dönem boyunca kabaca 30 ila 50× kaldı. DeepSeek 2024'te milyon başına $0,18 civarında fiyatlandı (V2) ve 2026'da milyon başına $0,18 civarında fiyatlandı (V4 Flash). Açık ağırlıklı fiyat tabanı hareket etmedi ve kapalı amiral gemisi tabanı farkı kapatacak kadar hareket etmedi. Fiyat rekabeti bir önceki nesil katmanında yaşanıyor; burada eski kapalı modeller ucuz alternatifler olarak canlı tutuluyor, ancak sınırda değil.
Yeni yön: Agentic benchmark'lar
Yapay zeka performansını ölçmek için kullanılan ileri düzey benchmark'lar, değiştirdikleri eski test paketleri gibi etkinliğini kaybetmeye başlıyor. Laboratuvarlar, eski akıl yürütme testleri yerine agentic benchmark'ları (SWE-Bench Pro, SWE-bench Verified, Terminal-Bench, OSWorld-Verified, Finance Agent) raporlamaya başladı. Bu değişimi izlemek için bir panel oluşturmaya başladık.
Örneğin, en yeni sınır modeli Claude Opus 4.8, sonuçlarını neredeyse tamamen bu agentic LLM benchmark'ları üzerinden raporluyor; ana panelimizin izlediği akıl yürütme benchmark'larında hiç puanı yok.
Yayın tarihine göre SWE-Bench Pro çözüm oranı; Scale'in SEAL standartlaştırılmış test düzeneğiyle puanlanmıştır. Çizilen modeller arasında:
- En iyi kapalı ağırlıklı performans gösterenler: Claude Fable 5 (%80,3), Claude Opus 4.5 (%45,9), Claude Sonnet 4.5 (%43,6) ve Gemini 3 Pro Preview (%43,3).
- En iyi açık ağırlıklı performans gösterenler: GLM 5.2 (%62,1), Qwen3-Coder-480B-A35B (%38,7), Kimi K2 Instruct (%27,7) ve Qwen3-235B-A22B (%21,4).
Agentic benchmark'ları keşfetmek için agentic kodlama benchmark'larına, agentic arama ve agentic izleme bölümlerine bakın.
Agentic performansı karşılaştırmanın zorlukları
Agentic benchmark sonuçlarını değerlendirmek ve karşılaştırmak birkaç temel zorluk barındırır:
- Yetenek metriklerine odaklanma: Yoğunluğu ölçmek için gereken kaynak verileri (parametre sayıları, eğitim hesaplama gücü ve doğrulanmış model başına fiyatlandırma) kapalı laboratuvarlar tarafından eksik kalıyor veya açıklanmıyor; bu nedenle yalnızca yetenek puanlarını gösterebiliyoruz.
- Sistem düzeyinde hassasiyet: Benchmark puanları yalnızca yapay zeka modelini değil tüm sistemi ölçer. Puanlar "yapı iskelesi"ne (çevreleyen yazılım framework'üne) büyük ölçüde bağımlı olduğundan, aynı model kullanılan belirli ajan koşum takımına bağlı olarak çok farklı sonuçlar verebilir.
- Standartlaştırma protokolü: Adil bir karşılaştırma sağlamak için bu rapor yalnızca tek bir standartlaştırılmış ortamdan (Scale'in SEAL lider tablosu) alınan SWE-Bench Pro verilerini çizer. Diğer laboratuvar raporlu puanlar farklı düzenekler kullanır ve doğrudan karşılaştırılamaz.
- Claude Opus 4.8 hariç tutulması: Opus 4.8 SWE-Bench Pro'da rekor düzeyde %69,2 bildirse de Anthropic'in iç test düzeneğinde test edildi ve henüz Scale'in SEAL'i tarafından değerlendirilmedi. Katı veri tutarlılığını korumak için puanını çizmek yerine burada not ediyoruz.
SWE-Bench Pro, Scale SEAL standartlaştırılmış test düzeneğinden alınmıştır. Diğer sütunlar laboratuvarlar tarafından farklı düzeneklerde raporlanmıştır ve satırlar arasında doğrudan karşılaştırılabilir değildir. Kısa çizgiler doğrulanmış puan bulunamadığı anlamına gelir.
Bu üçü mini-swe-agent düzeneğinde çalıştırıldı, bu nedenle dağılım grafiğini karşılaştırılabilir tutmak için grafikten çıkarıldı.
Zeka yoğunluğu metodolojisi
Panel kapsamı
- Modeller: Şubat 2023 ile Nisan 2026 arasında yayımlanan 71 LLM. Standart benchmark puanına sahip 37 model ve ileri düzey benchmark puanına sahip 54 model var. Tam bir benchmark grubuna sahip olmayan modeller o grubun yoğunluk hesaplamalarından çıkarılır.
- Benchmark'lar: 10 halka açık benchmark; tümü laboratuvar raporlu ve birincil kaynağa izlenebilir. Hiçbir benchmark'ı yeniden çalıştırmadık.
- Kaynaklar: Her model için yetenek puanını üç kaynağa bağımsız olarak böldük:
- Aktif parametreler: Bellek ve sunum maliyeti için bir proxy. Yalnızca açık ağırlıklı modellerle sınırlıdır, çünkü kapalı ağırlıklı laboratuvarlar (OpenAI, Anthropic, Google) parametre sayılarını açıklamaz.
- Eğitim hesaplama gücü (FLOP): Eğitim verimliliği için bir proxy. Ayrıca yalnızca açık ağırlıklı modellerle sınırlıdır. FLOP rakamları çoğunlukla Epoch AI'dan tahminlerdir ve yön gösterici olarak okunmalıdır.
- Inference fiyatı: Alıcının API'de fiilen ödediği fiyat. Yetenek, 3:1 girdi-çıktı oranında milyon token başına harmanlanmış fiyata bölünür. Hem açık hem kapalı modeller katılır, çünkü API fiyatlandırması kamuya açık olarak doğrulanabilir.
Neden iki benchmark grubu?
2024'te piyasaya sürülen modeller, yapay zeka laboratuvarlarının 2020'den beri kullandığı standart benchmark'ları doyurdu. Sınır modelleri bir benchmark'ta %90 veya üzerine ulaştığında, test artık güçlü modelleri daha güçlülerden ayırt edemez. Laboratuvarlar buna daha zor benchmark'lar sunarak yanıt verdi.
Bu değişimi iki nedenle net bir kopuş olarak ele alıyoruz:
- İlk olarak, kolay ve zor benchmark'ları tek bir yetenek puanı içinde karıştırmak, kolay bir benchmark'taki doymuş puanın zor bir benchmark'taki düşük puanı gizlemesine izin verir. MMLU-Pro'da 85 puan alan bir model, MMLU'da 85 puan alan bir modelden daha güçlüdür. İkisini eşdeğer saymak puan aralığını sıkıştırır ve eski benchmark'ları ödüllendirir.
- İkinci olarak, iki paketin farklı puan dağılımları vardır: standart benchmark'lar üstte kümelenir (çoğu sınır modeli 85 üzerindedir), ileri düzey benchmark'lar ise daha geniş bir yayılıma sahiptir (en iyi modeller 90 civarında, orta düzey 50 civarında, daha zayıf modeller 30 altındadır). İkisini aynı anda Z-skorlamak varyans tahminini bozar.
Her grup için yeteneği bağımsız olarak hesaplıyoruz:
- Standart benchmark'lar (2023–2024): MMLU (5-shot), GSM8K (8-shot chain of thought), HellaSwag (10-shot), ARC Challenge (25-shot), HumanEval (0-shot pass@1).
- İleri düzey benchmark'lar (2024–2026): MMLU-Pro, GPQA Diamond, AIME 2025, LiveCodeBench, SWE-bench Verified.
Standart benchmark'larda 90 puan, ileri düzey benchmark'larda 90 puana eşdeğer değildir. 2024 sonundan itibaren piyasaya sürülen herhangi bir model için anlamlı referans ileri düzey benchmark'lardır.
Yetenek formülü
Her benchmark b ve her model m için:
Popülasyon standart sapmasını kullanıyoruz (N'e böler, N−1'e değil). Bu, orijinal pandas hesaplamasıyla eşleşir ve tek bir yeni model eklemenin varyans tahminini geriye dönük olarak değiştirmemesini sağlar.
Daha sonra her modelin mevcut z-puanlarının ortalamasını her benchmark grubu içinde alır ve panel göreli puanı 0–100 aralığına min-maks ölçeklendiririz.
Yoğunluk formülü
Her yoğunluk görünümü için:
Payda görünüme göre değişir: milyar cinsinden aktif parametreler, 10²⁴'e bölünmüş eğitim FLOP'u veya milyon token başına harmanlanmış fiyat.
Zincirleme endeks metodolojisi
Makalenin başındaki iki endeks grafiği (Zeka Yoğunluğu ve Yetenek), S&P 500 kümülatif getiri formatına göre modellenen ve 2023'te 100'e endekslenen tek çizgili bir kümülatif büyümeyi gösterir. Mutlak değerleri çizmek yerine yıldan yıla büyüme oranlarını benchmark geçişi boyunca zincirliyoruz.
Adım 1. Her benchmark grubu için metriğin yıllık ortalamasını hesaplayın:
Zeka Yoğunluğu Endeksi için metrik, model başına üç yoğunluk puanının satır bazında ortalamasıdır (Birleşik Yoğunluk A veya B). Yetenek Endeksi için metrik, panel göreli yetenek puanıdır (Capability_A veya Capability_B).
Adım 2. Her yıldan yıla geçiş için büyümeyi tek bir benchmark grubu içinde hesaplayın. Her iki yıl da aynı gruptan gelmelidir:
Adım 3. 2023 temel değeri 100'den çarpımsal olarak zincirleyin:
Geçiş başına grup seçimi:
- 2023 – 2024: Standart benchmark'lar (İleri düzeyde 2023'te 1 model var; istikrarlı bir ortalama için çok az)
- 2024 – 2025: İleri düzey benchmark'lar (Standartlar 2024 sonunda doydu; İleri düzeyde 2024'te 16 model ve 2025'te 27 model var)
- 2025 – 2026: İleri düzey benchmark'lar (2026 için standartlar raporlanmadı)
Zincirleme endeks, bir grup içinde yıllar arasında altta yatan popülasyonların karşılaştırılabilir olduğunu varsayar. Panelimiz heterojendir (her yıl farklı modeller, farklı benchmark kapsamı); bu nedenle zincirlenmiş değerler kesin bir çarpan yerine yön gösterici bir özet olarak okunmalıdır.
Zeka yoğunluğu ölçümü için temel değerlendirme ilkeleri
- Sektör standardı benchmark'lar: Özel hiçbir benchmark sunmuyoruz.
- Birincil kaynak kullanımı: Her benchmark puanı modelin yayın makalesine, model kartına veya resmi duyurusuna izlenebilir. Birincil kaynak bir benchmark bildirmediyse hücre, değer atanmak yerine boş bırakılır.
- Kapsam bayrakları (N): Her model için, her gruptaki yetenek puanına katkıda bulunan benchmark sayısını raporluyoruz. N=1 olan modeller N=5 olan modellere göre daha gürültülü bir puan alır. N=1 durumu Qwen 3.6 35B A3B (SWE-bench Verified) ve birkaç 2026 kapalı amiral gemisi sürümü için geçerlidir.
Kapalı ağırlıklı modeller için fiyatlandırma kaynakları
Fiyatlandırma, endeksin kohorta en duyarlı parçasıdır. Şu hiyerarşiyi kullanıyoruz:
- Laboratuvar lansman duyurusu (tercih edilir): Laboratuvarın lansman yazısında, API dokümantasyonunda veya eş zamanlı basın haberlerinde belirtilen fiyat.
- Artificial Analysis sağlayıcılar arası medyan (ağırlık modelleri için yedek): Üç Llama 3.1 satırı (8B, 70B, 405B) ve GPT-OSS satırları için kullanılır, çünkü birinci taraf API mevcut değildir.
- Kapsamı olmayan ağırlıklar: 69 satırın 22'sinde dolar başına fiyat kaydedilmemiştir. Bunlar yetenek ve parametre başına grafiklerde görünür, ancak dolar başına grafiklerde yer almaz.
İki fiyat izini takip ediyoruz: lansman fiyatı (çıkış günündeki birinci taraf fiyatı) ve yerleşik fiyat (mevcut birinci taraf fiyatı veya kullanımdan kaldırmadan önceki son fiyat). Paneldeki altı model lansmandan sonra yeniden fiyatlandırıldı:
- Gemini 1.5 Pro: $3,50/$10,50 iken $1,25/$5,00 oldu (Ekim 2024)
- GPT-4o: $5,00/$15,00 iken $2,50/$10,00 oldu (Ekim 2024)
- Gemini 1.5 Flash: $0,35/$1,05 iken $0,075/$0,30 oldu (Ağustos 2024)
- Claude 3.5 Haiku: $1,00/$5,00 iken $0,80/$4,00 oldu (Aralık 2024)
- o3: $10,00/$40,00 iken $2,00/$8,00 oldu (Haziran 2025)
Başlıkta kullanılan dolar başına yoğunluk yerleşik fiyatlandırmayı kullanır. Fiyatlandırılmış 43 satırın 37'sinde lansman ve yerleşik fiyatlar aynıdır.
Güncelleme sıklığı
Endeksi aylık olarak yeniliyoruz. Her yenileme, önceki aydaki sınır veya dikkate değer her sürüm için yeni model satırları ekler, laboratuvarların fiyat değişikliklerini günceller, mevcut satırlar için yeni bildirilen benchmark'ları geri doldurur ve tüm panelde z-puanlarını yeniden hesaplar. Yeni model girişleri her benchmark'ın ortalamasını ve standart sapmasını değiştirdiğinden mevcut 0–100 puanları panelle birlikte hareket eder. Geçmiş anlık görüntüler korunur.
Zeka yoğunluğu değerlendirmesinin sınırlılıkları
- Laboratuvar raporlu iyimserlik: Benchmark puanları laboratuvarların kendisinden gelir. Bağımsız tekrarlar genellikle 5 ila 13 puan daha düşük gelir. Eğilim çizgileri yön gösterici olarak bilgilendiricidir ancak nokta hassasiyetinde değildir.
- Akıl yürütme ve akıl yürütmesiz modlar ayrılmadı: 2025 ve 2026'da piyasaya sürülen modeller, matematik ve kodlama puanlarını 5 ila 15 puan değiştirebilen genişletilmiş düşünme anahtarlarını destekler. Tanımlanabildiği durumda varsayılan mod puanlarını kullanırız.
- Eğitim FLOP rakamları çoğunlukla tahmindir: Birkaç satırda laboratuvar onaylı FLOP vardır. Geri kalanı, açıklanan parametreler ve eğitim token'larından, çoğunlukla Epoch AI aracılığıyla tahmin edilir.
- Kapalı model parametre sayıları bilinmiyor: Kapalı sınır satırları için parametre başına ve FLOP başına yoğunluk boştur. Kapalı modeller yalnızca dolar başına yoğunluğa katılır.
- Panel göreli puanlar: Yoğunluk puanları panel içinde min-maks olarak yeniden ölçeklendirilir. Daha yüksek ham orana sahip yeni bir model, mevcut her modelin 0–100 puanını kaydırır. Panel sürümlerini karşılaştırmak için yeniden ölçeklendirilmiş puanlar yerine altta yatan ham oranları kullanın.
Zeka yoğunluğu nedir?
Zeka yoğunluğu, bir modelin tek bir bellek veya hesaplama birimine ne kadar bilgi ve akıl yürütme yeteneği sığdırabileceğini değerlendirmek için yeni bir metriği temsil eder. Her parametreyi değer üretmek için ne kadar etkili kullandığını değerlendirerek model mimarisini ölçer.
Bu çerçevede x ekseni genellikle model parametrelerinin sayısını, y ekseni ise zorlu görevlerdeki performansı izler. Modeller, daha büyük modellerle ilişkili devasa hesaplama maliyetine gerek kalmadan üstün yetenekler gösterdiğinde yüksek yoğunluk oluşur. Bu süreç, zekanın yalnızca veri miktarına veya eğitim ölçeğine bağlı olmadığını, yazılım ve algoritmaların bu bilgiyi nasıl organize ettiğine bağlı olduğunu gösterir.
Önceden yapay zeka topluluğu, daha yüksek performansa ulaşmak için model parametrelerini ölçeklemeye bel bağlamıştı; bu da devasa ve kaynak yoğun sistemlere yol açtı. Bu odak değişimiyle birlikte, daha küçük modellerden daha fazla zeka üretmek için ham hacim yerine algoritmik optimizasyona öncelik veriliyor.
Zeka yoğunluğunu ölçmek neden önemlidir?
Verimli sistemler inference süresini ve bellek kullanımını optimize etmelidir. Daha fazla token veya ek hesaplamanın artık önemli kazanç sağlamadığı noktayı belirlemek, sektörün mevcut büyük dil modellerinin üst sınırlarını anlamasına yardımcı olur. Zeka yoğunluğunu ölçmenin başlıca nedenleri şöyle özetlenebilir:
- Yapay zeka topluluğu, veri merkezlerindeki aşırı büyük modelleri korumanın uzun vadeli yükünü hafife alıyor.
- Değer yaratımı pratik uygulamalarda, çıktı kalitesinin onu üretmek için gereken güce oranına bağlıdır.
- Donanım için Moore Yasası, dil modellerinin büyümesini, onları optimize etme biçimimizde buna karşılık gelen ilerleme olmadan sürdüremez.
- Pekiştirmeli öğrenme ve iyileştirilmiş veri dağılımı, yeni nesil araçların bir zamanlar yalnızca insanlara ayrılmış benchmark'lara ulaşmasını sağlar. Pekiştirmeli öğrenme ve diğer LLM fine-tuning teknikleri hakkında daha fazla bilgi edinin.
Daha büyük modeller yeni sınırları keşfetmek için hâlâ önemli olsa da, bir sistemin yoğunluğu gerçek dünyadaki fiili faydasını belirler. Bu bağlam, zekayı yalnızca devasa boyutun bir yan ürünü olarak değil, eğitimin yoğunlaştırılmış bir sonucu olarak görmeye yardımcı olur.
Daha fazla bilgi
Zeka yoğunluğu LLM'leri karşılaştırmanın bir yoludur. Diğer boyutlar ayrı analizlerde ele alınmıştır:
- Latency benchmark'ları: İlk token'a kadar geçen süre ve saniyede token sayısı için LLM latency benchmark sayfamıza bakın.
- Görev bazlı benchmark'lar: Finans akıl yürütme için finans LLM benchmark sayfamıza bakın. Kodlama için AI kodlama benchmark sayfamıza bakın.
Bu benchmarkı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{simsek2026,
author = {Şimşek, Hazal},
title = {{Daha Akıllı ve Daha Yoğun Modeller için 71 LLM'nin Zeka Yoğunluğu}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/intelligence-density}},
note = {AIMultiple. Erişim tarihi: 7 Temmuz 2026}
}91 veri noktasının sonuçları ve zaman damgaları. Bu makalede kullanılan verileri, 3 CSV dosyası ve bir README içeren ZIP dosyası olarak indirin.
Yorum yapan ilk kişi olun
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.