Şubat 2023 ile Mayıs 2026 arasında yayınlanan 71 LLM'yi izledik ve zeka yoğunluğunu ölçmek için 10 genel kıyaslama topladık. Yetkinlik puanını modelin tükettiği kaynağa (aktif parametreler, eğitim hesaplaması ve çıkarım fiyatı) böldük.
LLM zeka yoğunluğu genel bakış
Zeka yoğunluğunu hesaplamak için şu adımları izledik:
- Kaynak verimliliği: Her modelin yetkinliğini iki kaynak metriğine böldük:
- Aktif parametreler: Bellek ve sunum maliyeti için bir proxy (yalnızca açık ağırlıklı).
- Çıkarım fiyatı: Milyon token başına karma API fiyatlandırmasına dayalı piyasa maliyet verimliliği.
- Eğitim hesaplaması (FLOP) hakkında not: Başlangıçta üçüncü bir eksen, eğitim hesaplamasını (FLOP) dahil ettik, ancak doymuş Standart kıyaslamalardaki negatif eğimi 2023–2024 bileşik değerini sezgilere aykırı bir düşüşe sürüklediği için çıkardık.
- Kıyaslama gruplandırması: Puan doygunluğunun verimlilik kazanımlarını maskelemesini önlemek için yetkinlikleri iki farklı kıyaslama döneminde değerlendirdik:
- Standart kıyaslamalar (2023–2024): MMLU (5-shot), GSM8K (8-shot CoT), HellaSwag (10-shot), ARC Challenge (25-shot), HumanEval (0-shot pass@1).
- İleri düzey kıyaslamalar (2024–2026): MMLU-Pro, GPQA Diamond, AIME 2025, LiveCodeBench, SWE-bench Verified.
- Zincirlenmiş endeksleme: Eşleşen kıyaslama grupları içinde yıllık büyümeyi hesapladık ve birikimli eğilimi çizmek için 2023 temel çizgisi 100'den başlayarak çarpımsal olarak zincirledik.
Puanlama yaklaşımı ve kaynak başına dökümler için metodoloji bölümüne bakın.
LLM zeka yoğunluğu sonuçları
2026 ortasına gelindiğinde, yapay zeka ekosistemi kaynak birimi başına (parametreler ve dolar) 2023 temel çizgisine kıyasla yaklaşık 15 kat daha fazla zeka sundu. Eğilimi okurken dikkat edilmesi gereken iki nokta:
- 2024–2025 sıçraması (+%362) gerçek kazancı abartıyor: İleri düzey kıyaslamalar 2024'te yeniydi ve üzerlerinde puanı olan yalnızca birkaç model vardı, bu nedenle 2024 temel çizgisi yapay olarak düşük kalıyor. “Sıçramanın” çoğu panelin dolmasından kaynaklanıyor, bir yıllık verimlilik sıçraması değil.
- 2025–2026 kazancı (+%105) asıl hikayenin olduğu yer: Çok daha fazla model üzerinden ölçülüyor ve Qwen 3.6-35B-A3B ve DeepSeek V4 Flash gibi küçük açık ağırlıklı sürümlerin, çok daha küçük boyut ve maliyetle en üst düzey kapalı model yetkinliğine ulaşmasıyla yönlendiriliyor.
LLM yetkinliği
Yoğunluk grafiği verimliliği gösterir. Bağlam içine oturtmak için, aynı dönemde ham yetkinliği de ölçtük: Bu modeller herhangi bir kaynak ayarlaması yapılmadan önce gerçekte ne kadar akıllandı?
2023'te 100'e endekslenmiş, her yıl yayınlanan tüm modellerin ortalaması alınmış yetkinlik.
Eksenler ve araç ipucu yoğunluk grafiğiyle aynı şekilde çalışır; Y ekseni yoğunluk yerine ham kıyaslama performansını izler.
2023'te 100 olan yetkinlik puanı 2026'da 468'e yükseldi, yaklaşık 4,7 kat iyileşme. Yıl bazında:
- 2024 (+%88): Standart kıyaslamalarda doymadan önce hızlı ilerleme.
- 2025 (+%105): Standartın yerini alan daha zor ileri düzey kıyaslamalarda ölçülen aynı hızlı ilerleme.
- 2026 (+%22): Yavaşlama, ileri düzey kıyaslamaların da doymaya başladığının erken bir işaretidir.
İki grafiği yan yana koyduğumuzda:
- Yetkinlik 4,7 kat artarken zeka yoğunluğu 8,9 kat arttı.
- Modeller aynı anda hem daha akıllı hem de daha verimli hale geldi. Çalışmak için orantılı olarak daha fazla parametreye, eğitim hesaplamasına veya paraya ihtiyaç duymuyorlar.
Şunu unutmayın: 4,7 kat yetkinlik rakamı güvenilir bir büyüklüktür. 8,9 kat yoğunluk rakamı daha kırılgandır (2024 ileri düzey grubunda daha az veri noktası var, bu da o yılın büyüme oranını artırır), bu nedenle kesin bir çarpan yerine yön gösteren bir sinyal olarak değerlendirin.
Hangi LLM en yüksek zeka yoğunluğuna sahip?
Zeka yoğunluğu, hangi kaynağı ölçtüğümüze ve hangi kıyaslama grubunda puanladığımıza bağlıdır. Lider her kombinasyon için değişir.
Aktif parametre başına yoğunluk (yalnızca açık ağırlıklı)
Bu görünüm, bir modelin yetkinliği ağırlıklarına ne kadar verimli paketlediğini ölçer. Aktif parametreler önemlidir çünkü Uzman Karması (MoE) modelleri her token'ı toplam ağırlıkların bir kısmından yönlendirir. DeepSeek V3 toplam 671B parametreye ancak token başına 37B aktif parametreye sahiptir ve 37B rakamı etkin sunum maliyetini yansıtır.
Standart kıyaslama liderleri
- LLaMA 3.1 8B (Tem 2024): 100.0
- LLaMA 3 8B (Nis 2024): 85.0
- LLaMA 4 Maverick (Nis 2025): 55.9
- Mixtral 8x7B (Ara 2023): 47.4
- Mistral 7B (Eyl 2023): 46.3
İleri düzey kıyaslama liderleri
- Qwen 3.6-35B-A3B (Nis 2026): 100.0 (3B aktif parametre; puan yalnızca %73,4 ile SWE-bench Verified adlı tek bir kıyaslamaya dayanmaktadır, bu nedenle buna göre okuyun)
- GPT-OSS 20B (Ağu 2025): 85.2 (3.6B aktif parametre)
- GPT-OSS 120B (Ağu 2025): 64.4 (5.1B aktif parametre)
- Qwen 3.5 9B (Mar 2026): 35.2 (9B yoğun parametre)
- DeepSeek V4 Flash (Nis 2026): 26.0
Standart kıyaslama sıralaması 2024 sonundan beri hareket etmiyor çünkü kıyaslamalar doymuş durumda, ilerleme durduğu için değil. GPT-4 2023 başında standart kıyaslamalarda 90.2 puan alırken ileri düzey kıyaslamalarda 17.3 aldı.
Eğitim FLOP'u başına yoğunluk (yalnızca açık ağırlıklı)
Bu görünüm, ham harcama yerine veri iyileştirmeyi, mimari seçimlerini ve eğitim tariflerini ödüllendirir.
Not: Standart kıyaslamalarda FLOP başına yoğunluk zamanla düşüyor gibi görünüyor. Bu, eğitim verimliliğindeki bir düşüş değil, bir doygunluk yapaylığıdır. Eski kıyaslamalar artık son kazanımları ölçmez, bu nedenle eğitim hesaplaması büyümeye devam ederken yetkinlik puanları sıkışır.
Standart kıyaslama liderleri
- Mistral 7B (Eyl 2023): 100.0 (iki yılı aşkın süredir hâlâ panel çapası)
- LLaMA 3 8B (Nis 2024): 40.8
- LLaMA 1 (Şub 2023): 37.0
- DeepSeek V2 (May 2024): 32.6
- Mixtral 8x7B (Ara 2023): 27.1
İleri düzey kıyaslama liderleri
- Qwen 3.5 9B (Mar 2026): 100.0
- Qwen 3.6-35B-A3B (Nis 2026): 28.4
- DeepSeek V4 Flash (Nis 2026): 6.4
Qwen 3.5 (9B) sonucu dikkate değer: yaklaşık 1,5 × 10²³ FLOP ile eğitilmiş 9B yoğun bir model, ileri düzey kıyaslama yetkinliğinde 81.2 puan alıyor. Eğitim hesaplaması DeepSeek V4 Pro'dan kabaca bir büyüklük sırası daha düşük, ancak yetkinlik farkı daha küçük.
Çıkarım doları başına yoğunluk
Dolar başına yoğunluk, açık ağırlıklı ve kapalı en üst düzey modellerin doğrudan karşılaştırılabildiği eksendir, çünkü API fiyatlandırması kamuya açık olarak doğrulanabilir. Başlıkta oturmuş fiyatları kullanıyoruz, böylece lansman sonrası indirimler yansıtılır.
Standart kıyaslama liderleri
- Mistral Small 3 24B (Oca 2025): 100.0, Mistral'ın birinci taraf API'si üzerinden milyon token başına $0,10 / $0,30
- Gemini 1.5 Flash (May 2024): 99.3 (Ağustos 2024 fiyat indirimi sonrası en yüksek puanlı kapalı ağırlıklı model)
- DeepSeek V2 (May 2024): 66.0, milyon token başına $0,27 / $1,10
- DeepSeek V3 (Ara 2024): 30.9
- DeepSeek R1 (Oca 2025): 17.8
İleri düzey kıyaslama liderleri
- GPT-OSS 120B (Ağu 2025): 100.0 (fiyat referansı OpenRouter sağlayıcılar arası medyandır, çünkü OpenAI modeli birinci taraf API'de barındırmadı)
- GPT-OSS 20B (Ağu 2025): 80.0
- DeepSeek V4 Flash (Nis 2026): 44.0, DeepSeek'in birinci taraf API'si üzerinden milyon token başına $0,06 / $0,42
- DeepSeek V3.2 (Ara 2025): 22.5
- Mistral Small 3 24B (Oca 2025): 20.9
- DeepSeek V4 Pro (Nis 2026): 16.0, karma $0,54 ile, ileri düzey kıyaslama yetkinliği 97.8. Bu, V4 Pro'yu Claude Opus 4.7'nin yaklaşık 1/18'i karma fiyatla ( $0,54 vs $10,00 ) 2,2 yetkinlik puanı yakınına getirir.
Kapalı en üst düzey farkı kapanmadı
Anthropic, OpenAI ve Google'dan kapalı akıl yürütme modelleri, panel dönemi boyunca ileri düzey kıyaslama dolar başına yoğunlukta 0 ile 6 arasında kümelendi. GPT-4 Mart 2023'te 0.0 puan aldı. Claude Opus 4.7 Nisan 2026'da 0.9 puan aldı.
Kapalı laboratuvarlar mutlak fiyatları düşürdü:
- Claude Opus, milyon token başına $30'dan $10'a düştü (Opus 4 ile Opus 4.5 arasında).
- OpenAI'nin o3'ü lansmanda $10/$40 iken oturmuş fiyatı $2/$8'e düştü.
- Gemini 1.5 Flash yaklaşık %78 düştü.
Ancak açık ağırlıklı yoğunluk liderleriyle olan göreli fark, dönem boyunca kabaca 30 ila 50 kat olarak kaldı. DeepSeek 2024'te (V2) milyon başına $0,18 ve 2026'da (V4 Flash) milyon başına $0,18 yakınında fiyatlandı. Açık ağırlıklı fiyat tabanı hareket etmedi ve kapalı amiral gemisi tabanı farkı kapatacak kadar hareket etmedi. Fiyat rekabeti, önceki nesil katmanında, eski kapalı modellerin ucuz alternatifler olarak canlı tutulduğu yerde gerçekleşiyor, en üst düzeyde değil.
Yeni yön: Ajan kıyaslamaları
Yapay zeka performansını ölçmek için kullanılan ileri düzey kıyaslamalar, tıpkı yerini aldıkları eski test takımları gibi etkinliğini kaybetmeye başlıyor. Laboratuvarlar, eski akıl yürütme testleri yerine ajan kıyaslamalarını (SWE-Bench Pro, SWE-bench Verified, Terminal-Bench, OSWorld-Verified, Finance Agent) raporlamaya başladı. Bu değişimi izlemek için bir panel oluşturmaya başladık.
Örneğin, en yeni en üst düzey model Claude Opus 4.8, sonuçlarını neredeyse tamamen bu ajan LLM kıyaslamalarında raporluyor ve ana panelimizin izlediği akıl yürütme kıyaslamalarında hiç puan vermiyor.
Yayınlanma tarihine göre SWE-Bench Pro çözüm oranı, Scale'in SEAL standartlaştırılmış koşum takımında puanlandı. Grafiğe dahil edilen modeller arasında:
- En iyi kapalı ağırlıklı performans gösterenler: Claude Fable 5 (%80,3),Claude Opus 4.5 (%45,9), Claude Sonnet 4.5 (%43,6), ve Gemini 3 Pro Preview (%43,3).
- En iyi açık ağırlıklı performans gösterenler: GLM 5.2 (%62,1), Qwen3-Coder-480B-A35B (%38,7), Kimi K2 Instruct (%27,7), ve Qwen3-235B-A22B (%21,4).
ajan kodlama kıyaslamaları, ajan arama ve ajan izleme bölümlerine göz atarak ajan kıyaslamalarını keşfedin.
Ajan performansını karşılaştırmadaki zorluklar
Ajan kıyaslama sonuçlarını değerlendirmek ve karşılaştırmak birkaç temel zorluk sunar:
- Yetkinlik metriklerine odaklanma: Yetkinlik puanlarını gösterebiliriz, çünkü yoğunluğu ölçmek için gereken kaynak verileri (parametre sayıları, eğitim hesaplaması ve doğrulanmış model bazında fiyatlandırma) kapalı laboratuvarlar tarafından eksik veya açıklanmamış durumda.
- Sistem düzeyinde hassasiyet: Kıyaslama puanları yalnızca yapay zeka modelini değil, tüm sistemi ölçer. Puanlar büyük ölçüde “yapı iskelesine” (çevreleyen yazılım çerçevesine) bağlı olduğundan, aynı model kullanılan belirli ajan koşum takımına bağlı olarak çok farklı sonuçlar verebilir.
- Standardizasyon protokolü: Adil bir karşılaştırma sağlamak için, bu rapor yalnızca tek bir standartlaştırılmış ortamdan (Scale'in SEAL liderlik tablosu) alınan SWE-Bench Pro verilerini grafikler. Diğer laboratuvar raporlu puanlar farklı koşum takımları kullanır ve doğrudan karşılaştırılamaz.
- Claude Opus 4.8'in hariç tutulması: Opus 4.8 SWE-Bench Pro'da rekor bir %69,2 kendi kendine raporlasa da, Anthropic'in dahili koşum takımında test edildi ve henüz Scale'in SEAL'i tarafından değerlendirilmedi. Sıkı veri tutarlılığını korumak için, puanını grafiğe çizmek yerine burada not ediyoruz.
SWE-Bench Pro, Scale SEAL standartlaştırılmış koşum takımından. Diğer sütunlar, çeşitli koşum takımlarında laboratuvar raporludur ve satırlar arasında doğrudan karşılaştırılamaz. Tire işaretleri doğrulanmış puan bulunamadığı anlamına gelir.
Bu üçü mini-swe-agent koşum takımında çalıştı, bu nedenle karşılaştırılabilirliği korumak için dağılım grafiğinden çıkarıldılar.
Zeka yoğunluğu metodolojisi
Panel kapsamı
- Modeller: Şubat 2023 ile Nisan 2026 arasında yayınlanan 71 LLM. 37 modelin standart kıyaslama puanları, 54 modelin ise ileri düzey kıyaslama puanları var. Tam bir kıyaslama grubuna sahip olmayan modeller, o grubun yoğunluk hesaplamalarından çıkarılmıştır.
- Kıyaslamalar: Tümü laboratuvar raporlu ve birincil kaynağa kadar izlenebilir 10 genel kıyaslama. Hiçbir kıyaslamayı yeniden çalıştırmadık.
- Kaynaklar: Her model için yetkinlik puanını üç kaynağa bağımsız olarak böldük:
- Aktif parametreler: Bellek ve sunum maliyeti için bir proxy. Yalnızca açık ağırlıklı modellerle sınırlıdır, çünkü kapalı ağırlıklı laboratuvarlar (OpenAI, Anthropic, Google) parametre sayılarını açıklamaz.
- Eğitim hesaplaması (FLOP): Eğitim verimliliği için bir proxy. Yine yalnızca açık ağırlıklı modellerle sınırlıdır. FLOP rakamları çoğunlukla Epoch AI'dan tahminlerdir ve yön gösterici olarak okunmalıdır.
- Çıkarım fiyatı: Bir alıcının API'de gerçekten ödediği fiyat. Yetkinlik, 3:1 girdi-çıktı oranında milyon token başına karma fiyata bölünür. Hem açık hem kapalı modeller katılır, çünkü API fiyatlandırması kamuya açık olarak doğrulanabilir.
Neden iki kıyaslama grubu?
2024'te yayınlanan modeller, yapay zeka laboratuvarlarının 2020'den beri kullandığı standart kıyaslamaları doyurdu. En üst düzey modeller bir kıyaslamada %90 veya üzerine ulaştığında, test artık güçlü modelleri daha güçlü olanlardan ayırt edemez. Laboratuvarlar daha zor kıyaslamalar sunarak yanıt verdi.
Bu değişimi iki nedenden ötürü net bir kırılma olarak ele alıyoruz:
- İlk olarak, kolay ve zor kıyaslamaları tek bir yetkinlik puanı içinde karıştırmak, kolay bir kıyaslamadaki doymuş puanın zor bir kıyaslamadaki düşük puanı maskelemesine izin verirdi. MMLU-Pro'da 85 puan alan bir model, MMLU'da 85 puan alan bir modelden daha güçlüdür. İkisini eşdeğer saymak puan aralığını sıkıştırır ve eski kıyaslamaları ödüllendirir.
- İkincisi, iki takımın farklı puan dağılımları vardır: standart kıyaslamalar en üstte kümelenir (çoğu en üst düzey model 85'in üzerinde), ileri düzey kıyaslamalar ise daha geniş yayılıma sahiptir (en iyi modeller yaklaşık 90 civarında, orta seviye 50 civarında, daha zayıf modeller 30'un altında). Her ikisini bir arada z-puanlamak varyans tahminini bozar.
Her grup için yetkinliği bağımsız olarak hesaplıyoruz:
- Standart kıyaslamalar (2023–2024): MMLU (5-shot), GSM8K (8-shot düşünce zinciri), HellaSwag (10-shot), ARC Challenge (25-shot), HumanEval (0-shot pass@1).
- İleri düzey kıyaslamalar (2024–2026): MMLU-Pro, GPQA Diamond, AIME 2025, LiveCodeBench, SWE-bench Verified.
Standart kıyaslamalarda 90 puan, ileri düzey kıyaslamalarda 90 puana eşdeğer değildir. 2024 sonundan itibaren yayınlanan herhangi bir model için anlamlı referans ileri düzey kıyaslamalardır.
Yetkinlik formülü
Her bir kıyaslama b ve her model m için:
Popülasyon standart sapmasını kullanıyoruz (N'ye böler, N−1'e değil). Bu, orijinal pandas hesaplamasıyla ddof=0 eşleşir ve tek bir yeni model eklemenin varyans tahminini geriye dönük olarak kaydırmamasını sağlar.
Ardından her kıyaslama grubu içinde model başına mevcut z-puanlarının ortalamasını alır ve 0–100 panele göreli puana min-maks yeniden ölçeklendiririz.
Yoğunluk formülü
Her yoğunluk görünümü için:
Payda görünüme göre değişir: milyar cinsinden aktif parametreler, 10²⁴'e bölünmüş eğitim FLOP'u veya milyon token başına karma fiyat.
Zincirlenmiş endeks metodolojisi
Makalenin başındaki iki endeks grafiği (Zeka Yoğunluğu ve Yetkinlik), S&P 500 birikimli getiri formatını model alarak 2023'te 100'e endekslenmiş tek çizgili birikimli büyümeyi gösterir. Mutlak değerleri çizmek yerine kıyaslama geçişi boyunca yıllık büyüme oranlarını zincirliyoruz.
Adım 1. Her kıyaslama grubu için metriğin yıllık ortalamasını hesapla:
Zeka Yoğunluğu Endeksi için metrik, model başına üç yoğunluk puanının satır bazında ortalamasıdır (Birleşik Yoğunluk A veya B). Yetkinlik Endeksi için metrik, panele göreli yetkinlik puanıdır (Capability_A veya Capability_B).
Adım 2. Her yıldan yıla geçiş için, tek bir kıyaslama grubu içindeki büyümeyi hesapla. Her iki yıl da aynı gruptan gelmelidir:
Adım 3. 2023 temel çizgisi 100'den başlayarak çarpımsal olarak zincirle:
Geçiş başına grup seçimi:
- 2023 – 2024: Standart kıyaslamalar (İleri düzeyde 2023'te 1 model var, sabit bir ortalama hesaplamak için çok az)
- 2024 – 2025: İleri düzey kıyaslamalar (Standart 2024 sonunda doydu; İleri düzeyde 2024'te 16, 2025'te 27 model var)
- 2025 – 2026: İleri düzey kıyaslamalar (Standart 2026 için raporlanmadı)
Zincirlenmiş endeks, altta yatan popülasyonların bir grup içinde yıllar arasında karşılaştırılabilir olduğunu varsayar. Panelimiz heterojendir (her yıl farklı modeller, farklı kıyaslama kapsamı), bu nedenle zincirlenmiş değerler en iyi kesin bir çarpan yerine yön gösterici bir özet olarak okunur.
Zeka yoğunluğu ölçümü için temel değerlendirme ilkeleri
- Sektör standardı kıyaslamalar: Hiçbir özel kıyaslama sunmuyoruz.
- Birincil kaynaktan alıntı: Her kıyaslama puanı, modelin yayın makalesine, model kartına veya resmi duyurusuna kadar izlenebilir. Birincil kaynağın bir kıyaslamayı raporlamadığı durumlarda hücre boş bırakılır, atama yapılmaz.
- Kapsam bayrakları (N): Her model için, yetkinlik puanına katkıda bulunan kıyaslama sayısını her grupta raporlarız. N=1 olan modeller, N=5 olan modellere göre daha gürültülü bir puan alır. N=1 durumu, Qwen 3.6 35B A3B (yalnızca SWE-bench Verified) ve birkaç 2026 kapalı amiral gemisi sürümü için geçerlidir.
Kapalı ağırlıklı modeller için fiyatlandırma kaynakları
Fiyatlandırma endeksin en kohorta duyarlı parçasıdır. Aşağıdaki hiyerarşiyi kullanıyoruz:
- Laboratuvar lansman duyurusu (tercih edilen): Laboratuvarın lansman yazısında, API belgelerinde veya eş zamanlı basın haberlerinde belirtilen fiyat.
- Artificial Analysis sağlayıcılar arası medyan (yalnızca ağırlıkları açık modeller için yedek): Üç Llama 3.1 satırı (8B, 70B, 405B) ve GPT-OSS satırları için kullanıldı, çünkü birinci taraf API yok.
- Kapsam dışı yalnızca ağırlıklar: 69 satırdan 22'sinin dolar başına fiyatı kaydedilmemiştir. Bunlar yetkinlik ve parametre başına grafiklerde görünür, ancak dolar başına grafiklerde yoktur.
İki fiyat rotasını izliyoruz: lansman fiyatı (yayınlandığı günkü birinci taraf fiyatı) ve oturmuş fiyat (mevcut birinci taraf fiyatı veya kullanımdan kaldırılmadan önceki son fiyat). Paneldeki altı model lansmandan sonra yeniden fiyatlandırıldı:
- Gemini 1.5 Pro: $3,50/$10,50'den $1,25/$5,00'a (Ekim 2024)
- GPT-4o: $5,00/$15,00'den $2,50/$10,00'a (Ekim 2024)
- Gemini 1.5 Flash: $0,35/$1,05'den $0,075/$0,30'a (Ağustos 2024)
- Claude 3.5 Haiku: $1,00/$5,00'den $0,80/$4,00'a (Aralık 2024)
- o3: $10,00/$40,00'dan $2,00/$8,00'a (Haziran 2025)
Başlıktaki dolar başına yoğunluk, oturmuş fiyatlandırmayı kullanır. Fiyatlandırılmış 43 satırın 37'si için lansman ve oturmuş fiyatlar aynıdır.
Güncelleme sıklığı
Endeksi aylık olarak yeniliyoruz. Her yenilemede, önceki aydaki en üst düzey veya kayda değer herhangi bir sürüm için yeni model satırları eklenir, laboratuvarların fiyatlarını güncellediği durumlarda fiyatlandırma güncellenir, mevcut satırlar için yeni raporlanan kıyaslamalar geriye dönük doldurulur ve tüm panel genelinde z-puanları yeniden hesaplanır. Yeni model girişleri her bir kıyaslamanın ortalamasını ve standart sapmasını kaydırır, bu nedenle mevcut 0–100 puanları panelle birlikte hareket eder. Geçmiş anlık görüntüler korunur.
Zeka yoğunluğu değerlendirmesinin sınırlamaları
- Laboratuvar raporlu iyimserlik: Kıyaslama puanları laboratuvarların kendisinden gelir. Bağımsız yeniden çalıştırmalar tipik olarak 5 ila 13 puan daha düşük gelir. Eğilim çizgileri yön olarak bilgilendiricidir ancak nokta hassasiyetinde değildir.
- Akıl yürütme ve akıl yürütme dışı modlar ayrılmadı: 2025 ve 2026'da yayınlanan modeller, matematik ve kodlama puanlarını 5 ila 15 puan kaydırabilen genişletilmiş düşünme seçeneklerini destekler. Ayırt edilebilen yerlerde varsayılan mod puanlarını kullanıyoruz.
- Eğitim FLOP rakamları çoğunlukla tahmindir: Bir avuç satırda laboratuvar onaylı FLOP vardır. Geri kalanı, açıklanan parametreler ve eğitim token'larından, çoğunlukla Epoch AI aracılığıyla kestirilmiştir.
- Kapalı model parametre sayıları bilinmiyor: Parametre başına ve FLOP başına yoğunluk, kapalı en üst düzey satırlar için boştur. Kapalı modeller yalnızca dolar başına yoğunluğa katılır.
- Panele göreli puanlar: Yoğunluk puanları panel içinde min-maks yeniden ölçeklendirilir. Daha yüksek ham orana sahip yeni bir model, mevcut her modelin 0–100 puanını kaydırır. Panelin sürümlerini karşılaştırmak için yeniden ölçeklendirilmiş puanlar yerine altta yatan ham oranları kullanın.
Zeka yoğunluğu nedir?
Zeka yoğunluğu, bir modelin tek bir bellek veya hesaplama birimine ne kadar bilgi ve akıl yürütme yeteneği sığdırabileceğini değerlendiren yeni bir metriği temsil eder. Model mimarisini, her bir parametreyi değer üretmek için ne kadar etkili kullandığını değerlendirerek ölçer.
Bu çerçevede, x ekseni genellikle model parametrelerinin sayısını temsil ederken, y ekseni zorlu görevlerdeki performansı izler. Yüksek yoğunluk, modeller daha büyük modellerle ilişkili devasa hesaplama maliyetini gerektirmeden üstün yetenekler sergilediğinde ortaya çıkar. Bu süreç, zekanın yalnızca veri miktarına veya eğitimin ölçeğine bağlı olmadığını, daha ziyade yazılımın ve algoritmaların bu bilgiyi nasıl organize ettiğine bağlı olduğunu kanıtlar.
Eskiden yapay zeka topluluğu daha yüksek performansa ulaşmak için model parametrelerini ölçeklendirmeye güveniyordu, bu da devasa, kaynak ağırlıklı sistemlere yol açtı. Bu odak değişikliğiyle birlikte, daha küçük modellerden daha fazla zeka üretmek için ham hacim yerine algoritmik optimizasyon önceliklendirilmektedir.
Zeka yoğunluğunu ölçmek neden önemlidir?
Verimli sistemler, çıkarım süresini ve bellek kullanımını optimize etmelidir. Daha fazla token veya ek hesaplamanın artık önemli kazanımlar sağlamadığı noktayı belirlemek, endüstrinin mevcut büyük dil modellerinin üst sınırlarını anlamasına yardımcı olur. Zeka yoğunluğunu ölçmenin başlıca nedenleri şöyle özetlenebilir:
- Yapay zeka topluluğu, veri merkezlerinde aşırı büyük modelleri sürdürmenin uzun vadeli ek yükünü hafife alıyor.
- Değer yaratımı pratik uygulamalarda, çıktı kalitesinin onu üretmek için gereken güce oranına bağlıdır.
- Donanım için Moore Yasası, onları nasıl optimize ettiğimize dair karşılık gelen ilerleme olmadan dil modellerinin büyümesini sürdüremez.
- Pekiştirmeli öğrenme ve iyileştirilmiş veri dağılımı, yeni nesil araçların bir zamanlar yalnızca insanlara ayrılmış ölçütlere ulaşmasını sağlar. Pekiştirmeli öğrenme ve diğer LLM ince ayar teknikleri hakkında daha fazla bilgi edinin.
Daha büyük modeller yeni sınırları keşfetmek için hâlâ önemli olsa da, bir sistemin yoğunluğu gerçek dünyadaki asıl faydasını belirler. Bu bağlam, zekayı salt boyutun bir yan ürünü olarak değil, eğitimin yoğunlaştırılmış bir sonucu olarak görmeye yardımcı olur.
Daha fazla okuma
Zeka yoğunluğu, LLM'leri karşılaştırmanın bir yoludur. Diğer boyutlar ayrı analizlerde ele alınmıştır:
- Gecikme kıyaslamaları: İlk token'a kadar geçen süre ve saniye başına token için LLM gecikme kıyaslamamıza bakın.
- Görev başına kıyaslamalar: Finansal akıl yürütme için finans LLM kıyaslamamıza bakın. Kodlama için yapay zeka kodlama kıyaslamamıza bakın.
Bu benchmarkı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{simsek2026,
author = {Şimşek, Hazal},
title = {{71 LLM'nin Zeka Yoğunluğu: Daha Akıllı ve Daha Yoğun Modeller}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/intelligence-density}},
note = {AIMultiple. Erişim tarihi: 7 Temmuz 2026}
}69 veri noktasının sonuçları ve zaman damgaları. Bu makalede kullanılan verileri, bir CSV dosyası ve bir README içeren ZIP dosyası olarak indirin.
Yorum yapan ilk kişi olun
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.