Premium
Hizmetler
Premium

LLM Karşılaştırmaları

Kamuya açık karşılaştırmaları AIMultiple'ın kendi agentic, RAG ve kurumsal muhakeme değerlendirmeleriyle birleştiren tek ve şeffaf bir Zeka Endeksi. Endeks Nasıl Oluşturulur

EN İYİ MODEL
Claude Opus 5.5
Endeks 100
En iyi değer
Qwen3.8 Flash
$0.23 / 1M
En hızlı
MiniMax M2.7
0.15s TTFT
AIMultiple Zeka Endeksi

Liderlik Tablosu

Tüm benchmark'larda en yüksek puan alan modeller.

Filter & Sort
#
Model
Endeks
AA-LCR
AIM-A-CODE-LLM Bench
AIM-Agentic-RAG
AIM-FinanceReasoning
AIM-HALC-Bench
AIM-RELC-Bench
AIM-Text-to-SQL
APEX-Agents-AA
ARC-AGI-1
ARC-AGI-2
ARC-AGI-3
ArxivMath
AutomationBench-AA
BioMysteryBench
BrowseComp
Convex Coding Evals
CritPt
Crosby RedlineBench
DeepSWE 1.1
EnterpriseOps-Gym-AA
Frontier-Bench
FrontierCode
FrontierMath
GDPval
GPQA Diamond
Harvey LAB-AA
HealthBench Professional
HieroglyphBench
Humanity's Last Exam
IFBench
ITBench-AA
LegalBench
LiveCodeBench
MMMU-Pro
ObviousBench
Opus Magnum Bench
ReactBench
RuneBench
SciCode
SimpleBench
Swe-Bench
Tau2-Bench Telecom
Tau3-Banking
Terminal-Bench 2.1
Terminal-Bench 4.0
Terminal-Bench Hard
Terminal-Bench-Science
1
Claude Opus 5.5
Claude Opus 5.5
Anthropic
100
--9092--88---------32------1846--------------67--------
2
GPT-6 Astra
GPT-6 Astra
OpenAI
92
--8487--66--9563-41-928532-74--5398154296-70----------756----9058--
3
Claude Fable 5.1
Claude Fable 5.1
Anthropic
91
80-8490--67-9890--31--8131-67--5188173594-62-59--89-----663---479156--
4
Qwen3.8 Flash
Qwen3.8 Flash
Alibaba Cloud
87
77----------------------174392---3881--------47---4586---
5
Command A+
Command A+
Cohere
87
----------------30------------74-61---------81---25-
6
MiMo-V2.6-Pro
MiMo-V2.6-Pro
Xiaomi
87
----------------27------1673--------------61--------
7
Muse Spark 1.1
Muse Spark 1.1
Meta
86
81-----------------53----138190-59-46--85--99-23658---3278---
8
Claude Fable 5
Claude Fable 5
Anthropic
85
77698290--66599989-7917-878429-70-3454901741931463235664-89-8199224766182-993885426321
9
Claude Opus 5
Claude Opus 5
Anthropic
83
79-8590--64-989030915079918229-74-445373170894-60-55--87-85100--656---458952-30
10
GPT-6 Sol
GPT-6 Sol
OpenAI
79
--82---54---------31------1487--------------58--------
Sayfa 1 / 13

Maliyet$8.00
Gecikme2.81s
Bağlam1M
TTFT2.81s
AIM-Agentic-RAG
90
AIM-FinanceReasoning
92
AIM-Text-to-SQL
88
CritPt
32
GDPval
1846
SciCode
67

Maliyet$20.00
Gecikme6.31s
Bağlam1M
TTFT6.31s
AIM-Agentic-RAG
84
AIM-FinanceReasoning
87
AIM-Text-to-SQL
66
ARC-AGI-2
95
ARC-AGI-3
63
AutomationBench-AA
41
BrowseComp
92
Convex Coding Evals
85
CritPt
32
DeepSWE 1.1
74
FrontierCode
53
FrontierMath
98
GDPval
1542
GPQA Diamond
96
HealthBench Professional
70
RuneBench
7
SciCode
56
Terminal-Bench 2.1
90
Terminal-Bench 4.0
58

Maliyet$20.00
Gecikme3.84s
Bağlam1M
TTFT3.84s
AA-LCR
80
AIM-Agentic-RAG
84
AIM-FinanceReasoning
90
AIM-Text-to-SQL
67
ARC-AGI-1
98
ARC-AGI-2
90
AutomationBench-AA
31
Convex Coding Evals
81
CritPt
31
DeepSWE 1.1
67
FrontierCode
51
FrontierMath
88
GDPval
1735
GPQA Diamond
94
HealthBench Professional
62
Humanity's Last Exam
59
LegalBench
89
RuneBench
6
SciCode
63
Tau3-Banking
47
Terminal-Bench 2.1
91
Terminal-Bench 4.0
56

Maliyet$0.23
Gecikme0.85s
Bağlam1M
TTFT0.85s
AA-LCR
77
GDPval
1743
GPQA Diamond
92
Humanity's Last Exam
38
IFBench
81
SciCode
47
Tau3-Banking
45
Terminal-Bench 2.1
86

Maliyet$0.60
Gecikme-
Bağlam200k
TTFT
CritPt
30
IFBench
74
LegalBench
61
Tau2-Bench Telecom
81
Terminal-Bench Hard
25

Maliyet$0.54
Gecikme43.98s
Bağlam1M
TTFT43.98s
CritPt
27
GDPval
1673
SciCode
61

Maliyet$2.00
Gecikme5.26s
Bağlam1M
TTFT5.26s
AA-LCR
81
DeepSWE 1.1
53
GDPval
1381
GPQA Diamond
90
HealthBench Professional
59
Humanity's Last Exam
46
LegalBench
85
ObviousBench
99
ReactBench
23
RuneBench
6
SciCode
58
Tau3-Banking
32
Terminal-Bench 2.1
78

Maliyet$20.00
Gecikme4.35s
Bağlam1M
TTFT4.35s
AA-LCR
77
AIM-A-CODE-LLM Bench
69
AIM-Agentic-RAG
82
AIM-FinanceReasoning
90
AIM-Text-to-SQL
66
APEX-Agents-AA
59
ARC-AGI-1
99
ARC-AGI-2
89
ArxivMath
79
AutomationBench-AA
17
BrowseComp
87
Convex Coding Evals
84
CritPt
29
DeepSWE 1.1
70
Frontier-Bench
34
FrontierCode
54
FrontierMath
90
GDPval
1741
GPQA Diamond
93
Harvey LAB-AA
14
HealthBench Professional
63
HieroglyphBench
23
Humanity's Last Exam
56
IFBench
64
LegalBench
89
MMMU-Pro
81
ObviousBench
99
Opus Magnum Bench
22
ReactBench
47
RuneBench
6
SciCode
61
SimpleBench
82
Tau2-Bench Telecom
99
Tau3-Banking
38
Terminal-Bench 2.1
85
Terminal-Bench 4.0
42
Terminal-Bench Hard
63
Terminal-Bench-Science
21

Maliyet$10.00
Gecikme4.03s
Bağlam1M
TTFT4.03s
AA-LCR
79
AIM-Agentic-RAG
85
AIM-FinanceReasoning
90
AIM-Text-to-SQL
64
ARC-AGI-1
98
ARC-AGI-2
90
ARC-AGI-3
30
ArxivMath
91
AutomationBench-AA
50
BioMysteryBench
79
BrowseComp
91
Convex Coding Evals
82
CritPt
29
DeepSWE 1.1
74
Frontier-Bench
44
FrontierCode
53
FrontierMath
73
GDPval
1708
GPQA Diamond
94
HealthBench Professional
60
Humanity's Last Exam
55
LegalBench
87
MMMU-Pro
85
ObviousBench
100
RuneBench
6
SciCode
56
Tau3-Banking
45
Terminal-Bench 2.1
89
Terminal-Bench 4.0
52
Terminal-Bench-Science
30

Maliyet$4.00
Gecikme1.36s
Bağlam1M
TTFT1.36s
AIM-Agentic-RAG
82
AIM-Text-to-SQL
54
CritPt
31
GDPval
1487
SciCode
58
Sayfa 1 / 13
Model Çıkış Zamanları
Model yayın tarihine göre Zeka Endeksi
Maliyet ve Performans
Harmanlanmış maliyete karşı Zeka Endeksi
Model × Karşılaştırma
Seçili karşılaştırmalarda önde gelen modeller

Endeks Nasıl Oluşturulur

Her benchmark ham skor olarak değil, konum olarak okunur. Bir benchmark'ın içinde en iyi sonuç 100'e, en kötüsü 0'a oturur; diğer bütün modeller ikisinin arasında bir yere düşer. İndeks, modelin gerçekten koştuğu benchmark'lardaki bu konumların ağırlıklı ortalamasıdır: hiç koşmadığı bir benchmark sıfır sayılmaz, yalnızca yoktur. Benchmark'lar eşit ağırlıkta değildir ve her birinin taşıdığı ağırlık yanında belirtilir. Bir modelin sıralanabilmesi için en az iki indeks benchmark'ında sonucu olması gerekir; tek bir sonuç modeli o benchmark'ın çizgisine yerleştirir ama kendi başına bir sıralama vermez. Ham doğruluk yerine konum kullanılır, çünkü benchmark'lar zorluk ve ölçek bakımından keskin biçimde ayrışır ve farklı benchmark'ların skorları aynı ortalamayı paylaşamaz. Ağırlıklar: AIM-FinanceReasoning (10%) + AIM-Text-to-SQL (10%) + AIM-Agentic-RAG (10%) + SciCode (10%) + FrontierMath (10%) + Terminal-Bench 2.1 (10%) + CritPt (10%) + IFBench (10%) + MMMU-Pro (10%) + ARC-AGI-3 (10%).

Kullandığımız kıyaslamalar

Kamuya Açık
AA-LCRCok belgeli girdiler uzerinde uzun baglamli akil yurutme.
AIMultiple
AIM-A-CODE-LLM BenchCLI aracı üzerinden 10 yazılım geliştirme görevinde ajanik kodlama (~3.500 doğrulama adımı).
AIMultiple
AIM-Agentic-RAG5 veri tabanı üzerinde çoklu veri tabanı yönlendirmesi ve SQL sorgusu üretimi (BIRD-SQL, 500 soru).
AIMultiple
AIM-FinanceReasoning238 zor FinanceReasoning sorusunda çok adımlı, karmaşık finansal muhakeme.
AIMultiple
AIM-HALC-BenchUzun bağlamlı belgelerde geçmeyen metrikleri uydurmaya karşı direnç (204 tuzak, 14 transkript).
AIMultiple
AIM-RELC-BenchUzun bağlamda, belgenin farklı konumlarından sayısal bilgi çekme (100 öğe, 14 transkript).
AIMultiple
AIM-Text-to-SQL35'ten fazla LLM'de doğal dilden SQL sorgusu üretme doğruluğu.
Kamuya Açık
APEX-Agents-AAYatirim bankacilari, danismanlar ve sirket avukatlarinin yazdigi uzun soluklu, uygulamalar arasi gorevler.
Kamuya Açık
ARC-AGI-1Izgara donusumleri uzerinde az ornekli soyut akil yurutme; ilk ARC Prize kiyaslamasi.
Kamuya Açık
ARC-AGI-2Ezberi değil genellemeyi ölçen özgün görsel muhakeme bulmacaları.
Kamuya Açık
ARC-AGI-3Etkilesimli akil yurutme: ajanlar daha once gormedikleri oyun ortamlarini kesfeder, hedefi yol boyunca kendi belirler ve adimlar boyunca ogrenir. %100 insanin ogrenme verimliligine esittir.
Kamuya Açık
ArxivMathYeni arXiv matematik problemleri; kontaminasyonu sinirlamak icin yayindan hemen sonra kosulur.
Kamuya Açık
AutomationBench-AAUctan uca ofis otomasyonu gorevleri; kismi tamamlanma uzerinden puanlanir.
Kamuya Açık
BioMysteryBenchAnthropic'in, ajanlarin ham veriden gercek biyoinformatik bilmecelerini cozup cozemedigini olcen kiyaslamasi.
Kamuya Açık
BrowseCompCanli web'de bulunmasi zor bilgiler: yanit icin israrli gezinme gerektiren kisa sorular.
Kamuya Açık
Convex Coding EvalsIstemde cerceveye ozel yonerge olmadan Convex arka ucu ve istemci entegrasyonu yazma.
Kamuya Açık
CritPtCok adimli turetme gerektiren arastirma duzeyinde fizik problemleri.
Kamuya Açık
Crosby RedlineBenchSozlesme revizyonu gorevleri; avukat duzenlemelerine karsi tur tur puanlanir.
Kamuya Açık
DeepSWE 1.1Canli acik kaynak depolarindan uzun soluklu muhendislik gorevleri; islenen kod temiz bir ortamda degerlendirilir.
Kamuya Açık
EnterpriseOps-Gym-AASekiz kurumsal sistem uzerinde durum tutan ajan planlamasi ve arac kullanimi.
Kamuya Açık
Frontier-BenchGuncel depolar uzerinde ajan tabanli yazilim gorevleri; cozum orani ile puanlanir.
Kamuya Açık
FrontierCodeBir degisikligin testi gecmesi degil birlestirilebilir olmasi: gerileme guvenligi, kapsam ve bakim kolayligi rubrikle degerlendirilir.
Kamuya Açık
FrontierMathUzmanlarca hazırlanmış, yayımlanmamış araştırma düzeyi matematik problemleri (1–4. seviyeler).
Kamuya Açık
GDPvalABD GSYIH'sinin en buyuk dokuz sektorunden 44 meslege ait gercek is ciktilari; deneyimli profesyoneller tarafindan, insan yapimi bir referansa karsi kor degerlendirilir.
Kamuya Açık
GPQA DiamondAramayla cozulemeyen, derin akil yurutme gerektiren lisansustu duzeyde bilim sorulari.
Kamuya Açık
Harvey LAB-AAHarvey'nin hukuki ajan kiyaslamasi; tum adimlarin gecmesi uzerinden puanlanir.
Kamuya Açık
HealthBench ProfessionalHekimlerin yazdigi konusmalar, yine hekimlerin yazdigi rubriklerle puanlanir; profesyonel bolum.
Kamuya Açık
HieroglyphBenchGoruntulerden Misir hiyerogliflerini okuma; isaret dogrulugu uzerinden puanlanir.
Kamuya Açık
Humanity's Last Exam100'den fazla akademik alanda uzman düzeyinde, kaynak kullanmadan muhakeme (2,5 bin soru).
Kamuya Açık
IFBenchDaha once gorulmemis 58 dogrulanabilir cikti kisitinda hassas talimat takibi.
Kamuya Açık
ITBench-AASite guvenilirligi, FinOps ve guvenlik operasyonlarini kapsayan gercek BT otomasyonu senaryolari.
Kamuya Açık
LegalBenchHukuk profesyonellerinin oluşturduğu 162 görevde kitle kaynaklı hukuki muhakeme.
Kamuya Açık
LiveCodeBenchKontaminasyondan arındırılmış, sürekli güncellenen yarışma programlama problemleri.
Kamuya Açık
MMMU-ProDisiplinler arasi universite duzeyinde cok kipli anlama; yalnizca metinle cozmeye karsi sertlestirilmis.
Kamuya Açık
ObviousBenchCevabi asikar oldugu halde modellerin yanildigi sorular; pass-kup ile puanlanir.
Kamuya Açık
Opus Magnum BenchOpus Magnum bulmaca oyununda calisan makineler tasarlama.
Kamuya Açık
ReactBenchReact bileseni kurma ve duzeltme; pass@1 ile puanlanir.
Kamuya Açık
RuneBenchModelin daha once gormedigi, uydurulmus bir run yazisini okuma ve uzerinde akil yurutme; logaritmik olcekte puanlanir.
Kamuya Açık
SciCodeFizik, matematik, biyoloji ve kimyada araştırma düzeyinde bilimsel kodlama (338 alt problem)
Kamuya Açık
SimpleBenchInsanlarin ust duzey modelleri duzenli olarak gectigi gundelik akil yurutme sorulari.
Kamuya Açık
Swe-BenchUçtan uca çözülen gerçek GitHub issue'ları (2.294 örneklik tam set).
Kamuya Açık
Tau2-Bench TelecomTelekom alaninda arac kullanan musteri destek ajanlari; gorev basarisi uzerinden puanlanir.
Kamuya Açık
Tau3-BankingGercekci bankacilik musteri hizmetleri is akislarini yuruten arac kullanan ajanlar.
Kamuya Açık
Terminal-Bench 2.1Yazilim muhendisligi, veri ve sistem yonetimi alanlarinda ajan tabanli terminal gorevleri.
Kamuya Açık
Terminal-Bench 4.0Guncel Terminal-Bench kusagi: ajan tabanli terminal gorevleri, cozum orani ile puanlanir.
Kamuya Açık
Terminal-Bench HardTerminal-Bench'in zor alt kumesi: gercek bir terminalde cok adimli yazilim gorevleri.
Kamuya Açık
Terminal-Bench-ScienceGercek bilimsel hesaplama is akislarindan alinan terminal gorevleri.

Son Güncellemeler

Zeka Endeksi, model kapsamı ve AIMultiple karşılaştırma metodolojisindeki en son değişiklikler.

Anthropic

Claude Opus 5.5

AIMultiple Zeka Endeksine yeni eklenen model.

OpenAI

GPT-6 Sol

AIMultiple Zeka Endeksine yeni eklenen model.

OpenAI

GPT-6 Luna

AIMultiple Zeka Endeksine yeni eklenen model.

Xiaomi

MiMo-V2.6-Pro

AIMultiple Zeka Endeksine yeni eklenen model.

LLM Yayın Zaman ÇizelgesiYapay zeka inovasyonunun hızı
Yapay Zeka Laboratuvarları
Alibaba Cloud
Alibaba Cloud
03 Ağu 2026
Qwen3.7 Flash +1 dahaQwen3.7 FlashQwen3.8 Max
14 Ağu 2026
Qwen3.8 2.4T A95B +1 dahaQwen3.8 2.4T A95BQwen3.8 27B
03 Eyl 2026
Qwen3.8 Flash +1 dahaQwen3.8 FlashQwen3.8 Max (0902)
23 Eyl 2026
Qwen3.8 Max Prime +1 dahaQwen3.8 Max PrimeQwen3.8 Omni Flash
Z AI
Z AI
26 Ağu 2026
GLM 5.3 +1 dahaGLM 5.3GLM 5.3 Flash
23 Eyl 2026
GLM 5.3 FlashX +1 dahaGLM 5.3 FlashXGLM 5.3 Prime
Anthropic
Anthropic
24 Tem 2026
Claude Opus 5
01 Eyl 2026
Claude Fable 5.1
22 Eyl 2026
Claude Opus 5.5
OpenAI
OpenAI
22 Eyl 2026
GPT-6 Astra +2 dahaGPT-6 AstraGPT-6 LunaGPT-6 Sol
Xiaomi
Xiaomi
21 Eyl 2026
MiMo-V2.6-Pro
X
X
12 Ağu 2026
Grok 4.6
21 Eyl 2026
Grok 4.7
Meta
Meta
09 Ağu 2026
Muse Glimmer 30B +1 dahaMuse Glimmer 30BMuse Spark 1.2
02 Eyl 2026
Muse Spark 1.2 Contributor +2 dahaMuse Spark 1.2 ContributorMuse Spark 1.3Muse Spark 1.3 Contributor
Google
Google
13 Ağu 2026
Gemini 3.7 Flash
02 Eyl 2026
Gemini 3.8 Flash
Tencent
Tencent
28 Ağu 2026
Hy4

LLM Kullanım Durumları, Analizler ve Ölçümler Keşfedin

Text-to-SQL: LLM Doğruluk Karşılaştırması

LLM
Kıyaslama
25 Eyl

36 büyük dil modelini 759 soru üzerinde BIRD-SQL'den çalıştırdık; her model, 11 aday arasından kendisinin belirlemesi gereken bir veritabanına karşı SQL yazdı. Ayrıştırılabilen her sorgu gerçek veritabanında çalıştırıldı ve sonuç kümesi BIRD'ün altın sorgusunun sonuç kümesiyle karşılaştırıldı. Eksik, hatalı biçimlendirilmiş ve yürütme hatası veren sorgular ıskalanmış olarak puanlandı. Her çalıştırma sıcaklık 0'da, zero-shot olarak ve…

Devamını Oku
LLM
İçgörü
25 Eyl

LLM Pazar Payı: Kullanım ve Benimseme Karşılaştırması

Kullanım tabanlı verileri ve web ziyareti tahminlerini birleştirerek LLM pazar payını analiz ettik; büyük dil modellerine yönelik talebin yapay zeka laboratuvarları ve yapay zeka uygulamaları arasında nasıl dağıldığını gösteriyoruz. Bu sonuçları nasıl ölçtüğümüzü ve hesapladığımızı görmek için metodolojiyi okuyun. Amerika Birleşik Devletleri dört ayın tamamında web ziyaretlerinde baskındı; sürekli olarak 85–%95 paya sahipti. Bu, hem…

LLM
Kıyaslama
24 Eyl

Finans Alanında 40+ LLM Kıyaslaması: Claude Fable 5 ve GPT-5.6 Sol

LLM'leri FinanceReasoning kıyaslamasındaki 238 zor soru üzerinde değerlendirdik (Tang ve ark.).1 Bu alt küme, en zorlu finansal muhakeme görevlerini hedefler; finansal kavramları ve formülleri içeren karmaşık, çok adımlı nicel akıl yürütmeyi değerlendirir. Değerlendirmemizde özel bir prompt tasarımı ve doğruluk ile token tüketimi puanlama kriterleri kullanılmıştır. Bu metriklerin nasıl hesaplandığına ve bu değerlendirme için kullanılan framework'e…

LLM
Kıyaslama
21 Eyl

Çok Modlu Yapay Zeka Modellerini Görsel Muhakeme Konusunda Karşılaştırın

Önde gelen 15 çok modlu yapay zeka modelini 200 görsel tabanlı soru kullanarak görsel muhakeme konusunda kıyasladık. Değerlendirme iki parkurdan oluşuyordu: veri görselleştirme yorumlamasını test eden 100 grafik anlama sorusu ve örüntü tanıma ile uzamsal muhakemeyi değerlendiren 100 görsel mantık sorusu. Tutarlı ve güvenilir sonuçlar sağlamak için her soru 5 kez çalıştırıldı. Test prosedürlerimizi öğrenmek…

LLM
İçgörü
21 Eyl

Büyük Multimodal Model'ler (LMM'ler) vs LLM'ler

Finansal akıl yürütme görevlerinde Büyük Multimodal Model'lerin (LMM'lerin) performansını özenle seçilmiş bir dataset kullanarak değerlendirdik. Yüksek kaliteli finansal örneklerin bir alt kümesini analiz ederek, model'lerin finans alanındaki multimodal verileri işleme ve bu verilerle akıl yürütme yeteneklerini değerlendiriyoruz. metodoloji bölümü kullanılan dataset ve değerlendirme framework'ü hakkında ayrıntılı bilgiler sunar. Büyük multimodal model'leri keşfedin ve bunları büyük…

LLM
İçgörü
21 Eyl

LLM Kendi Kendine Barındırma için VRAM Hesaplayıcı

Bir LLM'yi kendi kendine barındırmak, çıkarımı operatörün kontrol ettiği donanımda, üçüncü taraf bir API aracılığıyla değil, çalıştırmak anlamına gelir; bu da maliyeti, veri kontrolünü ve gizlilik profilini değiştirir. Bir modelin hiç çalışıp çalışmayacağı belleğe bağlıdır. Hesaplayıcı, modele, hassasiyetine, bağlam uzunluğuna ve hedef donanıma bağlı olarak bir modelin yerel olarak çalıştırılması için gereken VRAM veya birleşik…

LLM
Kıyaslama
18 Eyl

Agentic IT: Yapay Zeka Ajanları Bir Benchmark Tasarlayabilir mi?

16 model'i text-to-SQL ve araç çağırma alanında bir benchmark tasarımında test ettik. Her model konu başına bir benchmark oluşturdu; toplam 32 gönderim oldu. Hiçbir gönderim tüm rubrik ölçütlerini geçemedi. Ajanlar testleri oluşturup çalıştırabildi ancak hiçbiri kendi puanlayıcısına ait hem boş-yanıt testini hem de doğru-yanıt testini gösteremedi. Text-to-SQL, sade bir dille yazılmış soruyu bir veritabanı sorgusuna…

LLM
Kıyaslama
17 Eyl

AIM Enterprise: Otonom Kurumsal Benchmark

Kuruluşlar düzenli görevleri için her gün LLM'ler kullanır. En maliyet etkin LLM'leri bulmak için, strateji, pazarlama, İK, satış ve operasyonları kapsayan 69 gerçek kurumsal görev kullandığımız etmen tabanlı bir kurumsal benchmark olan AIM Enterprise'ı tasarladık, İki hakem model, kontrolleri geçen her dosyayı puanladı. Bireysel puanların %32,7'sinde iki hakem ölçeğin dörtte birinden fazla farklılaştı ve bu…

LLM
İçgörü
17 Eyl

Büyük Dil Modellerinin Geleceği

büyük dil modellerinin geleceğini, kendi kendine eğitim, doğruluk kontrolü ve seyrek uzmanlık gibi umut verici yaklaşımlara inerek görün; bunlar LLM sınırlamalarını giderebilir. LLM'lerin başarı oranı karşılaştırması Claude Sonnet 4.6, genel 0.748 puanla benchmark'a liderlik etti; base ve thinking varyantları üç ondalık basamağa kadar eşitti. Claude Opus 4.8 (0.702), Opus 4.6 base (0.706) ve Opus 4.6…

LLM
Kıyaslama
15 Eyl

Siber Güvenlikte Büyük Dil Model'leri

7 büyük dil model'ini 9 siber güvenlik alanında, güvenlik görevleri için geniş ölçekli ve çok formatlı bir kıyaslama olan SecBench'i kullanarak değerlendirdik. Her model'i, veri güvenliği, kimlik ve erişim yönetimi, ağ güvenliği, zafiyet yönetimi ve bulut güvenliğini kapsayacak şekilde 44.823 çoktan seçmeli soru (MCQ) ve 3.087 kısa yanıtlı soru (SAQ) üzerinde test ettik. MCQ'lar (Çoktan…

LLM
İçgörü
15 Eyl

LLM Ölçekleme Yasaları: Yapay Zeka Araştırmacılarından Analiz

Büyük dil modelleri, metin verilerinden öğrenilen kalıplara dayanarak bir sonraki token'ı tahmin eder. LLM ölçekleme yasaları terimi, model performansını eğitim sırasında kullanılan hesaplama miktarı, eğitim verisi ve model parametreleriyle ilişkilendiren deneysel düzenlilikleri ifade eder. Bu ilişkilerin pratikte modern model tasarımını nasıl etkilediğini anlamak için 8 akademik makaleden bulguları ve 3 büyük yapay zeka laboratuvarı ile…