Servizi
Contattaci

Benchmark LLM

Un unico Indice di Intelligenza trasparente che combina benchmark pubblici con le valutazioni agentiche, RAG e di ragionamento aziendale di AIMultiple.

Ultimo aggiornamento Giu 2026
MODELLO MIGLIORE
Claude Fable 5
Indice 92
Miglior rapporto qualità-prezzo
MiniMax M3
$0.42 / 1M
Più veloce
GPT OSS 120B
0.19s TTFT
Copertura
64 modelli
8 benchmark · 336 valutazioni
Indice di Intelligenza AIMultiple

Classifica

I modelli con il punteggio più alto in tutti i benchmark.

Filter & Sort
#
Modello
Indice
LegalBench
FinanceReasoning
Text-to-SQL
Agentic RAG
ARC-AGI-2
Agentic LLM Benchmark
FrontierMath
Swe-Bench
1
Claude Fable 5
Claude Fable 5
Anthropic
92
89909098-69--
2
Kimi K3
Kimi K3
Moonshot AI
88
86887793-73--
3
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
87
879074879362--
4
Grok 4.5
Grok 4.5
X
86
86887983-73--
5
GPT-5.5
GPT-5.5
OpenAI
83
87---8559--
6
GPT-5.6 Terra
GPT-5.6 Terra
OpenAI
80
858771918461--
7
GPT-5.6 Sol Pro
GPT-5.6 Sol Pro
OpenAI
80
-917996-54--
8
Claude Opus 4.6
Claude Opus 4.6
Anthropic
78
-8868806972--
9
Gemini 3 Pro Preview
Gemini 3 Pro Preview
Google
77
8786608931---
10
Gemini 3.1 Pro Preview
Gemini 3.1 Pro Preview
Google
77
87876589774627-
Pagina 1 di 7

Costo$20.00
Latenza3.98s
Contesto1M
TTFT3.98s
LegalBench
89
FinanceReasoning
90
Text-to-SQL
90
Agentic RAG
98
Agentic LLM Benchmark
69

Costo$6.00
Latenza252.11s
Contesto1M
TTFT252.11s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
77
Agentic RAG
93
Agentic LLM Benchmark
73

Costo$11.25
Latenza2.47s
Contesto1M
TTFT2.47s
LegalBench
87
FinanceReasoning
90
Text-to-SQL
74
Agentic RAG
87
ARC-AGI-2
93
Agentic LLM Benchmark
62

Costo$3.00
Latenza10.26s
Contesto500k
TTFT10.26s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
79
Agentic RAG
83
Agentic LLM Benchmark
73

Costo$11.25
Latenza1.03s
Contesto272k
TTFT1.03s
LegalBench
87
ARC-AGI-2
85
Agentic LLM Benchmark
59

Costo$5.63
Latenza1.92s
Contesto1M
TTFT1.92s
LegalBench
85
FinanceReasoning
87
Text-to-SQL
71
Agentic RAG
91
ARC-AGI-2
84
Agentic LLM Benchmark
61

Costo$11.25
Latenza11.46s
Contesto1M
TTFT11.46s
FinanceReasoning
91
Text-to-SQL
79
Agentic RAG
96
Agentic LLM Benchmark
54

Costo$10.00
Latenza1.75s
Contesto1M
TTFT1.75s
FinanceReasoning
88
Text-to-SQL
68
Agentic RAG
80
ARC-AGI-2
69
Agentic LLM Benchmark
72

Costo$4.50
Latenza-
Contesto1M
TTFT
LegalBench
87
FinanceReasoning
86
Text-to-SQL
60
Agentic RAG
89
ARC-AGI-2
31

Costo$4.50
Latenza33.83s
Contesto1M
TTFT33.83s
LegalBench
87
FinanceReasoning
87
Text-to-SQL
65
Agentic RAG
89
ARC-AGI-2
77
Agentic LLM Benchmark
46
FrontierMath
27
Pagina 1 di 7

Grafici

Modelli secondo "Migliori prestazioni"

Evoluzione nel tempo
Indice di Intelligenza per data di rilascio del modello
Costo vs prestazioni
Costo combinato rispetto all'Indice di Intelligenza
Modello × Benchmark
Modelli migliori sui benchmark selezionati
Metodologia

Come viene costruito l'indice

L'Indice di Intelligenza normalizza ogni benchmark su una scala da 0 a 100 e calcola la media della posizione relativa di un modello sui benchmark su cui è stato valutato. Ogni benchmark qui sotto contribuisce a quel punteggio.

Aggiornamenti recenti

Aggiornamenti recenti

Ultime modifiche all'Indice di Intelligenza, alla copertura dei modelli e alla metodologia di benchmark di AIMultiple.

Moonshot AI

Kimi K3

Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.

OpenAI

GPT-5.6 Sol

Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.

OpenAI

GPT-5.6 Terra

Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.

OpenAI

GPT-5.6 Sol Pro

Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.

Esplora Casi d'uso, analisi e benchmark di LLM

Simulazione del pubblico: I LLM possono prevedere il comportamento umano?

LLM
Benchmark
22 Giu

Nel marketing, valutare con quanta precisione gli LLM prevedono il comportamento umano è fondamentale per giudicare la loro efficacia nell'anticipare le esigenze del pubblico e riconoscere i rischi di disallineamento, comunicazione inefficace o influenza non desiderata. La simulazione del pubblico con i LLM consente la creazione di pubblici virtuali, aiutando le organizzazioni ad anticipare le…

Per saperne di più
LLM
Benchmark
15 Giu

Gateway IA per OpenAI: OpenRouter Alternative

Abbiamo testato OpenRouter, SambaNova, TogetherAI, Groq e IA/ML API su tre indicatori (latenza del primo token, latenza totale e conteggio dei token di output), con 300 test utilizzando prompt brevi (circa 18 token) e prompt lunghi (circa 203 token) per la latenza totale. Se prevedi di utilizzare uno di questi gateway IA, puoi: In questo…

LLM
Benchmark
5 Giu

Modelli Linguistici di Grande Dimensione nella Cybersecurity

Abbiamo valutato 7 modelli linguistici di grande dimensione in 9 ambiti della cybersecurity utilizzando SecBench, un benchmark su larga scala e multi-formato per attività di sicurezza. Abbiamo testato ogni modello su 44.823 domande a scelta multipla (MCQ) e 3.087 domande a risposta breve (SAQ), coprendo aree come la sicurezza dei dati, la gestione dell'identità e…

LLM
Approfondimento
26 Mag

ChatGPT per l'assistenza clienti: i 10 migliori casi d'uso

ChatGPT è passato dalla novità all'infrastruttura nell'assistenza clienti. Le aziende lo utilizzano per ridurre i tempi di risposta, gestire volumi che i loro team non possono assorbire e ridurre i costi delle interazioni di routine. Ma i risultati variano notevolmente a seconda di come viene implementato. OpenAI ha lanciato GPT-5.2, un modello materialmente più capace…

LLM
Benchmark
15 Apr

LLM Quantizzazione: BF16 vs FP8 vs INT4

Abbiamo benchmarkato Qwen3-32B a 4 livelli di precisione (BF16, FP8, GPTQ-Int8, GPTQ-Int4) su una singola NVIDIA H100 80GB GPU. Ogni configurazione è stata valutata su 2 benchmark (~12,2K domande) che coprono conoscenza e generazione di codice, oltre a oltre 2.000 esecuzioni di inferenza per misurare il throughput. Int4 è 2,7x più veloce di BF16 pur…