Servizi
Contattaci

Benchmark LLM

Un unico Indice di Intelligenza trasparente che combina benchmark pubblici con le valutazioni agentiche, RAG e di ragionamento aziendale di AIMultiple. Vedi la metodologia.

MODELLO MIGLIORE
Claude Opus 5
Indice 86
Miglior rapporto qualità-prezzo
DeepSeek V4 Flash 0731
$0.11 / 1M
Più veloce
Trinity Large Thinking
0.12s TTFT
Copertura
151 modelli
12 benchmark · 697 valutazioni
Indice di Intelligenza AIMultiple

Classifica

I modelli con il punteggio più alto in tutti i benchmark.

Filter & Sort
#
Modello
Indice
Agentic RAG
ARC-AGI-1
ARC-AGI-2
ArxivMath
CritPt
FinanceReasoning
FrontierMath
LegalBench
MMMU-Pro
Terminal-Bench 2.1
Terminal-Bench Hard
Text-to-SQL
1
Claude Opus 5
Claude Opus 5
Anthropic
86
-989091299073878589--
2
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
81
879893-329083878389-74
3
Claude Fable 5
Claude Fable 5
Anthropic
79
989989792990888981856390
4
GPT-5.6 Terra
GPT-5.6 Terra
OpenAI
67
919784-308771858187-71
5
Claude Opus 4.8
Claude Opus 4.8
Anthropic
66
100937271-89568479855877
6
Claude Fable 5.1
Claude Fable 5.1
Anthropic
66
-9890-31-8889-91--
7
Gemini 3.7 Flash
Gemini 3.7 Flash
Google
62
-9685-14-37878686--
8
GPT-5.5 Pro
GPT-5.5 Pro
OpenAI
62
-9785-31-78-----
9
Kimi K3
Kimi K3
Moonshot AI
61
939560-238839868285-77
10
GPT-5.6 Sol Pro
GPT-5.6 Sol Pro
OpenAI
60
96----9181----79
Pagina 1 di 16

Costo$10.00
Latenza3.83s
Contesto1M
TTFT3.83s
ARC-AGI-1
98
ARC-AGI-2
90
ArxivMath
91
CritPt
29
FinanceReasoning
90
FrontierMath
73
LegalBench
87
MMMU-Pro
85
Terminal-Bench 2.1
89

Costo$8.00
Latenza4.43s
Contesto1M
TTFT4.43s
Agentic RAG
87
ARC-AGI-1
98
ARC-AGI-2
93
CritPt
32
FinanceReasoning
90
FrontierMath
83
LegalBench
87
MMMU-Pro
83
Terminal-Bench 2.1
89
Text-to-SQL
74

Costo$20.00
Latenza5.28s
Contesto1M
TTFT5.28s
Agentic RAG
98
ARC-AGI-1
99
ARC-AGI-2
89
ArxivMath
79
CritPt
29
FinanceReasoning
90
FrontierMath
88
LegalBench
89
MMMU-Pro
81
Terminal-Bench 2.1
85
Terminal-Bench Hard
63
Text-to-SQL
90

Costo$4.50
Latenza1.92s
Contesto1M
TTFT1.92s
Agentic RAG
91
ARC-AGI-1
97
ARC-AGI-2
84
CritPt
30
FinanceReasoning
87
FrontierMath
71
LegalBench
85
MMMU-Pro
81
Terminal-Bench 2.1
87
Text-to-SQL
71

Costo$10.00
Latenza4.53s
Contesto1M
TTFT4.53s
Agentic RAG
100
ARC-AGI-1
93
ARC-AGI-2
72
ArxivMath
71
FinanceReasoning
89
FrontierMath
56
LegalBench
84
MMMU-Pro
79
Terminal-Bench 2.1
85
Terminal-Bench Hard
58
Text-to-SQL
77

Costo$20.00
Latenza5.44s
Contesto1M
TTFT5.44s
ARC-AGI-1
98
ARC-AGI-2
90
CritPt
31
FrontierMath
88
LegalBench
89
Terminal-Bench 2.1
91

Costo$1.50
Latenza6.05s
Contesto1M
TTFT6.05s
ARC-AGI-1
96
ARC-AGI-2
85
CritPt
14
FrontierMath
37
LegalBench
87
MMMU-Pro
86
Terminal-Bench 2.1
86

Costo$33.75
Latenza3.65s
Contesto1M
TTFT3.65s
ARC-AGI-1
97
ARC-AGI-2
85
CritPt
31
FrontierMath
78

Costo$5.44
Latenza0.93s
Contesto1M
TTFT0.93s
Agentic RAG
93
ARC-AGI-1
95
ARC-AGI-2
60
CritPt
23
FinanceReasoning
88
FrontierMath
39
LegalBench
86
MMMU-Pro
82
Terminal-Bench 2.1
85
Text-to-SQL
77

Costo$2.00
Latenza10.25s
Contesto1M
TTFT10.25s
Agentic RAG
96
FinanceReasoning
91
FrontierMath
81
Text-to-SQL
79
Pagina 1 di 16
Evoluzione nel tempo
Indice di Intelligenza per data di rilascio del modello
Costo vs prestazioni
Costo combinato rispetto all'Indice di Intelligenza
Modello × Benchmark
Modelli migliori sui benchmark selezionati
Metodologia

Come viene costruito l'indice

Ogni benchmark diventa una posizione su una scala da 0 a 100 e l'indice è la media ponderata di quelle posizioni. Un benchmark su cui un modello non è stato testato conta come la media del campo, così i punteggi restano confrontabili. Indice = Terminal-Bench-Science (14%) + FrontierMath (12%) + Frontier-Bench (12%) + ArxivMath (10%) + MMMU-Pro (9%) + ARC-AGI-2 (8%) + CritPt (6%) + FinanceReasoning (5%) + Text-to-SQL (5%) + BioMysteryBench (5%) + ARC-AGI-1 (5%) + Terminal-Bench 2.1 (3%) + Agentic RAG (3%) + Terminal-Bench Hard (2%) + LegalBench (1%).

AIMultiple
Agentic RAGRouting multi-database e generazione di query SQL su 5 database (BIRD-SQL, 500 domande).
Pubblico
ARC-AGI-1Ragionamento astratto few-shot su trasformazioni di griglie; il primo benchmark ARC Prize.
Pubblico
ARC-AGI-2Nuovi rompicapo di ragionamento visivo che testano la generalizzazione, non la memorizzazione.
Pubblico
ArxivMathProblemi di matematica recenti da arXiv, eseguiti subito dopo la pubblicazione per limitare la contaminazione.
Pubblico
BioMysteryBenchBenchmark di Anthropic sulla capacita degli agenti di risolvere misteri bioinformatici reali a partire da dati grezzi.
Pubblico
CritPtProblemi di fisica di livello di ricerca che richiedono derivazioni multi-step.
AIMultiple
FinanceReasoningRagionamento finanziario complesso a più passaggi su 238 domande difficili di FinanceReasoning.
Pubblico
Frontier-BenchCompiti software agentici su repository di frontiera, valutati per tasso di risoluzione.
Pubblico
FrontierMathProblemi di matematica di ricerca inediti, scritti da esperti (livelli 1–4).
Pubblico
LegalBenchRagionamento giuridico in crowdsourcing su 162 compiti creati da professionisti del diritto.
Pubblico
MMMU-ProComprensione multimodale di livello universitario tra discipline, resa robusta contro scorciatoie solo testuali.
Pubblico
Terminal-Bench 2.1Compiti agentici da terminale su ingegneria del software, dati e amministrazione di sistema.
Pubblico
Terminal-Bench HardIl sottoinsieme difficile di Terminal-Bench: compiti software multi-step risolti in un terminale reale.
Pubblico
Terminal-Bench-ScienceCompiti da terminale tratti da flussi di lavoro reali di calcolo scientifico.
AIMultiple
Text-to-SQLAccuratezza nella generazione di query SQL a partire dal linguaggio naturale su oltre 35 LLM.
Aggiornamenti recenti

Aggiornamenti recenti

Ultime modifiche all'Indice di Intelligenza, alla copertura dei modelli e alla metodologia di benchmark di AIMultiple.

Google

Gemini 3.8 Flash

Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.

Anthropic

Claude Fable 5.1

Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.

Tencent

Hy4 preview

Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.

Z AI

GLM 5.3 Flash

Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.

Cronologia dei rilasci di modelli di IAUltimi 12 modelli in 20 giorni

I principali rilasci di modelli di IA dei fornitori leader negli ultimi 20 giorni.

Fornitore
OpenAI
OpenAI
04 Set 2026
GPT-6 Astra +1 altriGPT-6 AstraGPT-6 Astra Pro
Alibaba Cloud
Alibaba Cloud
26 Ago 2026
Qwen3.8 Flash
03 Set 2026
Qwen3.8 Max (0902)
Google
Google
02 Set 2026
Gemini 3.8 Flash
Meta
Meta
21 Ago 2026
Muse Spark 1.2 Contributor
02 Set 2026
Muse Spark 1.3 +1 altriMuse Spark 1.3Muse Spark 1.3 Contributor
Anthropic
Anthropic
01 Set 2026
Claude Fable 5.1
Tencent
Tencent
28 Ago 2026
Hy4 preview
Z AI
Z AI
18 Ago 2026
GLM 5.3
26 Ago 2026
GLM 5.3 Flash

Esplora Casi d'uso, analisi e benchmark di LLM

Confronta 9 Large Language Models in ambito sanitario

LLM
Confronto delle Funzionalità
4 Set

Abbiamo valutato 9 LLM utilizzando il dataset MedQA, un benchmark di esami clinici di livello universitario derivato dalle domande USMLE. Ogni model ha risposto agli stessi scenari clinici a scelta multipla utilizzando un prompt standardizzato, consentendo un confronto diretto dell'accuratezza. Abbiamo inoltre registrato la latenza per domanda dividendo il tempo di esecuzione totale per il…

Per saperne di più
LLM
Approfondimento
3 Set

Grandi modelli multimodali (LMM) vs LLMs

Abbiamo valutato le prestazioni dei modelli multimodali di grandi dimensioni (LMM) in compiti di ragionamento finanziario utilizzando un dataset accuratamente selezionato. Analizzando un sottoinsieme di campioni finanziari di alta qualità, valutiamo le capacità dei modelli nell'elaborare e ragionare con dati multimodali nel dominio finanziario. La sezione metodologia fornisce approfondimenti dettagliati sul dataset e sul framework…

LLM
Approfondimento
2 Set

LLM Leggi di scaling: analisi di ricercatori IA

Large language models prevedono il token successivo in base ai pattern appresi dai dati testuali. Il termine leggi di scaling di LLM si riferisce a regolarità empiriche che collegano le prestazioni del model alla quantità di calcolo, ai dati di addestramento e ai parametri del model utilizzati durante l'addestramento. Per comprendere come queste relazioni influenzino…

LLM
Approfondimento
2 Set

LLM Strumenti di osservabilità: Weights & Biases, Langsmith

Le applicazioni LLM si sono espanse da chat a turno singolo ad agenti multi-step che usano strumenti, interrogano database e si coordinano con altri model, rendendo il loro comportamento più difficile da interpretare. L'osservabilità LLM fornisce visibilità continua su questi flussi di lavoro complessi, aiutando le organizzazioni a monitorare la qualità, rilevare i guasti, risolvere…

LLM
Confronto delle Funzionalità
2 Set

Cloud LLM vs Local LLMs: Esempi & Vantaggi

Cloud LLMs, potenziati da modelli avanzati come GPT-5.5 e Claude Opus 4.7, offrono scalabilità e accessibilità. Al contrario, Local LLMs, guidati da modelli open source come Llama 4, DeepSeek V4 e Qwen3.6-Plus, assicurano maggiore privacy e personalizzazione. Esplora cosa sono i cloud LLMs, i loro punti di forza e debolezze, i casi di studio più…

LLM
Benchmark
1 Set

Simulazione del pubblico: gli LLM possono prevedere il comportamento umano?

Nel marketing, valutare con quanta precisione gli LLM prevedono il comportamento umano è fondamentale per valutare la loro efficacia nell'anticipare le esigenze del pubblico e riconoscere i rischi di disallineamento, comunicazione inefficace o influenza non intenzionale. La simulazione del pubblico con gli LLM consente la modellazione di pubblici virtuali, aiutando le organizzazioni ad anticipare le…

LLM
Approfondimento
1 Set

LLM Guida al Fine-Tuning per le Aziende

Segui i link per le soluzioni specifiche ai tuoi problemi di output LLM. Se il tuo LLM: L'adozione diffusa dei modelli linguistici di grandi dimensioni (LLMs) ha migliorato la nostra capacità di elaborare il linguaggio umano. Tuttavia, il loro addestramento generico spesso si traduce in prestazioni subottimali per compiti specifici. Per superare questa limitazione, vengono…

LLM
Approfondimento
1 Set

LLM Quota di mercato: Confronto su utilizzo e adozione

Abbiamo analizzato la quota di mercato LLM combinando dati basati sull'utilizzo e stime delle visite web per mostrare come la domanda di grandi modelli linguistici sia distribuita tra i laboratori IA e le applicazioni IA: Leggi la metodologia per vedere come abbiamo misurato e calcolato questi risultati. Gli Stati Uniti hanno dominato le visite web…

LLM
Approfondimento
1 Set

10+ Esempi di grandi modelli linguistici

Abbiamo raccolto benchmark open-source per confrontare i principali modelli linguistici di grandi dimensioni proprietari e open-source. Scegli il tuo caso d'uso per trovare il modello giusto. Puoi valutare i grandi modelli linguistici esaminando le loro prestazioni nei benchmark e la latenza reale (disponibile cliccando sul nome di ciascun modello nella tabella) e rivedendo i prezzi…

LLM
Approfondimento
31 Ago

LLM Calcolatore VRAM per il self-hosting

Il self-hosting di un LLM significa eseguire l'inferenza su hardware controllato dall'operatore anziché tramite un'API di terze parti, il che cambia il profilo di costi, controllo dei dati e privacy. Il fatto che un modello possa girare dipende interamente dalla memoria. Il calcolatore stima la VRAM o la memoria unificata necessaria a un modello per…

LLM
Confronto delle Funzionalità
27 Ago

LLM Prezzi: Confronto tra i migliori 15+ provider

Il pricing degli LLM si estende su quattro ordini di grandezza: i modelli più economici sono stati lanciati a meno di $0,03 per milione di token, mentre i modelli di ragionamento di frontiera sono stati lanciati fino a $262.50. Il grafico seguente tiene traccia dei prezzi di lancio: ogni punto rappresenta il prezzo medio dei…