Servizi
Contattaci

Benchmark LLM

Un unico Indice di Intelligenza trasparente che combina benchmark pubblici con le valutazioni agentiche, RAG e di ragionamento aziendale di AIMultiple. Vedi la metodologia.

MODELLO MIGLIORE
Claude Opus 5
Indice 86
Miglior rapporto qualità-prezzo
DeepSeek V4 Flash 0731
$0.11 / 1M
Più veloce
Trinity Large Thinking
0.12s TTFT
Copertura
151 modelli
12 benchmark · 697 valutazioni
Indice di Intelligenza AIMultiple

Classifica

I modelli con il punteggio più alto in tutti i benchmark.

Filter & Sort
#
Modello
Indice
Agentic RAG
ARC-AGI-1
ARC-AGI-2
ArxivMath
CritPt
FinanceReasoning
FrontierMath
LegalBench
MMMU-Pro
Terminal-Bench 2.1
Terminal-Bench Hard
Text-to-SQL
1
Claude Opus 5
Claude Opus 5
Anthropic
86
-989091299073878589--
2
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
81
879893-329083878389-74
3
Claude Fable 5
Claude Fable 5
Anthropic
79
989989792990888981856390
4
GPT-5.6 Terra
GPT-5.6 Terra
OpenAI
67
919784-308771858187-71
5
Claude Opus 4.8
Claude Opus 4.8
Anthropic
66
100937271-89568479855877
6
Claude Fable 5.1
Claude Fable 5.1
Anthropic
66
-9890-31-8889-91--
7
Gemini 3.7 Flash
Gemini 3.7 Flash
Google
62
-9685-14-37878686--
8
GPT-5.5 Pro
GPT-5.5 Pro
OpenAI
62
-9785-31-78-----
9
Kimi K3
Kimi K3
Moonshot AI
61
939560-238839868285-77
10
GPT-5.6 Sol Pro
GPT-5.6 Sol Pro
OpenAI
60
96----9181----79
Pagina 1 di 16

Costo$10.00
Latenza3.83s
Contesto1M
TTFT3.83s
ARC-AGI-1
98
ARC-AGI-2
90
ArxivMath
91
CritPt
29
FinanceReasoning
90
FrontierMath
73
LegalBench
87
MMMU-Pro
85
Terminal-Bench 2.1
89

Costo$8.00
Latenza4.43s
Contesto1M
TTFT4.43s
Agentic RAG
87
ARC-AGI-1
98
ARC-AGI-2
93
CritPt
32
FinanceReasoning
90
FrontierMath
83
LegalBench
87
MMMU-Pro
83
Terminal-Bench 2.1
89
Text-to-SQL
74

Costo$20.00
Latenza5.28s
Contesto1M
TTFT5.28s
Agentic RAG
98
ARC-AGI-1
99
ARC-AGI-2
89
ArxivMath
79
CritPt
29
FinanceReasoning
90
FrontierMath
88
LegalBench
89
MMMU-Pro
81
Terminal-Bench 2.1
85
Terminal-Bench Hard
63
Text-to-SQL
90

Costo$4.50
Latenza1.92s
Contesto1M
TTFT1.92s
Agentic RAG
91
ARC-AGI-1
97
ARC-AGI-2
84
CritPt
30
FinanceReasoning
87
FrontierMath
71
LegalBench
85
MMMU-Pro
81
Terminal-Bench 2.1
87
Text-to-SQL
71

Costo$10.00
Latenza4.53s
Contesto1M
TTFT4.53s
Agentic RAG
100
ARC-AGI-1
93
ARC-AGI-2
72
ArxivMath
71
FinanceReasoning
89
FrontierMath
56
LegalBench
84
MMMU-Pro
79
Terminal-Bench 2.1
85
Terminal-Bench Hard
58
Text-to-SQL
77

Costo$20.00
Latenza5.44s
Contesto1M
TTFT5.44s
ARC-AGI-1
98
ARC-AGI-2
90
CritPt
31
FrontierMath
88
LegalBench
89
Terminal-Bench 2.1
91

Costo$1.50
Latenza6.05s
Contesto1M
TTFT6.05s
ARC-AGI-1
96
ARC-AGI-2
85
CritPt
14
FrontierMath
37
LegalBench
87
MMMU-Pro
86
Terminal-Bench 2.1
86

Costo$33.75
Latenza3.65s
Contesto1M
TTFT3.65s
ARC-AGI-1
97
ARC-AGI-2
85
CritPt
31
FrontierMath
78

Costo$5.44
Latenza0.93s
Contesto1M
TTFT0.93s
Agentic RAG
93
ARC-AGI-1
95
ARC-AGI-2
60
CritPt
23
FinanceReasoning
88
FrontierMath
39
LegalBench
86
MMMU-Pro
82
Terminal-Bench 2.1
85
Text-to-SQL
77

Costo$2.00
Latenza10.25s
Contesto1M
TTFT10.25s
Agentic RAG
96
FinanceReasoning
91
FrontierMath
81
Text-to-SQL
79
Pagina 1 di 16
Evoluzione nel tempo
Indice di Intelligenza per data di rilascio del modello
Costo vs prestazioni
Costo combinato rispetto all'Indice di Intelligenza
Modello × Benchmark
Modelli migliori sui benchmark selezionati
Metodologia

Come viene costruito l'indice

Ogni benchmark diventa una posizione su una scala da 0 a 100 e l'indice è la media ponderata di quelle posizioni. Un benchmark su cui un modello non è stato testato conta come la media del campo, così i punteggi restano confrontabili. Indice = Terminal-Bench-Science (14%) + FrontierMath (12%) + Frontier-Bench (12%) + ArxivMath (10%) + MMMU-Pro (9%) + ARC-AGI-2 (8%) + CritPt (6%) + FinanceReasoning (5%) + Text-to-SQL (5%) + BioMysteryBench (5%) + ARC-AGI-1 (5%) + Terminal-Bench 2.1 (3%) + Agentic RAG (3%) + Terminal-Bench Hard (2%) + LegalBench (1%).

AIMultiple
Agentic RAGRouting multi-database e generazione di query SQL su 5 database (BIRD-SQL, 500 domande).
Pubblico
ARC-AGI-1Ragionamento astratto few-shot su trasformazioni di griglie; il primo benchmark ARC Prize.
Pubblico
ARC-AGI-2Nuovi rompicapo di ragionamento visivo che testano la generalizzazione, non la memorizzazione.
Pubblico
ArxivMathProblemi di matematica recenti da arXiv, eseguiti subito dopo la pubblicazione per limitare la contaminazione.
Pubblico
BioMysteryBenchBenchmark di Anthropic sulla capacita degli agenti di risolvere misteri bioinformatici reali a partire da dati grezzi.
Pubblico
CritPtProblemi di fisica di livello di ricerca che richiedono derivazioni multi-step.
AIMultiple
FinanceReasoningRagionamento finanziario complesso a più passaggi su 238 domande difficili di FinanceReasoning.
Pubblico
Frontier-BenchCompiti software agentici su repository di frontiera, valutati per tasso di risoluzione.
Pubblico
FrontierMathProblemi di matematica di ricerca inediti, scritti da esperti (livelli 1–4).
Pubblico
LegalBenchRagionamento giuridico in crowdsourcing su 162 compiti creati da professionisti del diritto.
Pubblico
MMMU-ProComprensione multimodale di livello universitario tra discipline, resa robusta contro scorciatoie solo testuali.
Pubblico
Terminal-Bench 2.1Compiti agentici da terminale su ingegneria del software, dati e amministrazione di sistema.
Pubblico
Terminal-Bench HardIl sottoinsieme difficile di Terminal-Bench: compiti software multi-step risolti in un terminale reale.
Pubblico
Terminal-Bench-ScienceCompiti da terminale tratti da flussi di lavoro reali di calcolo scientifico.
AIMultiple
Text-to-SQLAccuratezza nella generazione di query SQL a partire dal linguaggio naturale su oltre 35 LLM.
Aggiornamenti recenti

Aggiornamenti recenti

Ultime modifiche all'Indice di Intelligenza, alla copertura dei modelli e alla metodologia di benchmark di AIMultiple.

Google

Gemini 3.8 Flash

Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.

Anthropic

Claude Fable 5.1

Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.

Tencent

Hy4 preview

Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.

Z AI

GLM 5.3 Flash

Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.

Cronologia dei rilasci di modelli di IAUltimi 12 modelli in 23 giorni

I principali rilasci di modelli di IA dei fornitori leader negli ultimi 23 giorni.

Fornitore
OpenAI
OpenAI
04 Set 2026
GPT-6 Astra +1 altriGPT-6 AstraGPT-6 Astra Pro
Google
Google
02 Set 2026
Gemini 3.8 Flash
Meta
Meta
21 Ago 2026
Muse Spark 1.2 Contributor
02 Set 2026
Muse Spark 1.3 +1 altriMuse Spark 1.3Muse Spark 1.3 Contributor
Anthropic
Anthropic
01 Set 2026
Claude Fable 5.1
Tencent
Tencent
28 Ago 2026
Hy4 preview
Alibaba Cloud
Alibaba Cloud
14 Ago 2026
Qwen3.8 27B
26 Ago 2026
Qwen3.8 Flash
Z AI
Z AI
18 Ago 2026
GLM 5.3
26 Ago 2026
GLM 5.3 Flash

Esplora Casi d'uso, analisi e benchmark di LLM

Automazione LLM: i 7 migliori strumenti e 8 casi di studio

LLM
Approfondimento
27 Ago

L'automazione LLM si riferisce al passaggio a strumenti di automazione intelligente che sfruttano gli LLM, inclusi agenti IA, LLM fine-tuned e modelli RAG per automatizzare e coordinare le attività. Scopri cos'è l'automazione LLM, le sue principali applicazioni reali e i principali strumenti: Large language models nell'automazione sono un approccio sistematico che combina l'elaborazione del linguaggio…

Per saperne di più
LLM
Valutazione in Mondo Aperto
26 Ago

LLM Orchestrazione: 22 Framework e Gateway

Ottimizzare l'orchestrazione LLM è fondamentale per migliorare le prestazioni mantenendo sotto controllo l'uso delle risorse. Per valutare come si comportano nella pratica i diversi approcci di orchestrazione, abbiamo eseguito dei benchmark: Scopri una selezione di strumenti di orchestrazione LLM, tra cui framework per sviluppatori e gateway aziendali: L'orchestrazione LLM implica la gestione e l'integrazione di…

LLM
Benchmark
24 Ago

AIM Enterprise: benchmark enterprise agentico

Le imprese usano gli LLM ogni giorno per le loro attività ordinarie. Per trovare gli LLM più convenienti, abbiamo progettato AIM Enterprise, un benchmark enterprise agentico, in cui abbiamo utilizzato 69 attività aziendali reali tra strategia, marketing, HR, vendite e operations. Due judge model hanno valutato ogni file e spesso non erano d'accordo. In circa…

LLM
Benchmark
24 Ago

Text-to-SQL: Confronto dell'accuratezza degli LLM

Abbiamo eseguito 36 grandi modelli linguistici su 759 domande di BIRD-SQL, ciascun modello scrivendo SQL contro un database che doveva identificare da solo tra 11 candidati. Ogni query analizzabile è stata eseguita sul database reale e il suo set di risultati confrontato con il set di risultati della query gold di BIRD. Le query mancanti,…

LLM
Approfondimento
21 Ago

LLM Parameters: GPT-5 High, Medium, Low and Minimal

Alcuni LLM, come la famiglia GPT-5 di OpenAI, sono disponibili in diverse versioni (ad esempio, GPT-5, GPT-5-mini e GPT-5-nano) e con varie impostazioni dei parametri, tra cui alto, medio, basso e minimo. Di seguito, esploriamo le differenze tra queste versioni del modello raccogliendo le loro prestazioni sui benchmark e i costi per eseguire i benchmark.…

LLM
Benchmark
21 Ago

HALC-Bench: LLM Allucinazione su benchmark di recupero a lungo contesto

HALC-Bench (benchmark di allucinazione di LLM su recupero a lungo contesto) misura la resistenza di un grande modello linguistico a fabbricare prove per una metrica che non esiste nel documento di destinazione, utilizzando 3 pagliai posizionati all'inizio, a metà e alla fine della finestra di contesto del modello, con 204 domande. claude-fable-5 ha risposto correttamente…

LLM
Confronto delle Funzionalità
21 Ago

I migliori strumenti LLMOps e confronto con MLOps

Le piattaforme LLMOps gestiscono il lato operativo dell'esecuzione dei modelli linguistici di grandi dimensioni: distribuzione, monitoraggio, valutazione e gestione dei costi. Abbiamo esaminato i migliori strumenti LLMOps, le loro funzionalità principali, i modelli di prezzo e le differenze tra loro per aiutare a identificare la soluzione più adatta a diversi casi d'uso. Di seguito viene…

LLM
Approfondimento
19 Ago

50+ Casi d'uso di ChatGPT con esempi reali

ChatGPT ha raggiunto circa 1 miliardo di utenti attivi settimanali all'inizio del 2026, circa il 10% della popolazione mondiale.1 OpenAI ha superato i $20 miliardi di fatturato annuo per il 2025, come confermato dalla CFO Sarah Friar.2 L'indice economico di Anthropic distingue due modalità d'uso: il potenziamento, in cui un essere umano interagisce con l'IA,…

LLM
Approfondimento
19 Ago

ChatGPT per il Servizio Clienti: I 10 Migliori Casi d'Uso

ChatGPT è passato dall'essere una novità a un'infrastruttura nel servizio clienti. Le aziende lo utilizzano per ridurre i tempi di risposta, gestire il volume che i loro team non riescono ad assorbire e ridurre il costo delle interazioni di routine. Ma i risultati variano notevolmente a seconda di come viene implementato. OpenAI ha lanciato GPT-5.6,…

LLM
Approfondimento
18 Ago

Il futuro dei grandi modelli linguistici

Vedi il futuro dei grandi modelli linguistici approfondendo approcci promettenti, come l'auto-addestramento, la verifica dei fatti e la competenza sparsa, che potrebbero affrontare i limiti degli LLM. Confronto del tasso di successo degli LLM Claude Sonnet 4.6 ha guidato il benchmark con un punteggio complessivo di 0.748, con le varianti base e thinking a pari…

LLM
Benchmark
16 Ago

Densità di intelligenza di 71 LLMs per models più intelligenti e più densi

Abbiamo monitorato 71 LLMs rilasciati tra febbraio 2023 e maggio 2026 e raccolto 10 benchmark pubblici per misurare la densità di intelligenza. Abbiamo diviso il punteggio di capacità per la risorsa consumata dal model (parametri attivi, calcolo di addestramento e prezzo di inference). Per calcolare la densità di intelligenza, abbiamo eseguito i seguenti passaggi: Vedi…