Premium
Servizi
Premium

Benchmark LLM

Un unico Indice di Intelligenza trasparente che combina benchmark pubblici con le valutazioni agentiche, RAG e di ragionamento aziendale di AIMultiple. Come viene costruito l'indice

MODELLO MIGLIORE
Claude Opus 5.5
Indice 100
Miglior rapporto qualità-prezzo
Qwen3.8 Flash
$0.23 / 1M
Più veloce
MiniMax M2.7
0.15s TTFT
Indice di Intelligenza AIMultiple

Classifica

I modelli con il punteggio più alto in tutti i benchmark.

Filter & Sort
#
Modello
Indice
AA-LCR
AIM-A-CODE-LLM Bench
AIM-Agentic-RAG
AIM-FinanceReasoning
AIM-HALC-Bench
AIM-RELC-Bench
AIM-Text-to-SQL
APEX-Agents-AA
ARC-AGI-1
ARC-AGI-2
ARC-AGI-3
ArxivMath
AutomationBench-AA
BioMysteryBench
BrowseComp
Convex Coding Evals
CritPt
Crosby RedlineBench
DeepSWE 1.1
EnterpriseOps-Gym-AA
Frontier-Bench
FrontierCode
FrontierMath
GDPval
GPQA Diamond
Harvey LAB-AA
HealthBench Professional
HieroglyphBench
Humanity's Last Exam
IFBench
ITBench-AA
LegalBench
LiveCodeBench
MMMU-Pro
ObviousBench
Opus Magnum Bench
ReactBench
RuneBench
SciCode
SimpleBench
Swe-Bench
Tau2-Bench Telecom
Tau3-Banking
Terminal-Bench 2.1
Terminal-Bench 4.0
Terminal-Bench Hard
Terminal-Bench-Science
1
Claude Opus 5.5
Claude Opus 5.5
Anthropic
100
--9092--88---------32------1846--------------67--------
2
GPT-6 Astra
GPT-6 Astra
OpenAI
92
--8487--66--9563-41-928532-74--5398154296-70----------756----9058--
3
Claude Fable 5.1
Claude Fable 5.1
Anthropic
91
80-8490--67-9890--31--8131-67--5188173594-62-59--89-----663---479156--
4
Qwen3.8 Flash
Qwen3.8 Flash
Alibaba Cloud
87
77----------------------174392---3881--------47---4586---
5
Command A+
Command A+
Cohere
87
----------------30------------74-61---------81---25-
6
MiMo-V2.6-Pro
MiMo-V2.6-Pro
Xiaomi
87
----------------27------1673--------------61--------
7
Muse Spark 1.1
Muse Spark 1.1
Meta
86
81-----------------53----138190-59-46--85--99-23658---3278---
8
Claude Fable 5
Claude Fable 5
Anthropic
85
77698290--66599989-7917-878429-70-3454901741931463235664-89-8199224766182-993885426321
9
Claude Opus 5
Claude Opus 5
Anthropic
83
79-8590--64-989030915079918229-74-445373170894-60-55--87-85100--656---458952-30
10
GPT-6 Sol
GPT-6 Sol
OpenAI
79
--82---54---------31------1487--------------58--------
Pagina 1 di 13

Costo$8.00
Latenza2.81s
Contesto1M
TTFT2.81s
AIM-Agentic-RAG
90
AIM-FinanceReasoning
92
AIM-Text-to-SQL
88
CritPt
32
GDPval
1846
SciCode
67

Costo$20.00
Latenza6.31s
Contesto1M
TTFT6.31s
AIM-Agentic-RAG
84
AIM-FinanceReasoning
87
AIM-Text-to-SQL
66
ARC-AGI-2
95
ARC-AGI-3
63
AutomationBench-AA
41
BrowseComp
92
Convex Coding Evals
85
CritPt
32
DeepSWE 1.1
74
FrontierCode
53
FrontierMath
98
GDPval
1542
GPQA Diamond
96
HealthBench Professional
70
RuneBench
7
SciCode
56
Terminal-Bench 2.1
90
Terminal-Bench 4.0
58

Costo$20.00
Latenza3.84s
Contesto1M
TTFT3.84s
AA-LCR
80
AIM-Agentic-RAG
84
AIM-FinanceReasoning
90
AIM-Text-to-SQL
67
ARC-AGI-1
98
ARC-AGI-2
90
AutomationBench-AA
31
Convex Coding Evals
81
CritPt
31
DeepSWE 1.1
67
FrontierCode
51
FrontierMath
88
GDPval
1735
GPQA Diamond
94
HealthBench Professional
62
Humanity's Last Exam
59
LegalBench
89
RuneBench
6
SciCode
63
Tau3-Banking
47
Terminal-Bench 2.1
91
Terminal-Bench 4.0
56

Costo$0.23
Latenza0.85s
Contesto1M
TTFT0.85s
AA-LCR
77
GDPval
1743
GPQA Diamond
92
Humanity's Last Exam
38
IFBench
81
SciCode
47
Tau3-Banking
45
Terminal-Bench 2.1
86

Costo$0.60
Latenza-
Contesto200k
TTFT
CritPt
30
IFBench
74
LegalBench
61
Tau2-Bench Telecom
81
Terminal-Bench Hard
25

Costo$0.54
Latenza43.98s
Contesto1M
TTFT43.98s
CritPt
27
GDPval
1673
SciCode
61

Costo$2.00
Latenza5.26s
Contesto1M
TTFT5.26s
AA-LCR
81
DeepSWE 1.1
53
GDPval
1381
GPQA Diamond
90
HealthBench Professional
59
Humanity's Last Exam
46
LegalBench
85
ObviousBench
99
ReactBench
23
RuneBench
6
SciCode
58
Tau3-Banking
32
Terminal-Bench 2.1
78

Costo$20.00
Latenza4.35s
Contesto1M
TTFT4.35s
AA-LCR
77
AIM-A-CODE-LLM Bench
69
AIM-Agentic-RAG
82
AIM-FinanceReasoning
90
AIM-Text-to-SQL
66
APEX-Agents-AA
59
ARC-AGI-1
99
ARC-AGI-2
89
ArxivMath
79
AutomationBench-AA
17
BrowseComp
87
Convex Coding Evals
84
CritPt
29
DeepSWE 1.1
70
Frontier-Bench
34
FrontierCode
54
FrontierMath
90
GDPval
1741
GPQA Diamond
93
Harvey LAB-AA
14
HealthBench Professional
63
HieroglyphBench
23
Humanity's Last Exam
56
IFBench
64
LegalBench
89
MMMU-Pro
81
ObviousBench
99
Opus Magnum Bench
22
ReactBench
47
RuneBench
6
SciCode
61
SimpleBench
82
Tau2-Bench Telecom
99
Tau3-Banking
38
Terminal-Bench 2.1
85
Terminal-Bench 4.0
42
Terminal-Bench Hard
63
Terminal-Bench-Science
21

Costo$10.00
Latenza4.03s
Contesto1M
TTFT4.03s
AA-LCR
79
AIM-Agentic-RAG
85
AIM-FinanceReasoning
90
AIM-Text-to-SQL
64
ARC-AGI-1
98
ARC-AGI-2
90
ARC-AGI-3
30
ArxivMath
91
AutomationBench-AA
50
BioMysteryBench
79
BrowseComp
91
Convex Coding Evals
82
CritPt
29
DeepSWE 1.1
74
Frontier-Bench
44
FrontierCode
53
FrontierMath
73
GDPval
1708
GPQA Diamond
94
HealthBench Professional
60
Humanity's Last Exam
55
LegalBench
87
MMMU-Pro
85
ObviousBench
100
RuneBench
6
SciCode
56
Tau3-Banking
45
Terminal-Bench 2.1
89
Terminal-Bench 4.0
52
Terminal-Bench-Science
30

Costo$4.00
Latenza1.36s
Contesto1M
TTFT1.36s
AIM-Agentic-RAG
82
AIM-Text-to-SQL
54
CritPt
31
GDPval
1487
SciCode
58
Pagina 1 di 13
Evoluzione nel tempo
Indice di Intelligenza per data di rilascio del modello
Costo vs prestazioni
Costo combinato rispetto all'Indice di Intelligenza
Modello × Benchmark
Modelli migliori sui benchmark selezionati

Come viene costruito l'indice

Ogni benchmark viene letto come una posizione, non come un punteggio grezzo. All'interno di un benchmark il risultato migliore si colloca a 100, il peggiore a 0, e tutti gli altri modelli cadono in un punto intermedio. L'indice è la media ponderata di quelle posizioni sui benchmark che un modello ha effettivamente eseguito: un benchmark che non ha mai eseguito non conta come zero, semplicemente non c'è. I benchmark non contano allo stesso modo, e il peso di ciascuno è indicato accanto ad esso. Un modello ha bisogno di risultati in almeno due benchmark dell'indice per essere classificato, così un singolo risultato colloca il modello sulla linea di quel benchmark senza dargli una posizione propria. Si usano le posizioni al posto dell'accuratezza grezza perché i benchmark differiscono nettamente per difficoltà e scala, e punteggi di benchmark diversi non possono condividere una media. Pesi: AIM-FinanceReasoning (10%) + AIM-Text-to-SQL (10%) + AIM-Agentic-RAG (10%) + SciCode (10%) + FrontierMath (10%) + Terminal-Bench 2.1 (10%) + CritPt (10%) + IFBench (10%) + MMMU-Pro (10%) + ARC-AGI-3 (10%).

Benchmark utilizzati

Pubblico
AA-LCRRagionamento su contesti lunghi con input multi-documento.
AIMultiple
AIM-A-CODE-LLM BenchCoding agentico su 10 attività di sviluppo software tramite strumento CLI (~3.500 passaggi di validazione).
AIMultiple
AIM-Agentic-RAGRouting multi-database e generazione di query SQL su 5 database (BIRD-SQL, 500 domande).
AIMultiple
AIM-FinanceReasoningRagionamento finanziario complesso a più passaggi su 238 domande difficili di FinanceReasoning.
AIMultiple
AIM-HALC-BenchResistenza all'invenzione di metriche non menzionate in documenti a contesto lungo (204 trappole, 14 trascrizioni).
AIMultiple
AIM-RELC-BenchRecupero di dati numerici in contesti lunghi da diverse posizioni del documento (100 elementi, 14 trascrizioni).
AIMultiple
AIM-Text-to-SQLAccuratezza nella generazione di query SQL a partire dal linguaggio naturale su oltre 35 LLM.
Pubblico
APEX-Agents-AACompiti a lungo orizzonte e cross-applicazione scritti da banchieri d'investimento, consulenti e avvocati d'impresa.
Pubblico
ARC-AGI-1Ragionamento astratto few-shot su trasformazioni di griglie; il primo benchmark ARC Prize.
Pubblico
ARC-AGI-2Nuovi rompicapo di ragionamento visivo che testano la generalizzazione, non la memorizzazione.
Pubblico
ARC-AGI-3Ragionamento interattivo: gli agenti esplorano ambienti di gioco inediti, si pongono obiettivi in corsa e imparano passo dopo passo. Il 100% equivale all'efficienza di apprendimento umana.
Pubblico
ArxivMathProblemi di matematica recenti da arXiv, eseguiti subito dopo la pubblicazione per limitare la contaminazione.
Pubblico
AutomationBench-AACompiti di automazione d'ufficio end-to-end, valutati sul completamento parziale.
Pubblico
BioMysteryBenchBenchmark di Anthropic sulla capacita degli agenti di risolvere misteri bioinformatici reali a partire da dati grezzi.
Pubblico
BrowseCompFatti difficili da trovare sul web: domande brevi che richiedono una navigazione tenace.
Pubblico
Convex Coding EvalsScrittura di backend Convex e integrazioni client senza linee guida specifiche del framework nel prompt.
Pubblico
CritPtProblemi di fisica di livello di ricerca che richiedono derivazioni multi-step.
Pubblico
Crosby RedlineBenchCompiti di revisione contrattuale valutati turno per turno rispetto alle modifiche degli avvocati.
Pubblico
DeepSWE 1.1Compiti di ingegneria a lungo orizzonte da repository open source attivi, valutati sul codice committato in un ambiente pulito.
Pubblico
EnterpriseOps-Gym-AAPianificazione agentica con stato e uso di strumenti su otto sistemi aziendali.
Pubblico
Frontier-BenchCompiti software agentici su repository di frontiera, valutati per tasso di risoluzione.
Pubblico
FrontierCodeSe una modifica sia integrabile, non solo se supera i test: sicurezza dalle regressioni, ambito e manutenibilita valutati con rubrica.
Pubblico
FrontierMathProblemi di matematica di ricerca inediti, scritti da esperti (livelli 1–4).
Pubblico
GDPvalProdotti reali di 44 professioni nei nove maggiori settori del PIL statunitense, valutati alla cieca da professionisti esperti rispetto a un riferimento umano.
Pubblico
GPQA DiamondDomande scientifiche di livello universitario avanzato, a prova di ricerca online, che richiedono un ragionamento profondo.
Pubblico
Harvey LAB-AAIl benchmark per agenti legali di Harvey, valutato sul successo con tutti i passaggi superati.
Pubblico
HealthBench ProfessionalConversazioni scritte da medici valutate con rubriche redatte da medici, sulla partizione professionale.
Pubblico
HieroglyphBenchLettura di geroglifici egizi da immagini, valutata sull'accuratezza dei segni.
Pubblico
Humanity's Last ExamRagionamento a libro chiuso di livello esperto su oltre 100 materie accademiche (2,5k domande).
Pubblico
IFBenchRispetto preciso delle istruzioni su 58 vincoli di output verificabili mai visti prima.
Pubblico
ITBench-AAScenari reali di automazione IT su affidabilita dei sistemi, FinOps e operazioni di sicurezza.
Pubblico
LegalBenchRagionamento giuridico in crowdsourcing su 162 compiti creati da professionisti del diritto.
Pubblico
LiveCodeBenchProblemi di programmazione competitiva privi di contaminazione e aggiornati continuamente.
Pubblico
MMMU-ProComprensione multimodale di livello universitario tra discipline, resa robusta contro scorciatoie solo testuali.
Pubblico
ObviousBenchDomande dalla risposta ovvia che i modelli sbagliano comunque; punteggio pass-cubo.
Pubblico
Opus Magnum BenchProgettazione di macchine funzionanti nel gioco rompicapo Opus Magnum.
Pubblico
ReactBenchCreazione e correzione di componenti React, valutate con pass@1.
Pubblico
RuneBenchLettura e ragionamento su una scrittura runica inventata mai vista dal modello, con punteggio su scala logaritmica.
Pubblico
SciCodeCoding scientifico a livello di ricerca in fisica, matematica, biologia e chimica (338 sottoproblemi)
Pubblico
SimpleBenchDomande di ragionamento quotidiano in cui gli esseri umani battono regolarmente i modelli di frontiera.
Pubblico
Swe-BenchIssue GitHub reali risolte end-to-end (set completo di 2.294 istanze).
Pubblico
Tau2-Bench TelecomAgenti di assistenza clienti che usano strumenti in ambito telecomunicazioni, valutati sul successo del compito.
Pubblico
Tau3-BankingAgenti che usano strumenti per gestire flussi realistici di assistenza clienti bancaria.
Pubblico
Terminal-Bench 2.1Compiti agentici da terminale su ingegneria del software, dati e amministrazione di sistema.
Pubblico
Terminal-Bench 4.0L'attuale generazione di Terminal-Bench: compiti agentici da terminale valutati per tasso di risoluzione.
Pubblico
Terminal-Bench HardIl sottoinsieme difficile di Terminal-Bench: compiti software multi-step risolti in un terminale reale.
Pubblico
Terminal-Bench-ScienceCompiti da terminale tratti da flussi di lavoro reali di calcolo scientifico.

Aggiornamenti recenti

Ultime modifiche all'Indice di Intelligenza, alla copertura dei modelli e alla metodologia di benchmark di AIMultiple.

Anthropic

Claude Opus 5.5

Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.

OpenAI

GPT-6 Sol

Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.

OpenAI

GPT-6 Luna

Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.

Xiaomi

MiMo-V2.6-Pro

Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.

Cronologia dei rilasci di LLMIl ritmo dell'innovazione nell'IA
Laboratori di IA
Alibaba Cloud
Alibaba Cloud
03 ago 2026
Qwen3.7 Flash +1 altriQwen3.7 FlashQwen3.8 Max
14 ago 2026
Qwen3.8 2.4T A95B +1 altriQwen3.8 2.4T A95BQwen3.8 27B
03 set 2026
Qwen3.8 Flash +1 altriQwen3.8 FlashQwen3.8 Max (0902)
23 set 2026
Qwen3.8 Max Prime +1 altriQwen3.8 Max PrimeQwen3.8 Omni Flash
Z AI
Z AI
26 ago 2026
GLM 5.3 +1 altriGLM 5.3GLM 5.3 Flash
23 set 2026
GLM 5.3 FlashX +1 altriGLM 5.3 FlashXGLM 5.3 Prime
Anthropic
Anthropic
24 lug 2026
Claude Opus 5
01 set 2026
Claude Fable 5.1
22 set 2026
Claude Opus 5.5
OpenAI
OpenAI
22 set 2026
GPT-6 Astra +2 altriGPT-6 AstraGPT-6 LunaGPT-6 Sol
Xiaomi
Xiaomi
21 set 2026
MiMo-V2.6-Pro
X
X
12 ago 2026
Grok 4.6
21 set 2026
Grok 4.7
Meta
Meta
09 ago 2026
Muse Glimmer 30B +1 altriMuse Glimmer 30BMuse Spark 1.2
02 set 2026
Muse Spark 1.2 Contributor +2 altriMuse Spark 1.2 ContributorMuse Spark 1.3Muse Spark 1.3 Contributor
Google
Google
13 ago 2026
Gemini 3.7 Flash
02 set 2026
Gemini 3.8 Flash
Tencent
Tencent
28 ago 2026
Hy4

Esplora Casi d'uso, analisi e benchmark di LLM

Parametri LLM: GPT-5 High, Medio, Basso e Minimo

LLM
Approfondimento
21 ago

Alcuni LLM, come la famiglia OpenAI GPT-5, sono disponibili in diverse versioni (ad esempio GPT-5, GPT-5-mini e GPT-5-nano) e con diverse impostazioni dei parametri, tra cui alto, medio, basso e minimo. Di seguito esploriamo le differenze tra queste versioni del modello raccogliendo le loro prestazioni nei benchmark e i costi per eseguire i benchmark. Abbiamo…

Per saperne di più
LLM
Confronto delle Funzionalità
21 ago

I migliori strumenti LLMOps e confronto con MLOps

Le piattaforme LLMOps gestiscono il lato operativo dell'esecuzione dei modelli linguistici di grandi dimensioni: distribuzione, monitoraggio, valutazione e gestione dei costi. Abbiamo esaminato i migliori strumenti LLMOps, le loro funzionalità principali, i modelli di prezzo e le differenze tra loro per aiutare a identificare la soluzione più adatta a diversi casi d'uso. Di seguito viene…

LLM
Approfondimento
19 ago

50+ Casi d'uso di ChatGPT con esempi reali

ChatGPT ha raggiunto circa 1 miliardo di utenti attivi settimanali all'inizio del 2026, circa il 10% della popolazione mondiale.1 OpenAI ha superato i $20 miliardi di fatturato annuo per il 2025, come confermato dalla CFO Sarah Friar.2 L'indice economico di Anthropic distingue due modalità d'uso: il potenziamento, in cui un essere umano interagisce con l'IA,…

LLM
Approfondimento
19 ago

ChatGPT per il Servizio Clienti: I 10 Migliori Casi d'Uso

ChatGPT è passato dall'essere una novità a un'infrastruttura nel servizio clienti. Le aziende lo utilizzano per ridurre i tempi di risposta, gestire il volume che i loro team non riescono ad assorbire e ridurre il costo delle interazioni di routine. Ma i risultati variano notevolmente a seconda di come viene implementato. OpenAI ha lanciato GPT-5.6,…

LLM
Benchmark
16 ago

Densità di intelligenza di 71 LLMs per models più intelligenti e più densi

Abbiamo monitorato 71 LLMs rilasciati tra febbraio 2023 e maggio 2026 e raccolto 10 benchmark pubblici per misurare la densità di intelligenza. Abbiamo diviso il punteggio di capacità per la risorsa consumata dal model (parametri attivi, calcolo di addestramento e prezzo di inference). Per calcolare la densità di intelligenza, abbiamo eseguito i seguenti passaggi: Vedi…

LLM
Benchmark
12 ago

LLM Benchmark di latenza per casi d'uso

Abbiamo sottoposto a benchmark 11 modelli linguistici di grandi dimensioni di punta tramite modelli linguistici di grandi dimensioni con un totale di 1.320 richieste, suddividendo tra modelli reasoning e non-reasoning, e abbiamo misurato la latenza del primo token, la latenza per token e il tempo di risposta complessivo. Puoi trovare i dettagli su come abbiamo…

LLM
Benchmark
15 apr

LLM Quantizzazione: BF16 vs FP8 vs INT4

Abbiamo benchmarkato Qwen3-32B a 4 livelli di precisione (BF16, FP8, GPTQ-Int8, GPTQ-Int4) su una singola NVIDIA H100 80GB GPU. Ogni configurazione è stata valutata su 2 benchmark (~12,2K domande) che coprono conoscenza e generazione di codice, oltre a oltre 2.000 esecuzioni di inferenza per misurare il throughput. Int4 è 2,7x più veloce di BF16 pur…