Premium
Servizi
Premium

Benchmark LLM

Un unico Indice di Intelligenza trasparente che combina benchmark pubblici con le valutazioni agentiche, RAG e di ragionamento aziendale di AIMultiple. Come viene costruito l'indice

MODELLO MIGLIORE
Claude Opus 5.5
Indice 100
Miglior rapporto qualità-prezzo
Qwen3.8 Flash
$0.23 / 1M
Più veloce
MiniMax M2.7
0.15s TTFT
Indice di Intelligenza AIMultiple

Classifica

I modelli con il punteggio più alto in tutti i benchmark.

Filter & Sort
#
Modello
Indice
AA-LCR
AIM-A-CODE-LLM Bench
AIM-Agentic-RAG
AIM-FinanceReasoning
AIM-HALC-Bench
AIM-RELC-Bench
AIM-Text-to-SQL
APEX-Agents-AA
ARC-AGI-1
ARC-AGI-2
ARC-AGI-3
ArxivMath
AutomationBench-AA
BioMysteryBench
BrowseComp
Convex Coding Evals
CritPt
Crosby RedlineBench
DeepSWE 1.1
EnterpriseOps-Gym-AA
Frontier-Bench
FrontierCode
FrontierMath
GDPval
GPQA Diamond
Harvey LAB-AA
HealthBench Professional
HieroglyphBench
Humanity's Last Exam
IFBench
ITBench-AA
LegalBench
LiveCodeBench
MMMU-Pro
ObviousBench
Opus Magnum Bench
ReactBench
RuneBench
SciCode
SimpleBench
Swe-Bench
Tau2-Bench Telecom
Tau3-Banking
Terminal-Bench 2.1
Terminal-Bench 4.0
Terminal-Bench Hard
Terminal-Bench-Science
1
Claude Opus 5.5
Claude Opus 5.5
Anthropic
100
--9092--88---------32------1846--------------67--------
2
GPT-6 Astra
GPT-6 Astra
OpenAI
92
--8487--66--9563-41-928532-74--5398154296-70----------756----9058--
3
Claude Fable 5.1
Claude Fable 5.1
Anthropic
91
80-8490--67-9890--31--8131-67--5188173594-62-59--89-----663---479156--
4
Qwen3.8 Flash
Qwen3.8 Flash
Alibaba Cloud
87
77----------------------174392---3881--------47---4586---
5
Command A+
Command A+
Cohere
87
----------------30------------74-61---------81---25-
6
MiMo-V2.6-Pro
MiMo-V2.6-Pro
Xiaomi
87
----------------27------1673--------------61--------
7
Muse Spark 1.1
Muse Spark 1.1
Meta
86
81-----------------53----138190-59-46--85--99-23658---3278---
8
Claude Fable 5
Claude Fable 5
Anthropic
85
77698290--66599989-7917-878429-70-3454901741931463235664-89-8199224766182-993885426321
9
Claude Opus 5
Claude Opus 5
Anthropic
83
79-8590--64-989030915079918229-74-445373170894-60-55--87-85100--656---458952-30
10
GPT-6 Sol
GPT-6 Sol
OpenAI
79
--82---54---------31------1487--------------58--------
Pagina 1 di 13

Costo$8.00
Latenza2.81s
Contesto1M
TTFT2.81s
AIM-Agentic-RAG
90
AIM-FinanceReasoning
92
AIM-Text-to-SQL
88
CritPt
32
GDPval
1846
SciCode
67

Costo$20.00
Latenza6.31s
Contesto1M
TTFT6.31s
AIM-Agentic-RAG
84
AIM-FinanceReasoning
87
AIM-Text-to-SQL
66
ARC-AGI-2
95
ARC-AGI-3
63
AutomationBench-AA
41
BrowseComp
92
Convex Coding Evals
85
CritPt
32
DeepSWE 1.1
74
FrontierCode
53
FrontierMath
98
GDPval
1542
GPQA Diamond
96
HealthBench Professional
70
RuneBench
7
SciCode
56
Terminal-Bench 2.1
90
Terminal-Bench 4.0
58

Costo$20.00
Latenza3.84s
Contesto1M
TTFT3.84s
AA-LCR
80
AIM-Agentic-RAG
84
AIM-FinanceReasoning
90
AIM-Text-to-SQL
67
ARC-AGI-1
98
ARC-AGI-2
90
AutomationBench-AA
31
Convex Coding Evals
81
CritPt
31
DeepSWE 1.1
67
FrontierCode
51
FrontierMath
88
GDPval
1735
GPQA Diamond
94
HealthBench Professional
62
Humanity's Last Exam
59
LegalBench
89
RuneBench
6
SciCode
63
Tau3-Banking
47
Terminal-Bench 2.1
91
Terminal-Bench 4.0
56

Costo$0.23
Latenza0.85s
Contesto1M
TTFT0.85s
AA-LCR
77
GDPval
1743
GPQA Diamond
92
Humanity's Last Exam
38
IFBench
81
SciCode
47
Tau3-Banking
45
Terminal-Bench 2.1
86

Costo$0.60
Latenza-
Contesto200k
TTFT
CritPt
30
IFBench
74
LegalBench
61
Tau2-Bench Telecom
81
Terminal-Bench Hard
25

Costo$0.54
Latenza43.98s
Contesto1M
TTFT43.98s
CritPt
27
GDPval
1673
SciCode
61

Costo$2.00
Latenza5.26s
Contesto1M
TTFT5.26s
AA-LCR
81
DeepSWE 1.1
53
GDPval
1381
GPQA Diamond
90
HealthBench Professional
59
Humanity's Last Exam
46
LegalBench
85
ObviousBench
99
ReactBench
23
RuneBench
6
SciCode
58
Tau3-Banking
32
Terminal-Bench 2.1
78

Costo$20.00
Latenza4.35s
Contesto1M
TTFT4.35s
AA-LCR
77
AIM-A-CODE-LLM Bench
69
AIM-Agentic-RAG
82
AIM-FinanceReasoning
90
AIM-Text-to-SQL
66
APEX-Agents-AA
59
ARC-AGI-1
99
ARC-AGI-2
89
ArxivMath
79
AutomationBench-AA
17
BrowseComp
87
Convex Coding Evals
84
CritPt
29
DeepSWE 1.1
70
Frontier-Bench
34
FrontierCode
54
FrontierMath
90
GDPval
1741
GPQA Diamond
93
Harvey LAB-AA
14
HealthBench Professional
63
HieroglyphBench
23
Humanity's Last Exam
56
IFBench
64
LegalBench
89
MMMU-Pro
81
ObviousBench
99
Opus Magnum Bench
22
ReactBench
47
RuneBench
6
SciCode
61
SimpleBench
82
Tau2-Bench Telecom
99
Tau3-Banking
38
Terminal-Bench 2.1
85
Terminal-Bench 4.0
42
Terminal-Bench Hard
63
Terminal-Bench-Science
21

Costo$10.00
Latenza4.03s
Contesto1M
TTFT4.03s
AA-LCR
79
AIM-Agentic-RAG
85
AIM-FinanceReasoning
90
AIM-Text-to-SQL
64
ARC-AGI-1
98
ARC-AGI-2
90
ARC-AGI-3
30
ArxivMath
91
AutomationBench-AA
50
BioMysteryBench
79
BrowseComp
91
Convex Coding Evals
82
CritPt
29
DeepSWE 1.1
74
Frontier-Bench
44
FrontierCode
53
FrontierMath
73
GDPval
1708
GPQA Diamond
94
HealthBench Professional
60
Humanity's Last Exam
55
LegalBench
87
MMMU-Pro
85
ObviousBench
100
RuneBench
6
SciCode
56
Tau3-Banking
45
Terminal-Bench 2.1
89
Terminal-Bench 4.0
52
Terminal-Bench-Science
30

Costo$4.00
Latenza1.36s
Contesto1M
TTFT1.36s
AIM-Agentic-RAG
82
AIM-Text-to-SQL
54
CritPt
31
GDPval
1487
SciCode
58
Pagina 1 di 13
Evoluzione nel tempo
Indice di Intelligenza per data di rilascio del modello
Costo vs prestazioni
Costo combinato rispetto all'Indice di Intelligenza
Modello × Benchmark
Modelli migliori sui benchmark selezionati

Come viene costruito l'indice

Ogni benchmark viene letto come una posizione, non come un punteggio grezzo. All'interno di un benchmark il risultato migliore si colloca a 100, il peggiore a 0, e tutti gli altri modelli cadono in un punto intermedio. L'indice è la media ponderata di quelle posizioni sui benchmark che un modello ha effettivamente eseguito: un benchmark che non ha mai eseguito non conta come zero, semplicemente non c'è. I benchmark non contano allo stesso modo, e il peso di ciascuno è indicato accanto ad esso. Un modello ha bisogno di risultati in almeno due benchmark dell'indice per essere classificato, così un singolo risultato colloca il modello sulla linea di quel benchmark senza dargli una posizione propria. Si usano le posizioni al posto dell'accuratezza grezza perché i benchmark differiscono nettamente per difficoltà e scala, e punteggi di benchmark diversi non possono condividere una media. Pesi: AIM-FinanceReasoning (10%) + AIM-Text-to-SQL (10%) + AIM-Agentic-RAG (10%) + SciCode (10%) + FrontierMath (10%) + Terminal-Bench 2.1 (10%) + CritPt (10%) + IFBench (10%) + MMMU-Pro (10%) + ARC-AGI-3 (10%).

Benchmark utilizzati

Pubblico
AA-LCRRagionamento su contesti lunghi con input multi-documento.
AIMultiple
AIM-A-CODE-LLM BenchCoding agentico su 10 attività di sviluppo software tramite strumento CLI (~3.500 passaggi di validazione).
AIMultiple
AIM-Agentic-RAGRouting multi-database e generazione di query SQL su 5 database (BIRD-SQL, 500 domande).
AIMultiple
AIM-FinanceReasoningRagionamento finanziario complesso a più passaggi su 238 domande difficili di FinanceReasoning.
AIMultiple
AIM-HALC-BenchResistenza all'invenzione di metriche non menzionate in documenti a contesto lungo (204 trappole, 14 trascrizioni).
AIMultiple
AIM-RELC-BenchRecupero di dati numerici in contesti lunghi da diverse posizioni del documento (100 elementi, 14 trascrizioni).
AIMultiple
AIM-Text-to-SQLAccuratezza nella generazione di query SQL a partire dal linguaggio naturale su oltre 35 LLM.
Pubblico
APEX-Agents-AACompiti a lungo orizzonte e cross-applicazione scritti da banchieri d'investimento, consulenti e avvocati d'impresa.
Pubblico
ARC-AGI-1Ragionamento astratto few-shot su trasformazioni di griglie; il primo benchmark ARC Prize.
Pubblico
ARC-AGI-2Nuovi rompicapo di ragionamento visivo che testano la generalizzazione, non la memorizzazione.
Pubblico
ARC-AGI-3Ragionamento interattivo: gli agenti esplorano ambienti di gioco inediti, si pongono obiettivi in corsa e imparano passo dopo passo. Il 100% equivale all'efficienza di apprendimento umana.
Pubblico
ArxivMathProblemi di matematica recenti da arXiv, eseguiti subito dopo la pubblicazione per limitare la contaminazione.
Pubblico
AutomationBench-AACompiti di automazione d'ufficio end-to-end, valutati sul completamento parziale.
Pubblico
BioMysteryBenchBenchmark di Anthropic sulla capacita degli agenti di risolvere misteri bioinformatici reali a partire da dati grezzi.
Pubblico
BrowseCompFatti difficili da trovare sul web: domande brevi che richiedono una navigazione tenace.
Pubblico
Convex Coding EvalsScrittura di backend Convex e integrazioni client senza linee guida specifiche del framework nel prompt.
Pubblico
CritPtProblemi di fisica di livello di ricerca che richiedono derivazioni multi-step.
Pubblico
Crosby RedlineBenchCompiti di revisione contrattuale valutati turno per turno rispetto alle modifiche degli avvocati.
Pubblico
DeepSWE 1.1Compiti di ingegneria a lungo orizzonte da repository open source attivi, valutati sul codice committato in un ambiente pulito.
Pubblico
EnterpriseOps-Gym-AAPianificazione agentica con stato e uso di strumenti su otto sistemi aziendali.
Pubblico
Frontier-BenchCompiti software agentici su repository di frontiera, valutati per tasso di risoluzione.
Pubblico
FrontierCodeSe una modifica sia integrabile, non solo se supera i test: sicurezza dalle regressioni, ambito e manutenibilita valutati con rubrica.
Pubblico
FrontierMathProblemi di matematica di ricerca inediti, scritti da esperti (livelli 1–4).
Pubblico
GDPvalProdotti reali di 44 professioni nei nove maggiori settori del PIL statunitense, valutati alla cieca da professionisti esperti rispetto a un riferimento umano.
Pubblico
GPQA DiamondDomande scientifiche di livello universitario avanzato, a prova di ricerca online, che richiedono un ragionamento profondo.
Pubblico
Harvey LAB-AAIl benchmark per agenti legali di Harvey, valutato sul successo con tutti i passaggi superati.
Pubblico
HealthBench ProfessionalConversazioni scritte da medici valutate con rubriche redatte da medici, sulla partizione professionale.
Pubblico
HieroglyphBenchLettura di geroglifici egizi da immagini, valutata sull'accuratezza dei segni.
Pubblico
Humanity's Last ExamRagionamento a libro chiuso di livello esperto su oltre 100 materie accademiche (2,5k domande).
Pubblico
IFBenchRispetto preciso delle istruzioni su 58 vincoli di output verificabili mai visti prima.
Pubblico
ITBench-AAScenari reali di automazione IT su affidabilita dei sistemi, FinOps e operazioni di sicurezza.
Pubblico
LegalBenchRagionamento giuridico in crowdsourcing su 162 compiti creati da professionisti del diritto.
Pubblico
LiveCodeBenchProblemi di programmazione competitiva privi di contaminazione e aggiornati continuamente.
Pubblico
MMMU-ProComprensione multimodale di livello universitario tra discipline, resa robusta contro scorciatoie solo testuali.
Pubblico
ObviousBenchDomande dalla risposta ovvia che i modelli sbagliano comunque; punteggio pass-cubo.
Pubblico
Opus Magnum BenchProgettazione di macchine funzionanti nel gioco rompicapo Opus Magnum.
Pubblico
ReactBenchCreazione e correzione di componenti React, valutate con pass@1.
Pubblico
RuneBenchLettura e ragionamento su una scrittura runica inventata mai vista dal modello, con punteggio su scala logaritmica.
Pubblico
SciCodeCoding scientifico a livello di ricerca in fisica, matematica, biologia e chimica (338 sottoproblemi)
Pubblico
SimpleBenchDomande di ragionamento quotidiano in cui gli esseri umani battono regolarmente i modelli di frontiera.
Pubblico
Swe-BenchIssue GitHub reali risolte end-to-end (set completo di 2.294 istanze).
Pubblico
Tau2-Bench TelecomAgenti di assistenza clienti che usano strumenti in ambito telecomunicazioni, valutati sul successo del compito.
Pubblico
Tau3-BankingAgenti che usano strumenti per gestire flussi realistici di assistenza clienti bancaria.
Pubblico
Terminal-Bench 2.1Compiti agentici da terminale su ingegneria del software, dati e amministrazione di sistema.
Pubblico
Terminal-Bench 4.0L'attuale generazione di Terminal-Bench: compiti agentici da terminale valutati per tasso di risoluzione.
Pubblico
Terminal-Bench HardIl sottoinsieme difficile di Terminal-Bench: compiti software multi-step risolti in un terminale reale.
Pubblico
Terminal-Bench-ScienceCompiti da terminale tratti da flussi di lavoro reali di calcolo scientifico.

Aggiornamenti recenti

Ultime modifiche all'Indice di Intelligenza, alla copertura dei modelli e alla metodologia di benchmark di AIMultiple.

Anthropic

Claude Opus 5.5

Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.

OpenAI

GPT-6 Sol

Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.

OpenAI

GPT-6 Luna

Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.

Xiaomi

MiMo-V2.6-Pro

Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.

Cronologia dei rilasci di LLMIl ritmo dell'innovazione nell'IA
Laboratori di IA
Alibaba Cloud
Alibaba Cloud
03 ago 2026
Qwen3.7 Flash +1 altriQwen3.7 FlashQwen3.8 Max
14 ago 2026
Qwen3.8 2.4T A95B +1 altriQwen3.8 2.4T A95BQwen3.8 27B
03 set 2026
Qwen3.8 Flash +1 altriQwen3.8 FlashQwen3.8 Max (0902)
23 set 2026
Qwen3.8 Max Prime +1 altriQwen3.8 Max PrimeQwen3.8 Omni Flash
Z AI
Z AI
26 ago 2026
GLM 5.3 +1 altriGLM 5.3GLM 5.3 Flash
23 set 2026
GLM 5.3 FlashX +1 altriGLM 5.3 FlashXGLM 5.3 Prime
Anthropic
Anthropic
24 lug 2026
Claude Opus 5
01 set 2026
Claude Fable 5.1
22 set 2026
Claude Opus 5.5
OpenAI
OpenAI
22 set 2026
GPT-6 Astra +2 altriGPT-6 AstraGPT-6 LunaGPT-6 Sol
Xiaomi
Xiaomi
21 set 2026
MiMo-V2.6-Pro
X
X
12 ago 2026
Grok 4.6
21 set 2026
Grok 4.7
Meta
Meta
09 ago 2026
Muse Glimmer 30B +1 altriMuse Glimmer 30BMuse Spark 1.2
02 set 2026
Muse Spark 1.2 Contributor +2 altriMuse Spark 1.2 ContributorMuse Spark 1.3Muse Spark 1.3 Contributor
Google
Google
13 ago 2026
Gemini 3.7 Flash
02 set 2026
Gemini 3.8 Flash
Tencent
Tencent
28 ago 2026
Hy4

Esplora Casi d'uso, analisi e benchmark di LLM

Text-to-SQL: Confronto dell'accuratezza degli LLM

LLM
Benchmark
25 set

Abbiamo eseguito 36 grandi modelli linguistici su 759 domande di BIRD-SQL, ciascun modello scrivendo SQL contro un database che doveva identificare da solo tra 11 candidati. Ogni query analizzabile è stata eseguita sul database reale e il suo set di risultati confrontato con il set di risultati della query gold di BIRD. Le query mancanti,…

Per saperne di più
LLM
Approfondimento
25 set

LLM Quota di mercato: Confronto su utilizzo e adozione

Abbiamo analizzato la quota di mercato LLM combinando dati basati sull'utilizzo e stime delle visite web per mostrare come la domanda di grandi modelli linguistici sia distribuita tra i laboratori IA e le applicazioni IA: Leggi la metodologia per vedere come abbiamo misurato e calcolato questi risultati. Gli Stati Uniti hanno dominato le visite web…

LLM
Benchmark
24 set

Benchmark di 40+ LLM nella finanza: Claude Fable 5 e GPT-5.6 Sol

Abbiamo valutato gli LLM su 238 domande difficili del benchmark FinanceReasoning (Tang et al.).1 Questo sottoinsieme riguarda i compiti di ragionamento finanziario più impegnativi, valutando ragionamenti quantitativi complessi e a più passaggi che coinvolgono concetti e formule finanziarie. La nostra valutazione ha utilizzato una progettazione personalizzata dei prompt e criteri di punteggio basati su accuratezza…

LLM
Benchmark
21 set

Confronto tra modelli di IA multimodali sul ragionamento visivo

Abbiamo sottoposto a benchmark 15 modelli di IA multimodali leader sul ragionamento visivo utilizzando 200 domande basate su elementi visivi. La valutazione era composta da due tracce: 100 domande di comprensione dei grafici per testare l'interpretazione delle visualizzazioni di dati, e 100 domande di logica visiva per valutare il riconoscimento di pattern e il ragionamento…

LLM
Approfondimento
21 set

Grandi modelli multimodali (LMM) vs LLMs

Abbiamo valutato le prestazioni dei modelli multimodali di grandi dimensioni (LMM) in compiti di ragionamento finanziario utilizzando un dataset accuratamente selezionato. Analizzando un sottoinsieme di campioni finanziari di alta qualità, valutiamo le capacità dei modelli nell'elaborare e ragionare con dati multimodali nel dominio finanziario. La sezione metodologia fornisce approfondimenti dettagliati sul dataset e sul framework…

LLM
Approfondimento
21 set

LLM Calcolatore VRAM per il self-hosting

Il self-hosting di un LLM significa eseguire l'inferenza su hardware controllato dall'operatore anziché tramite un'API di terze parti, il che cambia il profilo di costi, controllo dei dati e privacy. Il fatto che un modello possa girare dipende interamente dalla memoria. Il calcolatore stima la VRAM o la memoria unificata necessaria a un modello per…

LLM
Benchmark
18 set

IT agentico: gli agenti IA possono progettare un benchmark

Abbiamo testato 16 modelli sulla progettazione di un benchmark in text-to-SQL e tool calling. Ogni modello ha creato un benchmark per argomento, per un totale di 32 proposte. Nessuna proposta ha superato ogni criterio della rubrica. Gli agenti sono riusciti a creare ed eseguire test, ma nessuno ha dimostrato sia un test con risposta vuota…

LLM
Benchmark
17 set

AIM Enterprise: benchmark aziendale agentico

Le aziende usano gli LLM ogni giorno per le loro attività regolari. Per trovare gli LLM più convenienti, abbiamo progettato AIM Enterprise, un benchmark aziendale agentico, in cui abbiamo utilizzato 69 attività aziendali reali tra strategia, marketing, HR, vendite e operazioni. Due modelli giudici hanno valutato ogni file che ha superato i controlli. Nel 32,7%…

LLM
Approfondimento
17 set

Il futuro dei grandi modelli linguistici

Scopri il futuro dei grandi modelli linguistici approfondendo approcci promettenti, come l'auto-addestramento, la verifica dei fatti e la competenza sparsa, che potrebbero affrontare i limiti degli LLM. Confronto del tasso di successo degli LLM Claude Sonnet 4.6 ha guidato il benchmark con un punteggio complessivo di 0.748, con le varianti base e thinking a pari…

LLM
Benchmark
15 set

I modelli linguistici di grandi dimensioni nella cybersecurity

Abbiamo valutato 7 modelli linguistici di grandi dimensioni in 9 domini di cybersecurity utilizzando SecBench, un benchmark su larga scala e multi-formato per attività di sicurezza. Abbiamo testato ciascun modello su 44.823 domande a scelta multipla (MCQ) e 3.087 domande a risposta breve (SAQ), coprendo sicurezza dei dati, gestione delle identità e degli accessi, sicurezza…

LLM
Approfondimento
15 set

LLM Leggi di scaling: analisi di ricercatori IA

Large language models prevedono il token successivo in base ai pattern appresi dai dati testuali. Il termine leggi di scaling di LLM si riferisce a regolarità empiriche che collegano le prestazioni del model alla quantità di calcolo, ai dati di addestramento e ai parametri del model utilizzati durante l'addestramento. Per comprendere come queste relazioni influenzino…