Premium
Servizi
Premium

Benchmark LLM

Un unico Indice di Intelligenza trasparente che combina benchmark pubblici con le valutazioni agentiche, RAG e di ragionamento aziendale di AIMultiple. Come viene costruito l'indice

MODELLO MIGLIORE
Claude Opus 5.5
Indice 100
Miglior rapporto qualità-prezzo
Qwen3.8 Flash
$0.23 / 1M
Più veloce
MiniMax M2.7
0.15s TTFT
Indice di Intelligenza AIMultiple

Classifica

I modelli con il punteggio più alto in tutti i benchmark.

Filter & Sort
#
Modello
Indice
AA-LCR
AIM-A-CODE-LLM Bench
AIM-Agentic-RAG
AIM-FinanceReasoning
AIM-HALC-Bench
AIM-RELC-Bench
AIM-Text-to-SQL
APEX-Agents-AA
ARC-AGI-1
ARC-AGI-2
ARC-AGI-3
ArxivMath
AutomationBench-AA
BioMysteryBench
BrowseComp
Convex Coding Evals
CritPt
Crosby RedlineBench
DeepSWE 1.1
EnterpriseOps-Gym-AA
Frontier-Bench
FrontierCode
FrontierMath
GDPval
GPQA Diamond
Harvey LAB-AA
HealthBench Professional
HieroglyphBench
Humanity's Last Exam
IFBench
ITBench-AA
LegalBench
LiveCodeBench
MMMU-Pro
ObviousBench
Opus Magnum Bench
ReactBench
RuneBench
SciCode
SimpleBench
Swe-Bench
Tau2-Bench Telecom
Tau3-Banking
Terminal-Bench 2.1
Terminal-Bench 4.0
Terminal-Bench Hard
Terminal-Bench-Science
1
Claude Opus 5.5
Claude Opus 5.5
Anthropic
100
--9092--88---------32------1846--------------67--------
2
GPT-6 Astra
GPT-6 Astra
OpenAI
92
--8487--66--9563-41-928532-74--5398154296-70----------756----9058--
3
Claude Fable 5.1
Claude Fable 5.1
Anthropic
91
80-8490--67-9890--31--8131-67--5188173594-62-59--89-----663---479156--
4
Qwen3.8 Flash
Qwen3.8 Flash
Alibaba Cloud
87
77----------------------174392---3881--------47---4586---
5
Command A+
Command A+
Cohere
87
----------------30------------74-61---------81---25-
6
MiMo-V2.6-Pro
MiMo-V2.6-Pro
Xiaomi
87
----------------27------1673--------------61--------
7
Muse Spark 1.1
Muse Spark 1.1
Meta
86
81-----------------53----138190-59-46--85--99-23658---3278---
8
Claude Fable 5
Claude Fable 5
Anthropic
85
77698290--66599989-7917-878429-70-3454901741931463235664-89-8199224766182-993885426321
9
Claude Opus 5
Claude Opus 5
Anthropic
83
79-8590--64-989030915079918229-74-445373170894-60-55--87-85100--656---458952-30
10
GPT-6 Sol
GPT-6 Sol
OpenAI
79
--82---54---------31------1487--------------58--------
Pagina 1 di 13

Costo$8.00
Latenza2.81s
Contesto1M
TTFT2.81s
AIM-Agentic-RAG
90
AIM-FinanceReasoning
92
AIM-Text-to-SQL
88
CritPt
32
GDPval
1846
SciCode
67

Costo$20.00
Latenza6.31s
Contesto1M
TTFT6.31s
AIM-Agentic-RAG
84
AIM-FinanceReasoning
87
AIM-Text-to-SQL
66
ARC-AGI-2
95
ARC-AGI-3
63
AutomationBench-AA
41
BrowseComp
92
Convex Coding Evals
85
CritPt
32
DeepSWE 1.1
74
FrontierCode
53
FrontierMath
98
GDPval
1542
GPQA Diamond
96
HealthBench Professional
70
RuneBench
7
SciCode
56
Terminal-Bench 2.1
90
Terminal-Bench 4.0
58

Costo$20.00
Latenza3.84s
Contesto1M
TTFT3.84s
AA-LCR
80
AIM-Agentic-RAG
84
AIM-FinanceReasoning
90
AIM-Text-to-SQL
67
ARC-AGI-1
98
ARC-AGI-2
90
AutomationBench-AA
31
Convex Coding Evals
81
CritPt
31
DeepSWE 1.1
67
FrontierCode
51
FrontierMath
88
GDPval
1735
GPQA Diamond
94
HealthBench Professional
62
Humanity's Last Exam
59
LegalBench
89
RuneBench
6
SciCode
63
Tau3-Banking
47
Terminal-Bench 2.1
91
Terminal-Bench 4.0
56

Costo$0.23
Latenza0.85s
Contesto1M
TTFT0.85s
AA-LCR
77
GDPval
1743
GPQA Diamond
92
Humanity's Last Exam
38
IFBench
81
SciCode
47
Tau3-Banking
45
Terminal-Bench 2.1
86

Costo$0.60
Latenza-
Contesto200k
TTFT
CritPt
30
IFBench
74
LegalBench
61
Tau2-Bench Telecom
81
Terminal-Bench Hard
25

Costo$0.54
Latenza43.98s
Contesto1M
TTFT43.98s
CritPt
27
GDPval
1673
SciCode
61

Costo$2.00
Latenza5.26s
Contesto1M
TTFT5.26s
AA-LCR
81
DeepSWE 1.1
53
GDPval
1381
GPQA Diamond
90
HealthBench Professional
59
Humanity's Last Exam
46
LegalBench
85
ObviousBench
99
ReactBench
23
RuneBench
6
SciCode
58
Tau3-Banking
32
Terminal-Bench 2.1
78

Costo$20.00
Latenza4.35s
Contesto1M
TTFT4.35s
AA-LCR
77
AIM-A-CODE-LLM Bench
69
AIM-Agentic-RAG
82
AIM-FinanceReasoning
90
AIM-Text-to-SQL
66
APEX-Agents-AA
59
ARC-AGI-1
99
ARC-AGI-2
89
ArxivMath
79
AutomationBench-AA
17
BrowseComp
87
Convex Coding Evals
84
CritPt
29
DeepSWE 1.1
70
Frontier-Bench
34
FrontierCode
54
FrontierMath
90
GDPval
1741
GPQA Diamond
93
Harvey LAB-AA
14
HealthBench Professional
63
HieroglyphBench
23
Humanity's Last Exam
56
IFBench
64
LegalBench
89
MMMU-Pro
81
ObviousBench
99
Opus Magnum Bench
22
ReactBench
47
RuneBench
6
SciCode
61
SimpleBench
82
Tau2-Bench Telecom
99
Tau3-Banking
38
Terminal-Bench 2.1
85
Terminal-Bench 4.0
42
Terminal-Bench Hard
63
Terminal-Bench-Science
21

Costo$10.00
Latenza4.03s
Contesto1M
TTFT4.03s
AA-LCR
79
AIM-Agentic-RAG
85
AIM-FinanceReasoning
90
AIM-Text-to-SQL
64
ARC-AGI-1
98
ARC-AGI-2
90
ARC-AGI-3
30
ArxivMath
91
AutomationBench-AA
50
BioMysteryBench
79
BrowseComp
91
Convex Coding Evals
82
CritPt
29
DeepSWE 1.1
74
Frontier-Bench
44
FrontierCode
53
FrontierMath
73
GDPval
1708
GPQA Diamond
94
HealthBench Professional
60
Humanity's Last Exam
55
LegalBench
87
MMMU-Pro
85
ObviousBench
100
RuneBench
6
SciCode
56
Tau3-Banking
45
Terminal-Bench 2.1
89
Terminal-Bench 4.0
52
Terminal-Bench-Science
30

Costo$4.00
Latenza1.36s
Contesto1M
TTFT1.36s
AIM-Agentic-RAG
82
AIM-Text-to-SQL
54
CritPt
31
GDPval
1487
SciCode
58
Pagina 1 di 13
Evoluzione nel tempo
Indice di Intelligenza per data di rilascio del modello
Costo vs prestazioni
Costo combinato rispetto all'Indice di Intelligenza
Modello × Benchmark
Modelli migliori sui benchmark selezionati

Come viene costruito l'indice

Ogni benchmark viene letto come una posizione, non come un punteggio grezzo. All'interno di un benchmark il risultato migliore si colloca a 100, il peggiore a 0, e tutti gli altri modelli cadono in un punto intermedio. L'indice è la media ponderata di quelle posizioni sui benchmark che un modello ha effettivamente eseguito: un benchmark che non ha mai eseguito non conta come zero, semplicemente non c'è. I benchmark non contano allo stesso modo, e il peso di ciascuno è indicato accanto ad esso. Un modello ha bisogno di risultati in almeno due benchmark dell'indice per essere classificato, così un singolo risultato colloca il modello sulla linea di quel benchmark senza dargli una posizione propria. Si usano le posizioni al posto dell'accuratezza grezza perché i benchmark differiscono nettamente per difficoltà e scala, e punteggi di benchmark diversi non possono condividere una media. Pesi: AIM-FinanceReasoning (10%) + AIM-Text-to-SQL (10%) + AIM-Agentic-RAG (10%) + SciCode (10%) + FrontierMath (10%) + Terminal-Bench 2.1 (10%) + CritPt (10%) + IFBench (10%) + MMMU-Pro (10%) + ARC-AGI-3 (10%).

Benchmark utilizzati

Pubblico
AA-LCRRagionamento su contesti lunghi con input multi-documento.
AIMultiple
AIM-A-CODE-LLM BenchCoding agentico su 10 attività di sviluppo software tramite strumento CLI (~3.500 passaggi di validazione).
AIMultiple
AIM-Agentic-RAGRouting multi-database e generazione di query SQL su 5 database (BIRD-SQL, 500 domande).
AIMultiple
AIM-FinanceReasoningRagionamento finanziario complesso a più passaggi su 238 domande difficili di FinanceReasoning.
AIMultiple
AIM-HALC-BenchResistenza all'invenzione di metriche non menzionate in documenti a contesto lungo (204 trappole, 14 trascrizioni).
AIMultiple
AIM-RELC-BenchRecupero di dati numerici in contesti lunghi da diverse posizioni del documento (100 elementi, 14 trascrizioni).
AIMultiple
AIM-Text-to-SQLAccuratezza nella generazione di query SQL a partire dal linguaggio naturale su oltre 35 LLM.
Pubblico
APEX-Agents-AACompiti a lungo orizzonte e cross-applicazione scritti da banchieri d'investimento, consulenti e avvocati d'impresa.
Pubblico
ARC-AGI-1Ragionamento astratto few-shot su trasformazioni di griglie; il primo benchmark ARC Prize.
Pubblico
ARC-AGI-2Nuovi rompicapo di ragionamento visivo che testano la generalizzazione, non la memorizzazione.
Pubblico
ARC-AGI-3Ragionamento interattivo: gli agenti esplorano ambienti di gioco inediti, si pongono obiettivi in corsa e imparano passo dopo passo. Il 100% equivale all'efficienza di apprendimento umana.
Pubblico
ArxivMathProblemi di matematica recenti da arXiv, eseguiti subito dopo la pubblicazione per limitare la contaminazione.
Pubblico
AutomationBench-AACompiti di automazione d'ufficio end-to-end, valutati sul completamento parziale.
Pubblico
BioMysteryBenchBenchmark di Anthropic sulla capacita degli agenti di risolvere misteri bioinformatici reali a partire da dati grezzi.
Pubblico
BrowseCompFatti difficili da trovare sul web: domande brevi che richiedono una navigazione tenace.
Pubblico
Convex Coding EvalsScrittura di backend Convex e integrazioni client senza linee guida specifiche del framework nel prompt.
Pubblico
CritPtProblemi di fisica di livello di ricerca che richiedono derivazioni multi-step.
Pubblico
Crosby RedlineBenchCompiti di revisione contrattuale valutati turno per turno rispetto alle modifiche degli avvocati.
Pubblico
DeepSWE 1.1Compiti di ingegneria a lungo orizzonte da repository open source attivi, valutati sul codice committato in un ambiente pulito.
Pubblico
EnterpriseOps-Gym-AAPianificazione agentica con stato e uso di strumenti su otto sistemi aziendali.
Pubblico
Frontier-BenchCompiti software agentici su repository di frontiera, valutati per tasso di risoluzione.
Pubblico
FrontierCodeSe una modifica sia integrabile, non solo se supera i test: sicurezza dalle regressioni, ambito e manutenibilita valutati con rubrica.
Pubblico
FrontierMathProblemi di matematica di ricerca inediti, scritti da esperti (livelli 1–4).
Pubblico
GDPvalProdotti reali di 44 professioni nei nove maggiori settori del PIL statunitense, valutati alla cieca da professionisti esperti rispetto a un riferimento umano.
Pubblico
GPQA DiamondDomande scientifiche di livello universitario avanzato, a prova di ricerca online, che richiedono un ragionamento profondo.
Pubblico
Harvey LAB-AAIl benchmark per agenti legali di Harvey, valutato sul successo con tutti i passaggi superati.
Pubblico
HealthBench ProfessionalConversazioni scritte da medici valutate con rubriche redatte da medici, sulla partizione professionale.
Pubblico
HieroglyphBenchLettura di geroglifici egizi da immagini, valutata sull'accuratezza dei segni.
Pubblico
Humanity's Last ExamRagionamento a libro chiuso di livello esperto su oltre 100 materie accademiche (2,5k domande).
Pubblico
IFBenchRispetto preciso delle istruzioni su 58 vincoli di output verificabili mai visti prima.
Pubblico
ITBench-AAScenari reali di automazione IT su affidabilita dei sistemi, FinOps e operazioni di sicurezza.
Pubblico
LegalBenchRagionamento giuridico in crowdsourcing su 162 compiti creati da professionisti del diritto.
Pubblico
LiveCodeBenchProblemi di programmazione competitiva privi di contaminazione e aggiornati continuamente.
Pubblico
MMMU-ProComprensione multimodale di livello universitario tra discipline, resa robusta contro scorciatoie solo testuali.
Pubblico
ObviousBenchDomande dalla risposta ovvia che i modelli sbagliano comunque; punteggio pass-cubo.
Pubblico
Opus Magnum BenchProgettazione di macchine funzionanti nel gioco rompicapo Opus Magnum.
Pubblico
ReactBenchCreazione e correzione di componenti React, valutate con pass@1.
Pubblico
RuneBenchLettura e ragionamento su una scrittura runica inventata mai vista dal modello, con punteggio su scala logaritmica.
Pubblico
SciCodeCoding scientifico a livello di ricerca in fisica, matematica, biologia e chimica (338 sottoproblemi)
Pubblico
SimpleBenchDomande di ragionamento quotidiano in cui gli esseri umani battono regolarmente i modelli di frontiera.
Pubblico
Swe-BenchIssue GitHub reali risolte end-to-end (set completo di 2.294 istanze).
Pubblico
Tau2-Bench TelecomAgenti di assistenza clienti che usano strumenti in ambito telecomunicazioni, valutati sul successo del compito.
Pubblico
Tau3-BankingAgenti che usano strumenti per gestire flussi realistici di assistenza clienti bancaria.
Pubblico
Terminal-Bench 2.1Compiti agentici da terminale su ingegneria del software, dati e amministrazione di sistema.
Pubblico
Terminal-Bench 4.0L'attuale generazione di Terminal-Bench: compiti agentici da terminale valutati per tasso di risoluzione.
Pubblico
Terminal-Bench HardIl sottoinsieme difficile di Terminal-Bench: compiti software multi-step risolti in un terminale reale.
Pubblico
Terminal-Bench-ScienceCompiti da terminale tratti da flussi di lavoro reali di calcolo scientifico.

Aggiornamenti recenti

Ultime modifiche all'Indice di Intelligenza, alla copertura dei modelli e alla metodologia di benchmark di AIMultiple.

Anthropic

Claude Opus 5.5

Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.

OpenAI

GPT-6 Sol

Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.

OpenAI

GPT-6 Luna

Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.

Xiaomi

MiMo-V2.6-Pro

Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.

Cronologia dei rilasci di LLMIl ritmo dell'innovazione nell'IA
Laboratori di IA
Alibaba Cloud
Alibaba Cloud
03 ago 2026
Qwen3.7 Flash +1 altriQwen3.7 FlashQwen3.8 Max
14 ago 2026
Qwen3.8 2.4T A95B +1 altriQwen3.8 2.4T A95BQwen3.8 27B
03 set 2026
Qwen3.8 Flash +1 altriQwen3.8 FlashQwen3.8 Max (0902)
23 set 2026
Qwen3.8 Max Prime +1 altriQwen3.8 Max PrimeQwen3.8 Omni Flash
Z AI
Z AI
26 ago 2026
GLM 5.3 +1 altriGLM 5.3GLM 5.3 Flash
23 set 2026
GLM 5.3 FlashX +1 altriGLM 5.3 FlashXGLM 5.3 Prime
Anthropic
Anthropic
24 lug 2026
Claude Opus 5
01 set 2026
Claude Fable 5.1
22 set 2026
Claude Opus 5.5
OpenAI
OpenAI
22 set 2026
GPT-6 Astra +2 altriGPT-6 AstraGPT-6 LunaGPT-6 Sol
Xiaomi
Xiaomi
21 set 2026
MiMo-V2.6-Pro
X
X
12 ago 2026
Grok 4.6
21 set 2026
Grok 4.7
Meta
Meta
09 ago 2026
Muse Glimmer 30B +1 altriMuse Glimmer 30BMuse Spark 1.2
02 set 2026
Muse Spark 1.2 Contributor +2 altriMuse Spark 1.2 ContributorMuse Spark 1.3Muse Spark 1.3 Contributor
Google
Google
13 ago 2026
Gemini 3.7 Flash
02 set 2026
Gemini 3.8 Flash
Tencent
Tencent
28 ago 2026
Hy4

Esplora Casi d'uso, analisi e benchmark di LLM

Confronta 9 Large Language Models in ambito sanitario

LLM
Confronto delle Funzionalità
15 set

Abbiamo valutato 9 LLM utilizzando il dataset MedQA, un benchmark di esami clinici di livello universitario derivato dalle domande USMLE. Ogni model ha risposto agli stessi scenari clinici a scelta multipla utilizzando un prompt standardizzato, consentendo un confronto diretto dell'accuratezza. Abbiamo inoltre registrato la latenza per domanda dividendo il tempo di esecuzione totale per il…

Per saperne di più
LLM
Benchmark
15 set

Simulazione del pubblico: gli LLM possono prevedere il comportamento umano?

Nel marketing, valutare con quanta precisione gli LLM prevedono il comportamento umano è fondamentale per valutare la loro efficacia nell'anticipare le esigenze del pubblico e riconoscere i rischi di disallineamento, comunicazione inefficace o influenza non intenzionale. La simulazione del pubblico con gli LLM consente la modellazione di pubblici virtuali, aiutando le organizzazioni ad anticipare le…

LLM
Benchmark
15 set

HALC-Bench: LLM Allucinazione su benchmark di recupero a lungo contesto

HALC-Bench (benchmark di allucinazione di LLM su recupero a lungo contesto) misura la resistenza di un grande modello linguistico a fabbricare prove per una metrica che non esiste nel documento di destinazione, utilizzando 3 pagliai posizionati all'inizio, a metà e alla fine della finestra di contesto del modello, con 204 domande. claude-fable-5 ha risposto correttamente…

LLM
Benchmark
15 set

Gateway IA per OpenAI: alternative a OpenRouter

Abbiamo confrontato OpenRouter, SambaNova, TogetherAI, Groq e IA/ML API su tre indicatori (latenza del primo token, latenza totale e numero di token in output), con 300 test utilizzando prompt brevi (circa 18 token) e prompt lunghi (circa 203 token) per la latenza totale. Se prevedi di utilizzare uno di questi gateway IA, puoi: In questo…

LLM
Approfondimento
2 set

LLM Strumenti di osservabilità: Weights & Biases, Langsmith

Le applicazioni LLM si sono espanse da chat a turno singolo ad agenti multi-step che usano strumenti, interrogano database e si coordinano con altri model, rendendo il loro comportamento più difficile da interpretare. L'osservabilità LLM fornisce visibilità continua su questi flussi di lavoro complessi, aiutando le organizzazioni a monitorare la qualità, rilevare i guasti, risolvere…

LLM
Confronto delle Funzionalità
2 set

Cloud LLM vs Local LLMs: Esempi & Vantaggi

Cloud LLMs, potenziati da modelli avanzati come GPT-5.5 e Claude Opus 4.7, offrono scalabilità e accessibilità. Al contrario, Local LLMs, guidati da modelli open source come Llama 4, DeepSeek V4 e Qwen3.6-Plus, assicurano maggiore privacy e personalizzazione. Esplora cosa sono i cloud LLMs, i loro punti di forza e debolezze, i casi di studio più…

LLM
Approfondimento
1 set

LLM Guida al Fine-Tuning per le Aziende

Segui i link per le soluzioni specifiche ai tuoi problemi di output LLM. Se il tuo LLM: L'adozione diffusa dei modelli linguistici di grandi dimensioni (LLMs) ha migliorato la nostra capacità di elaborare il linguaggio umano. Tuttavia, il loro addestramento generico spesso si traduce in prestazioni subottimali per compiti specifici. Per superare questa limitazione, vengono…

LLM
Approfondimento
1 set

10+ Esempi di grandi modelli linguistici

Abbiamo raccolto benchmark open-source per confrontare i principali modelli linguistici di grandi dimensioni proprietari e open-source. Scegli il tuo caso d'uso per trovare il modello giusto. Puoi valutare i grandi modelli linguistici esaminando le loro prestazioni nei benchmark e la latenza reale (disponibile cliccando sul nome di ciascun modello nella tabella) e rivedendo i prezzi…

LLM
Confronto delle Funzionalità
27 ago

LLM Prezzi: Confronto tra i migliori 15+ provider

Il pricing degli LLM si estende su quattro ordini di grandezza: i modelli più economici sono stati lanciati a meno di $0,03 per milione di token, mentre i modelli di ragionamento di frontiera sono stati lanciati fino a $262.50. Il grafico seguente tiene traccia dei prezzi di lancio: ogni punto rappresenta il prezzo medio dei…

LLM
Approfondimento
27 ago

Automazione LLM: i 7 migliori strumenti e 8 casi di studio

L'automazione LLM si riferisce al passaggio a strumenti di automazione intelligente che sfruttano gli LLM, inclusi agenti IA, LLM fine-tuned e modelli RAG per automatizzare e coordinare le attività. Scopri cos'è l'automazione LLM, le sue principali applicazioni reali e i principali strumenti: Large language models nell'automazione sono un approccio sistematico che combina l'elaborazione del linguaggio…

LLM
Valutazione in Mondo Aperto
26 ago

LLM Orchestrazione: 22 Framework e Gateway

Ottimizzare l'orchestrazione LLM è fondamentale per migliorare le prestazioni mantenendo sotto controllo l'uso delle risorse. Per valutare come si comportano nella pratica i diversi approcci di orchestrazione, abbiamo eseguito dei benchmark: Scopri una selezione di strumenti di orchestrazione LLM, tra cui framework per sviluppatori e gateway aziendali: L'orchestrazione LLM implica la gestione e l'integrazione di…