Servizi
Contattaci

Benchmark LLM

Un unico Indice di Intelligenza trasparente che combina benchmark pubblici con le valutazioni agentiche, RAG e di ragionamento aziendale di AIMultiple. Vedi la metodologia.

MODELLO MIGLIORE
Claude Fable 5
Indice 92
Miglior rapporto qualità-prezzo
MiniMax M3
$0.42 / 1M
Più veloce
GPT OSS 120B
0.23s TTFT
Copertura
64 modelli
8 benchmark · 336 valutazioni
Indice di Intelligenza AIMultiple

Classifica

I modelli con il punteggio più alto in tutti i benchmark.

Filter & Sort
#
Modello
Indice
LegalBench
FinanceReasoning
Text-to-SQL
Agentic RAG
ARC-AGI-2
Agentic LLM Benchmark
FrontierMath
Swe-Bench
1
Claude Fable 5
Claude Fable 5
Anthropic
92
89909098-69--
2
Kimi K3
Kimi K3
Moonshot AI
88
86887793-73--
3
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
87
879074879362--
4
Grok 4.5
Grok 4.5
X
86
86887983-73--
5
GPT-5.5
GPT-5.5
OpenAI
83
87---8559--
6
GPT-5.6 Terra
GPT-5.6 Terra
OpenAI
80
858771918461--
7
GPT-5.6 Sol Pro
GPT-5.6 Sol Pro
OpenAI
80
-917996-54--
8
Claude Opus 4.6
Claude Opus 4.6
Anthropic
78
-8868806972--
9
Gemini 3 Pro Preview
Gemini 3 Pro Preview
Google
77
8786608931---
10
Gemini 3.1 Pro Preview
Gemini 3.1 Pro Preview
Google
77
87876589774627-
Pagina 1 di 7

Costo$20.00
Latenza4.02s
Contesto1M
TTFT4.02s
LegalBench
89
FinanceReasoning
90
Text-to-SQL
90
Agentic RAG
98
Agentic LLM Benchmark
69

Costo$6.00
Latenza2.93s
Contesto1M
TTFT2.93s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
77
Agentic RAG
93
Agentic LLM Benchmark
73

Costo$11.25
Latenza4.31s
Contesto1M
TTFT4.31s
LegalBench
87
FinanceReasoning
90
Text-to-SQL
74
Agentic RAG
87
ARC-AGI-2
93
Agentic LLM Benchmark
62

Costo$3.00
Latenza7.25s
Contesto500k
TTFT7.25s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
79
Agentic RAG
83
Agentic LLM Benchmark
73

Costo$11.25
Latenza0.70s
Contesto272k
TTFT0.70s
LegalBench
87
ARC-AGI-2
85
Agentic LLM Benchmark
59

Costo$4.50
Latenza1.62s
Contesto1M
TTFT1.62s
LegalBench
85
FinanceReasoning
87
Text-to-SQL
71
Agentic RAG
91
ARC-AGI-2
84
Agentic LLM Benchmark
61

Costo$11.25
Latenza11.11s
Contesto1M
TTFT11.11s
FinanceReasoning
91
Text-to-SQL
79
Agentic RAG
96
Agentic LLM Benchmark
54

Costo$10.00
Latenza1.71s
Contesto1M
TTFT1.71s
FinanceReasoning
88
Text-to-SQL
68
Agentic RAG
80
ARC-AGI-2
69
Agentic LLM Benchmark
72

Costo$4.50
Latenza-
Contesto1M
TTFT
LegalBench
87
FinanceReasoning
86
Text-to-SQL
60
Agentic RAG
89
ARC-AGI-2
31

Costo$4.50
Latenza22.02s
Contesto1M
TTFT22.02s
LegalBench
87
FinanceReasoning
87
Text-to-SQL
65
Agentic RAG
89
ARC-AGI-2
77
Agentic LLM Benchmark
46
FrontierMath
27
Pagina 1 di 7
Evoluzione nel tempo
Indice di Intelligenza per data di rilascio del modello
Costo vs prestazioni
Costo combinato rispetto all'Indice di Intelligenza
Modello × Benchmark
Modelli migliori sui benchmark selezionati
Metodologia

Come viene costruito l'indice

L'Indice di Intelligenza normalizza ogni benchmark su una scala da 0 a 100 e calcola la media della posizione relativa di un modello sui benchmark su cui è stato valutato. Ogni benchmark qui sotto contribuisce a quel punteggio.

AIMultiple
FinanceReasoningRagionamento finanziario complesso a più passaggi su 238 domande difficili di FinanceReasoning.
AIMultiple
Text-to-SQLAccuratezza nella generazione di query SQL a partire dal linguaggio naturale su oltre 35 LLM.
AIMultiple
Agentic RAGRouting multi-database e generazione di query SQL su 5 database (BIRD-SQL, 500 domande).
AIMultiple
AI MemoryRecupero di dati numerici in contesti lunghi da diverse posizioni del documento (100 elementi, 14 trascrizioni).
AIMultiple
AI HallucinationResistenza all'invenzione di metriche non menzionate in documenti a contesto lungo (204 trappole, 14 trascrizioni).
Pubblico
Humanity's Last ExamRagionamento a libro chiuso di livello esperto su oltre 100 materie accademiche (2,5k domande).
Pubblico
SciCodeCoding scientifico a livello di ricerca in fisica, matematica, biologia e chimica (338 sottoproblemi)
Pubblico
LegalBenchRagionamento giuridico in crowdsourcing su 162 compiti creati da professionisti del diritto.
Pubblico
FrontierMathProblemi di matematica di ricerca inediti, scritti da esperti (livelli 1–4).
Pubblico
ARC-AGI-2Nuovi rompicapo di ragionamento visivo che testano la generalizzazione, non la memorizzazione.
Pubblico
Swe-BenchIssue GitHub reali risolte end-to-end (set completo di 2.294 istanze).
Pubblico
LiveCodeBenchProblemi di programmazione competitiva privi di contaminazione e aggiornati continuamente.
AIMultiple
Agentic LLM BenchmarkCoding agentico su 10 attività di sviluppo software tramite strumento CLI (~3.500 passaggi di validazione).
Aggiornamenti recenti

Aggiornamenti recenti

Ultime modifiche all'Indice di Intelligenza, alla copertura dei modelli e alla metodologia di benchmark di AIMultiple.

Moonshot AI

Kimi K3

Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.

OpenAI

GPT-5.6 Sol

Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.

OpenAI

GPT-5.6 Terra

Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.

OpenAI

GPT-5.6 Sol Pro

Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.

Esplora Casi d'uso, analisi e benchmark di LLM

LLM Quota di mercato: Confronto su utilizzo e adozione

LLM
Approfondimento
2 Lug

Abbiamo analizzato la quota di mercato LLM combinando dati basati sull'utilizzo e stime delle visite web per mostrare come la domanda di grandi modelli linguistici sia distribuita tra i laboratori IA e le applicazioni IA: Leggi la metodologia per vedere come abbiamo misurato e calcolato questi risultati. Gli Stati Uniti hanno dominato le visite web…

Per saperne di più
LLM
Approfondimento
26 Giu

LLM Parameters: GPT-5 High, Medium, Low and Minimal

Alcuni LLM, come la famiglia GPT-5 di OpenAI, sono disponibili in diverse versioni (ad esempio, GPT-5, GPT-5-mini e GPT-5-nano) e con varie impostazioni dei parametri, tra cui alto, medio, basso e minimo. Di seguito, esploriamo le differenze tra queste versioni del modello raccogliendo le loro prestazioni sui benchmark e i costi per eseguire i benchmark.…

LLM
Approfondimento
25 Giu

Il futuro dei grandi modelli linguistici

Vedi il futuro dei grandi modelli linguistici approfondendo approcci promettenti, come l'auto-addestramento, la verifica dei fatti e l'expertise sparsa che potrebbero affrontare le limitazioni degli LLM. Confronto dei tassi di successo degli LLM Claude Sonnet 4.6 ha guidato il benchmark con un punteggio complessivo di 0.748, con le varianti base e thinking a pari merito…

LLM
Approfondimento
22 Giu

10+ Esempi di grandi modelli linguistici

Abbiamo raccolto benchmark open-source per confrontare i principali modelli linguistici di grandi dimensioni proprietari e open-source. Scegli il tuo caso d'uso per trovare il modello giusto. Puoi valutare i grandi modelli linguistici esaminando le loro prestazioni nei benchmark e la latenza reale (disponibile cliccando sul nome di ciascun modello nella tabella) e rivedendo i prezzi…

LLM
Confronto delle Funzionalità
22 Giu

Cloud LLM vs Local LLMs: Esempi & Vantaggi

Cloud LLMs, potenziati da modelli avanzati come GPT-5.5 e Claude Opus 4.7, offrono scalabilità e accessibilità. Al contrario, Local LLMs, guidati da modelli open source come Llama 4, DeepSeek V4 e Qwen3.6-Plus, assicurano maggiore privacy e personalizzazione. Esplora cosa sono i cloud LLMs, i loro punti di forza e debolezze, i casi di studio più…

LLM
Benchmark
5 Giu

Modelli Linguistici di Grande Dimensione nella Cybersecurity

Abbiamo valutato 7 modelli linguistici di grande dimensione in 9 ambiti della cybersecurity utilizzando SecBench, un benchmark su larga scala e multi-formato per attività di sicurezza. Abbiamo testato ogni modello su 44.823 domande a scelta multipla (MCQ) e 3.087 domande a risposta breve (SAQ), coprendo aree come la sicurezza dei dati, la gestione dell'identità e…

LLM
Benchmark
15 Apr

LLM Quantizzazione: BF16 vs FP8 vs INT4

Abbiamo benchmarkato Qwen3-32B a 4 livelli di precisione (BF16, FP8, GPTQ-Int8, GPTQ-Int4) su una singola NVIDIA H100 80GB GPU. Ogni configurazione è stata valutata su 2 benchmark (~12,2K domande) che coprono conoscenza e generazione di codice, oltre a oltre 2.000 esecuzioni di inferenza per misurare il throughput. Int4 è 2,7x più veloce di BF16 pur…