Servizi
Contattaci

Benchmark LLM

Un unico Indice di Intelligenza trasparente che combina benchmark pubblici con le valutazioni agentiche, RAG e di ragionamento aziendale di AIMultiple.

Ultimo aggiornamento Giu 2026
MODELLO MIGLIORE
Claude Fable 5
Indice 92
Miglior rapporto qualità-prezzo
MiniMax M3
$0.42 / 1M
Più veloce
GPT OSS 120B
0.19s TTFT
Copertura
64 modelli
8 benchmark · 336 valutazioni
Indice di Intelligenza AIMultiple

Classifica

I modelli con il punteggio più alto in tutti i benchmark.

Filter & Sort
#
Modello
Indice
LegalBench
FinanceReasoning
Text-to-SQL
Agentic RAG
ARC-AGI-2
Agentic LLM Benchmark
FrontierMath
Swe-Bench
1
Claude Fable 5
Claude Fable 5
Anthropic
92
89909098-69--
2
Kimi K3
Kimi K3
Moonshot AI
88
86887793-73--
3
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
87
879074879362--
4
Grok 4.5
Grok 4.5
X
86
86887983-73--
5
GPT-5.5
GPT-5.5
OpenAI
83
87---8559--
6
GPT-5.6 Terra
GPT-5.6 Terra
OpenAI
80
858771918461--
7
GPT-5.6 Sol Pro
GPT-5.6 Sol Pro
OpenAI
80
-917996-54--
8
Claude Opus 4.6
Claude Opus 4.6
Anthropic
78
-8868806972--
9
Gemini 3 Pro Preview
Gemini 3 Pro Preview
Google
77
8786608931---
10
Gemini 3.1 Pro Preview
Gemini 3.1 Pro Preview
Google
77
87876589774627-
Pagina 1 di 7

Costo$20.00
Latenza3.98s
Contesto1M
TTFT3.98s
LegalBench
89
FinanceReasoning
90
Text-to-SQL
90
Agentic RAG
98
Agentic LLM Benchmark
69

Costo$6.00
Latenza252.11s
Contesto1M
TTFT252.11s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
77
Agentic RAG
93
Agentic LLM Benchmark
73

Costo$11.25
Latenza2.47s
Contesto1M
TTFT2.47s
LegalBench
87
FinanceReasoning
90
Text-to-SQL
74
Agentic RAG
87
ARC-AGI-2
93
Agentic LLM Benchmark
62

Costo$3.00
Latenza10.26s
Contesto500k
TTFT10.26s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
79
Agentic RAG
83
Agentic LLM Benchmark
73

Costo$11.25
Latenza1.03s
Contesto272k
TTFT1.03s
LegalBench
87
ARC-AGI-2
85
Agentic LLM Benchmark
59

Costo$5.63
Latenza1.92s
Contesto1M
TTFT1.92s
LegalBench
85
FinanceReasoning
87
Text-to-SQL
71
Agentic RAG
91
ARC-AGI-2
84
Agentic LLM Benchmark
61

Costo$11.25
Latenza11.46s
Contesto1M
TTFT11.46s
FinanceReasoning
91
Text-to-SQL
79
Agentic RAG
96
Agentic LLM Benchmark
54

Costo$10.00
Latenza1.75s
Contesto1M
TTFT1.75s
FinanceReasoning
88
Text-to-SQL
68
Agentic RAG
80
ARC-AGI-2
69
Agentic LLM Benchmark
72

Costo$4.50
Latenza-
Contesto1M
TTFT
LegalBench
87
FinanceReasoning
86
Text-to-SQL
60
Agentic RAG
89
ARC-AGI-2
31

Costo$4.50
Latenza33.83s
Contesto1M
TTFT33.83s
LegalBench
87
FinanceReasoning
87
Text-to-SQL
65
Agentic RAG
89
ARC-AGI-2
77
Agentic LLM Benchmark
46
FrontierMath
27
Pagina 1 di 7

Grafici

Modelli secondo "Migliori prestazioni"

Evoluzione nel tempo
Indice di Intelligenza per data di rilascio del modello
Costo vs prestazioni
Costo combinato rispetto all'Indice di Intelligenza
Modello × Benchmark
Modelli migliori sui benchmark selezionati
Metodologia

Come viene costruito l'indice

L'Indice di Intelligenza normalizza ogni benchmark su una scala da 0 a 100 e calcola la media della posizione relativa di un modello sui benchmark su cui è stato valutato. Ogni benchmark qui sotto contribuisce a quel punteggio.

Aggiornamenti recenti

Aggiornamenti recenti

Ultime modifiche all'Indice di Intelligenza, alla copertura dei modelli e alla metodologia di benchmark di AIMultiple.

Moonshot AI

Kimi K3

Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.

OpenAI

GPT-5.6 Sol

Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.

OpenAI

GPT-5.6 Terra

Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.

OpenAI

GPT-5.6 Sol Pro

Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.

Esplora Casi d'uso, analisi e benchmark di LLM

Oltre 50 casi d'uso di ChatGPT con esempi reali

LLM
Approfondimento
6 Lug

ChatGPT ha raggiunto circa 1 miliardo di utenti attivi settimanali all'inizio del 2026, circa il 10% della popolazione mondiale.1 OpenAI ha superato i 20 miliardi di dollari di fatturato annuo nel 2025, come confermato dal CFO Sarah Friar.2 L'Anthropic Economic Index distingue due modalità d'uso: l'aumento, in cui un essere umano interagisce con l'IA, e…

Per saperne di più
LLM
Benchmark
2 Lug

Confronta i Modelli IA Multimodali sul Ragionamento Visivo

Abbiamo sottoposto a benchmark 15 modelli IA multimodali leader sul ragionamento visivo utilizzando 200 domande basate su elementi visivi. La valutazione consisteva in due tracce: 100 domande di comprensione di grafici per testare l'interpretazione della visualizzazione dei dati, e 100 domande di logica visiva per valutare il riconoscimento di pattern e il ragionamento spaziale. Ogni…

LLM
Approfondimento
2 Lug

LLM Quota di mercato: Confronto su utilizzo e adozione

Abbiamo analizzato la quota di mercato LLM combinando dati basati sull'utilizzo e stime delle visite web per mostrare come la domanda di grandi modelli linguistici sia distribuita tra i laboratori IA e le applicazioni IA: Leggi la metodologia per vedere come abbiamo misurato e calcolato questi risultati. Gli Stati Uniti hanno dominato le visite web…

LLM
Confronto delle Funzionalità
2 Lug

Top LLMOps Tools & Confrontali con MLOPs

Le piattaforme LLMOps gestiscono l'aspetto operativo dell'esecuzione di grandi modelli linguistici: distribuzione, monitoraggio, valutazione e gestione dei costi. Abbiamo esaminato i migliori strumenti LLMOps, le loro funzionalità principali, i modelli di prezzo e le differenze reciproche per aiutare a identificare la soluzione migliore per vari casi d'uso. Di seguito è fornito un riepilogo di ciascuna…

LLM
Confronto delle Funzionalità
29 Giu

Confronto tra 9 Large Language Models in ambito sanitario

Abbiamo sottoposto a benchmark 9 LLM utilizzando il dataset MedQA, un benchmark di esami clinici a livello universitario derivato dalle domande USMLE. Ogni modello ha risposto agli stessi scenari clinici a scelta multipla utilizzando un prompt standardizzato, consentendo un confronto diretto dell'accuratezza. Abbiamo anche registrato la latenza per domanda dividendo il tempo di esecuzione totale…

LLM
Approfondimento
26 Giu

LLM Parameters: GPT-5 High, Medium, Low and Minimal

Alcuni LLM, come la famiglia GPT-5 di OpenAI, sono disponibili in diverse versioni (ad esempio, GPT-5, GPT-5-mini e GPT-5-nano) e con varie impostazioni dei parametri, tra cui alto, medio, basso e minimo. Di seguito, esploriamo le differenze tra queste versioni del modello raccogliendo le loro prestazioni sui benchmark e i costi per eseguire i benchmark.…

LLM
Valutazione in Mondo Aperto
25 Giu

LLM Orchestrazione: I primi 22 framework e gateway

Ottimizzare l'orchestrazione LLM è fondamentale per migliorare le prestazioni mantenendo sotto controllo l'utilizzo delle risorse. Per valutare le prestazioni pratiche di diversi approcci di orchestrazione, abbiamo eseguito benchmark su: Scopri strumenti selezionati di orchestrazione LLM, inclusi framework per sviluppatori e gateway aziendali: L'orchestrazione LLM comporta la gestione e l'integrazione di più Large Language Models (LLMs)…

LLM
Approfondimento
25 Giu

Il futuro dei grandi modelli linguistici

Vedi il futuro dei grandi modelli linguistici approfondendo approcci promettenti, come l'auto-addestramento, la verifica dei fatti e l'expertise sparsa che potrebbero affrontare le limitazioni degli LLM. Confronto dei tassi di successo degli LLM Claude Sonnet 4.6 ha guidato il benchmark con un punteggio complessivo di 0.748, con le varianti base e thinking a pari merito…

LLM
Approfondimento
22 Giu

Modelli Multimodali di Grandi Dimensioni (LMM) vs LLM

Abbiamo valutato le prestazioni dei modelli multimodali di grandi dimensioni (LMM) in compiti di ragionamento finanziario utilizzando un dataset accuratamente selezionato. Analizzando un sottoinsieme di campioni finanziari di alta qualità, valutiamo le capacità dei modelli nell'elaborare e ragionare con dati multimodali nel dominio finanziario. La sezione sulla metodologia fornisce approfondimenti dettagliati sul dataset e sul…

LLM
Approfondimento
22 Giu

10+ Esempi di grandi modelli linguistici

Abbiamo raccolto benchmark open-source per confrontare i principali modelli linguistici di grandi dimensioni proprietari e open-source. Scegli il tuo caso d'uso per trovare il modello giusto. Puoi valutare i grandi modelli linguistici esaminando le loro prestazioni nei benchmark e la latenza reale (disponibile cliccando sul nome di ciascun modello nella tabella) e rivedendo i prezzi…

LLM
Confronto delle Funzionalità
22 Giu

Cloud LLM vs Local LLMs: Esempi & Vantaggi

Cloud LLMs, potenziati da modelli avanzati come GPT-5.5 e Claude Opus 4.7, offrono scalabilità e accessibilità. Al contrario, Local LLMs, guidati da modelli open source come Llama 4, DeepSeek V4 e Qwen3.6-Plus, assicurano maggiore privacy e personalizzazione. Esplora cosa sono i cloud LLMs, i loro punti di forza e debolezze, i casi di studio più…