Servizi
Contattaci

Benchmark LLM

Un unico Indice di Intelligenza trasparente che combina benchmark pubblici con le valutazioni agentiche, RAG e di ragionamento aziendale di AIMultiple. Vedi la metodologia.

MODELLO MIGLIORE
Claude Fable 5
Indice 92
Miglior rapporto qualità-prezzo
MiniMax M3
$0.42 / 1M
Più veloce
GPT OSS 120B
0.23s TTFT
Copertura
64 modelli
8 benchmark · 336 valutazioni
Indice di Intelligenza AIMultiple

Classifica

I modelli con il punteggio più alto in tutti i benchmark.

Filter & Sort
#
Modello
Indice
LegalBench
FinanceReasoning
Text-to-SQL
Agentic RAG
ARC-AGI-2
Agentic LLM Benchmark
FrontierMath
Swe-Bench
1
Claude Fable 5
Claude Fable 5
Anthropic
92
89909098-69--
2
Kimi K3
Kimi K3
Moonshot AI
88
86887793-73--
3
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
87
879074879362--
4
Grok 4.5
Grok 4.5
X
86
86887983-73--
5
GPT-5.5
GPT-5.5
OpenAI
83
87---8559--
6
GPT-5.6 Terra
GPT-5.6 Terra
OpenAI
80
858771918461--
7
GPT-5.6 Sol Pro
GPT-5.6 Sol Pro
OpenAI
80
-917996-54--
8
Claude Opus 4.6
Claude Opus 4.6
Anthropic
78
-8868806972--
9
Gemini 3 Pro Preview
Gemini 3 Pro Preview
Google
77
8786608931---
10
Gemini 3.1 Pro Preview
Gemini 3.1 Pro Preview
Google
77
87876589774627-
Pagina 1 di 7

Costo$20.00
Latenza4.02s
Contesto1M
TTFT4.02s
LegalBench
89
FinanceReasoning
90
Text-to-SQL
90
Agentic RAG
98
Agentic LLM Benchmark
69

Costo$6.00
Latenza2.93s
Contesto1M
TTFT2.93s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
77
Agentic RAG
93
Agentic LLM Benchmark
73

Costo$11.25
Latenza4.31s
Contesto1M
TTFT4.31s
LegalBench
87
FinanceReasoning
90
Text-to-SQL
74
Agentic RAG
87
ARC-AGI-2
93
Agentic LLM Benchmark
62

Costo$3.00
Latenza7.25s
Contesto500k
TTFT7.25s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
79
Agentic RAG
83
Agentic LLM Benchmark
73

Costo$11.25
Latenza0.70s
Contesto272k
TTFT0.70s
LegalBench
87
ARC-AGI-2
85
Agentic LLM Benchmark
59

Costo$4.50
Latenza1.62s
Contesto1M
TTFT1.62s
LegalBench
85
FinanceReasoning
87
Text-to-SQL
71
Agentic RAG
91
ARC-AGI-2
84
Agentic LLM Benchmark
61

Costo$11.25
Latenza11.11s
Contesto1M
TTFT11.11s
FinanceReasoning
91
Text-to-SQL
79
Agentic RAG
96
Agentic LLM Benchmark
54

Costo$10.00
Latenza1.71s
Contesto1M
TTFT1.71s
FinanceReasoning
88
Text-to-SQL
68
Agentic RAG
80
ARC-AGI-2
69
Agentic LLM Benchmark
72

Costo$4.50
Latenza-
Contesto1M
TTFT
LegalBench
87
FinanceReasoning
86
Text-to-SQL
60
Agentic RAG
89
ARC-AGI-2
31

Costo$4.50
Latenza22.02s
Contesto1M
TTFT22.02s
LegalBench
87
FinanceReasoning
87
Text-to-SQL
65
Agentic RAG
89
ARC-AGI-2
77
Agentic LLM Benchmark
46
FrontierMath
27
Pagina 1 di 7
Evoluzione nel tempo
Indice di Intelligenza per data di rilascio del modello
Costo vs prestazioni
Costo combinato rispetto all'Indice di Intelligenza
Modello × Benchmark
Modelli migliori sui benchmark selezionati
Metodologia

Come viene costruito l'indice

L'Indice di Intelligenza normalizza ogni benchmark su una scala da 0 a 100 e calcola la media della posizione relativa di un modello sui benchmark su cui è stato valutato. Ogni benchmark qui sotto contribuisce a quel punteggio.

AIMultiple
FinanceReasoningRagionamento finanziario complesso a più passaggi su 238 domande difficili di FinanceReasoning.
AIMultiple
Text-to-SQLAccuratezza nella generazione di query SQL a partire dal linguaggio naturale su oltre 35 LLM.
AIMultiple
Agentic RAGRouting multi-database e generazione di query SQL su 5 database (BIRD-SQL, 500 domande).
AIMultiple
AI MemoryRecupero di dati numerici in contesti lunghi da diverse posizioni del documento (100 elementi, 14 trascrizioni).
AIMultiple
AI HallucinationResistenza all'invenzione di metriche non menzionate in documenti a contesto lungo (204 trappole, 14 trascrizioni).
Pubblico
Humanity's Last ExamRagionamento a libro chiuso di livello esperto su oltre 100 materie accademiche (2,5k domande).
Pubblico
SciCodeCoding scientifico a livello di ricerca in fisica, matematica, biologia e chimica (338 sottoproblemi)
Pubblico
LegalBenchRagionamento giuridico in crowdsourcing su 162 compiti creati da professionisti del diritto.
Pubblico
FrontierMathProblemi di matematica di ricerca inediti, scritti da esperti (livelli 1–4).
Pubblico
ARC-AGI-2Nuovi rompicapo di ragionamento visivo che testano la generalizzazione, non la memorizzazione.
Pubblico
Swe-BenchIssue GitHub reali risolte end-to-end (set completo di 2.294 istanze).
Pubblico
LiveCodeBenchProblemi di programmazione competitiva privi di contaminazione e aggiornati continuamente.
AIMultiple
Agentic LLM BenchmarkCoding agentico su 10 attività di sviluppo software tramite strumento CLI (~3.500 passaggi di validazione).
Aggiornamenti recenti

Aggiornamenti recenti

Ultime modifiche all'Indice di Intelligenza, alla copertura dei modelli e alla metodologia di benchmark di AIMultiple.

Moonshot AI

Kimi K3

Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.

OpenAI

GPT-5.6 Sol

Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.

OpenAI

GPT-5.6 Terra

Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.

OpenAI

GPT-5.6 Sol Pro

Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.

Esplora Casi d'uso, analisi e benchmark di LLM

Confronto tra 9 Large Language Models in Sanità

LLM
Confronto delle Funzionalità
17 Ago

Abbiamo confrontato 9 LLM utilizzando il dataset MedQA, un benchmark di esami clinici di livello universitario derivato dalle domande USMLE. Ogni modello ha risposto agli stessi scenari clinici a scelta multipla utilizzando un prompt standardizzato, consentendo un confronto diretto dell'accuratezza. Abbiamo inoltre registrato la latenza per domanda dividendo il tempo di esecuzione totale per il…

Per saperne di più
LLM
Benchmark
16 Ago

Densità di intelligenza di 71 LLMs per models più intelligenti e più densi

Abbiamo monitorato 71 LLMs rilasciati tra febbraio 2023 e maggio 2026 e raccolto 10 benchmark pubblici per misurare la densità di intelligenza. Abbiamo diviso il punteggio di capacità per la risorsa consumata dal model (parametri attivi, calcolo di addestramento e prezzo di inference). Per calcolare la densità di intelligenza, abbiamo eseguito i seguenti passaggi: Vedi…

LLM
Approfondimento
14 Ago

50+ Casi d'uso di ChatGPT con esempi reali

ChatGPT ha raggiunto circa 1 miliardo di utenti attivi settimanali all'inizio del 2026, circa il 10% della popolazione mondiale.1 OpenAI ha superato i $20 miliardi di fatturato annuo per il 2025, come confermato dalla CFO Sarah Friar.2 L'indice economico di Anthropic distingue due modalità d'uso: il potenziamento, in cui un essere umano interagisce con l'IA,…

LLM
Benchmark
14 Ago

Benchmark di 40+ LLM nella finanza: Claude Fable 5 & GPT-5.6 Sol

Abbiamo valutato 40+ LLM nel settore finanziario su 238 domande difficili del benchmark FinanceReasoning per identificare quali modelli eccellano in compiti complessi di ragionamento finanziario come analisi di bilancio, previsioni e calcoli di rapporti. Abbiamo valutato LLM su 238 domande difficili del benchmark FinanceReasoning (Tang et al.).1 Questo sottoinsieme punta ai compiti più impegnativi di…

LLM
Benchmark
14 Ago

AIM Enterprise: Benchmark aziendale agentico

Le aziende usano gli LLM ogni giorno per le loro attività regolari. Per trovare gli LLM più efficienti in termini di costi, abbiamo progettato AIM Enterprise, un benchmark aziendale agentico, dove abbiamo usato 69 attività aziendali in diverse categorie. Ogni modello ha consegnato un file per attività. I punteggi sono relativi: i giudici classificano ogni…

LLM
Approfondimento
13 Ago

LLM Leggi di scaling: analisi di ricercatori IA

Large language models prevedono il token successivo in base ai pattern appresi dai dati testuali. Il termine leggi di scaling di LLM si riferisce a regolarità empiriche che collegano le prestazioni del model alla quantità di calcolo, ai dati di addestramento e ai parametri del model utilizzati durante l'addestramento. Per comprendere come queste relazioni influenzino…

LLM
Approfondimento
13 Ago

LLM Strumenti di osservabilità: Weights & Biases, Langsmith

Le applicazioni LLM si sono espanse da chat a turno singolo ad agenti multi-step che usano strumenti, interrogano database e si coordinano con altri model, rendendo il loro comportamento più difficile da interpretare. L'osservabilità LLM fornisce visibilità continua su questi flussi di lavoro complessi, aiutando le organizzazioni a monitorare la qualità, rilevare i guasti, risolvere…

LLM
Approfondimento
13 Ago

Grandi modelli multimodali (LMM) vs LLMs

Abbiamo valutato le prestazioni dei grandi modelli multimodali (LMM) in compiti di ragionamento finanziario utilizzando un dataset accuratamente selezionato. Analizzando un sottoinsieme di campioni finanziari di alta qualità, valutiamo le capacità dei modelli nell'elaborare e ragionare con dati multimodali nel dominio finanziario. La sezione sulla metodologia fornisce approfondimenti dettagliati sul dataset e sul framework di…

LLM
Approfondimento
12 Ago

ChatGPT per il Servizio Clienti: I 10 Migliori Casi d'Uso

ChatGPT è passato dalla novità all'infrastruttura nel servizio clienti. Le aziende lo stanno utilizzando per ridurre i tempi di risposta, gestire volumi che i loro team non riescono ad assorbire e ridurre il costo delle interazioni di routine. Ma i risultati variano notevolmente a seconda di come viene implementato. OpenAI ha lanciato GPT-5.6, un modello…

LLM
Benchmark
12 Ago

LLM Benchmark di latenza per casi d'uso

Abbiamo sottoposto a benchmark 11 modelli linguistici di grandi dimensioni di punta tramite modelli linguistici di grandi dimensioni con un totale di 1.320 richieste, suddividendo tra modelli reasoning e non-reasoning, e abbiamo misurato la latenza del primo token, la latenza per token e il tempo di risposta complessivo. Puoi trovare i dettagli su come abbiamo…

LLM
Confronto delle Funzionalità
12 Ago

Top LLMOps Tools & Confrontali con MLOPs

Le piattaforme LLMOps gestiscono l'aspetto operativo dell'esecuzione di grandi modelli linguistici: distribuzione, monitoraggio, valutazione e gestione dei costi. Abbiamo esaminato i migliori strumenti LLMOps, le loro funzionalità principali, i modelli di prezzo e le differenze reciproche per aiutare a identificare la soluzione migliore per vari casi d'uso. Di seguito è fornito un riepilogo di ciascuna…