Il modello più recente dell'Indice di Intelligenza AIMultiple è Kimi K3.
Benchmark LLM
Un unico Indice di Intelligenza trasparente che combina benchmark pubblici con le valutazioni agentiche, RAG e di ragionamento aziendale di AIMultiple. Vedi la metodologia.
Classifica
I modelli con il punteggio più alto in tutti i benchmark.
# | Modello | Indice | LegalBench | FinanceReasoning | Text-to-SQL | Agentic RAG | ARC-AGI-2 | Agentic LLM Benchmark | FrontierMath | Swe-Bench |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 Anthropic | 92 | 89 | 90 | 90 | 98 | - | 69 | - | - |
| 2 | Kimi K3 Moonshot AI | 88 | 86 | 88 | 77 | 93 | - | 73 | - | - |
| 3 | GPT-5.6 Sol OpenAI | 87 | 87 | 90 | 74 | 87 | 93 | 62 | - | - |
| 4 | Grok 4.5 X | 86 | 86 | 88 | 79 | 83 | - | 73 | - | - |
| 5 | GPT-5.5 OpenAI | 83 | 87 | - | - | - | 85 | 59 | - | - |
| 6 | GPT-5.6 Terra OpenAI | 80 | 85 | 87 | 71 | 91 | 84 | 61 | - | - |
| 7 | GPT-5.6 Sol Pro OpenAI | 80 | - | 91 | 79 | 96 | - | 54 | - | - |
| 8 | Claude Opus 4.6 Anthropic | 78 | - | 88 | 68 | 80 | 69 | 72 | - | - |
| 9 | Gemini 3 Pro Preview Google | 77 | 87 | 86 | 60 | 89 | 31 | - | - | - |
| 10 | Gemini 3.1 Pro Preview Google | 77 | 87 | 87 | 65 | 89 | 77 | 46 | 27 | - |
Pagina 1 di 7 | ||||||||||
Come viene costruito l'indice
L'Indice di Intelligenza normalizza ogni benchmark su una scala da 0 a 100 e calcola la media della posizione relativa di un modello sui benchmark su cui è stato valutato. Ogni benchmark qui sotto contribuisce a quel punteggio.
Aggiornamenti recenti
Ultime modifiche all'Indice di Intelligenza, alla copertura dei modelli e alla metodologia di benchmark di AIMultiple.
Kimi K3
Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.
GPT-5.6 Sol
Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.
GPT-5.6 Terra
Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.
GPT-5.6 Sol Pro
Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.
Esplora Casi d'uso, analisi e benchmark di LLM
Agentic IT: Can LLMs Design a Benchmark
We gave 12 large language models the job a benchmark team does: invent a benchmark, build it, run four models through it, and report the results. Each did it twice. None of the 24 attempts passed every criterion, and six of the rubric’s checks were passed by none of them. The two topics are text-to-SQL,…
Text-to-SQL: Confronto dell'accuratezza degli LLM
Abbiamo eseguito 36 grandi modelli linguistici su 759 domande del dataset BIRD-SQL, ciascun modello scrivendo SQL su un database che doveva identificare autonomamente tra 11 candidati. Ogni query analizzabile è stata eseguita sul database reale e il suo set di risultati confrontato con quello della query gold di BIRD. Le query mancanti, malformate o che…
LLM Orchestrazione: I primi 22 framework e gateway
Ottimizzare l'orchestrazione LLM è fondamentale per migliorare le prestazioni mantenendo sotto controllo l'utilizzo delle risorse. Per valutare le prestazioni pratiche di diversi approcci di orchestrazione, abbiamo eseguito benchmark su: Scopri strumenti selezionati di orchestrazione LLM, inclusi framework per sviluppatori e gateway aziendali: L'orchestrazione LLM comporta la gestione e l'integrazione di più Large Language Models (LLMs)…
HALC-Bench: LLM Allucinazione su benchmark di recupero a lungo contesto
HALC-Bench (benchmark di allucinazione di LLM su recupero a lungo contesto) misura la resistenza di un grande modello linguistico a fabbricare prove per una metrica che non esiste nel documento di destinazione, utilizzando 3 pagliai posizionati all'inizio, a metà e alla fine della finestra di contesto del modello, con 204 domande. claude-fable-5 ha risposto correttamente…
Confronto tra modelli di IA multimodali sul ragionamento visivo
Abbiamo sottoposto a benchmark 15 modelli di IA multimodali leader sul ragionamento visivo utilizzando 200 domande basate su elementi visivi. La valutazione era composta da due tracce: 100 domande di comprensione dei grafici per testare l'interpretazione delle visualizzazioni di dati, e 100 domande di logica visiva per valutare il riconoscimento di pattern e il ragionamento…
Simulazione del pubblico: gli LLM possono prevedere il comportamento umano?
Nel marketing, valutare con quanta precisione gli LLM prevedono il comportamento umano è fondamentale per valutare la loro efficacia nell'anticipare le esigenze del pubblico e riconoscere i rischi di disallineamento, comunicazione inefficace o influenza non intenzionale. La simulazione del pubblico con gli LLM consente la modellazione di pubblici virtuali, aiutando le organizzazioni ad anticipare le…
IA Gateway per OpenAI: Alternative a OpenRouter
Abbiamo testato OpenRouter, SambaNova, TogetherAI, Groq e IA/ML API su tre indicatori (latenza del primo token, latenza totale e conteggio dei token in output), con 300 test utilizzando prompt brevi (circa 18 token) e prompt lunghi (circa 203 token) per la latenza totale. Se prevedi di utilizzare uno di questi IA gateway, puoi: In questo…
LLM Guida al Fine-Tuning per le Aziende
Segui i link per le soluzioni specifiche ai tuoi problemi di output LLM. Se il tuo LLM: L'adozione diffusa dei modelli linguistici di grandi dimensioni (LLMs) ha migliorato la nostra capacità di elaborare il linguaggio umano. Tuttavia, il loro addestramento generico spesso si traduce in prestazioni subottimali per compiti specifici. Per superare questa limitazione, vengono…
LLM Calcolatore VRAM per Auto-Hosting
Auto-ospitare un LLM significa eseguire l'inferenza su hardware controllato dall'operatore anziché tramite un'API di terze parti, il che cambia il profilo di costi, controllo dei dati e privacy. Se un modello possa essere eseguito o meno dipende dalla memoria. Il calcolatore stima la VRAM o memoria unificata necessaria per eseguire un modello in locale, basandosi…
LLM Quota di mercato: Confronto su utilizzo e adozione
Abbiamo analizzato la quota di mercato LLM combinando dati basati sull'utilizzo e stime delle visite web per mostrare come la domanda di grandi modelli linguistici sia distribuita tra i laboratori IA e le applicazioni IA: Leggi la metodologia per vedere come abbiamo misurato e calcolato questi risultati. Gli Stati Uniti hanno dominato le visite web…