Il modello più recente dell'Indice di Intelligenza AIMultiple è Kimi K3.
Benchmark LLM
Un unico Indice di Intelligenza trasparente che combina benchmark pubblici con le valutazioni agentiche, RAG e di ragionamento aziendale di AIMultiple. Vedi la metodologia.
Classifica
I modelli con il punteggio più alto in tutti i benchmark.
# | Modello | Indice | LegalBench | FinanceReasoning | Text-to-SQL | Agentic RAG | ARC-AGI-2 | Agentic LLM Benchmark | FrontierMath | Swe-Bench |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 Anthropic | 92 | 89 | 90 | 90 | 98 | - | 69 | - | - |
| 2 | Kimi K3 Moonshot AI | 88 | 86 | 88 | 77 | 93 | - | 73 | - | - |
| 3 | GPT-5.6 Sol OpenAI | 87 | 87 | 90 | 74 | 87 | 93 | 62 | - | - |
| 4 | Grok 4.5 X | 86 | 86 | 88 | 79 | 83 | - | 73 | - | - |
| 5 | GPT-5.5 OpenAI | 83 | 87 | - | - | - | 85 | 59 | - | - |
| 6 | GPT-5.6 Terra OpenAI | 80 | 85 | 87 | 71 | 91 | 84 | 61 | - | - |
| 7 | GPT-5.6 Sol Pro OpenAI | 80 | - | 91 | 79 | 96 | - | 54 | - | - |
| 8 | Claude Opus 4.6 Anthropic | 78 | - | 88 | 68 | 80 | 69 | 72 | - | - |
| 9 | Gemini 3 Pro Preview Google | 77 | 87 | 86 | 60 | 89 | 31 | - | - | - |
| 10 | Gemini 3.1 Pro Preview Google | 77 | 87 | 87 | 65 | 89 | 77 | 46 | 27 | - |
Pagina 1 di 7 | ||||||||||
Come viene costruito l'indice
L'Indice di Intelligenza normalizza ogni benchmark su una scala da 0 a 100 e calcola la media della posizione relativa di un modello sui benchmark su cui è stato valutato. Ogni benchmark qui sotto contribuisce a quel punteggio.
Aggiornamenti recenti
Ultime modifiche all'Indice di Intelligenza, alla copertura dei modelli e alla metodologia di benchmark di AIMultiple.
Kimi K3
Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.
GPT-5.6 Sol
Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.
GPT-5.6 Terra
Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.
GPT-5.6 Sol Pro
Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.
Esplora Casi d'uso, analisi e benchmark di LLM
LLM Automazione: I 7 Migliori Strumenti e 8 Casi di Studio
LLM automation si riferisce al passaggio a strumenti di automazione intelligente che sfruttano i LLM, inclusi agenti IA, LLM perfezionati e modelli RAG per automatizzare e coordinare compiti. Scopri cos'è l'automazione LLM, le sue principali applicazioni reali e i principali strumenti: I modelli linguistici di grandi dimensioni nell'automazione sono un approccio sistematico che combina l'elaborazione…
Benchmark di 40+ LLM nella finanza: Claude Fable 5 & GPT-5.6 Sol
Abbiamo valutato 40+ LLM nel settore finanziario su 238 domande difficili del benchmark FinanceReasoning per identificare quali modelli eccellano in compiti complessi di ragionamento finanziario come analisi di bilancio, previsioni e calcoli di rapporti. Abbiamo valutato LLM su 238 domande difficili del benchmark FinanceReasoning (Tang et al.).1 Questo sottoinsieme punta ai compiti più impegnativi di…
Agentic IT: Can LLMs Design a Benchmark
We gave 12 large language models the job a benchmark team does: invent a benchmark, build it, run four models through it, and report the results. Each did it twice. None of the 24 attempts passed every criterion, and six of the rubric’s checks were passed by none of them. The two topics are text-to-SQL,…
LLM Strumenti di Osservabilità: Weights & Biases, Langsmith
LLM le applicazioni si sono ampliate dalle chat a turno singolo a agenti multi-step che utilizzano strumenti, interrogano database e si coordinano con altri modelli, rendendo il loro comportamento più difficile da interpretare. LLM l'osservabilità fornisce visibilità continua su questi flussi di lavoro complessi, aiutando le organizzazioni a monitorare la qualità, rilevare guasti, risolvere problemi…
Text-to-SQL: Confronto dell'accuratezza degli LLM
Abbiamo eseguito 36 grandi modelli linguistici su 759 domande del dataset BIRD-SQL, ciascun modello scrivendo SQL su un database che doveva identificare autonomamente tra 11 candidati. Ogni query analizzabile è stata eseguita sul database reale e il suo set di risultati confrontato con quello della query gold di BIRD. Le query mancanti, malformate o che…
LLM Benchmark di latenza per casi d'uso
Abbiamo sottoposto a benchmark 11 modelli linguistici di grandi dimensioni di punta tramite modelli linguistici di grandi dimensioni con un totale di 1.320 richieste, suddividendo tra modelli reasoning e non-reasoning, e abbiamo misurato la latenza del primo token, la latenza per token e il tempo di risposta complessivo. Puoi trovare i dettagli su come abbiamo…
LLM Orchestrazione: I primi 22 framework e gateway
Ottimizzare l'orchestrazione LLM è fondamentale per migliorare le prestazioni mantenendo sotto controllo l'utilizzo delle risorse. Per valutare le prestazioni pratiche di diversi approcci di orchestrazione, abbiamo eseguito benchmark su: Scopri strumenti selezionati di orchestrazione LLM, inclusi framework per sviluppatori e gateway aziendali: L'orchestrazione LLM comporta la gestione e l'integrazione di più Large Language Models (LLMs)…
HALC-Bench: LLM Allucinazione su benchmark di recupero a lungo contesto
HALC-Bench (benchmark di allucinazione di LLM su recupero a lungo contesto) misura la resistenza di un grande modello linguistico a fabbricare prove per una metrica che non esiste nel documento di destinazione, utilizzando 3 pagliai posizionati all'inizio, a metà e alla fine della finestra di contesto del modello, con 204 domande. claude-fable-5 ha risposto correttamente…
Confronto tra modelli di IA multimodali sul ragionamento visivo
Abbiamo sottoposto a benchmark 15 modelli di IA multimodali leader sul ragionamento visivo utilizzando 200 domande basate su elementi visivi. La valutazione era composta da due tracce: 100 domande di comprensione dei grafici per testare l'interpretazione delle visualizzazioni di dati, e 100 domande di logica visiva per valutare il riconoscimento di pattern e il ragionamento…
Simulazione del pubblico: gli LLM possono prevedere il comportamento umano?
Nel marketing, valutare con quanta precisione gli LLM prevedono il comportamento umano è fondamentale per valutare la loro efficacia nell'anticipare le esigenze del pubblico e riconoscere i rischi di disallineamento, comunicazione inefficace o influenza non intenzionale. La simulazione del pubblico con gli LLM consente la modellazione di pubblici virtuali, aiutando le organizzazioni ad anticipare le…