Il modello più recente dell'Indice di Intelligenza AIMultiple è Claude Opus 5.5.
Benchmark LLM
Un unico Indice di Intelligenza trasparente che combina benchmark pubblici con le valutazioni agentiche, RAG e di ragionamento aziendale di AIMultiple. Come viene costruito l'indice
Classifica
I modelli con il punteggio più alto in tutti i benchmark.
# | Modello | Indice | AA-LCR | AIM-A-CODE-LLM Bench | AIM-Agentic-RAG | AIM-FinanceReasoning | AIM-HALC-Bench | AIM-RELC-Bench | AIM-Text-to-SQL | APEX-Agents-AA | ARC-AGI-1 | ARC-AGI-2 | ARC-AGI-3 | ArxivMath | AutomationBench-AA | BioMysteryBench | BrowseComp | Convex Coding Evals | CritPt | Crosby RedlineBench | DeepSWE 1.1 | EnterpriseOps-Gym-AA | Frontier-Bench | FrontierCode | FrontierMath | GDPval | GPQA Diamond | Harvey LAB-AA | HealthBench Professional | HieroglyphBench | Humanity's Last Exam | IFBench | ITBench-AA | LegalBench | LiveCodeBench | MMMU-Pro | ObviousBench | Opus Magnum Bench | ReactBench | RuneBench | SciCode | SimpleBench | Swe-Bench | Tau2-Bench Telecom | Tau3-Banking | Terminal-Bench 2.1 | Terminal-Bench 4.0 | Terminal-Bench Hard | Terminal-Bench-Science |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 5.5 Anthropic | 100 | - | - | 90 | 92 | - | - | 88 | - | - | - | - | - | - | - | - | - | 32 | - | - | - | - | - | - | 1846 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 67 | - | - | - | - | - | - | - | - |
| 2 | GPT-6 Astra OpenAI | 92 | - | - | 84 | 87 | - | - | 66 | - | - | 95 | 63 | - | 41 | - | 92 | 85 | 32 | - | 74 | - | - | 53 | 98 | 1542 | 96 | - | 70 | - | - | - | - | - | - | - | - | - | - | 7 | 56 | - | - | - | - | 90 | 58 | - | - |
| 3 | Claude Fable 5.1 Anthropic | 91 | 80 | - | 84 | 90 | - | - | 67 | - | 98 | 90 | - | - | 31 | - | - | 81 | 31 | - | 67 | - | - | 51 | 88 | 1735 | 94 | - | 62 | - | 59 | - | - | 89 | - | - | - | - | - | 6 | 63 | - | - | - | 47 | 91 | 56 | - | - |
| 4 | Qwen3.8 Flash Alibaba Cloud | 87 | 77 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 1743 | 92 | - | - | - | 38 | 81 | - | - | - | - | - | - | - | - | 47 | - | - | - | 45 | 86 | - | - | - |
| 5 | Command A+ Cohere | 87 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 30 | - | - | - | - | - | - | - | - | - | - | - | - | 74 | - | 61 | - | - | - | - | - | - | - | - | - | 81 | - | - | - | 25 | - |
| 6 | MiMo-V2.6-Pro Xiaomi | 87 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 27 | - | - | - | - | - | - | 1673 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 61 | - | - | - | - | - | - | - | - |
| 7 | Muse Spark 1.1 Meta | 86 | 81 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 53 | - | - | - | - | 1381 | 90 | - | 59 | - | 46 | - | - | 85 | - | - | 99 | - | 23 | 6 | 58 | - | - | - | 32 | 78 | - | - | - |
| 8 | Claude Fable 5 Anthropic | 85 | 77 | 69 | 82 | 90 | - | - | 66 | 59 | 99 | 89 | - | 79 | 17 | - | 87 | 84 | 29 | - | 70 | - | 34 | 54 | 90 | 1741 | 93 | 14 | 63 | 23 | 56 | 64 | - | 89 | - | 81 | 99 | 22 | 47 | 6 | 61 | 82 | - | 99 | 38 | 85 | 42 | 63 | 21 |
| 9 | Claude Opus 5 Anthropic | 83 | 79 | - | 85 | 90 | - | - | 64 | - | 98 | 90 | 30 | 91 | 50 | 79 | 91 | 82 | 29 | - | 74 | - | 44 | 53 | 73 | 1708 | 94 | - | 60 | - | 55 | - | - | 87 | - | 85 | 100 | - | - | 6 | 56 | - | - | - | 45 | 89 | 52 | - | 30 |
| 10 | GPT-6 Sol OpenAI | 79 | - | - | 82 | - | - | - | 54 | - | - | - | - | - | - | - | - | - | 31 | - | - | - | - | - | - | 1487 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 58 | - | - | - | - | - | - | - | - |
Come viene costruito l'indice
Ogni benchmark viene letto come una posizione, non come un punteggio grezzo. All'interno di un benchmark il risultato migliore si colloca a 100, il peggiore a 0, e tutti gli altri modelli cadono in un punto intermedio. L'indice è la media ponderata di quelle posizioni sui benchmark che un modello ha effettivamente eseguito: un benchmark che non ha mai eseguito non conta come zero, semplicemente non c'è. I benchmark non contano allo stesso modo, e il peso di ciascuno è indicato accanto ad esso. Un modello ha bisogno di risultati in almeno due benchmark dell'indice per essere classificato, così un singolo risultato colloca il modello sulla linea di quel benchmark senza dargli una posizione propria. Si usano le posizioni al posto dell'accuratezza grezza perché i benchmark differiscono nettamente per difficoltà e scala, e punteggi di benchmark diversi non possono condividere una media. Pesi: AIM-FinanceReasoning (10%) + AIM-Text-to-SQL (10%) + AIM-Agentic-RAG (10%) + SciCode (10%) + FrontierMath (10%) + Terminal-Bench 2.1 (10%) + CritPt (10%) + IFBench (10%) + MMMU-Pro (10%) + ARC-AGI-3 (10%).
Benchmark utilizzati
Aggiornamenti recenti
Ultime modifiche all'Indice di Intelligenza, alla copertura dei modelli e alla metodologia di benchmark di AIMultiple.
Claude Opus 5.5
Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.
GPT-6 Sol
Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.
GPT-6 Luna
Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.
MiMo-V2.6-Pro
Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.
Esplora Casi d'uso, analisi e benchmark di LLM
LLM Quota di mercato: Confronto su utilizzo e adozione
Abbiamo analizzato la quota di mercato LLM combinando dati basati sull'utilizzo e stime delle visite web per mostrare come la domanda di grandi modelli linguistici sia distribuita tra i laboratori IA e le applicazioni IA: Leggi la metodologia per vedere come abbiamo misurato e calcolato questi risultati. Gli Stati Uniti hanno dominato le visite web…
Benchmark di 40+ LLM nella finanza: Claude Fable 5 e GPT-5.6 Sol
Abbiamo valutato gli LLM su 238 domande difficili del benchmark FinanceReasoning (Tang et al.).1 Questo sottoinsieme riguarda i compiti di ragionamento finanziario più impegnativi, valutando ragionamenti quantitativi complessi e a più passaggi che coinvolgono concetti e formule finanziarie. La nostra valutazione ha utilizzato una progettazione personalizzata dei prompt e criteri di punteggio basati su accuratezza…
Confronto tra modelli di IA multimodali sul ragionamento visivo
Abbiamo sottoposto a benchmark 15 modelli di IA multimodali leader sul ragionamento visivo utilizzando 200 domande basate su elementi visivi. La valutazione era composta da due tracce: 100 domande di comprensione dei grafici per testare l'interpretazione delle visualizzazioni di dati, e 100 domande di logica visiva per valutare il riconoscimento di pattern e il ragionamento…
Grandi modelli multimodali (LMM) vs LLMs
Abbiamo valutato le prestazioni dei modelli multimodali di grandi dimensioni (LMM) in compiti di ragionamento finanziario utilizzando un dataset accuratamente selezionato. Analizzando un sottoinsieme di campioni finanziari di alta qualità, valutiamo le capacità dei modelli nell'elaborare e ragionare con dati multimodali nel dominio finanziario. La sezione metodologia fornisce approfondimenti dettagliati sul dataset e sul framework…
LLM Calcolatore VRAM per il self-hosting
Il self-hosting di un LLM significa eseguire l'inferenza su hardware controllato dall'operatore anziché tramite un'API di terze parti, il che cambia il profilo di costi, controllo dei dati e privacy. Il fatto che un modello possa girare dipende interamente dalla memoria. Il calcolatore stima la VRAM o la memoria unificata necessaria a un modello per…
IT agentico: gli agenti IA possono progettare un benchmark
Abbiamo testato 16 modelli sulla progettazione di un benchmark in text-to-SQL e tool calling. Ogni modello ha creato un benchmark per argomento, per un totale di 32 proposte. Nessuna proposta ha superato ogni criterio della rubrica. Gli agenti sono riusciti a creare ed eseguire test, ma nessuno ha dimostrato sia un test con risposta vuota…
AIM Enterprise: benchmark aziendale agentico
Le aziende usano gli LLM ogni giorno per le loro attività regolari. Per trovare gli LLM più convenienti, abbiamo progettato AIM Enterprise, un benchmark aziendale agentico, in cui abbiamo utilizzato 69 attività aziendali reali tra strategia, marketing, HR, vendite e operazioni. Due modelli giudici hanno valutato ogni file che ha superato i controlli. Nel 32,7%…
Il futuro dei grandi modelli linguistici
Scopri il futuro dei grandi modelli linguistici approfondendo approcci promettenti, come l'auto-addestramento, la verifica dei fatti e la competenza sparsa, che potrebbero affrontare i limiti degli LLM. Confronto del tasso di successo degli LLM Claude Sonnet 4.6 ha guidato il benchmark con un punteggio complessivo di 0.748, con le varianti base e thinking a pari…
I modelli linguistici di grandi dimensioni nella cybersecurity
Abbiamo valutato 7 modelli linguistici di grandi dimensioni in 9 domini di cybersecurity utilizzando SecBench, un benchmark su larga scala e multi-formato per attività di sicurezza. Abbiamo testato ciascun modello su 44.823 domande a scelta multipla (MCQ) e 3.087 domande a risposta breve (SAQ), coprendo sicurezza dei dati, gestione delle identità e degli accessi, sicurezza…
LLM Leggi di scaling: analisi di ricercatori IA
Large language models prevedono il token successivo in base ai pattern appresi dai dati testuali. Il termine leggi di scaling di LLM si riferisce a regolarità empiriche che collegano le prestazioni del model alla quantità di calcolo, ai dati di addestramento e ai parametri del model utilizzati durante l'addestramento. Per comprendere come queste relazioni influenzino…