Il modello più recente dell'Indice di Intelligenza AIMultiple è Claude Opus 5.5.
Benchmark LLM
Un unico Indice di Intelligenza trasparente che combina benchmark pubblici con le valutazioni agentiche, RAG e di ragionamento aziendale di AIMultiple. Come viene costruito l'indice
Classifica
I modelli con il punteggio più alto in tutti i benchmark.
# | Modello | Indice | AA-LCR | AIM-A-CODE-LLM Bench | AIM-Agentic-RAG | AIM-FinanceReasoning | AIM-HALC-Bench | AIM-RELC-Bench | AIM-Text-to-SQL | APEX-Agents-AA | ARC-AGI-1 | ARC-AGI-2 | ARC-AGI-3 | ArxivMath | AutomationBench-AA | BioMysteryBench | BrowseComp | Convex Coding Evals | CritPt | Crosby RedlineBench | DeepSWE 1.1 | EnterpriseOps-Gym-AA | Frontier-Bench | FrontierCode | FrontierMath | GDPval | GPQA Diamond | Harvey LAB-AA | HealthBench Professional | HieroglyphBench | Humanity's Last Exam | IFBench | ITBench-AA | LegalBench | LiveCodeBench | MMMU-Pro | ObviousBench | Opus Magnum Bench | ReactBench | RuneBench | SciCode | SimpleBench | Swe-Bench | Tau2-Bench Telecom | Tau3-Banking | Terminal-Bench 2.1 | Terminal-Bench 4.0 | Terminal-Bench Hard | Terminal-Bench-Science |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 5.5 Anthropic | 100 | - | - | 90 | 92 | - | - | 88 | - | - | - | - | - | - | - | - | - | 32 | - | - | - | - | - | - | 1846 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 67 | - | - | - | - | - | - | - | - |
| 2 | GPT-6 Astra OpenAI | 92 | - | - | 84 | 87 | - | - | 66 | - | - | 95 | 63 | - | 41 | - | 92 | 85 | 32 | - | 74 | - | - | 53 | 98 | 1542 | 96 | - | 70 | - | - | - | - | - | - | - | - | - | - | 7 | 56 | - | - | - | - | 90 | 58 | - | - |
| 3 | Claude Fable 5.1 Anthropic | 91 | 80 | - | 84 | 90 | - | - | 67 | - | 98 | 90 | - | - | 31 | - | - | 81 | 31 | - | 67 | - | - | 51 | 88 | 1735 | 94 | - | 62 | - | 59 | - | - | 89 | - | - | - | - | - | 6 | 63 | - | - | - | 47 | 91 | 56 | - | - |
| 4 | Qwen3.8 Flash Alibaba Cloud | 87 | 77 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 1743 | 92 | - | - | - | 38 | 81 | - | - | - | - | - | - | - | - | 47 | - | - | - | 45 | 86 | - | - | - |
| 5 | Command A+ Cohere | 87 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 30 | - | - | - | - | - | - | - | - | - | - | - | - | 74 | - | 61 | - | - | - | - | - | - | - | - | - | 81 | - | - | - | 25 | - |
| 6 | MiMo-V2.6-Pro Xiaomi | 87 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 27 | - | - | - | - | - | - | 1673 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 61 | - | - | - | - | - | - | - | - |
| 7 | Muse Spark 1.1 Meta | 86 | 81 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 53 | - | - | - | - | 1381 | 90 | - | 59 | - | 46 | - | - | 85 | - | - | 99 | - | 23 | 6 | 58 | - | - | - | 32 | 78 | - | - | - |
| 8 | Claude Fable 5 Anthropic | 85 | 77 | 69 | 82 | 90 | - | - | 66 | 59 | 99 | 89 | - | 79 | 17 | - | 87 | 84 | 29 | - | 70 | - | 34 | 54 | 90 | 1741 | 93 | 14 | 63 | 23 | 56 | 64 | - | 89 | - | 81 | 99 | 22 | 47 | 6 | 61 | 82 | - | 99 | 38 | 85 | 42 | 63 | 21 |
| 9 | Claude Opus 5 Anthropic | 83 | 79 | - | 85 | 90 | - | - | 64 | - | 98 | 90 | 30 | 91 | 50 | 79 | 91 | 82 | 29 | - | 74 | - | 44 | 53 | 73 | 1708 | 94 | - | 60 | - | 55 | - | - | 87 | - | 85 | 100 | - | - | 6 | 56 | - | - | - | 45 | 89 | 52 | - | 30 |
| 10 | GPT-6 Sol OpenAI | 79 | - | - | 82 | - | - | - | 54 | - | - | - | - | - | - | - | - | - | 31 | - | - | - | - | - | - | 1487 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 58 | - | - | - | - | - | - | - | - |
Come viene costruito l'indice
Ogni benchmark viene letto come una posizione, non come un punteggio grezzo. All'interno di un benchmark il risultato migliore si colloca a 100, il peggiore a 0, e tutti gli altri modelli cadono in un punto intermedio. L'indice è la media ponderata di quelle posizioni sui benchmark che un modello ha effettivamente eseguito: un benchmark che non ha mai eseguito non conta come zero, semplicemente non c'è. I benchmark non contano allo stesso modo, e il peso di ciascuno è indicato accanto ad esso. Un modello ha bisogno di risultati in almeno due benchmark dell'indice per essere classificato, così un singolo risultato colloca il modello sulla linea di quel benchmark senza dargli una posizione propria. Si usano le posizioni al posto dell'accuratezza grezza perché i benchmark differiscono nettamente per difficoltà e scala, e punteggi di benchmark diversi non possono condividere una media. Pesi: AIM-FinanceReasoning (10%) + AIM-Text-to-SQL (10%) + AIM-Agentic-RAG (10%) + SciCode (10%) + FrontierMath (10%) + Terminal-Bench 2.1 (10%) + CritPt (10%) + IFBench (10%) + MMMU-Pro (10%) + ARC-AGI-3 (10%).
Benchmark utilizzati
Aggiornamenti recenti
Ultime modifiche all'Indice di Intelligenza, alla copertura dei modelli e alla metodologia di benchmark di AIMultiple.
Claude Opus 5.5
Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.
GPT-6 Sol
Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.
GPT-6 Luna
Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.
MiMo-V2.6-Pro
Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.
Esplora Casi d'uso, analisi e benchmark di LLM
I migliori strumenti LLMOps e confronto con MLOps
Le piattaforme LLMOps gestiscono il lato operativo dell'esecuzione dei modelli linguistici di grandi dimensioni: distribuzione, monitoraggio, valutazione e gestione dei costi. Abbiamo esaminato i migliori strumenti LLMOps, le loro funzionalità principali, i modelli di prezzo e le differenze tra loro per aiutare a identificare la soluzione più adatta a diversi casi d'uso. Di seguito viene…
50+ Casi d'uso di ChatGPT con esempi reali
ChatGPT ha raggiunto circa 1 miliardo di utenti attivi settimanali all'inizio del 2026, circa il 10% della popolazione mondiale.1 OpenAI ha superato i $20 miliardi di fatturato annuo per il 2025, come confermato dalla CFO Sarah Friar.2 L'indice economico di Anthropic distingue due modalità d'uso: il potenziamento, in cui un essere umano interagisce con l'IA,…
ChatGPT per il Servizio Clienti: I 10 Migliori Casi d'Uso
ChatGPT è passato dall'essere una novità a un'infrastruttura nel servizio clienti. Le aziende lo utilizzano per ridurre i tempi di risposta, gestire il volume che i loro team non riescono ad assorbire e ridurre il costo delle interazioni di routine. Ma i risultati variano notevolmente a seconda di come viene implementato. OpenAI ha lanciato GPT-5.6,…
Densità di intelligenza di 71 LLMs per models più intelligenti e più densi
Abbiamo monitorato 71 LLMs rilasciati tra febbraio 2023 e maggio 2026 e raccolto 10 benchmark pubblici per misurare la densità di intelligenza. Abbiamo diviso il punteggio di capacità per la risorsa consumata dal model (parametri attivi, calcolo di addestramento e prezzo di inference). Per calcolare la densità di intelligenza, abbiamo eseguito i seguenti passaggi: Vedi…
LLM Benchmark di latenza per casi d'uso
Abbiamo sottoposto a benchmark 11 modelli linguistici di grandi dimensioni di punta tramite modelli linguistici di grandi dimensioni con un totale di 1.320 richieste, suddividendo tra modelli reasoning e non-reasoning, e abbiamo misurato la latenza del primo token, la latenza per token e il tempo di risposta complessivo. Puoi trovare i dettagli su come abbiamo…
LLM Quantizzazione: BF16 vs FP8 vs INT4
Abbiamo benchmarkato Qwen3-32B a 4 livelli di precisione (BF16, FP8, GPTQ-Int8, GPTQ-Int4) su una singola NVIDIA H100 80GB GPU. Ogni configurazione è stata valutata su 2 benchmark (~12,2K domande) che coprono conoscenza e generazione di codice, oltre a oltre 2.000 esecuzioni di inferenza per misurare il throughput. Int4 è 2,7x più veloce di BF16 pur…