Il modello più recente dell'Indice di Intelligenza AIMultiple è Claude Opus 5.5.
Benchmark LLM
Un unico Indice di Intelligenza trasparente che combina benchmark pubblici con le valutazioni agentiche, RAG e di ragionamento aziendale di AIMultiple. Come viene costruito l'indice
Classifica
I modelli con il punteggio più alto in tutti i benchmark.
# | Modello | Indice | AA-LCR | AIM-A-CODE-LLM Bench | AIM-Agentic-RAG | AIM-FinanceReasoning | AIM-HALC-Bench | AIM-RELC-Bench | AIM-Text-to-SQL | APEX-Agents-AA | ARC-AGI-1 | ARC-AGI-2 | ARC-AGI-3 | ArxivMath | AutomationBench-AA | BioMysteryBench | BrowseComp | Convex Coding Evals | CritPt | Crosby RedlineBench | DeepSWE 1.1 | EnterpriseOps-Gym-AA | Frontier-Bench | FrontierCode | FrontierMath | GDPval | GPQA Diamond | Harvey LAB-AA | HealthBench Professional | HieroglyphBench | Humanity's Last Exam | IFBench | ITBench-AA | LegalBench | LiveCodeBench | MMMU-Pro | ObviousBench | Opus Magnum Bench | ReactBench | RuneBench | SciCode | SimpleBench | Swe-Bench | Tau2-Bench Telecom | Tau3-Banking | Terminal-Bench 2.1 | Terminal-Bench 4.0 | Terminal-Bench Hard | Terminal-Bench-Science |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 5.5 Anthropic | 100 | - | - | 90 | 92 | - | - | 88 | - | - | - | - | - | - | - | - | - | 32 | - | - | - | - | - | - | 1846 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 67 | - | - | - | - | - | - | - | - |
| 2 | GPT-6 Astra OpenAI | 92 | - | - | 84 | 87 | - | - | 66 | - | - | 95 | 63 | - | 41 | - | 92 | 85 | 32 | - | 74 | - | - | 53 | 98 | 1542 | 96 | - | 70 | - | - | - | - | - | - | - | - | - | - | 7 | 56 | - | - | - | - | 90 | 58 | - | - |
| 3 | Claude Fable 5.1 Anthropic | 91 | 80 | - | 84 | 90 | - | - | 67 | - | 98 | 90 | - | - | 31 | - | - | 81 | 31 | - | 67 | - | - | 51 | 88 | 1735 | 94 | - | 62 | - | 59 | - | - | 89 | - | - | - | - | - | 6 | 63 | - | - | - | 47 | 91 | 56 | - | - |
| 4 | Qwen3.8 Flash Alibaba Cloud | 87 | 77 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 1743 | 92 | - | - | - | 38 | 81 | - | - | - | - | - | - | - | - | 47 | - | - | - | 45 | 86 | - | - | - |
| 5 | Command A+ Cohere | 87 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 30 | - | - | - | - | - | - | - | - | - | - | - | - | 74 | - | 61 | - | - | - | - | - | - | - | - | - | 81 | - | - | - | 25 | - |
| 6 | MiMo-V2.6-Pro Xiaomi | 87 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 27 | - | - | - | - | - | - | 1673 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 61 | - | - | - | - | - | - | - | - |
| 7 | Muse Spark 1.1 Meta | 86 | 81 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 53 | - | - | - | - | 1381 | 90 | - | 59 | - | 46 | - | - | 85 | - | - | 99 | - | 23 | 6 | 58 | - | - | - | 32 | 78 | - | - | - |
| 8 | Claude Fable 5 Anthropic | 85 | 77 | 69 | 82 | 90 | - | - | 66 | 59 | 99 | 89 | - | 79 | 17 | - | 87 | 84 | 29 | - | 70 | - | 34 | 54 | 90 | 1741 | 93 | 14 | 63 | 23 | 56 | 64 | - | 89 | - | 81 | 99 | 22 | 47 | 6 | 61 | 82 | - | 99 | 38 | 85 | 42 | 63 | 21 |
| 9 | Claude Opus 5 Anthropic | 83 | 79 | - | 85 | 90 | - | - | 64 | - | 98 | 90 | 30 | 91 | 50 | 79 | 91 | 82 | 29 | - | 74 | - | 44 | 53 | 73 | 1708 | 94 | - | 60 | - | 55 | - | - | 87 | - | 85 | 100 | - | - | 6 | 56 | - | - | - | 45 | 89 | 52 | - | 30 |
| 10 | GPT-6 Sol OpenAI | 79 | - | - | 82 | - | - | - | 54 | - | - | - | - | - | - | - | - | - | 31 | - | - | - | - | - | - | 1487 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 58 | - | - | - | - | - | - | - | - |
Come viene costruito l'indice
Ogni benchmark viene letto come una posizione, non come un punteggio grezzo. All'interno di un benchmark il risultato migliore si colloca a 100, il peggiore a 0, e tutti gli altri modelli cadono in un punto intermedio. L'indice è la media ponderata di quelle posizioni sui benchmark che un modello ha effettivamente eseguito: un benchmark che non ha mai eseguito non conta come zero, semplicemente non c'è. I benchmark non contano allo stesso modo, e il peso di ciascuno è indicato accanto ad esso. Un modello ha bisogno di risultati in almeno due benchmark dell'indice per essere classificato, così un singolo risultato colloca il modello sulla linea di quel benchmark senza dargli una posizione propria. Si usano le posizioni al posto dell'accuratezza grezza perché i benchmark differiscono nettamente per difficoltà e scala, e punteggi di benchmark diversi non possono condividere una media. Pesi: AIM-FinanceReasoning (10%) + AIM-Text-to-SQL (10%) + AIM-Agentic-RAG (10%) + SciCode (10%) + FrontierMath (10%) + Terminal-Bench 2.1 (10%) + CritPt (10%) + IFBench (10%) + MMMU-Pro (10%) + ARC-AGI-3 (10%).
Benchmark utilizzati
Aggiornamenti recenti
Ultime modifiche all'Indice di Intelligenza, alla copertura dei modelli e alla metodologia di benchmark di AIMultiple.
Claude Opus 5.5
Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.
GPT-6 Sol
Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.
GPT-6 Luna
Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.
MiMo-V2.6-Pro
Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.
Esplora Casi d'uso, analisi e benchmark di LLM
Simulazione del pubblico: gli LLM possono prevedere il comportamento umano?
Nel marketing, valutare con quanta precisione gli LLM prevedono il comportamento umano è fondamentale per valutare la loro efficacia nell'anticipare le esigenze del pubblico e riconoscere i rischi di disallineamento, comunicazione inefficace o influenza non intenzionale. La simulazione del pubblico con gli LLM consente la modellazione di pubblici virtuali, aiutando le organizzazioni ad anticipare le…
HALC-Bench: LLM Allucinazione su benchmark di recupero a lungo contesto
HALC-Bench (benchmark di allucinazione di LLM su recupero a lungo contesto) misura la resistenza di un grande modello linguistico a fabbricare prove per una metrica che non esiste nel documento di destinazione, utilizzando 3 pagliai posizionati all'inizio, a metà e alla fine della finestra di contesto del modello, con 204 domande. claude-fable-5 ha risposto correttamente…
Gateway IA per OpenAI: alternative a OpenRouter
Abbiamo confrontato OpenRouter, SambaNova, TogetherAI, Groq e IA/ML API su tre indicatori (latenza del primo token, latenza totale e numero di token in output), con 300 test utilizzando prompt brevi (circa 18 token) e prompt lunghi (circa 203 token) per la latenza totale. Se prevedi di utilizzare uno di questi gateway IA, puoi: In questo…
LLM Strumenti di osservabilità: Weights & Biases, Langsmith
Le applicazioni LLM si sono espanse da chat a turno singolo ad agenti multi-step che usano strumenti, interrogano database e si coordinano con altri model, rendendo il loro comportamento più difficile da interpretare. L'osservabilità LLM fornisce visibilità continua su questi flussi di lavoro complessi, aiutando le organizzazioni a monitorare la qualità, rilevare i guasti, risolvere…
Cloud LLM vs Local LLMs: Esempi & Vantaggi
Cloud LLMs, potenziati da modelli avanzati come GPT-5.5 e Claude Opus 4.7, offrono scalabilità e accessibilità. Al contrario, Local LLMs, guidati da modelli open source come Llama 4, DeepSeek V4 e Qwen3.6-Plus, assicurano maggiore privacy e personalizzazione. Esplora cosa sono i cloud LLMs, i loro punti di forza e debolezze, i casi di studio più…
LLM Guida al Fine-Tuning per le Aziende
Segui i link per le soluzioni specifiche ai tuoi problemi di output LLM. Se il tuo LLM: L'adozione diffusa dei modelli linguistici di grandi dimensioni (LLMs) ha migliorato la nostra capacità di elaborare il linguaggio umano. Tuttavia, il loro addestramento generico spesso si traduce in prestazioni subottimali per compiti specifici. Per superare questa limitazione, vengono…
10+ Esempi di grandi modelli linguistici
Abbiamo raccolto benchmark open-source per confrontare i principali modelli linguistici di grandi dimensioni proprietari e open-source. Scegli il tuo caso d'uso per trovare il modello giusto. Puoi valutare i grandi modelli linguistici esaminando le loro prestazioni nei benchmark e la latenza reale (disponibile cliccando sul nome di ciascun modello nella tabella) e rivedendo i prezzi…
LLM Prezzi: Confronto tra i migliori 15+ provider
Il pricing degli LLM si estende su quattro ordini di grandezza: i modelli più economici sono stati lanciati a meno di $0,03 per milione di token, mentre i modelli di ragionamento di frontiera sono stati lanciati fino a $262.50. Il grafico seguente tiene traccia dei prezzi di lancio: ogni punto rappresenta il prezzo medio dei…
Automazione LLM: i 7 migliori strumenti e 8 casi di studio
L'automazione LLM si riferisce al passaggio a strumenti di automazione intelligente che sfruttano gli LLM, inclusi agenti IA, LLM fine-tuned e modelli RAG per automatizzare e coordinare le attività. Scopri cos'è l'automazione LLM, le sue principali applicazioni reali e i principali strumenti: Large language models nell'automazione sono un approccio sistematico che combina l'elaborazione del linguaggio…
LLM Orchestrazione: 22 Framework e Gateway
Ottimizzare l'orchestrazione LLM è fondamentale per migliorare le prestazioni mantenendo sotto controllo l'uso delle risorse. Per valutare come si comportano nella pratica i diversi approcci di orchestrazione, abbiamo eseguito dei benchmark: Scopri una selezione di strumenti di orchestrazione LLM, tra cui framework per sviluppatori e gateway aziendali: L'orchestrazione LLM implica la gestione e l'integrazione di…