Il modello più recente dell'Indice di Intelligenza AIMultiple è Kimi K3.
Benchmark LLM
Un unico Indice di Intelligenza trasparente che combina benchmark pubblici con le valutazioni agentiche, RAG e di ragionamento aziendale di AIMultiple. Vedi la metodologia.
Classifica
I modelli con il punteggio più alto in tutti i benchmark.
# | Modello | Indice | LegalBench | FinanceReasoning | Text-to-SQL | Agentic RAG | ARC-AGI-2 | Agentic LLM Benchmark | FrontierMath | Swe-Bench |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 Anthropic | 92 | 89 | 90 | 90 | 98 | - | 69 | - | - |
| 2 | Kimi K3 Moonshot AI | 88 | 86 | 88 | 77 | 93 | - | 73 | - | - |
| 3 | GPT-5.6 Sol OpenAI | 87 | 87 | 90 | 74 | 87 | 93 | 62 | - | - |
| 4 | Grok 4.5 X | 86 | 86 | 88 | 79 | 83 | - | 73 | - | - |
| 5 | GPT-5.5 OpenAI | 83 | 87 | - | - | - | 85 | 59 | - | - |
| 6 | GPT-5.6 Terra OpenAI | 80 | 85 | 87 | 71 | 91 | 84 | 61 | - | - |
| 7 | GPT-5.6 Sol Pro OpenAI | 80 | - | 91 | 79 | 96 | - | 54 | - | - |
| 8 | Claude Opus 4.6 Anthropic | 78 | - | 88 | 68 | 80 | 69 | 72 | - | - |
| 9 | Gemini 3 Pro Preview Google | 77 | 87 | 86 | 60 | 89 | 31 | - | - | - |
| 10 | Gemini 3.1 Pro Preview Google | 77 | 87 | 87 | 65 | 89 | 77 | 46 | 27 | - |
Pagina 1 di 7 | ||||||||||
Come viene costruito l'indice
L'Indice di Intelligenza normalizza ogni benchmark su una scala da 0 a 100 e calcola la media della posizione relativa di un modello sui benchmark su cui è stato valutato. Ogni benchmark qui sotto contribuisce a quel punteggio.
Aggiornamenti recenti
Ultime modifiche all'Indice di Intelligenza, alla copertura dei modelli e alla metodologia di benchmark di AIMultiple.
Kimi K3
Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.
GPT-5.6 Sol
Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.
GPT-5.6 Terra
Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.
GPT-5.6 Sol Pro
Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.
Esplora Casi d'uso, analisi e benchmark di LLM
Densità di intelligenza di 71 LLMs per models più intelligenti e più densi
Abbiamo monitorato 71 LLMs rilasciati tra febbraio 2023 e maggio 2026 e raccolto 10 benchmark pubblici per misurare la densità di intelligenza. Abbiamo diviso il punteggio di capacità per la risorsa consumata dal model (parametri attivi, calcolo di addestramento e prezzo di inference). Per calcolare la densità di intelligenza, abbiamo eseguito i seguenti passaggi: Vedi…
50+ Casi d'uso di ChatGPT con esempi reali
ChatGPT ha raggiunto circa 1 miliardo di utenti attivi settimanali all'inizio del 2026, circa il 10% della popolazione mondiale.1 OpenAI ha superato i $20 miliardi di fatturato annuo per il 2025, come confermato dalla CFO Sarah Friar.2 L'indice economico di Anthropic distingue due modalità d'uso: il potenziamento, in cui un essere umano interagisce con l'IA,…
Benchmark di 40+ LLM nella finanza: Claude Fable 5 & GPT-5.6 Sol
Abbiamo valutato 40+ LLM nel settore finanziario su 238 domande difficili del benchmark FinanceReasoning per identificare quali modelli eccellano in compiti complessi di ragionamento finanziario come analisi di bilancio, previsioni e calcoli di rapporti. Abbiamo valutato LLM su 238 domande difficili del benchmark FinanceReasoning (Tang et al.).1 Questo sottoinsieme punta ai compiti più impegnativi di…
AIM Enterprise: Benchmark aziendale agentico
Le aziende usano gli LLM ogni giorno per le loro attività regolari. Per trovare gli LLM più efficienti in termini di costi, abbiamo progettato AIM Enterprise, un benchmark aziendale agentico, dove abbiamo usato 69 attività aziendali in diverse categorie. Ogni modello ha consegnato un file per attività. I punteggi sono relativi: i giudici classificano ogni…
LLM Leggi di scaling: analisi di ricercatori IA
Large language models prevedono il token successivo in base ai pattern appresi dai dati testuali. Il termine leggi di scaling di LLM si riferisce a regolarità empiriche che collegano le prestazioni del model alla quantità di calcolo, ai dati di addestramento e ai parametri del model utilizzati durante l'addestramento. Per comprendere come queste relazioni influenzino…
LLM Strumenti di osservabilità: Weights & Biases, Langsmith
Le applicazioni LLM si sono espanse da chat a turno singolo ad agenti multi-step che usano strumenti, interrogano database e si coordinano con altri model, rendendo il loro comportamento più difficile da interpretare. L'osservabilità LLM fornisce visibilità continua su questi flussi di lavoro complessi, aiutando le organizzazioni a monitorare la qualità, rilevare i guasti, risolvere…
Grandi modelli multimodali (LMM) vs LLMs
Abbiamo valutato le prestazioni dei grandi modelli multimodali (LMM) in compiti di ragionamento finanziario utilizzando un dataset accuratamente selezionato. Analizzando un sottoinsieme di campioni finanziari di alta qualità, valutiamo le capacità dei modelli nell'elaborare e ragionare con dati multimodali nel dominio finanziario. La sezione sulla metodologia fornisce approfondimenti dettagliati sul dataset e sul framework di…
ChatGPT per il Servizio Clienti: I 10 Migliori Casi d'Uso
ChatGPT è passato dalla novità all'infrastruttura nel servizio clienti. Le aziende lo stanno utilizzando per ridurre i tempi di risposta, gestire volumi che i loro team non riescono ad assorbire e ridurre il costo delle interazioni di routine. Ma i risultati variano notevolmente a seconda di come viene implementato. OpenAI ha lanciato GPT-5.6, un modello…
LLM Benchmark di latenza per casi d'uso
Abbiamo sottoposto a benchmark 11 modelli linguistici di grandi dimensioni di punta tramite modelli linguistici di grandi dimensioni con un totale di 1.320 richieste, suddividendo tra modelli reasoning e non-reasoning, e abbiamo misurato la latenza del primo token, la latenza per token e il tempo di risposta complessivo. Puoi trovare i dettagli su come abbiamo…
Top LLMOps Tools & Confrontali con MLOPs
Le piattaforme LLMOps gestiscono l'aspetto operativo dell'esecuzione di grandi modelli linguistici: distribuzione, monitoraggio, valutazione e gestione dei costi. Abbiamo esaminato i migliori strumenti LLMOps, le loro funzionalità principali, i modelli di prezzo e le differenze reciproche per aiutare a identificare la soluzione migliore per vari casi d'uso. Di seguito è fornito un riepilogo di ciascuna…