Benchmark LLM
Un unico Indice di Intelligenza trasparente che combina benchmark pubblici con le valutazioni agentiche, RAG e di ragionamento aziendale di AIMultiple.
Classifica
I modelli con il punteggio più alto in tutti i benchmark.
# | Modello | Indice | LegalBench | FinanceReasoning | Text-to-SQL | Agentic RAG | ARC-AGI-2 | Agentic LLM Benchmark | FrontierMath | Swe-Bench |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 Anthropic | 92 | 89 | 90 | 90 | 98 | - | 69 | - | - |
| 2 | Kimi K3 Moonshot AI | 88 | 86 | 88 | 77 | 93 | - | 73 | - | - |
| 3 | GPT-5.6 Sol OpenAI | 87 | 87 | 90 | 74 | 87 | 93 | 62 | - | - |
| 4 | Grok 4.5 X | 86 | 86 | 88 | 79 | 83 | - | 73 | - | - |
| 5 | GPT-5.5 OpenAI | 83 | 87 | - | - | - | 85 | 59 | - | - |
| 6 | GPT-5.6 Terra OpenAI | 80 | 85 | 87 | 71 | 91 | 84 | 61 | - | - |
| 7 | GPT-5.6 Sol Pro OpenAI | 80 | - | 91 | 79 | 96 | - | 54 | - | - |
| 8 | Claude Opus 4.6 Anthropic | 78 | - | 88 | 68 | 80 | 69 | 72 | - | - |
| 9 | Gemini 3 Pro Preview Google | 77 | 87 | 86 | 60 | 89 | 31 | - | - | - |
| 10 | Gemini 3.1 Pro Preview Google | 77 | 87 | 87 | 65 | 89 | 77 | 46 | 27 | - |
Pagina 1 di 7 | ||||||||||
Grafici
Modelli secondo "Migliori prestazioni"
Come viene costruito l'indice
L'Indice di Intelligenza normalizza ogni benchmark su una scala da 0 a 100 e calcola la media della posizione relativa di un modello sui benchmark su cui è stato valutato. Ogni benchmark qui sotto contribuisce a quel punteggio.
Aggiornamenti recenti
Ultime modifiche all'Indice di Intelligenza, alla copertura dei modelli e alla metodologia di benchmark di AIMultiple.
Kimi K3
Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.
GPT-5.6 Sol
Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.
GPT-5.6 Terra
Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.
GPT-5.6 Sol Pro
Nuovo modello aggiunto all'Indice di Intelligenza AIMultiple.
Esplora Casi d'uso, analisi e benchmark di LLM
LLM Prezzi: Top 15+ Provider a confronto
LLM pricing spans three orders of magnitude: the cheapest commodity models cost under $0.20 per million tokens, while frontier reasoning tiers launched as high as $262.50. The chart below tracks how launch prices moved: each model sits at its launch date with its launch list price per million tokens, blended at a 3:1 input-to-output ratio,…
Text-to-SQL: Confronto dell'accuratezza dei LLM
Ho fatto affidamento su SQL per l'analisi dei dati per 18 anni, a partire dai miei giorni come consulente. Tradurre domande in linguaggio naturale in SQL rende i dati più accessibili, consentendo a chiunque, anche a chi non ha competenze tecniche, di lavorare direttamente con i database. Abbiamo utilizzato la nostra text-to-SQL metodologia di benchmark…
LLM Guida al Fine-Tuning per le Aziende
Segui i link per le soluzioni specifiche ai tuoi problemi di output LLM. Se il tuo LLM: L'adozione diffusa dei modelli linguistici di grandi dimensioni (LLMs) ha migliorato la nostra capacità di elaborare il linguaggio umano. Tuttavia, il loro addestramento generico spesso si traduce in prestazioni subottimali per compiti specifici. Per superare questa limitazione, vengono…
LLM Strumenti di osservabilità: Weights & Biases, Langsmith
LLM Le applicazioni si sono estese da chat a turno singolo ad agenti multi-step che utilizzano strumenti, interrogano database e si coordinano con altri modelli, rendendo il loro comportamento più difficile da interpretare. LLM L'osservabilità fornisce visibilità continua su questi flussi di lavoro complessi, aiutando le organizzazioni a monitorare la qualità, rilevare guasti, risolvere problemi…
LLM Calcolatore VRAM per Auto-Hosting
Auto-ospitare un LLM significa eseguire l'inferenza su hardware controllato dall'operatore anziché tramite un'API di terze parti, il che cambia il profilo di costi, controllo dei dati e privacy. Se un modello possa essere eseguito o meno dipende dalla memoria. Il calcolatore stima la VRAM o memoria unificata necessaria per eseguire un modello in locale, basandosi…
Benchmark di 40+ LLM nella finanza: Claude Fable 5 & GPT-5.6 Sol
Abbiamo valutato 40+ LLM nel settore finanziario su 238 domande difficili del benchmark FinanceReasoning per identificare quali modelli eccellano in compiti complessi di ragionamento finanziario come analisi di bilancio, previsioni e calcoli di rapporti. Abbiamo valutato LLM su 238 domande difficili del benchmark FinanceReasoning (Tang et al.).1 Questo sottoinsieme punta ai compiti più impegnativi di…
LLM Automazione: I 7 Migliori Strumenti e 8 Casi di Studio
LLM automation si riferisce al passaggio a strumenti di automazione intelligente che sfruttano i LLM, inclusi agenti IA, LLM perfezionati e modelli RAG per automatizzare e coordinare compiti. Scopri cos'è l'automazione LLM, le sue principali applicazioni reali e i principali strumenti: I modelli linguistici di grandi dimensioni nell'automazione sono un approccio sistematico che combina l'elaborazione…
LLM Benchmark di latenza per casi d'uso
Abbiamo sottoposto a benchmark 11 migliori grandi modelli linguistici con un totale di 1.320 richieste, separando i modelli di ragionamento da quelli non di ragionamento, e abbiamo misurato la latenza del primo token, la latenza per token e il tempo di risposta complessivo. Qui trovi i dettagli su come abbiamo misurato la latenza. Riportiamo separatamente…
HALC-Bench: Allucinazione LLM su Benchmark di Recupero a Lungo Contesto
HALC-Bench (Allucinazione LLM su Benchmark di Recupero a Lungo Contesto) misura la resistenza di un grande modello linguistico a fabbricare prove per una metrica che non esiste nel documento di destinazione utilizzando 3 pagliai posizionati all'inizio, al centro e alla fine della finestra di contesto del modello, con 204 domande. claude-fable-5 ha risposto correttamente a…
Densità di intelligenza di 71 LLMs: Modelli più intelligenti e densi
Abbiamo monitorato 71 LLM rilasciati tra febbraio 2023 e maggio 2026 e raccolto 10 benchmark pubblici per misurare la densità di intelligenza. Abbiamo diviso il punteggio di capacità per la risorsa consumata dal modello (parametri attivi, calcolo di addestramento e prezzo di inferenza). Per calcolare la densità di intelligenza, abbiamo eseguito i seguenti passaggi: Vedi…