Abbiamo curato un elenco di oltre 800 benchmark IA per LLM, GPU, GPU cloud, agenti IA, IA tabulare e sicurezza informatica che non sono ancora saturi.
Crescita dei benchmark IA
Si noti che la maggior parte del picco di maggio-giugno corrisponde al periodo in cui abbiamo svolto la nostra ricerca. I benchmark che si aggiornano continuamente sono datati all'ultima volta in cui li abbiamo verificati, quindi tendono ad accumularsi nei mesi in cui stavamo raccogliendo i dati, piuttosto che indicare un aumento reale di nuovi benchmark.
Benchmark IA per categorie
Abbiamo elencato i benchmark IA in base alle loro categorie principali. I benchmark LLM sono quelli con il numero più elevato.
Benchmark IA per sottocategorie
Elenco dei benchmark IA
Per semplicità, abbiamo incluso i 250 benchmark più recenti dal nostro elenco completo di 809 benchmark. Leggi la nostra metodologia per sapere come abbiamo raccolto questo elenco.
Note su come leggere l'elenco:
Le quattro colonne con flag booleani (T = vero, F = falso) indicano quale dimensione di valutazione copre ciascun benchmark. Ogni flag risponde a una domanda sì/no sull'ambito del benchmark:
- Prestazioni (T/F): Il benchmark valuta capacità o qualità, come accuratezza dell'output, completamento dell'attività o intelligenza? Questo è contrassegnato con T per quasi tutti i benchmark, poiché la maggior parte di essi valuta quanto bene un model o un sistema si comporta. È contrassegnato con F per i benchmark che si concentrano esclusivamente su costo o velocità e non valutano la qualità dell'output.
- Prezzo (T/F): Il benchmark include fattori legati al costo, come dollari per token, prezzo per throughput o costo per attività?
- Latenza (T/F): Il benchmark misura la velocità, come token al secondo, tempo al primo token, throughput o tempo di risposta? È F per i benchmark che valutano la correttezza, indipendentemente da quanto tempo richiede la risposta.
- Affidabilità (T/F): Il benchmark valuta coerenza o attendibilità, come la varianza tra esecuzioni, la stabilità dei tassi di successo o la robustezza? Questo è il flag meno comune. È T per i benchmark progettati per questo scopo, tra cui HAL Reliability, tau-bench/tau2-bench, METR Time Horizons e diversi benchmark per agenti in cui la coerenza del tasso di superamento è centrale. È F per la maggior parte delle classifiche che riportano un unico punteggio complessivo.
- Resistente alla contaminazione (T/F): Indica se il benchmark è progettato per ridurre il rischio di contaminazione dei dati, quando le domande del test compaiono nei dati di addestramento di un model e il model ottiene punteggi alti grazie al richiamo piuttosto che a una capacità autentica. T significa che il benchmark ha una difesa significativa, come un set di controllo nascosto, domande nuove o rotanti, aggiornamenti mensili, elementi autogenerati o problemi di competizione rilasciati dopo il cutoff di addestramento di un model. F significa che il benchmark è un dataset pubblico fisso, online da anni e che potrebbe essere stato assorbito nei corpora di addestramento. In questi casi, i punteggi alti dovrebbero essere interpretati con maggiore cautela.
In pratica, una riga contrassegnata con T/F/F/F rappresenta un benchmark di pura qualità. Al contrario, un benchmark contrassegnato con T/T/T/T/F valuta insieme qualità, costo e velocità. Questi flag forniscono una tassonomia compatta che mostra quali dei quattro assi di valutazione copre ciascun benchmark.
Perché alcune celle sono vuote?
Resistente alla contaminazione e Fonte di contaminazione: Questi due campi sono solitamente vuoti per gli stessi tipi di righe, in particolare GPU, cloud GPU, benchmark di velocità e di prezzo. La resistenza alla contaminazione è rilevante per i benchmark di conoscenza e ragionamento, in cui un model potrebbe aver memorizzato le domande del test dai dati di addestramento. Per i benchmark di throughput hardware, latenza o prezzo, non ci sono domande di test da contaminare, quindi il campo viene lasciato vuoto invece di essere contrassegnato con T o F.
Metodologia dei benchmark IA
Abbiamo raccolto i dati sui benchmark attraverso un processo di ricerca e validazione online. L'obiettivo era costruire un elenco strutturato di benchmark tecnologici che rimangono utili per confrontare i sistemi e le infrastrutture IA attuali, coprendo LLM, GPU, cloud GPU, agenti IA, IA tabulare e sicurezza informatica.
Abbiamo iniziato definendo l'ambito del dataset. Ci siamo concentrati su benchmark che misurano capacità del model, prestazioni dell'infrastruttura, costi, latenza, affidabilità o resistenza alla contaminazione. L'elenco iniziale delle fonti includeva i principali fornitori di benchmark e analisi come Artificial Analysis, SemiAnalysis, Vals IA, LMArena, AIMultiple ed Epoch IA, oltre a siti web ufficiali di benchmark, repository GitHub, articoli accademici, pagine di classifiche e aggregatori di benchmark di terze parti pertinenti.
Per ogni benchmark, abbiamo registrato sia campi descrittivi sia campi valutativi. I campi descrittivi catturano cos'è il benchmark, cosa misura, quali prodotti o model vengono valutati e con quale frequenza viene aggiornato. I campi valutativi classificano se il benchmark misura prestazioni, prezzo, latenza o affidabilità. Abbiamo anche raccolto informazioni sulla struttura del benchmark e sull'integrità dei dati.
Abbiamo privilegiato le fonti primarie laddove possibile. Queste includevano pagine ufficiali di metodologia dei benchmark, pagine di classifiche, repository GitHub, articoli sui benchmark e documentazione dei fornitori. Quando una fonte primaria non forniva un campo specifico, abbiamo utilizzato fonti secondarie o aggregatori affidabili per colmare le lacune, soprattutto per i punteggi migliori, la copertura attuale dei model e le date di misurazione recenti. Le colonne delle fonti sono state incluse in tutto il dataset in modo che l'evidenza di ciascun valore potesse essere ricondotta alla sua fonte.
Cita questa ricerca
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{ermut2026,
author = {Ermut, Sıla},
title = {{800+ benchmark IA di riferimento}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/ai-benchmarks}},
note = {AIMultiple. Consultato il 17 Agosto 2026}
}Risultati e timestamp di 250 punti dati. Scarica i dati utilizzati in questo articolo come file ZIP contenente un file CSV.
In precedenza ha lavorato come reclutatrice in società di project management e consulenza. Sıla ha conseguito un Master of Science in Psicologia Sociale e un Bachelor of Arts in Relazioni Internazionali.
Sii il primo a commentare
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.