Abbiamo monitorato 71 LLM rilasciati tra febbraio 2023 e maggio 2026 e raccolto 10 benchmark pubblici per misurare la densità di intelligenza. Abbiamo diviso il punteggio di capacità per la risorsa consumata dal modello (parametri attivi, calcolo di addestramento e prezzo di inferenza).
Panoramica della densità di intelligenza degli LLM
Per calcolare la densità di intelligenza, abbiamo eseguito i seguenti passaggi:
- Efficienza delle risorse: Abbiamo diviso la capacità di ciascun modello per due metriche di risorsa:
- Parametri attivi: Un proxy per il costo di memoria e serving (solo modelli open-weight).
- Prezzo di inferenza: Efficienza dei costi di mercato basata sul prezzo misto delle API per milione di token.
- Nota sul calcolo di addestramento (FLOP): Inizialmente abbiamo incluso un terzo asse, il calcolo di addestramento (FLOP), ma lo abbiamo rimosso perché la sua pendenza negativa sui benchmark Standard saturi ha trascinato il composito 2023–2024 in un calo controintuitivo.
- Raggruppamento dei benchmark: Per evitare che la saturazione dei punteggi mascheri i guadagni di efficienza, abbiamo valutato le capacità su due ere distinte di benchmark:
- Benchmark standard (2023–2024): MMLU (5-shot), GSM8K (8-shot CoT), HellaSwag (10-shot), ARC Challenge (25-shot), HumanEval (0-shot pass@1).
- Benchmark avanzati (2024–2026): MMLU-Pro, GPQA Diamond, AIME 2025, LiveCodeBench, SWE-bench Verified.
- Indicizzazione concatenata: Abbiamo calcolato la crescita anno su anno all'interno di gruppi di benchmark corrispondenti e li abbiamo concatenati in modo moltiplicativo a partire da una baseline 2023 di 100 per tracciare il trend cumulativo.
Vedi la metodologia per l'approccio di punteggio e i dettagli per risorsa.
Risultati della densità di intelligenza degli LLM
A metà del 2026, l'ecosistema IA ha fornito quasi 15× più intelligenza per unità di risorsa (parametri e dollari) rispetto alla baseline del 2023. Due cose da notare leggendo il trend:
- Il salto 2024–2025 (+362%) sovrastima il guadagno reale: I benchmark avanzati erano nuovi nel 2024 e solo una manciata di modelli aveva punteggi su di essi, quindi la baseline 2024 è artificialmente bassa. La maggior parte dell'"impennata" è dovuta al completamento del pannello, non a un balzo di efficienza in un anno.
- Il guadagno 2025–2026 (+105%) è dove sta la vera storia: È misurato su molti più modelli ed è guidato da rilasci open-weight di piccole dimensioni come Qwen 3.6-35B-A3B e DeepSeek V4 Flash che eguagliano la capacità dei modelli chiusi di frontiera a una frazione delle dimensioni e del costo.
Capacità degli LLM
Il grafico della densità mostra l'efficienza. Per contestualizzarlo, abbiamo anche misurato la capacità grezza nello stesso periodo: quanto sono diventati effettivamente più intelligenti questi modelli prima di qualsiasi aggiustamento per le risorse?
Capacità indicizzata a 100 nel 2023, media su tutti i modelli rilasciati ogni anno.
Gli assi e il tooltip funzionano come nel grafico della densità, con l'asse Y che traccia le prestazioni grezze dei benchmark invece della densità.
Un punteggio di capacità di 100 nel 2023 è cresciuto fino a 468 entro il 2026, circa un miglioramento di 4.7×. Anno per anno:
- 2024 (+88%): Progressi rapidi sui benchmark standard prima che si saturassero.
- 2025 (+105%): Stessi rapidi progressi, misurati sui benchmark avanzati più difficili che hanno sostituito quelli standard.
- 2026 (+22%): Il rallentamento è un primo segnale che anche i benchmark avanzati stanno iniziando a saturarsi.
Mettendo i due grafici fianco a fianco:
- La capacità è cresciuta 4.7× mentre la densità di intelligenza è cresciuta 8.9×.
- I modelli sono diventati più intelligenti e più efficienti allo stesso tempo. Non hanno bisogno di proporzionalmente più parametri, calcolo di addestramento o denaro per funzionare.
Nota: La cifra di capacità 4.7× è un ordine di grandezza credibile. La cifra di densità 8.9× è più fragile (il gruppo avanzato 2024 ha meno punti dati, il che amplifica il tasso di crescita di quell'anno), quindi va considerato come un segnale direzionale piuttosto che un moltiplicatore preciso.
Quale LLM ha la più alta densità di intelligenza?
La densità di intelligenza dipende da quale risorsa misuriamo e su quale gruppo di benchmark valutiamo. Il leader cambia per ogni combinazione.
Densità per parametro attivo (solo open-weight)
Questa vista misura quanto efficientemente un modello impacchetta la capacità nei suoi pesi. I parametri attivi contano perché i modelli Mixture-of-Experts (MoE) instradano ogni token attraverso una frazione dei pesi totali. DeepSeek V3 ha 671B parametri totali ma 37B attivi per token, e la cifra di 37B riflette il costo di serving effettivo.
Leader dei benchmark standard
- LLaMA 3.1 8B (lug 2024): 100.0
- LLaMA 3 8B (apr 2024): 85.0
- LLaMA 4 Maverick (apr 2025): 55.9
- Mixtral 8x7B (dic 2023): 47.4
- Mistral 7B (set 2023): 46.3
Leader dei benchmark avanzati
- Qwen 3.6-35B-A3B (apr 2026): 100.0 (3B parametri attivi; il punteggio si basa su un unico benchmark, SWE-bench Verified al 73.4%, quindi da interpretare di conseguenza)
- GPT-OSS 20B (ago 2025): 85.2 (3.6B parametri attivi)
- GPT-OSS 120B (ago 2025): 64.4 (5.1B parametri attivi)
- Qwen 3.5 9B (mar 2026): 35.2 (9B parametri densi)
- DeepSeek V4 Flash (apr 2026): 26.0
La classifica dei benchmark standard ha smesso di muoversi dalla fine del 2024 perché i benchmark si sono saturati, non perché i progressi si siano fermati. GPT-4 ha ottenuto 90.2 sui benchmark standard all'inizio del 2023 ma 17.3 su quelli avanzati.
Densità per FLOP di addestramento (solo open-weight)
Questa vista premia la cura dei dati, le scelte architetturali e le ricette di addestramento piuttosto che la spesa grezza.
Nota: la densità per FLOP sui benchmark standard sembra in calo nel tempo. Si tratta di un artefatto da saturazione, non di un declino dell'efficienza di addestramento. I vecchi benchmark non misurano più i guadagni recenti, quindi i punteggi di capacità si comprimono mentre il calcolo di addestramento continua a crescere.
Leader dei benchmark standard
- Mistral 7B (set 2023): 100.0 (ancora l'ancoraggio del pannello, dopo più di due anni)
- LLaMA 3 8B (apr 2024): 40.8
- LLaMA 1 (feb 2023): 37.0
- DeepSeek V2 (mag 2024): 32.6
- Mixtral 8x7B (dic 2023): 27.1
Leader dei benchmark avanzati
- Qwen 3.5 9B (mar 2026): 100.0
- Qwen 3.6-35B-A3B (apr 2026): 28.4
- DeepSeek V4 Flash (apr 2026): 6.4
Il risultato di Qwen 3.5 (9B) è notevole: un modello denso da 9B addestrato a circa 1.5 × 10²³ FLOP che ottiene 81.2 sui benchmark avanzati di capacità. Il suo calcolo di addestramento è circa un ordine di grandezza inferiore a quello di DeepSeek V4 Pro, ma il divario di capacità è minore.
Densità per dollaro di inferenza
La densità per dollaro è l'asse su cui i modelli open-weight e quelli chiusi di frontiera possono essere confrontati direttamente, perché i prezzi delle API sono pubblicamente verificabili. Usiamo i prezzi consolidati per il riepilogo, così da riflettere i tagli successivi al lancio.
Leader dei benchmark standard
- Mistral Small 3 24B (gen 2025): 100.0 a $0.10 / $0.30 per milione di token tramite l'API proprietaria di Mistral
- Gemini 1.5 Flash (mag 2024): 99.3 (modello closed-weight con il punteggio più alto dopo il taglio di prezzo dell'agosto 2024)
- DeepSeek V2 (mag 2024): 66.0 a $0.27 / $1.10 per milione di token
- DeepSeek V3 (dic 2024): 30.9
- DeepSeek R1 (gen 2025): 17.8
Leader dei benchmark avanzati
- GPT-OSS 120B (ago 2025): 100.0 (il riferimento di prezzo è la mediana cross-provider di OpenRouter, poiché OpenAI non ha ospitato il modello su un'API proprietaria)
- GPT-OSS 20B (ago 2025): 80.0
- DeepSeek V4 Flash (apr 2026): 44.0 a $0.06 / $0.42 per milione di token tramite l'API proprietaria di DeepSeek
- DeepSeek V3.2 (dic 2025): 22.5
- Mistral Small 3 24B (gen 2025): 20.9
- DeepSeek V4 Pro (apr 2026): 16.0 a $0.54 misto, con una capacità sui benchmark avanzati di 97.8. Questo colloca V4 Pro a 2.2 punti di capacità da Claude Opus 4.7 a circa 1/18esimo del prezzo misto ($0.54 contro $10.00).
Il divario con la frontiera chiusa non si è ridotto
I modelli di ragionamento chiusi di Anthropic, OpenAI e Google si collocano tra 0 e 6 nella densità per dollaro sui benchmark avanzati per tutto il periodo del pannello. GPT-4 nel marzo 2023 ha ottenuto 0.0. Claude Opus 4.7 nell'aprile 2026 ha ottenuto 0.9.
I laboratori chiusi hanno tagliato i prezzi assoluti:
- Claude Opus è sceso da $30 a $10 per milione di token tra Opus 4 e Opus 4.5.
- o3 di OpenAI è sceso da $10/$40 al lancio a $2/$8 consolidati.
- Gemini 1.5 Flash è sceso di circa il 78%.
Ma il divario relativo rispetto ai leader open-weight per densità è rimasto all'incirca tra 30 e 50× per tutto il periodo. DeepSeek aveva un prezzo intorno a $0.18 per milione nel 2024 (V2) e intorno a $0.18 per milione nel 2026 (V4 Flash). Il prezzo minimo open-weight non si è mosso, e il prezzo minimo dei flagship chiusi non si è mosso abbastanza per colmare il divario. La competizione sui prezzi si sta verificando nella fascia della generazione precedente, dove i vecchi modelli chiusi vengono mantenuti in vita come alternative economiche, non alla frontiera.
La nuova direzione: benchmark agentici
I benchmark avanzati usati per misurare le prestazioni dell'IA stanno iniziando a perdere efficacia, come le vecchie suite di test che hanno sostituito. I laboratori hanno iniziato a riportare benchmark agentici (SWE-Bench Pro, SWE-bench Verified, Terminal-Bench, OSWorld-Verified, Finance Agent) invece dei vecchi test di ragionamento. Abbiamo iniziato a costruire un pannello per tracciare questo cambiamento.
Ad esempio, il più recente modello di frontiera, Claude Opus 4.8, riporta i suoi risultati quasi interamente su questi benchmark per LLM agentici, senza punteggi sui benchmark di ragionamento che il nostro pannello principale traccia.
Tasso di risoluzione di SWE-Bench Pro per data di rilascio, valutato sull'harness standardizzato SEAL di Scale. Tra i modelli rappresentati:
- I migliori performer closed-weight: Claude Fable 5 (80.3%),Claude Opus 4.5 (45.9%), Claude Sonnet 4.5 (43.6%), e Gemini 3 Pro Preview (43.3%).
- I migliori performer open-weight: GLM 5.2 (62.1%), Qwen3-Coder-480B-A35B (38.7%), Kimi K2 Instruct (27.7%), e Qwen3-235B-A22B (21.4%).
Esplora i benchmark agentici consultando benchmark di codifica agentica, ricerca agentica e monitoraggio agentico.
Sfide nel confrontare le prestazioni agentiche
Valutare e confrontare i risultati dei benchmark agentici presenta diverse difficoltà chiave:
- Focus sulle metriche di capacità: Possiamo mostrare i punteggi di capacità, perché i dati sulle risorse necessari per misurare la densità (conteggio dei parametri, calcolo di addestramento e prezzi verificati per modello) rimangono incompleti o non divulgati dai laboratori chiusi.
- Sensibilità a livello di sistema: I punteggi dei benchmark misurano l'intero sistema, non solo il modello IA. Poiché i punteggi dipendono fortemente dallo "scaffolding" (il framework software circostante), lo stesso modello può produrre risultati molto diversi a seconda dello specifico agent harness utilizzato.
- Protocollo di standardizzazione: Per garantire un confronto equo, questo report traccia esclusivamente i dati di SWE-Bench Pro provenienti da un unico ambiente standardizzato (la classifica SEAL di Scale). Gli altri punteggi riportati dai laboratori usano harness diversi e non sono direttamente confrontabili.
- Esclusione di Claude Opus 4.8: Sebbene Opus 4.8 auto-riporti un massimo storico del 69.2% su SWE-Bench Pro, è stato testato sull'harness interno di Anthropic e non è ancora stato valutato da SEAL di Scale. Per mantenere una rigorosa coerenza dei dati, annotiamo qui il suo punteggio anziché inserirlo nel grafico.
SWE-Bench Pro dall'harness standardizzato SEAL di Scale. Le altre colonne sono riportate dai laboratori su harness variabili e non sono direttamente confrontabili tra le righe. I trattini indicano che non è stato trovato un punteggio verificato.
Questi tre sono stati eseguiti sull'harness mini-swe-agent, quindi sono esclusi dal grafico a dispersione per mantenerlo confrontabile.
Metodologia della densità di intelligenza
Copertura del pannello
- Modelli: 71 LLM rilasciati tra febbraio 2023 e aprile 2026. 37 modelli hanno punteggi sui benchmark standard e 54 hanno punteggi sui benchmark avanzati. I modelli senza un gruppo di benchmark completo sono esclusi dai calcoli di densità di quel gruppo.
- Benchmark: 10 benchmark pubblici, tutti riportati dai laboratori e riconducibili a una fonte primaria. Non abbiamo rieseguito alcun benchmark.
- Risorse: Per ogni modello, abbiamo diviso il suo punteggio di capacità per tre risorse indipendentemente:
- Parametri attivi: Un proxy per il costo di memoria e serving. Limitato ai modelli open-weight, perché i laboratori closed-weight (OpenAI, Anthropic, Google) non divulgano il conteggio dei parametri.
- Calcolo di addestramento (FLOP): Un proxy per l'efficienza di addestramento. Anch'esso limitato ai modelli open-weight. I valori FLOP sono per lo più stime di Epoch IA e vanno letti come indicativi.
- Prezzo di inferenza: Il prezzo che un acquirente paga effettivamente all'API. La capacità è divisa per il prezzo misto per milione di token con un rapporto input-output di 3:1. Partecipano sia i modelli aperti che quelli chiusi, perché i prezzi delle API sono pubblicamente verificabili.
Perché due gruppi di benchmark?
I modelli rilasciati nel 2024 hanno saturato i benchmark standard che i laboratori IA utilizzavano dal 2020. Una volta che i modelli di frontiera raggiungono il 90% o più su un benchmark, il test non separa più i modelli forti da quelli più forti. I laboratori hanno risposto introducendo benchmark più difficili.
Trattiamo questo cambiamento come una rottura netta per due motivi:
- In primo luogo, mescolare benchmark facili e difficili in un unico punteggio di capacità permetterebbe a un punteggio saturo su un benchmark facile di mascherare un punteggio basso su uno difficile. Un modello che ottiene 85 su MMLU-Pro è più forte di uno che ottiene 85 su MMLU. Trattare i due come equivalenti comprime l'intervallo dei punteggi e premia i benchmark più vecchi.
- In secondo luogo, le due suite hanno distribuzioni di punteggio diverse: i benchmark standard si raggruppano in alto (la maggior parte dei modelli di frontiera sopra 85), mentre quelli avanzati hanno una dispersione più ampia (modelli top intorno a 90, quelli di fascia media intorno a 50, modelli più deboli sotto 30). Eseguire lo z-score su entrambi contemporaneamente distorcerebbe la stima della varianza.
Calcoliamo la capacità per ciascun gruppo in modo indipendente:
- Benchmark standard (2023–2024): MMLU (5-shot), GSM8K (8-shot chain of thought), HellaSwag (10-shot), ARC Challenge (25-shot), HumanEval (0-shot pass@1).
- Benchmark avanzati (2024–2026): MMLU-Pro, GPQA Diamond, AIME 2025, LiveCodeBench, SWE-bench Verified.
Un punteggio di 90 sui benchmark standard non è equivalente a 90 su quelli avanzati. Per qualsiasi modello rilasciato dalla fine del 2024 in poi, i benchmark avanzati sono il riferimento significativo.
Formula della capacità
Per ogni benchmark b e ogni modello m:
Utilizziamo la deviazione standard della popolazione (divide per N, non per N−1). Ciò corrisponde al calcolo originale di pandas con ddof=0 e garantisce che l'aggiunta di un singolo nuovo modello non sposti retroattivamente la stima della varianza.
Quindi facciamo la media degli z-score disponibili per modello all'interno di ciascun gruppo di benchmark e riscaliamo con min-max in un punteggio relativo al pannello 0–100.
Formula della densità
Per ciascuna vista di densità:
Il denominatore cambia per ogni vista: parametri attivi in miliardi, FLOP di addestramento divisi per 10²⁴, o prezzo misto per milione di token.
Metodologia dell'indice concatenato
I due grafici a indice all'inizio dell'articolo (Densità di intelligenza e Capacità) mostrano una crescita cumulativa a linea singola indicizzata a 100 nel 2023, sul modello del formato di rendimento cumulativo dell'S&P 500. Concateniamo i tassi di crescita anno su anno attraverso la transizione dei benchmark invece di tracciare valori assoluti.
Passo 1. Calcoliamo la media annuale della metrica per ciascun gruppo di benchmark:
Per l'Indice di Densità di Intelligenza, la metrica è la media per riga dei tre punteggi di densità per modello (Densità Combinata A o B). Per l'Indice di Capacità, la metrica è il punteggio di capacità relativo al pannello (Capacità_A o Capacità_B).
Passo 2. Per ogni transizione anno su anno, calcoliamo la crescita all'interno di un singolo gruppo di benchmark. Entrambi gli anni devono appartenere allo stesso gruppo:
Passo 3. Concateniamo in modo moltiplicativo a partire da una baseline 2023 di 100:
Selezione del gruppo per ogni transizione:
- 2023 – 2024: Benchmark standard (quelli avanzati hanno 1 modello nel 2023, troppo pochi per calcolare una media stabile)
- 2024 – 2025: Benchmark avanzati (quelli standard si sono saturati alla fine del 2024; quelli avanzati hanno 16 modelli nel 2024 e 27 nel 2025)
- 2025 – 2026: Benchmark avanzati (quelli standard non sono riportati per il 2026)
L'indice concatenato presuppone che le popolazioni sottostanti siano confrontabili tra gli anni all'interno di un gruppo. Il nostro pannello è eterogeneo (modelli diversi ogni anno, con coperture di benchmark diverse), per cui i valori concatenati vanno letti come un riepilogo direzionale piuttosto che come un moltiplicatore preciso.
Principi fondamentali di valutazione per la misurazione della densità di intelligenza
- Benchmark standard del settore: Non introduciamo alcun benchmark personalizzato.
- Fonti primarie: Ogni punteggio di benchmark è riconducibile al paper di rilascio del modello, alla scheda modello o all'annuncio ufficiale. Quando la fonte primaria non riporta un benchmark, la cella è vuota anziché imputata.
- Indicatori di copertura (N): Per ogni modello riportiamo il numero di benchmark che contribuiscono al suo punteggio di capacità in ciascun gruppo. I modelli con N=1 ricevono un punteggio più rumoroso rispetto a quelli con N=5. Il caso N=1 si applica a Qwen 3.6 35B A3B (solo SWE-bench Verified) e ad alcuni rilasci flagship chiusi del 2026.
Fonti di prezzo per i modelli closed-weight
Il prezzo è la parte più sensibile alla coorte dell'indice. Utilizziamo la seguente gerarchia:
- Annuncio di lancio del laboratorio (preferito): Prezzo indicato nel post di lancio del laboratorio, nella documentazione dell'API o nella copertura stampa contemporanea.
- Mediana cross-provider di Artificial Analysis (ripiego per i modelli solo pesi): Utilizzata per tre righe di Llama 3.1 (8B, 70B, 405B) e per le righe GPT-OSS, in quanto non esiste un'API proprietaria.
- Solo pesi senza copertura: 22 delle 69 righe non hanno un prezzo per dollaro registrato. Compaiono nei grafici di capacità e per parametro, ma sono assenti nei grafici per dollaro.
Tracciamo due tracce di prezzo: prezzo di lancio (prezzo proprietario il giorno del rilascio) e prezzo consolidato (prezzo proprietario attuale, o l'ultimo prima della deprecazione). Sei modelli nel pannello sono stati riprezzati dopo il lancio:
- Gemini 1.5 Pro: $3.50/$10.50 a $1.25/$5.00 (ottobre 2024)
- GPT-4o: $5.00/$15.00 a $2.50/$10.00 (ottobre 2024)
- Gemini 1.5 Flash: $0.35/$1.05 a $0.075/$0.30 (agosto 2024)
- Claude 3.5 Haiku: $1.00/$5.00 a $0.80/$4.00 (dicembre 2024)
- o3: $10.00/$40.00 a $2.00/$8.00 (giugno 2025)
La densità per dollaro principale utilizza i prezzi consolidati. Per 37 delle 43 righe prezzate, i prezzi di lancio e consolidati sono identici.
Cadenza di aggiornamento
Aggiorniamo l'indice mensilmente. Ogni aggiornamento aggiunge nuove righe di modelli per qualsiasi rilascio di frontiera o notevole del mese precedente, aggiorna i prezzi dove i laboratori hanno modificato le tariffe, integra i benchmark appena riportati per le righe esistenti e ricalcola gli z-score sull'intero pannello. Le nuove voci spostano la media e la deviazione standard di ciascun benchmark, quindi i punteggi 0–100 esistenti si muovono con il pannello. Le istantanee storiche sono conservate.
Limiti della valutazione della densità di intelligenza
- Ottimismo riportato dai laboratori: I punteggi dei benchmark provengono dai laboratori stessi. Le riesecuzioni indipendenti in genere si attestano da 5 a 13 punti in meno. Le linee di tendenza sono informative a livello direzionale ma non precise al punto.
- Modalità di ragionamento e non ragionamento non separate: I modelli rilasciati nel 2025 e 2026 supportano opzioni di pensiero esteso che possono spostare i punteggi di matematica e codifica da 5 a 15 punti. Utilizziamo i punteggi in modalità predefinita dove identificabile.
- I valori FLOP di addestramento sono per lo più stime: Una manciata di righe ha FLOP confermati dal laboratorio. Il resto è estrapolato dai parametri e dai token di addestramento divulgati, principalmente tramite Epoch IA.
- Conteggio dei parametri dei modelli chiusi sconosciuto: La densità per parametro e per FLOP è vuota per le righe di frontiera chiuse. I modelli chiusi partecipano solo alla densità per dollaro.
- Punteggi relativi al pannello: I punteggi di densità sono riscalati con min-max all'interno del pannello. Un nuovo modello con un rapporto grezzo più alto sposta il punteggio 0–100 di ogni modello esistente. Per confrontare le versioni del pannello, utilizzare i rapporti grezzi sottostanti anziché i punteggi riscalati.
Che cos'è la densità di intelligenza?
La densità di intelligenza rappresenta una nuova metrica per valutare quanta conoscenza e capacità di ragionamento un modello può impacchettare in una singola unità di memoria o calcolo. Misura l'architettura del modello valutando quanto efficacemente utilizza ogni parametro per generare valore.
In questo framework, l'asse x rappresenta spesso il numero di parametri del modello mentre l'asse y traccia le prestazioni su compiti impegnativi. Un'alta densità si verifica quando i modelli dimostrano capacità superiori senza richiedere il massiccio costo computazionale associato a modelli più grandi. Questo processo dimostra che l'intelligenza non dipende esclusivamente dalla quantità di dati o dalla scala dell'addestramento, ma piuttosto da come il software e gli algoritmi organizzano tali informazioni.
In precedenza, la comunità IA si era affidata al ridimensionamento dei parametri del modello per raggiungere prestazioni più elevate, il che si traduceva in sistemi massicci e ad alta intensità di risorse. Con questo cambio di focus, l'ottimizzazione algoritmica viene privilegiata rispetto al volume grezzo per produrre più intelligenza da modelli più piccoli.
Perché è importante misurare la densità di intelligenza?
I sistemi efficienti devono ottimizzare il tempo di inferenza e l'utilizzo della memoria. Identificare il punto in cui più token o calcolo aggiuntivo non producono più guadagni significativi aiuta il settore a comprendere i limiti superiori degli attuali grandi modelli linguistici. I principali motivi per misurare la densità di intelligenza possono essere riassunti come segue:
- La comunità IA sottovaluta il costo a lungo termine della manutenzione di modelli sovradimensionati nei data center.
- La creazione di valore nelle applicazioni pratiche dipende dal rapporto tra la qualità dell'output e la potenza necessaria per produrlo.
- La Legge di Moore per l'hardware non può sostenere la crescita dei modelli linguistici senza progressi corrispondenti nel modo in cui li ottimizziamo.
- L'apprendimento per rinforzo e una migliore distribuzione dei dati consentono agli strumenti di prossima generazione di raggiungere benchmark un tempo riservati solo agli umani. Ulteriori informazioni sull'apprendimento per rinforzo e altri tipi di fine-tuning degli LLM.
Sebbene i modelli più grandi contino ancora per esplorare nuove frontiere, la densità di un sistema determina la sua effettiva utilità nel mondo reale. Questo contesto aiuta a vedere l'intelligenza come un risultato concentrato dell'addestramento piuttosto che come un sottoprodotto della pura dimensione.
Ulteriori approfondimenti
La densità di intelligenza è un modo per confrontare gli LLM. Altre dimensioni sono trattate in analisi separate:
- Benchmark di latenza: Per il tempo al primo token e i token al secondo, consulta il nostro benchmark di latenza degli LLM.
- Benchmark per compito: Per il ragionamento finanziario consulta il nostro benchmark per LLM finanziari. Per la codifica consulta il nostro benchmark di codifica IA.
Cita questo benchmark
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{imek2026,
author = {Şimşek, Hazal},
title = {{Densità di intelligenza di 71 LLM: Modelli più intelligenti e densi}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/intelligence-density}},
note = {AIMultiple. Consultato il 7 Luglio 2026}
}Risultati e timestamp di 69 punti dati. Scarica i dati utilizzati in questo articolo come file ZIP contenente un file CSV e un README.
Sii il primo a commentare
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.