Densità di intelligenza di 71 LLMs per models più intelligenti e più densi
Abbiamo monitorato 71 LLMs rilasciati tra febbraio 2023 e maggio 2026 e raccolto 10 benchmark pubblici per misurare la densità di intelligenza. Abbiamo diviso il punteggio di capacità per la risorsa consumata dal model (parametri attivi, calcolo di addestramento e prezzo di inference).
Panoramica della densità di intelligenza degli LLM
Per calcolare la densità di intelligenza, abbiamo eseguito i seguenti passaggi:
- Efficienza delle risorse: Abbiamo diviso la capacità di ciascun model per due metriche di risorsa:
- Parametri attivi: Un proxy per la memoria e il costo di servizio (per i models open-weight).
- Prezzo di inference: Efficienza di costo di mercato basata sul prezzo misto delle API per milione di tokens.
- Nota sul calcolo di addestramento (FLOP): Inizialmente abbiamo incluso un terzo asse, il calcolo di addestramento (FLOP), ma lo abbiamo rimosso perché la sua pendenza negativa sui benchmark standard saturi ha trascinato il composito 2023–2024 in un calo controintuitivo.
- Raggruppamento dei benchmark: Per evitare che la saturazione dei punteggi mascheri i guadagni di efficienza, abbiamo valutato le capacità in due distinte epoche di benchmark:
- Benchmark standard (2023–2024): MMLU (5-shot), GSM8K (8-shot CoT), HellaSwag (10-shot), ARC Challenge (25-shot), HumanEval (0-shot pass@1).
- Benchmark avanzati (2024–2026): MMLU-Pro, GPQA Diamond, AIME 2025, LiveCodeBench, SWE-bench Verified.
- Indicizzazione concatenata: Abbiamo calcolato la crescita anno su anno all'interno dei gruppi di benchmark corrispondenti e li abbiamo concatenati moltiplicativamente partendo da una baseline del 2023 di 100 per tracciare la tendenza cumulativa.
Vedi metodologia per l'approccio di punteggio e le ripartizioni per ciascuna risorsa.
Risultati della densità di intelligenza degli LLM
Entro la metà del 2026, l'ecosistema IA ha fornito quasi 15× più intelligenza per unità di risorsa (parametri e dollari) rispetto alla baseline del 2023. Due aspetti da notare leggendo la tendenza:
- Il salto 2024–2025 (+362%) sovrastima il guadagno reale: I benchmark avanzati erano nuovi nel 2024 e solo una manciata di models aveva punteggi su di essi, quindi la baseline del 2024 è artificialmente bassa. Gran parte dell'“impennata” è dovuta al completamento del panel, non a un salto di efficienza in un anno.
- Il guadagno 2025–2026 (+105%) è dove sta la vera storia: È misurato su molti più models ed è guidato da piccole release open-weight come Qwen 3.6-35B-A3B e DeepSeek V4 Flash che eguagliano le capacità dei models chiusi di frontiera a una frazione di dimensioni e costo.
Capacità degli LLM
Il grafico della densità mostra l'efficienza. Per contestualizzarlo, abbiamo anche misurato la capacità grezza nello stesso periodo: quanto sono diventati effettivamente più intelligenti questi models prima di qualsiasi aggiustamento per le risorse?
Capacità indicizzata a 100 nel 2023, media tra tutti i models rilasciati ogni anno.
Gli assi e il tooltip funzionano come nel grafico della densità, con l'asse Y che traccia la prestazione grezza sui benchmark piuttosto che la densità.
Un punteggio di capacità di 100 nel 2023 è cresciuto fino a 468 entro il 2026, circa un miglioramento di 4.7×. Anno per anno:
- 2024 (+88%): Progressi rapidi sui benchmark standard prima che si saturassero.
- 2025 (+105%): Stessi progressi rapidi, misurati sui benchmark avanzati più difficili che hanno sostituito quelli standard.
- 2026 (+22%): Il rallentamento è un segnale precoce che anche i benchmark avanzati stanno iniziando a saturarsi.
Confrontando i due grafici fianco a fianco:
- La capacità è cresciuta 4.7× mentre la densità di intelligenza è cresciuta 8.9×.
- I models sono diventati più intelligenti e più efficienti allo stesso tempo. Non hanno bisogno di un numero proporzionalmente maggiore di parametri, calcolo di addestramento o denaro per funzionare.
Nota che: Il valore di capacità 4.7× è una grandezza credibile. Il valore di densità 8.9× è più fragile (il gruppo avanzato del 2024 ha meno punti dati, il che amplifica il tasso di crescita di quell'anno), quindi trattalo come un segnale direzionale piuttosto che un moltiplicatore preciso.
Quale LLM ha la più alta densità di intelligenza?
La densità di intelligenza dipende da quale risorsa misuriamo e da quale gruppo di benchmark valutiamo. Il leader cambia per ogni combinazione.
Densità per parametro attivo (open-weight)
Questa vista misura quanto efficientemente un model concentra la capacità nei suoi pesi. I parametri attivi contano perché i models Mixture-of-Experts (MoE) instradano ogni token attraverso una frazione dei pesi totali. DeepSeek V3 ha 671B parametri totali ma 37B attivi per token, e il valore 37B riflette il costo di servizio effettivo.
Leader dei benchmark standard
- LLaMA 3.1 8B (lug 2024): 100.0
- LLaMA 3 8B (apr 2024): 85.0
- LLaMA 4 Maverick (apr 2025): 55.9
- Mixtral 8x7B (dic 2023): 47.4
- Mistral 7B (set 2023): 46.3
Leader dei benchmark avanzati
- Qwen 3.6-35B-A3B (apr 2026): 100.0 (3B parametri attivi; il punteggio si basa su un singolo benchmark, SWE-bench Verified al 73.4%, quindi va letto di conseguenza)
- GPT-OSS 20B (ago 2025): 85.2 (3.6B parametri attivi)
- GPT-OSS 120B (ago 2025): 64.4 (5.1B parametri attivi)
- Qwen 3.5 9B (mar 2026): 35.2 (9B parametri densi)
- DeepSeek V4 Flash (apr 2026): 26.0
La classifica dei benchmark standard non si è più mossa dalla fine del 2024 perché i benchmark si sono saturati, non perché il progresso si sia fermato. GPT-4 ha ottenuto 90.2 sui benchmark standard all'inizio del 2023 ma 17.3 sui benchmark avanzati.
Densità per FLOP di addestramento (open-weight)
Questa vista premia la cura dei dati, le scelte architetturali e le ricette di addestramento piuttosto che la spesa grezza.
Nota: la densità per FLOP sui benchmark standard sembra diminuire nel tempo. Si tratta di un artefatto di saturazione, non di un declino dell'efficienza di addestramento. I benchmark più vecchi non misurano più i guadagni recenti, quindi i punteggi di capacità si comprimono mentre il calcolo di addestramento continua a crescere.
Leader dei benchmark standard
- Mistral 7B (set 2023): 100.0 (ancora l'ancora del panel, a più di due anni di distanza)
- LLaMA 3 8B (apr 2024): 40.8
- LLaMA 1 (feb 2023): 37.0
- DeepSeek V2 (mag 2024): 32.6
- Mixtral 8x7B (dic 2023): 27.1
Leader dei benchmark avanzati
- Qwen 3.5 9B (mar 2026): 100.0
- Qwen 3.6-35B-A3B (apr 2026): 28.4
- DeepSeek V4 Flash (apr 2026): 6.4
Il risultato di Qwen 3.5 (9B) è notevole: un model denso da 9B addestrato all'incirca con 1.5 × 10²³ FLOP che ottiene 81.2 di capacità sui benchmark avanzati. Il suo calcolo di addestramento è circa un ordine di grandezza inferiore a DeepSeek V4 Pro, ma il divario di capacità è più piccolo.
Densità per dollaro di inference
La densità per dollaro è l'asse su cui i models open-weight e quelli chiusi di frontiera possono essere confrontati direttamente, perché i prezzi delle API sono verificabili pubblicamente. Usiamo i prezzi stabilizzati per il valore principale, così da riflettere i tagli successivi al lancio.
Leader dei benchmark standard
- Mistral Small 3 24B (gen 2025): 100.0 a $0,10 / $0,30 per milione di tokens tramite l'API proprietaria di Mistral
- Gemini 1.5 Flash (mag 2024): 99.3 (model chiuso con il punteggio più alto dopo il taglio di prezzo dell'agosto 2024)
- DeepSeek V2 (mag 2024): 66.0 a $0,27 / $1,10 per milione di tokens
- DeepSeek V3 (dic 2024): 30.9
- DeepSeek R1 (gen 2025): 17.8
Leader dei benchmark avanzati
- GPT-OSS 120B (ago 2025): 100.0 (il riferimento di prezzo è la mediana multi-fornitore di OpenRouter, poiché OpenAI non ha ospitato il model su un'API proprietaria)
- GPT-OSS 20B (ago 2025): 80.0
- DeepSeek V4 Flash (apr 2026): 44.0 a $0,06 / $0,42 per milione di tokens tramite l'API proprietaria di DeepSeek
- DeepSeek V3.2 (dic 2025): 22.5
- Mistral Small 3 24B (gen 2025): 20.9
- DeepSeek V4 Pro (apr 2026): 16.0 a $0,54 misti, con 97.8 di capacità sui benchmark avanzati. Questo colloca V4 Pro entro 2.2 punti di capacità da Claude Opus 4.7 a circa 1/18 del prezzo misto ($0,54 contro $10,00).
Il divario dei models chiusi di frontiera non si è ridotto
I models di ragionamento chiusi di Anthropic, OpenAI e Google si raggruppano tra 0 e 6 di densità per dollaro sui benchmark avanzati durante tutto il periodo del panel. GPT-4 nel marzo 2023 ha ottenuto 0.0. Claude Opus 4.7 nell'aprile 2026 ha ottenuto 0.9.
I laboratori chiusi hanno tagliato i prezzi assoluti:
- Claude Opus è passato da $30 a $10 per milione di tokens tra Opus 4 e Opus 4.5.
- o3 di OpenAI è passato dal prezzo di lancio di $10/$40 a $2/$8 stabilizzato.
- Gemini 1.5 Flash è diminuito di circa il 78%.
Ma il divario relativo rispetto ai leader di densità open-weight è rimasto circa da 30 a 50× durante il periodo. DeepSeek aveva un prezzo vicino a $0,18 per milione nel 2024 (V2) e vicino a $0,18 per milione nel 2026 (V4 Flash). Il prezzo minimo open-weight non si è mosso, e il minimo delle ammiraglie chiuse non si è mosso abbastanza da colmare il divario. La concorrenza sui prezzi sta avvenendo nella fascia della generazione precedente, dove i models chiusi più vecchi vengono mantenuti in vita come alternative economiche, non alla frontiera.
La nuova direzione: benchmark agentici
I benchmark avanzati utilizzati per misurare le prestazioni dell'IA stanno iniziando a perdere efficacia, come le vecchie suite di test che hanno sostituito. I laboratori hanno iniziato a riportare benchmark agentici (SWE-Bench Pro, SWE-bench Verified, Terminal-Bench, OSWorld-Verified, Finance Agent) invece dei vecchi test di ragionamento. Abbiamo iniziato a costruire un panel per monitorare questo cambiamento.
Ad esempio, il più recente model di frontiera, Claude Opus 4.8, riporta i suoi risultati quasi interamente su questi agentici LLM benchmark, senza punteggi sui benchmark di ragionamento monitorati dal nostro panel principale.
Tasso di risoluzione di SWE-Bench Pro per data di rilascio, valutato sull'harness standardizzato SEAL di Scale. Tra i models tracciati:
- I migliori models chiusi: Claude Fable 5 (80.3%),Claude Opus 4.5 (45.9%), Claude Sonnet 4.5 (43.6%) e Gemini 3 Pro Preview (43.3%).
- I migliori models open-weight: GLM 5.2 (62.1%), Qwen3-Coder-480B-A35B (38.7%), Kimi K2 Instruct (27.7%) e Qwen3-235B-A22B (21.4%).
Esplora i benchmark agentici consultando benchmark di programmazione agentica, ricerca agentica e monitoraggio agentico.
Difficoltà nel confrontare le prestazioni agentiche
Valutare e confrontare i risultati dei benchmark agentici presenta diverse difficoltà fondamentali:
- Attenzione alle metriche di capacità: Possiamo mostrare i punteggi di capacità, perché i dati sulle risorse necessari per misurare la densità (numero di parametri, calcolo di addestramento e prezzi verificati per model) restano incompleti o non divulgati dai laboratori chiusi.
- Sensibilità a livello di sistema: I punteggi dei benchmark misurano l'intero sistema, non solo l'IA model. Poiché i punteggi dipendono fortemente dallo "scaffolding" (il framework software circostante), lo stesso model può produrre risultati molto diversi a seconda dello specifico agent harness utilizzato.
- Protocollo di standardizzazione: Per garantire un confronto equo, questo report traccia esclusivamente i dati SWE-Bench Pro provenienti da un unico ambiente standardizzato (la leaderboard SEAL di Scale). Altri punteggi riportati dai laboratori usano harness diversi e non sono direttamente confrontabili.
- Esclusione di Claude Opus 4.8: Sebbene Opus 4.8 auto-dichiari un massimo record del 69.2% su SWE-Bench Pro, è stato testato sull'harness interno di Anthropic e non è ancora stato valutato da SEAL di Scale. Per mantenere una rigorosa coerenza dei dati, annotiamo il suo punteggio qui invece di tracciarlo nel grafico.
SWE-Bench Pro dall'harness standardizzato SEAL di Scale. Le altre colonne sono riportate dai laboratori su harness diversi e non sono direttamente confrontabili tra le righe. I trattini indicano che non è stato trovato alcun punteggio verificato.
Questi tre hanno girato sull'harness mini-swe-agent, quindi sono esclusi dal grafico a dispersione per mantenerlo confrontabile.
Metodologia della densità di intelligenza
Copertura del panel
- Models: 71 LLMs rilasciati da febbraio 2023 ad aprile 2026. 37 models hanno punteggi sui benchmark standard e 54 hanno punteggi sui benchmark avanzati. I models senza un gruppo di benchmark completo sono esclusi dal calcolo della densità di quel gruppo.
- Benchmark: 10 benchmark pubblici, tutti riportati dai laboratori e riconducibili a una fonte primaria. Non abbiamo rieseguito alcun benchmark.
- Risorse: Per ogni model, abbiamo diviso il suo punteggio di capacità per tre risorse indipendentemente:
- Parametri attivi: Un proxy per la memoria e il costo di servizio. Limitato ai models open-weight, perché i laboratori closed-weight (OpenAI, Anthropic, Google) non divulgano il numero di parametri.
- Calcolo di addestramento (FLOP): Un proxy per l'efficienza di addestramento. Anch'esso limitato ai models open-weight. Le cifre FLOP sono per lo più stime di Epoch IA e vanno lette come indicative.
- Prezzo di inference: Il prezzo che un acquirente paga effettivamente all'API. La capacità viene divisa per il prezzo misto per milione di tokens con un rapporto input-output di 3:1. Partecipano sia i models aperti sia quelli chiusi, perché i prezzi delle API sono verificabili pubblicamente.
Perché due gruppi di benchmark?
I models rilasciati nel 2024 hanno saturato i benchmark standard che i laboratori di IA usavano dal 2020. Una volta che i models di frontiera raggiungono 90% o più su un benchmark, il test non distingue più i models forti da quelli più forti. I laboratori hanno risposto introducendo benchmark più difficili.
Trattiamo questo cambiamento come una rottura netta per due motivi:
- In primo luogo, mescolare benchmark facili e difficili all'interno di un singolo punteggio di capacità permetterebbe a un punteggio saturato su un benchmark facile di mascherare un punteggio basso su uno difficile. Un model che ottiene 85 su MMLU-Pro è più forte di uno che ottiene 85 su MMLU. Trattare i due come equivalenti comprime l'intervallo di punteggio e premia i benchmark più vecchi.
- In secondo luogo, le due suite hanno distribuzioni di punteggio diverse: i benchmark standard si concentrano nella parte alta (la maggior parte dei models di frontiera sopra 85), mentre i benchmark avanzati hanno una diffusione più ampia (models migliori intorno a 90, fascia media intorno a 50, models più deboli sotto 30). Applicare lo z-score a entrambi contemporaneamente distorcerebbe la stima della varianza.
Calcoliamo la capacità per ciascun gruppo in modo indipendente:
- Benchmark standard (2023–2024): MMLU (5-shot), GSM8K (8-shot catena di pensiero), HellaSwag (10-shot), ARC Challenge (25-shot), HumanEval (0-shot pass@1).
- Benchmark avanzati (2024–2026): MMLU-Pro, GPQA Diamond, AIME 2025, LiveCodeBench, SWE-bench Verified.
Un punteggio di 90 sui benchmark standard non è equivalente a 90 sui benchmark avanzati. Per qualsiasi model rilasciato dalla fine del 2024 in poi, i benchmark avanzati sono il riferimento significativo.
Formula della capacità
Per ogni benchmark b e ogni model m:
Utilizziamo la deviazione standard della popolazione (divide per N, non N−1). Questo corrisponde al calcolo originale di pandas con ddof=0 e garantisce che l'aggiunta di un singolo nuovo model non modifichi retroattivamente la stima della varianza.
Calcoliamo quindi la media degli z-score disponibili per ciascun model all'interno di ciascun gruppo di benchmark e riscaliamo con min-max su un punteggio relativo al panel da 0 a 100.
Formula della densità
Per ogni vista di densità:
Il denominatore cambia per ogni vista: parametri attivi in miliardi, FLOP di addestramento diviso per 10²⁴, oppure prezzo misto per milione di tokens.
Metodologia dell'indice concatenato
I due grafici indice all'inizio dell'articolo (Densità di intelligenza e Capacità) mostrano una crescita cumulativa a linea singola indicizzata a 100 nel 2023, sul modello del formato di rendimento cumulativo dell'S&P 500. Concateniamo i tassi di crescita anno su anno attraverso la transizione dei benchmark invece di tracciare valori assoluti.
Passaggio 1. Calcoliamo la media annuale della metrica per ciascun gruppo di benchmark:
Per l'indice di densità di intelligenza, la metrica è la media per riga dei tre punteggi di densità per model (Densità combinata A o B). Per l'indice di capacità, la metrica è il punteggio di capacità relativo al panel (Capability_A o Capability_B).
Passaggio 2. Per ogni transizione da un anno all'altro, calcoliamo la crescita all'interno di un singolo gruppo di benchmark. Entrambi gli anni devono provenire dallo stesso gruppo:
Passaggio 3. Concateniamo moltiplicativamente da una baseline del 2023 di 100:
Selezione del gruppo per ogni transizione:
- 2023 – 2024: Benchmark standard (Avanzati ha 1 model nel 2023, troppo pochi per calcolare una media stabile)
- 2024 – 2025: Benchmark avanzati (Standard saturato alla fine del 2024; Avanzati ha 16 models nel 2024 e 27 nel 2025)
- 2025 – 2026: Benchmark avanzati (Standard non riportato per il 2026)
L'indice concatenato presuppone che le popolazioni sottostanti siano confrontabili tra gli anni all'interno di un gruppo. Il nostro panel è eterogeneo (models diversi ogni anno, con copertura di benchmark diversa), quindi i valori concatenati vanno letti al meglio come sintesi direzionale piuttosto che come moltiplicatore preciso.
Principi fondamentali di valutazione per la misurazione della densità di intelligenza
- Benchmark standard del settore: Non introduciamo alcun benchmark personalizzato.
- Fonti primarie: Ogni punteggio di benchmark è riconducibile al paper di rilascio del model, alla model card o all'annuncio ufficiale. Quando la fonte primaria non riportava un benchmark, la cella è vuota anziché imputata.
- Flag di copertura (N): Per ogni model riportiamo il numero di benchmark che contribuiscono al suo punteggio di capacità in ciascun gruppo. I models con N=1 ricevono un punteggio più rumoroso rispetto ai models con N=5. Il caso N=1 si applica a Qwen 3.6 35B A3B (SWE-bench Verified) e ad alcune release ammiraglie chiuse del 2026.
Fonti di prezzo per i models closed-weight
Il prezzo è la parte dell'indice più sensibile alla coorte. Usiamo la seguente gerarchia:
- Annuncio di lancio del laboratorio (preferito): Prezzo indicato nel post di lancio del laboratorio, nella documentazione dell'API o nella copertura stampa contemporanea.
- Mediana multi-fornitore di Artificial Analysis (riserva per i models con pesi): Utilizzata per tre righe di Llama 3.1 (8B, 70B, 405B) e per le righe GPT-OSS, perché non esiste un'API di prima parte.
- Pesi senza copertura: 22 righe su 69 non hanno un prezzo per dollaro registrato. Compaiono nei grafici di capacità e per parametro, ma sono assenti dai grafici per dollaro.
Tracciamo due serie di prezzi: prezzo di lancio (prezzo di prima parte il giorno del rilascio) e prezzo stabilizzato (prezzo attuale di prima parte, o l'ultimo prima della deprecazione). Sei models nel panel sono stati riprezzati dopo il lancio:
- Gemini 1.5 Pro: $3,50/$10,50 a $1,25/$5,00 (ottobre 2024)
- GPT-4o: $5,00/$15,00 a $2,50/$10,00 (ottobre 2024)
- Gemini 1.5 Flash: $0,35/$1,05 a $0,075/$0,30 (agosto 2024)
- Claude 3.5 Haiku: $1,00/$5,00 a $0,80/$4,00 (dicembre 2024)
- o3: $10,00/$40,00 a $2,00/$8,00 (giugno 2025)
La densità per dollaro principale utilizza la tariffazione stabilizzata. Per 37 delle 43 righe con prezzo, i prezzi di lancio e stabilizzati sono identici.
Frequenza di aggiornamento
Aggiorniamo l'indice mensilmente. Ogni aggiornamento aggiunge nuove righe di models per ogni rilascio di frontiera o degno di nota nel mese precedente, aggiorna i prezzi dove i laboratori hanno modificato le tariffe, recupera i benchmark appena riportati per le righe esistenti e ricalcola gli z-score sull'intero panel. Le nuove voci di model spostano la media e la deviazione standard di ciascun benchmark, quindi i punteggi esistenti da 0 a 100 si muovono con il panel. Le istantanee storiche vengono preservate.
Limiti della valutazione della densità di intelligenza
- Ottimismo riportato dai laboratori: I punteggi dei benchmark provengono dai laboratori stessi. Le riesecuzioni indipendenti in genere risultano da 5 a 13 punti più basse. Le linee di tendenza sono informativamente direzionali ma non puntualmente precise.
- Modalità di ragionamento e non ragionamento non separate: I models rilasciati nel 2025 e nel 2026 supportano impostazioni di pensiero esteso che possono spostare i punteggi di matematica e programmazione da 5 a 15 punti. Usiamo i punteggi in modalità predefinita dove identificabili.
- Le cifre FLOP di addestramento sono per lo più stime: Una manciata di righe ha FLOP confermati dal laboratorio. Il resto è estrapolato da parametri e tokens di addestramento divulgati, per lo più tramite Epoch IA.
- Numero di parametri dei models chiusi sconosciuto: La densità per parametro e per FLOP è vuota per le righe di frontiera chiuse. I models chiusi partecipano alla densità per dollaro.
- Punteggi relativi al panel: I punteggi di densità sono riscalati min-max all'interno del panel. Un nuovo model con un rapporto grezzo più alto sposta il punteggio 0–100 di ogni model esistente. Per confrontare versioni del panel, usare i rapporti grezzi sottostanti piuttosto che i punteggi riscalati.
Che cos'è la densità di intelligenza?
La densità di intelligenza rappresenta una nuova metrica per valutare quanta conoscenza e capacità di ragionamento un model può concentrare in una singola unità di memoria o di calcolo. Misura l'architettura del model valutando quanto efficacemente utilizza ciascun parametro per generare valore.
In questo framework, l'asse x rappresenta spesso il numero di parametri del model mentre l'asse y traccia le prestazioni su compiti difficili. Un'alta densità si verifica quando i models dimostrano capacità superiori senza richiedere il massiccio costo computazionale associato ai models più grandi. Questo processo dimostra che l'intelligenza non dipende solo dalla quantità di dati o dalla scala di addestramento, ma piuttosto da come il software e gli algoritmi organizzano tali informazioni.
In passato, la comunità IA si era affidata alla scalabilità dei parametri del model per raggiungere prestazioni più elevate, il che ha prodotto sistemi enormi e ad alto consumo di risorse. Con questo cambio di focus, l'ottimizzazione algoritmica è privilegiata rispetto al volume grezzo per produrre più intelligenza da models più piccoli.
Perché è importante misurare la densità di intelligenza?
I sistemi efficienti devono ottimizzare il tempo di inference e l'uso della memoria. Identificare il punto in cui più tokens o calcolo aggiuntivo non producono più guadagni significativi aiuta il settore a comprendere i limiti superiori degli attuali large language models. Le principali ragioni per misurare la densità di intelligenza possono essere riassunte come:
- La comunità IA sottovaluta il sovraccarico a lungo termine del mantenimento di models sovradimensionati nei data center.
- La creazione di valore nelle applicazioni pratiche dipende dal rapporto tra qualità dell'output e potenza richiesta per produrlo.
- La Legge di Moore per l'hardware non può sostenere la crescita dei language models senza progressi corrispondenti nel modo in cui li ottimizziamo.
- L'apprendimento per rinforzo e una migliore distribuzione dei dati consentono agli strumenti di prossima generazione di raggiungere benchmark un tempo riservati solo agli umani. Scopri di più sull'apprendimento per rinforzo e su altri tipi di tecniche di LLM fine-tuning .
Sebbene i models più grandi contino ancora per esplorare nuove frontiere, la densità di un sistema determina la sua utilità effettiva nel mondo reale. Questo contesto aiuta a vedere l'intelligenza come un risultato concentrato dell'addestramento piuttosto che un sottoprodotto della pura dimensione.
Ulteriori letture
La densità di intelligenza è un modo per confrontare gli LLMs. Altre dimensioni sono trattate in analisi separate:
- Benchmark di latenza: Per il tempo al primo token e i tokens al secondo, consulta il nostro LLM latency benchmark.
- Benchmark per compito: Per il ragionamento finanziario consulta il nostro finance LLM benchmark. Per la programmazione consulta il nostro IA coding benchmark.
Cita questo benchmark
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{simsek2026,
author = {Şimşek, Hazal},
title = {{Densità di intelligenza di 71 LLMs per models più intelligenti e più densi}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/intelligence-density}},
note = {AIMultiple. Consultato il 7 Luglio 2026}
}Risultati e timestamp di 91 punti dati. Scarica i dati utilizzati in questo articolo come file ZIP contenente 3 file CSV e un README.
Sii il primo a commentare
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.