Servizi
Contattaci

Densità di intelligenza di 71 LLMs: Modelli più intelligenti e densi

Hazal Şimşek
Hazal Şimşek
aggiornato il 7 lug. 2026

Abbiamo monitorato 71 LLM rilasciati tra febbraio 2023 e maggio 2026 e raccolto 10 benchmark pubblici per misurare la densità di intelligenza. Abbiamo diviso il punteggio di capacità per la risorsa consumata dal modello (parametri attivi, calcolo di addestramento e prezzo di inferenza).

Loading Chart

LLM: panoramica della densità di intelligenza

Per calcolare la densità di intelligenza, abbiamo eseguito i seguenti passaggi:

  • Efficienza delle risorse: Abbiamo diviso la capacità di ciascun modello per due metriche di risorsa:
    • Parametri attivi: un proxy per il costo di memoria e di servizio (solo modelli a pesi aperti).
    • Prezzo di inferenza: efficienza in termini di costo di mercato basata sul prezzo medio ponderato delle API per milione di token.
    • Nota sul calcolo di addestramento (FLOP): Inizialmente avevamo incluso un terzo asse, il calcolo di addestramento (FLOP), ma lo abbiamo rimosso perché la sua pendenza negativa sui benchmark Standard saturi ha portato la composita 2023-2024 in un calo controintuitivo.
  • Raggruppamento dei benchmark: Per evitare che la saturazione del punteggio mascherasse i miglioramenti di efficienza, abbiamo valutato le capacità in due distinte epoche di benchmark:
    • Benchmark standard (2023–2024): MMLU (5-shot), GSM8K (8-shot CoT), HellaSwag (10-shot), ARC Challenge (25-shot), HumanEval (0-shot pass@1).
    • Benchmark avanzati (2024–2026): MMLU-Pro, GPQA Diamond, AIME 2025, LiveCodeBench, SWE-bench Verified.
  • Indicizzazione a catena: Abbiamo calcolato la crescita anno su anno all'interno di gruppi di benchmark corrispondenti e li abbiamo concatenati moltiplicativamente da una base 2023 di 100 per tracciare il trend cumulativo.

Vedi metodologia per l'approccio di scoring e le suddivisioni per risorsa.

LLM: risultati sulla densità di intelligenza

Entro metà 2026, l'ecosistema IA ha fornito quasi 15× più intelligenza per unità di risorsa (parametri e dollari) rispetto alla base 2023. Due cose da notare leggendo il trend:

  • Il salto 2024–2025 (+362%) sovrastima il guadagno reale: I benchmark Avanzati erano nuovi nel 2024 e pochi modelli avevano punteggi su di essi, quindi la base 2024 è artificialmente bassa. La maggior parte del “balzo” è dovuta al riempimento del pannello, non a un salto di efficienza di un anno.
  • Il guadagno 2025–2026 (+105%) è dove si trova la vera storia: È misurato su molti più modelli ed è trainato da rilasci a pesi aperti di piccole dimensioni come Qwen 3.6-35B-A3B e DeepSeek V4 Flash che eguagliano la capacità dei modelli chiusi di frontiera a una frazione della dimensione e del costo.

LLM: capacità

Il grafico della densità mostra l'efficienza. Per contestualizzarlo, abbiamo anche misurato la capacità grezza nello stesso periodo: quanto sono diventati più intelligenti questi modelli prima di qualsiasi aggiustamento per le risorse?

Capacità indicizzata a 100 nel 2023, media di tutti i modelli rilasciati ogni anno.

Assi e tooltip funzionano come nel grafico della densità, con l'asse Y che traccia le prestazioni grezze dei benchmark anziché la densità.

Un punteggio di capacità di 100 nel 2023 è cresciuto fino a 468 entro il 2026, circa un miglioramento di 4.7×. Anno per anno:

  • 2024 (+88%): Progressi rapidi sui benchmark standard prima che diventassero saturi.
  • 2025 (+105%): Stesso progresso rapido, misurato sui benchmark avanzati più difficili che hanno sostituito quelli standard.
  • 2026 (+22%): Il rallentamento è un segnale precoce che anche i benchmark avanzati stanno iniziando a saturarsi.

Mettendo i due grafici fianco a fianco:

  • La capacità è cresciuta 4.7× mentre la densità di intelligenza è cresciuta 8.9×.
  • I modelli sono diventati più intelligenti e più efficienti allo stesso tempo. Non hanno bisogno di proporzionalmente più parametri, calcolo di addestramento o denaro per funzionare.

Nota che: Il dato di capacità 4.7× è una grandezza credibile. Il dato di densità 8.9× è più fragile (il gruppo avanzato 2024 ha meno punti dati, il che amplifica il tasso di crescita di quell'anno), quindi trattalo come un segnale direzionale piuttosto che come un moltiplicatore preciso.

Quale LLM ha la densità di intelligenza più elevata?

La densità di intelligenza dipende da quale risorsa misuriamo e su quale gruppo di benchmark valutiamo. Il leader cambia per ogni combinazione.

Densità per parametro attivo (solo modelli a pesi aperti)

Questa vista misura quanto efficientemente un modello concentra la capacità nei propri pesi. I parametri attivi contano perché i modelli Mixture-of-Experts (MoE) instradano ogni token attraverso una frazione del totale dei pesi. DeepSeek V3 ha 671B parametri totali ma 37B attivi per token, e la cifra 37B riflette il costo di servizio effettivo.

Leader nei benchmark standard

  • LLaMA 3.1 8B (Lug 2024): 100.0
  • LLaMA 3 8B (Apr 2024): 85.0
  • LLaMA 4 Maverick (Apr 2025): 55.9
  • Mixtral 8x7B (Dic 2023): 47.4
  • Mistral 7B (Set 2023): 46.3

Leader nei benchmark avanzati

  • Qwen 3.6-35B-A3B (Apr 2026): 100.0 (3B parametri attivi; il punteggio si basa su un singolo benchmark, SWE-bench Verified al 73.4%, quindi leggi di conseguenza)
  • GPT-OSS 20B (Ago 2025): 85.2 (3.6B parametri attivi)
  • GPT-OSS 120B (Ago 2025): 64.4 (5.1B parametri attivi)
  • Qwen 3.5 9B (Mar 2026): 35.2 (9B parametri densi)
  • DeepSeek V4 Flash (Apr 2026): 26.0

La classifica dei benchmark standard ha smesso di muoversi dalla fine del 2024 perché i benchmark sono saturi, non perché il progresso si sia fermato. GPT-4 ha ottenuto 90.2 nei benchmark standard all'inizio del 2023 ma 17.3 nei benchmark avanzati.

Densità per FLOP di addestramento (solo modelli a pesi aperti)

Questa vista premia la cura dei dati, le scelte architetturali e le ricette di addestramento piuttosto che la spesa grezza.

Nota: la densità per FLOP nei benchmark standard sembra calare nel tempo. Si tratta di un artefatto da saturazione, non di un declino dell'efficienza di addestramento. I benchmark più vecchi non misurano più i guadagni recenti, quindi i punteggi di capacità si comprimono mentre il calcolo di addestramento continua a crescere.

Leader nei benchmark standard

  • Mistral 7B (Set 2023): 100.0 (ancora l’ancora del pannello, dopo più di due anni)
  • LLaMA 3 8B (Apr 2024): 40.8
  • LLaMA 1 (Feb 2023): 37.0
  • DeepSeek V2 (Mag 2024): 32.6
  • Mixtral 8x7B (Dic 2023): 27.1

Leader nei benchmark avanzati

  • Qwen 3.5 9B (Mar 2026): 100.0
  • Qwen 3.6-35B-A3B (Apr 2026): 28.4
  • DeepSeek V4 Flash (Apr 2026): 6.4

Il risultato di Qwen 3.5 (9B) è notevole: un modello denso da 9B addestrato con circa 1.5 × 10²³ FLOP che totalizza 81.2 di capacità nei benchmark avanzati. Il suo calcolo di addestramento è circa un ordine di grandezza inferiore a DeepSeek V4 Pro, ma il divario di capacità è minore.

Densità per dollaro di inferenza

La densità per dollaro è l'asse in cui i modelli a pesi aperti e quelli di frontiera chiusa possono essere confrontati direttamente, poiché i prezzi delle API sono pubblicamente verificabili. Utilizziamo i prezzi correnti per il dato principale, quindi i tagli successivi al lancio sono già riflessi.

Leader nei benchmark standard

  • Mistral Small 3 24B (Gen 2025): 100.0 a $0.10 / $0.30 per milione di token tramite l'API di prima parte di Mistral
  • Gemini 1.5 Flash (Mag 2024): 99.3 (modello a pesi chiusi con il punteggio più alto dopo il taglio di prezzo dell'agosto 2024)
  • DeepSeek V2 (Mag 2024): 66.0 a $0.27 / $1.10 per milione di token
  • DeepSeek V3 (Dic 2024): 30.9
  • DeepSeek R1 (Gen 2025): 17.8

Leader nei benchmark avanzati

  • GPT-OSS 120B (Ago 2025): 100.0 (il riferimento di prezzo è la mediana cross-provider di OpenRouter, poiché OpenAI non ha ospitato il modello su un'API di prima parte)
  • GPT-OSS 20B (Ago 2025): 80.0
  • DeepSeek V4 Flash (Apr 2026): 44.0 a $0.06 / $0.42 per milione di token tramite l'API di prima parte di DeepSeek
  • DeepSeek V3.2 (Dic 2025): 22.5
  • Mistral Small 3 24B (Gen 2025): 20.9
  • DeepSeek V4 Pro (Apr 2026): 16.0 a un prezzo medio di $0.54, con 97.8 di capacità avanzata. Questo pone V4 Pro a 2.2 punti di capacità da Claude Opus 4.7 a circa 1/18 del prezzo medio ($0.54 contro $10.00).

Il divario con i modelli di frontiera chiusi non si è ridotto

I modelli di ragionamento chiusi di Anthropic, OpenAI e Google si raggruppano tra 0 e 6 nella densità per dollaro sui benchmark avanzati durante tutto il periodo. GPT-4 nel marzo 2023 ha ottenuto 0.0. Claude Opus 4.7 nell'aprile 2026 ha ottenuto 0.9.

I laboratori chiusi hanno ridotto i prezzi assoluti:

  • Claude Opus è sceso da $30 a $10 per milione di token tra Opus 4 e Opus 4.5.
  • o3 di OpenAI è sceso da $10/$40 al lancio a $2/$8 correnti.
  • Gemini 1.5 Flash è sceso all'incirca del 78%.

Ma il divario relativo con i leader di densità a pesi aperti è rimasto all'incirca da 30 a 50× durante tutto il periodo. DeepSeek aveva un prezzo intorno a $0.18 per milione nel 2024 (V2) e intorno a $0.18 per milione nel 2026 (V4 Flash). Il prezzo minimo dei modelli a pesi aperti non si è mosso, e il prezzo minimo dei modelli di frontiera chiusi non si è mosso abbastanza per colmare il divario. La competizione sui prezzi sta avvenendo nella fascia della generazione precedente, dove vecchi modelli chiusi vengono mantenuti in vita come alternative economiche, non sulla frontiera.

La nuova direzione: benchmark agentici

I benchmark avanzati usati per misurare le prestazioni dell'IA stanno iniziando a perdere efficacia, come le suite più vecchie che hanno sostituito. I laboratori hanno iniziato a riportare benchmark agentici (SWE-Bench Pro, SWE-bench Verified, Terminal-Bench, OSWorld-Verified, Finance Agent) invece dei vecchi test di ragionamento. Abbiamo iniziato a costruire un panel per tracciare questo cambiamento.

Ad esempio, il più recente modello di frontiera, Claude Opus 4.8, riporta i suoi risultati quasi interamente su questi benchmark agentici di LLM, senza alcun punteggio sui benchmark di ragionamento monitorati dal nostro panel principale.

Tasso di risoluzione SWE-Bench Pro per data di rilascio, valutato sull'harness standardizzato SEAL di Scale. Tra i modelli tracciati:

  • I migliori a pesi chiusi: Claude Fable 5 (80.3%),Claude Opus 4.5 (45.9%), Claude Sonnet 4.5 (43.6%) e Gemini 3 Pro Preview (43.3%).
  • I migliori a pesi aperti: GLM 5.2 (62.1%), Qwen3-Coder-480B-A35B (38.7%), Kimi K2 Instruct (27.7%) e Qwen3-235B-A22B (21.4%).

Esplora i benchmark agentici consultando benchmark di coding agentico, ricerca agentica e monitoraggio agentico.

Sfide nel confrontare le prestazioni agentiche

Valutare e confrontare i risultati dei benchmark agentici presenta diverse difficoltà chiave:

  • Focus sulle metriche di capacità: Possiamo visualizzare i punteggi di capacità, perché i dati sulle risorse necessari per misurare la densità (conteggio dei parametri, calcolo di addestramento e prezzi verificati per modello) rimangono incompleti o non divulgati dai laboratori chiusi.
  • Sensibilità a livello di sistema: I punteggi dei benchmark misurano l'intero sistema, non solo il modello di IA. Poiché i punteggi dipendono fortemente dallo "scaffolding" (il framework software circostante), lo stesso modello può produrre risultati molto diversi a seconda dello specifico agent harness utilizzato.
  • Protocollo di standardizzazione: Per garantire un confronto equo, questo report traccia esclusivamente i dati SWE-Bench Pro da un unico ambiente standardizzato (la classifica SEAL di Scale). Altri punteggi riportati dai laboratori utilizzano harness diversi e non sono direttamente confrontabili.
  • Esclusione di Claude Opus 4.8: Sebbene Opus 4.8 dichiari un 69.2% su SWE-Bench Pro, un record, è stato testato sull'harness interno di Anthropic e non è ancora stato valutato da SEAL di Scale. Per mantenere una rigorosa coerenza dei dati, segnaliamo il suo punteggio qui anziché tracciarlo.

SWE-Bench Pro dall'harness standardizzato SEAL di Scale. Le altre colonne sono riportate dai laboratori su harness diversi e non sono direttamente confrontabili tra le righe. I trattini indicano che non è stato trovato un punteggio verificato.

Questi tre sono stati eseguiti con l'harness mini-swe-agent, quindi sono esclusi dal grafico a dispersione per mantenere la comparabilità.

Lascia che il nostro team automatizzi uno dei tuoi processi aziendali con agenti IA, gratuitamente.
Automatizza un processo

Metodologia della densità di intelligenza

Copertura del pannello

  • Modelli: 71 LLM rilasciati da febbraio 2023 ad aprile 2026. 37 modelli hanno punteggi sui benchmark standard e 54 hanno punteggi sui benchmark avanzati. I modelli senza un gruppo di benchmark completo sono esclusi dai calcoli di densità di quel gruppo.
  • Benchmark: 10 benchmark pubblici, tutti riportati dai laboratori e tracciabili a una fonte primaria. Non abbiamo rieseguito alcun benchmark.
  • Risorse: Per ciascun modello, abbiamo diviso il suo punteggio di capacità per tre risorse indipendentemente:
    • Parametri attivi: Un proxy per il costo di memoria e di servizio. Limitato ai modelli a pesi aperti, perché i laboratori a pesi chiusi (OpenAI, Anthropic, Google) non divulgano il conteggio dei parametri.
    • Calcolo di addestramento (FLOP): Un proxy per l'efficienza di addestramento. Limitato anch'esso ai modelli a pesi aperti. Le cifre FLOP sono per lo più stime di Epoch IA e vanno lette come direzionali.
    • Prezzo di inferenza: Il prezzo che un acquirente paga effettivamente all'API. La capacità è divisa per il prezzo medio ponderato per milione di token con un rapporto input-to-output di 3:1. Partecipano sia i modelli aperti che quelli chiusi, perché i prezzi delle API sono pubblicamente verificabili.

Perché due gruppi di benchmark?

I modelli rilasciati nel 2024 hanno saturato i benchmark standard che i laboratori di IA usavano dal 2020. Una volta che i modelli di frontiera raggiungono il 90% o più su un benchmark, il test non separa più modelli forti da modelli più forti. I laboratori hanno risposto introducendo benchmark più difficili.

Trattiamo questo cambiamento come un taglio netto per due ragioni:

  • Primo, mescolare benchmark facili e difficili all'interno di un unico punteggio di capacità lascerebbe che un punteggio saturo su un benchmark facile mascheri un punteggio basso su uno difficile. Un modello che totalizza 85 su MMLU-Pro è più forte di uno che totalizza 85 su MMLU. Trattare i due come equivalenti comprime l'intervallo di punteggio e premia i benchmark più vecchi.
  • Secondo, le due suite hanno distribuzioni di punteggio diverse: i benchmark standard si raggruppano in alto (la maggior parte dei modelli di frontiera sopra 85), mentre i benchmark avanzati hanno una dispersione più ampia (i migliori modelli intorno a 90, fascia media intorno a 50, modelli più deboli sotto 30). Calcolare lo z-score su entrambi contemporaneamente distorcerebbe la stima della varianza.

Calcoliamo la capacità per ciascun gruppo indipendentemente:

  • Benchmark standard (2023–2024): MMLU (5-shot), GSM8K (8-shot chain of thought), HellaSwag (10-shot), ARC Challenge (25-shot), HumanEval (0-shot pass@1).
  • Benchmark avanzati (2024–2026): MMLU-Pro, GPQA Diamond, AIME 2025, LiveCodeBench, SWE-bench Verified.

Un punteggio di 90 sui benchmark standard non equivale a 90 sui benchmark avanzati. Per qualsiasi modello rilasciato dalla fine del 2024 in poi, i benchmark avanzati sono il riferimento significativo.

Formula della capacità

Per ciascun benchmark b e ciascun modello m:

Utilizziamo la deviazione standard della popolazione (divide per N, non per N−1). Questo corrisponde al calcolo originale di pandas con ddof=0 e garantisce che l'aggiunta di un singolo nuovo modello non sposti retroattivamente la stima della varianza.

Successivamente calcoliamo la media dei punteggi z disponibili per modello all'interno di ciascun gruppo di benchmark e riscaliamo con min-max per ottenere un punteggio relativo al panel da 0 a 100.

Formula della densità

Per ciascuna vista di densità:

Il denominatore cambia in base alla vista: parametri attivi in miliardi, FLOP di addestramento diviso per 10²⁴, o prezzo medio ponderato per milione di token.

Metodologia dell'indice a catena

I due grafici a indice all'inizio dell'articolo (Densità di intelligenza e Capacità) mostrano una crescita cumulativa a singola linea indicizzata a 100 nel 2023, modellata sul formato di rendimento cumulativo dell’S&P 500. Concateniamo i tassi di crescita anno su anno attraverso la transizione dei benchmark, invece di tracciare valori assoluti.

Passo 1. Calcola la media annuale della metrica per ciascun gruppo di benchmark:

Per l'Indice di Densità di intelligenza, la metrica è la media per riga dei tre punteggi di densità per modello (Densità Combinata A o B). Per l'Indice di Capacità, la metrica è il punteggio di capacità relativo al panel (Capacità_A o Capacità_B).

Passo 2. Per ogni transizione anno su anno, calcola la crescita all'interno di un singolo gruppo di benchmark. Entrambi gli anni devono appartenere allo stesso gruppo:

Passo 3. Concatena moltiplicativamente da una base 2023 di 100:

Selezione del gruppo per transizione:

  • 2023 – 2024: Benchmark standard (il gruppo Avanzati ha 1 modello nel 2023, troppo poco per calcolare una media stabile)
  • 2024 – 2025: Benchmark avanzati (i benchmark standard sono saturati a fine 2024; gli Avanzati hanno 16 modelli nel 2024 e 27 nel 2025)
  • 2025 – 2026: Benchmark avanzati (i benchmark standard non sono riportati per il 2026)

L'indice a catena assume che le popolazioni sottostanti siano comparabili tra gli anni all'interno di un gruppo. Il nostro pannello è eterogeneo (modelli diversi ogni anno, con copertura di benchmark diversa), quindi i valori concatenati vanno letti come un riassunto direzionale piuttosto che come un moltiplicatore preciso.

Principi fondamentali di valutazione per la misurazione della densità di intelligenza

  • Benchmark standard del settore: Non introduciamo alcun benchmark personalizzato.
  • Fonti primarie: Ogni punteggio di benchmark è tracciabile al documento di rilascio del modello, alla scheda del modello o all'annuncio ufficiale. Laddove la fonte primaria non abbia riportato un benchmark, la cella è vuota anziché imputata.
  • Indicazioni di copertura (N): Per ciascun modello riportiamo il numero di benchmark che contribuiscono al suo punteggio di capacità in ciascun gruppo. I modelli con N=1 ricevono un punteggio più rumoroso rispetto a quelli con N=5. Il caso N=1 si applica a Qwen 3.6 35B A3B (solo SWE-bench Verified) e ad alcuni rilasci flagship chiusi del 2026.

Fonti di prezzo per i modelli a pesi chiusi

I prezzi sono la parte più sensibile alla coorte dell'indice. Utilizziamo la seguente gerarchia:

  1. Annuncio di lancio del laboratorio (preferito): Prezzo indicato nel post di lancio del laboratorio, nella documentazione delle API o nella copertura stampa contemporanea.
  2. Mediana cross-provider di Artificial Analysis (alternativa per soli pesi): Utilizzata per tre righe Llama 3.1 (8B, 70B, 405B) e per le righe GPT-OSS, perché non esiste un'API di prima parte.
  3. Solo pesi senza copertura: 22 delle 69 righe non hanno un prezzo per dollaro registrato. Appaiono nei grafici di capacità e per parametro ma sono assenti dai grafici per dollaro.

Monitoriamo due tracce di prezzo: prezzo di lancio (prezzo di prima parte il giorno del rilascio) e prezzo corrente (prezzo attuale di prima parte, o l'ultimo prima della dismissione). Sei modelli nel pannello sono stati riprezzati dopo il lancio:

  • Gemini 1.5 Pro: $3.50/$10.50 a $1.25/$5.00 (ottobre 2024)
  • GPT-4o: $5.00/$15.00 a $2.50/$10.00 (ottobre 2024)
  • Gemini 1.5 Flash: $0.35/$1.05 a $0.075/$0.30 (agosto 2024)
  • Claude 3.5 Haiku: $1.00/$5.00 a $0.80/$4.00 (dicembre 2024)
  • o3: $10.00/$40.00 a $2.00/$8.00 (giugno 2025)

La densità per dollaro principale utilizza i prezzi correnti. Per 37 delle 43 righe con prezzo, i prezzi di lancio e correnti sono identici.

Cadenza di aggiornamento

Aggiorniamo l'indice mensilmente. Ogni aggiornamento aggiunge nuove righe di modelli per ogni rilascio di frontiera o notevole del mese precedente, aggiorna i prezzi dove i laboratori hanno modificato le tariffe, integra retroattivamente i nuovi benchmark segnalati per le righe esistenti e ricalcola gli z-score su tutto il panel. Le nuove voci spostano la media e la deviazione standard di ciascun benchmark, quindi i punteggi 0–100 esistenti si muovono con il panel. Vengono conservati snapshot storici.

Limitazioni della valutazione della densità di intelligenza

  • Ottimismo riportato dai laboratori: I punteggi dei benchmark provengono dai laboratori stessi. Le riesecuzioni indipendenti tipicamente si attestano da 5 a 13 punti più in basso. Le linee di tendenza sono direzionalmente informative ma non precise al punto.
  • Modalità di ragionamento e non ragionamento non separate: I modelli rilasciati nel 2025 e 2026 supportano opzioni di pensiero esteso che possono spostare i punteggi di matematica e codifica da 5 a 15 punti. Utilizziamo i punteggi in modalità predefinita dove identificabili.
  • Le cifre FLOP di addestramento sono per lo più stime: Una manciata di righe ha FLOP confermati dal laboratorio. Il resto è estrapolato da parametri e token di addestramento dichiarati, principalmente via Epoch IA.
  • Conteggio dei parametri dei modelli chiusi sconosciuto: La densità per parametro e per FLOP è vuota per le righe di frontiera chiuse. I modelli chiusi partecipano solo alla densità per dollaro.
  • Punteggi relativi al panel: I punteggi di densità sono riscalati min-max all'interno del panel. Un nuovo modello con un rapporto grezzo più alto sposta il punteggio 0–100 di ogni modello esistente. Per confrontare versioni del panel, utilizzare i rapporti grezzi sottostanti anziché i punteggi riscalati.
Scopri altri nostri benchmark e approfondimenti basati sui dati nella Ricerca Google.
GoogleAggiungi come fonte preferita

Cos'è la densità di intelligenza?

La densità di intelligenza rappresenta una nuova metrica per valutare quanta conoscenza e capacità di ragionamento un modello riesce a concentrare in una singola unità di memoria o calcolo. Misura l'architettura del modello valutando quanto efficacemente utilizza ciascun parametro per generare valore.

In questo framework, l'asse x rappresenta spesso il numero di parametri del modello mentre l'asse y traccia le prestazioni su compiti impegnativi. Si ha alta densità quando i modelli dimostrano capacità superiori senza richiedere il massiccio costo computazionale associato a modelli più grandi. Questo processo dimostra che l'intelligenza non dipende unicamente dalla quantità di dati o dalla scala dell'addestramento, ma piuttosto da come il software e gli algoritmi organizzano tali informazioni.

In passato, la comunità dell'IA si era affidata all'aumento del numero di parametri per raggiungere prestazioni più elevate, il che ha prodotto sistemi massicci e intensivi in termini di risorse. Con questo cambiamento di focus, l'ottimizzazione algoritmica viene privilegiata rispetto al volume grezzo per produrre più intelligenza da modelli più piccoli.

Perché è importante misurare la densità di intelligenza?

I sistemi efficienti devono ottimizzare il tempo di inferenza e l'utilizzo della memoria. Identificare il punto in cui più token o ulteriore calcolo non producono più guadagni significativi aiuta l'industria a comprendere i limiti superiori degli attuali grandi modelli linguistici. I principali motivi per misurare la densità di intelligenza possono essere riassunti come segue:

  • La comunità dell'IA sottovaluta i costi generali a lungo termine del mantenimento di modelli sovradimensionati nei data center.
  • La creazione di valore nelle applicazioni pratiche dipende dal rapporto tra la qualità dell'output e la potenza richiesta per produrlo.
  • La Legge di Moore per l'hardware non può sostenere la crescita dei modelli linguistici senza un progresso corrispondente nel modo in cui li ottimizziamo.
  • L'apprendimento per rinforzo e una migliore distribuzione dei dati consentono agli strumenti di nuova generazione di raggiungere benchmark un tempo riservati solo agli esseri umani. Scopri di più sull'apprendimento per rinforzo e su altre tecniche di fine-tuning degli LLM.

Sebbene i modelli più grandi contino ancora per esplorare nuove frontiere, la densità di un sistema determina la sua effettiva utilità nel mondo reale. Questo contesto aiuta a vedere l'intelligenza come un risultato concentrato dell'addestramento piuttosto che come un sottoprodotto della semplice dimensione.

Letture consigliate

La densità di intelligenza è un modo per confrontare gli LLM. Altre dimensioni sono trattate in analisi separate:

Cita questo benchmark

Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.

Hazal Şimşek (2026) - "Densità di intelligenza di 71 LLMs: Modelli più intelligenti e densi". Pubblicato online su AIMultiple.com. Consultato il 7 Luglio 2026, da: https://aimultiple.com/intelligence-density [Risorsa online]

Şimşek, H. (2026, 7 Luglio). Densità di intelligenza di 71 LLMs: Modelli più intelligenti e densi. AIMultiple. https://aimultiple.com/intelligence-density

@misc{simsek2026,
  author = {Şimşek, Hazal},
  title  = {{Densità di intelligenza di 71 LLMs: Modelli più intelligenti e densi}},
  year   = {2026},
  month  = jul,
  howpublished    = {\url{https://aimultiple.com/intelligence-density}},
  note   = {AIMultiple. Consultato il 7 Luglio 2026}
}
Scarica tutti i dati

Risultati e timestamp di 69 punti dati. Scarica i dati utilizzati in questo articolo come file ZIP contenente un file CSV e un README.

Ultimo aggiornamento: 3 Luglio 2026
Scarica
Hazal Şimşek
Hazal Şimşek
Analista di settore
Hazal è un'analista di settore presso AIMultiple, specializzata in process mining e automazione IT.
Visualizza il profilo completo

Sii il primo a commentare

Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.

0/450