Vedi il futuro dei grandi modelli linguistici approfondendo approcci promettenti, come l'auto-addestramento, la verifica dei fatti e la competenza sparsa, che potrebbero affrontare i limiti degli LLM.
Confronto del tasso di successo degli LLM
Claude Sonnet 4.6 ha guidato il benchmark con un punteggio complessivo di 0.748, con le varianti base e thinking a pari merito fino alla terza cifra decimale. Claude Opus 4.8 (0.702), Opus 4.6 base (0.706) e Opus 4.6 thinking (0.729) seguono, dando ad Anthropic le prime cinque posizioni. Il primo modello non-Anthropic è stato Gemini 3.5 Flash, thinking a 0.625. Le varianti GPT si sono raggruppate tra 0.57 e 0.60, con punteggi backend migliori compensati dall'instabilità del frontend. Vedi di più nel nostro articolo benchmark.
Metodologia del benchmark LLM
Abbiamo valutato i principali grandi modelli linguistici in 10 attività di sviluppo software utilizzando un harness CLI agentico. Ogni modello è stato eseguito 3 volte per attività (30 campioni per modello, 270 celle di validazione per iterazione) per stabilizzare i punteggi e misurare la varianza per cella. Tutti i modelli sono stati accessibili tramite OpenRouter in condizioni identiche, stesso harness, stesse istruzioni di attività, stesso ambiente hardware.
Modelli testati
Il benchmark copre i modelli disponibili via API a giugno 2026. Tutte le varianti elencate di seguito sono state testate indipendentemente.
- Claude Sonnet 4.6 (base e thinking)
- Claude Opus 4.8
- Claude Opus 4.6 (base e thinking)
- Claude Opus 4.7
- Gemini 3.5 Flash (base e thinking)
- GPT 5.5 (thinking)
- GPT 5.4 Mini
- GPT 5.3 Codex
- MiniMax M3
- Grok 4.3
- Qwen 3.6 Plus (base e thinking)
- GLM 5.1 (base e thinking)
- Deepseek V4 Pro (base e thinking)
Ambiente di test
Ogni agente e attività inizia in un ambiente pulito. Le istruzioni per l'attività sono fornite come file TASK.md. Un watchdog heartbeat da 20 minuti monitora ogni esecuzione. Registriamo codici di uscita, tempo di esecuzione, creazione di file backend e frontend e utilizzo di token in tempo reale tra le categorie input, output e cache.
Le attività spaziano da sistemi di prenotazione a dashboard interattive. Tutte richiedono la gestione di progetti multi-file e un risultato full-stack funzionante.
Valutazione
Validazione backend: I progetti generati vengono distribuiti in ambienti isolati e testati rispetto a un contratto YAML canonico che copre scenari happy-path, gestione degli errori (400/403/409) e coerenza dei dati. Vengono usate due modalità:
- Modalità adattiva valida la funzionalità anche quando i nomi delle route differiscono dalla specifica
- Modalità rigorosa richiede l'aderenza esatta al contratto (route, codici di stato, campi di risposta)
Punteggio backend per cella: backend_overall = has_backend × (0.7 × adaptive_pass_rate + 0.3 × strict_pass_rate)
Validazione UI: L'automazione del browser simula flussi utente reali, inclusi preflight, rendering, invio del login e comportamento post-login. Otto passaggi divisi in due gruppi:
- Passaggi infrastrutturali (preflight backend, rendering frontend, modulo di login visibile, invio login, login 2xx, nessun crash a runtime)
- Passaggi comportamentali (segnale di autenticazione post-login, segnale di comportamento post-login)
Punteggio UI per cella: ui_score = (behavior_passed / (behavior_passed + behavior_failed)) × (infra_passed / infra_total)
I passaggi comportamentali bloccati sono esclusi dal denominatore comportamentale, così una cella non viene penalizzata due volte quando l'app non si carica.
Punteggio finale: Final Score = (0.7 × backend_overall) + (0.3 × ui_score)
Il backend ha un peso maggiore perché i guasti logici a livello API tipicamente invalidano qualsiasi successo del frontend.
Misurazione dei costi
Il costo per cella viene calcolato dall'utilizzo di token estratto dalla risposta dell'LLM API. I token di input in cache vengono sottratti dai token di input totali per ottenere l'input effettivo (solo token appena elaborati). I token di output non vengono mai messi in cache e rimangono invariati. Le tariffe per token provengono da Prezzi LLM al momento del test.
Limitazioni
- Ambito delle attività: Tutte le 10 attività riguardano la creazione di applicazioni web full-stack. Il benchmark non copre compiti di ragionamento puro, risoluzione di problemi scientifici, sintesi o carichi di lavoro specifici per dominio (legale, medico, finanziario). I punteggi riflettono specificamente la capacità di coding agentico.
- Accesso solo via API: Tutti i modelli sono stati testati tramite API. Distribuzioni locali o on-premise degli stessi modelli possono produrre risultati diversi a seconda di quantizzazione, hardware e configurazione dell'inferenza.
- Fotografia temporale: Le versioni dei modelli cambiano. I risultati riflettono la versione API attiva al momento del test. Un aggiornamento del modello può spostare i punteggi in entrambe le direzioni senza preavviso da parte del fornitore.
- Stile delle chiamate tool: I modelli differiscono nel modo in cui strutturano scritture e modifiche dei file (ad esempio, il
apply_patchdi OpenAI raggruppa un diff dell'intero file in una singola chiamata; i modelli Anthropic scrivono e rieditano in più chiamate). Il numero di chiamate tool non è un proxy diretto della qualità. - Harness unico: Tutti i test hanno utilizzato Opencode come harness agente. Un harness diverso può produrre classifiche relative differenti, in particolare per i modelli il cui comportamento predefinito è ottimizzato per specifici modelli di utilizzo degli strumenti.
Tendenze future dei grandi modelli linguistici
1- Verifica dei fatti in tempo reale con dati live
Gli LLM accedono a fonti esterne durante le conversazioni invece di affidarsi solo ai dati di addestramento. Il modello interroga database esterni, recupera informazioni aggiornate e fornisce citazioni.
Limitazione: Commette ancora errori. Le citazioni non garantiscono l'accuratezza; a volte i modelli citano le fonti in modo errato o interpretano male i contenuti citati.
Microsoft Copilot: Integra GPT-5.4 Thinking con dati internet in tempo reale, introducendo le modalità “Quick Response” e “Think Deeper” per un ragionamento su misura per diversi tipi di attività.1 L'agente Researcher combina GPT per la ricerca iniziale con Claude di Anthropic, che rivede gli output per accuratezza e qualità delle citazioni prima di consegnare un miglioramento del 13.8% sul benchmark di ricerca approfondita DRACO rispetto ai sistemi autonomi.2
- ChatGPT: Cerca sul web quando gli si chiedono eventi recenti. Cita le fonti nelle risposte.
- Perplexity: Creato appositamente per la ricerca con citazioni. Ogni risposta include link alle fonti.
2- Dati di addestramento sintetici
I modelli generano i propri dataset di addestramento invece di richiedere dati etichettati da umani.
Il modello auto-migliorante di Google (ricerca 2023):
- Il modello crea domande
- Cura le risposte
- Si ottimizza sui dati generati
Prestazioni migliorate: da 74.2% a 82.1% sui problemi matematici GSM8K, da 78.2% a 83.0% sulla comprensione della lettura DROP.
OpenAI, Anthropic e Google stanno tutte usando dati sintetici per integrare i dataset etichettati da umani. Ciò riduce i costi di etichettatura dei dati ma introduce nuovi rischi di bias; i modelli possono amplificare i propri errori.
Fonte: “I grandi modelli linguistici possono auto-migliorarsi”
Un'indagine di marzo 2026 ha rilevato che il 76% dei ricercatori di IA ritiene che i guadagni derivanti dall'aumento di calcolo e dati si siano stabilizzati, con i principali laboratori che segnalano rendimenti decrescenti nonostante investimenti massicci. La scoperta suggerisce che il prossimo salto nelle capacità degli LLM è più probabile che provenga da innovazioni architetturali, come una migliore efficienza di addestramento, architetture sparse o miglioramenti del ragionamento, piuttosto che dal semplice aumentare ulteriormente gli approcci esistenti.3
3- Modelli sparsi a esperti (Mixture of Experts)
Invece di attivare l'intera rete neurale per ogni input, si attiva solo un sottoinsieme rilevante di parametri a seconda del compito. Il modello instrada l'input verso “esperti” specializzati all'interno della rete. Solo gli esperti attivati elaborano la query.
Esempi reali:
- Llama 4 Scout: 109B parametri totali, 17B attivi per token. L'architettura Mixture of Experts (MoE) offre una finestra di contesto da 10M token su una singola H100 GPU.
- Mistral Devstral 2: Progettato appositamente per compiti di ingegneria del software. 123B parametri, finestra di contesto di 256K token. Raggiunge il 72.2% su SWE-bench Verified, affermandosi come il principale modello open-weight per il coding. Una variante più piccola, Devstral Small 2 (24B parametri), gira localmente su hardware consumer sotto licenza Apache 2.0.4
- Nel nostro A-CODE-LLM Bench, sia la variante base sia quella thinking di DeepSeek V4 Pro hanno ottenuto un punteggio complessivo inferiore a 0.45, con tempi di completamento superiori a 1.700 secondi per attività. La capacità di coding agentico del modello è indietro rispetto alla sua forte prestazione nei benchmark su singole query, probabilmente riflettendo una minore maturità nell'uso degli strumenti rispetto ai modelli di frontiera Anthropic e Google in questa fase.
4- Integrazione nei flussi di lavoro aziendali
Gli LLM sono integrati direttamente nei processi aziendali anziché essere usati come strumenti autonomi.
Esempi reali:
- Salesforce Agentforce (precedentemente Einstein Copilot): Integra gli LLM nelle operazioni CRM. Risponde alle domande dei clienti, genera contenuti ed esegue azioni in Salesforce, ancorato ai dati e ai metadati CRM dell'organizzazione tramite l'Einstein Trust Layer.5
- Microsoft 365 Copilot: Integrato in Word, Excel, PowerPoint e Outlook. Redige documenti, analizza fogli di calcolo, genera presentazioni e riassume thread di posta elettronica, attingendo ai dati aziendali tramite Microsoft Graph per fondare le risposte sul contesto organizzativo.6 L'agente Researcher utilizza un'architettura multi-modello in cui GPT gestisce la ricerca iniziale e Claude rivede gli output prima della consegna, la prima implementazione commerciale confermata di fornitori di IA concorrenti all'interno di un singolo prodotto enterprise.
- Anthropic Claude for Enterprise: La separazione della memoria basata su progetti mantiene distinti i contesti di lavoro tra i team. Claude Opus 4.6 ha introdotto i team di agenti, consentendo a più agenti Claude di suddividere compiti più grandi in flussi di lavoro paralleli, ognuno con un segmento e coordinandosi con gli altri simultaneamente. La stessa release ha integrato Claude direttamente in PowerPoint come pannello laterale nativo (anteprima di ricerca), consentendo di creare e modificare presentazioni all'interno dell'applicazione senza trasferimenti di file.7
5- LLM ibridi con capacità multimodali
I grandi modelli multimodali integrano più forme di dati, come testo, immagini e audio, consentendo loro di comprendere e generare contenuti su diversi tipi di media.
- Nel nostro A-CODE-LLM Bench, GPT 5.5 thinking ha ottenuto 0.597 con un tempo medio di completamento di 276 secondi, il modello più veloce sopra 0.50 in termini di tempo. Il costo API per cella è stato di $0,41–$0,45 per le varianti mini, circa un terzo del costo di Claude Sonnet 4.6 a fasce di punteggio simili.
- Gemini 2.5 Pro: Gestisce nativamente testo, audio, immagini, video e interi repository di codice all'interno di una finestra di contesto di 1M token. Disponibile su Google IA Studio, Vertex IA e NotebookLM. I prezzi partono da $1,25 per milione di token in input e $10 per milione di token in output tramite l'API.8
- Llama 4 Scout e Maverick: I modelli open-weight di Meta usano token multimodali di testo e visione con early-fusion, addestrati insieme fin dall'inizio piuttosto che aggiunti come moduli separati. I modelli sono stati pre-addestrati in 200 lingue e hanno fornito supporto specifico per il fine-tuning per 12 lingue, tra cui arabo, spagnolo, tedesco e hindi.9
La capacità multimodale è ormai uno standard tra i modelli di frontiera. La sfida rimanente è la coerenza: i modelli funzionano bene sulle combinazioni comuni immagine-testo ma peggiorano su contesti visivi rari, input a bassa risoluzione e ragionamento cross-modale che richiede di collegare prove visive e testuali.
6- Modelli di ragionamento
Modelli che pensano ai problemi passo dopo passo invece di generare risposte immediate.
Questo passaggio dalla previsione al ragionamento è fondamentale per consentire:
- Comportamento agentico, in cui i modelli pianificano, eseguono e adattano le attività in modo autonomo.
- IA interpretabile, in cui gli output sono passo e logicamente validi, non solo apparentemente plausibili.
- Claude Sonnet 4.6: l'attuale leader di produzione di Anthropic nei benchmark di coding agentico, con un punteggio di 0.748 nel benchmark A-CODE-LLM di AIMultiple, superiore a ogni variante Opus. Usa il pensiero adattivo, in cui il modello determina dinamicamente la profondità di ragionamento in base alla complessità del compito senza richiedere il cambio manuale di modalità. Il prezzo è di $3/$15 per milione di token. Su SWE-bench Verified, Sonnet 4.6 raggiunge il 79.6%, a un punto dall'80.8% di Opus 4.7, a un quinto del costo.
- Claude Opus 4.7: la punta di diamante di Anthropic per il ragionamento multi-step complesso e la visione (98.5% sul benchmark di acutezza visiva XBOW, contro il 54.5% della generazione precedente). Prezzo di $5/$25 per milione di token. Nel benchmark di AIMultiple, Opus 4.7 ha ottenuto 0.61, sotto Sonnet 4.6 (0.748) e Opus 4.8 (0.702), soprattutto a causa della latenza più elevata (1.562 secondi in media per attività) che degrada i punteggi UI. Il divario rispetto a Sonnet si amplia sui compiti di ragionamento astratto come ARC-AGI-2.
- Claude Opus 4.8: Rilasciato dopo Opus 4.7, recuperando dalla regressione del 4.7 nel coding agentico. Ha ottenuto 0.702 nel benchmark A-CODE-LLM, quinto in assoluto. Ha completato l'attività di base in 34 secondi, il modello più veloce nel benchmark su quel compito usando solo 6 chiamate tool. Prezzo: $2,92 per cella nelle condizioni del benchmark ($15/$75 per milione di token).
7- Modelli ottimizzati per domini specifici
Modelli addestrati su dati specializzati per settori specifici invece di un addestramento generico.
Google, Microsoft e Meta hanno tutti rilasciato importanti modelli proprietari specifici per dominio e ottimizzati, destinati a casi d'uso aziendali specifici oltre alle loro offerte generiche.
Questi LLM specializzati possono portare a meno allucinazioni e maggiore accuratezza sfruttando il pre-addestramento specifico per dominio, l'allineamento dei modelli e il fine-tuning supervisionato.
Coding
GitHub Copilot: Ottimizzato su repository di codice. A luglio 2025, 20 milioni di sviluppatori usano GitHub Copilot, un aumento del 400% anno su anno, e il 90% delle aziende Fortune 100 lo utilizza. Completa automaticamente il codice, genera funzioni e suggerisce correzioni di bug.10
Finanza
BloombergGPT: LLM da 50 miliardi di parametri addestrato su un dataset di 363 miliardi di token di documenti finanziari Bloomberg, superando modelli di dimensioni comparabili nei benchmark NLP finanziari, tra cui analisi del sentiment, riconoscimento di entità nominate e risposta alle domande.11
Sanità
Med-PaLM 2 di Google: Ottimizzato su dataset medici, ha raggiunto un'accuratezza superiore al 85% su domande in stile U.S. Medical Licensing Examination (USMLE), il primo LLM a raggiungere prestazioni di livello esperto su questo benchmark. Alimenta MedLM, la famiglia di modelli fondativi sanitari di Google Cloud.12
Diritto
ChatLAW: Un modello linguistico open-source specificamente addestrato su dataset del dominio legale cinese.13
8- IA etica e mitigazione dei bias
Le aziende si concentrano sempre di più sull'IA etica e sulla mitigazione dei bias nello sviluppo e nell'implementazione dei grandi modelli linguistici.
- Anthropic e OpenAI hanno condotto una valutazione reciproca dell'allineamento a metà 2025, testando i modelli pubblici l'uno dell'altro per quanto riguarda adulazione, tendenze alla segnalazione di illeciti e comportamenti di autoconservazione. L'esercizio ha rilevato adulazione in tutti i modelli testati, inclusi casi in cui i modelli convalidavano decisioni dannose da parte di utenti simulati con convinzioni deliranti. Anthropic ha successivamente sviluppato il framework di test Bloom appositamente per valutare questo comportamento nei nuovi modelli.
- Anthropic ha anche rilasciato Claude Mythos Preview (Project Glasswing), un modello solo su invito messo a disposizione di un piccolo gruppo di organizzazioni specificamente per trovare e correggere vulnerabilità di sicurezza informatica nei principali sistemi operativi e browser web. Anthropic ha dichiarato che non intende rendere questo modello generalmente disponibile. L'approccio ad accesso controllato rappresenta un nuovo framework per l'implementazione di modelli specialistici altamente capaci laddove il profilo di rischio richiede un rilascio limitato.14
- Google DeepMind: Ha pubblicato “The Ethics of Advanced IA Assistants”, offrendo il primo trattamento sistematico delle questioni etiche e sociali sollevate dagli agenti IA, coprendo allineamento dei valori, rischi di manipolazione, antropomorfismo, privacy ed equità. La valutazione della Responsible IA dell'azienda ha incluso oltre 350 esercizi avversari di red-team e ha introdotto un nuovo livello di capacità critica specificamente per la manipolazione dannosa, trattandolo come un rischio di livello frontiera insieme agli attacchi informatici e alle minacce CBRN.
Limitazioni dei grandi modelli linguistici (LLM)
1- Allucinazioni
I modelli generano informazioni apparentemente plausibili ma errate.
La classifica delle allucinazioni di Vectara è il benchmark di sintesi grounded più ampiamente citato del settore. Sul dataset originale Vectara, i modelli Gemini di Google occupano costantemente le prime posizioni, con le varianti Gemini Flash che raggiungono tassi di allucinazione inferiori al 1%. La famiglia GPT di OpenAI si colloca tra il 0.8% e il 2.0%.
Vectara ha lanciato un benchmark significativamente più difficile a fine 2025 con 7.700 articoli (rispetto ai 1.000 precedenti), documenti più lunghi fino a 32K token e contenuti su diritto, medicina, finanza e tecnologia. I risultati sul nuovo dataset rivelano un modello controintuitivo: i modelli di ragionamento e thinking che eccellono nei compiti complessi spesso allucinano di più nella sintesi grounded rispetto a modelli più piccoli e veloci. La maggior parte dei modelli di classe thinking mostra tassi di allucinazione superiori al 10% sul dataset più difficile, mentre modelli più leggeri come le varianti Gemini Flash mantengono tassi più bassi.15
Nota: Nessun singolo benchmark fornisce un “tasso di allucinazione” definitivo per alcun modello. Una valutazione responsabile incrocia almeno due benchmark che misurano cose diverse: un compito grounded (Vectara), un compito di conoscenza aperto, e specifica la versione esatta del modello e le condizioni di chiamata.
Tutti i modelli allucinano. La frequenza si è ridotta notevolmente da circa il 21% nel 2021 a meno del 5% per i migliori nei benchmark standard, ma non è stata eliminata. Le applicazioni critiche richiedono ancora la verifica umana.
2- Bias
I modelli assorbono e amplificano i bias sociali dai dati di addestramento.
Figura: Punteggi complessivi di bias per modelli e dimensione
Fonte: Arxiv16
Tipi di bias osservati:
- Bias di genere nei suggerimenti occupazionali
- Bias razziale nelle simulazioni di screening dei curriculum
- Bias di età nelle raccomandazioni sanitarie
- Bias socioeconomico nei contenuti educativi
3- Tossicità
I modelli possono generare contenuti dannosi, offensivi o tossici nonostante le misure di sicurezza.
Figura: mappa della tossicità degli LLM
Fonte: Ricercatori di UCLA e UC Berkeley17
*GPT-4-turbo-2024-04-09*, Llama-3-70b* e Gemini-1.5-pro* sono usati come moderatore, i risultati potrebbero essere distorti su questi 3 modelli.
Misure di sicurezza rigorose riducono la tossicità ma aumentano i falsi positivi (rifiutare richieste innocue). Misure lasche lasciano passare la tossicità.
4- Limitazioni della finestra di contesto
Ogni modello ha una capacità di memoria fissa, il numero di token che può elaborare in una singola sessione. Superato questo limite, il modello tronca i contenuti precedenti o rifiuta la richiesta. Il divario pratico tra i modelli è abbastanza ampio da contare per i carichi di lavoro reali.
Finestre di contesto più recenti:
- Llama 4 Scout (Meta): 10M token (~7.5M parole), la più grande finestra di contesto verificata in produzione tra i modelli leader.18 In pratica, ciò significa caricare interi codebase, archivi legali o cronologie di conversazioni di più giorni senza suddivisione.
- Gemini 2.5 Pro: 1.048.576 token (~780.000 parole), con input multimodale nativo per testo, audio, immagini e video all'interno della stessa finestra. Il richiamo si mantiene al 100% fino a 530.000 token e al 99.7% al limite completo di 1 milione di token
- Claude Sonnet 4.6: 1M token (~750.000 parole) a prezzo standard, disponibile senza header beta o configurazioni speciali.19
- GPT-5.5: finestra di contesto di 1M token a livello API.20
Una grande finestra di contesto non significa automaticamente prestazioni migliori su tutta la sua lunghezza. Il richiamo si degrada verso la metà di contesti molto lunghi nella maggior parte dei modelli, e i costi crescono con la lunghezza dell'input: elaborare 1M token costa significativamente di più che elaborare 10K token sullo stesso modello. Per la maggior parte dei carichi di lavoro in produzione, la domanda pratica non è quale modello abbia la finestra più grande, ma quale modello recuperi in modo affidabile alle lunghezze di contesto che il tuo caso d'uso richiede effettivamente.
5- Data di taglio della conoscenza statica
I modelli si basano su conoscenze pre-addestrate con una data di taglio specifica. Non hanno accesso alle informazioni successive all'addestramento a meno che non siano collegati a fonti esterne.
Problemi:
- Informazioni obsolete sugli eventi attuali
- Impossibilità di gestire gli sviluppi recenti
- Minore rilevanza nei domini dinamici (tecnologia, finanza, medicina)
Soluzione: Integrazione con la ricerca web. ChatGPT, Claude e Perplexity offrono tutti la ricerca in tempo reale. Ma la ricerca non elimina le allucinazioni; a volte i modelli interpretano male i risultati della ricerca.
Principali piattaforme LLM
GPT-5.5
L'attuale punta di diamante di OpenAI è stata rilasciata il 23 aprile 2026. Costruita attorno a uno sforzo di ragionamento configurabile, gli sviluppatori impostano la profondità di pensiero per ogni richiesta (da none a xhigh), così le query semplici non consumano calcolo riservato ai problemi difficili. Il modello eccelle nel coding agentico, nell'uso del computer e nei compiti a lungo orizzonte in cui deve mantenere il contesto su grandi sistemi e verificare il proprio lavoro durante l'esecuzione.20
Chi lo usa: Sviluppatori, aziende e creatori di contenuti. La più grande base di utenti tra gli LLM.
Limitazioni: $5/$30 per milione di token, il prezzo base più alto in questo elenco. Ancora allucina. Richiede l'integrazione della ricerca web per qualsiasi cosa successiva al suo cutoff di addestramento.
Claude Opus 4.8 / Sonnet 4.6
Claude Sonnet 4.6 guida il benchmark A-CODE-LLM di AIMultiple con un punteggio complessivo di 0.748 a $1,26–$1,33 per cella, superiore a ogni variante Opus testata. Claude Opus 4.8 segue a 0.702, recuperando dalla regressione di Opus 4.7 (0.61) a $2,92 per cella. Opus 4.7 rimane il migliore nei compiti complessi di ragionamento multi-step e visione (98.5% sul benchmark di acutezza visiva XBOW), ma il suo tempo medio di completamento di 1.562 secondi nei flussi di lavoro agentici porta il costo totale a $3,08 per cella, il modello più costoso del benchmark.
Sia Sonnet 4.6 sia le varianti Opus usano il pensiero adattivo: il modello determina la profondità del ragionamento in base alla complessità del compito senza richiedere un cambio di modalità manuale. Sonnet 4.6 ha effettuato il minor numero di chiamate tool per compito tra i modelli Anthropic (51 base, 48 thinking), raggiungendo il punteggio benchmark più alto con meno iterazioni rispetto alle varianti Opus (56–70 chiamate tool). I team di agenti, disponibili sulla linea di produzione di Anthropic, consentono a più istanze Claude di dividere un compito in flussi di lavoro paralleli coordinati in tempo reale.
Chi lo usa: Sviluppatori e aziende che eseguono coding agentico, flussi di lavoro di ricerca o pipeline multi-agente. I team che danno priorità all'efficienza dei costi usano Sonnet 4.6; i team con carichi di lavoro pesanti di visione o ragionamento complesso usano Opus 4.7.
Limitazioni: Il pensiero esteso è più lento e più costoso per token. Il divario prestazionale rispetto a Sonnet si amplia nei compiti di ragionamento astratto (ARC-AGI-2). Opus 4.8 ha un prezzo di $15/$75 per milione di token.
Gemini 3.5 Flash
Gemini 3.5 Flash thinking ha ottenuto 0.625, il risultato più alto non-Anthropic a $1,30 per cella e 390 secondi di completamento medio. La variante base ha ottenuto un punteggio inferiore a thinking a un costo più alto ($0,56 per cella di base), a causa della sovrascrittura (131 righe per un compito la cui soluzione di riferimento è di circa 50 righe).
Llama 4 Scout
Il modello MoE open-weight di Meta. 109B parametri totali, 17B attivi per token, gira su una singola NVIDIA H100 GPU con quantizzazione int4. L'implicazione pratica è che una finestra di contesto di 10M token è accessibile senza un contratto con un data center.18 La multimodalità con early-fusion significa che testo e visione vengono elaborati congiuntamente dal primo livello anziché essere combinati nella fase di output. Disponibile sotto la licenza Llama 4 Community di Meta.
Chi lo usa: Ricercatori, organizzazioni che necessitano di distribuzione on-premise, sviluppatori che vogliono evitare il lock-in del fornitore e team in cui il costo su larga scala rende insostenibili i prezzi API.
Limitazioni: Le prestazioni dipendono fortemente dalla configurazione di hosting e dalle scelte di quantizzazione. Richiede investimenti in infrastruttura e capacità di ML ops. Meno rifinito in produzione rispetto ai modelli commerciali.
DeepSeek V4
Il modello di quarta generazione di DeepSeek è disponibile come anteprima. Utilizza un'architettura MoE da 1 trilione di parametri, circa il 50% più grande di V3, con capacità multimodali su testo, immagine e video. Il Thinking in Tool-Use consente al modello di ragionare internamente prima di chiamare strumenti esterni e di verificare gli output degli strumenti rispetto alla propria logica, il che è il principale elemento distintivo per i flussi di lavoro agentici. I prezzi di input dell'API partono da $0,27 per milione di token (cache-miss), circa 18x più economico di GPT-5.5.21
FAQ
Un grande modello linguistico è un modello di IA progettato per generare e comprendere testo simile a quello umano analizzando grandi quantità di dati.
Questi modelli fondativi si basano su tecniche di deep learning e in genere coinvolgono reti neurali con molti strati e un gran numero di parametri, che consentono loro di catturare modelli complessi nei dati su cui sono addestrati.
Cita questa ricerca
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Sezer, Sena},
title = {{Il futuro dei grandi modelli linguistici}},
year = {2026},
month = jun,
howpublished = {\url{https://aimultiple.com/future-of-large-language-models}},
note = {AIMultiple. Consultato il 25 Giugno 2026}
}Registro delle modifiche
10 aggiornamenti- 2026
Sostituiti GPT-5.2, Gemini 3.1 Pro e DeepSeek V3.2 con GPT-5.5, Gemini 2.5 Pro, DeepSeek V4 e Claude Opus 4.7.
Aggiornati i dati degli 'Esempi reali' nella sezione 'Domain-Specific Fine-Tuned Models'.
Aggiornata la sezione "Tendenze future dei modelli linguistici di grandi dimensioni" con nuovi esempi di verifica dei fatti in tempo reale.
- 2025
Aggiunti i modelli di ragionamento alla sezione degli approcci promettenti.
- 2024
Sostituita la sezione "Qual è lo stato attuale dei modelli linguistici di grandi dimensioni?" con nuovi contenuti.
Aggiornata la sezione 'Qual è il futuro dei modelli linguistici di grandi dimensioni?' con nuove categorie ed esempi reali.
Aggiornata l'introduzione con nuove statistiche sui visitatori per ChatGPT.
Aggiunto Claude 3 (Anthropic) all'elenco dei LLM.
Rimossa la Figura 1 dall'introduzione.
Aggiunti modelli multimodali alla sezione "Dati di addestramento sintetici".
Collegamenti di riferimento
Il lavoro di Cem presso AIMultiple è stato citato da importanti testate internazionali tra cui Business Insider, Forbes, Morning Brew e Washington Post, da aziende globali come Deloitte e HPE, da ONG come il World Economic Forum e da organizzazioni sovranazionali come la Commissione europea. [1], [2], [3], [4], [5]
Nel corso della sua carriera, Cem ha lavorato come consulente tecnologico, acquirente tecnologico e imprenditore tecnologico. Ha consigliato le aziende sulle loro decisioni tecnologiche presso McKinsey & Company e Altman Solon per più di un decennio. Ha inoltre pubblicato un report McKinsey sulla digitalizzazione.
Ha guidato la strategia tecnologica e gli approvvigionamenti di una società di telecomunicazioni rispondendo direttamente al CEO. Ha inoltre guidato la crescita commerciale dell'azienda deep tech Hypatos, che ha raggiunto ricavi ricorrenti annuali a 7 cifre e una valutazione a 9 cifre partendo da zero in 2 anni. Il lavoro di Cem in Hypatos è stato ripreso da importanti testate tecnologiche come TechCrunch e Business Insider.
Cem interviene regolarmente a conferenze tecnologiche internazionali. Si è laureato come ingegnere informatico presso l'Università di Bogazici e possiede un MBA della Columbia Business School.




Sii il primo a commentare
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.