LLM Prezzi: Confronto tra i migliori 15+ provider
Il pricing degli LLM si estende su quattro ordini di grandezza: i modelli più economici sono stati lanciati a meno di $0,03 per milione di token, mentre i modelli di ragionamento di frontiera sono stati lanciati fino a $262.50. Il grafico seguente tiene traccia dei prezzi di lancio: ogni punto rappresenta il prezzo medio dei modelli di una classe dimensionale lanciati in un trimestre solare, con un mix di 3 parti di input e 1 parte di output, su 8 classi dimensionali. I prezzi sono la tariffa di listino standard del fornitore, senza sconti per cache o batch, oppure la tariffa hosted al momento del lancio per i modelli open-weight senza prezzo di prima parte; l'asse y è logaritmico.
- I modelli chat di punta diventano più economici. GPT-4 è stato lanciato a $37,50 nel marzo 2023; Claude Opus 5 a $10,00 nel luglio 2026.
- I piani Reasoning Pro fissano un nuovo tetto. o1-pro ha raggiunto un picco di $262,50 nel marzo 2025; i lanci Pro 2026 di OpenAI restano a $67.50.
- Il livello economico sta salendo. Il costo mediano dei lanci closed-small è stato di $0,53 nel 2024 e di $3,00 nei primi otto mesi del 2026. Sei modelli sono stati lanciati in quella classe quest'anno e solo Solar Pro 4 di Upstage, a $0,53, è arrivato sotto $1.00.
- I modelli open-weight di punta hanno triplicato il prezzo e restano comunque più convenienti dei modelli closed. Il loro prezzo mediano di lancio è salito da $0,48 nel 2024 a $1,63 nel 2026, contro un mediano di $3,75 per i lanci closed mid-tier. Il Kimi K3 di Moonshot, a $6,00, è il lancio open-weights più costoso del grafico.
- I lanci closed mid-tier costano il 38% in meno rispetto al 2024. Il mediano è sceso da $6,00 nel 2024 a $4,38 nel 2025 e $3,75 nel 2026. Grok 4.5 e Grok 4.6 sono stati lanciati a $3,00, Meta Muse Spark 1.1 a $2.00.
I prezzi sono prezzi di lancio medi ponderati per milione di token, con un peso di tre parti di input e una parte di output, ed escludono le promozioni di lancio a tempo limitato.
Valutazione dei prezzi delle LLM API
Esistono due modi per pagare un LLM: piani in abbonamento con tariffa forfettaria per LLM dai principali provider, oppure un modello API pay-as-you-go fatturato in base ai token.
Fai clic sui nomi dei modelli per visualizzare i risultati dei benchmark, la latenza reale e i prezzi, e valutare l'efficienza e il rapporto costi-efficacia di ciascun modello.
Classifica: I modelli sono classificati in base alla posizione media in tutti i benchmark.
Puoi consultare i tassi di allucinazione e le prestazioni di ragionamento dei migliori LLM nei nostri benchmark.
Confronto dei piani in abbonamento LLM
Gli utenti non tecnici potrebbero preferire l'interfaccia utente piuttosto che le API. Nel 2026 la maggior parte degli abbonamenti dei provider include molto più di una semplice chat. Agenti di coding come Claude Code, Codex, Kimi Code e Mistral Vibe sono inclusi nei piani di fascia Pro. Per sviluppatori e utenti intensivi, l'abbonamento giusto da $10–$200 spesso sostituisce ciò che altrimenti sarebbe un abbonamento separato a un IDE di coding, un budget API per token e uno strumento video o di ricerca combinati.
OpenAI
Il piano Free include chat testuali quotidiane illimitate con GPT-5.6 Luna, la modalità vocale standard, caricamenti limitati e la generazione di immagini di base. Gli annunci contestuali raggiungono circa 40 mercati ad agosto 2026, inclusi gli Stati Uniti e gran parte dell'Europa, e compaiono solo sui piani Free e Go.
- ChatGPT Go ($8/mese) è un piano a basso costo che può includere annunci. Le chat testuali sono illimitate, come su Free; l'upgrade offre limiti più elevati per il caricamento di file, la creazione di immagini, la voce e la memoria, tutto su GPT-5.6 Luna.
- ChatGPT Plus ($20/mese) include limiti di utilizzo estesi, accesso a GPT-5.6 Sol, Terra e Luna, modalità vocale avanzata, l'agente Codex, la generazione di immagini e funzionalità ad accesso anticipato.
Il piano Pro ha due livelli a partire da aprile 2026:
- ChatGPT Pro ($100/mese) offre la stessa gamma di modelli del livello da $200 (incluso GPT-5.6 Sol) con limiti di utilizzo pari a circa 5x quelli di Plus.
- ChatGPT Pro ($200/mese) offre i limiti di utilizzo individuali più elevati (circa 20x Plus), il massimo delle ricerche approfondite Deep Research, voce avanzata con video e condivisione dello schermo, Codex con il massimo incremento di utilizzo e Sora.
Entrambi i livelli Pro includono accesso prioritario nelle ore di punta. Il costo di Codex su Plus, Pro e Business è passato da un addebito per messaggio a un utilizzo allineato ai token delle API nell'aprile 2026.
ChatGPT Work, l'agente di OpenAI per progetti multi-step di lunga durata (lanciato il 9 luglio 2026), è incluso nei piani a pagamento e l'app desktop che riunisce Chat, Work e Codex è disponibile su ogni piano, incluso Free.
- Piano Business ($20/utente/mese annuale oppure $25/utente/mese mensile) è il piano di OpenAI per team piccoli e medi (in precedenza ChatGPT Team, rinominato nell'agosto 2025). Aggiunge limiti di messaggi più elevati, console di amministrazione, SSO, dati del team esclusi dall'addestramento e pool di crediti condivisi per funzionalità avanzate. App incluse: Codex con crediti condivisi per l'area di lavoro. I posti riservati solo a Codex sono stati chiusi ai nuovi spazi di lavoro il 24 giugno 2026; OpenAI ha annunciato posti Premium a $100/utente/mese annuali ($125 mensili) con utilizzo 5x Standard. Il piano richiede almeno 2 posti.
- Il piano Enterprise (prezzo personalizzato) offre accesso ai modelli ad alta velocità, finestre di contesto estese, controlli dei dati di livello enterprise, verifica del dominio, analisi e registri di audit. App incluse: Codex con pool di crediti condiviso e posti opzionali solo Codex.
Anthropic (Claude)
Il piano Free include accesso web e mobile, analisi di base, accesso a Claude Sonnet 5 e Haiku e il caricamento di documenti. L'utilizzo giornaliero è limitato e i modelli Opus e Fable non sono disponibili.
- Piano Pro ($20/mese, oppure $17/mese con fatturazione annuale) offre accesso a Opus 5, Sonnet 5 e Haiku, circa 5x in più di utilizzo rispetto a Free, organizzazione dei progetti e accesso prioritario nelle ore di punta. Fable 5 non rientra nei limiti di utilizzo del piano Pro; viene fatturato alle tariffe API tramite crediti pay-as-you-go. App incluse: Claude Code (l'agente di coding di Anthropic nel terminale e nell'IDE), Cowork, Claude Design e Claude per Microsoft 365, tutti con lo stesso pool di utilizzo della chat.
- Piano Max 5x ($100/mese) offre circa 5x più utilizzo rispetto a Pro, accesso prioritario a funzionalità e modelli più recenti e accesso completo a Claude Code al livello di utilizzo Max più elevato.
- Piano Max 20x ($200/mese) offre circa 20x più utilizzo rispetto a Pro, massima priorità di accesso e accesso completo a Claude Code. Pensato per utenti intensivi giornalieri che eseguono carichi di lavoro con Claude Code. Entrambi i livelli Max includono Fable 5, il modello più costoso di Anthropic; il suo utilizzo può assorbire fino alla metà del limite di utilizzo settimanale del piano.
Il piano Team offre due tipi di posto e supporta da 2 a 150 membri:
- Posto Standard: $20/utente/mese annuale ($25/utente/mese mensile). Include funzionalità di base, limiti di utilizzo standard e accesso a Claude Code.
- Posto Premium: $100/utente/mese annuale ($125/utente/mese mensile). Tutto ciò che è incluso in Standard, più limiti di utilizzo più elevati per utenti intensivi che eseguono carichi di lavoro più pesanti con Claude Code.
App incluse: Claude Code e Cowork sono inclusi con ogni posto Team (Standard e Premium); la differenza sta nella quantità di utilizzo consentita, non nell'accesso. Entrambi i tipi di posto includono fatturazione centralizzata, strumenti di collaborazione e controlli amministrativi.
- Piano Enterprise ($20/posto/mese più utilizzo alle tariffe API sul livello self-serve; prezzo personalizzato con il reparto commerciale) offre finestre di contesto estese, SSO, acquisizione del dominio, accesso basato sui ruoli, SCIM, registri di audit e integrazioni dati. App incluse: nei piani Enterprise nuovi e self-serve, Claude Code e Cowork sono inclusi con ogni posto; i contratti Enterprise meno recenti possono distinguere tra posti solo Chat e posti Chat + Claude Code con fatturazione a consumo.
Google (Gemini)
Il piano gratuito offre accesso a Gemini 3.6 Flash e un accesso variabile a Gemini 3.1 Pro, generazione di immagini di base, Deep Research, Gemini Live, Canvas e Gems. App incluse: Gemini Notebook (in precedenza NotebookLM) e Flow con accesso limitato a Nano Banana Pro.
Google utilizza prezzi regionali, quindi i prezzi possono variare da regione a regione.
- Google IA Plus ($4,99/mese, USA) è il livello a pagamento di ingresso con limiti di utilizzo 2x rispetto a Free. App incluse: più accesso a Gemini 3.1 Pro nella chat, generazione di immagini con Nano Banana Pro, generazione video con Gemini Omni Flash, 200 crediti Flow, Gemini Notebook con più Audio Overview, Gemini in Gmail, Docs e Vids e accesso anticipato a Gemini in Chrome. Include 400 GB di spazio di archiviazione.
- Google IA Pro ($19,99/mese, USA) offre limiti di utilizzo 4x rispetto a Free e 5 TB di spazio. App incluse: Jules (agente di coding asincrono), Google Antigravity (piattaforma di sviluppo agentico), limiti ampliati di IA Studio, $40/mese in crediti Google Cloud, Gemini Notebook con 5x Audio Overview, Deep Research, 1.000 crediti Flow, YouTube Premium Lite e Google Home Premium (piano Standard).
- Google IA Ultra (USA) costa $99,99/mese per limiti di utilizzo 5x di IA Pro oppure $199,99/mese per 20x. App incluse: ragionamento Deep Think, Gemini Agent (solo USA), Gemini Spark, Project Genie (modello di mondo interattivo), Jules ai limiti più elevati, Antigravity di primo livello, 10.000 o 25.000 crediti Flow, Google Home Premium (piano Advanced) e un abbonamento individuale YouTube Premium. Lo spazio di archiviazione parte da 20 TB.
Microsoft Copilot
Il piano gratuito (Copilot Chat) è disponibile senza costi aggiuntivi per tutti gli utenti di Microsoft Entra con una sottoscrizione idonea a Microsoft 365. Include la chat Copilot di base nelle app Microsoft, senza le funzionalità più approfondite all'interno dei documenti.
- Microsoft 365 Premium ($19,99/mese oppure $199,99/anno) è ora il piano consumer di Copilot. Include le app di Office, fino a 6 TB di spazio (1 TB ciascuno per un massimo di sei persone) e i limiti Copilot consumer più elevati; le funzionalità IA si applicano solo al titolare dell'abbonamento. Il precedente Copilot Pro ($20/mese) non è più disponibile per nuovi acquisti e gli abbonati esistenti possono mantenerlo o passare a Premium.
- Microsoft 365 Copilot Business ($21/utente/mese annuale; $18/utente/mese come tariffa del primo anno per acquisti fino al 30 settembre 2026; $25,20/utente/mese mensile) aggiunge Copilot nelle app Microsoft 365, l'integrazione con Teams e i controlli amministrativi. App incluse: Copilot Studio Lite per creare agenti leggeri, Copilot in SharePoint e Copilot Pages per bozze collaborative. Limitato alle organizzazioni con un massimo di 300 utenti.
- Microsoft 365 Copilot Enterprise ($30/utente/mese annuale, oppure $31,50/utente/mese con fatturazione mensile; richiede una licenza idonea di Microsoft 365) offre sicurezza avanzata, conformità e analisi oltre alle funzionalità Business. App incluse: creazione di agenti con Copilot Studio (gli agenti con dati di lavoro e predefiniti possono essere a consumo; Copilot Studio autonomo viene venduto separatamente), Copilot in Microsoft Purview e Intune per flussi di lavoro IT e di sicurezza e la governance degli agenti distribuiti.
xAI (Grok)
Il piano gratuito offre un accesso limitato a Grok.
- SuperGrok Lite ($10/mese) è il livello a pagamento di ingresso. Include conversazioni 2x più lunghe, limiti di frequenza aumentati e creazione di immagini e video con l'IA. App incluse: Grok Build (l'agente di creazione di app di xAI, anche gratuito sul web da agosto 2026) e Grok Imagine per la generazione di immagini e video.
- SuperGrok ($30/mese oppure $300/anno) include ragionamento potenziato con Grok 4.6, conversazioni 5x più lunghe, caricamenti di file più lunghi, modalità Voice per chat vocali e 20x più generazioni di immagini e video di Grok Imagine, inclusi video HD 720p da 30 secondi.
- SuperGrok Plus ($100/mese) aggiunge l'accesso a Grok Bot, la generazione di video a 1080p, limiti di utilizzo più elevati, risposte più rapide e accesso prioritario.
- SuperGrok Heavy ($300/mese) offre tutto ciò che è incluso in Plus, un team di agenti per il lavoro in parallelo, limiti di frequenza massimi, anteprime anticipate delle prossime funzionalità xAI e un abbonamento X Premium+. A luglio 2026 xAI ha inoltre rilasciato componenti aggiuntivi per Excel, Outlook e Google Workspace oltre a Automazioni pianificate; la maggior parte sono gratuito, mentre il componente aggiuntivo per Outlook e le Automazioni attivate via email sono riservati agli utenti a pagamento.
Grok è incluso anche negli abbonamenti X: X Premium ($8/mese) è il percorso a pagamento più economico per Grok all'interno dell'app X e include lo stato verificato e una riduzione degli annunci. X Premium+ ($40/mese) rimuove gli annunci in tutta X e offre i limiti di utilizzo più elevati di Grok, insieme alla monetizzazione completa per i creator.
Moonshot IA (Kimi)
I piani consumer di Kimi prendono il nome dalle indicazioni di tempo musicali, dal più lento al più veloce. I prezzi internazionali sono in USD; gli utenti cinesi pagano in CNY a tariffe inferiori. Ad agosto 2026, i nuovi acquisti sono in lista d'attesa. La pagina dei prezzi annuncia piani futuri che separano i vantaggi di Kimi e Kimi Code, e la nota di Moonshot del 20 luglio cita vincoli di capacità di calcolo per il lancio ritardato, quattro giorni dopo l'uscita di K3. Gli abbonati esistenti mantengono i loro piani e possono rinnovarli.
- Adagio (Free) offre conversazioni di base illimitate con 6 utilizzi degli agenti, ricerche Deep Research limitate e attività di base dell'agente OK Computer.
- Moderato ($19/mese) aggiunge Kimi K3 nella chat e nelle attività degli agenti, oltre a sessioni Deep Research ampliate. App incluse: Kimi Code (agente di coding IA che privilegia il terminale; una stima tra 300 e 1.200 richieste per finestra di 5 ore, fatturate dal pool di crediti condiviso), più gli strumenti di creazione Slides e Websites.
- Allegretto ($39/mese) offre un utilizzo più elevato su tutto ciò che è incluso in Moderato. App incluse: Agent Swarm (orchestrazione parallela di subagenti, fino a 4 sottoattività parallele su questo livello), il deployment cloud Kimi Claw per gruppi eterogenei di agenti con memoria persistente e 2x i crediti agente di Moderato.
- Allegro ($99/mese) offre 5x crediti agente, Agent Swarm con fino a 8 sottoattività parallele e chat K3 con fino a 1M token di contesto.
- Vivace ($199/mese) offre 10x crediti agente, 4 attività simultanee, Agent Swarm con fino a 8 sottoattività parallele e chat K3 con fino a 1M token di contesto, pensato per ricerca intensa e carichi di lavoro agentici.
L'abbonamento include chiavi API Kimi Code da usare in strumenti di coding di terze parti; la API separata Kimi Open Platform viene fatturata per token.
MiniMax
MiniMax vende un unico Token Plan basato sui suoi modelli M3 e M2.7. Ha sostituito i precedenti piani separati di crediti Agent e il Coding Plan a metà 2026.
MiniMax Token Plan (un'unica quota per agenti, coding e lavoro multimodale):
- Plus ($20/mese): finestre di quota mobili di 5 ore e settimanali, sufficienti per 3 o 4 agenti di coding eseguiti in parallelo; per progetti personali e prototipazione.
- Max ($50/mese): le stesse finestre per 4 o 5 agenti paralleli; per il coding quotidiano con agenti e lavoro multimodale.
- Ultra ($120/mese): 6 o 7 agenti paralleli; per flussi di lavoro agentici pesanti e sessioni prolungate.
- Pacchetti di crediti: $5 per 5.000 crediti, $25 per 25.000, $100 per 100.000 (1.000 crediti = $1, validi 365 giorni), utilizzabili in aggiunta a qualsiasi piano.
Il Token Plan copre l'intera gamma di modelli (M3, M2.7, immagini e voce) con un'unica quota, rendendolo uno dei percorsi più economici verso un modello di coding di frontiera se abbinato a una CLI come Cline o Kilo Code.
Mistral IA
Il piano Free di Mistral Vibe (in precedenza Le Chat) include navigazione web, analisi di file di base, generazione di immagini, sessioni di coding limitate, 100+ connettori e $10/mese in crediti API.
- Piano Pro ($14,99/utente/mese) include più messaggi e ricerche web, più pensiero esteso e report Deep Research, 15 GB di spazio per i documenti, fino a 1.000 progetti, generazione di immagini e $30/mese in crediti API. App incluse: la modalità Code di Mistral Vibe nella CLI, nell'IDE o sul web, con tariffazione pay-as-you-go oltre la quota inclusa. Gli studenti verificati ottengono Pro a $5,99/mese.
- Piano Team ($24,99/utente/mese) include tutto ciò che è in Pro con fino a 30 GB di spazio per utente, fatturazione centralizzata, controllo accessi basato sui ruoli, verifica del nome di dominio ed esportazione dei dati. App incluse: Mistral Vibe al livello di utilizzo Team con controlli amministrativi condivisi.
- Piano Enterprise (prezzo personalizzato) offre opzioni di deployment sicure, tra cui self-hosted e cloud privato, SSO SAML, registri di audit, supporto premium e analisi dettagliate. App incluse: Mistral Vibe con opzioni di deployment on-premise per carichi di lavoro regolamentati.
DeepSeek
DeepSeek non offre piani di abbonamento tradizionali. L'accesso in chat web e mobile ai modelli più recenti (attualmente DeepSeek V4-Flash e V4-Pro) è gratuito per tutti gli utenti, con limitazioni basate su un utilizzo corretto.
L'accesso alle API è pay-per-token con tariffe di punta e non di punta dal 16 agosto 2026. Fuori dalle ore di punta, V4-Flash costa $0,22 per milione di token di input (cache miss) e $0,66 per milione di token di output; le tariffe di punta sono doppie ($0,44 e $1,32). V4-Pro costa $0,66 e $1,98 fuori dalle ore di punta. I cache hit costano circa il 3% della tariffa di miss e le ore di punta sono 01:00-04:00 e 06:00-10:00 UTC nei giorni feriali.
DeepSeek è entrato anche negli strumenti per agenti. DeepSeek Harness, un toolkit open source basato su plugin per creare ed eseguire agenti IA, è in anteprima per sviluppatori con codice sorgente pubblico. Non ha un prezzo proprio ed è indipendente dal modello; l'utilizzo viene fatturato in base al modello API chiamato dall'agente.
Meta (Muse Spark)
Meta IA resta gratuito all'interno di WhatsApp, Instagram, Facebook, Messenger, dell'app Meta IA e degli occhiali Ray-Ban Meta, ed è basato su Muse Spark (lanciato l'8 aprile 2026, ora alla versione 1.2). Meta ha avviato test limitati degli abbonamenti a pagamento Meta One. I piani Plus e Premium aumentano la quota mensile di utilizzo dell'IA e l'accesso alla modalità Thinking, secondo quanto riportato a $7,99 e $19,99 al mese.1
La Meta Model API è in anteprima pubblica, self-serve e compatibile con l'SDK di OpenAI. Il pricing pay-as-you-go di Muse Spark 1.2 parte da $1,25 per milione di token di input e $4,25 per milione di token di output con una finestra di contesto da 1M token. Muse Code, un agente di coding da terminale, è stato rilasciato in beta il 5 agosto 2026.
Capire i prezzi degli LLM
Token: l'unità fondamentale di prezzo
Figura 1: Esempio di tokenizzazione con il tokenizer GPT-4o & GPT-4o mini per la frase "Identificare Nuove Tecnologie, Accelera la Tua Impresa."2
Sebbene i fornitori offrano diverse strutture di prezzo, il prezzo per token è il più comune. I metodi di tokenizzazione variano da modello a modello; tra gli esempi:
- Byte-Pair Encoding (BPE): divide le parole in unità sub-parola frequenti, bilanciando dimensione del vocabolario ed efficienza.3
- Esempio: "unbelievable" → ["un", "believ", "able"]
- WordPiece: simile a BPE ma ottimizza per la verosimiglianza del modello linguistico, usato in BERT.4
- Esempio: "tokenization" → ["token", "##ization"]. "token" è una parola autonoma; "##ization" è un suffisso.
- SentencePiece: tokenizza il testo senza basarsi sugli spazi, efficace per modelli multilingue come T5.5
- Esempio: "natural language" → [" natural", " lan", "guage"] oppure [" natu", "ral", " language"].
Si noti che le sub-parole esatte dipendono dai dati di addestramento e dal processo BPE/WordPiece. Per comprendere meglio questi metodi di tokenizzazione, guarda il video qui sotto:
Dopo aver compreso la tokenizzazione, si può stimare un prezzo medio in base alla lunghezza in token del progetto. La Tabella 2 illustra gli intervalli di token per tipo di contenuto, inclusi prompt di UI, frammenti di email, blog di marketing, report dettagliati e articoli di ricerca, e sottolinea che il numero di token varia da modello a modello. Una volta scelto un modello, il suo tokenizer può essere usato per stimare il numero medio di token del contenuto.
Tabella 2: Tipi di contenuto tipici, relativi intervalli di dimensioni e considerazioni aziendali (gli intervalli sono stime e possono variare).
Implicazioni della finestra di contesto
La finestra di contesto impone un limite rigido al numero di token di input e output per chiamata, inclusi gli eventuali token usati dai modelli di ragionamento per il ragionamento a catena di pensiero. Se il totale supera questo limite, la risposta viene troncata o la richiesta fallisce del tutto.
Figura 2: Illustrazione delle limitazioni della finestra di contesto che portano al troncamento dell'output in una conversazione a più turni.6
Per le applicazioni che mantengono conversazioni lunghe, ogni turno aggiuntivo spinge più cronologia nell'input. Senza interventi, i token di input crescono linearmente con la lunghezza della conversazione, e così anche il conto. Gli utenti delle API affrontano in genere il problema in uno di questi tre modi:
- Prompt caching. OpenAI, Anthropic, Google e DeepSeek memorizzano lato server i prefissi ripetuti dei prompt e fatturano i cache hit a una frazione della tariffa di input standard, in genere dal 3 al 10 percento del prezzo di cache miss. Per le applicazioni che riutilizzano un prompt di sistema lungo o un prefisso di conversazione, la cache può ridurre il costo di input di un ordine di grandezza.
- Finestra mobile o generazione assistita da recupero (RAG). Elimina i turni più vecchi una volta raggiunta una soglia, oppure recupera solo i messaggi passati rilevanti da un archivio vettoriale a ogni chiamata.
- Sintesi. Condensa periodicamente i turni più vecchi in un riepilogo invece di rinviarli testualmente.
Per carichi di lavoro agentici come sessioni di coding o ricerca approfondita, i moderni agenti di coding gestiscono automaticamente questa esigenza durante la sessione. Claude Code, ad esempio, include la compattazione del contesto: quando la conversazione si avvicina al limite, sintetizza i messaggi più vecchi in una versione condensata mantenendo intatti i turni recenti. I turni successivi inviano al modello solo il riepilogo più il contesto recente.
L'impatto sui prezzi è diretto. Sulle API a consumo, la compattazione limita la crescita dell'input di ogni chiamata e la cache riduce il prezzo del prefisso ripetuto, quindi il costo per turno resta prevedibile nelle sessioni lunghe. Sugli abbonamenti a tariffa fissa come Claude Pro, ChatGPT Plus o Kimi Moderato, la compattazione allunga i limiti di utilizzo giornalieri e settimanali perché ogni chiamata trasporta meno contesto. Una sessione di coding che altrimenti brucerebbe il limite di frequenza di 5 ore può durare più a lungo quando i turni più vecchi vengono compressi.
Il compromesso è che qualsiasi forma di sintesi comporta una perdita di informazioni. Il riepilogo può omettere dettagli che in seguito si rivelano importanti, costringendo l'utente a fornirli di nuovo
Token di output massimi
Il numero massimo di token di output limita la lunghezza della risposta di un modello. Sebbene molte documentazioni affermino che può essere regolato tramite il parametro max_tokens, è fondamentale consultare la documentazione della specifica API utilizzata per individuare il parametro corretto. Deve essere regolato in base alle esigenze specifiche:
Se impostato su un valore troppo basso, può produrre output incompleti, inducendo il modello a interrompere le risposte prima di fornire la risposta completa.
Se impostato su un valore troppo alto, a seconda della temperatura (un parametro che controlla la creatività della risposta), può portare a output inutilmente prolissi, tempi di risposta più lunghi e costi maggiori.
Si tratta quindi di un parametro che richiede un'attenta valutazione per ottimizzare l'uso delle risorse bilanciando qualità dell'output, costi e prestazioni.
Tabella 3: Esempi di prompt di input e conteggi di token stimati per tipo di contenuto.
*Si suppone che ogni modello produca risposte con un numero uguale di token di output, sebbene il numero di token sia per input che per output possa variare in base alla tokenizzazione di ciascun modello; il numero è stato mantenuto costante per ogni modello.
Combinando gli intervalli di token della Tabella 2 con le tariffe per token di un modello si ottiene il costo previsto per ciascun tipo di contenuto; i prompt di esempio della Tabella 3 mostrano le dimensioni di input e output alla base di tali stime.
Usare più modelli linguistici
Un gateway IA come OpenRouter consente di inviare lo stesso prompt a più modelli contemporaneamente. Le risposte, il consumo di token, il tempo di risposta e i prezzi possono quindi essere confrontati per determinare quale modello sia più adatto al compito.
Figura 3: Interfaccia che mostra un prompt inviato a più Large Language Model tramite OpenRouter.7
Vantaggi e sfide
- Maggiore adattabilità ed efficienza: L'orchestrazione migliora la reattività, consentendo una valutazione in tempo reale dell'efficienza dei modelli e l'individuazione di un modello conveniente e di potenziali risparmi.
- Sensibilità e ottimizzazione dei prompt: Prompt identici possono produrre output molto diversi tra i modelli, rendendo necessario un prompt engineering su misura per ciascun modello per ottenere i risultati desiderati, con una maggiore complessità di sviluppo e manutenzione.
Meccanismi di prezzo e costi nascosti
Token di ragionamento vs token di output
Un numero crescente di fornitori ha introdotto modelli di ragionamento che utilizzano calcolo aggiuntivo per eseguire internamente il ragionamento a catena di pensiero. OpenAI, Anthropic e Google fatturano quei token di ragionamento come token di output alla tariffa di output standard del modello, quindi l'aumento dei costi deriva dal volume, non da un prezzo per token più elevato.
Modelli come GPT-5.5 Pro, Claude Opus 5 con pensiero esteso o Gemini 3.1 Pro Deep Think generano tracce di ragionamento interne
anche quando non le richiedi esplicitamente. Questi token interni concorrono al costo e possono aumentare notevolmente la spesa, soprattutto in attività analitiche lunghe come revisione legale, analisi dei dati o ragionamento multi-step.
È quindi essenziale:
- Scegliere un modello di ragionamento solo quando l'accuratezza supera di gran lunga il costo.
- Disattivare la catena di pensiero o impostare un numero massimo di token di output più basso quando possibile.
- Testare la stessa attività su modelli non di ragionamento per verificare se le prestazioni sono paragonabili a una frazione del prezzo.
Poiché un modello di ragionamento può emettere da 10 a 30 volte più token di output rispetto allo stesso prompt senza ragionamento, è fondamentale comprendere questa distinzione per pianificare i costi.
Differenze di prezzo legate all'architettura
Le architetture degli LLM influenzano direttamente l'efficienza del modello e, di conseguenza, i prezzi delle API. Per esempio:
- I modelli Mixture-of-Experts (MoE) attivano solo un sottoinsieme di parametri per richiesta, riducendo il costo di calcolo e consentendo ai fornitori di offrire tariffe per token più basse.
- La decodifica speculativa abbina un modello bozza più piccolo a uno più grande, migliorando il throughput e riducendo i costi per le attività deterministiche.
- Le varianti quantizzate (ad es. a 4 bit o 8 bit) possono eseguire l'inferenza a precisione inferiore, consentendo prezzi più bassi per versioni distribuite localmente o ospitate su cloud.
Comprendere queste scelte architetturali aiuta gli utenti a prevedere non solo le differenze di prezzo, ma anche latenza, qualità e scalabilità di un modello nei carichi di lavoro in produzione.
Costi operativi oltre le tariffe API
Sebbene il prezzo per token sia il principale fattore di costo, molte implementazioni in produzione comportano costi aggiuntivi oltre all'uso delle API:
- Embedding e database vettoriali: l'archiviazione e il recupero dei vettori (ad es. Pinecone, Weaviate, ChromaDB) aggiungono costi per query e per GB di spazio.
- Modelli di reranking e post-elaborazione: molte applicazioni utilizzano modelli più piccoli per sintetizzare, filtrare o classificare prima di inviare la richiesta finale a un modello più grande.
- Livelli di caching: fornitori come OpenAI offrono ora caching a livello di prompt, ma un'infrastruttura di caching locale può richiedere capacità di calcolo aggiuntiva.
- Logging, monitoraggio e audit: le aziende spesso sostengono costi per il monitoraggio a livello di token, il tracciamento della latenza e gli audit di sicurezza.
Questi costi nascosti rappresentano spesso tra il 20 e il 40% delle spese operative totali per gli LLM e devono essere considerati nella valutazione delle strutture di prezzo.
Considerazioni sui prezzi per le aziende
Molti fornitori di LLM applicano costi aggiuntivi per funzionalità di sicurezza e conformità di livello enterprise, come:
- Deployment single-tenant
- Cluster GPU dedicati
- SLA potenziati (ad es. garanzie di uptime e latenza)
- Residenza dei dati e controlli regionali
- Modalità di conformità SOC2, HIPAA o GDPR
Queste opzioni possono aumentare notevolmente i costi ma sono essenziali per i settori regolamentati come sanità, finanza, servizi legali e istituzioni pubbliche.
Tendenze future nei prezzi degli LLM
Tre fattori hanno definito i prezzi degli LLM nel 2025: i modelli commodity sono diventati economici, quasi tutti i principali fornitori hanno lanciato un abbonamento chat e i modelli di ragionamento sono rimasti costosi. Il divario è strutturale e probabilmente destinato ad ampliarsi: un milione di token di output costa $0,66 su DeepSeek V4-Flash (fuori dalle ore di punta) e $180 su GPT-5.5 Pro. Le domande interessanti dal 2026 in poi riguardano cosa cambierà sopra quella base.
La fatturazione per token lascia il posto al prezzo per attività
Gli agenti oggi guidano la maggior parte dell'uso intensivo degli LLM. Una singola attività di coding con Claude Code, una sessione di ricerca con Cowork o una navigazione autonoma con Operator possono generare centinaia di chiamate sequenziali al modello. La fatturazione a token diventa imprevedibile sia per l'acquirente sia per il venditore.
In risposta, i fornitori stanno passando dai contatori di token a quote per attività e per sessione. Moonshot stima tra 300 e 1.200 richieste Kimi Code per finestra di 5 ore da un pool di crediti condiviso. Claude Code limita l'utilizzo per sessione di 5 ore piuttosto che per messaggio. MiniMax imposta le quote del Token Plan come finestre mobili di 5 ore e settimanali dimensionate in base al numero di agenti di coding paralleli. Kimi definisce limiti specifici per livello sui subagenti paralleli di Agent Swarm.
Gli harness per agenti multiprovider come OpenClaw e MaxHermes spingono ancora oltre. Si collocano tra gli utenti e più API di modelli e i loro prezzi seguono sempre più il throughput per attività piuttosto che per milione di token. È probabile che nel prossimo anno altri fornitori pubblichino SKU per attività o per sessione.
I piccoli modelli di ragionamento si spostano sul dispositivo
Apple Intelligence esegue l'inferenza on-device per le richieste di routine, ricorrendo al Private Cloud Compute solo per le richieste complesse. I PC Copilot+ di Microsoft vengono forniti con un modello locale. I dispositivi Pixel eseguono Gemini Nano. Modelli piccoli recenti come Phi-4 di Microsoft e Gemma 3 di Google sono in grado di ragionare a dimensioni compatibili con l'unità di elaborazione neurale di un telefono o di un laptop.
La conseguenza sui prezzi è un mercato consumer a due livelli. Il lavoro di routine viene eseguito gratuito con il token marginale on-device. Gli abbonamenti cloud competono su ciò che il locale non può fare: ragionamento di frontiera, contesti ampi, generazione multimodale e orchestrazione di agenti. La base gratuito locale spinge verso lo zero gli abbonamenti solo chat, lasciando le app incluse come vera ragione per pagare.
Contesto lungo e memoria decidono chi vince il lavoro agentico
Le attività agentiche di lungo periodo falliscono quando i modelli perdono traccia delle istruzioni precedenti o allucinano fatti che dovrebbero ricordare. Il lavoro agentico prolungato dipende da tre cose: un'ampia finestra di contesto, una memoria persistente e un basso tasso di allucinazione.
In un anno, tre capacità di frontiera sono crollate verso il livello di base. Claude Opus 5, Gemini 3.1 Pro, GPT-5.6 e Kimi K3 offrono finestre di contesto da 1M token. Su OpenAI, Anthropic, Google e DeepSeek, i cache hit costano dal 3 al 10 per cento dei cache miss. ChatGPT e Claude ora includono la memoria persistente nei livelli gratuito.
Modelli agentici specializzati stanno emergendo al vertice di questo mercato. A giugno 2026, Anthropic ha rilasciato Claude Fable 5, un modello di classe Mythos generalmente disponibile8, al prezzo di $10 per l'input e $50 per l'output per milione di token, il doppio della tariffa di Opus 5. Fable 5 è pensato per coding agentico, uso del computer e ricerca di lungo periodo; Claude Mythos 5, lo stesso modello con alcune protezioni rimosse, resta limitato ai partner approvati allo stesso prezzo.
La domanda competitiva si sposta da "quanto è ampia la finestra di contesto" a "quanto a buon mercato e in modo affidabile il modello può sostenere un'attività agentica lunga?". I fornitori che risolveranno bene questo aspetto potranno imporre prezzi premium. Chi non lo farà perderà i carichi di lavoro agentici, indipendentemente dal prezzo per token dichiarato.
FAQ
L'accesso ai Large Language Model (LLM) tramite un'Application Programming Interface (API) consente di utilizzare da remoto i modelli di intelligenza artificiale. Questo accesso è soggetto a una tariffa, spesso chiamata "tariffa API", addebitata dal fornitore del servizio. Questa tariffa è un aspetto critico da considerare quando si integrano gli LLM nelle proprie applicazioni.
Rappresenta il costo associato a ogni query, richiesta o attività eseguita tramite la API del fornitore. Poiché le strutture di prezzo possono variare notevolmente (in base a fattori come l'utilizzo di token, il volume di chiamate alle API, l'utilizzo di funzionalità o i modelli di abbonamento), è essenziale capire come i fornitori calcolano questi costi.
Il pricing delle LLM API può essere complesso a causa di fattori come il consumo di token, la lunghezza del contesto e la scelta del modello. Le procedure di tokenizzazione variano da modello a modello, con alcuni che usano Byte-Pair Encoding (BPE), WordPiece o SentencePiece, ciascuno dei quali influenza il modo in cui il testo viene suddiviso in token e incide sull'efficienza dei costi. Comprendere queste differenze aiuta a ottimizzare l'uso e il pricing delle API.
I costi degli LLM sono determinati principalmente dall'utilizzo dei token (sia input sia output), dal volume di chiamate alle API e dal modello di prezzo (ad es. per token o in abbonamento).
Confronta i prezzi dei token di input e output, i limiti della finestra di contesto ed eventuali costi aggiuntivi. Strumenti come OpenRouter consentono di inviare lo stesso prompt a più modelli e di confrontare direttamente risultati, utilizzo di token, velocità e prezzi. Considera la lunghezza tipica dei tuoi contenuti e i modelli di utilizzo per stimare i costi complessivi.
I token di input sono i token presenti nel prompt inviato all'LLM, mentre i token di output sono i token della risposta generata. Per i modelli di ragionamento, anche i token generati durante il processo di ragionamento vengono conteggiati come token di output, influendo sul costo finale. Sia l'input sia l'output contribuiscono al costo complessivo.
Richieste di testo più grandi richiedono più elaborazione, aumentando tempi di risposta e costi. Ottimizza le dimensioni dell'input e usa un calcolatore di prezzi per LLM API per stimare il numero di token e gestire efficacemente il budget.
La community degli LLM ha sviluppato vari strumenti e benchmark per aiutare gli utenti a comprendere e ottimizzare i prezzi degli LLM. Queste risorse includono spesso calcolatori e grafici comparativi che offrono indicazioni sulla potenza e sull'efficienza dei diversi modelli.
Piattaforme come Hugging Face e GitHub ospitano strumenti e codice sviluppati dalla community per analizzare prestazioni e costi dei modelli. Molti servizi offrono supporto tramite forum o funzionalità di chat.
Cita questa ricerca
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{dilmegani2026,
author = {Dilmegani, Cem},
title = {{LLM Prezzi: Confronto tra i migliori 15+ provider}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/llm-pricing}},
note = {AIMultiple. Consultato il 27 Agosto 2026}
}Risultati e timestamp di 19 punti dati. Scarica i dati utilizzati in questo articolo come file ZIP contenente 3 file CSV.
Registro delle modifiche
8 aggiornamenti- 2026
Aggiornata la descrizione del grafico nell'introduzione.
Aggiunto un grafico alla sezione dei tipi di prezzo LLM.
Rimossa la sezione 'Comprendere i prezzi LLM'.
Espansa la sezione "Implicazioni della finestra di contesto" con strategie per la gestione dell'utilizzo dei token nelle conversazioni lunghe.
Aggiunto ChatGPT Go alla sezione OpenAI.
- 2025
Espansa la sezione "Confronto dei piani di abbonamento LLM" con i prezzi dettagliati per Microsoft Copilot, Google Gemini, Mistral AI, OpenAI e Claude.ai.
Aggiunta la sezione "Meccanismi di prezzo e costi nascosti" all'articolo.
Rimossa la definizione di Rango (Limite Superiore) dalla sezione prima delle FAQ.
Collegamenti di riferimento
Il lavoro di Cem presso AIMultiple è stato citato da importanti testate internazionali tra cui Business Insider, Forbes, Morning Brew e Washington Post, da aziende globali come Deloitte e HPE, da ONG come il World Economic Forum e da organizzazioni sovranazionali come la Commissione europea. [1], [2], [3], [4], [5]
Nel corso della sua carriera, Cem ha lavorato come consulente tecnologico, acquirente tecnologico e imprenditore tecnologico. Ha consigliato le aziende sulle loro decisioni tecnologiche presso McKinsey & Company e Altman Solon per più di un decennio. Ha inoltre pubblicato un report McKinsey sulla digitalizzazione.
Ha guidato la strategia tecnologica e gli approvvigionamenti di una società di telecomunicazioni rispondendo direttamente al CEO. Ha inoltre guidato la crescita commerciale dell'azienda deep tech Hypatos, che ha raggiunto ricavi ricorrenti annuali a 7 cifre e una valutazione a 9 cifre partendo da zero in 2 anni. Il lavoro di Cem in Hypatos è stato ripreso da importanti testate tecnologiche come TechCrunch e Business Insider.
Cem interviene regolarmente a conferenze tecnologiche internazionali. Si è laureato come ingegnere informatico presso l'Università di Bogazici e possiede un MBA della Columbia Business School.



Sii il primo a commentare
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.