Migliori fornitori di LLM API a tariffa fissa
I fornitori di LLM a tariffa fissa vendono un utilizzo illimitato del modello a un prezzo mensile fisso invece di fatturare a token. Questo modello si è diffuso perché le sessioni di coding agentico possono utilizzare decine di milioni di token, rendendo difficile prevedere una fattura a consumo. Pochissimi fornitori offrono una vera tariffa fissa; la maggior parte dei piani commercializzati come fissi nascondono una quota di utilizzo sottostante. Di seguito confrontiamo i fornitori che effettivamente vendono un utilizzo illimitato, con i modelli serviti, il limite di concorrenza e i prezzi per ciascuno.
Fornitore | Focus | Modelli | Concorrenza | Prezzo |
|---|---|---|---|---|
Giotto.ai | Implementazione sovrana ospitata nell'UE | Giotto 1 (modello proprio) | 1 richiesta alla volta | 49.90 CHF/mo |
Featherless.ai | Varietà di modelli open-weight a costo fisso | 30.000+ modelli open-weight | da 4 a 8 unità per piano | Da $25/mo |
Awan LLM | Accesso a tariffa fissa economico | Llama 3 e 3.1 (8B e 70B) | 100 a 200 richieste/min | $5 a $80/mo |
I fornitori in questa tabella soddisfano due criteri:
- Un prezzo mensile fisso pubblicato.
- Utilizzo illimitato: nessun budget di token o prompt che ti blocchi. Sono consentiti limiti di velocità che regolano le richieste; non lo sono i budget che interrompono l'utilizzo.
Fornitori di LLM a tariffa fissa analizzati
Featherless.ai
Featherless serve più di 30.000 modelli open-weight (DeepSeek, Kimi, GLM, Qwen, Llama e fine-tune) attraverso una OpenAI compatibile API con token e richieste illimitati.1 Invece di un contatore di token, addebita per unità di concorrenza: un modello piccolo costa 1 unità per richiesta in volo, un modello di classe 70B costa 4, e le richieste oltre il budget restituiscono un errore HTTP 429 invece di un addebito.
Il piano Premium include 4 unità, quindi $25 acquistano una corsia per modello grande o quattro corsie per modelli piccoli. I piani Agent aggiungono 8 unità e un sandbox per carichi di lavoro autonomi. L'azienda ha raccolto una serie A di $20M co-guidata da AMD Ventures e Airbus Ventures il 2026-04-30, il più forte sostegno finanziario in questo mercato.
Caso d'uso migliore: Coding agentico a flusso singolo intenso e sperimentazione di modelli con un tetto di costo rigido.
Modelli: 30.000+ modelli open-weight; limite dimensionale di 229B sui piani da $100, nessun limite sui piani da $200.
Concorrenza: 4 unità (Premium), 8 unità (Agent e per unità Business).
Prezzo: Premium $25/mo. Agent $100 o $200/mo. Business $100 o $200 per unità/mo.
Caratteristiche principali:
- Token e richieste illimitati su ogni piano.
- Qualsiasi modello open-weight catalogato, commutabile per richiesta.
- OpenAI compatibile API.
- Politica documentata di non registrazione per prompt e completamenti.
- La concorrenza scala linearmente sui piani Business.
Limitazioni:
- Una richiesta di classe 70B consuma l'intero budget di unità Premium.
- Le richieste oltre il budget vengono respinte con HTTP 429, quindi gli strumenti paralleli necessitano di una propria coda di richieste.
- Il throughput per corsia non è pubblicato; il fornitore non dichiara i token al secondo.
Giotto.ai
Giotto è un laboratorio svizzero a Losanna che serve il proprio modello di ragionamento, Giotto 1, che posiziona come il modello più potente eseguibile su una singola GPU.2 L'azienda vende lo stesso sistema come cloud ospitato nell'UE, distribuzione privata on-premise o hardware preinstallato, con certificazione ISO 27001.
L'API a tariffa fissa è stata annunciata dal CEO Aldo Podestà il 2026-07-09: 49.90 CHF al mese, una richiesta simultanea, utilizzo illimitato.3 A partire dal 2026-07-23 l'offerta non è presente su giotto.ai, che non ha una pagina dei prezzi e indirizza gli acquirenti a un modulo di contatto, quindi tutti i termini seguenti sono provvisori.
Caso d'uso migliore: Requisiti di residenza dei dati e sovranità UE con un budget fisso.
Modelli: Solo Giotto 1.
Concorrenza: 1 richiesta alla volta (mono-concorrenza).
Prezzo: Prezzo: 49.90 CHF/mo; spazio di lavoro Giotto Open gratuito con limiti API non dichiarati.
Caratteristiche principali:
- Utilizzo illimitato attraverso una singola corsia di richieste.
- Hosting UE in data center svizzeri e partner UE.
- Stesso modello disponibile per distribuzione privata su proprie GPU.
- Spazio di lavoro condiviso gratuito include accesso API.
Limitazioni:
- Non ancora acquistabile; nessuna pagina dei prezzi pubblica al 2026-07-23.
- L'annuncio dichiara risparmi fino a 200x rispetto a Fable 5 e 350x rispetto all'API di GPT Pro; questi confrontano solo il prezzo. La tabella benchmark di Giotto posiziona Giotto 1 contro modelli a singola GPU come Gemma 4 31B e GPT-OSS-120B, non i modelli di frontiera nella dichiarazione di prezzo.
- Azienda in fase iniziale: il prodotto è stato lanciato il 2026-05-18 e il CEO ha dichiarato a giugno 2026 che si prevedeva la chiusura di un prestito convertibile di 5-10M CHF entro luglio, con un round seed più ampio pianificato per fine anno.4
Awan LLM
Awan LLM vende “token illimitati” a partire da $5 al mese, con limiti giornalieri di richieste che scalano per classe di dimensione del modello e limiti di velocità al minuto.5 I limiti giornalieri (da 30K a 80K richieste sul piano Pro da $20) sono molto al di sopra di ciò che genera un singolo utente interattivo, il che rende il piano a tariffa fissa nella pratica.
Il catalogo modelli si trova su una pagina modelli separata anziché sulla pagina dei prezzi: Llama 3.1 8B e 70B Instruct, Llama 3 8B e 70B, e i fine-tune 8B proprietari di Awan.6 Il più recente di questi è stato lanciato a luglio 2024, quindi il catalogo è indietro di una o due generazioni rispetto alle attuali versioni open-weight.
Caso d'uso migliore: Ingresso a tariffa fissa più economico per carichi di lavoro open-weight leggeri e medi.
Modelli: Llama 3.1 (8B, 70B), Llama 3 (8B, 70B), e fine-tune 8B.
Concorrenza: Limitata a velocità di 100 richieste/min (Pro) a 200 richieste/min (Max).
Prezzo: Lite gratuito, Core $5/mo, Plus $10/mo, Pro $20/mo, Max $80/mo.
Caratteristiche principali:
- Token illimitati su ogni livello a pagamento.
- Livello gratuito disponibile per test su piccola scala.
- Il livello Max rimuove i limiti giornalieri di richieste.
- Ingresso a pagamento più economico in questo mercato a $5/mo.
Limitazioni:
- Il catalogo si ferma a Llama 3.1; nessun modello open-weight del 2025 o 2026 è servito.
- I limiti di richieste per classe di dimensione del modello sostituiscono il contatore di token.
Piani a prezzo fisso con quote di utilizzo
La maggior parte dei piani nell'ambito della tariffa fissa sono abbonamenti con una quota che si rinnova: il prezzo è fisso, e un budget di prompt o token ti blocca invece di addebitarti. Ciò che accade al limite della quota varia da fornitore ed è importante quanto la dimensione della quota. Copriamo questi piani livello per livello nella nostra guida ai prezzi LLM.
Piano Z.ai GLM Coding
- Contatore: ~80 a 1.600 prompt per finestra di 5 ore più ~400 a 8.000 a settimana per livello; ogni prompt attiva circa 15 a 20 chiamate del modello; detrazione di quota 3x nelle ore di punta.
- Al limite: blocco rigido fino al rinnovo della finestra, nessun fallback a consumo.
- Panoramica: $18 a $160/mo, serve GLM-5.2 tramite un endpoint compatibile con Anthropic in oltre 20 strumenti di coding.7
Kimi Code
- Contatore: un pool di crediti condiviso con tutte le funzionalità dell'abbonamento Kimi, rinnovato settimanalmente senza riporto, più una finestra mobile di 5 ore; volumi della quota non pubblicati.
- Al limite: ricarica a consumo tramite Extra Usage invece di un blocco rigido.
- Panoramica: $19 a $199/mo per K2.7 Code con 2-8 attività agente simultanee; la modalità HighSpeed consuma 3x la quota.8
Piano Coding MiniMax
- Contatore: ~1,7B a 12,5B token al mese all'interno di finestre di 5 ore e settimanali; la quota non utilizzata non viene riportata.
- Panoramica: $20 a $120/mo; MiniMax consiglia il pagamento a consumo per uso in produzione.9
Cerebras Code
- Contatore: 24M a 120M token al giorno.
- Panoramica: $50 o $200/mo per GLM 4.7 su hardware Cerebras; tutti i livelli risultavano ancora esauriti il 2026-07-23.10
NanoGPT Pro
- Contatore: 60M token di input a settimana; i modelli grandi deducono a 2x.
- Panoramica: $12/mo su un insieme di modelli open-source inclusi, web e API.11
Synthetic
- Contatore: 500 richieste ogni 5 ore, 1 richiesta simultanea per modello.
- Panoramica: $30/mo per sette modelli open-weight sempre attivi, interfaccia utente più API.12
Chutes
- Contatore: utilizzo incluso limitato a 5x il prezzo del piano, poi la fatturazione continua a token.
- Panoramica: pacchetti prepagati da $10 o $20/mo su calcolo decentralizzato; un programma di sconto piuttosto che una tariffa fissa.13
Abbonamenti Claude e ChatGPT
- Contatore: sessioni di 5 ore più limiti settimanali (Claude); livelli di utilizzo con limiti (ChatGPT).
- Panoramica: $20 a $200+/mo; l'unica strada a prezzo fisso per i modelli chiusi di frontiera, venduti come posti, non come API.14 15
Come funziona la tariffazione a forfait
1. Le corsie di concorrenza sostituiscono il contatore di token
Un fornitore a tariffa fissa limita quante richieste è possibile eseguire contemporaneamente invece di quanti token si consumano. Una corsia di richiesta non può assorbire più dell'output di un flusso di una singola GPU, quindi il costo di servizio nel caso peggiore per il fornitore è fisso. Anche l'aritmetica ti limita: una corsia che trasmette 50 token al secondo ininterrottamente produce al massimo circa 130M token di output in un mese di 30 giorni, e l'utilizzo reale è molto al di sotto perché la corsia rimane inattiva tra una chiamata e l'altra. I token al secondo diventano quindi un criterio di acquisto, e nessuno dei tre fornitori lo pubblica.
2. Economia degli open-weight
Ogni vero fornitore a tariffa fissa serve o modelli open-weight su GPU commodity (Featherless, Awan) o il proprio modello sulla propria infrastruttura (Giotto). Nessuno vende accesso illimitato a tariffa fissa a un modello chiuso di frontiera, perché un rivenditore non può limitare il costo di servizio di un modello che concede in licenza a token. Anthropic e OpenAI vendono prezzi fissi solo per i propri modelli, raggruppati in abbonamenti chat con limiti di quota.
3. Pareggio rispetto al pagamento a consumo
Un piano fisso conviene quando la spesa a consumo per lo stesso modello supererebbe il prezzo del piano, e il punto di pareggio dipende fortemente da quale host a consumo si confronta. Llama 3.3 70B costa $0,10 per milione di token di input e $0,32 per milione di output su DeepInfra, contro un prezzo fisso di $1,04 per milione su Together IA.16 Ipotizzando un mix input-output 70:30, Featherless Premium a $25 raggiunge il pareggio a circa 150M token al mese rispetto a DeepInfra, ma a soli circa 24M token rispetto a Together IA. Un uso agentico intenso a flusso singolo supera facilmente la soglia inferiore e può superare quella superiore.
Il caso opposto è altrettanto importante. Un carico di 5M token al mese distribuito su venti sessioni brevi parallele costa meno di $1 a consumo su DeepInfra, mentre servire quella concorrenza su corsie a tariffa fissa costerebbe $100 o più. La tariffa fissa si adatta a lavori ad alto volume e bassa concorrenza; il pagamento a consumo vince su traffico a basso volume o altamente parallelo. Le cifre sono esempi alle date di accesso citate; esegui i conteggi dei token del mese scorso con la stessa aritmetica.
4. Sostenibilità dei prezzi illimitati
I piani illimitati attraggono gli utenti più pesanti e il mercato mostra già la tensione. Cerebras Code era esaurito a tutti i livelli il 2026-07-23, dieci giorni dopo il nostro primo controllo. NanoGPT ha aumentato il suo abbonamento da $8 a $12 entro un anno. Lo sconto 30% di Z.ai è a tempo.
I precedenti sono più grandi di questa nicchia. Il CEO di OpenAI ha dichiarato a gennaio 2025 che il piano ChatGPT Pro da $200/mo era in perdita perché gli abbonati lo usavano più del previsto.17 GitHub ha sostituito le unità di richiesta premium di Copilot con crediti IA basati sull'utilizzo il 2026-06-01 mantenendo invariati i prezzi degli abbonamenti.18 Cursor ha sostituito la sua allocazione di 500 richieste con un pool di utilizzo da $20 a giugno 2025 ed ha emesso rimborsi dopo le polemiche.19 Quando i maggiori venditori di utilizzo IA a prezzo fisso si ritirano verso i contatori, considera il piano illimitato di un piccolo fornitore come un prezzo introduttivo e i calcoli di pareggio validi per mesi anziché anni.
Perché avresti bisogno di un piano LLM a tariffa fissa nel 2026?
1. Coding agentico pesante
Una singola sessione di agente di coding effettua centinaia di chiamate sequenziali al modello e può bruciare decine di milioni di token. Una corsia serve questo schema in modo continuo senza variazioni di fattura. Featherless è adatto; Giotto lo sarà una volta acquistabile.
2. Residenza dei dati UE
Giotto ospita in data center svizzeri e dell'UE, serve il proprio modello e offre lo stesso sistema per distribuzione privata, il che si adatta ai team regolamentati che non possono inviare dati a API ospitate negli Stati Uniti.
3. Sperimentazione di modelli
Featherless espone 30.000+ modelli open-weight dietro un'unica API e un'unica tariffa, quindi confrontare i modelli non costa nulla oltre l'abbonamento.
4. Progetti secondari con limite di costo
Un progetto hobbistico con utilizzo a picchi rischia fatture a sorpresa su un contatore. Awan LLM a $5 a $20 al mese limita il rischio al prezzo dell'abbonamento.
5. Elaborazione batch e in background
Lavori notturni di sintesi, classificazione o pulizia dei dati tollerano l'accodamento, quindi possono saturare le ore di inattività di una corsia a costo marginale zero. Uno qualsiasi dei tre fornitori va bene se la qualità del modello è sufficiente.
Come scegliere il giusto piano LLM a tariffa fissa?
La forma del carico di lavoro decide più del prezzo. Il lavoro sequenziale (un agente, una chat, lavori batch) funziona bene su una singola corsia. Flotte di agenti paralleli si serializzano dietro una corsia e necessitano di maggiore concorrenza: Featherless tariffa esplicitamente le unità extra e respinge le richieste oltre budget con HTTP 429, mentre un piano a mono-concorrenza come l'API annunciata di Giotto non può essere affatto ampliato.
La qualità del modello stabilisce il livello base. Un piano fisso fa risparmiare solo se il modello servito può svolgere il tuo lavoro, quindi verifica i punteggi benchmark indipendenti per il modello specifico prima di confrontare i prezzi. I multipli di prezzo citati contro i modelli di frontiera confrontano classi di qualità diverse. Il nostro benchmark agentico LLM valuta i modelli open-weight serviti da questi piani, inclusi Kimi, GLM e MiniMax.
Il volume mensile e l'alternativa a consumo decidono insieme se scegliere la tariffa fissa o quella a consumo. Rispetto a un host economico, il punto di incrocio per un piano da $25 si aggira intorno a 150M token al mese; rispetto a un host premium scende a circa 24M. Al di sotto del punto di incrocio, il consumo è più economico; molto al di sopra, un piano fisso restituisce multipli del suo prezzo.
Limitazioni da verificare prima di abbonarsi:
- Dati su token al secondo e latenza, che attualmente nessun fornitore pubblica.
- Quanto costa in unità di concorrenza una richiesta per un modello grande.
- Comportamento al limite: richieste respinte (Featherless), accodamento o ricarica a consumo.
- Se il catalogo dei modelli serviti è documentato (Awan non lo elenca).
- Termini per uso commerciale e in produzione.
La solidità del fornitore è un criterio reale in questo mercato. Featherless ha una Serie A da $20M; Giotto stava ancora chiudendo un prestito convertibile da 5-10M CHF a giugno 2026. Preferisci fornitori la cui regolazione del traffico garantisce un'economia unitaria sostenibile, ed evita di standardizzare un team su un piano che potrebbe essere riprezzato o esaurito entro un anno.
FAQ
A luglio 2026: Featherless.ai (da $25/mo, limitato per concorrenza), Awan LLM ($5 a $80/mo, limitato per velocità di richiesta) e l'API annunciata di Giotto.ai a 49,90 CHF/mo, non ancora pubblicamente acquistabile. Ogni altro piano a prezzo fisso che abbiamo controllato misura l'utilizzo tramite quote che si rinnovano.
Limitando le richieste simultanee. Una corsia non può consumare più dell'output di un flusso di una singola GPU, quindi il costo nel caso peggiore per il fornitore è fisso, e i modelli serviti sono open-weight o di proprietà del fornitore, quindi non si applica alcun costo di licenza a token.
Generalmente no. Il throughput è limitato alle corsie acquistate, nessun fornitore nella tabella principale pubblica un SLA per questi piani e le alternative basate su quote indirizzano esplicitamente gli utenti di produzione al consumo.
Cita questa ricerca
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{kalelioglu2026,
author = {Kalelioğlu, Berk},
title = {{Migliori fornitori di LLM API a tariffa fissa}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/flat-rate-llm-api}},
note = {AIMultiple. Consultato il 7 Agosto 2026}
}
Sii il primo a commentare
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.