I migliori fornitori di LLM API a tariffa fissa
I fornitori di LLM a tariffa fissa vendono un utilizzo illimitato dei modelli a un prezzo mensile fisso invece di fatturare per token. Questo modello si è diffuso perché le sessioni di codifica agentica possono consumare decine di milioni di token, rendendo difficile prevedere il costo per token. Pochissimi fornitori offrono una vera tariffa fissa; la maggior parte dei piani commercializzati come a tariffa fissa nasconde un limite di utilizzo sottostante. Di seguito confrontiamo i fornitori che vendono effettivamente un utilizzo illimitato, con i modelli offerti, il limite di concorrenza e il prezzo per ciascuno.
Fornitore | Focus | Modelli | Concorrenza | Prezzo |
|---|---|---|---|---|
Giotto.ai | Implementazione sovrana ospitata nell'UE | Giotto 1 (modello proprio) | 1 richiesta alla volta | 49.90 CHF/mese, annunciato |
Featherless.ai | Varietà di modelli a peso aperto a un costo fisso | 30.000+ modelli a peso aperto | Da 4 a 8 unità per piano | Da $25/mese |
Awan LLM | Accesso a tariffa fissa economico | A peso aperto, catalogo non elencato | 100 a 200 richieste/min | Da $5 a $80/mese |
I fornitori in questa tabella soddisfano due criteri:
- Un prezzo mensile fisso pubblicato.
- Nessuna quota di token, prompt o finestra temporale sull'utilizzo.
Fornitori di LLM a tariffa fissa analizzati
Featherless.ai
Featherless serve più di 30.000 modelli a peso aperto (DeepSeek, Kimi, GLM, Qwen, Llama e versioni ottimizzate) attraverso un'unica API compatibile con OpenAI con token e richieste illimitati.1 Invece di un contatore di token, vengono tariffate le unità di concorrenza: un modello piccolo costa 1 unità per richiesta in volo, un modello di classe 70B costa 4, e le richieste che superano il budget restituiscono un errore HTTP 429 invece di un addebito.
Il piano Premium include 4 unità, quindi $25 acquistano una corsia per modelli grandi o quattro corsie per modelli piccoli. I piani Agent aggiungono 8 unità e una sandbox per carichi di lavoro autonomi. L'azienda ha raccolto un finanziamento Serie A da $20M co-guidato da AMD Ventures e Airbus Ventures il 30-04-2026, il supporto finanziario più forte in questo mercato.
Caso d'uso migliore: Codifica agentica a flusso singolo intensiva e sperimentazione di modelli con un tetto di costo rigido.
Modelli: 30.000+ modelli a peso aperto; limite di dimensione 229B sui tier da $100, nessun limite sui tier da $200.
Concorrenza: 4 unità (Premium), 8 unità (Agent e per unità Business).
Prezzo: Premium $25/mese. Agent $100 o $200/mese. Business $100 o $200 per unità/mese.
Caratteristiche principali:
- Token e richieste illimitati su ogni piano.
- Qualsiasi modello a peso aperto catalogato, selezionabile per richiesta.
- OpenAI-compatible API.
- Politica documentata di non registrazione per prompt e completamenti.
- La concorrenza scala linearmente sui piani Business.
Limitazioni:
- Una richiesta di classe 70B consuma l'intero budget di unità Premium.
- Le richieste in eccesso vengono rifiutate con HTTP 429, quindi gli strumenti paralleli necessitano di una propria coda di richieste.
- Il throughput per corsia non è pubblicato; il fornitore non indica i token al secondo.
Giotto.ai
Giotto è un laboratorio svizzero con sede a Losanna che offre il proprio modello di ragionamento, Giotto 1, che viene posizionato come il modello più potente eseguibile su una singola GPU.2 L'azienda vende lo stesso sistema come cloud ospitato nell'UE, implementazione on-premise privata o hardware preinstallato, con certificazione ISO 27001.
L'API a tariffa fissa è stata annunciata dal CEO Aldo Podestà il 09-07-2026: 49,90 CHF al mese, una richiesta simultanea, utilizzo illimitato.3 Dal 23-07-2026 l'offerta non è presente su giotto.ai, che non ha una pagina dei prezzi e indirizza gli acquirenti a un modulo di contatto, quindi tutti i termini di seguito sono provvisori.
Caso d'uso migliore: Requisiti di residenza dei dati nell'UE e sovranità con un budget fisso.
Modelli: Solo Giotto 1.
Concorrenza: 1 richiesta alla volta (mono-concorrenza).
Prezzo: 49,90 CHF/mese, solo annuncio; gratuito spazio di lavoro Giotto Open con limiti API non dichiarati.
Caratteristiche principali:
- Utilizzo illimitato attraverso una singola corsia di richieste, secondo l'annuncio.
- Hosting UE in centri dati svizzeri e di partner UE.
- Lo stesso modello disponibile per implementazione privata su proprie GPU.
- Lo spazio di lavoro gratuito condiviso include l'accesso API.
Limitazioni:
- Non ancora acquistabile; nessuna pagina dei prezzi pubblica al 23-07-2026.
- L'annuncio dichiara un risparmio fino a 200x rispetto a Fable 5 e 350x rispetto all'API di GPT Pro; questi confronti riguardano solo il prezzo. La tabella di benchmark di Giotto stessa posiziona Giotto 1 rispetto a modelli single-GPU come Gemma 4 31B e GPT-OSS-120B, non rispetto ai modelli di frontiera usati nel confronto di prezzo.
- Azienda in fase iniziale: il prodotto è stato lanciato il 18-05-2026, e il CEO ha dichiarato a giugno 2026 che un prestito convertibile CHF 5-10M avrebbe dovuto chiudersi entro luglio, con un round seed più ampio pianificato per la fine dell'anno.
Awan LLM
Awan LLM vende "token illimitati" a partire da $5 al mese, con limiti giornalieri di richieste che scalano per classe di dimensione del modello e limiti di velocità al minuto.4 I limiti giornalieri (30K a 80K richieste sul piano Pro da $20) sono ben superiori a quanto genererebbe un singolo utente interattivo, rendendo il piano a tariffa fissa nella pratica.
La pagina dei prezzi non elenca quali modelli vengono serviti né quanto sono aggiornati. Verificare il catalogo rispetto al proprio carico di lavoro prima di pagare.
Caso d'uso migliore: Ingresso a tariffa fissa più economico per carichi di lavoro aperti leggeri e medi.
Modelli: A peso aperto; catalogo e versioni non specificati sulla pagina dei prezzi.
Concorrenza: Limitato a 100 richieste/min (Pro) fino a 200 richieste/min (Max).
Prezzo: Lite gratuito, Core $5/mese, Plus $10/mese, Pro $20/mese, Max $80/mese.
Caratteristiche principali:
- Token illimitati su ogni livello a pagamento.
- Livello gratuito disponibile per test su piccola scala.
- Il livello Max rimuove i limiti giornalieri di richieste.
- L'ingresso a pagamento più economico in questo mercato a $5/mese.
Limitazioni:
- I modelli serviti e le loro versioni non sono documentati; la qualità non è verificata.
- I limiti di richiesta per classe di dimensione del modello sostituiscono il contatore di token.
Piani a prezzo fisso con quote di utilizzo
La maggior parte dei piani nel dibattito sulla tariffa fissa sono abbonamenti con una quota che si rinnova: il prezzo è fisso, e un budget di prompt o token ti blocca invece di addebitarti. Cosa succede al limite della quota varia a seconda del fornitore ed è importante quanto la dimensione della quota. Trattiamo questi piani livello per livello nella nostra guida ai prezzi LLM.
Piano Z.ai GLM Coding
- Contatore: ~80 a 1.600 prompt per finestra di 5 ore più ~400 a 8.000 a settimana per livello; ogni prompt attiva una stima di 15 a 20 chiamate al modello; deduzione della quota 3x nelle ore di punta.
- Al limite: blocco rigido fino al rinnovo della finestra, nessuna alternativa a consumo.
- Panoramica: $18 a $160/mese, serve GLM-5.2 tramite un endpoint compatibile con Anthropic in 20+ strumenti di codifica.5
Kimi Code
- Contatore: un pool di crediti condiviso con tutte le funzionalità dell'abbonamento Kimi, rinnovato settimanalmente senza riporto, più una finestra mobile di 5 ore; volumi di quota non pubblicati.
- Al limite: ricarica misurata tramite Extra Usage invece di un blocco rigido.
- Panoramica: $19 a $199/mese per K2.7 Code con 2 a 8 attività agentiche simultanee; la modalità HighSpeed consuma 3x la quota.6
Piano MiniMax Coding
- Contatore: ~1,7B a 12,5B token al mese all'interno di finestre di 5 ore e settimanali; la quota non utilizzata non viene riportata.
- Panoramica: $20 a $120/mese; MiniMax consiglia il pay-as-you-go per l'uso in produzione.7
Cerebras Code
- Contatore: 24M a 120M token al giorno.
- Panoramica: $50 o $200/mese per GLM 4.7 su hardware Cerebras; ogni livello risultava ancora esaurito il 23-07-2026.8
NanoGPT Pro
- Contatore: 60M token di input a settimana; i modelli grandi deducono a 2x.
- Panoramica: $12/mese per un insieme di modelli open source inclusi, via web e API.9
Synthetic
- Contatore: 500 richieste ogni 5 ore, 1 richiesta simultanea per modello.
- Panoramica: $30/mese per sette modelli a peso aperto sempre attivi, interfaccia utente più API.10
Chutes
- Contatore: utilizzo incluso limitato a 5x il prezzo del piano, poi la fatturazione continua per token.
- Panoramica: $10 o $20/mese in bundle prepagati su calcolo decentralizzato; un programma di sconto piuttosto che una tariffa fissa.11
Abbonamenti Claude e ChatGPT
- Contatore: sessioni di 5 ore più limiti settimanali (Claude); livelli di utilizzo con limiti (ChatGPT).
- Panoramica: $20 a $200+/mese; l'unica via a prezzo fisso per i modelli chiusi di frontiera, venduti come posti, non come API.12
Come funziona la tariffazione a forfait
1. Le corsie di concorrenza sostituiscono il contatore di token
Un fornitore a tariffa fissa limita quante richieste puoi eseguire contemporaneamente invece di quanti token consumi. Una singola corsia di richieste non può assorbire più della produzione di uno stream di una GPU, quindi il costo di servizio nel caso peggiore per il fornitore è fisso. L'aritmetica limita anche te: una corsia che trasmette 50 token al secondo senza interruzioni produce al massimo circa 130M token di output in un mese di 30 giorni, e l'utilizzo reale è ben al di sotto perché la corsia rimane inattiva tra le chiamate. I token al secondo diventano quindi un criterio di acquisto, e nessuno dei tre fornitori li pubblica.
2. Economia dei modelli a peso aperto
Ogni vero fornitore a tariffa fissa serve o modelli a peso aperto su GPU commodity (Featherless, Awan) o il proprio modello sulla propria infrastruttura (Giotto). Nessuno vende un accesso flat illimitato a un modello chiuso di frontiera, perché un rivenditore non può limitare il costo di servizio di un modello che licenzia per token. Anthropic e OpenAI vendono prezzi fissi solo per i propri modelli, integrati in abbonamenti chat con limiti di quota.
3. Punto di pareggio rispetto al pay-per-token
Un piano flat conviene quando la spesa misurata per lo stesso modello supererebbe il prezzo del piano, e il punto di pareggio dipende fortemente da quale host misurato si confronta. Llama 3.3 70B costa $0,10 per milione di token di input e $0,32 per milione di output su DeepInfra, contro un flat di $1,04 per milione su Together IA.13 Assumendo un mix input-output di 70:30, Featherless Premium a $25 raggiunge il pareggio a circa 150M token al mese rispetto a DeepInfra, ma a solo circa 24M token rispetto a Together IA. Un uso agentico a flusso singolo intensivo supera facilmente la barra più bassa e può superare anche quella più alta.
Il caso inverso è altrettanto importante. Un carico di lavoro di 5M token al mese distribuito su venti sessioni brevi parallele costa meno di $1 misurato su DeepInfra, mentre servire quella concorrenza su corsie a tariffa fissa costerebbe $100 o più. La tariffa fissa si adatta a lavori ad alto volume e bassa concorrenza; il pay-per-token vince su traffico a basso volume o altamente parallelo. Le cifre sono illustrazioni alle date di accesso citate; inserisci i conteggi di token dell'ultimo mese nella stessa aritmetica.
4. Sostenibilità dei prezzi illimitati
I piani illimitati attirano gli utenti più pesanti, e il mercato mostra già la tensione. Cerebras Code era esaurito a ogni livello il 23-07-2026, dieci giorni dopo il nostro primo controllo. NanoGPT ha aumentato il suo abbonamento da $8 a $12 in un anno. Lo sconto del 30% di Z.ai è limitato nel tempo.
I precedenti vanno oltre questa nicchia. Il CEO di OpenAI ha dichiarato a gennaio 2025 che il piano ChatGPT Pro da $200/mese stava perdendo denaro perché gli abbonati lo usavano più del previsto.14 GitHub ha sostituito le unità di richiesta premium di Copilot con IA Credits basati sull'utilizzo il 01-06-2026, mantenendo invariati i prezzi degli abbonamenti.15 Cursor ha scambiato la sua allocazione di 500 richieste con un pool di utilizzo di $20 a giugno 2025 e ha emesso rimborsi dopo le reazioni negative.16 Quando i maggiori venditori di utilizzo IA a prezzo fisso si ritirano verso i contatori, considera il piano illimitato di un piccolo fornitore come un prezzo introduttivo, e la matematica del pareggio valida per mesi anziché anni.
Perché avresti bisogno di un piano LLM a tariffa fissa nel 2026?
1. Codifica agentica intensiva
Una singola sessione di codifica agentica effettua centinaia di chiamate sequenziali al modello e può bruciare decine di milioni di token. Una corsia serve questo schema in modo continuativo senza variazioni di costo. Featherless si adatta; Giotto lo farà una volta acquistabile.
2. Residenza dei dati nell'UE
Giotto ospita in centri dati svizzeri e dell'UE, serve il proprio modello e offre lo stesso sistema per l'implementazione privata, il che si adatta a team regolamentati che non possono inviare dati a API ospitate negli Stati Uniti.
3. Sperimentazione di modelli
Featherless espone 30.000+ modelli a peso aperto dietro un'unica API e una tariffa, quindi confrontare i modelli non costa nulla oltre l'abbonamento.
4. Progetti secondari con limite di costo
Un progetto hobbistico con utilizzo a picchi rischia fatture a sorpresa con un contatore. Awan LLM da $5 a $20 al mese limita il lato negativo al prezzo dell'abbonamento.
5. Elaborazione batch e in background
Lavori notturni di riepilogo, classificazione o pulizia dei dati tollerano l'accodamento, quindi possono saturare le ore di inattività di una corsia a costo marginale zero. Qualunque dei tre fornitori va bene se la qualità del modello è sufficiente.
Come scegliere il giusto piano LLM a tariffa fissa?
La forma del carico di lavoro conta più del prezzo. Il lavoro sequenziale (un agente, una chat, lavori batch) funziona bene su una singola corsia. Flotte di agenti paralleli si serializzano dietro una corsia e necessitano di maggiore concorrenza: Featherless tariffa esplicitamente unità extra e rifiuta le richieste in eccesso con HTTP 429, mentre un piano a mono-concorrenza come l'API annunciata di Giotto non può essere affatto ampliato.
La qualità del modello stabilisce il livello minimo. Un piano flat fa risparmiare solo se il modello servito può svolgere il tuo lavoro, quindi controlla i punteggi di benchmark indipendenti per il modello specifico prima di confrontare i prezzi. I multipli di prezzo citati rispetto ai modelli di frontiera confrontano classi di qualità diverse.
Il volume mensile e l'alternativa misurata decidono insieme tra flat e contatore. Rispetto a un host a basso costo, il punto di incrocio per un piano da $25 si colloca vicino a 150M token al mese; rispetto a un host premium scende a circa 24M. Al di sotto del tuo incrocio, il pay-as-you-go è più economico; molto al di sopra, un piano flat restituisce multipli del suo prezzo.
Limitazioni da verificare prima di sottoscrivere:
- Token al secondo e cifre di latenza, che attualmente nessun fornitore pubblica.
- Quanto costa una richiesta di un modello grande in unità di concorrenza.
- Comportamento al limite: richieste rifiutate (Featherless), accodamento o ricarica misurata.
- Se il catalogo dei modelli serviti è documentato (Awan non lo elenca).
- Termini di utilizzo commerciale e per la produzione.
La durabilità del fornitore è un criterio reale in questo mercato. Featherless ha un Serie A da $20M; Giotto stava ancora chiudendo un prestito convertibile CHF da 5-10M a giugno 2026. Preferisci fornitori la cui limitazione garantisca un'economia unitaria sostenibile, ed evita di standardizzare un team su un piano che potrebbe essere riprezzato o esaurito entro un anno.
FAQ
A partire da luglio 2026: Featherless.ai (da $25/mese, limitato per concorrenza), Awan LLM ($5 a $80/mese, limitato per tasso di richieste), e l'API annunciata di Giotto.ai a 49,90 CHF/mese, non ancora pubblicamente acquistabile. Ogni altro piano a prezzo fisso che abbiamo verificato misura l'utilizzo tramite quote rinnovabili.
Limitando le richieste simultanee. Una corsia non può consumare più della produzione di uno stream di una GPU, quindi il costo nel caso peggiore per il fornitore è fisso, e i modelli serviti sono a peso aperto o di proprietà del fornitore, quindi non si applica alcun costo di licenza per token.
In genere no. Il throughput raggiunge il massimo con le corsie acquistate, nessun fornitore nella tabella principale pubblica un SLA per questi piani, e le alternative basate su quote indirizzano esplicitamente gli utenti di produzione verso il pay-as-you-go.
Cita questa ricerca
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{kalelioglu2026,
author = {Kalelioğlu, Berk},
title = {{I migliori fornitori di LLM API a tariffa fissa}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/flat-rate-llm-api}},
note = {AIMultiple. Consultato il 23 Luglio 2026}
}
Sii il primo a commentare
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.