Les fournisseurs LLM à tarif fixe proposent une utilisation illimitée des modèles pour un prix mensuel fixe au lieu de facturer par token. Ce modèle s'est répandu car les sessions de codage agentique peuvent utiliser des dizaines de millions de tokens, rendant la facture par token difficile à prévoir. Très peu de fournisseurs offrent un véritable forfait fixe ; la plupart des plans commercialisés comme fixes cachent un quota d'utilisation. Ci-dessous, nous comparons les fournisseurs qui vendent réellement une utilisation illimitée, avec les modèles servis, la limite de concurrence et les tarifs pour chacun.
Fournisseur | Domaine | Modèles | Concurrence | Prix |
|---|---|---|---|---|
Giotto.ai | Déploiement souverain hébergé dans l'UE | Giotto 1 (modèle propre) | 1 requête à la fois | 49.90 CHF/mois |
Featherless.ai | Variété de modèles open-weight à coût fixe | 30 000+ modèles open-weight | 4 à 8 unités par plan | À partir de $25/mois |
Awan LLM | Accès à forfait fixe économique | Llama 3 et 3.1 (8B et 70B) | 100 à 200 requêtes/min | $5 à $80/mois |
Les fournisseurs de ce tableau répondent à deux critères :
- Un prix mensuel fixe publié.
- Utilisation illimitée : aucun budget de tokens ou de prompts qui vous arrête. Les limites de taux qui régulent les requêtes sont autorisées ; les budgets qui mettent fin à l'utilisation ne le sont pas.
Fournisseurs LLM à tarif fixe analysés
Featherless.ai
Featherless propose plus de 30 000 modèles open-weight (DeepSeek, Kimi, GLM, Qwen, Llama, et fine-tunes) via une seule OpenAI-compatible API avec des tokens et des requêtes illimités.1 Au lieu d'un compteur de tokens, il tarifie les unités de concurrence : un petit modèle coûte 1 unité par requête en cours, un modèle de classe 70B coûte 4, et les requêtes dépassant votre budget renvoient une erreur HTTP 429 au lieu d'un frais.
Le plan Premium inclut 4 unités, donc $25 achètent une voie de grand modèle ou quatre voies de petits modèles. Les plans Agent ajoutent 8 unités et un bac à sable pour les charges de travail autonomes. L'entreprise a levé une Série A de $20M codirigée par AMD Ventures et Airbus Ventures le 30 04 2026, ce qui constitue le soutien financier le plus solide de ce marché.
Cas d'utilisation idéal : Codage agentique à flux unique lourd et expérimentation de modèles avec un plafond de coût strict.
Modèles : 30 000+ modèles open-weight ; limite de taille 229B sur les formules à $100, pas de limite sur les formules à $200.
Concurrence : 4 unités (Premium), 8 unités (Agent et par unité Business).
Prix : Premium $25/mois. Agent $100 ou $200/mois. Business $100 ou $200 par unité/mois.
Fonctionnalités clés :
- Tokens et requêtes illimités sur chaque plan.
- Tout modèle open-weight catalogué, modifiable par requête.
- OpenAI-compatible API.
- Politique documentée d'absence de journalisation pour les prompts et les complétions.
- La concurrence évolue linéairement sur les plans Business.
Limites :
- Une requête de classe 70B consomme tout le budget d'unités Premium.
- Les requêtes dépassant le budget sont rejetées avec une erreur HTTP 429, donc les outils parallèles nécessitent leur propre file d'attente.
- Le débit par voie n'est pas publié ; le fournisseur ne communique pas le nombre de tokens par seconde.
Giotto.ai
Giotto est un laboratoire suisse à Lausanne proposant son propre modèle de raisonnement, Giotto 1, qu'il positionne comme le modèle plus puissant fonctionnant sur un seul GPU.2 L'entreprise vend le même système sous forme de cloud hébergé dans l'UE, de déploiement privé sur site ou de matériel préinstallé, avec certification ISO 27001.
L'API à tarif fixe a été annoncée par le PDG Aldo Podestà le 09 07 2026 : 49.90 CHF par mois, une requête concurrente, utilisation illimitée.3 À la date du 23 07 2026, l'offre n'est pas sur giotto.ai, qui n'a pas de page de tarification et redirige les acheteurs vers un formulaire de contact ; tous les termes ci-dessous sont donc provisoires.
Cas d'utilisation idéal : Exigences de résidence et de souveraineté des données dans l'UE avec un budget fixe.
Modèles : Giotto 1 uniquement.
Concurrence : 1 requête à la fois (mono-concurrence).
Prix : 49.90 CHF/mois ; gratuit espace de travail Giotto Open avec des limites d'API non précisées.
Fonctionnalités clés :
- Utilisation illimitée via une seule voie de requête.
- Hébergement dans l'UE, dans des centres de données suisses et partenaires de l'UE.
- Même modèle disponible pour un déploiement privé sur ses propres GPU.
- L'espace de travail partagé gratuit inclut l'accès à l'API.
Limites :
- Pas encore achetable ; pas de page de tarification publique au 23 07 2026.
- L'annonce revendique jusqu'à 200x d'économies par rapport à Fable 5 et 350x par rapport à l'API de GPT Pro ; ces comparaisons ne portent que sur le prix. Le propre tableau de benchmarks de Giotto positionne Giotto 1 face à des modèles mono-GPU tels que Gemma 4 31B et GPT-OSS-120B, et non face aux modèles de pointe revendiqués.
- Entreprise en phase de démarrage : le produit a été lancé le 18 05 2026, et le PDG a déclaré en juin 2026 qu'un prêt convertible de 5 à 10M CHF devait être finalisé d'ici juillet, avec un tour de table de démarrage plus important prévu pour la fin de l'année.4
Awan LLM
Awan LLM vend des « tokens illimités » à partir de 5 $ par mois, avec des plafonds de requêtes par jour qui évoluent selon la classe de taille du modèle et des limites de taux par minute.5 Les plafonds quotidiens (30K à 80K requêtes sur le plan Pro à $20) sont bien au-dessus de ce qu'un utilisateur interactif unique génère, ce qui rend le plan effectivement à tarif fixe en pratique.
Le catalogue de modèles se trouve sur une page de modèles séparée plutôt que sur la page de tarification : Llama 3.1 8B et 70B Instruct, Llama 3 8B et 70B, et les fine-tunes 8B d'Awan.6 Les plus récents de ces modèles ont été lancés en juillet 2024, de sorte que le catalogue a une à deux générations de retard par rapport aux versions open-weight actuelles.
Cas d'utilisation idéal : Entrée à tarif fixe la moins chère pour les charges de travail open-weight légères et moyennes.
Modèles : Llama 3.1 (8B, 70B), Llama 3 (8B, 70B), et fine-tunes 8B.
Concurrence : Limité par taux à 100 requêtes/min (Pro) à 200 requêtes/min (Max).
Prix : Lite gratuit, Core 5 $/mois, Plus $10/mois, Pro $20/mois, Max $80/mois.
Fonctionnalités clés :
- Tokens illimités sur tous les paliers payants.
- Palier gratuit disponible pour les tests à petite échelle.
- Le palier Max supprime les plafonds de requêtes quotidiens.
- L'entrée payante la moins chère de ce marché à 5 $/mois.
Limites :
- Le catalogue s'arrête à Llama 3.1 ; aucun modèle open-weight de 2025 ou 2026 n'est proposé.
- Les plafonds de requêtes par classe de taille de modèle remplacent le compteur de tokens.
Plans à tarif fixe avec quotas d'utilisation
La plupart des plans dans la discussion sur le tarif fixe sont des abonnements avec un quota renouvelable : le prix est fixe, et un budget de prompts ou de tokens vous arrête au lieu de vous facturer. Ce qui se passe à la limite du quota varie selon le fournisseur et importe autant que la taille du quota. Nous couvrons ces plans niveau par niveau dans notre guide de tarification LLM.
Plan de codage Z.ai GLM
- Compteur : environ 80 à 1 600 prompts par fenêtre de 5 heures plus environ 400 à 8 000 par semaine selon le niveau ; chaque prompt déclenche environ 15 à 20 appels de modèle ; déduction de quota 3x aux heures de pointe.
- À la limite : blocage complet jusqu'au renouvellement de la fenêtre, sans recours au paiement à l'utilisation.
- Aperçu : $18 à $160/mois, fournit GLM-5.2 via un point de terminaison compatible Anthropic dans plus de 20 outils de codage.7
Kimi Code
- Compteur : un pool de crédits partagé avec toutes les fonctionnalités d'adhésion Kimi, renouvelé chaque semaine sans report, plus une fenêtre glissante de 5 heures ; les volumes de quota ne sont pas publiés.
- À la limite : recharge mesurée via l'Utilisation Supplémentaire au lieu d'un blocage complet.
- Aperçu : $19 à $199/mois pour K2.7 Code avec 2 à 8 tâches d'agent concurrentes ; le mode HighSpeed consomme 3x le quota.8
MiniMax Plan de codage
- Compteur : environ 1.7B à 12.5B tokens par mois dans des fenêtres de 5 heures et hebdomadaires ; le quota inutilisé n'est pas reporté.
- Aperçu : $20 à $120/mois ; MiniMax recommande le paiement à l'utilisation pour un usage en production.9
Cerebras Code
- Compteur : 24M à 120M de tokens par jour.
- Aperçu : $50 ou $200/mois pour GLM 4.7 sur du matériel Cerebras ; tous les niveaux étaient encore épuisés le 23 07 2026.10
NanoGPT Pro
- Compteur : 60M tokens d'entrée par semaine ; les grands modèles déduisent à 2x.
- Aperçu : $12/mois pour un ensemble de modèles open source inclus, web et API.11
Synthetic
- Compteur : 500 requêtes par 5 heures, 1 requête simultanée par modèle.
- Aperçu : $30/mois pour sept modèles open-weight toujours actifs, interface utilisateur et API.12
Chutes
- Compteur : utilisation incluse plafonnée à 5x le prix du plan, puis la facturation se poursuit par token.
- Aperçu : $10 ou $20/mois en forfaits prépayés sur du calcul décentralisé ; un programme de remise plutôt qu'un tarif fixe.13
Abonnements Claude et ChatGPT
- Compteur : sessions de 5 heures plus plafonds hebdomadaires (Claude) ; paliers d'utilisation avec limites (ChatGPT).
- Aperçu : $20 à $200+/mois ; la seule voie à tarif fixe vers les modèles fermés de pointe, vendus en tant que sièges, pas en tant qu'APIs.14 15
Comment fonctionne la tarification à tarif fixe
1. Les voies de concurrence remplacent le compteur de tokens
Un fournisseur à tarif fixe plafonne le nombre de requêtes que vous pouvez exécuter simultanément au lieu du nombre de tokens que vous consommez. Une voie de requête ne peut pas consommer plus que la sortie d'un flux GPU, de sorte que le coût de service dans le pire des cas pour le fournisseur est fixe. Le calcul vous plafonne également : une voie diffusant 50 tokens par seconde 24 heures sur 24 produit au maximum environ 130M de tokens de sortie en un mois de 30 jours, et l'utilisation réelle est bien inférieure car la voie est inactive entre les appels. Le nombre de tokens par seconde devient donc un critère d'achat, et aucun des trois fournisseurs ne le publie.
2. Économie des modèles open-weight
Tout véritable fournisseur à tarif fixe propose soit des modèles open-weight sur des GPU standard (Featherless, Awan) soit son propre modèle sur sa propre infrastructure (Giotto). Personne ne vend un accès illimité à un modèle fermé de pointe, car un revendeur ne peut pas plafonner le coût de service d'un modèle qu'il licencie par token. Anthropic et OpenAI proposent des prix fixes uniquement pour leurs propres modèles, intégrés dans des abonnements de chat à quota limité.
3. Équilibre par rapport au paiement par token
Un plan fixe est gagnant lorsque les dépenses mesurées pour le même modèle dépasseraient le prix du plan, et le point d'équilibre dépend fortement de l'hôte mesuré auquel on le compare. Llama 3.3 70B coûte $0.10 par million de tokens d'entrée et $0.32 par million de sortie sur DeepInfra, contre un tarif fixe de $1.04 par million sur Together IA.16 En supposant une répartition entrée-sortie de 70:30, le plan Premium de Featherless à $25 atteint l'équilibre à environ 150M de tokens par mois par rapport à DeepInfra, mais à seulement environ 24M de tokens par rapport à Together IA. Une utilisation agentique lourde à flux unique dépasse facilement la barre inférieure et peut dépasser la plus élevée.
Le cas inverse importe tout autant. Une charge de travail de 5M de tokens par mois répartie sur vingt sessions courtes parallèles coûte moins de 1 $ en mode mesuré sur DeepInfra, tandis que servir cette concurrence sur des voies à tarif fixe coûterait $100 ou plus. Le tarif fixe convient à un travail à volume élevé et à faible concurrence ; le paiement par token l'emporte pour un trafic à faible volume ou hautement parallèle. Les chiffres sont des illustrations aux dates d'accès citées ; utilisez les comptes de tokens du mois dernier dans le même calcul.
4. Viabilité de la tarification illimitée
Les forfaits illimités attirent les utilisateurs les plus lourds, et le marché montre déjà des tensions. Cerebras Code était épuisé à tous les niveaux le 23 07 2026, dix jours après notre première vérification. NanoGPT a augmenté son abonnement de 8 $ à $12 en un an. La réduction de 30 % de Z.ai est limitée dans le temps.
Les précédents sont plus vastes que cette niche. Le PDG d'OpenAI a déclaré en janvier 2025 que le plan ChatGPT Pro à $200/mois perdait de l'argent parce que les abonnés l'utilisaient plus que prévu.17 GitHub a remplacé les unités de requêtes premium de Copilot par des crédits d'IA basés sur l'utilisation le 01 06 2026, tout en maintenant les prix d'abonnement inchangés.18 Cursor a remplacé son allocation de 500 requêtes par un pool d'utilisation de $20 en juin 2025 et a émis des remboursements après les réactions négatives.19 Lorsque les plus grands vendeurs d'utilisation d'IA à prix fixe reculent vers des compteurs, considérez le plan illimité d'un petit fournisseur comme un prix de lancement, et les calculs d'équilibre comme valables pour des mois plutôt que des années.
Pourquoi auriez-vous besoin d'un plan LLM à tarif fixe en 2026 ?
1. Codage agentique lourd
Une seule session d'agent de codage effectue des centaines d'appels de modèle séquentiels et peut consommer des dizaines de millions de tokens. Une voie dessert ce schéma en continu sans variation de facture. Featherless convient ; Giotto le fera une fois achetable.
2. Résidence des données dans l'UE
Giotto héberge dans des centres de données suisses et de l'UE, sert son propre modèle et propose le même système pour un déploiement privé, ce qui convient aux équipes réglementées qui ne peuvent pas envoyer de données vers des APIs hébergées aux États-Unis.
3. Expérimentation de modèles
Featherless expose 30 000+ modèles open-weight derrière une seule API et un seul tarif, de sorte que comparer les modèles ne coûte rien au-delà de l'abonnement.
4. Projets personnels à coût plafonné
Un projet personnel à l'utilisation irrégulière risque des factures surprises avec un compteur. Awan LLM à $5 à $20 par mois plafonne le risque au prix de l'abonnement.
5. Traitement par lots et en arrière-plan
Les tâches de résumé, de classification ou de nettoyage de données exécutées pendant la nuit tolèrent la mise en file d'attente, de sorte qu'elles peuvent saturer les heures d'inactivité d'une voie à un coût marginal nul. N'importe lequel des trois fournisseurs convient si la qualité du modèle est suffisante.
Comment choisir le bon plan LLM à tarif fixe ?
La forme de la charge de travail compte plus que le prix. Le travail séquentiel (un agent, un chat, des tâches par lots) fonctionne bien sur une seule voie. Les flottes d'agents parallèles se sérialisent derrière une voie et nécessitent plus de concurrence : Featherless tarifie explicitement les unités supplémentaires et rejette les requêtes dépassant le budget avec HTTP 429, tandis qu'un plan à mono-concurrence comme l'API annoncée de Giotto ne peut pas du tout être élargie.
La qualité du modèle fixe le plancher. Un plan fixe ne permet d'économiser de l'argent que si le modèle servi peut faire votre travail ; vérifiez donc les notes de benchmark indépendantes pour le modèle spécifique avant de comparer les prix. Les multiples de prix cités par rapport aux modèles de pointe comparent différentes classes de qualité. Notre benchmark LLM agentique évalue les modèles open-weight que ces plans servent, y compris Kimi, GLM et MiniMax.
Le volume mensuel et l'alternative mesurée déterminent ensemble le choix entre fixe et mesuré. Par rapport à un hébergeur à bas coût, le point de basculement pour un plan à $25 se situe autour de 150M de tokens par mois ; par rapport à un hébergeur premium, il tombe à environ 24M. En dessous de votre point de basculement, le paiement à l'utilisation est moins cher ; bien au-dessus, un plan fixe rapporte des multiples de son prix.
Limites à vérifier avant de souscrire :
- Les chiffres de tokens par seconde et de latence, qu'aucun fournisseur ne publie actuellement.
- Ce que coûte une requête de grand modèle en unités de concurrence.
- Le comportement à la limite : requêtes rejetées (Featherless), mise en file d'attente ou recharge mesurée.
- Si le catalogue de modèles servis est documenté (Awan ne le répertorie pas).
- Les conditions d'utilisation commerciale et de production.
La durabilité du fournisseur est un critère réel sur ce marché. Featherless dispose d'une Série A de $20M ; Giotto finalisait encore un prêt convertible de 5 à 10M CHF en juin 2026. Privilégiez les fournisseurs dont la limitation leur assure une économie unitaire durable, et évitez de standardiser une équipe sur un plan qui pourrait être reprixé ou épuisé d'ici un an.
FAQ
En juillet 2026 : Featherless.ai (à partir de $25/mois, plafonné par concurrence), Awan LLM ($5 à $80/mois, plafonné par taux de requêtes), et l'API annoncée de Giotto.ai à 49.90 CHF/mois, pas encore disponible à l'achat. Tous les autres plans à prix fixe que nous avons vérifiés mesurent l'utilisation via des quotas renouvelables.
En plafonnant les requêtes concurrentes. Une voie ne peut pas consommer plus que la sortie d'un flux GPU, de sorte que le coût dans le pire des cas du fournisseur est fixe, et les modèles servis sont open-weight ou propriétaires, donc aucun coût de licence par token ne s'applique.
En général, non. Le débit est limité aux voies achetées, aucun fournisseur du tableau principal ne publie de SLA pour ces plans, et les alternatives à quota orientent explicitement les utilisateurs en production vers le paiement à l'utilisation.
Citer cette recherche
Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.
@misc{kalelioglu2026,
author = {Kalelioğlu, Berk},
title = {{Meilleurs fournisseurs LLM API à tarif fixe}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/flat-rate-llm-api}},
note = {AIMultiple. Consulté le 7 Août 2026}
}
Soyez le premier à commenter
Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.