Pauschalpreis-LLM-Anbieter verkaufen unbegrenzte Modellnutzung zu einem festen Monatspreis statt pro Token abzurechnen. Dieses Modell verbreitete sich, weil agentische Kodierungssitzungen zig Millionen Token verbrauchen können, sodass eine tokenbasierte Rechnung schwer vorhersehbar ist. Nur sehr wenige Anbieter bieten eine echte Pauschalgebühr; die meisten als Pauschal vermarkteten Pläne enthalten eine Nutzungsquote. Im Folgenden vergleichen wir die Anbieter, die tatsächlich unbegrenzte Nutzung verkaufen, mit den bedienten Modellen, der Parallelitätsgrenze und den Preisen für jeden.
Anbieter | Fokus | Modelle | Parallelität | Preis |
|---|---|---|---|---|
Giotto.ai | EU-gehostete souveräne Bereitstellung | Giotto 1 (eigenes Modell) | 1 Anfrage gleichzeitig | 49.90 CHF/Monat, angekündigt |
Featherless.ai | Open-Weight-Modellvielfalt zu einem Festpreis | 30,000+ Open-Weight-Modelle | 4 bis 8 Einheiten pro Plan | Ab $25/Monat |
Awan LLM | Budget-Pauschalzugang | Open-Weight, Katalog nicht aufgeführt | 100 bis 200 Anfragen/Minute | $5 bis $80/Monat |
Die Anbieter in dieser Tabelle erfüllen zwei Kriterien:
- Ein veröffentlichter fester Monatspreis.
- Keine Token-, Prompt- oder Zeitfensterquote für die Nutzung.
Analysierte Pauschalpreis-LLM-Anbieter
Featherless.ai
Featherless bedient mehr als 30.000 Open-Weight-Modelle (DeepSeek, Kimi, GLM, Qwen, Llama und Fine-Tunes) über eine OpenAI-kompatible API mit unbegrenzten Tokens und Anfragen.1 Anstelle eines Token-Zählers wird nach Parallelitätseinheiten abgerechnet: Ein kleines Modell kostet 1 Einheit pro laufender Anfrage, ein Modell der 70B-Klasse kostet 4, und Anfragen über Ihr Budget hinaus erhalten einen HTTP-Fehler 429 statt einer Gebühr.
Der Premium-Tarif umfasst 4 Einheiten, sodass man mit $25 eine große Modell-Spur oder vier kleine Modell-Spuren erhält. Agent-Tarife fügen 8 Einheiten und eine Sandbox für autonome Workloads hinzu. Das Unternehmen hat eine $20M Series-A-Finanzierung unter gemeinsamer Führung von AMD Ventures und Airbus Ventures am 2026-04-30 eingeworben, die stärkste finanzielle Unterstützung in diesem Markt.
Bester Anwendungsfall: Intensive agentische Einzelsitzungs-Codierung und Modell-Experimente mit einer harten Kostengrenze.
Modelle: 30.000+ Open-Weight-Modelle; 229B Größenbeschränkung auf den $100-Tarifen, keine Beschränkung auf den $200-Tarifen.
Parallelität: 4 Einheiten (Premium), 8 Einheiten (Agent und pro Business-Einheit).
Preis: Premium $25/Monat. Agent $100 oder $200/Monat. Business $100 oder $200 pro Einheit/Monat.
Wesentliche Funktionen:
- Unbegrenzte Tokens und Anfragen bei jedem Tarif.
- Jedes katalogisierte Open-Weight-Modell, pro Anfrage wechselbar.
- OpenAI-kompatible API.
- Dokumentierte Keine-Logging-Richtlinie für Prompts und Completions.
- Linear skalierende Parallelität bei Business-Tarifen.
Einschränkungen:
- Eine Anfrage der 70B-Klasse verbraucht das gesamte Premium-Einheitenbudget.
- Überbudget-Anfragen werden mit HTTP 429 abgewiesen, sodass paralleles Tooling eine eigene Anfrage-Warteschlange benötigt.
- Durchsatz pro Spur wird nicht veröffentlicht; der Anbieter gibt keine Tokens pro Sekunde an.
Giotto.ai
Giotto ist ein Schweizer Labor in Lausanne, das sein eigenes Reasoning-Modell Giotto 1 anbietet, das es als das stärkste Modell positioniert, das auf einer einzelnen GPU läuft.2 Das Unternehmen vertreibt dasselbe System als EU-gehostete Cloud, private On-Premise-Bereitstellung oder vorinstallierte Hardware mit ISO 27001-Zertifizierung.
Die Pauschalpreis-API wurde von CEO Aldo Podestà am 2026-07-09 angekündigt: 49.90 CHF pro Monat, eine gleichzeitige Anfrage, unbegrenzte Nutzung.3 Stand 2026-07-23 ist das Angebot nicht auf giotto.ai verfügbar, da es keine Preisseite gibt und Käufer zu einem Kontaktformular weitergeleitet werden; daher sind alle Bedingungen vorläufig.
Bester Anwendungsfall: EU-Datenresidenz und Souveränitätsanforderungen zu einem festen Budget.
Modelle: Nur Giotto 1.
Parallelität: 1 Anfrage gleichzeitig (Mono-Parallelität).
Preis: 49.90 CHF/Monat, nur Ankündigung; kostenlos Giotto Open Workspace mit nicht genannten API-Limits.
Wesentliche Funktionen:
- Unbegrenzte Nutzung über eine einzelne Anfragespur laut Ankündigung.
- EU-Hosting in Schweizer und EU-Partner-Rechenzentren.
- Gleiches Modell für private Bereitstellung auf eigenen GPUs verfügbar.
- Kostenloser Shared Workspace beinhaltet API-Zugang.
Einschränkungen:
- Noch nicht käuflich; keine öffentliche Preisseite zum 2026-07-23.
- Die Ankündigung verspricht bis zu 200-fach Einsparungen gegenüber Fable 5 und 350-fach gegenüber der GPT Pro-API; dies vergleicht nur den Preis. Giotto's eigene Benchmark-Tabelle positioniert Giotto 1 gegenüber Single-GPU-Modellen wie Gemma 4 31B und GPT-OSS-120B, nicht gegenüber den Frontier-Modellen der Preisbehauptung.
- Unternehmen in der Frühphase: Das Produkt startete am 2026-05-18, und der CEO erklärte im Juni 2026, dass ein CHF 5-10M Wandelkredit bis Juli abgeschlossen sein sollte, mit einer größeren Seed-Runde zum Jahresende.
Awan LLM
Awan LLM verkauft „unbegrenzte Tokens“ ab $5 pro Monat, mit täglichen Anfrageobergrenzen, die nach Modellgrößenklasse skalieren, und Ratenlimits pro Minute.4 Die täglichen Obergrenzen (30K bis 80K Anfragen im $20 Pro-Tarif) liegen weit über dem, was ein einzelner interaktiver Benutzer erzeugt, wodurch der Tarif in der Praxis pauschal ist.
Die Preisseite listet nicht auf, welche Modelle bedient werden oder wie aktuell sie sind. Überprüfen Sie den Katalog mit Ihrer Arbeitslast, bevor Sie zahlen.
Bester Anwendungsfall: Günstigster Pauschalpreis-Einstieg für leichte und mittlere Open-Weight-Workloads.
Modelle: Open-Weight; Katalog und Versionen nicht auf der Preisseite angegeben.
Parallelität: Ratenlimitiert auf 100 Anfragen/Minute (Pro) bis 200 Anfragen/Minute (Max).
Preis: Lite kostenlos, Core $5/Monat, Plus $10/Monat, Pro $20/Monat, Max $80/Monat.
Wesentliche Funktionen:
- Unbegrenzte Tokens in jedem bezahlten Tarif.
- Kostenloser Tarif für Tests im kleinen Maßstab verfügbar.
- Max-Tarif entfernt tägliche Anfrageobergrenzen.
- Günstigster bezahlter Einstieg in diesem Markt mit $5/Monat.
Einschränkungen:
- Bediente Modelle und ihre Versionen sind nicht dokumentiert; Qualität unbestätigt.
- Anfrageobergrenzen nach Modellgrößenklasse ersetzen den Token-Zähler.
Pauschal bepreiste Pläne mit Nutzungsquoten
Die meisten Pläne im Pauschalpreis-Gespräch sind Abonnements mit einer sich erneuernden Quote: Der Preis ist fix und ein Prompt- oder Token-Budget stoppt Sie, anstatt Ihnen zu berechnen. Was an der Quotengrenze passiert, ist je nach Anbieter unterschiedlich und ebenso wichtig wie die Quotengröße. Wir behandeln diese Pläne Tarif für Tarif in unserem LLM-Preisleitfaden.
Z.ai GLM Coding Plan
- Zähler: ~80 bis 1.600 Prompts pro 5-Stunden-Fenster plus ~400 bis 8.000 pro Woche je nach Tarif; jeder Prompt löst schätzungsweise 15 bis 20 Modellaufrufe aus; 3-fache Quotenabzug zu Spitzenzeiten.
- An der Grenze: Harte Blockade bis das Fenster zurücksetzt, kein Fallback auf Pay-as-you-go.
- Überblick: $18 bis $160/Monat, bedient GLM-5.2 über einen Anthropic-kompatiblen Endpunkt in 20+ Coding-Tools.5
Kimi Code
- Zähler: Ein Guthabenpool, der mit allen Kimi-Mitgliedschaftsfunktionen geteilt wird, wöchentlich ohne Übertrag aktualisiert, zuzüglich eines rollierenden 5-Stunden-Ratenfensters; Quotenmengen nicht veröffentlicht.
- An der Grenze: Messbarer Nachkauf über Extra-Nutzung statt harter Blockade.
- Überblick: $19 bis $199/Monat für K2.7 Code mit 2 bis 8 gleichzeitigen Agentenaufgaben; HighSpeed-Modus verbraucht 3-fache Quote.6
MiniMax Coding Plan
- Zähler: ~1,7 Mrd. bis 12,5 Mrd. Tokens pro Monat innerhalb eines 5-Stunden- und Wochenfensters; ungenutzte Quote wird nicht übertragen.
- Überblick: $20 bis $120/Monat; MiniMax empfiehlt Pay-as-you-go für die Produktionsnutzung.7
Cerebras Code
- Zähler: 24 Mio. bis 120 Mio. Tokens pro Tag.
- Überblick: $50 oder $200/Monat für GLM 4.7 auf Cerebras-Hardware; alle Tarife waren am 2026-07-23 weiterhin ausverkauft.8
NanoGPT Pro
- Zähler: 60 Mio. Eingabetokens pro Woche; große Modelle rechnen 2-fach ab.
- Überblick: $12/Monat für ein enthaltenes Open-Source-Modellset, Web und API.9
Synthetic
- Zähler: 500 Anfragen pro 5 Stunden, 1 gleichzeitige Anfrage pro Modell.
- Überblick: $30/Monat für sieben ständig laufende Open-Weight-Modelle, UI plus API.10
Chutes
- Zähler: Enthaltene Nutzung begrenzt auf das 5-fache des Planpreises, dann wird pro Token weitergerechnet.
- Überblick: $10 oder $20/Monat Prepaid-Bundles auf dezentraler Rechenleistung; eher ein Rabattprogramm als eine Pauschale.11
Claude und ChatGPT Abonnements
- Zähler: 5-Stunden-Sitzungen plus wöchentliche Obergrenzen (Claude); Nutzungsstufen mit Limits (ChatGPT).
- Überblick: $20 bis $200+/Monat; der einzige pauschal bepreiste Weg zu geschlossenen Frontier-Modellen, verkauft als Sitzplätze, nicht als APIs.12
Wie Pauschalpreise funktionieren
1. Parallelitätsspuren ersetzen den Token-Zähler
Ein Pauschalpreis-Anbieter begrenzt, wie viele Anfragen Sie gleichzeitig ausführen können, statt wie viele Tokens Sie verbrauchen. Eine Anfragespur kann nicht mehr als den Output eines GPU-Streams abrufen, sodass die Worst-Case-Servierungskosten des Anbieters fixiert sind. Die Arithmetik begrenzt auch Sie: Eine Spur, die rund um die Uhr 50 Tokens pro Sekunde streamt, produziert in einem 30-Tage-Monat höchstens etwa 130 Mio. Ausgabe-Tokens, und die tatsächliche Nutzung liegt weit darunter, da die Spur zwischen Aufrufen im Leerlauf ist. Tokens pro Sekunde wird daher zum Kaufkriterium, und keiner der drei Anbieter veröffentlicht diese.
2. Open-Weight-Ökonomie
Jeder echte Pauschalpreis-Anbieter bedient entweder Open-Weight-Modelle auf Standard-GPUs (Featherless, Awan) oder sein eigenes Modell auf eigener Infrastruktur (Giotto). Niemand verkauft pauschalen, unbegrenzten Zugang zu einem geschlossenen Frontier-Modell, da ein Reseller die Servierungskosten eines pro Token lizenzierten Modells nicht deckeln kann. Anthropic und OpenAI verkaufen Pauschalpreise nur für ihre eigenen Modelle, gebündelt in quotenbegrenzten Chat-Abonnements.
3. Break-even gegenüber Pay-per-Token
Ein Pauschalplan lohnt sich, wenn die messbasierte Ausgabe für dasselbe Modell den Planpreis übersteigen würde, und der Break-even-Punkt hängt stark davon ab, mit welchem messbasierten Anbieter Sie vergleichen. Llama 3.3 70B kostet $0,10 pro Million Eingabetokens und $0,32 pro Million Ausgabe bei DeepInfra, gegenüber pauschal $1,04 pro Million bei Together KI.13 Unter der Annahme eines 70:30 Input-Output-Mix erreicht Featherless Premium für $25 den Break-even bei ungefähr 150 Mio. Tokens pro Monat gegenüber DeepInfra, aber bei nur etwa 24 Mio. Tokens gegenüber Together KI. Intensive agentische Einzelsitzungs-Nutzung übertrifft die niedrigere Schwelle mühelos und kann auch die höhere erreichen.
Der umgekehrte Fall ist ebenso wichtig. Ein Workload von 5 Mio. Tokens pro Monat, verteilt auf zwanzig parallele Kurz-Sessions, kostet gemessen weniger als $1 bei DeepInfra, während die Bereitstellung dieser Parallelität auf Pauschal-Spuren $100 oder mehr kosten würde. Pauschalpreis eignet sich für Arbeiten mit hohem Volumen und geringer Parallelität; Pay-per-Token gewinnt bei geringem Volumen oder stark parallelem Traffic. Die Zahlen sind Illustrationen zu den genannten Zugriffsdaten; führen Sie die Token-Zahlen des letzten Monats durch dieselbe Arithmetik.
4. Nachhaltigkeit der unbegrenzten Preisgestaltung
Unbegrenzte Pläne ziehen die schwersten Nutzer an, und der Markt zeigt bereits die Belastung. Cerebras Code war am 2026-07-23 auf allen Stufen ausverkauft, zehn Tage nach unserer ersten Prüfung. NanoGPT erhöhte sein Abonnement innerhalb eines Jahres von $8 auf $12. Der 30% Rabatt von Z.ai ist zeitlich begrenzt.
Die Präzedenzfälle sind größer als diese Nische. Der CEO von OpenAI sagte im Januar 2025, dass der $200/Monat ChatGPT Pro Plan Verlust machte, weil Abonnenten ihn mehr nutzten als prognostiziert.14 GitHub ersetzte die Premium-Anfrageeinheiten von Copilot am 2026-06-01 durch nutzungsbasierte KI-Credits und behielt die Abonnementpreise unverändert bei.15 Cursor tauschte sein 500-Anfragen-Kontingent im Juni 2025 gegen einen $20 Nutzungspool und gab nach dem Widerstand Rückerstattungen.16 Wenn die größten Verkäufer von pauschal bepreister KI-Nutzung sich wieder Zählern zuwenden, betrachten Sie den unbegrenzten Plan eines kleinen Anbieters als Einführungspreis und die Break-even-Rechnung als für Monate, nicht Jahre gültig.
Warum benötigen Sie 2026 einen Pauschalpreis-LLM-Plan?
1. Intensive agentische Codierung
Eine einzelne Coding-Agent-Sitzung führt Hunderte sequenzieller Modellaufrufe aus und kann zig Millionen Tokens verbrauchen. Eine Spur bedient dieses Muster kontinuierlich ohne Rechnungsschwankungen. Featherless passt; Giotto wird, sobald es käuflich ist.
2. EU-Datenresidenz
Giotto hostet in Schweizer und EU-Rechenzentren, bedient sein eigenes Modell und bietet dasselbe System für die private Bereitstellung an, was regulierten Teams entspricht, die keine Daten an in den USA gehostete APIs senden können.
3. Modell-Experimente
Featherless legt 30.000+ Open-Weight-Modelle hinter einer API und einer Gebühr offen, sodass der Modellvergleich nichts über das Abonnement hinaus kostet.
4. Kostenbegrenzte Nebenprojekte
Ein Hobbyprojekt mit stoßartiger Nutzung riskiert Überraschungsrechnungen bei einem Zähler. Awan LLM für $5 bis $20 pro Monat begrenzt die Abwärtsbewegung auf den Abonnementpreis.
5. Batch- und Hintergrundverarbeitung
Über Nacht ausgeführte Zusammenfassungs-, Klassifizierungs- oder Datenbereinigungsjobs tolerieren Warteschlangen, sodass sie die Leerlaufstunden einer Spur zu null Grenzkosten ausschöpfen können. Jeder der drei Anbieter passt, wenn die Modellqualität ausreicht.
Wie wählt man den richtigen Pauschalpreis-LLM-Plan aus?
Die Arbeitslastform entscheidet mehr als der Preis. Sequentielle Arbeit (ein Agent, ein Chat, Batch-Jobs) läuft gut auf einer einzigen Spur. Parallele Agentenflotten müssen sich hinter einer Spur serialisieren und benötigen mehr Parallelität: Featherless bepreist zusätzliche Einheiten explizit und weist überbudgetierte Anfragen mit HTTP 429 ab, während ein Mono-Parallelitäts-Plan wie die angekündigte API von Giotto überhaupt nicht erweiterbar ist.
Die Modellqualität setzt die Untergrenze. Ein Pauschalplan spart nur Geld, wenn das bediente Modell Ihre Arbeit erledigen kann; überprüfen Sie daher unabhängige Benchmark-Ergebnisse für das spezifische Modell, bevor Sie Preise vergleichen. Preisvielfache, die gegenüber Frontier-Modellen genannt werden, vergleichen unterschiedliche Qualitätsklassen.
Das monatliche Volumen und die messbasierte Alternative entscheiden gemeinsam über Pauschal versus bemessen. Gegenüber einem kostengünstigen Host liegt der Crossover für einen $25-Plan bei etwa 150 Mio. Tokens pro Monat; gegenüber einem Premium-Host sinkt er auf etwa 24 Mio.. Unterhalb Ihres Crossovers ist Pay-as-you-go günstiger; weit oberhalb bringt ein Pauschalplan ein Vielfaches seines Preises.
Einschränkungen, die vor dem Abonnieren geprüft werden sollten:
- Tokens pro Sekunde und Latenzwerte, die derzeit kein Anbieter veröffentlicht.
- Was eine große Modell-Anfrage in Parallelitätseinheiten kostet.
- Verhalten an der Grenze: abgewiesene Anfragen (Featherless), Warteschlange oder gemessener Nachkauf.
- Ob der bediente Modellkatalog dokumentiert ist (Awan listet ihn nicht auf).
- Kommerzielle Nutzungsbedingungen und Produktionseinsatz.
Die Langlebigkeit des Anbieters ist ein echtes Kriterium in diesem Markt. Featherless verfügt über eine $20 Mio. Series-A-Finanzierung; Giotto schloss im Juni 2026 noch einen CHF 5-10 Mio. Wandelkredit ab. Bevorzugen Sie Anbieter, deren Drosselung ihnen nachhaltige Stückkostenwirtschaft ermöglicht, und vermeiden Sie, ein Team auf einen Plan zu standardisieren, der innerhalb eines Jahres neu bepreist oder ausverkauft sein könnte.
FAQs
Stand Juli 2026: Featherless.ai (ab $25/Monat, parallelitätsbegrenzt), Awan LLM ($5 bis $80/Monat, anfragenratenbegrenzt) und die angekündigte 49.90 CHF/Monat API von Giotto.ai, noch nicht öffentlich käuflich. Jeder andere pauschal bepreiste Plan, den wir überprüft haben, misst die Nutzung über sich erneuernde Quoten.
Indem gleichzeitige Anfragen begrenzt werden. Eine Spur kann nicht mehr als den Output eines GPU-Streams verbrauchen, sodass die Worst-Case-Kosten des Anbieters fixiert sind, und die bedienten Modelle sind Open-Weight oder anbietereigen, sodass keine pro Token-Lizenzkosten anfallen.
Im Allgemeinen nein. Der Durchsatz deckelt sich bei den gekauften Spuren, kein Anbieter in der Haupttabelle veröffentlicht ein SLA für diese Pläne, und quotenbasierte Alternativen verweisen Produktionsnutzer explizit auf Pay-as-you-go.
Diese Forschung zitieren
Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.
@misc{kalelioglu2026,
author = {Kalelioğlu, Berk},
title = {{Beste Pauschalpreis-LLM API Anbieter}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/flat-rate-llm-api}},
note = {AIMultiple. Abgerufen am 23. Juli 2026}
}
Seien Sie der Erste, der kommentiert
Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.