Sabit ücretli LLM sağlayıcıları, token başına faturalandırma yerine aylık sabit bir fiyat karşılığında sınırsız model kullanımı sunar. Bu model, ajan tabanlı kodlama oturumları on milyonlarca token kullanabildiğinden, token başına faturanın tahmin edilmesi zor olduğu için yaygınlaştı. Gerçek bir sabit ücret sunan çok az sağlayıcı vardır; sabit olarak pazarlanan çoğu planın altında bir kullanım kotası yatar. Aşağıda, gerçekten sınırsız kullanım sunan sağlayıcıları, sunulan modeller, eşzamanlılık sınırı ve her biri için fiyatlandırma ile karşılaştırıyoruz.
Sağlayıcı | Odaklandığı Alan | Modeller | Eşzamanlılık | Fiyat |
|---|---|---|---|---|
Giotto.ai | AB'de barındırılan egemen dağıtım | Giotto 1 (kendi modeli) | Aynı anda 1 istek | 49.90 CHF/ay |
Featherless.ai | Sabit bir maliyetle açık ağırlıklı model çeşitliliği | 30.000+ açık ağırlıklı model | Plan başına 4 ila 8 birim | $25/ay'dan itibaren |
Awan LLM | Bütçe dostu sabit ücret erişimi | Llama 3 ve 3.1 (8B ve 70B) | 100 ila 200 istek/dk | $5 ila $80/ay |
Bu tablodaki sağlayıcılar iki kriteri karşılamaktadır:
- Yayınlanmış sabit bir aylık fiyat.
- Sınırsız kullanım: sizi durduracak bir token veya prompt bütçesi yok. İstekleri hızlandıran hız sınırlarına izin verilir; kullanımı sonlandıran bütçelere izin verilmez.
İncelenen Sabit Ücretli LLM Sağlayıcıları
Featherless.ai
Featherless, tek bir OpenAI uyumlu API aracılığıyla sınırsız token ve istek ile 30.000'den fazla açık ağırlıklı model (DeepSeek, Kimi, GLM, Qwen, Llama ve ince ayar modelleri) sunar.1 Token sayacı yerine, eşzamanlılık birimleri üzerinden fiyatlandırma yapar: küçük bir model, devam eden her istek için 1 birim; 70B sınıfı bir model 4 birim; ve bütçenizi aşan istekler ek ücret yerine bir HTTP 429 hatası döndürür.
Premium plan 4 birim içerir, bu nedenle $25 bir büyük model hattı veya dört küçük model hattı satın alır. Ajan planları, 8 birim ve otonom iş yükleri için bir korumalı alan ekler. Şirket, 2026-04-30 tarihinde AMD Ventures ve Airbus Ventures tarafından eş liderliğinde bir $20M A Serisi turu topladı; bu pazardaki en güçlü finansal destek.
En uygun kullanım alanı: Sert bir maliyet tavanıyla yoğun tek akışlı ajan tabanlı kodlama ve model denemesi.
Modeller: 30.000'den fazla açık ağırlıklı model; $100 seviyelerinde 229B boyut sınırı, $200 seviyelerinde sınır yok.
Eşzamanlılık: 4 birim (Premium), 8 birim (Ajan ve İş birimi başına).
Fiyat: Premium $25/ay. Ajan $100 veya $200/ay. İş $100 veya $200 birim/ay başına.
Öne çıkan özellikler:
- Her planda sınırsız token ve istek.
- İstek başına değiştirilebilen, kataloglanmış herhangi bir açık ağırlıklı model.
- OpenAI uyumlu API.
- Promptlar ve tamamlamalar için belgelenmiş kayıt tutmama politikası.
- İş planlarında eşzamanlılık doğrusal olarak ölçeklenir.
Sınırlamalar:
- Bir 70B sınıfı istek, tüm Premium birim bütçesini tüketir.
- Bütçe aşan istekler HTTP 429 ile reddedilir, bu nedenle paralel araçların kendi istek kuyruğuna ihtiyacı vardır.
- Hat başına aktarım hızı yayınlanmamıştır; satıcı saniyedeki token sayısını belirtmez.
Giotto.ai
Giotto, Lozan'da, tek bir GPU üzerinde çalışan en güçlü model olarak konumlandırdığı kendi muhakeme modeli Giotto 1'i sunan bir İsviçre laboratuvarıdır.2 Şirket aynı sistemi AB'de barındırılan bulut, özel yerinde dağıtım veya önceden kurulu donanım olarak, ISO 27001 sertifikasıyla satmaktadır.
Sabit ücretli API, CEO Aldo Podestà tarafından 2026-07-09 tarihinde duyuruldu: aylık 49.90 CHF, aynı anda bir istek, sınırsız kullanım.3 2026-07-23 itibarıyla teklif, fiyatlandırma sayfası olmayan ve alıcıları iletişim formuna yönlendiren giotto.ai'de bulunmuyor, bu nedenle aşağıdaki tüm koşullar geçicidir.
En uygun kullanım alanı: Sabit bir bütçeyle AB veri ikameti ve egemenlik gereksinimleri.
Modeller: Yalnızca Giotto 1.
Eşzamanlılık: Aynı anda 1 istek (tek eşzamanlılık).
Fiyat: 49.90 CHF/ay; belirtilmemiş API limitli ücretsiz Giotto Open çalışma alanı.
Öne çıkan özellikler:
- Tek bir istek hattıyla sınırsız kullanım.
- İsviçre ve AB ortak veri merkezlerinde AB barındırma.
- Aynı model, kişinin kendi GPU'larında özel dağıtım için kullanılabilir.
- Ücretsiz paylaşımlı çalışma alanı API erişimi içerir.
Sınırlamalar:
- Henüz satın alınamaz; 2026-07-23 itibarıyla herkese açık fiyatlandırma sayfası yok.
- Duyuru, Fable 5'e kıyasla 200 kata ve GPT Pro'nun API'sine kıyasla 350 kata varan tasarruf iddia ediyor; bunlar yalnızca fiyat karşılaştırmasıdır. Giotto'nun kendi kıyaslama tablosu, Giotto 1'i Gemma 4 31B ve GPT-OSS-120B gibi tek GPU'lu modellerle karşılaştırıyor; fiyat iddiasındaki öncü modellerle değil.
- Erken aşama şirket: ürün 2026-05-18 tarihinde piyasaya sürüldü ve CEO, Haziran 2026'da CHF 5-10M tutarında dönüştürülebilir bir kredinin Temmuz ayına kadar kapanmasının beklendiğini, yıl sonu için daha büyük bir tohum turu planlandığını belirtti.4
Awan LLM
Awan LLM, model boyut sınıfına göre ölçeklenen günlük istek üst sınırları ve dakika başına hız sınırları ile aylık $5'dan başlayan fiyatlarla “sınırsız token” satıyor.5 Günlük üst sınırlar (Pro planda $20 için 30K ila 80K istek), tek bir etkileşimli kullanıcının oluşturduğunun çok üzerindedir, bu da planı pratikte sabit ücretli hale getirir.
Model kataloğu, fiyatlandırma sayfasından ayrı bir modeller sayfasında yer alır: Llama 3.1 8B ve 70B Instruct, Llama 3 8B ve 70B ve Awan'ın kendi 8B ince ayarları.6 Bunlardan en yenisi Temmuz 2024'te piyasaya sürüldü, dolayısıyla katalog mevcut açık ağırlıklı sürümlerin bir ila iki jenerasyon gerisinde kalmaktadır.
En uygun kullanım alanı: Hafif ve orta ölçekli açık ağırlıklı iş yükleri için en düşük maliyetli sabit ücret girişi.
Modeller: Llama 3.1 (8B, 70B), Llama 3 (8B, 70B) ve 8B ince ayarlar.
Eşzamanlılık: Hız sınırları: Pro'da 100 istek/dk'dan Max'te 200 istek/dk'ya kadar.
Fiyat: Lite ücretsiz, Core $5/ay, Plus $10/ay, Pro $20/ay, Max $80/ay.
Öne çıkan özellikler:
- Her ücretli seviyede sınırsız token.
- Küçük ölçekli testler için ücretsiz seviye mevcut.
- Max seviyesi günlük istek üst sınırlarını kaldırır.
- Bu pazardaki en ucuz ücretli giriş $5/ay.
Sınırlamalar:
- Katalog Llama 3.1'de duruyor; 2025 veya 2026 açık ağırlıklı model sunulmuyor.
- Model boyut sınıfına göre istek üst sınırları token sayacının yerini alır.
Kullanım Kotalı Sabit Fiyatlı Planlar
Sabit ücretli söylemindeki çoğu plan, yenilenen bir kotaya sahip aboneliklerdir: fiyat sabittir ve sizi faturalandırmak yerine bir prompt veya token bütçesi durdurur. Kota sınırında ne olduğu satıcıya göre değişir ve kota boyutu kadar önemlidir. Bu planları, LLM fiyatlandırma kılavuzumuzda seviye ele alıyoruz.
Z.ai GLM Coding Plan
- Sayaç: Seviyeye göre her 5 saatlik pencere başına ~80 ila 1.600 prompt ve hafta başına ~400 ila 8.000 prompt; her prompt tahmini 15 ila 20 model çağrısı tetikler; yoğun saatlerde 3 kat kota kesintisi.
- Sınırda: pencere yenilenene kadar sert engelleme, kullandıkça ödeye dönme yok.
- Genel bakış: $18 ila $160/ay, 20'den fazla kodlama aracında Anthropic uyumlu bir uç nokta aracılığıyla GLM-5.2 sunar.7
Kimi Code
- Ölçüm: tüm Kimi üyelik özellikleriyle paylaşılan, haftalık olarak yenilenen ve devir yapmayan bir kredi havuzu, ayrıca kayan 5 saatlik hız penceresi; kota miktarları yayınlanmamıştır.
- Sınırda: sert engel yerine Ekstra Kullanım yoluyla ölçümlü ek ücret.
- Genel bakış: $19 ila $199/ay karşılığında 2 ila 8 eşzamanlı ajan görevi ile K2.7 Code; HighSpeed modu 3 kat kota tüketir.8
MiniMax Coding Plan
- Sayaç: 5 saatlik ve haftalık pencerelerde aylık ~1,7 milyar ila 12,5 milyar token; kullanılmayan kota devretmez.
- Genel bakış: $20 ila $120/ay; MiniMax, üretim kullanımı için kullandıkça ödemeyi önerir.9
Cerebras Code
- Sayaç: 24 milyon ila 120 milyon token/gün.
- Genel bakış: $50 veya $200/ay karşılığında Cerebras donanımında GLM 4.7; tüm seviyeler 2026-07-23 itibarıyla hâlâ tükendi olarak gösteriyordu.10
NanoGPT Pro
- Ölçüm: Haftada 60 milyon girdi tokeni; büyük modeller 2 kat düşer.
- Genel bakış: $12/ay karşılığında dahil edilen açık kaynaklı bir model seti, web ve API.11
Synthetic
- Ölçüm: 5 saatte 500 istek, model başına 1 eşzamanlı istek.
- Genel bakış: $30/ay karşılığında yedi sürekli aktif açık ağırlıklı model, arayüz artı API.12
Chutes
- Ölçüm: Dahil edilen kullanım, plan fiyatının 5 katı ile sınırlıdır, ardından faturalandırma token başına devam eder.
- Genel bakış: $10 veya $20/ay merkeziyetsiz bilişim üzerine ön ödemeli paketler; sabit ücretten ziyade bir indirim programı.13
Claude and ChatGPT subscriptions
- Ölçüm: 5 saatlik oturumlar artı haftalık üst sınırlar (Claude); limitli kullanım seviyeleri (ChatGPT).
- Genel bakış: $20 ila $200+/ay; öncü kapalı modellere giden tek sabit fiyatlı yol, koltuk olarak satılır, API olarak değil.14 15
Sabit Ücretli Fiyatlandırma Nasıl Çalışır?
1. Eşzamanlılık Hatları Token Sayacının Yerini Alır
Bir sabit ücretli sağlayıcı, kaç token tükettiğiniz yerine aynı anda kaç istek çalıştırabileceğinizi sınırlar. Bir istek hattı, bir GPU akışının çıktısından daha fazlasını çekemez, bu nedenle sağlayıcının en kötü durumdaki sunum maliyeti sabittir. Aritmetik aynı zamanda sizi de sınırlandırır: saniyede 50 token akıtan bir hat, 30 günlük bir ayda en fazla yaklaşık 130 milyon çıktı tokeni üretir ve gerçek kullanım, hat çağrılar arasında boşta kaldığı için bu değerin oldukça altındadır. Bu nedenle saniyedeki token sayısı bir satın alma kriteri haline gelir ve üç sağlayıcıdan hiçbiri bunu yayınlamaz.
2. Açık Ağırlık Ekonomisi
Gerçek sabit ücretli her sağlayıcı, ya ticari GPU'larda açık ağırlıklı modeller (Featherless, Awan) ya da kendi altyapısında kendi modelini (Giotto) sunar. Hiç kimse öncü bir kapalı modele sınırsız sabit erişim satmaz, çünkü bir bayi, token başına lisansladığı bir modelin sunum maliyetini sınırlayamaz. Anthropic ve OpenAI, yalnızca kendi modelleri için, kotalı sohbet aboneliklerine dahil edilmiş sabit fiyatlar satar.
3. Kullandıkça Ödeye Karşı Başa Baş Noktası
Bir sabit plan, aynı model için ölçümlü harcama plan fiyatını aştığında kazanır ve başa baş noktası, karşılaştırdığınız ölçümlü ana bilgisayara büyük ölçüde bağlıdır. Llama 3.3 70B, DeepInfra'da milyon girdi tokeni başına $0,10 ve milyon çıktı başına $0,32 iken, Together AI'da sabit olarak milyon başına $1,04'tür.16 70:30 girdi-çıktı karışımı varsayıldığında, $25'lık Featherless Premium, DeepInfra'ya karşı ayda yaklaşık 150 milyon token ile başa baş olurken, Together AI'ya karşı yalnızca yaklaşık 24 milyon token ile başa baş olur. Yoğun tek akışlı ajan kullanımı, alt çıtayı kolayca aşar ve üstteki çıtayı da aşabilir.
Ters durum da aynı derecede önemlidir. Ayda 5 milyon tokenlik bir iş yükü, yirmi paralel kısa oturuma yayıldığında DeepInfra'da ölçümlü olarak $1'ın altında bir maliyete gelirken, aynı eşzamanlılığı sabit ücretli hatlarda sunmak $100 veya daha fazlasına mal olur. Sabit ücret, yüksek hacimli, düşük eşzamanlılıklı işlere uygundur; kullandıkça öde, düşük hacimli veya yüksek paralel trafikte kazanır. Rakamlar belirtilen erişim tarihlerinde örnek niteliğindedir; geçen ayki token sayılarınızı aynı aritmetikten geçirin.
4. Sınırsız Fiyatlandırmanın Sürdürülebilirliği
Sınırsız planlar en ağır kullanıcıları çeker ve piyasa zaten bu gerilimi gösteriyor. Cerebras Code, ilk kontrol ettiğimizden on gün sonra, 2026-07-23 tarihinde tüm seviyelerde tükenmişti. NanoGPT, bir yıl içinde aboneliğini $8'dan $12'a yükseltti. Z.ai'nin %30 indirimi zaman sınırlıdır.
Emsaller bu nişten daha büyüktür. OpenAI CEO'su Ocak 2025'te, $200/ay ChatGPT Pro planının, abonelerin onu öngörülenden daha fazla kullanması nedeniyle zarar ettiğini söyledi.17 GitHub, Copilot'un premium istek birimlerini 2026-06-01 tarihinde kullanıma dayalı Yapay Zeka Kredileri ile değiştirirken abonelik fiyatlarını değiştirmedi.18 Cursor, Haziran 2025'te 500 istek tahsisini $20 kullanım havuzuyla değiştirdi ve tepkiden sonra para iadesi yaptı.19 Sabit fiyatlı yapay zeka kullanımının en büyük satıcıları ölçümlere yöneldikçe, küçük bir sağlayıcının sınırsız planını bir giriş fiyatı olarak değerlendirin ve başa baş hesaplamalarını yıllar yerine aylar için geçerli sayın.
2026'da Neden Sabit Ücretli Bir LLM Planına İhtiyacınız Olur?
1. Yoğun Ajan Tabanlı Kodlama
Tek bir kodlama ajanı oturumu, yüzlerce ardışık model çağrısı yapar ve on milyonlarca token tüketebilir. Bir hat, bu kalıbı fatura değişkenliği olmadan sürekli olarak sunar. Featherless uyuyor; Giotto satın alınabilir olduğunda uyacak.
2. AB Veri İkameti
Giotto, İsviçre ve AB veri merkezlerinde barındırır, kendi modelini sunar ve aynı sistemi özel dağıtım için sunar; bu, verileri ABD'de barındırılan API'lere gönderemeyen düzenlenmiş ekipler için uygundur.
3. Model Denemesi
Featherless, tek bir API ve tek bir ücret arkasında 30.000'den fazla açık ağırlıklı model sunar, bu nedenle modelleri karşılaştırmak aboneliğin ötesinde hiçbir maliyet gerektirmez.
4. Maliyet Sınırlı Yan Projeler
Ani kullanımı olan bir hobi projesi, ölçümlü faturada sürpriz faturalar riski taşır. Awan LLM'nin $5 ila $20/ay fiyatı, olumsuz tarafı abonelik fiyatıyla sınırlandırır.
5. Toplu ve Arka Plan İşleme
Gece boyu özetleme, sınıflandırma veya veri temizleme işleri kuyruğa almayı tolere eder, böylece sıfır marjinal maliyetle bir hattın boş saatlerini doldurabilirler. Model kalitesi yeterliyse, üç sağlayıcıdan herhangi biri uygundur.
Doğru Sabit Ücretli LLM Planını Nasıl Seçersiniz?
İş yükü şekli fiyattan daha belirleyicidir. Sıralı işler (tek ajan, tek sohbet, toplu işler) tek bir hatta iyi çalışır. Paralel ajan filoları bir hattın arkasında sıraya girer ve daha fazla eşzamanlılığa ihtiyaç duyar: Featherless, ek birimleri açıkça fiyatlandırır ve bütçeyi aşan istekleri HTTP 429 ile reddeder; Giotto'nun duyurduğu API gibi tek eşzamanlılıklı bir plan ise hiç genişletilemez.
Model kalitesi tabanı belirler. Bir sabit plan, yalnızca sunulan model işinizi yapabiliyorsa tasarruf sağlar, bu nedenle fiyatları karşılaştırmadan önce belirli model için bağımsız kıyaslama puanlarını kontrol edin. Öncü modellere karşı verilen fiyat katları, farklı kalite sınıflarını karşılaştırır. Ajan tabanlı LLM kıyaslamamız, Kimi, GLM ve MiniMax dahil olmak üzere bu planların sunduğu açık ağırlıklı modelleri puanlar.
Aylık hacim ve ölçümlü alternatif, sabit ile ölçümlü arasındaki kararı birlikte belirler. Düşük maliyetli bir ana bilgisayara karşı $25 planı için geçiş noktası ayda yaklaşık 150 milyon token civarındadır; premium bir ana bilgisayara karşı bu değer yaklaşık 24 milyon'a düşer. Geçiş noktanızın altında, kullandıkça öde daha ucuzdur; çok üzerinde ise, sabit bir plan fiyatının katlarını geri döndürür.
Abone Olmadan Önce Kontrol Etmeye Değer Sınırlamalar:
- Şu anda hiçbir sağlayıcının yayınlamadığı saniyedeki token ve gecikme rakamları.
- Büyük bir model isteğinin eşzamanlılık birimi cinsinden maliyeti.
- Sınırda davranış: reddedilen istekler (Featherless), kuyruğa alma veya ölçümlü ek ücret.
- Sunulan model kataloğunun belgelenip belgelenmediği (Awan bunu listelemez).
- Ticari ve üretim kullanım şartları.
Sağlayıcı dayanıklılığı bu pazarda gerçek bir kriterdir. Featherless, bir $20 milyon A Serisi turuna sahiptir; Giotto ise Haziran 2026 itibarıyla hâlâ CHF 5-10 milyon dönüştürülebilir krediyi kapatıyordu. Hız sınırının kendilerine sürdürülebilir birim ekonomisi sağladığı sağlayıcıları tercih edin ve bir ekip için, bir yıl içinde yeniden fiyatlandırılabilecek veya tükenebilecek bir plan üzerinde standardizasyon yapmaktan kaçının.
SSS'ler
Temmuz 2026 itibarıyla: Featherless.ai ($25/ay'dan itibaren, eşzamanlılık sınırlı), Awan LLM ($5 ila $80/ay, istek hızı sınırlı) ve Giotto.ai'nin duyurulan 49.90 CHF/ay API'si, henüz herkese açık olarak satın alınamaz. İncelediğimiz diğer tüm sabit fiyatlı planlar, yenilenen kotalar aracılığıyla kullanımı ölçer.
Eşzamanlı istekleri sınırlayarak. Bir hat, bir GPU akışının çıktısından fazlasını tüketemez, bu nedenle sağlayıcının en kötü durum maliyeti sabittir ve sunulan modeller açık ağırlıklı veya satıcıya aittir, dolayısıyla token başına lisans maliyeti uygulanmaz.
Genellikle hayır. Aktarım hızı satın alınan hatlarda üst sınıra ulaşır, ana tablodaki hiçbir sağlayıcı bu planlar için bir SLA yayınlamaz ve kota tabanlı alternatifler, üretim kullanıcılarını açıkça kullandıkça ödeye yönlendirir.
Bu araştırmayı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{kalelioglu2026,
author = {Kalelioğlu, Berk},
title = {{En İyi Sabit Ücretli LLM API Sağlayıcıları}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/flat-rate-llm-api}},
note = {AIMultiple. Erişim tarihi: 7 Ağustos 2026}
}
Yorum yapan ilk kişi olun
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.