Hizmetler
Bize Ulaşın

LLM Fiyatlandırması: En İyi 15+ Sağlayıcı Karşılaştırması

Cem Dilmegani
Cem Dilmegani
Güncellenme tarihi: 14 Tem 2026

Bir LLM için ödeme yapmanın iki yolu vardır: büyük sağlayıcıların abonelik planları veya token kullanımına göre faturalandırılan kullandıkça öde API modeli.

Her modelin verimliliğini ve maliyet etkinliğini değerlendirmek için model adlarına tıklayarak benchmark sonuçlarını, gerçek dünya gecikme sürelerini ve fiyatlandırmayı görüntüleyin.

Sıralama: Modeller, tüm benchmark'lardaki ortalama konumlarına göre sıralanmıştır.

En iyi LLM'lerin halüsinasyon oranlarını ve muhakeme performansını benchmark'larımızda kontrol edebilirsiniz.

LLM API fiyat değerlendirmesi

API fiyatları her model neslinde değişir. Aşağıdaki grafik her modeli piyasaya çıkış tarihinde gösterir, milyon token başına listelenen fiyatını sunar, 3:1 oranında ağırlıklı girdi-çıktı oranı kullanır ve modelleri sekiz boyut sınıfına ayırır. Fiyatlar, önbellek veya toplu indirim olmaksızın standart API fiyatlarıdır ve y ekseni logaritmiktir.

  • Amiral gemisi sohbet modelleri ucuzluyor. GPT-4 Mart 2023'te $37.50 ile piyasaya sürüldü; Claude Opus 4.8 ise Mayıs 2026'da $10.00 ile.
  • Muhakeme Pro katmanları yeni bir tavan belirliyor. o1-pro Mart 2025'te $262.50 ile zirveye ulaştı; OpenAI’nin 2026 Pro lansmanları $67.50 seviyesinde kaldı.
  • Ucuz katman yükseliyor. 2026 küçük model lansmanları milyon token başına $1.69–$5.62 arasında, Temmuz 2024'teki GPT-4o mini'nin $0.26'sına kıyasla.
  • Açık ağırlıklar yavaşça yükseliyor. Açık amiral gemisi lansman fiyatı medyanı $0.48'den (2024) $1.35'e (2026) çıktı, hâlâ kapalı katmanların altında.
  • Orta katman yerinde sayıyor. GPT-base, Sonnet ve Gemini Pro lansmanları 2024'ten beri $4-6 medyanını korudu.

LLM abonelik planlarının karşılaştırılması

Teknik olmayan kullanıcılar API yerine kullanıcı arayüzünü tercih edebilir. 2026'da çoğu sağlayıcının abonelikleri, bir sohbet arayüzünden çok daha fazlasını paketler. Claude Code, Codex, Kimi Code ve Mistral Vibe gibi kodlama ajanları Pro katmanlı planlarının içinde yer alır. Geliştiriciler ve yoğun kullanıcılar için doğru $10–$200 abonelik, çoğu zaman ayrı bir kodlama IDE aboneliğinin, token başına API bütçesinin ve bir video veya araştırma aracının birleşiminin yerini alır.

OpenAI

Ücretsiz plan, sınırlı günlük kullanım ile GPT-5.5 Instant'a erişim, standart ses modu, sınırlı yüklemeler ve temel görüntü oluşturmayı içerir. Artık ABD dahil birkaç bölgede bağlamsal reklamlar gösterilir.

  • ChatGPT Go ($8/ay)
  • , reklam destekli uygun fiyatlı bir plandır ve yaklaşık 10x daha fazla ücretsiz katmanın mesajları, dosya yüklemeleri, görüntü oluşturmaları ve GPT-5.5 tam erişimi sunar.
  • ChatGPT Plus ($20/ay), genişletilmiş kullanım limitleri, GPT-5.5 ve güncel muhakeme modellerine erişim, gelişmiş ses modu, Codex ajanı, görüntü ve video oluşturma ve erken erişim özellikleri içerir.

Pro planının Nisan 2026 itibarıyla iki katmanı vardır:

  • ChatGPT Pro ($100/ay), $200 katmanıyla aynı model yelpazesini sunar (GPT-5.5 Pro ve en yeni muhakeme modelleri dahil) ve yaklaşık 5x Plus kullanım limiti sağlar. Paket uygulamalar: Codex (Plus kullanımının 5x’i), daha fazla Deep Research çalıştırması ve tam Sora erişimi.
  • ChatGPT Pro ($200/ay), en yüksek bireysel kullanım limitlerini (yaklaşık 20x Plus) sağlar, ayda 250 Deep Research çalıştırması, video ve ekran paylaşımlı gelişmiş ses, azami kullanım desteği ile Codex, Sora ve Operator önizlemesi (yalnızca ABD).

Her iki Pro katmanı yoğun saatlerde öncelikli erişim içerir. Codex fiyatlandırması Plus, Pro ve Business’ta Nisan 2026’da mesaj başına faturalandırmadan API token hizalı kullanıma kaydırıldı.

  • Business plan ($20/kullanıcı/ay yıllık veya $25/kullanıcı/ay aylık), OpenAI'nin küçük ve orta ölçekli ekipler için planıdır (önceden ChatGPT Team, Ağustos 2025’te yeniden adlandırıldı). Daha yüksek mesaj limitleri, yönetici konsolu, SSO, eğitime dahil edilmeyen ekip verileri ve gelişmiş özellikler için ortak kredi havuzları ekler. Paket uygulamalar: ortak çalışma alanı kredileri ile Codex ve yalnızca kodlama için ayrı, kullanıma dayalı fiyatlandırma ile Codex koltukları atama seçeneği. En az 2 koltuk.
  • Enterprise plan (özel fiyatlandırma), yüksek hızlı model erişimi, genişletilmiş bağlam pencereleri, kurumsal düzeyde veri kontrolleri, alan doğrulaması, analitik ve denetim kayıtları sağlar. Paket uygulamalar: ortak kredi havuzlu Codex, opsiyonel yalnız Codex koltukları ve Operator erişimi.

Anthropic (Claude)

Ücretsiz plan web ve mobil erişim, temel analiz, Claude Sonnet 4.6'ya erişim ve belge yüklemeyi içerir. Günlük kullanım sınırlıdır ve Opus modelleri mevcut değildir.

  • Pro plan ($20/ay veya yıllık faturalandırıldığında $17/ay), Opus 4.7 ve Sonnet 4.6 dahil tüm Claude modellerine erişim, Ücretsiz’e kıyasla yaklaşık 5x daha fazla kullanım, proje organizasyonu ve yoğun saatlerde öncelikli erişim sağlar. Paket uygulamalar: terminal ve IDE'de Claude Code (Anthropic'in kodlama ajanı) ve Cowork (Araştırma modu), her ikisi de sohbet ile aynı kullanım havuzunu paylaşır. Mayıs 2026 itibarıyla Claude Code’un beş saatlik hız limitleri iki katına çıkarıldı ve yoğun saat azaltımı kaldırıldı.
  • Max 5x plan ($100/ay), Pro’dan yaklaşık 5x daha fazla kullanım, en yeni özellik ve modellere öncelikli erişim ve daha yüksek Max kullanım seviyesinde tam Claude Code erişimi sağlar.
  • Max 20x plan ($200/ay), Pro’dan yaklaşık 20x daha fazla kullanım, azami öncelikli erişim ve tam Claude Code erişimi sağlar. Günlük Claude Code iş yükü çalıştıran yoğun kullanıcılar için tasarlanmıştır.

Ekip planı iki koltuk türü sunar ve 5–150 üyeyi destekler:

  • Standart koltuk: $20/kullanıcı/ay yıllık ($25/kullanıcı/ay aylık). Temel özellikler, standart kullanım limitleri ve Claude Code erişimi içerir.
  • Premium koltuk: $100/kullanıcı/ay yıllık ($125/kullanıcı/ay aylık). Standart’taki her şeyin yanı sıra, daha ağır Claude Code iş yükleri çalıştıran yoğun kullanıcılar için daha yüksek kullanım limitleri.

Paket uygulamalar: Claude Code ve Cowork, her Ekip koltuğunda (Standart ve Premium) yer alır; fark kullanım hakkındadır, erişimde değil. Her iki koltuk türü de merkezi faturalandırma, iş birliği araçları ve yönetici kontrollerini içerir.

  • Enterprise plan (özel fiyatlandırma), genişletilmiş bağlam pencereleri, SSO, alan yakalama, rol tabanlı erişim, SCIM, denetim kayıtları ve veri entegrasyonları sağlar. Paket uygulamalar: yeni ve self-serve Enterprise planlarında Claude Code ve Cowork her koltukta yer alır; eski Enterprise sözleşmeleri yalnızca Sohbet koltukları ile Sohbet + Claude Code koltukları arasında kullanıma dayalı faturalandırma ile ayrım yapabilir.

Google (Gemini)

Ücretsiz plan Gemini 3 Flash'a erişim ve değişken düzeyde Gemini 3.1 Pro'ya, temel görüntü oluşturmaya, Deep Research'e, Gemini Live'a, Canvas'a ve Gems'e erişim sağlar. Paket uygulamalar: NotebookLM (araştırma ve yazma asistanı) ve Flow (sınırlı Veo 3.1 erişimi, AI film yapımı için).

Google bölgesel fiyatlandırma kullanır, bu nedenle fiyatlar bölgeye göre değişebilir.

  • Google AI Plus ($7.99/ay, ABD), giriş seviyesi ücretli katmandır. Paket uygulamalar: sohbette gelişmiş Gemini 3.1 Pro erişimi, Nano Banana Pro ile görüntü oluşturma, Veo 3.1 Lite video oluşturma, sınırlı Veo 3.1 ile Flow, daha fazla Sesli Özet ile NotebookLM, Gmail, Docs ve Vids'te Gemini ve Chrome'da erken erişim Gemini. 200 GB depolama içerir.
  • Google AI Pro ($19.99/ay, ABD), Gemini 3.1 Pro için daha yüksek kullanım limitleri ve 5 TB depolama sağlar. Paket uygulamalar: Jules (eşzamansız kodlama ajanı), IDE'ler için Gemini Code Assist ve Gemini CLI, Google Antigravity (etmen tabanlı geliştirme platformu), 5x Sesli Özet ile NotebookLM, Deep Research, Veo 3.1 Lite video ve Google Home Premium (Standart plan).
  • Google AI Ultra ($249.99/ay, ilk üç ay için ABD tanıtım teklifiyle $124.99/ay), tüm özelliklerde en yüksek kullanım limitlerini ve 30 TB depolama sağlar. Paket uygulamalar: tam Veo 3.1 video oluşturma, Deep Think muhakeme, Gemini Agent (yalnızca ABD), Project Mariner etmen tarama, Project Genie (etkileşimli dünya modeli), Pro limitlerinin 20x’i Jules, en üst düzey Antigravity, en yüksek kapasitede NotebookLM, Google Home Premium (Advanced plan) ve bireysel YouTube Premium aboneliği.

Microsoft Copilot

Ücretsiz plan (Copilot Chat), uygun bir Microsoft 365 aboneliğine sahip tüm Microsoft Entra kullanıcıları için ek maliyet olmadan sunulur. Microsoft uygulamaları genelinde temel Copilot sohbetini içerir, daha derin belge içi özellikler olmadan.

  • Copilot Pro ($20/ay), öncelikli model erişimi, görüntü oluşturma artırımları ve tam Copilot entegrasyonu ile Word, Excel, PowerPoint, Outlook ve OneNote'a eklenir; ayrıca görüntü ve belge düzenleri için Designer'da Copilot. Aktif bir Microsoft 365 Personal veya Family aboneliği gerektirir. Microsoft ayrıca Pro özelliklerinin çoğunu, Office uygulamaları, 1 TB OneDrive ve Copilot'u tek bir abonelikte birleştiren yeni Microsoft 365 Premium planına ($19.99/ay) katladı.
  • Microsoft 365 Copilot Business ($18/kullanıcı/ay, 30 Haziran 2026'ya kadar promosyon fiyatı, ardından $21/kullanıcı/ay yıllık; $25.20/kullanıcı/ay aylık), Microsoft 365 uygulamaları genelinde Copilot, Teams entegrasyonu ve yönetici kontrolleri ekler. Paket uygulamalar: hafif etmenler oluşturmak için Copilot Studio Lite, SharePoint'te Copilot ve ortak taslaklar için Copilot Pages. En fazla 300 kullanıcıya sahip kuruluşlarla sınırlıdır.
  • Microsoft 365 Copilot Enterprise ($30/kullanıcı/ay, yıllık taahhüt), Business özelliklerine ek olarak gelişmiş güvenlik, uyumluluk ve analitik sağlar. Paket uygulamalar: özel etmen geliştirme için tam Copilot Studio, BT ve güvenlik iş akışları için Microsoft Purview ve Intune'da Copilot ve dağıtılan etmenler üzerinde kurumsal düzey yönetişim.

xAI (Grok)

Ücretsiz plan, iki saatte bir yaklaşık 10 istek limitli sınırlı Grok erişimi sunar.

  • SuperGrok Lite ($10/ay), giriş seviyesi ücretli katmandır. 2x daha uzun konuşmalar, artırılmış hız limitleri ve AI görüntü ve video oluşturmayı içerir. Paket uygulamalar: Expert modunda 1 AI ajanı ve görüntü ve video oluşturma için Grok Imagine.
  • SuperGrok ($30/ay veya $300/yıl), gelişmiş muhakeme, ışık hızında yanıtlar, daha uzun dosya yüklemeleri ve Grok 4.3'ün kademeli olarak kullanıma sunulmasını içerir. Paket uygulamalar: paralel çalışan Expert modunda 4 AI ajanı, canlı web araştırması için DeepSearch, genişletilmiş düşünme için Big Brain modu, sesli sohbet için Voice modu ve HD 720p 30 saniyelik video dahil olmak üzere 20x daha fazla Grok Imagine görüntü ve video oluşturma hakkı.
  • SuperGrok Heavy ($300/ay), Grok 4.3'e, Grok 4 Heavy'ye (256K bağlam pencereli çoklu ajan muhakeme) tam erişim, maksimum hız limitleri, yoğun yükte öncelikli erişim ve yaklaşan xAI özelliklerinin erken önizlemelerini sağlar. Paket uygulamalar: Expert modunda maksimum ajan eşzamanlılığı, tam DeepSearch, Big Brain, Voice ve Grok Imagine kotaları.

Grok ayrıca X aboneliklerine dahildir: X Premium ($8/ay), X uygulaması içinde Grok'a en ucuz ücretli geçiştir ve doğrulanmış statü ve ücretsiz reklamsız tarama içerir. X Premium+ ($40/ay), tam içerik üretici gelir paylaşımıyla birlikte Grok'u, aşamalı Grok 4.3 kullanıma sunumunu ve aynı Grok ajan ve DeepSearch yeteneklerini X Premium+ kullanım seviyesinde sunar.

Moonshot AI (Kimi)

Kimi'nin tüketici planları, en yavaştan en hızlıya müzikal tempo işaretlerine göre adlandırılmıştır. Uluslararası fiyatlandırma USD cinsindendir; Çinli kullanıcılar CNY ile daha düşük fiyatlar öder.

  • Adagio (Ücretsiz), 6 ajan kullanım hakkı, sınırlı Deep Research sorguları ve temel OK Computer ajan görevleri ile sınırsız temel konuşmalar sunar.
  • Moderato ($19/ay), sohbet ve ajan görevlerinde Kimi K2.6 ile birlikte genişletilmiş Deep Research oturumları ekler. Paket uygulamalar: 5 saatlik pencere başına 300–1,200 API çağrısı ile Kimi Code (terminal öncelikli AI kodlama ajanı) 1x krediyle; ayrıca Slides ve Websites yazma araçları.
  • Allegretto ($39/ay), Moderato'daki her şeyde daha yüksek kullanım sağlar. Paket uygulamalar: Agent Swarm (100 alt ajan ve ~1,500 koordineli adım ile K2.5'te, K2.6'da 300 alt ajan ve 4,000 adıma ölçeklenen paralel alt ajan orkestrasyonu), kalıcı belleğe sahip heterojen ajan grupları için Kimi Claw bulut dağıtımı ve 5x Kimi Code kredisi.
  • Allegro ($99/ay), aylık 120 kullanımlı Agent Swarm, 15x Kimi Code kredisi ve araştırma yoğun iş akışları için 12,000 Pro Data isteği sağlar.
  • Vivace ($199/ay), aylık 240 kullanımlı ve 8'e kadar paralel alt ajan içeren Agent Swarm, 30x Kimi Code kredisi ve 24,000 Pro Data isteği sağlar. Ağır araştırma ve etmen tabanlı iş yüklerine yöneliktir.

Üyelik, token başına ayrıca faturalandırılan API kullanımını içermez.

MiniMax

MiniMax, tüketici Agent ürününü kodlama odaklı aboneliklerinden ayırır; her ikisi de temeldeki M2.x model ailesi üzerine kuruludur.

MiniMax Agent planları (otonom, çok adımlı araştırma, programlama ve Office iş akışları):

  • Ücretsiz: 3 gün geçerli 1,000 başlangıç kredisi, ayrıca yenilenen ve devreden günlük 200 kredi.
  • Basic ($39/ay): aylık 5,000 kredi (~30 Pro-mod görev), yoğun saat önceliği, filigran kaldırma, özel alan adı, 1 MaxClaw ve 1 MaxHermes 24/7 bulut dağıtımı.
  • Pro ($119/ay): aylık 20,000 kredi (~120 Pro-mod görev), 3 MaxClaw ve 1 MaxHermes dağıtımı, tüm Basic avantajları.
  • Ultra ($219/ay): aylık 40,000 kredi (~240 Pro-mod görev), Pro ile aynı dağıtım sayısı ve en yüksek öncelik.
  • Team (özel): kuruluşlar için merkezi faturalandırma ve yönetici kontrolleri.

MiniMax Coding Plan (geliştiriciler için API'nin üzerine ayrıca katmanlanmış; MiniMax M2.x tarafından desteklenir):

  • $10/ay: 5 saatlik pencere başına 100 prompt'lar.
  • $20/ay (Plus): 5 saatlik pencere başına 300 prompt'lar.
  • $50/ay (Max): 5 saatlik pencere başına 1,000 prompt'lar.

Kodlama Planı, token tabanlı faturalandırma yerine öngörülebilir prompt'lar kotaları ile gelir ve Cline veya Kilo Code gibi bir CLI ile eşleştirildiğinde uç bir kodlama modeline en ucuz yollardan birini sunar.

Mistral AI

Ücretsiz plan (Le Chat) web taraması, temel dosya analizi, görüntü oluşturma, hızlı Flash yanıtları, projelere ayrılmış grup sohbetleri, 500'e kadar kayıtlı bellek ve 40'tan fazla kurumsal bağlayıcı içerir.

  • Pro plan ($14.99/kullanıcı/ay), daha fazla mesaj ve web araması, daha fazla genişletilmiş düşünme ve Deep Research raporu, 15 GB belge depolama, 1,000'e kadar proje ve en son görüntü oluşturmayı içerir. Paket uygulamalar: Mistral Vibe (tüm gün geliştirme için Mistral'in kodlama ajanı, dahil edilen kotanın ötesinde kullandıkça öde). Mistral ayrıca aynı Pro özelliklerine sahip $7.04/kullanıcı/ay Öğrenci katmanı sunar.
  • Team plan ($24.99/kullanıcı/ay), kullanıcı başına 30 GB'a kadar depolama, merkezi faturalandırma, rol tabanlı erişim kontrolü, alan adı doğrulaması ve veri dışa aktarma ile Pro'daki her şeyi içerir. Paket uygulamalar: paylaşılan yönetici kontrolleri ile ekip kullanım seviyesinde Mistral Vibe.
  • Enterprise plan (özel fiyatlandırma), şirket içi barındırma ve özel bulut dahil güvenli dağıtım seçenekleri, SAML SSO, denetim kayıtları, premium destek ve ayrıntılı analitik sağlar. Paket uygulamalar: düzenlenmiş iş yükleri için yerinde dağıtım seçenekleriyle Mistral Vibe.

DeepSeek

DeepSeek geleneksel abonelik planları sunmaz. En son modellere web ve mobil sohbet erişimi (şu anda DeepSeek V4-Flash ve V4-Pro) tüm kullanıcılar için ücretsizdir ve günlük sıfırlanan adil kullanım kısıtlaması ile sınırlıdır.

API erişimi yalnızca token başına ödeme şeklindedir. V4-Flash, milyon girdi token'ı başına $0.14 (önbellek kaçırması) ve milyon çıktı token'ı başına $0.28 olarak fiyatlandırılır; önbellek isabetleri girdi fiyatının yaklaşık 1/50'si oranında sunulur.

Meta (Muse Spark)

Meta şu anda AI asistanı için bir tüketici aboneliği satmamaktadır. Meta Superintelligence Labs'ın ilk modeli olan Muse Spark (8 Nisan 2026'da piyasaya sürüldü), araç kullanımı, görsel zincirleme düşünme ve çok ajanlı orkestrasyona sahip, doğal olarak çok modlu bir muhakeme modelidir. WhatsApp, Instagram, Facebook, Messenger, Meta AI uygulaması ve Ray-Ban Meta gözlükleri içinde Meta AI'ya güç verir; tümü son kullanıcılar için ücretsizdir.

API erişimi şu anda seçili geliştiriciler ve kuruluşlar için özel önizleme aşamasındadır ve açıklanmış bir fiyatlandırma yoktur. Meta, daha geniş kullanılabilirlik ve fiyatlandırmanın takip edeceğini belirtmiştir.

LLM fiyatlandırmasını anlamak

Token'lar: Fiyatlandırmanın Temel Birimi

Şekil 1: “Identify New Technologies, Accelerate Your Enterprise.” cümlesi için GPT-4o & GPT-4o mini tokenleştirici kullanılarak tokenleştirme örneği.1

Sağlayıcılar çeşitli fiyatlandırma yapıları sunsa da token başına fiyatlandırma en yaygın olanıdır. Tokenleştirme yöntemleri modeller arasında farklılık gösterir; örnekler şunlardır:

  • Byte-Pair Encoding (BPE): Kelimeleri sık kullanılan alt sözcük birimlerine bölerek kelime dağarcığı boyutunu ve verimliliği dengeler.2
    • Örnek: “unbelievable” → [“un”, “believ”, “able”]
  • WordPiece: BPE'ye benzer ancak dil modeli olasılığı için optimize edilmiştir, BERT'te kullanılır.3
    • Örnek: “tokenization” → [“token”, “##ization”]. “token” bağımsız bir kelime; “##ization” bir son ektir.
  • SentencePiece: Metni boşluklara dayalı olmadan tokenleştirir; T5 gibi çok dilli modeller için etkilidir.4
    • Örnek: “natural language” → [” natural”, ” lan”, “guage”] veya [” natu”, “ral”, ” language”].

Kesin alt sözcüklerin eğitim verisine ve BPE/WordPiece sürecine bağlı olduğunu unutmayın. Bu tokenleştirme yöntemlerini daha iyi anlamak için aşağıdaki videoyu izleyin:

Tokenleştirme yöntemlerini açıklayan video.

Tokenleştirme kavrandıktan sonra, proje token uzunluğuna göre ortalama bir fiyat tahmin edilebilir. Tablo 2, UI istemleri, e-posta parçacıkları, pazarlama blogları, ayrıntılı raporlar ve araştırma makaleleri dahil olmak üzere içerik türüne göre token aralıklarını özetler ve token sayılarının modeller arasında değiştiğini belirtir. Bir model seçildikten sonra, içerik için ortalama token sayısını tahmin etmek üzere onun tokenleştiricisi kullanılabilir.

Tablo 2: Tipik içerik türleri, boyut aralıkları ve kurumsal hususlar (aralıklar tahminidir ve değişebilir).

Bağlam penceresi etkileri

Bağlam penceresi, çağrı başına girdi ve çıktı token'larının sayısına, muhakeme modelleri tarafından zincirleme düşünme için kullanılan token'lar da dahil olmak üzere, katı bir sınır koyar. Toplam bu sınırı aşarsa yanıt kesilir veya istek tamamen başarısız olur.

Şekil 2: Çok turlu bir konuşmada çıktı kesintisine yol açan bağlam penceresi sınırlamalarının illüstrasyonu.5

Uzun konuşmaları sürdüren uygulamalar için her ek tur, girdiye daha fazla geçmiş iter. Müdahale olmadan, girdi token'ları konuşma uzunluğuyla birlikte doğrusal olarak büyür ve fatura da öyle. API kullanıcıları bunu tipik olarak üç yoldan biriyle ele alır:

  • İstem önbellekleme. OpenAI, Anthropic, Google ve DeepSeek, tekrarlanan prompt'lar öneklerini sunucu tarafında önbelleğe alır ve önbellek isabetlerini standart girdi fiyatının bir kısmına, tipik olarak önbellek kaçırma fiyatının %10 ile %50'si arasında faturalandırır. Uzun bir sistem istemini veya konuşma ön ekini yeniden kullanan uygulamalar için önbellekleme, girdi maliyetini büyüklük sırasına göre azaltabilir.
  • Kayan pencere veya RAG. Bir eşik aşıldığında en eski turları bırakın veya her çağrıda bir vektör deposundan yalnızca ilgili geçmiş mesajları getirin.
  • Özetleme. Eski turları kelimesi kelimesine yeniden göndermek yerine periyodik olarak bir özete dönüştürün.

Kodlama oturumları veya derin araştırma gibi etmen tabanlı iş yükleri için modern kodlama ajanları bunu oturum içinde otomatik olarak halleder. Örneğin Claude Code, bağlam sıkıştırma ile gelir: konuşma sınıra yaklaştığında, eski mesajları özetlenmiş bir sürüme dönüştürürken son turları bozulmadan tutar. Sonraki turlar modele yalnızca özet artı son bağlamı gönderir.

Fiyatlandırma etkisi doğrudandır. Token başına API'lerde, prompt'lar önbellekleme ve sıkıştırma her çağrının girdisinin ne kadar büyüyeceğini sınırlar, böylece tur başına maliyet uzun oturumlar boyunca öngörülebilir kalır. Claude Pro, ChatGPT Plus veya Kimi Moderato gibi sabit ücretli aboneliklerde, sıkıştırma günlük ve haftalık kullanım limitlerini esnetir çünkü her çağrı daha az bağlam taşır. Beş saatlik hız sınırını aşması muhtemel bir kodlama oturumu, eski turlar sıkıştırıldığında daha uzun süre çalışabilir.

Ödünleşme, herhangi bir özetleme biçiminin kayıplı olmasıdır. Özet, daha sonra önemli olduğu ortaya çıkabilecek ayrıntıları düşürebilir ve kullanıcıyı bunları yeniden sağlamaya zorlayabilir.

Maksimum çıktı token'ları

Maksimum çıktı token'ları, bir modelin yanıtının uzunluğunu sınırlar. Birçok dokümantasyon, max_tokens parametresi kullanılarak ayarlanabileceğini belirtse de, doğru parametreyi belirlemek için kullanılan API'nin dokümantasyonunu incelemek çok önemlidir. Özel ihtiyaçlara göre ayarlanmalıdır:

Çok düşük ayarlanırsa, eksik çıktılara neden olarak modelin tam cevabı vermeden yanıtları kesmesine yol açabilir.

Çok yüksek ayarlanırsa, sıcaklığa (yanıt yaratıcılığını kontrol eden bir parametre) bağlı olarak, gereksiz uzun çıktılara, daha uzun yanıt sürelerine ve artan maliyete yol açabilir.

Bu nedenle, kaynak kullanımını optimize ederken çıktı kalitesini, maliyeti ve performansı dengelemek için dikkatli değerlendirme gerektiren bir parametredir.

Tablo 3: İçerik türü başına örnek girdi istemleri ve tahmini token sayıları.

*Bu, her modelin eşit sayıda çıktı token'ı ile yanıt ürettiğini varsayar; ancak hem girdi hem de çıktı için token sayısı her modelin tokenleştirmesine bağlı olarak değişebilir; burada sayı her model için sabit tutulmuştur.

Tablo 2'deki token aralıkları ile bir modelin token başına fiyatları birleştirilerek içerik türü başına beklenen maliyet elde edilir; Tablo 3'teki örnek prompt'lar, bu tahminlerin arkasındaki girdi ve çıktı boyutlarını gösterir.

Birden fazla dil modeli kullanma

OpenRouter gibi bir AI ağ geçidi, aynı prompt'lar aynı anda birden çok modele gönderilmesini sağlar. Daha sonra yanıtlar, token tüketimi, yanıt süresi ve fiyatlandırma karşılaştırılarak görev için en uygun model belirlenebilir.

Şekil 3: OpenRouter aracılığıyla birden fazla Büyük Dil Modeline gönderilen bir prompt'lar gösteren arayüz.6

Faydalar ve zorluklar

  • Artan uyarlanabilirlik ve verimlilik: Orkestrasyon, yanıt verme yeteneğini geliştirir, model verimliliğinin gerçek zamanlı değerlendirilmesini ve uygun maliyetli bir modelin ve potansiyel tasarrufların belirlenmesini sağlar.
  • İstem hassasiyeti ve optimizasyonu: Özdeş prompt'lar, modeller arasında büyük ölçüde farklı çıktılar ortaya çıkarabilir, istenen sonuçları elde etmek için her modele özgü prompt'lar mühendisliği gerektirir, bu da geliştirme ve bakım karmaşıklığına eklenir.
Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

Fiyatlandırma mekanikleri ve gizli maliyetler

Muhakeme token'ları ve çıktı token'ları karşılaştırması

Artan sayıda sağlayıcı, dahili olarak zincirleme düşünme gerçekleştirmek için ek işlem harcayan muhakeme modellerini piyasaya sürdü. Bu modeller, genellikle önemli ölçüde daha yüksek maliyetlere neden olan ayrı bir “muhakeme token'ı” sınıfı (standart çıktı token'larından farklı) kullanabilir.

Örneğin, GPT-5.5 Pro, genişletilmiş düşünme ile Claude Opus 4.7 veya Gemini 3.1 Pro Deep Think gibi modeller, açıkça talep edilmese bile dahili muhakeme izleri oluşturur. Bu dahili token'lar faturanıza sayılır ve özellikle yasal inceleme, veri analizi veya çok adımlı muhakeme gibi uzun analitik görevlerde maliyeti önemli ölçüde artırabilir.

Bu, şunları zorunlu kılar:

  • Muhakeme modelini yalnızca doğruluk maliyeti önemli ölçüde ağır bastığında seçin.
  • Mümkün olduğunda zincirleme düşünmeyi devre dışı bırakın veya daha kısa bir maksimum çıktı token'ı sayısı ayarlayın.
  • Aynı görevi muhakeme içermeyen modellerde, fiyatın çok daha azında karşılaştırılabilir performans gösterip göstermediğini test edin.

Muhakeme modelleri istek başına 10-30x daha fazla düşünme token'ı üretebileceğinden, maliyet planlaması için bu ayrımı anlamak kritiktir.

Mimari kaynaklı fiyatlandırma farklılıkları

LLM mimarileri model verimliliğini ve dolayısıyla API fiyatlandırmasını doğrudan etkiler. Örneğin:

  • Mixture-of-Experts (MoE) modelleri istek başına yalnızca parametrelerin bir alt kümesini etkinleştirir, işlem maliyetini düşürür ve sağlayıcıların daha düşük token başına fiyat sunmasına olanak tanır.
  • Spekülatif kod çözme, daha küçük bir taslak modeli daha büyük bir modelle eşleştirir, verimi artırır ve deterministik görevler için maliyeti düşürür.
  • Nicemlenmiş varyantlar (ör. 4-bit veya 8-bit), daha düşük hassasiyette çıkarım yapabilir, yerel olarak dağıtılan veya bulutta barındırılan sürümler için daha düşük fiyatlandırma sağlar.

Bu mimari seçimleri anlamak, kullanıcıların yalnızca fiyatlandırma farklılıklarını değil, aynı zamanda gecikme süresini, kaliteyi ve bir modelin üretim iş yükleri altında nasıl ölçeklendiğini tahmin etmelerine yardımcı olur.

API ücretlerinin ötesindeki operasyonel maliyetler

Token başına fiyatlandırma birincil maliyet etkeni olsa da, birçok üretim dağıtımı API kullanımının ötesinde ek maliyetler doğurur:

  • Gömme ve vektör veritabanları: Vektörleri depolamak ve almak (ör. Pinecone, Weaviate, ChromaDB) sorgu başına ve GB depolama başına maliyet ekler.
  • Yeniden sıralama ve işleme sonrası modeller: Birçok uygulama, daha büyük bir modele son bir istek göndermeden önce özetleme, filtreleme veya sınıflandırma için daha küçük modeller kullanır.
  • Önbellekleme katmanları: OpenAI gibi sağlayıcılar artık prompt'lar düzeyinde önbellekleme sunar, ancak yerel önbellekleme altyapısı ek işlem gerektirebilir.
  • Günlüğe kaydetme, izleme ve denetim: Kuruluşlar genellikle token düzeyinde izleme, gecikme takibi ve güvenlik denetimleri için maliyetlere katlanır.

Bu gizli maliyetler genellikle toplam LLM operasyonel giderlerinin %20–%40'ını oluşturur ve fiyatlandırma yapılarını değerlendirirken dikkate alınmalıdır.

Kurumsal düzeye özel fiyatlandırma hususları

Birçok LLM sağlayıcısı, aşağıdakiler gibi kurumsal düzeyde güvenlik ve uyumluluk özellikleri için ek ücret talep eder:

  • Tek kiracılı dağıtımlar
  • Adanmış GPU kümeleri
  • Geliştirilmiş SLA'lar (ör. çalışma süresi, gecikme garantileri)
  • Veri ikameti ve bölgesel kontroller
  • SOC2, HIPAA veya GDPR uyumluluk modları

Bu teklifler maliyetleri önemli ölçüde artırabilir ancak sağlık hizmetleri, finans, hukuk hizmetleri ve kamu kurumları gibi düzenlenmiş sektörler için gereklidir.

Google Arama'da daha fazla kıyaslamamızı ve veri odaklı içgörülerimizi görün.
GoogleTercih edilen kaynak olarak ekle

LLM fiyatlandırmasında gelecek eğilimler

2025 LLM fiyatlandırmasını tanımlayan üç şey oldu: ürün modelleri ucuzladı, her büyük sağlayıcı bir sohbet aboneliği başlattı ve muhakeme modelleri pahalı kaldı. $0.14'lık ürün token'ları (DeepSeek V4-Flash) ile $180'lık uç muhakeme token'ları (GPT-5.5 Pro) arasındaki iki katmanlı uçurum artık yapısaldır ve muhtemelen açılacaktır. 2026 ve sonrası için ilginç sorular, bu temelin üzerinde neyin değişeceği ile ilgilidir.

Token başına faturalandırma, yerini görev başına fiyatlandırmaya bırakıyor

Ajanlar artık en yoğun LLM kullanımını yönlendiriyor. Claude Code ile tek bir kodlama görevi, Cowork ile bir araştırma çalışması veya Operator ile otonom bir tarama oturumu, art arda yüzlerce model çağrısı yapabilir. Token faturalandırması hem alıcı hem de satıcı için öngörülemez hale gelir.

Buna yanıt olarak sağlayıcılar token sayaçlarından görev kotalarına geçiyor. Kimi Code, 5 saatlik pencere başına 300 ila 1,200 API çağrısı ücretlendiriyor. Claude Code hız limitleri, mesaj sayısıyla değil 5 saatlik oturumlarla sınırlandırılıyor. MiniMax Coding Plan, 5 saatlik pencere başına 100 ila 1,000 prompt'lar satıyor. Kimi Agent Swarm, sabit sayıda paralel alt ajanla aylık çalıştırmalar satıyor. MiniMax Agent, aylık Pro mod görevlerine dönüşen krediler üzerinden fiyatlandırıyor.

OpenClaw ve MaxHermes gibi çapraz sağlayıcı ajan koşum takımları bunu daha da ileri götürüyor. Kullanıcılar ile birden çok model API'si arasında otururlar ve fiyatlandırmaları giderek milyon token başına değil, görev başına çıktıyı izler. Gelecek yıl boyunca daha fazla sağlayıcının görev başına veya oturum başına SKU'lar yayınlamasını bekleyin.

Küçük muhakeme modelleri cihaza taşınıyor

Apple Intelligence, rutin sorgular için cihaz üzerinde çıkarım yapar ve yalnızca karmaşık istekler için Private Cloud Compute'a başvurur. Microsoft Copilot+ PC'ler yerel bir modelle gelir. Pixel cihazları Gemini Nano çalıştırır. Yakın zamanda piyasaya sürülen küçük modeller (Microsoft'tan Phi-4, Google'dan Gemma 3, Meta'dan Llama 4 Scout, Anthropic'ten Claude Haiku 4.5) bir telefon veya dizüstü bilgisayarın sinir işleme birimine uyacak boyutlarda muhakeme yapabilir.

Fiyatlandırma etkisi, iki katmanlı bir tüketici pazarıdır. Rutin işler, cihaz üzerinde marjinal token'da ücretsiz çalışır. Bulut abonelikleri, yerelin yapamadığı şeylerde rekabet eder: uç muhakeme, büyük bağlam, çok modlu üretim ve ajan orkestrasyonu. Ücretsiz-yerel taban, yalnızca sohbet aboneliklerini sıfıra doğru iter ve paket uygulamaları ödemenin asıl nedeni haline getirir.

Uzun bağlam ve bellek, etmen tabanlı işi kimin kazanacağını belirler

Modeller önceki talimatları kaybettiğinde veya hatırlamaları gereken gerçekleri uydurduğunda, uzun vadeli etmen tabanlı görevler başarısız olur. Sürekli etmen tabanlı çalışma üç şeye bağlıdır: geniş bir bağlam penceresi, kalıcı bellek ve düşük bir halüsinasyon oranı.

Bir yıl içinde, üç uç yetenek taban seviyeye çöktü. 1M-token bağlam pencereleri Claude Opus 4.7, Sonnet 4.6, Gemini 3.1 Pro ve GPT-5.5'te varsayılan olarak gelir. İstem önbellekleme her yerdedir; OpenAI, Anthropic, Google ve DeepSeek'te önbellek isabetleri önbellek kaçırma fiyatlarının yaklaşık %10 ila %20'si arasındadır. Kalıcı bellek en yavaş metalaşandır; ChatGPT ve Claude'da hâlâ ücretli katmanların arkasında erişim kısıtlıdır.

Bu pazarın tepesinde uzman etmen tabanlı modeller ortaya çıkıyor. Anthropic'in Claude Mythos önizlemesi7 , milyon token başına $25 girdi ve $125 çıktı olarak fiyatlandırılır, etmen tabanlı kodlama, bilgisayar kullanımı ve siber güvenlik iş yüklerini hedefler. SWE-bench Verified'da Opus 4.6'yı 13 puan (%93,9 vs %80,8) ve Terminal-Bench 2.0'da 17 puan (%82,0 vs %65,4) geride bırakır. Anthropic, Mythos'un kendisi için genel kullanılabilirlik planlamadığını belirtir, ancak model, yeni nesil Opus sürümlerinin ulaşacağı yetenek ve fiyat tavanını işaretler.

Rekabetçi soru, “bağlam penceresi ne kadar büyük”ten “modelin uzun bir etmen tabanlı görevi ne kadar ucuza ve güvenilir bir şekilde sürdürebileceğine” kayıyor. Bunu iyi çözen sağlayıcılar prim talep edecek. Edemeyenler, başlıktaki token fiyatı ne olursa olsun etmen tabanlı iş yüklerini kaybedecek.

SSS'ler

Büyük Dil Modellerine (LLM'ler) bir Uygulama Programlama Arayüzü (API) aracılığıyla erişmek, size AI modellerine uzaktan erişim sağlar. Bu erişim, hizmet sağlayıcı tarafından alınan ve genellikle “API ücreti” olarak adlandırılan bir ücrete tabidir. Bu ücret, LLM'leri uygulamalarınıza entegre ederken kritik bir husustur.

Sağlayıcının API'si aracılığıyla gerçekleştirilen her sorgu, istek veya görevle ilişkili maliyeti temsil eder. Fiyatlandırma yapıları büyük ölçüde değişebileceğinden (token kullanımı, API çağrı hacmi, özellik kullanımı veya abonelik modelleri gibi faktörlere bağlı olarak), sağlayıcıların bu maliyetleri nasıl hesapladığını anlamak çok önemlidir.

LLM API fiyatlandırması, token tüketimi, bağlam uzunluğu ve model seçimi gibi faktörler nedeniyle karmaşık olabilir. Tokenleştirme prosedürleri modeller arasında değişiklik gösterir; bazıları Byte-Pair Encoding (BPE), WordPiece veya SentencePiece kullanır, bu da metnin token'lara nasıl ayrıldığını etkiler ve maliyet verimliliğini etkiler. Bu farklılıkları anlamak, API kullanımını ve fiyatlandırmayı optimize etmeye yardımcı olur.

LLM maliyetleri temel olarak token kullanımı (hem girdi hem çıktı), API çağrı hacmi ve fiyatlandırma modeli (ör. token başına veya abonelik) tarafından belirlenir.

Girdi ve çıktı token fiyatlarını, bağlam penceresi sınırlarını ve ek ücretleri karşılaştırın. OpenRouter gibi araçlar, aynı prompt'lar birden çok modele gönderip sonuçlarını, token kullanımlarını, hızlarını ve fiyatlandırmalarını doğrudan karşılaştırmanıza olanak tanır. Genel maliyetleri tahmin etmek için tipik içerik uzunluğunuzu ve kullanım modellerinizi göz önünde bulundurun.

Girdi token'ları, LLM'ye gönderdiğiniz istemdeki token'lardır; çıktı token'ları ise oluşturulan yanıttaki token'lardır. Muhakeme modellerinde, muhakeme sürecinin kendisi sırasında üretilen token'lar da çıktı token'ları olarak sayılır ve nihai maliyeti etkiler. Hem girdi hem de çıktı, genel maliyete katkıda bulunur.

Daha büyük metin istekleri daha fazla işlem gerektirir, yanıt süresini ve maliyetleri artırır. Girdi boyutlarını optimize edin ve token sayılarını tahmin etmek ve bütçenizi etkili bir şekilde yönetmek için bir LLM API fiyatlandırma hesaplayıcısı kullanın.

LLM topluluğu, kullanıcıların LLM fiyatlandırmasını anlamalarına ve optimize etmelerine yardımcı olmak için çeşitli araçlar ve benchmark'lar geliştirmiştir. Bu kaynaklar genellikle farklı modellerin gücü ve verimliliği hakkında içgörüler sunan hesaplayıcılar ve karşılaştırma çizelgeleri içerir.

Hugging Face ve GitHub gibi platformlar, model performansını ve maliyetlerini analiz etmek için topluluk tarafından geliştirilen araçları ve kodları barındırır. Birçok hizmet, forumlar veya sohbet özellikleri aracılığıyla topluluk desteği sunar.

Bu benchmarkı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Cem Dilmegani (2026) - "LLM Fiyatlandırması: En İyi 15+ Sağlayıcı Karşılaştırması". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 14 Temmuz 2026, kaynak: https://aimultiple.com/llm-pricing [Çevrimiçi Kaynak]

Dilmegani, C. (2026, 14 Temmuz). LLM Fiyatlandırması: En İyi 15+ Sağlayıcı Karşılaştırması. AIMultiple. https://aimultiple.com/llm-pricing

@misc{dilmegani2026,
  author = {Dilmegani, Cem},
  title  = {{LLM Fiyatlandırması: En İyi 15+ Sağlayıcı Karşılaştırması}},
  year   = {2026},
  month  = jul,
  howpublished    = {\url{https://aimultiple.com/llm-pricing}},
  note   = {AIMultiple. Erişim tarihi: 14 Temmuz 2026}
}
Cem Dilmegani
Cem Dilmegani
Baş Analist
Cem, 2017'den beri AIMultiple'da baş analist olarak görev yapmaktadır. AIMultiple, her ay Fortune 500 şirketlerinin %55'i de dahil olmak üzere yüz binlerce işletmeye (benzer Web'e göre) bilgi sağlamaktadır. Cem'in çalışmaları, Business Insider, Forbes, Washington Post gibi önde gelen küresel yayınlar, Deloitte, HPE gibi küresel firmalar, Dünya Ekonomik Forumu gibi STK'lar ve Avrupa Komisyonu gibi uluslararası kuruluşlar tarafından alıntılanmıştır. AIMultiple'ı referans gösteren daha fazla saygın şirket ve kaynağı görebilirsiniz. Kariyeri boyunca Cem, teknoloji danışmanı, teknoloji alıcısı ve teknoloji girişimcisi olarak görev yapmıştır. On yıldan fazla bir süre McKinsey & Company ve Altman Solon'da işletmelere teknoloji kararları konusunda danışmanlık yapmıştır. Ayrıca dijitalleşme üzerine bir McKinsey raporu yayınlamıştır. Bir telekom şirketinin CEO'suna bağlı olarak teknoloji stratejisi ve tedarikini yönetmiştir. Ayrıca, 2 yıl içinde sıfırdan 7 haneli yıllık yinelenen gelire ve 9 haneli değerlemeye ulaşan derin teknoloji şirketi Hypatos'un ticari büyümesini yönetmiştir. Cem'in Hypatos'taki çalışmaları TechCrunch ve Business Insider gibi önde gelen teknoloji yayınlarında yer aldı. Cem düzenli olarak uluslararası teknoloji konferanslarında konuşmacı olarak yer almaktadır. Boğaziçi Üniversitesi'nden bilgisayar mühendisliği diplomasına ve Columbia Business School'dan MBA derecesine sahiptir.
Tam Profili Görüntüle

Yorum yapan ilk kişi olun

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450