OpenAI'in GPT-5 ailesi gibi bazı LLM'ler, farklı sürümlerde (ör. GPT-5, GPT-5-mini ve GPT-5-nano) ve yüksek, orta, düşük ve minimal dahil olmak üzere çeşitli parametre ayarlarıyla gelir.
Aşağıda, bu model sürümleri arasındaki farkları, benchmark performanslarını ve benchmark'ları çalıştırmanın maliyetlerini inceleyerek keşfediyoruz.
Fiyat vs. başarı: Temel çıkarımlar
Analizimizde GPT-5 ailesini kullandık. Muhakeme, kodlama, talimat takibi ve matematik dahil olmak üzere çeşitli alanlarda altı benchmark kullandık.
Analizimiz şunları ortaya koydu:
- Benchmark'lar genelinde ortalama olarak, GPT-5 (high) ve GPT-5 (medium) neredeyse aynı başarı oranlarını sunar (%65'e karşı %64), ancak GPT-5 (high) neredeyse iki kat daha pahalıdır ($511'e karşı $280). Onları sırasıyla %62, %61 ve %60 başarı oranlarıyla GPT-5-mini (high), GPT-5 (low) ve GPT-5-mini (medium) takip eder ve çok daha düşük fiyatlarla: $105, $90 ve $28. Bu, başarı oranında yalnızca ~%5'lik bir düşüşü kabul ederek, GPT-5 (high)'ten GPT-5-mini (medium)'ya geçerek görevlerin 18 kata kadar daha düşük maliyetle tamamlanabileceğini gösterir.
- GPT-5-mini (high), neredeyse her benchmark'ta GPT-5 (low)'dan daha iyi performans gösterir ve bunu aynı veya daha düşük maliyetle yapar. IFBench'te başarı oranları %75'e karşı %67; AIME 2025'te %97'ye karşı %83; Humanity's Last Exam'de %20'ye karşı %18; ve GPQA Diamond'da %83'e karşı %81. SciCode'da %39 ile eşitlik sağlarlar, ancak GPT-5-mini (high) yine de daha düşük bir maliyetle gelir.
- En pahalı model olan GPT-5 (high), yalnızca üç benchmark'ta en iyi ikinci performans gösterenden daha iyidir ve bu durumda bile fark %3'ten fazla değildir. Diğer tüm benchmark'larda, daha ucuz alternatifler tarafından geride bırakılır.
Yüksek-orta-düşük-minimal parametre ayarları
LLM parametreleri genellikle sayısal ayarlamalar açısından tanımlansa da, yüksek, orta ve düşük gibi niteliksel aralıklar olarak da ifade edilebilirler. Bu aralıklar sabit standartlar değildir; bunun yerine, bir parametrenin modelin çıktısı üzerinde ne kadar etkiye sahip olduğunu tanımlayan kavramsal kategorilerdir.
Bu üç seviyeyi kullanmak, istenen yaratıcılık, determinizm veya uzunluk düzeyine bağlı olarak farklı görevler için ayarları hızlıca seçmeye yardımcı olur. Bu seviyeler, top-P, maks. token'lar ve ceza parametrelerini ayarlarken faydalıdır.
Orta parametre, bir modelin normal (parametrelendirilmemiş) sürümünü ifade eder.
Minimal ayar:
- Top-p / Top-k: Çok düşük (top-p ≈ 0,1–0,2, top-k = 1–5)
- Maks. token'lar: Kısa sınır
- Cezalar: Çok düşük veya hiç yok
- Etkiler:
- Oldukça deterministik, her seferinde neredeyse aynı çıktılar.
- Çok özlü, olgusal ve katı.
- Kod, matematik, veritabanı sorguları veya katı uyumluluk yanıtları için en iyisi.
- Çok kısıtlı, düşük rastgelelik ile öngörülebilirlik ve hassasiyeti tercih eder.
Düşük ayar:
- Top-p / Top-k: Düşük (top-p ≈ 0,3–0,5, top-k = 5–10)
- Maks. token'lar: Kısa ila orta
- Cezalar: Düşük ila orta
- Etkiler:
- Çoğunlukla deterministik ancak küçük farklılıklara izin verir.
- Minimale kıyasla robotik tekrarı azaltır.
- Özetler, yapılandırılmış açıklamalar veya tutarlı bir stile sahip profesyonel yazılar için uygundur.
Orta ayar:
- Top-p / Top-k: Orta (top-p ≈ 0,7–0,9, top-k = 20–50)
- Maks. token'lar: Orta uzunluk
- Cezalar: Orta düzeyde, tekrardan kaçınmak ancak biraz yaratıcılığa izin vermek için
- Etkiler:
- Doğruluk ve yaratıcılık arasında dengeli.
- Çalıştırmalar arasında hafifçe değişen doğal yanıtlar üretir.
- Genel soru-cevap, taslak oluşturma ve beyin fırtınası için uygundur.
Yüksek ayar:
- Top-p / Top-k: Yüksek (top-p ≈ 0,95–1,0, top-k = 50–100)
- Maks. token'lar: Daha uzun çıktılar için geniş sınır
- Cezalar: Orta ila yüksek, çeşitlilik ve yeniliği teşvik eder
- Etkiler:
- Oldukça yaratıcı ve çeşitli çıktılar.
- Daha az öngörülebilir, daha yüksek halüsinasyon riski taşır.
- Hikaye anlatımı, fikir geliştirme, rol yapma ve yaratıcı yazım için en iyisi.
Hangi seviyeyi kullanacağınıza karar vermek için şunları göz önünde bulundurun:
- Görev türü/amacı: Doğruluğa ihtiyacınız varsa (hukuk, sağlık, kod, olgusal), minimal veya ortayı seçin. Yaratıcılığa, üsluba, yeniliğe ihtiyacınız varsa, yüksek daha iyi olabilir.
- Hata toleransı: Ara sıra ortaya çıkan tuhaflıklar veya hatalar ne kadar kötü? Düşükse, yüksek rastgelelikten kaçının.
- Hesaplama kısıtları: Yüksek çıktı uzunlukları ve yüksek rastgelelik genellikle daha fazla hesaplama ve bellek gerektirir.
- Model boyutu: Daha büyük modeller yüksek rastgelelikle daha iyi başa çıkma eğilimindeyken, daha küçük modeller yüksek ayarlar altında önemli ölçüde bozulabilir.
- İstenen çıktı uzunluğu: Daha uzun üretilen metin sapma gösterebilir, bu nedenle yüksek rastgelelik artı uzun uzunluk daha risklidir.
GPT-5
GPT-5, daha yüksek muhakeme yeteneğini orta hızla dengeler ve bu da onu doğruluk ile uyarlanabilirliğin kritik olduğu karmaşık, çok adımlı görevler için uygun hale getirir.
- Bağlam penceresi: 400.000
- Maks. çıktı token'ları: 128.000
- Bilgi kesme tarihi: 30 Eylül 2024
- Muhakeme: Daha yüksek, muhakeme token'ı desteğiyle
Fiyatlandırma (1M token başına)
- Giriş: $1,25
- Önbelleklenmiş giriş: $0,125
- Çıktı: $10,00
Modaliteler
- Metin: giriş ve çıkış
- Görüntü: yalnızca giriş
- Ses: desteklenmiyor
GPT-5 mini
GPT-5 mini, GPT-5'in daha küçük, daha hızlı ve daha uygun fiyatlı bir sürümüdür. Güçlü muhakeme yeteneğini korurken, iyi tanımlanmış görevler için daha uygundur.
- Bağlam penceresi: 400.000
- Maks. çıktı token'ları: 128.000
- Bilgi kesme tarihi: 31 Mayıs 2024
- Özellikler: Web araması, dosya araması ve kod yorumlayıcıyı destekler.
1M token başına fiyatlandırma:
- Giriş: $0,25
- Önbelleklenmiş giriş: $0,025
- Çıktı: $2,00
GPT-5 nano
GPT-5 nano, sınıflandırma ve özetleme gibi hafif görevler için tasarlanmış en hızlı ve en ucuz seçenektir.
- Bağlam penceresi: 400.000
- Maks. çıktı token'ları: 128.000
- Bilgi kesme tarihi: 31 Mayıs 2024
- Özellikler: Dosya araması, görüntü oluşturma ve kod yorumlayıcıyı destekler (ancak web aramasını desteklemez).
1M token başına fiyatlandırma:
- Giriş: $0,05
- Önbelleklenmiş giriş: $0,005
- Çıktı: $0,40
GPT-5 serisi özellikleri
GPT-5 serisi, kontrolü, biçimlendirmeyi ve verimliliği artıran çeşitli yetenekler sunar. Bu özellikler GPT-5, GPT-5 Mini ve GPT-5 Nano için geçerlidir.
Ayrıntı düzeyi parametresi
Ayrıntı düzeyi parametresi, geliştiricilerin prompt'u değiştirmeden model çıktılarındaki ayrıntı seviyesini etkilemesine olanak tanır.
Üç değer alır:
- Düşük: kısa ve öz sonuçlar
- Orta: dengeli sonuçlar (varsayılan)
- Yüksek: açıklama, dokümantasyon veya inceleme için uygun ayrıntılı çıktılar
Daha yüksek ayrıntı düzeyi, daha uzun yanıtlara ve daha yüksek çıktı token'ı kullanımına yol açar.
Serbest biçimli fonksiyon çağırma
GPT-5 serisi, yapılandırılmış JSON yerine ham metin çıktısı kabul eden özel araç çağrılarını destekler. Bu, aşağıdaki gibi harici çalışma ortamlarına doğrudan aktarılan kod, SQL sorguları veya yapılandırma metni oluşturmayı mümkün kılar:
- Kod korumalı alanları
- SQL motorları
- Kabuk ortamları
- Yapılandırma sistemleri
Özel araç türü, paralel araç çağrılarını desteklemez. Doğal metnin katı bir JSON şemasına tercih edildiği durumlar için tasarlanmıştır.
Bağlam-ücretsiz dilbilgisi (CFG) desteği
Modeller, Lark veya regex sözdizimi ile tanımlanmış bir dilbilgisi tarafından kısıtlanan metin üretebilir. Bu, üretilen metnin katı yapısal kurallara uymasını sağlar. Yaygın kullanım alanları şunlardır:
- Belirli SQL lehçelerini zorunlu kılmak
- Zaman damgalarını veya tanımlayıcıları kısıtlamak
- Yapılandırma biçimlerini doğrulamak
CFG'leri kullanırken, geliştiriciler kabul edilebilir dizeler kümesini tanımlayan terminaller ve kurallar tanımlar. Model yalnızca bu kurallarla eşleşen çıktılar üretir.
Minimal muhakeme modu
Minimal muhakeme modu, muhakeme token'larını azaltır veya kaldırır. Bu, gecikmeyi azaltır ve ilk token'a kadar geçen süreyi iyileştirir.
Aşağıdaki gibi görevler için uygundur:
- Sınıflandırma
- Kısa yeniden yazmalar
- Yapılandırılmış çıkarma
- Temel biçimlendirme işlemleri
Herhangi bir muhakeme ayarı sağlanmadığında, varsayılan çaba seviyesi ortadır.
Temel farklar
Üç model öncelikle muhakeme derinliği, hız ve maliyet açısından farklılık gösterir. Yeni özellikler tüm modellerde kullanılabilir, ancak etkileri modele göre değişir.
Muhakeme
- GPT-5 en güçlü muhakeme yeteneğini sağlar. Kodlama, bilimsel analiz veya karar desteğindeki karmaşık, çok adımlı problemler için uygundur.
- GPT-5 mini, öngörülebilir görev sınırlarına sahip yapılandırılmış prompt'lar için güçlü muhakeme sunar.
- GPT-5 nano, orta düzey muhakeme performansına sahiptir ve derin analiz gerektirmeyen görevlerde en iyi sonucu verir.
- Minimal muhakeme modu tüm modellerle kullanılabilir ve hız avantajları göz önüne alındığında en önemli faydayı GPT-5 nano ve GPT-5 mini için sağlar.
Hız
- GPT-5 nano en hızlı seçenektir ve gerçek zamanlı veya büyük ölçekli iş yükleri için etkilidir.
- GPT-5 mini, hız ile muhakemeyi dengeler ve bu da onu normal üretim iş yükleri için uygun hale getirir.
- GPT-5 daha fazla dahili muhakeme gerçekleştirdiği için daha yavaştır, ancak bu daha hassas çıktıyla sonuçlanır.
- Minimal muhakeme modu, özellikle nano için gecikmeyi daha da azaltabilir.
Maliyet
- GPT-5 nano, token başına en düşük maliyete sahiptir. Toplu sınıflandırma veya özetleme gibi yüksek hacimli görevler için tercih edilir.
- GPT-5 mini orta aralıkta yer alır ve yetenek ile maliyet arasında bir denge sunar.
- GPT-5 en pahalı modeldir ve genellikle doğruluk ve tutarlılığın öncelikli olduğu durumlarda kullanılır.
- Ayrıntı düzeyi ayarları maliyeti etkiler çünkü daha yüksek ayrıntı düzeyi daha fazla çıktı token'ı üretir.
LLM parametreleri nedir?
LLM parametreleri, büyük dil modellerinin (LLM'ler) inference sırasında nasıl metin ürettiğini etkileyen ayarlardır. Bu parametre kontrolleri, önceden eğitilmiş bir modelin öğrenilmiş ağırlıklarını değiştirmez. Bunun yerine, dil modelinin yanıt üretirken olası token'lar üzerindeki bir olasılık dağılımından nasıl örnekleme yaptığını şekillendirirler.
Büyük dil modelleri, tipik olarak transformer model mimarisi üzerine inşa edilmiş sinir ağı sistemleridir. Eğitim sırasında model, ağırlıklar ve sapmalar adı verilen sayısal değerleri öğrenir. Ağırlıklar, farklı girdilere atanan önemi temsil eder ve modelin kelimeler, kavramlar ve bağlam arasındaki ilişkileri yakalamasını sağlar. Sapmalar, belirli koşullar altında nöronların etkinleşmesine yardımcı olan katmanlar içinde eklenen sabit değerlerdir. Together, bu değerler modelin dildeki karmaşık örüntüleri tanıma yeteneğini tanımlar.
Inference parametreleri ise eğitimden sonra çalışır. Altta yatan ağırlıkları değiştirmeden modelin öğrenilmiş bilgisinin nasıl kullanıldığını şekillendirirler. LLM parametrelerini ayarlamak, kullanıcıların çıktı çeşitliliğini, öngörülebilirliğini, tekrarı ve çıktı uzunluğunu etkilemesine olanak tanır; bu, yaratıcı yazım, yapılandırılmış üretim veya teknik açıklamalar gibi belirli görevlerde model performansını optimize etmek için gereklidir.
Temel parametreler arasında top-p çekirdek örneklemesi, maks. token'lar, frekans cezası, varlık cezası ve durdurma dizileri bulunur. Together, bu örnekleme parametreleri, çıktı kalitesi, hesaplama maliyeti ve inference verimliliğini dengelerken üretilen çıktıyı kontrol eder.
Model boyutu, parametreler ve eğitim temelleri
Büyük dil modellerindeki parametre sayısı milyarlara ulaşabilir. Daha büyük modeller tipik olarak incelikli dili, uzun menzilli bağımlılıkları ve karmaşık muhakemeyi ele alma konusunda daha güçlü bir yeteneğe sahiptir. Bu iyileştirilmiş model performansı, hem eğitim hem de inference sırasında daha yüksek hesaplama gücü gereksinimleri pahasına gelir.
Daha küçük modeller daha az hesaplama kaynağı gerektirir ve daha iyi hesaplama verimliliği sunar, ancak daha karmaşık örüntüler veya daha uzun bağlam pencereleriyle zorlanabilirler. Daha büyük modeller ile daha küçük modeller arasında seçim yapmak, göreve, kabul edilebilir gecikmeye ve mevcut altyapıya bağlıdır. Model boyutu, veri kalitesi ve eğitim stratejisinin etkisini değerlendirmek için LLM ölçekleme yasalarına bakın.
Bir modelin inference öncesinde nasıl öğrendiğini şekillendiren çeşitli eğitim parametreleri vardır:
- Yığın boyutu, model ağırlıklarını güncellemeden önce işlenen eğitim örneklerinin sayısını ifade eder. Daha büyük yığın boyutları eğitim verimliliğini artırır ancak bellek kullanımını yükseltir.
- Öğrenme oranı, modelin ağırlıklarını ve sapmalarını ne kadar hızlı ayarladığını kontrol eder. Daha yüksek değerler öğrenmeyi hızlandırır ancak kararsızlık riski taşır, daha düşük değerler ise istikrarlı yakınsamayı teşvik eder.
- Hiperparametreler, model boyutu, yığın boyutu ve öğrenme oranı gibi harici ayarları tanımlayarak genel eğitim sürecini şekillendirir.
Ön eğitimden sonra, fine-tuning ve hizalama gereklidir. Fine-tuning, önceden eğitilmiş bir modeli alana özgü verilere veya görevlere uyarlarken, hizalama üretilen metnin insan niyetini yansıtmasını sağlar.
Parametre-verimli fine-tuning (PEFT), çoğu parametreyi dondurarak ve yalnızca görevle ilgili parametrelerin küçük bir alt kümesini güncelleyerek hesaplama verimliliğini artırır.
Top-p örneklemesi
Çekirdek örneklemesi olarak da bilinen top-p örneklemesi, token seçimini kümülatif olasılığı belirli bir p eşiğini aşan en küçük grupla sınırlar. Model, sabit sayıda token arasından seçim yapmak yerine, belirtilen olasılık kütlesini birlikte oluşturan olası token'lar arasından dinamik olarak seçim yapar.
- Daha düşük değerler (örneğin, p = 0,5) örneklemeyi en yüksek olasılıklı token'lardan oluşan dar bir kümeyle sınırlandırarak tutarlı ancak daha az çeşitli metin üretir.
- Daha yüksek değerler (örneğin, p = 0,9) daha geniş bir havuzdan örneklemeye izin vererek çıktı çeşitliliğini artırır ancak konudan sapma riskini de yükseltir.
Top-k örneklemesi
Top-k örneklemesi, modelin seçimini metin üretimindeki bir sonraki adım için k en yüksek olasılıklı token ile sınırlar. Aday kümesini daraltarak, bu parametre öngörülebilirliği ve çeşitliliği doğrudan etkiler.
- Daha düşük top-k değerleri, seçimi yüksek olasılıklı token'lardan oluşan küçük bir kümeyle sınırlandırarak daha öngörülebilir ve odaklanmış çıktılar üretir.
- Daha yüksek değerler aday havuzunu genişleterek değişkenliği artırır ve daha çeşitli dili destekler.
Top-p örneklemesi olasılık kütlesine dayalı olarak dinamik olarak uyarlanırken, top-k örneklemesi sabit bir kesme noktası kullanır. Bu ikisi, belirli görevler için en uygun ayarları belirlemek amacıyla model değerlendirmesi sırasında sıklıkla karşılaştırılır.
Maks. token'lar (Token sayısı)
max_tokens parametresi, modelin tek bir yanıtta üretebileceği maksimum token sayısını tanımlar. Çıktı uzunluğunu doğrudan belirler ve hesaplama maliyetini etkiler.
- Daha düşük maksimum değerler özlü yanıtları zorunlu kılar ancak önemli ayrıntıları kesebilir.
- Daha yüksek değerler daha ayrıntılı açıklamalara izin verir ancak daha fazla hesaplama kaynağı gerektirir ve inference süresini artırır.
Maksimum token sayısı, hem girdi verilerini hem de üretilen çıktıyı içeren bağlam penceresi tarafından kısıtlanır. Birleşik token sayısı modelin token sınırını aşarsa, maks. token'lar ayarından bağımsız olarak üretim durur.
Frekans cezası parametresi
Frekans cezası, token'ların olasılığını, üretilen metinde ne sıklıkta göründüklerine göre ayarlar.
- Pozitif değerler tekrarı azaltır ve daha uzun yanıtlarda çıktı kalitesini artırır.
- Negatif değerler yeniden kullanımı teşvik eder, bu da tutarlı terminoloji gerektiren belgeler için faydalı olabilir.
Aşırı yüksek cezalar tutarlılığa zarar verebilir, çünkü doğal tekrar genellikle insan benzeri metin için gereklidir. Bu parametre, uzun biçimli metin üretimi için model performansını optimize ederken en etkilidir.
Varlık cezası
Varlık cezası, sıklıktan bağımsız olarak en az bir kez görünen token'ların olasılığını azaltır. Bu, modeli yeni fikirler sunmaya teşvik eder.
- Pozitif değerler yeniliği ve keşfi teşvik eder, bu da beyin fırtınası ve yaratıcı yazımda faydalıdır.
- Negatif değerler mevcut terimleri pekiştirir, bu da yapılandırılmış veya kısıtlı çıktılarda yardımcı olabilir.
Varlık cezası, fikir çeşitliliğini yönlendirmek için değerli bir kontroldür, ancak kilit terimlerin doğal olmayan şekilde kaçınılmasını önlemek için dikkatli uygulanmalıdır.
Durdurma dizileri
Durdurma dizileri, modele üretimi durdurması için sinyal veren belirli token'ları veya dizeleri tanımlar. Yapılandırılmış uygulamalarda yaygın olarak kullanılırlar.
- Diyalog sistemlerinde veya kod üretiminde şablonları zorunlu kılmak için kullanışlıdır.
- Çıktı uzunluğunu kontrol etmeye ve ilgisiz devamlılıkları önlemeye yardımcı olur.
Durdurma dizileri, yalnızca token sınırlarına güvenmeden üretilen metin çıktılarında öngörülebilirliği artırır.
Tohum ve determinizm
Bazı sistemler, kullanıcıların rastgele bir tohum belirlemesine izin vererek aynı girdi verilerinin ve parametre ayarlarının aynı üretilen çıktıyı üretmesini sağlar.
- Model değerlendirmesi ve test için kullanışlıdır.
- Sonuçları etkileyen rastgele değişiklikler olmadan farklı parametre yapılandırmalarını karşılaştırmaya yardımcı olur.
Deterministik üretim tekrarlanabilirliği destekler, ancak kesin çıktılar farklı yapay zeka modelleri veya dağıtım ortamları arasında yine değişebilir.
Temel parametreler arasındaki farklar
Temel parametrelerin nasıl farklılaştığını anlamak, en uygun sonuçlar için LLM parametrelerini ayarlarken yardımcı olur.
- Frekans cezası vs. varlık cezası: Frekans cezası bir token'ın ne sıklıkta göründüğüne göre ölçeklenirken, varlık cezası bir token ilk kez göründükten sonra bir kez uygulanır.
- Top-k vs. top-p örneklemesi: Top-k seçimi sabit sayıda token ile sınırlarken, top-p kümülatif olasılığa dayalı olarak dinamik olarak token seçer.
- Maks. token'lar vs. bağlam penceresi: Maks. token'lar çıktı uzunluğunu sınırlarken, bağlam penceresi hem girdi hem de çıktı token'larını kapsayan sabit bir üst sınırdır.
Bu parametrelerin dikkatli bir şekilde ayarlanması, uygulayıcıların erişimle zenginleştirilmiş üretim, analitik görevler ve açık uçlu metin üretimi gibi uygulamalarda çıktı kalitesi, hesaplama verimliliği ve LLM performansını dengelemesine olanak tanır.
Bu araştırmayı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{ermut2026,
author = {Ermut, Sıla and Alper, Şevval},
title = {{LLM Parametreleri: GPT-5 High, Orta, Düşük ve Minimal}},
year = {2026},
month = jun,
howpublished = {\url{https://aimultiple.com/llm-parameters}},
note = {AIMultiple. Erişim tarihi: 26 Haziran 2026}
}
Yorum yapan ilk kişi olun
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.