Hizmetler
Bize Ulaşın

LLM Kullanım Durumlarına Göre Gecikme Karşılaştırması

Cem Dilmegani
Cem Dilmegani
Güncellenme tarihi: 12 Ağu 2026

En iyi 11 büyük dil modelini toplam 1.320 istek ile test ettik, akıl yürüten ve akıl yürütmeyen modelleri birbirinden ayırdık ve ilk token gecikmesini, token başına gecikmeyi ve toplam yanıt süresini ölçtük.

LLM gecikme karşılaştırması

Loading Chart

Gecikmeyi nasıl ölçtüğümüze dair ayrıntıları burada bulabilirsiniz.

Uçtan uca yanıt süresi, modele göre

LLM gecikme karşılaştırması sonuçları

Akıl yürüten ve akıl yürütmeyen modelleri ayrı olarak raporluyoruz. Akıl yürüten modeller, ilk görünür yanıttan önce birkaç saniye düşünür, bu nedenle onları doğrudan akıl yürütmeyen modellerle gecikme açısından karşılaştırmak yanıltıcı olur. Bazı modeller ayrıca göreve göre davranış değiştirir: GPT-5.2 Soru-Cevap'a akıl yürütmeden yanıt verir, ancak kodlama istemlerinde akıl yürütür.

Kısa yanıt durumu (Soru-Cevap)

Kısa durumda önemli olan, ilk yanıt token'ının ne kadar hızlı göründüğüdür, çünkü tüm yanıt yalnızca bir veya iki cümledir. Akıl yürütmeyen modeller düşük gecikme bölgesinde kümelenir:

  • claude-opus-4-8: 0.75 saniye
  • gpt-5-2: 0.8 saniye
  • claude-haiku-4-5: 0.96 saniye
  • claude-sonnet-5: 1.5 saniye
  • claude-opus-4-7: 2 saniye

Akıl yürüten modeller, önce düşündükleri için burada bile ilk yanıt kelimesine daha yavaş ulaştı:

  • mimo-v2-5: 1.2 saniye
  • minimax-m3: 2.4 saniye
  • deepseek-v4-flash: 3.6 saniye
  • gemini-3-1-pro-preview: 9 saniye
  • hy3-preview: 14.6 saniye

Kısa sorularda, yanıtın kendisi kısa olduğu için düşünme adımı çoğunlukla ek yüktür.

Uzun yanıt durumu (kod üretimi)

Uzun durumda ilk token gecikmesi daha az önemlidir ve akış spUzun durumda ilk token gecikmesi daha az önemlidir ve akış hızı ve toplam yanıt süresi devreye girer. claude-haiku-4-5 her ikisinde de öne çıktı, saniyede yaklaşık 180 token hızında akış yaparak yaklaşık 5.5 saniyede tamamladı. Diğer akıl yürütmeyen modeller yaklaşık 10 ila 13 saniyede tamamladı: claude-sonnet-5 10 saniye, claude-opus-4-8 10.8 saniye ve claude-opus-4-7 12.7 saniye.

Akıl yürüten modeller, düşünme ve uzun çıktı bir araya geldiği için daha uzun toplam süreler üretti:

  • gemini-3-1-pro-preview: 18.5 saniye
  • hy3-preview: 23.1 saniye
  • deepseek-v4-flash: 24.3 saniye
  • minimax-m3: 28.1 saniye
  • mimo-v2-5: 35 saniye

Bazıları başladıktan sonra hızlı akar (hy3-preview saniyede yaklaşık 200 token hızında çalışır), ancak önceden düşünme toplamı yüksek tutar.

Çıktı uzunluğu açık bırakılmak yerine sınırlandırıldı, böylece modeller ayrıntı düzeyine göre karşılaştırılmaz: kısa yanıtlar için yaklaşık 128 token, uzun yanıtlar için 1.024 token. Akıl yürüten modellere, düşünme token'larını tutmaları için bu sınırın ötesinde ek bütçe verildi, böylece uçtan uca süreler, düşünce ortasında kesilmiş bir yanıt yerine düşünme artı yanıtı yansıtır.

Kısa yanıtlar ve uzun yanıtlar karşılaştırması

İki durum arasındaki fark ana çıkarımdır:

  • Kısa durumda en hızlı modeller bir saniyenin altında yanıt verdi ve dağılım dardı.
  • Uzun durumda akıl yürütmeyen modeller önlerde kaldı (en hızlı Haiku yaklaşık 5.5 saniye), akıl yürüten modeller ise 18 ila 35 saniye ile oldukça geride kaldı.
  • Akıl yürütmeyen grup içindeki sıralama da değişiyor: Haiku, kısa istemlerde saniyeler altı başlatıcılardan biriydi, ancak akış hızı nedeniyle uzun çıktılarda belirgin şekilde öne çıkıyor.

90th persentildeki gecikme

Ana örüntü, akıl yürüten modeller için kuyruğun yalnızca kaymakla kalmayıp katlanmasıdır. Kodlama görevinde, MiniMax medyanda yaklaşık 13 saniyeden p90'da yaklaşık 42 saniyeye, Hunyuan ise yaklaşık 16 saniyeden 46 saniyeye yükseldi. Ekstra süre düşünmedir ve düşünme uzunluğu istekten isteğe değişir, bu nedenle bu modeller yalnızca daha yavaş değil, aynı zamanda daha az öngörülebilirdir.

Birkaç nokta öne çıkıyor:

  • MiMo, akıl yürüten modeller arasında istisnadır. Her istekte akıl yürütür ancak kısaca düşünür, bu nedenle p90'ı 3.7 saniye civarında kaldı. Akıl yürütme tek başına bir modeli öngörülemez yapmaz; önemli olan düşünme miktarıdır.
  • GPT-5.2, yalnızca akıl yürüttüğü yerde bir kuyruk gösterir. Soru-Cevap'ta p90'ı 2 saniyenin altındaydı, ancak akıl yürütmeyi açtığı kodlamada p90'ı yaklaşık 11 saniyeye yükseldi.
  • Akıl yürütmeyen modeller sıkı kaldı. Haiku 4.5 ve Opus 4.8, p90'ı yaklaşık 2 ila 2.5 saniye arasında tuttu. Uzun çıktılarda genişleyen Sonnet 5 bile (medyanda yaklaşık 4 saniyeden p90'da 8 saniyeye), akıl yürüten grubun çok altında kaldı.

Pratik nokta, medyanın bunu gizleyebileceğidir. MiniMax'in kodlama medyanı, yaklaşık 13 saniye, gruptaki en kötüsü değildir, ancak yaklaşık 42 saniye olan p90'ı Hunyuan ile eşleşir, bu nedenle kötü bir istekte ölçülen herhangi bir şey kadar yavaştır.

Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

LLM akıl yürütme ve hız üzerindeki etkisi

Akıl yürüten modeller, görünür yanıttan önce içsel düşünce zinciri token'ları ürettikleri için ilk yanıt token'ını üretmeleri daha uzun sürer. Bu düşünme adımı, akıl yürütmeyen modeller için yaklaşık bir saniyeden birkaç saniyeye veya daha fazlasına, ilk yanıt sürelerini yükselten şeydir.

Bir modelin akıl yürütüp yürütmediği her zaman sabit değildir. Her yanıtın döndürdüğü akıl yürütme token sayısından istek başına akıl yürütme durumunu tespit ettik ve ardından sonuçları göreve göre grupladık. Her modelin akıl yürüttüğü isteklerin payı:

GPT-5.2 bunu doğrudan gösterir: kısa Soru-Cevap istemlerine akıl yürütmeden yanıt verdi, ancak çoğu kodlama isteminde akıl yürüttü. Bunun gibi hibrit bir model için “akıl yürütme” sabit bir etiket değildir; model göreve göre karar verir ve gecikmesi bu kararla değişir. Bu nedenle GPT-5.2 Soru-Cevap'ta hızlı grupta yer alırken kodlamada geri düşer.

Her modeli varsayılan durumunda ölçtük. Bazıları istek üzerine akıl yürütebilen ancak düşünme kapalı olarak gönderilen hibritlerdir: örneğin Claude Opus 4.8, genişletilmiş düşünmeyi destekler ancak varsayılan olarak devre dışıdır, bu nedenle çalışmalarımızda hiçbir zaman akıl yürütme token'ı üretmedi ve hızlı kaldı, tıpkı diğer Claude modelleri (Opus 4.7, Sonnet 5, Haiku 4.5) gibi.

Geri kalanlar neredeyse her istekte akıl yürüttü, bu nedenle ilk yanıta daha yavaş görünürler. Yani burada “hiç akıl yürütmez” ifadesi varsayılan olarak değil, yeteneğin eksik olduğu anlamına gelmez. GPT-5.2, bu seçimi kendi başına yaptığı için öne çıkar; daha zor kodlama istemlerinde akıl yürütmeyi açarken Soru-Cevap için kapalı bırakır.

LLM'ler için uç noktanın gecikmeye etkisi

Sunucuda barındırılan bir modelin gecikmesi yalnızca model değildir. Ayrıca sağlayıcının sunum yığınını, kuyruklanmayı, ağ yolunu ve coğrafyayı da içerir. Listemiz bunu tek bir model satırında gösteriyor. Avrupa’daki Google Vertex üzerinden sunulan Claude Opus 4.8, ilk token'ını yaklaşık 0.75 saniyede döndürürken, Anthropic'in kendi API'si üzerinden sunulan Claude Opus 4.7 yaklaşık 2 saniye sürdü.

Bunlar farklı sürümlerdir, bu nedenle fark tamamen uç noktadan kaynaklanmaz, ancak örüntü iyi bilinen bir etkiyle eşleşir: aynı ağırlıklar, nerede ve nasıl sunulduklarına bağlı olarak birkaç kat daha hızlı veya daha yavaş olabilir. Ölçüm istemcimiz Avrupa'da çalıştığından, Avrupa Vertex uç noktası daha kısa ağ yoluna sahipti, bu da onun öne çıkmasının nedenlerinden biridir.

Her model için sağlayıcıyı nasıl seçtiğimizi görmek için karşılaştırma metodolojimize bakın.

Maksimum token sınırı ve akıl yürüten modeller

Gecikmeyi adil bir şekilde ölçmek için, hiçbir modelin daha fazla yazdığı için ödüllendirilmemesi veya cezalandırılmaması için sabit bir maksimum çıktı uzunluğu belirledik. Bu üst sınır, tüm yanıt için token bütçesidir ve başarısızlıkların çoğunun kaynağıdır:

  • Akıl yürüten modeller, bütçenin bir kısmını yanıt başlamadan önce düşünmeye harcar.
  • Zor kodlama istemlerinde bazıları çok ve öngörülemez bir şekilde düşünür (MiniMax tek bir istemde yaklaşık 2.500 ila 3.700 düşünme token'ı kullandı).
  • Düşünme tüm bütçeyi doldurduğunda, yanıt için hiç token kalmaz ve yanıt boş döner.
  • Bu, MiniMax'i kodlamada en çok etkiledi; ilk geçişte isteklerin yarısından azı tamamlandı.

Çıkarılması gereken sonuç, maksimum token sınırının izlenmesi gereken bir parametre olduğudur: onu çok düşük ayarlarsanız, bir akıl yürüten model tümünü düşünmeye harcayabilir ve asla bir yanıta ulaşamayabilir. Akıl yürüten modeller için bütçeyi artırdık, yanıt uzunluğunun üzerine düşünme alanı ekledik ve başarısız istekleri tekrar denedik. Çoğu boşluk dolduruldu, ancak bir modelin düşünmesi daha büyük bütçeyi bile aştığında bazıları hala başarısız oldu.

Kıyaslamalarımızı ve veri odaklı içgörülerimizi kaçırmayın. Düğme Google'ı açar; AIMultiple'ı seçmeniz, Google arama sonuçlarında AIMultiple'ı daha sık görmek istediğinizi onaylar.
GoogleTercih edilen kaynak olarak ekle

LLM gecikme karşılaştırması metodolojisi

Her modelin ne kadar hızlı yanıt verdiğini ölçerek 11 dil modelini 1.320 istek ile test ettik.

Modeller

OpenRouter'daki en çok kullanılan beş modeli aldık ve üzerine altı güncel model daha ekledik:

  • Varsayılan olarak akıl yürütmeyen: Claude Opus 4.8, Claude Opus 4.7, Claude Sonnet 5, Claude Haiku 4.5, GPT-5.2
  • Varsayılan olarak akıl yürüten: DeepSeek V4 Flash, Xiaomi MiMo v2.5, MiniMax M3, Gemini 3.1 Pro, Tencent Hunyuan HY3, Claude Fable 5

Kullanım durumları ve örnek prompt'lar

Sonuçların, bir prompt'lar veya yanıtın ne kadar uzun olduğuna değil hıza yansıması için sabit giriş ve çıkış uzunluklarına sahip iki kullanım durumu kullandık:

  • Kısa yanıt (Soru-Cevap): kısa giriş (yaklaşık 256 token), kısa çıkış (128 token ile sınırlı). Örnek: “Bir veritabanında birincil anahtarın amacı nedir?”
  • Uzun yanıt (kod üretimi): kısa giriş (yaklaşık 512 token), uzun çıkış (1.024 token ile sınırlı). Örnek: “Python'da bir dizi resim URL'si alan ve bunları eşzamanlı olarak indiren çok iş parçacıklı bir URL indiricisi oluşturun.”

Her kullanım durumu için 20 prompt'lar kullanıldı ve her prompt'lar model başına 3 kez gönderilerek model ve kullanım durumu başına 60 ölçüm elde edildi. Medyanı (p50) ve p90'ı raporluyoruz.

Ne ölçtük

Her yanıtı akıttık ve isteğin ne zaman gönderildiğini, ilk token'ın ne zaman geldiğini, ilk yanıt token'ının ne zaman geldiğini (herhangi bir düşünmeden sonra) ve son token'ın ne zaman geldiğini kaydettik. Bunlardan ilk token'a kadar süre, ilk yanıt token'ına kadar süre, token başına gecikme ve çıktı hızı ile uçtan uca süreyi türettik.

Akıl yürütme ve akıl yürütmeme karşılaştırması

Her yanıt, akıl yürütme token sayısını içeren bir kullanım özeti döndürür. Bunu her istek için okuduk ve modelin etiketine güvenmek yerine, sayı sıfırdan büyük olduğunda isteği akıl yürüten, sıfır olduğunda ise akıl yürütmeyen olarak işaretledik. GPT-5.2'nin kodlamada akıl yürütüp Soru-Cevap'ta akıl yürütmediğini bu şekilde bulduk.

Sağlayıcıları nasıl seçtik

Aynı model farklı hızlarda farklı sağlayıcılar tarafından sunulur, bu nedenle isteklerin serbestçe yönlendirilmesine izin vermek yerine her modeli tek bir sağlayıcıya sabitledik. OpenRouter, her sağlayıcının çalışma süresini, gecikmesini ve verimini listeler ve seçim yapmak için bu rakamları kullandık. Yaklaşık yüzde 98 çalışma süresinin altındaki tüm sağlayıcıları eledik, ardından geri kalanlar arasında gecikme ve verime göre en hızlı olanı seçtik. Her istek için bu sağlayıcıyı sabitledik ve sabitlemenin geçerli olduğunu doğrulamak için her yanıtı gerçekten sunan sağlayıcıyı günlüğe kaydettik. En hızlı sağlayıcılardan birkaçı hesabımızla erişilebilir değildi ve hız sınırı hataları döndürdü, bu nedenle güvenilir şekilde hizmet veren en hızlı sağlayıcıyı kullandık.

Sabitlenen sağlayıcılar şunlardı: Claude Opus 4.8 Google Vertex (Avrupa) üzerinde, Claude Opus 4.7 Anthropic üzerinde, Claude Sonnet 5 ve GPT-5.2 Azure üzerinde, Claude Fable 5 ve Claude Haiku 4.5 Amazon Bedrock üzerinde, DeepSeek V4 Flash Novita üzerinde, MiMo v2.5 DeepInfra üzerinde, MiniMax M3 Together üzerinde, Gemini 3.1 Pro Google Vertex üzerinde ve Hunyuan HY3 GMICloud üzerinde.

Kontroller

  • Tüm istekler tek bir istemci bölgesinden çalıştırıldı.
  • Çıktı uzunluğu sınırlandırıldı (kısa için 128, uzun için 1.024) böylece ayrıntı gecikmeyi çarpıtmasın. Akıl yürüten modellere, bu sınırın üzerine düşünme için ek bütçe verildi.
  • Her prompt'lar, prompt'lar önbelleğini engellemek için benzersiz bir metin bloğuyla başladı ve hiçbir giriş token'ının önbellekten gelmediğini doğruladık.
  • Tüm token sayıları, modeller arasında hız karşılaştırılabilir olması için tek bir tokenleştirici kullanır.

Bu benchmarkı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Cem Dilmegani and Nazlı Şipi (2026) - "LLM Kullanım Durumlarına Göre Gecikme Karşılaştırması". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 12 Ağustos 2026, kaynak: https://aimultiple.com/llm-latency-benchmark [Çevrimiçi Kaynak]

Dilmegani, C., & Şipi, N. (2026, 12 Ağustos). LLM Kullanım Durumlarına Göre Gecikme Karşılaştırması. AIMultiple. https://aimultiple.com/llm-latency-benchmark

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Şipi, Nazlı},
  title  = {{LLM Kullanım Durumlarına Göre Gecikme Karşılaştırması}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/llm-latency-benchmark}},
  note   = {AIMultiple. Erişim tarihi: 12 Ağustos 2026}
}
Tüm verileri indir

1.3 bin veri noktasının sonuçları ve zaman damgaları. Bu makalede kullanılan verileri, 2 CSV dosyası ve bir README içeren ZIP dosyası olarak indirin.

Son güncelleme: 17 Ağustos 2026
İndir
Cem Dilmegani
Cem Dilmegani
Baş Analist
Cem, 2017'den beri AIMultiple'da baş analisttir. AIMultiple, her ay Fortune 500'ün %60'ı dahil olmak üzere (similarWeb'e göre) yüz binlerce işletmeyi bilgilendirmektedir.

Cem'in çalışmaları Business Insider, Forbes, Washington Post gibi önde gelen küresel yayınlar, Deloitte, HPE gibi küresel firmalar, Dünya Ekonomik Forumu gibi STK'lar ve Avrupa Komisyonu gibi uluslarüstü kuruluşlar tarafından alıntılanmıştır.

Cem, kariyeri boyunca teknoloji danışmanı, teknoloji alıcısı ve teknoloji girişimcisi olarak görev yapmıştır. On yıldan fazla bir süre McKinsey & Company ve Altman Solon'da işletmelere teknoloji kararlarında danışmanlık yapmıştır. Ayrıca dijitalleşme üzerine bir McKinsey raporu yayımlamıştır.

CEO'ya rapor verirken bir telekomünikasyon şirketinin teknoloji stratejisini ve satın alımını yönetmiştir. Ayrıca, 2 yıl içinde 0'dan 7 haneli yıllık yinelenen gelire ve 9 haneli değerlemeye ulaşan derin teknoloji şirketi Hypatos'un ticari büyümesini yönetmiştir. Cem'in Hypatos'taki çalışmaları TechCrunch ve Business Insider gibi önde gelen teknoloji yayınları tarafından ele alınmıştır.

Cem, uluslararası teknoloji konferanslarında düzenli olarak konuşma yapmaktadır. Boğaziçi Üniversitesi'nden bilgisayar mühendisi olarak mezun olmuş ve Columbia Business School'dan MBA derecesine sahiptir.
Tam Profili Görüntüle
Araştıran
Nazlı Şipi
Nazlı Şipi
Yapay Zeka Araştırmacısı
Nazlı, AIMultiple bünyesinde veri analistidir. Çeşitli sektörlerde veri analizi konusunda önceki deneyime sahiptir ve karmaşık dataset'leri eyleme dönüştürülebilir içgörülere dönüştürme konusunda çalışmıştır.
Tam Profili Görüntüle

Yorum yapan ilk kişi olun

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450