Hizmetler
Bize Ulaşın

LLM Kullanım Durumlarına Göre Gecikme Karşılaştırması

Cem Dilmegani
Cem Dilmegani
Güncellenme tarihi: 8 Tem 2026

Toplam 1.320 istekle 11 üst düzey büyük dil modelini karşılaştırdık; akıl yürüten ve akıl yürütmeyen modelleri ayırdık ve ilk token gecikmesini, token başına gecikmeyi ve toplam yanıt süresini ölçtük.

LLM gecikme karşılaştırması

Loading Chart

Gecikmeyi nasıl ölçtüğümüze dair ayrıntıları burada bulabilirsiniz.

Modele göre uçtan uca yanıt süresi

LLM gecikme karşılaştırma sonuçları

Akıl yürüten ve akıl yürütmeyen modelleri ayrı ayrı raporluyoruz. Akıl yürüten modeller ilk görünür yanıttan önce birkaç saniye düşünmeye harcar, bu nedenle onları gecikme açısından doğrudan akıl yürütmeyen modellerle karşılaştırmak yanıltıcı olur. Bazı modeller ayrıca göreve göre davranış değiştirir: GPT-5.2 soru-cevabı akıl yürütmeden yanıtlar, ancak kodlama istemlerinde akıl yürütür.

Kısa yanıt durumu (Soru-Cevap)

Kısa durumda önemli olan, ilk yanıt token'ının ne kadar hızlı göründüğüdür, çünkü tüm yanıt yalnızca bir veya iki cümledir. Akıl yürütmeyen modeller düşük gecikme bölgesinde kümelenir:

  • claude-opus-4-8: 0.75 saniye
  • gpt-5-2: 0.8 saniye
  • claude-haiku-4-5: 0.96 saniye
  • claude-sonnet-5: 1.5 saniye
  • claude-opus-4-7: 2 saniye

Akıl yürüten modeller burada bile ilk yanıt sözcüğüne ulaşmada daha yavaştı, çünkü önce düşünürler:

  • mimo-v2-5: 1.2 saniye
  • minimax-m3: 2.4 saniye
  • deepseek-v4-flash: 3.6 saniye
  • gemini-3-1-pro-preview: 9 saniye
  • hy3-preview: 14.6 saniye

Kısa sorularda düşünme adımı çoğunlukla ek yüktür, çünkü yanıtın kendisi kısadır.

Uzun yanıt durumu (kod üretimi)

Uzun yanıt durumunda ilk token gecikmesi daha az önemlidir ve akış spUzun yanıt durumunda ilk token gecikmesi daha az önemlidir ve akış hızı ve toplam yanıt süresi öne çıkar. claude-haiku-4-5 her ikisinde de öndeydi, saniyede yaklaşık 180 token akış hızıyla ve yaklaşık 5.5 saniyede tamamladı. Diğer akıl yürütmeyen modeller yaklaşık 10 ila 13 saniyede tamamladı: claude-sonnet-5 10 saniyede, claude-opus-4-8 10.8 saniyede ve claude-opus-4-7 12.7 saniyede.

Akıl yürüten modeller, düşünme ve uzun çıktının birleşmesi nedeniyle daha uzun toplam süreler üretti:

  • gemini-3-1-pro-preview: 18.5 saniye
  • hy3-preview: 23.1 saniye
  • deepseek-v4-flash: 24.3 saniye
  • minimax-m3: 28.1 saniye
  • mimo-v2-5: 35 saniye

Bazıları başladıktan sonra hızlı akış sağlar (hy3-preview saniyede yaklaşık 200 token hızında çalışır), ancak önceden düşünme toplamı yüksek tutar.

Çıktı uzunluğu açık bırakılmak yerine sınırlandı, böylece modeller laf kalabalığı açısından karşılaştırılmadı: kısa yanıtlar için yaklaşık 128 token ve uzun yanıtlar için 1,024 token. Akıl yürüten modellere, düşünme token'larını tutmaları için bu sınırın üzerinde ek bütçe verildi, böylece uçtan uca süreleri, düşünme artı yanıtı yansıtır, düşünmenin ortasında kesilmiş bir yanıtı değil.

Kısa yanıtlar ve uzun yanıtlar

İki durum arasındaki fark ana çıkarımdır:

  • Kısa durumda en hızlı modeller bir saniyenin altında yanıt verdi ve dağılım dardı.
  • Uzun durumda akıl yürütmeyen modeller ön sıralarda kaldı (Haiku yaklaşık 5.5 saniye ile en hızlısı), akıl yürüten modeller ise 18 ila 35 saniye ile oldukça geride kaldı.
  • Akıl yürütmeyen grup içindeki sıralama da değişiyor: Haiku kısa istemlerde saniye altı başlangıç yapan birkaç modelden biriydi, ancak akış hızı sayesinde uzun çıktılarda açık ara öne çıkıyor.

90. yüzdelik dilimde gecikme

Ana desen, akıl yürüten modeller için kuyruğun yalnızca kaymak yerine katlanmasıdır. Kodlama görevinde, MiniMax medyanda yaklaşık 13 saniyeden p90'da 42 saniyeye, Hunyuan ise yaklaşık 16 saniyeden 46 saniyeye çıktı. Ek süre düşünmedir ve düşünme süresi istekten isteğe değişir, bu nedenle bu modeller yalnızca daha yavaş değil, aynı zamanda daha az öngörülebilirdir.

Birkaç nokta öne çıkıyor:

  • MiMo akıl yürüten modeller arasında istisnadır. Her istekte akıl yürütür ancak kısa süre düşünür, bu nedenle p90'ı 3.7 saniye civarında kaldı. Akıl yürütme kendi başına bir modeli öngörülemez kılmaz; düşünme miktarı öngörülemez kılar.
  • GPT-5.2 yalnızca akıl yürüttüğü yerde kuyruk gösterir. Soru-Cevap'ta p90'ı 2 saniyenin altındaydı, ancak akıl yürütmeyi açtığı kodlamada p90'ı yaklaşık 11 saniyeye yükseldi.
  • Akıl yürütmeyen modeller dar bir aralıkta kaldı. Haiku 4.5 ve Opus 4.8 p90'ı yaklaşık 2 ila 2.5 saniye içinde tuttu. Uzun çıktılarda genişleyen Sonnet 5 bile (medyanda yaklaşık 4 saniyeden p90'da 8 saniyeye), akıl yürüten grubun oldukça altında kaldı.

Pratik nokta, medyanın bunu gizleyebilmesidir. MiniMax'in kodlamada medyanı, yaklaşık 13 saniye, gruptaki en kötüsü değildir, ancak yaklaşık 42 saniyelik p90'ı Hunyuan ile eşleşir, bu nedenle kötü bir istekte ölçülen her şey kadar yavaştır.

Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

LLM akıl yürütme ve hız üzerindeki etkisi

Akıl yürüten modeller, görünür yanıttan önce iç zincirleme düşünce token'ları ürettikleri için ilk yanıt token'ını üretmeleri daha uzun sürer. Bu düşünme adımı, akıl yürütmeyen modeller için yaklaşık bir saniyeden birkaç saniyeye veya daha fazlasına çıkararak ilk yanıt süresini yükseltir.

Bir modelin akıl yürütüp yürütmediği her zaman sabit değildir. Her yanıtın döndürdüğü akıl yürütme token sayısından istek başına akıl yürütmeyi tespit ettik, ardından sonuçları göreve göre gruplandırdık. Her modelin akıl yürüttüğü isteklerin oranı:

GPT-5.2 bunu doğrudan gösterir: kısa Soru-Cevap istemlerini akıl yürütmeden yanıtladı, ancak çoğu kodlama isteminde akıl yürüttü. Bunun gibi bir hibrit model için "akıl yürütme" sabit bir etiket değildir; model göreve göre karar verir ve gecikmesi bu kararla değişir. Bu nedenle GPT-5.2 Soru-Cevap'ta hızlı grupta yer alırken kodlamada geri düşer.

Her modeli varsayılan durumunda ölçtük. Birçoğu, isteğe bağlı olarak akıl yürütebilen ancak düşünme kapalı olarak gönderilen hibritlerdir: örneğin Claude Opus 4.8 genişletilmiş düşünmeyi destekler, ancak varsayılan olarak devre dışıdır, bu nedenle çalışmalarımızda hiç akıl yürütme token'ı üretmedi ve hızlı kaldı; diğer Claude modelleri de (Opus 4.7, Sonnet 5, Haiku 4.5) aynı şekilde.

Geri kalanlar neredeyse her istekte akıl yürüttü, bu nedenle ilk yanıtta daha yavaş görünmelerinin nedeni budur. Yani burada "asla akıl yürütmez", yeteneğin eksik olduğu anlamına değil, varsayılan olarak yapmadığı anlamına gelir. GPT-5.2, bu seçimi kendi başına yaptığı için öne çıkar; daha zor kodlama istemleri için akıl yürütmeyi açarken Soru-Cevap için kapalı bırakır.

Uç noktanın LLM'lerde gecikmeye etkisi

Barındırılan bir modelin gecikmesi yalnızca modelin kendisi değildir. Sağlayıcının sunum yığınını, sıraya almayı, ağ yolunu ve coğrafyayı da içerir. Listemiz bunu tek bir model satırı içinde gösterir. Claude Opus 4.8, Avrupa'daki Google Vertex üzerinden sunulduğunda ilk token'ını yaklaşık 0.75 saniyede döndürürken, Claude Opus 4.7, Anthropic'in kendi API'si üzerinden sunulduğunda yaklaşık 2 saniye sürdü.

Bunlar farklı sürümlerdir, bu nedenle fark tamamen uç noktadan kaynaklanmaz, ancak desen iyi bilinen bir etkiyle örtüşür: aynı ağırlıklar, nerede ve nasıl sunulduklarına bağlı olarak birkaç kat daha hızlı veya daha yavaş olabilir. Ölçüm istemcimiz Avrupa'da çalıştı, bu nedenle Avrupa Vertex uç noktasının ağ yolu daha kısaydı, bu da öne çıkmasının bir nedenidir.

Her model için sağlayıcıyı nasıl seçtiğimizi görmek için karşılaştırma metodolojimizi okuyun.

Maksimum token sınırı ve akıl yürüten modeller

Gecikmeyi adil ölçmek için sabit bir maksimum çıktı uzunluğu belirledik, böylece hiçbir model daha fazla yazdığı için ödüllendirilmez veya cezalandırılmaz. Bu sınır, tüm yanıt için token bütçesidir ve çoğu hatanın kaynağıdır:

  • Akıl yürüten modeller, yanıt başlamadan önce bütçenin bir kısmını düşünmeye harcar.
  • Zor kodlama istemlerinde bazıları çok ve öngörülemez şekilde düşünür (MiniMax tek bir istemde yaklaşık 2,500 ila 3,700 düşünme token'ı kullandı).
  • Düşünme tüm bütçeyi doldurduğunda, yanıt için token kalmaz ve yanıt boş döner.
  • Bu durum MiniMax'i en çok kodlamada etkiledi; ilk geçişte isteklerin yarısından azını tamamladı.

Çıkarım, maksimum token sınırının izlenmeye değer bir parametre olduğudur: çok düşük ayarlarsanız, akıl yürüten bir model tüm bütçeyi düşünmeye harcayıp hiçbir zaman yanıta ulaşamayabilir. Akıl yürüten modeller için bütçeyi yükselttik, yanıt uzunluğunun üstüne düşünme alanı verdik ve başarısız istekleri tekrar denedik. Birkaçı hâlâ başarısız olsa da, çoğu boşluk doldu; çünkü bir modelin düşünmesi daha büyük bütçeyi bile aştı.

Kıyaslamalarımızı ve veri odaklı içgörülerimizi kaçırmayın. Düğme Google'ı açar; AIMultiple'ı seçmeniz, Google arama sonuçlarında AIMultiple'ı daha sık görmek istediğinizi onaylar.
GoogleTercih edilen kaynak olarak ekle

LLM gecikme karşılaştırma metodolojisi

11 dil modelini 1,320 istekle karşılaştırdık ve her modelin ne kadar hızlı yanıt verdiğini ölçtük.

Modeller

OpenRouter üzerinde en çok kullanılan beş modeli aldık ve üzerine altı güncel model daha ekledik:

  • Varsayılan olarak akıl yürütmeyenler: Claude Opus 4.8, Claude Opus 4.7, Claude Sonnet 5, Claude Haiku 4.5, GPT-5.2
  • Varsayılan olarak akıl yürütenler: DeepSeek V4 Flash, Xiaomi MiMo v2.5, MiniMax M3, Gemini 3.1 Pro, Tencent Hunyuan HY3, Claude Fable 5

Kullanım durumları ve örnek prompt'lar

Girdi ve çıktı uzunlukları sabit iki kullanım durumu kullandık, böylece sonuçlar hızı yansıtır, bir prompt'lar veya yanıtın ne kadar uzun olduğuna bağlı kalmaz:

  • Kısa yanıt (Soru-Cevap): kısa girdi (yaklaşık 256 token), kısa çıktı (en fazla 128 token). Örnek: “Bir veritabanında birincil anahtarın amacı nedir?”
  • Uzun yanıt (kod üretimi): kısa girdi (yaklaşık 512 token), uzun çıktı (en fazla 1,024 token). Örnek: “Python'da bir dizi resim URL'sini alıp bunları eşzamanlı olarak indiren çok iş parçacıklı bir URL indirici oluştur.”

Her kullanım durumu için 20 prompt'lar kullanıldı ve her prompt'lar model başına 3 kez gönderildi, böylece model başına kullanım durumu başına 60 ölçüm elde edildi. Medyanı (p50) ve p90'ı raporluyoruz.

Ne ölçtük

Her yanıtı akış olarak aldık ve isteğin gönderildiği zamanı, ilk token'ın geldiği zamanı, ilk yanıt token'ının geldiği zamanı (herhangi bir düşünmeden sonra) ve son token'ın geldiği zamanı kaydettik. Bunlardan ilk token'a kadar geçen süre, ilk yanıt token'ına kadar geçen süre, token başına gecikme ve çıktı hızı ile uçtan uca süre türetildi.

Akıl yürütme ve akıl yürütmeme

Her yanıt, bir akıl yürütme token sayısı içeren bir kullanım özeti döndürür. Bunu her istek için okuduk ve modelin etiketine güvenmek yerine sayı sıfırdan büyük olduğunda isteği akıl yürüten, sıfır olduğunda akıl yürütmeyen olarak işaretledik. GPT-5.2'nin kodlamada akıl yürüttüğünü ancak Soru-Cevap'ta yürütmediğini böyle bulduk.

Sağlayıcıları nasıl seçtik

Aynı model farklı sağlayıcılar tarafından farklı hızlarda sunulur, bu nedenle isteklerin serbestçe yönlendirilmesine izin vermek yerine her modeli tek bir sağlayıcıya sabitledik. OpenRouter her sağlayıcının çalışma süresini, gecikmesini ve verimini listeler ve seçim yapmak için bu rakamları kullandık. Yaklaşık 98 yüzde çalışma süresinin altındaki herhangi bir sağlayıcıyı eledik, ardından geri kalanlar arasından gecikme ve verime göre en hızlısını seçtik. Her istek için o sağlayıcıyı sabitledik ve sabitlemenin korunduğunu doğrulamak için her yanıtı gerçekten sunan sağlayıcıyı kaydettik. En hızlı sağlayıcılardan birkaçı hesabımızla erişilebilir değildi ve hız sınırı hataları döndü, bu nedenle güvenilir şekilde hizmet veren en hızlı sağlayıcıyı kullandık.

Sabitlenen sağlayıcılar şunlardı: Claude Opus 4.8 Google Vertex (Avrupa) üzerinde, Claude Opus 4.7 Anthropic üzerinde, Claude Sonnet 5 ve GPT-5.2 Azure üzerinde, Claude Fable 5 ve Claude Haiku 4.5 Amazon Bedrock üzerinde, DeepSeek V4 Flash Novita üzerinde, MiMo v2.5 DeepInfra üzerinde, MiniMax M3 Together üzerinde, Gemini 3.1 Pro Google Vertex üzerinde ve Hunyuan HY3 GMICloud üzerinde.

Kontroller

  • Tüm istekler tek bir istemci bölgesinden çalıştırıldı.
  • Çıktı uzunluğu sınırlandı (kısa için 128, uzun için 1,024), böylece laf kalabalığı gecikmeyi çarpıtmaz. Akıl yürüten modellere bu sınırın üzerinde düşünme için ek bütçe verildi.
  • Her prompt'lar, prompt'lar önbelleğe almayı engellemek için benzersiz bir metin bloğuyla başladı ve hiçbir girdi token'ının önbellekten gelmediğini doğruladık.
  • Tüm token sayıları tek bir tokenleştirici kullanılarak yapıldı, böylece hız modeller arasında karşılaştırılabilir.

Bu benchmarkı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Cem Dilmegani and Nazlı Şipi (2026) - "LLM Kullanım Durumlarına Göre Gecikme Karşılaştırması". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 8 Temmuz 2026, kaynak: https://aimultiple.com/llm-latency-benchmark [Çevrimiçi Kaynak]

Dilmegani, C., & Şipi, N. (2026, 8 Temmuz). LLM Kullanım Durumlarına Göre Gecikme Karşılaştırması. AIMultiple. https://aimultiple.com/llm-latency-benchmark

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Şipi, Nazlı},
  title  = {{LLM Kullanım Durumlarına Göre Gecikme Karşılaştırması}},
  year   = {2026},
  month  = jul,
  howpublished    = {\url{https://aimultiple.com/llm-latency-benchmark}},
  note   = {AIMultiple. Erişim tarihi: 8 Temmuz 2026}
}
Tüm verileri indir

1.3 bin veri noktasının sonuçları ve zaman damgaları. Bu makalede kullanılan verileri, bir CSV dosyası ve bir README içeren ZIP dosyası olarak indirin.

Son güncelleme: 9 Temmuz 2026
İndir
Cem Dilmegani
Cem Dilmegani
Baş Analist
Cem, 2017'den beri AIMultiple'da baş analisttir. AIMultiple, her ay Fortune 500'ün %60'ı dahil olmak üzere (similarWeb'e göre) yüz binlerce işletmeyi bilgilendirmektedir.

Cem'in çalışmaları Business Insider, Forbes, Washington Post gibi önde gelen küresel yayınlar, Deloitte, HPE gibi küresel firmalar, Dünya Ekonomik Forumu gibi STK'lar ve Avrupa Komisyonu gibi uluslarüstü kuruluşlar tarafından alıntılanmıştır.

Cem, kariyeri boyunca teknoloji danışmanı, teknoloji alıcısı ve teknoloji girişimcisi olarak görev yapmıştır. On yıldan fazla bir süre McKinsey & Company ve Altman Solon'da işletmelere teknoloji kararlarında danışmanlık yapmıştır. Ayrıca dijitalleşme üzerine bir McKinsey raporu yayımlamıştır.

CEO'ya rapor verirken bir telekomünikasyon şirketinin teknoloji stratejisini ve satın alımını yönetmiştir. Ayrıca, 2 yıl içinde 0'dan 7 haneli yıllık yinelenen gelire ve 9 haneli değerlemeye ulaşan derin teknoloji şirketi Hypatos'un ticari büyümesini yönetmiştir. Cem'in Hypatos'taki çalışmaları TechCrunch ve Business Insider gibi önde gelen teknoloji yayınları tarafından ele alınmıştır.

Cem, uluslararası teknoloji konferanslarında düzenli olarak konuşma yapmaktadır. Boğaziçi Üniversitesi'nden bilgisayar mühendisi olarak mezun olmuş ve Columbia Business School'dan MBA derecesine sahiptir.
Tam Profili Görüntüle
Araştıran
Nazlı Şipi
Nazlı Şipi
Yapay Zeka Araştırmacısı
Nazlı, AIMultiple'de veri analistidir. Çeşitli sektörlerde veri analizi konusunda önceden deneyime sahip olup, karmaşık dataset'leri eyleme dönüştürülebilir içgörülere dönüştürme üzerine çalışmıştır.
Tam Profili Görüntüle

Yorum yapan ilk kişi olun

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450