Son 20 yılı sistem düzeyinde hesaplama performansı optimizasyonuna odaklanarak geçirdim. En yeni NVIDIA GPU'larını; NVIDIA'nın H100, H200 ve B200'ü ve AMD'nin MI300X'i dahil olmak üzere eşzamanlılık ölçekleme analizi için benchmark'ledik. vLLM framework'ü ile gpt-oss-20b modelini kullanarak, bu GPU'ların 1'den 512'ye kadar eşzamanlı istekleri nasıl işlediğini test ettik. Sistem çıktı verimini, sorgu başına çıktı hızını ve uçtan uca gecikmeyi ölçerek, yapay zeka iş yükleri için GPU performansının anlaşılmasına yardımcı olacak bulguları paylaşıyoruz.
Eşzamanlılık benchmark sonuçları
Sistem çıktı verimi vs eşzamanlılık
Bu grafik, her eşzamanlılık düzeyinde sistem tarafından saniyede üretilen toplam çıktı token sayısını gösterir.
Sorgu başına çıktı hızı vs eşzamanlılık
Bu metrik, sistem yoğunlaştıkça tek bir sorgunun ne kadar hızlı işlendiğini (saniye başına token cinsinden) gösterir. 1.000 token'lık bir çıktı için uçtan uca gecikmeye göre hesaplanır.
Uçtan uca gecikme vs eşzamanlılık
Bu grafik, farklı eşzamanlılık düzeylerinde bir isteğin baştan sona tamamlanması için geçen ortalama süreyi (milisaniye cinsinden) gösterir.
Saniye başına dolar başına token vs. eşzamanlılık
Bu grafik, saatlik kiralama için harcanan her dolar başına saniyede kaç token üretildiğini ölçerek her GPU'nun maliyet verimliliğini değerlendirir. Bu metrik, özellikle bütçe odaklı dağıtımlar için her donanım seçeneğinin yatırım getirisini anlamak açısından kritiktir.
Not: Fiyatlandırma, Mart 2026 itibarıyla Runpod bulut platformunun isteğe bağlı saatlik ücretlerine dayanmaktadır. Fiyatlar değişebilir ve kullanılabilirlik ile örnek türüne göre farklılık gösterebilir.
Eşzamanlılık benchmark metodolojimiz hakkında daha fazla bilgi edinebilirsiniz.
Eşzamanlılık nedir?
Eşzamanlılık, bir GPU'nun aynı anda birden fazla isteği işleme yeteneğini ifade eder; bu, büyük dil modeli çıkarımı gibi yapay zeka iş yükleri için önemli bir faktördür. Performans değerlendirmemizde eşzamanlılık düzeyleri, test çalışmaları sırasında GPU'ya gönderilen eşzamanlı istek sayısını (1'den 512'ye kadar) temsil eder. Daha yüksek eşzamanlılık, GPU'nun paralel görevleri performansı düşürmeden yönetme kapasitesini test eder ve verim ile gecikmeyi dengeler.
Eşzamanlılığı anlamak, değişken talep veya toplu işleme ihtiyaçları olan iş yükleri için doğru GPU'yu belirlemeye yardımcı olur. Grafik testleri veya GPU benchmark paketleri çalıştırırken eşzamanlılık performansı GPU'lar arasında önemli ölçüde farklılık gösterebilir; bu da tüketicilerin ve alıcıların farklı sistem yapılandırmaları ve fiyat noktaları arasında test sonuçlarını karşılaştırmasını gerekli kılar.
vLLM nedir?
vLLM, büyük dil modeli (LLM) çıkarımı ve sunumu için hızlı ve kullanımı kolay, katkıda bulunanlardan oluşan bir topluluk tarafından desteklenen açık kaynaklı bir kütüphanedir. Belleği yöneterek, eşzamanlı istekleri işleyerek ve gpt-oss-20b gibi modelleri verimli bir şekilde sunarak hem bulut hem de kendi barındırılan LLM dağıtımlarını yönetir. Kendi barındırılan LLM'ler için vLLM, bellek yönetimi için PagedAttention1, sürekli toplu işleme ve hem NVIDIA hem de AMD GPU'larını destekleyerek yerel donanımda birden fazla eşzamanlı isteği mümkün kılan özelliklerle dağıtımı basitleştirir.
Eşzamanlılık benchmark metodolojisi
En yeni yüksek performanslı GPU mimarilerini, yapay zeka çıkarım iş yükleri için eşzamanlılık ölçekleme yeteneklerini değerlendirmek üzere hem NVIDIA hem de AMD'den test ettik. Benchmark'ımız, NVIDIA H100, H200 ve B200 GPU'larını, AMD'nin MI300X'iyle birlikte, değişen eşzamanlı yük koşulları altında vLLM aracılığıyla OpenAI gpt-oss-20b modelini çalıştırarak test etti. Verim metrikleri, gecikme dağılımları ve kaynak kullanım örüntülerinin ölçümü yoluyla bu analiz, yapay zeka çıkarım dağıtımları için içgörüler sağlamayı amaçlamaktadır.
Test altyapısı
Testlerimizi, Runpod'un bulut altyapısında, NVIDIA'nın en gelişmiş GPU mimarilerini ve vLLM framework'ünü kullanarak dağıttık.
- GPU platformu: Runpod bulut altyapısı (H100, H200, B200 ve MI300X)
- Model: OpenAI GPT-OSS-20B vLLM framework ile
Yazılım ortamı
NVIDIA GPU'ları (H100, H200, B200):
- RunPod şablonu:
runpod/pytorch:1.0.2-cu1281-torch280-ubuntu2404 - vLLM kurulumu:
vllm[flashinfer]==0.11.0
AMD GPU (MI300X):
- Docker imajı:
rocm/vllm-dev:open-mi300-08052025
vLLM sunucu yapılandırması
Her donanım mimarisi için performansı optimize etmek amacıyla farklı vLLM ayarları kullanıldı.
- NVIDIA H100, H200 ve B200 GPU'ları için, sunucu aşağıdaki komutla başlatıldı:
- AMD MI300X GPU için, mimariye özel ayarlarla ROCm için optimize edilmiş bir vLLM sürümü kullanıldı:
Not: Bu benchmark, vLLM v0.11.0 kullanılarak gerçekleştirildi. 2025 başında yayınlanan vLLM v1.0, farklı verim sonuçları üretebilecek mimari değişiklikler getirir.
Benchmark yapılandırması
Her GPU, tutarlı sonuçlar sağlamak için standartlaştırılmış parametrelerle 9 farklı eşzamanlılık düzeyinde test edildi.
- Eşzamanlılık düzeyleri: 1, 4, 8, 16, 32, 64, 128, 256, 512 eşzamanlı istek
- Test süresi: 180 saniye ölçüm aşaması, 30s ısınma/soğuma ile
- İstek boyutu: istek başına 1.000 girdi/çıktı token'ı
Sonuç doğrulama notu: Nihai metrikleri kaydetmeden önce, her GPU için en uygun yapılandırmayı belirlemek amacıyla çok sayıda test çalıştırdık. Belirlendikten sonra benchmark, kararlılığı doğrulamak için arka arkaya üç kez çalıştırıldı. Verim sonuçları bu çalıştırmalar arasında tutarlıydı ve varyans %0,1'den azdı. Bu analizde raporlanan rakamlar, bu üç ardışık çalıştırmanın sonuncusuna dayanmaktadır.
Temel metrikler
Yük altında GPU yeteneklerine kapsamlı bir bakış sağlamak için performansı birden fazla boyutta izledik.
- Verim: Saniyede sistem çıktı token'ı, saniyede başarılı istek sayısı ve istek başına token üretim hızı
- Gecikme: İlk Token Süresi (TTFT), P50/P95/P99 yüzdelik dilimleriyle uçtan uca gecikme, istek başına ortalama gecikme
- Güvenilirlik: Başarı oranı yüzdesi, zaman aşımı ve diğer hata sınıflandırması karşılaştırması
Yazılım yığınına ilişkin değerlendirmeler
Performans yalnızca donanımın bir işlevi değildir. vLLM gibi framework'ler, AMD'nin ROCm'una kıyasla NVIDIA'nın CUDA ekosistemi için daha olgun ve yüksek düzeyde optimize edilmiş desteğe sahiptir. MI300X sonuçlarında gözlemlenen performans farklılıkları, donanımın teorik potansiyelinden ziyade mevcut yazılım optimizasyon durumunu kısmen yansıtabilir.
Yeni nesil donanım yol haritası
Bu benchmark'ta test edilen GPU'lar; B200, H200, H100 ve MI300X, mevcut nesil yapay zeka çıkarım donanımını temsil eder. Hem NVIDIA hem de AMD, haleflerini duyurdu; bu, 2026 ve sonrası için altyapı yatırımları planlayan ekipler için önemli bir bağlamdır.
NVIDIA tarafında Jensen Huang, CES 2026'da Vera Rubin NVL72 platformunun tam üretime geçtiğini ve ilk sistemlerin 2026'nın ikinci yarısında sevk edilmesinin beklendiğini duyurdu.2 NVIDIA'ya göre Rubin GPU'su, yaklaşık 50 PFLOP FP4 çıkarım performansı sunar; bu, burada benchmark edilen B200 gibi Blackwell tabanlı sistemlerin yaklaşık beş katıdır.2
AMD tarafında, CDNA 5 mimarisine dayanan Instinct MI400'ün 2026 için planlandığı ve 432 GB HBM4 bellek sunarken MI350 hesaplama performansını yaklaşık iki katına çıkarmasının beklendiği ifade ediliyor.3 AMD ayrıca Meta'nın 6 gigawatt'a kadar kapasitede özel MI450 tabanlı Instinct sunucularını devreye alacağını ve sevkiyatların 2026'nın ikinci yarısında başlayacağını duyurdu.4 Oracle ayrıca 2026'nın 3. çeyreğinden itibaren yaklaşık 50.000 MI450 serisi GPU'larla desteklenen herkese açık bir yapay zeka süper kümesi sunacak.5
Yakın vadeli dağıtımlar için bu benchmark'taki GPU'ları değerlendiren ekipler için B200 ve MI300X, şu anda mevcut en yüksek performanslı seçenekler olmaya devam ediyor. Daha uzun planlama ufukları için 2026 yol haritası, her iki satıcıdan da hem verim hem de maliyet verimliliğinde önemli bir sıçrama öngörüyor.
Sonuç
B200, verimde öne çıkar ve toplu çıkarım için iyi ölçeklenir. MI300X, düşük eşzamanlılıkta en hızlı yanıt sürelerini sunar; bu da onu chatbot'lar gibi gerçek zamanlı uygulamalar için daha uygun hale getirir. H100 ve H200 ise arada yer alır ve her iki boyutta da öne çıkmadan genel amaçlı iş yüklerini karşılar.
Temel ödünleşim tüm donanımlarda geçerlidir: daha yüksek eşzamanlılık sistem verimini artırır, ancak istek başına gecikmeyi yükseltir. İş yükünüzün hacme mi yoksa yanıt süresine mi öncelik verdiğine göre seçim yapın.
Daha fazla bilgi
Aşağıdakiler gibi diğer yapay zeka donanım araştırmalarını inceleyin:
- En İyi 20 Yapay Zeka Çip Üreticisi: NVIDIA ve Rakipleri
- Derin Öğrenme için Bulut GPU'ları: Kullanılabilirlik ve Fiyat / Performans
- En İyi 10 Sunucusuz GPU Bulutu ve 14 Uygun Maliyetli GPU'lar
- Çoklu-GPU Benchmark
Bu benchmarkı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{dogan2026,
author = {Dogan, Sedat and Sarı, Ekrem},
title = {{GPU Eşzamanlılık Benchmark'ı: H100 vs H200 vs B200 vs MI300X}},
year = {2026},
month = mar,
howpublished = {\url{https://aimultiple.com/gpu-benchmark}},
note = {AIMultiple. Erişim tarihi: 12 Mart 2026}
}Değişiklik günlüğü
4 güncelleme- 2026
Zaman uyumsuzluk testindeki 'Zorluklar ve sınırlamalar' bölümü kaldırıldı.
- 2025
Sonuç bölümü değiştirildi.
Kıyaslanan GPU'lar listesine AMD MI300X eklendi.
Eşzamanlılık karşılaştırma metodolojisi bölümü, AMD'nin MI300X GPU'sunu içerecek şekilde genişletildi.
Referans Linkleri
- Programlama dilleri ve sunucu mimarileri konusunda kapsamlı uzmanlığa sahip, 20 yıllık deneyime sahip bir beyaz şapkalı hacker ve geliştirme gurusudur.
- Erken aşama teknoloji şirketlerine yatırım yapan bir VC'de ve 125.000 işletmeye hizmet veren bölgesel bir dijital ödeme platformu olan Ödeal'da yönetim kurulu danışmanıdır.
- Yedi ulusal seçimin teknoloji altyapısını ve siber güvenliğini yönetmiş ve Twitter dahil küresel teknoloji liderleri tarafından siber güvenlik Onur Listesi'nde tanınmıştır.
Yorum yapan ilk kişi olun
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.