Son 20 yılımı sistem düzeyinde hesaplama performansı optimizasyonuna odaklanarak geçirdim. En yeni NVIDIA GPU'larını, NVIDIA'nın H100, H200 ve B200'ü ile AMD'nin MI300X'i dahil olmak üzere eşzamanlılık ölçeklendirme analizi için kıyasladık. gpt-oss-20b modelini kullanan vLLM çerçevesi ile bu GPU'ların 1'den 512'ye kadar eşzamanlı istekleri nasıl işlediğini test ettik. Sistem çıkış verimini, sorgu başına çıkış hızını ve uçtan uca gecikmeyi ölçerek, yapay zeka iş yükleri için GPU performansını anlamaya yardımcı olacak bulguları paylaşıyoruz.
Eşzamanlılık kıyaslama sonuçları
Sistem çıkış verimi vs eşzamanlılık
Bu grafik, her eşzamanlılık düzeyinde sistem tarafından saniyede üretilen toplam çıkış token sayısını gösterir.
Sorgu başına çıkış hızı vs eşzamanlılık
Bu metrik, sistem yoğunlaştıkça bireysel bir sorgunun ne kadar hızlı işlendiğini (saniyedeki token sayısı cinsinden) gösterir. 1.000 token'lık bir çıktı için uçtan uca gecikme temel alınarak hesaplanır.
Uçtan uca gecikme vs eşzamanlılık
Bu grafik, farklı eşzamanlılık düzeylerinde bir isteğin baştan sona tamamlanması için geçen ortalama süreyi (milisaniye cinsinden) gösterir.
Dolar başına saniyede token sayısı vs eşzamanlılık
Bu grafik, saatlik kiralama için harcanan her dolar başına saniyede kaç token üretildiğini ölçerek her GPU'nun maliyet verimliliğini değerlendirir. Bu metrik, özellikle bütçe bilincine sahip dağıtımlar için her donanım seçeneğinin yatırım getirisini anlamak açısından kritiktir.
Not: Fiyatlandırma, Mart 2026 itibarıyla Runpod bulut platformundaki isteğe bağlı saatlik ücretlere dayanmaktadır. Fiyatlar değişebilir ve kullanılabilirlik ile örnek türüne göre farklılık gösterebilir.
Eşzamanlılık kıyaslama metodolojimiz hakkında daha fazla bilgi edinebilirsiniz.
Eşzamanlılık nedir?
Eşzamanlılık, bir GPU'nun aynı anda birden çok isteği işleyebilme yeteneğini ifade eder; bu, büyük dil modeli çıkarımı gibi yapay zeka iş yükleri için önemli bir faktördür. Performans değerlendirmemizde, eşzamanlılık düzeyleri, test çalışmaları sırasında GPU'ya gönderilen eşzamanlı istek sayısını (1'den 512'ye kadar) temsil eder. Daha yüksek eşzamanlılık, GPU'nun performansı düşürmeden paralel görevleri yönetme kapasitesini test eder ve verim ile gecikme arasında denge kurar.
Eşzamanlılığı anlamak, kullanıcıların değişken talep veya toplu işleme ihtiyaçları olan iş yükleri için doğru GPU'yu belirlemelerine yardımcı olur. Grafik testleri veya GPU kıyaslama paketleri çalıştırırken, eşzamanlılık performansı GPU'lar arasında önemli ölçüde farklılık gösterebilir; bu da tüketicilerin ve alıcıların farklı sistem yapılandırmaları ve fiyat noktaları arasında test sonuçlarını karşılaştırmasını zorunlu kılar.
vLLM nedir?
vLLM, büyük dil modeli (LLM) çıkarımı ve sunumu için hızlı ve kullanımı kolay açık kaynaklı bir kütüphanedir ve bir katkıda bulunanlar topluluğu tarafından desteklenir. Bellek yönetimi, eşzamanlı istekleri işleme ve gpt-oss-20b gibi modelleri verimli bir şekilde sunma yoluyla hem bulut hem de kendi kendine barındırılan LLM dağıtımlarını yönetir. Kendi kendine barındırılan LLM'ler için vLLM, bellek yönetimi için PagedAttention1 , sürekli toplu işleme ve hem NVIDIA hem de AMD GPU'ları desteği gibi özelliklerle dağıtımı basitleştirir ve yerel donanımda birden çok eşzamanlı isteğe olanak tanır.
Eşzamanlılık kıyaslama metodolojisi
Hem NVIDIA hem de AMD'nin en yeni yüksek performanslı GPU mimarilerini, yapay zeka çıkarım iş yükleri için eşzamanlılık ölçeklendirme yeteneklerini değerlendirmek üzere test ettik. Kıyaslamamız, NVIDIA H100, H200 ve B200 GPU'larını AMD'nin MI300X'i ile birlikte test ederek, değişen eşzamanlı yük koşulları altında OpenAI gpt-oss-20b modelini vLLM aracılığıyla çalıştırdı. Verim metrikleri, gecikme dağılımları ve kaynak kullanım modellerinin ölçümü yoluyla bu analiz, yapay zeka çıkarım dağıtımları için içgörüler sağlamayı amaçlamaktadır.
Test altyapısı
Testlerimizi Runpod'un bulut altyapısında, NVIDIA'nın en gelişmiş GPU mimarilerini ve vLLM çerçevesini kullanarak gerçekleştirdik.
- GPU platformu: Runpod bulut altyapısı (H100, H200, B200 ve MI300X)
- Model: OpenAI GPT-OSS-20B, vLLM çerçevesi aracılığıyla
Yazılım ortamı
NVIDIA GPU'ları (H100, H200, B200):
- RunPod şablonu:
runpod/pytorch:1.0.2-cu1281-torch280-ubuntu2404 - vLLM kurulumu:
vllm[flashinfer]==0.11.0
AMD GPU (MI300X):
- Docker imajı:
rocm/vllm-dev:open-mi300-08052025
vLLM sunucu yapılandırması
Her donanım mimarisi için performansı optimize etmek üzere farklı vLLM ayarları kullanıldı.
- NVIDIA H100, H200 ve B200 GPU'ları için, sunucu aşağıdaki komutla başlatıldı:
- AMD MI300X GPU için, mimariye özel ayarlarla ROCm için optimize edilmiş bir vLLM derlemesi kullanıldı:
Not: Bu kıyaslama, vLLM v0.11.0 kullanılarak gerçekleştirilmiştir. 2025 başında piyasaya sürülen vLLM v1.0, farklı verim sonuçları üretebilecek mimari değişiklikler sunmaktadır.
Kıyaslama yapılandırması
Tutarlı sonuçlar sağlamak için her GPU, standartlaştırılmış parametrelerle 9 farklı eşzamanlılık düzeyinde test edildi.
- Eşzamanlılık düzeyleri: 1, 4, 8, 16, 32, 64, 128, 256, 512 eşzamanlı istek
- Test süresi: 180 saniye ölçüm aşaması, 30s ısınma/soğuma
- İstek boyutu: İstek başına 1.000 giriş/çıkış token'ı
Sonuç doğrulama notu: Nihai metrikleri kaydetmeden önce, her GPU için en uygun yapılandırmayı belirlemek üzere çok sayıda test yaptık. Belirlendikten sonra, kararlılığı doğrulamak için kıyaslama art arda üç kez çalıştırıldı. Bu çalıştırmalar boyunca verim sonuçları tutarlıydı ve varyans %0,1'den azdı. Bu analizde bildirilen rakamlar, bu üç ardışık yürütmenin sonuncusuna dayanmaktadır.
Temel metrikler
Yük altında GPU yeteneklerine kapsamlı bir bakış sağlamak için performansı birden çok boyutta izledik.
- Verim: Saniye başına sistem çıkış token'ları, saniye başına başarılı istekler ve bireysel istek token üretim hızı
- Gecikme: İlk Token Süresi (TTFT), P50/P95/P99 yüzdelik dilimleriyle uçtan uca gecikme, istek başına ortalama gecikme
- Güvenilirlik: Başarı oranı yüzdesi, zaman aşımı vs. diğer hata sınıflandırması
Yazılım yığını değerlendirmeleri
Performans yalnızca donanımın bir işlevi değildir. vLLM gibi çerçeveler, AMD'nin ROCm'una kıyasla NVIDIA'nın CUDA ekosistemi için daha olgun ve yüksek düzeyde optimize edilmiş destek sunar. MI300X sonuçlarında gözlemlenen performans farklılıkları, kısmen donanımın teorik potansiyelinden ziyade yazılım optimizasyonunun mevcut durumunu yansıtıyor olabilir.
Yeni nesil donanım yol haritası
Bu kıyaslamada test edilen GPU'lar; B200, H200, H100 ve MI300X, mevcut nesil yapay zeka çıkarım donanımını temsil etmektedir. Hem NVIDIA hem de AMD, 2026 ve sonrası için altyapı yatırımları planlayan ekipler için ilgili bağlam olan haleflerini duyurdu.
NVIDIA cephesinde, Jensen Huang CES 2026'da Vera Rubin NVL72 platformunun tam üretime girdiğini ve ilk sistemlerin 2026'nın ikinci yarısında sevk edilmesinin beklendiğini duyurdu.2 NVIDIA'ya göre, Rubin GPU'su yaklaşık 50 PFLOP FP4 çıkarım performansı sunmakta olup, bu da burada kıyaslanan B200 gibi Blackwell tabanlı sistemlerin kabaca beş katıdır.3
AMD cephesinde, CDNA 5 mimarisine dayanan Instinct MI400, 2026 için planlanmıştır ve MI350 hesaplama performansını kabaca iki katına çıkarırken 432 GB HBM4 bellek sunması bekleniyor.4 AMD ayrıca Meta'nın, 2026'nın ikinci yarısından itibaren sevkiyatına başlanacak olan, 6 gigawatt'a kadar kapasitede özel MI450 tabanlı Instinct sunucuları dağıtacağını duyurdu.5 Oracle ayrıca, 2026'nın 3. çeyreğinden itibaren yaklaşık 50.000 MI450 serisi GPU ile desteklenen, herkese açık bir yapay zeka süper kümesi sunacak.6
Bu kıyaslamadaki GPU'ları yakın vadeli dağıtımlar için değerlendiren ekipler için B200 ve MI300X, şu anda mevcut en yüksek performanslı seçenekler olmaya devam etmektedir. Daha uzun planlama ufukları için 2026 yol haritası, her iki satıcıda verim ve maliyet verimliliği açısından önemli bir sıçramaya işaret etmektedir.
Sonuç
B200, verimde liderdir ve toplu çıkarım için iyi ölçeklenir. MI300X, düşük eşzamanlılıkta en hızlı yanıt sürelerini sunar ve bu da onu chatbot'lar gibi gerçek zamanlı uygulamalar için daha uygun hale getirir. H100 ve H200, her iki boyutta da öne çıkmadan genel amaçlı iş yüklerini kapsayarak arada yer alır.
Temel ödünleşim tüm donanımlarda geçerlidir: daha yüksek eşzamanlılık sistem verimini artırır ancak istek başına gecikmeyi yükseltir. İş yükünüzün hacme mi yoksa yanıt süresine mi öncelik verdiğine göre seçim yapın.
İleri okuma
Aşağıdakiler gibi diğer yapay zeka donanım araştırmalarını keşfedin:
- En İyi 20 Yapay Zeka Çipi Üreticisi: NVIDIA ve Rakipleri
- Derin Öğrenme için Bulut GPU'ları: Kullanılabilirlik ve Fiyat / Performans
- En İyi 10 Sunucusuz GPU Bulutu ve 14 Uygun Maliyetli GPU
- Çoklu GPU Kıyaslaması
Bu benchmarkı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{dogan2026,
author = {Dogan, Sedat and Sarı, Ekrem},
title = {{GPU Eşzamanlılık Kıyaslaması: H100 vs H200 vs B200 vs MI300X}},
year = {2026},
month = mar,
howpublished = {\url{https://aimultiple.com/gpu-benchmark}},
note = {AIMultiple. Erişim tarihi: 12 Mart 2026}
}
Yorum yapan ilk kişi olun
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.