Premium
Hizmetler
Premium

Çoklu GPU Benchmark: B200 vs H200 vs H100 vs MI300X

Sedat Dogan
Sedat Dogan
Güncellenme tarihi: 21 Eyl 2026

Yirmi yılı aşkın süredir, hesaplama performansını optimize etmek çalışmalarımın temel taşlarından biri olmuştur. NVIDIA'nın B200, H200, H100 ve AMD'nin MI300X'ini, Large Language Model (LLM) inference için ne kadar iyi ölçeklendiklerini değerlendirmek amacıyla kıyasladık. vLLM framework'ü ve meta-llama/Llama-3.1-8B-Instruct modelini kullanarak 1, 2, 4 ve 8 GPU'da testler yürüttük.

Her GPU mimarisinin paralelleştirilmiş, hesaplama yoğun iş yüklerini nasıl ele aldığını göstermek için verim ve ölçeklenme verimliliğini analiz ettik.

Çoklu GPU benchmark sonuçları

Toplam verim vs. GPU sayısı

Grafik Yükleniyor
  • Toplam verim (token/saniye): Bu metrik, tüm çoklu GPU sisteminin ham işlem gücünü temsil eder. Doymuş, çevrimdışı bir iş yükü altında maksimum performansın en önemli göstergesi olan saniyede işlenen toplam giriş ve çıkış token sayısını ölçer.

Puanı nasıl hesapladığımızı anlamak için çoklu GPU benchmark metodolojimize bakın.

Temel performans içgörüleri:

Performans analizi: NVIDIA H200, test edilen tüm yapılandırmalar arasında en yüksek verimi sağlar ve H100'e göre 9-%10 performans iyileştirmesi sunar. Sistem, çift GPU yapılandırmalarında %99,8 ölçeklenme verimliliği elde eder ve bu da neredeyse optimum kaynak kullanımına işaret eder.

AMD MI300X performans özellikleri: AMD MI300X, tek GPU başına saniyede 18.752 token verimine ulaşır; bu, H200'ün performansının yaklaşık %74'üne karşılık gelir. Sistem, iki GPU ve dört GPU yapılandırmaları için sırasıyla %95 ve %81 ölçeklenme verimliliğini korur.

Ortalama inference gecikmesi vs. GPU sayısı

  • Ortalama inference gecikmesi (milisaniye): Bu metrik, tek bir isteğin baştan sona işlenmesi için geçen ortalama süreyi ölçer. Daha düşük gecikme, son kullanıcılar için daha hızlı ve daha duyarlı bir deneyim anlamına gelir.

Temel performans içgörüleri:

Gecikme performans analizi: NVIDIA B200, değerlendirilen tüm yapılandırmalar arasında en düşük gecikme ölçümlerini sergiler ve sekiz GPU'lu uygulamada 2.40ms değerine ulaşır. Bu performans özellikleri, onu minimum yanıt süresi gerektiren uygulamalar için konumlandırır; örneğin, 3ms altı gecikmenin tasarım gereksinimi olduğu gerçek zamanlı etkileşimli sistemler.

Ölçeklenme verimliliği gözlemleri: Analiz, tüm platformlarda GPU sayısı arttıkça gecikme azalmasında azalan getiriler olduğunu ortaya koymaktadır. En büyük gecikme düşüşü, tekli yapılandırmadan çift GPU yapılandırmasına geçişte gerçekleşir (platformlar genelinde yaklaşık %50). 4'ten fazla GPU'ya sahip yapılandırmalar giderek daha küçük gecikme iyileştirmeleri gösterir.

H200 ve H100 karşılaştırmalı analizi: H200, tüm ölçeklerde H100'e göre 5-%8 daha düşük gecikme gösterir; mutlak fark, daha yüksek GPU sayılarında azalır (sekiz GPU'da 2.81ms'ye karşı 2.86ms, 0.05ms fark). Bu marjinal performans farkı, %41'lik fiyat farkıyla karşılaştırıldığında, H100'ün gecikmeye duyarlı dağıtımlar için daha uygun maliyet-performans özellikleri sunabileceğini düşündürmektedir.

AMD MI300X gecikme özellikleri: MI300X, test edilen yapılandırmalarda H200'e göre 37-%75 daha yüksek gecikme değerleri gösterir; bu durum, vLLM ROCm ve CUDA uygulamaları arasındaki mevcut yazılım yığını olgunluk farklılıklarına bağlanabilir. Sekiz GPU ölçeğinde MI300X, 4.20ms gecikme elde eder; bu değer, NVIDIA platformlarına göre performans farkına rağmen çok sayıda üretim uygulaması için kabul edilebilir parametreler içinde kalır.

Performans vs. fiyat: Maliyet verimliliği analizi

Ham performans metrikleri önemli olsa da, her kuruluş için nihai karar maliyet verimliliğine bağlıdır. Her platform için yatırım getirisini (ROI) analiz etmek amacıyla, elde ettiğimiz verim sonuçlarını test sırasında RunPod'un talep üzerine saatlik fiyatlandırmasıyla eşleştirdik. Bu, hangi kurulumun en düşük maliyetle en fazla hesaplama gücü sunduğunu gösteren bir “dolar başına performans” puanı hesaplamamıza olanak tanır.

Not: Tüm fiyatlandırma bilgileri, benchmark sırasında (Eylül 2025) RunPod Cloud platformunda mevcut olan talep üzerine ücretleri yansıtmaktadır ve değişiklik gösterebilir. Maliyetler karşılaştırmalı analiz için sunulmuştur ve depolama veya ağ ücretlerini içermez.

Dolar başına verimi nasıl hesapladık

Bu grafiği oluşturmak için ham performans verilerimizi saatlik maliyetlerle işledik. Hesaplama formülü şudur:

  • Veri Hazırlığı: Sonuç tablomuzdaki her veri noktası için, ilgili GPU yapılandırmasına karşılık gelen saatlik maliyeti aldık (ör. 4x H100, $10,76).
  • Hesaplama: Ardından, throughput_per_dollar değerini hesaplamak için formülü uyguladık. Örneğin, 1x GPU yapılandırmasındaki H100, $2,69/saat maliyetle 23.243 token/saniye değerini sağladı; bu da dolar başına 8.642 token/saniye puanıyla sonuçlandı.

Bu verimlilik puanı, konuşmayı “hangisi en hızlı?” sorusundan “iş yükümüz için en akıllı yatırım hangisi?” sorusuna taşıyan bir karar verme aracı sağlar.

Çoklu GPU ölçeklenmesi nedir?

Çoklu GPU ölçekleme, tek bir büyük görevi birden çok GPU'ya dağıtarak performansını artırma yeteneğini ifade eder. LLM inference için bu, bağımsız model kopyalarının her bir GPU'da çalıştığı ve bir yük dengeleyicinin gelen istekleri tüm örnekler arasında dağıttığı veri paralelliği ile sağlanabilir.

İdeal olarak, iki GPU kullanmak tek bir GPU'nun performansının iki katını sunmalıdır (2x hızlanma). Ancak gerçekte performans kazanımları; CPU ve sistem darboğazları, ana sistemin birden çok eşzamanlı işlemi yönetmek için harcadığı süre, bellek bant genişliği kısıtlamaları ve kaynak çekişmesi ile sınırlıdır. Benchmark'ımız, her platformun bu sistem düzeyindeki kısıtlamaları ne kadar verimli yönettiğini ölçer; bu, küçük-orta boyutlu model'ler için uygun maliyetli, yüksek performanslı yapay zeka inference sunucuları oluşturmak açısından kritik bir faktördür.

Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

Çoklu GPU ölçekleme testlerindeki zorluklar nelerdir?

Çoklu GPU sistemlerini test etmek, performansı önemli ölçüde etkileyebilecek benzersiz zorluklar doğurur.

İletişim yükü ve ara bağlantı darboğazları

Bir model GPU'lar arasında bölündüğünde, NVIDIA'nın NVLink'i veya AMD'nin Infinity Fabric'i gibi ara bağlantı, kritik bir performans darboğazı haline gelir. GPU'lar arası iletişimin verimliliği ölçeklemeyi doğrudan etkiler. Başka bir GPU'dan veri beklemek için harcanan süre, hesaplamanın paralelleştirilmesiyle tasarruf edilen süreyi aşarsa performans kazanımları azalır. Bu etki, her bir GPU'nun hesaplama kapasitesini tam olarak doyuracak kadar büyük olmayan model'lerde özellikle belirgindir.

Yazılım ekosistemi olgunluğu

Performans yalnızca donanımın bir fonksiyonu değildir. Sürücüler, (NVIDIA için NCCL ve AMD için RCCL gibi) iletişim kütüphaneleri ve inference motoru (vLLM) dahil olmak üzere yazılım yığını büyük bir rol oynar. Bir platformun performansının, yazılım desteğinin olgunluğuna derinden bağlı olduğunu keşfettik. NVIDIA'nın CUDA'sı gibi yerleşik bir ekosistem, genellikle yıllarca süren fine-tuning ve optimizasyondan faydalanır; bu da güçlü donanımlarda bile AMD'nin ROCm'u gibi daha yeni entegrasyonlara kıyasla üstün ölçekleme verimliliğine yol açabilir.

Platforma özgü optimizasyonlar

Testlerimizin ortaya koyduğu gibi, optimum performansa ulaşmak genellikle platforma özgü yapılandırmalar gerektirir. Genel, “herkese uyan tek tip” bir yaklaşım kullanmak, yanıltıcı derecede düşük performansa yol açabilir. Doğru Docker imajı, ortam değişkenleri (ör. özel AMD kernel'lerini etkinleştirmek) ve hatta model veri türleri (ör. Blackwell için bfloat16), donanımın gerçek potansiyelini ortaya çıkarmak için gereklidir. Bu, adil “elmadan elmaya” karşılaştırmaları önemli bir teknik zorluk haline getirir.

Çoklu GPU benchmark metodolojisi

Hem NVIDIA hem de AMD tarafından sunulan en yeni yüksek performanslı GPU mimarilerini, ölçekleme yeteneklerini değerlendirmek için test ettik. Benchmark'ımız, standart meta-llama/Llama-3.1-8B-Instruct1 modelini ve vLLM2 inference motorunu kullanarak tekli ve çoklu GPU (1x, 2x, 4x, 8x) yapılandırmalarının performansını ölçtü.

Test ortamı ve süreç

  • Platform: Tutarlı donanım erişimi sağlamak için tüm benchmark'lar RunPod Cloud üzerinde çalıştırıldı.
  • Inference motoru: Standart motor olarak vLLM (vllm bench throughput aracı) kullanıldı.
  • Model: meta-llama/Llama-3.1-8B-Instruct.
  • Dataset: Konuşmaya dayalı bir iş yükünü simüle etmek için ShareGPT Vicuna dataset (25.000 prompt).
  • Strateji: Veri paralelliği; her çoklu GPU testi, her bir GPU üzerinde bağımsız bir vLLM örneği çalıştırdı. Toplam prompt yükü, örnekler arasında eşit olarak dağıtıldı ve bu örnekler, yük dengeli bir üretim ortamını simüle etmek için eşzamanlı olarak yürütüldü. Bu yaklaşım, GPU'lar arası iletişimi (NVLink/PCIe) bir darboğaz olmaktan çıkarır ve performans sınırlayıcılarını ana sisteme (CPU, RAM) kaydırır.
  • Otomasyon: Ortam kurulumu, test yürütme, kaynak izleme (nvidia-smi, rocm-smi) ve sonuçların toplanmasını otomatikleştirmek için özel Bash script'leri kullanıldı.

Platforma özgü yapılandırmalar

Optimum performans elde etmek, her mimari için özel olarak uyarlanmış yapılandırmalar gerektirdi.

NVIDIA platformları (H100, H200, B200)

  • Temel imaj: runpod/pytorch:2.8.0-py3.11-cuda12.8.1.
  • vLLM kurulumu:
    • H100/H200 (Hopper): pip install vllm aracılığıyla standart kurulum.
    • B200 (Blackwell): Yeni mimari için yerel desteği etkinleştirmek ve “no kernel image” hatalarını çözmek amacıyla vLLM kaynak koddan derlendi (pip install -e .).
  • Temel parametreler:
  • Kritik Ortam Değişkeni:

AMD platformu (MI300X)

  • Temel imaj: rocm/vllm:rocm6.4.1_vllm_0.10.1_20250909
  • vLLM kurulumu: Optimize edilmiş sürüm imajda yer aldığı için kurulum gerekmedi.
  • Temel parametreler & optimizasyonlar: Kapsamlı ayar çalışmaları, maksimum verim elde etmek için aşağıdaki varsayılan olmayan ayarların kritik olduğunu belirledi:
  • AMD'ye özgü ortam değişkenleri:
  • Aygıt görünürlüğü: Örnekleri belirli GPU'lara atamak için CUDA'nın eşdeğeri yerine ROCR_VISIBLE_DEVICES kullanıldı.

Benchmark yürütme aşamaları

Doğru ve tekrarlanabilir sonuçlar sağlamak için her benchmark çalıştırması üç aşamalı bir yürütme protokolünü izledi:

Aşama 1: Isınma

Her çoklu GPU yapılandırma testinden önce, soğuk başlatma etkilerini ortadan kaldırmak için özel bir ısınma aşaması gerçekleştirdik:

  • Süre: GPU 0 üzerinde işlenen 100 prompt
  • Amaç: Model yükleme, KV önbellek başlatma ve CUDA/ROCm kernel derlemesi
  • Çıktı: Atıldı (ölçümlere dahil edilmedi)
  • Platforma özgü davranış:
    • NVIDIA (CUDA): Kernel derlemesi ve CUDA grafik optimizasyonu (~30-60 saniye)
    • AMD (ROCm): Kernel derlemesi ve isteğe bağlı TunableOp ayarı (PYTORCH_TUNABLEOP_ENABLED ayarına göre değişir)

Aşama 2: GPU izleme başlatma

Benchmark yürütmeyle eşzamanlı olarak, her bir GPU için özel izleme süreçleri başlattık:

  • Örnekleme hızı: 1 saniye aralıklarla
  • Toplanan metrikler: GPU kullanımı, bellek kullanımı, sıcaklık, güç tüketimi
  • Araçlar: nvidia-smi (NVIDIA) veya rocm-smi (AMD)
  • Çıktı: Analiz sonrası için CSV günlükleri

Aşama 3: Paralel benchmark yürütme

Isınma tamamlandıktan sonra tüm GPU örnekleri eşzamanlı olarak başlatıldı:

  • Her GPU, 25.000 toplam prompt yükünün eşit bir payını işledi
  • Tüm örnekler, üretim yük dengelemeyi simüle etmek için aynı saniye içinde başlatıldı
  • Toplam verim, tüm GPU çıktılarının toplamı olarak ölçülür
  • Yürütme süresi, ilk örneğin başlatılmasından son örneğin tamamlanmasına kadar ölçülür
Kıyaslamalarımızı ve veri odaklı içgörülerimizi kaçırmayın. Düğme Google'ı açar; AIMultiple'ı seçmeniz, Google arama sonuçlarında AIMultiple'ı daha sık görmek istediğinizi onaylar.
GoogleTercih edilen kaynak olarak ekle

Testlerin gerçek dünyadaki performans etkisi

Testlerimiz, küçük yapılandırma hatalarının önemli ve yanıltıcı performans sonuçlarına yol açabileceğini ortaya koydu. Aşağıdaki tablo, platforma özgü yanlış yapılandırmaların etkisini göstermektedir:

Sonuç

8B-13B sınıfındaki model'lerin sunulması için veri paralelliği oldukça verimli bir stratejidir. Donanım seçimi, belirli dağıtım önceliklerine bağlıdır.

Maliyet verimliliğinin birincil öncelik olduğu iş yükleri için NVIDIA H100, performans metriklerini, edinme maliyetlerini ve öngörülebilir ölçekleme davranışını dengeleyen olumlu özellikler sunar.

Bütçe kısıtlamaları olmaksızın verimin en üst düzeye çıkarılması temel amaç olduğunda, NVIDIA H200, değerlendirilen platformlar arasında en yüksek performans ölçümlerini sergiler.

AMD MI300X, uzun vadeli dağıtım stratejileri ve AMD tabanlı altyapı ortamları için dikkate değer özellikler sunar. Yazılım optimizasyon yinelemeleri yoluyla performans iyileştirmeleri beklenmektedir ve platformun önemli VRAM kapasitesi, daha büyük model mimarilerinin barındırılmasına olanak tanır.

NVIDIA B200, bu belirli iş yükü yapılandırmasında sınırlamalar gösterir; CPU kaynaklı performans kısıtları ve optimumun altında maliyet verimliliği sergiler. Bu mimari, tensör paralelliği stratejileriyle büyük ölçekli model'ler kullanan uygulamalar için daha uygun görünmektedir.

Daha fazla okuma

Diğer yapay zeka donanım araştırmalarını keşfedin, örneğin:

Bu benchmarkı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Sedat Dogan and Ekrem Sarı (2026) - "Çoklu GPU Benchmark: B200 vs H200 vs H100 vs MI300X". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 21 Eylül 2026, kaynak: https://aimultiple.com/multi-gpu [Çevrimiçi Kaynak]

Dogan, S., & Sarı, E. (2026, 21 Eylül). Çoklu GPU Benchmark: B200 vs H200 vs H100 vs MI300X. AIMultiple. https://aimultiple.com/multi-gpu

@misc{dogan2026,
  author = {Dogan, Sedat and Sarı, Ekrem},
  title  = {{Çoklu GPU Benchmark: B200 vs H200 vs H100 vs MI300X}},
  year   = {2026},
  month  = sep,
  howpublished    = {\url{https://aimultiple.com/multi-gpu}},
  note   = {AIMultiple. Erişim tarihi: 21 Eylül 2026}
}
Tüm verileri indir

7 veri noktasının sonuçları ve zaman damgaları. Bu makaledeki grafik ve tablolarda gösterilen özet verileri, bir CSV dosyası içeren ZIP dosyası olarak indirin.

Son güncelleme: 25 Eylül 2026
İndir

Arkasındaki ayrıntılı veriyi ister misiniz? Premium'a katılın

Değişiklik günlüğü

2 güncelleme
  1. Çoklu GPU karşılaştırma sonuçları bölümündeki Veri Kümesi güncellendi.

  2. Total throughput vs. GPU count' bölümünden 'Saniyedeki istekler' metriği kaldırıldı.

Sedat Dogan
Sedat Dogan
CTO
Sedat, yazılım geliştirme, ağ altyapısı ve siber güvenlik alanlarında 20 yıllık deneyime sahip bir teknoloji ve bilgi güvenliği lideridir. Sedat:
- Programlama dilleri ve sunucu mimarileri konusunda kapsamlı uzmanlığa sahip, 20 yıllık deneyime sahip bir beyaz şapkalı hacker ve geliştirme gurusudur.
- Erken aşama teknoloji şirketlerine yatırım yapan bir VC'de ve 125.000 işletmeye hizmet veren bölgesel bir dijital ödeme platformu olan Ödeal'da yönetim kurulu danışmanıdır.
- Yedi ulusal seçimin teknoloji altyapısını ve siber güvenliğini yönetmiş ve Twitter dahil küresel teknoloji liderleri tarafından siber güvenlik Onur Listesi'nde tanınmıştır.
Tam Profili Görüntüle
Araştıran
Ekrem Sarı
Ekrem Sarı
Yapay Zeka Araştırmacısı
Ekrem, AIMultiple'da Yapay Zeka Araştırmacısı ve Veri Bilimcidir. Yapay zeka ve LLM sistemleri için uygulamalı benchmark'lar tasarlar ve yürütür.
Tam Profili Görüntüle

Yorum yapan ilk kişi olun

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450