Yirmi yılı aşkın süredir, hesaplama performansını optimize etmek çalışmalarımın temel taşlarından biri olmuştur. NVIDIA'nın B200, H200, H100 ve AMD'nin MI300X'ini, Large Language Model (LLM) inference için ne kadar iyi ölçeklendiklerini değerlendirmek amacıyla kıyasladık. vLLM framework'ü ve meta-llama/Llama-3.1-8B-Instruct modelini kullanarak 1, 2, 4 ve 8 GPU'da testler yürüttük.
Her GPU mimarisinin paralelleştirilmiş, hesaplama yoğun iş yüklerini nasıl ele aldığını göstermek için verim ve ölçeklenme verimliliğini analiz ettik.
Çoklu GPU benchmark sonuçları
Toplam verim vs. GPU sayısı
- Toplam verim (token/saniye): Bu metrik, tüm çoklu GPU sisteminin ham işlem gücünü temsil eder. Doymuş, çevrimdışı bir iş yükü altında maksimum performansın en önemli göstergesi olan saniyede işlenen toplam giriş ve çıkış token sayısını ölçer.
Puanı nasıl hesapladığımızı anlamak için çoklu GPU benchmark metodolojimize bakın.
Temel performans içgörüleri:
Performans analizi: NVIDIA H200, test edilen tüm yapılandırmalar arasında en yüksek verimi sağlar ve H100'e göre 9-%10 performans iyileştirmesi sunar. Sistem, çift GPU yapılandırmalarında %99,8 ölçeklenme verimliliği elde eder ve bu da neredeyse optimum kaynak kullanımına işaret eder.
AMD MI300X performans özellikleri: AMD MI300X, tek GPU başına saniyede 18.752 token verimine ulaşır; bu, H200'ün performansının yaklaşık %74'üne karşılık gelir. Sistem, iki GPU ve dört GPU yapılandırmaları için sırasıyla %95 ve %81 ölçeklenme verimliliğini korur.
Ortalama inference gecikmesi vs. GPU sayısı
- Ortalama inference gecikmesi (milisaniye): Bu metrik, tek bir isteğin baştan sona işlenmesi için geçen ortalama süreyi ölçer. Daha düşük gecikme, son kullanıcılar için daha hızlı ve daha duyarlı bir deneyim anlamına gelir.
Temel performans içgörüleri:
Gecikme performans analizi: NVIDIA B200, değerlendirilen tüm yapılandırmalar arasında en düşük gecikme ölçümlerini sergiler ve sekiz GPU'lu uygulamada 2.40ms değerine ulaşır. Bu performans özellikleri, onu minimum yanıt süresi gerektiren uygulamalar için konumlandırır; örneğin, 3ms altı gecikmenin tasarım gereksinimi olduğu gerçek zamanlı etkileşimli sistemler.
Ölçeklenme verimliliği gözlemleri: Analiz, tüm platformlarda GPU sayısı arttıkça gecikme azalmasında azalan getiriler olduğunu ortaya koymaktadır. En büyük gecikme düşüşü, tekli yapılandırmadan çift GPU yapılandırmasına geçişte gerçekleşir (platformlar genelinde yaklaşık %50). 4'ten fazla GPU'ya sahip yapılandırmalar giderek daha küçük gecikme iyileştirmeleri gösterir.
H200 ve H100 karşılaştırmalı analizi: H200, tüm ölçeklerde H100'e göre 5-%8 daha düşük gecikme gösterir; mutlak fark, daha yüksek GPU sayılarında azalır (sekiz GPU'da 2.81ms'ye karşı 2.86ms, 0.05ms fark). Bu marjinal performans farkı, %41'lik fiyat farkıyla karşılaştırıldığında, H100'ün gecikmeye duyarlı dağıtımlar için daha uygun maliyet-performans özellikleri sunabileceğini düşündürmektedir.
AMD MI300X gecikme özellikleri: MI300X, test edilen yapılandırmalarda H200'e göre 37-%75 daha yüksek gecikme değerleri gösterir; bu durum, vLLM ROCm ve CUDA uygulamaları arasındaki mevcut yazılım yığını olgunluk farklılıklarına bağlanabilir. Sekiz GPU ölçeğinde MI300X, 4.20ms gecikme elde eder; bu değer, NVIDIA platformlarına göre performans farkına rağmen çok sayıda üretim uygulaması için kabul edilebilir parametreler içinde kalır.
Performans vs. fiyat: Maliyet verimliliği analizi
Ham performans metrikleri önemli olsa da, her kuruluş için nihai karar maliyet verimliliğine bağlıdır. Her platform için yatırım getirisini (ROI) analiz etmek amacıyla, elde ettiğimiz verim sonuçlarını test sırasında RunPod'un talep üzerine saatlik fiyatlandırmasıyla eşleştirdik. Bu, hangi kurulumun en düşük maliyetle en fazla hesaplama gücü sunduğunu gösteren bir “dolar başına performans” puanı hesaplamamıza olanak tanır.
Not: Tüm fiyatlandırma bilgileri, benchmark sırasında (Eylül 2025) RunPod Cloud platformunda mevcut olan talep üzerine ücretleri yansıtmaktadır ve değişiklik gösterebilir. Maliyetler karşılaştırmalı analiz için sunulmuştur ve depolama veya ağ ücretlerini içermez.
Dolar başına verimi nasıl hesapladık
Bu grafiği oluşturmak için ham performans verilerimizi saatlik maliyetlerle işledik. Hesaplama formülü şudur:
- Veri Hazırlığı: Sonuç tablomuzdaki her veri noktası için, ilgili GPU yapılandırmasına karşılık gelen saatlik maliyeti aldık (ör. 4x H100, $10,76).
- Hesaplama: Ardından, throughput_per_dollar değerini hesaplamak için formülü uyguladık. Örneğin, 1x GPU yapılandırmasındaki H100, $2,69/saat maliyetle 23.243 token/saniye değerini sağladı; bu da dolar başına 8.642 token/saniye puanıyla sonuçlandı.
Bu verimlilik puanı, konuşmayı “hangisi en hızlı?” sorusundan “iş yükümüz için en akıllı yatırım hangisi?” sorusuna taşıyan bir karar verme aracı sağlar.
Çoklu GPU ölçeklenmesi nedir?
Çoklu GPU ölçekleme, tek bir büyük görevi birden çok GPU'ya dağıtarak performansını artırma yeteneğini ifade eder. LLM inference için bu, bağımsız model kopyalarının her bir GPU'da çalıştığı ve bir yük dengeleyicinin gelen istekleri tüm örnekler arasında dağıttığı veri paralelliği ile sağlanabilir.
İdeal olarak, iki GPU kullanmak tek bir GPU'nun performansının iki katını sunmalıdır (2x hızlanma). Ancak gerçekte performans kazanımları; CPU ve sistem darboğazları, ana sistemin birden çok eşzamanlı işlemi yönetmek için harcadığı süre, bellek bant genişliği kısıtlamaları ve kaynak çekişmesi ile sınırlıdır. Benchmark'ımız, her platformun bu sistem düzeyindeki kısıtlamaları ne kadar verimli yönettiğini ölçer; bu, küçük-orta boyutlu model'ler için uygun maliyetli, yüksek performanslı yapay zeka inference sunucuları oluşturmak açısından kritik bir faktördür.
Çoklu GPU ölçekleme testlerindeki zorluklar nelerdir?
Çoklu GPU sistemlerini test etmek, performansı önemli ölçüde etkileyebilecek benzersiz zorluklar doğurur.
İletişim yükü ve ara bağlantı darboğazları
Bir model GPU'lar arasında bölündüğünde, NVIDIA'nın NVLink'i veya AMD'nin Infinity Fabric'i gibi ara bağlantı, kritik bir performans darboğazı haline gelir. GPU'lar arası iletişimin verimliliği ölçeklemeyi doğrudan etkiler. Başka bir GPU'dan veri beklemek için harcanan süre, hesaplamanın paralelleştirilmesiyle tasarruf edilen süreyi aşarsa performans kazanımları azalır. Bu etki, her bir GPU'nun hesaplama kapasitesini tam olarak doyuracak kadar büyük olmayan model'lerde özellikle belirgindir.
Yazılım ekosistemi olgunluğu
Performans yalnızca donanımın bir fonksiyonu değildir. Sürücüler, (NVIDIA için NCCL ve AMD için RCCL gibi) iletişim kütüphaneleri ve inference motoru (vLLM) dahil olmak üzere yazılım yığını büyük bir rol oynar. Bir platformun performansının, yazılım desteğinin olgunluğuna derinden bağlı olduğunu keşfettik. NVIDIA'nın CUDA'sı gibi yerleşik bir ekosistem, genellikle yıllarca süren fine-tuning ve optimizasyondan faydalanır; bu da güçlü donanımlarda bile AMD'nin ROCm'u gibi daha yeni entegrasyonlara kıyasla üstün ölçekleme verimliliğine yol açabilir.
Platforma özgü optimizasyonlar
Testlerimizin ortaya koyduğu gibi, optimum performansa ulaşmak genellikle platforma özgü yapılandırmalar gerektirir. Genel, “herkese uyan tek tip” bir yaklaşım kullanmak, yanıltıcı derecede düşük performansa yol açabilir. Doğru Docker imajı, ortam değişkenleri (ör. özel AMD kernel'lerini etkinleştirmek) ve hatta model veri türleri (ör. Blackwell için bfloat16), donanımın gerçek potansiyelini ortaya çıkarmak için gereklidir. Bu, adil “elmadan elmaya” karşılaştırmaları önemli bir teknik zorluk haline getirir.
Çoklu GPU benchmark metodolojisi
Hem NVIDIA hem de AMD tarafından sunulan en yeni yüksek performanslı GPU mimarilerini, ölçekleme yeteneklerini değerlendirmek için test ettik. Benchmark'ımız, standart meta-llama/Llama-3.1-8B-Instruct1 modelini ve vLLM2 inference motorunu kullanarak tekli ve çoklu GPU (1x, 2x, 4x, 8x) yapılandırmalarının performansını ölçtü.
Test ortamı ve süreç
- Platform: Tutarlı donanım erişimi sağlamak için tüm benchmark'lar RunPod Cloud üzerinde çalıştırıldı.
- Inference motoru: Standart motor olarak vLLM (vllm bench throughput aracı) kullanıldı.
- Model: meta-llama/Llama-3.1-8B-Instruct.
- Dataset: Konuşmaya dayalı bir iş yükünü simüle etmek için ShareGPT Vicuna dataset (25.000 prompt).
- Strateji: Veri paralelliği; her çoklu GPU testi, her bir GPU üzerinde bağımsız bir vLLM örneği çalıştırdı. Toplam prompt yükü, örnekler arasında eşit olarak dağıtıldı ve bu örnekler, yük dengeli bir üretim ortamını simüle etmek için eşzamanlı olarak yürütüldü. Bu yaklaşım, GPU'lar arası iletişimi (NVLink/PCIe) bir darboğaz olmaktan çıkarır ve performans sınırlayıcılarını ana sisteme (CPU, RAM) kaydırır.
- Otomasyon: Ortam kurulumu, test yürütme, kaynak izleme (nvidia-smi, rocm-smi) ve sonuçların toplanmasını otomatikleştirmek için özel Bash script'leri kullanıldı.
Platforma özgü yapılandırmalar
Optimum performans elde etmek, her mimari için özel olarak uyarlanmış yapılandırmalar gerektirdi.
NVIDIA platformları (H100, H200, B200)
- Temel imaj: runpod/pytorch:2.8.0-py3.11-cuda12.8.1.
- vLLM kurulumu:
- H100/H200 (Hopper): pip install vllm aracılığıyla standart kurulum.
- B200 (Blackwell): Yeni mimari için yerel desteği etkinleştirmek ve “no kernel image” hatalarını çözmek amacıyla vLLM kaynak koddan derlendi (pip install -e .).
- Temel parametreler:
- Kritik Ortam Değişkeni:
AMD platformu (MI300X)
- Temel imaj: rocm/vllm:rocm6.4.1_vllm_0.10.1_20250909
- vLLM kurulumu: Optimize edilmiş sürüm imajda yer aldığı için kurulum gerekmedi.
- Temel parametreler & optimizasyonlar: Kapsamlı ayar çalışmaları, maksimum verim elde etmek için aşağıdaki varsayılan olmayan ayarların kritik olduğunu belirledi:
- AMD'ye özgü ortam değişkenleri:
- Aygıt görünürlüğü: Örnekleri belirli GPU'lara atamak için CUDA'nın eşdeğeri yerine ROCR_VISIBLE_DEVICES kullanıldı.
Benchmark yürütme aşamaları
Doğru ve tekrarlanabilir sonuçlar sağlamak için her benchmark çalıştırması üç aşamalı bir yürütme protokolünü izledi:
Aşama 1: Isınma
Her çoklu GPU yapılandırma testinden önce, soğuk başlatma etkilerini ortadan kaldırmak için özel bir ısınma aşaması gerçekleştirdik:
- Süre: GPU 0 üzerinde işlenen 100 prompt
- Amaç: Model yükleme, KV önbellek başlatma ve CUDA/ROCm kernel derlemesi
- Çıktı: Atıldı (ölçümlere dahil edilmedi)
- Platforma özgü davranış:
- NVIDIA (CUDA): Kernel derlemesi ve CUDA grafik optimizasyonu (~30-60 saniye)
- AMD (ROCm): Kernel derlemesi ve isteğe bağlı TunableOp ayarı (
PYTORCH_TUNABLEOP_ENABLEDayarına göre değişir)
Aşama 2: GPU izleme başlatma
Benchmark yürütmeyle eşzamanlı olarak, her bir GPU için özel izleme süreçleri başlattık:
- Örnekleme hızı: 1 saniye aralıklarla
- Toplanan metrikler: GPU kullanımı, bellek kullanımı, sıcaklık, güç tüketimi
- Araçlar:
nvidia-smi(NVIDIA) veyarocm-smi(AMD) - Çıktı: Analiz sonrası için CSV günlükleri
Aşama 3: Paralel benchmark yürütme
Isınma tamamlandıktan sonra tüm GPU örnekleri eşzamanlı olarak başlatıldı:
- Her GPU, 25.000 toplam prompt yükünün eşit bir payını işledi
- Tüm örnekler, üretim yük dengelemeyi simüle etmek için aynı saniye içinde başlatıldı
- Toplam verim, tüm GPU çıktılarının toplamı olarak ölçülür
- Yürütme süresi, ilk örneğin başlatılmasından son örneğin tamamlanmasına kadar ölçülür
Testlerin gerçek dünyadaki performans etkisi
Testlerimiz, küçük yapılandırma hatalarının önemli ve yanıltıcı performans sonuçlarına yol açabileceğini ortaya koydu. Aşağıdaki tablo, platforma özgü yanlış yapılandırmaların etkisini göstermektedir:
Sonuç
8B-13B sınıfındaki model'lerin sunulması için veri paralelliği oldukça verimli bir stratejidir. Donanım seçimi, belirli dağıtım önceliklerine bağlıdır.
Maliyet verimliliğinin birincil öncelik olduğu iş yükleri için NVIDIA H100, performans metriklerini, edinme maliyetlerini ve öngörülebilir ölçekleme davranışını dengeleyen olumlu özellikler sunar.
Bütçe kısıtlamaları olmaksızın verimin en üst düzeye çıkarılması temel amaç olduğunda, NVIDIA H200, değerlendirilen platformlar arasında en yüksek performans ölçümlerini sergiler.
AMD MI300X, uzun vadeli dağıtım stratejileri ve AMD tabanlı altyapı ortamları için dikkate değer özellikler sunar. Yazılım optimizasyon yinelemeleri yoluyla performans iyileştirmeleri beklenmektedir ve platformun önemli VRAM kapasitesi, daha büyük model mimarilerinin barındırılmasına olanak tanır.
NVIDIA B200, bu belirli iş yükü yapılandırmasında sınırlamalar gösterir; CPU kaynaklı performans kısıtları ve optimumun altında maliyet verimliliği sergiler. Bu mimari, tensör paralelliği stratejileriyle büyük ölçekli model'ler kullanan uygulamalar için daha uygun görünmektedir.
Daha fazla okuma
Diğer yapay zeka donanım araştırmalarını keşfedin, örneğin:
- En İyi 30 Bulut GPU Sağlayıcısı ve GPU'ları
- GPU Eşzamanlılık Benchmark
- En İyi 25+ Yapay Zeka Çip Üreticisi: NVIDIA ve Rakipleri
Bu benchmarkı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{dogan2026,
author = {Dogan, Sedat and Sarı, Ekrem},
title = {{Çoklu GPU Benchmark: B200 vs H200 vs H100 vs MI300X}},
year = {2026},
month = sep,
howpublished = {\url{https://aimultiple.com/multi-gpu}},
note = {AIMultiple. Erişim tarihi: 21 Eylül 2026}
}7 veri noktasının sonuçları ve zaman damgaları. Bu makaledeki grafik ve tablolarda gösterilen özet verileri, bir CSV dosyası içeren ZIP dosyası olarak indirin.
Arkasındaki ayrıntılı veriyi ister misiniz? Premium'a katılın
Değişiklik günlüğü
2 güncellemeÇoklu GPU karşılaştırma sonuçları bölümündeki Veri Kümesi güncellendi.
Total throughput vs. GPU count' bölümünden 'Saniyedeki istekler' metriği kaldırıldı.
Referans Linkleri
- Programlama dilleri ve sunucu mimarileri konusunda kapsamlı uzmanlığa sahip, 20 yıllık deneyime sahip bir beyaz şapkalı hacker ve geliştirme gurusudur.
- Erken aşama teknoloji şirketlerine yatırım yapan bir VC'de ve 125.000 işletmeye hizmet veren bölgesel bir dijital ödeme platformu olan Ödeal'da yönetim kurulu danışmanıdır.
- Yedi ulusal seçimin teknoloji altyapısını ve siber güvenliğini yönetmiş ve Twitter dahil küresel teknoloji liderleri tarafından siber güvenlik Onur Listesi'nde tanınmıştır.
Yorum yapan ilk kişi olun
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.