Hizmetler
Bize Ulaşın

GPU Eşzamanlılık Kıyaslaması: H100 vs H200 vs B200 vs MI300X

Sedat Dogan
Sedat Dogan
Güncellenme tarihi: 12 Mar 2026

Son 20 yılımı sistem düzeyinde hesaplama performansı optimizasyonuna odaklanarak geçirdim. En yeni NVIDIA GPU'larını, NVIDIA'nın H100, H200 ve B200'ü ile AMD'nin MI300X'i dahil olmak üzere eşzamanlılık ölçeklendirme analizi için kıyasladık. gpt-oss-20b modelini kullanan vLLM çerçevesi ile bu GPU'ların 1'den 512'ye kadar eşzamanlı istekleri nasıl işlediğini test ettik. Sistem çıkış verimini, sorgu başına çıkış hızını ve uçtan uca gecikmeyi ölçerek, yapay zeka iş yükleri için GPU performansını anlamaya yardımcı olacak bulguları paylaşıyoruz.

Eşzamanlılık kıyaslama sonuçları

Sistem çıkış verimi vs eşzamanlılık

Loading Chart

Bu grafik, her eşzamanlılık düzeyinde sistem tarafından saniyede üretilen toplam çıkış token sayısını gösterir.

Sorgu başına çıkış hızı vs eşzamanlılık

Bu metrik, sistem yoğunlaştıkça bireysel bir sorgunun ne kadar hızlı işlendiğini (saniyedeki token sayısı cinsinden) gösterir. 1.000 token'lık bir çıktı için uçtan uca gecikme temel alınarak hesaplanır.

Uçtan uca gecikme vs eşzamanlılık

Bu grafik, farklı eşzamanlılık düzeylerinde bir isteğin baştan sona tamamlanması için geçen ortalama süreyi (milisaniye cinsinden) gösterir.

Dolar başına saniyede token sayısı vs eşzamanlılık

Bu grafik, saatlik kiralama için harcanan her dolar başına saniyede kaç token üretildiğini ölçerek her GPU'nun maliyet verimliliğini değerlendirir. Bu metrik, özellikle bütçe bilincine sahip dağıtımlar için her donanım seçeneğinin yatırım getirisini anlamak açısından kritiktir.

Not: Fiyatlandırma, Mart 2026 itibarıyla Runpod bulut platformundaki isteğe bağlı saatlik ücretlere dayanmaktadır. Fiyatlar değişebilir ve kullanılabilirlik ile örnek türüne göre farklılık gösterebilir.

Eşzamanlılık kıyaslama metodolojimiz hakkında daha fazla bilgi edinebilirsiniz.

Eşzamanlılık nedir?

Eşzamanlılık, bir GPU'nun aynı anda birden çok isteği işleyebilme yeteneğini ifade eder; bu, büyük dil modeli çıkarımı gibi yapay zeka iş yükleri için önemli bir faktördür. Performans değerlendirmemizde, eşzamanlılık düzeyleri, test çalışmaları sırasında GPU'ya gönderilen eşzamanlı istek sayısını (1'den 512'ye kadar) temsil eder. Daha yüksek eşzamanlılık, GPU'nun performansı düşürmeden paralel görevleri yönetme kapasitesini test eder ve verim ile gecikme arasında denge kurar.

Eşzamanlılığı anlamak, kullanıcıların değişken talep veya toplu işleme ihtiyaçları olan iş yükleri için doğru GPU'yu belirlemelerine yardımcı olur. Grafik testleri veya GPU kıyaslama paketleri çalıştırırken, eşzamanlılık performansı GPU'lar arasında önemli ölçüde farklılık gösterebilir; bu da tüketicilerin ve alıcıların farklı sistem yapılandırmaları ve fiyat noktaları arasında test sonuçlarını karşılaştırmasını zorunlu kılar.

Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

vLLM nedir?

vLLM, büyük dil modeli (LLM) çıkarımı ve sunumu için hızlı ve kullanımı kolay açık kaynaklı bir kütüphanedir ve bir katkıda bulunanlar topluluğu tarafından desteklenir. Bellek yönetimi, eşzamanlı istekleri işleme ve gpt-oss-20b gibi modelleri verimli bir şekilde sunma yoluyla hem bulut hem de kendi kendine barındırılan LLM dağıtımlarını yönetir. Kendi kendine barındırılan LLM'ler için vLLM, bellek yönetimi için PagedAttention1 , sürekli toplu işleme ve hem NVIDIA hem de AMD GPU'ları desteği gibi özelliklerle dağıtımı basitleştirir ve yerel donanımda birden çok eşzamanlı isteğe olanak tanır.

Eşzamanlılık kıyaslama metodolojisi

Hem NVIDIA hem de AMD'nin en yeni yüksek performanslı GPU mimarilerini, yapay zeka çıkarım iş yükleri için eşzamanlılık ölçeklendirme yeteneklerini değerlendirmek üzere test ettik. Kıyaslamamız, NVIDIA H100, H200 ve B200 GPU'larını AMD'nin MI300X'i ile birlikte test ederek, değişen eşzamanlı yük koşulları altında OpenAI gpt-oss-20b modelini vLLM aracılığıyla çalıştırdı. Verim metrikleri, gecikme dağılımları ve kaynak kullanım modellerinin ölçümü yoluyla bu analiz, yapay zeka çıkarım dağıtımları için içgörüler sağlamayı amaçlamaktadır.

Test altyapısı

Testlerimizi Runpod'un bulut altyapısında, NVIDIA'nın en gelişmiş GPU mimarilerini ve vLLM çerçevesini kullanarak gerçekleştirdik.

  • GPU platformu: Runpod bulut altyapısı (H100, H200, B200 ve MI300X)
  • Model: OpenAI GPT-OSS-20B, vLLM çerçevesi aracılığıyla

Yazılım ortamı

NVIDIA GPU'ları (H100, H200, B200):

  • RunPod şablonu: runpod/pytorch:1.0.2-cu1281-torch280-ubuntu2404
  • vLLM kurulumu: vllm[flashinfer]==0.11.0

AMD GPU (MI300X):

  • Docker imajı: rocm/vllm-dev:open-mi300-08052025

vLLM sunucu yapılandırması

Her donanım mimarisi için performansı optimize etmek üzere farklı vLLM ayarları kullanıldı.

  • NVIDIA H100, H200 ve B200 GPU'ları için, sunucu aşağıdaki komutla başlatıldı:
  • AMD MI300X GPU için, mimariye özel ayarlarla ROCm için optimize edilmiş bir vLLM derlemesi kullanıldı:

Not: Bu kıyaslama, vLLM v0.11.0 kullanılarak gerçekleştirilmiştir. 2025 başında piyasaya sürülen vLLM v1.0, farklı verim sonuçları üretebilecek mimari değişiklikler sunmaktadır.

Kıyaslama yapılandırması

Tutarlı sonuçlar sağlamak için her GPU, standartlaştırılmış parametrelerle 9 farklı eşzamanlılık düzeyinde test edildi.

  • Eşzamanlılık düzeyleri: 1, 4, 8, 16, 32, 64, 128, 256, 512 eşzamanlı istek
  • Test süresi: 180 saniye ölçüm aşaması, 30s ısınma/soğuma
  • İstek boyutu: İstek başına 1.000 giriş/çıkış token'ı

Sonuç doğrulama notu: Nihai metrikleri kaydetmeden önce, her GPU için en uygun yapılandırmayı belirlemek üzere çok sayıda test yaptık. Belirlendikten sonra, kararlılığı doğrulamak için kıyaslama art arda üç kez çalıştırıldı. Bu çalıştırmalar boyunca verim sonuçları tutarlıydı ve varyans %0,1'den azdı. Bu analizde bildirilen rakamlar, bu üç ardışık yürütmenin sonuncusuna dayanmaktadır.

Temel metrikler

Yük altında GPU yeteneklerine kapsamlı bir bakış sağlamak için performansı birden çok boyutta izledik.

  • Verim: Saniye başına sistem çıkış token'ları, saniye başına başarılı istekler ve bireysel istek token üretim hızı
  • Gecikme: İlk Token Süresi (TTFT), P50/P95/P99 yüzdelik dilimleriyle uçtan uca gecikme, istek başına ortalama gecikme
  • Güvenilirlik: Başarı oranı yüzdesi, zaman aşımı vs. diğer hata sınıflandırması

Yazılım yığını değerlendirmeleri

Performans yalnızca donanımın bir işlevi değildir. vLLM gibi çerçeveler, AMD'nin ROCm'una kıyasla NVIDIA'nın CUDA ekosistemi için daha olgun ve yüksek düzeyde optimize edilmiş destek sunar. MI300X sonuçlarında gözlemlenen performans farklılıkları, kısmen donanımın teorik potansiyelinden ziyade yazılım optimizasyonunun mevcut durumunu yansıtıyor olabilir.

Kıyaslamalarımızı ve veri odaklı içgörülerimizi kaçırmayın. Düğme Google'ı açar; AIMultiple'ı seçmeniz, Google arama sonuçlarında AIMultiple'ı daha sık görmek istediğinizi onaylar.
GoogleTercih edilen kaynak olarak ekle

Yeni nesil donanım yol haritası

Bu kıyaslamada test edilen GPU'lar; B200, H200, H100 ve MI300X, mevcut nesil yapay zeka çıkarım donanımını temsil etmektedir. Hem NVIDIA hem de AMD, 2026 ve sonrası için altyapı yatırımları planlayan ekipler için ilgili bağlam olan haleflerini duyurdu.

NVIDIA cephesinde, Jensen Huang CES 2026'da Vera Rubin NVL72 platformunun tam üretime girdiğini ve ilk sistemlerin 2026'nın ikinci yarısında sevk edilmesinin beklendiğini duyurdu.2 NVIDIA'ya göre, Rubin GPU'su yaklaşık 50 PFLOP FP4 çıkarım performansı sunmakta olup, bu da burada kıyaslanan B200 gibi Blackwell tabanlı sistemlerin kabaca beş katıdır.3

AMD cephesinde, CDNA 5 mimarisine dayanan Instinct MI400, 2026 için planlanmıştır ve MI350 hesaplama performansını kabaca iki katına çıkarırken 432 GB HBM4 bellek sunması bekleniyor.4 AMD ayrıca Meta'nın, 2026'nın ikinci yarısından itibaren sevkiyatına başlanacak olan, 6 gigawatt'a kadar kapasitede özel MI450 tabanlı Instinct sunucuları dağıtacağını duyurdu.5 Oracle ayrıca, 2026'nın 3. çeyreğinden itibaren yaklaşık 50.000 MI450 serisi GPU ile desteklenen, herkese açık bir yapay zeka süper kümesi sunacak.6

Bu kıyaslamadaki GPU'ları yakın vadeli dağıtımlar için değerlendiren ekipler için B200 ve MI300X, şu anda mevcut en yüksek performanslı seçenekler olmaya devam etmektedir. Daha uzun planlama ufukları için 2026 yol haritası, her iki satıcıda verim ve maliyet verimliliği açısından önemli bir sıçramaya işaret etmektedir.

Sonuç

B200, verimde liderdir ve toplu çıkarım için iyi ölçeklenir. MI300X, düşük eşzamanlılıkta en hızlı yanıt sürelerini sunar ve bu da onu chatbot'lar gibi gerçek zamanlı uygulamalar için daha uygun hale getirir. H100 ve H200, her iki boyutta da öne çıkmadan genel amaçlı iş yüklerini kapsayarak arada yer alır.

Temel ödünleşim tüm donanımlarda geçerlidir: daha yüksek eşzamanlılık sistem verimini artırır ancak istek başına gecikmeyi yükseltir. İş yükünüzün hacme mi yoksa yanıt süresine mi öncelik verdiğine göre seçim yapın.

İleri okuma

Aşağıdakiler gibi diğer yapay zeka donanım araştırmalarını keşfedin:

Bu benchmarkı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Sedat Dogan and Ekrem Sarı (2026) - "GPU Eşzamanlılık Kıyaslaması: H100 vs H200 vs B200 vs MI300X". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 12 Mart 2026, kaynak: https://aimultiple.com/gpu-benchmark [Çevrimiçi Kaynak]

Dogan, S., & Sarı, E. (2026, 12 Mart). GPU Eşzamanlılık Kıyaslaması: H100 vs H200 vs B200 vs MI300X. AIMultiple. https://aimultiple.com/gpu-benchmark

@misc{dogan2026,
  author = {Dogan, Sedat and Sarı, Ekrem},
  title  = {{GPU Eşzamanlılık Kıyaslaması: H100 vs H200 vs B200 vs MI300X}},
  year   = {2026},
  month  = mar,
  howpublished    = {\url{https://aimultiple.com/gpu-benchmark}},
  note   = {AIMultiple. Erişim tarihi: 12 Mart 2026}
}
Sedat Dogan
Sedat Dogan
CTO
Sedat, yazılım geliştirme, web veri toplama ve siber güvenlik alanlarında deneyime sahip bir teknoloji ve bilgi güvenliği lideridir. Sedat: - Programlama dilleri ve sunucu mimarileri konusunda geniş uzmanlığa sahip, 20 yıllık beyaz şapkalı hacker ve geliştirme uzmanı deneyimine sahiptir. - Ödeme altyapısı gibi yüksek trafikli ve kritik öneme sahip teknoloji operasyonlarına sahip şirketlerin üst düzey yöneticilerine ve yönetim kurulu üyelerine danışmanlık yapmaktadır. - Teknik uzmanlığının yanı sıra kapsamlı iş zekasına da sahiptir.
Tam Profili Görüntüle
Araştıran
Ekrem Sarı
Ekrem Sarı
Yapay Zeka Araştırmacısı
Ekrem, AIMultiple'da yapay zeka araştırmacısı olarak çalışmakta olup, akıllı otomasyon, GPU'lar, yapay zeka ajanları ve RAG çerçeveleri üzerine yoğunlaşmaktadır.
Tam Profili Görüntüle

Yorum yapan ilk kişi olun

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450