Hizmetler
Bize Ulaşın

GPU Eşzamanlılık Kıyaslaması: H100 vs H200 vs B200 vs MI300X

Sedat Dogan
Sedat Dogan
Güncellenme tarihi: 12 Mar 2026

Son 20 yılımı sistem düzeyinde hesaplama performans optimizasyonuna odaklanarak geçirdim. Eşzamanlılık ölçekleme analizi için, en yeni NVIDIA GPU'ları ( NVIDIA'nın H100, H200 ve B200) ve AMD'nin MI300X'i dahil kıyasladık. gpt-oss-20b modeli ile vLLM çerçevesini kullanarak, bu GPU'ların 1'den 512'ye kadar eşzamanlı istekleri nasıl işlediğini test ettik. Sistem çıkış verimi, sorgu başına çıkış hızı ve uçtan uca gecikme süresini ölçerek, yapay zeka iş yükleri için GPU performansını anlamaya yardımcı olacak bulguları paylaşıyoruz.

Eşzamanlılık kıyaslama sonuçları

Sistem çıkış verimi ile eşzamanlılık karşılaştırması

Loading Chart

Bu grafik, her eşzamanlılık seviyesinde sistem tarafından saniyede üretilen toplam çıkış token sayısını gösterir.

Sorgu başına çıkış hızı ile eşzamanlılık karşılaştırması

Bu metrik, sistem yoğunlaştıkça tek bir sorgunun ne kadar hızlı işlendiğini (saniyedeki token cinsinden) gösterir. 1.000 token'lık çıkış için uçtan uca gecikme süresine dayanarak hesaplanır.

Uçtan uca gecikme süresi ile eşzamanlılık karşılaştırması

Bu grafik, farklı eşzamanlılık seviyelerinde bir isteğin baştan sona tamamlanması için geçen ortalama süreyi (milisaniye cinsinden) gösterir.

Dolar başına saniyedeki token ile eşzamanlılık

Bu grafik, saatlik kiralama için harcanan her dolar için saniyede kaç token üretildiğini ölçerek her GPU'nun maliyet verimliliğini değerlendirir. Bu metrik, özellikle bütçe kısıtlı dağıtımlar için, her donanım seçeneğinin yatırım getirisini anlamak açısından çok önemlidir.

Not: Fiyatlandırma, Mart 2026 itibarıyla Runpod bulut platformundaki isteğe bağlı saatlik ücretlere dayanmaktadır. Fiyatlar değişebilir ve kullanılabilirlik ile örnek türüne göre farklılık gösterebilir.

Daha fazla bilgi için eşzamanlılık kıyaslama metodolojimizi okuyabilirsiniz.

Eşzamanlılık nedir?

Eşzamanlılık, bir GPU'nun birden çok isteği aynı anda işleyebilme yeteneğini ifade eder; bu, büyük dil modeli çıkarımı gibi yapay zeka iş yükleri için önemli bir faktördür. Performans değerlendirmemizde, eşzamanlılık seviyeleri test çalışmaları sırasında GPU'ya gönderilen eşzamanlı istek sayısını (1'den 512'ye kadar) temsil eder. Daha yüksek eşzamanlılık, GPU'nun performansı düşürmeden paralel görevleri yönetme kapasitesini test ederek verim ve gecikme süresini dengeler.

Eşzamanlılığı anlamak, kullanıcıların değişken talep veya toplu işleme ihtiyaçları olan iş yükleri için doğru GPU'yu belirlemelerine yardımcı olur. Grafik testleri veya GPU kıyaslama paketleri çalıştırırken, eşzamanlılık performansı GPU'lar arasında önemli ölçüde farklılık gösterebilir; bu da tüketicilerin ve alıcıların farklı sistem yapılandırmaları ve fiyat noktalarındaki test sonuçlarını karşılaştırmasını zorunlu kılar.

Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

vLLM nedir?

vLLM, katkıda bulunan bir topluluk tarafından desteklenen, büyük dil modeli (LLM) çıkarımı ve sunumu için hızlı ve kullanımı kolay açık kaynaklı bir kütüphanedir. Hem bulut hem de self-hosted LLM dağıtımlarını, belleği yöneterek, eşzamanlı istekleri işleyerek ve gpt-oss-20b gibi modelleri verimli bir şekilde sunarak destekler. Self-hosted LLM'ler için vLLM, bellek yönetimi için PagedAttention1 , sürekli gruplandırma ve hem NVIDIA hem de AMD GPU desteği gibi özelliklerle dağıtımı basitleştirir; bu da yerel donanımda birden çok eşzamanlı isteğe olanak tanır.

Eşzamanlılık kıyaslama metodolojisi

Yapay zeka çıkarım iş yükleri için eşzamanlılık ölçekleme yeteneklerini değerlendirmek üzere, hem NVIDIA hem de AMD'nin en yeni yüksek performanslı GPU mimarilerini test ettik. Kıyaslamamız, NVIDIA H100, H200 ve B200 GPU'ları ile AMD'nin MI300X'ini, vLLM aracılığıyla OpenAI gpt-oss-20b modelini değişen eşzamanlı yük koşullarında çalıştırarak test etti. Verim metrikleri, gecikme dağılımları ve kaynak kullanım modellerinin ölçümü yoluyla, bu analiz yapay zeka çıkarım dağıtımları için içgörü sağlamayı amaçlamaktadır.

Test altyapısı

Testlerimizi, Runpod'un bulut altyapısı üzerinde, NVIDIA'nın en gelişmiş GPU mimarilerini ve vLLM çerçevesini kullanarak gerçekleştirdik.

  • GPU platformu: Runpod bulut altyapısı (H100, H200, B200 ve MI300X)
  • Model: OpenAI GPT-OSS-20B vLLM çerçevesi aracılığıyla

Yazılım ortamı

NVIDIA GPU'lar (H100, H200, B200):

  • RunPod şablonu: runpod/pytorch:1.0.2-cu1281-torch280-ubuntu2404
  • vLLM kurulumu: vllm[flashinfer]==0.11.0

AMD GPU (MI300X):

  • Docker imajı: rocm/vllm-dev:open-mi300-08052025

vLLM sunucu yapılandırması

Her donanım mimarisi için performansı optimize etmek amacıyla farklı vLLM ayarları kullanılmıştır.

  • NVIDIA H100, H200 ve B200 GPU'lar için, sunucu aşağıdaki komutla başlatıldı:
  • AMD MI300X GPU için, mimariye özel ayarlarla ROCm için optimize edilmiş bir vLLM yapısı kullanıldı:

Not: Bu kıyaslama vLLM v0.11.0 kullanılarak gerçekleştirilmiştir. 2025'in başlarında yayınlanan vLLM v1.0, farklı verim sonuçları üretebilecek mimari değişiklikler getirmektedir.

Kıyaslama yapılandırması

Her GPU, tutarlı sonuçlar sağlamak için standartlaştırılmış parametrelerle 9 farklı eşzamanlılık seviyesinde test edildi.

  • Eşzamanlılık seviyeleri: 1, 4, 8, 16, 32, 64, 128, 256, 512 eşzamanlı istek
  • Test süresi: 180 saniye ölçüm aşaması, 30sn ısınma/soğuma süresiyle
  • İstek boyutu: istek başına 1.000 giriş/çıkış token'ı

Sonuç doğrulama notu: Nihai metrikleri kaydetmeden önce, her GPU için en uygun yapılandırmayı belirlemek amacıyla çok sayıda test yaptık. Belirlendikten sonra, kararlılığı doğrulamak için kıyaslama üç kez art arda çalıştırıldı. Verim sonuçları bu çalıştırmalarda tutarlıydı ve varyans %0.1'den azdı. Bu analizde bildirilen rakamlar, bu üç ardışık yürütmenin sonuncusuna dayanmaktadır.

Anahtar metrikler

Yük altında GPU yeteneklerinin kapsamlı bir görünümünü sağlamak için performansı birden çok boyutta takip ettik.

  • Verim: Sistem çıkışı saniyedeki token, saniyedeki başarılı istek sayısı ve bireysel istek token üretim hızı
  • Gecikme: İlk Token Süresi (TTFT), P50/P95/P99 yüzdelikli uçtan uca gecikme, istek başına ortalama gecikme
  • Güvenilirlik: Başarı oranı yüzdesi, zaman aşımı ve diğer hata sınıflandırması

Yazılım yığını değerlendirmeleri

Performans yalnızca donanımın bir fonksiyonu değildir. vLLM gibi çerçeveler, AMD'nin ROCm'una kıyasla, NVIDIA'nın CUDA ekosistemi için daha olgun ve yüksek düzeyde optimize edilmiş desteğe sahiptir. MI300X sonuçlarında gözlemlenen performans farklılıkları, donanımın teorik potansiyelinden ziyade kısmen yazılım optimizasyonunun mevcut durumunu yansıtabilir.

Kıyaslamalarımızı ve veri odaklı içgörülerimizi kaçırmayın. Düğme Google'ı açar; AIMultiple'ı seçmeniz, Google arama sonuçlarında AIMultiple'ı daha sık görmek istediğinizi onaylar.
GoogleTercih edilen kaynak olarak ekle

Yeni nesil donanım yol haritası

Bu kıyaslamada test edilen GPU'lar (B200, H200, H100 ve MI300X), mevcut nesil yapay zeka çıkarım donanımını temsil etmektedir. Hem NVIDIA hem de AMD, 2026 ve sonrası için altyapı yatırımları planlayan ekipler için ilgili bağlam olan haleflerini duyurdu.

NVIDIA tarafında, Jensen Huang CES 2026'da Vera Rubin NVL72 platformunun tam üretime geçtiğini ve ilk sistemlerin 2026'nın ikinci yarısında sevk edilmesinin beklendiğini duyurdu.2 NVIDIA'ya göre, Rubin GPU yaklaşık 50 PFLOP FP4 çıkarım performansı sunuyor; bu, burada kıyaslanan B200 gibi Blackwell tabanlı sistemlerin kabaca beş katıdır.2

AMD tarafında, CDNA 5 mimarisine dayanan Instinct MI400'ün 2026 için planlandığı ve MI350'nin hesaplama performansını kabaca iki katına çıkarırken 432 GB HBM4 bellek sunması beklenmektedir.3 AMD ayrıca Meta'nın, sevkiyatları 2026'nın ikinci yarısında başlamak üzere 6 gigawatt kapasiteye kadar özel MI450 tabanlı Instinct sunucuları devreye alacağını duyurdu.4 Oracle ayrıca, 2026'nın 3. çeyreğinden itibaren yaklaşık 50.000 MI450 serisi GPU ile güçlendirilmiş, herkese açık bir yapay zeka süper kümesi sunacak.5

Yakın vadeli dağıtımlar için bu kıyaslamadaki GPU'ları değerlendiren ekipler için B200 ve MI300X, hâlihazırda mevcut en yüksek performanslı seçenekler olmaya devam etmektedir. Daha uzun planlama ufukları için 2026 yol haritası, her iki tedarikçiden de hem verim hem de maliyet verimliliğinde önemli bir sıçrama öngörmektedir.

Sonuç

B200, verimde liderdir ve toplu çıkarım için iyi ölçeklenir. MI300X, düşük eşzamanlılıkta en hızlı yanıt sürelerini sunarak chatbot'lar gibi gerçek zamanlı uygulamalar için daha uygundur. H100 ve H200 ise arada yer alır ve her iki boyutta da öne çıkmadan genel amaçlı iş yüklerini karşılar.

Temel denge tüm donanımlarda geçerlidir: daha yüksek eşzamanlılık sistem verimini artırır ancak istek başına gecikmeyi yükseltir. İş yükünüzün hacmi mi yoksa yanıt süresini mi önceliklendirdiğine göre seçim yapın.

Daha fazla okuma

Aşağıdakiler gibi diğer yapay zeka donanım araştırmalarını inceleyin:

Bu benchmarkı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Sedat Dogan and Ekrem Sarı (2026) - "GPU Eşzamanlılık Kıyaslaması: H100 vs H200 vs B200 vs MI300X". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 12 Mart 2026, kaynak: https://aimultiple.com/gpu-benchmark [Çevrimiçi Kaynak]

Dogan, S., & Sarı, E. (2026, 12 Mart). GPU Eşzamanlılık Kıyaslaması: H100 vs H200 vs B200 vs MI300X. AIMultiple. https://aimultiple.com/gpu-benchmark

@misc{dogan2026,
  author = {Dogan, Sedat and Sarı, Ekrem},
  title  = {{GPU Eşzamanlılık Kıyaslaması: H100 vs H200 vs B200 vs MI300X}},
  year   = {2026},
  month  = mar,
  howpublished    = {\url{https://aimultiple.com/gpu-benchmark}},
  note   = {AIMultiple. Erişim tarihi: 12 Mart 2026}
}
Sedat Dogan
Sedat Dogan
CTO
Sedat, yazılım geliştirme, web veri toplama ve siber güvenlik alanlarında deneyime sahip bir teknoloji ve bilgi güvenliği lideridir. Sedat: - Programlama dilleri ve sunucu mimarileri konusunda geniş uzmanlığa sahip, 20 yıllık beyaz şapkalı hacker ve geliştirme uzmanı deneyimine sahiptir. - Ödeme altyapısı gibi yüksek trafikli ve kritik öneme sahip teknoloji operasyonlarına sahip şirketlerin üst düzey yöneticilerine ve yönetim kurulu üyelerine danışmanlık yapmaktadır. - Teknik uzmanlığının yanı sıra kapsamlı iş zekasına da sahiptir.
Tam Profili Görüntüle
Araştıran
Ekrem Sarı
Ekrem Sarı
Yapay Zeka Araştırmacısı
Ekrem, AIMultiple'da bir Yapay Zeka Araştırmacısı ve Veri Analistidir. Yapay zeka ve LLM sistemleri için uygulamalı benchmark'lar tasarlar ve yürütür.
Tam Profili Görüntüle

Yorum yapan ilk kişi olun

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450