Ekrem Sarı
Ekrem, AIMultiple'da bir Yapay Zeka Araştırmacısı ve Veri Analistidir. Yapay zeka ve LLM sistemleri için uygulamalı benchmark'lar tasarlar ve yürütür.
Profesyonel Deneyim
AIMultiple'da, Ekrem uçtan uca yapay zeka sistemlerini benchmark eder ve benchmark ve ürün metriklerini izlemek için kullanılan veri iş akışlarını ve panolarını oluşturur. Onun benchmark'ları; embedding ve reranker model'lerini, vektör ve graf veritabanlarını, inference motorlarını, kuantizasyonu, GPU eşzamanlılığını ve çoklu GPU ölçeklemesini, bulut GPU fiyatlandırmasını ve sağlayıcılarını, text-to-SQL, RAG ve agentic RAG framework'lerini kapsar.
AIMultiple'dan önce, Yandex'te Değerlendirici olarak çalıştı; burada arama kalitesini değerlendirdi ve sıralama ile model kalitesini desteklemek için ayrıntılı yönergelere göre büyük hacimli verileri etiketledi.
Araştırma İlgi Alanları
Ekrem'in çalışmaları MLOps ve LLMOps yaşam döngüsüne ve yapay zeka sistemlerinin performansının ölçülmesine odaklanmaktadır. Ekrem, doğruluk, verim, API maliyeti ve ölçeklenebilirlik gibi metrikler açısından embedding model'lerinden ve vektör veritabanlarından GPU ve bulut altyapısına kadar tüm yığın boyunca model'leri, framework'leri ve altyapıyı karşılaştırır. Yüksek lisans tezi, RAG tabanlı bir pipeline ile sistematik literatür taramalarını otomatikleştirmektedir.
Eğitim
Ekrem, Hacettepe Üniversitesi'nden lisans derecesine sahiptir ve Başkent Üniversitesi'nde yüksek lisans eğitimini tamamlamaktadır.
Ekrem Tarafından Son Makaleler
Uzak Tarayıcılar: Yapay Zeka Ajanları için Web Altyapısı Karşılaştırması
Yapay zeka ajanları, web görevlerini anti-scraping önlemleri tarafından engellenmeden otomatikleştirmek için uzak tarayıcılara güvenir. Bu tarayıcı altyapısının performansı, bir ajanın başarısı için kritik öneme sahiptir. 8 sağlayıcıyı başarı oranı, hız ve özellikler açısından kıyasladık. Bunu yapmak için, her hizmet için 4 farklı senaryoyu 5 kez çalıştırarak 160 otomatik görevi gerçekleştirdik ve gerçek dünya performanslarını ölçtük.…
LLM Çıkarım Motorları: vLLM vs LMDeploy vs SGLang
NVIDIA H100 üzerinde 3 lider LLM çıkarım motorunu kıyasladık: vLLM, LMDeploy ve SGLang. Her motor, mimari tercihlerinin ve optimizasyon stratejilerinin gerçek performans etkisini yalıtmak için aynı iş yüklerini işledi: Llama 3.1 8B-Instruct kullanarak 1.000 ShareGPT prompt'u. İstatistiksel kararlılığı sağlamak için 10.000 toplam çıkarım işlemi (1.000 prompt × motor başına 10 çalıştırma) boyunca çevrimdışı toplu iş…
En İyi 10 Çok Dilli Embedding Model'leri RAG için
10 çok dilli embedding model'ini ~606k Amazon yorumu üzerinde 6 dilde (Almanca, İngilizce, İspanyolca, Fransızca, Japonca, Çince) kıyasladık. 1.800 sorgu oluşturduk (dil başına 300), her biri kaynak incelemesinden somut ayrıntılara değinir. Arama için eğitilmiş modeller (sorgu vs belge ayrımı), genel metin benzerliği için eğitilmiş daha büyük modellerden daha iyi performans gösterir: e5_base (110M parametre), 5x…
Çoklu-GPU Benchmark: B200 vs H200 vs H100 vs MI300X
Yirmi yılı aşkın süredir, hesaplama performansını optimize etmek çalışmalarımın temel taşı olmuştur. Büyük Dil Modeli (LLM) çıkarımı için ne kadar iyi ölçeklendiklerini değerlendirmek amacıyla NVIDIA'nın B200, H200, H100 ve AMD'nin MI300X'ini test ettik. meta-llama/Llama-3.1-8B-Instruct modeli ile vLLM framework'ünü kullanarak 1, 2, 4 ve 8 GPU üzerinde testler gerçekleştirdik. Her bir GPU mimarisinin paralelleştirilmiş, hesaplama yoğun…
LLM Kuantizasyonu: BF16 vs FP8 vs INT4
Qwen3-32B'yi tek bir NVIDIA H100 80GB GPU üzerinde 4 hassasiyet seviyesinde (BF16, FP8, GPTQ-Int8, GPTQ-Int4) benchmark'ladık. Her yapılandırma, bilgi ve kod üretimi kapsayan 2 benchmark'ta (~12.2K soru) ve verimliliği ölçmek için 2.000'den fazla inference çalıştırmasında değerlendirildi. Int4, MMLU-Pro'da 2 puandan daha az kayıp yaşarken BF16'dan 2.7 kat daha hızlıdır, ancak kod üretimi (HumanEval) 8 puan…
AIMultiple Bülteni
Haftada 1 ücretsiz e-posta ile en son B2B teknoloji haberleri ve uzman içgörüler ile işletmenizi hızlandırın.