Ekrem Sarı
Ekrem, AIMultiple'da Yapay Zeka Araştırmacısı ve Veri Bilimcidir. Yapay zeka ve LLM sistemleri için uygulamalı benchmark'lar tasarlar ve yürütür.
Profesyonel Deneyim
AIMultiple'da Ekrem, uçtan uca yapay zeka sistemlerini benchmark eder ve benchmark ve ürün metriklerini izlemek için kullanılan veri iş akışlarını ve panoları geliştirir. Onun benchmark'ları embedding ve reranker model'lerini, vektör ve grafik veritabanlarını, inference motorlarını, kuantizasyonu, GPU eşzamanlılığını ve çoklu-GPU ölçeklemesini, bulut GPU fiyatlandırmasını ve sağlayıcılarını, metinden-SQL'e dönüşümü ve RAG ile ajan bazlı RAG framework'lerini kapsar.
AIMultiple'dan önce Yandex'te Veri Bilimci olarak çalıştı; burada büyük dataset'leri SQL ile sorgulayıp analiz ederek arama ve sıralama kalitesini ayrıntılı yönergelere göre değerlendirdi.
Araştırma İlgi Alanı
Ekrem'in çalışmaları, LLM ve erişim sistemlerinin pratikte nasıl performans gösterdiğini ölçmeye odaklanır. Test düzeneğini tasarlar, iş yüklerini gerçek donanımda çalıştırır; embedding model'lerinden vektör veritabanlarına ve inference motorlarından GPU altyapısına kadar tüm yığında model'leri, framework'leri ve altyapıyı doğruluk, verim, gecikme, maliyet ve ölçeklenebilirlik açısından karşılaştırır. Yüksek lisans tezi, sistematik literatür taramalarını RAG tabanlı bir pipeline ile otomatikleştirir.
Eğitim
Ekrem, Başkent Üniversitesi'nden Yönetim Bilişim Sistemleri alanında yüksek lisans derecesine sahiptir; tezinde sistematik literatür taramalarını RAG tabanlı bir pipeline ile otomatikleştirmiştir ve Hacettepe Üniversitesi'nde Veri ve Bilgi Mühendisliği alanında ikinci yüksek lisansına devam etmektedir.
Ekrem Tarafından Son Makaleler
Finans Alanında 40+ LLM Kıyaslaması: Claude Fable 5 ve GPT-5.6 Sol
LLM'leri FinanceReasoning kıyaslamasındaki 238 zor soru üzerinde değerlendirdik (Tang ve ark.).1 Bu alt küme, en zorlu finansal muhakeme görevlerini hedefler; finansal kavramları ve formülleri içeren karmaşık, çok adımlı nicel akıl yürütmeyi değerlendirir. Değerlendirmemizde özel bir prompt tasarımı ve doğruluk ile token tüketimi puanlama kriterleri kullanılmıştır. Bu metriklerin nasıl hesaplandığına ve bu değerlendirme için kullanılan framework'e…
Agentic RAG Benchmark: 11 SQL Veritabanında Yönlendirme
Yönlendirme doğruluğu, modelin son yanıtında doğru veritabanını açıkça belirttiği puanlanan soruların yüzdesidir. Başlık, 184 soruyu kullanır; bu sorular hem benzerlik testimiz hem de üç LLM'den oluşan jüri tarafından zor olarak işaretlenmiştir. Açık bildirim eksik olanlar puan almaz. Qwen3.8-max, 153 / 184 zor yönlendirme sorusunu $25,14 kayıtlı maliyetle doğru yanıtladı. claude-fable-5 151 soruyu $121,55 maliyetle yanıtladı.…
Yedekleme yazılımı kıyaslaması: Acronis vs NinjaOne vs Comet vs MSP360
NinjaOne Backup, Acronis Cyber Protect Cloud Backup, Comet Backup ve MSP360 Managed Backup'ı aynı AWS altyapısında kıyasladık. Her satıcı aynı 625.946-dosyalık / 50 GB iş yükünün dosya modunda yedeklemesini ve sistem diskinin tam görüntü yedeklemesini çalıştırdı; ardından 15 GB'lik orta boyutlu alt dizini geri yükledi. İşte 50 GB / 625.946 dosyalık iş yükünde test edilen…
Text-to-SQL: LLM Doğruluk Karşılaştırması
36 büyük dil modelini 759 soru üzerinde BIRD-SQL'den çalıştırdık; her model, 11 aday arasından kendisinin belirlemesi gereken bir veritabanına karşı SQL yazdı. Ayrıştırılabilen her sorgu gerçek veritabanında çalıştırıldı ve sonuç kümesi BIRD'ün altın sorgusunun sonuç kümesiyle karşılaştırıldı. Eksik, hatalı biçimlendirilmiş ve yürütme hatası veren sorgular ıskalanmış olarak puanlandı. Her çalıştırma sıcaklık 0'da, zero-shot olarak ve…
Bulut GPU Kiralama Fiyat Endeksi
Yayınlanan bulut GPU kiralama fiyatlarını 17 model için 75 sağlayıcı genelinde izliyoruz; talep üzerine, spot ve rezerve edilmiş ücretleri kapsıyor. Son çıkan, üç grup arasında en büyük fiyat artışına sahiptir. Talep üzerine medyanı Ekim 2024'te GPU-saat başına $2,12'den Eylül 2026'da $4,72'ye yükseldi. Aynı dönemde Modern grup $1,35'ten $1,45'e ilerlerken Legacy $1,77'den $0,95'e geriledi. Her medyan,…
Reranker Benchmark: En İyi 8 Model Karşılaştırması
8 reranker modelini ~145k İngilizce Amazon yorumu üzerinde değerlendirerek yeniden sıralama aşamasının yoğun getirmeyi ne kadar iyileştirdiğini ölçtük. multilingual-e5-base ile ilk 100 adayı getirdik, her modelle yeniden sıraladık ve ilk 10 sonucu, her biri kaynak yorumundaki somut ayrıntılara atıfta bulunan 300 sorguya göre değerlendirdik. En iyi reranker Hit@1'i %62,67'ten %83,00'e yükseltti (+20.33pp). Metrikler açıklandı: ΔHit@1…
En İyi 30+ AI Çip Üreticisi: NVIDIA ve Rakipleri
AIMultiple’ın bulut GPU kıyaslamasını 4 farklı senaryoda 10 farklı GPU modeliyle çalıştırma deneyimimize dayanarak, bunlar veri merkezi iş yükleri için en iyi AI donanım şirketleridir. *Seçili AI çipi, her satıcıyı en iyi temsil eden parça, platform veya duyurulan projedir. Bazı girişler tek bir çip yerine sistemler, hizmetler veya lisanslanabilir IP'dir. Sıralama kategoriye göredir. Satıcılar, ilk…
Bot Tespiti: 9 Anti-Bot Satıcısı Kıyaslandı
Canlı web sitelerine karşı iki benchmark çalıştırdık, ardından her alan adının önündeki anti-bot şirketini belirledik ve her şirketin alan adlarının talep ettiğimiz içeriği ne sıklıkla döndürdüğünü ölçtük. Bu, 3.800 etiketli alan adını ve 50.000 isteği kapsıyor. İlk benchmark, 100 e-ticaret alan adında her biri 50 URL olmak üzere ürün ve arama sayfalarını getirdi. İkincisi, alan…
Uzak Tarayıcılar: Yapay Zeka Ajanları için Web Altyapısı Karşılaştırması
Yapay zeka ajanları, anti-scraping önlemleri tarafından engellenmeden web görevlerini otomatikleştirmek için uzak tarayıcılara güvenir. Bu tarayıcı altyapısının performansı bir ajanın başarısı için kritik öneme sahiptir. 8 sağlayıcıyı başarı oranı, hız ve özellikler açısından kıyasladık. Bunu yapmak için 160 otomatik görev yürüttük; gerçek dünya performanslarını ölçmek için her hizmet için 4 farklı senaryoyu 5 kez çalıştırdık.…
Büyük Ölçekli Web Kazıma: 7 Sağlayıcı Karşılaştırıldı
Canlı web sitelerinde, 5 ile 5.000 arasında eşzamanlı istek ile iki kıyaslama çalıştırdık. İlki, Tranco en iyi 10.000 alan adı genelinde dört web engel kaldırıcı üzerinden 260.000 istek gönderdi, ayrıca 10.000 URL üzerinde bir markdown çıkarma testi yapıldı. İkincisi, beş kazıma sağlayıcısının her birinden 100 e-ticaret alan adı genelinde 65.000 ürün ve arama sayfası getirdi.…
AIMultiple Bülteni
Haftada 1 ücretsiz e-posta ile en son B2B teknoloji haberleri ve uzman içgörüler ile işletmenizi hızlandırın.