Ekrem Sarı
Ekrem, AIMultiple'da Yapay Zeka Araştırmacısı ve Veri Bilimcidir. Yapay zeka ve LLM sistemleri için uygulamalı benchmark'lar tasarlar ve yürütür.
Profesyonel Deneyim
AIMultiple'da Ekrem, uçtan uca yapay zeka sistemlerini benchmark eder ve benchmark ve ürün metriklerini izlemek için kullanılan veri iş akışlarını ve panoları geliştirir. Onun benchmark'ları embedding ve reranker model'lerini, vektör ve grafik veritabanlarını, inference motorlarını, kuantizasyonu, GPU eşzamanlılığını ve çoklu-GPU ölçeklemesini, bulut GPU fiyatlandırmasını ve sağlayıcılarını, metinden-SQL'e dönüşümü ve RAG ile ajan bazlı RAG framework'lerini kapsar.
AIMultiple'dan önce Yandex'te Veri Bilimci olarak çalıştı; burada büyük dataset'leri SQL ile sorgulayıp analiz ederek arama ve sıralama kalitesini ayrıntılı yönergelere göre değerlendirdi.
Araştırma İlgi Alanı
Ekrem'in çalışmaları, LLM ve erişim sistemlerinin pratikte nasıl performans gösterdiğini ölçmeye odaklanır. Test düzeneğini tasarlar, iş yüklerini gerçek donanımda çalıştırır; embedding model'lerinden vektör veritabanlarına ve inference motorlarından GPU altyapısına kadar tüm yığında model'leri, framework'leri ve altyapıyı doğruluk, verim, gecikme, maliyet ve ölçeklenebilirlik açısından karşılaştırır. Yüksek lisans tezi, sistematik literatür taramalarını RAG tabanlı bir pipeline ile otomatikleştirir.
Eğitim
Ekrem, Başkent Üniversitesi'nden Yönetim Bilişim Sistemleri alanında yüksek lisans derecesine sahiptir; tezinde sistematik literatür taramalarını RAG tabanlı bir pipeline ile otomatikleştirmiştir ve Hacettepe Üniversitesi'nde Veri ve Bilgi Mühendisliği alanında ikinci yüksek lisansına devam etmektedir.
Ekrem Tarafından Son Makaleler
Finans Alanında 40+ LLM Kıyaslaması: Claude Fable 5 ve GPT-5.6 Sol
LLM'leri FinanceReasoning kıyaslamasındaki 238 zor soru üzerinde değerlendirdik (Tang ve ark.).1 Bu alt küme, en zorlu finansal muhakeme görevlerini hedefler; finansal kavramları ve formülleri içeren karmaşık, çok adımlı nicel akıl yürütmeyi değerlendirir. Değerlendirmemizde özel bir prompt tasarımı ve doğruluk ile token tüketimi puanlama kriterleri kullanılmıştır. Bu metriklerin nasıl hesaplandığına ve bu değerlendirme için kullanılan framework'e…
Vektör Veritabanı Kıyaslaması: RAG için 7 Açık Kaynak Motor
Yedi açık kaynak, kendi barındırılan vektör veritabanını bir RAG pipeline'ının getirme katmanı olarak kıyasladık; her biri aynı bge-m3 embedding'leri ve gerçek tıbbi ve teknik sorgular üzerinde birer kez çalıştırıldı, böylece veritabanı indeksi tek değişken oldu. İş yükü; doğruluk ve getirme kalitesinden hız, bellek, filtrelenmiş ve hibrit arama, derleme maliyeti ve canlı değişime kadar sekiz boyutta…
Bulut GPU Fiyatlandırması, Performans ve Sağlayıcı Karşılaştırması
Bulut GPU liste fiyatları aynı model için bir sağlayıcıdan diğerine birkaç kat farklılık gösterebilir. Üç fiyatlandırma kademesinin tamamında 40+ GPU yapılandırması için en düşük ücreti, sağlayıcıyı, piyasa aralığını ve medyanı; ayrıca 10 modelde dolar başına verim kıyaslamasını derledik. İş yükünüz için en uygun maliyetli GPU'yu 13 hiperskaler ve neocloud sağlayıcı arasında, dolar başına verim bazında…
RAG Değerlendirme Araçları: Weights & Biases vs Ragas vs DeepEval
Bir RAG pipeline'ı yanlış bağlamı getirdiğinde, LLM kendinden emin şekilde yanlış cevabı üretir. Bağlam ilgililik puanlayıcıları birincil savunmadır. Beş aracı aynı koşullar altında 1.460 soru ve 14.600+ puanlanmış bağlam üzerinde kıyasladık: aynı jüri modeli (GPT-4o), varsayılan yapılandırmalar ve özel prompt yok. Standart koşullar altında WandB, TruLens ve Ragas en iyi performans gösterenler oldu. Çekişmeli baskı…
Embedding Model'ler: OpenAI vs Gemini vs Voyage
15 İngilizce metin embedding model'ini ve bir BM25 taban çizgisini, üç erişim alanında 500'den fazla elle derlenmiş sorgu üzerinde benchmark ettik: hukuk sözleşmeleri (CUAD), müşteri desteği (IBM TechQA) ve sağlık (MedRAG PubMed). Voyage-3.5 genel olarak birinci sırada yer alıyor. Perplexity Embed V1 0.6b, benchmark'ımızdaki en düşük fiyat noktasında üst-orta seviyeye ulaşıyor. nDCG@3: Kesme değeri 3'te…
RAG Framework'leri: LangChain vs LangGraph vs LlamaIndex
5 RAG framework'ünü, aynı ajanik RAG iş akışını standartlaştırılmış bileşenlerle oluşturarak kıyasladık: LangChain, LangGraph, LlamaIndex, Haystack ve DSPy; özdeş modeller (GPT-4.1-mini), embedding'ler (BGE-small), retriever (Qdrant) ve araçlar (Tavily web araması). Bu, her framework'ün gerçek ek yükünü ve token verimliliğini izole eder. Kıyaslama, istikrarlı ortalamalar sağlamak için her framework'ün tam seti 100 kez çalıştırdığı 100 sorgudan…
Açık Kaynak Embedding Modelleri Benchmark'ı RAG için
NVIDIA Llama-Embed-Nemotron-8B doğrulukta lider. Maliyet açısından, Google'ın EmbeddingGemma-300m modeli, küçük bir doğruluk kaybı karşılığında Nemotron'dan kabaca 4x daha ucuza çalışıyor. nDCG@3: Kesme noktası 3'te normalize edilmiş indirimli kümülatif kazanç. Sorgu başına tek ilgili doküman varsa, altın doküman ilk 3'e girdiğinde 1 / log2(sıra + 1), aksi halde 0 olur. 1. sıra 1.000, 2. sıra 0.631,…
En İyi RAG Araçları, Framework'ler ve Kütüphaneler
RAG, LLM yanıtlarını yalnızca modelin eğitimde ezberledikleriyle değil, harici verilere dayandırarak iyileştirir. Bir RAG sisteminin bileşenlerini kıyasladık ve sonuçları tek yerde topladık; yığının her parçasını seçmeye yönelik pratik bir rehberle birlikte. Her RAG bileşeni için benchmark sonuçlarımıza, bir RAG yığını seçme rehberimize veya RAG temellerine bakın: ne olduğu, nasıl çalıştığı ve nereye oturduğu. Embedding modeli,…
Ajanik Arama: Ajanlar için 8 Arama API'sini Kıyaslama
Ajanik arama, geleneksel arama motorları ile yapay zeka arama yetenekleri arasındaki boşluğu kapatmada çok önemli bir rol oynar. Arama API'leri, bir ajanik aracın ilk katmanıdır ve burada performans, aşağı akıştaki her şeyin kalitesini üst sınırlar. Gerçek dünyaya ait 100 yapay zeka/LLM sorgusunda 8 arama API'sini kıyasladık; 4.000 alınan sonucu, her birini alaka, kalite, gürültü ve…
Çok Modlu Embedding Modelleri: Apple vs Meta vs OpenAI
Çok modlu embedding modelleri nesneleri tanımada başarılıdır, ancak ilişkilerde zorlanır. Mevcut modeller “haritadaki telefon” ile “telefondaki harita”yı ayırt etmekte zorlanır. Bu spesifik sınırlılığı ölçmek için MS-COCO ve Winoground genelinde 7 önde gelen modeli benchmarkladık. Adil bir karşılaştırma sağlamak için her modeli aynı koşullar altında NVIDIA A40 donanımı ve bfloat16 hassasiyetiyle değerlendirdik. Bu deterministik kurulum, hangi…
AIMultiple Bülteni
Haftada 1 ücretsiz e-posta ile en son B2B teknoloji haberleri ve uzman içgörüler ile işletmenizi hızlandırın.