Premium
Hizmetler
Premium
Ekrem Sarı

Ekrem Sarı

Yapay Zeka Araştırmacısı
37 Makale
B2B Teknolojisinde Güncel Kalın

Ekrem, AIMultiple'da Yapay Zeka Araştırmacısı ve Veri Bilimcidir. Yapay zeka ve LLM sistemleri için uygulamalı benchmark'lar tasarlar ve yürütür.

Profesyonel Deneyim

AIMultiple'da Ekrem, uçtan uca yapay zeka sistemlerini benchmark eder ve benchmark ve ürün metriklerini izlemek için kullanılan veri iş akışlarını ve panoları geliştirir. Onun benchmark'ları embedding ve reranker model'lerini, vektör ve grafik veritabanlarını, inference motorlarını, kuantizasyonu, GPU eşzamanlılığını ve çoklu-GPU ölçeklemesini, bulut GPU fiyatlandırmasını ve sağlayıcılarını, metinden-SQL'e dönüşümü ve RAG ile ajan bazlı RAG framework'lerini kapsar.

AIMultiple'dan önce Yandex'te Veri Bilimci olarak çalıştı; burada büyük dataset'leri SQL ile sorgulayıp analiz ederek arama ve sıralama kalitesini ayrıntılı yönergelere göre değerlendirdi.

Araştırma İlgi Alanı

Ekrem'in çalışmaları, LLM ve erişim sistemlerinin pratikte nasıl performans gösterdiğini ölçmeye odaklanır. Test düzeneğini tasarlar, iş yüklerini gerçek donanımda çalıştırır; embedding model'lerinden vektör veritabanlarına ve inference motorlarından GPU altyapısına kadar tüm yığında model'leri, framework'leri ve altyapıyı doğruluk, verim, gecikme, maliyet ve ölçeklenebilirlik açısından karşılaştırır. Yüksek lisans tezi, sistematik literatür taramalarını RAG tabanlı bir pipeline ile otomatikleştirir.

Eğitim

Ekrem, Başkent Üniversitesi'nden Yönetim Bilişim Sistemleri alanında yüksek lisans derecesine sahiptir; tezinde sistematik literatür taramalarını RAG tabanlı bir pipeline ile otomatikleştirmiştir ve Hacettepe Üniversitesi'nde Veri ve Bilgi Mühendisliği alanında ikinci yüksek lisansına devam etmektedir.

Ekrem Tarafından Son Makaleler

Yapay Zeka
Kıyaslama
9 Eyl

Finans Alanında 40+ LLM Kıyaslaması: Claude Fable 5 ve GPT-5.6 Sol

LLM'leri FinanceReasoning kıyaslamasındaki 238 zor soru üzerinde değerlendirdik (Tang ve ark.).1 Bu alt küme, en zorlu finansal muhakeme görevlerini hedefler; finansal kavramları ve formülleri içeren karmaşık, çok adımlı nicel akıl yürütmeyi değerlendirir. Değerlendirmemizde özel bir prompt tasarımı ve doğruluk ile token tüketimi puanlama kriterleri kullanılmıştır. Bu metriklerin nasıl hesaplandığına ve bu değerlendirme için kullanılan framework'e…

Yapay Zeka
Kıyaslama
4 Eyl

Vektör Veritabanı Kıyaslaması: RAG için 7 Açık Kaynak Motor

Yedi açık kaynak, kendi barındırılan vektör veritabanını bir RAG pipeline'ının getirme katmanı olarak kıyasladık; her biri aynı bge-m3 embedding'leri ve gerçek tıbbi ve teknik sorgular üzerinde birer kez çalıştırıldı, böylece veritabanı indeksi tek değişken oldu. İş yükü; doğruluk ve getirme kalitesinden hız, bellek, filtrelenmiş ve hibrit arama, derleme maliyeti ve canlı değişime kadar sekiz boyutta…

Yapay Zeka
Kıyaslama
31 Ağu

Bulut GPU Fiyatlandırması, Performans ve Sağlayıcı Karşılaştırması

Bulut GPU liste fiyatları aynı model için bir sağlayıcıdan diğerine birkaç kat farklılık gösterebilir. Üç fiyatlandırma kademesinin tamamında 40+ GPU yapılandırması için en düşük ücreti, sağlayıcıyı, piyasa aralığını ve medyanı; ayrıca 10 modelde dolar başına verim kıyaslamasını derledik. İş yükünüz için en uygun maliyetli GPU'yu 13 hiperskaler ve neocloud sağlayıcı arasında, dolar başına verim bazında…

Yapay Zeka
Kıyaslama
31 Ağu

RAG Değerlendirme Araçları: Weights & Biases vs Ragas vs DeepEval

Bir RAG pipeline'ı yanlış bağlamı getirdiğinde, LLM kendinden emin şekilde yanlış cevabı üretir. Bağlam ilgililik puanlayıcıları birincil savunmadır. Beş aracı aynı koşullar altında 1.460 soru ve 14.600+ puanlanmış bağlam üzerinde kıyasladık: aynı jüri modeli (GPT-4o), varsayılan yapılandırmalar ve özel prompt yok. Standart koşullar altında WandB, TruLens ve Ragas en iyi performans gösterenler oldu. Çekişmeli baskı…

Yapay Zeka
Kıyaslama
31 Ağu

Embedding Model'ler: OpenAI vs Gemini vs Voyage

15 İngilizce metin embedding model'ini ve bir BM25 taban çizgisini, üç erişim alanında 500'den fazla elle derlenmiş sorgu üzerinde benchmark ettik: hukuk sözleşmeleri (CUAD), müşteri desteği (IBM TechQA) ve sağlık (MedRAG PubMed). Voyage-3.5 genel olarak birinci sırada yer alıyor. Perplexity Embed V1 0.6b, benchmark'ımızdaki en düşük fiyat noktasında üst-orta seviyeye ulaşıyor. nDCG@3: Kesme değeri 3'te…

Yapay Zeka
Kıyaslama
31 Ağu

RAG Framework'leri: LangChain vs LangGraph vs LlamaIndex

5 RAG framework'ünü, aynı ajanik RAG iş akışını standartlaştırılmış bileşenlerle oluşturarak kıyasladık: LangChain, LangGraph, LlamaIndex, Haystack ve DSPy; özdeş modeller (GPT-4.1-mini), embedding'ler (BGE-small), retriever (Qdrant) ve araçlar (Tavily web araması). Bu, her framework'ün gerçek ek yükünü ve token verimliliğini izole eder. Kıyaslama, istikrarlı ortalamalar sağlamak için her framework'ün tam seti 100 kez çalıştırdığı 100 sorgudan…

Yapay Zeka
Kıyaslama
31 Ağu

Açık Kaynak Embedding Modelleri Benchmark'ı RAG için

NVIDIA Llama-Embed-Nemotron-8B doğrulukta lider. Maliyet açısından, Google'ın EmbeddingGemma-300m modeli, küçük bir doğruluk kaybı karşılığında Nemotron'dan kabaca 4x daha ucuza çalışıyor. nDCG@3: Kesme noktası 3'te normalize edilmiş indirimli kümülatif kazanç. Sorgu başına tek ilgili doküman varsa, altın doküman ilk 3'e girdiğinde 1 / log2(sıra + 1), aksi halde 0 olur. 1. sıra 1.000, 2. sıra 0.631,…

Yapay Zeka
Kıyaslama
31 Ağu

En İyi RAG Araçları, Framework'ler ve Kütüphaneler

RAG, LLM yanıtlarını yalnızca modelin eğitimde ezberledikleriyle değil, harici verilere dayandırarak iyileştirir. Bir RAG sisteminin bileşenlerini kıyasladık ve sonuçları tek yerde topladık; yığının her parçasını seçmeye yönelik pratik bir rehberle birlikte. Her RAG bileşeni için benchmark sonuçlarımıza, bir RAG yığını seçme rehberimize veya RAG temellerine bakın: ne olduğu, nasıl çalıştığı ve nereye oturduğu. Embedding modeli,…

Otonom Yapay Zeka
Kıyaslama
20 Ağu

Ajanik Arama: Ajanlar için 8 Arama API'sini Kıyaslama

Ajanik arama, geleneksel arama motorları ile yapay zeka arama yetenekleri arasındaki boşluğu kapatmada çok önemli bir rol oynar. Arama API'leri, bir ajanik aracın ilk katmanıdır ve burada performans, aşağı akıştaki her şeyin kalitesini üst sınırlar. Gerçek dünyaya ait 100 yapay zeka/LLM sorgusunda 8 arama API'sini kıyasladık; 4.000 alınan sonucu, her birini alaka, kalite, gürültü ve…

Yapay Zeka
Kıyaslama
14 Ağu

Çok Modlu Embedding Modelleri: Apple vs Meta vs OpenAI

Çok modlu embedding modelleri nesneleri tanımada başarılıdır, ancak ilişkilerde zorlanır. Mevcut modeller “haritadaki telefon” ile “telefondaki harita”yı ayırt etmekte zorlanır. Bu spesifik sınırlılığı ölçmek için MS-COCO ve Winoground genelinde 7 önde gelen modeli benchmarkladık. Adil bir karşılaştırma sağlamak için her modeli aynı koşullar altında NVIDIA A40 donanımı ve bfloat16 hassasiyetiyle değerlendirdik. Bu deterministik kurulum, hangi…