Ekrem Sarı
Ekrem ist KI-Forscher und Datenwissenschaftler bei AIMultiple. Er entwirft und führt praxisnahe Benchmarks für KI- und LLM-Systeme durch.
Berufserfahrung
Bei AIMultiple führt Ekrem Benchmarks für End-to-End-KI-Systeme durch und erstellt die Daten-Workflows und Dashboards, die zur Verfolgung von Benchmark- und Produktmetriken verwendet werden. Seine Benchmarks decken Embedding- und Reranker-Models, Vektor- und Graphdatenbanken, Inference-Engines, Quantisierung, GPU-Parallelität und Multi-GPU-Skalierung, Cloud-GPU-Preise und -Anbieter, Text-zu-SQL sowie RAG- und agentische RAG-Frameworks ab.
Vor AIMultiple arbeitete er als Datenwissenschaftler bei Yandex, wo er große Datensätze mit SQL abfragte und analysierte, um die Such- und Rankingqualität anhand detaillierter Richtlinien zu bewerten.
Forschungsinteresse
Ekrems Arbeit konzentriert sich darauf zu messen, wie LLM- und Retrieval-Systeme in der Praxis funktionieren. Er entwirft das Test-Harness, führt die Workloads auf echter Hardware aus und vergleicht Models, Frameworks und Infrastruktur hinsichtlich Genauigkeit, Durchsatz, Latenz, Kosten und Skalierbarkeit – über den gesamten Stack von Embedding-Models und Vektordatenbanken bis hin zu Inference-Engines und GPU-Infrastruktur. Seine MSc-Arbeit automatisiert systematische Literaturrecherchen mit einer auf RAG basierenden Pipeline.
Ausbildung
Ekrem hat einen MSc in Management-Informationssystemen von der Başkent University, wo seine Abschlussarbeit systematische Literaturrecherchen mit einer auf RAG basierenden Pipeline automatisierte, und strebt einen zweiten MSc in Daten- und Wissensengineering an der Hacettepe University an.
Neueste Artikel von Ekrem
Vergleiche relationale Foundation-Modelle
Wir haben SAP-RPT-1-OSS mit Gradient Boosting (LightGBM, CatBoost) auf 17 tabellarischen Datensätzen verglichen, die das semantisch-numerische Spektrum abdecken: kleine, hochsemantische Tabellen, gemischte Geschäftsdatensätze und große, niedrigsemantische numerische Datensätze. Unser Ziel ist es zu messen, wo die vortrainierten semantischen Prioren eines relationalen LLM Vorteile gegenüber traditionellen Baummodellen bieten können und wo sie bei großem Umfang oder…
Top 70+ Cloud-GPU-Anbieter
Cloud-GPU-Anbieter lassen sich in drei Stufen einteilen. Hyperscaler betreiben breite Cloud-Plattformen, bei denen GPU-Vermietung ein Produkt unter vielen ist. Spezialisierte Neoclouds konzentrieren sich auf GPU- und KI-Infrastruktur als Kernprodukt. Community-Marktplätze bündeln Inventar vieler kleiner Betreiber, oft am unteren Ende der veröffentlichten Preisspanne. Spaltendefinitionen: Ranking: Abonnenten werden verlinkt und oben in der Tabelle hervorgehoben. Die übrigen…
Cloud-GPU-Preise, Leistung & Anbietervergleich
Cloud-GPU-Listenpreise für dasselbe Model können sich von Anbieter zu Anbieter um ein Vielfaches unterscheiden. Wir haben den niedrigsten Preis, den Anbieter, die Marktspanne und den Median für 40+ GPU-Konfigurationen über alle drei Preisstufen hinweg zusammengestellt, plus einen Durchsatz-pro-Dollar-Benchmark bei 10 Models. Hier sehen Sie die kosteneffizienteste GPU für Ihre Workload über 13 Hyperscaler- und Neocloud-Anbieter…
RAG Evaluierungs-Tools: Weights & Biases vs Ragas vs DeepEval
Wenn eine RAG-Pipeline den falschen Kontext abruft, generiert das LLM selbstbewusst die falsche Antwort. Kontextrelevanz-Scorer sind die erste Verteidigungslinie. Wir haben fünf Tools über 1.460 Fragen und 14.600+ bewertete Kontexte unter identischen Bedingungen einem Benchmark unterzogen: gleiches Judge-Modell (GPT-4o), Standardkonfigurationen und keine benutzerdefinierten Prompts. Unter Standardbedingungen erwiesen sich WandB, TruLens und Ragas als die besten…
Embedding-Models: OpenAI vs. Gemini vs. Voyage
Wir benchmarkten 15 englische Text-Embedding-Models und eine BM25-Baseline an über 500 manuell kuratierten Queries über drei Retrieval-Domänen: Rechtsverträge (CUAD), Kundensupport (IBM TechQA) und Gesundheitswesen (MedRAG PubMed). Voyage-3.5 belegt insgesamt den ersten Platz. Perplexity Embed V1 0.6b erreicht die obere Mittelklasse zum niedrigsten Preispunkt in unserem Benchmark. nDCG@3: Normalisierter diskontierter kumulativer Gewinn bei Cutoff 3. Mit…
RAG-Frameworks: LangChain vs. LangGraph vs. LlamaIndex
Wir haben 5 RAG-Frameworks gebenchmarkt: LangChain, LangGraph, LlamaIndex, Haystack und DSPy, indem wir denselben agentischen RAG-Workflow mit standardisierten Komponenten erstellt haben: identische Modelle (GPT-4.1-mini), Embeddings (BGE-small), Retriever (Qdrant) und Tools (Tavily-Websuche). Dadurch werden der tatsächliche Overhead und die Token-Effizienz jedes Frameworks isoliert. Der Benchmark bestand aus 100 Anfragen, wobei jedes Framework den gesamten Satz 100…
Backup-Software-Benchmark: Acronis vs NinjaOne vs Comet vs MSP360
Wir haben NinjaOne Backup, Acronis Cyber Protect Cloud Backup, Comet Backup und MSP360 Managed Backup auf identischer AWS-Infrastruktur einem Benchmark unterzogen. Jeder Anbieter führte ein dateimodusbasiertes Backup derselben Arbeitslast mit 625.946 Dateien / 50 GB sowie ein vollständiges Image-Backup der Systemfestplatte durch und stellte anschließend das mittlere Unterverzeichnis mit 15 GB wieder her. Hier sind…
Open-Source-Embedding-Models-Benchmark für RAG
NVIDIA Llama-Embed-Nemotron-8B führt bei der Genauigkeit. Bei den Kosten läuft Googles EmbeddingGemma-300m etwa 4x günstiger als Nemotron, bei einem kleinen Verlust an Genauigkeit. nDCG@3: Normalisierter diskontierter kumulativer Gewinn bei Cutoff 3. Bei einem relevanten Dokument pro Anfrage beträgt er 1 / log2(Rang + 1), wenn das Gold-Dokument in den Top 3 landet, andernfalls 0. Rang…
Reranker-Benchmark: Top 8 Modelle im Vergleich
Wir haben 8 Reranker-Modelle auf ~145k englischen Amazon-Rezensionen getestet, um zu messen, wie stark eine Reranking-Stufe das Dense Retrieval verbessert. Wir haben Top-100-Kandidaten mit multilingual-e5-base abgerufen, sie mit jedem Modell neu gerankt und die Top-10-Ergebnisse anhand von 300 Anfragen bewertet, von denen sich jede auf konkrete Details aus ihrer Quell-Rezension bezieht. Der beste Reranker erhöhte…
LLM VRAM-Rechner für Self-Hosting
Self-Hosting eines LLMs bedeutet, Inferenz auf Hardware auszuführen, die der Betreiber kontrolliert, statt über eine API eines Drittanbieters, was Kosten, Datenkontrolle und Datenschutzprofil verändert. Ob ein Modell überhaupt läuft, hängt vom Speicher ab. Der Rechner schätzt den VRAM oder Unified Memory, den ein Modell lokal benötigt, basierend auf dem Modell, seiner Präzision, der Kontextlänge und…
AIMultiple Newsletter
1 kostenlose E-Mail pro Woche mit den neuesten B2B-Technachrichten und Experten Einblicken.