Ekrem Sarı
Ekrem ist KI-Forscher und Datenanalyst bei AIMultiple. Er entwirft und führt praxisnahe Benchmarks für KI- und LLM-Systeme durch.
Berufserfahrung
Bei AIMultiple führt Ekrem Benchmarks für End-to-End-KI-Systeme durch und erstellt die Daten-Workflows und Dashboards zur Verfolgung von Benchmark- und Produktmetriken. Seine Benchmarks umfassen Embedding- und Reranker-Models, Vektor- und Graphdatenbanken, Inference-Engines, Quantisierung, GPU-Nebenläufigkeit und Multi-GPU-Skalierung, Cloud-GPU-Preise und -Anbieter, Text-zu-SQL sowie RAG- und agentische RAG-Frameworks.
Vor AIMultiple war er als Assessor bei Yandex tätig, wo er die Suchqualität bewertete und große Datenmengen anhand detaillierter Richtlinien kennzeichnete, um Ranking- und Model-Qualität zu unterstützen.
Forschungsinteresse
Ekrems Arbeit konzentriert sich auf den MLOps- und LLMOps-Lebenszyklus sowie auf die Messung der Leistung von KI-Systemen. Er vergleicht Models, Frameworks und Infrastruktur anhand von Metriken wie Genauigkeit, Durchsatz, API-Kosten und Skalierbarkeit, über den gesamten Stack von Embedding-Models und Vektordatenbanken bis hin zu GPU- und Cloud-Infrastruktur. Seine MSc-Arbeit automatisiert systematische Literaturreviews mit einer RAG-basierten Pipeline.
Ausbildung
Ekrem hat einen BA von der Hacettepe University und schließt gerade einen MSc an der Başkent University ab.
Neueste Artikel von Ekrem
Agentic RAG-Benchmark: Multidatenbank-Routing über 36 LLMs
Wir haben 36 große Sprachmodelle beim Cross-Database-Routing getestet. Jedes Modell erhält eine natürlichsprachliche Frage und 11 SQL-Datenbanken, die auf Absatzebene beschrieben sind, und muss dann entscheiden, welche Datenbank die Antwort enthält, bevor es SQL schreibt. Die 11 Datenbanken wurden aus 80 BIRD-SQL-Kandidaten ausgewählt, indem ihre Beschreibungseinbettungen geclustert wurden, sodass die Kandidaten semantisch nahe beieinander liegen…
Top 60+ Cloud GPU Anbieter
Cloud-GPU-Anbieter lassen sich in drei Stufen einteilen. Hyperscaler betreiben breite Cloud-Plattformen, bei denen die GPU-Vermietung nur eines von vielen Produkten ist. Spezialisierte Neoclouds konzentrieren sich auf GPU- und KI-Infrastruktur als ihr Kernprodukt. Community-Marktplätze bündeln das Inventar vieler kleiner Betreiber, oft zum unteren Ende der veröffentlichten Preisspanne. Wir verfolgen 71 Cloud-GPU-Anbieter und 14 kuratierte GPU-Modellfamilien mit…
Text-zu-SQL: Vergleich der LLM-Genauigkeit
Wir führten 36 große Sprachmodelle über 759 Fragen aus BIRD-SQL durch, wobei jedes Modell SQL gegen eine Datenbank schrieb, die es selbst aus 11 Kandidaten identifizieren musste. Jede ausführbare Abfrage wurde gegen die echte Datenbank ausgeführt und ihre Ergebnismenge mit der Ergebnismenge der Gold-Abfrage von BIRD verglichen. Fehlende, fehlerhaft formatierte und ausführungsfehlschlagende Abfragen wurden als…
RAG Frameworks: LangChain vs LangGraph vs LlamaIndex
Wir haben 5 RAG-Frameworks einem Benchmark-Test unterzogen: LangChain, LangGraph, LlamaIndex, Haystack und DSPy, indem wir denselben agentischen RAG-Workflow mit standardisierten Komponenten aufbauten: identische Modelle (GPT-4.1-mini), Embeddings (BGE-small), Retriever (Qdrant) und Tools (Tavily-Websuche). Dies isoliert den tatsächlichen Overhead und die Token-Effizienz jedes Frameworks. Der Benchmark bestand aus 100 Abfragen, wobei jedes Framework den gesamten Satz 100…
Backup-Software-Benchmark: Acronis vs NinjaOne vs Comet vs MSP360
Wir haben NinjaOne Backup, Acronis Cyber Protect Cloud Backup, Comet Backup und MSP360 Managed Backup auf identischer AWS-Infrastruktur getestet. Jeder Anbieter führte eine dateibasierte Sicherung derselben 625.946-Dateien / 50 GB Workload und eine vollständige Image-Sicherung des Systemlaufwerks durch und stellte dann das 15 GB große mittlere Unterverzeichnis wieder her. Hier sind die vier Backup-Produkte, die…
Vergleiche relationale Foundation-Modelle
Wir haben SAP-RPT-1-OSS mit Gradient Boosting (LightGBM, CatBoost) auf 17 tabellarischen Datensätzen verglichen, die das semantisch-numerische Spektrum abdecken: kleine, hochsemantische Tabellen, gemischte Geschäftsdatensätze und große, niedrigsemantische numerische Datensätze. Unser Ziel ist es zu messen, wo die vortrainierten semantischen Prioren eines relationalen LLM Vorteile gegenüber traditionellen Baummodellen bieten können und wo sie bei großem Umfang oder…
Agentische Suche: Benchmark von 8 Such-APIs für Agenten
Agentische Suche spielt eine entscheidende Rolle dabei, die Kluft zwischen traditionellen Suchmaschinen und KI-Suchfähigkeiten zu überbrücken. Such-APIs sind die erste Schicht eines agentischen Werkzeugs, wobei die Leistungsfähigkeit die Qualität aller nachgelagerten Prozesse begrenzt. Wir haben 8 Such-APIs anhand von 100 echten KI/LLM-Abfragen einem Benchmark unterzogen und 4.000 abgerufene Ergebnisse mit einem LLM-Richter bewertet, der jedes…
DLP-Software-Benchmark
Wir haben Acronis DeviceLock DLP und ManageEngine DLP Plus auf identischen Windows Server 2022 VMs mit 28 Szenarien verglichen: 23 Datenleck-Tests (darunter 12 Adversarial-Evasion-Dateien), 3 Agentensicherheitstests und 2 Tests unter hoher CPU- und Arbeitsspeicherauslastung. Für die anderen DLP-Produkte, Netwrix Endpoint Protector, Sophos Intercept X, Teramind DLP und Trellix DLP, haben wir deren Funktionen überprüft. Wir…
Reranker-Benchmark: Top-8-Models im Vergleich
Wir haben 8 Reranker-Models auf ~145k englischen Amazon-Rezensionen evaluiert, um zu messen, wie stark eine Reranking-Stufe die Dense Retrieval verbessert. Wir haben Top-100-Kandidaten mit multilingual-e5-base abgerufen, sie mit jedem Model neu gerankt und die Top-10-Ergebnisse anhand von 300 Queries bewertet, die jeweils auf konkrete Details aus ihrer Quellbewertung verweisen. Der beste Reranker steigerte Hit@1 von…
GPU-Nebenläufigkeits-Benchmark: H100 vs H200 vs B200 vs MI300X
Ich habe die letzten 20 Jahre damit verbracht, mich auf systemnahe Rechenleistungsoptimierung zu konzentrieren. Wir haben die neuesten NVIDIA-GPUs, darunter die NVIDIA H100, H200 und B200 sowie die AMD MI300X, auf ihre Skalierbarkeit bei Nebenläufigkeit getestet. Mit dem vLLM-Framework und dem gpt-oss-20b-Modell untersuchten wir, wie diese GPUs gleichzeitige Anfragen von 1 bis 512 verarbeiten. Durch…
AIMultiple Newsletter
1 kostenlose E-Mail pro Woche mit den neuesten B2B-Technachrichten und Experten Einblicken.