Ekrem Sarı
Ekrem ist KI-Forscher und Datenanalyst bei AIMultiple. Er entwirft und führt praxisnahe Benchmarks für KI- und LLM-Systeme durch.
Berufserfahrung
Bei AIMultiple führt Ekrem Benchmarks für End-to-End-KI-Systeme durch und erstellt die Daten-Workflows und Dashboards zur Verfolgung von Benchmark- und Produktmetriken. Seine Benchmarks umfassen Embedding- und Reranker-Models, Vektor- und Graphdatenbanken, Inference-Engines, Quantisierung, GPU-Nebenläufigkeit und Multi-GPU-Skalierung, Cloud-GPU-Preise und -Anbieter, Text-zu-SQL sowie RAG- und agentische RAG-Frameworks.
Vor AIMultiple war er als Assessor bei Yandex tätig, wo er die Suchqualität bewertete und große Datenmengen anhand detaillierter Richtlinien kennzeichnete, um Ranking- und Model-Qualität zu unterstützen.
Forschungsinteresse
Ekrems Arbeit konzentriert sich auf den MLOps- und LLMOps-Lebenszyklus sowie auf die Messung der Leistung von KI-Systemen. Er vergleicht Models, Frameworks und Infrastruktur anhand von Metriken wie Genauigkeit, Durchsatz, API-Kosten und Skalierbarkeit, über den gesamten Stack von Embedding-Models und Vektordatenbanken bis hin zu GPU- und Cloud-Infrastruktur. Seine MSc-Arbeit automatisiert systematische Literaturreviews mit einer RAG-basierten Pipeline.
Ausbildung
Ekrem hat einen BA von der Hacettepe University und schließt gerade einen MSc an der Başkent University ab.
Neueste Artikel von Ekrem
Remote-Browser: Web-Infrastruktur für KI-Agenten im Vergleich
KI-Agenten sind auf Remote-Browser angewiesen, um Webaufgaben zu automatisieren, ohne von Anti-Scraping-Maßnahmen blockiert zu werden. Die Leistung dieser Browser-Infrastruktur ist entscheidend für den Erfolg eines Agenten. Wir haben 8 Anbieter hinsichtlich Erfolgsquote, Geschwindigkeit und Funktionen bewertet. Dazu haben wir 160 automatisierte Aufgaben ausgeführt und 4 verschiedene Szenarien 5 Mal für jeden Dienst durchgetestet, um ihre…
LLM Inference-Engines: vLLM vs LMDeploy vs SGLang
Wir haben 3 führende LLM Inference-Engines auf NVIDIA H100 verglichen: vLLM, LMDeploy und SGLang. Jede Engine verarbeitete identische Workloads: 1.000 ShareGPT-Prompts mit Llama 3.1 8B-Instruct, um die tatsächliche Leistungsauswirkung ihrer Architekturentscheidungen und Optimierungsstrategien zu isolieren. Wir haben den Offline-Batch-Durchsatz über 10.000 gesamte Inferenzoperationen gemessen (1.000 Prompts × 10 Durchläufe pro Engine), um statistische Stabilität zu…
Top 10 Multilinguale Embedding-Modelle für RAG
Wir haben 10 multilinguale Embedding-Modelle anhand von ~606k Amazon-Bewertungen in 6 Sprachen (Deutsch, Englisch, Spanisch, Französisch, Japanisch, Chinesisch) verglichen. Wir haben 1.800 Abfragen (300 pro Sprache) generiert, die jeweils konkrete Details aus der ursprünglichen Bewertung referenzieren. Modelle, die für die Suche trainiert wurden (Trennung von Abfrage und Dokument), übertreffen größere Modelle, die für allgemeine Textähnlichkeit…
Mehr-GPU-Benchmark: B200 vs H200 vs H100 vs MI300X
Seit über zwei Jahrzehnten ist die Optimierung der Rechenleistung ein Eckpfeiler meiner Arbeit. Wir haben die GPUs von NVIDIA (B200, H200, H100) und AMD (MI300X) getestet, um zu bewerten, wie gut sie sich für die Inferenz von Large Language Models (LLM) skalieren lassen. Mit dem vLLM-Framework und dem Modell meta-llama/Llama-3.1-8B-Instruct führten wir Tests mit 1,…
LLM Quantisierung: BF16 vs FP8 vs INT4
Wir haben Qwen3-32B auf 4 Genauigkeitsstufen (BF16, FP8, GPTQ-Int8, GPTQ-Int4) auf einer einzelnen NVIDIA H100 80GB GPU getestet. Jede Konfiguration wurde auf 2 Benchmarks (~12,2K Fragen) bewertet, die Wissen und Code-Generierung abdecken, sowie auf 2.000+ Inferenzläufen zur Messung des Durchsatzes. Int4 ist 2,7-mal schneller als BF16, verliert jedoch weniger als 2 Punkte auf MMLU-Pro, während…
AIMultiple Newsletter
1 kostenlose E-Mail pro Woche mit den neuesten B2B-Technachrichten und Experten Einblicken.