Ekrem Sarı
Ekrem ist KI-Forscher und Datenwissenschaftler bei AIMultiple. Er entwirft und führt praxisnahe Benchmarks für KI- und LLM-Systeme durch.
Berufserfahrung
Bei AIMultiple führt Ekrem Benchmarks für End-to-End-KI-Systeme durch und erstellt die Daten-Workflows und Dashboards, die zur Verfolgung von Benchmark- und Produktmetriken verwendet werden. Seine Benchmarks decken Embedding- und Reranker-Models, Vektor- und Graphdatenbanken, Inference-Engines, Quantisierung, GPU-Parallelität und Multi-GPU-Skalierung, Cloud-GPU-Preise und -Anbieter, Text-zu-SQL sowie RAG- und agentische RAG-Frameworks ab.
Vor AIMultiple arbeitete er als Datenwissenschaftler bei Yandex, wo er große Datensätze mit SQL abfragte und analysierte, um die Such- und Rankingqualität anhand detaillierter Richtlinien zu bewerten.
Forschungsinteresse
Ekrems Arbeit konzentriert sich darauf zu messen, wie LLM- und Retrieval-Systeme in der Praxis funktionieren. Er entwirft das Test-Harness, führt die Workloads auf echter Hardware aus und vergleicht Models, Frameworks und Infrastruktur hinsichtlich Genauigkeit, Durchsatz, Latenz, Kosten und Skalierbarkeit – über den gesamten Stack von Embedding-Models und Vektordatenbanken bis hin zu Inference-Engines und GPU-Infrastruktur. Seine MSc-Arbeit automatisiert systematische Literaturrecherchen mit einer auf RAG basierenden Pipeline.
Ausbildung
Ekrem hat einen MSc in Management-Informationssystemen von der Başkent University, wo seine Abschlussarbeit systematische Literaturrecherchen mit einer auf RAG basierenden Pipeline automatisierte, und strebt einen zweiten MSc in Daten- und Wissensengineering an der Hacettepe University an.
Neueste Artikel von Ekrem
Top Serverless-Funktionen: Vercel vs Azure vs AWS
Serverless-Funktionen ermöglichen es Entwicklern, Code auszuführen, ohne einen Server verwalten zu müssen. So können sie sich auf das Schreiben und Bereitstellen von Anwendungen konzentrieren, während die Skalierung und Wartung der Infrastruktur automatisch im Hintergrund abläuft. In diesem Benchmark bewerteten wir 7 beliebte Cloud-Service-Anbieter gemäß unserer Methodik, um die Leistung ihrer Serverless-Funktionen zu testen. Wir maßen…
LLM Inference-Engines: vLLM vs LMDeploy vs SGLang
Wir haben 3 führende LLM Inference-Engines auf NVIDIA H100 verglichen: vLLM, LMDeploy und SGLang. Jede Engine verarbeitete identische Workloads: 1.000 ShareGPT-Prompts mit Llama 3.1 8B-Instruct, um die tatsächliche Leistungsauswirkung ihrer Architekturentscheidungen und Optimierungsstrategien zu isolieren. Wir haben den Offline-Batch-Durchsatz über 10.000 gesamte Inferenzoperationen gemessen (1.000 Prompts × 10 Durchläufe pro Engine), um statistische Stabilität zu…
Top 10 Multilinguale Embedding-Modelle für RAG
Wir haben 10 multilinguale Embedding-Modelle anhand von ~606k Amazon-Bewertungen in 6 Sprachen (Deutsch, Englisch, Spanisch, Französisch, Japanisch, Chinesisch) verglichen. Wir haben 1.800 Abfragen (300 pro Sprache) generiert, die jeweils konkrete Details aus der ursprünglichen Bewertung referenzieren. Modelle, die für die Suche trainiert wurden (Trennung von Abfrage und Dokument), übertreffen größere Modelle, die für allgemeine Textähnlichkeit…
Mehr-GPU-Benchmark: B200 vs H200 vs H100 vs MI300X
Seit über zwei Jahrzehnten ist die Optimierung der Rechenleistung ein Eckpfeiler meiner Arbeit. Wir haben die GPUs von NVIDIA (B200, H200, H100) und AMD (MI300X) getestet, um zu bewerten, wie gut sie sich für die Inferenz von Large Language Models (LLM) skalieren lassen. Mit dem vLLM-Framework und dem Modell meta-llama/Llama-3.1-8B-Instruct führten wir Tests mit 1,…
LLM Quantisierung: BF16 vs FP8 vs INT4
Wir haben Qwen3-32B auf 4 Genauigkeitsstufen (BF16, FP8, GPTQ-Int8, GPTQ-Int4) auf einer einzelnen NVIDIA H100 80GB GPU getestet. Jede Konfiguration wurde auf 2 Benchmarks (~12,2K Fragen) bewertet, die Wissen und Code-Generierung abdecken, sowie auf 2.000+ Inferenzläufen zur Messung des Durchsatzes. Int4 ist 2,7-mal schneller als BF16, verliert jedoch weniger als 2 Punkte auf MMLU-Pro, während…
AIMultiple Newsletter
1 kostenlose E-Mail pro Woche mit den neuesten B2B-Technachrichten und Experten Einblicken.