Dienstleistungen
Kontaktieren
Ekrem Sarı

Ekrem Sarı

KI-Forscher
35 Artikel
Bleiben Sie über B2B-Technologie auf dem Laufenden

Ekrem ist KI-Forscher und Datenanalyst bei AIMultiple. Er entwirft und führt praxisnahe Benchmarks für KI- und LLM-Systeme durch.

Berufserfahrung

Bei AIMultiple führt Ekrem Benchmarks für End-to-End-KI-Systeme durch und erstellt die Daten-Workflows und Dashboards zur Verfolgung von Benchmark- und Produktmetriken. Seine Benchmarks umfassen Embedding- und Reranker-Models, Vektor- und Graphdatenbanken, Inference-Engines, Quantisierung, GPU-Nebenläufigkeit und Multi-GPU-Skalierung, Cloud-GPU-Preise und -Anbieter, Text-zu-SQL sowie RAG- und agentische RAG-Frameworks.

Vor AIMultiple war er als Assessor bei Yandex tätig, wo er die Suchqualität bewertete und große Datenmengen anhand detaillierter Richtlinien kennzeichnete, um Ranking- und Model-Qualität zu unterstützen.

Forschungsinteresse

Ekrems Arbeit konzentriert sich auf den MLOps- und LLMOps-Lebenszyklus sowie auf die Messung der Leistung von KI-Systemen. Er vergleicht Models, Frameworks und Infrastruktur anhand von Metriken wie Genauigkeit, Durchsatz, API-Kosten und Skalierbarkeit, über den gesamten Stack von Embedding-Models und Vektordatenbanken bis hin zu GPU- und Cloud-Infrastruktur. Seine MSc-Arbeit automatisiert systematische Literaturreviews mit einer RAG-basierten Pipeline.

Ausbildung

Ekrem hat einen BA von der Hacettepe University und schließt gerade einen MSc an der Başkent University ab.

Neueste Artikel von Ekrem

Daten
Benchmark
2. Jul

Remote-Browser: Web-Infrastruktur für KI-Agenten im Vergleich

KI-Agenten sind auf Remote-Browser angewiesen, um Webaufgaben zu automatisieren, ohne von Anti-Scraping-Maßnahmen blockiert zu werden. Die Leistung dieser Browser-Infrastruktur ist entscheidend für den Erfolg eines Agenten. Wir haben 8 Anbieter hinsichtlich Erfolgsquote, Geschwindigkeit und Funktionen bewertet. Dazu haben wir 160 automatisierte Aufgaben ausgeführt und 4 verschiedene Szenarien 5 Mal für jeden Dienst durchgetestet, um ihre…

KI
Benchmark
1. Jul

LLM Inference-Engines: vLLM vs LMDeploy vs SGLang

Wir haben 3 führende LLM Inference-Engines auf NVIDIA H100 verglichen: vLLM, LMDeploy und SGLang. Jede Engine verarbeitete identische Workloads: 1.000 ShareGPT-Prompts mit Llama 3.1 8B-Instruct, um die tatsächliche Leistungsauswirkung ihrer Architekturentscheidungen und Optimierungsstrategien zu isolieren. Wir haben den Offline-Batch-Durchsatz über 10.000 gesamte Inferenzoperationen gemessen (1.000 Prompts × 10 Durchläufe pro Engine), um statistische Stabilität zu…

KI
Benchmark
30. Jun

Top 10 Multilinguale Embedding-Modelle für RAG

Wir haben 10 multilinguale Embedding-Modelle anhand von ~606k Amazon-Bewertungen in 6 Sprachen (Deutsch, Englisch, Spanisch, Französisch, Japanisch, Chinesisch) verglichen. Wir haben 1.800 Abfragen (300 pro Sprache) generiert, die jeweils konkrete Details aus der ursprünglichen Bewertung referenzieren. Modelle, die für die Suche trainiert wurden (Trennung von Abfrage und Dokument), übertreffen größere Modelle, die für allgemeine Textähnlichkeit…

KI
Benchmark
30. Jun

Mehr-GPU-Benchmark: B200 vs H200 vs H100 vs MI300X

Seit über zwei Jahrzehnten ist die Optimierung der Rechenleistung ein Eckpfeiler meiner Arbeit. Wir haben die GPUs von NVIDIA (B200, H200, H100) und AMD (MI300X) getestet, um zu bewerten, wie gut sie sich für die Inferenz von Large Language Models (LLM) skalieren lassen. Mit dem vLLM-Framework und dem Modell meta-llama/Llama-3.1-8B-Instruct führten wir Tests mit 1,…

KI
Benchmark
15. Apr

LLM Quantisierung: BF16 vs FP8 vs INT4

Wir haben Qwen3-32B auf 4 Genauigkeitsstufen (BF16, FP8, GPTQ-Int8, GPTQ-Int4) auf einer einzelnen NVIDIA H100 80GB GPU getestet. Jede Konfiguration wurde auf 2 Benchmarks (~12,2K Fragen) bewertet, die Wissen und Code-Generierung abdecken, sowie auf 2.000+ Inferenzläufen zur Messung des Durchsatzes. Int4 ist 2,7-mal schneller als BF16, verliert jedoch weniger als 2 Punkte auf MMLU-Pro, während…