Ekrem Sarı
Ekrem ist KI-Forscher und Datenanalyst bei AIMultiple. Er entwirft und führt praxisnahe Benchmarks für KI- und LLM-Systeme durch.
Berufserfahrung
Bei AIMultiple führt Ekrem Benchmarks für End-to-End-KI-Systeme durch und erstellt die Daten-Workflows und Dashboards zur Verfolgung von Benchmark- und Produktmetriken. Seine Benchmarks umfassen Embedding- und Reranker-Models, Vektor- und Graphdatenbanken, Inference-Engines, Quantisierung, GPU-Nebenläufigkeit und Multi-GPU-Skalierung, Cloud-GPU-Preise und -Anbieter, Text-zu-SQL sowie RAG- und agentische RAG-Frameworks.
Vor AIMultiple war er als Assessor bei Yandex tätig, wo er die Suchqualität bewertete und große Datenmengen anhand detaillierter Richtlinien kennzeichnete, um Ranking- und Model-Qualität zu unterstützen.
Forschungsinteresse
Ekrems Arbeit konzentriert sich auf den MLOps- und LLMOps-Lebenszyklus sowie auf die Messung der Leistung von KI-Systemen. Er vergleicht Models, Frameworks und Infrastruktur anhand von Metriken wie Genauigkeit, Durchsatz, API-Kosten und Skalierbarkeit, über den gesamten Stack von Embedding-Models und Vektordatenbanken bis hin zu GPU- und Cloud-Infrastruktur. Seine MSc-Arbeit automatisiert systematische Literaturreviews mit einer RAG-basierten Pipeline.
Ausbildung
Ekrem hat einen BA von der Hacettepe University und schließt gerade einen MSc an der Başkent University ab.
Neueste Artikel von Ekrem
Benchmark der Open-Source-Embedding-Modelle für RAG
NVIDIA Llama-Embed-Nemotron-8B führt bei der Genauigkeit. Bei den Kosten läuft Googles EmbeddingGemma-300m etwa 4x günstiger als Nemotron, bei einem kleinen Genauigkeitsverlust. nDCG@3: Normalisierter diskontierter kumulativer Gewinn bei Cutoff 3. Bei einem relevanten Dokument pro Abfrage beträgt er 1 / log2(Rang + 1), wenn das Golddokument unter den Top 3 landet, andernfalls 0. Rang 1 erzielt…
Multimodale Embedding-Modelle: Apple vs Meta vs OpenAI
Multimodale Embedding-Modelle erkennen Objekte hervorragend, haben aber Schwierigkeiten mit Beziehungen. Aktuelle Modelle tun sich schwer, „Telefon auf einer Karte“ von „Karte auf einem Telefon“ zu unterscheiden. Wir haben 7 führende Modelle über MS-COCO und Winoground einem Benchmark unterzogen, um diese spezifische Einschränkung zu messen. Um einen fairen Vergleich zu gewährleisten, haben wir jedes Modell unter…
Benchmark von 40+ LLMs im Finanzwesen: Claude Fable 5 & GPT-5.6 Sol
Wir haben 40+ LLMs im Finanzwesen anhand von 238 schwierigen Fragen aus dem FinanceReasoning-Benchmark evaluiert, um herauszufinden, welche Modelle bei komplexen Finanzlogik-Aufgaben wie Bilanzanalyse, Prognosen und Kennzahlenberechnungen hervorragend sind. Wir haben LLMs auf 238 schwierigen Fragen aus dem FinanceReasoning-Benchmark (Tang et al.) evaluiert.1 Diese Untergruppe zielt auf die anspruchsvollsten Finanzlogik-Aufgaben ab und bewertet komplexe, mehrstufige…
Embedding-Modelle: OpenAI vs. Gemini vs. Voyage
Wir haben 15 englische Text-Embedding-Modelle und eine BM25-Baseline an über 500 manuell kuratierten Abfragen in drei Retrieval-Domänen einem Benchmark unterzogen: Vertragsrecht (CUAD), Kundensupport (IBM TechQA) und Gesundheitswesen (MedRAG PubMed). Voyage-3.5 liegt insgesamt auf Platz 1. Perplexity Embed V1 0.6b erreicht das obere Mittelfeld zum niedrigsten Preis in unserem Benchmark. nDCG@3: Normalized discounted cumulative gain bei…
E-Mail-Archivierungssoftware-Benchmark
Wir haben einen Microsoft 365 Mandanten bereitgestellt, ihn mit einem synthetischen Korpus aus 10.000 E-Mails und 1.700 Anhängen über 8 Dateityp-Untertypen befüllt und anschließend NinjaOne SaaS Archiver, Barracuda Cloud Archiving Service, Acronis Cyber Protect Cloud Email Archiving und MailPiler auf demselben Mandanten anhand von 10 Dimensionen einem Benchmark unterzogen, die Erfassung, Suche, Anhangs-Wiederauffindung, Export, Unveränderbarkeit,…
E-Commerce-Scraper: 4 Anbieter im Benchmark
Wir haben vier Webdaten-Anbieter über 100 E-Commerce-Domains hinweg in einem Benchmark getestet und dabei 65.000 Produkt- und Suchseiten mit jeweils 5 bis 5.000 gleichzeitigen Anfragen abgerufen. Über die Parallelitätsstufen gemittelt erreichte Bright Data die höchste Erfolgsquote (76 %) bei einem Median von 16 Sekunden. Apify verzeichnete die höchste mediane Antwortzeit mit 46 Sekunden. Die Antwortzeit wird…
Disaster-Recovery-Benchmark: Acronis vs Comet vs MSP360
Wir haben Acronis Cyber Protect Cloud, Comet Backup und MSP360 Managed Backup in Sachen Disaster Recovery bewertet. Jeder Anbieter erstellte ein Image eines Live-Windows-Server-2022 und eines Live-Ubuntu-24.04-Servers, auf denen dieselbe deterministische Workload lief: ein Webdienst, eine Datenbank mit 10.000 Zeilen und 50 Dateien. Anschließend wurde die gesamte Maschine auf einem separaten Server wiederhergestellt, nachdem ein…
Graphdatenbank-Benchmark: Neo4j vs FalkorDB vs Memgraph
Wir haben Neo4j, FalkorDB und Memgraph anhand eines synthetischen Graphen einem Benchmark unterzogen, der aus 120.000 Amazon-Produktbewertungen abgeleitet wurde (381K Knoten, 804K Kanten). Wir führten 12 Abfragevorlagen mit jeweils 1.000 Messungen aus, testeten die Datenaufnahme bei 6 Stapelgrößen, hielten eine gleichzeitige Last für 60 Sekunden bei bis zu 32 Threads aufrecht und maßen Speicher, Kaltstart,…
Bot-Erkennung: 9 Anti-Bot-Anbieter im Benchmark
Wir haben zwei Benchmarks gegen Live-Websites ausgeführt, dann das Anti-Bot-Unternehmen vor jeder Domain identifiziert und gemessen, wie oft die Domains jedes Unternehmens den angeforderten Inhalt zurückgaben. Das umfasst über 3.800 gekennzeichnete Domains und über 50.000 Anfragen. Der erste Benchmark lud Produkt- und Suchseiten auf 100 E-Commerce-Domains, jeweils 50 URLs. Der zweite lud 10.000 allgemeine Web-URLs,…
Top 30+ KI-Chip-Hersteller: NVIDIA & seine Konkurrenten
Basierend auf unserer Erfahrung mit dem Cloud-GPU-Benchmark von AIMultiple mit 10 verschiedenen GPU-Modellen in 4 verschiedenen Szenarien sind dies die führenden KI-Hardware-Unternehmen für Rechenzentrums-Workloads. *Der ausgewählte KI-Chip ist die Komponente, Plattform oder das angekündigte Projekt, das jeden Anbieter am besten repräsentiert. Einige Einträge sind Systeme, Dienste oder lizenzierbare IPs und nicht ein einzelner Chip. Sortierung…
AIMultiple Newsletter
1 kostenlose E-Mail pro Woche mit den neuesten B2B-Technachrichten und Experten Einblicken.