Ekrem Sarı
Ekrem ist KI-Forscher und Datenwissenschaftler bei AIMultiple. Er entwirft und führt praxisnahe Benchmarks für KI- und LLM-Systeme durch.
Berufserfahrung
Bei AIMultiple führt Ekrem Benchmarks für End-to-End-KI-Systeme durch und erstellt die Daten-Workflows und Dashboards, die zur Verfolgung von Benchmark- und Produktmetriken verwendet werden. Seine Benchmarks decken Embedding- und Reranker-Models, Vektor- und Graphdatenbanken, Inference-Engines, Quantisierung, GPU-Parallelität und Multi-GPU-Skalierung, Cloud-GPU-Preise und -Anbieter, Text-zu-SQL sowie RAG- und agentische RAG-Frameworks ab.
Vor AIMultiple arbeitete er als Datenwissenschaftler bei Yandex, wo er große Datensätze mit SQL abfragte und analysierte, um die Such- und Rankingqualität anhand detaillierter Richtlinien zu bewerten.
Forschungsinteresse
Ekrems Arbeit konzentriert sich darauf zu messen, wie LLM- und Retrieval-Systeme in der Praxis funktionieren. Er entwirft das Test-Harness, führt die Workloads auf echter Hardware aus und vergleicht Models, Frameworks und Infrastruktur hinsichtlich Genauigkeit, Durchsatz, Latenz, Kosten und Skalierbarkeit – über den gesamten Stack von Embedding-Models und Vektordatenbanken bis hin zu Inference-Engines und GPU-Infrastruktur. Seine MSc-Arbeit automatisiert systematische Literaturrecherchen mit einer auf RAG basierenden Pipeline.
Ausbildung
Ekrem hat einen MSc in Management-Informationssystemen von der Başkent University, wo seine Abschlussarbeit systematische Literaturrecherchen mit einer auf RAG basierenden Pipeline automatisierte, und strebt einen zweiten MSc in Daten- und Wissensengineering an der Hacettepe University an.
Neueste Artikel von Ekrem
Benchmark von 40+ LLMs im Finanzwesen: Claude Fable 5 & GPT-5.6 Sol
Wir haben 40+ LLMs im Finanzwesen anhand von 238 schwierigen Fragen aus dem FinanceReasoning-Benchmark evaluiert, um herauszufinden, welche Modelle bei komplexen Finanzlogik-Aufgaben wie Bilanzanalyse, Prognosen und Kennzahlenberechnungen hervorragend sind. Wir haben LLMs auf 238 schwierigen Fragen aus dem FinanceReasoning-Benchmark (Tang et al.) evaluiert.1 Diese Untergruppe zielt auf die anspruchsvollsten Finanzlogik-Aufgaben ab und bewertet komplexe, mehrstufige…
E-Mail-Archivierungssoftware-Benchmark
Wir haben einen Microsoft 365 Mandanten bereitgestellt, ihn mit einem synthetischen Korpus aus 10.000 E-Mails und 1.700 Anhängen über 8 Dateityp-Untertypen befüllt und anschließend NinjaOne SaaS Archiver, Barracuda Cloud Archiving Service, Acronis Cyber Protect Cloud Email Archiving und MailPiler auf demselben Mandanten anhand von 10 Dimensionen einem Benchmark unterzogen, die Erfassung, Suche, Anhangs-Wiederauffindung, Export, Unveränderbarkeit,…
Disaster-Recovery-Benchmark: Acronis vs Comet vs MSP360
Wir haben Acronis Cyber Protect Cloud, Comet Backup und MSP360 Managed Backup in Sachen Disaster Recovery bewertet. Jeder Anbieter erstellte ein Image eines Live-Windows-Server-2022 und eines Live-Ubuntu-24.04-Servers, auf denen dieselbe deterministische Workload lief: ein Webdienst, eine Datenbank mit 10.000 Zeilen und 50 Dateien. Anschließend wurde die gesamte Maschine auf einem separaten Server wiederhergestellt, nachdem ein…
Graphdatenbank-Benchmark: Neo4j vs FalkorDB vs Memgraph
Wir haben Neo4j, FalkorDB und Memgraph anhand eines synthetischen Graphen einem Benchmark unterzogen, der aus 120.000 Amazon-Produktbewertungen abgeleitet wurde (381K Knoten, 804K Kanten). Wir führten 12 Abfragevorlagen mit jeweils 1.000 Messungen aus, testeten die Datenaufnahme bei 6 Stapelgrößen, hielten eine gleichzeitige Last für 60 Sekunden bei bis zu 32 Threads aufrecht und maßen Speicher, Kaltstart,…
Agentic RAG-Benchmark: Multidatenbank-Routing über 36 LLMs
Wir haben 36 große Sprachmodelle beim Cross-Database-Routing getestet. Jedes Modell erhält eine natürlichsprachliche Frage und 11 SQL-Datenbanken, die auf Absatzebene beschrieben sind, und muss dann entscheiden, welche Datenbank die Antwort enthält, bevor es SQL schreibt. Die 11 Datenbanken wurden aus 80 BIRD-SQL-Kandidaten ausgewählt, indem ihre Beschreibungseinbettungen geclustert wurden, sodass die Kandidaten semantisch nahe beieinander liegen…
DLP-Software-Benchmark
Wir haben Acronis DeviceLock DLP und ManageEngine DLP Plus auf identischen Windows Server 2022 VMs mit 28 Szenarien verglichen: 23 Datenleck-Tests (darunter 12 Adversarial-Evasion-Dateien), 3 Agentensicherheitstests und 2 Tests unter hoher CPU- und Arbeitsspeicherauslastung. Für die anderen DLP-Produkte, Netwrix Endpoint Protector, Sophos Intercept X, Teramind DLP und Trellix DLP, haben wir deren Funktionen überprüft. Wir…
Großangelegtes Web Scraping: 7 Anbieter im Benchmark
Wir führten zwei Benchmarks gegen Live-Websites durch, von 5 bis 5.000 gleichzeitigen Anfragen. Der erste schickte 260.000 Anfragen durch vier Web Unblocker über die Tranco-Top-10.000-Domains sowie einen Markdown-Extraktionstest auf 10.000 URLs. Der zweite holte 65.000 Produkt- und Suchseiten von jedem der fünf Scraping-Anbieter über 100 E-Commerce-Domains. Erklärung der Metriken Inhaltlich verifizierte Erfolgsquote: der Anteil der…
Vergleich der Top 6 kostenlosen Cloud-GPU-Dienste
Die beste kostenlos GPU-Stufe ist etwa $19 pro Monat zu Mietpreisen wert, und acht Plattformen bieten eine echte GPU ohne Kreditkarte. Sechs davon begrenzen die kostenlos Nutzung pro Monat, und wir haben diese zum günstigsten aktuellen On-Demand-Tarif für jede GPU in unseren Cloud-GPU-Preisdaten bewertet. Jeder Balken stellt die Mietkosten derselben GPU-Zeit dar, berechnet als die…
Vektordatenbank-Dimensionierungs- und Auswahlrechner
Die praktische Frage hinter einer selbst gehosteten Vektordatenbank für RAG ist, welche Engine auf einen bestimmten Server passt und welche die Arbeitslast ausschließt. Der folgende Rechner beantwortet beides, basierend auf unserem Benchmark von sieben selbst gehosteten Vektordatenbanken, die mit angeglichenem Recall auf identischen Embeddings getestet wurden. Fünf Kontrollkästchen oben im Rechner benennen fünf gängige RAG-Arbeitslasten,…
Vektordatenbank-Benchmark: 7 Open-Source-Engines für RAG
Wir haben sieben quelloffene, selbst gehostete Vektordatenbanken als Abrufschicht einer RAG-Pipeline getestet, wobei jede einzeln mit identischen bge-m3-Embeddings und realen medizinischen und technischen Anfragen ausgeführt wurde, sodass der Datenbankindex die einzige Variable war. Das Pensum umfasste MedRAG-50k, TechQA-28k und einen 2.25M-Vektor-Korpus über acht Dimensionen, von Genauigkeit und Abrufqualität über Geschwindigkeit, Speicher, gefilterte und hybride Suche,…
AIMultiple Newsletter
1 kostenlose E-Mail pro Woche mit den neuesten B2B-Technachrichten und Experten Einblicken.