Ekrem Sarı
Ekrem ist KI-Forscher und Datenwissenschaftler bei AIMultiple. Er entwirft und führt praxisnahe Benchmarks für KI- und LLM-Systeme durch.
Berufserfahrung
Bei AIMultiple führt Ekrem Benchmarks für End-to-End-KI-Systeme durch und erstellt die Daten-Workflows und Dashboards, die zur Verfolgung von Benchmark- und Produktmetriken verwendet werden. Seine Benchmarks decken Embedding- und Reranker-Models, Vektor- und Graphdatenbanken, Inference-Engines, Quantisierung, GPU-Parallelität und Multi-GPU-Skalierung, Cloud-GPU-Preise und -Anbieter, Text-zu-SQL sowie RAG- und agentische RAG-Frameworks ab.
Vor AIMultiple arbeitete er als Datenwissenschaftler bei Yandex, wo er große Datensätze mit SQL abfragte und analysierte, um die Such- und Rankingqualität anhand detaillierter Richtlinien zu bewerten.
Forschungsinteresse
Ekrems Arbeit konzentriert sich darauf zu messen, wie LLM- und Retrieval-Systeme in der Praxis funktionieren. Er entwirft das Test-Harness, führt die Workloads auf echter Hardware aus und vergleicht Models, Frameworks und Infrastruktur hinsichtlich Genauigkeit, Durchsatz, Latenz, Kosten und Skalierbarkeit – über den gesamten Stack von Embedding-Models und Vektordatenbanken bis hin zu Inference-Engines und GPU-Infrastruktur. Seine MSc-Arbeit automatisiert systematische Literaturrecherchen mit einer auf RAG basierenden Pipeline.
Ausbildung
Ekrem hat einen MSc in Management-Informationssystemen von der Başkent University, wo seine Abschlussarbeit systematische Literaturrecherchen mit einer auf RAG basierenden Pipeline automatisierte, und strebt einen zweiten MSc in Daten- und Wissensengineering an der Hacettepe University an.
Neueste Artikel von Ekrem
Remote Browser: Web-Infrastruktur für KI-Agenten im Vergleich
KI-Agenten sind auf Remote-Browser angewiesen, um Web-Aufgaben zu automatisieren, ohne von Anti-Scraping-Maßnahmen blockiert zu werden. Die Leistung dieser Browser-Infrastruktur ist entscheidend für den Erfolg eines Agenten. Wir haben 8 Anbieter hinsichtlich Erfolgsrate, Geschwindigkeit und Funktionen einem Benchmark unterzogen. Dazu haben wir 160 automatisierte Aufgaben ausgeführt und 4 verschiedene Szenarien jeweils 5 Mal pro Dienst durchlaufen,…
Beste RAG Tools, Frameworks und Bibliotheken
RAG verbessert LLM-Antworten, indem es sie auf externe Daten stützt, statt nur auf das, was das Modell im Training auswendig gelernt hat. Wir haben die Komponenten, aus denen ein RAG-System besteht, einem Benchmark unterzogen und die Ergebnisse an einem Ort zusammengeführt, mit einem praktischen Leitfaden zur Auswahl jedes Teils des Stacks. Siehe unsere Benchmark-Ergebnisse für…
Top 30+ KI-Chip-Hersteller: NVIDIA & seine Konkurrenten
Basierend auf unseren Erfahrungen mit dem Cloud-GPU-Benchmark von AIMultiple mit 10 verschiedenen GPU-Modellen in 4 verschiedenen Szenarien sind dies die führenden KI-Hardware-Unternehmen für Rechenzentrums-Workloads. *Ausgewählter KI-Chip ist die Komponente, Plattform oder das angekündigte Projekt, das den jeweiligen Anbieter am besten repräsentiert. Bei einigen Einträgen handelt es sich um Systeme, Dienste oder lizenzierbares geistiges Eigentum statt…
Cloud-GPU-Mietpreisindex
Die On-Demand-Preise für die neuesten Cloud-GPUs (B200, B300, MI300X, RTX 5090) haben sich im vergangenen Jahr grob verdoppelt, während Mainstream-Karten (H100, H200, A100) in einem engen Band blieben. Wir erstellen den GPU-Index monatlich aus 69 Anbietern und 17 GPU-Modellen und decken On-Demand-, Spot- und 1-Jahres-Reservierungsstufen ab. Das Diagramm zeigt den monatlichen Medianpreis über drei Buckets…
Text-zu-SQL: Vergleich der LLM-Genauigkeit
Wir haben 36 große Sprachmodelle über 759 Fragen aus BIRD-SQL ausgeführt, wobei jedes Modell SQL gegen eine Datenbank schrieb, die es selbst aus 11 Kandidaten identifizieren musste. Jede parsebare Abfrage wurde gegen die echte Datenbank ausgeführt und ihre Ergebnismenge mit der Ergebnismenge der Gold-Abfrage von BIRD verglichen. Fehlende, fehlerhafte und bei der Ausführung fehlgeschlagene Abfragen…
GPU Parallelitäts-Benchmark: H100 vs H200 vs B200 vs MI300X
Ich habe die letzten 20 Jahre auf die Optimierung der Rechenleistung auf Systemebene konzentriert. Wir haben die neuesten NVIDIA-GPUs getestet, einschließlich der NVIDIA’s H100, H200 und B200 sowie der AMD’s MI300X, um die Parallelitätsskalierung zu analysieren. Unter Verwendung des vLLM-Framework mit dem gpt-oss-20b model haben wir getestet, wie diese GPUs gleichzeitige Anfragen von 1 bis…
Bot-Erkennung: 9 Anti-Bot-Anbieter im Benchmark
Wir haben zwei Benchmarks gegen Live-Websites ausgeführt, dann das Anti-Bot-Unternehmen vor jeder Domain identifiziert und gemessen, wie oft die Domains jedes Unternehmens den angeforderten Inhalt zurückgaben. Das umfasst über 3.800 gekennzeichnete Domains und über 50.000 Anfragen. Der erste Benchmark lud Produkt- und Suchseiten auf 100 E-Commerce-Domains, jeweils 50 URLs. Der zweite lud 10.000 allgemeine Web-URLs,…
E-Commerce-Scraper: 4 Anbieter im Benchmark
Wir haben vier Webdaten-Anbieter über 100 E-Commerce-Domains hinweg einem Benchmark unterzogen und dabei jeweils 65.000 Produkt- und Suchseiten mit 5 bis 5.000 gleichzeitigen Anfragen abgerufen. Über die Parallelitätsstufen gemittelt erreichte Bright Data die höchste Erfolgsrate (76 %) bei einem Median von 16 Sekunden. Apify verzeichnete die höchste mediane Antwortzeit mit 46 Sekunden. Die Antwortzeit wird als…
Agentische Suche: Benchmark von 8 Such-APIs für Agenten
Agentische Suche spielt eine entscheidende Rolle, wenn es darum geht, die Lücke zwischen herkömmlichen Suchmaschinen und KI-Suchfunktionen zu überbrücken. Such-APIs sind die erste Schicht eines agentischen Tools, bei der die Leistung die Qualität von allem nachgelagerten begrenzt. Wir haben 8 Such-APIs über 100 reale KI-/LLM-Anfragen hinweg einem Benchmark unterzogen und 4.000 abgerufene Ergebnisse mit einem…
Multimodale Embedding-Modelle: Apple vs Meta vs OpenAI
Multimodale Embedding-Modelle erkennen Objekte hervorragend, haben aber Schwierigkeiten mit Beziehungen. Aktuelle Modelle tun sich schwer, „Telefon auf einer Karte“ von „Karte auf einem Telefon“ zu unterscheiden. Wir haben 7 führende Modelle über MS-COCO und Winoground einem Benchmark unterzogen, um diese spezifische Einschränkung zu messen. Um einen fairen Vergleich zu gewährleisten, haben wir jedes Modell unter…
AIMultiple Newsletter
1 kostenlose E-Mail pro Woche mit den neuesten B2B-Technachrichten und Experten Einblicken.