Dienstleistungen
Kontaktieren
Ekrem Sarı

Ekrem Sarı

KI-Forscher
35 Artikel
Bleiben Sie über B2B-Technologie auf dem Laufenden

Ekrem ist KI-Forscher und Datenwissenschaftler bei AIMultiple. Er entwirft und führt praxisnahe Benchmarks für KI- und LLM-Systeme durch.

Berufserfahrung

Bei AIMultiple führt Ekrem Benchmarks für End-to-End-KI-Systeme durch und erstellt die Daten-Workflows und Dashboards, die zur Verfolgung von Benchmark- und Produktmetriken verwendet werden. Seine Benchmarks decken Embedding- und Reranker-Models, Vektor- und Graphdatenbanken, Inference-Engines, Quantisierung, GPU-Parallelität und Multi-GPU-Skalierung, Cloud-GPU-Preise und -Anbieter, Text-zu-SQL sowie RAG- und agentische RAG-Frameworks ab.

Vor AIMultiple arbeitete er als Datenwissenschaftler bei Yandex, wo er große Datensätze mit SQL abfragte und analysierte, um die Such- und Rankingqualität anhand detaillierter Richtlinien zu bewerten.

Forschungsinteresse

Ekrems Arbeit konzentriert sich darauf zu messen, wie LLM- und Retrieval-Systeme in der Praxis funktionieren. Er entwirft das Test-Harness, führt die Workloads auf echter Hardware aus und vergleicht Models, Frameworks und Infrastruktur hinsichtlich Genauigkeit, Durchsatz, Latenz, Kosten und Skalierbarkeit – über den gesamten Stack von Embedding-Models und Vektordatenbanken bis hin zu Inference-Engines und GPU-Infrastruktur. Seine MSc-Arbeit automatisiert systematische Literaturrecherchen mit einer auf RAG basierenden Pipeline.

Ausbildung

Ekrem hat einen MSc in Management-Informationssystemen von der Başkent University, wo seine Abschlussarbeit systematische Literaturrecherchen mit einer auf RAG basierenden Pipeline automatisierte, und strebt einen zweiten MSc in Daten- und Wissensengineering an der Hacettepe University an.

Neueste Artikel von Ekrem

Daten
Benchmark
31. Aug

Remote Browser: Web-Infrastruktur für KI-Agenten im Vergleich

KI-Agenten sind auf Remote-Browser angewiesen, um Web-Aufgaben zu automatisieren, ohne von Anti-Scraping-Maßnahmen blockiert zu werden. Die Leistung dieser Browser-Infrastruktur ist entscheidend für den Erfolg eines Agenten. Wir haben 8 Anbieter hinsichtlich Erfolgsrate, Geschwindigkeit und Funktionen einem Benchmark unterzogen. Dazu haben wir 160 automatisierte Aufgaben ausgeführt und 4 verschiedene Szenarien jeweils 5 Mal pro Dienst durchlaufen,…

KI
Benchmark
31. Aug

Beste RAG Tools, Frameworks und Bibliotheken

RAG verbessert LLM-Antworten, indem es sie auf externe Daten stützt, statt nur auf das, was das Modell im Training auswendig gelernt hat. Wir haben die Komponenten, aus denen ein RAG-System besteht, einem Benchmark unterzogen und die Ergebnisse an einem Ort zusammengeführt, mit einem praktischen Leitfaden zur Auswahl jedes Teils des Stacks. Siehe unsere Benchmark-Ergebnisse für…

KI
Funktionsvergleich
26. Aug

Top 30+ KI-Chip-Hersteller: NVIDIA & seine Konkurrenten

Basierend auf unseren Erfahrungen mit dem Cloud-GPU-Benchmark von AIMultiple mit 10 verschiedenen GPU-Modellen in 4 verschiedenen Szenarien sind dies die führenden KI-Hardware-Unternehmen für Rechenzentrums-Workloads. *Ausgewählter KI-Chip ist die Komponente, Plattform oder das angekündigte Projekt, das den jeweiligen Anbieter am besten repräsentiert. Bei einigen Einträgen handelt es sich um Systeme, Dienste oder lizenzierbares geistiges Eigentum statt…

KI
Funktionsvergleich
25. Aug

Cloud-GPU-Mietpreisindex

Die On-Demand-Preise für die neuesten Cloud-GPUs (B200, B300, MI300X, RTX 5090) haben sich im vergangenen Jahr grob verdoppelt, während Mainstream-Karten (H100, H200, A100) in einem engen Band blieben. Wir erstellen den GPU-Index monatlich aus 69 Anbietern und 17 GPU-Modellen und decken On-Demand-, Spot- und 1-Jahres-Reservierungsstufen ab. Das Diagramm zeigt den monatlichen Medianpreis über drei Buckets…

KI
Benchmark
24. Aug

Text-zu-SQL: Vergleich der LLM-Genauigkeit

Wir haben 36 große Sprachmodelle über 759 Fragen aus BIRD-SQL ausgeführt, wobei jedes Modell SQL gegen eine Datenbank schrieb, die es selbst aus 11 Kandidaten identifizieren musste. Jede parsebare Abfrage wurde gegen die echte Datenbank ausgeführt und ihre Ergebnismenge mit der Ergebnismenge der Gold-Abfrage von BIRD verglichen. Fehlende, fehlerhafte und bei der Ausführung fehlgeschlagene Abfragen…

KI
Benchmark
24. Aug

GPU Parallelitäts-Benchmark: H100 vs H200 vs B200 vs MI300X

Ich habe die letzten 20 Jahre auf die Optimierung der Rechenleistung auf Systemebene konzentriert. Wir haben die neuesten NVIDIA-GPUs getestet, einschließlich der NVIDIA’s H100, H200 und B200 sowie der AMD’s MI300X, um die Parallelitätsskalierung zu analysieren. Unter Verwendung des vLLM-Framework mit dem gpt-oss-20b model haben wir getestet, wie diese GPUs gleichzeitige Anfragen von 1 bis…

Cybersicherheit
Benchmark
21. Aug

Bot-Erkennung: 9 Anti-Bot-Anbieter im Benchmark

Wir haben zwei Benchmarks gegen Live-Websites ausgeführt, dann das Anti-Bot-Unternehmen vor jeder Domain identifiziert und gemessen, wie oft die Domains jedes Unternehmens den angeforderten Inhalt zurückgaben. Das umfasst über 3.800 gekennzeichnete Domains und über 50.000 Anfragen. Der erste Benchmark lud Produkt- und Suchseiten auf 100 E-Commerce-Domains, jeweils 50 URLs. Der zweite lud 10.000 allgemeine Web-URLs,…

Daten
Benchmark
21. Aug

E-Commerce-Scraper: 4 Anbieter im Benchmark

Wir haben vier Webdaten-Anbieter über 100 E-Commerce-Domains hinweg einem Benchmark unterzogen und dabei jeweils 65.000 Produkt- und Suchseiten mit 5 bis 5.000 gleichzeitigen Anfragen abgerufen. Über die Parallelitätsstufen gemittelt erreichte Bright Data die höchste Erfolgsrate (76 %) bei einem Median von 16 Sekunden. Apify verzeichnete die höchste mediane Antwortzeit mit 46 Sekunden. Die Antwortzeit wird als…

Agentische KI
Benchmark
20. Aug

Agentische Suche: Benchmark von 8 Such-APIs für Agenten

Agentische Suche spielt eine entscheidende Rolle, wenn es darum geht, die Lücke zwischen herkömmlichen Suchmaschinen und KI-Suchfunktionen zu überbrücken. Such-APIs sind die erste Schicht eines agentischen Tools, bei der die Leistung die Qualität von allem nachgelagerten begrenzt. Wir haben 8 Such-APIs über 100 reale KI-/LLM-Anfragen hinweg einem Benchmark unterzogen und 4.000 abgerufene Ergebnisse mit einem…

KI
Benchmark
14. Aug

Multimodale Embedding-Modelle: Apple vs Meta vs OpenAI

Multimodale Embedding-Modelle erkennen Objekte hervorragend, haben aber Schwierigkeiten mit Beziehungen. Aktuelle Modelle tun sich schwer, „Telefon auf einer Karte“ von „Karte auf einem Telefon“ zu unterscheiden. Wir haben 7 führende Modelle über MS-COCO und Winoground einem Benchmark unterzogen, um diese spezifische Einschränkung zu messen. Um einen fairen Vergleich zu gewährleisten, haben wir jedes Modell unter…