Dienstleistungen
Kontaktieren
Ekrem Sarı

Ekrem Sarı

KI-Forscher
35 Artikel
Bleiben Sie über B2B-Technologie auf dem Laufenden

Ekrem ist KI-Forscher und Datenanalyst bei AIMultiple. Er entwirft und führt praxisnahe Benchmarks für KI- und LLM-Systeme durch.

Berufserfahrung

Bei AIMultiple führt Ekrem Benchmarks für End-to-End-KI-Systeme durch und erstellt die Daten-Workflows und Dashboards zur Verfolgung von Benchmark- und Produktmetriken. Seine Benchmarks umfassen Embedding- und Reranker-Models, Vektor- und Graphdatenbanken, Inference-Engines, Quantisierung, GPU-Nebenläufigkeit und Multi-GPU-Skalierung, Cloud-GPU-Preise und -Anbieter, Text-zu-SQL sowie RAG- und agentische RAG-Frameworks.

Vor AIMultiple war er als Assessor bei Yandex tätig, wo er die Suchqualität bewertete und große Datenmengen anhand detaillierter Richtlinien kennzeichnete, um Ranking- und Model-Qualität zu unterstützen.

Forschungsinteresse

Ekrems Arbeit konzentriert sich auf den MLOps- und LLMOps-Lebenszyklus sowie auf die Messung der Leistung von KI-Systemen. Er vergleicht Models, Frameworks und Infrastruktur anhand von Metriken wie Genauigkeit, Durchsatz, API-Kosten und Skalierbarkeit, über den gesamten Stack von Embedding-Models und Vektordatenbanken bis hin zu GPU- und Cloud-Infrastruktur. Seine MSc-Arbeit automatisiert systematische Literaturreviews mit einer RAG-basierten Pipeline.

Ausbildung

Ekrem hat einen BA von der Hacettepe University und schließt gerade einen MSc an der Başkent University ab.

Neueste Artikel von Ekrem

KI
Benchmark
14. Aug

Benchmark der Open-Source-Embedding-Modelle für RAG

NVIDIA Llama-Embed-Nemotron-8B führt bei der Genauigkeit. Bei den Kosten läuft Googles EmbeddingGemma-300m etwa 4x günstiger als Nemotron, bei einem kleinen Genauigkeitsverlust. nDCG@3: Normalisierter diskontierter kumulativer Gewinn bei Cutoff 3. Bei einem relevanten Dokument pro Abfrage beträgt er 1 / log2(Rang + 1), wenn das Golddokument unter den Top 3 landet, andernfalls 0. Rang 1 erzielt…

KI
Benchmark
14. Aug

Multimodale Embedding-Modelle: Apple vs Meta vs OpenAI

Multimodale Embedding-Modelle erkennen Objekte hervorragend, haben aber Schwierigkeiten mit Beziehungen. Aktuelle Modelle tun sich schwer, „Telefon auf einer Karte“ von „Karte auf einem Telefon“ zu unterscheiden. Wir haben 7 führende Modelle über MS-COCO und Winoground einem Benchmark unterzogen, um diese spezifische Einschränkung zu messen. Um einen fairen Vergleich zu gewährleisten, haben wir jedes Modell unter…

KI
Benchmark
14. Aug

Benchmark von 40+ LLMs im Finanzwesen: Claude Fable 5 & GPT-5.6 Sol

Wir haben 40+ LLMs im Finanzwesen anhand von 238 schwierigen Fragen aus dem FinanceReasoning-Benchmark evaluiert, um herauszufinden, welche Modelle bei komplexen Finanzlogik-Aufgaben wie Bilanzanalyse, Prognosen und Kennzahlenberechnungen hervorragend sind. Wir haben LLMs auf 238 schwierigen Fragen aus dem FinanceReasoning-Benchmark (Tang et al.) evaluiert.1 Diese Untergruppe zielt auf die anspruchsvollsten Finanzlogik-Aufgaben ab und bewertet komplexe, mehrstufige…

KI
Benchmark
14. Aug

Embedding-Modelle: OpenAI vs. Gemini vs. Voyage

Wir haben 15 englische Text-Embedding-Modelle und eine BM25-Baseline an über 500 manuell kuratierten Abfragen in drei Retrieval-Domänen einem Benchmark unterzogen: Vertragsrecht (CUAD), Kundensupport (IBM TechQA) und Gesundheitswesen (MedRAG PubMed). Voyage-3.5 liegt insgesamt auf Platz 1. Perplexity Embed V1 0.6b erreicht das obere Mittelfeld zum niedrigsten Preis in unserem Benchmark. nDCG@3: Normalized discounted cumulative gain bei…

Unternehmenssoftware
Benchmark
14. Aug

E-Mail-Archivierungssoftware-Benchmark

Wir haben einen Microsoft 365 Mandanten bereitgestellt, ihn mit einem synthetischen Korpus aus 10.000 E-Mails und 1.700 Anhängen über 8 Dateityp-Untertypen befüllt und anschließend NinjaOne SaaS Archiver, Barracuda Cloud Archiving Service, Acronis Cyber Protect Cloud Email Archiving und MailPiler auf demselben Mandanten anhand von 10 Dimensionen einem Benchmark unterzogen, die Erfassung, Suche, Anhangs-Wiederauffindung, Export, Unveränderbarkeit,…

Daten
Benchmark
14. Aug

E-Commerce-Scraper: 4 Anbieter im Benchmark

Wir haben vier Webdaten-Anbieter über 100 E-Commerce-Domains hinweg in einem Benchmark getestet und dabei 65.000 Produkt- und Suchseiten mit jeweils 5 bis 5.000 gleichzeitigen Anfragen abgerufen. Über die Parallelitätsstufen gemittelt erreichte Bright Data die höchste Erfolgsquote (76 %) bei einem Median von 16 Sekunden. Apify verzeichnete die höchste mediane Antwortzeit mit 46 Sekunden. Die Antwortzeit wird…

Cybersicherheit
Open-World-Bewertung
14. Aug

Disaster-Recovery-Benchmark: Acronis vs Comet vs MSP360

Wir haben Acronis Cyber Protect Cloud, Comet Backup und MSP360 Managed Backup in Sachen Disaster Recovery bewertet. Jeder Anbieter erstellte ein Image eines Live-Windows-Server-2022 und eines Live-Ubuntu-24.04-Servers, auf denen dieselbe deterministische Workload lief: ein Webdienst, eine Datenbank mit 10.000 Zeilen und 50 Dateien. Anschließend wurde die gesamte Maschine auf einem separaten Server wiederhergestellt, nachdem ein…

Daten
Benchmark
14. Aug

Graphdatenbank-Benchmark: Neo4j vs FalkorDB vs Memgraph

Wir haben Neo4j, FalkorDB und Memgraph anhand eines synthetischen Graphen einem Benchmark unterzogen, der aus 120.000 Amazon-Produktbewertungen abgeleitet wurde (381K Knoten, 804K Kanten). Wir führten 12 Abfragevorlagen mit jeweils 1.000 Messungen aus, testeten die Datenaufnahme bei 6 Stapelgrößen, hielten eine gleichzeitige Last für 60 Sekunden bei bis zu 32 Threads aufrecht und maßen Speicher, Kaltstart,…

Cybersicherheit
Benchmark
12. Aug

Bot-Erkennung: 9 Anti-Bot-Anbieter im Benchmark

Wir haben zwei Benchmarks gegen Live-Websites ausgeführt, dann das Anti-Bot-Unternehmen vor jeder Domain identifiziert und gemessen, wie oft die Domains jedes Unternehmens den angeforderten Inhalt zurückgaben. Das umfasst über 3.800 gekennzeichnete Domains und über 50.000 Anfragen. Der erste Benchmark lud Produkt- und Suchseiten auf 100 E-Commerce-Domains, jeweils 50 URLs. Der zweite lud 10.000 allgemeine Web-URLs,…

KI
Funktionsvergleich
11. Aug

Top 30+ KI-Chip-Hersteller: NVIDIA & seine Konkurrenten

Basierend auf unserer Erfahrung mit dem Cloud-GPU-Benchmark von AIMultiple mit 10 verschiedenen GPU-Modellen in 4 verschiedenen Szenarien sind dies die führenden KI-Hardware-Unternehmen für Rechenzentrums-Workloads. *Der ausgewählte KI-Chip ist die Komponente, Plattform oder das angekündigte Projekt, das jeden Anbieter am besten repräsentiert. Einige Einträge sind Systeme, Dienste oder lizenzierbare IPs und nicht ein einzelner Chip. Sortierung…