Dienstleistungen
Kontaktieren
Ekrem Sarı

Ekrem Sarı

KI-Forscher
35 Artikel
Bleiben Sie über B2B-Technologie auf dem Laufenden

Ekrem ist KI-Forscher und Datenanalyst bei AIMultiple. Er entwirft und führt praxisnahe Benchmarks für KI- und LLM-Systeme durch.

Berufserfahrung

Bei AIMultiple führt Ekrem Benchmarks für End-to-End-KI-Systeme durch und erstellt die Daten-Workflows und Dashboards zur Verfolgung von Benchmark- und Produktmetriken. Seine Benchmarks umfassen Embedding- und Reranker-Models, Vektor- und Graphdatenbanken, Inference-Engines, Quantisierung, GPU-Nebenläufigkeit und Multi-GPU-Skalierung, Cloud-GPU-Preise und -Anbieter, Text-zu-SQL sowie RAG- und agentische RAG-Frameworks.

Vor AIMultiple war er als Assessor bei Yandex tätig, wo er die Suchqualität bewertete und große Datenmengen anhand detaillierter Richtlinien kennzeichnete, um Ranking- und Model-Qualität zu unterstützen.

Forschungsinteresse

Ekrems Arbeit konzentriert sich auf den MLOps- und LLMOps-Lebenszyklus sowie auf die Messung der Leistung von KI-Systemen. Er vergleicht Models, Frameworks und Infrastruktur anhand von Metriken wie Genauigkeit, Durchsatz, API-Kosten und Skalierbarkeit, über den gesamten Stack von Embedding-Models und Vektordatenbanken bis hin zu GPU- und Cloud-Infrastruktur. Seine MSc-Arbeit automatisiert systematische Literaturreviews mit einer RAG-basierten Pipeline.

Ausbildung

Ekrem hat einen BA von der Hacettepe University und schließt gerade einen MSc an der Başkent University ab.

Neueste Artikel von Ekrem

Daten
Benchmark
30. Jul

Großangelegtes Web Scraping: 7 Anbieter im Benchmark

Wir führten zwei Benchmarks gegen Live-Websites durch, von 5 bis 5.000 gleichzeitigen Anfragen. Der erste schickte 260.000 Anfragen durch vier Web Unblocker über die Tranco-Top-10.000-Domains sowie einen Markdown-Extraktionstest auf 10.000 URLs. Der zweite holte 65.000 Produkt- und Suchseiten von jedem der fünf Scraping-Anbieter über 100 E-Commerce-Domains. Erklärung der Metriken Inhaltlich verifizierte Erfolgsquote: der Anteil der…

KI
Open-World-Bewertung
23. Jul

Vergleich der Top 6 kostenlosen Cloud-GPU-Dienste

Die beste kostenlos GPU-Stufe ist etwa $19 pro Monat zu Mietpreisen wert, und acht Plattformen bieten eine echte GPU ohne Kreditkarte. Sechs davon begrenzen die kostenlos Nutzung pro Monat, und wir haben diese zum günstigsten aktuellen On-Demand-Tarif für jede GPU in unseren Cloud-GPU-Preisdaten bewertet. Jeder Balken stellt die Mietkosten derselben GPU-Zeit dar, berechnet als die…

KI
Benchmark
20. Jul

Vektordatenbank-Dimensionierungs- und Auswahlrechner

Die praktische Frage hinter einer selbst gehosteten Vektordatenbank für RAG ist, welche Engine auf einen bestimmten Server passt und welche die Arbeitslast ausschließt. Der folgende Rechner beantwortet beides, basierend auf unserem Benchmark von sieben selbst gehosteten Vektordatenbanken, die mit angeglichenem Recall auf identischen Embeddings getestet wurden. Fünf Kontrollkästchen oben im Rechner benennen fünf gängige RAG-Arbeitslasten,…

KI
Benchmark
18. Jul

Beste RAG Werkzeuge, Frameworks und Bibliotheken

RAG verbessert LLM-Antworten, indem es sie auf externen Daten fundiert, anstatt nur auf dem, was das Modell während des Trainings auswendig gelernt hat. Wir haben die Komponenten, aus denen ein RAG-System aufgebaut ist, einem Benchmark unterzogen und die Ergebnisse an einem Ort zusammengestellt, mit einem praktischen Leitfaden zur Auswahl jedes Teils des Stacks. Sehen Sie…

KI
Benchmark
18. Jul

Vektordatenbank-Benchmark: 7 Open-Source-Engines für RAG

Wir haben sieben quelloffene, selbst gehostete Vektordatenbanken als Abrufschicht einer RAG-Pipeline getestet, wobei jede einzeln mit identischen bge-m3-Embeddings und realen medizinischen und technischen Anfragen ausgeführt wurde, sodass der Datenbankindex die einzige Variable war. Das Pensum umfasste MedRAG-50k, TechQA-28k und einen 2.25M-Vektor-Korpus über acht Dimensionen, von Genauigkeit und Abrufqualität über Geschwindigkeit, Speicher, gefilterte und hybride Suche,…

KI
Benchmark
16. Jul

Cloud GPU Preise, Leistung & Anbietervergleich

Cloud GPU Listenpreise für dasselbe Modell können sich von Anbieter zu Anbieter um ein Vielfaches unterscheiden. Wir haben den niedrigsten Preis, den Anbieter, die Marktspanne und den Median für 40+ GPU-Konfigurationen in allen drei Preismodellen sowie einen Durchsatz-pro-Dollar-Benchmark für 10 Modelle zusammengestellt. Sehen Sie die kosteneffektivste GPU für Ihre Workload über 13 Hyperscaler- und Neocloud-Anbieter,…

KI
Funktionsvergleich
16. Jul

Cloud GPU-Mietpreisindex

Die On-Demand-Preise für Cloud-GPUs der neuesten Generation (B200, B300, MI300X, RTX 5090) haben sich im vergangenen Jahr etwa verdoppelt, während Mainstream-Karten (H100, H200, A100) in einem engen Band blieben. Wir erstellen den GPU-Index monatlich aus 63 Anbietern und 17 GPU-Modellen und decken dabei On-Demand-, Spot- und 1-Jahres-Reservierungsstufen ab. Das Diagramm zeigt den monatlichen Median-Preis über…

KI
Einblick
12. Jul

LLM VRAM-Rechner für Selbsthosting

Einen LLM selbst zu hosten bedeutet, die Inferenz auf Hardware auszuführen, die der Betreiber kontrolliert, anstatt über eine API eines Drittanbieters, was die Kosten, die Datenkontrolle und das Datenschutzprofil verändert. Ob ein Modell überhaupt läuft, hängt vom Speicher ab. Der Rechner schätzt den benötigten VRAM oder vereinheitlichten Speicher, um ein Modell lokal auszuführen, basierend auf…

Unternehmenssoftware
Benchmark
2. Jul

Top Serverless-Funktionen: Vercel vs Azure vs AWS

Serverless-Funktionen ermöglichen es Entwicklern, Code auszuführen, ohne einen Server verwalten zu müssen. So können sie sich auf das Schreiben und Bereitstellen von Anwendungen konzentrieren, während die Skalierung und Wartung der Infrastruktur automatisch im Hintergrund abläuft. In diesem Benchmark bewerteten wir 7 beliebte Cloud-Service-Anbieter gemäß unserer Methodik, um die Leistung ihrer Serverless-Funktionen zu testen. Wir maßen…

KI
Benchmark
2. Jul

RAG Evaluierungswerkzeuge: Weights & Biases vs Ragas vs DeepEval

Wenn eine RAG-Pipeline den falschen Kontext abruft, generiert das LLM selbstbewusst die falsche Antwort. Scorer für die Kontextrelevanz sind die primäre Verteidigungslinie. Wir haben fünf Tools über 1.460 Fragen und über 14.600 bewertete Kontexte unter identischen Bedingungen getestet: gleiches Beurteilungsmodell (GPT-4o), Standardkonfigurationen und keine benutzerdefinierten Prompts. Unter Standardbedingungen erwiesen sich WandB, TruLens und Ragas als…