Ekrem Sarı
Ekrem ist KI-Forscher und Datenanalyst bei AIMultiple. Er entwirft und führt praxisnahe Benchmarks für KI- und LLM-Systeme durch.
Berufserfahrung
Bei AIMultiple führt Ekrem Benchmarks für End-to-End-KI-Systeme durch und erstellt die Daten-Workflows und Dashboards zur Verfolgung von Benchmark- und Produktmetriken. Seine Benchmarks umfassen Embedding- und Reranker-Models, Vektor- und Graphdatenbanken, Inference-Engines, Quantisierung, GPU-Nebenläufigkeit und Multi-GPU-Skalierung, Cloud-GPU-Preise und -Anbieter, Text-zu-SQL sowie RAG- und agentische RAG-Frameworks.
Vor AIMultiple war er als Assessor bei Yandex tätig, wo er die Suchqualität bewertete und große Datenmengen anhand detaillierter Richtlinien kennzeichnete, um Ranking- und Model-Qualität zu unterstützen.
Forschungsinteresse
Ekrems Arbeit konzentriert sich auf den MLOps- und LLMOps-Lebenszyklus sowie auf die Messung der Leistung von KI-Systemen. Er vergleicht Models, Frameworks und Infrastruktur anhand von Metriken wie Genauigkeit, Durchsatz, API-Kosten und Skalierbarkeit, über den gesamten Stack von Embedding-Models und Vektordatenbanken bis hin zu GPU- und Cloud-Infrastruktur. Seine MSc-Arbeit automatisiert systematische Literaturreviews mit einer RAG-basierten Pipeline.
Ausbildung
Ekrem hat einen BA von der Hacettepe University und schließt gerade einen MSc an der Başkent University ab.
Neueste Artikel von Ekrem
Großangelegtes Web Scraping: 7 Anbieter im Benchmark
Wir führten zwei Benchmarks gegen Live-Websites durch, von 5 bis 5.000 gleichzeitigen Anfragen. Der erste schickte 260.000 Anfragen durch vier Web Unblocker über die Tranco-Top-10.000-Domains sowie einen Markdown-Extraktionstest auf 10.000 URLs. Der zweite holte 65.000 Produkt- und Suchseiten von jedem der fünf Scraping-Anbieter über 100 E-Commerce-Domains. Erklärung der Metriken Inhaltlich verifizierte Erfolgsquote: der Anteil der…
Vergleich der Top 6 kostenlosen Cloud-GPU-Dienste
Die beste kostenlos GPU-Stufe ist etwa $19 pro Monat zu Mietpreisen wert, und acht Plattformen bieten eine echte GPU ohne Kreditkarte. Sechs davon begrenzen die kostenlos Nutzung pro Monat, und wir haben diese zum günstigsten aktuellen On-Demand-Tarif für jede GPU in unseren Cloud-GPU-Preisdaten bewertet. Jeder Balken stellt die Mietkosten derselben GPU-Zeit dar, berechnet als die…
Vektordatenbank-Dimensionierungs- und Auswahlrechner
Die praktische Frage hinter einer selbst gehosteten Vektordatenbank für RAG ist, welche Engine auf einen bestimmten Server passt und welche die Arbeitslast ausschließt. Der folgende Rechner beantwortet beides, basierend auf unserem Benchmark von sieben selbst gehosteten Vektordatenbanken, die mit angeglichenem Recall auf identischen Embeddings getestet wurden. Fünf Kontrollkästchen oben im Rechner benennen fünf gängige RAG-Arbeitslasten,…
Beste RAG Werkzeuge, Frameworks und Bibliotheken
RAG verbessert LLM-Antworten, indem es sie auf externen Daten fundiert, anstatt nur auf dem, was das Modell während des Trainings auswendig gelernt hat. Wir haben die Komponenten, aus denen ein RAG-System aufgebaut ist, einem Benchmark unterzogen und die Ergebnisse an einem Ort zusammengestellt, mit einem praktischen Leitfaden zur Auswahl jedes Teils des Stacks. Sehen Sie…
Vektordatenbank-Benchmark: 7 Open-Source-Engines für RAG
Wir haben sieben quelloffene, selbst gehostete Vektordatenbanken als Abrufschicht einer RAG-Pipeline getestet, wobei jede einzeln mit identischen bge-m3-Embeddings und realen medizinischen und technischen Anfragen ausgeführt wurde, sodass der Datenbankindex die einzige Variable war. Das Pensum umfasste MedRAG-50k, TechQA-28k und einen 2.25M-Vektor-Korpus über acht Dimensionen, von Genauigkeit und Abrufqualität über Geschwindigkeit, Speicher, gefilterte und hybride Suche,…
Cloud GPU Preise, Leistung & Anbietervergleich
Cloud GPU Listenpreise für dasselbe Modell können sich von Anbieter zu Anbieter um ein Vielfaches unterscheiden. Wir haben den niedrigsten Preis, den Anbieter, die Marktspanne und den Median für 40+ GPU-Konfigurationen in allen drei Preismodellen sowie einen Durchsatz-pro-Dollar-Benchmark für 10 Modelle zusammengestellt. Sehen Sie die kosteneffektivste GPU für Ihre Workload über 13 Hyperscaler- und Neocloud-Anbieter,…
Cloud GPU-Mietpreisindex
Die On-Demand-Preise für Cloud-GPUs der neuesten Generation (B200, B300, MI300X, RTX 5090) haben sich im vergangenen Jahr etwa verdoppelt, während Mainstream-Karten (H100, H200, A100) in einem engen Band blieben. Wir erstellen den GPU-Index monatlich aus 63 Anbietern und 17 GPU-Modellen und decken dabei On-Demand-, Spot- und 1-Jahres-Reservierungsstufen ab. Das Diagramm zeigt den monatlichen Median-Preis über…
LLM VRAM-Rechner für Selbsthosting
Einen LLM selbst zu hosten bedeutet, die Inferenz auf Hardware auszuführen, die der Betreiber kontrolliert, anstatt über eine API eines Drittanbieters, was die Kosten, die Datenkontrolle und das Datenschutzprofil verändert. Ob ein Modell überhaupt läuft, hängt vom Speicher ab. Der Rechner schätzt den benötigten VRAM oder vereinheitlichten Speicher, um ein Modell lokal auszuführen, basierend auf…
Top Serverless-Funktionen: Vercel vs Azure vs AWS
Serverless-Funktionen ermöglichen es Entwicklern, Code auszuführen, ohne einen Server verwalten zu müssen. So können sie sich auf das Schreiben und Bereitstellen von Anwendungen konzentrieren, während die Skalierung und Wartung der Infrastruktur automatisch im Hintergrund abläuft. In diesem Benchmark bewerteten wir 7 beliebte Cloud-Service-Anbieter gemäß unserer Methodik, um die Leistung ihrer Serverless-Funktionen zu testen. Wir maßen…
RAG Evaluierungswerkzeuge: Weights & Biases vs Ragas vs DeepEval
Wenn eine RAG-Pipeline den falschen Kontext abruft, generiert das LLM selbstbewusst die falsche Antwort. Scorer für die Kontextrelevanz sind die primäre Verteidigungslinie. Wir haben fünf Tools über 1.460 Fragen und über 14.600 bewertete Kontexte unter identischen Bedingungen getestet: gleiches Beurteilungsmodell (GPT-4o), Standardkonfigurationen und keine benutzerdefinierten Prompts. Unter Standardbedingungen erwiesen sich WandB, TruLens und Ragas als…
AIMultiple Newsletter
1 kostenlose E-Mail pro Woche mit den neuesten B2B-Technachrichten und Experten Einblicken.