Dienstleistungen
Kontaktieren
Ekrem Sarı

Ekrem Sarı

KI-Forscher
35 Artikel
Bleiben Sie über B2B-Technologie auf dem Laufenden

Ekrem ist KI-Forscher und Datenwissenschaftler bei AIMultiple. Er entwirft und führt praxisnahe Benchmarks für KI- und LLM-Systeme durch.

Berufserfahrung

Bei AIMultiple führt Ekrem Benchmarks für End-to-End-KI-Systeme durch und erstellt die Daten-Workflows und Dashboards, die zur Verfolgung von Benchmark- und Produktmetriken verwendet werden. Seine Benchmarks decken Embedding- und Reranker-Models, Vektor- und Graphdatenbanken, Inference-Engines, Quantisierung, GPU-Parallelität und Multi-GPU-Skalierung, Cloud-GPU-Preise und -Anbieter, Text-zu-SQL sowie RAG- und agentische RAG-Frameworks ab.

Vor AIMultiple arbeitete er als Datenwissenschaftler bei Yandex, wo er große Datensätze mit SQL abfragte und analysierte, um die Such- und Rankingqualität anhand detaillierter Richtlinien zu bewerten.

Forschungsinteresse

Ekrems Arbeit konzentriert sich darauf zu messen, wie LLM- und Retrieval-Systeme in der Praxis funktionieren. Er entwirft das Test-Harness, führt die Workloads auf echter Hardware aus und vergleicht Models, Frameworks und Infrastruktur hinsichtlich Genauigkeit, Durchsatz, Latenz, Kosten und Skalierbarkeit – über den gesamten Stack von Embedding-Models und Vektordatenbanken bis hin zu Inference-Engines und GPU-Infrastruktur. Seine MSc-Arbeit automatisiert systematische Literaturrecherchen mit einer auf RAG basierenden Pipeline.

Ausbildung

Ekrem hat einen MSc in Management-Informationssystemen von der Başkent University, wo seine Abschlussarbeit systematische Literaturrecherchen mit einer auf RAG basierenden Pipeline automatisierte, und strebt einen zweiten MSc in Daten- und Wissensengineering an der Hacettepe University an.

Neueste Artikel von Ekrem

KI
Benchmark
2. Sep

Vergleiche relationale Foundation-Modelle

Wir haben SAP-RPT-1-OSS mit Gradient Boosting (LightGBM, CatBoost) auf 17 tabellarischen Datensätzen verglichen, die das semantisch-numerische Spektrum abdecken: kleine, hochsemantische Tabellen, gemischte Geschäftsdatensätze und große, niedrigsemantische numerische Datensätze. Unser Ziel ist es zu messen, wo die vortrainierten semantischen Prioren eines relationalen LLM Vorteile gegenüber traditionellen Baummodellen bieten können und wo sie bei großem Umfang oder…

KI
Open-World-Bewertung
31. Aug

Top 70+ Cloud-GPU-Anbieter

Cloud-GPU-Anbieter lassen sich in drei Stufen einteilen. Hyperscaler betreiben breite Cloud-Plattformen, bei denen GPU-Vermietung ein Produkt unter vielen ist. Spezialisierte Neoclouds konzentrieren sich auf GPU- und KI-Infrastruktur als Kernprodukt. Community-Marktplätze bündeln Inventar vieler kleiner Betreiber, oft am unteren Ende der veröffentlichten Preisspanne. Spaltendefinitionen: Ranking: Abonnenten werden verlinkt und oben in der Tabelle hervorgehoben. Die übrigen…

KI
Benchmark
31. Aug

Cloud-GPU-Preise, Leistung & Anbietervergleich

Cloud-GPU-Listenpreise für dasselbe Model können sich von Anbieter zu Anbieter um ein Vielfaches unterscheiden. Wir haben den niedrigsten Preis, den Anbieter, die Marktspanne und den Median für 40+ GPU-Konfigurationen über alle drei Preisstufen hinweg zusammengestellt, plus einen Durchsatz-pro-Dollar-Benchmark bei 10 Models. Hier sehen Sie die kosteneffizienteste GPU für Ihre Workload über 13 Hyperscaler- und Neocloud-Anbieter…

KI
Benchmark
31. Aug

RAG Evaluierungs-Tools: Weights & Biases vs Ragas vs DeepEval

Wenn eine RAG-Pipeline den falschen Kontext abruft, generiert das LLM selbstbewusst die falsche Antwort. Kontextrelevanz-Scorer sind die erste Verteidigungslinie. Wir haben fünf Tools über 1.460 Fragen und 14.600+ bewertete Kontexte unter identischen Bedingungen einem Benchmark unterzogen: gleiches Judge-Modell (GPT-4o), Standardkonfigurationen und keine benutzerdefinierten Prompts. Unter Standardbedingungen erwiesen sich WandB, TruLens und Ragas als die besten…

KI
Benchmark
31. Aug

Embedding-Models: OpenAI vs. Gemini vs. Voyage

Wir benchmarkten 15 englische Text-Embedding-Models und eine BM25-Baseline an über 500 manuell kuratierten Queries über drei Retrieval-Domänen: Rechtsverträge (CUAD), Kundensupport (IBM TechQA) und Gesundheitswesen (MedRAG PubMed). Voyage-3.5 belegt insgesamt den ersten Platz. Perplexity Embed V1 0.6b erreicht die obere Mittelklasse zum niedrigsten Preispunkt in unserem Benchmark. nDCG@3: Normalisierter diskontierter kumulativer Gewinn bei Cutoff 3. Mit…

KI
Benchmark
31. Aug

RAG-Frameworks: LangChain vs. LangGraph vs. LlamaIndex

Wir haben 5 RAG-Frameworks gebenchmarkt: LangChain, LangGraph, LlamaIndex, Haystack und DSPy, indem wir denselben agentischen RAG-Workflow mit standardisierten Komponenten erstellt haben: identische Modelle (GPT-4.1-mini), Embeddings (BGE-small), Retriever (Qdrant) und Tools (Tavily-Websuche). Dadurch werden der tatsächliche Overhead und die Token-Effizienz jedes Frameworks isoliert. Der Benchmark bestand aus 100 Anfragen, wobei jedes Framework den gesamten Satz 100…

Cybersicherheit
Benchmark
31. Aug

Backup-Software-Benchmark: Acronis vs NinjaOne vs Comet vs MSP360

Wir haben NinjaOne Backup, Acronis Cyber Protect Cloud Backup, Comet Backup und MSP360 Managed Backup auf identischer AWS-Infrastruktur einem Benchmark unterzogen. Jeder Anbieter führte ein dateimodusbasiertes Backup derselben Arbeitslast mit 625.946 Dateien / 50 GB sowie ein vollständiges Image-Backup der Systemfestplatte durch und stellte anschließend das mittlere Unterverzeichnis mit 15 GB wieder her. Hier sind…

KI
Benchmark
31. Aug

Open-Source-Embedding-Models-Benchmark für RAG

NVIDIA Llama-Embed-Nemotron-8B führt bei der Genauigkeit. Bei den Kosten läuft Googles EmbeddingGemma-300m etwa 4x günstiger als Nemotron, bei einem kleinen Verlust an Genauigkeit. nDCG@3: Normalisierter diskontierter kumulativer Gewinn bei Cutoff 3. Bei einem relevanten Dokument pro Anfrage beträgt er 1 / log2(Rang + 1), wenn das Gold-Dokument in den Top 3 landet, andernfalls 0. Rang…

KI
Benchmark
31. Aug

Reranker-Benchmark: Top 8 Modelle im Vergleich

Wir haben 8 Reranker-Modelle auf ~145k englischen Amazon-Rezensionen getestet, um zu messen, wie stark eine Reranking-Stufe das Dense Retrieval verbessert. Wir haben Top-100-Kandidaten mit multilingual-e5-base abgerufen, sie mit jedem Modell neu gerankt und die Top-10-Ergebnisse anhand von 300 Anfragen bewertet, von denen sich jede auf konkrete Details aus ihrer Quell-Rezension bezieht. Der beste Reranker erhöhte…

KI
Einblick
31. Aug

LLM VRAM-Rechner für Self-Hosting

Self-Hosting eines LLMs bedeutet, Inferenz auf Hardware auszuführen, die der Betreiber kontrolliert, statt über eine API eines Drittanbieters, was Kosten, Datenkontrolle und Datenschutzprofil verändert. Ob ein Modell überhaupt läuft, hängt vom Speicher ab. Der Rechner schätzt den VRAM oder Unified Memory, den ein Modell lokal benötigt, basierend auf dem Modell, seiner Präzision, der Kontextlänge und…