Ekrem Sarı
Ekrem ist KI-Forscher bei AIMultiple und konzentriert sich auf intelligente Automatisierung, GPUs, KI-Agenten und LLMOps für RAG-Frameworks.
Berufserfahrung
Während seiner Tätigkeit als Assessor bei Yandex bewertete er Suchergebnisse mithilfe firmeneigener Frameworks und automatisierter Protokolle. Er implementierte Qualitätssicherungstests durch Datenannotation, Relevanzbewertung und Nutzerintention-Mapping für monatlich über 10.000 Suchanfragen und führte gleichzeitig technische Bewertungen durch, darunter Leistungsüberwachung und Spam-Erkennung mithilfe von ML-Feedbackschleifen.Forschungsinteresse
Bei AIMultiple konzentriert sich seine Forschung auf den MLOps-Lebenszyklus sowie die Leistungsfähigkeit und das Benchmarking von End-to-End-KI-Systemen. Er wirkt an einer Vielzahl von Projekten mit, darunter die Optimierung von Retrieval-Augmented Generation (RAG), umfassende Benchmarking-Studien für große Sprachmodelle (LLM) und die Entwicklung agentenbasierter KI-Frameworks. Ekrem ist spezialisiert auf die Entwicklung datengetriebener Methoden zur Messung und Verbesserung der Leistungsfähigkeit von KI-Technologien anhand kritischer Kennzahlen wie Genauigkeit, Effizienz, API-Kosten und Skalierbarkeit. Seine Analysen umfassen den gesamten Technologie-Stack, von grundlegenden Komponenten wie Einbettungsmodellen und Vektordatenbanken bis hin zur leistungsstarken GPU- und Cloud-Infrastruktur, die für den Einsatz von KI-Agenten erforderlich ist.Ausbildung
Ekrem hat einen Bachelor-Abschluss der Hacettepe Üniversitesi und einen Master-Abschluss der Başkent Üniversitesi.Neueste Artikel von Ekrem
Beste 20+ Agentic RAG Frameworks
Agentic RAG verbessert traditionelles RAG, indem es die LLM-Leistung steigert und eine stärkere Spezialisierung ermöglicht. Wir haben einen Benchmark durchgeführt, um seine Leistung bei der Weiterleitung zwischen mehreren Datenbanken und der Generierung von Abfragen zu bewerten. Entdecken Sie agentic RAG Frameworks und Bibliotheken, die wichtigsten Unterschiede zu Standard-RAG, Vorteile und Herausforderungen, um ihr volles Potenzial…
Cloud GPU Preise, Leistung & Anbietervergleich
Cloud GPU Listenpreise für dasselbe Modell können sich von Anbieter zu Anbieter um ein Vielfaches unterscheiden. Wir haben den niedrigsten Preis, den Anbieter, die Marktspanne und den Median für 40+ GPU-Konfigurationen in allen drei Preismodellen sowie einen Durchsatz-pro-Dollar-Benchmark für 10 Modelle zusammengestellt. Sehen Sie die kosteneffektivste GPU für Ihre Workload über 13 Hyperscaler- und Neocloud-Anbieter,…
Cloud GPU-Mietpreisindex
Die On-Demand-Preise für Cloud-GPUs der neuesten Generation (B200, B300, MI300X, RTX 5090) haben sich im vergangenen Jahr etwa verdoppelt, während Mainstream-Karten (H100, H200, A100) in einem engen Band blieben. Wir erstellen den GPU-Index monatlich aus 63 Anbietern und 17 GPU-Modellen und decken dabei On-Demand-, Spot- und 1-Jahres-Reservierungsstufen ab. Das Diagramm zeigt den monatlichen Median-Preis über…
LLM VRAM-Rechner für Selbsthosting
Einen LLM selbst zu hosten bedeutet, die Inferenz auf Hardware auszuführen, die der Betreiber kontrolliert, anstatt über eine API eines Drittanbieters, was die Kosten, die Datenkontrolle und das Datenschutzprofil verändert. Ob ein Modell überhaupt läuft, hängt vom Speicher ab. Der Rechner schätzt den benötigten VRAM oder vereinheitlichten Speicher, um ein Modell lokal auszuführen, basierend auf…
Benchmark von 40+ LLMs im Finanzwesen: Claude Fable 5 & GPT-5.6 Sol
Wir haben 40+ LLMs im Finanzwesen anhand von 238 schwierigen Fragen aus dem FinanceReasoning-Benchmark evaluiert, um herauszufinden, welche Modelle bei komplexen Finanzlogik-Aufgaben wie Bilanzanalyse, Prognosen und Kennzahlenberechnungen hervorragend sind. Wir haben LLMs auf 238 schwierigen Fragen aus dem FinanceReasoning-Benchmark (Tang et al.) evaluiert.1 Diese Untergruppe zielt auf die anspruchsvollsten Finanzlogik-Aufgaben ab und bewertet komplexe, mehrstufige…
Benchmark für Open-Source-Einbettungsmodelle für RAG
Wir haben 14 Open-Source-Einbettungsmodelle auf einer einzelnen H100 selbst gehostet und anhand von über 500 manuell kuratierten Abfrageanfragen getestet, die Rechtsverträge, technische Support-Notizen und medizinische Zusammenfassungen abdecken. NVIDIA Llama-Embed-Nemotron-8B führt in der Genauigkeit. Bei den Kosten läuft Google EmbeddingGemma-300m etwa 4x günstiger als Nemotron, bei einem kleinen Genauigkeitsverlust. nDCG@3: Normalisierter kumulierter diskontierter Nutzen bei Cutoff…
Vergleich relationaler Fundamentaler Modelle
Wir haben SAP-RPT-1-OSS gegen Gradient Boosting (LightGBM, CatBoost) an 17 tabellarischen Datensätzen getestet, die das semantisch-numerische Spektrum, kleine/hohe semantische Tabellen, gemischte Geschäftsdatensätze und große numerische Datensätze mit geringer Semantik abdecken. Unser Ziel ist es zu messen, wo ein relationales LLM seine vortrainierten semantischen Priors nutzen kann, um Vorteile gegenüber traditionellen Baummodellen zu erzielen, und wo…
E-Mail-Archivierungssoftware-Benchmark
Wir haben einen Microsoft 365-Mandanten bereitgestellt, ihn mit einem synthetischen Korpus von 10,000 Mails und 1,700 Anhängen in 8 Dateityp-Unterarten gefüllt und dann NinjaOne SaaS Archiver, Barracuda Cloud Archiving Service, Acronis Cyber Protect Cloud Email Archiving und MailPiler auf demselben Mandanten anhand von 10 Dimensionen benchmarkt, die Aufnahme, Suche, Anhangsrückruf, Export, Unveränderbarkeit, Rechtsspeicherung, Audit, Verschlüsselung,…
Top Serverless-Funktionen: Vercel vs Azure vs AWS
Serverless-Funktionen ermöglichen es Entwicklern, Code auszuführen, ohne einen Server verwalten zu müssen. So können sie sich auf das Schreiben und Bereitstellen von Anwendungen konzentrieren, während die Skalierung und Wartung der Infrastruktur automatisch im Hintergrund abläuft. In diesem Benchmark bewerteten wir 7 beliebte Cloud-Service-Anbieter gemäß unserer Methodik, um die Leistung ihrer Serverless-Funktionen zu testen. Wir maßen…
Multimodale Embedding-Modelle: Apple vs Meta vs OpenAI
Multimodale Embedding-Modelle sind hervorragend darin, Objekte zu identifizieren, haben aber Schwierigkeiten mit Beziehungen. Aktuelle Modelle können nicht zwischen „Telefon auf einer Karte“ und „Karte auf einem Telefon“ unterscheiden. Wir haben 7 führende Modelle an MS-COCO und Winoground getestet, um diese spezifische Einschränkung zu messen. Um einen fairen Vergleich zu gewährleisten, haben wir jedes Modell unter…
AIMultiple Newsletter
1 kostenlose E-Mail pro Woche mit den neuesten B2B-Technachrichten und Experten Einblicken.