Dienstleistungen
Kontaktieren
Ekrem Sarı

Ekrem Sarı

KI-Forscher
32 Artikel
Bleiben Sie über B2B-Technologie auf dem Laufenden

Ekrem ist KI-Forscher bei AIMultiple und konzentriert sich auf intelligente Automatisierung, GPUs, KI-Agenten und LLMOps für RAG-Frameworks.

Berufserfahrung

Während seiner Tätigkeit als Assessor bei Yandex bewertete er Suchergebnisse mithilfe firmeneigener Frameworks und automatisierter Protokolle. Er implementierte Qualitätssicherungstests durch Datenannotation, Relevanzbewertung und Nutzerintention-Mapping für monatlich über 10.000 Suchanfragen und führte gleichzeitig technische Bewertungen durch, darunter Leistungsüberwachung und Spam-Erkennung mithilfe von ML-Feedbackschleifen.

Forschungsinteresse

Bei AIMultiple konzentriert sich seine Forschung auf den MLOps-Lebenszyklus sowie die Leistungsfähigkeit und das Benchmarking von End-to-End-KI-Systemen. Er wirkt an einer Vielzahl von Projekten mit, darunter die Optimierung von Retrieval-Augmented Generation (RAG), umfassende Benchmarking-Studien für große Sprachmodelle (LLM) und die Entwicklung agentenbasierter KI-Frameworks. Ekrem ist spezialisiert auf die Entwicklung datengetriebener Methoden zur Messung und Verbesserung der Leistungsfähigkeit von KI-Technologien anhand kritischer Kennzahlen wie Genauigkeit, Effizienz, API-Kosten und Skalierbarkeit. Seine Analysen umfassen den gesamten Technologie-Stack, von grundlegenden Komponenten wie Einbettungsmodellen und Vektordatenbanken bis hin zur leistungsstarken GPU- und Cloud-Infrastruktur, die für den Einsatz von KI-Agenten erforderlich ist.

Ausbildung

Ekrem hat einen Bachelor-Abschluss der Hacettepe Üniversitesi und einen Master-Abschluss der Başkent Üniversitesi.

Neueste Artikel von Ekrem

KI
Benchmark
17. Jul

Beste 20+ Agentic RAG  Frameworks

Agentic RAG verbessert traditionelles RAG, indem es die LLM-Leistung steigert und eine stärkere Spezialisierung ermöglicht. Wir haben einen Benchmark durchgeführt, um seine Leistung bei der Weiterleitung zwischen mehreren Datenbanken und der Generierung von Abfragen zu bewerten. Entdecken Sie agentic RAG Frameworks und Bibliotheken, die wichtigsten Unterschiede zu Standard-RAG, Vorteile und Herausforderungen, um ihr volles Potenzial…

KI
Benchmark
16. Jul

Cloud GPU Preise, Leistung & Anbietervergleich

Cloud GPU Listenpreise für dasselbe Modell können sich von Anbieter zu Anbieter um ein Vielfaches unterscheiden. Wir haben den niedrigsten Preis, den Anbieter, die Marktspanne und den Median für 40+ GPU-Konfigurationen in allen drei Preismodellen sowie einen Durchsatz-pro-Dollar-Benchmark für 10 Modelle zusammengestellt. Sehen Sie die kosteneffektivste GPU für Ihre Workload über 13 Hyperscaler- und Neocloud-Anbieter,…

KI
Funktionsvergleich
16. Jul

Cloud GPU-Mietpreisindex

Die On-Demand-Preise für Cloud-GPUs der neuesten Generation (B200, B300, MI300X, RTX 5090) haben sich im vergangenen Jahr etwa verdoppelt, während Mainstream-Karten (H100, H200, A100) in einem engen Band blieben. Wir erstellen den GPU-Index monatlich aus 63 Anbietern und 17 GPU-Modellen und decken dabei On-Demand-, Spot- und 1-Jahres-Reservierungsstufen ab. Das Diagramm zeigt den monatlichen Median-Preis über…

KI
Einblick
12. Jul

LLM VRAM-Rechner für Selbsthosting

Einen LLM selbst zu hosten bedeutet, die Inferenz auf Hardware auszuführen, die der Betreiber kontrolliert, anstatt über eine API eines Drittanbieters, was die Kosten, die Datenkontrolle und das Datenschutzprofil verändert. Ob ein Modell überhaupt läuft, hängt vom Speicher ab. Der Rechner schätzt den benötigten VRAM oder vereinheitlichten Speicher, um ein Modell lokal auszuführen, basierend auf…

KI
Benchmark
10. Jul

Benchmark von 40+ LLMs im Finanzwesen: Claude Fable 5 & GPT-5.6 Sol

Wir haben 40+ LLMs im Finanzwesen anhand von 238 schwierigen Fragen aus dem FinanceReasoning-Benchmark evaluiert, um herauszufinden, welche Modelle bei komplexen Finanzlogik-Aufgaben wie Bilanzanalyse, Prognosen und Kennzahlenberechnungen hervorragend sind. Wir haben LLMs auf 238 schwierigen Fragen aus dem FinanceReasoning-Benchmark (Tang et al.) evaluiert.1 Diese Untergruppe zielt auf die anspruchsvollsten Finanzlogik-Aufgaben ab und bewertet komplexe, mehrstufige…

KI
Benchmark
3. Jul

Benchmark für Open-Source-Einbettungsmodelle für RAG

Wir haben 14 Open-Source-Einbettungsmodelle auf einer einzelnen H100 selbst gehostet und anhand von über 500 manuell kuratierten Abfrageanfragen getestet, die Rechtsverträge, technische Support-Notizen und medizinische Zusammenfassungen abdecken. NVIDIA Llama-Embed-Nemotron-8B führt in der Genauigkeit. Bei den Kosten läuft Google EmbeddingGemma-300m etwa 4x günstiger als Nemotron, bei einem kleinen Genauigkeitsverlust. nDCG@3: Normalisierter kumulierter diskontierter Nutzen bei Cutoff…

KI
Benchmark
2. Jul

Vergleich relationaler Fundamentaler Modelle

Wir haben SAP-RPT-1-OSS gegen Gradient Boosting (LightGBM, CatBoost) an 17 tabellarischen Datensätzen getestet, die das semantisch-numerische Spektrum, kleine/hohe semantische Tabellen, gemischte Geschäftsdatensätze und große numerische Datensätze mit geringer Semantik abdecken. Unser Ziel ist es zu messen, wo ein relationales LLM seine vortrainierten semantischen Priors nutzen kann, um Vorteile gegenüber traditionellen Baummodellen zu erzielen, und wo…

Unternehmenssoftware
Benchmark
2. Jul

E-Mail-Archivierungssoftware-Benchmark

Wir haben einen Microsoft 365-Mandanten bereitgestellt, ihn mit einem synthetischen Korpus von 10,000 Mails und 1,700 Anhängen in 8 Dateityp-Unterarten gefüllt und dann NinjaOne SaaS Archiver, Barracuda Cloud Archiving Service, Acronis Cyber Protect Cloud Email Archiving und MailPiler auf demselben Mandanten anhand von 10 Dimensionen benchmarkt, die Aufnahme, Suche, Anhangsrückruf, Export, Unveränderbarkeit, Rechtsspeicherung, Audit, Verschlüsselung,…

Unternehmenssoftware
Benchmark
2. Jul

Top Serverless-Funktionen: Vercel vs Azure vs AWS

Serverless-Funktionen ermöglichen es Entwicklern, Code auszuführen, ohne einen Server verwalten zu müssen. So können sie sich auf das Schreiben und Bereitstellen von Anwendungen konzentrieren, während die Skalierung und Wartung der Infrastruktur automatisch im Hintergrund abläuft. In diesem Benchmark bewerteten wir 7 beliebte Cloud-Service-Anbieter gemäß unserer Methodik, um die Leistung ihrer Serverless-Funktionen zu testen. Wir maßen…

KI
Benchmark
2. Jul

Multimodale Embedding-Modelle: Apple vs Meta vs OpenAI

Multimodale Embedding-Modelle sind hervorragend darin, Objekte zu identifizieren, haben aber Schwierigkeiten mit Beziehungen. Aktuelle Modelle können nicht zwischen „Telefon auf einer Karte“ und „Karte auf einem Telefon“ unterscheiden. Wir haben 7 führende Modelle an MS-COCO und Winoground getestet, um diese spezifische Einschränkung zu messen. Um einen fairen Vergleich zu gewährleisten, haben wir jedes Modell unter…