Premium
Services
Premium
Ekrem Sarı

Ekrem Sarı

Chercheur en IA
37 Articles
Restez informé des dernières technologies B2B

Ekrem est chercheur en IA et scientifique des données chez AIMultiple. Il conçoit et exécute des benchmarks pratiques pour les systèmes d'IA et de LLM.

Expérience professionnelle

Chez AIMultiple, Ekrem évalue des systèmes d'IA de bout en bout et construit les flux de données et les tableaux de bord utilisés pour suivre les indicateurs de benchmark et de produit. Ses benchmarks couvrent les modèles d'embedding et de reclassement, les bases de données vectorielles et de graphes, les moteurs d'inférence, la quantification, la concurrence GPU et la mise à l'échelle multi-GPU, la tarification et les fournisseurs de GPU cloud, le text-to-SQL, ainsi que les frameworks RAG et RAG agentique.

Avant AIMultiple, il a travaillé comme scientifique des données chez Yandex, où il a interrogé et analysé de grands datasets avec SQL pour évaluer la qualité de la recherche et du classement par rapport à des consignes détaillées.

Intérêts de recherche

Les travaux d'Ekrem portent sur la mesure des performances en conditions réelles des systèmes LLM et de recherche d'information. Il conçoit le harnais de test, exécute les charges de travail sur du matériel réel et compare les modèles, les frameworks et l'infrastructure en termes de précision, de débit, de latence, de coût et d'évolutivité, sur l'ensemble de la pile, des modèles d'embedding et des bases de données vectorielles aux moteurs d'inférence et à l'infrastructure GPU. Son mémoire de master automatise les revues systématiques de la littérature avec un pipeline basé sur RAG.

Formation

Ekrem est titulaire d'un master en systèmes d'information de gestion de l'université Başkent, où son mémoire a automatisé les revues systématiques de la littérature avec un pipeline basé sur RAG, et poursuit un deuxième master en ingénierie des données et de la connaissance à l'université Hacettepe.

Derniers articles de Ekrem

IA
Évaluation en Monde Ouvert
16 sep

GPU cloud gratuits: modèles, limites et conditions d'accès

Des GPU cloud gratuits sont disponibles via des notebooks Python, des démos d’IA et des crédits de calcul mensuels. Comparez le matériel GPU, les quotas gratuit et les conditions d’accès, ou vérifiez quels services conviennent à votre charge de travail. Deux T4 fournissent deux allocations mémoire distinctes de 16 Go. Exécuter un modèle sur les…

IA
Benchmark
15 sep

Comparaison des modèles de fondation relationnels

Nous avons comparé SAP-RPT-1-OSS au gradient boosting (LightGBM, CatBoost) sur 17 jeux de données tabulaires couvrant le spectre sémantique‑numérique, des petites tables à haute sémantique, des jeux de données métier mixtes et de grands jeux de données numériques à faible sémantique. Notre objectif est de mesurer où les priors sémantiques pré‑entraînés d’un LLM relationnel peuvent…

Cybersécurité
Évaluation en Monde Ouvert
10 sep

Benchmark de reprise après sinistre: Acronis vs Comet vs MSP360

Nous avons comparé Acronis Cyber Protect Cloud, Comet Backup et MSP360 Managed Backup en matière de reprise après sinistre. Chaque fournisseur a imagé un serveur Windows Server 2022 en production et un serveur Ubuntu 24.04 en production exécutant la même charge de travail déterministe, un service web, une base de données de 10 000 lignes et…

IA
Benchmark
4 sep

Benchmark de bases de données vectorielles: 7 moteurs open source pour RAG

Nous avons évalué sept bases de données vectorielles open source auto-hébergées comme couche de récupération d’un pipeline RAG, chacune exécutée une par une sur des embeddings bge-m3 identiques et des requêtes médicales et techniques réelles, de sorte que l’index de la base de données était la seule variable. La charge de travail couvrait MedRAG-50k, TechQA-28k…

IA
Benchmark
31 août

Tarification, performances et comparatif des fournisseurs de GPU cloud

Les prix catalogue des GPU cloud pour un même modèle peuvent varier de plusieurs fois d’un fournisseur à l’autre. Nous avons sélectionné le tarif le plus bas, le fournisseur, la plage de prix du marché et la médiane pour plus de 40 configurations de GPU dans les trois niveaux de tarification, ainsi qu’un benchmark de…

IA
Benchmark
31 août

RAG Outils d'évaluation: Weights & Biases vs Ragas vs DeepEval

Lorsqu'un pipeline RAG récupère le mauvais contexte, le LLM génère avec assurance la mauvaise réponse. Les évaluateurs de pertinence du contexte constituent la première défense. Nous avons évalué cinq outils sur 1 460 questions et plus de 14 600 contextes notés dans des conditions identiques : même modèle juge (GPT-4o), configurations par défaut et aucun prompt personnalisé.…

IA
Benchmark
31 août

RAG Frameworks: LangChain vs LangGraph vs LlamaIndex

Nous avons benchmarké 5 RAG frameworks : LangChain, LangGraph, LlamaIndex, Haystack et DSPy, en construisant le même workflow RAG agentique avec des composants standardisés : modèles identiques (GPT-4.1-mini), embeddings (BGE-small), retriever (Qdrant) et outils (recherche web Tavily). Ceci isole la surcharge réelle et l’efficacité en tokens de chaque framework. Le benchmark consistait en 100 requêtes,…

IA
Benchmark
31 août

Meilleurs RAG outils, frameworks et bibliothèques

RAG améliore les réponses des LLM en les ancrant dans des données externes au lieu de se contenter de ce que le modèle a mémorisé pendant l’entraînement. Nous avons évalué les composants à partir desquels un système RAG est construit et rassemblé les résultats en un seul endroit, avec un guide pratique pour choisir chaque…

Agentic AI
Benchmark
20 août

Recherche agentique: benchmark de 8 API de recherche pour les agents

La recherche agentique joue un rôle crucial pour combler le fossé entre les moteurs de recherche traditionnels et les capacités de recherche de l’IA. Les API de recherche constituent la première couche d’un outil agentique, où la performance plafonne la qualité de tout ce qui suit. Nous avons évalué 8 API de recherche sur 100…

IA
Benchmark
14 août

Models d'embedding multimodaux: Apple vs Meta vs OpenAI

Les models d’embedding multimodaux excellent à identifier les objets, mais peinent à saisir les relations. Les models actuels ont du mal à distinguer « un téléphone sur une carte » de « une carte sur un téléphone ». Nous avons benchmarké 7 models de premier plan sur MS-COCO et Winoground pour mesurer cette limitation spécifique.…