Ekrem Sarı
Ekrem est chercheur en IA et scientifique des données chez AIMultiple. Il conçoit et exécute des benchmarks pratiques pour les systèmes d'IA et de LLM.
Expérience professionnelle
Chez AIMultiple, Ekrem évalue des systèmes d'IA de bout en bout et construit les flux de données et les tableaux de bord utilisés pour suivre les indicateurs de benchmark et de produit. Ses benchmarks couvrent les modèles d'embedding et de reclassement, les bases de données vectorielles et de graphes, les moteurs d'inférence, la quantification, la concurrence GPU et la mise à l'échelle multi-GPU, la tarification et les fournisseurs de GPU cloud, le text-to-SQL, ainsi que les frameworks RAG et RAG agentique.
Avant AIMultiple, il a travaillé comme scientifique des données chez Yandex, où il a interrogé et analysé de grands datasets avec SQL pour évaluer la qualité de la recherche et du classement par rapport à des consignes détaillées.
Intérêts de recherche
Les travaux d'Ekrem portent sur la mesure des performances en conditions réelles des systèmes LLM et de recherche d'information. Il conçoit le harnais de test, exécute les charges de travail sur du matériel réel et compare les modèles, les frameworks et l'infrastructure en termes de précision, de débit, de latence, de coût et d'évolutivité, sur l'ensemble de la pile, des modèles d'embedding et des bases de données vectorielles aux moteurs d'inférence et à l'infrastructure GPU. Son mémoire de master automatise les revues systématiques de la littérature avec un pipeline basé sur RAG.
Formation
Ekrem est titulaire d'un master en systèmes d'information de gestion de l'université Başkent, où son mémoire a automatisé les revues systématiques de la littérature avec un pipeline basé sur RAG, et poursuit un deuxième master en ingénierie des données et de la connaissance à l'université Hacettepe.
Derniers articles de Ekrem
Models d'embedding multimodaux: Apple vs Meta vs OpenAI
Les models d’embedding multimodaux excellent à identifier les objets, mais peinent à saisir les relations. Les models actuels ont du mal à distinguer « un téléphone sur une carte » de « une carte sur un téléphone ». Nous avons benchmarké 7 models de premier plan sur MS-COCO et Winoground pour mesurer cette limitation spécifique.…
Benchmark de 40+ LLM en finance: Claude Fable 5 & GPT-5.6 Sol
Nous avons évalué les LLM sur 238 questions difficiles du benchmark FinanceReasoning (Tang et al.).1 Ce sous-ensemble cible les tâches de raisonnement financier les plus difficiles, en évaluant le raisonnement quantitatif complexe à plusieurs étapes impliquant des concepts et des formules financiers. Notre évaluation a utilisé une conception de prompt personnalisée et des critères de…
Benchmark des logiciels d'archivage d'e-mails
Nous avons provisionné un locataire Microsoft 365, l'avons rempli avec un corpus synthétique de 10 000 e-mails et 1 700 pièces jointes réparties sur 8 sous-types de fichiers, puis avons comparé NinjaOne SaaS Archiver, Barracuda Cloud Archiving Service, Acronis Cyber Protect Cloud Email Archiving et MailPiler sur le même locataire selon 10 dimensions couvrant l'ingestion, la recherche,…
Benchmark de reprise après sinistre: Acronis vs Comet vs MSP360
Nous avons testé Acronis Cyber Protect Cloud, Comet Backup et MSP360 Managed Backup en matière de reprise après sinistre. Chaque fournisseur a imagé un serveur Windows Server 2022 actif et un serveur Ubuntu 24.04 actif portant la même charge de travail déterministe, un service web, une base de données de 10 000 lignes et 50 fichiers,…
Benchmark de bases de données graphiques: Neo4j vs FalkorDB vs Memgraph
Nous avons comparé Neo4j, FalkorDB et Memgraph sur un graphe synthétique dérivé de 120 000 avis produits Amazon (381K nœuds, 804K arêtes). Nous avons exécuté 12 modèles de requêtes avec 1 000 mesures chacun, testé l’ingestion à 6 tailles de lots, maintenu une charge simultanée pendant 60 secondes jusqu’à 32 threads, et mesuré la mémoire, le démarrage…
Benchmark RAG Agentic: Routage Multi-Bases de Données sur 36 LLMs
Nous avons benchmarké 36 grands modèles de langage sur le routage inter-bases de données. Chaque modèle reçoit une question en langage naturel et 11 bases de données SQL décrites au niveau paragraphe, puis doit décider quelle base détient la réponse avant d'écrire le moindre SQL. Les 11 bases de données ont été tirées de 80…
Benchmark des logiciels DLP
Nous avons benchmarké Acronis DeviceLock DLP et ManageEngine DLP Plus sur des machines virtuelles Windows Server 2022 identiques avec 28 scénarios : 23 tests de fuite de données (dont 12 fichiers d’évasion adversariale), 3 tests de sécurité de l’agent et 2 tests avec une forte consommation de CPU et de mémoire. Pour les autres produits…
Web Scraping à Grande Échelle: 7 Fournisseurs Évalués
Nous avons exécuté deux benchmarks sur des sites web réels, de 5 à 5 000 requêtes simultanées. Le premier a envoyé 260 000 requêtes via quatre débloqueurs web sur les 10 000 premiers domaines Tranco, plus un test d'extraction markdown sur 10 000 URLs. Le second a récupéré 65 000 pages produits et pages de recherche auprès de chacun des…
Comparaison des 6 meilleurs services GPU cloud gratuits
Le meilleur niveau gratuit de GPU vaut environ 19 $ par mois aux tarifs de location, et huit plateformes offrent un véritable GPU sans carte de crédit. Six d'entre elles plafonnent l'utilisation gratuit par mois, et nous les avons chiffrées au tarif à la demande le moins cher actuel pour chaque GPU dans nos données…
Calculateur de dimensionnement et de sélection de bases de données vectorielles
La question pratique derrière une base de données vectorielle auto-hébergée pour RAG est de savoir quel moteur convient à un serveur donné, et lequel est exclu par la charge de travail. Le calculateur ci-dessous répond aux deux, à partir de notre benchmark de sept bases de données vectorielles auto-hébergées exécuté à rappel équivalent sur des…
Newsletter AIMultiple
Un e-mail gratuit par semaine contenant les dernières actualités technologiques B2B et des analyses d'experts pour accélérer la croissance de votre entreprise.