Ekrem Sarı
Ekrem est chercheur en IA et scientifique des données chez AIMultiple. Il conçoit et exécute des benchmarks pratiques pour les systèmes d'IA et de LLM.
Expérience professionnelle
Chez AIMultiple, Ekrem évalue des systèmes d'IA de bout en bout et construit les flux de données et les tableaux de bord utilisés pour suivre les indicateurs de benchmark et de produit. Ses benchmarks couvrent les modèles d'embedding et de reclassement, les bases de données vectorielles et de graphes, les moteurs d'inférence, la quantification, la concurrence GPU et la mise à l'échelle multi-GPU, la tarification et les fournisseurs de GPU cloud, le text-to-SQL, ainsi que les frameworks RAG et RAG agentique.
Avant AIMultiple, il a travaillé comme scientifique des données chez Yandex, où il a interrogé et analysé de grands datasets avec SQL pour évaluer la qualité de la recherche et du classement par rapport à des consignes détaillées.
Intérêts de recherche
Les travaux d'Ekrem portent sur la mesure des performances en conditions réelles des systèmes LLM et de recherche d'information. Il conçoit le harnais de test, exécute les charges de travail sur du matériel réel et compare les modèles, les frameworks et l'infrastructure en termes de précision, de débit, de latence, de coût et d'évolutivité, sur l'ensemble de la pile, des modèles d'embedding et des bases de données vectorielles aux moteurs d'inférence et à l'infrastructure GPU. Son mémoire de master automatise les revues systématiques de la littérature avec un pipeline basé sur RAG.
Formation
Ekrem est titulaire d'un master en systèmes d'information de gestion de l'université Başkent, où son mémoire a automatisé les revues systématiques de la littérature avec un pipeline basé sur RAG, et poursuit un deuxième master en ingénierie des données et de la connaissance à l'université Hacettepe.
Derniers articles de Ekrem
LLM Calculateur de VRAM pour l'auto-hébergement
Auto-héberger un LLM signifie exécuter l'inférence sur du matériel contrôlé par l'opérateur plutôt que via une API tierce, ce qui modifie le coût, le contrôle des données et le profil de confidentialité. Qu'un modèle puisse s'exécuter dépend de la mémoire. Le calculateur estime la VRAM ou la mémoire unifiée dont un modèle a besoin pour…
Navigateurs distants: infrastructure web pour agents IA comparée
Les agents IA s'appuient sur des navigateurs distants pour automatiser des tâches web sans être bloqués par les mesures anti-scraping. La performance de cette infrastructure de navigateur est essentielle à la réussite d'un agent. Nous avons évalué 8 fournisseurs sur le taux de réussite, la vitesse et les fonctionnalités. Pour ce faire, nous avons exécuté…
Meilleurs RAG outils, frameworks et bibliothèques
RAG améliore les réponses des LLM en les ancrant dans des données externes au lieu de se contenter de ce que le modèle a mémorisé pendant l’entraînement. Nous avons évalué les composants à partir desquels un système RAG est construit et rassemblé les résultats en un seul endroit, avec un guide pratique pour choisir chaque…
Meilleurs 30+ fabricants de puces d'IA: NVIDIA et ses concurrents
Sur la base de notre expérience de l'exécution du AIMultiple benchmark cloud GPU avec 10 modèles GPU différents dans 4 scénarios différents, voici les principales entreprises de matériel d'IA pour les charges de travail des centres de données. *La puce d'IA sélectionnée est le composant, la plateforme ou le projet annoncé qui représente le mieux…
Indice des prix de location de GPU cloud
Les tarifs à la demande des GPU cloud de dernière génération (B200, B300, MI300X, RTX 5090) ont à peu près doublé au cours de l'année écoulée, tandis que les cartes grand public (H100, H200, A100) sont restées dans une fourchette resserrée. Nous compilons l'indice GPU chaque mois à partir de 69 fournisseurs et 17 modèles…
Text-to-SQL: Comparaison de la précision des LLM
Nous avons exécuté 36 large language models sur 759 questions de BIRD-SQL, chaque model écrivant SQL contre une base de données qu’il devait identifier lui-même parmi 11 candidates. Toute requête analysable a été exécutée sur la base de données réelle et son ensemble de résultats comparé à l’ensemble de résultats de la requête de référence…
GPU Benchmark de concurrence: H100 vs H200 vs B200 vs MI300X
J'ai passé les 20 dernières années à me concentrer sur l'optimisation des performances de calcul au niveau système. Nous avons évalué les derniers NVIDIA GPUs, y compris les NVIDIA H100, H200 et B200, et l'AMD MI300X, pour une analyse de mise à l'échelle de la concurrence. En utilisant le framework vLLM avec le gpt-oss-20b model,…
Détection de bots: 9 fournisseurs anti-bots évalués
Nous avons exécuté deux benchmarks sur des sites web en direct, puis identifié l'entreprise anti-bot devant chaque domaine et mesuré à quelle fréquence les domaines de chaque entreprise ont renvoyé le contenu demandé. Cela couvre plus de 3 800 domaines étiquetés et plus de 50 000 requêtes. Le premier benchmark a récupéré des pages produits et de…
Scraper e-commerce: 4 fournisseurs évalués
Nous avons comparé quatre fournisseurs de données web sur 100 domaines e-commerce, en récupérant 65 000 pages produit et recherche chacun, avec un niveau de 5 à 5 000 requêtes simultanées. En moyenne sur les niveaux de simultanéité, Bright Data a atteint le taux de réussite le plus élevé (76 %) avec une médiane de 16…
Recherche agentique: benchmark de 8 API de recherche pour les agents
La recherche agentique joue un rôle crucial pour combler le fossé entre les moteurs de recherche traditionnels et les capacités de recherche de l’IA. Les API de recherche constituent la première couche d’un outil agentique, où la performance plafonne la qualité de tout ce qui suit. Nous avons évalué 8 API de recherche sur 100…
Newsletter AIMultiple
Un e-mail gratuit par semaine contenant les dernières actualités technologiques B2B et des analyses d'experts pour accélérer la croissance de votre entreprise.