Ekrem Sarı
Ekrem est chercheur en IA et analyste de données chez AIMultiple. Il conçoit et exécute des benchmarks pratiques pour les systèmes d'IA et de LLM.
Expérience professionnelle
Chez AIMultiple, Ekrem effectue des benchmarks de systèmes d'IA de bout en bout et construit les workflows de données et les tableaux de bord utilisés pour suivre les métriques de benchmark et de produit. Ses benchmarks couvrent les models d'embedding et de reranking, les bases de données vectorielles et de graphes, les moteurs d'inference, la quantification, la concurrence GPU et la mise à l'échelle multi-GPU, la tarification et les fournisseurs de GPU cloud, le text-to-SQL, ainsi que les frameworks RAG et RAG agentique.
Avant AIMultiple, il a travaillé comme évaluateur chez Yandex, où il a évalué la qualité de la recherche et étiqueté de grands volumes de données selon des directives détaillées pour soutenir le classement et la qualité des models.
Intérêts de recherche
Le travail d'Ekrem se concentre sur le cycle de vie MLOps et LLMOps et sur la mesure des performances des systèmes d'IA. Il compare les models, les frameworks et l'infrastructure sur des métriques telles que l'exactitude, le débit, le coût de l'API et l'évolutivité, sur l'ensemble de la pile, des models d'embedding et des bases de données vectorielles aux GPU et à l'infrastructure cloud. Son mémoire de master automatise les revues systématiques de la littérature à l'aide d'un pipeline basé sur RAG.
Formation
Ekrem est titulaire d'une licence de Hacettepe University et termine un master à Başkent University.
Derniers articles de Ekrem
Benchmark RAG Agentic: Routage Multi-Bases de Données sur 36 LLMs
Nous avons benchmarké 36 grands modèles de langage sur le routage inter-bases de données. Chaque modèle reçoit une question en langage naturel et 11 bases de données SQL décrites au niveau paragraphe, puis doit décider quelle base détient la réponse avant d'écrire le moindre SQL. Les 11 bases de données ont été tirées de 80…
Top 60+ fournisseurs Cloud GPU
Les fournisseurs de GPU cloud se répartissent en trois niveaux. Les hyperscalers exploitent de larges plateformes cloud où la location de GPU n’est qu’un produit parmi d’autres. Les néoclouds spécialisés se concentrent sur l’infrastructure GPU et IA comme produit principal. Les places de marché communautaires agrègent l’inventaire de nombreux petits opérateurs, souvent au plus bas…
Text-to-SQL: Comparaison de la précision des LLM
Nous avons exécuté 36 grands modèles de langage sur 759 questions de BIRD-SQL, chaque modèle écrivant du SQL contre une base de données qu'il devait identifier par lui-même parmi 11 candidates. Chaque requête analysable a été exécutée contre la base de données réelle et son ensemble de résultats comparé à l'ensemble de résultats de la…
Frameworks RAG: LangChain vs LangGraph vs LlamaIndex
Nous avons évalué 5 frameworks RAG : LangChain, LangGraph, LlamaIndex, Haystack et DSPy, en construisant le même workflow RAG agentique avec des composants standardisés : modèles identiques (GPT-4.1-mini), embeddings (BGE-small), retriever (Qdrant) et outils (recherche web Tavily). Cela isole le véritable surcoût et l'efficacité en tokens de chaque framework. Le benchmark comprenait 100 requêtes, chaque…
Test comparatif des logiciels de sauvegarde: Acronis vs NinjaOne vs Comet vs MSP360
Nous avons testé NinjaOne Backup, Acronis Cyber Protect Cloud Backup, Comet Backup et MSP360 Managed Backup sur une infrastructure AWS identique. Chaque fournisseur a exécuté une sauvegarde en mode fichier de la même charge de travail de 625 946 fichiers / 50 Go et une sauvegarde complète de l'image du disque système, puis a restauré…
Comparaison des modèles de fondation relationnels
Nous avons comparé SAP-RPT-1-OSS au gradient boosting (LightGBM, CatBoost) sur 17 jeux de données tabulaires couvrant le spectre sémantique‑numérique, des petites tables à haute sémantique, des jeux de données métier mixtes et de grands jeux de données numériques à faible sémantique. Notre objectif est de mesurer où les priors sémantiques pré‑entraînés d’un LLM relationnel peuvent…
Recherche agentique: Benchmark de 8 API de recherche pour agents
La recherche agentique joue un rôle crucial pour combler le fossé entre les moteurs de recherche traditionnels et les capacités de recherche IA. Les API de recherche constituent la première couche d'un outil agentique, où les performances plafonnent la qualité de tout ce qui suit en aval. Nous avons évalué 8 API de recherche sur…
Benchmark des logiciels DLP
Nous avons benchmarké Acronis DeviceLock DLP et ManageEngine DLP Plus sur des machines virtuelles Windows Server 2022 identiques avec 28 scénarios : 23 tests de fuite de données (dont 12 fichiers d’évasion adversariale), 3 tests de sécurité de l’agent et 2 tests avec une forte consommation de CPU et de mémoire. Pour les autres produits…
Benchmark des rerankers: Comparaison des 8 meilleurs modèles
Nous avons évalué 8 modèles de reranking sur environ 145k avis Amazon en anglais pour mesurer l'amélioration apportée par une étape de reranking à la recherche dense. Nous avons récupéré les 100 premiers candidats avec multilingual-e5-base, les avons rerankés avec chaque modèle, et avons évalué les 10 premiers résultats par rapport à 300 requêtes, chacune…
GPU Benchmark de concurrence: H100 vs H200 vs B200 vs MI300X
J'ai passé les 20 dernières années à me concentrer sur l'optimisation des performances informatiques au niveau système. Nous avons évalué les derniers NVIDIA GPUs, y compris les NVIDIA H100, H200 et B200, et le AMD MI300X, pour une analyse de la scalabilité concurrentielle. En utilisant le framework vLLM avec le gpt-oss-20b model, nous avons testé…
Newsletter AIMultiple
Un e-mail gratuit par semaine contenant les dernières actualités technologiques B2B et des analyses d'experts pour accélérer la croissance de votre entreprise.