Ekrem Sarı
Ekrem est chercheur en IA et analyste de données chez AIMultiple. Il conçoit et exécute des benchmarks pratiques pour les systèmes d'IA et de LLM.
Expérience professionnelle
Chez AIMultiple, Ekrem effectue des benchmarks de systèmes d'IA de bout en bout et construit les workflows de données et les tableaux de bord utilisés pour suivre les métriques de benchmark et de produit. Ses benchmarks couvrent les models d'embedding et de reranking, les bases de données vectorielles et de graphes, les moteurs d'inference, la quantification, la concurrence GPU et la mise à l'échelle multi-GPU, la tarification et les fournisseurs de GPU cloud, le text-to-SQL, ainsi que les frameworks RAG et RAG agentique.
Avant AIMultiple, il a travaillé comme évaluateur chez Yandex, où il a évalué la qualité de la recherche et étiqueté de grands volumes de données selon des directives détaillées pour soutenir le classement et la qualité des models.
Intérêts de recherche
Le travail d'Ekrem se concentre sur le cycle de vie MLOps et LLMOps et sur la mesure des performances des systèmes d'IA. Il compare les models, les frameworks et l'infrastructure sur des métriques telles que l'exactitude, le débit, le coût de l'API et l'évolutivité, sur l'ensemble de la pile, des models d'embedding et des bases de données vectorielles aux GPU et à l'infrastructure cloud. Son mémoire de master automatise les revues systématiques de la littérature à l'aide d'un pipeline basé sur RAG.
Formation
Ekrem est titulaire d'une licence de Hacettepe University et termine un master à Başkent University.
Derniers articles de Ekrem
Navigateurs distants: Infrastructure Web pour agents IA comparée
Les agents IA s'appuient sur des navigateurs distants pour automatiser les tâches web sans être bloqués par les mesures anti-scraping. La performance de cette infrastructure de navigateur est cruciale pour le succès d'un agent. Nous avons évalué 8 fournisseurs sur le taux de réussite, la vitesse et les fonctionnalités. Pour ce faire, nous avons exécuté…
LLM Moteurs d'inférence: vLLM vs LMDeploy vs SGLang
Nous avons évalué 3 principaux moteurs d'inférence LLM sur du matériel NVIDIA H100 : vLLM, LMDeploy et SGLang. Chaque moteur a traité des charges de travail identiques : 1 000 prompts ShareGPT en utilisant Llama 3.1 8B-Instruct pour isoler le véritable impact de leurs choix architecturaux et de leurs stratégies d'optimisation sur les performances. Nous…
Top 10 des modèles d'embedding multilingues pour RAG
Nous avons évalué 10 modèles d’embedding multilingues sur environ 606k avis Amazon dans 6 langues (allemand, anglais, espagnol, français, japonais, chinois). Nous avons généré 1 800 requêtes (300 par langue), chacune faisant référence à des détails concrets de son avis source. Les modèles entraînés pour la recherche (séparation requête vs document) surpassent les modèles plus grands…
Benchmark Multi-GPU: B200 vs H200 vs H100 vs MI300X
Pendant plus de deux décennies, l'optimisation des performances de calcul a été une pierre angulaire de mon travail. Nous avons effectué des benchmarks des GPU B200, H200, H100 de NVIDIA et MI300X de AMD pour évaluer leur évolutivité pour l'inférence de grands modèles de langage (LLM). En utilisant le framework vLLM avec le modèle meta-llama/Llama-3.1-8B-Instruct,…
LLM Quantification: BF16 vs FP8 vs INT4
Nous avons effectué des benchmarks de Qwen3-32B à 4 niveaux de précision (BF16, FP8, GPTQ-Int8, GPTQ-Int4) sur un seul NVIDIA H100 80GB GPU. Chaque configuration a été évaluée sur 2 benchmarks (~12,2K questions) couvrant les connaissances et la génération de code, ainsi que sur plus de 2 000 exécutions d'inférence pour mesurer le débit. Int4…
Newsletter AIMultiple
Un e-mail gratuit par semaine contenant les dernières actualités technologiques B2B et des analyses d'experts pour accélérer la croissance de votre entreprise.