Services
Contactez-nous
Ekrem Sarı

Ekrem Sarı

Chercheur en IA
35 Articles
Restez informé des dernières technologies B2B

Ekrem est chercheur en IA et scientifique des données chez AIMultiple. Il conçoit et exécute des benchmarks pratiques pour les systèmes d'IA et de LLM.

Expérience professionnelle

Chez AIMultiple, Ekrem évalue des systèmes d'IA de bout en bout et construit les flux de données et les tableaux de bord utilisés pour suivre les indicateurs de benchmark et de produit. Ses benchmarks couvrent les modèles d'embedding et de reclassement, les bases de données vectorielles et de graphes, les moteurs d'inférence, la quantification, la concurrence GPU et la mise à l'échelle multi-GPU, la tarification et les fournisseurs de GPU cloud, le text-to-SQL, ainsi que les frameworks RAG et RAG agentique.

Avant AIMultiple, il a travaillé comme scientifique des données chez Yandex, où il a interrogé et analysé de grands datasets avec SQL pour évaluer la qualité de la recherche et du classement par rapport à des consignes détaillées.

Intérêts de recherche

Les travaux d'Ekrem portent sur la mesure des performances en conditions réelles des systèmes LLM et de recherche d'information. Il conçoit le harnais de test, exécute les charges de travail sur du matériel réel et compare les modèles, les frameworks et l'infrastructure en termes de précision, de débit, de latence, de coût et d'évolutivité, sur l'ensemble de la pile, des modèles d'embedding et des bases de données vectorielles aux moteurs d'inférence et à l'infrastructure GPU. Son mémoire de master automatise les revues systématiques de la littérature avec un pipeline basé sur RAG.

Formation

Ekrem est titulaire d'un master en systèmes d'information de gestion de l'université Başkent, où son mémoire a automatisé les revues systématiques de la littérature avec un pipeline basé sur RAG, et poursuit un deuxième master en ingénierie des données et de la connaissance à l'université Hacettepe.

Derniers articles de Ekrem

Logiciel d'entreprise
Benchmark
2 Juil

Meilleures fonctions serverless: Vercel vs Azure vs AWS

Les fonctions serverless permettent aux développeurs d'exécuter du code sans avoir à gérer un serveur. Cela leur permet de se concentrer sur l'écriture et le déploiement d'applications tandis que la mise à l'échelle et la maintenance de l'infrastructure sont gérées automatiquement en arrière-plan. Dans ce benchmark, nous avons évalué 7 fournisseurs de services cloud populaires…

IA
Benchmark
1 Juil

LLM Moteurs d'inférence: vLLM vs LMDeploy vs SGLang

Nous avons évalué 3 principaux moteurs d'inférence LLM sur du matériel NVIDIA H100 : vLLM, LMDeploy et SGLang. Chaque moteur a traité des charges de travail identiques : 1 000 prompts ShareGPT en utilisant Llama 3.1 8B-Instruct pour isoler le véritable impact de leurs choix architecturaux et de leurs stratégies d'optimisation sur les performances. Nous…

IA
Benchmark
30 Juin

Top 10 des modèles d'embedding multilingues pour RAG

Nous avons évalué 10 modèles d’embedding multilingues sur environ 606k avis Amazon dans 6 langues (allemand, anglais, espagnol, français, japonais, chinois). Nous avons généré 1 800 requêtes (300 par langue), chacune faisant référence à des détails concrets de son avis source. Les modèles entraînés pour la recherche (séparation requête vs document) surpassent les modèles plus grands…

IA
Benchmark
30 Juin

Benchmark Multi-GPU: B200 vs H200 vs H100 vs MI300X

Pendant plus de deux décennies, l'optimisation des performances de calcul a été une pierre angulaire de mon travail. Nous avons effectué des benchmarks des GPU B200, H200, H100 de NVIDIA et MI300X de AMD pour évaluer leur évolutivité pour l'inférence de grands modèles de langage (LLM). En utilisant le framework vLLM avec le modèle meta-llama/Llama-3.1-8B-Instruct,…

IA
Benchmark
15 Avr

LLM Quantification: BF16 vs FP8 vs INT4

Nous avons effectué des benchmarks de Qwen3-32B à 4 niveaux de précision (BF16, FP8, GPTQ-Int8, GPTQ-Int4) sur un seul NVIDIA H100 80GB GPU. Chaque configuration a été évaluée sur 2 benchmarks (~12,2K questions) couvrant les connaissances et la génération de code, ainsi que sur plus de 2 000 exécutions d'inférence pour mesurer le débit. Int4…