Premium
Services
Premium
Ekrem Sarı

Ekrem Sarı

Chercheur en IA
37 Articles
Restez informé des dernières technologies B2B

Ekrem est chercheur en IA et scientifique des données chez AIMultiple. Il conçoit et exécute des benchmarks pratiques pour les systèmes d'IA et de LLM.

Expérience professionnelle

Chez AIMultiple, Ekrem évalue des systèmes d'IA de bout en bout et construit les flux de données et les tableaux de bord utilisés pour suivre les indicateurs de benchmark et de produit. Ses benchmarks couvrent les modèles d'embedding et de reclassement, les bases de données vectorielles et de graphes, les moteurs d'inférence, la quantification, la concurrence GPU et la mise à l'échelle multi-GPU, la tarification et les fournisseurs de GPU cloud, le text-to-SQL, ainsi que les frameworks RAG et RAG agentique.

Avant AIMultiple, il a travaillé comme scientifique des données chez Yandex, où il a interrogé et analysé de grands datasets avec SQL pour évaluer la qualité de la recherche et du classement par rapport à des consignes détaillées.

Intérêts de recherche

Les travaux d'Ekrem portent sur la mesure des performances en conditions réelles des systèmes LLM et de recherche d'information. Il conçoit le harnais de test, exécute les charges de travail sur du matériel réel et compare les modèles, les frameworks et l'infrastructure en termes de précision, de débit, de latence, de coût et d'évolutivité, sur l'ensemble de la pile, des modèles d'embedding et des bases de données vectorielles aux moteurs d'inférence et à l'infrastructure GPU. Son mémoire de master automatise les revues systématiques de la littérature avec un pipeline basé sur RAG.

Formation

Ekrem est titulaire d'un master en systèmes d'information de gestion de l'université Başkent, où son mémoire a automatisé les revues systématiques de la littérature avec un pipeline basé sur RAG, et poursuit un deuxième master en ingénierie des données et de la connaissance à l'université Hacettepe.

Derniers articles de Ekrem

Logiciel d'entreprise
Benchmark
14 août

Benchmark des logiciels d'archivage d'e-mails

Nous avons provisionné un locataire Microsoft 365, l'avons rempli avec un corpus synthétique de 10 000 e-mails et 1 700 pièces jointes réparties sur 8 sous-types de fichiers, puis avons comparé NinjaOne SaaS Archiver, Barracuda Cloud Archiving Service, Acronis Cyber Protect Cloud Email Archiving et MailPiler sur le même locataire selon 10 dimensions couvrant l'ingestion, la recherche,…

Données
Benchmark
14 août

Benchmark de bases de données graphiques: Neo4j vs FalkorDB vs Memgraph

Nous avons comparé Neo4j, FalkorDB et Memgraph sur un graphe synthétique dérivé de 120 000 avis produits Amazon (381K nœuds, 804K arêtes). Nous avons exécuté 12 modèles de requêtes avec 1 000 mesures chacun, testé l’ingestion à 6 tailles de lots, maintenu une charge simultanée pendant 60 secondes jusqu’à 32 threads, et mesuré la mémoire, le démarrage…

IA
Benchmark
20 juil

Calculateur de dimensionnement et de sélection de bases de données vectorielles

La question pratique derrière une base de données vectorielle auto-hébergée pour RAG est de savoir quel moteur convient à un serveur donné, et lequel est exclu par la charge de travail. Le calculateur ci-dessous répond aux deux, à partir de notre benchmark de sept bases de données vectorielles auto-hébergées exécuté à rappel équivalent sur des…

Logiciel d'entreprise
Benchmark
2 juil

Meilleures fonctions serverless: Vercel vs Azure vs AWS

Les fonctions serverless permettent aux développeurs d'exécuter du code sans avoir à gérer un serveur. Cela leur permet de se concentrer sur l'écriture et le déploiement d'applications tandis que la mise à l'échelle et la maintenance de l'infrastructure sont gérées automatiquement en arrière-plan. Dans ce benchmark, nous avons évalué 7 fournisseurs de services cloud populaires…

IA
Benchmark
1 juil

LLM Moteurs d'inférence: vLLM vs LMDeploy vs SGLang

Nous avons évalué 3 principaux moteurs d'inférence LLM sur du matériel NVIDIA H100 : vLLM, LMDeploy et SGLang. Chaque moteur a traité des charges de travail identiques : 1 000 prompts ShareGPT en utilisant Llama 3.1 8B-Instruct pour isoler le véritable impact de leurs choix architecturaux et de leurs stratégies d'optimisation sur les performances. Nous…

IA
Benchmark
30 juin

Top 10 des modèles d'embedding multilingues pour RAG

Nous avons évalué 10 modèles d’embedding multilingues sur environ 606k avis Amazon dans 6 langues (allemand, anglais, espagnol, français, japonais, chinois). Nous avons généré 1 800 requêtes (300 par langue), chacune faisant référence à des détails concrets de son avis source. Les modèles entraînés pour la recherche (séparation requête vs document) surpassent les modèles plus grands…

IA
Benchmark
15 avr

LLM Quantification: BF16 vs FP8 vs INT4

Nous avons effectué des benchmarks de Qwen3-32B à 4 niveaux de précision (BF16, FP8, GPTQ-Int8, GPTQ-Int4) sur un seul NVIDIA H100 80GB GPU. Chaque configuration a été évaluée sur 2 benchmarks (~12,2K questions) couvrant les connaissances et la génération de code, ainsi que sur plus de 2 000 exécutions d'inférence pour mesurer le débit. Int4…