Ekrem Sarı
Ekrem est chercheur en IA et analyste de données chez AIMultiple. Il conçoit et exécute des benchmarks pratiques pour les systèmes d'IA et de LLM.
Expérience professionnelle
Chez AIMultiple, Ekrem effectue des benchmarks de systèmes d'IA de bout en bout et construit les workflows de données et les tableaux de bord utilisés pour suivre les métriques de benchmark et de produit. Ses benchmarks couvrent les models d'embedding et de reranking, les bases de données vectorielles et de graphes, les moteurs d'inference, la quantification, la concurrence GPU et la mise à l'échelle multi-GPU, la tarification et les fournisseurs de GPU cloud, le text-to-SQL, ainsi que les frameworks RAG et RAG agentique.
Avant AIMultiple, il a travaillé comme évaluateur chez Yandex, où il a évalué la qualité de la recherche et étiqueté de grands volumes de données selon des directives détaillées pour soutenir le classement et la qualité des models.
Intérêts de recherche
Le travail d'Ekrem se concentre sur le cycle de vie MLOps et LLMOps et sur la mesure des performances des systèmes d'IA. Il compare les models, les frameworks et l'infrastructure sur des métriques telles que l'exactitude, le débit, le coût de l'API et l'évolutivité, sur l'ensemble de la pile, des models d'embedding et des bases de données vectorielles aux GPU et à l'infrastructure cloud. Son mémoire de master automatise les revues systématiques de la littérature à l'aide d'un pipeline basé sur RAG.
Formation
Ekrem est titulaire d'une licence de Hacettepe University et termine un master à Başkent University.
Derniers articles de Ekrem
Benchmark des modèles d'embedding open source pour RAG
NVIDIA Llama-Embed-Nemotron-8B domine en précision. En termes de coût, Google EmbeddingGemma-300m est environ 4x moins cher que Nemotron au prix d'une légère perte de précision. nDCG@3 : Gain cumulé actualisé normalisé à la coupure 3. Avec un document pertinent par requête, il vaut 1 / log2(rang + 1) lorsque le document de référence se classe…
Models d'embedding multimodaux: Apple vs Meta vs OpenAI
Les models d’embedding multimodaux excellent à identifier les objets, mais peinent à saisir les relations. Les models actuels ont du mal à distinguer « un téléphone sur une carte » de « une carte sur un téléphone ». Nous avons benchmarké 7 models de premier plan sur MS-COCO et Winoground pour mesurer cette limitation spécifique.…
Benchmark de 40+ LLM en finance: Claude Fable 5 & GPT-5.6 Sol
Nous avons évalué les LLM sur 238 questions difficiles du benchmark FinanceReasoning (Tang et al.).1 Ce sous-ensemble cible les tâches de raisonnement financier les plus difficiles, en évaluant le raisonnement quantitatif complexe à plusieurs étapes impliquant des concepts et des formules financiers. Notre évaluation a utilisé une conception de prompt personnalisée et des critères de…
Modèles d'embedding: OpenAI vs Gemini vs Voyage
Nous avons évalué 15 modèles d'embedding de texte anglais et une baseline BM25 sur plus de 500 requêtes organisées manuellement dans trois domaines de recherche documentaire : contrats juridiques (CUAD), support client (IBM TechQA) et santé (MedRAG PubMed). Voyage-3.5 arrive en tête du classement général. Perplexity Embed V1 0.6b atteint le niveau moyen-supérieur au prix…
Benchmark des logiciels d'archivage d'e-mails
Nous avons provisionné un locataire Microsoft 365, l'avons rempli avec un corpus synthétique de 10 000 e-mails et 1 700 pièces jointes réparties sur 8 sous-types de fichiers, puis avons comparé NinjaOne SaaS Archiver, Barracuda Cloud Archiving Service, Acronis Cyber Protect Cloud Email Archiving et MailPiler sur le même locataire selon 10 dimensions couvrant l'ingestion, la recherche,…
Scraper e-commerce: 4 fournisseurs benchmarkés
Nous avons benchmarké quatre fournisseurs de données web sur 100 domaines e-commerce, en récupérant 65 000 pages produit et de recherche chacun à des niveaux de 5 à 5 000 requêtes simultanées. En moyenne sur l’ensemble des niveaux de simultanéité, Bright Data a atteint le taux de réussite le plus élevé (76 %) avec une médiane de 16…
Benchmark de reprise après sinistre: Acronis vs Comet vs MSP360
Nous avons testé Acronis Cyber Protect Cloud, Comet Backup et MSP360 Managed Backup en matière de reprise après sinistre. Chaque fournisseur a imagé un serveur Windows Server 2022 actif et un serveur Ubuntu 24.04 actif portant la même charge de travail déterministe, un service web, une base de données de 10 000 lignes et 50 fichiers,…
Benchmark de bases de données graphiques: Neo4j vs FalkorDB vs Memgraph
Nous avons comparé Neo4j, FalkorDB et Memgraph sur un graphe synthétique dérivé de 120 000 avis produits Amazon (381K nœuds, 804K arêtes). Nous avons exécuté 12 modèles de requêtes avec 1 000 mesures chacun, testé l’ingestion à 6 tailles de lots, maintenu une charge simultanée pendant 60 secondes jusqu’à 32 threads, et mesuré la mémoire, le démarrage…
Détection de bots: 9 fournisseurs anti-bots évalués
Nous avons exécuté deux benchmarks sur des sites web en direct, puis identifié l'entreprise anti-bot devant chaque domaine et mesuré à quelle fréquence les domaines de chaque entreprise ont renvoyé le contenu demandé. Cela couvre plus de 3 800 domaines étiquetés et plus de 50 000 requêtes. Le premier benchmark a récupéré des pages produits et de…
Top 30+ fabricants de puces IA: NVIDIA et ses concurrents
Sur la base de notre expérience de l’exécution du benchmark cloud GPU d’AIMultiple avec 10 modèles de GPU différents dans 4 scénarios différents, voici les principales entreprises de matériel informatique pour les charges de travail des centres de données. *La puce IA sélectionnée est le composant, la plateforme ou le projet annoncé qui représente le…
Newsletter AIMultiple
Un e-mail gratuit par semaine contenant les dernières actualités technologiques B2B et des analyses d'experts pour accélérer la croissance de votre entreprise.