Ekrem Sarı
Ekrem est chercheur en IA et scientifique des données chez AIMultiple. Il conçoit et exécute des benchmarks pratiques pour les systèmes d'IA et de LLM.
Expérience professionnelle
Chez AIMultiple, Ekrem évalue des systèmes d'IA de bout en bout et construit les flux de données et les tableaux de bord utilisés pour suivre les indicateurs de benchmark et de produit. Ses benchmarks couvrent les modèles d'embedding et de reclassement, les bases de données vectorielles et de graphes, les moteurs d'inférence, la quantification, la concurrence GPU et la mise à l'échelle multi-GPU, la tarification et les fournisseurs de GPU cloud, le text-to-SQL, ainsi que les frameworks RAG et RAG agentique.
Avant AIMultiple, il a travaillé comme scientifique des données chez Yandex, où il a interrogé et analysé de grands datasets avec SQL pour évaluer la qualité de la recherche et du classement par rapport à des consignes détaillées.
Intérêts de recherche
Les travaux d'Ekrem portent sur la mesure des performances en conditions réelles des systèmes LLM et de recherche d'information. Il conçoit le harnais de test, exécute les charges de travail sur du matériel réel et compare les modèles, les frameworks et l'infrastructure en termes de précision, de débit, de latence, de coût et d'évolutivité, sur l'ensemble de la pile, des modèles d'embedding et des bases de données vectorielles aux moteurs d'inférence et à l'infrastructure GPU. Son mémoire de master automatise les revues systématiques de la littérature avec un pipeline basé sur RAG.
Formation
Ekrem est titulaire d'un master en systèmes d'information de gestion de l'université Başkent, où son mémoire a automatisé les revues systématiques de la littérature avec un pipeline basé sur RAG, et poursuit un deuxième master en ingénierie des données et de la connaissance à l'université Hacettepe.
Derniers articles de Ekrem
Benchmark des modèles d'embedding open source pour RAG
NVIDIA Llama-Embed-Nemotron-8B est en tête en précision. Côté coût, l’EmbeddingGemma-300m de Google est environ 4x moins cher que Nemotron, au prix d’une légère perte de précision. nDCG@3 : Gain cumulé actualisé normalisé avec une coupure à 3. Avec un document pertinent par requête, il vaut 1 / log2(rang + 1) lorsque le document de référence…
Modèles embedding: OpenAI vs Gemini vs Voyage
Nous avons évalué 15 modèles d’embedding de texte en anglais et une référence BM25 sur plus de 500 requêtes sélectionnées manuellement dans trois domaines de recherche : contrats juridiques (CUAD), support client (IBM TechQA) et santé (MedRAG PubMed). Voyage-3.5 se classe premier au classement général. Perplexity Embed V1 0.6b atteint le segment intermédiaire supérieur au…
Benchmark du RAG agentique: routage entre 11 bases de données SQL
La précision de routage est le pourcentage de questions notées pour lesquelles le modèle désigne explicitement la bonne base de données dans sa réponse finale. Le résultat principal utilise les 184 questions signalées comme difficiles à la fois par notre test de similarité et par un jury de trois LLMs. Les déclarations explicites manquantes ne…
Text-to-SQL: Comparaison de la précision des LLM
Nous avons exécuté 36 large language models sur 759 questions de BIRD-SQL, chaque model écrivant SQL contre une base de données qu’il devait identifier lui-même parmi 11 candidates. Toute requête analysable a été exécutée sur la base de données réelle et son ensemble de résultats comparé à l’ensemble de résultats de la requête de référence…
Benchmark de 40+ LLMs en finance: Claude Fable 5 & GPT-5.6 Sol
Nous avons évalué des LLMs sur 238 questions difficiles du benchmark FinanceReasoning (Tang et al.).1 Ce sous-ensemble cible les tâches de raisonnement financier les plus difficiles, évaluant un raisonnement quantitatif complexe en plusieurs étapes impliquant des concepts et des formules financières. Notre évaluation a utilisé une conception de prompt personnalisée et des critères de notation…
Benchmark des logiciels de sauvegarde: Acronis vs NinjaOne vs Comet vs MSP360
Nous avons évalué NinjaOne Backup, Acronis Cyber Protect Cloud Backup, Comet Backup et MSP360 Managed Backup sur une infrastructure AWS identique. Chaque fournisseur a effectué une sauvegarde en mode fichier de la même charge de travail de 625 946 fichiers / 50 Go et une sauvegarde d'image complète du disque système, puis a restauré le sous-répertoire…
Indice des prix de location de GPU cloud
Nous suivons les prix de location affichés de GPU cloud pour 17 modèles auprès de 75 fournisseurs, couvrant les tarifs à la demande, spot et réservés. La catégorie Dernière génération affiche la plus forte hausse de prix parmi les trois groupes. Sa médiane à la demande est passée de $2,12 par GPU-heure en octobre 2024…
Benchmark de rerankers: Top 8 modèles comparés
Nous avons évalué 8 modèles de reranking sur ~145k avis Amazon en anglais afin de mesurer l'amélioration apportée par une étape de reranking à la recherche dense. Nous avons récupéré les 100 meilleurs candidats avec multilingual-e5-base, les avons reclassés avec chaque modèle, et avons évalué les 10 meilleurs résultats par rapport à 300 requêtes, chacune…
Top 30+ fabricants de puces IA: NVIDIA et ses concurrents
Sur la base de notre expérience dans l'exécution du benchmark de GPU cloud d'AIMultiple, nous comparons les fabricants de puces par produit, disponibilité et architecture, en couvrant les GPUs de centre de données, les puces mobiles, les accélérateurs en périphérie et les fonderies. Chaque ligne indique un produit représentatif, son type et sa disponibilité. La…
Détection de bots: 9 fournisseurs anti-bots évalués
Nous avons exécuté deux benchmarks sur des sites web en direct, puis identifié l'entreprise anti-bot devant chaque domaine et mesuré à quelle fréquence les domaines de chaque entreprise ont renvoyé le contenu demandé. Cela couvre plus de 3 800 domaines étiquetés et plus de 50 000 requêtes. Le premier benchmark a récupéré des pages produits et de…
Newsletter AIMultiple
Un e-mail gratuit par semaine contenant les dernières actualités technologiques B2B et des analyses d'experts pour accélérer la croissance de votre entreprise.