Premium
Services
Premium
Ekrem Sarı

Ekrem Sarı

Chercheur en IA
37 Articles
Restez informé des dernières technologies B2B

Ekrem est chercheur en IA et scientifique des données chez AIMultiple. Il conçoit et exécute des benchmarks pratiques pour les systèmes d'IA et de LLM.

Expérience professionnelle

Chez AIMultiple, Ekrem évalue des systèmes d'IA de bout en bout et construit les flux de données et les tableaux de bord utilisés pour suivre les indicateurs de benchmark et de produit. Ses benchmarks couvrent les modèles d'embedding et de reclassement, les bases de données vectorielles et de graphes, les moteurs d'inférence, la quantification, la concurrence GPU et la mise à l'échelle multi-GPU, la tarification et les fournisseurs de GPU cloud, le text-to-SQL, ainsi que les frameworks RAG et RAG agentique.

Avant AIMultiple, il a travaillé comme scientifique des données chez Yandex, où il a interrogé et analysé de grands datasets avec SQL pour évaluer la qualité de la recherche et du classement par rapport à des consignes détaillées.

Intérêts de recherche

Les travaux d'Ekrem portent sur la mesure des performances en conditions réelles des systèmes LLM et de recherche d'information. Il conçoit le harnais de test, exécute les charges de travail sur du matériel réel et compare les modèles, les frameworks et l'infrastructure en termes de précision, de débit, de latence, de coût et d'évolutivité, sur l'ensemble de la pile, des modèles d'embedding et des bases de données vectorielles aux moteurs d'inférence et à l'infrastructure GPU. Son mémoire de master automatise les revues systématiques de la littérature avec un pipeline basé sur RAG.

Formation

Ekrem est titulaire d'un master en systèmes d'information de gestion de l'université Başkent, où son mémoire a automatisé les revues systématiques de la littérature avec un pipeline basé sur RAG, et poursuit un deuxième master en ingénierie des données et de la connaissance à l'université Hacettepe.

Derniers articles de Ekrem

IA
Benchmark
26 sep

Benchmark des modèles d'embedding open source pour RAG

NVIDIA Llama-Embed-Nemotron-8B est en tête en précision. Côté coût, l’EmbeddingGemma-300m de Google est environ 4x moins cher que Nemotron, au prix d’une légère perte de précision. nDCG@3 : Gain cumulé actualisé normalisé avec une coupure à 3. Avec un document pertinent par requête, il vaut 1 / log2(rang + 1) lorsque le document de référence…

IA
Benchmark
26 sep

Modèles embedding: OpenAI vs Gemini vs Voyage

Nous avons évalué 15 modèles d’embedding de texte en anglais et une référence BM25 sur plus de 500 requêtes sélectionnées manuellement dans trois domaines de recherche : contrats juridiques (CUAD), support client (IBM TechQA) et santé (MedRAG PubMed). Voyage-3.5 se classe premier au classement général. Perplexity Embed V1 0.6b atteint le segment intermédiaire supérieur au…

IA
Benchmark
25 sep

Benchmark du RAG agentique: routage entre 11 bases de données SQL

La précision de routage est le pourcentage de questions notées pour lesquelles le modèle désigne explicitement la bonne base de données dans sa réponse finale. Le résultat principal utilise les 184 questions signalées comme difficiles à la fois par notre test de similarité et par un jury de trois LLMs. Les déclarations explicites manquantes ne…

IA
Benchmark
25 sep

Text-to-SQL: Comparaison de la précision des LLM

Nous avons exécuté 36 large language models sur 759 questions de BIRD-SQL, chaque model écrivant SQL contre une base de données qu’il devait identifier lui-même parmi 11 candidates. Toute requête analysable a été exécutée sur la base de données réelle et son ensemble de résultats comparé à l’ensemble de résultats de la requête de référence…

IA
Benchmark
24 sep

Benchmark de 40+ LLMs en finance: Claude Fable 5 & GPT-5.6 Sol

Nous avons évalué des LLMs sur 238 questions difficiles du benchmark FinanceReasoning (Tang et al.).1 Ce sous-ensemble cible les tâches de raisonnement financier les plus difficiles, évaluant un raisonnement quantitatif complexe en plusieurs étapes impliquant des concepts et des formules financières. Notre évaluation a utilisé une conception de prompt personnalisée et des critères de notation…

Cybersécurité
Benchmark
22 sep

Benchmark des logiciels de sauvegarde: Acronis vs NinjaOne vs Comet vs MSP360

Nous avons évalué NinjaOne Backup, Acronis Cyber Protect Cloud Backup, Comet Backup et MSP360 Managed Backup sur une infrastructure AWS identique. Chaque fournisseur a effectué une sauvegarde en mode fichier de la même charge de travail de 625 946 fichiers / 50 Go et une sauvegarde d'image complète du disque système, puis a restauré le sous-répertoire…

IA
Comparaison des Fonctionnalités
22 sep

Indice des prix de location de GPU cloud

Nous suivons les prix de location affichés de GPU cloud pour 17 modèles auprès de 75 fournisseurs, couvrant les tarifs à la demande, spot et réservés. La catégorie Dernière génération affiche la plus forte hausse de prix parmi les trois groupes. Sa médiane à la demande est passée de $2,12 par GPU-heure en octobre 2024…

IA
Benchmark
22 sep

Benchmark de rerankers: Top 8 modèles comparés

Nous avons évalué 8 modèles de reranking sur ~145k avis Amazon en anglais afin de mesurer l'amélioration apportée par une étape de reranking à la recherche dense. Nous avons récupéré les 100 meilleurs candidats avec multilingual-e5-base, les avons reclassés avec chaque modèle, et avons évalué les 10 meilleurs résultats par rapport à 300 requêtes, chacune…

IA
Comparaison des Fonctionnalités
21 sep

Top 30+ fabricants de puces IA: NVIDIA et ses concurrents

Sur la base de notre expérience dans l'exécution du benchmark de GPU cloud d'AIMultiple, nous comparons les fabricants de puces par produit, disponibilité et architecture, en couvrant les GPUs de centre de données, les puces mobiles, les accélérateurs en périphérie et les fonderies. Chaque ligne indique un produit représentatif, son type et sa disponibilité. La…

Cybersécurité
Benchmark
21 sep

Détection de bots: 9 fournisseurs anti-bots évalués

Nous avons exécuté deux benchmarks sur des sites web en direct, puis identifié l'entreprise anti-bot devant chaque domaine et mesuré à quelle fréquence les domaines de chaque entreprise ont renvoyé le contenu demandé. Cela couvre plus de 3 800 domaines étiquetés et plus de 50 000 requêtes. Le premier benchmark a récupéré des pages produits et de…