Services
Contactez-nous
Ekrem Sarı

Ekrem Sarı

Chercheur en IA
35 Articles
Restez informé des dernières technologies B2B

Ekrem est chercheur en IA et analyste de données chez AIMultiple. Il conçoit et exécute des benchmarks pratiques pour les systèmes d'IA et de LLM.

Expérience professionnelle

Chez AIMultiple, Ekrem effectue des benchmarks de systèmes d'IA de bout en bout et construit les workflows de données et les tableaux de bord utilisés pour suivre les métriques de benchmark et de produit. Ses benchmarks couvrent les models d'embedding et de reranking, les bases de données vectorielles et de graphes, les moteurs d'inference, la quantification, la concurrence GPU et la mise à l'échelle multi-GPU, la tarification et les fournisseurs de GPU cloud, le text-to-SQL, ainsi que les frameworks RAG et RAG agentique.

Avant AIMultiple, il a travaillé comme évaluateur chez Yandex, où il a évalué la qualité de la recherche et étiqueté de grands volumes de données selon des directives détaillées pour soutenir le classement et la qualité des models.

Intérêts de recherche

Le travail d'Ekrem se concentre sur le cycle de vie MLOps et LLMOps et sur la mesure des performances des systèmes d'IA. Il compare les models, les frameworks et l'infrastructure sur des métriques telles que l'exactitude, le débit, le coût de l'API et l'évolutivité, sur l'ensemble de la pile, des models d'embedding et des bases de données vectorielles aux GPU et à l'infrastructure cloud. Son mémoire de master automatise les revues systématiques de la littérature à l'aide d'un pipeline basé sur RAG.

Formation

Ekrem est titulaire d'une licence de Hacettepe University et termine un master à Başkent University.

Derniers articles de Ekrem

IA
Benchmark
14 Août

Benchmark des modèles d'embedding open source pour RAG

NVIDIA Llama-Embed-Nemotron-8B domine en précision. En termes de coût, Google EmbeddingGemma-300m est environ 4x moins cher que Nemotron au prix d'une légère perte de précision. nDCG@3 : Gain cumulé actualisé normalisé à la coupure 3. Avec un document pertinent par requête, il vaut 1 / log2(rang + 1) lorsque le document de référence se classe…

IA
Benchmark
14 Août

Models d'embedding multimodaux: Apple vs Meta vs OpenAI

Les models d’embedding multimodaux excellent à identifier les objets, mais peinent à saisir les relations. Les models actuels ont du mal à distinguer « un téléphone sur une carte » de « une carte sur un téléphone ». Nous avons benchmarké 7 models de premier plan sur MS-COCO et Winoground pour mesurer cette limitation spécifique.…

IA
Benchmark
14 Août

Benchmark de 40+ LLM en finance: Claude Fable 5 & GPT-5.6 Sol

Nous avons évalué les LLM sur 238 questions difficiles du benchmark FinanceReasoning (Tang et al.).1 Ce sous-ensemble cible les tâches de raisonnement financier les plus difficiles, en évaluant le raisonnement quantitatif complexe à plusieurs étapes impliquant des concepts et des formules financiers. Notre évaluation a utilisé une conception de prompt personnalisée et des critères de…

IA
Benchmark
14 Août

Modèles d'embedding: OpenAI vs Gemini vs Voyage

Nous avons évalué 15 modèles d'embedding de texte anglais et une baseline BM25 sur plus de 500 requêtes organisées manuellement dans trois domaines de recherche documentaire : contrats juridiques (CUAD), support client (IBM TechQA) et santé (MedRAG PubMed). Voyage-3.5 arrive en tête du classement général. Perplexity Embed V1 0.6b atteint le niveau moyen-supérieur au prix…

Logiciel d'entreprise
Benchmark
14 Août

Benchmark des logiciels d'archivage d'e-mails

Nous avons provisionné un locataire Microsoft 365, l'avons rempli avec un corpus synthétique de 10 000 e-mails et 1 700 pièces jointes réparties sur 8 sous-types de fichiers, puis avons comparé NinjaOne SaaS Archiver, Barracuda Cloud Archiving Service, Acronis Cyber Protect Cloud Email Archiving et MailPiler sur le même locataire selon 10 dimensions couvrant l'ingestion, la recherche,…

Données
Benchmark
14 Août

Scraper e-commerce: 4 fournisseurs benchmarkés

Nous avons benchmarké quatre fournisseurs de données web sur 100 domaines e-commerce, en récupérant 65 000 pages produit et de recherche chacun à des niveaux de 5 à 5 000 requêtes simultanées. En moyenne sur l’ensemble des niveaux de simultanéité, Bright Data a atteint le taux de réussite le plus élevé (76 %) avec une médiane de 16…

Cybersécurité
Évaluation en Monde Ouvert
14 Août

Benchmark de reprise après sinistre: Acronis vs Comet vs MSP360

Nous avons testé Acronis Cyber Protect Cloud, Comet Backup et MSP360 Managed Backup en matière de reprise après sinistre. Chaque fournisseur a imagé un serveur Windows Server 2022 actif et un serveur Ubuntu 24.04 actif portant la même charge de travail déterministe, un service web, une base de données de 10 000 lignes et 50 fichiers,…

Données
Benchmark
14 Août

Benchmark de bases de données graphiques: Neo4j vs FalkorDB vs Memgraph

Nous avons comparé Neo4j, FalkorDB et Memgraph sur un graphe synthétique dérivé de 120 000 avis produits Amazon (381K nœuds, 804K arêtes). Nous avons exécuté 12 modèles de requêtes avec 1 000 mesures chacun, testé l’ingestion à 6 tailles de lots, maintenu une charge simultanée pendant 60 secondes jusqu’à 32 threads, et mesuré la mémoire, le démarrage…

Cybersécurité
Benchmark
12 Août

Détection de bots: 9 fournisseurs anti-bots évalués

Nous avons exécuté deux benchmarks sur des sites web en direct, puis identifié l'entreprise anti-bot devant chaque domaine et mesuré à quelle fréquence les domaines de chaque entreprise ont renvoyé le contenu demandé. Cela couvre plus de 3 800 domaines étiquetés et plus de 50 000 requêtes. Le premier benchmark a récupéré des pages produits et de…

IA
Comparaison des Fonctionnalités
11 Août

Top 30+ fabricants de puces IA: NVIDIA et ses concurrents

Sur la base de notre expérience de l’exécution du benchmark cloud GPU d’AIMultiple avec 10 modèles de GPU différents dans 4 scénarios différents, voici les principales entreprises de matériel informatique pour les charges de travail des centres de données. *La puce IA sélectionnée est le composant, la plateforme ou le projet annoncé qui représente le…