Services
Contactez-nous
Ekrem Sarı

Ekrem Sarı

Chercheur en IA
35 Articles
Restez informé des dernières technologies B2B

Ekrem est chercheur en IA et scientifique des données chez AIMultiple. Il conçoit et exécute des benchmarks pratiques pour les systèmes d'IA et de LLM.

Expérience professionnelle

Chez AIMultiple, Ekrem évalue des systèmes d'IA de bout en bout et construit les flux de données et les tableaux de bord utilisés pour suivre les indicateurs de benchmark et de produit. Ses benchmarks couvrent les modèles d'embedding et de reclassement, les bases de données vectorielles et de graphes, les moteurs d'inférence, la quantification, la concurrence GPU et la mise à l'échelle multi-GPU, la tarification et les fournisseurs de GPU cloud, le text-to-SQL, ainsi que les frameworks RAG et RAG agentique.

Avant AIMultiple, il a travaillé comme scientifique des données chez Yandex, où il a interrogé et analysé de grands datasets avec SQL pour évaluer la qualité de la recherche et du classement par rapport à des consignes détaillées.

Intérêts de recherche

Les travaux d'Ekrem portent sur la mesure des performances en conditions réelles des systèmes LLM et de recherche d'information. Il conçoit le harnais de test, exécute les charges de travail sur du matériel réel et compare les modèles, les frameworks et l'infrastructure en termes de précision, de débit, de latence, de coût et d'évolutivité, sur l'ensemble de la pile, des modèles d'embedding et des bases de données vectorielles aux moteurs d'inférence et à l'infrastructure GPU. Son mémoire de master automatise les revues systématiques de la littérature avec un pipeline basé sur RAG.

Formation

Ekrem est titulaire d'un master en systèmes d'information de gestion de l'université Başkent, où son mémoire a automatisé les revues systématiques de la littérature avec un pipeline basé sur RAG, et poursuit un deuxième master en ingénierie des données et de la connaissance à l'université Hacettepe.

Derniers articles de Ekrem

IA
Benchmark
14 Août

Models d'embedding multimodaux: Apple vs Meta vs OpenAI

Les models d’embedding multimodaux excellent à identifier les objets, mais peinent à saisir les relations. Les models actuels ont du mal à distinguer « un téléphone sur une carte » de « une carte sur un téléphone ». Nous avons benchmarké 7 models de premier plan sur MS-COCO et Winoground pour mesurer cette limitation spécifique.…

IA
Benchmark
14 Août

Benchmark de 40+ LLM en finance: Claude Fable 5 & GPT-5.6 Sol

Nous avons évalué les LLM sur 238 questions difficiles du benchmark FinanceReasoning (Tang et al.).1 Ce sous-ensemble cible les tâches de raisonnement financier les plus difficiles, en évaluant le raisonnement quantitatif complexe à plusieurs étapes impliquant des concepts et des formules financiers. Notre évaluation a utilisé une conception de prompt personnalisée et des critères de…

Logiciel d'entreprise
Benchmark
14 Août

Benchmark des logiciels d'archivage d'e-mails

Nous avons provisionné un locataire Microsoft 365, l'avons rempli avec un corpus synthétique de 10 000 e-mails et 1 700 pièces jointes réparties sur 8 sous-types de fichiers, puis avons comparé NinjaOne SaaS Archiver, Barracuda Cloud Archiving Service, Acronis Cyber Protect Cloud Email Archiving et MailPiler sur le même locataire selon 10 dimensions couvrant l'ingestion, la recherche,…

Cybersécurité
Évaluation en Monde Ouvert
14 Août

Benchmark de reprise après sinistre: Acronis vs Comet vs MSP360

Nous avons testé Acronis Cyber Protect Cloud, Comet Backup et MSP360 Managed Backup en matière de reprise après sinistre. Chaque fournisseur a imagé un serveur Windows Server 2022 actif et un serveur Ubuntu 24.04 actif portant la même charge de travail déterministe, un service web, une base de données de 10 000 lignes et 50 fichiers,…

Données
Benchmark
14 Août

Benchmark de bases de données graphiques: Neo4j vs FalkorDB vs Memgraph

Nous avons comparé Neo4j, FalkorDB et Memgraph sur un graphe synthétique dérivé de 120 000 avis produits Amazon (381K nœuds, 804K arêtes). Nous avons exécuté 12 modèles de requêtes avec 1 000 mesures chacun, testé l’ingestion à 6 tailles de lots, maintenu une charge simultanée pendant 60 secondes jusqu’à 32 threads, et mesuré la mémoire, le démarrage…

IA
Benchmark
11 Août

Benchmark RAG Agentic: Routage Multi-Bases de Données sur 36 LLMs

Nous avons benchmarké 36 grands modèles de langage sur le routage inter-bases de données. Chaque modèle reçoit une question en langage naturel et 11 bases de données SQL décrites au niveau paragraphe, puis doit décider quelle base détient la réponse avant d'écrire le moindre SQL. Les 11 bases de données ont été tirées de 80…

Cybersécurité
Benchmark
4 Août

Benchmark des logiciels DLP

Nous avons benchmarké Acronis DeviceLock DLP et ManageEngine DLP Plus sur des machines virtuelles Windows Server 2022 identiques avec 28 scénarios : 23 tests de fuite de données (dont 12 fichiers d’évasion adversariale), 3 tests de sécurité de l’agent et 2 tests avec une forte consommation de CPU et de mémoire. Pour les autres produits…

Données
Benchmark
30 Juil

Web Scraping à Grande Échelle: 7 Fournisseurs Évalués

Nous avons exécuté deux benchmarks sur des sites web réels, de 5 à 5 000 requêtes simultanées. Le premier a envoyé 260 000 requêtes via quatre débloqueurs web sur les 10 000 premiers domaines Tranco, plus un test d'extraction markdown sur 10 000 URLs. Le second a récupéré 65 000 pages produits et pages de recherche auprès de chacun des…

IA
Évaluation en Monde Ouvert
23 Juil

Comparaison des 6 meilleurs services GPU cloud gratuits

Le meilleur niveau gratuit de GPU vaut environ 19 $ par mois aux tarifs de location, et huit plateformes offrent un véritable GPU sans carte de crédit. Six d'entre elles plafonnent l'utilisation gratuit par mois, et nous les avons chiffrées au tarif à la demande le moins cher actuel pour chaque GPU dans nos données…

IA
Benchmark
20 Juil

Calculateur de dimensionnement et de sélection de bases de données vectorielles

La question pratique derrière une base de données vectorielle auto-hébergée pour RAG est de savoir quel moteur convient à un serveur donné, et lequel est exclu par la charge de travail. Le calculateur ci-dessous répond aux deux, à partir de notre benchmark de sept bases de données vectorielles auto-hébergées exécuté à rappel équivalent sur des…