Services
Contactez-nous
Ekrem Sarı

Ekrem Sarı

Chercheur en IA
32 Articles
Restez informé des dernières technologies B2B

Ekrem est chercheur en IA chez AIMultiple, spécialisé dans l'automatisation intelligente, les GPU, les agents IA et le LLMOps pour les frameworks RAG.

Expérience professionnelle

Durant son poste d'évaluateur chez Yandex, il a analysé les résultats de recherche à l'aide de frameworks propriétaires et de protocoles automatisés. Il a mis en œuvre des tests d'assurance qualité par l'annotation de données, l'attribution de scores de pertinence et la cartographie de l'intention de l'utilisateur sur plus de 10 000 requêtes mensuelles, tout en réalisant des évaluations techniques, notamment le suivi des performances et la détection de spam grâce à des boucles de rétroaction d'apprentissage automatique.

Intérêts de recherche

Chez AIMultiple, ses recherches portent sur le cycle de vie MLOps et l'évaluation des performances des systèmes d'IA de bout en bout. Il contribue à de nombreux projets, notamment l'optimisation de la génération augmentée par la recherche (RAG), l'évaluation comparative de modèles de langage étendus (LLM) et la conception de frameworks d'IA agentiques. Ekrem est spécialisé dans le développement de méthodologies basées sur les données pour mesurer et améliorer les performances des technologies d'IA selon des indicateurs opérationnels critiques tels que la précision, l'efficacité, le coût des API et la scalabilité. Son analyse couvre l'ensemble de la pile technologique, des composants fondamentaux comme les modèles embarqués et les bases de données vectorielles jusqu'à l'infrastructure GPU et cloud haute performance nécessaire au déploiement des agents d'IA.

Éducation

Ekrem est titulaire d'un baccalauréat de l'université Hacettepe et d'une maîtrise de l'université Başkent.

Derniers articles de Ekrem

IA
Benchmark
17 Juil

Top 20+ RAG  frameworks agentiques

Le RAG agentique améliore le RAG traditionnel en boostant les performances des LLM et en permettant une plus grande spécialisation. Nous avons réalisé un benchmark pour évaluer ses performances en matière de routage entre plusieurs bases de données et de génération de requêtes. Explorez les frameworks et bibliothèques de RAG agentique, les principales différences par…

IA
Benchmark
16 Juil

Comparaison des prix, performances et fournisseurs de GPU Cloud

Les prix catalogue des GPU cloud pour le même modèle peuvent différer plusieurs fois d'un fournisseur à l'autre. Nous avons compilé le tarif le plus bas, le fournisseur, la fourchette de marché et la médiane pour plus de 40 configurations de GPU sur les trois niveaux de tarification, ainsi qu'un benchmark de débit par dollar…

IA
Comparaison des Fonctionnalités
16 Juil

Indice des prix de location Cloud GPU

Les tarifs à la demande pour les GPU cloud de dernière génération (B200, B300, MI300X, RTX 5090) ont environ doublé au cours de l'année écoulée, tandis que les cartes grand public (H100, H200, A100) sont restées dans une fourchette étroite. Nous compilons l'indice GPU chaque mois à partir de 63 fournisseurs et 17 GPU models,…

IA
Analyse
12 Juil

LLM Calculateur VRAM pour l'auto-hébergement

Auto-héberger un LLM signifie exécuter l'inférence sur du matériel que l'opérateur contrôle, plutôt que via une API tierce, ce qui modifie le coût, le contrôle des données et le profil de confidentialité. Qu'un modèle puisse fonctionner ou non dépend de la mémoire. Le calculateur estime la VRAM ou la mémoire unifiée dont un modèle a…

IA
Benchmark
10 Juil

Benchmark de 40+ LLMs en finance: Claude Fable 5 & GPT-5.6 Sol

Nous avons évalué 40+ LLMs en finance sur 238 questions difficiles du benchmark FinanceReasoning afin d'identifier les modèles qui excellent dans les tâches de raisonnement financier complexes telles que l'analyse des états financiers, les prévisions et les calculs de ratios. Nous avons évalué les LLMs sur 238 questions difficiles du benchmark FinanceReasoning (Tang et al.).1…

IA
Benchmark
3 Juil

Benchmark de modèles d'embedding open source pour RAG

Nous avons benchmarké 14 modèles d'embedding open source, auto-hébergés sur un seul H100, à travers plus de 500 requêtes de recherche organisées manuellement couvrant des contrats juridiques, des notes techniques de support client et des résumés médicaux. NVIDIA Llama-Embed-Nemotron-8B mène en précision. Côté coût, EmbeddingGemma-300m de Google est environ 4x moins cher que Nemotron au…

IA
Benchmark
2 Juil

Comparer les modèles relationnels fondamentaux

Nous avons évalué SAP-RPT-1-OSS par rapport au boosting gradient (LightGBM, CatBoost) sur 17 jeux de données tabulaires couvrant le spectre sémantique-numérique, les petites tables à forte sémantique, les jeux de données commerciaux mixtes et les grands jeux de données numériques à faible sémantique. Notre objectif est de mesurer où les a priori sémantiques pré-entraînés d’un…

Logiciel d'entreprise
Benchmark
2 Juil

Comparatif des logiciels d'archivage d'e-mails

Nous avons provisionné un tenant Microsoft 365, l'avons peuplé d'un corpus synthétique de 10,000 e-mails et de 1,700 pièces jointes réparties sur 8 sous-types de fichiers, puis avons comparé NinjaOne SaaS Archiver, Barracuda Cloud Archiving Service, Acronis Cyber Protect Cloud Email Archiving et MailPiler sur le même tenant selon 10 dimensions couvrant l'ingestion, la recherche,…

Logiciel d'entreprise
Benchmark
2 Juil

Meilleures fonctions serverless: Vercel vs Azure vs AWS

Les fonctions serverless permettent aux développeurs d'exécuter du code sans avoir à gérer un serveur. Cela leur permet de se concentrer sur l'écriture et le déploiement d'applications tandis que la mise à l'échelle et la maintenance de l'infrastructure sont gérées automatiquement en arrière-plan. Dans ce benchmark, nous avons évalué 7 fournisseurs de services cloud populaires…

IA
Benchmark
2 Juil

Modèles d'embedding multimodaux: Apple vs Meta vs OpenAI

Les modèles d'embedding multimodaux excellent dans l'identification d'objets mais peinent avec les relations. Les modèles actuels ont du mal à distinguer « un téléphone sur une carte » d'« une carte sur un téléphone ». Nous avons évalué 7 modèles de premier plan sur MS-COCO et Winoground pour mesurer cette limitation spécifique. Pour assurer une…