Ekrem Sarı
Ekrem est chercheur en IA chez AIMultiple, spécialisé dans l'automatisation intelligente, les GPU, les agents IA et le LLMOps pour les frameworks RAG.
Expérience professionnelle
Durant son poste d'évaluateur chez Yandex, il a analysé les résultats de recherche à l'aide de frameworks propriétaires et de protocoles automatisés. Il a mis en œuvre des tests d'assurance qualité par l'annotation de données, l'attribution de scores de pertinence et la cartographie de l'intention de l'utilisateur sur plus de 10 000 requêtes mensuelles, tout en réalisant des évaluations techniques, notamment le suivi des performances et la détection de spam grâce à des boucles de rétroaction d'apprentissage automatique.Intérêts de recherche
Chez AIMultiple, ses recherches portent sur le cycle de vie MLOps et l'évaluation des performances des systèmes d'IA de bout en bout. Il contribue à de nombreux projets, notamment l'optimisation de la génération augmentée par la recherche (RAG), l'évaluation comparative de modèles de langage étendus (LLM) et la conception de frameworks d'IA agentiques. Ekrem est spécialisé dans le développement de méthodologies basées sur les données pour mesurer et améliorer les performances des technologies d'IA selon des indicateurs opérationnels critiques tels que la précision, l'efficacité, le coût des API et la scalabilité. Son analyse couvre l'ensemble de la pile technologique, des composants fondamentaux comme les modèles embarqués et les bases de données vectorielles jusqu'à l'infrastructure GPU et cloud haute performance nécessaire au déploiement des agents d'IA.Éducation
Ekrem est titulaire d'un baccalauréat de l'université Hacettepe et d'une maîtrise de l'université Başkent.Derniers articles de Ekrem
RAG Outils d'évaluation: Weights & Biases vs Ragas vs DeepEval
Lorsqu'un pipeline RAG récupère le mauvais contexte, le LLM génère avec confiance la mauvaise réponse. Les scoreurs de pertinence du contexte sont la première ligne de défense. Nous avons évalué cinq outils sur 1 460 questions et plus de 14 600 contextes notés dans des conditions identiques : même modèle juge (GPT-4o), configurations par défaut…
Navigateurs distants: Infrastructure Web pour agents IA comparée
Les agents IA s'appuient sur des navigateurs distants pour automatiser les tâches web sans être bloqués par les mesures anti-scraping. La performance de cette infrastructure de navigateur est cruciale pour le succès d'un agent. Nous avons évalué 8 fournisseurs sur le taux de réussite, la vitesse et les fonctionnalités. Pour ce faire, nous avons exécuté…
Test de base de données de graphe: Neo4j vs FalkorDB vs Memgraph
Nous avons testé Neo4j, FalkorDB et Memgraph sur un graphe synthétique dérivé de 120 000 avis produits Amazon (381K nœuds, 804K arêtes). Nous avons exécuté 12 modèles de requête avec 1 000 mesures chacun, testé l'ingestion sur 6 tailles de lot, maintenu une charge simultanée pendant 60 secondes avec jusqu'à 32 threads, et mesuré la…
LLM Moteurs d'inférence: vLLM vs LMDeploy vs SGLang
Nous avons évalué 3 principaux moteurs d'inférence LLM sur du matériel NVIDIA H100 : vLLM, LMDeploy et SGLang. Chaque moteur a traité des charges de travail identiques : 1 000 prompts ShareGPT en utilisant Llama 3.1 8B-Instruct pour isoler le véritable impact de leurs choix architecturaux et de leurs stratégies d'optimisation sur les performances. Nous…
Top 10 des modèles d'embedding multilingues pour RAG
Nous avons évalué 10 modèles d’embedding multilingues sur environ 606k avis Amazon dans 6 langues (allemand, anglais, espagnol, français, japonais, chinois). Nous avons généré 1,800 requêtes (300 par langue), chacune faisant référence à des détails concrets de son avis source. Les modèles entraînés pour la recherche (séparation requête vs document) surpassent les modèles plus grands…
Benchmark Multi-GPU: B200 vs H200 vs H100 vs MI300X
Pendant plus de deux décennies, l'optimisation des performances de calcul a été une pierre angulaire de mon travail. Nous avons effectué des benchmarks des GPU B200, H200, H100 de NVIDIA et MI300X de AMD pour évaluer leur évolutivité pour l'inférence de grands modèles de langage (LLM). En utilisant le framework vLLM avec le modèle meta-llama/Llama-3.1-8B-Instruct,…
Modèles d'embedding: OpenAI vs Gemini vs Voyage
Nous avons évalué 15 modèles d'embedding de texte en anglais et une baseline BM25 sur plus de 500 requêtes sélectionnées manuellement dans trois domaines de recherche documentaire : contrats juridiques (CUAD), support client (IBM TechQA) et santé (MedRAG PubMed). Voyage-3.5 se classe premier toutes catégories. Perplexity Embed V1 0.6b atteint le niveau intermédiaire supérieur au…
RAG Frameworks: LangChain vs LangGraph vs LlamaIndex
Nous avons benchmarké 5 frameworks RAG : LangChain, LangGraph, LlamaIndex, Haystack et DSPy, en construisant le même workflow RAG agentique avec des composants standardisés : modèles identiques (GPT-4.1-mini), embeddings (BGE-small), retriever (Qdrant) et outils (recherche web Tavily). Cela isole la véritable surcharge et l'efficacité en tokens de chaque framework. Le benchmark comprenait 100 requêtes, chaque…
Benchmark des rerankers: Comparaison des 8 meilleurs modèles
Nous avons évalué 8 modèles de reranking sur environ 145 000 avis Amazon en anglais pour mesurer dans quelle mesure une étape de reranking améliore la recherche dense. Nous avons récupéré les 100 meilleurs candidats avec multilingual-e5-base, nous les avons rerankés avec chaque modèle, et nous avons évalué les 10 meilleurs résultats par rapport à…
Recherche Agentic: Benchmark de 8 APIs de Recherche pour Agents
La recherche agentic joue un rôle crucial pour combler le fossé entre les moteurs de recherche traditionnels et les capacités de recherche IA. Les APIs de recherche sont la première couche d'un outil agentic, où la performance plafonne la qualité de tout ce qui est en aval. Nous avons évalué 8 APIs de recherche sur…
Newsletter AIMultiple
Un e-mail gratuit par semaine contenant les dernières actualités technologiques B2B et des analyses d'experts pour accélérer la croissance de votre entreprise.