Şevval Alper
Intérêts de recherche
Şevval se concentre sur les outils de codage IA, les agents IA et les technologies quantiques.Elle fait partie de l’équipe benchmark de AIMultiple, réalisant des évaluations et fournissant des informations pour aider les lecteurs à comprendre diverses technologies émergentes et leurs applications.
Expérience professionnelle
Elle a contribué à l’organisation et à l’encadrement des participants lors de trois événements « CERN International Masterclasses - hands-on particle physics » en Turquie, en travaillant aux côtés des enseignants pour faciliter l’apprentissage.Formation
Şevval est titulaire d’une licence en physique de la Middle East Technical University.Derniers articles de Şevval
Benchmark de codage IA: Claude Code vs Cursor
Dans le codage IA, le marché s'est fragmenté en deux catégories : les outils CLI agentique et les éditeurs de code IA intégrés aux IDE. Chacun prétend automatiser le développement. Peu de comparaisons montrent en quoi ils diffèrent sur des charges de travail identiques. Nous avons évalué chaque agent sur 10 tâches de développement web…
Simulation d'audience: Les LLM peuvent-elles prédire le comportement humain ?
En marketing, évaluer avec quelle précision les LLMs prédisent le comportement humain est crucial pour estimer leur efficacité à anticiper les besoins du public et pour reconnaître les risques de décalage, de communication inefficace ou d'influence non désirée. La simulation d'audience avec des LLMs permet de modéliser des publics virtuels, aidant les organisations à anticiper…
Agents IA: Opérateur vs Utilisation du navigateur vs Projet Mariner
Les agents IA sont de plus en plus commercialisés comme des travailleurs numériques de bout en bout, mais les performances réelles peuvent varier considérablement en fonction de la tâche, des outils et de l'environnement d'exécution. Pour comprendre ce que ces systèmes peuvent réellement livrer aujourd'hui, nous avons mené des tests pratiques dans des scénarios commerciaux…
Exécution de code avec MCP: une nouvelle approche de l'efficacité des agents IA
Anthropic a introduit une méthode dans laquelle les agents IA interagissent avec les Model Context Protocol (MCP) serveurs en écrivant du code exécutable plutôt que de faire des appels directs aux outils. L’agent traite les outils comme des fichiers sur un ordinateur, trouve ce dont il a besoin et les utilise directement avec du code,…
Benchmark des plateformes d'agents IA: Claude Managed Agents contre Google Vertex Agent Engine
Nous avons benchmarké 4 plateformes d'agents IA selon 3 dimensions : réalisation des tâches (10 tâches de codage × 3 exécutions), capacités spécifiques au harnais (pilotage, reconnexion, rappel de longue conversation, gestion de gros fichiers) et coût. Claude Managed Agents et Vertex IA Agent Engine atteignent toutes deux un taux de réussite de 100 % sur…
RELC-Bench: Benchmark de récupération en contexte long
RELC-Bench (RELC-Bench : Benchmark de récupération en contexte long) vise à mesurer la capacité d'un modèle à trouver et extraire une valeur numérique spécifique d'un ou plusieurs documents dans son contexte. Il teste si le modèle peut se souvenir et récupérer un fait spécifique qu'il vient de voir dans l'entrée. claude-fable-5 obtient 97,0 % sur les…
MCP Benchmark: Meilleurs serveurs MCP pour l'accès Web
Nous avons évalué 8 serveurs MCP sur des tâches de recherche et extraction Web, ainsi que d'automatisation de navigateur, en exécutant 4 tâches différentes 5 fois sur tous les MCPs appropriés. Nous avons également effectué un test de charge impliquant 250 agents IA simultanés. *Les tâches de recherche et extraction Web sont exécutées avec le…
LLM Paramètres: GPT-5 High, Moyen, Bas et Minimal
Certains LLMs, comme OpenAI’s GPT-5 family, existent en différentes versions (par exemple, GPT-5, GPT-5-mini et GPT-5-nano) et avec divers réglages de paramètres, notamment élevé, moyen, bas et minimal. Ci-dessous, nous explorons les différences entre ces versions de modèles en rassemblant leurs performances de benchmark et les coûts d’exécution de ces benchmarks. Nous avons utilisé la…
HALC-Bench: LLM Hallucination sur un benchmark de récupération en contexte long
HALC-Bench (LLM Hallucination on Long-Context Retrieval Benchmark) mesure la résistance d'un LLM à fabriquer des preuves pour une métrique qui n'existe pas dans le document cible en utilisant 3 bottes de foin placées au début, au milieu et à la fin de la fenêtre de contexte du modèle, avec 204 questions. claude-fable-5 a répondu correctement…
Meilleur éditeur de code IA: Cursor vs Windsurf vs Replit
Créer une application sans savoir coder est très tendance en ce moment. Mais ces outils peuvent-ils réellement créer et déployer une application ? Nous avons évalué 6 éditeurs de code IA sur 10 tâches de développement web réelles. Chaque tâche nécessitait des implémentations telles que le backend, le frontend, l’authentification et la gestion d’état. Nous…
Newsletter AIMultiple
Un e-mail gratuit par semaine contenant les dernières actualités technologiques B2B et des analyses d'experts pour accélérer la croissance de votre entreprise.