Şevval Alper
Intérêts de recherche
Şevval se concentre sur les outils de codage IA, les agents IA et les technologies quantiques.Elle fait partie de l’équipe benchmark de AIMultiple, réalisant des évaluations et fournissant des informations pour aider les lecteurs à comprendre diverses technologies émergentes et leurs applications.
Expérience professionnelle
Elle a contribué à l’organisation et à l’encadrement des participants lors de trois événements « CERN International Masterclasses - hands-on particle physics » en Turquie, en travaillant aux côtés des enseignants pour faciliter l’apprentissage.Formation
Şevval est titulaire d’une licence en physique de la Middle East Technical University.Derniers articles de Şevval
A-CODE-LLM Bench: Benchmark de codage agentique
Nous avons évalué les meilleurs grands modèles de langage (LLMs) sur 10 tâches de développement logiciel à l'aide d'un outil CLI agentique. Nous avons exécuté environ 3 500 étapes de validation automatisées par modèle à la fois sur les couches API et UI. Chaque alias a été exécuté 3 fois sur 10 tâches (30 échantillons par…
Benchmark des outils de revue de code IA
Avec l'utilisation accrue des outils de codage IA, les bases de code sont devenues plus vulnérables, ce qui a accru le besoin de revues de code efficaces. Pour y répondre, nous présentons RevEval (IA Code Review Eval), qui évalue les quatre principaux outils de revue de code IA sur 309 pull requests issues de dépôts…
Benchmarks d'agents
IT agentique: les agents IA peuvent-ils concevoir un benchmark ?
Nous avons testé 16 modèles sur une conception de benchmark en text-to-SQL et en appel d'outils. Chaque modèle a construit un benchmark par sujet, pour un total de 32 soumissions. Aucune soumission n'a réussi tous les critères de la grille d'évaluation. Les agents ont pu construire et exécuter des tests, mais aucun n'a démontré à…
Benchmark de codage IA: Claude Code vs Cursor
Dans le codage IA, le marché s'est fragmenté en deux catégories : les outils CLI agentique et les éditeurs de code IA intégrés aux IDE. Chacun prétend automatiser le développement. Peu de comparaisons montrent en quoi ils diffèrent sur des charges de travail identiques. Nous avons évalué chaque agent sur 10 tâches de développement web…
VELC-Bench: Vérification sur le benchmark de contexte long
La capacité du modèle à localiser une métrique spécifique dans le contexte, à comparer sa valeur à une affirmation, et à la confirmer ou la rejeter. Cela teste la correspondance fine des valeurs dans des conditions de contexte long. Le modèle doit à la fois récupérer la valeur et effectuer une comparaison précise. Les modèles…
RELC-Bench: benchmark de récupération sur contexte long
RELC-Bench (RELC-Bench : benchmark de récupération sur contexte long) vise à mesurer la capacité d'un modèle à trouver et à extraire une valeur numérique spécifique d'un ou plusieurs documents dans son contexte. Il teste si le modèle peut se souvenir et récupérer un fait spécifique qu'il vient de voir dans l'entrée. claude-fable-5 obtient un score…
Simulation d'audience: Les LLM peuvent-elles prédire le comportement humain ?
En marketing, évaluer avec quelle précision les LLMs prédisent le comportement humain est crucial pour estimer leur efficacité à anticiper les besoins du public et pour reconnaître les risques de décalage, de communication inefficace ou d'influence non désirée. La simulation d'audience avec des LLMs permet de modéliser des publics virtuels, aidant les organisations à anticiper…
HALC-Bench: LLM Hallucination sur le benchmark de récupération en contexte long
HALC-Bench (LLM Hallucination sur le benchmark de récupération en contexte long) mesure la résistance d’un modèle de langage de grande taille à fabriquer des preuves pour une mesure qui n’existe pas dans le document cible, en utilisant 3 meules de foin placées au début, au milieu et à la fin de la fenêtre de contexte…
Exécution de code avec MCP: une nouvelle approche de l'efficacité des agents IA
Anthropic a introduit une méthode dans laquelle les agents IA interagissent avec des serveurs Model Context Protocol (MCP) en écrivant du code exécutable plutôt que d’effectuer des appels directs aux outils. L’agent traite les outils comme des fichiers sur un ordinateur, trouve ce dont il a besoin et les utilise directement avec du code, de…
Newsletter AIMultiple
Un e-mail gratuit par semaine contenant les dernières actualités technologiques B2B et des analyses d'experts pour accélérer la croissance de votre entreprise.