Premium
Services
Premium
Şevval Alper

Şevval Alper

Chercheuse en IA
19 Articles
Restez informé des dernières technologies B2B
Şevval est chercheuse en IA chez AIMultiple. Elle a une expérience de recherche préalable dans la génération de nombres pseudo-aléatoires à l’aide de systèmes chaotiques.

Intérêts de recherche

Şevval se concentre sur les outils de codage IA, les agents IA et les technologies quantiques.

Elle fait partie de l’équipe benchmark de AIMultiple, réalisant des évaluations et fournissant des informations pour aider les lecteurs à comprendre diverses technologies émergentes et leurs applications.

Expérience professionnelle

Elle a contribué à l’organisation et à l’encadrement des participants lors de trois événements « CERN International Masterclasses - hands-on particle physics » en Turquie, en travaillant aux côtés des enseignants pour faciliter l’apprentissage.

Formation

Şevval est titulaire d’une licence en physique de la Middle East Technical University.

Derniers articles de Şevval

Agentic AI
Benchmark
22 sep

A-CODE-LLM Bench: Benchmark de codage agentique

Nous avons évalué les meilleurs grands modèles de langage (LLMs) sur 10 tâches de développement logiciel à l'aide d'un outil CLI agentique. Nous avons exécuté environ 3 500 étapes de validation automatisées par modèle à la fois sur les couches API et UI. Chaque alias a été exécuté 3 fois sur 10 tâches (30 échantillons par…

IA
Benchmark
22 sep

Benchmark des outils de revue de code IA

Avec l'utilisation accrue des outils de codage IA, les bases de code sont devenues plus vulnérables, ce qui a accru le besoin de revues de code efficaces. Pour y répondre, nous présentons RevEval (IA Code Review Eval), qui évalue les quatre principaux outils de revue de code IA sur 309 pull requests issues de dépôts…

Agentic AI
21 sep

Benchmarks d'agents

IA
Benchmark
18 sep

IT agentique: les agents IA peuvent-ils concevoir un benchmark ?

Nous avons testé 16 modèles sur une conception de benchmark en text-to-SQL et en appel d'outils. Chaque modèle a construit un benchmark par sujet, pour un total de 32 soumissions. Aucune soumission n'a réussi tous les critères de la grille d'évaluation. Les agents ont pu construire et exécuter des tests, mais aucun n'a démontré à…

IA
Benchmark
16 sep

Benchmark de codage IA: Claude Code vs Cursor

Dans le codage IA, le marché s'est fragmenté en deux catégories : les outils CLI agentique et les éditeurs de code IA intégrés aux IDE. Chacun prétend automatiser le développement. Peu de comparaisons montrent en quoi ils diffèrent sur des charges de travail identiques. Nous avons évalué chaque agent sur 10 tâches de développement web…

Agentic AI
Benchmark
15 sep

VELC-Bench: Vérification sur le benchmark de contexte long

La capacité du modèle à localiser une métrique spécifique dans le contexte, à comparer sa valeur à une affirmation, et à la confirmer ou la rejeter. Cela teste la correspondance fine des valeurs dans des conditions de contexte long. Le modèle doit à la fois récupérer la valeur et effectuer une comparaison précise. Les modèles…

Agentic AI
Benchmark
15 sep

RELC-Bench: benchmark de récupération sur contexte long

RELC-Bench (RELC-Bench : benchmark de récupération sur contexte long) vise à mesurer la capacité d'un modèle à trouver et à extraire une valeur numérique spécifique d'un ou plusieurs documents dans son contexte. Il teste si le modèle peut se souvenir et récupérer un fait spécifique qu'il vient de voir dans l'entrée. claude-fable-5 obtient un score…

IA
Benchmark
15 sep

Simulation d'audience: Les LLM peuvent-elles prédire le comportement humain ?

En marketing, évaluer avec quelle précision les LLMs prédisent le comportement humain est crucial pour estimer leur efficacité à anticiper les besoins du public et pour reconnaître les risques de décalage, de communication inefficace ou d'influence non désirée. La simulation d'audience avec des LLMs permet de modéliser des publics virtuels, aidant les organisations à anticiper…

IA
Benchmark
15 sep

HALC-Bench: LLM Hallucination sur le benchmark de récupération en contexte long

HALC-Bench (LLM Hallucination sur le benchmark de récupération en contexte long) mesure la résistance d’un modèle de langage de grande taille à fabriquer des preuves pour une mesure qui n’existe pas dans le document cible, en utilisant 3 meules de foin placées au début, au milieu et à la fin de la fenêtre de contexte…

Agentic AI
Benchmark
11 sep

Exécution de code avec MCP: une nouvelle approche de l'efficacité des agents IA

Anthropic a introduit une méthode dans laquelle les agents IA interagissent avec des serveurs Model Context Protocol (MCP) en écrivant du code exécutable plutôt que d’effectuer des appels directs aux outils. L’agent traite les outils comme des fichiers sur un ordinateur, trouve ce dont il a besoin et les utilise directement avec du code, de…