Services
Contactez-nous
Şevval Alper

Şevval Alper

Chercheuse en IA
21 Articles
Restez informé des dernières technologies B2B
Şevval est chercheuse en IA chez AIMultiple. Elle a une expérience de recherche préalable dans la génération de nombres pseudo-aléatoires à l’aide de systèmes chaotiques.

Intérêts de recherche

Şevval se concentre sur les outils de codage IA, les agents IA et les technologies quantiques.

Elle fait partie de l’équipe benchmark de AIMultiple, réalisant des évaluations et fournissant des informations pour aider les lecteurs à comprendre diverses technologies émergentes et leurs applications.

Expérience professionnelle

Elle a contribué à l’organisation et à l’encadrement des participants lors de trois événements « CERN International Masterclasses - hands-on particle physics » en Turquie, en travaillant aux côtés des enseignants pour faciliter l’apprentissage.

Formation

Şevval est titulaire d’une licence en physique de la Middle East Technical University.

Derniers articles de Şevval

IA
Benchmark
7 Sep

Benchmark de codage IA: Claude Code vs Cursor

Dans le codage IA, le marché s'est fragmenté en deux catégories : les outils CLI agentique et les éditeurs de code IA intégrés aux IDE. Chacun prétend automatiser le développement. Peu de comparaisons montrent en quoi ils diffèrent sur des charges de travail identiques. Nous avons évalué chaque agent sur 10 tâches de développement web…

IA
Benchmark
1 Sep

Simulation d'audience: Les LLM peuvent-elles prédire le comportement humain ?

En marketing, évaluer avec quelle précision les LLMs prédisent le comportement humain est crucial pour estimer leur efficacité à anticiper les besoins du public et pour reconnaître les risques de décalage, de communication inefficace ou d'influence non désirée. La simulation d'audience avec des LLMs permet de modéliser des publics virtuels, aidant les organisations à anticiper…

Agentic AI28 Août

Agents IA: Opérateur vs Utilisation du navigateur vs Projet Mariner

Les agents IA sont de plus en plus commercialisés comme des travailleurs numériques de bout en bout, mais les performances réelles peuvent varier considérablement en fonction de la tâche, des outils et de l'environnement d'exécution. Pour comprendre ce que ces systèmes peuvent réellement livrer aujourd'hui, nous avons mené des tests pratiques dans des scénarios commerciaux…

Agentic AI
Benchmark
27 Août

Exécution de code avec MCP: une nouvelle approche de l'efficacité des agents IA

Anthropic a introduit une méthode dans laquelle les agents IA interagissent avec les Model Context Protocol (MCP) serveurs en écrivant du code exécutable plutôt que de faire des appels directs aux outils. L’agent traite les outils comme des fichiers sur un ordinateur, trouve ce dont il a besoin et les utilise directement avec du code,…

Agentic AI
Benchmark
21 Août

Benchmark des plateformes d'agents IA: Claude Managed Agents contre Google Vertex Agent Engine

Nous avons benchmarké 4 plateformes d'agents IA selon 3 dimensions : réalisation des tâches (10 tâches de codage × 3 exécutions), capacités spécifiques au harnais (pilotage, reconnexion, rappel de longue conversation, gestion de gros fichiers) et coût. Claude Managed Agents et Vertex IA Agent Engine atteignent toutes deux un taux de réussite de 100 % sur…

Agentic AI
Benchmark
21 Août

RELC-Bench: Benchmark de récupération en contexte long

RELC-Bench (RELC-Bench : Benchmark de récupération en contexte long) vise à mesurer la capacité d'un modèle à trouver et extraire une valeur numérique spécifique d'un ou plusieurs documents dans son contexte. Il teste si le modèle peut se souvenir et récupérer un fait spécifique qu'il vient de voir dans l'entrée. claude-fable-5 obtient 97,0 % sur les…

Agentic AI
Benchmark
21 Août

MCP Benchmark: Meilleurs serveurs MCP pour l'accès Web

Nous avons évalué 8 serveurs MCP sur des tâches de recherche et extraction Web, ainsi que d'automatisation de navigateur, en exécutant 4 tâches différentes 5 fois sur tous les MCPs appropriés. Nous avons également effectué un test de charge impliquant 250 agents IA simultanés. *Les tâches de recherche et extraction Web sont exécutées avec le…

IA
Analyse
21 Août

LLM Paramètres: GPT-5 High, Moyen, Bas et Minimal

Certains LLMs, comme OpenAI’s GPT-5 family, existent en différentes versions (par exemple, GPT-5, GPT-5-mini et GPT-5-nano) et avec divers réglages de paramètres, notamment élevé, moyen, bas et minimal. Ci-dessous, nous explorons les différences entre ces versions de modèles en rassemblant leurs performances de benchmark et les coûts d’exécution de ces benchmarks. Nous avons utilisé la…

IA
Benchmark
21 Août

HALC-Bench: LLM Hallucination sur un benchmark de récupération en contexte long

HALC-Bench (LLM Hallucination on Long-Context Retrieval Benchmark) mesure la résistance d'un LLM à fabriquer des preuves pour une métrique qui n'existe pas dans le document cible en utilisant 3 bottes de foin placées au début, au milieu et à la fin de la fenêtre de contexte du modèle, avec 204 questions. claude-fable-5 a répondu correctement…

IA
Benchmark
21 Août

Meilleur éditeur de code IA: Cursor vs Windsurf vs Replit

Créer une application sans savoir coder est très tendance en ce moment. Mais ces outils peuvent-ils réellement créer et déployer une application ? Nous avons évalué 6 éditeurs de code IA sur 10 tâches de développement web réelles. Chaque tâche nécessitait des implémentations telles que le backend, le frontend, l’authentification et la gestion d’état. Nous…