Şevval Alper
Şevval est chercheuse en intelligence artificielle chez AIMultiple. Elle possède une expérience de recherche antérieure dans le domaine de la génération de nombres pseudo-aléatoires à l'aide de systèmes chaotiques.
Intérêts de recherche
Şevval se concentre sur les outils de codage IA, les agents IA et les technologies quantiques.
Elle fait partie de l'équipe d'analyse comparative d'AIMultiple, où elle réalise des évaluations et fournit des analyses pour aider les lecteurs à comprendre diverses technologies émergentes et leurs applications.
Expérience professionnelle
Elle a contribué à l'organisation et à l'encadrement des participants à trois événements « Masterclasses internationales du CERN - physique des particules pratique » en Turquie, en collaborant avec les professeurs pour faciliter l'apprentissage.
Éducation
Şevval est titulaire d'une licence en physique de l'Université technique du Moyen-Orient.
Derniers articles de Şevval
Benchmark des outils de revue de code IA
Avec l'utilisation accrue des outils de codage IA, les bases de code sont devenues plus vulnérables, ce qui a accru le besoin de revues de code efficaces. Pour y répondre, nous présentons RevEval (IA Code Review Eval), qui évalue les quatre principaux outils de revue de code IA sur 309 pull requests issues de dépôts…
Benchmark des plateformes d'agents IA: Claude Managed Agents contre Google Vertex Agent Engine
Nous avons benchmarké 4 plateformes d'agents IA selon 3 dimensions : réalisation des tâches (10 tâches de codage × 3 exécutions), capacités spécifiques au harnais (pilotage, reconnexion, rappel de longue conversation, gestion de gros fichiers) et coût. Claude Managed Agents et Vertex IA Agent Engine atteignent toutes deux un taux de réussite de 100 % sur…
Exécution de code avec MCP: une nouvelle approche de l'efficacité des agents IA
Anthropic a introduit une méthode dans laquelle les agents IA interagissent avec les Model Context Protocol (MCP) serveurs en écrivant du code exécutable plutôt que de faire des appels directs aux outils. L’agent traite les outils comme des fichiers sur un ordinateur, trouve ce dont il a besoin et les utilise directement avec du code,…
OCR Benchmark: Précision de l'extraction / capture de texte
La précision de l'OCR est essentielle pour de nombreuses tâches de traitement de documents, et les LLMs multimodaux SOTA offrent désormais une alternative à l'OCR. Nous avons benchmarké les principaux services d'OCR dans DeltOCR Bench pour identifier leurs niveaux de précision sur différents types de documents : Les noms complets des produits ci-dessus et leurs…
Meilleur éditeur de code IA: Cursor vs Windsurf vs Replit
Créer une application sans savoir coder est très tendance en ce moment. Mais ces outils peuvent-ils réellement créer et déployer une application ? Nous avons évalué 6 éditeurs de code IA sur 10 tâches de développement web réelles. Chaque tâche nécessitait des implémentations telles que le backend, le frontend, l’authentification et la gestion d’état. Nous…
Meilleurs harnais d'agent: Claude Code vs Codex
Les harnais d’agent servent de runtime de production pour les agents d’IA, avec des choix de conception qui créent des variations de performance sur des modèles sous-jacents identiques. Nous avons comparé 17 harnais d’agent sur 10 tâches de codage. Pour isoler le harnais plutôt que le modèle, nous avons exécuté chaque CLI agentique sur un…
Agentic IT: Can LLMs Design a Benchmark
We gave 12 large language models the job a benchmark team does: invent a benchmark, build it, run four models through it, and report the results. Each did it twice. None of the 24 attempts passed every criterion, and six of the rubric’s checks were passed by none of them. The two topics are text-to-SQL,…
VELC-Bench: Vérification sur le benchmark de contexte long
La capacité du modèle à localiser une métrique spécifique dans le contexte, à comparer sa valeur à une affirmation, et à la confirmer ou la rejeter. Cela teste la correspondance fine des valeurs dans des conditions de contexte long. Le modèle doit à la fois récupérer la valeur et effectuer une comparaison précise. Les modèles…
Capture d'écran en Code: Lovable vs v0 vs Bolt
Au cours de mes 20 ans en tant que développeur de logiciels, j’ai dirigé de nombreuses équipes front-end dans le développement de pages basées sur des conceptions inspirées de captures d’écran. Les conceptions peuvent être transférées en code à l’aide d’outils d’IA. Bien qu’il soit erroné de s’attendre à un transfert parfait au pixel près…
Simulation d'audience: Les LLM peuvent-elles prédire le comportement humain ?
En marketing, évaluer avec quelle précision les LLMs prédisent le comportement humain est crucial pour estimer leur efficacité à anticiper les besoins du public et pour reconnaître les risques de décalage, de communication inefficace ou d'influence non désirée. La simulation d'audience avec des LLMs permet de modéliser des publics virtuels, aidant les organisations à anticiper…
Newsletter AIMultiple
Un e-mail gratuit par semaine contenant les dernières actualités technologiques B2B et des analyses d'experts pour accélérer la croissance de votre entreprise.