Services
Contactez-nous
Şevval Alper

Şevval Alper

Chercheur en IA
19 Articles
Restez informé des dernières technologies B2B

Şevval est chercheuse en intelligence artificielle chez AIMultiple. Elle possède une expérience de recherche antérieure dans le domaine de la génération de nombres pseudo-aléatoires à l'aide de systèmes chaotiques.

Intérêts de recherche

Şevval se concentre sur les outils de codage IA, les agents IA et les technologies quantiques.

Elle fait partie de l'équipe d'analyse comparative d'AIMultiple, où elle réalise des évaluations et fournit des analyses pour aider les lecteurs à comprendre diverses technologies émergentes et leurs applications.

Expérience professionnelle

Elle a contribué à l'organisation et à l'encadrement des participants à trois événements « Masterclasses internationales du CERN - physique des particules pratique » en Turquie, en collaborant avec les professeurs pour faciliter l'apprentissage.

Éducation

Şevval est titulaire d'une licence en physique de l'Université technique du Moyen-Orient.

Derniers articles de Şevval

IA
Benchmark
14 Août

Benchmark des outils de revue de code IA

Avec l'utilisation accrue des outils de codage IA, les bases de code sont devenues plus vulnérables, ce qui a accru le besoin de revues de code efficaces. Pour y répondre, nous présentons RevEval (IA Code Review Eval), qui évalue les quatre principaux outils de revue de code IA sur 309 pull requests issues de dépôts…

Agentic AI
Benchmark
14 Août

Benchmark des plateformes d'agents IA: Claude Managed Agents contre Google Vertex Agent Engine

Nous avons benchmarké 4 plateformes d'agents IA selon 3 dimensions : réalisation des tâches (10 tâches de codage × 3 exécutions), capacités spécifiques au harnais (pilotage, reconnexion, rappel de longue conversation, gestion de gros fichiers) et coût. Claude Managed Agents et Vertex IA Agent Engine atteignent toutes deux un taux de réussite de 100 % sur…

Agentic AI
Benchmark
14 Août

Exécution de code avec MCP: une nouvelle approche de l'efficacité des agents IA

Anthropic a introduit une méthode dans laquelle les agents IA interagissent avec les Model Context Protocol (MCP) serveurs en écrivant du code exécutable plutôt que de faire des appels directs aux outils. L’agent traite les outils comme des fichiers sur un ordinateur, trouve ce dont il a besoin et les utilise directement avec du code,…

IA
Benchmark
12 Août

OCR Benchmark: Précision de l'extraction / capture de texte

La précision de l'OCR est essentielle pour de nombreuses tâches de traitement de documents, et les LLMs multimodaux SOTA offrent désormais une alternative à l'OCR. Nous avons benchmarké les principaux services d'OCR dans DeltOCR Bench pour identifier leurs niveaux de précision sur différents types de documents : Les noms complets des produits ci-dessus et leurs…

IA
Benchmark
12 Août

Meilleur éditeur de code IA: Cursor vs Windsurf vs Replit

Créer une application sans savoir coder est très tendance en ce moment. Mais ces outils peuvent-ils réellement créer et déployer une application ? Nous avons évalué 6 éditeurs de code IA sur 10 tâches de développement web réelles. Chaque tâche nécessitait des implémentations telles que le backend, le frontend, l’authentification et la gestion d’état. Nous…

Agentic AI
Benchmark
11 Août

Meilleurs harnais d'agent: Claude Code vs Codex

Les harnais d’agent servent de runtime de production pour les agents d’IA, avec des choix de conception qui créent des variations de performance sur des modèles sous-jacents identiques. Nous avons comparé 17 harnais d’agent sur 10 tâches de codage. Pour isoler le harnais plutôt que le modèle, nous avons exécuté chaque CLI agentique sur un…

IA
Benchmark
11 Août

Agentic IT: Can LLMs Design a Benchmark

We gave 12 large language models the job a benchmark team does: invent a benchmark, build it, run four models through it, and report the results. Each did it twice. None of the 24 attempts passed every criterion, and six of the rubric’s checks were passed by none of them. The two topics are text-to-SQL,…

Agentic AI
Benchmark
10 Août

VELC-Bench: Vérification sur le benchmark de contexte long

La capacité du modèle à localiser une métrique spécifique dans le contexte, à comparer sa valeur à une affirmation, et à la confirmer ou la rejeter. Cela teste la correspondance fine des valeurs dans des conditions de contexte long. Le modèle doit à la fois récupérer la valeur et effectuer une comparaison précise. Les modèles…

IA
Benchmark
4 Août

Capture d'écran en Code: Lovable vs v0 vs Bolt

Au cours de mes 20 ans en tant que développeur de logiciels, j’ai dirigé de nombreuses équipes front-end dans le développement de pages basées sur des conceptions inspirées de captures d’écran. Les conceptions peuvent être transférées en code à l’aide d’outils d’IA. Bien qu’il soit erroné de s’attendre à un transfert parfait au pixel près…

IA
Benchmark
4 Août

Simulation d'audience: Les LLM peuvent-elles prédire le comportement humain ?

En marketing, évaluer avec quelle précision les LLMs prédisent le comportement humain est crucial pour estimer leur efficacité à anticiper les besoins du public et pour reconnaître les risques de décalage, de communication inefficace ou d'influence non désirée. La simulation d'audience avec des LLMs permet de modéliser des publics virtuels, aidant les organisations à anticiper…