IT agentique: les agents IA peuvent-ils concevoir un benchmark ?
Nous avons testé 16 modèles sur une conception de benchmark en text-to-SQL et en appel d'outils. Chaque modèle a construit un benchmark par sujet, pour un total de 32 soumissions. Aucune soumission n'a réussi tous les critères de la grille d'évaluation. Les agents ont pu construire et exécuter des tests, mais aucun n'a démontré à la fois un test de réponse vide et un test de réponse correcte de son propre évaluateur.
Scores de conception du benchmark
Le text-to-SQL transforme une question en langage naturel en requête de base de données. L'appel d'outils sélectionne une fonction et renseigne ses arguments.
Nous avons noté chaque soumission selon une grille d'évaluation que les agents ne voyaient pas. La grille de text-to-SQL compte 78 points, et celle de l'appel d'outils en compte 74. Les scores indiquent le pourcentage de points applicables de la grille. Les étiquettes des barres sont arrondies à des nombres entiers.
- Text-to-SQL : Claude Opus 5 et Grok 4.6 sont à égalité à 78,2 %. Lorsque nous rééchantillonnons les critères de la grille, les 95 % centraux de leurs rangs se situent entre la 1st et la 5 place.
- Appel d'outils : GPT 5.6 Sol est en tête avec 74,3 %. Les 95 % centraux de ses rangs rééchantillonnés se situent entre la 1st et la 4 place. Les plages de rangs proviennent du rééchantillonnage des critères de la grille.
Sur les 16 modèles, les scores des deux sujets sont corrélés à 0.42 (Pearson). Le score moyen combine deux grilles d'évaluation aux critères différents, il ne s'agit donc pas d'une comparaison terme à terme.
Contrôles de qualité manquants
Aucune soumission n'a réussi ces quatre contrôles :
- Test de réponse vide : Les réponses vides passent par l'évaluateur. Un évaluateur fonctionnel devrait attribuer un score proche de zéro point.
- Test de réponse correcte : Les réponses de référence passent par toutes les étapes d'extraction et de notation. Un évaluateur fonctionnel devrait attribuer la note maximale.
- Test de référence manquante : Les cas sont répétés sans le schéma de base de données ni les définitions d'outils.
- Objectif de difficulté : Le modèle plus fort devrait obtenir un score entre 40 % et 60 %. Il a obtenu plus de 60 % dans 30 des 32 soumissions.
Vingt soumissions n'ont pas non plus atteint l'écart requis d'au moins 20 points entre le modèle plus fort et le plus faible.
- Calibration : Deux soumissions ont réussi le contrôle de calibration : GLM 5.3 en text-to-SQL et Claude Opus 5 en appel d'outils. Pour réussir, une soumission devait conserver ses révisions et les expliquer après avoir manqué l'objectif de difficulté.
- Prédictions : Six des 32 soumissions ont réussi le contrôle de prédiction. Pour réussir, il fallait nommer le meilleur et le moins bon modèle et placer au moins deux de leurs quatre scores dans les intervalles prédits. Chaque agent devait aussi prédire l'intervalle de score et le rang d'un cinquième modèle mis de côté. Deux soumissions ont correctement réussi les deux : Gemini 3.8 Flash et Grok 4.6, toutes deux en text-to-SQL.
- Affirmations non étayées : Vingt-deux des 32 rapports ont échoué au contrôle du panel de juges sur les affirmations sans preuves à l'appui.
Coût et temps
Les relevés de coût couvrent 16 modèles et ceux de temps écoulé en couvrent 15. Le graphique utilise les 15 disposant des deux relevés, en omettant Grok 4.6 car sa durée n'a pas été enregistrée.
Les coûts couvrent l'inférence de l'agent de rédaction par sujet, y compris les nouvelles tentatives enregistrées. Ils excluent les appels d'API effectués par les programmes de benchmark générés, ce qui sous-estime le coût complet de construction et d'exécution d'un benchmark.
Les exécutions utilisent différents programmes d'agents et incluent des tentatives de remplacement. Les données ne permettent pas de déterminer si des dépenses plus élevées ou des exécutions plus longues conduisent à de meilleurs scores.
Les intervalles de score obtenus par rééchantillonnage des critères de la grille ont une largeur moyenne de 32.7 points. Ils excluent la variation qu'ajouteraient des exécutions de rédaction répétées.
Ce que les modèles ont réussi
Chaque ligne de résultat des 32 soumissions principales renvoie vers une réponse de modèle enregistrée. La réexécution de l'évaluateur de chaque soumission sur ces réponses enregistrées a reproduit son tableau de résultats. La notation est reproductible, mais la reproduction n'authentifie pas les réponses enregistrées.
Nous avons séparément supprimé et altéré des fichiers de réponse échantillonnés. Les 32 évaluateurs ont tous modifié leur sortie et ont distingué une réponse supprimée d'une réponse altérée. Le test ne vérifie pas toutes les règles de notation.
Vingt-deux des 32 rapports ont échoué au contrôle du panel sur les affirmations non étayées.
Ce que les résultats signifient pour l'IT agentique
Dans les opérations informatiques, un agent IA lit l'état d'un système et agit dessus, par exemple en installant un correctif ou en redémarrant un service. Un contrôle distinct doit ensuite confirmer que l'action a fonctionné. Les tests de contrôle de l'évaluateur de ce benchmark jouent le même rôle pour la notation : ils confirment que l'évaluateur fonctionne avant que ses résultats ne soient utilisés. Aucune des 32 soumissions principales n'a réussi ces tests.
Ce benchmark couvre le text-to-SQL et l'appel d'outils. Il ne s'agit pas d'un test de correctifs, de tri des tickets ou d'autres tâches informatiques.
Nous testons séparément les outils de gestion informatique, sur des systèmes réels. Résultats sélectionnés :
Plateformes d'IT agentique
Les 16 modèles de ce benchmark sont des LLM. Les plateformes ci-dessous n'en sont pas. Elles se situent au-dessus de ces modèles et ajoutent des données informatiques, des flux de travail et des contrôles.
Un système agentique décide de sa prochaine étape à partir de l'état qu'il observe, tandis qu'une automatisation fondée sur des règles suit des étapes définies à l'avance. Les produits informatiques combinent les deux ; chaque entrée ci-dessous indique donc quelle partie relève de quoi.
Creatio
Creatio exécute des agents IA au sein d'une plateforme de CRM et de flux de travail, de sorte qu'un agent agit sur les enregistrements de l'entreprise plutôt que sur une transcription de chat.
Modèles : OpenAI, Azure OpenAI, ou tout fournisseur pris en charge par la bibliothèque LiteLLM, y compris des modèles sur les serveurs de l'entreprise. Chaque agent peut en utiliser un différent.
Les équipes construisent leurs propres agents : Un agent est défini dans l'interface, et non dans le code : ses instructions, puis ce qu'il ne doit pas faire, les données auxquelles il ne peut pas accéder, les compétences qu'il peut appeler et les actions qu'il peut effectuer sur un enregistrement.
Les agents de codage créent les applications : Claude Code, Codex et GitHub Copilot se connectent à la plateforme via un plugin, des compétences d'agent et des MCP outils, et peuvent créer des modèles de données, des pages, des règles métier et des données de test.
ServiceNow
ServiceNow est une plateforme de gestion des services informatiques (ITSM).
Modèles : L'orchestration des agents peut s'exécuter sur Azure OpenAI, Claude sur AWS, Google Gemini, ou Now LLM, le modèle propre de ServiceNow.
Confirmation avant action : Les agents ITSM peuvent être lancés manuellement depuis le panneau Now Assist, ou s'exécuter automatiquement lorsqu'un enregistrement est créé ou mis à jour. Les administrateurs décident quelles actions nécessitent la confirmation d'une personne.
NinjaOne
NinjaOne est une plateforme de gestion des points de terminaison couvrant la surveillance, les correctifs, la sauvegarde et l'accès à distance.
Modèles : NinjaOne ne documente pas de choix de modèle pour ses fonctionnalités d'IA. Celles-ci s'exécutent au sein de la plateforme, contrairement aux options ci-dessus où un administrateur choisit le fournisseur.
Risque des correctifs évalué à partir de rapports de la communauté : Patch Intelligence IA analyse la télémétrie des fournisseurs et les rapports publics d'autres administrateurs sur les mises à jour Windows, puis signale les mises à jour qui ont cassé des systèmes ailleurs et résume le contexte. Les autres plateformes de cette section lisent les enregistrements d'une entreprise ; cette fonctionnalité lit ce qui s'est passé dans d'autres entreprises.
Détection des CVE sans analyse : Le module de vulnérabilité identifie les CVE à partir de la télémétrie des logiciels analysée dans le cloud de NinjaOne ; aucune analyse ne s'exécute donc sur le point de terminaison, et les résultats sont transmis au module de correctifs pour remédiation.
Méthodologie
La tâche
Pour chaque sujet, chaque modèle a reçu le même prompt fixe. Le prompt demandait à l'agent de :
- choisir un sujet métier,
- rédiger au moins 24 cas de test répartis dans quatre catégories,
- écrire un runner (le programme qui envoie les cas aux modèles) et un évaluateur (le programme qui note les réponses),
- exécuter quatre modèles nommés deux fois sur chaque cas.
Un cinquième modèle a été mis de côté. L'agent a d'abord prédit ses résultats, puis l'a testé.
Le prompt demandait à chaque agent de décider quelles normes de qualité un benchmark doit respecter avant publication et de montrer qu'il les respectait. Le prompt ne précisait ni l'objectif numérique de difficulté ni le nom d'aucun test d'évaluateur.
Agents et soumissions
Les soumissions se sont déroulées entre juillet et septembre 2026. La plupart utilisaient opencode, un programme d'agent qui donne au modèle un shell et un système de fichiers.
La version précédente couvrait 14 modèles et 28 soumissions. Nos données historiques incluent également sept modèles plus anciens qui ne figurent plus dans la liste.
Nous avons également exécuté cinq configurations pilotes pour GPT 5.5, produisant 10 soumissions supplémentaires. Leurs prompts diffèrent de la tâche principale ; les graphiques les excluent donc. Au total, cette mise à jour inclut 42 soumissions et en note 40. Deux soumissions pilotes n'ont pas atteint la taille minimale du dataset, si bien que le panel de juges ne les a pas notées.
Notation
Le code vérifie les fichiers soumis, reconstruit les bases de données, réexécute les évaluateurs et met en correspondance les lignes de résultats avec les fichiers de réponse. Un panel de modèles note les critères qui nécessitent une interprétation. Le code soumis s'exécute dans une copie isolée sans accès réseau.
Nous excluons une réexécution en direct d'appels de modèles échantillonnés pour chaque soumission, car les runners ont des interfaces différentes et certains n'ont pas de configurations de fournisseur exploitables. Sans ce critère, les grilles totalisent 78 points pour le text-to-SQL et 74 pour l'appel d'outils.
Toutes les 32 soumissions des graphiques réussissent les contrôles requis de fichiers et de taille de dataset. Les prompts de tâche n'ont pas été modifiés pour cette mise à jour, et les résultats utilisent une soumission conservée par modèle et par sujet.
Tests de contrôle de l'évaluateur
Le test de référence manquante vérifie si les modèles peuvent répondre sans les informations dont ils sont censés avoir besoin. S'ils obtiennent toujours de bons scores, les questions peuvent révéler la réponse, ou les modèles peuvent avoir vu les données pendant l'entraînement. Un score élevé seul ne prouve ni l'un ni l'autre.
Un prompt pilote nommait les trois tests de l'évaluateur, et ce pilote les a exécutés dans les deux sujets. La réexécution de ses fichiers de test enregistrés sans accès réseau a reproduit les nombres consignés.
Les prompts des 32 soumissions principales laissaient ces tests à l'agent, et aucune de ces soumissions n'a réussi l'un des trois. Un seul prompt de l'étude nommait les tests ; leur effet sur les modèles reste donc non testé.
Le panel de juges
GPT 5.6 Sol et Claude Opus 5 notent chaque critère envoyé au panel. En cas de désaccord, Grok 4.6 a la voix prépondérante.
Les juges s'exécutent à une température de 0 (le réglage le moins aléatoire), avec un effort de raisonnement élevé et une limite de 32 000 tokens. Si un juge renvoie un JSON incomplet ou invalide, aucun verdict n'est enregistré et l'appel est relancé.
Sur 672 critères, pilotes inclus, les deux juges principaux ont été en désaccord sur 195. Sol a réussi à 54,8 %, et Opus à 82,6 %. Grok a réussi 133 des critères contestés.
Les fournisseurs des juges ont également des soumissions notées dans ce benchmark : quatre provenant d'OpenAI, quatre d'Anthropic et une de xAI. Les prompts des juges omettent les noms des auteurs et suppriment les chemins de fichiers pouvant identifier un modèle. Le style d'écriture peut toutefois révéler l'auteur.
Sur les soumissions de fournisseurs autres qu'OpenAI et Anthropic, Sol obtient 13.9 points de moins qu'Opus. Sur les soumissions d'OpenAI, l'écart était de 9.1 points, soit 4.8 points de moins. Sur les soumissions créées par Anthropic, l'avance d'Opus sur Sol est inférieure de 0.1 point à celle observée sur le travail d'autres fournisseurs. Les prompts pilotes diffèrent ; l'audit ne permet donc pas d'établir un favoritisme. Grok ne juge que les litiges, y compris ceux concernant ses propres soumissions, et ses votes sont hors de cet audit.
Intervalles
Les intervalles de score et les 95 % centraux des positions de classement utilisent 4 000 tirages appariés de critères de grille avec remise. Chaque soumission est renotée sur les mêmes critères tirés que les autres de son sujet. Les intervalles décrivent la dépendance à la grille et excluent l'incertitude liée à l'échantillonnage des tâches et aux variations entre exécutions. Les corrélations sont de Pearson.
Citez ce benchmark
Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.
@misc{kalelioglu2026,
author = {Kalelioğlu, Berk and Alper, Şevval},
title = {{IT agentique: les agents IA peuvent-ils concevoir un benchmark ?}},
year = {2026},
month = sep,
howpublished = {\url{https://aimultiple.com/agentic-it}},
note = {AIMultiple. Consulté le 18 septembre 2026}
}Résultats et horodatages de 21 points de données. Téléchargez les données de synthèse présentées dans les graphiques et les tableaux de cet article sous forme de fichier ZIP contenant 2 fichiers CSV et un README.
Vous voulez les données détaillées derrière ? Rejoindre Premium
Şevval se concentre sur les outils de codage IA, les agents IA et les technologies quantiques.
Soyez le premier à commenter
Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.