Les entreprises utilisent des LLMs tous les jours pour leurs tâches courantes. Pour trouver les LLMs les plus rentables, nous avons conçu AIM Enterprise, un benchmark d'entreprise agentique, dans lequel nous avons utilisé 69 tâches d'entreprise réelles couvrant la stratégie, le marketing, les RH, les ventes et les opérations.
Résultats du benchmark
- Claude Opus 5 (66.4) et GPT 5.6 Sol (62.4) ont terminé avec plus de 7 points d'avance sur la troisième place, et ont occupé les deux premières places dans les 4 000 rescoring effectués sur des re-sélections aléatoires des tâches.
- Opus 5 a remporté 43 des 69 tâches et Sol a remporté 13. Aucun autre modèle n'en a remporté plus de quatre.
- Opus 5 a également obtenu la moyenne la plus élevée sur les 17 tâches les plus difficiles, 66.2 contre 62.3 pour Sol.
- Les six modèles suivants ont obtenu entre 51.4 et 55.2. C'est plus proche que ce que 69 tâches peuvent séparer, de sorte que leur ordre varie selon la sélection des tâches.
Coût et score
- GPT 5.6 Luna a obtenu 55.2 à $0,040 par tâche. C'est 7 points de moins que le meilleur modèle du graphique, pour un dix-septième de son coût.
- Sur les 11 modèles tarifés, le coût par tâche et le score présentent une corrélation de 0.71.
- Sur l'ensemble des 16 configurations, la corrélation entre le temps par tâche et le score est de 0.55. Les quatre plus rapides étaient quatre des cinq moins bien notés, et Inkling Small a terminé une tâche en 49 secondes pour se classer avant-dernier.
- Kimi K3 à $0,652 et Qwen 3.8 Max à $0,628 coûtent à peu près ce que GPT 5.6 Sol coûte à $0,670, et obtiennent 8 et 11 points de moins.
Désaccord entre les juges
Deux modèles de juge ont noté chaque fichier, et ils étaient souvent en désaccord. Sur environ un tiers des notes individuelles, les deux se sont écartés de plus d'un quart de l'échelle, et personne n'a examiné ces lignes.
Ils s'accordaient sur les extrémités et non sur le milieu. Tous deux plaçaient Opus 5 et GPT 5.6 Sol au-dessus de tous les autres, mais 11 des 16 configurations se retrouvent à une position différente selon le modèle de notation suivi.
Les deux étaient également en désaccord sur le leader, chacun plaçant le modèle de son entreprise en tête. L'ordre publié combine les deux classements.
Benchmark AIM Marketing
La même méthode s'applique aux travaux de marketing : trouver les offres qu'un concurrent publie et qu'AIMultiple ne publie pas, élaborer une liste de comptes la mieux adaptée et produire un support de vente personnalisé. Chaque tâche est notée de 0 à 100 et la note globale est la moyenne des trois. Un audit de réputation du site web est réalisé en parallèle et est présenté selon ses propres axes, car il n'a pas de score maximal fixe.
Résultats complets : le benchmark de marketing agentique.
Benchmark AIM IT
Douze modèles ont chacun exécuté deux fois une tâche de conception de benchmark, inventant un benchmark, le construisant et y faisant passer quatre modèles. Aucune des 24 tentatives n'a satisfait à tous les critères, et six des vérifications de la grille n'ont été réussies par aucun d'entre eux. Claude Opus 5 a dominé en text-to-SQL avec 78.2 et Kimi K3 en appel d'outils avec 74.3.
Résultats complets : les LLMs peuvent-ils concevoir un benchmark.
Benchmark AIM VC
On a demandé à treize modèles répertoriés de citer les clients d'une entreprise avec des preuves datées, pour trois entreprises cibles. Claude Opus 5 a obtenu 89.1 sur 100 et Claude Fable 5 85.0, et ces deux-là ont été les seuls à rester au-dessus de 76 sur les trois cibles telles que notées. La plupart des autres ont obtenu leur plus bas score sur la cible dont les clients apparaissent dans la publicité des podcasts plutôt que sur des pages indexées.
Résultats complets : le benchmark de liste de clients.
Méthodologie
Les 69 tâches ont été rédigées par le fondateur d’AIMultiple sur la base de décisions réelles d'entreprise et mises en correspondance avec les identifiants du cadre APQC Process Classification Framework.1
Elles couvrent la stratégie (16 tâches), le marketing (15), les RH (7), les ventes (6), les opérations (5), l'IT et la finance (4 chacune), et sept domaines plus petits. Chaque tâche précise le fichier attendu : un results.csv avec une liste de colonnes fixe, généralement 10 lignes et 8 colonnes, avec une règle explicite pour chaque champ entier.
Comment les modèles ont été exécutés
Treize modèles ont été exécutés dans 16 configurations, une configuration étant un modèle sous un programme d'agent. Onze ont tourné sur opencode 1.15.13 via OpenRouter. Les autres ont tourné sur les programmes agents fournis par leurs propres éditeurs, Claude Code et Codex, facturés sur abonnements.
Chaque configuration a reçu le même prompt figé, un accès web en direct via une scraping API et une limite de deux heures. Les prompts n'ont jamais été ajustés par modèle, et les grilles de notation ne sont jamais parvenues à la machine qui exécutait les tâches.
Personne n'a choisi un niveau de raisonnement. Chaque configuration a été exécutée au niveau par défaut de son programme d'agent, et les valeurs par défaut ne correspondent pas à un seul niveau :
Claude Code 2.1.220 est livré avec un niveau élevé pour les deux modèles qu'il a exécutés, et Codex a enregistré un niveau élevé à chaque exécution. opencode ne choisit rien et laisse le niveau au fournisseur, de sorte que ces huit configurations restent au niveau par défaut de chaque modèle.
Un niveau de raisonnement par défaut plus élevé n'a pas été associé à un score plus élevé. Les deux modèles dont le défaut est supérieur à élevé, Kimi K3 au niveau maximum et Qwen 3.8 Max au niveau très élevé, ont terminé 4 et 8 sur 13. Les trois modèles qui ont tourné à la fois sous une CLI d'éditeur et sous opencode se retrouvent à moins de 0.83 point l'un de l'autre.
Chaque chiffre de coût présenté ici est recalculé à partir des tokens qu'une exécution a réellement déplacés, aux prix catalogue OpenRouter relevés le 19 août 2026, avec les entrées en cache facturées au tarif du cache.
La facturation propre des programmes d'agent ne serait pas comparable. opencode facture selon sa propre grille tarifaire groupée, et les exécutions de Claude Code et de Codex sont facturées sur des abonnements qui n'enregistrent aucun coût par exécution. Les deux configurations de Claude Code n'ont conservé aucun relevé d'utilisation et ne peuvent pas du tout être chiffrées.
Cela a produit 1 104 fichiers, un par configuration et par tâche. Six configurations opencode ont manqué 25 exécutions au premier passage parce que la recherche de fichiers de l'agent a parcouru des chemins que sa propre sandbox refusait ensuite d'ouvrir, ce qui a bloqué l'exécution. Relancer ces 25 exécutions dans un répertoire isolé a permis de toutes les récupérer, de sorte que la livraison est indiquée à la fois comme un taux au premier passage et comme un taux final. Chaque tâche a été exécutée une fois et notée une fois. Un modèle qui n'a produit aucun fichier a été exécuté à nouveau, mais aucun fichier n'a jamais été noté deux fois, donc aucun résultat ne provient du choix de la meilleure de deux tentatives.
Une soixante-dixième tâche, un playbook de traitement des demandes, est exclue de tous les chiffres présentés ici. Son fichier d'entrée était manquant au moment de l'exécution et une seule configuration a produit un fichier pour elle. En comptant chaque relance, 83 des 759 exécutions avec relevé d'utilisation ont nécessité plus d'un essai.
Comment fonctionnent les vérifications et les juges
Les vérifications déterministes s'exécutent d'abord, et aucun juge ne voit un fichier qui les échoue : ensemble de colonnes et nombre de lignes, analyse RFC 4180,2
le formatage des entiers, aucune cellule vide, aucune ligne dupliquée, et l'ordre de tri lorsque la tâche l'exige.
Un fichier qui échoue obtient zéro plutôt que d'être écarté. DeepSeek V4 Flash a échoué sur 6 de ses 69 fichiers, Inkling Small sur 2, MiniMax M3 et GPT 5.6 Terra sur un chacun. Retirer toutes les tâches où une configuration a échoué laisse les deux leaders en place.
Les 1 094 fichiers qui ont réussi sont allés à deux juges : GPT 5.6 Sol via la CLI Codex et Claude Opus 5 via la CLI Claude Code, tous deux à un effort de raisonnement élevé avec un accès web en direct.
Chaque colonne du fichier est confiée à son propre sous-agent, qui voit les réponses de cette colonne pour chaque modèle et rien d'autre, sous des identifiants de ligne anonymes mélangés séparément pour chaque juge. Le juge classe ces réponses les unes par rapport aux autres et ne peut pas en déclarer deux égales. Les deux classements sont ensuite combinés en additionnant la position de chaque réponse chez chaque juge. Cela a produit 90 530 scores.
Mesuré avec les noms de modèles visibles, Sol a classé les réponses GPT 8.4 percentiles au-dessus de là où Opus les a classées, et Opus a classé les réponses Anthropic 4.9 percentiles au-dessus de là où Sol les a classées. L'anonymisation n'élimine pas l'effet. Les exécutions derrière ce classement ont été anonymisées, et chaque juge a tout de même placé en premier la configuration de sa propre entreprise.
Comment fonctionne la notation
Le score d'un modèle est la somme de ses moyennes de colonnes, remis à l'échelle de sorte que le total le plus élevé possible soit 100. Ce plafond dépend du nombre de modèles ayant réussi les vérifications, c'est pourquoi ces scores se comparent à l'intérieur de ce benchmark et nulle part ailleurs.
Pour tester dans quelle mesure le classement dépend de la sélection des tâches, nous avons re-noté le classement 4 000 fois, à chaque fois sur une re-sélection aléatoire des 69 tâches. Cela mesure uniquement la sensibilité aux tâches. Cela ne mesure pas de combien une nouvelle exécution de la même tâche ferait bouger un score, car aucune tâche n'a été notée deux fois.
Le quart le plus difficile correspond aux 17 tâches ayant le score moyen le plus bas sur l'ensemble des 16 configurations. Cette règle a été fixée avant que le classement de tout modèle sur ces tâches ne soit calculé.
Douze des 13 modèles apparaissent également dans les benchmarks ci-dessus. Leurs scores ne sont pas reportés, car chaque benchmark définit sa propre échelle.
Chaque score présenté ici est une position relative aux modèles contre lesquels il a été exécuté, de sorte que supprimer une configuration re-noterait tout le reste au lieu de retirer une barre. Qwen 3.8 Max n'exécute que ce benchmark et reste dans le graphique pour cette raison.
FAQ
Pas sur la base de ces éléments. L'échelle est relative, donc même le meilleur score de 66.4 indique seulement que les réponses d'un modèle se sont classées au-dessus des autres, et les lignes sur lesquelles les deux modèles de notation divergent substantiellement ne sont pas examinées. Les fournisseurs qui construisent ce type d'agent figurent dans notre analyse des entreprises d'IA d'entreprise, et AIMultiple automatise des processus comme ceux-ci.
Parce que six d'entre eux sont réellement proches, et que 69 tâches ne peuvent pas distinguer des différences inférieures à environ 1.5 point. Le benchmark sépare les modèles forts des modèles faibles. Le rééchantillonnage des tâches réordonne les six du milieu.
Pas pour la qualité de sortie, dans les trois cas que nous avons pu tester. Trois modèles ont chacun été exécutés sous deux programmes d'agent et aucune paire n'a différé de plus de 0.83 point, même si les CLI des éditeurs ont raisonné au niveau élevé et que les exécutions opencode ont pris le défaut du fournisseur. Les graphiques utilisent le programme propre de l'éditeur pour ces trois modèles. La différence est apparue plutôt dans les opérations : seules les configurations opencode ont perdu des exécutions à cause d'un conflit de sandbox, et seul Claude Code n'a laissé aucun relevé d'utilisation.
Citez ce benchmark
Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.
@misc{kalelioglu2026,
author = {Kalelioğlu, Berk},
title = {{AIM Enterprise: Benchmark d'entreprise agentique}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/agentic-enterprise}},
note = {AIMultiple. Consulté le 24 Août 2026}
}
Soyez le premier à commenter
Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.