Premium
Services
Premium

AIM Enterprise: Benchmark d'entreprise agentique

Berk Kalelioğlu
Berk Kalelioğlu
mis à jour le 17 sept. 2026

Les entreprises utilisent des LLM tous les jours pour leurs tâches courantes. Pour trouver les LLM les plus rentables, nous avons conçu AIM Enterprise, un benchmark d'entreprise agentique, dans lequel nous avons utilisé 69 tâches d'entreprise réelles couvrant la stratégie, le marketing, les RH, la vente et les opérations.

Résultats du benchmark

Chargement du graphique
  • Opus 5 a obtenu un meilleur score sur 39 tâches et Astra sur 30. Les quatre premiers, avec Claude Fable 5.1 et Grok 4.6, s'étalent sur 2.9 points.
  • Astra est en tête sur 23 tâches, Opus 5 sur 22, et Fable 5.1 sur 16.
  • Claude Fable 5.1 a battu Claude Fable 5 sur 63 des 69 tâches et a obtenu en moyenne 7.2 points de plus. GPT 6 Astra a obtenu en moyenne 8.8 points de plus que GPT 5.6 Sol et l'a battu sur 61.
  • Claude Sonnet 5 coûte $1,23 par tâche. Gemini 3.8 Flash obtient 1.5 points de plus pour $0,61, et Grok 4.6 obtient 13 points de plus pour $1.09.

Coût et score

  • GPT 6 Astra et Claude Opus 5 coûtent à peu près la même chose, $1,76 et $1,73 par tâche, et leurs scores s'écartent de 1.6 point.
  • GPT 5.6 Luna a obtenu 45.2 à $0,016 par tâche, soit 18.7 points de moins que Claude Opus 5 pour moins d'un pour cent de son coût.
  • GPT 5.6 Sol obtient un score de 53.5 à $0,167 par tâche. Grok 4.6 obtient 7.5 points de plus et coûte 6.5 fois plus cher.
  • Claude Fable 5.1 est le model le plus cher du graphique à $3,19 par tâche et obtient 1.8 point de moins que Claude Opus 5, qui coûte $1.73.
  • Sur les 16 models du graphique, le coût par tâche et le score présentent une corrélation de 0.68. Le temps médian par tâche et le score présentent une corrélation de 0.04. Le model le plus rapide, Inkling Small avec 66 secondes par tâche, se classe dernier.

Désaccord entre les juges

Deux models juges ont noté chaque fichier ayant réussi les contrôles. Sur 32,7 % des scores individuels, les deux ont différé de plus d’un quart de l’échelle, et personne n’a examiné ces lignes.

Les deux juges placent les quatre mêmes configurations aux quatre premières places et les deux mêmes aux dernières ; 12 des 17 configurations sont classées différemment selon chaque juge.

Chaque juge a placé en première position le model de sa propre entreprise. GPT 5.6 Sol a classé GPT 6 Astra premier et Claude Opus 5 deuxième ; Opus 5 s’est classé lui-même premier et Astra quatrième. L’ordre publié combine les deux classements.

Benchmark AIM Marketing

La même méthode s’applique au travail marketing : trouver des offres qu’un concurrent publie et qu'AIMultiple ne publie pas, élaborer une liste de comptes la plus adaptée et produire un support de vente personnalisé. Chaque tâche est notée de 0 à 100 et le score global est la moyenne des trois. Un audit de réputation du site Web est réalisé en parallèle et est présenté selon ses propres axes, car il n’a pas de score maximal fixe.

Résultats complets : le benchmark de marketing agentique.

Laissez notre équipe automatiser l'un de vos processus métier avec des agents IA, gratuitement.
Automatiser un processus

Benchmark AIM IT

Douze models ont chacun exécuté deux fois une tâche de conception de benchmark, en inventant un benchmark, en le construisant et en y faisant passer quatre models. Aucune des 24 tentatives n’a satisfait à tous les critères, et six des contrôles de la grille n’ont été réussis par aucune d’entre elles. Claude Opus 5 a dominé en text-to-SQL avec 78.2 et Kimi K3 en appel d’outils avec 74.3.

Résultats complets : les LLM peuvent-ils concevoir un benchmark.

Benchmark AIM VC

Treize models répertoriés ont été invités à nommer les clients d’une entreprise avec des preuves datées, pour trois entreprises cibles. Claude Opus 5 a obtenu 89.1 sur 100 et Claude Fable 5 85.0, et ces deux-là ont été les seuls à rester au-dessus de 76 sur les trois cibles telles qu’évaluées. La plupart des autres ont obtenu leur score le plus bas sur la cible dont les clients apparaissent dans la publicité des podcasts plutôt que sur des pages indexées.

Résultats complets : le benchmark de liste de clients.

Ne manquez pas nos benchmarks et analyses basées sur les données. Le bouton ouvre Google ; sélectionner AIMultiple confirme que vous souhaitez voir AIMultiple plus souvent dans les résultats de recherche Google.
GoogleAjouter comme source préférée

Plateformes d'entreprise agentiques

Les entreprises peuvent également utiliser des LLM via des logiciels métiers. Les plateformes ci-dessous connectent des models de fournisseurs tels qu'OpenAI, Anthropic et Google aux enregistrements CRM, aux flux de travail et aux agents préconstruits.

Creatio

Creatio est une plateforme de CRM et de flux de travail dotée d’agents d’IA préconstruits.

Agents par service : Les agents disponibles dépendent des applications installées par l’entreprise. Exemples :

  • Agent commercial : enrichit les données de compte, renseigne les champs d’opportunité après les réunions Zoom et prépare les nouvelles réunions.
  • Agent de connaissance : rédige des articles de base de connaissances à partir des dossiers résolus.
  • Agent de segmentation : transforme des descriptions d’audience en langage naturel en segments marketing.

Un model distinct par agent, y compris autohébergés : Chaque agent ou sous-agent peut utiliser son propre model. Les options prises en charge sont OpenAI, Azure OpenAI et les fournisseurs pris en charge par LiteLLM, y compris les models sur la propre infrastructure de l’entreprise. Les scénarios d’agent nécessitent au moins une fenêtre de contexte de 40 000 tokens et la capacité d’appel de fonctions.

Salesforce Agentforce

Agentforce est la couche d’agents du CRM de Salesforce.

Models : Les agents utilisent des models compatibles Salesforce de partenaires, notamment Anthropic, Google et OpenAI. Les entreprises peuvent également connecter leur propre compte LLM, et le model par défaut d’un agent peut être modifié.

Einstein Trust Layer : Les appels de model passent par une couche qui, selon Salesforce, comprend la détection de toxicité, des accords de non-conservation des données et la défense contre l'injection de prompt.

Transfert vers une personne : « Transférer à un agent humain » est l’une des actions qu’un agent peut choisir. Cela permet à une conversation d’être transférée à une personne lorsqu’un processus ne peut pas tolérer d’erreurs.

Microsoft Copilot Studio

Copilot Studio est l’outil de Microsoft pour créer des agents pour Microsoft 365 et Power Platform.

Models : Les models OpenAI sont utilisés par défaut. Les créateurs peuvent également ajouter des models externes d'Anthropic, de xAI ou de Mistral.

Étiquettes de production : Microsoft marque certains models comme expérimentaux ou en avant-première et déconseille de les utiliser en production. Les agents publiés qui utilisent ces models restent facturés aux tarifs standard.

Repli : Si un administrateur désactive les models Anthropic, les agents construits sur ceux-ci basculent automatiquement vers le model OpenAI par défaut.

Méthodologie

Les 69 tâches ont été rédigées par le fondateur d'AIMultiple à partir de décisions réelles d'entreprise et ont été mappées aux identifiants APQC Process Classification Framework.1

Elles couvrent la stratégie (16 tâches), le marketing (15), les RH (7), la vente (6), les opérations (5), l’informatique et la finance (4 chacun), ainsi que sept domaines plus restreints. Chaque tâche nomme le fichier attendu : un results.csv avec une liste de colonnes fixe, généralement 10 lignes et 8 colonnes, avec une règle explicite pour chaque champ entier.

Comment les models ont été exécutés

Seize models ont été exécutés dans 17 configurations, une configuration étant un model sous un programme d’agent. Huit ont fonctionné sur opencode 1.15.13 via OpenRouter. Les neuf autres ont utilisé Claude Code, Codex ou Grok Build, les programmes d’agent des fournisseurs respectifs. Tous ont été facturés dans le cadre d’abonnements.

Fable 5.1 a fonctionné sur Claude Code 2.1.258 tandis que les trois autres configurations Claude ont fonctionné sur 2.1.220 ; Astra a fonctionné sur Codex 0.153.4 tandis que les trois configurations GPT 5.6 ont fonctionné sur 0.146.0. Gemini 3.8 Flash a fonctionné sur la même version d’opencode que les autres.

Chaque configuration a reçu le même prompt figé, un accès Web en direct via une scraping API et une limite d’une heure. Les prompts n’ont jamais été ajustés par model, et les grilles de notation n’ont jamais atteint la machine qui a exécuté les tâches.

Personne n’a choisi de niveau de raisonnement. Chaque configuration a fonctionné avec le niveau par défaut de son programme d’agent, et ces valeurs par défaut ne correspondent pas à un seul niveau :

Claude Code utilise par défaut le niveau élevé pour chaque model qu’il a exécuté. Codex applique le défaut du catalogue de chaque model. Ce niveau est faible pour GPT 5.6 Sol et moyen pour Luna, Terra et GPT 6 Astra. Grok Build a exécuté Grok 4.6 en niveau élevé. opencode laisse le niveau au fournisseur, de sorte que ses huit configurations ont fonctionné avec le niveau par défaut OpenRouter de chaque model.

Un niveau de raisonnement par défaut plus élevé n’a pas été associé à un score plus élevé. Sur le graphique de 16 models, les trois models dont le niveau par défaut dépasse élevé se classent 9, 11 et 14 : GLM 5.3 à max, Qwen 3.8 Max à xhigh et Kimi K3 à max. Claude Sonnet 5 a fonctionné à la fois sous un CLI de fournisseur et sous opencode et a obtenu 47.9 et 47.5.

Chaque chiffre de coût présenté ici est recalculé à partir de la consommation de tokens enregistrée aux prix catalogue d'OpenRouter gelés le 27 août 2026. Les tokens de raisonnement sont facturés comme des tokens de sortie, ce qui correspond à la manière dont OpenRouter les facture. GPT 6 Astra et Gemini 3.8 Flash ont rejoint l’évaluation plus tard et utilisent les tarifs d'OpenRouter relevés le 5 septembre 2026 ; Claude Fable 5.1 utilise les tarifs publiés d'Anthropic à la même date, car OpenRouter ne le répertorie pas.

Les coûts de Claude Code appliquent également trois règles publiées d'Anthropic qu’une simple grille tarifaire ne reflète pas. Le cache de prompt d’une heure coûte deux fois le tarif des tokens d’entrée, tandis qu’un cache de cinq minutes coûte 1.25 fois le tarif des tokens d’entrée. La recherche Web coûte $10 par millier de requêtes. Le sous-agent Haiku 4.5 que Claude Code exécute parallèlement au model principal est inclus.

Les chiffres de coût propres aux programmes d’agent ne sont pas comparables. Chaque exécution s’est faite dans le cadre d’un abonnement, de sorte qu’aucune configuration n’a de facture par exécution. Lorsqu’un programme indique un coût, il évalue ses propres tokens selon sa propre grille. opencode utilise une grille tarifaire groupée. Grok Build utilise une grille xAI proxy environ un tiers du tarif public. Codex ne rapporte rien. Claude Code a estimé Sonnet 5 à $3 et $15 par million de tokens, soit le tarif de Claude Sonnet 4.6, alors que Sonnet 5 est à $2 et $10.

Les exécutions ont produit 1 140 fichiers sur 1 173 couples configuration-tâche. Un fichier manquant obtient zéro et n’est pas relancé, sauf si l’exécution a atteint la limite d’une heure ou s’est terminée par une erreur du fournisseur du model ; chaque exception autorise une nouvelle tentative.

Cinq exécutions se sont bloquées et quatre ont produit un fichier lors de la nouvelle tentative. Dix-huit exécutions se sont terminées par une erreur du fournisseur, une 502 ou 504 de l'API ou une réponse corrompue. L’une avait déjà écrit son fichier ; les 17 autres ont été relancées, et 16 ont abouti. Une exécution a rencontré à la fois la limite de temps et une erreur du fournisseur.

Huit exécutions de Qwen 3.8 Max se sont terminées lorsque le garde-fou de boucle d’opencode a empêché le model de répéter le même appel d’outil une troisième fois. Aucune autre configuration n’a déclenché ce garde-fou. Ces exécutions n’ont pas été relancées, et quatre d’entre elles n’ont produit aucun fichier. Chaque fichier n’a été noté qu’une seule fois, de sorte qu’aucun résultat ne provient du choix de la meilleure des deux tentatives.

Comment fonctionnent les contrôles et les juges

Les contrôles déterministes s’exécutent en premier, et aucun juge ne voit un fichier qui les échoue : ensemble de colonnes et nombre de lignes, analyse RFC 4180,2

la mise en forme des entiers, l’absence de cellules vides, l’absence de lignes en double et l’ordre de tri lorsque la tâche l’exige.

Un fichier qui échoue obtient zéro plutôt que d’être écarté. MiniMax M3 a échoué sur 8 des 64 fichiers livrés, six d’entre eux parce que le CSV ne pouvait pas être analysé, et GPT 5.6 Luna et GPT 5.6 Terra ont échoué sur un chacun. En supprimant toutes les tâches où une configuration a obtenu zéro, il reste 38 tâches et le même model en tête.

Les 1 130 fichiers ayant réussi les contrôles ont été soumis à deux juges : GPT 5.6 Sol via le CLI Codex et Claude Opus 5 via le CLI Claude Code, tous deux avec un effort de raisonnement élevé et un accès Web en direct.

Chaque colonne du fichier est confiée à son propre sous-agent, qui voit les réponses de cette colonne pour chaque model et rien d’autre, sous des identifiants de ligne anonymisés mélangés séparément pour chaque juge. Le juge classe ces réponses les unes par rapport aux autres et ne peut pas considérer deux réponses comme égales. Les deux classements sont ensuite combinés en additionnant la position de chaque réponse selon chaque juge. Cela a produit 93 490 scores.

Mesurés avec les noms des models visibles, Sol a classé les réponses de GPT 8.4 points de centile au-dessus du niveau où Opus les a classées, et Opus a classé les réponses d'Anthropic 4.9 points de centile au-dessus du niveau où Sol les a classées. Dans l’exécution anonymisée à l’origine de ce classement, Sol a classé GPT 6 Astra en première position et Opus a classé Claude Opus 5 en première position.

Comment fonctionne la notation

Le score d’un model est la somme de ses moyennes par colonne, redimensionnée de manière à ce que le total le plus élevé possible soit 100. Ce plafond dépend du nombre de models ayant réussi les contrôles, ce qui explique pourquoi ces scores ne se comparent qu’au sein de ce benchmark et nulle part ailleurs.

Pour tester dans quelle mesure le classement dépend de la sélection des tâches, nous avons recalculé le classement 4 000 fois, chaque fois sur une re-sélection aléatoire des 69 tâches. Cela mesure uniquement la sensibilité aux tâches. Cela ne mesure pas dans quelle mesure une nouvelle exécution de la même tâche modifierait un score, car aucune tâche n’a été notée deux fois.

Le quart le plus difficile correspond à 17 tâches, celles dont le score moyen est le plus bas sur l’ensemble des 17 configurations. Cinq tâches sont à égalité pour les quatre dernières places, et Opus 5 obtient la moyenne la plus élevée dans les cinq sélections possibles. Cette règle a été fixée avant que le classement d’un model sur ces tâches ne soit calculé.

Dix des 16 models figurent également dans les benchmarks ci-dessus. Leurs scores ne sont pas comparables d’un benchmark à l’autre, car chacun définit sa propre échelle.

Chaque configuration est notée sur sa position par rapport aux models contre lesquels elle a été exécutée, de sorte que supprimer une configuration modifie tous les autres scores. Pour la même raison, ces scores ne se comparent pas à ceux de l’exécution précédente de ce benchmark, qui a évalué un domaine différent. Seul l’ordre des configurations peut être comparé entre les exécutions.

Gemini 3.7 Flash a été exécuté sur ce domaine et a été retiré lorsque Gemini 3.8 Flash a terminé, conformément à la règle selon laquelle un model quitte le classement une fois que son successeur a été exécuté. La même règle a retiré Grok 4.5 et GLM 5.2.

FAQ

Pas sur la base de ces éléments. L’échelle est relative, de sorte que même le meilleur score de 63.9 signifie seulement que les réponses d’un model se sont classées au-dessus des autres, et les lignes sur lesquelles les deux models de notation divergent sensiblement n’ont pas été examinées. Les fournisseurs qui construisent ce type d’agent figurent dans notre analyse des entreprises d’IA d’entreprise, et AIMultiple automatise des processus semblables.

Sept d’entre eux obtiennent un score compris entre 45.2 et 49.4, plus proches que ce que 69 tâches peuvent séparer. Les quatre premiers sont également à moins de 2.9 points les uns des autres. Le benchmark sépare les models forts des models faibles ; le rééchantillonnage des tâches réordonne ces deux groupes.

Un model a été exécuté sous les deux programmes lors de cette exécution, et il a obtenu 47.9 sous Claude Code et 47.5 sous opencode. Une seule comparaison ne fournit pas de réponse générale. Les graphiques présentent le résultat de Claude Code. La configuration opencode a lu 4.5 fois plus de contexte mis en cache et a produit 1.2 fois plus de tokens de sortie, y compris de raisonnement. Elle a coûté $1,59 par tâche, contre $1,23 pour Claude Code, dont le chiffre inclut déjà un sous-agent qu’opencode n’exécute pas.

Citez ce benchmark

Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.

Berk Kalelioğlu (2026) - "AIM Enterprise: Benchmark d'entreprise agentique". Publié en ligne sur AIMultiple.com. Consulté le 17 septembre 2026, à : https://aimultiple.com/agentic-enterprise [Ressource en ligne]

Kalelioğlu, B. (2026, 17 septembre). AIM Enterprise: Benchmark d'entreprise agentique. AIMultiple. https://aimultiple.com/agentic-enterprise

@misc{kalelioglu2026,
  author = {Kalelioğlu, Berk},
  title  = {{AIM Enterprise: Benchmark d'entreprise agentique}},
  year   = {2026},
  month  = sep,
  howpublished    = {\url{https://aimultiple.com/agentic-enterprise}},
  note   = {AIMultiple. Consulté le 17 septembre 2026}
}
Télécharger toutes les données

Résultats et horodatages de 33 points de données. Téléchargez les données de synthèse présentées dans les graphiques et les tableaux de cet article sous forme de fichier ZIP contenant 2 fichiers CSV et un README.

Dernière mise à jour : 24 septembre 2026
Télécharger

Vous voulez les données détaillées derrière ? Rejoindre Premium

Journal des modifications

1 mises à jour
  1. Ajout d'un tableau de l'effort de raisonnement par modèle et programme agent à la section méthodologie.

Berk Kalelioğlu
Berk Kalelioğlu
Chercheur en IA
Berk est chercheur en IA au sein de l’équipe benchmark d’AIMultiple, se concentrant sur l’IA agentique, l’apprentissage automatique et les grands et petits modèles de langage (LLM et SLM).
Voir le profil complet

Soyez le premier à commenter

Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.

0/450