Benchmark des plateformes d'agents IA: Claude Managed Agents contre Google Vertex Agent Engine
Nous avons benchmarké 4 plateformes d'agents IA selon 3 dimensions : réalisation des tâches (10 tâches de codage × 3 exécutions), capacités spécifiques au harnais (pilotage, reconnexion, rappel de longue conversation, gestion de gros fichiers) et coût.
Résultats du benchmark des plateformes d'agents IA
Plateforme | Model | Taux de réussite | Temps écoulé | Coût | Token |
|---|---|---|---|---|---|
Claude Managed Agents | Claude Sonnet 4.6 | 30/30 (100 %) | 1 172s | $2.50 | 93k |
Vertex IA Agent Engine | Gemini 2.5 Pro | 30/30 (100 %) | 1 447s | $1.45 | 159k |
OpenAI Responses + CI | GPT-5.4 | 27/30 (90 %) | 522s | $1.54 | 113k |
Témoin (auto-hébergé) | Claude Sonnet 4.6 | 30/30 (100 %) | 794s | $1.96 | 464k |
Claude Managed Agents et Vertex IA Agent Engine atteignent toutes deux un taux de réussite de 100 % sur la suite de tâches, Vertex l'emportant sur le coût ($1.45 contre $2.50). Pour les fonctionnalités spécifiques au harnais uniquement disponibles dans les plateformes gérées comme le pilotage en cours de flux, la déconnexion/reconnexion, la compaction de longue conversation, Claude Managed Agents est le plus capable, mais Vertex Agent Engine le rattrape sur les tests portables (compaction, gestion de gros fichiers).
Principaux résultats du benchmark des tâches
- Claude MA et Vertex AE ont fait jeu égal sur le taux de réussite à 30/30 (100 %). Les deux gèrent tous les types de tâches, y compris les tâches réseau (06, 10) qui ont fait trébucher OpenAI.
- Les échecs d'OpenAI proviennent de sa politique de sandbox. Les tâches 06 (client REST API) et 10 (téléchargeur concurrent) nécessitent toutes deux du HTTP sortant. Le sandbox de Code Interpreter limite cela, et les deux ont échoué respectivement 2/3 et 1/3. Nous avons constaté que GPT-5.4 peut écrire le code, mais le sandbox ne l’exécute pas de manière fiable.
- Vertex AE est le moins cher à $1.45 au total. Claude MA est le plus cher à $2.50. C'est 72 % de plus que Vertex sur la même suite de tâches avec le même taux de réussite.
- Vertex AE est le plus lent. L'orchestration ADK gérée ajoute de la surcharge.
Capacités spécifiques au harnais
Deux plateformes sont comparées en tête-à-tête sur des fonctionnalités qui n'existent que parce qu'il y a un harnais géré.
Voir la méthodologie ci-dessous.
Plateformes d'agents IA
Claude Managed Agents
Le service Claude Managed Agents d'Anthropic fournit un runtime d'agent hébergé combinant sessions avec état, exécution d'outils intégrée, streaming basé sur les événements et compaction automatique pour les charges de travail autonomes de longue durée. La plateforme se différencie par des primitives uniques indisponibles dans les offres comparables, comme l'injection d'événements utilisateur en cours de flux pour le pilotage en vol, les flux SSE reprenables pour la déconnexion/reconnexion, et l'intégration native du serveur MCP. Le tout est livré comme un service entièrement géré sans infrastructure à provisionner pour les développeurs.1
La tarification est de $0.08 par heure de session en plus des coûts standard de token API de Claude.
Avantages :
- Les sessions avec état avec injection d'événements en cours de flux permettent aux nouveaux messages utilisateur de piloter les agents pendant l'exécution en vol.
- Prise en charge de la déconnexion et de la reconnexion via des flux SSE persistants ; les sessions continuent de s'exécuter côté serveur malgré les interruptions réseau et les clients peuvent reprendre la consommation d'événements à la reconnexion.
- La boîte à outils intégrée de l'agent regroupe bash, les opérations sur fichiers (read, write, edit, glob, grep) et les outils web (web_fetch, web_search) accessibles via un seul paramètre de configuration, éliminant le câblage d'outils personnalisés.
- Intégration native du serveur MCP (Model Context Protocol) pour des extensions d'outils personnalisées sans modifier la boîte à outils intégrée de l'agent.
Inconvénients :
- Actuellement en bêta ; toutes les requêtes nécessitent l'en-tête bêta managed-agents-2026-04-01, et le comportement peut évoluer entre les versions.
- Limitée à Claude, aucune flexibilité de model par rapport à des plateformes comme AWS Bedrock AgentCore ou Northflank qui prennent en charge plusieurs fournisseurs de model.
Salesforce Agentforce
Salesforce Agentforce se différencie par l'accès natif aux données CRM via le moteur de raisonnement Atlas et des agents préconstruits pour les workflows de vente, service, marketing et commerce.2
La plateforme s'intègre à MuleSoft Agent Fabric pour l'orchestration inter-systèmes et propose Agentforce 360 pour les partenariats AWS.
Agentforce s'adresse aux organisations nécessitant des workflows autonomes orientés client intégrés directement dans leur infrastructure cloud Salesforce existante.
Avantages :
– L'accès natif aux données CRM via le moteur de raisonnement Atlas permet des actions d'agent contextuelles.
– Les agents préconstruits disponibles pour la vente, le service, le marketing et le commerce réduisent le délai de déploiement.
– Autorisé FedRAMP sur le cloud gouvernemental Salesforce pour les secteurs réglementés.
– Le niveau Foundations gratuit inclut 200 000 Flex Credits pour les tests initiaux.
Inconvénients :
– SaaS uniquement en cloud sans option de déploiement sur site disponible.
– Agnosticisme de model limité ; utilise par défaut des models gérés par Salesforce avec un support limité des fournisseurs externes.
– Nécessite un investissement dans l'écosystème Salesforce existant pour en tirer pleinement valeur.
Microsoft Copilot Studio
Avantages :
– Inclus avec les licences Microsoft 365 Copilot pour une utilisation d'agents internes sans frais supplémentaires.3
– Agents vocaux en temps réel et prise en charge de la téléphonie IVR pour les scénarios de service client.
– Autorisé FedRAMP via Azure Government pour les déploiements du secteur public.
– Prend en charge les models OpenAI, Anthropic et les frameworks open source dans un seul environnement de construction.
Inconvénients :
– Fonctionnalités limitées en dehors de l'écosystème Microsoft ; nécessite un engagement Azure ou M365 pour bénéficier de toutes les capacités.
– Pas de niveau permanent autonome gratuit ; nécessite un abonnement M365 Copilot existant pour l'utilisation incluse.
– Model d'IA vocale en temps réel hébergé uniquement en Amérique du Nord à partir d'avril 2026.
Copilot Studio est le plus rentable pour les organisations utilisant déjà Microsoft 365, Teams et Azure, offrant une automatisation orientée employé qui hérite des configurations d'identité, de sécurité et de conformité existantes.
Google Agentspace et Vertex IA Agent Builder
L'offre double de Google combine Agentspace pour la gestion des connaissances d'entreprise et Vertex IA Agent Builder pour le développement low-code, différenciée par l'intégration du model Gemini, le contexte inter-produits Google Workspace et la prise en charge d'entrées multimodales pour le texte, la voix et les images.4
La plateforme offre $300 de crédits gratuit pour les nouveaux utilisateurs et une tarification à l'usage pour Vertex IA Agent Engine.
Avantages :
– $300 de crédits gratuit pour les nouveaux utilisateurs permettent un prototypage intensif sans investissement initial.
– Déploiement sur site pris en charge via Google Distributed Cloud pour les environnements réglementés.
– Autorisé FedRAMP via Google Cloud.
– Le Google ADK (Agent Development Kit) prend en charge le développement code-first en Python, TypeScript, Go et Java.
Inconvénients :
– La conception centrée sur Gemini limite la flexibilité de model par rapport aux plateformes entièrement agnostiques.
AWS Bedrock Agents et AgentCore
AWS Bedrock Agents et la plateforme plus récente AgentCore fournissent une gestion d'infrastructure serverless pour les agents à l'échelle de l'entreprise, lancée à re:Invent 2025.5
Les différenciateurs incluent une tarification à l'usage à $0.0895 par heure-vCPU pour le runtime AgentCore, des options de débit provisionné, et Mem0 comme fournisseur de mémoire exclusif.
Avantages :
– Autorisé FedRAMP High sur AWS GovCloud pour les charges de travail sensibles.
– Le streaming bidirectionnel prend en charge les agents vocaux avec parole simultanée de l'utilisateur et de l'agent.
– Un niveau gratuit est disponible pour les nouveaux clients AWS pour l'expérimentation initiale.
– Accès aux models de Anthropic, Amazon, Meta, Mistral et AI21 via le catalogue Bedrock.
Inconvénients :
– Pas de modèles d'agent prédéfinis spécifiques au domaine ; nécessite une construction à partir de zéro en utilisant le SDK.
– Aucune option de déploiement sur site ; fonctionne exclusivement sur l'infrastructure AWS.
– La construction d'agents nécessite un codage API/SDK important par rapport aux constructeurs visuels.
AWS Bedrock s'adresse aux entreprises nécessitant une infrastructure d'agents évolutive et serverless avec une intégration profonde dans l'écosystème AWS, offrant une efficacité des coûts grâce à une facturation granulaire basée sur l'utilisation.
IBM watsonx Orchestrate
IBM watsonx Orchestrate cible les entreprises réglementées avec plus de 150 agents prédéfinis spécifiques au domaine pour les RH, les achats, les ventes et la finance, ainsi que Skills Studio pour la création de compétences personnalisées.6
La plateforme offre une flexibilité de déploiement en cloud hybride et sur site via IBM Cloud Pak for Data et Software Hub.
Avantages :
– Installation sur site prise en charge via IBM Cloud Pak for Data pour les exigences de résidence des données.
– Plus de 150 agents et outils prédéfinis d'IBM et de ses partenaires, avec plus de 80 intégrations d'applications d'entreprise, notamment SAP, Salesforce et Workday.
– Autorisation FedRAMP étendue en avril 2026 pour les déploiements fédéraux.
– Véritable agnosticisme de model prenant en charge plusieurs fournisseurs de LLM sans verrouillage fournisseur.
Inconvénients :
– Pas de niveau permanent gratuit ; nécessite un abonnement payant Essentials ou Standard pour une utilisation continue.
– Les capacités vocales et de téléphonie sont disponibles dans watsonx Orchestrate via la configuration vocale native dans l'ADK et des intégrations avec des fournisseurs tels que Deepgram et ElevenLabs, bien qu'une téléphonie avancée puisse nécessiter une configuration supplémentaire.
– Structure tarifaire complexe nécessitant des devis personnalisés pour les fonctionnalités d'entreprise.
ServiceNow IA Agents
ServiceNow IA Agents s'intègrent directement dans la Now Platform, se différenciant par une intégration native avec les workflows IT, RH et de service client plutôt que de fonctionner comme une plateforme autonome.
La plateforme comprend IA Control Tower pour la gouvernance, des workflows agentiques prédéfinis pour ITSM et HRSD, et un Context Engine reliant l'historique des politiques aux actions des agents.7
Avantages :
– Hérite de la gouvernance existante de Now Platform, des règles de SLA et des workflows d'approbation.
– Les IA Voice Agents prennent en charge Genesys Cloud, Twilio et 3CLogic en tant que fournisseurs CCaaS.
– Les IA Web Agents apprennent à partir de démonstrations humaines pour automatiser les tâches basées sur le navigateur.
Inconvénients :
– Pas de niveau permanent gratuit ; les nouveaux clients ne reçoivent que 100 appels Build Agent gratuit.
– L'autorisation FedRAMP High pour IA Agents, IA Agent Orchestrator et IA Agent Studio a été confirmée pour les clients Government Community Cloud (GCC) à partir de mars 2026.
– Valeur limitée pour les organisations n'utilisant pas déjà ServiceNow pour la gestion des services IT ou RH.
Kore.ai
Kore.ai se concentre sur l'IA conversationnelle d'entreprise avec plus de 300 agents prédéfinis, plus de 250 intégrations d'entreprise et une architecture agnostique en termes de models prenant en charge les déploiements cloud et sur site.
La plateforme dessert six secteurs verticaux, notamment la banque, la santé et le commerce de détail.8
Avantages :
– Infrastructure vocale native offrant des interactions vocales mondiales à faible latence.
– Déploiement flexible incluant des options sur site et en cloud privé.
– Prend en charge plusieurs fournisseurs de LLM.
Inconvénients :
– Pas de niveau permanent gratuit ; offre seulement $500 de crédits uniques pour les tests initiaux.
LangGraph
Avantages :
– La licence open source MIT autorise une utilisation commerciale et des modifications sans restriction.
– Le contrôle déterministe des workflows via une architecture graphique garantit des chemins d'exécution reproductibles.
– L'intégration d'observabilité LangSmith fournit une surveillance et un traçage en production.
Inconvénients :
– Pas de constructeur visuel no-code ; nécessite du code Python ou JavaScript pour définir les graphes d'agents.
– Pas d'intégration native de voix ou de téléphonie ; nécessite un codage personnalisé pour les canaux vocaux.
– Courbe d'apprentissage abrupte pour les équipes peu familières avec les paradigmes de programmation basés sur les graphes.
LangGraph convient aux équipes d'ingénierie construisant des agents de qualité production nécessitant une logique conditionnelle complexe, une récupération d'erreurs et une auditabilité des étapes d'exécution individuelles.
CrewAI
Avantages :
– L'abstraction basée sur les rôles reflète les structures d'équipes humaines pour une coordination intuitive des agents.
– Cœur open source gratuit sans frais de licence pour les déploiements auto-hébergés.
– Éditeur visuel et copilote IA disponibles dans le niveau gratuit pour les membres d'équipe non techniques.
Inconvénients :
– Pas de place de marché de modèles officielle maintenue par le fournisseur ; repose sur les contributions de la communauté.
– L'approche code-first nécessite des connaissances en Python pour la création d'agents.
– La tarification du plan Enterprise n'est disponible que sur demande, ce qui peut créer une incertitude budgétaire pour les petites équipes par rapport à d'autres options open source.
CrewAI permet un prototypage rapide de pipelines d'agents basés sur les rôles, particulièrement adapté au traitement de documents, aux workflows de recherche et aux tâches de génération de contenu en plusieurs étapes.
n8n
n8n fonctionne sous une licence fair-code (Sustainable Use License), offrant plus de 400 connecteurs d'applications natifs avec des nœuds IA visuels et une infrastructure auto-hébergeable.
Avantages :
– L'édition communautaire auto-hébergée comprend SSO SAML, LDAP, RBAC et des magasins de secrets chiffrés sans frais.
– Prise en charge native de LangChain et LlamaIndex dans les workflows visuels.
– L'éditeur de workflow visuel permet une automatisation complexe sans codage.
Inconvénients :
– La licence fair-code nécessite une licence payante pour l'hébergement commercial ou les produits SaaS.
– Pas de nœud natif de voix ou de téléphonie ; nécessite une intégration API externe pour la voix.
– Aucune autorisation FedRAMP confirmée.
n8n fait le pont entre l'automatisation traditionnelle des workflows et les agents IA, au service des analystes métier techniques et des équipes DevOps qui nécessitent un déploiement auto-hébergé pour la résidence des données tout en conservant des capacités de construction visuelle.
Dify
Dify est une plateforme LLMOps open source.
La plateforme prend en charge les pipelines RAG, les outils d'ingénierie de prompt et une architecture agnostique en termes de models.
Avantages :
– L'édition communautaire auto-hébergée est gratuit en permanence avec un contrôle total des données via un déploiement Docker.
– Le constructeur de workflow visuel permet la création d'agents complexes sans codage.
– Prend en charge des centaines de LLM propriétaires et open source provenant de dizaines de fournisseurs d'inférence.
Inconvénients :
– Le support vocal nécessite des plugins de la place de marché tels qu'Agora ou Tencent RTC ; pas de téléphonie PSTN native.
– Aucune autorisation FedRAMP.
– Le plan Cloud Team à $159 par mois peut être coûteux pour les petites équipes.
Dify convient aux équipes produit et opérations nécessitant des agents sensibles aux documents avec de fortes capacités RAG, en particulier celles qui privilégient le contrôle des données via l'auto-hébergement.
Voiceflow
Voiceflow se différencie comme la seule plateforme majeure traitant la conception d'agents axée sur la voix comme un citoyen de première classe plutôt que comme un module complémentaire, avec un canevas de conception spécialement conçu pour les agents vocaux et de chat avec une latence inférieure à 500ms.
La plateforme se spécialise dans l'automatisation des tickets de service client et les systèmes IVR.
Avantages :
– Canaux vocaux et de téléphonie natifs avec prise en charge IVR et latence inférieure à 500ms.
– Capacités d'extraction d'entités pour les requêtes de base de connaissances.
– Le plan gratuit comprend 2 agents et 100 tokens IA mensuels sans expiration.
– Canevas visuel conçu spécifiquement pour les workflows d'IA conversationnelle.
Inconvénients :
– Le déploiement sur site n'est disponible que via des accords d'entreprise personnalisés.
Voiceflow s'adresse aux équipes CX et de support qui construisent des agents conversationnels orientés client nécessitant un déploiement sur les canaux vocaux, de chat et de messagerie à partir d'une seule interface de conception.
Relevance IA
Relevance IA offre une flexibilité bring-your-own-LLM (BYOLLM) avec un modèle de facturation basé sur les actions, permettant aux équipes non techniques de construire des équipes multi-agents via des descriptions en langage naturel.
Avantages :
– Le niveau gratuit comprend 100 crédits par jour sans expiration.
– Plus de 2 000 intégrations, notamment HubSpot, Salesforce, Slack et Gmail.
– Véritable agnosticisme de model prenant en charge plusieurs fournisseurs de LLM.
Inconvénients :
– Pas d'option d'auto-hébergement ou de déploiement sur site ; SaaS uniquement en cloud.
– Aucune autorisation FedRAMP pour les secteurs réglementés.
– Les capacités vocales nécessitent une intégration avec Vapi ou Twilio plutôt qu'une téléphonie native.
Lindy IA
Lindy IA fournit diverses intégrations via Pipedream, des modèles d'agents prédéfinis pour le tri des e-mails et la planification, et des capacités d'agent d'appel téléphonique via la fonction vocale Gaia.9
La plateforme utilise un modèle d'exécution basé sur les crédits avec un niveau gratuit disponible.
Avantages :
– Le niveau gratuit comprend 400 crédits par mois et une base de connaissances de 1 million de caractères.
– Véritable agnosticisme de model et bibliothèque d'intégration étendue.
Inconvénients :
– Le déploiement sur site n'est disponible que via des accords d'entreprise personnalisés pour les secteurs réglementés.
Idéal pour les utilisateurs professionnels individuels, les fondateurs et les équipes opérationnelles nécessitant une automatisation rapide des workflows de messagerie, de calendrier et de CRM sans ressources d'ingénierie.
Méthodologie
Qu'apporte réellement une plateforme d'agents IA gérée par rapport à ses concurrents, et par rapport à l'alternative de construire son propre harnais d'agent ? L'espace des outils d'IA a un angle mort persistant ici. Les produits « agent géré » sont couramment comparés à l'aide des mêmes grilles d'évaluation de réalisation de tâches que celles utilisées pour les models de langage bruts, ce qui confond deux choses très différentes : la capacité du model à générer du code correct, et la capacité du harnais à exécuter ce code de manière fiable dans un runtime géré avec état, outils et isolation. Nous avons conçu ce benchmark pour séparer ces signaux.
Qu'est-ce qu'une plateforme d'agents gérée ?
Nous benchmarkons une catégorie spécifique : des runtimes hébergés qui regroupent l'inférence LLM, l'orchestration d'agents et l'exécution de code sandboxée dans un seul service géré. Cela se distingue de (1) les LLM inférence APIs bruts, (2) les frameworks d'orchestration d'agents que vous hébergez vous-même, et (3) les sandboxes de calcul que vous associez à votre propre model. Les quatre plateformes testées prennent chacune une forme légèrement différente de ce regroupement :
- Claude Managed Agents (Anthropic) : Harnais entièrement géré. Les définitions d'agent, les sessions, le streaming basé sur les événements, la compaction et l'exécution d'outils sont tous côté serveur. L'un des deux véritables concurrents de cette catégorie.
- Vertex IA Agent Engine (Google) : Harnais entièrement géré. Déployez un agent défini par ADK sur un runtime géré ; le déploiement héberge l'état de l'agent et l'exécution des outils. Accessible via le SDK vertexai.agent_engines.
- OpenAI Responses API avec Code Interpreter : Catégorie adjacente. API d'inférence avec un outil Python sandbox intégré, mais sans état de session multi-tours persistant ni pilotage en cours de flux.
- Contrôle : Claude Messages API avec une boucle d'outils locale : Inclus comme référence. Même model que Claude MA (claude-sonnet-4-6), mais nous implémentons la boucle d'agent localement en ~150 lignes de Python. Les outils (bash, write, read, edit) s'exécutent dans un répertoire temporaire par tâche sur la machine de benchmark. Cela isole ce que le harnais géré apporte au-delà de « model plus boucle d'outils ». L'exécution de l'API Messages avec une boucle d'agent locale produit une comparaison où le model est identique mais le harnais absent. Tout écart entre Claude MA et le contrôle est attribuable entièrement au harnais, et non à la capacité du model.
La suite de tâches
Dix tâches de codage réparties sur trois niveaux de difficulté. Chaque tâche a un prompt fixe spécifiant le livrable, un script de vérification codant des critères de réussite/échec déterministes. Chaque tâche est exécutée trois fois par plateforme pour mesurer la variance.
Tests de stress spécifiques au harnais
La suite de tâches mesure l'exactitude de bout en bout. Elle ne peut pas mesurer les capacités qui n'existent que grâce à un harnais géré : persistance de session avec état, pilotage en cours de flux, reprise de connexion, compaction automatique du contexte et gestion des artefacts du système de fichiers géré. Pour celles-ci, nous avons conçu deux suites de tests supplémentaires.
Suite A : Pilotage et interruption
Trois tests exerçant les primitives spécifiques au harnais.
A1 démarre un agent sur une tâche de codage, puis injecte un nouvel événement utilisateur via POST /events après 10 secondes modifiant les exigences, et vérifie en inspectant le système de fichiers du conteneur que l'artefact final reflète la nouvelle exigence plutôt que l'originale.
A2 ouvre un flux SSE, coupe la connexion après quatre événements, se reconnecte et vérifie que la session atteint toujours status_idle.
A3 envoie un prompt délibérément contradictoire et mesure si l'agent demande des éclaircissements ou choisit silencieusement une interprétation.
Seul A3 est portable entre les plateformes. L'injection d'événements en cours de flux d'A1 n'a pas d'équivalent direct sur OpenAI Responses (requête/réponse unique) ni sur Vertex Agent Engine (le session model ne permet pas l'injection de messages en vol). La déconnexion/reconnexion d'A2 n'a pas non plus d'équivalent ailleurs. Ce sont de véritables avantages structurels du session model piloté par événements de Claude MA, non benchmarkables sur les alternatives. Nous avons exécuté A1 et A2 sur Claude MA uniquement et A3 sur les deux, Claude MA et Vertex Agent Engine.
Suite B : Compaction et contexte
Deux tests exerçant les fonctionnalités de contexte géré.
B1 place une chaîne canari unique (un token dérivé d'un UUID) dans le premier tour d'une session, exécute 23 tours de remplissage de petites tâches de codage sans rapport produisant chacune des appels d'outils et des résultats d'outils, puis demande à l'agent de rappeler le canari de mémoire au 25e tour sans recherche de fichier autorisée. Un rappel réussi après 23 tours de remplissage est une preuve que le harnais préserve le contexte initial quelle que soit sa politique de compaction.
B2 demande à l'agent de générer un fichier texte de 50 000 lignes avec un marqueur enfoui, puis de répondre à une question nécessitant de trouver le marqueur. Cela teste si l'agent peut raisonner sur des artefacts plus grands que sa fenêtre de contexte sans tenter de lire tout le fichier.
B1 et B2 ont été exécutés à la fois sur Claude MA et Vertex Agent Engine, en utilisant les mêmes prompts et protocoles.
LLM-as-judge pour la notation comportementale
Pour la suite A3 (contradictions), la réussite/échec n'est pas un contrôle déterministe ; nous avons traité « l'agent a-t-il demandé des éclaircissements » comme un jugement qualitatif sur le comportement conversationnel. Nous utilisons une conception LLM-as-judge avec trois garde-fous méthodologiques :
- Le model juge est différent du model testé : Claude Opus 4.6 est le juge pour éviter le biais d'auto-évaluation.
- Grille structurée avec 4 dimensions booléennes : Le juge renvoie une notation JSON : recognized_contradiction, asked_for_clarification, proceeded_with_assumption, documented_assumption, et un raisonnement d'un paragraphe.
- Contrôle de cohérence sur 3 exécutions : Chaque jugement est exécuté 3 fois. Nous rapportons le consensus majoritaire par dimension et le taux d'accord par dimension. Si l'accord d'une dimension tombe en dessous de 67 %, le juge est signalé comme incohérent sur cette dimension, et le résultat est traité comme étant à faible confiance.
Une heuristique par mots-clés s'exécute en parallèle comme vérification de cohérence. Les divergences entre l'heuristique et le juge sont journalisées pour un examen manuel.
Notation
Pour chaque exécution de tâche sur chaque plateforme :
- Réussite/échec
- Temps écoulé : Secondes écoulées entre l'envoi du prompt et la réception de l'événement terminal (status_idle pour Claude MA, achèvement de tâche pour Vertex AE, achèvement de réponse pour OpenAI, sortie de boucle d'outils pour le contrôle).
- Nombre d'appels d'outils : Invocations d'outils distinctes. Utile comme empreinte comportementale ; moins utile comme métrique d'efficacité car la granularité des outils diffère considérablement entre les plateformes.
- Utilisation de token : Analysée à partir des événements model_request_end sur Claude MA, de usage_metadata sur Vertex AE, de response.usage sur OpenAI, et de l'accumulation par tour dans la boucle de messages du contrôle. Décomposée en entrée, sortie, lecture de cache et création de cache.
- Coût en USD : Calculé à partir de l'utilisation de token selon la tarification publiée : claude-sonnet-4-6 à $3/$15/$0.30/$3.75 par million ; gpt-5.4 à $2.50/$15/$0.25 ; gemini-2.5-pro à $1.25/$10/$0.13. Des frais d'infrastructure spécifiques à la plateforme sont ajoutés : $0.08/heure de session de Claude MA au prorata du temps écoulé, $0.03/conteneur d'OpenAI lorsqu'un appel d'outil a eu lieu, et environ $0.35/heure de frais d'hébergement de Vertex AE au prorata de la disponibilité du déploiement.
Les résultats des suites A et B capturent en outre des métriques au niveau session (tours, rappel de canari, consensus et accord du juge).
Considérations d'équité et limitations connues
Plusieurs asymétries dans la configuration affectent la façon dont les chiffres doivent être interprétés ; nous les signalons explicitement :
Le contrôle exécute les outils sur la machine de benchmark sans aller-retour cloud. Cela lui donne un avantage injuste en temps écoulé qui ne reflète pas tant la vitesse de l'agent qu'un saut de réseau. Lorsque nous observons que le contrôle termine les tâches ~25 % plus vite que Claude MA sur le même model, environ la moitié de cet écart est due à l'asymétrie des aller-retours.
OpenAI Code Interpreter fonctionne dans un sandbox restreint au réseau. Les tâches 06 (client REST API) et 10 (téléchargeur concurrent) nécessitent du HTTP sortant, que CI n'autorise que par intermittence. Les échecs d'OpenAI sur ces tâches sont des échecs de politique de sandbox, pas des échecs de capacité du model. GPT-5.4 peut écrire du code HTTP concurrent correct ; la plateforme ne peut pas toujours l'exécuter. Les lecteurs ne doivent pas interpréter « OpenAI échoue sur les tâches réseau » comme une déclaration sur le model.
Gemini 3.1-pro-preview est soumis à une liste d'autorisation d'aperçu au niveau du projet. Nous avons tenté de benchmarker ce model à la fois via l'API Vertex directe et via Vertex Agent Engine. Les appels API directs ont renvoyé 404 ; les déploiements Agent Engine avec le model ont réussi au moment du déploiement, mais les appels d'inférence ont renvoyé zéro événement sans erreur. Nous sommes repliés sur gemini-2.5-pro.
Une suite de tâches de refactorisation de plusieurs heures, de débogage dans des bases de code inconnues, ou des workflows autonomes de longue durée stresseraient les harnais difféRemment et sépareraient probablement plus clairement les meilleures options.
Nous n'avons pas mesuré la latence de provisionnement, le comportement de démarrage à froid, les performances de sessions concurrentes ou les plafonds de limitation de débit. Ceux-ci sont importants pour les charges de travail de production à haut débit mais étaient hors périmètre pour cette itération.
Fonctionnalités communes à toutes les plateformes d'agents IA
Chaque plateforme de cette comparaison fournit des capacités de base qui définissent la catégorie des agents IA. Ces fonctionnalités communes établissent le produit minimum viable pour l'automatisation agentique, tandis que les fonctionnalités différenciantes déterminent la sélection de la plateforme.
Orchestration multi-agents : Toutes les plateformes prennent en charge l'orchestration multi-agents, bien que la mise en œuvre varie (voir les sections individuelles des plateformes ci-dessus).
Utilisation d'outils et intégrations externes : Les agents de chaque plateforme peuvent appeler des APIs externes, des bases de données et des applications métier. Le nombre de connecteurs prédéfinis varie d'environ 50 (Dify) à 2 000+ (Relevance IA), toutes les plateformes prenant en charge des définitions d'API personnalisées.
Mémoire persistante et gestion du contexte : La conservation d'informations au sein des sessions (mémoire à court terme) et entre les sessions (mémoire à long terme) est une capacité standard, obtenue via des bases de données vectorielles, des objets de session ou des fenêtres de contexte configurables selon la plateforme.
Surveillance et observabilité : Chaque plateforme expose des journaux, des traces ou des analyses pour inspecter l'exécution des agents, suivre l'utilisation de token et la latence, et identifier les échecs.
Supervision humaine et contrôles d'approbation : Des mécanismes de revue humaine, d'approbation ou de remplacement des actions des agents sont présents sur toutes les plateformes. Les exemples incluent les portes d'approbation par outil de n8n, les primitives d'interruption et de reprise de LangGraph, les contrôles de politique de Bedrock AgentCore, ServiceNow IA Control Tower et l'escalade automatique de Lindy.
Base de connaissances et génération augmentée par récupération (RAG) : L'ancrage des agents dans des connaissances personnalisées via l'indexation et la récupération de documents est une capacité de base dans toute la catégorie. Les implémentations incluent le pipeline RAG de Dify, la base de connaissances de Voiceflow, les bases de connaissances de Bedrock, le moteur RAG de Vertex IA et Search IA de Kore.ai.
Interface de construction d'agents no-code ou low-code : Des interfaces graphiques ou en langage naturel pour la création d'agents sont disponibles sur toutes les plateformes. Les plateformes d'entreprise proposent des studios no-code (Agentforce Builder, Copilot Studio, watsonx Orchestrate), tandis que les frameworks pour développeurs fournissent des outils visuels compagnons (LangGraph Studio, AutoGen Studio, CrewAI Studio).
Citer cette recherche
Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.
@misc{alper2026,
author = {Alper, Şevval},
title = {{Benchmark des plateformes d'agents IA: Claude Managed Agents contre Google Vertex Agent Engine}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/ai-agent-platforms}},
note = {AIMultiple. Consulté le 14 Août 2026}
}
Soyez le premier à commenter
Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.