Benchmark delle piattaforme di agenti IA: Claude Managed Agents vs Google Vertex Agent Engine
Abbiamo confrontato 4 piattaforme di agenti IA su 3 dimensioni: completamento delle attività (10 attività di codifica × 3 esecuzioni), capacità specifiche dell'harness (steering, riconnessione, richiamo di conversazioni lunghe, gestione di file di grandi dimensioni) e costo.
Risultati del benchmark delle piattaforme di agenti IA
Piattaforma | Modello | Tasso di superamento | Tempo totale | Costo | Token |
|---|---|---|---|---|---|
Claude Managed Agents | Claude Sonnet 4.6 | 30/30 (100%) | 1.172s | $2.50 | 93k |
Vertex IA Agent Engine | Gemini 2.5 Pro | 30/30 (100%) | 1.447s | $1.45 | 159k |
OpenAI Responses + CI | GPT-5.4 | 27/30 (90%) | 522s | $1.54 | 113k |
Controllo (self-hosted) | Claude Sonnet 4.6 | 30/30 (100%) | 794s | $1.96 | 464k |
Claude Managed Agents e Vertex IA Agent Engine raggiungono entrambi tassi di superamento del 100% nella suite di attività, con Vertex vincente sul costo ($1.45 vs $2.50). Per le funzionalità specifiche dell'harness disponibili solo nelle piattaforme gestite come lo steering mid-stream, disconnessione/riconnessione, compattazione di conversazioni lunghe, Claude Managed Agents è il più capace, ma Vertex Agent Engine lo eguaglia nei test portatili (compattazione, gestione di file di grandi dimensioni).
Risultati principali dal benchmark delle attività
- Claude MA e Vertex AE hanno pareggiato sul tasso di superamento a 30/30 (100%). Entrambi gestiscono tutti i tipi di attività, incluse le attività di rete (06, 10) che hanno fatto inciampare OpenAI.
- I fallimenti di OpenAI derivano dalla sua politica sandbox. Le attività 06 (client API REST) e 10 (download concorrente) richiedono entrambe HTTP in uscita. La sandbox di Code Interpreter lo limita, ed entrambe sono fallite rispettivamente 2/3 e 1/3. Abbiamo visto che GPT-5.4 è in grado di scrivere il codice, ma la sandbox non lo esegue in modo affidabile.
- Vertex AE è il più economico a un totale di $1.45. Claude MA è il più costoso a $2.50. È il 72% più caro di Vertex sulla stessa suite di attività a parità di tasso di superamento.
- Vertex AE è il più lento. L'orchestrazione ADK gestita aggiunge overhead.
Capacità specifiche dell'harness
Due piattaforme vengono confrontate testa a testa su funzionalità che esistono solo perché esiste un harness gestito.
Vedi la metodologia del benchmark qui sotto.
Piattaforme di agenti IA
Claude Managed Agents
Anthropic’s Claude Managed Agents offre un runtime per agenti ospitato che combina sessioni stateful, esecuzione integrata di strumenti, streaming basato su eventi e compattazione automatica per carichi di lavoro autonomi di lunga durata. La piattaforma si differenzia per primitive uniche non disponibili in offerte comparabili, come l'iniezione di eventi utente mid-stream per lo steering in corso, flussi SSE ripristinabili per disconnessione/riconnessione e l'integrazione nativa di server MCP. Tutte sono fornite come servizio completamente gestito senza infrastruttura da provisioning per gli sviluppatori.1
Il prezzo è di $0.08 per ora di sessione oltre ai costi standard dei token dell'Claude API.
Pro:
- Le sessioni stateful con iniezione di eventi mid-stream consentono ai nuovi messaggi utente di guidare gli agenti durante l'esecuzione in corso.
- Supporto a disconnessione e riconnessione tramite flussi SSE persistenti; le sessioni continuano l'esecuzione lato server durante le interruzioni di rete e i client possono riprendere il consumo degli eventi alla riconnessione.
- Il set di strumenti integrato dell'agente include bash, operazioni sui file (read, write, edit, glob, grep) e strumenti web (web_fetch, web_search) accessibili tramite un unico parametro di configurazione, eliminando la necessità di cablare strumenti personalizzati.
- Integrazione nativa di server MCP (Model Context Protocol) per estensioni di strumenti personalizzate senza modificare il set di strumenti integrato dell'agente.
Contro:
- Attualmente in beta; tutte le richieste richiedono l'header beta managed-agents-2026-04-01, e il comportamento potrebbe variare tra i rilasci.
- Solo Claude, nessuna flessibilità di modello rispetto a piattaforme come AWS Bedrock AgentCore o Northflank che supportano più fornitori di modelli.
Salesforce Agentforce
Salesforce Agentforce si differenzia per l'accesso nativo ai dati CRM tramite Atlas Reasoning Engine e agenti predefiniti per flussi di lavoro di vendita, assistenza, marketing e commercio.2
La piattaforma si integra con MuleSoft Agent Fabric per l'orchestrazione tra sistemi e offre Agentforce 360 per partnership AWS.
Agentforce serve organizzazioni che richiedono flussi di lavoro autonomi rivolti al cliente integrati direttamente nell'infrastruttura Salesforce Cloud esistente.
Pro:
– L'accesso nativo ai dati CRM tramite Atlas Reasoning Engine consente azioni degli agenti contestuali.
– Agenti predefiniti disponibili per vendite, assistenza, marketing e commercio riducono il time-to-deployment.
– Autorizzato FedRAMP su Salesforce Government Cloud per settori regolamentati.
– Il piano Foundations gratuito include 200.000 Flex Credits per i test iniziali.
Contro:
– Solo SaaS cloud, senza opzione di deployment on-premise disponibile.
– Agnosticità del modello limitata; utilizza per impostazione predefinita modelli gestiti da Salesforce con supporto limitato a fornitori esterni.
– Richiede un investimento nell'ecosistema Salesforce esistente per realizzare il valore completo.
Microsoft Copilot Studio
Pro:
– Incluso con le licenze Microsoft 365 Copilot per l'uso interno degli agenti senza costi aggiuntivi.3
– Agenti vocali in tempo reale e supporto di telefonia IVR per scenari di assistenza clienti.
– Autorizzato FedRAMP tramite Azure Government per le implementazioni nel settore pubblico.
– Supporta modelli OpenAI, Anthropic e framework open-source all'interno di un unico ambiente di build.
Contro:
– Funzionalità limitate al di fuori dell'ecosistema Microsoft; richiede un impegno Azure o M365 per le funzionalità complete.
– Nessun livello gratuito autonomo permanente; richiede un abbonamento M365 Copilot esistente per l'uso incluso.
– Modello vocale IA in tempo reale ospitato solo in Nord America a partire da aprile 2026.
Copilot Studio è più conveniente per le organizzazioni che già utilizzano Microsoft 365, Teams e Azure, offrendo automazione rivolta ai dipendenti che eredita le configurazioni esistenti di identità, sicurezza e conformità.
Google Agentspace e Vertex IA Agent Builder
L'offerta duplice di Google combina Agentspace per la gestione della conoscenza aziendale e Vertex IA Agent Builder per lo sviluppo low-code, differenziata da integrazione del modello Gemini, contesto cross-prodotto di Google Workspace e supporto di input multimodali per testo, voce e immagini.4
La piattaforma offre $300 in crediti gratuito per i nuovi utenti e prezzi pay-as-you-go per Vertex IA Agent Engine.
Pro:
– $300 di credito gratuito per i nuovi utenti consentono una prototipazione estesa senza investimento iniziale.
– Deployment on-premise supportato tramite Google Distributed Cloud per ambienti regolamentati.
– Autorizzato FedRAMP tramite Google Cloud.
– Google ADK (Agent Development Kit) supporta lo sviluppo code-first in Python, TypeScript, Go e Java.
Contro:
– La progettazione Gemini-first limita la flessibilità del modello rispetto a piattaforme completamente agnostiche.
AWS Bedrock Agents e AgentCore
AWS Bedrock Agents e la più recente piattaforma AgentCore forniscono gestione serverless dell'infrastruttura per agenti su scala aziendale, lanciati al re:Invent 2025.5
I differenziatori includono prezzi pay-as-you-go a $0.0895 per vCPU-ora per il runtime AgentCore, opzioni di throughput con provisioning e Mem0 come provider di memoria esclusivo.
Pro:
– Autorizzato FedRAMP High su AWS GovCloud per carichi di lavoro sensibili.
– Lo streaming bidirezionale supporta agenti vocali con parlato simultaneo di utente e agente.
– Livello Free disponibile per i nuovi clienti AWS per la sperimentazione iniziale.
– Accesso a modelli di Anthropic, Amazon, Meta, Mistral e AI21 attraverso il catalogo Bedrock.
Contro:
– Nessun template di agente predefinito specifico per dominio; richiede la costruzione da zero tramite SDK.
– Nessuna opzione di deployment on-premise; funziona esclusivamente su infrastruttura AWS.
– La costruzione di agenti richiede una codifica significativa di API/SDK rispetto ai builder visuali.
AWS Bedrock serve aziende che richiedono infrastruttura per agenti scalabile e serverless con profonda integrazione nell'ecosistema AWS, offrendo efficienza dei costi tramite fatturazione granulare basata sull'uso.
IBM watsonx Orchestrate
IBM watsonx Orchestrate si rivolge alle aziende regolamentate con oltre 150 agenti predefiniti specifici per dominio per HR, procurement, vendite e finanza, insieme a Skills Studio per la creazione di competenze personalizzate.6
La piattaforma offre flessibilità di deployment in cloud ibrido e on-premise tramite IBM Cloud Pak for Data e Software Hub.
Pro:
– Installazione on-premise supportata tramite IBM Cloud Pak for Data per requisiti di residenza dei dati.
– Oltre 150 agenti e strumenti predefiniti di IBM e partner, con oltre 80 integrazioni di applicazioni aziendali tra cui SAP, Salesforce e Workday.
– Autorizzazione FedRAMP ampliata ad aprile 2026 per le implementazioni federali.
– Vera agnosticità del modello a supporto di più provider LLM senza vendor lock-in.
Contro:
– Nessun livello gratuito permanente; richiede un abbonamento Essentials o Standard a pagamento per l'uso continuativo.
– Le funzionalità vocali e di telefonia sono disponibili all'interno di watsonx Orchestrate tramite configurazione vocale nativa in ADK e integrazioni con provider come Deepgram e ElevenLabs, sebbene la telefonia avanzata possa richiedere configurazioni aggiuntive.
– Struttura di prezzi complessa che richiede preventivi personalizzati per le funzionalità enterprise.
ServiceNow IA Agents
Gli agenti IA di ServiceNow si integrano direttamente nella Now Platform, differenziandosi per l'integrazione nativa con i flussi di lavoro IT, HR e assistenza clienti piuttosto che operare come piattaforma autonoma.
La piattaforma include IA Control Tower per la governance, flussi di lavoro agentic predefiniti per ITSM e HRSD e un Context Engine che collega la cronologia delle policy alle azioni degli agenti.7
Pro:
– Eredita governance, regole SLA e flussi di lavoro di approvazione esistenti della Now Platform.
– Gli agenti IA Voice supportano Genesys Cloud, Twilio e 3CLogic come provider CCaaS.
– Gli agenti IA Web apprendono dalle dimostrazioni umane per automatizzare le attività basate su browser.
Contro:
– Nessun livello gratuito permanente; i nuovi clienti ricevono solo 100 chiamate Build Agent gratuito.
– L'autorizzazione FedRAMP High per IA Agents, IA Agent Orchestrator e IA Agent Studio è stata confermata per i clienti Government Community Cloud (GCC) a partire da marzo 2026.
– Valore limitato per le organizzazioni che non utilizzano già ServiceNow per la gestione dei servizi IT o HR.
Kore.ai
Kore.ai si concentra sull'IA conversazionale aziendale con oltre 300 agenti predefiniti, oltre 250 integrazioni aziendali e un'architettura agnostica rispetto al modello che supporta deployment cloud e on-premise.
La piattaforma serve sei settori verticali tra cui banking, sanità e retail.8
Pro:
– Infrastruttura vocale nativa che offre interazioni vocali globali a bassa latenza.
– Deployment flessibile con opzioni on-premise e cloud privato.
– Supporto di più provider LLM.
Contro:
– Nessun livello gratuito permanente; offre solo $500 in crediti una tantum per i test iniziali.
LangGraph
Pro:
– La licenza open-source MIT consente uso commerciale e modifiche senza restrizioni.
– Il controllo deterministico del flusso di lavoro tramite architettura a grafo garantisce percorsi di esecuzione riproducibili.
– L'integrazione di osservabilità LangSmith fornisce monitoraggio e tracing in produzione.
Contro:
– Nessun builder visuale no-code; richiede codice Python o JavaScript per definire i grafi degli agenti.
– Nessuna integrazione nativa voce o telefonia; richiede codifica personalizzata per i canali vocali.
– Curva di apprendimento ripida per team non familiari con i paradigmi di programmazione a grafo.
LangGraph è adatto ai team di ingegneria che costruiscono agenti di livello produttivo che richiedono logica condizionale complessa, recupero dagli errori e verificabilità dei singoli passaggi di esecuzione.
CrewAI
Pro:
– L'astrazione basata sui ruoli rispecchia le strutture dei team umani per un coordinamento intuitivo degli agenti.
– Core open-source gratuito senza costi di licenza per deployment self-hosted.
– Editor visuale e copilota IA disponibili nel livello gratuito per i membri del team non tecnici.
Contro:
– Nessun marketplace di template ufficiale mantenuto dal vendor; si basa sui contributi della community.
– L'approccio code-first richiede conoscenza di Python per la creazione di agenti.
– Il prezzo del piano Enterprise è disponibile solo su richiesta, il che può creare incertezza di budget per i piccoli team rispetto ad altre opzioni open-source.
CrewAI consente la prototipazione rapida di pipeline di agenti basate sui ruoli, particolarmente adatta all'elaborazione di documenti, ai flussi di lavoro di ricerca e alle attività di generazione di contenuti in più passaggi.
n8n
n8n opera sotto una licenza fair-code (Sustainable Use License), offrendo oltre 400 connettori app nativi con nodi IA visuali e infrastruttura self-hosted.
Pro:
– La Community Edition self-hosted include SSO SAML, LDAP, RBAC e archivi segreti crittografati senza costi.
– Supporto nativo per LangChain e LlamaIndex all'interno di flussi di lavoro visuali.
– L'editor di flussi di lavoro visuale consente automazioni complesse senza codifica.
Contro:
– La licenza fair-code richiede una licenza a pagamento per l'hosting commerciale o per prodotti SaaS.
– Nessun nodo nativo voce o telefonia; richiede integrazione API esterna per la voce.
– Nessuna autorizzazione FedRAMP confermata.
n8n collega l'automazione tradizionale dei flussi di lavoro e gli agenti IA, servendo analisti di business tecnici e team DevOps che richiedono deployment self-hosted per la residenza dei dati mantenendo al contempo capacità di costruzione visuale.
Dify
Dify è una piattaforma LLMOps open-source.
La piattaforma supporta pipeline RAG, strumenti di prompt engineering e architettura agnostica rispetto al modello.
Pro:
– La Community Edition self-hosted è permanentemente gratuito con controllo completo dei dati tramite deployment Docker.
– Il builder di flussi di lavoro visuale consente la creazione di agenti complessi senza codifica.
– Supporta centinaia di LLM proprietari e open-source da decine di provider di inference.
Contro:
– Il supporto vocale richiede plugin del marketplace come Agora o Tencent RTC; nessuna telefonia PSTN nativa.
– Nessuna autorizzazione FedRAMP.
– Il piano Cloud Team a $159 al mese può essere costoso per i piccoli team.
Dify è adatto a team di prodotto e operations che richiedono agenti consapevoli dei documenti con forti capacità RAG, in particolare quelli che danno priorità al controllo dei dati tramite self-hosting.
Voiceflow
Voiceflow si differenzia come l'unica piattaforma principale che tratta la progettazione di agenti voice-first come cittadina di prima classe piuttosto che come componente aggiuntivo, con una canvas di design appositamente costruita per agenti vocali e chat con latenza inferiore a 500ms.
La piattaforma è specializzata nell'automazione dei ticket di assistenza clienti e nei sistemi IVR.
Pro:
– Canali voce e telefonia nativi con supporto IVR e latenza inferiore a 500ms.
– Capacità di estrazione di entità per le query della knowledge base.
– Il piano Free include 2 agenti e 100 token IA mensili senza scadenza.
– Canvas visuale progettata specificamente per flussi di lavoro di IA conversazionale.
Contro:
– Il deployment on-premise è disponibile solo tramite accordi enterprise personalizzati.
Voiceflow serve team CX e di supporto che costruiscono agenti conversazionali rivolti al cliente che richiedono il deployment su canali voce, chat e messaggistica da un'unica interfaccia di progettazione.
Relevance IA
Relevance IA offre flessibilità bring-your-own-LLM (BYOLLM) con un modello di fatturazione basato sulle azioni, consentendo ai team non tecnici di costruire team multi-agente tramite descrizioni in linguaggio naturale.
Pro:
– Il livello Free include 100 crediti al giorno senza scadenza.
– Oltre 2.000 integrazioni tra cui HubSpot, Salesforce, Slack e Gmail.
– Vera agnosticità del modello a supporto di più provider LLM.
Contro:
– Nessuna opzione di self-hosting o deployment on-premise; SaaS solo cloud.
– Nessuna autorizzazione FedRAMP per i settori regolamentati.
– Le funzionalità vocali richiedono l'integrazione con Vapi o Twilio piuttosto che la telefonia nativa.
Lindy IA
Lindy IA fornisce varie integrazioni tramite Pipedream, template di agenti predefiniti per il triage email e la pianificazione e funzionalità di agente per chiamate telefoniche tramite la funzione vocale Gaia.9
La piattaforma utilizza un modello di esecuzione basato su crediti con un livello gratuito disponibile.
Pro:
– Il livello Free include 400 crediti al mese e una knowledge base da 1 milione di caratteri.
– Vera agnosticità del modello e ampia libreria di integrazioni.
Contro:
– Il deployment on-premise è disponibile solo tramite accordi enterprise personalizzati per settori regolamentati.
Ideale per singoli utenti business, fondatori e team operativi che richiedono una rapida automazione dei flussi di lavoro email, calendario e CRM senza risorse di ingegneria.
Metodologia
Cosa offre davvero una piattaforma di agenti IA gestita rispetto ai suoi concorrenti e rispetto all'alternativa di costruire il proprio harness per agenti? Lo spazio degli strumenti IA ha qui un punto cieco persistente. I prodotti “agente gestito” vengono regolarmente confrontati utilizzando le stesse scorecard di completamento delle attività usate per i modelli linguistici grezzi, il che confonde due cose molto diverse: la capacità del modello di generare codice corretto e la capacità dell'harness di eseguire quel codice in modo affidabile in un runtime gestito con stato, strumenti e isolamento. Abbiamo progettato questo benchmark per separare quei segnali.
Cos'è una piattaforma di agenti gestita?
Stiamo confrontando una categoria specifica: runtime ospitati che raggruppano inferenza LLM, orchestrazione di agenti ed esecuzione di codice in sandbox in un unico servizio gestito. Questo è distinto da (1) LLM inference API grezze, (2) framework di orchestrazione di agenti che ospiti tu stesso e (3) sandbox di calcolo da abbinare al tuo modello. Le quattro piattaforme in test assumono ciascuna una forma leggermente diversa di questo pacchetto:
- Claude Managed Agents (Anthropic): harness completamente gestito. Definizioni di agenti, sessioni, streaming basato su eventi, compattazione ed esecuzione di strumenti sono tutti lato server. Uno dei due veri concorrenti in questa categoria.
- Vertex IA Agent Engine (Google): harness completamente gestito. Distribuisci un agente definito con ADK su un runtime gestito; il deployment ospita lo stato dell'agente e l'esecuzione degli strumenti. Accessibile tramite l'SDK vertexai.agent_engines.
- OpenAI Responses API con Code Interpreter: categoria adiacente. API di inference con uno strumento sandbox Python integrato, ma nessuno stato di sessione persistente multi-turno o steering mid-stream.
- Controllo: Claude Messages API con un loop di strumenti locale: incluso come baseline. Stesso modello di Claude MA (claude-sonnet-4-6), ma implementiamo il loop dell'agente localmente in ~150 righe di Python. Gli strumenti (bash, write, read, edit) vengono eseguiti in una tempdir per attività sulla macchina del benchmark. Questo isola ciò che l'harness gestito contribuisce oltre a “modello più loop di strumenti”. L'esecuzione dell'API Messages con un loop di agenti locale produce un confronto in cui il modello è identico ma l'harness è assente. Qualsiasi delta tra Claude MA e il controllo è interamente attribuibile all'harness, non alla capacità del modello.
La suite di attività
Dieci attività di codifica che coprono tre livelli di difficoltà. Ogni attività ha un prompt fisso che specifica il deliverable e uno script di verifica che codifica criteri deterministici di superamento/fallimento. Ogni attività viene eseguita tre volte per piattaforma per misurare la varianza.
Stress test specifici dell'harness
La suite di attività misura la correttezza end-to-end. Non può misurare capacità che esistono solo grazie a un harness gestito: persistenza di sessioni stateful, steering mid-stream, ripresa della connessione, compattazione automatica del contesto e gestione gestita degli artefatti del filesystem. Per queste abbiamo progettato due suite di test aggiuntive.
Suite A: Steering & Interruzione
Tre test che esercitano primitive specifiche dell'harness.
A1 avvia un agente su un'attività di codifica, poi inietta un nuovo evento utente tramite POST /events dopo 10 secondi modificando i requisiti e verifica, ispezionando il filesystem del container, che l'artefatto finale rifletta il nuovo requisito piuttosto che quello originale.
A2 apre un flusso SSE, interrompe la connessione dopo quattro eventi, si riconnette e verifica che la sessione raggiunga ancora status_idle.
A3 invia un prompt deliberatamente contraddittorio e misura se l'agente chiede chiarimenti o sceglie silenziosamente un'interpretazione.
Solo A3 è portabile tra le piattaforme. L'iniezione di eventi mid-stream di A1 non ha un equivalente diretto su OpenAI Responses (singola richiesta/risposta) o su Vertex Agent Engine (il modello di sessione non dispone di iniezione di messaggi in corso). La disconnessione/riconnessione di A2 non ha analogamente equivalenti altrove. Questi sono genuini vantaggi strutturali del modello di sessione guidato dagli eventi di Claude MA, non confrontabili sulle alternative. Abbiamo eseguito A1 e A2 solo su Claude MA e A3 su entrambi Claude MA e Vertex Agent Engine.
Suite B: Compattazione & Contesto
Due test che esercitano funzionalità di contesto gestito.
B1 inserisce una stringa canary unica (un token derivato da UUID) nel primo turno di una sessione, esegue 23 turni di riempimento di piccole attività di codifica non correlate che producono ciascuna chiamate e risultati strumento, quindi chiede all'agente di richiamare il canary dalla memoria al 25° turno senza consentire la ricerca nei file. Il richiamo riuscito dopo 23 turni di riempimento è la prova che l'harness preserva il contesto iniziale qualunque sia la politica di compattazione utilizzata.
B2 chiede all'agente di generare un file di testo di 50.000 righe con un marcatore nascosto, quindi di rispondere a una domanda che richiede di trovare il marcatore. Questo verifica se l'agente è in grado di ragionare su artefatti più grandi della sua finestra di contesto senza tentare di leggere l'intero file.
Sia B1 sia B2 sono stati eseguiti su entrambi Claude MA e Vertex Agent Engine, utilizzando gli stessi prompt e protocolli.
LLM-as-judge per il punteggio comportamentale
Per la Suite A3 (contraddizioni), il superamento/fallimento non è un controllo deterministico; abbiamo trattato “l'agente ha chiesto chiarimenti?” come un giudizio qualitativo sul comportamento conversazionale. Utilizziamo un design LLM-as-judge con tre presidi metodologici:
- Il modello giudice è diverso dal modello testato: Claude Opus 4.6 è il giudice per evitare bias di autovalutazione.
- Rubrica strutturata con 4 dimensioni booleane: Il giudice restituisce un punteggio JSON: recognized_contradiction, asked_for_clarification, proceeded_with_assumption, documented_assumption e un ragionamento di un paragrafo.
- Verifica di coerenza su 3 esecuzioni: Ogni giudizio viene eseguito 3 volte. Riportiamo il consenso di maggioranza per dimensione e il tasso di accordo per dimensione. Se l'accordo di qualsiasi dimensione scende sotto il 67%, il giudice viene segnalato come incoerente su quella dimensione e il risultato è trattato come a bassa confidenza.
Un'euristica basata su parole chiave viene eseguita in parallelo come controllo di sanità. Le divergenze tra l'euristica e il giudice vengono registrate per la revisione manuale.
Punteggio
Per ogni esecuzione di attività su ogni piattaforma:
- Superato/fallito
- Tempo totale: secondi trascorsi dall'invio del prompt alla ricezione dell'evento terminale (status_idle per Claude MA, completamento dell'attività per Vertex AE, completamento della risposta per OpenAI, uscita dal loop di strumenti per il controllo).
- Numero di chiamate strumento: invocazioni distinte di strumenti. Utile come impronta comportamentale; meno utile come metrica di efficienza perché la granularità degli strumenti differisce notevolmente tra le piattaforme.
- Uso dei token: analizzato dagli eventi model_request_end su Claude MA, usage_metadata su Vertex AE, response.usage su OpenAI, accumulo per turno nel loop di messaggi del controllo. Suddiviso in input, output, lettura cache e creazione cache.
- Costo in USD: calcolato dall'uso dei token rispetto ai prezzi pubblicati: claude-sonnet-4-6 a $3/$15/$0.30/$3.75 per milione; gpt-5.4 a $2.50/$15/$0.25; gemini-2.5-pro a $1.25/$10/$0.13. Le tariffe infrastrutturali specifiche della piattaforma sono aggiunte: $0.08/ora di sessione di Claude MA riproporzionata in base al tempo totale, $0.03/container di OpenAI quando si verifica una chiamata strumento, tariffa di hosting di Vertex AE di circa $0.35/ora riproporzionata in base all'uptime del deployment.
I risultati delle Suite A e B catturano inoltre metriche a livello di sessione (turni, richiamo del canary, consenso e accordo del giudice).
Considerazioni sull'equità e limitazioni note
Diverse asimmetrie nella configurazione influenzano il modo in cui i numeri dovrebbero essere letti; le esplicitiamo chiaramente:
Il controllo esegue gli strumenti sulla macchina del benchmark senza round-trip cloud. Questo gli conferisce un vantaggio ingiusto in termini di tempo totale che non riflette tanto la velocità dell'agente quanto l'assenza di rete. Quando osserviamo il controllo completare le attività circa il 25% più velocemente di Claude MA sullo stesso modello, circa la metà di quel divario è asimmetria di round-trip.
Code Interpreter di OpenAI opera in una sandbox con restrizioni di rete. Le attività 06 (client API REST) e 10 (download concorrente) richiedono HTTP in uscita, che CI consente solo in modo intermittente. I fallimenti di OpenAI su quelle attività sono fallimenti di policy della sandbox, non di capacità del modello. GPT-5.4 può scrivere codice HTTP concorrente corretto; la piattaforma non è sempre in grado di eseguirlo. I lettori non devono interpretare “OpenAI fallisce nelle attività di rete” come un'affermazione sul modello.
Gemini 3.1-pro-preview è limitato da allowlist di anteprima a livello di progetto. Abbiamo tentato di confrontare questo modello sia sull'API diretta di Vertex sia su Vertex Agent Engine. Le chiamate dirette all'API hanno restituito 404; i deployment di Agent Engine con il modello sono riusciti al momento del deploy, ma le chiamate di inference hanno restituito zero eventi senza errori. Siamo ripiegati su gemini-2.5-pro.
Una suite di attività di refactoring multi-ora, debugging in codebase sconosciuti o flussi di lavoro autonomi di lunga durata solleciterebbero gli harness in modo diverso e probabilmente separerebbero più chiaramente le opzioni di primo livello.
Non abbiamo misurato la latenza di provisioning, il comportamento a freddo, le prestazioni di sessioni concorrenti o i limiti di rate limit. Questi sono importanti per carichi di lavoro di produzione ad alto throughput ma erano fuori dall'ambito di questo round.
Funzionalità comuni a tutte le piattaforme di agenti IA
Ogni piattaforma in questo confronto fornisce capacità di base che definiscono la categoria degli agenti IA. Queste funzionalità comuni stabiliscono il prodotto minimo vitale per l'automazione agentica, mentre le funzionalità differenzianti determinano la scelta della piattaforma.
Orchestrazione multi-agente: Tutte le piattaforme supportano l'orchestrazione multi-agente, sebbene l'implementazione vari (vedi le sezioni delle singole piattaforme sopra).
Uso di strumenti e integrazioni esterne: Gli agenti su ogni piattaforma possono chiamare API esterne, database e applicazioni aziendali. I conteggi dei connettori predefiniti vanno da circa 50 (Dify) a oltre 2.000 (Relevance IA), con tutte le piattaforme che supportano definizioni di API personalizzate.
Memoria persistente e gestione del contesto: Conservare informazioni all'interno delle sessioni (memoria a breve termine) e tra le sessioni (memoria a lungo termine) è una capacità standard, ottenuta tramite database vettoriali, oggetti sessione o finestre di contesto configurabili a seconda della piattaforma.
Monitoraggio e osservabilità: Ogni piattaforma espone log, tracce o analisi per ispezionare l'esecuzione degli agenti, monitorare l'uso dei token e la latenza e identificare i guasti.
Controllo umano e approvazione: Meccanismi di revisione umana, approvazione o override delle azioni degli agenti sono presenti su ogni piattaforma. Gli esempi includono i cancelli di approvazione per strumento di n8n, le primitive interrupt-and-resume di LangGraph, i controlli di policy di Bedrock AgentCore, IA Control Tower di ServiceNow e l'escalation automatica di Lindy.
Knowledge base e generazione aumentata da recupero (RAG): Grounding degli agenti in conoscenza personalizzata tramite indicizzazione e recupero dei documenti è una capacità di base in tutta la categoria. Le implementazioni includono la pipeline RAG di Dify, la Knowledge Base di Voiceflow, le Knowledge Bases di Bedrock, il RAG Engine di Vertex IA e Kore.ai Search IA.
Interfaccia builder di agenti no-code o low-code: Interfacce grafiche o in linguaggio naturale per la creazione di agenti sono disponibili su ogni piattaforma. Le piattaforme enterprise offrono studi no-code (Agentforce Builder, Copilot Studio, watsonx Orchestrate), mentre i framework per sviluppatori forniscono strumenti visuali complementari (LangGraph Studio, AutoGen Studio, CrewAI Studio).
Cita questa ricerca
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{alper2026,
author = {Alper, Şevval},
title = {{Benchmark delle piattaforme di agenti IA: Claude Managed Agents vs Google Vertex Agent Engine}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/ai-agent-platforms}},
note = {AIMultiple. Consultato il 14 Agosto 2026}
}Risultati e timestamp di 0 punti dati. Scarica i dati utilizzati in questo articolo come file ZIP contenente 0 file CSV e un README.
Sii il primo a commentare
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.