Servicios
Contáctanos

Benchmark de plataformas de agentes de IA: Claude Managed Agents vs Google Vertex Agent Engine

Şevval Alper
Şevval Alper
actualizado el 14 de ago. de 2026

Evaluamos 4 plataformas de agentes de IA en 3 dimensiones: finalización de tareas (10 tareas de programación × 3 ejecuciones), capacidades específicas del harness (dirección, reconexión, recuperación en conversaciones largas, manejo de archivos grandes) y costo.

Resultados del benchmark de plataformas de agentes de IA

Plataforma
Modelo
Tasa de aprobación
Tiempo transcurrido
Costo
Token
Claude Managed Agents
Claude Sonnet 4.6
30/30 (100 %)
1.172s
$2.50
93k
Vertex IA Agent Engine
Gemini 2.5 Pro
30/30 (100 %)
1.447s
$1.45
159k
OpenAI Responses + CI
GPT-5.4
27/30 (90 %)
522s
$1.54
113k
Control (autohospedado)
Claude Sonnet 4.6
30/30 (100 %)
794s
$1.96
464k

Claude Managed Agents y Vertex IA Agent Engine logran ambos tasas de aprobación del 100 % en el conjunto de tareas, y Vertex gana en costo ($1.45 frente a $2.50). En las funcionalidades específicas del harness solo disponibles en plataformas gestionadas, como la dirección a mitad de flujo, la desconexión/reconexión y la compactación de conversaciones largas, Claude Managed Agents es el más capaz, pero Vertex Agent Engine lo iguala en las pruebas portátiles (compactación, manejo de archivos grandes).

Hallazgos clave del benchmark de tareas

  1. Claude MA y Vertex AE empataron en tasa de aprobación con 30/30 (100 %). Ambos manejan todos los tipos de tareas, incluidas las tareas de red (06, 10) que hicieron fallar a OpenAI.
  2. Los fracasos de OpenAI derivan de su política de sandbox. Las tareas 06 (cliente REST API) y 10 (descargador concurrente) requieren ambas HTTP saliente. El sandbox de Code Interpreter lo restringe, y ambas fallaron 2/3 y 1/3, respectivamente. Observamos que GPT-5.4 puede escribir el código, pero el sandbox no lo ejecuta de forma fiable.
  3. Vertex AE es la más barata con $1.45 en total. Claude MA es el más caro con $2.50. Es un 72 % más que Vertex en el mismo conjunto de tareas con la misma tasa de aprobación.
  4. Vertex AE es el más lento. La orquestación gestionada del ADK añade sobrecarga.

Capacidades específicas del harness

Se comparan dos plataformas cara a cara en funcionalidades que solo existen porque hay un harness gestionado.

Consulte la metodología del benchmark a continuación.

Plataformas de agentes de IA

Claude Managed Agents

Anthropic ofrece Claude Managed Agents, un runtime de agente alojado que combina sesiones con estado, ejecución integrada de herramientas, streaming basado en eventos y compactación automática para cargas de trabajo autónomas de larga duración. La plataforma se diferencia por primitivas únicas no disponibles en ofertas comparables, como la inyección de eventos de usuario a mitad de flujo para dirigir el agente en ejecución, flujos SSE reanudables para desconexión/reconexión e integración nativa del servidor MCP. Todo se entrega como un servicio totalmente gestionado sin infraestructura que los desarrolladores deban aprovisionar.1

El precio es de $0.08 por hora de sesión, además de los costes estándar de tokens de Claude API.

Ventajas:

  • Las sesiones con estado y la inyección de eventos a mitad de flujo permiten que nuevos mensajes de usuario dirijan a los agentes durante la ejecución en curso.
  • Soporte de desconexión y reconexión mediante flujos SSE persistentes; las sesiones continúan ejecutándose del lado del servidor durante interrupciones de red y los clientes pueden reanudar el consumo de eventos al reconectar.
  • El conjunto de herramientas integrado del agente incluye bash, operaciones de archivos (read, write, edit, glob, grep) y herramientas web (web_fetch, web_search), accesibles mediante un único parámetro de configuración, eliminando el cableado de herramientas personalizadas.
  • Integración nativa del servidor MCP (Model Context Protocol) para extensiones de herramientas personalizadas sin modificar el conjunto de herramientas integrado del agente.

Desventajas:

  • Actualmente en beta; todas las solicitudes requieren el encabezado beta managed-agents-2026-04-01, y el comportamiento puede ajustarse entre versiones.
  • Exclusivo de Claude, sin flexibilidad de modelos en comparación con plataformas como AWS Bedrock AgentCore o Northflank que admiten múltiples proveedores de modelos.

Salesforce Agentforce

Salesforce Agentforce se diferencia por el acceso nativo a datos de CRM a través del Atlas Reasoning Engine y por agentes predefinidos para flujos de trabajo de ventas, servicio, marketing y comercio.2

La plataforma se integra con MuleSoft Agent Fabric para la orquestación entre sistemas y ofrece Agentforce 360 para alianzas con AWS.

Agentforce atiende a organizaciones que requieren flujos de trabajo autónomos orientados al cliente integrados directamente en su infraestructura existente de Salesforce Cloud.

Ventajas:

– El acceso nativo a datos de CRM mediante Atlas Reasoning Engine permite acciones de agente conscientes del contexto.

– Los agentes predefinidos disponibles para ventas, servicio, marketing y comercio reducen el tiempo de implementación.

– Autorizado por FedRAMP en Salesforce Government Cloud para industrias reguladas.

– El plan gratis de Foundations incluye 200.000 Flex Credits para pruebas iniciales.

Desventajas:

– SaaS solo en la nube sin opción de implementación local disponible.

– Agnosticismo de modelos limitado; usa por defecto modelos gestionados por Salesforce con soporte restringido a proveedores externos.

– Requiere una inversión existente en el ecosistema de Salesforce para obtener todo su valor.

Microsoft Copilot Studio

Ventajas:

– Incluido con las licencias de Copilot de Microsoft 365 para uso interno del agente sin coste adicional.3

– Agentes de voz en tiempo real y soporte de telefonía IVR para escenarios de atención al cliente.

– Autorizado por FedRAMP a través de Azure Government para implementaciones del sector público.

– Admite modelos de OpenAI y Anthropic, y frameworks de código abierto dentro de un único entorno de compilación.

Desventajas:

– Funcionalidad limitada fuera del ecosistema de Microsoft; requiere compromiso con Azure o M365 para obtener todas las capacidades.

– No hay un plan gratis permanente e independiente; requiere suscripción existente a M365 Copilot para el uso incluido.

– El modelo de IA de voz en tiempo real se aloja solo en Norteamérica a partir de abril de 2026.

Copilot Studio es más rentable para organizaciones que ya usan Microsoft 365, Teams y Azure, ya que ofrece automatización orientada a empleados que hereda las configuraciones existentes de identidad, seguridad y cumplimiento.

Google Agentspace y Vertex IA Agent Builder

La doble oferta de Google combina Agentspace para la gestión del conocimiento empresarial y Vertex IA Agent Builder para el desarrollo con poco código, diferenciada por la integración del modelo Gemini, el contexto entre productos de Google Workspace y el soporte de entrada multimodal para texto, voz e imágenes.4

La plataforma ofrece $300 en créditos gratis para nuevos usuarios y precios de pago por uso para Vertex IA Agent Engine.

Ventajas:

– Los $300 de crédito gratis para nuevos usuarios permiten crear prototipos extensos sin inversión inicial.

– Implementación local compatible a través de Google Distributed Cloud para entornos regulados.

– Autorizado por FedRAMP a través de Google Cloud.

– Google ADK (Agent Development Kit) admite el desarrollo basado en código en Python, TypeScript, Go y Java.

Desventajas:

– El diseño centrado en Gemini limita la flexibilidad de modelos en comparación con plataformas totalmente agnósticas.

AWS Bedrock Agents y AgentCore

AWS Bedrock Agents y la plataforma más reciente AgentCore proporcionan gestión de infraestructura sin servidor para agentes a escala empresarial, lanzados en re:Invent 2025.5

Los diferenciadores incluyen precios de pago por uso de $0.0895 por vCPU-hora para el runtime de AgentCore, opciones de rendimiento aprovisionado y Mem0 como proveedor exclusivo de memoria.

Ventajas:

– Autorizado FedRAMP High en AWS GovCloud para cargas de trabajo sensibles.

– El streaming bidireccional admite agentes de voz con habla simultánea del usuario y del agente.

– Hay un plan gratuito disponible para nuevos clientes de AWS para la experimentación inicial.

– Acceso a modelos de Anthropic, Amazon, Meta, Mistral y AI21 a través del catálogo de Bedrock.

Desventajas:

– No hay plantillas de agentes predefinidas para dominios específicos; requiere construir desde cero con el SDK.

– No hay opción de implementación local; se ejecuta exclusivamente en la infraestructura de AWS.

– Crear agentes requiere una codificación significativa de API/SDK en comparación con los creadores visuales.

AWS Bedrock atiende a empresas que requieren infraestructura de agentes escalable y sin servidor con una integración profunda en el ecosistema de AWS, y ofrece eficiencia de costes mediante facturación granular basada en el uso.

IBM watsonx Orchestrate

IBM watsonx Orchestrate se dirige a empresas reguladas con más de 150 agentes predefinidos para dominios específicos de RR. HH., adquisiciones, ventas y finanzas, junto con Skills Studio para crear habilidades personalizadas.6

La plataforma ofrece flexibilidad de implementación en nube híbrida y local a través de IBM Cloud Pak for Data y Software Hub.

Ventajas:

– Instalación local compatible a través de IBM Cloud Pak for Data para requisitos de residencia de datos.

– Más de 150 agentes y herramientas predefinidos de IBM y sus socios, con más de 80 integraciones de aplicaciones empresariales, incluidas SAP, Salesforce y Workday.

– Autorización FedRAMP ampliada en abril de 2026 para implementaciones federales.

– Verdadero agnosticismo de modelos con soporte para múltiples proveedores de LLM sin dependencia de un proveedor.

Desventajas:

– No hay un plan gratis permanente; requiere suscripción de pago Essentials o Standard para uso continuo.

– Las capacidades de voz y telefonía están disponibles en watsonx Orchestrate mediante la configuración de voz nativa en el ADK e integraciones con proveedores como Deepgram y ElevenLabs, aunque la telefonía avanzada puede requerir configuración adicional.

– Estructura de precios compleja que requiere cotizaciones personalizadas para funciones empresariales.

ServiceNow IA Agents

ServiceNow IA Agents se integran directamente en la Now Platform y se diferencian por la integración nativa con flujos de trabajo de TI, RR. HH. y atención al cliente, en lugar de operar como una plataforma independiente.

La plataforma incluye IA Control Tower para la gobernanza, flujos de trabajo agénticos predefinidos para ITSM y HRSD, y un Context Engine que conecta el historial de políticas con las acciones de los agentes.7

Ventajas:

– Hereda la gobernanza existente de Now Platform, las reglas de SLA y los flujos de trabajo de aprobación.

– IA Voice Agents admite Genesys Cloud, Twilio y 3CLogic como proveedores de CCaaS.

– IA Web Agents aprenden de demostraciones humanas para automatizar tareas basadas en navegador.

Desventajas:

– No hay un plan gratis permanente; los nuevos clientes reciben solo 100 llamadas gratis de Build Agent.

– La autorización FedRAMP High para IA Agents, IA Agent Orchestrator y IA Agent Studio se confirmó para los clientes de Government Community Cloud (GCC) a partir de marzo de 2026.

– Valor limitado para organizaciones que aún no utilizan ServiceNow para la gestión de servicios de TI o RR. HH.

Kore.ai

Kore.ai se centra en la IA conversacional empresarial con más de 300 agentes predefinidos, más de 250 integraciones empresariales y una arquitectura agnóstica de modelos compatible con implementaciones en la nube y locales.

La plataforma atiende a seis verticales, incluidos banca, salud y comercio minorista.8

Ventajas:

– Infraestructura de voz nativa que ofrece interacciones de voz globales de baja latencia.

– Implementación flexible, incluidas opciones locales y de nube privada.

– Soporte para múltiples proveedores de LLM.

Desventajas:

– No hay un plan gratis permanente; solo ofrece $500 en créditos únicos para pruebas iniciales.

LangGraph

Ventajas:

– La licencia de código abierto MIT permite el uso comercial y la modificación sin restricciones.

– El control determinista del flujo de trabajo mediante arquitectura de grafos garantiza rutas de ejecución reproducibles.

– La integración de observabilidad de LangSmith proporciona monitorización y trazabilidad en producción.

Desventajas:

– No tiene un creador visual sin código; requiere código Python o JavaScript para definir grafos de agentes.

– No tiene integración nativa de voz o telefonía; requiere codificación personalizada para canales de voz.

– Curva de aprendizaje pronunciada para equipos no familiarizados con paradigmas de programación basados en grafos.

LangGraph es adecuado para equipos de ingeniería que crean agentes de calidad de producción que requieren lógica condicional compleja, recuperación de errores y auditabilidad de los pasos de ejecución individuales.

CrewAI

Ventajas:

– La abstracción basada en roles refleja las estructuras de equipos humanos para una coordinación intuitiva de agentes.

– Núcleo gratuito de código abierto sin tarifas de licencia para implementaciones autohospedadas.

– Editor visual y copiloto de IA disponibles en el plan gratis para miembros no técnicos del equipo.

Desventajas:

– No tiene un mercado de plantillas oficial mantenido por el proveedor; depende de contribuciones de la comunidad.

– El enfoque basado en código requiere conocimientos de Python para la creación de agentes.

– El precio del plan Enterprise solo está disponible bajo solicitud, lo que puede generar incertidumbre presupuestaria para equipos pequeños en comparación con otras opciones de código abierto.

CrewAI permite la creación rápida de prototipos de pipelines de agentes basados en roles, especialmente adecuados para el procesamiento de documentos, flujos de trabajo de investigación y tareas de generación de contenido en varios pasos.

n8n

n8n opera bajo una licencia de fair code (Sustainable Use License) y ofrece más de 400 conectores de aplicaciones nativos con nodos visuales de IA e infraestructura autohospedable.

Ventajas:

– La Community Edition autohospedada incluye SSO SAML, LDAP, RBAC y almacenes de secretos cifrados sin costo.

– Soporte nativo de LangChain y LlamaIndex dentro de flujos de trabajo visuales.

– El editor visual de flujos de trabajo permite automatización compleja sin codificación.

Desventajas:

– La licencia de fair code requiere una licencia de pago para alojamiento comercial o productos SaaS.

– No hay un nodo nativo de voz o telefonía; requiere integración de API externa para voz.

– No se ha confirmado autorización FedRAMP.

n8n une la automatización de flujos de trabajo tradicional y los agentes de IA, y sirve a analistas de negocio técnicos y equipos de DevOps que requieren implementación autohospedada para la residencia de datos, manteniendo capacidades visuales de construcción.

Dify

Dify es una plataforma LLMOps de código abierto.

La plataforma admite pipelines de RAG, herramientas de ingeniería de prompts y una arquitectura agnóstica de modelos.

Ventajas:

– La Community Edition autohospedada es permanentemente gratis con control total de los datos mediante implementación con Docker.

– El creador visual de flujos de trabajo permite crear agentes complejos sin codificación.

– Admite cientos de LLM propietarios y de código abierto de decenas de proveedores de inference.

Desventajas:

– El soporte de voz requiere plugins del marketplace como Agora o Tencent RTC; no hay telefonía PSTN nativa.

– Sin autorización FedRAMP.

– El plan Cloud Team de $159 al mes puede resultar costoso para equipos pequeños.

Dify es adecuado para equipos de producto y operaciones que requieren agentes con comprensión de documentos y sólidas capacidades de RAG, especialmente aquellos que priorizan el control de datos mediante el autohospedaje.

Voiceflow

Voiceflow se diferencia como la única plataforma importante que trata el diseño de agentes con enfoque en la voz como un elemento de primera clase, no como un complemento, con un lienzo de diseño creado específicamente para agentes de voz y chat con latencia inferior a 500ms.

La plataforma se especializa en la automatización de tickets de atención al cliente y sistemas IVR.

Ventajas:

– Canales nativos de voz y telefonía con soporte IVR y latencia inferior a 500ms.

– Capacidades de extracción de entidades para consultas a la base de conocimiento.

– El plan gratuito incluye 2 agentes y 100 tokens de IA mensuales sin caducidad.

– Lienzo visual diseñado específicamente para flujos de trabajo de IA conversacional.

Desventajas:

– La implementación local solo está disponible mediante acuerdos empresariales personalizados.

Voiceflow sirve a equipos de CX y soporte que crean agentes conversacionales orientados al cliente y que requieren implementación en canales de voz, chat y mensajería desde una única interfaz de diseño.

Relevance IA

Relevance IA ofrece flexibilidad bring-your-own-LLM (BYOLLM) con un modelo de facturación basado en acciones, lo que permite a equipos no técnicos crear equipos multiagente mediante descripciones en lenguaje natural.

Ventajas:

– El plan gratuito incluye 100 créditos al día sin caducidad.

– Más de 2.000 integraciones, incluidas HubSpot, Salesforce, Slack y Gmail.

– Verdadero agnosticismo de modelos con soporte para múltiples proveedores de LLM.

Desventajas:

– No hay opciones de autohospedaje ni de implementación local; solo SaaS en la nube.

– Sin autorización FedRAMP para industrias reguladas.

– Las capacidades de voz requieren integración con Vapi o Twilio en lugar de telefonía nativa.

Lindy IA

Lindy IA ofrece diversas integraciones a través de Pipedream, plantillas de agentes predefinidas para la clasificación de correos electrónicos y la programación, y capacidades de agente de llamadas telefónicas mediante la funcionalidad de voz Gaia.9

La plataforma utiliza un modelo de ejecución basado en créditos con un plan gratis disponible.

Ventajas:

– El plan gratuito incluye 400 créditos al mes y una base de conocimiento de 1 millón de caracteres.

– Verdadero agnosticismo de modelos y una amplia biblioteca de integraciones.

Desventajas:

– La implementación local solo está disponible mediante acuerdos empresariales personalizados para industrias reguladas.

Ideal para usuarios de negocio individuales, fundadores y equipos de operaciones que requieren una automatización rápida de correo electrónico, calendario y flujos de trabajo de CRM sin recursos de ingeniería.

Metodología

¿Qué ofrece realmente una plataforma de agentes de IA gestionados frente a sus competidores y frente a la alternativa de crear tu propio harness de agente? El espacio de herramientas de IA tiene un punto ciego persistente aquí. Los productos de “agente gestionado” se comparan habitualmente con los mismos cuadros de mando de finalización de tareas que se usan para los modelos de lenguaje puros, lo que confunde dos cosas muy diferentes: la capacidad del modelo para generar código correcto y la capacidad del harness para ejecutar ese código de forma fiable en un runtime gestionado con estado, herramientas y aislamiento. Diseñamos este benchmark para separar esas señales.

¿Qué es una plataforma de agentes gestionados?

Estamos evaluando una categoría específica: runtimes alojados que combinan inference de LLM, orquestación de agentes y ejecución de código en sandbox en un único servicio gestionado. Esto es distinto de (1) las APIs de inference de LLM puras, (2) los frameworks de orquestación de agentes que alojas tú mismo y (3) los sandboxes de cómputo que combinas con tu propio modelo. Las cuatro plataformas analizadas adoptan una forma ligeramente distinta de este paquete:

  • Claude Managed Agents (Anthropic): harness totalmente gestionado. Las definiciones de agentes, las sesiones, el streaming basado en eventos, la compactación y la ejecución de herramientas se realizan del lado del servidor. Uno de los dos verdaderos competidores de esta categoría.
  • Vertex IA Agent Engine (Google): harness totalmente gestionado. Implementa un agente definido con ADK en un runtime gestionado; la implementación aloja el estado del agente y la ejecución de herramientas. Se accede a través del SDK vertexai.agent_engines.
  • OpenAI Responses API con Code Interpreter: categoría adyacente. API de inference con una herramienta de sandbox de Python integrada, pero sin estado de sesión persistente de varios turnos ni dirección a mitad de flujo.
  • Control: Claude Messages API con un bucle de herramientas local: incluido como referencia. El mismo modelo que Claude MA (claude-sonnet-4-6), pero implementamos el bucle del agente localmente en ~150 líneas de Python. Las herramientas (bash, write, read, edit) se ejecutan en un directorio temporal por tarea en la máquina del benchmark. Esto aísla lo que aporta el harness gestionado más allá de “modelo más bucle de herramientas”. Ejecutar la API de Messages con un bucle de agente local produce una comparación donde el modelo es idéntico pero el harness está ausente. Cualquier diferencia entre Claude MA y el control es atribuible por completo al harness, no a la capacidad del modelo.
Deja que nuestro equipo automatice uno de tus procesos de negocio con agentes de IA, sin coste alguno.
Automatizar un proceso

El conjunto de tareas

Diez tareas de programación distribuidas en tres niveles de dificultad. Cada tarea tiene un prompt fijo que especifica el entregable y un script de verificación que define criterios deterministas de aprobado/fallido. Cada tarea se ejecuta tres veces por plataforma para medir la variación.

Pruebas de estrés específicas del harness

El conjunto de tareas mide la corrección de extremo a extremo. No puede medir capacidades que solo existen gracias a un harness gestionado: persistencia de sesiones con estado, dirección a mitad de flujo, reanudación de conexión, compactación automática del contexto y manejo gestionado de artefactos del sistema de archivos. Para ello diseñamos dos conjuntos de pruebas adicionales.

Suite A: Dirección e interrupción

Tres pruebas que ejercitan primitivas específicas del harness.

A1 inicia un agente en una tarea de programación, luego inyecta un nuevo evento de usuario mediante POST /events después de 10 segundos para cambiar los requisitos, y verifica inspeccionando el sistema de archivos del contenedor que el artefacto final refleje el nuevo requisito y no el original.

A2 abre un flujo SSE, interrumpe la conexión después de cuatro eventos, se reconecta y verifica que la sesión aún alcance status_idle.

A3 envía un prompt deliberadamente contradictorio y mide si el agente pide aclaraciones o elige silenciosamente una interpretación.

Solo A3 es portátil entre plataformas. La inyección de eventos a mitad de flujo de A1 no tiene equivalente directo en OpenAI Responses (solicitud/respuesta única) o en Vertex Agent Engine (el modelo de sesión carece de inyección de mensajes durante el vuelo). La desconexión/reconexión de A2 tampoco tiene equivalente en otros lugares. Estas son ventajas estructurales reales del modelo de sesión controlado por eventos de Claude MA, no comparables con las alternativas. Ejecutamos A1 y A2 solo en Claude MA y A3 en Claude MA y Vertex Agent Engine.

Suite B: Compactación y contexto

Dos pruebas que ejercitan funciones de contexto gestionado.

B1 coloca una cadena canario única (un token derivado de un UUID) en el primer turno de una sesión, ejecuta 23 turnos de relleno con pequeñas tareas de programación no relacionadas, cada una con llamadas y resultados de herramientas, y luego pide al agente que recuerde el canario de memoria en el turno 25 sin permitir la búsqueda en archivos. Recordar con éxito después de 23 turnos de relleno evidencia que el harness conserva el contexto inicial mediante la política de compactación que utilice.

B2 pide al agente que genere un archivo de texto de 50.000 líneas con un marcador oculto y que luego responda una pregunta que requiere encontrar el marcador. Esto comprueba si el agente puede razonar sobre artefactos más grandes que su ventana de contexto sin intentar leer todo el archivo.

B1 y B2 se ejecutaron tanto en Claude MA como en Vertex Agent Engine, con los mismos prompts y protocolos.

No te pierdas nuestros análisis comparativos e insights basados en datos. El botón abre Google; seleccionar AIMultiple confirma que deseas ver AIMultiple con más frecuencia en los resultados de búsqueda de Google.
GoogleAñadir como fuente preferida

LLM como juez para la puntuación conductual

Para la Suite A3 (contradicciones), aprobado/fallido no es una comprobación determinista; tratamos “¿pidió el agente una aclaración?” como un juicio cualitativo sobre el comportamiento conversacional. Usamos un diseño de LLM como juez con tres salvaguardas metodológicas:

  1. El modelo juez es distinto del modelo evaluado: Claude Opus 4.6 es el juez para evitar el sesgo de autoevaluación.
  2. Rúbrica estructurada con 4 dimensiones booleanas: el juez devuelve una puntuación en JSON: recognized_contradiction, asked_for_clarification, proceeded_with_assumption, documented_assumption y un razonamiento de un párrafo.
  3. Comprobación de consistencia en 3 ejecuciones: cada juicio se ejecuta 3 veces. Informamos del consenso mayoritario por dimensión y de la tasa de concordancia por dimensión. Si la concordancia de alguna dimensión cae por debajo del 67 %, el juez se marca como inconsistente en esa dimensión y el resultado se trata como de baja confianza.

Una heurística de palabras clave se ejecuta en paralelo como comprobación de cordura. Las divergencias entre la heurística y el juez se registran para revisión manual.

Puntuación

Para cada ejecución de tarea en cada plataforma:

  • Aprobado/fallido
  • Tiempo transcurrido: segundos transcurridos desde el envío del prompt hasta la recepción del evento terminal (status_idle para Claude MA, finalización de la tarea para Vertex AE, finalización de la respuesta para OpenAI, salida del bucle de herramientas para el control).
  • Número de llamadas a herramientas: invocaciones de herramientas distintas. Útil como huella conductual; menos útil como métrica de eficiencia porque la granularidad de las herramientas difiere significativamente entre plataformas.
  • Uso de tokens: analizado a partir de los eventos model_request_end en Claude MA, usage_metadata en Vertex AE, response.usage en OpenAI y la acumulación por turno en el bucle de mensajes del control. Se desglosa en entrada, salida, lectura de caché y creación de caché.
  • Costo en USD: calculado a partir del uso de tokens según los precios publicados: claude-sonnet-4-6 a $3/$15/$0.30/$3.75 por millón; gpt-5.4 a $2.50/$15/$0.25; gemini-2.5-pro a $1.25/$10/$0.13. Se añaden tarifas de infraestructura específicas de la plataforma: $0.08/hora de sesión de Claude MA prorrateada por tiempo transcurrido, $0.03/contenedor de OpenAI cuando se produjo alguna llamada a herramienta, y la tarifa de alojamiento de Vertex AE de aproximadamente $0.35/hora prorrateada por el tiempo de actividad de la implementación.

Los resultados de las Suites A y B también capturan métricas a nivel de sesión (turnos, recuerdo del canario, consenso del juez y concordancia).

Consideraciones de equidad y limitaciones conocidas

Varias asimetrías en la configuración afectan a cómo deben interpretarse las cifras; las señalamos explícitamente:

El control ejecuta las herramientas en la máquina del benchmark sin viaje de ida y vuelta a la nube. Esto le da una ventaja injusta de tiempo transcurrido que no refleja tanto la velocidad del agente como la ausencia de red. Cuando observamos que el control completa las tareas ~25 % más rápido que Claude MA con el mismo modelo, aproximadamente la mitad de esa diferencia es asimetría de ida y vuelta.

El Code Interpreter de OpenAI opera en un sandbox con red restringida. Las tareas 06 (cliente REST API) y 10 (descargador concurrente) requieren HTTP saliente, que CI solo permite de forma intermitente. Los fallos de OpenAI en esas tareas son fallos de la política del sandbox, no de la capacidad del modelo. GPT-5.4 puede escribir código HTTP concurrente correcto; la plataforma no siempre puede ejecutarlo. Los lectores no deben interpretar “OpenAI falla en tareas de red” como una afirmación sobre el modelo.

Gemini 3.1-pro-preview está limitado por una lista de permitidos de vista previa a nivel de proyecto. Intentamos evaluar este modelo tanto en la API directa de Vertex como en Vertex Agent Engine. Las llamadas directas a la API devolvieron 404; las implementaciones en Agent Engine con el modelo se realizaron correctamente, pero las llamadas de inference devolvieron cero eventos sin error. Recurrimos a gemini-2.5-pro.

Un conjunto de tareas de refactorización de varias horas, depuración en bases de código desconocidas o flujos de trabajo autónomos de larga duración sometería a los harnesses a un estrés distinto y probablemente separaría con más claridad las opciones de primer nivel.

No medimos la latencia de aprovisionamiento, el comportamiento de arranque en frío, el rendimiento de sesiones concurrentes ni los límites de tasa. Son importantes para cargas de trabajo de producción de alto rendimiento, pero quedaron fuera del alcance de esta ronda.

Funcionalidades comunes a todas las plataformas de agentes de IA

Todas las plataformas de esta comparación ofrecen capacidades básicas que definen la categoría de agentes de IA. Estas funcionalidades comunes establecen el producto mínimo viable para la automatización agéntica, mientras que las funcionalidades diferenciadoras determinan la selección de la plataforma.

Orquestación multiagente: Todas las plataformas admiten la orquestación multiagente, aunque la implementación varía (consulte las secciones individuales de cada plataforma más arriba).

Uso de herramientas e integraciones externas: los agentes de todas las plataformas pueden llamar a APIs externas, bases de datos y aplicaciones empresariales. El número de conectores predefinidos va desde aproximadamente 50 (Dify) hasta más de 2.000 (Relevance IA), y todas las plataformas admiten definiciones personalizadas de API.

Memoria persistente y gestión del contexto: retener información dentro de las sesiones (memoria a corto plazo) y entre sesiones (memoria a largo plazo) es una capacidad estándar que se logra mediante bases de datos vectoriales, objetos de sesión o ventanas de contexto configurables según la plataforma.

Monitorización y observabilidad: todas las plataformas exponen logs, trazas o analíticas para inspeccionar la ejecución de los agentes, rastrear el uso de tokens y la latencia, e identificar fallos.

Supervisión humana y controles de aprobación: en todas las plataformas existen mecanismos de revisión, aprobación o anulación humana de las acciones de los agentes. Algunos ejemplos son las compuertas de aprobación por herramienta de n8n, las primitivas de interrupción y reanudación de LangGraph, los controles de políticas de Bedrock AgentCore, ServiceNow IA Control Tower y la escalada automática de Lindy.

Base de conocimiento y generación aumentada por recuperación (RAG): fundamentar a los agentes en conocimiento personalizado mediante la indexación y recuperación de documentos es una capacidad básica en toda la categoría. Las implementaciones incluyen el pipeline de RAG de Dify, Voiceflow Knowledge Base, Bedrock Knowledge Bases, Vertex IA RAG Engine y Kore.ai Search IA.

Interfaz de creación de agentes sin código o con poco código: en todas las plataformas hay interfaces gráficas o de lenguaje natural para crear agentes. Las plataformas empresariales ofrecen estudios sin código (Agentforce Builder, Copilot Studio, watsonx Orchestrate), mientras que los frameworks para desarrolladores proporcionan herramientas visuales complementarias (LangGraph Studio, AutoGen Studio, CrewAI Studio).

Cita esta investigación

Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.

Şevval Alper (2026) - "Benchmark de plataformas de agentes de IA: Claude Managed Agents vs Google Vertex Agent Engine". Publicado en línea en AIMultiple.com. Recuperado el 14 de Agosto de 2026, de: https://aimultiple.com/ai-agent-platforms [Recurso en línea]

Alper, Ş. (2026, 14 de Agosto). Benchmark de plataformas de agentes de IA: Claude Managed Agents vs Google Vertex Agent Engine. AIMultiple. https://aimultiple.com/ai-agent-platforms

@misc{alper2026,
  author = {Alper, Şevval},
  title  = {{Benchmark de plataformas de agentes de IA: Claude Managed Agents vs Google Vertex Agent Engine}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/ai-agent-platforms}},
  note   = {AIMultiple. Recuperado el 14 de Agosto de 2026}
}
Descargar todos los datos

Resultados y marcas de tiempo de 0 puntos de datos. Descargue los datos utilizados en este artículo como un archivo ZIP que contiene 0 archivos CSV y un README.

Última actualización: 17 de Agosto de 2026
Descargar
Şevval Alper
Şevval Alper
Investigador de IA
Şevval es analista del sector en AIMultiple, especializado en herramientas de codificación de IA, agentes de IA y tecnologías cuánticas.
Ver perfil completo

Sé el primero en comentar

Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.

0/450