Pasamos el último trimestre probando agentes de IA en codificación, servicio al cliente, ventas, investigación y flujos de trabajo empresariales. No leyendo marketing de proveedores, sino usando estas herramientas a diario para ver qué funciona y qué no.
La mayoría de las herramientas actuales son copilotos, no autopilotos. Se encargan de la investigación y automatizan tareas repetitivas, pero aún requieren la toma de decisiones humana para todo lo que importa.
¿Qué es un agente de IA?
Un agente de IA itera. Esa es la diferencia fundamental con un chatbot.
Fuente: GitHub1
No existe una definición única unánime. La IA tradicional define a los agentes como sistemas que interactúan con su entorno. Algunas firmas de análisis los definen como sistemas completamente autónomos que operan de forma independiente durante periodos prolongados, utilizando herramientas como funciones o APIs para relacionarse con su entorno y tomar decisiones basadas en el contexto y los objetivos.2 Otros usan el término para describir implementaciones más prescriptivas que siguen flujos de trabajo predefinidos.3
Estos son los factores que hacen que un sistema de IA se considere más agéntico:
Aquí hay un ejemplo real y una conversación de un agente de software de código abierto que gestiona despliegues en Humanlayer:4
Fuente: GitHub 5
Capacidades de los sistemas de IA agénticos
Adaptado de: Cobus Greyling6
Leer más: Agentes de IA empresariales, constructores de agentes de IA, modelos de gran acción (LAMs), y IA agéntica en ciberseguridad.
Agentes de codificación
Cursor
Cursor sigue siendo el editor de código de IA más adoptado entre los desarrolladores individuales. En los hilos de Reddit, incluso quienes prefieren otras herramientas se comparan con él.
Su ventaja es la sensación: una integración fluida en el IDE construida sobre VSCode, cambio rápido de contexto entre archivos y un flujo de trabajo que prioriza la velocidad sobre la inteligencia bruta.
Cursor también está construyendo, según se informa, un agente de lugar de trabajo de propósito general, internamente llamado Sand, que respondería correos electrónicos, organizaría hojas de cálculo y manejaría tareas no relacionadas con la codificación, posicionándolo como un competidor directo de Claude Cowork y ChatGPT Work.7
Cursor también lanzó Automatizaciones, que permiten que los agentes se ejecuten automáticamente a partir de un cambio de código, un mensaje de Slack o un temporizador, y publicó una beta pública para iOS con Control Remoto y notificaciones en vivo.8
Claude Code
Claude Code superó los 2.5 mil millones de dólares en ingresos anualizados en tasa de ejecución para febrero de 2026, habiendo duplicado desde el inicio del año. Representa más de la mitad de todo el gasto empresarial en productos de Anthropic.9 Las empresas representan el 80% del negocio total de Anthropic, y el número de clientes que gastan más de 100,000 dólares al año en Claude se ha multiplicado por siete en el último año.
Cowork se expandió más allá del escritorio en julio de 2026, implementándose en web y móvil (iOS y Android) en beta primero para los suscriptores Max.10 Las sesiones ahora se ejecutan de forma remota en los servidores de Anthropic, por lo que las tareas programadas continúan incluso sin ningún dispositivo en línea, y Chat y Cowork comparten una única pestaña de inicio con una barra lateral y una lista de proyectos.
La aplicación fue construida por el propio Claude Code en aproximadamente 1.5 semanas. El 30 de enero, Anthropic añadió un sistema de complementos que permite la automatización a nivel departamental a través de integraciones personalizadas de MCP, subagentes y comandos de barra.11
Anthropic lanzó Code Review para Claude Code, un sistema multiagente que envía un equipo de IA para analizar cada solicitud de incorporación de cambios. La función está en vista previa de investigación para usuarios de Team y Enterprise. En el despliegue interno de Anthropic, los comentarios sustantivos en PR aumentaron del 16% al 54% después del lanzamiento.12 Menos del 1% de los hallazgos son marcados como incorrectos por los ingenieros, y el sistema no aprueba PRs; esa decisión queda en manos humanas.
GitHub Copilot
GitHub Copilot experimentó una gran expansión en 2026, pasando de ser una herramienta de sugerencia de código a un entorno de desarrollo multiagente. La actualización de CLI del 14 de enero introdujo cuatro agentes paralelos especializados: Explore (preguntas y respuestas rápidas sobre la base de código sin saturar el contexto principal), Task y Code-review.
Estos agentes se ejecutan de forma concurrente, comprimiendo lo que antes requería transferencias secuenciales en una ejecución paralela.13
Una actualización de julio de 2026 añadió Codex como un nuevo proveedor de agentes dentro de Copilot CLI y los IDE de JetBrains (vista previa pública), junto con la selección del modo de permiso y el registro de depuración para el agente de Claude.14
El mismo ciclo de lanzamiento trajo herramientas de navegador agénticas a disponibilidad general en VS Code, permitiendo a los agentes navegar por páginas y validar aplicaciones web directamente en el editor, además de soporte para ventanas de contexto de 1M tokens en modelos compatibles de Anthropic y OpenAI.15
Kiro (AWS)
Kiro pasó de la vista previa a la disponibilidad general el 7 de mayo de 2026, lanzándose como el sucesor directo de Amazon Q Developer en lugar de una actualización incremental del mismo.
Las nuevas inscripciones a Q Developer se detuvieron el 15 de mayo de 2026, y el soporte finalizará el 30 de abril de 2027.16 Kiro es un IDE agéntico basado en especificaciones que convierte las indicaciones en lenguaje natural en requisitos estructurados, documentos de diseño técnico y tareas de implementación secuenciadas.
Amazon ordenó la adopción interna de Kiro en lugar de Claude Code, y aproximadamente el 70% de sus ingenieros de software habían utilizado Kiro al menos una vez. Sin embargo, alrededor de 1,500 ingenieros de Amazon firmaron un mensaje en un foro interno apoyando a Claude Code, citando las deficiencias de rendimiento de Kiro como un impedimento para la productividad.
Esto creó un conflicto visible: los ingenieros de ventas de AWS que venden Claude Code a través de Amazon Bedrock no pueden usarlo oficialmente en su propio trabajo de producción.17
Agentes de flujos de trabajo empresariales
OpenAI Frontier
OpenAI lanzó Frontier en 2026 como una plataforma abierta de extremo a extremo para que las empresas construyan, desplieguen y gestionen agentes de IA de cualquier proveedor. HP, Intuit, Oracle, State Farm, Thermo Fisher y Uber se encuentran entre los primeros en adoptarla. Frontier es la respuesta directa de OpenAI a IBM WatsonX, Orchestrate, Relevance IA y Salesforce Agentforce en la orquestación de agentes empresariales.
OpenAI dejó obsoleto su framework Swarm y lanzó un SDK de agentes unificado e independiente del proveedor que soporta más de 100 LLMs, señalando un cambio de herramientas experimentales hacia una infraestructura de grado de producción.18
Capacidades clave: Identidad definida del agente con permisos explícitos y barreras basadas en roles para entornos regulados; evaluación de calidad y bucles de retroalimentación integrados; una capa de contexto empresarial compartida que conecta almacenes de datos, CRMs y aplicaciones internas; y un tiempo de ejecución desplegable en local, en la nube empresarial o alojado por OpenAI.19
IBM Watsonx Orchestrate
IBM Watsonx Orchestrate está orientado a la orquestación de nivel empresarial, con gobierno y seguridad integrados. Está diseñado para industrias reguladas donde los registros de auditoría y el cumplimiento importan.
El compromiso es real: plazos de implementación más largos, mayor costo y la necesidad de adoptar el ecosistema de IBM. Para las empresas que ya ejecutan infraestructura de IBM, esta es la opción más defendible. Para todos los demás, el costo adicional rara vez justifica la elección.
Relevance IA
Relevance IA combina analítica integrada con flujos de decisión. Triunfa al integrarse profundamente con plataformas empresariales comunes, incluyendo Salesforce, Slack, Notion y Google Analytics. Donde las plataformas horizontales te dan flexibilidad, Relevance te ofrece un camino más rápido hacia el despliegue dentro de los flujos de trabajo existentes.
Agentes de servicio al cliente
Tidio’s Lyro
Tidio’s Lyro se enfoca en el chat en vivo para pymes con capacidades agénticas. Según informes de usuarios reales: maneja entre el 70 y el 80% de las preguntas comunes sin intervención humana y mejora con la retroalimentación durante los primeros meses. Falla en preguntas que requieren empatía o juicio. No es la herramienta adecuada para situaciones complejas de clientes.
Salesforce Agentforce
Salesforce Agentforce se ha convertido en la plataforma de agentes de servicio al cliente de nivel empresarial dominante. Agentforce alcanzó los 800 millones de dólares en ingresos recurrentes anuales, un 169% más que el año anterior. Salesforce ha cerrado 29,000 acuerdos acumulados desde el lanzamiento, y el número de acuerdos creció un 50% trimestre a trimestre.20 Más del 60% de las reservas de Agentforce en el cuarto trimestre provinieron de la expansión de clientes existentes, lo que sugiere que el producto está entregando suficiente valor en producción para que los clientes amplíen lugar de abandonar.
En un despliegue de producción en UCSF Health, Agentforce Voice logró una cobertura de tareas del 88% utilizando entrenamiento basado en simulación, significativamente por encima del 60-70% típico de los enfoques tradicionales.21
El patrón general se mantiene en todas las plataformas: los agentes de servicio al cliente funcionan bien en consultas repetitivas y de alto volumen, y tienen dificultades con las tareas que requieren juicio, empatía o contexto multiparte.
Investigación y Análisis
Kompas IA
Kompas IA se especializa en investigación profunda y generación de informes. Realmente lee y sintetiza artículos académicos, mantiene correctamente las citas, monitorea continuamente nuevas publicaciones y se integra con arXiv, PubMed y SSRN. El compromiso es la velocidad: optimiza la precisión sobre el rendimiento y cuesta más por consulta que la IA de propósito general. Para los trabajadores del conocimiento que necesitan resultados defendibles y citados, ese compromiso vale la pena.
Beam IA
Beam IA maneja flujos de trabajo con gran cantidad de documentos, especialmente en entornos donde la extracción de datos estructurados de grandes conjuntos de documentos es el principal cuello de botella.
Otter.ai
Otter.ai sigue siendo sólido para las notas de reuniones, pero no ha evolucionado mucho más allá de la transcripción y el resumen básico desde 2024. Si eso es todo lo que necesitas, todavía funciona. Si necesitas agentes que actúen sobre el contenido de las reuniones, busca en otra parte.
Qué diferencia a los agentes realmente útiles
Autonomía vs. Control
La decisión más importante es cuánta independencia deseas realmente. Los agentes copiloto como Cursor y Otter mantienen la supervisión humana en las decisiones clave, encargándose de la investigación y la ejecución, pero requiriendo aprobación antes de acciones críticas. Las plataformas de automatización estratégica como n8n y Make siguen flujos de trabajo predefinidos con una toma de decisiones mínima en tiempo real, lo cual es predecible y fiable, pero falla al enfrentarse a escenarios inesperados. Los sistemas basados en reglas responden a activadores sin comprensión contextual, no son realmente agénticos pero son valiosos para la automatización directa.
La mayoría de las empresas en 2026 operan con agentes de nivel 2-3. La autonomía total crea más problemas de los que resuelve a menos que hayas construido amplias barreras.
Especializados vs. de Propósito General
Los agentes especializados incorporan un profundo conocimiento del dominio. Entienden los flujos de trabajo de la industria, la terminología y los requisitos de cumplimiento, logran tasas de éxito más altas dentro de su dominio y son completamente inadecuados para casos de uso adyacentes.
Las plataformas horizontales como LangGraph, watsonx Orchestrate y Relevance IA proporcionan marcos flexibles para construir agentes personalizados. Sacrifican la optimización del dominio por la versatilidad. LangGraph se enfoca en la generación de flujos de trabajo multiagente de grado de producción, lo cual es potente para los desarrolladores que construyen sistemas complejos pero requiere experiencia técnica. Relevance IA se dirige a los usuarios de negocio con plantillas predefinidas y una configuración más sencilla. Los agentes de investigación como Kompas IA optimizan la precisión y la exhaustividad sobre la velocidad.
Profundidad de integración
Anthropic donó MCP a la Agentic IA Foundation de la Linux Foundation, convirtiéndolo en un estándar abierto neutral respecto al proveedor bajo el mismo modelo de gobernanza independiente que Kubernetes y Node.js. MCP cuenta ahora con más de 10,000 servidores publicados y 97 millones de descargas mensuales del SDK, con soporte de primera clase en Claude, Cursor, GitHub Copilot, Gemini, VS Code y ChatGPT.
Las integraciones nativas con la plataforma distinguen a los agentes enfocados al negocio. Beam IA y Relevance IA triunfan al integrarse profundamente con Salesforce, Slack, Notion y Google Analytics. El valor proviene menos de las capacidades de IA y más del flujo de datos sin interrupciones. Las arquitecturas basadas en APIs como n8n y Make permiten integraciones personalizadas pero requieren experiencia técnica, soportando cientos de conectores preconstruidos y permitiendo nodos personalizados.
Seguridad y Cumplimiento
Los requisitos de despliegue en producción crean grandes diferencias arquitectónicas. Los agentes de nivel empresarial como IBM WatsonX y los agentes sanitarios priorizan las certificaciones de seguridad (SOC 2, ISO 27001), los registros de auditoría, los marcos de cumplimiento (GDPR, HIPAA), el control de acceso basado en roles, el cifrado de datos y los flujos de trabajo de gobernanza. Esa sobrecarga de infraestructura aumenta los costos pero permite el despliegue en industrias reguladas.
Una prueba real notable de estos límites: en febrero de 2026, tres agencias del gabinete de EE. UU. instruyeron al personal que dejara de usar Claude después de que Anthropic se negara a eliminar las prohibiciones contractuales sobre la vigilancia masiva doméstica y las armas totalmente autónomas.22 El episodio ilustra que las decisiones de gobernanza tomadas a nivel de proveedor tienen consecuencias operativas directas para los clientes empresariales en entornos regulados o adyacentes al gobierno.
Las herramientas centradas en el desarrollador, como LangGraph y los agentes de codificación, se enfocan en la depuración, el registro y la integración con sistemas de control de versiones, sirviendo a usuarios técnicos que implementan su propia seguridad. Las herramientas orientadas al consumidor a menudo carecen por completo de las características de cumplimiento empresarial.
El problema de gobernanza que nadie ha resuelto todavía
Las herramientas de gobernanza están empezando a ponerse al día. Se han lanzado varias soluciones concretas:
- Cisco IA Agent Monitor for Splunk Observability Cloud seguimiento en tiempo real de la calidad del flujo de trabajo de los agentes, costo por ejecución y anomalías de comportamiento, entrando en pruebas públicas. 23
- OpenAI Frontier a cada agente se le asigna una identidad definida con permisos explícitos, registros de auditoría y barreras, modelado según cómo las empresas gestionan el acceso de los empleados humanos24
- Agentic IA Foundation (AAIF), OpenAI, Anthropic y Block cofundaron un consorcio respaldado por la Linux Foundation en diciembre de 2025 para establecer estándares de gobernanza abiertos y neutrales respecto al proveedor para la IA agéntica. AWS, Google, Microsoft, Bloomberg y Cloudflare se unieron como miembros Platino. Anthropic donó MCP a la fundación, asegurando que siga siendo un estándar industrial abierto en lugar de un protocolo propietario25
Qué funciona, qué no (Ejemplos reales)
Qué funciona realmente hoy
Asistencia de codificación en Nivel 3: Combinación de Cursor + Claude Code utilizada por miles de desarrolladores. Cursor para el flujo y la iteración rápida, Claude para los problemas difíciles.
Flujo de trabajo típico:
- Usar Cursor para el 80% de la codificación (implementación de funciones, refactorización)
- Cuando te atasques, escalar a Claude Code para el razonamiento arquitectónico
- Dejar que el agente ejecute pruebas, itere sobre los fallos
- Un humano revisa la salida final antes de la fusión
Automatización de prospección de ventas: Los agentes de IA califican leads, programan reuniones y envían seguimientos. Las empresas reportan un aumento de 2 a 3x en la productividad del equipo de ventas.
Klarna desplegó agentes de ventas que se encargan del contacto inicial y la calificación. Los representantes humanos se enfocan en acuerdos complejos y en la construcción de relaciones.
Servicio al cliente para preguntas comunes: Los agentes manejan entre el 70 y el 80% de las consultas rutinarias fuera del horario laboral. Las puntuaciones de satisfacción del cliente mejoraron porque las respuestas son instantáneas en lugar de "le responderemos mañana".
Síntesis de investigación: Los investigadores académicos utilizan agentes para escanear nuevos artículos, extraer secciones relevantes y mantener bases de datos de citas. Ahorra horas de revisión manual de la literatura.
Qué aún no funciona
Despliegue totalmente autónomo: Agentes de nivel 4 que despliegan código en producción sin aprobación humana. Demasiado arriesgado para la mayoría de las empresas. Incluso con pruebas exhaustivas, los casos límite causan problemas.
Excepción: Sistemas simples y bien delimitados donde los fallos son recuperables.
Situaciones complejas de clientes: Los agentes fallan cuando se requiere empatía, juicio o una comprensión matizada. "Entiendo que esté frustrado" de un agente suena vacío.
Toma de decisiones con múltiples partes interesadas: Los agentes no pueden navegar la política de oficina, entender el contexto no expresado o leer entre líneas en las negociaciones comerciales.
Estrategia creativa: Los agentes pueden ejecutar tácticas pero no desarrollan enfoques estratégicos novedosos. Optimizan dentro de los parámetros dados pero no cuestionan los parámetros en sí mismos.
La realidad de los costos
Todos hablan de las capacidades de los agentes. Pocos discuten la economía.
Costos directos:
- Llamadas a la API del modelo: $0.003-0.10 por cada 1K tokens (varía según el modelo)
- Ejecución de herramientas: APIs, fuentes de datos, integraciones
- Infraestructura: Alojamiento, cómputo para sistemas autoalojados
Costos ocultos:
- El uso de la ventana de contexto se acumula rápidamente con las conversaciones de varios turnos
- Intentos de ejecución fallidos (el agente intenta, falla, reintenta; pagas por cada intento)
- Tiempo de depuración y refinamiento
- Infraestructura de gobernanza y seguridad
- Capacitar al equipo para trabajar eficazmente con agentes
Las organizaciones líderes tratan la optimización de costos de agentes como una preocupación arquitectónica de primer orden. Construyen modelos económicos en el diseño del agente en lugar de adaptar los controles de costos después del despliegue.
Estrategias de optimización de ejemplo:
- Enrutar consultas simples a modelos más pequeños y baratos
- Usar la caché de prompts de forma agresiva (90% de reducción de costos para contexto repetido)
- Implementar interruptores de circuito para detener agentes descontrolados
- Monitorear el uso de tokens por tarea, optimizar los prompts
- Procesar solicitudes en lote cuando la latencia no es crítica
Si estás investigando la infraestructura que potencia la IA agéntica con capacidad web, aquí están nuestras últimas evaluaciones comparativas:
- Navegadores remotos: Cómo la infraestructura de navegadores permite a los agentes interactuar con la web de forma segura.
- Navegador MCP referencia: Principales servidores MCP para uso de herramientas y acceso web.
También está en marcha un cambio estructural en la forma en que los proveedores fijan el precio de las herramientas agénticas. El movimiento de Cursor hacia un sistema de créditos de doble grupo, y la inclusión de Anthropic de Claude Code en los asientos del plan Team, reflejan que el mercado está normalizando la IA agéntica como un costo de infraestructura de línea de partida en lugar de un gasto por consulta. Las organizaciones de ingeniería líderes ahora modelan el gasto en tokens a nivel de flujo de trabajo, no por cada prompt individual.26
Lecturas adicionales
Cita esta investigación
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{dilmegani2026,
author = {Dilmegani, Cem},
title = {{Compara más de 50 herramientas de agentes de IA}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/ai-agent-tools}},
note = {AIMultiple. Recuperado el 22 de Julio de 2026}
}

Sé el primero en comentar
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.