Servicios
Contáctanos

Benchmark de Marketing Agentic AIM

Sıla Ermut
Sıla Ermut
actualizado el 5 de ago. de 2026

Presentamos el Benchmark de Marketing Agentic AIM, que mide el rendimiento de los agentes en tres flujos de trabajo de marketing: análisis de brechas competitivas, preparación de listas de cuentas ABM y una presentación de ventas personalizada.

Probamos el rendimiento de 11 modelos en tres tareas de la vida real y medimos el rendimiento de ejecución de extremo a extremo:

Resultados del benchmark de marketing agentic

Loading Chart

Las puntuaciones de las tareas se normalizan a una escala de 0 a 100.

  • Para el análisis competitivo, la puntuación es igual a: 100 × MAX(0, brechas verificadas encontradas − brechas incorrectas) / 10
  • Para la preparación de la lista de cuentas, la puntuación es el porcentaje de los 71 puntos de rúbrica disponibles obtenidos por el modelo.
  • Para la tarea de la presentación de ventas, la puntuación es la suma de 5 secciones de 20 puntos cada una.

La puntuación general es la media aritmética de las tres puntuaciones de las tareas, otorgando a cada tarea el mismo peso a pesar de los diferentes tamaños de sus rúbricas. Las presentaciones no válidas cuentan como cero en el cálculo general, con dos excepciones: Kimi K3 y Gemini 3.5 Flash no tienen puntuación general porque ambos no ejecutaron la tarea de la presentación de ventas.

Lea la metodología para obtener más información sobre la evaluación de tareas.

Ningún modelo fue fiable en los tres flujos de trabajo

Fable 5 al 84.4 % y Sol al 74 % son los únicos modelos que se ubicaron entre los tres primeros en cada tarea. Debajo de ellos, el orden es casi una reorganización. GLM 5.2 obtuvo 80 % y 76.1 % en las dos primeras tareas y luego no escribió ninguna presentación. Sonnet 5 falló por completo en el análisis competitivo y produjo la tercera mejor presentación. MiniMax M3 terminó último de los nueve modelos con una puntuación de tres tareas, a pesar de tener la cuarta mejor puntuación en la presentación.

Una clasificación de un flujo de trabajo de marketing no se transfiere al siguiente. Así que pruebe un modelo en el flujo de trabajo que planea automatizar antes de elegirlo.

Cada cero provino de la entrega, no de la investigación

Cinco ejecuciones obtuvieron cero, y ninguna fue juzgada mal en cuanto al contenido. Sonnet 5 envió once filas contra un límite de diez filas. Kimi K3 y MiniMax M3 nunca produjeron un archivo de cuenta válido. GLM 5.2 y Opus 4.8 terminaron la ejecución de la presentación sin escribir un archivo.

En cada caso, la investigación nunca fue leída. Si está implementando un agente, esta puede ser la restricción que más importa que la calidad de la investigación: un agente que no puede producir un archivo bien formado a tiempo no puntúa nada.

Las presentaciones de ventas vendieron bien y no demostraron nada

En las siete presentaciones que produjeron los modelos, obtuvieron el 83 % de los puntos disponibles por explicar qué valor tiene AIMultiple para el destinatario, el 36 % por citar los benchmarks relevantes para ese destinatario, y el 20 % por proponer qué investigar a continuación.

Redactar un discurso persuasivo resultó ser la mitad fácil. Fundamentarlo en trabajos publicados, que es lo que vende una firma de investigación, es donde fallaron las presentaciones.

Las tareas de la vida real utilizadas en el benchmark

Estas tareas de marketing agentic incluyen cobertura de estrategia y contenido, crecimiento e investigación de ventas. Cada una requiere investigación web, validación de fuentes, calificación basada en reglas y salida estructurada.

Tarea 1: Análisis de brechas competitivas

El modelo trabaja como analista de estrategia en AIMultiple y la compara con una plataforma de benchmarking de IA competidora. La ejecución permite 90 minutos y acceso web en vivo a través del Bright Data MCP, con ejecución de código deshabilitada.

La salida es un solo archivo y contiene hasta diez filas ordenadas por prioridad. Cada fila nombra una oferta que publica el competidor y que AIMultiple no publica, explica la diferencia en una o dos oraciones, cita una página del competidor que el modelo abrió y enumera las páginas de AIMultiple que examinó antes de afirmar la ausencia.

La afirmación de ausencia es la mitad más difícil de cada hallazgo. Identificar una característica en el sitio del competidor requiere una sola página. Establecer que AIMultiple no la proporciona requiere revisar las páginas de categoría, benchmarks, artículos y el mapa del sitio.

Cuando AIMultiple publica una oferta adyacente, el modelo debe nombrar esa página y especificar en qué se diferencia la versión del competidor. La cobertura del mismo tema amplio no establece una oferta equivalente.

Cómo puntuamos la tarea

La puntuación se realiza contra una clave de respuestas compilada manualmente: diez brechas verificadas en ambos sitios, junto con las afirmaciones de ausencia que las páginas activas de AIMultiple refutan.

Cada brecha verificada suma un punto, y cada afirmación de ausencia incorrecta descuenta uno. Una afirmación incorrecta incluye cualquier fila cuya URL sea inventada, inaccesible o no respalde la afirmación adjunta.

La clave contiene diez brechas, pero un modelo puede encontrar una real que no esté en ella. Un revisor lee esos hallazgos manualmente y otorga el punto si la página citada muestra la oferta, ninguna página activa de AIMultiple contradice la afirmación y la oferta realmente falta en AIMultiple.

Dos reglas limitan estos puntos adicionales:

  • Un hallazgo que repita una de las diez existentes con palabras diferentes no gana nada extra. En su lugar, se acredita bajo la brecha listada.
  • Un hallazgo que falle la revisión cuesta un punto. Si AIMultiple ya publica la oferta, o el competidor no la tiene, la fila puntúa cero, la misma penalización que cualquier otra afirmación incorrecta.

Esto evita que la clave penalice un hallazgo que los analistas no registraron, al tiempo que retiene el crédito de afirmaciones especulativas.

Como última parte de la evaluación, el revisor realiza comprobaciones de enlaces. Las comprobaciones de enlaces siguen redirecciones y evalúan el destino final, por lo que un 301 no falla una fila por sí solo. Un nombre de archivo incorrecto, columnas faltantes o desordenadas, un recuento de filas fuera de uno a diez, una prioridad fuera de 1 a 10, una URL de evidencia en el dominio equivocado o filas desordenadas hacen que la ejecución sea inválida, y una ejecución inválida no recibe puntuación numérica.

Tarea 2: Preparación de la lista de cuentas de mejor ajuste

El modelo actúa como un especialista en marketing de crecimiento que prepara una lista de marketing basado en cuentas para AIMultiple.

El trabajo comienza con un mapa de cobertura de las páginas activas de AIMultiple. El agente registra páginas de categoría, benchmarks y páginas de comparación de proveedores, así como proveedores mencionados en el cuerpo de los artículos y en las divulgaciones de patrocinio.

Luego prepara una lista priorizada de 100 cuentas. Cada empresa debe ser un proveedor de tecnología B2B con ingresos anuales entre $100 millones y $1 mil millones, con sede en EE. UU., Europa o Israel, y activa en una categoría cubierta por AIMultiple. La empresa también necesita una señal de marketing de crecimiento actual y al menos una página de AIMultiple donde represente una oportunidad comercial genuina.

El archivo de cuentas registra el dominio de la empresa, la página de LinkedIn, la sede, la categoría, los ingresos y la fuente, el número de empleados, el año de fundación, el estado de financiación o propiedad, las páginas relevantes de AIMultiple, la señal de marketing y la puntuación de ajuste.

Las empresas matrices y las subsidiarias no pueden aparecer ambas para la misma oportunidad de proveedor. Las reglas también excluyen empresas de servicios, negocios de consumo, empresas de análisis o reseñas, y candidatos que no cumplan con los requisitos de ingresos o sede.

Cómo puntuamos la tarea

La rúbrica contiene 71 puntos en siete secciones. La sección del mapa de cobertura verifica si el modelo revisó al menos 30 páginas activas de AIMultiple e incluyó cada tipo de página requerido. Los revisores muestrean filas para confirmar que los proveedores nombrados y las divulgaciones de patrocinio coinciden con las páginas activas.

La sección del archivo de cuentas requiere exactamente 100 dominios distintos, las columnas especificadas, clasificaciones aceptadas, puntuaciones de ajuste descendentes y campos de evidencia completos. Luego se utiliza una muestra fija de 20 cuentas para comprobaciones detalladas que cubren ingresos, identidad de LinkedIn, sede real, ajuste de categoría, evidencia de marketing de crecimiento y estado de proveedor B2B.

Otras secciones prueban si las páginas propuestas son aperturas genuinas, penalizan cuentas descalificadas o inventadas, recompensan la inclusión de empresas verificadas de alto ajuste y verifican si los modelos evitan los casi aciertos conocidos.

Un archivo de cuenta faltante, columnas incorrectas o cualquier recuento de filas distinto de 100 invalida la ejecución.

Tarea 3: Presentación de ventas personalizada

Nota: Excluimos Kimi K3 y Gemini 3.5 Flash porque cada uno solicitó acceso a un directorio fuera de su carpeta de trabajo; el arnés denegó la solicitud automáticamente y ambas ejecuciones terminaron allí. Ninguno produjo una presentación y ninguno falló la tarea, ya que nada de lo que produjeron fue juzgado. Un cero pondría un problema de infraestructura en el registro del modelo, por lo que ambos se marcan como no ejecutados y se excluyen del promedio.

El modelo trabaja como analista de preventa en AIMultiple y construye una presentación dirigida a un ejecutivo senior de marketing de productos. La ejecución permite 90 minutos, acceso web en vivo a través del Bright Data MCP, ejecución de código y una carpeta de activos de marca que contiene los logotipos y las fuentes.

La mayor parte de la investigación se dirige al ejecutivo en lugar de a la empresa. Este ejecutivo dirige el marketing de una sola línea de productos y ha declarado públicamente lo que cuenta al juzgar el hardware: cuántos tokens se pueden comprar con un dólar, si alguien independiente verificó los números y si la prueba parecía una carga de trabajo real o una demostración.

Otro argumento recurrente es que un rack es una unidad de comparación más justa que un chip. Dado que estos argumentos son públicos y se pueden encontrar en entrevistas, charlas en conferencias y publicaciones, la tarea es leerlos y luego encontrar los benchmarks de AIMultiple que los respondan. Una presentación puede ser precisa sobre AIMultiple y aún así pasar por alto a la persona por completo, y esa es la versión que puntúa mal.

Aquí hay algunos resultados de Fable 5, Gemini 3-1 pro-preview, y GPT 5.6 Sol:

Cómo puntuamos la tarea

La presentación se puntúa en cinco aspectos, con un valor de 20 puntos cada uno: si sigue la identidad visual de AIMultiple, si cita los benchmarks correctos, si propone próximos estudios útiles, si explica qué valor tiene AIMultiple para el destinatario y si las diapositivas son claras. Cada uno de los cinco se desglosa en pequeñas comprobaciones con respuestas fijas.

La identidad visual es la única parte que un modelo puede acertar sin hacer ninguna investigación. Los archivos de logotipo, el valor hexadecimal del color de acento, los colores del texto, el tipo de letra y la ortografía del nombre de la empresa son correctos o no. Por ejemplo, una presentación configurada en Calibri pierde los puntos.

La segunda parte evalúa a qué apunta la presentación hoy. AIMultiple publica muchos artículos sobre hardware, y solo algunos prueban el tipo de chips que vende esta persona. Por lo tanto, los puntos van a una presentación que cite estudios de GPU para centros de datos en lugar de las páginas de hardware que aparecieron primero.

La tercera sección trata sobre el trabajo que AIMultiple podría hacer a continuación. Una sugerencia cuenta aquí si nombra el estudio y el número que produciría. Por ejemplo, volver a ejecutar una comparación existente con los chips de este año o agregar el hardware de la empresa a un benchmark que actualmente lo omite gana un punto. Por otro lado, proponer que las dos firmas analicen el rendimiento de inferencia juntas no nombra ni un estudio ni una medición, por lo tanto, no gana puntos.

La cuarta parte se refiere a qué valor tiene AIMultiple para el destinatario. Se otorgan puntos por tres declaraciones que:

  • AIMultiple es independiente
  • Su audiencia tiene un tamaño declarado respaldado por una fuente nombrada
  • Esta audiencia sirve a un propósito específico para el negocio del destinatario, como llegar a los compradores en la etapa de preselección

Una presentación que enumera lo que publica AIMultiple sin conectar nada de ello con los productos propios del destinatario no gana puntos.

La quinta parte cubre si la presentación se puede leer. Dos comprobaciones importan más que el resto: los titulares deben expresar una conclusión en lugar de etiquetar la diapositiva, y los números deben decir de dónde provienen, manteniendo las cifras de la empresa separadas de las mediciones propias de AIMultiple. El resto es mecánico, como evaluar el número de diapositivas, el desbordamiento de texto, las etiquetas de los gráficos, el relleno.

Cuatro de las cinco partes también conllevan penalizaciones. Un benchmark inventado, una cifra inventada, un enlace roto o presentar una afirmación de marketing de la empresa como una medición de AIMultiple cuesta puntos. Prometer resultados favorables, clasificación preferencial o una revisión antes de la publicación también cuesta puntos, ya que AIMultiple no ofrece nada de eso. La presentación debe persuadir sin fabricar evidencia y sin ofrecer nada que el negocio no venda.

Deja que nuestro equipo automatice uno de tus procesos de negocio con agentes de IA, sin coste alguno.
Automatizar un proceso

Metodología del benchmark de marketing agentic

Construimos el benchmark a partir de tres flujos de trabajo que ejecutan nuestros equipos de estrategia, crecimiento y ventas.

La tarea de análisis competitivo respalda las decisiones sobre cobertura de productos, prioridades de contenido y posicionamiento. La tarea de lista de cuentas respalda el marketing basado en cuentas y la investigación de ventas. La presentación de ventas respalda el alcance de preventa: elegir un cliente potencial, determinar qué benchmarks publicados importan y construir el documento.

Para cada flujo de trabajo, creamos un archivo de tarea que define:

  • el rol del modelo
  • las herramientas disponibles
  • los requisitos de evidencia
  • las reglas de calificación
  • las salidas requeridas
  • el límite de tiempo

Diseñamos las tareas en torno a nuestras propias páginas y flujos de trabajo comerciales, y nuestros datos forman parte de la clave de respuestas. Esto facilita la verificación de la evidencia, aunque también limita cuán ampliamente se aplican los resultados a otras empresas y entornos de marketing.

Instrucciones de tareas y rúbricas de puntuación

Para el análisis competitivo, los modelos podían investigar la web en vivo a través del Bright Data MCP. Deshabilitamos la ejecución de código y establecimos un límite de 90 minutos.

Para la preparación de la lista de cuentas, los modelos utilizaron el mismo acceso web, con ejecución de código habilitada. Permitimos hasta 240 minutos porque la tarea requería dos archivos de salida y 100 cuentas calificadas.

Para la preparación de la presentación de ventas, habilitamos el mismo acceso web con ejecución de código. La duración fue de 90 minutos, con una carpeta de activos de marca en el directorio de trabajo.

Le entregamos a cada modelo las instrucciones de la tarea y el esquema de salida, manteniendo oculta la rúbrica de puntuación.

Los modelos tenían que usar fuentes actuales

Las tres tareas dependen de información que cambia: ofertas del sitio, inventarios de benchmarks, páginas de productos, ingresos de la empresa, sede, propiedad, divulgaciones de patrocinio, actividad de marketing y las declaraciones públicas de un individuo nombrado.

Contamos una URL cuando se resolvió y respaldó la afirmación adjunta. Una página de inicio de la empresa no puede respaldar una cifra de ingresos específica, y una base de datos de marketing no puede demostrar que una plataforma ofrece un formato de benchmark en particular.

Las claves de respuesta para las dos primeras tareas se verificaron por última vez el 7 de julio de 2026. La rúbrica de la presentación de ventas se verificó el 25 de julio de 2026 y las presentaciones se puntuaron al día siguiente.

Las salidas se diseñaron para uso operativo

Las dos primeras tareas requieren archivos CSV con columnas fijas y celdas atómicas, lo que nos permite verificar automáticamente campos faltantes, duplicados, dominios no admitidos, recuentos de filas incorrectos, valores mal formados y errores de clasificación. La tercera requiere un archivo de PowerPoint que se abra sin un aviso de reparación en formato 16:9.

Las listas de cuentas y los análisis competitivos se mueven a hojas de cálculo, flujos de trabajo de CRM y herramientas de automatización, y una presentación va a un cliente. Un archivo estructuralmente inválido bloquea el siguiente paso incluso cuando la investigación en su interior está intacta. Es por eso que dos modelos obtuvieron cero en la tarea de presentación sin que nadie leyera sus argumentos.

Informamos puntuaciones de una sola ejecución sin varianza

Los resultados incluyen una puntuación reportada por modelo. Actualmente no reportamos ejecuciones repetidas, semillas, intervalos de confianza o barras de error.

Por lo tanto, los lectores deben tratar las pequeñas diferencias de puntuación con precaución. En el análisis competitivo, una brecha neta correcta adicional cambia la puntuación en diez puntos. En la preparación de la lista de cuentas, unas pocas filas muestreadas pueden determinar si se aprueba un criterio completo basado en umbrales.

Combinamos verificaciones determinísticas con un juez LLM

Los scripts determinísticos manejaron todo lo que el software puede resolver directamente: existencia de archivos, análisis de CSV, orden de columnas, recuentos de filas, valores aceptados, dominios de URL, duplicados, clasificación y, para la presentación, integridad del archivo, dimensiones de diapositivas y declaraciones de fuentes. Los scripts también recuperaron cada URL citada, siguieron las redirecciones y pasaron el contenido de la página resuelta al juez.

Un juez LLM puntuó los criterios semánticos una fila, brecha o criterio a la vez contra reglas de aprobado/fallido, y nunca asignó una calificación de calidad general. Nuestros analistas construyeron las claves de respuesta y el juez las aplicó.

El análisis competitivo agrega un paso humano. Un modelo puede reportar una brecha real que la clave no enumera, por lo que esos hallazgos van a un analista, quien los acredita solo después de verificar ambos sitios.

Preguntas frecuentes

El marketing agentic implica el uso de agentes impulsados por IA para planificar y completar tareas de marketing de varios pasos con una mínima intervención humana. Estos agentes utilizan datos de clientes, reglas comerciales, contexto en tiempo real e instrucciones en lenguaje natural para tomar decisiones a lo largo de los flujos de trabajo de marketing.

La automatización de marketing tradicional ejecuta reglas predefinidas, como enviar un correo electrónico después del envío de un formulario o mover un cliente potencial entre segmentos de audiencia. Los sistemas agentic pueden interpretar un objetivo comercial, seleccionar las herramientas necesarias, completar la configuración de la campaña, monitorear el rendimiento de la campaña y ajustar las acciones para optimizar el rendimiento.

Una plataforma de marketing agentic puede apoyar tareas como:
– analizar el comportamiento del cliente e identificar segmentos de audiencia;
– adaptar los recorridos del cliente en función de nuevas señales;
– asignar el gasto publicitario entre campañas de marketing;
– generar contenido dentro de las pautas de la marca;
– coordinar flujos de trabajo creativos y preservar la dirección creativa;
– producir información generada por IA para la optimización del recorrido;
– mover datos entre herramientas desconectadas en una nube de marketing;
– asignar tareas específicas a múltiples agentes.

Las tres tareas ponen a prueba diferentes capacidades.

El análisis competitivo recompensa la investigación comparativa, el juicio semántico y la verificación cuidadosa de la ausencia.

La preparación de la lista de cuentas recompensa la investigación web sostenida, la calificación repetida, la resolución de entidades y el control preciso de la salida.

La presentación de ventas recompensa leer las posiciones públicas de una persona y conectarlas con el trabajo publicado, dentro de un formato de archivo que debe sobrevivir a PowerPoint.

Un modelo puede manejar una comparación corta y no terminar un archivo estructurado grande. GLM 5.2 obtuvo 80 y 76.1 en las dos primeras tareas y luego no produjo ninguna presentación. Sonnet 5 hizo lo contrario: su archivo de análisis competitivo rompió una regla de formato y obtuvo cero, y su presentación quedó en tercer lugar.

No te pierdas nuestros análisis comparativos e insights basados en datos. El botón abre Google; seleccionar AIMultiple confirma que deseas ver AIMultiple con más frecuencia en los resultados de búsqueda de Google.
GoogleAñadir como fuente preferida

Cita esta investigación

Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.

Sıla Ermut and Berk Kalelioğlu (2026) - "Benchmark de Marketing Agentic AIM". Publicado en línea en AIMultiple.com. Recuperado el 5 de Agosto de 2026, de: https://aimultiple.com/agentic-marketing [Recurso en línea]

Ermut, S., & Kalelioğlu, B. (2026, 5 de Agosto). Benchmark de Marketing Agentic AIM. AIMultiple. https://aimultiple.com/agentic-marketing

@misc{ermut2026,
  author = {Ermut, Sıla and Kalelioğlu, Berk},
  title  = {{Benchmark de Marketing Agentic AIM}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/agentic-marketing}},
  note   = {AIMultiple. Recuperado el 5 de Agosto de 2026}
}
Sıla Ermut
Sıla Ermut
Analista de la industria
Sıla Ermut es una analista de la industria en AIMultiple centrada en el marketing por correo electrónico y los vídeos de ventas. Anteriormente trabajó como reclutadora en empresas de gestión de proyectos y consultoría. Sıla tiene un máster en Psicología Social y una licenciatura en Relaciones Internacionales.
Ver perfil completo
Investigado por
Berk Kalelioğlu
Berk Kalelioğlu
Investigador de IA
Berk es un investigador de IA en AIMultiple, centrándose en sistemas de IA agentivos y modelos de lenguaje.
Ver perfil completo

Sé el primero en comentar

Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.

0/450