Estamos presentando el Benchmark AIM de Marketing Agentivo que mide el rendimiento de los agentes en el análisis de brechas competitivas y la preparación de listas de objetivos ABM.
Probamos el rendimiento de 11 modelos y medimos el rendimiento de ejecución de extremo a extremo:
Resultados del benchmark de marketing agentivo
Las puntuaciones de las tareas se normalizan en una escala de 0–100.
- Para el análisis competitivo, la puntuación equivale a: 100 × MAX(0, brechas verificadas encontradas – brechas incorrectas) / 10
- Para la preparación de la lista de cuentas, la puntuación es el porcentaje de los 71 puntos de rúbrica disponibles obtenidos por el modelo.
La puntuación total es la media aritmética de las dos puntuaciones de las tareas, otorgando a cada tarea el mismo peso a pesar de sus diferentes tamaños de rúbrica. Las entregas inválidas o faltantes cuentan como cero en el cálculo total, aunque la tabla las marca por separado de las entregas válidas que obtienen una puntuación de cero.
Lea la metodología para obtener más información sobre la evaluación de las tareas.
Fable 5 ocupó el primer lugar en ambas tareas
Fable 5 logró la puntuación total más alta con 75.15, con 70 en análisis competitivo y 80.3 en preparación de lista de cuentas. Su ventaja provino de producir el resultado válido más sólido en ambos flujos de trabajo y de evitar el cero que sigue a una entrega inválida o faltante.
Las puntuaciones agregadas no revelan qué capacidad subyacente creó esta ventaja. El cumplimiento del formato, la selección de fuentes, la cobertura de búsqueda y la aplicación repetida de reglas podrían contribuir; separarlas requeriría una comparación a nivel de criterio de los archivos de cada modelo.
GLM 5.2 ocupó el segundo lugar con 68.05 y también quedó segundo en ambas tareas. Fable 5 lideró por 10 puntos en análisis competitivo y por 4.2 puntos en la preparación de lista de cuentas.
El análisis competitivo arrojó puntuaciones más bajas
Cuando la entrega inválida se incluye como cero, la puntuación media del análisis competitivo es de 40.9. Fable 5 lideró con 70, mientras que las puntuaciones válidas oscilaron entre 30 y 70.
Estas cifras deben interpretarse junto con la fórmula de puntuación. Debido a que la tarea utiliza diez brechas esperadas, cada hallazgo neto correcto adicional cambia la puntuación en diez puntos. Un modelo que encuentra seis brechas válidas y ninguna falsa obtiene 60; un modelo que encuentra siete brechas válidas y añade una afirmación incorrecta recibe el mismo resultado.
La rúbrica también describe esta tarea como un discriminador débil entre los modelos de vanguardia. Su principal valor radica en separar los sistemas más débiles que omiten varias brechas, añaden afirmaciones de ausencia falsas o no cumplen con el formato de salida requerido. Por lo tanto, las pequeñas diferencias de puntuación cerca de la cima deben recibir menos peso que los fallos mayores o las entregas inválidas.
La preparación de listas de cuentas proporcionó una mayor resolución de puntuación
La tarea de lista de cuentas utiliza una rúbrica de 71 puntos, lo que produce resultados más granulares. Las puntuaciones válidas oscilaron entre 32.4 y 80.3, y Fable 5 y GLM 5.2 superaron 70.
Sol, Terra, Sonnet 5 y Opus 4.8 formaron un grupo intermedio cercano, puntuando entre 66.2 y 69. Gemini 3.1 Pro presentó la entrega válida más baja con 32.4. Kimi K3 no produjo un resultado puntuado, mientras que MiniMax M3 falló una condición estructural obligatoria.
La media fue de 51.5 después de que las ejecuciones inválidas y faltantes se convirtieran a cero. Debido a que el flujo de trabajo requería un mapa de cobertura y 100 cuentas calificadas, la puntuación reflejó el rendimiento en cientos de afirmaciones y clasificaciones individuales en lugar de una lista corta de hallazgos.
El rendimiento varió según el flujo de trabajo
Kimi K3 obtuvo 60 en análisis competitivo y no presentó una lista de cuentas válida. Sonnet 5 mostró el patrón inverso: su salida de análisis competitivo fue inválida, mientras que su entrega de lista de cuentas obtuvo 67.6.
Estos casos muestran por qué importan los resultados a nivel de tarea. El análisis competitivo enfatiza la comparación semántica y la verificación de ausencia; la preparación de la lista de cuentas impone mayores exigencias a la investigación sostenida, la resolución de entidades, la gestión de fuentes y la construcción de archivos.
Para los equipos de marketing, la implicación práctica es clara: elija modelos en función del flujo de trabajo que se va a automatizar y luego pruébelos frente al formato de salida y al estándar de evidencia requeridos.
Las tareas de la vida real utilizadas en el benchmark
Estas tareas de marketing agentivo incluyen cobertura de estrategia y contenido, crecimiento e investigación de ventas. Cada una requiere investigación web, validación de fuentes, calificación basada en reglas y salida estructurada.
Tarea 1: Análisis de brechas competitivas
El modelo actúa como un analista de estrategia que compara AIMultiple con otras plataformas de investigación y benchmarking.
El agente revisa ambos sitios web e identifica las ofertas que la otra plataforma proporciona pero de las que AIMultiple carece. Las categorías válidas son: arena, benchmark, evaluation_format, content, methodology, dataset y other.
La tarea permite hasta diez brechas. Cada fila CSV contiene la brecha, su categoría, una explicación, una página en vivo que demuestre que la oferta de la competencia existe, las páginas de AIMultiple verificadas y una puntuación de prioridad.
Cuando AIMultiple ofrece una oferta relacionada, el modelo debe nombrarla y explicar la diferencia restante. Una amplia superposición de categorías por sí sola no establece equivalencia.
Cómo puntuamos la tarea
La clave de respuestas oculta contiene diez brechas verificadas y un conjunto de afirmaciones de ausencia falsas conocidas. Cada brecha respaldada añade uno a A_encontradas, mientras que cada brecha incorrecta añade uno a B_incorrectas. La puntuación es: MAX(0, A_encontradas – B_incorrectas) / 10
Una URL fabricada, inaccesible o no respaldada elimina el crédito por la brecha relacionada y añade una penalización por precisión. Este diseño hace que la expansión especulativa de listas sea costosa, ya que añadir una afirmación plausible puede reducir la puntuación final.
La salida también debe pasar las compuertas estructurales a nivel de ejecución. El CSV necesita el nombre de archivo y las columnas correctas, entre 1 y 10 filas, valores de categoría aceptados, dominios válidos, celdas atómicas y un orden descendente de prioridad. El fallo en cualquier compuerta invalida la entrega.
Tarea 2: Preparación de la lista de cuentas de mejor ajuste
El modelo actúa como un especialista en marketing de crecimiento que prepara una lista de marketing basado en cuentas para AIMultiple.
El trabajo comienza con un mapa de cobertura de las páginas en vivo de AIMultiple. El agente registra páginas de categoría, benchmarks y páginas de comparación de proveedores, así como los proveedores mencionados en los cuerpos de los artículos y en las divulgaciones de patrocinio.
A continuación, prepara una lista priorizada de 100 cuentas. Cada empresa debe ser un proveedor de tecnología B2B con ingresos anuales entre $100 millones y $1 mil millones, con sede en los EE. UU., Europa o Israel, y activa en una categoría cubierta por AIMultiple. La empresa también necesita una señal de marketing de crecimiento actual y al menos una página de AIMultiple donde represente una oportunidad comercial genuina.
El archivo de cuentas registra el dominio de la empresa, la página de LinkedIn, la sede, la categoría, los ingresos y la fuente, el número de empleados, el año de fundación, el estado de financiación o propiedad, las páginas relevantes de AIMultiple, la señal de marketing y la puntuación de ajuste.
Las empresas matrices y las subsidiarias no pueden aparecer ambas para la misma oportunidad de proveedor. Las reglas también excluyen a las empresas de servicios, las empresas de consumo, las empresas de analistas o de reseñas, y los candidatos que no cumplan con los requisitos de ingresos o sede.
Cómo puntuamos la tarea
La rúbrica contiene 71 puntos en siete secciones. La sección del mapa de cobertura verifica si el modelo revisó al menos 30 páginas en vivo de AIMultiple e incluyó todos los tipos de página requeridos. Los revisores muestrean filas para confirmar que los proveedores nombrados y las divulgaciones de patrocinio coinciden con las páginas en vivo.
La sección del archivo de cuentas requiere exactamente 100 dominios distintos, las columnas especificadas, clasificaciones aceptadas, puntuaciones de ajuste descendentes y campos de evidencia completos. Luego se utiliza una muestra fija de 20 cuentas para realizar comprobaciones detalladas que cubren los ingresos, la identidad de LinkedIn, la sede real, el ajuste de categoría, la evidencia de marketing de crecimiento y el estado de proveedor B2B.
Otras secciones prueban si las páginas propuestas son oportunidades genuinas, penalizan las cuentas descalificadas o inventadas, recompensan la inclusión de empresas de alto ajuste verificadas y comprueban si los modelos evitan los casi aciertos conocidos.
Un archivo de cuentas faltante, columnas incorrectas o cualquier recuento de filas distinto de 100 invalida la ejecución.
Metodología del benchmark de marketing agentivo
Construimos ambos benchmarks a partir de flujos de trabajo utilizados por nuestros equipos de estrategia y crecimiento.
La tarea de análisis competitivo respalda las decisiones sobre la cobertura de productos, las prioridades de contenido y el posicionamiento. La tarea de lista de cuentas respalda el marketing basado en cuentas y la investigación de ventas.
Para cada flujo de trabajo, creamos un archivo de tareas que define:
- el rol del modelo
- las herramientas disponibles
- los requisitos de evidencia
- las reglas de calificación
- las salidas requeridas
- el límite de tiempo
Diseñamos las tareas en torno a nuestras propias páginas y flujos de trabajo comerciales, y nuestros datos forman parte de la clave de respuestas. Esto facilita la verificación de la evidencia, aunque también limita la amplitud con la que los resultados se aplican a otras empresas y entornos de marketing.
Instrucciones de la tarea y rúbricas de puntuación
Para el análisis competitivo, los modelos podían investigar la web en vivo a través de Bright Data MCP. Desactivamos la ejecución de código y establecimos un límite de 90 minutos.
Para la preparación de la lista de cuentas, los modelos utilizaron el mismo acceso web, con la ejecución de código habilitada. Permitimos hasta 240 minutos porque la tarea requería dos archivos de salida y 100 cuentas calificadas.
Le dimos a cada modelo las instrucciones de la tarea y el esquema de salida, mientras mantuvimos oculta la rúbrica de puntuación.
Los modelos tuvieron que usar fuentes actuales
Ambas tareas dependen de información que cambia con el tiempo, incluidas las ofertas de los sitios web, los inventarios de benchmarks, las páginas de productos, los ingresos de las empresas, las sedes, la propiedad, las divulgaciones de patrocinio y la actividad de marketing.
Contamos una URL cuando se resolvía y respaldaba la afirmación adjunta. La página de inicio de una empresa no podía respaldar una cifra de ingresos específica, y una base de datos de marketing genérica no podía probar que una plataforma ofreciera un formato de benchmark en particular. Verificamos por última vez las claves de respuesta el 7 de julio de 2026.
Las salidas se diseñaron para uso operativo
Ambas tareas requieren archivos CSV con columnas fijas y celdas atómicas. Este formato nos permite comprobar automáticamente si faltan campos, duplicados, categorías no válidas, dominios no admitidos, recuentos de filas incorrectos, valores mal formados y errores de ordenación.
También refleja cómo los equipos de marketing utilizan estos resultados. Las listas de cuentas y los análisis competitivos a menudo se trasladan a hojas de cálculo, flujos de trabajo de CRM, bases de datos internas o herramientas de automatización. Un archivo estructuralmente inválido puede bloquear el siguiente paso incluso cuando partes de la investigación son correctas.
Informamos puntuaciones de una sola ejecución sin varianza
Los resultados incluyen una puntuación informada por modelo. Actualmente no informamos ejecuciones repetidas, semillas, intervalos de confianza ni barras de error.
Por lo tanto, los lectores deben tratar las pequeñas diferencias de puntuación con precaución. En el análisis competitivo, una brecha neta correcta adicional cambia la puntuación en diez puntos. En la preparación de la lista de cuentas, unas pocas filas muestreadas pueden determinar si un criterio completo basado en umbrales se aprueba o no.
Combinamos comprobaciones deterministas con un juez LLM
Los scripts deterministas se encargaron de todo lo que el software puede resolver directamente: existencia de archivos, análisis sintáctico de CSV, orden de columnas, recuentos de filas, valores aceptados, dominios de URL, duplicados y ordenación. Los scripts también obtuvieron cada URL citada, siguieron las redirecciones y pasaron el contenido de la página resuelta al juez.
Un juez LLM puntuó los criterios semánticos, si dos ofertas son equivalentes, si una afirmación de ausencia se mantiene, si una empresa encaja en una categoría, si una página obtenida respalda la afirmación que se le atribuye y si una página propuesta es una oportunidad genuina.
El juez puntuó una fila o una brecha a la vez según las reglas de aprobación o fallo de la rúbrica, y los scripts agregaron esos juicios en los criterios de umbral (por ejemplo, ≥18 de 20 filas muestreadas). Nunca asignó una calificación de calidad general. Nuestros propios analistas construyeron y congelaron la clave de respuestas: las cuentas de oro, las trampas y las transcripciones de divulgación de patrocinio, el 7 de julio de 2026; el juez aplicó esa clave en lugar de formar su propia opinión sobre lo que debería contar.
Esto nos permitió puntuar dos archivos largos y con mucha evidencia, pero conlleva un riesgo: un juez puede aceptar una fuente que leyó con demasiada generosidad, que es el mismo modo de fallo que la rúbrica penaliza en los modelos. Estos resultados utilizan una sola pasada de evaluación, sin verificación de acuerdo entre múltiples jueces y sin calibración con una muestra puntuada por humanos.
Preguntas frecuentes
El marketing agentivo implica el uso de agentes impulsados por IA para planificar y completar tareas de marketing de varios pasos con una mínima intervención humana. Estos agentes utilizan datos de clientes, reglas comerciales, contexto en tiempo real e instrucciones en lenguaje natural para tomar decisiones a lo largo de los flujos de trabajo de marketing.
La automatización de marketing tradicional ejecuta reglas predefinidas, como enviar un correo electrónico después del envío de un formulario o mover un lead entre segmentos de audiencia. Los sistemas agentivos pueden interpretar un objetivo comercial, seleccionar las herramientas necesarias, completar la configuración de la campaña, monitorear el rendimiento de la campaña y ajustar las acciones para optimizar el rendimiento.
Una plataforma de marketing agentivo puede apoyar tareas como:
– analizar el comportamiento de los clientes e identificar segmentos de audiencia;
– adaptar los recorridos del cliente en función de nuevas señales;
– asignar el gasto publicitario entre las campañas de marketing;
– generar contenido dentro de las directrices de la marca;
– coordinar flujos de trabajo creativos y preservar la dirección creativa;
– producir información generada por IA para la optimización del recorrido;
– mover datos entre herramientas desconectadas en una nube de marketing;
– asignar tareas específicas a múltiples agentes.
El análisis de brechas competitivas requiere evidencia de ambos lados de cada hallazgo. El modelo debe confirmar que la plataforma competidora proporciona una oferta específica. Luego debe inspeccionar las páginas relevantes de AIMultiple y determinar si existe un equivalente.
El segundo paso requiere una exploración más amplia del sitio. La evidencia relevante puede aparecer en una página de benchmark, una página de categoría, un artículo, una página de herramienta o una entrada del mapa del sitio.
La similitud semántica añade otro desafío. Dos ofertas pueden abordar el mismo mercado amplio mientras utilizan diferentes formatos de evaluación o metodologías. El agente debe decidir si la diferencia crea una brecha significativa.
La rúbrica también penaliza los hallazgos especulativos. Un comportamiento de búsqueda amplio puede mejorar el recall y aumentar el número de afirmaciones de ausencia falsas. Un comportamiento conservador puede proteger la precisión y omitir las brechas esperadas.
Las dos tareas evalúan diferentes combinaciones de capacidades. El análisis competitivo requiere investigación comparativa, juicio semántico y una verificación cuidadosa de la ausencia.
La preparación de la lista de cuentas requiere investigación web sostenida, calificación repetida, resolución de entidades, gestión de fuentes y un control de salida exacto.
Un modelo puede rendir bien en una tarea de comparación corta, pero no completar un archivo grande y estructurado. Otro modelo puede manejar la investigación repetida de cuentas y fallar una compuerta estructural en el análisis competitivo.
Por lo tanto, la selección de modelos para el marketing agentivo debe considerar los flujos de trabajo de marketing específicos que un equipo planea automatizar.
Cita esta investigación
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{ermut2026,
author = {Ermut, Sıla and Kalelioğlu, Berk},
title = {{Benchmark AIM de Marketing Agentivo}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/agentic-marketing}},
note = {AIMultiple. Recuperado el 17 de Julio de 2026}
}
Sé el primero en comentar
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.