Presentamos el Benchmark de Marketing Agéntico AIM, que mide el rendimiento de los agentes en tres flujos de trabajo de marketing: análisis de brechas competitivas, preparación de lista de objetivos ABM y una presentación de ventas personalizada.
También realizamos una auditoría de reputación del sitio web por separado, en la que los agentes examinaron el contenido en inglés de AIMultiple e informaron de problemas verificables relacionados con la precisión factual, las citas, la coherencia, la actualidad, la funcionalidad, la gramática y el formato que podrían socavar la confianza de los lectores.
Resultados del benchmark de marketing agéntico
Las puntuaciones de las tareas se normalizan a una escala de 0–100.
- Para el análisis competitivo, la puntuación es igual a: 100 × MAX(0, brechas verificadas encontradas − brechas incorrectas) / 10
- Para la preparación de la lista de cuentas, la puntuación es el porcentaje de los 71 puntos disponibles de la rúbrica obtenidos por el modelo.
- Para la tarea del deck de ventas, la puntuación es la suma de 5 secciones de 20 puntos.
- La puntuación global es la media aritmética de las puntuaciones de análisis competitivo, lista de cuentas y deck de ventas. La auditoría de reputación del sitio web no contribuye a esta puntuación global. La auditoría se informa en sus propios ejes en lugar de una puntuación única.
A diferencia de las tres tareas normalizadas, la auditoría no tiene una puntuación máxima fija. Por lo tanto, incluimos los resultados en una evaluación separada y no los combinamos con el benchmark global.
Lea la metodología para obtener más información sobre la evaluación de las tareas.
Las tareas reales utilizadas en el benchmark
Estos flujos de trabajo de marketing agéntico cubren la cobertura de estrategia y contenido, el crecimiento, la investigación de ventas, la creación de contenido personalizado y el aseguramiento de la calidad del sitio web. Cada uno requiere investigación en vivo, validación de fuentes, juicio basado en reglas y un resultado que pueda integrarse en un flujo de trabajo operativo.
Tarea 1: Análisis de brechas competitivas
El modelo actúa como analista de estrategia en AIMultiple y lo compara con una plataforma de benchmarking de IA competidora. La ejecución permite 90 minutos de tiempo de ejecución y acceso web en vivo a través del Bright Data MCP, con la ejecución de código deshabilitada.
El resultado es un único archivo que contiene hasta 10 filas, ordenadas por prioridad. Cada fila nombra una oferta que el competidor publica pero AIMultiple no, explica la diferencia en una o dos frases, cita la página del competidor que el modelo abrió y enumera las páginas de AIMultiple que examinó antes de afirmar la ausencia.
La afirmación de ausencia es la mitad más difícil de cada hallazgo. Identificar una característica en el sitio del competidor requiere una sola página. Establecer que AIMultiple no la proporciona requiere revisar las páginas de categoría, los benchmarks, los artículos y el sitemap.
Cuando AIMultiple publica una oferta adyacente, el modelo debe nombrar esa página y especificar qué hace de manera diferente la versión del competidor. La cobertura del mismo tema amplio no establece una oferta equivalente.
Cómo puntuamos la tarea
La puntuación se realiza comparando con una clave de respuestas compilada manualmente: diez brechas verificadas en ambos sitios, junto con las afirmaciones de ausencia que las páginas en vivo de AIMultiple refutan.
Cada brecha verificada suma un punto, y cada afirmación de ausencia incorrecta descuenta uno. Una afirmación incorrecta incluye cualquier fila cuya URL sea inventada, inaccesible o no respalde la afirmación adjunta.
La clave contiene diez brechas, pero un modelo puede encontrar una real que no esté en ella. Un revisor lee esos hallazgos manualmente y otorga el punto si la página citada muestra la oferta, ninguna página en vivo de AIMultiple contradice la afirmación y la oferta realmente falta en AIMultiple.
Dos reglas limitan estos puntos adicionales:
- Un hallazgo que repita una de las diez brechas existentes con palabras diferentes no obtiene nada adicional. En su lugar, se acredita bajo la brecha listada.
- Un hallazgo que no supere la revisión cuesta un punto. Si AIMultiple publica la oferta, o el competidor no la tiene, la fila puntúa cero, la misma penalización que cualquier otra afirmación incorrecta.
Esto evita que la clave penalice un hallazgo que los analistas no registraron, al tiempo que retiene el crédito de afirmaciones especulativas.
Como última parte de la evaluación, el revisor realiza comprobaciones de enlaces. Las comprobaciones de enlaces siguen las redirecciones y evalúan el destino final, por lo que un 301 no hace fallar una fila por sí mismo. Un nombre de archivo incorrecto, columnas faltantes o desordenadas, un recuento de filas fuera de uno a diez, una prioridad fuera de 1 a 10, una URL de evidencia en el dominio equivocado o filas fuera de orden invalidan la ejecución, y una ejecución inválida no recibe puntuación numérica.
Tarea 2: Preparación de lista de cuentas de mejor ajuste
El modelo actúa como un especialista en marketing de crecimiento que prepara una lista de marketing basado en cuentas para AIMultiple.
El trabajo comienza con un mapa de cobertura de las páginas en vivo de AIMultiple. El agente registra páginas de categoría, benchmarks y páginas de comparación de proveedores, así como los proveedores mencionados en los cuerpos de los artículos y en las divulgaciones de patrocinio.
A continuación, prepara una lista priorizada de 100 cuentas. Cada empresa debe ser un proveedor de tecnología B2B con ingresos anuales entre $100 millones y $1 mil millones, con sede en EE. UU., Europa o Israel, y activa en una categoría cubierta por AIMultiple. La empresa también necesita una señal actual de marketing de crecimiento y al menos una página de AIMultiple donde represente una oportunidad comercial genuina.
El archivo de cuentas registra el dominio de la empresa, la página de LinkedIn, la sede, la categoría, los ingresos y la fuente, el número de empleados, el año de fundación, el estado de financiación o propiedad, las páginas relevantes de AIMultiple, la señal de marketing y la puntuación de ajuste.
Las empresas matrices y las filiales no pueden aparecer ambas para la misma oportunidad de proveedor. Las reglas también excluyen a las empresas de servicios, los negocios de consumo, las empresas de análisis o revisión, y los candidatos que no cumplan con los requisitos de ingresos o sede.
Cómo puntuamos la tarea
La rúbrica contiene 71 puntos distribuidos en siete secciones. La sección del mapa de cobertura comprueba si el modelo revisó al menos 30 páginas en vivo de AIMultiple e incluyó cada tipo de página requerido. Los revisores muestrean filas para confirmar que los proveedores nombrados y las divulgaciones de patrocinio coinciden con las páginas en vivo.
La sección del archivo de cuentas requiere exactamente 100 dominios distintos, las columnas especificadas, clasificaciones aceptadas, puntuaciones de ajuste descendentes y campos de evidencia completos. A continuación, se utiliza una muestra fija de 20 cuentas para comprobaciones detalladas que cubren los ingresos, la identidad de LinkedIn, la sede real, el ajuste de categoría, la evidencia de marketing de crecimiento y el estado de proveedor B2B.
Otras secciones evalúan si las páginas propuestas son aperturas genuinas, penalizan las cuentas descalificadas o inventadas, recompensan la inclusión de empresas verificadas de alto ajuste y comprueban si los modelos evitan los casi aciertos conocidos.
Un archivo de cuentas faltante, columnas incorrectas o cualquier recuento de filas distinto de 100 invalida la ejecución.
Tarea 3: Presentación de ventas personalizada
Nota: Excluimos a Kimi K3 y Gemini 3.5 Flash porque cada uno solicitó acceso a un directorio fuera de su carpeta de trabajo; el entorno denegó la solicitud automáticamente y ambas ejecuciones terminaron allí. Ninguno produjo una presentación y ninguno falló la tarea, ya que no se juzgó nada de lo que produjeron. Un cero pondría un problema de infraestructura en el registro del modelo, por lo que ambos se marcan como no ejecutados y se excluyen del promedio.
El modelo actúa como analista de preventa en AIMultiple y construye una presentación para un ejecutivo senior de marketing de producto. La ejecución incluye 90 minutos, acceso web en vivo a través del Bright Data MCP, ejecución de código y una carpeta de activos de marca que contiene los logotipos y las fuentes.
La mayor parte de la investigación se centra en el ejecutivo más que en la empresa. Este ejecutivo dirige el marketing de una sola línea de productos y ha declarado públicamente qué cuenta al juzgar el hardware: cuántos tokens se obtienen por dólar, si un tercero independiente comprobó las cifras y si la prueba se asemejaba a una carga de trabajo real o a una demo.
Otro argumento recurrente es que un rack es una unidad de comparación más justa que un chip. Dado que estos argumentos son públicos y se pueden encontrar en entrevistas, charlas de conferencias y publicaciones, la tarea consiste en leerlos y luego encontrar los benchmarks de AIMultiple que los responden. Una presentación puede ser precisa sobre AIMultiple y aun así no abordar a la persona en absoluto, y esa es la versión que obtiene una puntuación baja.
Aquí hay algunos resultados de Fable 5, Gemini 3-1 pro-preview y GPT 5.6 Sol:
Cómo puntuamos la tarea
La presentación se puntúa en cinco aspectos, cada uno con un valor de 20 puntos: si sigue la identidad visual de AIMultiple, si cita los benchmarks correctos, si propone próximos pasos útiles, si explica lo que AIMultiple vale para el destinatario y si las diapositivas son claras. Cada uno de los cinco se desglosa en pequeñas comprobaciones con respuestas fijas.
La identidad visual es la única parte que un modelo puede acertar sin hacer ninguna investigación. Los archivos de logotipo, el valor hexadecimal del color de acento, los colores del texto, la tipografía y la ortografía del nombre de la empresa son correctos o no lo son. Por ejemplo, una presentación configurada en Calibri pierde los puntos.
La segunda parte evalúa a qué apunta la presentación hoy. AIMultiple publica muchos artículos sobre hardware, y algunos de ellos prueban el tipo de chips que esta persona vende. Por lo tanto, los puntos van para una presentación que cite estudios de GPU para centros de datos en lugar de las páginas de hardware que aparecieron primero.
La tercera sección trata sobre el trabajo que AIMultiple podría hacer a continuación. Una sugerencia cuenta aquí si nombra el estudio y la cifra que produciría. Por ejemplo, volver a ejecutar una comparación existente con los chips de este año o añadir el hardware de la empresa a un benchmark que actualmente lo excluye gana un punto. En cambio, proponer que las dos empresas analicen juntas el rendimiento de inferencia no nombra ni un estudio ni una medición, por lo que no gana puntos.
La cuarta parte se refiere a lo que AIMultiple vale para el destinatario. Se otorgan puntos por tres afirmaciones que:
- AIMultiple es independiente
- Su audiencia tiene un tamaño declarado respaldado por una fuente nombrada
- Esta audiencia sirve a un propósito específico para el negocio del destinatario, como llegar a compradores en la etapa de preselección
Una presentación que enumera lo que AIMultiple publica sin conectar nada de ello con los productos propios del destinatario no gana puntos.
La quinta parte cubre si la presentación se puede leer. Dos comprobaciones importan más que el resto: los titulares deben declarar una conclusión en lugar de etiquetar la diapositiva, y las cifras deben decir de dónde provienen, manteniendo las cifras de la empresa separadas de las mediciones propias de AIMultiple. El resto es mecánico, como evaluar el número de diapositivas, el desbordamiento de texto, las etiquetas de gráficos, el contenido de relleno.
Cuatro de las cinco partes también conllevan penalizaciones. Un benchmark inventado, una cifra inventada, un enlace roto o presentar la afirmación de marketing propia de la empresa como una medición de AIMultiple cuesta puntos. Prometer resultados favorables, clasificación preferente o una revisión antes de la publicación también cuesta puntos, ya que AIMultiple no ofrece nada de eso. La presentación debe persuadir sin fabricar evidencia y sin ofrecer nada que el negocio no venda.
Tarea 4: Auditoría de reputación del sitio web
El modelo actúa como auditor de calidad y reputación del sitio web para AIMultiple. La ejecución permite 120 minutos, acceso web en vivo a través del Bright Data MCP y ejecución de código.
El agente comienza obteniendo el sitemap de publicaciones de AIMultiple y excluyendo las URL con prefijos de idioma alemán, español, francés, italiano, portugués o turco. Debe examinar al menos 100 URL restantes en inglés.
Para cada página, el agente busca problemas que podrían dañar la credibilidad de AIMultiple. Estos pueden incluir información inconsistente entre páginas, enlaces rotos, afirmaciones desactualizadas, errores factuales, mala gramática o formato, citas faltantes, afirmaciones engañosas, funcionalidad rota y contenido de relleno genérico generado por IA.
El resultado es un archivo Results.csv que contiene como máximo 50 filas. Cada fila debe describir un problema distinto y deduplicado, y agregar todas las URL donde ocurre ese problema.
Cada fila registra:
- el ID del problema;
- prioridad;
- severidad;
- número de URL afectadas;
- URL afectadas;
- evidencia textual exacta citada;
- una explicación del problema reputacional;
- y una solución recomendada.
El archivo debe estar ordenado por prioridad de mayor a menor.
Cómo puntuamos la tarea
La prioridad se calcula como: Prioridad = Severidad × Número de URL afectadas
La severidad utiliza cuatro niveles:
- 4: Errores factuales, funcionalidad rota u otros problemas que pueden causar un daño reputacional significativo.
- 3: Inconsistencias entre páginas, información desactualizada, fuentes faltantes, enlaces rotos o contenido de relleno estilo IA.
- 2: Problemas graves de gramática o formato.
- 1: Problemas menores de gramática, formato o estilo que no afectan la legibilidad.
Una fila cuenta cuando supera todas las comprobaciones aplicables. Los scripts deterministas se ejecutan primero. Comprueban la estructura del archivo y la coherencia interna de cada fila, y resuelven la evidencia de cada fila con la página a la que se atribuye.
A continuación, un panel de modelos de tres proveedores revisa las filas que los scripts conservaron. El panel trabaja con una copia fechada de cada página en lugar del sitio en vivo, por lo que un defecto que el sitio haya corregido desde entonces no se cuenta en contra del modelo que lo encontró.
Por último, se comprueba el envío completo en busca de hallazgos duplicados y problemas demasiado amplios para ser verificados. Por ejemplo, "problemas de citas" es demasiado general para una fila, mientras que "enlaces de citas rotos" es un problema suficientemente específico.
La auditoría informa cuántas de las filas de un modelo sobrevivieron a la verificación, junto con la proporción de sus filas enviadas que sobrevivieron. Un modelo que envía un archivo inválido o ninguna fila de datos válida se registra como que no entregó nada. Vea el rendimiento de cada modelo a continuación:
Metodología del benchmark de marketing agéntico
Construimos el benchmark original a partir de tres flujos de trabajo utilizados por nuestros equipos de estrategia, crecimiento y ventas. Luego añadimos una auditoría de reputación del sitio web que representa el aseguramiento de la calidad del contenido y la gobernanza editorial.
La tarea de análisis competitivo apoya las decisiones sobre la cobertura de productos, las prioridades de contenido y el posicionamiento. La tarea de lista de cuentas apoya el marketing basado en cuentas y la investigación de ventas. La presentación de ventas apoya el alcance de preventa: seleccionar un prospecto, determinar qué benchmarks publicados importan y construir el documento.
La auditoría de reputación del sitio web apoya el mantenimiento del contenido y la confianza. Identifica evidencia rota, información obsoleta, inconsistencias entre páginas, problemas factuales, fallos de funcionalidad y defectos editoriales.
Para cada flujo de trabajo, creamos un archivo de tarea que define:
- el rol del modelo
- las herramientas disponibles
- los requisitos de evidencia
- las reglas de calificación
- los resultados requeridos
- el límite de tiempo
Diseñamos las tareas en torno a nuestras propias páginas y flujos de trabajo comerciales, y nuestros datos forman parte de la clave de respuestas. Esto hace que la evidencia sea más fácil de verificar, aunque también limita la amplitud con la que los resultados se aplican a otras empresas y entornos de marketing.
Instrucciones de las tareas y rúbricas de puntuación
Para el análisis competitivo, los modelos podían investigar la web en vivo a través del Bright Data MCP. Deshabilitamos la ejecución de código y establecimos un límite de 90 minutos.
Para la preparación de la lista de cuentas, los modelos utilizaron el mismo acceso web, con la ejecución de código habilitada. Permitimos hasta 240 minutos porque la tarea requería dos archivos de salida y 100 cuentas calificadas.
Para la preparación de la presentación de ventas, habilitamos el mismo acceso web con ejecución de código. La duración fue de 90 minutos, con una carpeta de activos de marca en el directorio de trabajo.
Para la auditoría de reputación del sitio web, los modelos utilizaron acceso web en vivo a través del Bright Data MCP con ejecución de código habilitada. Permitimos hasta 120 minutos, ya que la tarea requería rastrear y analizar al menos 100 páginas. El resultado requerido era un único CSV que contenía como máximo 50 grupos de problemas deduplicados.
Entregamos a cada modelo las instrucciones de la tarea y el esquema de salida, manteniendo la rúbrica de puntuación oculta.
Los modelos tuvieron que usar fuentes actuales
Los cuatro flujos de trabajo dependen de información que puede cambiar. Esto incluye las ofertas del sitio, los inventarios de benchmarks, las páginas de productos, los ingresos de las empresas, las sedes, la propiedad, las divulgaciones de patrocinio, la actividad de marketing, las declaraciones públicas, el contenido de los artículos, las citas y los destinos de los enlaces.
Contamos una URL cuando se resolvía y respaldaba la afirmación adjunta a ella. Una página de inicio de empresa no puede respaldar una cifra de ingresos específica, y una página que contiene una frase similar no puede respaldar un hallazgo de auditoría a menos que la cita enviada y el defecto descrito estén presentes.
Las claves de respuestas para las tareas de análisis competitivo y lista de cuentas se verificaron por última vez el 7 de julio de 2026. La rúbrica de la presentación de ventas se verificó el 25 de julio de 2026, y las presentaciones se puntuaron al día siguiente.
La auditoría de reputación del sitio web no utilizó una lista fija de problemas esperados. Cada hallazgo enviado se comprobó con las páginas en vivo de AIMultiple en el momento de la puntuación. Esto es necesario porque el sitio web se actualiza continuamente y un problema que existía durante una ejecución puede corregirse más tarde.
Los resultados se diseñaron para uso operativo
Las tareas de análisis competitivo, lista de cuentas y reputación del sitio web requieren archivos CSV con columnas fijas y celdas atómicas. Esto nos permite comprobar automáticamente campos faltantes, duplicados, dominios no admitidos, recuentos de filas incorrectos, valores mal formados, errores aritméticos y problemas de ordenación.
La tarea de la presentación de ventas requiere un archivo PowerPoint de 16:9 que se abra sin un aviso de reparación.
Los análisis competitivos y las listas de cuentas pueden trasladarse a hojas de cálculo, flujos de trabajo de CRM y herramientas de automatización. El resultado de la auditoría de reputación puede trasladarse a un gestor de incidencias editorial o de ingeniería. La presentación puede enviarse a un prospecto después de su revisión.
Un archivo estructuralmente inválido bloquea el siguiente paso operativo incluso cuando parte de la investigación que contiene es útil. Por esta razón, la entrega de archivos y el cumplimiento del esquema forman parte del benchmark en lugar de ser requisitos administrativos externos al mismo.
Informamos puntuaciones de una sola ejecución sin varianza
Los resultados incluyen una puntuación informada por modelo. Actualmente no informamos ejecuciones repetidas, semillas, intervalos de confianza ni barras de error.
Por lo tanto, los lectores deben tratar las pequeñas diferencias de puntuación con precaución. En el análisis competitivo, una brecha correcta neta adicional cambia la puntuación en diez puntos. En la preparación de la lista de cuentas, unas pocas filas muestreadas pueden determinar si se supera un criterio completo basado en umbrales.
Combinamos comprobaciones deterministas con un juez LLM
Los scripts deterministas manejaron todo lo que el software puede resolver directamente: existencia de archivos, análisis de CSV, orden de columnas, recuentos de filas, valores aceptados, dominios de URL, duplicados, ordenación y, para la presentación, integridad del archivo, dimensiones de diapositivas y declaraciones de fuentes. Los scripts también obtuvieron cada URL citada, siguieron las redirecciones y pasaron el contenido de la página resuelta al juez.
Un juez LLM puntuó los criterios semánticos fila por fila, brecha por brecha o criterio por criterio, aplicando reglas de aprobado/reprobado, y nunca asignó una calificación de calidad general. Nuestros analistas construyeron las claves de respuestas y el juez las aplicó.
El análisis competitivo añade un paso humano. Un modelo puede informar de una brecha real que la clave no enumera, por lo que esos hallazgos van a un analista, que los acredita después de comprobar ambos sitios.
Cita esta investigación
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{ermut2026,
author = {Ermut, Sıla and Kalelioğlu, Berk},
title = {{Benchmark de Marketing Agéntico AIM}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/agentic-marketing}},
note = {AIMultiple. Recuperado el 5 de Agosto de 2026}
}
Sé el primero en comentar
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.