Premium
Servicios
Premium

AIM Enterprise: Benchmark empresarial agéntico

Berk Kalelioğlu
Berk Kalelioğlu
actualizado el 17 de sept. de 2026

Las empresas usan LLM todos los días para sus tareas habituales. Para encontrar los LLM más rentables, diseñamos AIM Enterprise, un benchmark empresarial agéntico, donde usamos 69 tareas empresariales reales en estrategia, marketing, RR. HH., ventas y operaciones.

Resultados del benchmark

Cargando gráfico
  • Opus 5 obtuvo una puntuación más alta en 39 tareas y Astra en 30. Los cuatro primeros, con Claude Fable 5.1 y Grok 4.6, abarcan 2.9 puntos.
  • Astra lideró en 23 tareas, Opus 5 en 22 y Fable 5.1 en 16.
  • Claude Fable 5.1 superó a Claude Fable 5 en 63 de 69 tareas y promedió 7.2 puntos más. GPT 6 Astra promedió 8.8 puntos más que GPT 5.6 Sol y lo superó en 61.
  • Claude Sonnet 5 cuesta $1,23 por tarea. Gemini 3.8 Flash obtuvo 1.5 puntos más por $0,61, y Grok 4.6 obtuvo 13 puntos más por $1.09.

Coste y puntuación

  • GPT 6 Astra y Claude Opus 5 cuestan aproximadamente lo mismo, $1,76 y $1,73 por tarea, y sus puntuaciones distan 1.6 puntos.
  • GPT 5.6 Luna obtuvo 45.2 a $0,016 por tarea, 18.7 puntos por debajo de Claude Opus 5 a menos del uno por ciento de su coste.
  • GPT 5.6 Sol obtiene 53.5 a $0,167 por tarea. Grok 4.6 obtiene 7.5 puntos más y cuesta 6.5 veces más.
  • Claude Fable 5.1 es el modelo más caro del gráfico, a $3,19 por tarea, y obtiene 1.8 puntos menos que Claude Opus 5, que cuesta $1.73.
  • En los 16 modelos del gráfico, el coste por tarea y la puntuación correlacionan en 0.68. El tiempo medio por tarea y la puntuación correlacionan en 0.04. El modelo más rápido, Inkling Small con 66 segundos por tarea, ocupa el último lugar.

Desacuerdo entre jueces

Dos modelos jueces puntuaron cada archivo que superó las comprobaciones. En el 32,7 % de las puntuaciones individuales, los dos difirieron en más de una cuarta parte de la escala y nadie ha revisado esas filas.

Ambos jueces situaron las mismas cuatro configuraciones entre los cuatro primeros puestos y a los mismos dos en los últimos; 12 de las 17 configuraciones se ordenan de forma distinta según cada juez.

Cada juez puso primero el modelo de su propia empresa. GPT 5.6 Sol clasificó a GPT 6 Astra primero y a Claude Opus 5 segundo; Opus 5 se clasificó a sí mismo primero y a Astra cuarto. El orden publicado combina ambas clasificaciones.

Benchmark de AIM Marketing

El mismo método se aplica al trabajo de marketing: encontrar ofertas que publica un competidor y AIMultiple no, crear una lista de cuentas de mejor ajuste y producir una presentación de ventas personalizada. Cada tarea se puntúa de 0 a 100 y la puntuación global es la media de las tres. Una auditoría de reputación del sitio web se ejecuta junto a ellas y se informa en sus propios ejes, porque no tiene una puntuación máxima fija.

Resultados completos: el benchmark de marketing agéntico.

Deja que nuestro equipo automatice uno de tus procesos de negocio con agentes de IA, sin coste alguno.
Automatizar un proceso

Benchmark de TI de AIM

Doce modelos ejecutaron dos veces una tarea de diseño de benchmarks, inventando un benchmark, construyéndolo y haciendo pasar a cuatro modelos por él. Ninguno de los 24 intentos superó todos los criterios, y seis de las comprobaciones de la rúbrica no fueron superadas por ninguno de ellos. Claude Opus 5 lideró en texto a SQL con 78.2 y Kimi K3 en llamadas a herramientas con 74.3.

Resultados completos: pueden los LLM diseñar un benchmark.

Benchmark de VC de AIM

Se pidió a trece modelos registrados que nombraran a los clientes de una empresa con evidencia fechada, en tres empresas objetivo. Claude Opus 5 obtuvo 89.1 de 100 y Claude Fable 5 85.0, y esos dos fueron los únicos que se mantuvieron por encima de 76 en los tres objetivos según la puntuación. La mayoría de los demás obtuvieron la puntuación más baja en el objetivo cuyos clientes aparecen en publicidad de podcasts en lugar de en páginas indexadas.

Resultados completos: el benchmark de listas de clientes.

No te pierdas nuestros análisis comparativos e insights basados en datos. El botón abre Google; seleccionar AIMultiple confirma que deseas ver AIMultiple con más frecuencia en los resultados de búsqueda de Google.
GoogleAñadir como fuente preferida

Plataformas empresariales agénticas

Las empresas también pueden usar LLM a través de software empresarial. Las plataformas siguientes conectan modelos de proveedores como OpenAI, Anthropic y Google con registros de CRM, flujos de trabajo y agentes predefinidos.

Creatio

Creatio es una plataforma de CRM y flujos de trabajo con agentes de IA predefinidos.

Agentes por departamento: Los agentes disponibles dependen de las aplicaciones que una empresa tenga instaladas. Ejemplos:

  • Agente de Ventas: enriquece los datos de las cuentas, completa los campos de oportunidad después de las reuniones de Zoom y se prepara para nuevas reuniones.
  • Agente de Conocimiento: redacta artículos de la base de conocimiento a partir de casos resueltos.
  • Agente de segmentación: convierte descripciones de audiencia en lenguaje sencillo en segmentos de marketing.

Un modelo separado por agente, incluidos los autoalojados: Cada agente o subagente puede usar su propio modelo. Las opciones compatibles son OpenAI, Azure OpenAI y proveedores compatibles con LiteLLM, incluidos modelos en la propia infraestructura de la empresa. Los escenarios de agente requieren al menos una ventana de contexto de 40.000 tokens y llamada de funciones.

Salesforce Agentforce

Agentforce es la capa de agentes del CRM de Salesforce.

Modelos: Los agentes usan modelos habilitados para Salesforce de socios, incluidos Anthropic, Google y OpenAI. Las empresas también pueden conectar su propia cuenta de LLM, y el modelo predeterminado de un agente se puede cambiar.

Capa de confianza de Einstein: Las llamadas a modelos pasan por una capa que Salesforce afirma que incluye detección de toxicidad, acuerdos de cero retención de datos y defensa contra la inyección de prompts.

Transferencia a una persona: “Transferir a un agente humano” es una de las acciones que un agente puede elegir. Esto permite que una conversación pase a una persona cuando un proceso no puede tolerar errores.

Microsoft Copilot Studio

Copilot Studio es la herramienta de Microsoft para crear agentes para Microsoft 365 y Power Platform.

Modelos: Los modelos de OpenAI son los predeterminados. Los creadores también pueden añadir modelos externos de Anthropic, xAI o Mistral.

Etiquetas de producción: Microsoft marca algunos modelos como experimentales o de vista previa y desaconseja usarlos en producción. Los agentes publicados que usan estos modelos se siguen facturando a las tarifas estándar.

Respaldo: Si un administrador desactiva los modelos de Anthropic, los agentes creados con ellos cambian automáticamente al modelo predeterminado de OpenAI.

Metodología

Las 69 tareas fueron redactadas por el fundador de AIMultiple a partir de decisiones reales de empresas y se asignaron a los ID del Marco de Clasificación de Procesos de APQC.1

Cubren estrategia (16 tareas), marketing (15), RR. HH. (7), ventas (6), operaciones (5), TI y finanzas (4 cada una) y siete áreas más pequeñas. Cada tarea nombra el archivo que desea: un results.csv con una lista fija de columnas, normalmente 10 filas y 8 columnas, con una regla explícita para cada campo entero.

Cómo se ejecutaron los modelos

Dieciséis modelos se ejecutaron en 17 configuraciones, cada configuración consistente en un modelo bajo un programa de agente. Ocho se ejecutaron en opencode 1.15.13 a través de OpenRouter. Los otros nueve usaron Claude Code, Codex o Grok Build, los programas de agente de sus propios proveedores. Todos ellos facturaron contra suscripciones.

Fable 5.1 se ejecutó en Claude Code 2.1.258 mientras que las otras tres configuraciones de Claude se ejecutaron en 2.1.220; Astra se ejecutó en Codex 0.153.4 mientras que las tres configuraciones de GPT 5.6 se ejecutaron en 0.146.0. Gemini 3.8 Flash se ejecutó en la misma compilación de opencode que el resto.

Cada configuración recibió el mismo prompt congelado, acceso web en vivo a través de una API de scraping y un límite de una hora. Los prompts nunca se ajustaron por modelo, y las rúbricas de puntuación nunca llegaron a la máquina que ejecutó las tareas.

Nadie eligió un nivel de razonamiento. Cada configuración se ejecutó con el valor predeterminado de su programa de agente, y los predeterminados no corresponden a un único nivel:

Claude Code aplica por defecto el nivel alto en todos los modelos que ejecutó. Codex envía el valor predeterminado del catálogo de cada modelo. Eso es bajo para GPT 5.6 Sol y medio para Luna, Terra y GPT 6 Astra. Grok Build ejecutó Grok 4.6 en alto. opencode deja el nivel al proveedor, por lo que sus ocho configuraciones se ejecutaron con el valor predeterminado de OpenRouter de cada modelo.

Un nivel de razonamiento predeterminado más alto no se tradujo en una puntuación más alta. En el gráfico de 16 modelos, los tres modelos cuyo valor predeterminado está por encima de alto ocupan los puestos 9, 11 y 14: GLM 5.3 en máximo, Qwen 3.8 Max en xhigh y Kimi K3 en máximo. Claude Sonnet 5 se ejecutó tanto con una CLI del proveedor como con opencode y obtuvo 47.9 y 47.5.

Cada cifra de coste aquí se recalcula a partir del uso registrado de tokens con los precios de lista de OpenRouter congelados el 27 de agosto de 2026. Los tokens de razonamiento se facturan como tokens de salida, que es como OpenRouter los cobra. GPT 6 Astra y Gemini 3.8 Flash se incorporaron más tarde y usan las tarifas de OpenRouter leídas el 5 de septiembre de 2026; Claude Fable 5.1 usa las tarifas publicadas de Anthropic de la misma fecha, porque OpenRouter no lo incluye.

Los costes de Claude Code también aplican tres reglas publicadas de Anthropic que una lista plana de precios no incluye. La caché de prompts de una hora cuesta el doble de la tarifa de entrada, mientras que una caché de cinco minutos cuesta 1.25 veces la tarifa de entrada. La búsqueda web cuesta $10 por cada mil solicitudes. Se incluye el subagente Haiku 4.5 que Claude Code ejecuta junto al modelo principal.

Las propias cifras de coste de los programas de agente no son comparables. Cada ejecución se realizó bajo una suscripción, por lo que ninguna configuración tiene una factura por ejecución. Cuando un programa informa de un coste, valora sus propios tokens según su propia lista. opencode utiliza una lista de precios incluida. Grok Build usa una lista de xAI a aproximadamente un tercio de la tarifa pública. Codex no informa de nada. Claude Code valoró Sonnet 5 a $3 y $15 por millón de tokens, la tarifa de Claude Sonnet 4.6, mientras que Sonnet 5 está a $2 y $10.

Las ejecuciones produjeron 1.140 archivos de un total de 1.173 pares de configuración-tarea. Un archivo ausente recibe una puntuación de cero y no se vuelve a ejecutar, a menos que la ejecución alcanzara el límite de una hora o terminara con un error del proveedor del modelo; cada excepción permite un reintento.

Cinco ejecuciones se bloquearon y cuatro entregaron en el reintento. Dieciocho ejecuciones terminaron con un error del proveedor, un 502 o 504 de la API o una respuesta corrupta. Una ya había escrito su archivo; las otras 17 se volvieron a ejecutar y 16 entregaron. Una ejecución alcanzó tanto el límite de tiempo como un error del proveedor.

Ocho ejecuciones de Qwen 3.8 Max terminaron cuando el guardián de bucle de opencode impidió que el modelo repitiera la misma llamada de herramienta por tercera vez. Ninguna otra configuración activó el guardián. Esas ejecuciones no se volvieron a ejecutar, y cuatro de ellas no produjeron ningún archivo. Cada archivo se puntuó una sola vez, de modo que ningún resultado procede de elegir el mejor de dos intentos.

Cómo funcionan las comprobaciones y los jueces

Las comprobaciones deterministas se ejecutan primero y ningún juez ve un archivo que no las supere: conjunto de columnas y recuento de filas, análisis de RFC 4180,2

formato de enteros, sin celdas vacías, sin filas duplicadas y orden de clasificación cuando la tarea lo requiera.

Un archivo que falla recibe una puntuación de cero en lugar de descartarse. MiniMax M3 falló en 8 de los 64 archivos que entregó, seis de ellos porque el CSV no se podía analizar, y GPT 5.6 Luna y GPT 5.6 Terra fallaron en uno cada uno. Eliminar cada tarea en la que alguna configuración obtuvo cero deja 38 tareas y el mismo líder.

Los 1.130 archivos que pasaron se enviaron a dos jueces: GPT 5.6 Sol a través de la CLI de Codex y Claude Opus 5 a través de la CLI de Claude Code, ambos con un alto esfuerzo de razonamiento y acceso web en vivo.

Cada columna del archivo va a su propio subagente, que ve las respuestas de esa columna de todos los modelos y nada más, bajo ID de fila anónimos barajados por separado para cada juez. El juez clasifica esas respuestas entre sí y no puede considerar iguales a dos. Las dos clasificaciones se combinan sumando la posición de cada respuesta según cada juez. Eso produjo 93.490 puntuaciones.

Medido con los nombres de los modelos visibles, Sol clasificó las respuestas de GPT 8.4 puntos percentiles por encima de donde las clasificó Opus, y Opus clasificó las respuestas de Anthropic 4.9 puntos percentiles por encima de donde las clasificó Sol. En la ejecución anonimizada que respalda esta tabla de clasificación, Sol clasificó a GPT 6 Astra primero y Opus clasificó a Claude Opus 5 primero.

Cómo funciona la puntuación

La puntuación de un modelo es la suma de sus promedios por columna, reescalada de modo que el total más alto posible sea 100. Ese techo depende de cuántos modelos superaron las comprobaciones, por lo que estas puntuaciones solo se comparan dentro de este benchmark y en ningún otro lugar.

Para comprobar cuánto depende la clasificación de la selección de tareas, volvimos a puntuar la tabla de clasificación 4.000 veces, cada vez con una nueva selección aleatoria de las 69 tareas. Eso mide únicamente la sensibilidad a las tareas. No mide cuánto movería la puntuación una repetición de la misma tarea, porque ninguna tarea se puntuó dos veces.

El cuarto más difícil son 17 tareas, las de menor puntuación media entre las 17 configuraciones. Cinco tareas empatan en los últimos cuatro puestos, y Opus 5 tiene el promedio más alto en las cinco selecciones posibles. Esa regla se fijó antes de calcular la posición de cualquier modelo en esas tareas.

Diez de los 16 modelos también aparecen en los benchmarks anteriores. Sus puntuaciones no son comparables entre benchmarks, porque cada uno establece su propia escala.

Cada configuración aquí se puntúa según su posición relativa a los modelos contra los que se ejecutó, por lo que eliminar una configuración cambia todas las demás puntuaciones. Por la misma razón, estas puntuaciones no se comparan con la ejecución anterior de este benchmark, que puntuó un campo diferente. Solo se puede comparar el orden de las configuraciones entre ejecuciones.

Gemini 3.7 Flash se ejecutó en este campo y se eliminó cuando Gemini 3.8 Flash completó, según la regla de que un modelo sale una vez que su sucesor se ha ejecutado. La misma regla retiró a Grok 4.5 y GLM 5.2.

Preguntas frecuentes

No con esta evidencia. La escala es relativa, de modo que incluso la puntuación más alta de 63.9 solo significa que las respuestas de un modelo se clasificaron por encima de las demás, y las filas en las que los dos modelos de puntuación discrepan sustancialmente no han sido revisadas. Los proveedores que crean este tipo de agente aparecen en nuestro desglose de empresas de IA empresarial, y AIMultiple automatiza procesos como estos.

Siete de ellos obtienen entre 45.2 y 49.4, más cerca de lo que 69 tareas pueden separar. Los cuatro primeros también están a menos de 2.9 puntos entre sí. El benchmark separa los modelos fuertes de los débiles; volver a muestrear las tareas reordena ambos grupos.

Un modelo se ejecutó bajo ambos programas en esta ejecución y obtuvo 47.9 con Claude Code y 47.5 con opencode. Una sola comparación no da una respuesta general. Los gráficos muestran el resultado de Claude Code. La configuración de opencode leyó 4.5 veces más contexto en caché y produjo 1.2 veces más tokens de salida, incluido el razonamiento. Costó $1,59 por tarea, en comparación con $1,23 para Claude Code, cuya cifra ya incluye un subagente que opencode no ejecuta.

Cita este benchmark

Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.

Berk Kalelioğlu (2026) - "AIM Enterprise: Benchmark empresarial agéntico". Publicado en línea en AIMultiple.com. Recuperado el 17 de septiembre de 2026, de: https://aimultiple.com/agentic-enterprise [Recurso en línea]

Kalelioğlu, B. (2026, 17 de septiembre). AIM Enterprise: Benchmark empresarial agéntico. AIMultiple. https://aimultiple.com/agentic-enterprise

@misc{kalelioglu2026,
  author = {Kalelioğlu, Berk},
  title  = {{AIM Enterprise: Benchmark empresarial agéntico}},
  year   = {2026},
  month  = sep,
  howpublished    = {\url{https://aimultiple.com/agentic-enterprise}},
  note   = {AIMultiple. Recuperado el 17 de septiembre de 2026}
}
Descargar todos los datos

Resultados y marcas de tiempo de 33 puntos de datos. Descargue los datos resumidos que se muestran en los gráficos y las tablas de este artículo como un archivo ZIP que contiene 2 archivos CSV y un README.

Última actualización: 25 de septiembre de 2026
Descargar

¿Quieres los datos granulares que hay detrás? Únete a Premium

Registro de cambios

1 actualizaciones
  1. Se añadió a la sección de metodología una tabla del esfuerzo de razonamiento por modelo y programa agente.

Berk Kalelioğlu
Berk Kalelioğlu
Investigador de IA
Berk es Investigador de IA en el equipo de benchmark de AIMultiple, centrándose en IA agéntica, aprendizaje automático y los models de lenguaje grandes y pequeños (LLMs y SLMs).
Ver perfil completo

Sé el primero en comentar

Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.

0/450