Las empresas usan LLM a diario para sus tareas habituales. Para encontrar los LLM más rentables, diseñamos AIM Enterprise, un benchmark empresarial agéntico, donde utilizamos 69 tareas empresariales reales de estrategia, marketing, RR. HH., ventas y operaciones.
Resultados del benchmark
- Claude Opus 5 (66.4) y GPT 5.6 Sol (62.4) terminaron más de 7 puntos por delante del tercer lugar y ocuparon los dos primeros puestos en todas las 4.000 repuntuaciones al volver a seleccionar aleatoriamente las tareas.
- Opus 5 ganó 43 de las 69 tareas y Sol ganó 13. Ningún otro modelo ganó más de cuatro.
- Opus 5 también tuvo el promedio más alto en las 17 tareas más difíciles, 66.2 frente a 62.3 de Sol.
- Los seis modelos siguientes obtuvieron entre 51.4 y 55.2. Es una diferencia menor que la que pueden separar 69 tareas, por lo que su orden cambia con la selección de tareas.
Costo y puntuación
- GPT 5.6 Luna obtuvo 55.2 a $0,040 por tarea. Eso está 7 puntos por debajo del mejor modelo del gráfico a un diecisieteavo de su costo.
- En los 11 modelos con precio, el costo por tarea y la puntuación correlacionan en 0.71.
- En las 16 configuraciones, la correlación entre el tiempo por tarea y la puntuación es de 0.55. Los cuatro más rápidos fueron cuatro de los cinco con peor puntuación, e Inkling Small terminó una tarea en 49 segundos y quedó penúltimo.
- Kimi K3 a $0,652 y Qwen 3.8 Max a $0,628 cuestan aproximadamente lo que cuesta GPT 5.6 Sol a $0,670, y obtienen 8 y 11 puntos menos.
Desacuerdo de los jueces
Dos modelos jueces puntuaron cada archivo y a menudo no coincidieron. En aproximadamente un tercio de las puntuaciones individuales, los dos quedaron a más de un cuarto de la escala de distancia, y nadie ha revisado esas filas.
Coincidieron en los extremos y no en el medio. Ambos pusieron a Opus 5 y GPT 5.6 Sol por encima de todos los demás, pero 11 de las 16 configuraciones quedan en una posición diferente según el modelo de puntuación que se siga.
Los dos también discreparon sobre qué líder va primero, y cada uno colocó el modelo de su propia empresa en la cima. El orden publicado combina ambas clasificaciones.
AIM Marketing benchmark
El mismo método se aplica al trabajo de marketing: encontrar ofertas que un competidor publica y AIMultiple no, crear una lista de cuentas que mejor se ajuste y producir una presentación de ventas personalizada. Cada tarea se puntúa de 0 a 100 y la puntuación global es la media de las tres. Una auditoría de reputación del sitio web se ejecuta junto con ellas y se informa en sus propios ejes, porque no tiene una puntuación máxima fija.
Resultados completos: el benchmark de marketing agéntico.
AIM IT benchmark
Doce modelos ejecutaron cada uno dos veces una tarea de diseño de benchmark, inventando un benchmark, construyéndolo y pasando cuatro modelos por él. Ninguno de los 24 intentos superó todos los criterios, y seis de las comprobaciones de la rúbrica no fueron superadas por ninguno de ellos. Claude Opus 5 lideró en texto a SQL con 78.2 y Kimi K3 en llamadas a herramientas con 74.3.
Resultados completos: ¿Pueden los LLM diseñar un benchmark?.
AIM VC benchmark
Se pidió a trece modelos del gráfico que nombraran a los clientes de una empresa con evidencia fechada, en tres empresas objetivo. Claude Opus 5 obtuvo 89.1 de 100 y Claude Fable 5 85.0, y esos dos fueron los únicos que se mantuvieron por encima de 76 en los tres objetivos según la puntuación. La mayoría de los demás obtuvieron la puntuación más baja en el objetivo cuyos clientes aparecen en publicidad de podcasts en lugar de en páginas indexadas.
Resultados completos: el benchmark de lista de clientes.
Metodología
Las 69 tareas fueron redactadas por el fundador de AIMultiple a partir de decisiones reales de empresa y se asignaron a los IDs del Marco de Clasificación de Procesos de APQC.1
Cubren estrategia (16 tareas), marketing (15), RR. HH. (7), ventas (6), operaciones (5), TI y finanzas (4 cada una) y siete áreas menores. Cada tarea indica el archivo que desea: un results.csv con una lista fija de columnas, normalmente 10 filas y 8 columnas, con una regla explícita para cada campo entero.
Cómo se ejecutaron los modelos
Trece modelos se ejecutaron en 16 configuraciones, siendo una configuración un modelo bajo un programa agente. Once se ejecutaron en opencode 1.15.13 a través de OpenRouter. El resto se ejecutó en los programas agente que distribuyen sus propios proveedores, Claude Code y Codex, facturados contra suscripciones.
Cada configuración recibió el mismo prompt congelado, acceso web en vivo a través de una API de extracción y un límite de dos horas. Los prompts nunca se ajustaron por modelo, y las rúbricas de puntuación nunca llegaron a la máquina que ejecutó las tareas.
Nadie eligió un nivel de razonamiento. Cada configuración se ejecutó con el valor predeterminado de su programa agente, y los valores predeterminados no son un único nivel:
Claude Code 2.1.220 viene con nivel alto para los dos modelos que ejecutó y Codex registró nivel alto en cada ejecución. opencode no elige nada y deja el nivel en manos del proveedor, por lo que esos ocho se sitúan en el valor predeterminado de cada modelo.
Un valor predeterminado de razonamiento más alto no se tradujo en una puntuación más alta. Los dos modelos que por defecto están por encima de alto, Kimi K3 en máximo y Qwen 3.8 Max en muy alto, terminaron en los puestos 4 y 8 de 13. Los tres modelos que se ejecutaron tanto en una CLI de proveedor como en opencode quedan a menos de 0.83 puntos de sí mismos.
Cada cifra de costo aquí se recalcula a partir de los tokens que una ejecución movió realmente, según los precios de lista de OpenRouter leídos el 19 de agosto de 2026, con la entrada en caché facturada a la tarifa de caché.
La facturación propia de los programas agente no sería comparable. opencode factura según su propia lista de precios integrada, y las ejecuciones de Claude Code y Codex se facturan contra suscripciones que no registran ningún cargo por ejecución. Las dos configuraciones de Claude Code no conservaron ningún registro de uso y no se pueden valorar en absoluto.
Eso produjo 1.104 archivos, uno por configuración y por tarea. Seis configuraciones de opencode perdieron 25 ejecuciones en la primera pasada porque la búsqueda de archivos del agente recorrió rutas que luego su propio sandbox se negó a abrir, lo que detuvo la ejecución. Volver a ejecutar esas 25 en un directorio aislado recuperó todas, por lo que la entrega se informa tanto como tasa de primera pasada como final. Cada tarea se ejecutó una vez y se puntuó una vez. Un modelo que no produjo ningún archivo se volvió a ejecutar, pero ningún archivo se puntuó dos veces, por lo que ningún resultado provino de elegir el mejor de dos intentos.
Una septuagésima tarea, un manual de gestión de consultas, se deja fuera de todas las cifras aquí. Su archivo de entrada faltaba en tiempo de ejecución y solo una configuración llegó a producir un archivo para ella. Contando cada reinicio, 83 de las 759 ejecuciones con registros de uso necesitaron más de un intento.
Cómo funcionan las comprobaciones y los jueces
Las comprobaciones deterministas se ejecutan primero y ningún juez ve un archivo que no las supere: conjunto de columnas y número de filas, análisis RFC 4180,2
formato de enteros, sin celdas vacías, sin filas duplicadas y orden de clasificación cuando la tarea lo requiera.
Un archivo que falla obtiene cero en lugar de descartarse. DeepSeek V4 Flash falló en 6 de sus 69 archivos, Inkling Small en 2, MiniMax M3 y GPT 5.6 Terra en uno cada uno. Eliminar cada tarea en la que falló alguna configuración deja a los dos líderes en su lugar.
Los 1.094 archivos que pasaron fueron a dos jueces: GPT 5.6 Sol a través de la CLI de Codex y Claude Opus 5 a través de la CLI de Claude Code, ambos con esfuerzo de razonamiento alto y acceso web en vivo.
Cada columna del archivo va a su propio subagente, que ve las respuestas de esa columna de todos los modelos y nada más, bajo identificadores de fila anónimos barajados por separado para cada juez. El juez clasifica esas respuestas entre sí y no puede considerar iguales a dos. Las dos clasificaciones se combinan sumando la posición de cada respuesta según cada juez. Eso produjo 90.530 puntuaciones.
Medido con los nombres de los modelos visibles, Sol clasificó las respuestas de GPT 8.4 percentiles por encima de donde Opus las clasificó, y Opus clasificó las respuestas de Anthropic 4.9 percentiles por encima de donde Sol las clasificó. La anonimización no elimina el efecto. Las ejecuciones detrás de esta tabla de clasificación fueron anonimizadas, y cada juez aun así puso primero la configuración de su propia empresa.
Cómo funciona la puntuación
La puntuación de un modelo es la suma de sus promedios de columna, reescalada para que el total más alto posible sea 100. Ese techo depende de cuántos modelos superaron las comprobaciones, por lo que estas puntuaciones se comparan dentro de este benchmark y en ningún otro lugar.
Para comprobar cuánto depende la clasificación de la selección de tareas, repuntuamos la tabla de clasificación 4.000 veces, cada vez con una nueva selección aleatoria de las 69 tareas. Eso mide solo la sensibilidad a las tareas. No mide cuánto movería una puntuación volver a ejecutar la misma tarea, porque ninguna tarea se puntuó dos veces.
El cuartil más difícil son las 17 tareas con la puntuación promedio más baja en todas las 16 configuraciones. Esa regla se fijó antes de calcular la posición de cualquier modelo en esas tareas.
Doce de los 13 modelos también aparecen en los benchmarks anteriores. Sus puntuaciones no se trasladan, porque cada benchmark establece su propia escala.
Cada puntuación aquí es una posición relativa a los modelos con los que compitió, de modo que eliminar una configuración repuntuaría todo lo demás en lugar de quitar una barra. Qwen 3.8 Max solo se ejecuta en este benchmark y permanece en el gráfico por esa razón.
Preguntas frecuentes
No con esta evidencia. La escala es relativa, por lo que incluso la puntuación máxima de 66.4 solo dice que las respuestas de un modelo se clasificaron por encima de las demás, y las filas en las que los dos modelos de puntuación discrepan sustancialmente no se han revisado. Los proveedores que crean este tipo de agente figuran en nuestro desglose de empresas de IA empresarial, y AIMultiple automatiza procesos como estos.
Porque seis de ellos están realmente cerca, y 69 tareas no pueden separar diferencias de menos de aproximadamente 1.5 puntos. El benchmark separa los modelos fuertes de los débiles. El remuestreo de tareas reordena a los seis del medio.
No para la calidad de salida, en los tres casos que pudimos probar. Tres modelos se ejecutaron cada uno bajo dos programas agente y ningún par difirió en más de 0.83 puntos, aunque las CLI de los proveedores razonaron en alto y las ejecuciones de opencode tomaron el valor predeterminado del proveedor. Los gráficos dibujan el programa propio del proveedor para esos tres. La diferencia apareció en cambio en las operaciones: solo las configuraciones de opencode perdieron ejecuciones por un conflicto de sandbox, y solo Claude Code no dejó registro de uso.
Cita este benchmark
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{kalelioglu2026,
author = {Kalelioğlu, Berk},
title = {{AIM Enterprise: Benchmark empresarial agéntico}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/agentic-enterprise}},
note = {AIMultiple. Recuperado el 24 de Agosto de 2026}
}Registro de cambios
1 actualizaciones- 2026
Se añadió a la sección de metodología una tabla del esfuerzo de razonamiento por modelo y programa agente.
Sé el primero en comentar
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.