Las empresas usan LLMs a diario para sus tareas habituales. Para encontrar los LLMs más rentables, diseñamos AIM Enterprise, un benchmark empresarial agéntico, donde usamos 69 tareas empresariales en diferentes categorías.
Resultados del benchmark de tareas empresariales
Cada modelo entregó un archivo por tarea. Las puntuaciones son relativas: los jueces clasifican cada respuesta frente a las otras respuestas de la misma tarea, por lo que la puntuación media es 50 por diseño. Un 55 significa que las respuestas de un modelo quedaron por encima de la mayoría de las demás, no que el 55 % de su trabajo fuera correcto.
Dos modelos terminaron claramente por delante. Claude Opus 5 obtuvo 66.4 y GPT 5.6 Sol 62.4, más de 7 puntos por encima de la configuración en tercer lugar. Su ventaja no depende de qué tareas elegimos: volvimos a puntuar la tabla de clasificación 4.000 veces en re-selecciones aleatorias de las 69 tareas, y esos dos ocuparon el primer y segundo lugar en cada ocasión.
Los nueve modelos siguientes puntuaron entre 51.4 y 55.3. Sesenta y nueve tareas no pueden separar puntuaciones tan cercanas, por lo que su orden cambia según qué tareas se cuenten. Kimi K3 es la excepción de ese grupo, ya que terminó por encima de Claude Sonnet 5 en el 94 % de las repuntuaciones.
Opus 5 también ganó las tareas más difíciles. Tomamos las 17 tareas con la puntuación media más baja entre las 16 configuraciones, fijadas por esa regla antes de calcular la posición de nadie en ellas, y Opus 5 superó a las otras 15 configuraciones en ese subconjunto.
Opus 5 no tiene tareas débiles. Su mejor puntuación, 80.6, es la más alta que logró cualquiera, y la peor, 52.9, sigue superando a una respuesta media. Puntuó por encima de 60 en 62 de las 69 tareas y terminó primero en 43 de ellas. GPT 5.6 Sol ganó 13 tareas y ningún otro modelo ganó más de cuatro.
Los dos modelos de puntuación no coincidieron sobre cuál de los líderes debería quedar primero. Cada uno puso en lo más alto el modelo de su propia empresa, por lo que el orden publicado combina ambas clasificaciones.
Coste y puntuación
El coste cubre las 11 configuraciones facturadas por ejecución. Cinco configuraciones, incluidos ambos líderes, se ejecutaron en suscripciones que no registran ningún cargo por ejecución.
La configuración de pago con mejor puntuación es también la más barata. GPT 5.6 Luna obtuvo 55.3 a $0.032 por tarea, justo por debajo de DeepSeek V4 Flash a $0.033. Claude Sonnet 5 obtuvo 53.2 a $1.46, es decir, 46 veces el coste y 2.1 puntos menos.
Pagar más aporta poco aquí. En las 11 configuraciones de pago, la correlación entre el coste por tarea y la puntuación es 0.48. Kimi K3 a $0.92 y Qwen 3.8 Max a $0.74 puntuaron en el mismo rango que Luna a $0.03.
Una ejecución rápida es una señal de advertencia, pero una lenta no demuestra nada. En las 16 configuraciones, la correlación entre el tiempo por tarea y la puntuación es 0.55, y los cuatro más rápidos fueron cuatro de los cinco con peor puntuación. Inkling Small terminó una tarea en 49 segundos y quedó penúltimo. Entre los nueve modelos agrupados en la zona media, que tardaron entre 127 y 569 segundos, esa correlación cae a −0.06.
Los costes son lo que facturó el arnés según su lista de precios empaquetados, no una cotización. Los precios de lista de los proveedores están en nuestra comparativa de precios de LLM. Los intentos fallidos cuentan en el total de un modelo, pero no en su cifra por tarea, y los dos difieren más en Grok 4.5: $26.14 gastados frente a $22.84 de ejecuciones entregadas.
Desacuerdo entre jueces
Dos modelos puntuaron cada archivo y a menudo no estuvieron de acuerdo. En aproximadamente un tercio de las puntuaciones individuales, los dos quedaron separados por más de un cuarto de la escala, y nadie ha revisado esas filas.
Coincidieron en los extremos y no en la zona media. Ambos colocaron a Opus 5 y a GPT 5.6 Sol por encima de todos los demás, pero 11 de las 16 configuraciones quedan en una posición distinta según a qué modelo de puntuación sigas.
Cada tarea se ejecutó una vez y se puntuó una vez. Un modelo que no produjo ningún archivo se ejecutó de nuevo, pero ningún archivo se puntuó dos veces, por lo que ningún resultado provino de elegir el mejor de dos intentos.
Una septuagésima tarea, un manual de gestión de consultas, se deja fuera de todas las cifras aquí. Su archivo de entrada faltaba en tiempo de ejecución y solo una configuración llegó a producir un archivo para ella.
Benchmark de marketing de AIM
El mismo método se aplica al trabajo de marketing: encontrar ofertas que un competidor publica y AIMultiple no, crear una lista de cuentas de mejor ajuste y producir una presentación de ventas personalizada. Cada tarea se puntúa de 0 a 100 y la puntuación general es la media de las tres. Una auditoría de reputación de sitios web se ejecuta junto a ellas y se informa en sus propios ejes, porque no tiene una puntuación máxima fija.
Resultados completos: el benchmark de marketing agéntico.
Benchmark de TI de AIM
Se pidió a doce modelos que inventaran un benchmark, lo construyeran y pasaran a cuatro modelos por él, dos veces cada uno. Ninguno de los 24 intentos superó todos los criterios, y seis de las comprobaciones de la rúbrica no fueron superadas por ninguno de ellos. Claude Opus 5 lideró en texto a SQL con 78.2 y Kimi K3 en llamadas a herramientas con 74.3.
Resultados completos: si los LLMs pueden diseñar un benchmark.
Benchmark de capital riesgo de AIM
Se pidió a trece modelos que nombraran a los clientes de una empresa con evidencia fechada, en tres empresas objetivo. Claude Opus 5 obtuvo 89.1 de 100 y Claude Fable 5 85.0, y esos dos fueron los únicos que se mantuvieron por encima de 76 en los tres objetivos. La mayoría de los demás se hundieron en el objetivo cuyos clientes se nombran en lecturas de anuncios de podcasts en lugar de páginas indexadas.
Resultados completos: el benchmark de listas de clientes.
Metodología
Las 69 tareas fueron redactadas por el fundador de AIMultiple a partir de decisiones empresariales reales y se asignaron a los identificadores del APQC Process Classification Framework.
1Cubren estrategia (16 tareas), marketing (15), RR. HH. (7), ventas (6), operaciones (5), TI y finanzas (4 cada una) y siete áreas menores. Cada tarea nombra su entregable: un results.csv con una lista fija de columnas, normalmente 10 filas y 8 columnas, con una regla explícita para cada campo entero.
Cómo se ejecutaron los modelos
Trece modelos se ejecutaron en 16 configuraciones; una configuración es un modelo bajo un programa de agente. Once se ejecutaron en opencode 1.15.13 a través de OpenRouter. El resto se ejecutó en los programas de agente que distribuyen sus propios proveedores, Claude Code y Codex, facturados contra suscripciones.
Cada configuración recibió el mismo prompt congelado, acceso web en vivo a través de una API de extracción y un límite de dos horas. Los prompts nunca se ajustaron por modelo, y las rúbricas de puntuación nunca llegaron a la máquina que ejecutó las tareas.
Eso produjo 1.104 archivos, uno por modelo y tarea. Seis configuraciones de opencode omitieron 25 celdas en la primera pasada porque la búsqueda de archivos del agente recorrió rutas que su propio sandbox luego se negó a abrir, lo que detuvo la ejecución. Volver a ejecutar esas 25 en un directorio aislado recuperó todas, por lo que la entrega se informa tanto como tasa de primera pasada como final. Contando cada reinicio, 83 de las 759 celdas con registros de uso necesitaron más de un intento.
Cómo funcionan las verificaciones y los jueces
Las comprobaciones deterministas se ejecutan primero y ningún juez ve un archivo que las suspenda: conjunto de columnas y recuento de filas, análisis RFC 4180,
2formato de enteros, sin celdas vacías, sin filas duplicadas y el orden de clasificación donde la tarea lo exija.
Un archivo que falla obtiene cero en lugar de descartarse, porque un archivo que nadie puede analizar es un resultado. DeepSeek V4 Flash falló en 6 de sus 69 archivos, Inkling Small en 2, MiniMax M3 y GPT 5.6 Terra en uno cada uno. Eliminar cada tarea donde falló alguna configuración deja intactos a los dos líderes y la forma general.
Los 1.094 archivos que pasaron fueron a dos jueces: GPT 5.6 Sol a través de la CLI de Codex y Claude Opus 5 a través de la CLI de Claude Code, ambos con un alto esfuerzo de razonamiento y acceso web en vivo.
Cada columna del entregable va a su propio subagente, que ve las respuestas de esa columna de todos los modelos y nada más, con identificadores de fila anónimos barajados por separado para cada juez. El juez clasifica esas respuestas entre sí y no puede declarar iguales a dos. Las dos clasificaciones se combinan sumando la posición de cada respuesta según cada juez. Eso produjo 90.530 puntuaciones.
La anonimización no es cosmética. Medido con los nombres de los modelos visibles, Sol clasificó las respuestas de GPT 8.4 percentiles por encima de donde Opus las clasificó, y Opus clasificó las respuestas de Anthropic 4.9 percentiles por encima de donde Sol las clasificó. No elimina el efecto: las ejecuciones detrás de esta tabla de clasificación estaban anonimizadas y cada juez aun así puso primero la configuración de su propia empresa.
Cómo funciona la puntuación
La puntuación de un modelo es la suma de sus promedios de columna, reescalada para que el total más alto posible sea 100. Ese techo depende de cuántos modelos superaron las comprobaciones, por eso estas puntuaciones se comparan dentro de este benchmark y en ningún otro lugar.
Para comprobar cuánto depende la clasificación de la selección de tareas, volvimos a puntuar la tabla 4.000 veces, cada vez con una nueva selección aleatoria de las 69 tareas. Eso mide solo la sensibilidad a las tareas. No mide cuánto movería una repetición de la misma tarea una puntuación, porque ninguna tarea se puntuó dos veces.
El cuarto más difícil son las 17 tareas con la puntuación media más baja entre las 16 configuraciones. Esa regla se fijó antes de calcular la posición de cualquier modelo en esas tareas.
Doce de los 13 modelos de aquí también se ejecutan en los otros benchmarks anteriores, por lo que su orden se mantiene a lo largo de la serie. Las cifras no, porque cada benchmark establece su propia escala.
Este benchmark no se puede recortar como los demás. Cada puntuación es una posición relativa a los modelos contra los que se ejecutó, por lo que eliminar una configuración volvería a puntuar a todas las demás en lugar de quitar una barra. Qwen 3.8 Max se ejecuta solo en este benchmark y permanece en el gráfico por esa razón.
Preguntas frecuentes
No con esta evidencia. La escala es relativa, por lo que incluso la puntuación máxima de 66.4 solo dice que las respuestas de un modelo quedaron por encima de las demás, y las filas donde los dos modelos de puntuación discrepan sustancialmente no se han revisado. Los proveedores que crean este tipo de agente figuran en nuestro desglose de empresas de IA para empresas, y AIMultiple automatiza procesos como estos.
Porque nueve de ellos están realmente cerca, y 69 tareas no pueden separar diferencias inferiores a unos 1.5 puntos. El benchmark distingue modelos fuertes de modelos débiles, no un modelo de mitad de tabla del siguiente.
No para la calidad de la salida, en los tres casos que pudimos probar. Tres modelos se ejecutaron cada uno bajo dos programas de agente y ninguna pareja difirió en más de 0.83 puntos. La diferencia apareció en cambio en las operaciones: solo las configuraciones de opencode perdieron celdas por un conflicto de sandbox, y solo los programas facturados por suscripción no dejaron registro de uso.
Cita esta investigación
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{kalelioglu2026,
author = {Kalelioğlu, Berk},
title = {{AIM Enterprise: Benchmark Empresarial Agéntico}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/agentic-enterprise}},
note = {AIMultiple. Recuperado el 14 de Agosto de 2026}
}
Sé el primero en comentar
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.