Benchmarks de LLM
Un único Índice de Inteligencia transparente que combina benchmarks públicos con las propias evaluaciones agénticas, de RAG y de razonamiento empresarial de AIMultiple.
Clasificación
Los modelos con mayor puntuación en todos los benchmarks.
# | Modelo | Índice | LegalBench | FinanceReasoning | Text-to-SQL | Agentic RAG | ARC-AGI-2 | Agentic LLM Benchmark | FrontierMath | Swe-Bench |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 Anthropic | 92 | 89 | 90 | 90 | 98 | - | 69 | - | - |
| 2 | Kimi K3 Moonshot AI | 88 | 86 | 88 | 77 | 93 | - | 73 | - | - |
| 3 | GPT-5.6 Sol OpenAI | 87 | 87 | 90 | 74 | 87 | 93 | 62 | - | - |
| 4 | Grok 4.5 X | 86 | 86 | 88 | 79 | 83 | - | 73 | - | - |
| 5 | GPT-5.5 OpenAI | 83 | 87 | - | - | - | 85 | 59 | - | - |
| 6 | GPT-5.6 Terra OpenAI | 80 | 85 | 87 | 71 | 91 | 84 | 61 | - | - |
| 7 | GPT-5.6 Sol Pro OpenAI | 80 | - | 91 | 79 | 96 | - | 54 | - | - |
| 8 | Claude Opus 4.6 Anthropic | 78 | - | 88 | 68 | 80 | 69 | 72 | - | - |
| 9 | Gemini 3 Pro Preview Google | 77 | 87 | 86 | 60 | 89 | 31 | - | - | - |
| 10 | Gemini 3.1 Pro Preview Google | 77 | 87 | 87 | 65 | 89 | 77 | 46 | 27 | - |
Página 1 de 7 | ||||||||||
Gráficos
Modelos siguiendo "Mejor rendimiento"
Cómo se construye el índice
El Índice de Inteligencia normaliza cada benchmark a una escala de 0 a 100 y promedia la posición relativa de un modelo en los benchmarks en los que se evaluó. Cada benchmark a continuación alimenta esa puntuación.
Actualizaciones recientes
Últimos cambios en el Índice de Inteligencia, la cobertura de modelos y la metodología de benchmarks de AIMultiple.
Kimi K3
Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.
GPT-5.6 Sol
Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.
GPT-5.6 Terra
Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.
GPT-5.6 Sol Pro
Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.
Explorar Casos de uso, análisis y comparativas del programa LLM
Puertas de enlace de IA para OpenAI: Alternativas a OpenRouter
Evaluamos OpenRouter, SambaNova, TogetherAI, Groq y IA/ML API en tres indicadores (latencia del primer token, latencia total y cantidad de tokens de salida), con 300 pruebas usando prompts cortos (aprox. 18 tokens) y prompts largos (aprox. 203 tokens) para la latencia total. Si planea usar una de estas puertas de enlace de IA, puede: En…
Modelos de Lenguaje Grandes en Ciberseguridad
Evaluar 7 modelos de lenguaje grandes en 9 dominios de ciberseguridad utilizando SecBench, un benchmark a gran escala y de múltiples formatos para tareas de seguridad. Probamos cada modelo con 44,823 preguntas de opción múltiple (MCQs) y 3,087 preguntas de respuesta corta (SAQs), cubriendo áreas como seguridad de datos, gestión de identidad y acceso, seguridad…
ChatGPT para Atención al Cliente: Los 10 Mejores Casos de Uso
ChatGPT ha pasado de ser una novedad a una infraestructura en la atención al cliente. Las empresas lo utilizan para reducir los tiempos de respuesta, manejar volúmenes que sus equipos no pueden absorber y reducir el costo de las interacciones rutinarias. Pero los resultados varían drásticamente dependiendo de cómo se implemente. OpenAI lanzó GPT-5.2, un…
LLM Cuantización: BF16 vs FP8 vs INT4
Hemos realizado un benchmark de Qwen3-32B en 4 niveles de precisión (BF16, FP8, GPTQ-Int8, GPTQ-Int4) en una sola NVIDIA H100 80GB GPU. Cada configuración fue evaluada en 2 benchmarks (~12.2K preguntas) que cubren conocimiento y generación de código, además de 2,000+ ejecuciones de inferencia para medir el rendimiento. Int4 es 2.7x más rápido que BF16…