Premium
Servicios
Premium

AIM System One Index

Los modelos System One, también llamados modelos de decisión, devuelven en una sola pasada una decisión tipada con una probabilidad para cada opción, en lugar de generar texto token a token. Cómo funciona el AIM System One Index

Mejor modelo
Kev-9B
AIM System One Index 69
Modelo más rápido
Laya
Mediana de 200 ms por decisión
Modelo API más barato
Jev 1.13
$0.034 por cada 1.000 decisiones
AIM System One Index

Clasificación de modelos System One

Modelos System One clasificados por el AIM System One Index.

#
Modelo
Índice
AIM-Decision (%)
AIM-Decision tiempo por tarea (s)
Latencia mediana (ms)
Precisión en AIM-Agentic-RAG (%)
Puntuación AIM-AI-Bias
1
Kev-9B
Modelo System One
69
4038.895297.1-
2
Jev 1.13
Jev 1.13
Modelo System One
66
345.434498.880.6
3
Laya
Laya
Modelo System One
25
0-20050.6-

Costo-
Latencia952 ms
Contexto-
AIM-Decision (%)
40
Precisión en AIM-Agentic-RAG (%)
97.1

Costo-
Latencia344 ms
Contexto-
AIM-Decision (%)
34
Precisión en AIM-Agentic-RAG (%)
98.8
Puntuación AIM-AI-Bias
80.6

Costo-
Latencia200 ms
Contexto-
AIM-Decision (%)
0
Precisión en AIM-Agentic-RAG (%)
50.6

AIM System One Index frente a tiempo por decisión

Más arriba y más a la izquierda es mejor.

AIM System One Index frente a tiempo por decisión
*AIM System One Index tal como se explica en Cómo funciona el AIM System One Index. Tiempo: mediana por decisión de enrutamiento de AIM-Agentic-RAG; el de Kev-9B incluye un túnel SSH hasta su GPU.

Ajustado frente a original

Tareas de navegador completadas de 50, cada modelo ajustado frente a su versión original.

Fine-tuned vs stock: browser tasks completed out of 50
*Each fine-tuned model against its stock version, run the same day. Kev-9B: p = 0.0034. Laya: p = 0.25, not significant.

Benchmarks individuales

AIM-Decision

Tareas completadas de 50 en las mismas tareas de navegador.

Browser tasks completed out of 50
*One attempt per task.

AIM-Agentic-RAG

243 preguntas de enrutamiento de bases de datos.

*Laya: local M4 MPS. Kev: later A100 FP32 run, including SSH/network time. Others: hosted APIs.

Cómo funciona el AIM System One Index

El AIM System One Index es la media de la precisión de cada modelo en AIM-Agentic-RAG y AIM-Decision.

La latencia y el coste se muestran como referencia y no cuentan para el índice.

Los resultados de AIM-AI-Bias se muestran como referencia y no cuentan para el índice.

Los costes de API son los importes que se nos facturaron. Los costes de los modelos autoalojados (Kev-9B, Laya) son estimaciones de hardware a pleno uso; la latencia de Kev-9B incluye un túnel SSH hasta su GPU.

Benchmarks utilizados

Actualizaciones recientes

Modelos añadidos más recientemente a los benchmarks de System One.

Jared Palmer

Kev-9B

Nuevo modelo añadido a los benchmarks de System One.

TypeSafe

Jev 1.13

Nuevo modelo añadido a los benchmarks de System One.

Convai Innovations

Laya

Nuevo modelo añadido a los benchmarks de System One.