El modelo más reciente en los benchmarks de System One es Kev-9B.
AIM System One Index
Los modelos System One, también llamados modelos de decisión, devuelven en una sola pasada una decisión tipada con una probabilidad para cada opción, en lugar de generar texto token a token. Cómo funciona el AIM System One Index
Clasificación de modelos System One
Modelos System One clasificados por el AIM System One Index.
# | Modelo | Índice | AIM-Decision (%) | AIM-Decision tiempo por tarea (s) | Latencia mediana (ms) | Precisión en AIM-Agentic-RAG (%) | Puntuación AIM-AI-Bias |
|---|---|---|---|---|---|---|---|
| 1 | Kev-9B Modelo System One | 69 | 40 | 38.8 | 952 | 97.1 | - |
| 2 | Jev 1.13 Modelo System One | 66 | 34 | 5.4 | 344 | 98.8 | 80.6 |
| 3 | Laya Modelo System One | 25 | 0 | - | 200 | 50.6 | - |
AIM System One Index frente a tiempo por decisión
Más arriba y más a la izquierda es mejor.
Ajustado frente a original
Tareas de navegador completadas de 50, cada modelo ajustado frente a su versión original.
Benchmarks individuales
AIM-Decision
Tareas completadas de 50 en las mismas tareas de navegador.
AIM-Agentic-RAG
243 preguntas de enrutamiento de bases de datos.
Cómo funciona el AIM System One Index
El AIM System One Index es la media de la precisión de cada modelo en AIM-Agentic-RAG y AIM-Decision.
La latencia y el coste se muestran como referencia y no cuentan para el índice.
Los resultados de AIM-AI-Bias se muestran como referencia y no cuentan para el índice.
Los costes de API son los importes que se nos facturaron. Los costes de los modelos autoalojados (Kev-9B, Laya) son estimaciones de hardware a pleno uso; la latencia de Kev-9B incluye un túnel SSH hasta su GPU.
Benchmarks utilizados
Actualizaciones recientes
Modelos añadidos más recientemente a los benchmarks de System One.
Kev-9B
Nuevo modelo añadido a los benchmarks de System One.
Jev 1.13
Nuevo modelo añadido a los benchmarks de System One.
Laya
Nuevo modelo añadido a los benchmarks de System One.