O modelo mais recente nos benchmarks System One é Kev-9B.
AIM System One Index
Os modelos System One, também chamados modelos de decisão, devolvem numa única passagem uma decisão tipada com uma probabilidade para cada opção, em vez de gerar texto token a token. Como funciona o AIM System One Index
Classificação dos modelos System One
Modelos System One classificados pelo AIM System One Index.
# | Modelo | Índice | AIM-Decision (%) | AIM-Decision tempo por tarefa (s) | Latência mediana (ms) | Pontuação AIM-AI-Bias | Precisão no AIM-Agentic-RAG (%) |
|---|---|---|---|---|---|---|---|
| 1 | Kev-9B Modelo System One | 69 | 40 | 38.8 | 952 | - | 97.1 |
| 2 | Jev 1.13 Modelo System One | 66 | 34 | 5.4 | 344 | 80.6 | 98.8 |
| 3 | Laya Modelo System One | 25 | 0 | - | 200 | - | 50.6 |
AIM System One Index e tempo por decisão
Mais alto e mais à esquerda é melhor.
Ajustado e original
Tarefas de navegador concluídas de 50, cada modelo ajustado contra a sua versão original.
Benchmarks individuais
AIM-Decision
Tarefas concluídas de 50 nas mesmas tarefas de navegador.
AIM-Agentic-RAG
243 perguntas de roteamento de bancos de dados.
Como funciona o AIM System One Index
O AIM System One Index é a média da precisão de cada modelo em AIM-Agentic-RAG e AIM-Decision.
A latência e o custo são exibidos como referência e não contam para o índice.
Os resultados de AIM-AI-Bias são exibidos como referência e não contam para o índice.
Os custos de API são os valores cobrados. Os custos dos modelos auto-hospedados (Kev-9B, Laya) são estimativas de hardware em uso pleno; a latência do Kev-9B inclui um túnel SSH até a sua GPU.
Benchmarks utilizados
Atualizações recentes
Modelos adicionados mais recentemente aos benchmarks System One.
Kev-9B
Novo modelo adicionado aos benchmarks System One.
Jev 1.13
Novo modelo adicionado aos benchmarks System One.
Laya
Novo modelo adicionado aos benchmarks System One.