Premium
Serviços
Premium

AIM System One Index

Os modelos System One, também chamados modelos de decisão, devolvem numa única passagem uma decisão tipada com uma probabilidade para cada opção, em vez de gerar texto token a token. Como funciona o AIM System One Index

Melhor modelo
Kev-9B
AIM System One Index 69
Modelo mais rápido
Laya
Mediana de 200 ms por decisão
Modelo API mais barato
Jev 1.13
$0.034 por 1.000 decisões
AIM System One Index

Classificação dos modelos System One

Modelos System One classificados pelo AIM System One Index.

#
Modelo
Índice
AIM-Decision (%)
AIM-Decision tempo por tarefa (s)
Latência mediana (ms)
Pontuação AIM-AI-Bias
Precisão no AIM-Agentic-RAG (%)
1
Kev-9B
Modelo System One
69
4038.8952-97.1
2
Jev 1.13
Jev 1.13
Modelo System One
66
345.434480.698.8
3
Laya
Laya
Modelo System One
25
0-200-50.6

Custo-
Latência952 ms
Contexto-
AIM-Decision (%)
40
Precisão no AIM-Agentic-RAG (%)
97.1

Custo-
Latência344 ms
Contexto-
AIM-Decision (%)
34
Pontuação AIM-AI-Bias
80.6
Precisão no AIM-Agentic-RAG (%)
98.8

Custo-
Latência200 ms
Contexto-
AIM-Decision (%)
0
Precisão no AIM-Agentic-RAG (%)
50.6

AIM System One Index e tempo por decisão

Mais alto e mais à esquerda é melhor.

AIM System One Index e tempo por decisão
*AIM System One Index conforme explicado em Como funciona o AIM System One Index. Tempo: mediana por decisão de roteamento do AIM-Agentic-RAG; o do Kev-9B inclui um túnel SSH até a sua GPU.

Ajustado e original

Tarefas de navegador concluídas de 50, cada modelo ajustado contra a sua versão original.

Fine-tuned vs stock: browser tasks completed out of 50
*Each fine-tuned model against its stock version, run the same day. Kev-9B: p = 0.0034. Laya: p = 0.25, not significant.

Benchmarks individuais

AIM-Decision

Tarefas concluídas de 50 nas mesmas tarefas de navegador.

Browser tasks completed out of 50
*One attempt per task.

AIM-Agentic-RAG

243 perguntas de roteamento de bancos de dados.

*Laya: local M4 MPS. Kev: later A100 FP32 run, including SSH/network time. Others: hosted APIs.

Como funciona o AIM System One Index

O AIM System One Index é a média da precisão de cada modelo em AIM-Agentic-RAG e AIM-Decision.

A latência e o custo são exibidos como referência e não contam para o índice.

Os resultados de AIM-AI-Bias são exibidos como referência e não contam para o índice.

Os custos de API são os valores cobrados. Os custos dos modelos auto-hospedados (Kev-9B, Laya) são estimativas de hardware em uso pleno; a latência do Kev-9B inclui um túnel SSH até a sua GPU.

Benchmarks utilizados

Atualizações recentes

Modelos adicionados mais recentemente aos benchmarks System One.

Jared Palmer

Kev-9B

Novo modelo adicionado aos benchmarks System One.

TypeSafe

Jev 1.13

Novo modelo adicionado aos benchmarks System One.

Convai Innovations

Laya

Novo modelo adicionado aos benchmarks System One.