Premium
Servizi
Premium

AIM System One Index

I modelli System One, detti anche modelli decisionali, restituiscono in un solo passaggio una decisione tipizzata con una probabilità per ogni opzione, invece di generare testo token per token. Come funziona l'AIM System One Index

Modello migliore
Kev-9B
AIM System One Index 69
Modello più veloce
Laya
Mediana di 200 ms per decisione
Modello API più economico
Jev 1.13
$0.034 ogni 1.000 decisioni
AIM System One Index

Classifica dei modelli System One

Modelli System One classificati secondo l'AIM System One Index.

#
Modello
Indice
AIM-Decision (%)
AIM-Decision tempo per task (s)
Accuratezza AIM-Agentic-RAG (%)
Latenza mediana (ms)
Punteggio AIM-AI-Bias
1
Kev-9B
Modello System One
69
4038.897.1952-
2
Jev 1.13
Jev 1.13
Modello System One
66
345.498.834480.6
3
Laya
Laya
Modello System One
25
0-50.6200-

Costo-
Latenza952 ms
Contesto-
AIM-Decision (%)
40
Accuratezza AIM-Agentic-RAG (%)
97.1

Costo-
Latenza344 ms
Contesto-
AIM-Decision (%)
34
Accuratezza AIM-Agentic-RAG (%)
98.8
Punteggio AIM-AI-Bias
80.6

Costo-
Latenza200 ms
Contesto-
AIM-Decision (%)
0
Accuratezza AIM-Agentic-RAG (%)
50.6

AIM System One Index e tempo per decisione

Più in alto e più a sinistra è meglio.

AIM System One Index e tempo per decisione
*AIM System One Index come spiegato in Come funziona l'AIM System One Index. Tempo: mediana per decisione di instradamento AIM-Agentic-RAG; quello di Kev-9B include un tunnel SSH verso la sua GPU.

Fine-tuned e originale

Task di browser completati su 50, ogni modello fine-tuned contro la sua versione originale.

Fine-tuned vs stock: browser tasks completed out of 50
*Each fine-tuned model against its stock version, run the same day. Kev-9B: p = 0.0034. Laya: p = 0.25, not significant.

Benchmark singoli

AIM-Decision

Task completati su 50 negli stessi task di browser.

Browser tasks completed out of 50
*One attempt per task.

AIM-Agentic-RAG

243 domande di instradamento di database.

*Laya: local M4 MPS. Kev: later A100 FP32 run, including SSH/network time. Others: hosted APIs.

Come funziona l'AIM System One Index

L'AIM System One Index è la media dell'accuratezza di ogni modello su AIM-Agentic-RAG e AIM-Decision.

Latenza e costo sono mostrati come riferimento e non contano nell'indice.

I risultati di AIM-AI-Bias sono mostrati come riferimento e non contano nell'indice.

I costi API sono gli importi fatturati. I costi dei modelli self-hosted (Kev-9B, Laya) sono stime hardware a pieno utilizzo; la latenza di Kev-9B include un tunnel SSH verso la sua GPU.

Benchmark utilizzati

Aggiornamenti recenti

Modelli aggiunti più di recente ai benchmark System One.

Jared Palmer

Kev-9B

Nuovo modello aggiunto ai benchmark System One.

TypeSafe

Jev 1.13

Nuovo modello aggiunto ai benchmark System One.

Convai Innovations

Laya

Nuovo modello aggiunto ai benchmark System One.