Il modello più recente nei benchmark System One è Kev-9B.
AIM System One Index
I modelli System One, detti anche modelli decisionali, restituiscono in un solo passaggio una decisione tipizzata con una probabilità per ogni opzione, invece di generare testo token per token. Come funziona l'AIM System One Index
Classifica dei modelli System One
Modelli System One classificati secondo l'AIM System One Index.
# | Modello | Indice | AIM-Decision (%) | AIM-Decision tempo per task (s) | Accuratezza AIM-Agentic-RAG (%) | Latenza mediana (ms) | Punteggio AIM-AI-Bias |
|---|---|---|---|---|---|---|---|
| 1 | Kev-9B Modello System One | 69 | 40 | 38.8 | 97.1 | 952 | - |
| 2 | Jev 1.13 Modello System One | 66 | 34 | 5.4 | 98.8 | 344 | 80.6 |
| 3 | Laya Modello System One | 25 | 0 | - | 50.6 | 200 | - |
AIM System One Index e tempo per decisione
Più in alto e più a sinistra è meglio.
Fine-tuned e originale
Task di browser completati su 50, ogni modello fine-tuned contro la sua versione originale.
Benchmark singoli
AIM-Decision
Task completati su 50 negli stessi task di browser.
AIM-Agentic-RAG
243 domande di instradamento di database.
Come funziona l'AIM System One Index
L'AIM System One Index è la media dell'accuratezza di ogni modello su AIM-Agentic-RAG e AIM-Decision.
Latenza e costo sono mostrati come riferimento e non contano nell'indice.
I risultati di AIM-AI-Bias sono mostrati come riferimento e non contano nell'indice.
I costi API sono gli importi fatturati. I costi dei modelli self-hosted (Kev-9B, Laya) sono stime hardware a pieno utilizzo; la latenza di Kev-9B include un tunnel SSH verso la sua GPU.
Benchmark utilizzati
Aggiornamenti recenti
Modelli aggiunti più di recente ai benchmark System One.
Kev-9B
Nuovo modello aggiunto ai benchmark System One.
Jev 1.13
Nuovo modello aggiunto ai benchmark System One.
Laya
Nuovo modello aggiunto ai benchmark System One.