Premium
Services
Premium

AIM System One Index

Les modèles System One, aussi appelés modèles de décision, renvoient en une seule passe une décision typée avec une probabilité pour chaque option, au lieu de générer du texte token par token. Fonctionnement de l'AIM System One Index

Meilleur modèle
Kev-9B
AIM System One Index 69
Modèle le plus rapide
Laya
Médiane de 200 ms par décision
Modèle API le moins cher
Jev 1.13
$0.034 pour 1 000 décisions
AIM System One Index

Classement des modèles System One

Modèles System One classés selon l'AIM System One Index.

#
Modèle
Index
AIM-Decision (%)
AIM-Decision temps par tâche (s)
Latence médiane (ms)
Précision AIM-Agentic-RAG (%)
Score AIM-AI-Bias
1
Kev-9B
Modèle System One
69
4038.895297.1-
2
Jev 1.13
Jev 1.13
Modèle System One
66
345.434498.880.6
3
Laya
Laya
Modèle System One
25
0-20050.6-

Coût-
Latence952 ms
Contexte-
AIM-Decision (%)
40
Précision AIM-Agentic-RAG (%)
97.1

Coût-
Latence344 ms
Contexte-
AIM-Decision (%)
34
Précision AIM-Agentic-RAG (%)
98.8
Score AIM-AI-Bias
80.6

Coût-
Latence200 ms
Contexte-
AIM-Decision (%)
0
Précision AIM-Agentic-RAG (%)
50.6

AIM System One Index et temps par décision

Plus haut et plus à gauche, c'est mieux.

AIM System One Index et temps par décision
*AIM System One Index tel qu'expliqué dans Fonctionnement de l'AIM System One Index. Temps : médiane par décision de routage AIM-Agentic-RAG ; celui de Kev-9B inclut un tunnel SSH vers son GPU.

Affiné et original

Tâches de navigateur réussies sur 50, chaque modèle affiné face à sa version d'origine.

Fine-tuned vs stock: browser tasks completed out of 50
*Each fine-tuned model against its stock version, run the same day. Kev-9B: p = 0.0034. Laya: p = 0.25, not significant.

Benchmarks individuels

AIM-Decision

Tâches réussies sur 50 pour les mêmes tâches de navigateur.

Browser tasks completed out of 50
*One attempt per task.

AIM-Agentic-RAG

243 questions de routage de bases de données.

*Laya: local M4 MPS. Kev: later A100 FP32 run, including SSH/network time. Others: hosted APIs.

Fonctionnement de l'AIM System One Index

L'AIM System One Index est la moyenne de la précision de chaque modèle sur AIM-Agentic-RAG et AIM-Decision.

La latence et le coût sont affichés à titre de référence et ne comptent pas dans l'index.

Les résultats AIM-AI-Bias sont affichés à titre de référence et ne comptent pas dans l'index.

Les coûts API sont les montants facturés. Les coûts des modèles auto-hébergés (Kev-9B, Laya) sont des estimations matérielles à pleine utilisation ; la latence de Kev-9B inclut un tunnel SSH vers son GPU.

Benchmarks utilisés

Mises à jour récentes

Modèles ajoutés le plus récemment aux benchmarks System One.

Jared Palmer

Kev-9B

Nouveau modèle ajouté aux benchmarks System One.

TypeSafe

Jev 1.13

Nouveau modèle ajouté aux benchmarks System One.

Convai Innovations

Laya

Nouveau modèle ajouté aux benchmarks System One.