Le modèle le plus récent dans les benchmarks System One est Kev-9B.
AIM System One Index
Les modèles System One, aussi appelés modèles de décision, renvoient en une seule passe une décision typée avec une probabilité pour chaque option, au lieu de générer du texte token par token. Fonctionnement de l'AIM System One Index
Classement des modèles System One
Modèles System One classés selon l'AIM System One Index.
# | Modèle | Index | AIM-Decision (%) | AIM-Decision temps par tâche (s) | Latence médiane (ms) | Précision AIM-Agentic-RAG (%) | Score AIM-AI-Bias |
|---|---|---|---|---|---|---|---|
| 1 | Kev-9B Modèle System One | 69 | 40 | 38.8 | 952 | 97.1 | - |
| 2 | Jev 1.13 Modèle System One | 66 | 34 | 5.4 | 344 | 98.8 | 80.6 |
| 3 | Laya Modèle System One | 25 | 0 | - | 200 | 50.6 | - |
AIM System One Index et temps par décision
Plus haut et plus à gauche, c'est mieux.
Affiné et original
Tâches de navigateur réussies sur 50, chaque modèle affiné face à sa version d'origine.
Benchmarks individuels
AIM-Decision
Tâches réussies sur 50 pour les mêmes tâches de navigateur.
AIM-Agentic-RAG
243 questions de routage de bases de données.
Fonctionnement de l'AIM System One Index
L'AIM System One Index est la moyenne de la précision de chaque modèle sur AIM-Agentic-RAG et AIM-Decision.
La latence et le coût sont affichés à titre de référence et ne comptent pas dans l'index.
Les résultats AIM-AI-Bias sont affichés à titre de référence et ne comptent pas dans l'index.
Les coûts API sont les montants facturés. Les coûts des modèles auto-hébergés (Kev-9B, Laya) sont des estimations matérielles à pleine utilisation ; la latence de Kev-9B inclut un tunnel SSH vers son GPU.
Benchmarks utilisés
Mises à jour récentes
Modèles ajoutés le plus récemment aux benchmarks System One.
Kev-9B
Nouveau modèle ajouté aux benchmarks System One.
Jev 1.13
Nouveau modèle ajouté aux benchmarks System One.
Laya
Nouveau modèle ajouté aux benchmarks System One.