Premium
Dienstleistungen
Premium

AIM System One Index

System One Modelle, auch Entscheidungsmodelle genannt, liefern in einem Durchgang eine typisierte Entscheidung mit einer Wahrscheinlichkeit für jede Option, statt Text Token für Token zu erzeugen. So funktioniert der AIM System One Index

Bestes Modell
Kev-9B
AIM System One Index 69
Schnellstes Modell
Laya
Median 200 ms pro Entscheidung
Günstigstes API-Modell
Jev 1.13
$0.034 pro 1.000 Entscheidungen
AIM System One Index

Rangliste der System One Modelle

System One Modelle nach dem AIM System One Index gerankt.

#
Modell
Index
AIM-Agentic-RAG-Genauigkeit (%)
AIM-AI-Bias-Wert
AIM-Decision (%)
AIM-Decision Zeit pro Aufgabe (s)
Median-Latenz (ms)
1
Kev-9B
System One Modell
69
97.1-4038.8952
2
Jev 1.13
Jev 1.13
System One Modell
66
98.880.6345.4344
3
Laya
Laya
System One Modell
25
50.6-0-200

Kosten-
Latenz952 ms
Kontext-
AIM-Agentic-RAG-Genauigkeit (%)
97.1
AIM-Decision (%)
40

Kosten-
Latenz344 ms
Kontext-
AIM-Agentic-RAG-Genauigkeit (%)
98.8
AIM-AI-Bias-Wert
80.6
AIM-Decision (%)
34

Kosten-
Latenz200 ms
Kontext-
AIM-Agentic-RAG-Genauigkeit (%)
50.6
AIM-Decision (%)
0

AIM System One Index und Zeit pro Entscheidung

Höher und weiter links ist besser.

AIM System One Index und Zeit pro Entscheidung
*AIM System One Index wie unter „So funktioniert der AIM System One Index“ beschrieben. Zeit: Median pro AIM-Agentic-RAG-Routing-Entscheidung; bei Kev-9B inklusive SSH-Tunnel zu seiner GPU.

Feinabgestimmt und Original

Abgeschlossene Browser-Aufgaben von 50, jedes feinabgestimmte Modell gegen seine Originalversion.

Fine-tuned vs stock: browser tasks completed out of 50
*Each fine-tuned model against its stock version, run the same day. Kev-9B: p = 0.0034. Laya: p = 0.25, not significant.

Einzelne Benchmarks

AIM-Decision

Abgeschlossene Aufgaben von 50 bei denselben Browser-Aufgaben.

Browser tasks completed out of 50
*One attempt per task.

AIM-Agentic-RAG

243 Fragen zum Datenbank-Routing.

*Laya: local M4 MPS. Kev: later A100 FP32 run, including SSH/network time. Others: hosted APIs.

So funktioniert der AIM System One Index

Der AIM System One Index ist der Durchschnitt der Genauigkeit jedes Modells auf AIM-Agentic-RAG und AIM-Decision.

Latenz und Kosten werden als Referenz gezeigt und zählen nicht zum Index.

Ergebnisse von AIM-AI-Bias werden als Referenz gezeigt und zählen nicht zum Index.

API-Kosten sind die uns berechneten Beträge. Die Kosten selbst gehosteter Modelle (Kev-9B, Laya) sind Hardware-Schätzungen bei voller Auslastung; die Latenz von Kev-9B enthält einen SSH-Tunnel zu seiner GPU.

Verwendete Benchmarks

Neueste Aktualisierungen

Zuletzt zu den System One Benchmarks hinzugefügte Modelle.

Jared Palmer

Kev-9B

Neues Modell zu den System One Benchmarks hinzugefügt.

TypeSafe

Jev 1.13

Neues Modell zu den System One Benchmarks hinzugefügt.

Convai Innovations

Laya

Neues Modell zu den System One Benchmarks hinzugefügt.