Premium
Hizmetler
Premium

AIM System One Index

Karar modelleri olarak da bilinen System One modelleri, metni token token üretmek yerine tek geçişte her seçenek için bir olasılıkla birlikte tipli bir karar döndürür. AIM System One Index nasıl hesaplanır

En iyi model
Kev-9B
AIM System One Index 69
En hızlı model
Laya
Karar başına medyan 200 ms
En ucuz API modeli
Jev 1.13
1.000 karar başına $0.034
AIM System One Index

System One Modelleri Sıralaması

System One modelleri AIM System One Index'e göre sıralanır.

#
Model
Endeks
AIM-Agentic-RAG doğruluğu (%)
AIM-AI-Bias skoru
AIM-Decision (%)
AIM-Decision görev başına süre (sn)
Medyan gecikme (ms)
1
Kev-9B
System One modeli
69
97.1-4038.8952
2
Jev 1.13
Jev 1.13
System One modeli
66
98.880.6345.4344
3
Laya
Laya
System One modeli
25
50.6-0-200

Maliyet-
Gecikme952 ms
Bağlam-
AIM-Agentic-RAG doğruluğu (%)
97.1
AIM-Decision (%)
40

Maliyet-
Gecikme344 ms
Bağlam-
AIM-Agentic-RAG doğruluğu (%)
98.8
AIM-AI-Bias skoru
80.6
AIM-Decision (%)
34

Maliyet-
Gecikme200 ms
Bağlam-
AIM-Agentic-RAG doğruluğu (%)
50.6
AIM-Decision (%)
0

AIM System One Index ve karar başına süre

Daha yukarı ve daha sol daha iyidir.

AIM System One Index ve karar başına süre
*AIM System One Index, AIM System One Index nasıl hesaplanır bölümünde anlatıldığı gibidir. Süre: AIM-Agentic-RAG yönlendirme kararı başına medyan; Kev-9B'ninki GPU'suna giden SSH tünelini içerir.

Fine-tune edilmiş ve orijinal

50 tarayıcı görevinden tamamlananlar, her fine-tune model kendi orijinal sürümüne karşı.

Fine-tuned vs stock: browser tasks completed out of 50
*Each fine-tuned model against its stock version, run the same day. Kev-9B: p = 0.0034. Laya: p = 0.25, not significant.

Benchmarklar tek tek

AIM-Decision

Aynı tarayıcı görevlerinde 50 görevden tamamlananlar.

Browser tasks completed out of 50
*One attempt per task.

AIM-Agentic-RAG

243 veritabanı yönlendirme sorusu.

*Laya: local M4 MPS. Kev: later A100 FP32 run, including SSH/network time. Others: hosted APIs.

AIM System One Index nasıl hesaplanır

AIM System One Index, her modelin AIM-Agentic-RAG ve AIM-Decision doğruluklarının ortalamasıdır.

Gecikme ve maliyet referans olarak gösterilir ve index'e sayılmaz.

AIM-AI-Bias sonuçları referans olarak gösterilir ve index'e sayılmaz.

API maliyetleri bize faturalanan tutarlardır. Kendi sunucumuzdaki modellerin (Kev-9B, Laya) maliyeti tam kullanımda donanım tahminidir; Kev-9B'nin gecikmesi GPU'suna giden SSH tünelini içerir.

Kullandığımız Benchmarklar

Son Güncellemeler

System One benchmarklarına en son eklenen modeller.

Jared Palmer

Kev-9B

System One benchmarklarına yeni model eklendi.

TypeSafe

Jev 1.13

System One benchmarklarına yeni model eklendi.

Convai Innovations

Laya

System One benchmarklarına yeni model eklendi.