RELC-Bench (RELC-Bench: Uzun Bağlamda Erişim Karşılaştırması), bir modelin bağlamındaki bir veya daha fazla belgeden belirli bir sayısal değeri bulma ve çıkarma yeteneğini ölçmeyi amaçlar. Modelin, girdide az önce gördüğü belirli bir gerçeği hatırlayıp hatırlamadığını ve geri getirip getirmediğini test eder.
Sonuçlar
claude-fable-5, 100 doğrudan hatırlama öğesinde %97,0 puan alır, saman balyası konumları boyunca sabittir (başlangıç %97,0, orta %97,1, son %97,0).
Metodoloji
Question format
Bir sayısal metrik isteyen doğal dil sorusu. Örnek:
S: 2026 1. Çeyrek Adobe (ADBE) için Gelir neydi?
Beklenen: $6.40 milyar
Veri Kaynağı
Komut dosyası, her Motley Fool kazanç transkriptinin Önemli Noktalar bölümünü ayrıştırır ve tüm sayısal metrikleri çıkarır. Her metrik için, komut dosyası sayının post-Önemli Noktalar transkript gövdesinde (gerçek konferans görüşmesi metni) aynen göründüğünü doğrular, böylece modelin özet maddesini değil gerçek konuşmayı okuması gerekir. Özet maddeleri metinlerden çıkarılır.
Puanlama Kuralı
- Her öğenin bir hedef değerler listesi vardır; ilki birincil hedeftir (sorunun başlık cevabı)
- 1.0 puan eğer birincil hedef, tahmindeki herhangi bir sayıyla eşleşirse
- Aksi takdirde 0.0 puan
- Retler (“Bilmiyorum”) 0.0 puan alır
- claude-fable-5, Claude Code üzerinden test edilir: saman balyası bir dosya olarak sağlanır ve model, bağlam penceresinden okumak yerine arama araçlarıyla ondan alır. Puanları, modeli Claude Code kıyafetiyle birlikte ölçer ve bu yapıda konum değişmezliği beklenir çünkü hedef derinliği dosya aramasına uygulanmaz.
İyi Performans Nasıl Görünür
Aşama 1 ≥ 85% (model, tek bir belgede metrikleri güvenilir bir şekilde bulur).
Aşama 2 ≥ 90% (model, dikkati dağılmadan saman balyasındaki hedefe gider).
Konumdan bağımsız puanlar gerçek uzun bağlam yeteneğini gösterir; derinlikle azalan puanlar “ortada kaybolma”yı gösterir.
Öğe Sayısı
100 doğrudan hatırlama öğesi, 14 transkripte yayılmıştır.
Daha Fazla Okuma
- Bilişsel Ajanlar: LangChain ile Bir Zihin Oluşturma
- 5 Açık Kaynak Ajan Yapay Zeka Çerçevesi
- MCP Bellek Karşılaştırması ve Öğreticisi ile Yapay Zeka Uygulamaları
- MCP ile Kod Çalıştırma: Yapay Zeka Ajan Verimliliğine Yeni Bir Yaklaşım
Bu benchmarkı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{dilmegani2026,
author = {Dilmegani, Cem},
title = {{RELC-Bench: Uzun Bağlamda Erişim Karşılaştırması}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/ai-memory}},
note = {AIMultiple. Erişim tarihi: 7 Temmuz 2026}
}
Yorum yapan ilk kişi olun
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.