Hizmetler
Bize Ulaşın

RELC-Bench: Uzun Bağlamda Erişim Karşılaştırması

Cem Dilmegani
Cem Dilmegani
Güncellenme tarihi: 21 Ağu 2026

RELC-Bench (RELC-Bench: Uzun Bağlamda Erişim Karşılaştırması), bir modelin bağlamındaki bir veya daha fazla belgeden belirli bir sayısal değeri bulma ve çıkarma yeteneğini ölçmeyi amaçlar. Modelin, girdide az önce gördüğü belirli bir gerçeği hatırlayıp hatırlamadığını ve geri getirip getirmediğini test eder.

Sonuçlar

Loading Chart

claude-fable-5, 100 doğrudan hatırlama öğesinde %97,0 puan alır, saman balyası konumları boyunca sabittir (başlangıç %97,0, orta %97,1, son %97,0).

Metodoloji

Question format

Bir sayısal metrik isteyen doğal dil sorusu. Örnek:

S: 2026 1. Çeyrek Adobe (ADBE) için Gelir neydi?
Beklenen: $6,40 milyar

Veri Kaynağı

Komut dosyası, her Motley Fool kazanç transkriptinin Önemli Noktalar bölümünü ayrıştırır ve tüm sayısal metrikleri çıkarır. Her metrik için, komut dosyası sayının post-Önemli Noktalar transkript gövdesinde (gerçek konferans görüşmesi metni) aynen göründüğünü doğrular, böylece modelin özet maddesini değil gerçek konuşmayı okuması gerekir. Özet maddeleri metinlerden çıkarılır.

Puanlama Kuralı

  • Her öğenin bir hedef değerler listesi vardır; ilki birincil hedeftir (sorunun başlık cevabı)
  • 1.0 puan eğer birincil hedef, tahmindeki herhangi bir sayıyla eşleşirse
  • Aksi takdirde 0.0 puan
  • Retler (“Bilmiyorum”) 0.0 puan alır
  • claude-fable-5, Claude Code üzerinden test edilir: saman balyası bir dosya olarak sağlanır ve model, bağlam penceresinden okumak yerine arama araçlarıyla ondan alır. Puanları, modeli Claude Code kıyafetiyle birlikte ölçer ve bu yapıda konum değişmezliği beklenir çünkü hedef derinliği dosya aramasına uygulanmaz.

İyi Performans Nasıl Görünür

Aşama 1 ≥ %85 (model, tek bir belgede metrikleri güvenilir bir şekilde bulur).
Aşama 2 ≥ %90 (model, dikkati dağılmadan saman balyasındaki hedefe gider).
Konumdan bağımsız puanlar gerçek uzun bağlam yeteneğini gösterir; derinlikle azalan puanlar “ortada kaybolma”yı gösterir.

Öğe Sayısı

100 doğrudan hatırlama öğesi, 14 transkripte yayılmıştır.

Daha Fazla Okuma

Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

Bu benchmarkı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Cem Dilmegani and Şevval Alper (2026) - "RELC-Bench: Uzun Bağlamda Erişim Karşılaştırması". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 21 Ağustos 2026, kaynak: https://aimultiple.com/ai-memory [Çevrimiçi Kaynak]

Dilmegani, C., & Alper, Ş. (2026, 21 Ağustos). RELC-Bench: Uzun Bağlamda Erişim Karşılaştırması. AIMultiple. https://aimultiple.com/ai-memory

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Alper, Şevval},
  title  = {{RELC-Bench: Uzun Bağlamda Erişim Karşılaştırması}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/ai-memory}},
  note   = {AIMultiple. Erişim tarihi: 21 Ağustos 2026}
}

Değişiklik günlüğü

8 güncelleme
  1. 2026

    Giriş bölümündeki "GPT-5 hariç tutma" verileri güncellendi.

  2. Mimari çözümlerle "Büyük Modeller Neden Bellek Konusunda Zorlanıyor?" bölümü genişletildi.

  3. Yapay zeka bellek karşılaştırma metodolojisi soru türleri ile değiştirildi.

  4. 2025

    Yapay zeka bellek karşılaştırma sonuçları bölümünde karşılaştırılan büyük dil modellerinin sayısı güncellendi.

  5. Yapay zeka belleği bulgularından GPT-5 verileri kaldırıldı.

  6. “Etkili bağlam penceresi test sonuçları ve metodolojisi” bölümü kaldırıldı.

  7. FAQ bölümü eklendi.

  8. Metodoloji bölümüne Etkili bağlam penceresi test sonuçları ve metodolojisi eklendi.

Cem Dilmegani
Cem Dilmegani
Baş Analist
Cem, 2017'den beri AIMultiple bünyesinde baş analisttir. Cem'in AIMultiple'daki çalışmaları; Business Insider, Forbes, Morning Brew ve Washington Post gibi önde gelen küresel yayınlar, Deloitte ve HPE gibi küresel firmalar, Dünya Ekonomik Forumu gibi STK'lar ve Avrupa Komisyonu gibi uluslarüstü kuruluşlar tarafından alıntılanmıştır. [1], [2], [3], [4], [5] Kariyeri boyunca Cem; teknoloji danışmanı, teknoloji alıcısı ve teknoloji girişimcisi olarak görev yaptı. On yılı aşkın süre boyunca McKinsey & Company ve Altman Solon'da işletmelere teknoloji kararlarında danışmanlık yaptı. Ayrıca dijitalleşme üzerine bir McKinsey raporu yayımladı. CEO'ya rapor verirken bir telekom şirketinin teknoloji stratejisini ve satın alma süreçlerini yönetti. Ayrıca 2 yıl içinde 0'dan 7 haneli yıllık yinelenen gelire ve 9 haneli değerlemeye ulaşan derin teknoloji şirketi Hypatos'un ticari büyümesini yönetti. Cem'in Hypatos'taki çalışmaları TechCrunch ve Business Insider gibi önde gelen teknoloji yayınları tarafından ele alındı. Cem, uluslararası teknoloji konferanslarında düzenli olarak konuşma yapmaktadır. Boğaziçi Üniversitesi'nden bilgisayar mühendisi olarak mezun oldu ve Columbia Business School'dan MBA derecesine sahiptir.
Tam Profili Görüntüle
Teknik olarak inceleyen
Şevval Alper
Şevval Alper
Yapay Zeka Araştırmacısı
Şevval, AIMultiple'da bir yapay zeka araştırmacısıdır. Kaotik sistemler kullanarak sözde rastgele sayı üretimi konusunda daha önce araştırma deneyimine sahiptir.
Şevval, yapay zeka kodlama araçları, yapay zeka ajanları ve kuantum teknolojilerine odaklanmaktadır.
Tam Profili Görüntüle

Yorum yapan ilk kişi olun

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450