Premium
Servizi
Premium

RELC-Bench: benchmark di retrieval su contesto lungo

Cem Dilmegani
Cem Dilmegani
aggiornato il 15 set. 2026

RELC-Bench (RELC-Bench: benchmark di retrieval su contesto lungo) mira a misurare la capacità di un model di trovare ed estrarre un valore numerico specifico da uno o più documenti presenti nel proprio contesto. Verifica se il model riesce a ricordare e recuperare un fatto specifico appena visto nell'input.

Caricamento del grafico

Risultati

claude-fable-5 ottiene 97,0% nei 100 elementi di richiamo diretto, con risultati uniformi nelle diverse posizioni all'interno del pagliaio (97,0% inizio, 97,1% centro, 97,0% fine).

Metodologia

Question format

Una domanda in linguaggio naturale che richiede un singolo parametro numerico. Esempio:

D: Qual è stato il fatturato del Q1 2026 di Adobe (ADBE)?
Previsto: $6,40 miliardi

Fonte dei dati

Lo script analizza la sezione Takeaways di ogni trascrizione degli utili di Motley Fool ed estrae tutti i parametri numerici. Per ogni parametro, lo script verifica che il numero compaia testualmente nel corpo della trascrizione post-Takeaways (il testo reale della teleconferenza), in modo che il model debba leggere la conversazione reale e non i punti di sintesi. I punti di sintesi vengono rimossi dai testi.

Regola di punteggio

  • Ogni elemento ha un elenco di valori obiettivo; il primo è l'obiettivo primario (la risposta principale alla domanda).
  • Punteggio = 1.0 se l'obiettivo primario corrisponde a qualsiasi numero nella previsione.
  • Punteggio = 0.0 altrimenti.
  • I rifiuti («Non lo so») ottengono un punteggio di 0.0
  • claude-fable-5 viene testato tramite Claude Code: il pagliaio viene fornito come file e il model recupera da esso con strumenti di ricerca invece di leggerlo dalla propria finestra di contesto. I suoi punteggi misurano il model insieme all'harness di Claude Code, e in questa configurazione ci si aspetta invarianza di posizione perché la profondità dell'obiettivo non si applica alla ricerca su file.

Come si presenta una buona prestazione

Fase 1 ≥ 85% (il model trova in modo affidabile i parametri in un singolo documento).
Fase 2 ≥ 90% (il model naviga fino all'obiettivo in un pagliaio senza distrazioni).
I punteggi invarianti rispetto alla posizione indicano una vera capacità di contesto lungo; punteggi in calo con la profondità indicano «persi nel mezzo».

Numero di elementi

100 elementi di richiamo diretto distribuiti su 14 trascrizioni.

Che cos'è la memoria IA?

La memoria IA è la capacità di un sistema di intelligenza artificiale di archiviare e richiamare esperienze passate per migliorare il processo decisionale, la percezione e le prestazioni complessive.1 A differenza della memoria umana, che è soggettiva e selettiva, la memoria IA è un'architettura tecnica, un archivio strutturato di informazioni all'interno di reti neurali o database esterni.

Il concetto è distinto dalla finestra di contesto di un model, che è il buffer di token finito e legato alla sessione che funge da memoria di lavoro durante l'inference.2 Mentre la finestra di contesto si azzera tra le sessioni e perde informazioni quando i token vengono troncati, la memoria IA persiste tra le sessioni tramite archiviazione esterna.3 È inoltre distinta dalla generazione aumentata da recupero (RAG), che è in sola lettura e tratta la rilevanza come una proprietà del contenuto piuttosto che dell'utente; la memoria IA richiede un percorso di scrittura che estrae fatti dalle conversazioni e aggiorna l'archiviazione quando le informazioni cambiano.4

Il settore riconosce due livelli principali. La memoria a breve termine, o memoria di lavoro, tiene traccia della conversazione in corso all'interno di una sessione, mentre la memoria a lungo termine archivia dati specifici dell'utente o a livello di applicazione tra le sessioni.5 Alcuni framework aggiungono una terza categoria, la memoria episodica, che consente agli agenti di richiamare specifiche esperienze passate in modo simile a come gli esseri umani ricordano i singoli eventi.

Nei prodotti di consumo, la “memoria chat” si riferisce specificamente alle preferenze dell'utente e al succo della conversazione resi disponibili automaticamente, ed è architetturalmente più ristretta rispetto alla “memoria agente” utilizzata nei framework per sviluppatori; quest'ultima comprende lo stato delle attività, la cronologia delle chiamate agli strumenti e le procedure apprese.6

Lascia che il nostro team automatizzi uno dei tuoi processi aziendali con agenti IA, gratuitamente.
Automatizza un processo

Come funziona la memoria IA?

I sistemi di memoria IA convergono su una pipeline comune di scrittura/recupero/consolidamento che differisce dal recupero statico. Le nuove informazioni entrano attraverso una fase di estrazione che elabora coppie di messaggi per identificare fatti candidati, passano attraverso una fase di aggiornamento in cui un LLM decide se aggiungere, aggiornare, eliminare o ignorare ogni fatto, ed escono attraverso una fase di recupero che esegue una ricerca semantica al momento della query.7

Applicazioni reali della memoria IA

Assistenti IA personali

La funzione di memoria di ChatGPT di OpenAI crea profili persistenti dalle conversazioni degli utenti, dai file e dalle app collegate. Un aggiornamento “Dreaming” del 2026 ha introdotto la sintesi in background tra molte conversazioni, consentendo ai ricordi di auto-aggiornarsi nel tempo; ad esempio, un ricordo salvato che afferma “l'utente andrà a Singapore a luglio” si riscrive automaticamente in “l'utente è andato a Singapore a luglio 2026” una volta trascorso il viaggio.8 Gli utenti gestiscono la memoria tramite Impostazioni > Personalizzazione > Memoria, sebbene OpenAI osservi che il riepilogo visibile non cattura tutto ciò che viene archiviato.

Anthropic ha lanciato la memoria Claude per gli utenti del piano Team l'11 settembre 2025, l'ha estesa al piano Enterprise il 18 settembre 2025, e ha raggiunto tutti gli utenti, incluso il piano gratuito, il 2 marzo 2026.9 Il 10 luglio 2026, Anthropic ha riprogettato la funzione in voci categorizzate che Claude legge e aggiorna durante le conversazioni, sostituendo il precedente riepilogo giornaliero unico.

Google ha dotato Gemini di una memoria che archivia le informazioni che gli utenti chiedono di ricordare più i dettagli dedotti dalle conversazioni passate quando il contesto personale è abilitato.10 L'aggiornamento separato “Personal Intelligence”, quando attivato, si collega a Gmail e Foto senza addestrare models su tali contenuti.11

Agenti aziendali e assistenza clienti

L'implementazione di Decagon con Rippling ha collegato l'agente IA ad API interne in modo che l'agente potesse recuperare i dati dei singoli account dei dipendenti anziché rispondere in modo generico, aumentando la deviazione della chat dal 38% a oltre il 50%, con un miglioramento relativo del 32%.12 Il lavoro di Decagon con Chime ha automatizzato attività ad alto attrito, tra cui la sostituzione delle carte e i controlli sullo stato dei depositi, riducendo i costi di assistenza clienti del 60% e raddoppiando i punteggi di soddisfazione dei membri.13

Robotica, sanità e IA incarnata

Il robot logistico ospedaliero Moxi di Diligent Robotics opera in più di 25 strutture statunitensi e ha completato oltre 1.25 milioni di consegne autonome a partire dal 2026, mappando ogni ambiente ospedaliero tramite sensori di bordo e navigando tra ostacoli dinamici, comprese le porte con accesso tramite badge.14 Moxi 2.0 funziona su elaborazione NVIDIA IGX Thor con 10 volte la capacità di elaborazione dell'originale, addestrato su tre anni di dati reali di consegna ospedaliera.

Il framework ReMEmbR di NVIDIA fornisce ai robot mobili una memoria spazio-temporale a lungo orizzonte per costruire e ragionare su registrazioni continue di ciò che hanno visto per i compiti di navigazione.15 ASPIRE, rilasciato il 29 giugno 2026, archivia ogni correzione di debug convalidata come un modello di codice denominato e riutilizzabile, portando i tassi di successo dal 20% al 92% sul benchmark di passaggio di oggetti bimanuale di Robosuite grazie al solo debug iterativo.16

Nell'assistenza sanitaria, la piattaforma di documentazione IA ambientale di Abridge è utilizzata da Northwell Health in 28 ospedali per ridurre il carico di documentazione clinica.17 Riverside Health ha sperimentato strumenti di documentazione ambientale per due mesi prima di scegliere Abridge per una distribuzione ampliata.18

Non perderti i nostri benchmark e approfondimenti basati sui dati. Il pulsante apre Google; selezionare AIMultiple conferma che desideri vedere AIMultiple più spesso nei risultati di ricerca di Google.
GoogleAggiungi come fonte preferita

Vantaggi della memoria IA

I sistemi di memoria riducono i costi in token e la latenza nei benchmark a lungo orizzonte rispetto alla riproduzione dell'intero contesto. Sul benchmark LoCoMo, che testa conversazioni con una media di 300 turni su un massimo di 35 sessioni, Mem0 segnala un risparmio superiore al 90% in costi di token rispetto alla riproduzione dell'intera cronologia della conversazione, una riduzione della latenza p95 del 91% (1.44s contro 17.12s) e un miglioramento relativo del 26% nel punteggio LLM-as-a-Judge rispetto alla baseline di memoria di OpenAI.7

Zep segnala un'accuratezza del 94,8% sul benchmark Deep Memory Retrieval contro il 93,4% di MemGPT, guadagni di accuratezza aggregata fino al 18,5% su LongMemEval abbinato a GPT-4o e una riduzione del 90% della latenza di risposta rispetto alle baseline a contesto completo, con il tempo di risposta mediano sceso da 28,9 secondi a 2,58 secondi mentre i token di contesto sono scesi da circa 115.000 a 1.600.1920

Il benchmark BEAM, che testa fino a 10 milioni di token, ha rilevato che il suo framework di memoria LIGHT ha migliorato le prestazioni in media da 3.5 a 12.69 punti percentuali rispetto alle baseline esistenti più forti, e che anche gli LLM con finestre di contesto da 1 milione di token degradano sostanzialmente man mano che la lunghezza della conversazione cresce.21

L'architettura Dreaming di OpenAI per ChatGPT ha migliorato l'accuratezza della memoria sensibile al tempo dal 9,4% al 75,1%, con un richiamo fattuale del 82,8% e un'aderenza alle preferenze del 71,3%, riducendo al contempo il costo di calcolo di circa 5x.8

Sfide e rischi della memoria IA

Avvelenamento della memoria e sicurezza

L'avvelenamento della memoria è classificato come ASI06, “Memory and Context Poisoning”, nella OWASP Top 10 per le applicazioni agentiche, definito come corruzione della memoria persistente dell'agente che porta a disallineamento e comportamenti dannosi tra le sessioni.2223 Nel febbraio 2025, il ricercatore Johann Rehberger ha dimostrato un attacco di “invocazione ritardata dello strumento” contro Google Gemini che ha indotto il sistema ad archiviare fatti falsi come ricordi a lungo termine, incluse informazioni errate sull'età.24

MINJA (Memory INJection Attack), accettato a NeurIPS 2025, mostra che gli attaccanti con una semplice interazione query-risposta possono avvelenare la memoria a lungo termine, raggiungendo un tasso di successo dell'iniezione del 98,2% e un tasso di successo dell'attacco del 76,8% in media tra gli agenti testati.25 AgentPoison, pubblicato a NeurIPS 2024, ottiene oltre l'80% di tasso di successo dell'attacco avvelenando meno dello 0,1% dei record di memoria, degradando le prestazioni dei compiti benigni di meno dell'1%.26

Privacy e governance dei dati

MEXTRA, un attacco black-box di estrazione della memoria, crea query per estrarre dati privati memorizzati, ottenendo tassi di estrazione completa dell'83% contro EHRAgent e dell'87% contro agenti di shopping web utilizzando 30 prompt di attacco.27 Aumentare la profondità di recupero o la dimensione totale della memoria aumenta entrambi i tassi di perdita di dati.27

L'autorità italiana per la protezione dei dati ha multato OpenAI €15 milioni nel dicembre 2024 per aver trattato dati personali per addestrare ChatGPT senza una base giuridica adeguata, sebbene il Tribunale di Roma abbia annullato la multa nel marzo 2026 stabilendo che la Commissione irlandese per la protezione dei dati aveva giurisdizione come autorità di controllo capofila dell'UE.2829

La documentazione di OpenAI afferma che disattivare la memoria non elimina automaticamente i ricordi archiviati in precedenza; un ripristino completo richiede sia la disattivazione della memoria sia la cancellazione separata delle voci esistenti.

Limitazioni tecniche

Tra i dieci approcci di memoria valutati sul benchmark LoCoMo, la maggior parte dei metodi ottiene punteggi più bassi nelle domande di ragionamento temporale rispetto al recupero fattuale a singolo salto, sebbene almeno un approccio inverta questo schema.7

L'obsolescenza della memoria presenta un altro problema irrisolto: quando i fatti memorizzati sono contraddetti da nuove informazioni, i sistemi faticano a distinguere i dati attuali da quelli obsoleti. Il benchmark MemConflict valuta scenari in cui i fatti memorizzati diventano obsoleti o entrano direttamente in conflitto, rilevando che i sistemi esistenti non riescono a risolvere in modo affidabile questi conflitti.30

Inoltre, le prestazioni sui benchmark standardizzati non si traducono in modo affidabile in affidabilità in produzione perché gli ambienti sintetici semplificano eccessivamente l'uso reale.31

Per approfondire

Cita questo benchmark

Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.

Cem Dilmegani and Şevval Alper (2026) - "RELC-Bench: benchmark di retrieval su contesto lungo". Pubblicato online su AIMultiple.com. Consultato il 15 settembre 2026, da: https://aimultiple.com/ai-memory [Risorsa online]

Dilmegani, C., & Alper, Ş. (2026, 15 settembre). RELC-Bench: benchmark di retrieval su contesto lungo. AIMultiple. https://aimultiple.com/ai-memory

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Alper, Şevval},
  title  = {{RELC-Bench: benchmark di retrieval su contesto lungo}},
  year   = {2026},
  month  = sep,
  howpublished    = {\url{https://aimultiple.com/ai-memory}},
  note   = {AIMultiple. Consultato il 15 settembre 2026}
}
Scarica tutti i dati

Risultati e timestamp di 0 punti dati. Scarica i dati di sintesi mostrati nei grafici e nelle tabelle di questo articolo come file ZIP contenente 0 file CSV.

Ultimo aggiornamento: 26 settembre 2026
Scarica

Vuoi i dati granulari che ci stanno dietro? Passa a Premium

Registro delle modifiche

10 aggiornamenti
  1. Aggiunti i risultati di claude-fable-5 alla sezione Metodologia.

  2. Sostituito il benchmark di memoria IA con 26 modelli con le sezioni di risultati e metodologia di RELC-Bench.

  3. Aggiornati i dati di "esclusione di GPT-5" nell'introduzione.

  4. Espansa la sezione "Perché i modelli grandi faticano con la memoria?" con soluzioni architettoniche.

  5. Sostituita la metodologia di benchmark della memoria AI con i tipi di domanda.

Collegamenti di riferimento

1.
What Is AI Agent Memory? | IBM
2.
Context windows - Claude Platform Docs
3.
What Is Agent Memory? A Guide to Enhancing AI Learning and Recall | MongoDB
MongoDB
4.
RAG vs. Memory: What AI Agent Developers Need to Know
Mem0
5.
Memory overview - Docs by LangChain
Docs by LangChain
6.
Memory in ChatGPT | OpenAI Help Center
7.
[2504.19413] Mem0: Building Production-Ready AI Agents with Scalable Long-Term Memory
8.
Dreaming: Better memory for a more helpful ChatGPT | OpenAI
9.
Release notes | Claude Help Center
10.
Get personalization with memory of your past Gemini chats - Computer - Gemini Apps Help
11.
Gemini gets personal as Google rolls out a big memory upgrade- Android Authority
Authority Media
12.
Rippling Customer Success Story | Decagon AI
Decagon AI
13.
Chime Customer Success Story | Decagon AI
Decagon AI
14.
Diligent Robotics Unveils Moxi 2.0, Advancing The Largest Fleet of Deployed AI-Powered Mobile Manipulation Robots Operating in Unstructured, Human-Centric Work Environments
15.
ResearchGate - Temporarily Unavailable
16.
Robot Skill Library ASPIRE Gives Robots Memory: Handover Climbs to 92%
Tech Times
17.
Northwell Leverages Abridge to Drive Digital Transformation
18.
Riverside Health Case Study | Abridge
19.
[2501.13956] Zep: A Temporal Knowledge Graph Architecture for Agent Memory
20.
Zep Is The New State of the Art In Agent Memory
Zep - Agent memory at enterprise scale
21.
[2510.27246] Beyond a Million Tokens: Benchmarking and Enhancing Long-Term Memory in LLMs
22.
OWASP Agent Memory Guard
23.
OWASP Top 10 for Agentic Applications - The Benchmark for Agentic Security in the Age of Autonomous AI - OWASP Gen AI Security Project
OWASP Top 10 for LLM & Generative AI Security
24.
Google Gemini's Long-term Memory Vulnerable to a Kind of Phishing Attack - InfoQ
InfoQ
25.
[2503.03704] Memory Injection Attacks on LLM Agents via Query-Only Interaction
26.
[2407.12784] AgentPoison: Red-teaming LLM Agents via Poisoning Memory or Knowledge Bases
27.
[2502.13172] Unveiling Privacy Risks in LLM Agent Memory
28.
Italy fines OpenAI over ChatGPT privacy rules breach By Reuters
Investing.com
29.
Italian court scraps 15-million-euro privacy watchdog fine on ChatGPT-maker OpenAI
Yahoo! Finance
30.
MemConflict: Evaluating Long-Term Memory Systems UnderMemory Conflicts
31.
A Survey of Agent Memory in the Second Half: TowardsSelf-Evolving and Long-Horizon Agents
Cem Dilmegani
Cem Dilmegani
Analista principale
Cem è analista principale presso AIMultiple dal 2017.

Il lavoro di Cem presso AIMultiple è stato citato da importanti testate internazionali tra cui Business Insider, Forbes, Morning Brew e Washington Post, da aziende globali come Deloitte e HPE, da ONG come il World Economic Forum e da organizzazioni sovranazionali come la Commissione europea. [1], [2], [3], [4], [5]

Nel corso della sua carriera, Cem ha lavorato come consulente tecnologico, acquirente tecnologico e imprenditore tecnologico. Ha consigliato le aziende sulle loro decisioni tecnologiche presso McKinsey & Company e Altman Solon per più di un decennio. Ha inoltre pubblicato un report McKinsey sulla digitalizzazione.

Ha guidato la strategia tecnologica e gli approvvigionamenti di una società di telecomunicazioni rispondendo direttamente al CEO. Ha inoltre guidato la crescita commerciale dell'azienda deep tech Hypatos, che ha raggiunto ricavi ricorrenti annuali a 7 cifre e una valutazione a 9 cifre partendo da zero in 2 anni. Il lavoro di Cem in Hypatos è stato ripreso da importanti testate tecnologiche come TechCrunch e Business Insider.

Cem interviene regolarmente a conferenze tecnologiche internazionali. Si è laureato come ingegnere informatico presso l'Università di Bogazici e possiede un MBA della Columbia Business School.
Visualizza il profilo completo
Revisionato tecnicamente da
Şevval Alper
Şevval Alper
Ricercatrice di IA
Şevval è una ricercatrice di IA presso AIMultiple. Ha precedenti esperienze di ricerca nella generazione di numeri pseudocasuali utilizzando sistemi caotici.
Şevval si concentra su strumenti di programmazione IA, agenti IA e tecnologie quantistiche.
Visualizza il profilo completo

Sii il primo a commentare

Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.

0/450