RELC-Bench (RELC-Bench: benchmark di retrieval su contesto lungo) mira a misurare la capacità di un model di trovare ed estrarre un valore numerico specifico da uno o più documenti presenti nel proprio contesto. Verifica se il model riesce a ricordare e recuperare un fatto specifico appena visto nell'input.
Risultati
claude-fable-5 ottiene 97,0% nei 100 elementi di richiamo diretto, con risultati uniformi nelle diverse posizioni all'interno del pagliaio (97,0% inizio, 97,1% centro, 97,0% fine).
Metodologia
Question format
Una domanda in linguaggio naturale che richiede un singolo parametro numerico. Esempio:
D: Qual è stato il fatturato del Q1 2026 di Adobe (ADBE)?
Previsto: $6,40 miliardi
Fonte dei dati
Lo script analizza la sezione Takeaways di ogni trascrizione degli utili di Motley Fool ed estrae tutti i parametri numerici. Per ogni parametro, lo script verifica che il numero compaia testualmente nel corpo della trascrizione post-Takeaways (il testo reale della teleconferenza), in modo che il model debba leggere la conversazione reale e non i punti di sintesi. I punti di sintesi vengono rimossi dai testi.
Regola di punteggio
- Ogni elemento ha un elenco di valori obiettivo; il primo è l'obiettivo primario (la risposta principale alla domanda).
- Punteggio = 1.0 se l'obiettivo primario corrisponde a qualsiasi numero nella previsione.
- Punteggio = 0.0 altrimenti.
- I rifiuti («Non lo so») ottengono un punteggio di 0.0
- claude-fable-5 viene testato tramite Claude Code: il pagliaio viene fornito come file e il model recupera da esso con strumenti di ricerca invece di leggerlo dalla propria finestra di contesto. I suoi punteggi misurano il model insieme all'harness di Claude Code, e in questa configurazione ci si aspetta invarianza di posizione perché la profondità dell'obiettivo non si applica alla ricerca su file.
Come si presenta una buona prestazione
Fase 1 ≥ 85% (il model trova in modo affidabile i parametri in un singolo documento).
Fase 2 ≥ 90% (il model naviga fino all'obiettivo in un pagliaio senza distrazioni).
I punteggi invarianti rispetto alla posizione indicano una vera capacità di contesto lungo; punteggi in calo con la profondità indicano «persi nel mezzo».
Numero di elementi
100 elementi di richiamo diretto distribuiti su 14 trascrizioni.
Che cos'è la memoria IA?
La memoria IA è la capacità di un sistema di intelligenza artificiale di archiviare e richiamare esperienze passate per migliorare il processo decisionale, la percezione e le prestazioni complessive.1 A differenza della memoria umana, che è soggettiva e selettiva, la memoria IA è un'architettura tecnica, un archivio strutturato di informazioni all'interno di reti neurali o database esterni.
Il concetto è distinto dalla finestra di contesto di un model, che è il buffer di token finito e legato alla sessione che funge da memoria di lavoro durante l'inference.2 Mentre la finestra di contesto si azzera tra le sessioni e perde informazioni quando i token vengono troncati, la memoria IA persiste tra le sessioni tramite archiviazione esterna.3 È inoltre distinta dalla generazione aumentata da recupero (RAG), che è in sola lettura e tratta la rilevanza come una proprietà del contenuto piuttosto che dell'utente; la memoria IA richiede un percorso di scrittura che estrae fatti dalle conversazioni e aggiorna l'archiviazione quando le informazioni cambiano.4
Il settore riconosce due livelli principali. La memoria a breve termine, o memoria di lavoro, tiene traccia della conversazione in corso all'interno di una sessione, mentre la memoria a lungo termine archivia dati specifici dell'utente o a livello di applicazione tra le sessioni.5 Alcuni framework aggiungono una terza categoria, la memoria episodica, che consente agli agenti di richiamare specifiche esperienze passate in modo simile a come gli esseri umani ricordano i singoli eventi.
Nei prodotti di consumo, la “memoria chat” si riferisce specificamente alle preferenze dell'utente e al succo della conversazione resi disponibili automaticamente, ed è architetturalmente più ristretta rispetto alla “memoria agente” utilizzata nei framework per sviluppatori; quest'ultima comprende lo stato delle attività, la cronologia delle chiamate agli strumenti e le procedure apprese.6
Come funziona la memoria IA?
I sistemi di memoria IA convergono su una pipeline comune di scrittura/recupero/consolidamento che differisce dal recupero statico. Le nuove informazioni entrano attraverso una fase di estrazione che elabora coppie di messaggi per identificare fatti candidati, passano attraverso una fase di aggiornamento in cui un LLM decide se aggiungere, aggiornare, eliminare o ignorare ogni fatto, ed escono attraverso una fase di recupero che esegue una ricerca semantica al momento della query.7
Applicazioni reali della memoria IA
Assistenti IA personali
La funzione di memoria di ChatGPT di OpenAI crea profili persistenti dalle conversazioni degli utenti, dai file e dalle app collegate. Un aggiornamento “Dreaming” del 2026 ha introdotto la sintesi in background tra molte conversazioni, consentendo ai ricordi di auto-aggiornarsi nel tempo; ad esempio, un ricordo salvato che afferma “l'utente andrà a Singapore a luglio” si riscrive automaticamente in “l'utente è andato a Singapore a luglio 2026” una volta trascorso il viaggio.8 Gli utenti gestiscono la memoria tramite Impostazioni > Personalizzazione > Memoria, sebbene OpenAI osservi che il riepilogo visibile non cattura tutto ciò che viene archiviato.
Anthropic ha lanciato la memoria Claude per gli utenti del piano Team l'11 settembre 2025, l'ha estesa al piano Enterprise il 18 settembre 2025, e ha raggiunto tutti gli utenti, incluso il piano gratuito, il 2 marzo 2026.9 Il 10 luglio 2026, Anthropic ha riprogettato la funzione in voci categorizzate che Claude legge e aggiorna durante le conversazioni, sostituendo il precedente riepilogo giornaliero unico.
Google ha dotato Gemini di una memoria che archivia le informazioni che gli utenti chiedono di ricordare più i dettagli dedotti dalle conversazioni passate quando il contesto personale è abilitato.10 L'aggiornamento separato “Personal Intelligence”, quando attivato, si collega a Gmail e Foto senza addestrare models su tali contenuti.11
Agenti aziendali e assistenza clienti
L'implementazione di Decagon con Rippling ha collegato l'agente IA ad API interne in modo che l'agente potesse recuperare i dati dei singoli account dei dipendenti anziché rispondere in modo generico, aumentando la deviazione della chat dal 38% a oltre il 50%, con un miglioramento relativo del 32%.12 Il lavoro di Decagon con Chime ha automatizzato attività ad alto attrito, tra cui la sostituzione delle carte e i controlli sullo stato dei depositi, riducendo i costi di assistenza clienti del 60% e raddoppiando i punteggi di soddisfazione dei membri.13
Robotica, sanità e IA incarnata
Il robot logistico ospedaliero Moxi di Diligent Robotics opera in più di 25 strutture statunitensi e ha completato oltre 1.25 milioni di consegne autonome a partire dal 2026, mappando ogni ambiente ospedaliero tramite sensori di bordo e navigando tra ostacoli dinamici, comprese le porte con accesso tramite badge.14 Moxi 2.0 funziona su elaborazione NVIDIA IGX Thor con 10 volte la capacità di elaborazione dell'originale, addestrato su tre anni di dati reali di consegna ospedaliera.
Il framework ReMEmbR di NVIDIA fornisce ai robot mobili una memoria spazio-temporale a lungo orizzonte per costruire e ragionare su registrazioni continue di ciò che hanno visto per i compiti di navigazione.15 ASPIRE, rilasciato il 29 giugno 2026, archivia ogni correzione di debug convalidata come un modello di codice denominato e riutilizzabile, portando i tassi di successo dal 20% al 92% sul benchmark di passaggio di oggetti bimanuale di Robosuite grazie al solo debug iterativo.16
Nell'assistenza sanitaria, la piattaforma di documentazione IA ambientale di Abridge è utilizzata da Northwell Health in 28 ospedali per ridurre il carico di documentazione clinica.17 Riverside Health ha sperimentato strumenti di documentazione ambientale per due mesi prima di scegliere Abridge per una distribuzione ampliata.18
Vantaggi della memoria IA
I sistemi di memoria riducono i costi in token e la latenza nei benchmark a lungo orizzonte rispetto alla riproduzione dell'intero contesto. Sul benchmark LoCoMo, che testa conversazioni con una media di 300 turni su un massimo di 35 sessioni, Mem0 segnala un risparmio superiore al 90% in costi di token rispetto alla riproduzione dell'intera cronologia della conversazione, una riduzione della latenza p95 del 91% (1.44s contro 17.12s) e un miglioramento relativo del 26% nel punteggio LLM-as-a-Judge rispetto alla baseline di memoria di OpenAI.7
Zep segnala un'accuratezza del 94,8% sul benchmark Deep Memory Retrieval contro il 93,4% di MemGPT, guadagni di accuratezza aggregata fino al 18,5% su LongMemEval abbinato a GPT-4o e una riduzione del 90% della latenza di risposta rispetto alle baseline a contesto completo, con il tempo di risposta mediano sceso da 28,9 secondi a 2,58 secondi mentre i token di contesto sono scesi da circa 115.000 a 1.600.1920
Il benchmark BEAM, che testa fino a 10 milioni di token, ha rilevato che il suo framework di memoria LIGHT ha migliorato le prestazioni in media da 3.5 a 12.69 punti percentuali rispetto alle baseline esistenti più forti, e che anche gli LLM con finestre di contesto da 1 milione di token degradano sostanzialmente man mano che la lunghezza della conversazione cresce.21
L'architettura Dreaming di OpenAI per ChatGPT ha migliorato l'accuratezza della memoria sensibile al tempo dal 9,4% al 75,1%, con un richiamo fattuale del 82,8% e un'aderenza alle preferenze del 71,3%, riducendo al contempo il costo di calcolo di circa 5x.8
Sfide e rischi della memoria IA
Avvelenamento della memoria e sicurezza
L'avvelenamento della memoria è classificato come ASI06, “Memory and Context Poisoning”, nella OWASP Top 10 per le applicazioni agentiche, definito come corruzione della memoria persistente dell'agente che porta a disallineamento e comportamenti dannosi tra le sessioni.2223 Nel febbraio 2025, il ricercatore Johann Rehberger ha dimostrato un attacco di “invocazione ritardata dello strumento” contro Google Gemini che ha indotto il sistema ad archiviare fatti falsi come ricordi a lungo termine, incluse informazioni errate sull'età.24
MINJA (Memory INJection Attack), accettato a NeurIPS 2025, mostra che gli attaccanti con una semplice interazione query-risposta possono avvelenare la memoria a lungo termine, raggiungendo un tasso di successo dell'iniezione del 98,2% e un tasso di successo dell'attacco del 76,8% in media tra gli agenti testati.25 AgentPoison, pubblicato a NeurIPS 2024, ottiene oltre l'80% di tasso di successo dell'attacco avvelenando meno dello 0,1% dei record di memoria, degradando le prestazioni dei compiti benigni di meno dell'1%.26
Privacy e governance dei dati
MEXTRA, un attacco black-box di estrazione della memoria, crea query per estrarre dati privati memorizzati, ottenendo tassi di estrazione completa dell'83% contro EHRAgent e dell'87% contro agenti di shopping web utilizzando 30 prompt di attacco.27 Aumentare la profondità di recupero o la dimensione totale della memoria aumenta entrambi i tassi di perdita di dati.27
L'autorità italiana per la protezione dei dati ha multato OpenAI €15 milioni nel dicembre 2024 per aver trattato dati personali per addestrare ChatGPT senza una base giuridica adeguata, sebbene il Tribunale di Roma abbia annullato la multa nel marzo 2026 stabilendo che la Commissione irlandese per la protezione dei dati aveva giurisdizione come autorità di controllo capofila dell'UE.2829
La documentazione di OpenAI afferma che disattivare la memoria non elimina automaticamente i ricordi archiviati in precedenza; un ripristino completo richiede sia la disattivazione della memoria sia la cancellazione separata delle voci esistenti.
Limitazioni tecniche
Tra i dieci approcci di memoria valutati sul benchmark LoCoMo, la maggior parte dei metodi ottiene punteggi più bassi nelle domande di ragionamento temporale rispetto al recupero fattuale a singolo salto, sebbene almeno un approccio inverta questo schema.7
L'obsolescenza della memoria presenta un altro problema irrisolto: quando i fatti memorizzati sono contraddetti da nuove informazioni, i sistemi faticano a distinguere i dati attuali da quelli obsoleti. Il benchmark MemConflict valuta scenari in cui i fatti memorizzati diventano obsoleti o entrano direttamente in conflitto, rilevando che i sistemi esistenti non riescono a risolvere in modo affidabile questi conflitti.30
Inoltre, le prestazioni sui benchmark standardizzati non si traducono in modo affidabile in affidabilità in produzione perché gli ambienti sintetici semplificano eccessivamente l'uso reale.31
Per approfondire
- 5 framework IA agentici open-source
- Esecuzione del codice con MCP: un nuovo approccio all'efficienza degli agenti IA
Cita questo benchmark
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Alper, Şevval},
title = {{RELC-Bench: benchmark di retrieval su contesto lungo}},
year = {2026},
month = sep,
howpublished = {\url{https://aimultiple.com/ai-memory}},
note = {AIMultiple. Consultato il 15 settembre 2026}
}Risultati e timestamp di 0 punti dati. Scarica i dati di sintesi mostrati nei grafici e nelle tabelle di questo articolo come file ZIP contenente 0 file CSV.
Vuoi i dati granulari che ci stanno dietro? Passa a Premium
Registro delle modifiche
10 aggiornamentiAggiunti i risultati di claude-fable-5 alla sezione Metodologia.
Sostituito il benchmark di memoria IA con 26 modelli con le sezioni di risultati e metodologia di RELC-Bench.
Aggiornati i dati di "esclusione di GPT-5" nell'introduzione.
Espansa la sezione "Perché i modelli grandi faticano con la memoria?" con soluzioni architettoniche.
Sostituita la metodologia di benchmark della memoria AI con i tipi di domanda.
Collegamenti di riferimento
Il lavoro di Cem presso AIMultiple è stato citato da importanti testate internazionali tra cui Business Insider, Forbes, Morning Brew e Washington Post, da aziende globali come Deloitte e HPE, da ONG come il World Economic Forum e da organizzazioni sovranazionali come la Commissione europea. [1], [2], [3], [4], [5]
Nel corso della sua carriera, Cem ha lavorato come consulente tecnologico, acquirente tecnologico e imprenditore tecnologico. Ha consigliato le aziende sulle loro decisioni tecnologiche presso McKinsey & Company e Altman Solon per più di un decennio. Ha inoltre pubblicato un report McKinsey sulla digitalizzazione.
Ha guidato la strategia tecnologica e gli approvvigionamenti di una società di telecomunicazioni rispondendo direttamente al CEO. Ha inoltre guidato la crescita commerciale dell'azienda deep tech Hypatos, che ha raggiunto ricavi ricorrenti annuali a 7 cifre e una valutazione a 9 cifre partendo da zero in 2 anni. Il lavoro di Cem in Hypatos è stato ripreso da importanti testate tecnologiche come TechCrunch e Business Insider.
Cem interviene regolarmente a conferenze tecnologiche internazionali. Si è laureato come ingegnere informatico presso l'Università di Bogazici e possiede un MBA della Columbia Business School.
Şevval si concentra su strumenti di programmazione IA, agenti IA e tecnologie quantistiche.
Sii il primo a commentare
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.