RELC-Bench (RELC-Bench: Benchmark di recupero su contesto lungo) mira a misurare la capacità di un modello di trovare ed estrarre un valore numerico specifico da uno o più documenti all'interno del suo contesto. Verifica se il modello è in grado di ricordare e recuperare un fatto specifico che ha appena visto nell'input.
Risultati
claude-fable-5 ottiene un punteggio del 97.0% sui 100 item di richiamo diretto, piatto su tutte le posizioni del haystack (97.0% inizio, 97.1% metà, 97.0% fine).
Metodologia
Question format
Una domanda in linguaggio naturale che richiede una metrica numerica. Esempio:
Q: Qual è stato il fatturato del primo trimestre 2026 di Adobe (ADBE)?
Atteso: $6.40 miliardi
Fonte dei dati
Lo script analizza la sezione Takeaways di ogni trascrizione degli utili di Motley Fool ed estrae tutte le metriche numeriche. Per ogni metrica, lo script verifica che il numero appaia testualmente nel corpo della trascrizione post-Takeaways (il testo effettivo della conference call), in modo che il modello debba leggere la conversazione reale, non i punti riassuntivi. I punti riassuntivi vengono rimossi dai testi.
Regola di punteggio
- Ogni item ha un elenco di valori target; il primo è il target primario (la risposta principale alla domanda)
- Punteggio = 1.0 se il target primario corrisponde a qualsiasi numero nella previsione
- Punteggio = 0.0 altrimenti
- I rifiuti ("Non lo so") ottengono un punteggio di 0.0
- claude-fable-5 viene testato tramite Claude Code: il haystack viene fornito come file e il modello recupera da esso con strumenti di ricerca invece di leggerlo dalla sua finestra di contesto. I suoi punteggi misurano il modello insieme all'harness di Claude Code, e l'invarianza di posizione è attesa in questa configurazione perché la profondità del target non si applica alla ricerca su file.
Che aspetto hanno le buone prestazioni
Fase 1 ≥ 85% (il modello trova in modo affidabile le metriche in un singolo documento).
Fase 2 ≥ 90% (il modello naviga verso il target in un haystack senza distrazioni).
Punteggi invarianti rispetto alla posizione indicano una vera capacità di contesto lungo; punteggi in calo con la profondità indicano “perso nel mezzo”.
Conteggio degli item
100 item di richiamo diretto distribuiti su 14 trascrizioni.
Cos'è la memoria IA?
La memoria IA è la capacità di un sistema di intelligenza artificiale di archiviare e richiamare esperienze passate per migliorare il processo decisionale, la percezione e le prestazioni complessive.1 A differenza della memoria umana, che è soggettiva e selettiva, la memoria IA è un'architettura tecnica, un archivio strutturato di informazioni all'interno di reti neurali o database esterni.
Il concetto è distinto dalla finestra di contesto di un modello, che è il buffer di token finito e legato alla sessione che funge da memoria di lavoro durante l'inferenza.2 Mentre la finestra di contesto si azzera tra le sessioni e perde informazioni quando i token vengono troncati, la memoria IA persiste tra le sessioni attraverso una memoria esterna.3 È anche distinta dalla generazione aumentata da recupero (RAG), che è di sola lettura e tratta la rilevanza come una proprietà del contenuto piuttosto che dell'utente; la memoria IA richiede un percorso di scrittura che estrae fatti dalle conversazioni e aggiorna l'archiviazione quando le informazioni cambiano.4
Il campo riconosce due livelli principali. La memoria a breve termine, o memoria di lavoro, tiene traccia della conversazione in corso all'interno di una sessione, mentre la memoria a lungo termine archivia dati specifici dell'utente o a livello di applicazione tra le sessioni.5 Alcuni framework aggiungono una terza categoria, la memoria episodica, che consente agli agenti di richiamare esperienze passate specifiche in modo simile a come gli umani ricordano eventi individuali.
Nei prodotti di consumo, la “memoria chat” si riferisce specificamente alle preferenze dell'utente e ai riassunti delle conversazioni emersi automaticamente, il che è architetturalmente più ristretto della “memoria agente” come utilizzata nei framework per sviluppatori, che comprende lo stato delle attività, la cronologia delle chiamate agli strumenti e le procedure apprese.6
Come funziona la memoria IA?
I sistemi di memoria IA convergono su una pipeline comune di scrittura/recupero/consolidamento che differisce dal recupero statico. Le nuove informazioni entrano attraverso una fase di estrazione che elabora coppie di messaggi per identificare fatti candidati, passano attraverso una fase di aggiornamento in cui un LLM decide se aggiungere, aggiornare, eliminare o ignorare ogni fatto, ed escono attraverso una fase di recupero che esegue una ricerca semantica al momento della query.7
Applicazioni reali della memoria IA
Assistenti IA personali
La funzione di memoria di OpenAI ChatGPT costruisce profili persistenti dalle conversazioni degli utenti, dai file e dalle app collegate. Un aggiornamento “Dreaming” del 2026 ha introdotto la sintesi in background su molte conversazioni, consentendo ai ricordi di auto-aggiornarsi nel tempo; ad esempio, un ricordo salvato che dice “l'utente andrà a Singapore a luglio” si riscrive automaticamente in “l'utente è andato a Singapore a luglio 2026” una volta che il viaggio è passato.8 Gli utenti gestiscono la memoria tramite Impostazioni > Personalizzazione > Memoria, anche se OpenAI nota che il riepilogo visibile non cattura tutto ciò che è archiviato.
La memoria di Anthropic per Claude è stata lanciata per gli utenti del piano Team l'11 settembre 2025, estesa all'Enterprise il 18 settembre 2025, e ha raggiunto tutti gli utenti, incluso il livello gratuito, il 2 marzo 2026.9 Il 10 luglio 2026, Anthropic ha riprogettato la funzione in voci categorizzate che Claude legge e aggiorna durante le conversazioni, sostituendo il precedente riepilogo giornaliero singolo.
Google Gemini memorizza le informazioni che gli utenti chiedono di ricordare più i dettagli dedotti dalle conversazioni passate quando il contesto Personale è abilitato.10 L'aggiornamento separato “Personal Intelligence”, quando attivato, si connette a Gmail e Foto senza addestrare modelli su quel contenuto.11
Agenti aziendali e assistenza clienti
Fastweb e Vodafone Italia hanno implementato un sistema multi-agente costruito con LangGraph e LangSmith che serve 9.5 milioni di clienti, iniettando automaticamente i dati CRM all'inizio di ogni interazione per identificare i clienti e personalizzare le risposte. Il sistema riporta un tasso di correttezza del 90%, un tasso di risoluzione del 82% e un Customer Effort Score di 5.2 su 7.12
L'implementazione di Decagon con Rippling ha collegato l'agente IA alle API interne in modo che l'agente potesse recuperare i dati del conto dei singoli dipendenti invece di rispondere genericamente, aumentando la deviazione della chat dal 38% a oltre il 50%, un miglioramento relativo del 32%.13 Il lavoro di Decagon con Chime ha automatizzato attività ad alto attrito tra cui la sostituzione della carta e i controlli dello stato dei depositi, riducendo i costi di assistenza clienti del 60% raddoppiando al contempo i punteggi di soddisfazione dei membri.14
Robotica, sanità e IA incarnata
Il robot logistico ospedaliero Moxi di Diligent Robotics opera in più di 25 strutture negli Stati Uniti e ha completato oltre 1.25 milioni di consegne autonome a partire dal 2026, mappando ogni ambiente ospedaliero utilizzando sensori di bordo e navigando ostacoli dinamici comprese porte con accesso tramite badge.15 Moxi 2.0 funziona con il calcolo NVIDIA IGX Thor con 10 volte la capacità di elaborazione dell'originale, addestrato su tre anni di dati reali di consegna ospedaliera.
Il framework ReMEmbR di NVIDIA fornisce ai robot mobili una memoria spazio-temporale a lungo orizzonte per costruire e ragionare su registrazioni continue di ciò che hanno visto per compiti di navigazione.16 ASPIRE, rilasciato il 29 giugno 2026, memorizza ogni correzione di debug convalidata come un modello di codice riutilizzabile e denominato, aumentando i tassi di successo dal 20% al 92% sul benchmark di passaggio di oggetti bimanuali di Robosuite attraverso il solo debugging iterativo.17
Nel settore sanitario, la piattaforma di documentazione IA ambientale di Abridge è distribuita da Northwell Health in 28 ospedali per ridurre il carico di documentazione clinica.18 Riverside Health ha sperimentato strumenti di documentazione ambientale per due mesi prima di selezionare Abridge per un'implementazione estesa.19
Vantaggi della memoria IA
I sistemi di memoria riducono i costi dei token e la latenza nei benchmark a lungo orizzonte rispetto al replay dell'intero contesto. Sul benchmark LoCoMo, che testa conversazioni con una media di 300 turni distribuiti su un massimo di 35 sessioni, Mem0 segnala un risparmio di oltre il 90% nel costo dei token rispetto al replay dell'intera cronologia delle conversazioni, riducendo la latenza p95 del 91% (1.44s contro 17.12s), e ottenendo un miglioramento relativo del 26% nel punteggio LLM-come-Giudice rispetto alla baseline di memoria di OpenAI.7
Zep riporta un'accuratezza del 94.8% sul benchmark Deep Memory Retrieval contro il 93.4% per MemGPT, fino al 18.5% di guadagni di accuratezza aggregati su LongMemEval abbinato a GPT-4o, e una riduzione del 90% della latenza di risposta rispetto alle baseline a contesto completo, con il tempo di risposta mediano che scende da 28.9 secondi a 2.58 secondi mentre i token di contesto sono scesi da circa 115.000 a 1.600.20 21
Il benchmark BEAM, che testa fino a 10 milioni di token, ha rilevato che il suo framework di memoria LIGHT ha migliorato le prestazioni in media da 3.5 a 12.69 punti percentuali rispetto alle baseline più forti esistenti, e che anche gli LLM con finestre di contesto da 1 milione di token si degradano sostanzialmente all'aumentare della lunghezza della conversazione.22
L'architettura Dreaming di OpenAI per ChatGPT ha migliorato l'accuratezza della memoria sensibile al tempo dal 9.4% al 75.1%, con un richiamo fattuale del 82.8% e un'aderenza alle preferenze del 71.3%, riducendo al contempo il costo computazionale di circa 5x.8
Sfide e rischi della memoria IA
Avvelenamento della memoria e sicurezza
L'avvelenamento della memoria è classificato come ASI06, “Memory and Context Poisoning”, nella Top 10 OWASP per le Applicazioni Agentiche, definito come la corruzione della memoria persistente dell'agente che porta a disallineamento e comportamento dannoso tra le sessioni.23 24 Nel febbraio 2025, il ricercatore Johann Rehberger ha dimostrato un attacco di “invocazione ritardata di strumenti” contro Google Gemini che ha indotto il sistema a memorizzare falsi fatti come ricordi a lungo termine, comprese informazioni errate sull'età.25
MINJA (Memory INJection Attack), accettato a NeurIPS 2025, mostra che gli attaccanti con una semplice interazione di query e risposta possono avvelenare la memoria a lungo termine, raggiungendo un tasso di successo dell'iniezione del 98.2% e un tasso di successo dell'attacco del 76.8% in media tra gli agenti testati.26 AgentPoison, pubblicato a NeurIPS 2024, ottiene oltre l'80% di tasso di successo dell'attacco avvelenando meno dello 0.1% dei record di memoria, degradando le prestazioni del compito benigno di meno dell'1%.27
Privacy e governance dei dati
MEXTRA, un attacco di estrazione della memoria a scatola nera, crea query per estrarre dati privati memorizzati, raggiungendo tassi di estrazione completa del 83% contro EHRAgent e del 87% contro agenti di acquisto web utilizzando 30 prompt di attacco.28 L'aumento della profondità di recupero o della dimensione totale della memoria aumentano entrambi i tassi di fuga di dati.28
L'autorità italiana per la protezione dei dati ha multato OpenAI per €15 milioni nel dicembre 2024 per aver trattato dati personali per addestrare ChatGPT senza una base giuridica adeguata, sebbene la Corte di Roma abbia annullato la multa nel marzo 2026 stabilendo che la Commissione per la protezione dei dati irlandese aveva giurisdizione come autorità di controllo capofila dell'UE.29 30
La documentazione di OpenAI afferma che disattivare la memoria non elimina automaticamente i ricordi precedentemente archiviati; un ripristino completo richiede sia la disattivazione della memoria che la cancellazione separata delle voci esistenti.
Limitazioni tecniche
Tra dieci approcci di memoria valutati sul benchmark LoCoMo, la maggior parte dei metodi ottiene punteggi più bassi su domande di ragionamento temporale che sul recupero fattuale a singolo salto, anche se almeno un approccio inverte questo pattern.7
La obsolescenza della memoria presenta un altro problema irrisolto: quando i fatti memorizzati vengono contraddetti da nuove informazioni, i sistemi faticano a distinguere i dati attuali da quelli obsoleti. Il benchmark MemConflict valuta scenari in cui i fatti memorizzati diventano obsoleti o entrano direttamente in conflitto, riscontrando che i sistemi esistenti non riescono a risolvere in modo affidabile questi conflitti.31
Inoltre, le prestazioni sui benchmark standardizzati non si traducono in modo affidabile in affidabilità in produzione perché gli ambienti sintetici semplificano eccessivamente l'uso reale.32
Ulteriori letture
- Agenti Cognitivi: Creare una Mente con LangChain
- 5 Framework IA Agentici Open-Source
- App IA con MCP Benchmark di Memoria e Tutorial
- Esecuzione di Codice con MCP: Un Nuovo Approccio all'Efficienza degli Agenti IA
Cita questo benchmark
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{dilmegani2026,
author = {Dilmegani, Cem},
title = {{RELC-Bench: Benchmark di recupero su contesto lungo}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/ai-memory}},
note = {AIMultiple. Consultato il 4 Agosto 2026}
}Collegamenti di riferimento
Il lavoro di Cem è stato citato da importanti pubblicazioni globali tra cui Business Insider, Forbes, Washington Post, aziende globali come Deloitte, HPE e ONG come il World Economic Forum e organizzazioni sovranazionali come la Commissione europea.
Nel corso della sua carriera, Cem ha lavorato come consulente tecnologico, acquirente di tecnologia e imprenditore tecnologico. Ha consigliato aziende sulle loro decisioni tecnologiche presso McKinsey & Company e Altman Solon per oltre un decennio. Ha anche pubblicato un rapporto McKinsey sulla digitalizzazione.
Ha guidato la strategia tecnologica e gli approvvigionamenti di una società di telecomunicazioni rispondendo direttamente al CEO. Ha anche guidato la crescita commerciale dell'azienda deep tech Hypatos che ha raggiunto un fatturato annuo ricorrente a 7 cifre e una valutazione a 9 cifre partendo da 0 in 2 anni. Il lavoro di Cem in Hypatos è stato trattato da importanti pubblicazioni tecnologiche come TechCrunch e Business Insider.
Cem interviene regolarmente a conferenze tecnologiche internazionali. Si è laureato in ingegneria informatica all'Università Bogazici e ha conseguito un MBA presso la Columbia Business School.
Sii il primo a commentare
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.