Servizi
Contattaci

RELC-Bench: Benchmark di recupero su contesto lungo

Cem Dilmegani
Cem Dilmegani
aggiornato il 4 ago. 2026

RELC-Bench (RELC-Bench: Benchmark di recupero su contesto lungo) mira a misurare la capacità di un modello di trovare ed estrarre un valore numerico specifico da uno o più documenti all'interno del suo contesto. Verifica se il modello è in grado di ricordare e recuperare un fatto specifico che ha appena visto nell'input.

Risultati

Loading Chart

claude-fable-5 ottiene un punteggio del 97.0% sui 100 item di richiamo diretto, piatto su tutte le posizioni del haystack (97.0% inizio, 97.1% metà, 97.0% fine).

Metodologia

Question format

Una domanda in linguaggio naturale che richiede una metrica numerica. Esempio:

Q: Qual è stato il fatturato del primo trimestre 2026 di Adobe (ADBE)?
Atteso: $6.40 miliardi

Fonte dei dati

Lo script analizza la sezione Takeaways di ogni trascrizione degli utili di Motley Fool ed estrae tutte le metriche numeriche. Per ogni metrica, lo script verifica che il numero appaia testualmente nel corpo della trascrizione post-Takeaways (il testo effettivo della conference call), in modo che il modello debba leggere la conversazione reale, non i punti riassuntivi. I punti riassuntivi vengono rimossi dai testi.

Regola di punteggio

  • Ogni item ha un elenco di valori target; il primo è il target primario (la risposta principale alla domanda)
  • Punteggio = 1.0 se il target primario corrisponde a qualsiasi numero nella previsione
  • Punteggio = 0.0 altrimenti
  • I rifiuti ("Non lo so") ottengono un punteggio di 0.0
  • claude-fable-5 viene testato tramite Claude Code: il haystack viene fornito come file e il modello recupera da esso con strumenti di ricerca invece di leggerlo dalla sua finestra di contesto. I suoi punteggi misurano il modello insieme all'harness di Claude Code, e l'invarianza di posizione è attesa in questa configurazione perché la profondità del target non si applica alla ricerca su file.

Che aspetto hanno le buone prestazioni

Fase 1 ≥ 85% (il modello trova in modo affidabile le metriche in un singolo documento).
Fase 2 ≥ 90% (il modello naviga verso il target in un haystack senza distrazioni).
Punteggi invarianti rispetto alla posizione indicano una vera capacità di contesto lungo; punteggi in calo con la profondità indicano “perso nel mezzo”.

Conteggio degli item

100 item di richiamo diretto distribuiti su 14 trascrizioni.

Cos'è la memoria IA?

La memoria IA è la capacità di un sistema di intelligenza artificiale di archiviare e richiamare esperienze passate per migliorare il processo decisionale, la percezione e le prestazioni complessive.1 A differenza della memoria umana, che è soggettiva e selettiva, la memoria IA è un'architettura tecnica, un archivio strutturato di informazioni all'interno di reti neurali o database esterni.

Il concetto è distinto dalla finestra di contesto di un modello, che è il buffer di token finito e legato alla sessione che funge da memoria di lavoro durante l'inferenza.2 Mentre la finestra di contesto si azzera tra le sessioni e perde informazioni quando i token vengono troncati, la memoria IA persiste tra le sessioni attraverso una memoria esterna.3 È anche distinta dalla generazione aumentata da recupero (RAG), che è di sola lettura e tratta la rilevanza come una proprietà del contenuto piuttosto che dell'utente; la memoria IA richiede un percorso di scrittura che estrae fatti dalle conversazioni e aggiorna l'archiviazione quando le informazioni cambiano.4

Il campo riconosce due livelli principali. La memoria a breve termine, o memoria di lavoro, tiene traccia della conversazione in corso all'interno di una sessione, mentre la memoria a lungo termine archivia dati specifici dell'utente o a livello di applicazione tra le sessioni.5 Alcuni framework aggiungono una terza categoria, la memoria episodica, che consente agli agenti di richiamare esperienze passate specifiche in modo simile a come gli umani ricordano eventi individuali.

Nei prodotti di consumo, la “memoria chat” si riferisce specificamente alle preferenze dell'utente e ai riassunti delle conversazioni emersi automaticamente, il che è architetturalmente più ristretto della “memoria agente” come utilizzata nei framework per sviluppatori, che comprende lo stato delle attività, la cronologia delle chiamate agli strumenti e le procedure apprese.6

Lascia che il nostro team automatizzi uno dei tuoi processi aziendali con agenti IA, gratuitamente.
Automatizza un processo

Come funziona la memoria IA?

I sistemi di memoria IA convergono su una pipeline comune di scrittura/recupero/consolidamento che differisce dal recupero statico. Le nuove informazioni entrano attraverso una fase di estrazione che elabora coppie di messaggi per identificare fatti candidati, passano attraverso una fase di aggiornamento in cui un LLM decide se aggiungere, aggiornare, eliminare o ignorare ogni fatto, ed escono attraverso una fase di recupero che esegue una ricerca semantica al momento della query.7

Applicazioni reali della memoria IA

Assistenti IA personali

La funzione di memoria di OpenAI ChatGPT costruisce profili persistenti dalle conversazioni degli utenti, dai file e dalle app collegate. Un aggiornamento “Dreaming” del 2026 ha introdotto la sintesi in background su molte conversazioni, consentendo ai ricordi di auto-aggiornarsi nel tempo; ad esempio, un ricordo salvato che dice “l'utente andrà a Singapore a luglio” si riscrive automaticamente in “l'utente è andato a Singapore a luglio 2026” una volta che il viaggio è passato.8 Gli utenti gestiscono la memoria tramite Impostazioni > Personalizzazione > Memoria, anche se OpenAI nota che il riepilogo visibile non cattura tutto ciò che è archiviato.

La memoria di Anthropic per Claude è stata lanciata per gli utenti del piano Team l'11 settembre 2025, estesa all'Enterprise il 18 settembre 2025, e ha raggiunto tutti gli utenti, incluso il livello gratuito, il 2 marzo 2026.9 Il 10 luglio 2026, Anthropic ha riprogettato la funzione in voci categorizzate che Claude legge e aggiorna durante le conversazioni, sostituendo il precedente riepilogo giornaliero singolo.

Google Gemini memorizza le informazioni che gli utenti chiedono di ricordare più i dettagli dedotti dalle conversazioni passate quando il contesto Personale è abilitato.10 L'aggiornamento separato “Personal Intelligence”, quando attivato, si connette a Gmail e Foto senza addestrare modelli su quel contenuto.11

Agenti aziendali e assistenza clienti

Fastweb e Vodafone Italia hanno implementato un sistema multi-agente costruito con LangGraph e LangSmith che serve 9.5 milioni di clienti, iniettando automaticamente i dati CRM all'inizio di ogni interazione per identificare i clienti e personalizzare le risposte. Il sistema riporta un tasso di correttezza del 90%, un tasso di risoluzione del 82% e un Customer Effort Score di 5.2 su 7.12

L'implementazione di Decagon con Rippling ha collegato l'agente IA alle API interne in modo che l'agente potesse recuperare i dati del conto dei singoli dipendenti invece di rispondere genericamente, aumentando la deviazione della chat dal 38% a oltre il 50%, un miglioramento relativo del 32%.13 Il lavoro di Decagon con Chime ha automatizzato attività ad alto attrito tra cui la sostituzione della carta e i controlli dello stato dei depositi, riducendo i costi di assistenza clienti del 60% raddoppiando al contempo i punteggi di soddisfazione dei membri.14

Robotica, sanità e IA incarnata

Il robot logistico ospedaliero Moxi di Diligent Robotics opera in più di 25 strutture negli Stati Uniti e ha completato oltre 1.25 milioni di consegne autonome a partire dal 2026, mappando ogni ambiente ospedaliero utilizzando sensori di bordo e navigando ostacoli dinamici comprese porte con accesso tramite badge.15 Moxi 2.0 funziona con il calcolo NVIDIA IGX Thor con 10 volte la capacità di elaborazione dell'originale, addestrato su tre anni di dati reali di consegna ospedaliera.

Il framework ReMEmbR di NVIDIA fornisce ai robot mobili una memoria spazio-temporale a lungo orizzonte per costruire e ragionare su registrazioni continue di ciò che hanno visto per compiti di navigazione.16 ASPIRE, rilasciato il 29 giugno 2026, memorizza ogni correzione di debug convalidata come un modello di codice riutilizzabile e denominato, aumentando i tassi di successo dal 20% al 92% sul benchmark di passaggio di oggetti bimanuali di Robosuite attraverso il solo debugging iterativo.17

Nel settore sanitario, la piattaforma di documentazione IA ambientale di Abridge è distribuita da Northwell Health in 28 ospedali per ridurre il carico di documentazione clinica.18 Riverside Health ha sperimentato strumenti di documentazione ambientale per due mesi prima di selezionare Abridge per un'implementazione estesa.19

Non perderti i nostri benchmark e approfondimenti basati sui dati. Il pulsante apre Google; selezionare AIMultiple conferma che desideri vedere AIMultiple più spesso nei risultati di ricerca di Google.
GoogleAggiungi come fonte preferita

Vantaggi della memoria IA

I sistemi di memoria riducono i costi dei token e la latenza nei benchmark a lungo orizzonte rispetto al replay dell'intero contesto. Sul benchmark LoCoMo, che testa conversazioni con una media di 300 turni distribuiti su un massimo di 35 sessioni, Mem0 segnala un risparmio di oltre il 90% nel costo dei token rispetto al replay dell'intera cronologia delle conversazioni, riducendo la latenza p95 del 91% (1.44s contro 17.12s), e ottenendo un miglioramento relativo del 26% nel punteggio LLM-come-Giudice rispetto alla baseline di memoria di OpenAI.7

Zep riporta un'accuratezza del 94.8% sul benchmark Deep Memory Retrieval contro il 93.4% per MemGPT, fino al 18.5% di guadagni di accuratezza aggregati su LongMemEval abbinato a GPT-4o, e una riduzione del 90% della latenza di risposta rispetto alle baseline a contesto completo, con il tempo di risposta mediano che scende da 28.9 secondi a 2.58 secondi mentre i token di contesto sono scesi da circa 115.000 a 1.600.20 21

Il benchmark BEAM, che testa fino a 10 milioni di token, ha rilevato che il suo framework di memoria LIGHT ha migliorato le prestazioni in media da 3.5 a 12.69 punti percentuali rispetto alle baseline più forti esistenti, e che anche gli LLM con finestre di contesto da 1 milione di token si degradano sostanzialmente all'aumentare della lunghezza della conversazione.22

L'architettura Dreaming di OpenAI per ChatGPT ha migliorato l'accuratezza della memoria sensibile al tempo dal 9.4% al 75.1%, con un richiamo fattuale del 82.8% e un'aderenza alle preferenze del 71.3%, riducendo al contempo il costo computazionale di circa 5x.8

Sfide e rischi della memoria IA

Avvelenamento della memoria e sicurezza

L'avvelenamento della memoria è classificato come ASI06, “Memory and Context Poisoning”, nella Top 10 OWASP per le Applicazioni Agentiche, definito come la corruzione della memoria persistente dell'agente che porta a disallineamento e comportamento dannoso tra le sessioni.23 24 Nel febbraio 2025, il ricercatore Johann Rehberger ha dimostrato un attacco di “invocazione ritardata di strumenti” contro Google Gemini che ha indotto il sistema a memorizzare falsi fatti come ricordi a lungo termine, comprese informazioni errate sull'età.25

MINJA (Memory INJection Attack), accettato a NeurIPS 2025, mostra che gli attaccanti con una semplice interazione di query e risposta possono avvelenare la memoria a lungo termine, raggiungendo un tasso di successo dell'iniezione del 98.2% e un tasso di successo dell'attacco del 76.8% in media tra gli agenti testati.26 AgentPoison, pubblicato a NeurIPS 2024, ottiene oltre l'80% di tasso di successo dell'attacco avvelenando meno dello 0.1% dei record di memoria, degradando le prestazioni del compito benigno di meno dell'1%.27

Privacy e governance dei dati

MEXTRA, un attacco di estrazione della memoria a scatola nera, crea query per estrarre dati privati memorizzati, raggiungendo tassi di estrazione completa del 83% contro EHRAgent e del 87% contro agenti di acquisto web utilizzando 30 prompt di attacco.28 L'aumento della profondità di recupero o della dimensione totale della memoria aumentano entrambi i tassi di fuga di dati.28

L'autorità italiana per la protezione dei dati ha multato OpenAI per €15 milioni nel dicembre 2024 per aver trattato dati personali per addestrare ChatGPT senza una base giuridica adeguata, sebbene la Corte di Roma abbia annullato la multa nel marzo 2026 stabilendo che la Commissione per la protezione dei dati irlandese aveva giurisdizione come autorità di controllo capofila dell'UE.29 30

La documentazione di OpenAI afferma che disattivare la memoria non elimina automaticamente i ricordi precedentemente archiviati; un ripristino completo richiede sia la disattivazione della memoria che la cancellazione separata delle voci esistenti.

Limitazioni tecniche

Tra dieci approcci di memoria valutati sul benchmark LoCoMo, la maggior parte dei metodi ottiene punteggi più bassi su domande di ragionamento temporale che sul recupero fattuale a singolo salto, anche se almeno un approccio inverte questo pattern.7

La obsolescenza della memoria presenta un altro problema irrisolto: quando i fatti memorizzati vengono contraddetti da nuove informazioni, i sistemi faticano a distinguere i dati attuali da quelli obsoleti. Il benchmark MemConflict valuta scenari in cui i fatti memorizzati diventano obsoleti o entrano direttamente in conflitto, riscontrando che i sistemi esistenti non riescono a risolvere in modo affidabile questi conflitti.31

Inoltre, le prestazioni sui benchmark standardizzati non si traducono in modo affidabile in affidabilità in produzione perché gli ambienti sintetici semplificano eccessivamente l'uso reale.32

Ulteriori letture

Cita questo benchmark

Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.

Cem Dilmegani (2026) - "RELC-Bench: Benchmark di recupero su contesto lungo". Pubblicato online su AIMultiple.com. Consultato il 4 Agosto 2026, da: https://aimultiple.com/ai-memory [Risorsa online]

Dilmegani, C. (2026, 4 Agosto). RELC-Bench: Benchmark di recupero su contesto lungo. AIMultiple. https://aimultiple.com/ai-memory

@misc{dilmegani2026,
  author = {Dilmegani, Cem},
  title  = {{RELC-Bench: Benchmark di recupero su contesto lungo}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/ai-memory}},
  note   = {AIMultiple. Consultato il 4 Agosto 2026}
}

Collegamenti di riferimento

1.
What Is AI Agent Memory? | IBM
2.
Context windows - Claude Platform Docs
3.
What Is Agent Memory? A Guide to Enhancing AI Learning and Recall | MongoDB
MongoDB
4.
RAG vs. Memory: What AI Agent Developers Need to Know
Mem0
5.
Memory overview - Docs by LangChain
Docs by LangChain
6.
Memory FAQ | OpenAI Help Center
7.
[2504.19413] Mem0: Building Production-Ready AI Agents with Scalable Long-Term Memory
8.
Dreaming: Better memory for a more helpful ChatGPT | OpenAI
9.
Release notes | Claude Help Center
10.
Get personalization with memory of your past Gemini chats - Computer - Gemini Apps Help
11.
Gemini gets personal as Google rolls out a big memory upgrade- Android Authority
Authority Media
12.
Fastweb + Vodafone: Transforming Customer Experience with AI Agents using LangGraph and LangSmith
LangChain Blog
13.
Rippling Customer Success Story | Decagon AI
Decagon AI
14.
Chime Customer Success Story | Decagon AI
Decagon AI
15.
Diligent Robotics Unveils Moxi 2.0, Advancing The Largest Fleet of Deployed AI-Powered Mobile Manipulation Robots Operating in Unstructured, Human-Centric Work Environments — Diligent Robotics
16.
ResearchGate - Temporarily Unavailable
17.
Robot Skill Library ASPIRE Gives Robots Memory: Handover Climbs to 92%
Tech Times
18.
Northwell Leverages Abridge to Drive Digital Transformation
19.
Riverside Health Case Study | Abridge
20.
[2501.13956] Zep: A Temporal Knowledge Graph Architecture for Agent Memory
21.
Zep Is The New State of the Art In Agent Memory
Zep - Agent memory at enterprise scale
22.
[2510.27246] Beyond a Million Tokens: Benchmarking and Enhancing Long-Term Memory in LLMs
23.
OWASP Agent Memory Guard | OWASP Foundation
24.
OWASP Top 10 for Agentic Applications - The Benchmark for Agentic Security in the Age of Autonomous AI - OWASP Gen AI Security Project
OWASP Top 10 for LLM & Generative AI Security
25.
Google Gemini's Long-term Memory Vulnerable to a Kind of Phishing Attack - InfoQ
InfoQ
26.
[2503.03704] Memory Injection Attacks on LLM Agents via Query-Only Interaction
27.
[2407.12784] AgentPoison: Red-teaming LLM Agents via Poisoning Memory or Knowledge Bases
28.
[2502.13172] Unveiling Privacy Risks in LLM Agent Memory
29.
Italy fines OpenAI over ChatGPT privacy rules breach By Reuters
Investing.com
30.
Italian court scraps 15-million-euro privacy watchdog fine on ChatGPT-maker OpenAI
Yahoo! Finance
31.
https://arxiv.org/pdf/2605.20926
32.
https://arxiv.org/pdf/2602.06052
Cem Dilmegani
Cem Dilmegani
Analista principale
Cem è l'analista principale di AIMultiple dal 2017. AIMultiple informa centinaia di migliaia di aziende (secondo SimilarWeb) compreso il 60% delle Fortune 500 ogni mese.

Il lavoro di Cem è stato citato da importanti pubblicazioni globali tra cui Business Insider, Forbes, Washington Post, aziende globali come Deloitte, HPE e ONG come il World Economic Forum e organizzazioni sovranazionali come la Commissione europea.

Nel corso della sua carriera, Cem ha lavorato come consulente tecnologico, acquirente di tecnologia e imprenditore tecnologico. Ha consigliato aziende sulle loro decisioni tecnologiche presso McKinsey & Company e Altman Solon per oltre un decennio. Ha anche pubblicato un rapporto McKinsey sulla digitalizzazione.

Ha guidato la strategia tecnologica e gli approvvigionamenti di una società di telecomunicazioni rispondendo direttamente al CEO. Ha anche guidato la crescita commerciale dell'azienda deep tech Hypatos che ha raggiunto un fatturato annuo ricorrente a 7 cifre e una valutazione a 9 cifre partendo da 0 in 2 anni. Il lavoro di Cem in Hypatos è stato trattato da importanti pubblicazioni tecnologiche come TechCrunch e Business Insider.

Cem interviene regolarmente a conferenze tecnologiche internazionali. Si è laureato in ingegneria informatica all'Università Bogazici e ha conseguito un MBA presso la Columbia Business School.
Visualizza il profilo completo

Sii il primo a commentare

Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.

0/450