15 Strumenti di osservabilità per agenti IA: AgentOps & Langfuse
Gli strumenti di osservabilità per agenti IA, come ad esempio Langfuse e Arize, aiutano a raccogliere tracce dettagliate (una registrazione dell'esecuzione di un programma o transazione) e forniscono dashboard per monitorare le metriche in tempo reale.
Molti framework agentici, come LangChain, utilizzano lo standard OpenTelemetry per condividere metadati con il monitoraggio agentico. Inoltre, molti strumenti di osservabilità forniscono strumentazione personalizzata per una maggiore flessibilità.
Abbiamo testato 15 piattaforme di osservabilità per applicazioni basate su LLM e agenti IA. Ogni piattaforma è stata implementata in modo pratico, configurando flussi di lavoro, integrazioni e scenari di test. Abbiamo confrontato 4 strumenti di osservabilità per misurare se introducono un sovraccarico nei pipeline di produzione. Abbiamo anche realizzato un tutorial sull'osservabilità di LangChain utilizzando Langfuse.
Benchmark del sovraccarico degli strumenti di monitoraggio agentico
Abbiamo integrato ciascuna piattaforma di osservabilità nel nostro sistema di pianificazione viaggi multi-agente ed eseguito 100 query identiche per misurare il loro sovraccarico prestazionale rispetto a una baseline senza strumentazione. Leggi la nostra metodologia di benchmark.
- LangSmith ha dimostrato un'efficienza eccezionale con un sovraccarico praticamente non misurabile, rendendolo ideale per ambienti di produzione critici in termini di prestazioni.
- Laminar ha introdotto un sovraccarico minimo del 5%, rendendolo altamente adatto per ambienti di produzione dove le prestazioni sono critiche.
- AgentOps e Langfuse hanno mostrato un sovraccarico moderato rispettivamente del 12% e del 15%, rappresentando un compromesso ragionevole tra funzionalità di osservabilità e impatto sulle prestazioni. Queste piattaforme mantengono comunque una latenza accettabile per la maggior parte dei casi d'uso in produzione.
Possibili ragioni dietro le differenze di prestazioni
Il nostro benchmark indica che le differenze di latenza sono determinate dalla profondità della strumentazione e dal coinvolgimento del percorso di esecuzione, in particolare nei flussi di lavoro multi-agente. Gli strumenti che offrono un'osservabilità più profonda a livello di singolo passaggio hanno mostrato un sovraccarico più elevato, mentre gli approcci di tracciamento più leggeri sono rimasti più vicini alla baseline.
1. Profondità della strumentazione sul percorso di esecuzione
Gli strumenti di osservabilità aggiungono logica al flusso di esecuzione dell'agente per catturare tracce e metadati. Quando questa logica viene eseguita in modo sincrono durante la gestione della richiesta, aumenta direttamente la latenza end-to-end perché l'agente deve completare questo lavoro extra prima di restituire una risposta.
Per esempio:
- LangSmith ha aggiunto praticamente nessun sovraccarico misurabile (~0%), indicando poco lavoro sincrono,
- La strumentazione più profonda a livello di passaggio di Langfuse ha contribuito a un sovraccarico più elevato (~15%).
2. Amplificazione degli eventi nei pipeline multi-step
Nei sistemi multi-agente, una singola richiesta utente attiva più azioni dell'agente. Quando uno strumento registra dati dettagliati a ogni passaggio, il numero totale di eventi cresce rapidamente, aumentando il sovraccarico di elaborazione e gestione delle tracce man mano che il flusso di lavoro diventa più profondo.
Nei risultati del benchmark:
- Langfuse e AgentOps hanno generato un sovraccarico notevolmente più elevato (15% e 12%) nel nostro flusso di lavoro di pianificazione viaggi multi-step
- LangSmith e Laminar hanno emesso meno eventi per passo dell'agente.
3. Sovraccarico di valutazione e validazione inline
Alcune piattaforme eseguono controlli o monitoraggi aggiuntivi durante l'esecuzione dell'agente. Sebbene ogni controllo sia leggero, applicarli ripetutamente su tutti i passaggi dell'agente aggiunge una latenza misurabile.
Per esempio:
- Il monitoraggio a livello di ciclo di vita di AgentOps ha coinciso con un sovraccarico del 12%
- Laminar non ha mostrato evidenze di valutazione inline che influenzasse l'esecuzione, rimanendo a ~5%.
4. Frequenza di serializzazione e persistenza
La cattura di dati di osservabilità dettagliati richiede la serializzazione delle tracce e la loro scrittura su storage o backend esterni. Maggiore è il dettaglio delle tracce, più spesso questo avviene, aggiungendo sovraccarico di I/O a ogni richiesta.
Nel nostro benchmark:
- Il tracciamento dettagliato di prompt, output e token di Langfuse ha prodotto il sovraccarico più elevato (~15%)
- Gli artefatti di traccia più leggeri di LangSmith sono rimasti vicini alla baseline.
5. Grado di integrazione con il framework agentico
Quanto strettamente uno strumento si integra con il framework agentico influisce sulle prestazioni. Integrazioni più strette riducono i passaggi di traduzione e orchestrazione, mentre SDK più generici aggiungono strati di elaborazione extra.
Per esempio:
- L'allineamento stretto di LangSmith con l'esecuzione dell'agente è correlato a un sovraccarico di ~0%
- AgentOps e Langfuse hanno mostrato un impatto sulla latenza più elevato, coerente con percorsi di integrazione più disaccoppiati.
Piattaforme di osservabilità per agenti IA
Livello 1: Osservabilità granulare di LLM e prompt/output
* Le funzionalità elencate in queste colonne sono esempi illustrativi di ciò che ogni strumento può monitorare quando esteso tramite integrazioni o personalizzazioni. Non sono esclusive di una singola piattaforma.
Livello 2: Osservabilità di flusso di lavoro, modello e valutazione
Livello 3: Osservabilità del ciclo di vita e delle operazioni dell'agente
Livello 4: Monitoraggio di sistema e infrastruttura (non nativo per agenti)
Datadog (con il suo modulo di osservabilità per LLM) e Prometheus (tramite esportatori) vengono sempre più utilizzati insieme a Langfuse/LangSmith.
Piattaforme di sviluppo e orchestrazione di agenti:
- Strumenti come Flowise, Langflow, SuperAGI e CrewAI consentono di creare, orchestrare e ottimizzare flussi di lavoro agentici con interfacce no-code/low-code
Edizioni gratuite e prezzi
Le edizioni gratuite variano in base ai limiti di utilizzo (ad esempio, osservazioni, tracce, token o unità di lavoro). I prezzi di partenza sono generalmente per un piano base, che potrebbe avere restrizioni su funzionalità, utenti o limiti di utilizzo.
Weights & Biases (W&B Weave)
Caso d'uso: Debugging dei fallimenti nei sistemi multi-agente tracciando come gli errori si propagano attraverso le chiamate degli agenti.
Weights & Biases Weave registra tracce di esecuzione strutturate per sistemi multi-agente, preservando le relazioni padre-figlio tra le chiamate degli agenti. Input, output, stati intermedi, latenza e utilizzo dei token vengono catturati per agente e per traccia.
Funzionalità di monitoraggio di Weave
- Tracciamento gerarchico degli agenti anziché log di richieste lineari
- Attribuzione dei costi e della latenza a livello di agente
- Supporto nativo per valutatori di punteggio applicati direttamente alle tracce.
Capacità di valutazione
Weave fornisce anche valutatori di punteggio integrati per la valutazione, tra cui:
- HallucinationFreeScorer per rilevare le allucinazioni,
- SummarizationScorer per valutare la qualità dei riassunti,
- EmbeddingSimilarityScorer per la similarità semantica,
- ValidJSONScorer e ValidXMLScorer per la validazione del formato,
- PydanticScorer per la conformità allo schema,
- OpenAIModerationScorer per la sicurezza dei contenuti,
- Valutatori RAGAS come ContextEntityRecallScorer,
- ContextRelevancyScorer per la valutazione di sistemi RAG.
Ideale per: Team che eseguono flussi di lavoro multi-step o multi-agente e necessitano di un'analisi delle cause profonde a livello di traccia anziché metriche superficiali.
Langfuse
Casi d'uso: Tracciare le interazioni con gli LLM, gestire le versioni dei prompt e monitorare le prestazioni del modello con sessioni utente.
Langfuse offre una visibilità approfondita sul livello dei prompt, catturando prompt, risposte, costi e tracce di esecuzione per aiutare a fare debug, monitorare e ottimizzare le applicazioni basate su LLM.
Tuttavia, Langfuse potrebbe non essere adatto a team che preferiscono flussi di lavoro basati su Git per la gestione del codice e dei prompt, poiché il suo sistema di gestione dei prompt esterno potrebbe non offrire lo stesso livello di controllo versione e collaborazione.
Funzionalità di monitoraggio di Langfuse
- Visibilità sull'evoluzione dei prompt e sui modelli di utilizzo
- Analisi basata su sessione, adatta per applicazioni rivolte agli utenti
- Modello pratico di metadati e tagging per il filtraggio e la revisione
Funzionalità di livello aziendale:
Alcune di queste funzionalità includono:
- Livelli di log: Regola la verbosità dei log per ottenere approfondimenti più granulari.
- Multi-modalità: Supporta testo, immagini, audio e altri formati per applicazioni LLM multi-modali.
- Rilasci e versionamento: Tieni traccia della cronologia delle versioni e osserva come i nuovi rilasci influenzano le prestazioni del modello.
- URL delle tracce: Accedi a tracce dettagliate tramite URL unici per ulteriori ispezioni e debugging.
- Grafici degli agenti: Visualizza le interazioni e le dipendenze degli agenti per una migliore comprensione del loro comportamento.
- Campionamento: Raccogli dati rappresentativi dalle interazioni per analizzare senza sovraccaricare il sistema.
- Monitoraggio token e costi: Tieni traccia dell'utilizzo dei token e dei costi per ogni chiamata al modello, garantendo una gestione efficiente delle risorse.
- Mascheramento: Proteggi i dati sensibili mascherandoli nelle tracce, garantendo privacy e conformità.
Ideale per: Team che iterano sui prompt e monitorano l'utilizzo in produzione, specialmente dove le sessioni utente sono importanti.
Galileo
Casi d'uso: Monitorare costi/latenza, valutare la qualità dell'output, bloccare risposte non sicure e fornire correzioni attuabili.
Galileo tiene traccia di costi, latenza e metriche di qualità dell'output, applicando al contempo controlli di sicurezza e conformità in tempo reale.
La piattaforma combina osservabilità tradizionale (latenza, costi, prestazioni) con debugging e valutazione potenziati dall'IA (rilevamento delle allucinazioni, correttezza fattuale, coerenza, aderenza al contesto).
Funzionalità di monitoraggio di Galileo
- Identificazione delle modalità di fallimento oltre gli errori superficiali (ad esempio, allucinazioni che portano a input di strumenti non validi)
- Feedback prescrittivo come modifiche ai prompt suggerite o aggiunte few-shot
- Stretto accoppiamento tra risultati della valutazione e correzioni consigliate.
Ideale per: Organizzazioni che danno priorità alla qualità dell'output, alla sicurezza e a cicli di iterazione rapidi con correzioni guidate.
Guardrails IA
Casi d'uso: Prevenire output dannosi, convalidare le risposte degli LLM e garantire la conformità con le policy di sicurezza
Guardrails convalida gli input e gli output degli LLM rispetto a regole configurabili, tra cui tossicità, bias, esposizione di PII, segnalazione di allucinazioni e conformità del formato.
Funzionalità di monitoraggio di Guardrails IA
- Validazione deterministica tramite specifiche RAIL
- Guard per input per il rilevamento di prompt injection e jailbreak
- Nuovi tentativi automatici quando la validazione fallisce.
Ideale per
Team che devono applicare rigorose garanzie di sicurezza, conformità o formattazione prima che le risposte vengano restituite.
LangSmith
Casi d'uso: Debugging del ragionamento dell'agente e delle chiamate agli strumenti (incentrato su LangChain)
LangSmith cattura tracce complete del ragionamento per gli agenti basati su LangChain, inclusi prompt, contesto recuperato, logica di selezione degli strumenti, input/output degli strumenti, errori ed eccezioni.
Funzionalità di monitoraggio di LangSmith
- Ispezione passo-passo dei percorsi decisionali dell'agente
- Riesecuzione e confronto affiancato tra prompt, modelli o strumenti
- Integrazione stretta con LangChain tramite callback.
Ideale per
Team che sviluppano con LangChain e hanno bisogno di fare debugging dettagliato del ragionamento errato o dell'invocazione degli strumenti.
Langtrace IA
Casi d'uso: Identificare i colli di bottiglia di costi e latenza nelle app basate su LLM
Langtrace tiene traccia del conteggio dei token, della durata dell'esecuzione, dei costi delle API e dei parametri di richiesta attraverso i pipeline LLM utilizzando tracce compatibili con OpenTelemetry.
Funzionalità di monitoraggio di Langtrace IA
- Allineamento con OpenTelemetry per l'integrazione con backend esistenti
- Visibilità sui fattori di costo e latenza per ogni passaggio
- Versionamento leggero dei prompt e playground di test.
Ideale per: Team che ottimizzano prestazioni e spesa in flussi di lavoro LLM piuttosto che valutare la qualità dell'output.
Arize (Phoenix)
Casi d'uso: Monitorare il drift del modello, rilevare bias e valutare gli output degli LLM con sistemi di punteggio completi
Phoenix si concentra sul drift comportamentale, sul rilevamento dei bias e sul punteggio LLM-as-a-judge per pertinenza, tossicità e accuratezza.
Tuttavia, ha un sovraccarico di integrazione maggiore rispetto ai proxy leggeri e non gestisce il versionamento dei prompt in modo altrettanto pulito come gli strumenti dedicati.
Funzionalità di monitoraggio di Phoenix
- Core open-source con estensioni aziendali opzionali
- Playground interattivo per prompt per lo sviluppo
- Rilevamento del drift per tracciare i cambiamenti comportamentali nel tempo
- Controlli dei bias per identificare pregiudizi nelle risposte,
- Punteggio LLM-as-a-judge per accuratezza, tossicità e pertinenza.
Ideale per: Team che monitorano il comportamento a lungo termine del modello e il rischio di regressione piuttosto che l'iterazione sui prompt.
Agenta
Casi d'uso: Scoprire quale prompt funziona meglio su quale modello
Agenta confronta le risposte dei modelli in termini di costi, latenza e qualità dell'output utilizzando input condivisi e contesto controllato.
Funzionalità di monitoraggio di Agenta
- Valutazione affiancata dei modelli
- Supporto decisionale pre-produzione.
Ideale per: Valutazione in fase iniziale e selezione del modello.
AgentOps.ai
Casi d'uso: Monitorare il ragionamento dell'agente, tracciare i costi e fare debug delle sessioni in produzione
AgentOps cattura le tracce di ragionamento, le chiamate a strumenti/API, lo stato della sessione, il comportamento di caching e le metriche di costo per gli agenti distribuiti.
Funzionalità di monitoraggio di AgentOps
- Replay della sessione per il debugging in produzione
- Focus sul comportamento dell'agente in esecuzione piuttosto che sulla valutazione offline.
Ideale per: Team che eseguono agenti in produzione e necessitano di visibilità operativa.
Braintrust
Casi d'uso: Scoprire quale prompt, dataset o modello offre prestazioni migliori con valutazione dettagliata e analisi degli errori
Braintrust valuta prompt, dataset e modelli rispetto agli output attesi, tenendo traccia di latenza, costi, errori degli strumenti e metriche di esecuzione.
Funzionalità di monitoraggio di Braintrust
- Valuta dataset di test con input e output attesi, quindi confronta prompt o modelli affiancati utilizzando variabili come
{{input}},{{expected}}e{{metadata}}. - Scomposizione delle metriche, inclusa la qualità dell'esecuzione degli strumenti
Ideale per: Team che confrontano modelli e prompt prima del rilascio.
AgentNeo
Casi d'uso: Debugging delle interazioni multi-agente, tracciamento dell'uso degli strumenti e valutazione dei flussi di lavoro di coordinamento
AgentNeo tiene traccia della comunicazione tra agenti, dell'uso degli strumenti, dei grafici di esecuzione e dei costi e della latenza per agente tramite un SDK Python.
Funzionalità di monitoraggio di AgentNeo
- Open-source ed eseguibile localmente
- Dashboard locale interattiva (
localhost:3000) per il monitoraggio in tempo reale dei flussi di lavoro multi-agente. - Integrazione tramite decoratori (ad esempio,
@tracer.trace_agent,@tracer.trace_tool)
Ideale per: Team di ingegneri che sperimentano sistemi multi-agente.
Laminar
Caso d'uso: Tracciare le prestazioni tra diversi framework e modelli LLM.
Laminar tiene traccia degli span di esecuzione, dei costi, dell'utilizzo dei token e dei percentili di latenza su diversi framework e modelli LLM.
Funzionalità di monitoraggio di Laminar
- Analisi delle prestazioni indipendente dal framework
- Ispezione granulare degli span.
Ideale per: Analisi comparativa delle prestazioni su stack eterogenei.
Helicone
Casi d'uso: Tracciare flussi di lavoro multi-step degli agenti e analizzare i modelli di sessione degli utenti.
Helicone cattura volumi di richieste, costi, errori, tendenze di latenza e flussi di lavoro degli agenti a livello di sessione.
Funzionalità di monitoraggio di Helicone
- Visibilità sul percorso dell'utente
- Analisi delle tendenze storiche.
Ideale per: Team di prodotto che monitorano i modelli di utilizzo e il comportamento a livello utente.
Coval
Casi d'uso: Simulare migliaia di conversazioni tra agenti, testare interazioni vocali/chat e convalidare il comportamento prima del deployment.
Coval simula migliaia di conversazioni per misurare il completamento delle attività, la correttezza e l'efficacia delle chiamate agli strumenti.
Funzionalità di monitoraggio di Coval
- Test degli agenti basato su simulazione
- Rilevamento automatico delle regressioni
- Supporto per agenti vocali e testuali.
Ideale per: Validazione pre-deployment e rilevamento delle regressioni.
Datadog
Casi d'uso: Osservabilità dell'infrastruttura e delle applicazioni con correlazione dei segnali degli LLM.
Datadog raccoglie metriche dell'infrastruttura (CPU, memoria, rete), dati sulle prestazioni delle applicazioni (latenza, tassi di errore, throughput) e log. Per le applicazioni basate su LLM, può acquisire l'utilizzo dei token, i costi per richiesta, la latenza del modello e segnali relativi alla sicurezza come i tentativi di prompt injection.
Funzionalità di monitoraggio di Datadog
- Osservabilità ampia e a livello di sistema su infrastruttura, applicazioni e carichi di lavoro IA
- Ampio ecosistema di integrazioni (900+ integrazioni) che consente la correlazione tra il comportamento dell'IA e lo stato dell'infrastruttura
Ideale per: Organizzazioni che vogliono correlare il comportamento degli LLM con le prestazioni dell'infrastruttura e delle applicazioni sottostanti, piuttosto che ispezionare il ragionamento dell'agente o i prompt.
Prometheus
Casi d'uso: Monitorare le prestazioni del sistema, tracciare le metriche delle applicazioni e impostare avvisi per problemi di infrastruttura.
Prometheus è un sistema di monitoraggio open-source che raccoglie metriche a serie temporali da endpoint HTTP a intervalli regolari per tracciare infrastruttura, applicazioni, database, container e metriche di business personalizzate.
Funzionalità di monitoraggio di Prometheus
- Raccolta di metriche a serie temporali tramite scraping pull-based
- PromQL per interrogazioni, aggregazioni e condizioni di avviso
- Ecosistema di esportatori (ad esempio, Node Exporter) per un'ampia copertura del sistema
Ideale per: Monitoraggio di infrastruttura e applicazioni con avvisi basati su regole.
Grafana
Casi d'uso: Visualizzare metriche, creare dashboard e instradare avvisi su dati di LLM, agenti e infrastruttura.
Grafana è una piattaforma open-source di visualizzazione e analisi che si integra con fonti di dati come Prometheus, OpenTelemetry e Datadog per fornire dashboard di osservabilità unificate.
Funzionalità di monitoraggio di Grafana
- Dashboard su metriche, log e tracce
- Correlazione cross-system per segnali di LLM, agenti e infrastruttura
- Instradamento degli avvisi e gestione delle notifiche.
Ideale per: Visualizzazione centralizzata dell'osservabilità e risposta agli incidenti.
Tutorial: osservabilità di LangChain con Langfuse
Abbiamo costruito un pipeline multi-step LangChain con tre fasi:
- analisi della domanda
- generazione della risposta
- verifica della risposta
Dopo aver impostato il pipeline, lo abbiamo collegato a Langfuse per monitorare e tracciare l'esecuzione in tempo reale. In questo modo, abbiamo potuto esplorare come Langfuse ci aiuta a raccogliere approfondimenti dettagliati sulle prestazioni, i costi e il comportamento delle applicazioni IA.
Ecco cosa abbiamo osservato tramite Langfuse:
Panoramica della dashboard
Langfuse ci ha fornito diverse dashboard che ci danno visibilità su diversi aspetti delle prestazioni del pipeline:
- Dashboard dei costi: Tiene traccia della spesa per tutte le chiamate API, con suddivisioni dettagliate per modello e periodo di tempo.
- Gestione dell'utilizzo: Monitora le metriche di esecuzione, come il conteggio delle osservazioni e l'allocazione delle risorse, aiutandoci a tracciare come vengono utilizzate le risorse durante l'esecuzione.
- Dashboard della latenza: Questa dashboard ci ha aiutato ad analizzare i tempi di risposta, rilevare i colli di bottiglia e visualizzare le tendenze delle prestazioni.
Metriche di utilizzo
La dashboard delle metriche di utilizzo ci ha fornito le seguenti informazioni su come il sistema ha operato:
- Conteggio totale delle tracce: Abbiamo tracciato otto tracce, ciascuna rappresentante un ciclo completo domanda-risposta nel pipeline.
- Conteggio totale delle osservazioni: In media, ogni traccia aveva 16 osservazioni, riflettendo la natura multi-step del processo.
Inoltre, Langfuse ci consente di tracciare i modelli di utilizzo, l'allocazione delle risorse e i momenti di picco negli ultimi 7 giorni, aiutandoci a capire quando il sistema è più attivo e come le risorse sono distribuite nel tempo.
Ispezione delle tracce
Approfondendo una singola traccia, siamo stati in grado di vedere informazioni dettagliate sull'esecuzione:
- Righe delle tracce: Ogni riga rappresenta un'esecuzione completa del pipeline con un ID di traccia univoco.
- Metriche di latenza: Il tempo di esecuzione variava, oscillando da 0.00s a 34.08s.
- Conteggio dei token: La dashboard tiene traccia dell'utilizzo dei token di input/output, il che aiuta nella gestione dei costi e dell'efficienza.
- Filtraggio per ambiente: Abbiamo potuto filtrare le tracce in base agli ambienti di deployment (ad esempio sviluppo, produzione).
Dettagli della singola traccia
Abbiamo ulteriormente esplorato la traccia in modo più dettagliato per comprendere la scomposizione dell'esecuzione:
- Architettura a catena sequenziale: La traccia ha visualizzato un flusso visivo che mostra ogni passaggio, partendo da SequentialChain → LLMChain → ChatOpenAI, con una struttura gerarchica.
- Tracciamento di input/output: La domanda originale, “Quali sono i vantaggi dell'utilizzo di Langfuse per l'osservabilità degli agenti IA?” è stata tracciata in ogni fase, insieme ai rispettivi output prodotti dall'IA a ogni passaggio.
- Analisi dei token: Abbiamo osservato che sono stati utilizzati 1.203 token per l'input e 1.516 token per l'output, il che ha implicazioni sui costi legate all'utilizzo dei token e aiuta a ottimizzare la gestione delle risorse.
- Dati di timing: La latenza totale per l'intera traccia è stata di 34.08s, suddivisa tra i vari componenti:
- SequentialChain → 14.02s
- LLMChain → 10.25s
- ChatOpenAI → 9.81s
- Informazioni sul modello: Langfuse ha confermato l'utilizzo del modello Anthropic Claude-Sonnet-4, con dettagli sulle impostazioni specifiche, inclusa la configurazione della temperatura.
- Output formattato: Sono state fornite sia la vista Preview che JSON per il debugging, offrendo approfondimenti sulla risposta del modello in formato leggibile e in formato machine-readable.
Analisi automatizzata
Langfuse ha anche fornito valutazioni automatizzate delle nostre risposte:
- Valutazione della qualità: Il sistema ha valutato la struttura, la coerenza e la completezza delle risposte, evidenziando sezioni ben organizzate ma suggerendo che le risposte potrebbero essere più concise.
- Suggerimenti di miglioramento: Ha identificato sezioni con ridondanza, suggerendo dove si potrebbe migliorare la formulazione e ha combinato punti correlati per rendere la risposta più trasparente ed efficiente.
- Approfondimenti sulle prestazioni: Il sistema ha fornito feedback sull'utilizzo dei token e sulla pertinenza della risposta, aiutandoci a ottimizzare l'efficienza garantendo al contempo che l'output rimanga utile e in tema.
- Feedback strutturato: Il feedback è stato organizzato in categorie, consentendoci di affrontare aree specifiche di miglioramento in modo mirato.
Analisi utente
Langfuse traccia le interazioni dettagliate tra gli utenti e l'agente IA:
- Cronologia dell'attività utente: Mostra la prima e l'ultima interazione per ciascun utente, aiutando a identificare gli utenti attivi rispetto a quelli inattivi. Possiamo vedere quando gli utenti hanno interagito con il sistema per la prima e l'ultima volta.
- Tracciamento del volume di eventi: Tiene traccia del numero di eventi attivati da ciascun utente. Ad esempio, alcuni utenti hanno generato oltre 2.000 eventi, mostrando il loro livello di engagement con il sistema.
- Analisi del consumo di token: Monitora il numero totale di token consumati da ciascun utente. L'utilizzo dei token variava da 6.59K a 357K token, fornendo approfondimenti sull'utilizzo delle risorse.
- Attribuzione dei costi: Suddivide i costi associati a ciascun utente, facilitando il tracciamento della spesa e l'ottimizzazione dell'allocazione del budget per l'uso delle risorse.
- Identificazione utente: Utilizza ID utente anonimizzati per mantenere la privacy tracciando al contempo le interazioni individuali degli utenti, aiutando con l'analisi dell'utilizzo senza compromettere la riservatezza dell'utente.
La vista sessione ci consente di tracciare i dettagli granulari delle interazioni utente:
- Flusso completo della conversazione: Mostra l'intera interazione domanda-risposta, facilitando il seguimento dell'intera conversazione dall'inizio alla fine.
- Visibilità dell'implementazione: Visualizza il codice Python effettivo utilizzato durante la sessione, fornendo informazioni sull'implementazione tecnica.
- Correlazione input/output: Collega le domande degli utenti alle corrispondenti risposte del sistema, aiutandoci a risolvere i problemi e a identificare dove potrebbero essersi verificati problemi nella conversazione.
- Metadati della sessione: Include dettagli tecnici come il timing, il contesto utente e dati specifici dell'implementazione, offrendo una visione completa dell'esecuzione della sessione.
Quando non utilizzare gli strumenti di osservabilità
- Sviluppo in fase iniziale: Se stai ancora validando il product-market fit o costruendo i tuoi primi flussi di lavoro agentici, l'attenzione dovrebbe essere sulla funzionalità di base piuttosto che su un'osservabilità approfondita.
- Colli di bottiglia delle API: Se i tuoi problemi principali sono i costi delle API, la latenza o il caching, la priorità immediata dovrebbe essere l'ottimizzazione di queste aree, non il monitoraggio delle metriche a livello di sistema.
- Ottimizzazione del modello: Se i miglioramenti sono principalmente guidati dalla selezione del modello, dal fine-tuning o dall'ingegneria dei prompt, gli strumenti di osservabilità per drift e bias potrebbero non essere ancora necessari.
Quando utilizzare gli strumenti di osservabilità
- Produzione su larga scala: Quando operi su più modelli, agenti o catene, gli strumenti di osservabilità sono essenziali per monitorare le prestazioni e garantire lo stato di salute del sistema.
- Applicazioni aziendali o rivolte ai clienti: Per applicazioni in cui affidabilità, sicurezza e conformità sono irrinunciabili, gli strumenti di osservabilità forniscono la visibilità e il controllo necessari.
- Monitoraggio continuo: Quando è necessario monitorare nel tempo drift, bias, prestazioni e problemi di sicurezza, che non possono essere facilmente catturati con script di base o controlli manuali, gli strumenti di osservabilità sono cruciali.
- Scenari ad alto rischio: In ambienti in cui il costo di un fallimento (ad es., allucinazioni, output non sicuri) è significativo, l'osservabilità garantisce che i rischi siano ridotti al minimo e che i problemi vengano rilevati tempestivamente.
Metodologia del benchmark
Per valutare il sovraccarico prestazionale delle piattaforme di osservabilità nelle applicazioni LLM in produzione, abbiamo sviluppato un approccio sistematico di benchmarking utilizzando un flusso di lavoro agentico reale.
Applicazione di test
Abbiamo costruito un sistema di pianificazione viaggi multi-agente sequenziale utilizzando LangChain che elabora richieste di viaggio in linguaggio naturale attraverso cinque fasi:
- Agente parser: Estrae dati strutturati (origine, destinazione, date, durata) dall'input dell'utente
- Agente di ricerca voli: Recupera i voli disponibili tramite l'API di Amadeus
- Agente di previsioni meteo: Recupera le previsioni meteo della destinazione utilizzando WeatherAPI
- Agente di raccomandazione attività: Suggerisce attività in base alle condizioni meteorologiche
- Agente pianificatore di viaggio: Sintetizza tutti gli output in un itinerario completo
Il sistema utilizza Claude 4 Haiku tramite OpenRouter per tutte le chiamate LLM e integra API esterne per dati in tempo reale.
Progettazione del benchmark
Definizione della baseline: Abbiamo prima misurato le prestazioni dell'applicazione senza alcuna strumentazione di osservabilità, eseguendo 100 query identiche per stabilire una baseline di confronto.
Integrazione della piattaforma: Abbiamo quindi integrato cinque piattaforme di osservabilità leader (LangSmith, Laminar, AgentOps, Langfuse) una alla volta, strumentando gli stessi punti di tracciamento su tutte le piattaforme per coerenza.
Esecuzione sequenziale: Ogni piattaforma è stata testata indipendentemente eseguendo tutte le 100 query consecutivamente prima di passare alla piattaforma successiva. Questo approccio riduce al minimo la variabilità dovuta a fattori esterni come le condizioni di rete o i limiti di frequenza delle API.
Ambiente controllato: Tutti i test sono stati eseguiti sulla stessa infrastruttura server con set di query identici per garantire un confronto equo. Per isolare il sovraccarico dalla variabilità della latenza indotta dagli LLM, abbiamo configurato il modello con temperature=0 e prompt strutturati per ridurre al minimo la variabilità delle risposte tra le esecuzioni.
Metriche raccolte
Per ogni piattaforma, abbiamo misurato la latenza media e calcolato il sovraccarico come latenza aggiuntiva introdotta rispetto alla baseline: ((Platform Latency - Base Latency) / Base Latency) × 100
FAQ
L'osservabilità è la capacità di comprendere il funzionamento interno di un agente IA esaminando segnali esterni come log, metriche e tracce.
Per gli agenti IA, ciò comporta il monitoraggio delle azioni, dell'uso degli strumenti, delle interazioni con i modelli e delle risposte per risolvere i problemi e migliorare le prestazioni.
L'osservabilità degli agenti è cruciale per tracciare e migliorare le prestazioni dell'IA consentendo:
Comprendere i compromessi: Aiuta a misurare metriche chiave come l'accuratezza e i costi, rendendo più facile trovare un equilibrio tra prestazioni e utilizzo delle risorse.
Misurare la latenza: Il tracciamento della latenza in tempo reale offre approfondimenti sui tempi di risposta, aiutando a ottimizzare le prestazioni dell'agente.
Rilevare input dannosi: L'osservabilità aiuta a identificare linguaggio dannoso e prompt injection, consentendo un intervento tempestivo per prevenire problemi.
Monitorare il feedback degli utenti: Osservando le interazioni e il feedback degli utenti, l'osservabilità fornisce dati preziosi per il miglioramento continuo e il perfezionamento degli agenti.
Le componenti chiave includono:
– Monitoraggio delle azioni: Monitoraggio di ogni passo compiuto dall'agente.
– Utilizzo degli strumenti: Osservazione degli strumenti e delle risorse che l'agente utilizza.
– Misurazione della latenza: Monitoraggio dei tempi di risposta per ottimizzare le prestazioni.
– Valutazioni: Valutazione del comportamento dell'agente e delle prestazioni del modello.
– Rilevamento di input dannosi: Identificazione di prompt o attacchi dannosi.
Cita questa ricerca
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Şipi, Nazlı},
title = {{15 Strumenti di osservabilità per agenti IA: AgentOps & Langfuse}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/agentic-monitoring}},
note = {AIMultiple. Consultato il 11 Agosto 2026}
}Collegamenti di riferimento
Il lavoro di Cem è stato citato da importanti pubblicazioni globali tra cui Business Insider, Forbes, Washington Post, aziende globali come Deloitte, HPE e ONG come il World Economic Forum e organizzazioni sovranazionali come la Commissione europea.
Nel corso della sua carriera, Cem ha lavorato come consulente tecnologico, acquirente di tecnologia e imprenditore tecnologico. Ha consigliato aziende sulle loro decisioni tecnologiche presso McKinsey & Company e Altman Solon per oltre un decennio. Ha anche pubblicato un rapporto McKinsey sulla digitalizzazione.
Ha guidato la strategia tecnologica e gli approvvigionamenti di una società di telecomunicazioni rispondendo direttamente al CEO. Ha anche guidato la crescita commerciale dell'azienda deep tech Hypatos che ha raggiunto un fatturato annuo ricorrente a 7 cifre e una valutazione a 9 cifre partendo da 0 in 2 anni. Il lavoro di Cem in Hypatos è stato trattato da importanti pubblicazioni tecnologiche come TechCrunch e Business Insider.
Cem interviene regolarmente a conferenze tecnologiche internazionali. Si è laureato in ingegneria informatica all'Università Bogazici e ha conseguito un MBA presso la Columbia Business School.























Sii il primo a commentare
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.