Servizi
Contattaci

LLM Strumenti di osservabilità: Weights & Biases, Langsmith

Sıla Ermut
Sıla Ermut
aggiornato il 9 giu. 2026

Le applicazioni LLM si sono espanse da chat a turno singolo ad agenti multi-step che usano strumenti, interrogano database e si coordinano con altri model, rendendo il loro comportamento più difficile da interpretare.

L'osservabilità LLM fornisce visibilità continua su questi flussi di lavoro complessi, aiutando le organizzazioni a monitorare la qualità, rilevare i guasti, risolvere i problemi e gestire prestazioni e costi.

LLM osservabilità: confronto delle funzionalità degli strumenti

Weights & Biases (W&B Weave)

W&B Weave è la piattaforma di Weights & Biases‘ LLM osservabilità per il monitoraggio, la valutazione e l'ottimizzazione delle applicazioni di language model. Weave traccia automaticamente ogni chiamata LLM usando il decoratore @weave.op, acquisendo input, output, costi, latenza e metriche di valutazione senza configurazione manuale.

La piattaforma traccia automaticamente l'utilizzo dei token e calcola i costi, monitora i tempi di risposta per individuare le query lente e misura l'accuratezza confrontando le previsioni con i risultati attesi. È possibile confrontare diversi esperimenti uno accanto all'altro per vedere quale model o prompt offre prestazioni migliori. Il monitoraggio degli errori mostra quali previsioni non sono riuscite e perché, mentre il versionamento automatico conserva ogni modifica di configurazione per la riproducibilità. Ciò consente di testare facilmente approcci diversi, identificare ciò che funziona meglio ed eseguire il debug dei problemi quando i model commettono errori.

Dashboard di riepilogo dei punteggi

Figura 1: Grafici che mostrano la dashboard delle metriche di prestazione del model, monitorando accuratezza, costi e andamento della latenza.

Le metriche di prestazione sono mostrate in tutte le esecuzioni di valutazione. Costo totale, utilizzo dei token e tempi di risposta sono visualizzati con grafici che mostrano le variazioni. Le metriche personalizzate, come accuratezza e tassi di errore, appaiono in pannelli separati. Le linee di tendenza aiutano a individuare quando le prestazioni peggiorano o i costi aumentano in modo imprevisto, con la dashboard che si aggiorna automaticamente man mano che i nuovi test vengono completati.

Vista delle tracce

Figura 2: Tabella delle tracce di valutazione che mostra le versioni del model e i relativi risultati di classificazione degli intenti.

Ogni esecuzione di test viene salvata con dettagli completi. Ogni traccia mostra quale model è stato usato, quale prompt è stato inviato e tutte le impostazioni. Gli indicatori di successo o fallimento indicano se i test sono stati completati correttamente. La colonna prompt visualizza il testo inviato al model per la verifica. Questa registrazione consente di confrontare diverse versioni una accanto all'altra, vedere cosa è cambiato tra un'esecuzione e l'altra e ripetere qualsiasi test utilizzando la configurazione salvata.

Classifica di confronto dei model

Figura 3: Immagine che mostra la classifica che confronta le versioni del model di classificazione degli intenti in base alle metriche di accuratezza e latenza.

È possibile confrontare diversi models e impostazioni sugli stessi dati di test. Le colonne mostrano accuratezza, previsioni corrette, punteggi e tempi di risposta. La codifica a colori evidenzia in verde i model con prestazioni migliori. Questo confronto rivela compromessi come una maggiore accuratezza a scapito di una velocità inferiore o risposte più rapide con un'accuratezza leggermente inferiore, aiutando a scegliere quale configurazione funziona meglio per le esigenze di produzione.

Versionamento dei model

Figura 4: Pannello di configurazione del classificatore di intenti che mostra le impostazioni del model e i dettagli della versione.

Ogni modifica di configurazione crea automaticamente una nuova versione, mantenendo una cronologia completa. I dettagli della versione mostrano quando sono avvenute le modifiche, chi le ha apportate e lo spazio di archiviazione usato. La scheda Valori visualizza le impostazioni esatte, inclusi nome del model, parametri e versioni delle funzioni. Questo versionamento garantisce che qualsiasi test possa essere ripetuto con impostazioni identiche, consente di monitorare come sono cambiate le prestazioni e permette di tornare a versioni precedenti se necessario.

Risultati dettagliati della valutazione

Risultati della valutazione che mostrano singoli casi di test con intenti previsti e punteggi di accuratezza.

Figura 5: Risultati della valutazione che mostrano singoli casi di test con intenti previsti e punteggi di accuratezza.

I risultati dei singoli test sono mostrati per ogni campione. La sezione Punteggi riepiloga il totale delle previsioni corrette, la percentuale di accuratezza e i punteggi personalizzati.

La tabella Risultati visualizza ogni query con la risposta attesa e la previsione del model, usando segni di spunta per le risposte corrette e X per quelle errate. Le previsioni non riuscite sono facili da individuare e spesso mostrano schemi come la confusione tra categorie simili.

Facendo clic su una qualsiasi riga si apre la traccia completa, inclusi prompt, risposta, conteggi dei token e tempi, rendendo semplice il debug dei guasti e il miglioramento dei prompt o della selezione del model.

Langsmith

LangSmith è la piattaforma di osservabilità di LangChain per il monitoraggio, il debug e la valutazione delle applicazioni LLM. Traccia automaticamente ogni chiamata LLM, acquisisce prompt e output, monitora costi e latenza e consente una valutazione sistematica tramite test basati su dataset. LangSmith si integra nativamente con LangChain ma supporta qualsiasi applicazione LLM tramite il suo SDK.

Risultati della valutazione per campione

Figura 6: Immagine che mostra la valutazione del singolo caso di test su previsioni e metriche di prestazione.

Gli esiti delle singole previsioni vengono visualizzati accanto agli output attesi, consentendo di individuare dove il model commette errori. Il confronto tra previsioni attese ed effettive rivela confusione tra categorie semanticamente simili. La latenza e i conteggi dei token per query mostrano quali tipi di input sono più costosi da elaborare, consentendo di ottimizzare le query lente o costose.

Volume delle tracce e monitoraggio dello stato

Figura 7: Grafico che mostra la visualizzazione delle tracce del progetto monitorando i tassi di successo e di errore.

Lo stato di salute dell'applicazione viene mostrato tramite l'andamento del volume delle tracce e i rapporti successo/errori. Sono disponibili diverse viste per analizzare le chiamate LLM, l'andamento dei costi, le invocazioni degli strumenti o i punteggi di feedback. Problemi come picchi di errori o aumenti dei costi diventano visibili, indicando questioni che richiedono indagine.

Confronto tra model e configurazioni

Figura 8: Vista di confronto degli esperimenti che mostra le metriche di prestazione in più esecuzioni di test.

È possibile confrontare diversi model uno accanto all'altro sullo stesso dataset di test. I compromessi tra accuratezza, latenza (P50/P99) ed efficienza dei token vengono visualizzati graficamente. Individuare quale configurazione soddisfa meglio i requisiti, sia che si tratti di massimizzare l'accuratezza o di ridurre al minimo costi e tempi di risposta, è semplice grazie a questi confronti.

Langfuse

Langfuse è una piattaforma open-source di osservabilità LLM progettata per il monitoraggio, il debug e la valutazione delle applicazioni di language model. Disponibile sia come soluzione self-hosted che cloud, Langfuse offre un tracciamento completo con acquisizione automatica di prompt, output, costi e latenza.

La piattaforma supporta qualsiasi LLM framework tramite il suo SDK flessibile e offre funzionalità di valutazione integrate, incluso LLM-as-a-judge per la valutazione automatica della qualità. Langfuse tiene traccia delle versioni dei prompt tra le esecuzioni, consentendo il confronto delle metriche di prestazione tra diverse formulazioni.

La raccolta del feedback degli utenti tramite valutazioni con pollice su/giù aiuta a identificare output di alta e bassa qualità, mentre il punteggio personalizzato consente di monitorare metriche specifiche dell'applicazione. Le valutazioni automatizzate possono elaborare migliaia di tracce a tassi di campionamento configurabili, consentendo un monitoraggio continuo della qualità su larga scala senza revisione manuale di ogni output.

Langfuse è stata acquisita da ClickHouse e ora opera come parte di ClickHouse, pur rimanendo open-source.1

Vista dettagliata della traccia

Figura 10: Log delle tracce che mostrano i dettagli delle chiamate API con dati su prestazioni e costi.

Le singole tracce mostrano i dettagli completi di esecuzione per ogni chiamata LLM. La vista della traccia mostra misurazioni esatte della latenza, consumo di token (token di prompt e di completamento separatamente) e costi calcolati per richiesta.

La configurazione del model viene preservata, inclusi temperature, max_tokens e altri parametri. La sezione Anteprima visualizza il prompt completo inviato al model insieme alla risposta completa, consentendo di capire esattamente cosa il model ha ricevuto e generato.

Questa visibilità granulare consente il debug di guasti specifici esaminando l'esatta coppia input-output che ha causato un errore.

Tabella di panoramica delle tracce

Figura 11: Ispezione della singola traccia che mostra i dettagli della richiesta e la risposta del model.

Tutte le tracce vengono aggregate in una tabella filtrabile che mostra output, livelli di osservazione, latenza, utilizzo di token e costi totali. Ogni riga rappresenta una singola chiamata LLM con livelli di osservazione codificati a colori che indicano la gerarchia o l'importanza della traccia. I conteggi dei token mostrano sia i token di prompt che quelli di completamento, insieme ai totali, mentre i calcoli dei costi vengono eseguiti automaticamente in base al model usato.

Il selettore Colonne consente di personalizzare le metriche visualizzate, mentre i filtri permettono di restringere le tracce per ambiente, intervallo di tempo o altri criteri. Questa vista tabellare rende semplice identificare schemi come query costantemente lente o richieste inaspettatamente costose.

Braintrust

Braintrust è una piattaforma di osservabilità LLM che combina valutazione e monitoraggio in produzione. La piattaforma consente di testare i model su dataset, confrontare diversi prompt o configurazioni e monitorare le metriche di qualità tramite punteggio automatizzato. Le funzioni di valutazione integrate e personalizzate misurano accuratezza, pertinenza o criteri specifici del dominio, con risultati mostrati in tabelle di confronto che evidenziano le differenze di prestazione tra le versioni.

Per il monitoraggio in produzione, Braintrust tiene traccia delle metriche in tempo reale, tra cui latenza, costi e punteggi di qualità personalizzati, mentre il traffico attraversa le applicazioni. Gli avvisi si attivano quando le soglie di qualità vengono superate o le barriere di sicurezza vengono violate. Brainstore, il sistema di archiviazione dei log della piattaforma, acquisisce i log delle applicazioni su larga scala con una ricerca ottimizzata per le interazioni IA. La dashboard mostra metriche aggregate tra esperimenti ed esecuzioni in produzione, acquisendo monitoraggio dei costi, utilizzo dei token e metadati delle risposte sia per le richieste di valutazione sia per quelle di produzione.

Helicone

Helicone è una piattaforma di osservabilità basata su proxy che monitora le applicazioni LLM instradando le richieste API attraverso il proprio server proxy. L'integrazione richiede la modifica dell'URL di base senza installazione di SDK o modifiche al codice. La piattaforma acquisisce automaticamente richieste, risposte, costi e utilizzo dei token per monitorare il comportamento dell'applicazione.

La dashboard mostra i volumi totali delle richieste, i costi aggregati e il consumo di token in tutte le chiamate API. I log delle richieste mostrano i prompt di input completi e gli output del model, consentendo di indagare su previsioni o errori specifici. Il monitoraggio dei costi suddivide la spesa per tipo di model, utente o tag personalizzati per identificare le operazioni costose. La cache integrata rileva le richieste duplicate e fornisce risposte memorizzate nella cache, riducendo sia i costi delle API sia i tempi di risposta. La limitazione della velocità impone limiti di utilizzo per utente o endpoint per prevenire picchi di spesa imprevisti.

La piattaforma si concentra sul monitoraggio delle singole chiamate API: ogni richiesta appare come una voce di log separata, senza supporto integrato per raggruppare le chiamate correlate o visualizzare le sequenze. Ciò rende Helicone adatta ad applicazioni come chiamate LLM indipendenti (ad esempio chatbot a turno singolo), generazione di contenuti in batch o attività di classificazione, ma meno adatta al monitoraggio di flussi di lavoro multi-step in cui è importante comprendere le relazioni tra chiamate sequenziali.

Comet Opik

Opik è una piattaforma open-source di osservabilità e valutazione LLM di Comet, un fornitore affermato di MLOps e monitoraggio degli esperimenti.2 Le sue funzionalità principali includono:

  • Tracciamento: acquisisce le chiamate LLM, i passaggi degli agenti e le invocazioni degli strumenti per una visibilità end-to-end sul comportamento dell'applicazione
  • Valutazione: fornisce metriche integrate e valutatori LLM as judge per assegnare punteggi agli output come allucinazione, pertinenza e moderazione
  • Integrazione con Comet: collega le tracce LLM con la piattaforma di monitoraggio degli esperimenti di Comet, consentendo ai team di unificare i metadati ML tradizionali e l'osservabilità LLM in un unico posto3
Lascia che il nostro team automatizzi uno dei tuoi processi aziendali con agenti IA, gratuitamente.
Automatizza un processo

Arize Phoenix

Arize Phoenix è una piattaforma open-source per lo sviluppo, l'osservabilità e la valutazione di applicazioni IA, creata da Arize IA e dalla comunità open-source.4 È costruita su OpenTelemetry e alimentata dalla strumentazione OpenInference, così le tracce funzionano con gli strumenti esistenti senza un formato proprietario. Le sue funzionalità principali includono:

  • Tracciamento: acquisisce ogni passaggio compiuto da un agente, inclusi prompt, recuperi, chiamate agli strumenti e output, offrendo visibilità end-to-end sulle esecuzioni degli agenti
  • Valutazione: fornisce un framework di valutazione che assegna punteggi agli output e aiuta a individuare le regressioni prima che raggiungano gli utenti, con supporto sia per la revisione umana sia per gli approcci LLM as judge
  • Ingegneria dei prompt e iterazione: include un Prompt IDE per testare modifiche a prompt e harness su esempi reali di produzione
  • Dataset ed esperimenti: consente ai team di creare dataset a partire dalle tracce ed eseguire esperimenti che confrontano le modifiche sugli stessi input per misurare se la qualità migliora effettivamente
  • Annotazioni: supporta l'etichettatura di tracce e span per segnalare cosa ha funzionato e cosa si è rotto durante la revisione
  • Opzioni di distribuzione: può essere eseguito localmente, tramite Docker, su Kubernetes con Helm o come Phoenix Cloud, con due istanze gratuito Phoenix Cloud disponibili
  • Open source e self-hostable: con licenza ELv2 con oltre 10.000 GitHub stelle e 2.5 milioni di download al mese, con tracce archiviate nell'ambiente dell'utente quando self-hosted

Piattaforme di monitoraggio che si estendono all'osservabilità LLM


I fornitori affermati di monitoraggio delle prestazioni delle applicazioni (APM) stanno estendendo le loro piattaforme per coprire i carichi di lavoro LLM.

Datadog

Il prodotto Datadog’s LLM Observability è generalmente disponibile e traccia ogni passaggio di una pipeline LLM, inclusi prompt, risposte del model, passaggi di recupero e chiamate agli strumenti. Monitora la latenza e l'utilizzo dei token in questi passaggi ed esegue valutazioni integrate sugli output, inclusi controlli per allucinazioni, prompt injection, tossicità ed esposizione di dati sensibili.5 6

IBM Instana

IBM Instana elenca GenAI Observability come parte della sua piattaforma full-stack di monitoraggio di applicazioni e infrastrutture, posizionandola accanto alle sue funzionalità di indagine sugli incidenti di intelligenza artificiale agentica.7

OpenObserve

OpenObserve ha introdotto Observability 3.0, una piattaforma IA-native che combina log, metriche, tracce e monitoraggio reale degli utenti con l'osservabilità LLM in un unico strumento. Il suo agente IA SRE correla gli avvisi in incidenti e identifica automaticamente le cause principali, mentre un IA Assistant converte il linguaggio naturale in query SQL e PromQL, riepiloga i modelli dei log e genera dashboard e avvisi a partire da descrizioni in inglese semplice. Il rilevamento di Anomaly è offerto come tipo di avviso integrato insieme alle opzioni a soglia e composite.8

Honeycomb

Honeycomb, una piattaforma di osservabilità, ha aggiunto funzionalità specifiche per IA e LLM al suo prodotto. La sua Agent Timeline rivela le relazioni tra input degli utenti, interazioni LLM, chiamate agli strumenti e invocazioni degli agenti, mentre BubbleUp, uno strumento di rilevamento delle anomalie basato su machine learning, fa emergere le anomalie combinando metriche, tracce e log. La piattaforma supporta anche il monitoraggio dell'utilizzo dei token e un Query Assistant in linguaggio naturale per analizzare il comportamento del sistema.9

New Relic

New Relic ha introdotto Agentic IA Monitoring, aggiungendo funzionalità incentrate sugli agenti alla sua piattaforma di osservabilità. Fornisce una mappa dei servizi delle interazioni tra agenti, metriche di prestazione come volume di richieste, latenza media e percentuali di errore, e drill-down a livello di traccia nelle singole chiamate di agenti e strumenti.10

Non perderti i nostri benchmark e approfondimenti basati sui dati. Il pulsante apre Google; selezionare AIMultiple conferma che desideri vedere AIMultiple più spesso nei risultati di ricerca di Google.
GoogleAggiungi come fonte preferita

Cos'è l'osservabilità LLM?

L'osservabilità LLM è la pratica di raccogliere e interpretare dati continui dai large language models per capire come si comportano durante l'uso nel mondo reale. Si concentra sulla raccolta di metriche, tracce e log che mostrano come gli LLM rispondono a diversi prompt, strumenti e chiamate API esterne.

Poiché i language model operano tramite ragionamento probabilistico, i loro processi interni non possono essere ispezionati direttamente. Ciò rende il monitoraggio degli LLM dipendente dalla revisione degli output LLM, degli input LLM e dei passaggi intermedi che compaiono nei flussi di lavoro agentici. Studiando queste tracce, gli sviluppatori di LLM ottengono visibilità su prestazioni del sistema, comportamento del model e modelli di utilizzo che influenzano le prestazioni dell'applicazione e la qualità dell'output.

L'osservabilità LLM è fondamentale per diversi motivi:

  • Garanzia di qualità: I large language models possono produrre output errati o di bassa qualità per un'ampia gamma di motivi, tra cui prompt poco chiari, dati in deriva o comportamenti imprevisti degli utenti. Il monitoraggio di prompt e risposte aiuta a tenere traccia di metriche di valutazione come correttezza, coerenza, pertinenza e rispondenza ai fatti. Ciò consente ai team di rilevare quando gli output degli LLM iniziano a peggiorare in termini di qualità della risposta o quando il model inizia a generare allucinazioni. Man mano che l'uso degli LLM si espande nei flussi di lavoro aziendali, garantire un'accuratezza costante diventa una sfida comune.
  • Risoluzione dei problemi: Quando si verificano problemi all'interno delle applicazioni LLM, le cause principali possono provenire da molte aree. Tra gli esempi figurano prompt regolati male, fine-tuning difettoso, chiamate API esterne non riuscite o errori logici all'interno di flussi di lavoro multi-step degli agenti. Raccogliendo tracce LLM che mostrano i passaggi intermedi, gli sviluppatori possono eseguire un'analisi delle cause principali in modo efficiente e individuare la fase esatta in cui il comportamento è divergato. Ciò riduce la necessità di intervento umano e accorcia i tempi di tracciamento degli errori.
  • Ottimizzazione: Il monitoraggio delle prestazioni del sistema, dell'utilizzo delle risorse e dell'utilizzo dei token aiuta le organizzazioni a identificare i colli di bottiglia e a migliorare le prestazioni degli LLM. I team possono misurare latenza, throughput, utilizzo della memoria e tassi di errore per capire come si comportano gli LLM a diversi livelli di carico. Possono inoltre tenere traccia dei token per controllare i costi e rivedere i modelli di utilizzo per migliorare le prestazioni e l'efficienza dei costi. Il monitoraggio continuo di queste metriche chiave è particolarmente utile nella retrieval-augmented generation e nei flussi di lavoro degli agenti, dove i colli di bottiglia delle prestazioni spesso emergono da chiamate inefficienti agli strumenti o da round-trip non necessari durante il reasoning.

Categorie di metriche fondamentali

Gli strumenti di osservabilità LLM in genere raggruppano le metriche pertinenti in tre categorie che supportano sia i team di sviluppo software sia i team operativi.

Metriche di prestazione del sistema

  • Latenza: Misura il tempo che intercorre tra la ricezione di un prompt e la consegna di una risposta.
  • Throughput: Indica quante richieste il model può elaborare in un dato periodo.
  • Tassi di errore: Rivelano quanto spesso il sistema restituisce risposte non valide o non riuscite.

Metriche di utilizzo delle risorse

  • Consumo di CPU e GPU: Aiuta a capire con quale efficienza il sistema utilizza l'hardware.
  • Utilizzo della memoria: Influisce sulle decisioni di scalabilità e sulla pianificazione della capacità.
  • Utilizzo dei token: Influisce sull'efficienza dei costi e aiuta i team a controllare i costi durante un utilizzo intensivo degli LLM.
  • Compromessi tra throughput e latenza: Mostrano come il sistema bilancia velocità e volume di elaborazione.

Metriche di comportamento del model

  • Correttezza, rispondenza ai fatti e qualità della risposta: Per identificare output di bassa qualità.
  • Coinvolgimento e feedback degli utenti: Forniscono indicazioni su quanto bene il model soddisfa le esigenze degli utenti.
  • Metriche di fedeltà e ancoraggio alla fonte: Riflettono quanto il model aderisce al materiale di origine.

Osservabilità manuale vs. autonoma

Affidarsi all'osservazione manuale presenta diverse sfide. I large language models generano elevati volumi di dati e le catene di ragionamento multi-step producono numerosi log e tracce. La necessità di monitoraggio in tempo reale aumenta la complessità operativa e persino i team esperti faticano a esaminare ogni chiamata LLM senza perdere segnali essenziali. I flussi di lavoro manuali rendono inoltre difficile stare al passo con i continui cambiamenti nel comportamento degli utenti e nelle variazioni dei prompt.

I sistemi di osservabilità autonoma affrontano queste sfide utilizzando agenti software che analizzano continuamente l'attività degli LLM. Questi agenti rilevano anomalie, diagnosticano problemi ed eseguono l'analisi delle cause principali senza costante intervento umano. Le valutazioni automatizzate aiutano inoltre a identificare comportamenti rischiosi, come la prompt injection.

Un sistema di questo tipo supporta il monitoraggio continuo e garantisce un tracciamento coerente delle metriche di valutazione sull'intero model. Di conseguenza, le organizzazioni beneficiano di una risoluzione dei problemi più rapida, di prestazioni applicative migliori e di un migliore controllo dei rischi operativi.

Cosa cercare negli strumenti di osservabilità LLM

Valutazioni di qualità e sicurezza

  • Rilevamento delle allucinazioni per identificare quando il model si discosta dai dati affidabili.
  • Rilevamento di prompt injection e jailbreak per affrontare i problemi di sicurezza.
  • Punteggio di tossicità e valutazioni di sicurezza che supportano conformità e riduzione del rischio.
  • Clustering che raggruppa output LLM simili per identificare la deriva.

Funzionalità di sperimentazione

  • Test A/B per la gestione dei prompt e le modifiche di configurazione.
  • Confronto rapido tra più model LLM o parametri.
  • Valutazione di accuratezza, consumo di token e latenza prima della distribuzione.
  • Test delle modifiche al model su scenari reali utilizzando dati simili a quelli di produzione.

Correlazione con l'infrastruttura

  • Collegamento delle tracce LLM ai dati di monitoraggio delle prestazioni delle applicazioni backend.
  • Collegamento del tempo di risposta e della qualità della risposta alle sessioni reali degli utenti.
  • Identificazione di come le prestazioni del sistema influenzano le prestazioni degli LLM e la stabilità dell'applicazione.

Per le distribuzioni LLM on-premises, questa correlazione spesso si estende fino alla telemetria a livello di GPU. OpenLIT, uno strumento di osservabilità nativo di OpenTelemetry per applicazioni GenAI e LLM, include il monitoraggio integrato della GPU con supporto per hardware NVIDIA e AMD Radeon, acquisendo metriche come utilizzo, uso della memoria, temperatura e assorbimento di potenza durante l'inference.

Correlare queste metriche con il throughput del model consente agli operatori di identificare quando i limiti di potenza o termici stanno degradando le prestazioni di inference e aiuta a regolare le impostazioni hardware per sostenere carichi di lavoro IA affidabili.11 12

LLMOps e governance

  • Guardrail che filtrano i prompt non sicuri e bloccano le risposte dannose.
  • Dashboard per monitorare l'esposizione di PII, allucinazioni e violazioni della sicurezza.
  • Strumenti che supportano conformità, reporting e analisi degli incidenti di sicurezza.

Diversi prodotti sono costruiti specificamente per queste esigenze di governance e conformità:

Databricks Unity IA Gateway è un livello di controllo centrale per agenti, endpoint LLM e server Model Context Protocol (MCP). Le sue funzionalità includono:

  • Controlli di accesso e policy: configura le autorizzazioni e applica i guardrail sugli endpoint
  • Gestione della capacità: gestisce la capacità tra i provider e limita la velocità sugli endpoint
  • Registrazione dei payload: registra i payload di richieste e risposte a fini di audit
  • Monitoraggio di utilizzo e costi: tiene traccia di utilizzo e costi tramite tabelle di sistema
  • Governance dei server MCP: governa i server MCP tramite le autorizzazioni di Unity Catalog13 14

Openlayer è una piattaforma di governance e osservabilità IA rivolta ai settori regolamentati. Le sue funzionalità includono:

  • Test pre-distribuzione: test strutturati su allucinazioni, bias, tossicità e robustezza
  • Osservabilità in tempo reale: monitoraggio e tracciamento per chiamate LLM, pipeline di retrieval e agenti multi-step
  • Guardrail: protezione contro prompt injection e perdita di PII
  • Supporto alla conformità: mappatura automatizzata della conformità con acquisizione continua delle prove e reporting pronto per l'audit, allineato a framework come EU IA Act e ISO/IEC 4200115

OpenTelemetry come standard emergente

OpenTelemetry è un framework open source e vendor-neutral per la raccolta di tracce, metriche e log dai sistemi software. È importante per l'osservabilità LLM perché le applicazioni IA combinano molte parti in movimento come model, database vettoriali, strumenti e framework di agenti, e senza uno standard condiviso ogni componente emette dati nel proprio formato, il che rende difficile il debug end-to-end e vincola i team al fornitore di monitoraggio per cui hanno scelto per primi la strumentazione.

Le convenzioni semantiche GenAI di OpenTelemetry definiscono uno schema comune per chiamate ai model, utilizzo dei token, invocazioni di strumenti e flussi di lavoro degli agenti, così le tracce provenienti da diverse librerie possono essere acquisite e analizzate in modo coerente.16

La maggior parte delle principali piattaforme di osservabilità LLM, tra cui Arize Phoenix, Langfuse e Honeycomb, ingeriscono i dati OpenTelemetry in modo nativo, il che consente ai team di strumentare le proprie applicazioni una sola volta e cambiare backend in seguito senza riscrivere il codice di tracciamento.17

Osservabilità dei flussi di lavoro multi-agente

Man mano che gli LLM alimentano flussi di lavoro multi-step degli agenti, i requisiti di osservabilità si estendono oltre le singole coppie richiesta-risposta. Le applicazioni agentiche introducono ulteriori livelli di complessità che richiedono approcci di tracciamento dedicati.

Dimensioni chiave dell'osservabilità per gli agenti:

  • Tracce di pianificazione e ragionamento: Visibilità su come l'agente scompone le attività, seleziona le azioni e perfeziona il proprio approccio in base ai risultati intermedi
  • Monitoraggio delle chiamate agli strumenti: Monitoraggio delle chiamate API esterne, delle query ai database e delle esecuzioni di funzioni per identificare colli di bottiglia della latenza o guasti
  • Tracciamento dei passaggi di consegna: Per i sistemi multi-agente, monitoraggio di come le attività vengono trasferite tra agenti e se il contesto viene preservato correttamente
  • Evoluzione dello stato: Comprensione di come memoria e contesto cambiano attraverso più turni all'interno di una sessione

Together, queste dimensioni costituiscono la base del monitoraggio agentico. Gli strumenti di osservabilità LLM come Langsmith, Langfuse, AgentOps e Weights & Biases forniscono viste di tracciamento specifiche per gli agenti che mostrano grafici di esecuzione completi.

Oltre a questi strumenti generici, alcuni prodotti si concentrano specificamente sull'affidabilità degli agenti. Un esempio è Omium, che si posiziona come prodotto di osservabilità e affidabilità creato appositamente per gli agenti IA in produzione.18

Le sue funzionalità principali includono:

  • Span strutturati: Acquisisce span per ogni chiamata LLM, uso di strumenti e decisione dell'agente
  • Tracciamento multi-agente: Cuce le chiamate tra agenti in un'unica traccia unificata per la diagnostica in tempo reale
  • Classificazione dei guasti: Etichetta automaticamente i guasti in categorie come hallucination, ciclo infinito, errore dello strumento e perdita di contesto
  • Recovery da checkpoint: Salva lo stato dell'agente a ogni chiamata di strumento e risposta LLM, consentendo ai flussi di lavoro di riprendere da qualsiasi checkpoint invece di ricominciare da zero
  • Supporto ai framework: SDK per TypeScript, Python e Go, con rilevamento auto per LangChain, LangGraph, OpenAI e Anthropic

FAQ

L'osservabilità efficace degli agenti acquisisce la traccia completa di esecuzione, dalla richiesta iniziale alle chiamate agli strumenti e alla risposta finale. Ciò include come un model riceve una richiesta, seleziona gli strumenti, recupera dati da una fonte di dati e genera una risposta finale. L'osservabilità è importante perché le applicazioni LLM continuano a crescere in complessità e il numero di app basate su LLM che si affidano al ragionamento multi-step aumenta rapidamente. Di conseguenza, le organizzazioni hanno bisogno di strumenti di osservabilità che forniscano monitoraggio in tempo reale e valutazione automatizzata per garantire prestazioni costanti in tutte le app LLM.

I moderni strumenti di osservabilità LLM mirano a fornire una panoramica dettagliata di ogni azione all'interno delle app basate su LLM. Ciò include il monitoraggio di ogni chiamata LLM, di ogni interazione con gli strumenti e di ogni passaggio intermedio che compare in una catena di ragionamento agentico. La capacità di osservare l'intero flusso di lavoro dal prompt alla risposta finale aiuta i team a rilevare comportamenti imprevisti e a capire come i LLM model prendono le decisioni.

Anche l'analisi dei costi e dei token è diventata essenziale. Il monitoraggio in tempo reale dell'utilizzo dei token aiuta le organizzazioni a mantenere l'efficienza dei costi ed evitare picchi di spesa imprevisti. I team possono suddividere l'utilizzo dei token per provider, model, funzionalità o percorso applicativo per capire come i diversi componenti contribuiscono ai costi. Alcuni strumenti di osservabilità consentono agli utenti di confrontare più provider LLM uno accanto all'altro, aiutando nelle decisioni su prestazioni ed efficienza dei costi quando si instradano richieste tra LLM open-source e opzioni proprietarie.

In tutto l'ecosistema, gli strumenti di osservabilità inquadrano costantemente l'osservabilità LLM come un requisito per gestire le applicazioni LLM su larga scala. I team che si affidano a flussi di lavoro degli agenti hanno bisogno di visibilità su come il model si muove attraverso il ragionamento multi-step e su come ogni decisione influisce sulle prestazioni del model. L'osservabilità aiuta a garantire risposte costanti di alta qualità, rilevare tempestivamente i guasti e mantenere la fiducia degli utenti.

Un altro tema è la necessità di gestire i costi operativi. Il monitoraggio dell'utilizzo dei token, dell'utilizzo della memoria e delle metriche di utilizzo delle risorse aiuta le organizzazioni a controllare la spesa mantenendo prestazioni ed efficienza dei costi. L'osservabilità rivela anche i colli di bottiglia delle prestazioni che influenzano la soddisfazione degli utenti e le prestazioni dell'applicazione.

Infine, l'osservabilità LLM è importante perché le organizzazioni si affidano sempre più ai model LLM per funzioni critiche. Man mano che questi sistemi si espandono, gli strumenti di monitoraggio devono essere framework-agnostic, in grado di integrarsi con piattaforme open-source e capaci di fornire approfondimenti su più servizi. Ciò supporta una distribuzione sicura, riduce i problemi di sicurezza e aiuta i team a comprendere gli output del model in un contesto operativo più ampio.

Cita questa ricerca

Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.

Sıla Ermut and Nazlı Şipi (2026) - "LLM Strumenti di osservabilità: Weights & Biases, Langsmith". Pubblicato online su AIMultiple.com. Consultato il 9 Giugno 2026, da: https://aimultiple.com/llm-observability [Risorsa online]

Ermut, S., & Şipi, N. (2026, 9 Giugno). LLM Strumenti di osservabilità: Weights & Biases, Langsmith. AIMultiple. https://aimultiple.com/llm-observability

@misc{ermut2026,
  author = {Ermut, Sıla and Şipi, Nazlı},
  title  = {{LLM Strumenti di osservabilità: Weights & Biases, Langsmith}},
  year   = {2026},
  month  = jun,
  howpublished    = {\url{https://aimultiple.com/llm-observability}},
  note   = {AIMultiple. Consultato il 9 Giugno 2026}
}
Sıla Ermut
Sıla Ermut
Analista di Settore
Sıla Ermut è un'analista di settore presso AIMultiple e si occupa di modelli di IA, infrastrutture di IA, governance dell'IA e applicazioni aziendali dell'IA. La sua ricerca si concentra principalmente sull'uso dell'IA nel marketing, nella sanità, nelle catene di approvvigionamento e nella sostenibilità. In precedenza ha lavorato come recruiter in società di project management e consulenza. Sıla possiede un Master of Science in Psicologia Sociale e un Bachelor of Arts in Relazioni Internazionali.
Visualizza il profilo completo
Ricercato da
Nazlı Şipi
Nazlı Şipi
Ricercatrice IA
Nazlı è un'analista di dati presso AIMultiple. Ha precedenti esperienze nell'analisi dei dati in diversi settori, dove ha lavorato alla trasformazione di dataset complessi in insight attuabili.
Visualizza il profilo completo

Sii il primo a commentare

Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.

0/450