LLM Strumenti di osservabilità: Weights & Biases, Langsmith
LLM Le applicazioni si sono estese da chat a turno singolo ad agenti multi-step che utilizzano strumenti, interrogano database e si coordinano con altri modelli, rendendo il loro comportamento più difficile da interpretare.
LLM L'osservabilità fornisce visibilità continua su questi flussi di lavoro complessi, aiutando le organizzazioni a monitorare la qualità, rilevare guasti, risolvere problemi e gestire prestazioni e costi.
LLM Confronto delle funzionalità degli strumenti di osservabilità
Weights & Biases (W&B Weave)
W&B Weave è la piattaforma di osservabilità Weights & Biases‘ LLM osservabilità per il monitoraggio, la valutazione e l'ottimizzazione delle applicazioni di modelli linguistici. Weave traccia automaticamente ogni chiamata LLM utilizzando il decoratore @weave.op, catturando input, output, costi, latenza e metriche di valutazione senza configurazione manuale.
La piattaforma tiene traccia dell'utilizzo dei token e calcola automaticamente i costi, monitora i tempi di risposta per individuare query lente e misura l'accuratezza confrontando le previsioni con i risultati attesi. È possibile confrontare diversi esperimenti fianco a fianco per vedere quale modello o prompt offre prestazioni migliori. Il tracciamento degli errori mostra quali previsioni hanno fallito e perché, mentre il versioning automatico preserva ogni modifica di configurazione per la riproducibilità. Ciò semplifica il test di approcci diversi, l'identificazione di ciò che funziona meglio e il debug dei problemi quando i modelli commettono errori.
Dashboard riepilogativa dei punteggi
Figura 1: Grafici che mostrano la dashboard delle metriche di performance del modello, monitorando le tendenze di accuratezza, costo e latenza nel tempo.
Le metriche di performance vengono mostrate in tutte le esecuzioni di valutazione. Costo totale, utilizzo dei token e tempi di risposta sono visualizzati con grafici che mostrano le variazioni nel tempo. Metriche personalizzate, come accuratezza e tassi di errore, appaiono in pannelli separati. Le linee di tendenza aiutano a individuare quando le prestazioni peggiorano o i costi aumentano inaspettatamente, con la dashboard che si aggiorna automaticamente al completamento dei nuovi test.
Vista delle tracce
Figura 2: Tabella delle tracce di valutazione che mostra le versioni del modello e i loro risultati di classificazione dell'intento.
Ogni esecuzione di test viene salvata con tutti i dettagli. Ogni traccia mostra quale modello è stato utilizzato, quale prompt è stato inviato e tutte le impostazioni. Gli indicatori di successo o fallimento indicano se i test sono stati completati correttamente. La colonna del prompt mostra il testo inviato al modello per la verifica. Questa registrazione consente di confrontare diverse versioni fianco a fianco, vedere cosa è cambiato tra un'esecuzione e l'altra e ripetere qualsiasi test utilizzando la sua configurazione salvata.
Classifica comparativa dei modelli
Figura 3: Immagine che mostra la classifica comparativa delle versioni del modello di classificazione degli intenti in base a metriche di accuratezza e latenza.
Diversi modelli e impostazioni possono essere confrontati sugli stessi dati di test. Le colonne mostrano accuratezza, previsioni corrette, punteggi e tempi di risposta. La codifica a colori evidenzia in verde i migliori risultati. Questo confronto rivela compromessi come una maggiore accuratezza a scapito di una minore velocità o risposte più rapide con un'accuratezza leggermente inferiore, aiutando a scegliere la configurazione migliore per le esigenze di produzione.
Versioning del modello
Figura 4: Pannello di configurazione del classificatore di intenti che mostra le impostazioni del modello e i dettagli della versione.
Ogni modifica della configurazione crea automaticamente una nuova versione, mantenendo una cronologia completa. I dettagli della versione mostrano quando sono avvenute le modifiche, chi le ha apportate e lo spazio di archiviazione utilizzato. La scheda Valori mostra le impostazioni esatte, inclusi nome del modello, parametri e versioni delle funzioni. Questo versioning garantisce che qualsiasi test possa essere ripetuto con impostazioni identiche, consente di tracciare come le prestazioni sono cambiate nel tempo e permette di tornare a versioni precedenti se necessario.
Risultati dettagliati della valutazione

Figura 5: Risultati della valutazione che mostrano singoli casi di test con intenti previsti e punteggi di accuratezza.
I risultati dei singoli test sono mostrati per ogni campione. La sezione Punteggi riassume il totale delle previsioni corrette, la percentuale di accuratezza e i punteggi personalizzati.
La tabella dei risultati mostra ogni query con la risposta attesa e la previsione del modello, utilizzando segni di spunta per le risposte corrette e segni X per quelle errate. Le previsioni fallite sono facili da individuare, spesso mostrando schemi come confusione tra categorie simili.
Facendo clic su qualsiasi riga si apre la traccia completa, inclusi prompt, risposta, conteggio dei token e tempi, facilitando il debug degli errori e il miglioramento dei prompt o della selezione del modello.
Langsmith
LangSmith è la piattaforma di osservabilità di LangChain per il monitoraggio, il debug e la valutazione delle applicazioni LLM. Traccia automaticamente ogni chiamata LLM, cattura prompt e output, tiene traccia dei costi e della latenza e consente una valutazione sistematica tramite test basati su dataset. LangSmith si integra nativamente con LangChain ma supporta qualsiasi applicazione LLM tramite il suo SDK.
Risultati di valutazione per campione
Figura 6: Immagine che mostra la valutazione del singolo caso di test su previsioni e metriche di performance.
I risultati delle singole previsioni sono visualizzati accanto agli output attesi, consentendo di identificare dove il modello commette errori. Il confronto tra previsioni attese ed effettive rivela confusione tra categorie semanticamente simili. La latenza e il conteggio dei token per query mostrano quali tipi di input sono più costosi da elaborare, consentendo l'ottimizzazione delle query lente o costose.
Volume delle tracce e monitoraggio dello stato di salute
Figura 7: Grafico che mostra la visualizzazione delle tracce del progetto che traccia i tassi di successo e di errore nel tempo.
Lo stato di salute dell'applicazione viene mostrato attraverso le tendenze del volume delle tracce e i rapporti successo/errore nel tempo. Sono disponibili diverse viste per analizzare le chiamate LLM, le tendenze dei costi, le invocazioni degli strumenti o i punteggi di feedback. Problemi come picchi di errore o aumenti dei costi diventano visibili, indicando problematiche da indagare.
Confronto tra modelli e configurazioni
Figura 8: Vista di confronto degli esperimenti che mostra le metriche di performance tra esecuzioni di test multiple.
Diversi modelli possono essere confrontati fianco a fianco sullo stesso dataset di test. I compromessi tra accuratezza, latenza (P50/P99) ed efficienza dei token sono visualizzati graficamente. Identificare quale configurazione soddisfa al meglio i requisiti, che si tratti di massimizzare l'accuratezza o ridurre al minimo costi e tempi di risposta, è semplice attraverso questi confronti.
Langfuse
Langfuse è una piattaforma di osservabilità LLM open-source progettata per il monitoraggio, il debug e la valutazione delle applicazioni di modelli linguistici. Disponibile sia come soluzione auto-ospitata che cloud, Langfuse offre un tracciamento completo con acquisizione automatica di prompt, output, costi e latenza.
La piattaforma supporta qualsiasi LLM framework tramite il suo SDK flessibile e offre funzionalità di valutazione integrate, incluso LLM-as-a-judge per la valutazione automatizzata della qualità. Langfuse tiene traccia delle versioni dei prompt tra le esecuzioni, consentendo il confronto delle metriche di performance tra formulazioni diverse.
La raccolta del feedback degli utenti tramite valutazioni pollice su/giù aiuta a identificare output di alta e bassa qualità, mentre il punteggio personalizzato consente di tracciare metriche specifiche dell'applicazione. Le valutazioni automatizzate possono elaborare migliaia di tracce a tassi di campionamento configurabili, consentendo un monitoraggio continuo della qualità su larga scala senza revisione manuale di ogni output.
Langfuse è stata acquisita da ClickHouse e ora opera come parte di ClickHouse, rimanendo open-source.1
Vista dettagliata della traccia
Figura 10: Log delle tracce che mostrano i dettagli delle chiamate API con dati di performance e costi.
Le singole tracce visualizzano i dettagli completi dell'esecuzione per ogni chiamata LLM. La vista della traccia mostra le misurazioni esatte della latenza, il consumo di token (token di prompt e di completamento separatamente) e i costi calcolati per richiesta.
La configurazione del modello viene preservata, inclusi temperatura, max_tokens e altri parametri. La sezione Anteprima mostra il prompt completo inviato al modello insieme alla risposta completa, consentendo di comprendere esattamente ciò che il modello ha ricevuto e generato.
Questa visibilità granulare consente il debug di errori specifici esaminando la coppia esatta input-output che ha causato un errore.
Tabella panoramica delle tracce
Figura 11: Ispezione della singola traccia che mostra i dettagli della richiesta e la risposta del modello.
Tutte le tracce sono aggregate in una tabella filtrabile che mostra output, livelli di osservazione, latenza, utilizzo dei token e costi totali. Ogni riga rappresenta una singola chiamata LLM con livelli di osservazione codificati a colori che indicano la gerarchia o l'importanza della traccia. I conteggi dei token mostrano sia i token di prompt che di completamento, insieme ai totali, mentre i calcoli dei costi vengono eseguiti automaticamente in base al modello utilizzato.
Il selettore Colonne consente la personalizzazione delle metriche visualizzate e i filtri permettono di restringere le tracce per ambiente, intervallo di tempo o altri criteri. Questa vista tabellare semplifica l'identificazione di pattern come query costantemente lente o richieste inaspettatamente costose.
Braintrust
Braintrust è una piattaforma di osservabilità LLM che combina valutazione e monitoraggio in produzione. La piattaforma consente di testare modelli su dataset, confrontare diversi prompt o configurazioni e tenere traccia delle metriche di qualità tramite punteggio automatico. Le funzioni di valutazione integrate e personalizzate misurano accuratezza, pertinenza o criteri specifici del dominio, con risultati visualizzati in tabelle di confronto che mostrano le differenze di performance tra le versioni.
Per il monitoraggio in produzione, Braintrust traccia metriche in tempo reale tra cui latenza, costo e punteggi di qualità personalizzati mentre il traffico fluisce attraverso le applicazioni. Gli avvisi scattano quando le soglie di qualità vengono superate o le barriere di sicurezza vengono violate. Brainstore, il sistema di archiviazione dei log della piattaforma, acquisisce i log delle applicazioni su larga scala con ricerca ottimizzata per le interazioni IA. La dashboard visualizza metriche aggregate tra esperimenti ed esecuzioni in produzione, catturando il monitoraggio dei costi, l'utilizzo dei token e i metadati delle risposte sia per le richieste di valutazione che di produzione.
Helicone
Helicone è una piattaforma di osservabilità basata su proxy che monitora le applicazioni LLM instradando le richieste API attraverso il suo server proxy. L'integrazione richiede solo la modifica dell'URL di base senza installazione di SDK o modifiche al codice. La piattaforma acquisisce automaticamente richieste, risposte, costi e utilizzo dei token per monitorare il comportamento dell'applicazione.
La dashboard visualizza i volumi totali delle richieste, i costi aggregati e il consumo di token in tutte le chiamate API. I log delle richieste mostrano i prompt di input completi e gli output del modello, consentendo l'indagine su previsioni o errori specifici. Il monitoraggio dei costi suddivide la spesa per tipo di modello, utente o tag personalizzati per identificare le operazioni costose. La cache integrata rileva richieste duplicate e fornisce risposte memorizzate nella cache, riducendo sia i costi API che i tempi di risposta. La limitazione della velocità impone limiti di utilizzo per utente o endpoint per prevenire picchi di spesa imprevisti.
La piattaforma si concentra sul monitoraggio delle singole chiamate API – ogni richiesta appare come una voce di log separata senza supporto integrato per raggruppare chiamate correlate o visualizzare sequenze. Ciò rende Helicone pratico per applicazioni come chiamate LLM indipendenti (ad esempio, chatbot a turno singolo), generazione batch di contenuti o attività di classificazione, ma meno adatto per tracciare flussi di lavoro multi-step in cui è importante comprendere le relazioni tra chiamate sequenziali.
Comet Opik
Opik è una piattaforma open-source di osservabilità e valutazione LLM di Comet, un fornitore affermato di MLOps e tracciamento degli esperimenti.2 Le sue funzionalità principali includono:
- Tracciamento: acquisisce le chiamate LLM, i passaggi dell'agente e le invocazioni degli strumenti per una visibilità end-to-end sul comportamento dell'applicazione
- Valutazione: fornisce metriche integrate e valutatori LLM-as-a-judge per assegnare punteggi agli output come allucinazioni, pertinenza e moderazione
- Integrazione con Comet: collega le tracce LLM con la piattaforma di tracciamento degli esperimenti di Comet, consentendo ai team di unificare i metadati ML tradizionali e l'osservabilità LLM in un unico luogo3
Arize Phoenix
Arize Phoenix è una piattaforma open-source per lo sviluppo, l'osservabilità e la valutazione delle applicazioni IA, costruita da Arize IA e dalla comunità open-source.4 È costruita su OpenTelemetry e basata sulla strumentazione OpenInference, in modo che le tracce funzionino con gli strumenti esistenti senza un formato proprietario. Le sue funzionalità principali includono:
- Tracciamento: acquisisce ogni passaggio eseguito da un agente, inclusi prompt, recupero, chiamate agli strumenti e output, offrendo visibilità end-to-end sulle esecuzioni dell'agente
- Valutazione: fornisce un framework di valutazione che assegna punteggi agli output e aiuta a rilevare le regressioni prima che raggiungano gli utenti, con supporto sia per la revisione umana che per l'approccio LLM-as-a-judge
- Ingegneria dei prompt e iterazione: include un IDE per i prompt per testare modifiche ai prompt e all'harness utilizzando esempi di produzione reali
- Dataset ed esperimenti: consente ai team di creare dataset dalle tracce ed eseguire esperimenti che confrontano le modifiche sugli stessi input per misurare se la qualità migliora effettivamente
- Annotazioni: supporta l'etichettatura di tracce e span per segnalare ciò che ha funzionato e ciò che si è rotto durante la revisione
- Opzioni di deployment: può essere eseguito localmente, tramite Docker, su Kubernetes con Helm o come Phoenix Cloud, con due istanze Phoenix Cloud gratuite disponibili
- Open source e auto-ospitabile: con licenza ELv2, oltre 10.000 stelle su GitHub e 2,5 milioni di download al mese, con tracce archiviate nell'ambiente dell'utente quando auto-ospitato
Piattaforme di monitoraggio che si estendono all'osservabilità LLM
I fornitori consolidati di monitoraggio delle prestazioni delle applicazioni (APM) stanno estendendo le loro piattaforme per coprire i carichi di lavoro LLM.
Datadog
Il prodotto di osservabilità Datadog’s LLM è generalmente disponibile e traccia ogni fase di una pipeline LLM, inclusi prompt, risposte del modello, fasi di recupero e chiamate agli strumenti. Tiene traccia della latenza e dell'utilizzo dei token in queste fasi ed esegue valutazioni integrate sugli output, inclusi controlli per allucinazioni, injection di prompt, tossicità ed esposizione di dati sensibili.5 6
IBM Instana
IBM Instana elenca l'osservabilità GenAI come parte della sua piattaforma di monitoraggio full-stack di applicazioni e infrastrutture, posizionata insieme alle sue capacità di indagine sugli incidenti agentic-IA.7
OpenObserve
OpenObserve ha introdotto Observability 3.0, una piattaforma nativa IA che combina log, metriche, tracce e monitoraggio degli utenti reali con l'osservabilità LLM in un unico strumento. Il suo agente IA SRE correla gli avvisi in incidenti e identifica automaticamente le cause principali, mentre un Assistente IA converte il linguaggio naturale in query SQL e PromQL, riassume i modelli di log e genera dashboard e avvisi da descrizioni in linguaggio semplice. Anomaly rilevamento è offerto come tipo di avviso integrato insieme alle opzioni di soglia e composito.8
Honeycomb
Honeycomb, una piattaforma di osservabilità, ha aggiunto funzionalità specifiche per IA e LLM al suo prodotto. La sua Timeline dell'Agente rivela le relazioni tra input dell'utente, interazioni LLM, chiamate agli strumenti e invocazioni dell'agente, mentre BubbleUp, uno strumento di rilevamento delle anomalie basato su machine learning, fa emergere le anomalie combinando metriche, tracce e log. La piattaforma supporta anche il monitoraggio dell'utilizzo dei token e un Assistente alle Query in linguaggio naturale per analizzare il comportamento del sistema.9
New Relic
New Relic ha introdotto Agentic IA Monitoring, aggiungendo funzionalità incentrate sugli agenti alla sua piattaforma di osservabilità. Fornisce una mappa dei servizi delle interazioni tra agenti, metriche di performance come volume di richieste, latenza media e percentuali di errore, e drill-down a livello di traccia nelle singole chiamate di agenti e strumenti.10
Cos'è l'osservabilità LLM?
L'osservabilità LLM è la pratica di raccogliere e interpretare dati continui dai modelli linguistici di grandi dimensioni per comprendere come si comportano durante l'uso nel mondo reale. Si concentra sulla raccolta di metriche, tracce e log che mostrano come gli LLM rispondono a diversi prompt, strumenti e chiamate API esterne.
Poiché i modelli linguistici operano tramite ragionamento probabilistico, i loro processi interni non possono essere ispezionati direttamente. Ciò rende il monitoraggio LLM dipendente dalla revisione degli output LLM, degli input LLM e dei passaggi intermedi che compaiono nei flussi di lavoro agentici. Studiando queste tracce, gli sviluppatori LLM ottengono visibilità sulle prestazioni del sistema, sul comportamento del modello e sui modelli di utilizzo che influenzano le prestazioni dell'applicazione e la qualità dell'output.
L'osservabilità LLM è fondamentale per diversi motivi:
- Garanzia di qualità: I modelli linguistici di grandi dimensioni possono produrre output errati o di bassa qualità per una vasta gamma di motivi, inclusi prompt poco chiari, dati in deriva o comportamento imprevisto dell'utente. Il monitoraggio dei prompt e delle risposte nel tempo aiuta a tenere traccia delle metriche di valutazione come correttezza, coerenza, pertinenza e veridicità. Ciò consente ai team di rilevare quando gli output LLM iniziano a diminuire nella qualità della risposta o quando il modello inizia a generare allucinazioni. Man mano che l'uso degli LLM si espande nei flussi di lavoro aziendali, garantire un'accuratezza costante diventa una sfida comune.
- Risoluzione dei problemi: Quando si verificano problemi all'interno delle applicazioni LLM, le cause principali possono provenire da molte aree. Esempi includono prompt mal calibrati, fine-tuning difettoso, chiamate API esterne fallite o errori logici all'interno di flussi di lavoro agentici multi-step. Raccogliendo tracce LLM che mostrano i passaggi intermedi, gli sviluppatori possono eseguire un'analisi delle cause principali in modo efficiente e individuare la fase esatta in cui il comportamento ha deviato. Ciò riduce la necessità di intervento umano e accorcia i tempi di tracciamento degli errori.
- Ottimizzazione: Il monitoraggio delle prestazioni del sistema, dell'utilizzo delle risorse e dell'utilizzo dei token aiuta le organizzazioni a identificare i colli di bottiglia e a migliorare le prestazioni LLM. I team possono misurare latenza, throughput, utilizzo della memoria e tassi di errore per comprendere come si comportano gli LLM sotto carichi di lavoro variabili. Possono anche monitorare i token per controllare i costi e rivedere i modelli di utilizzo per migliorare le prestazioni e l'efficienza dei costi. Il monitoraggio continuo di queste metriche chiave è particolarmente prezioso nei flussi di lavoro di retrieval-augmented generation e agentici, dove i colli di bottiglia delle prestazioni spesso emergono da chiamate inefficienti agli strumenti o andate e ritorni non necessari durante il ragionamento.
Categorie principali di metriche
Gli strumenti di osservabilità LLM in genere raggruppano le metriche rilevanti in tre categorie che supportano sia i team di sviluppo software che i team operativi.
Metriche di performance del sistema
- Latenza: Misura il tempo tra la ricezione di un prompt e la consegna di una risposta.
- Throughput: Indica quante richieste il modello può elaborare in un determinato periodo.
- Tassi di errore: Rivelano con quale frequenza il sistema restituisce risposte non valide o fallite.
Metriche di utilizzo delle risorse
- CPU e GPU consumo: Aiutano a capire come il sistema utilizza l'hardware in modo efficiente.
- Utilizzo della memoria: Influisce sulle decisioni di scalabilità e sulla pianificazione della capacità.
- Utilizzo dei token: Influenza l'efficienza dei costi e aiuta i team a controllare le spese durante un uso intensivo di LLM.
- Compromessi throughput-latenza: Mostrano come il sistema bilancia velocità e volume di elaborazione.
Metriche di comportamento del modello
- Correttezza, veridicità e qualità della risposta: Per identificare output di bassa qualità.
- Coinvolgimento e feedback degli utenti: Forniscono indicazioni su quanto bene il modello soddisfi le esigenze degli utenti.
- Metriche di fedeltà e ancoraggio: Riflettono quanto il modello aderisca al materiale di origine.
Osservabilità manuale vs. autonoma
Affidarsi all'osservazione manuale presenta diverse sfide. I modelli linguistici di grandi dimensioni generano elevati volumi di dati e le catene di ragionamento multi-step producono numerosi log e tracce. La necessità di monitoraggio in tempo reale aumenta la complessità operativa e anche i team esperti faticano a rivedere ogni chiamata LLM senza perdere segnali essenziali. I flussi di lavoro manuali rendono inoltre difficile tenere il passo con i continui cambiamenti nel comportamento degli utenti e le variazioni dei prompt.
I sistemi di osservabilità autonoma affrontano queste sfide utilizzando agenti software che analizzano continuamente l'attività LLM. Questi agenti rilevano anomalie, diagnosticano problemi ed eseguono analisi delle cause principali senza un costante intervento umano. Le valutazioni automatizzate aiutano anche a identificare comportamenti rischiosi, come l'iniezione di prompt.
Un sistema di questo tipo supporta il monitoraggio continuo e garantisce un tracciamento coerente delle metriche di valutazione sull'intero modello. Di conseguenza, le organizzazioni beneficiano di una risoluzione dei problemi più rapida, migliori prestazioni delle applicazioni e un migliore controllo sui rischi operativi.
Cosa cercare negli strumenti di osservabilità LLM
Valutazioni di qualità e sicurezza
- Rilevamento delle allucinazioni per identificare quando il modello si discosta da dati affidabili.
- Rilevamento di injection di prompt e jailbreak per affrontare problemi di sicurezza.
- Punteggio di tossicità e valutazioni di sicurezza che supportano la conformità e la riduzione dei rischi.
- Clustering che raggruppa output LLM simili per identificare la deriva nel tempo.
Funzionalità di sperimentazione
- Test A/B per la gestione dei prompt e le modifiche alla configurazione.
- Confronto rapido tra più modelli LLM o parametri.
- Valutazione di accuratezza, consumo di token e latenza prima del deployment.
- Test delle modifiche al modello rispetto a scenari reali utilizzando dati simili a quelli di produzione.
Correlazione con l'infrastruttura
- Collegamento delle tracce LLM ai dati di monitoraggio delle prestazioni delle applicazioni backend.
- Collegamento del tempo di risposta e della qualità della risposta alle sessioni utente reali.
- Identificazione di come le prestazioni del sistema influenzano le prestazioni LLM e la stabilità dell'applicazione.
Per i deployment LLM on-premises, questa correlazione spesso si estende alla telemetria a livello di GPU. OpenLIT, uno strumento di osservabilità nativo OpenTelemetry per applicazioni GenAI e LLM, include il monitoraggio GPU integrato con supporto per hardware NVIDIA e AMD Radeon, acquisendo metriche come utilizzo, utilizzo della memoria, temperatura e consumo energetico durante l'inferenza.
Correlare queste metriche con il throughput del modello consente agli operatori di identificare quando i limiti di potenza o termici stanno degradando le prestazioni di inferenza e aiuta a regolare le impostazioni hardware per sostenere carichi di lavoro IA affidabili.11 12
LLMOps e governance
- Guardrail che filtrano prompt non sicuri e bloccano risposte dannose.
- Dashboard per il monitoraggio dell'esposizione di PII, delle allucinazioni e delle violazioni della sicurezza.
- Strumenti che supportano conformità, reporting e analisi degli incidenti di sicurezza.
Diversi prodotti sono costruiti specificamente attorno a queste esigenze di governance e conformità:
Databricks Unity IA Gateway è un livello di controllo centrale per agenti, endpoint LLM e server Model Context Protocol (MCP). Le sue funzionalità includono:
- Controlli di accesso e policy: configura i permessi e applica i guardrail tra gli endpoint
- Gestione della capacità: gestisce la capacità tra i fornitori e limita la velocità degli endpoint
- Registrazione dei payload: registra i payload di richiesta e risposta per l'audit
- Monitoraggio dell'utilizzo e dei costi: tiene traccia dell'utilizzo e dei costi tramite tabelle di sistema
- MCP server governance: governa i server MCP attraverso i permessi di Unity Catalog13 14
Openlayer è una piattaforma di governance e osservabilità IA rivolta ai settori regolamentati. Le sue funzionalità includono:
- Test pre-deployment: test strutturati su allucinazioni, pregiudizi, tossicità e robustezza
- Osservabilità in tempo reale: monitoraggio e tracciamento per chiamate LLM, pipeline di recupero e agenti multi-step
- Guardrail: protezione contro l'iniezione di prompt e la perdita di PII
- Supporto alla conformità: mappatura automatizzata della conformità con acquisizione continua delle prove e reporting pronto per l'audit, allineato a framework come l'EU IA Act e ISO/IEC 4200115
OpenTelemetry come standard emergente
OpenTelemetry è un framework open source e indipendente dal fornitore per la raccolta di tracce, metriche e log dai sistemi software. È importante per l'osservabilità LLM perché le applicazioni IA combinano molte parti mobili come modelli, database vettoriali, strumenti e framework per agenti, e senza uno standard condiviso ogni componente emette dati nel proprio formato, il che rende difficile il debug end-to-end e vincola i team al fornitore di monitoraggio per cui hanno effettuato la strumentazione iniziale.
Le convenzioni semantiche GenAI di OpenTelemetry definiscono uno schema comune per le chiamate ai modelli, l'utilizzo dei token, le invocazioni degli strumenti e i flussi di lavoro degli agenti, in modo che le tracce provenienti da librerie diverse possano essere acquisite e analizzate in modo coerente.16
La maggior parte delle principali piattaforme di osservabilità LLM, tra cui Arize Phoenix, Langfuse e Honeycomb, acquisiscono i dati OpenTelemetry in modo nativo, il che consente ai team di strumentare le proprie applicazioni una volta sola e di cambiare backend in seguito senza riscrivere il codice di tracciamento.17
Osservabilità dei flussi di lavoro multi-agente
Man mano che gli LLM alimentano flussi di lavoro di agenti multi-step, i requisiti di osservabilità si espandono oltre le singole coppie richiesta-risposta. Le applicazioni agentiche introducono ulteriori livelli di complessità che richiedono approcci di tracciamento dedicati.
Dimensioni chiave di osservabilità per gli agenti:
- Tracce di pianificazione e ragionamento: Visibilità su come l'agente scompone i compiti, seleziona le azioni e perfeziona il suo approccio in base ai risultati intermedi
- Monitoraggio delle chiamate agli strumenti: Tracciamento delle chiamate API esterne, delle query al database e delle esecuzioni di funzioni per identificare colli di bottiglia di latenza o errori
- Tracciamento degli handoff: Per sistemi multi-agente, monitoraggio di come i compiti vengono trasferiti tra agenti e se il contesto viene preservato correttamente
- Evoluzione dello stato: Comprensione di come la memoria e il contesto cambiano in più turni all'interno di una sessione
Insieme, queste dimensioni costituiscono la base del monitoraggio agentico. Strumenti di osservabilità LLM come Langsmith, Langfuse, AgentOps e Weights & Biases forniscono viste di tracciamento specifiche per gli agenti che visualizzano grafici di esecuzione completi.
Oltre a questi strumenti generici, alcuni prodotti si concentrano specificamente sull'affidabilità degli agenti. Un esempio è Omium, che si posiziona come un prodotto di osservabilità e affidabilità progettato appositamente per gli agenti IA in produzione.18
Le sue funzionalità principali includono:
- Span strutturati: Acquisisce span per ogni chiamata LLM, utilizzo di strumenti e decisione dell'agente
- Tracciamento multi-agente: Unisce le chiamate tra agenti in un'unica traccia unificata per la diagnostica in tempo reale
- Classificazione degli errori: Etichetta automaticamente gli errori in categorie come allucinazione, loop infinito, errore dello strumento e perdita di contesto
- Recupero dei checkpoint: Cattura lo stato dell'agente a ogni chiamata dello strumento e risposta LLM, consentendo ai flussi di lavoro di riprendere da qualsiasi checkpoint invece di ripartire da zero
- Supporto framework: SDK per TypeScript, Python e Go, con rilevamento auto per LangChain, LangGraph, OpenAI e Anthropic
FAQ
Un'osservabilità efficace degli agenti cattura l'intera traccia di esecuzione, dalla richiesta iniziale alle chiamate agli strumenti e alla risposta finale. Ciò include come un modello riceve una richiesta, seleziona gli strumenti, recupera i dati da una fonte dati e genera una risposta finale. L'osservabilità è importante perché le applicazioni LLM continuano a crescere in complessità e il numero di app basate su LLM che si basano sul ragionamento multi-step aumenta notevolmente. Di conseguenza, le organizzazioni hanno bisogno di strumenti di osservabilità che forniscano monitoraggio in tempo reale e valutazione automatizzata per garantire prestazioni coerenti in tutte le app LLM.
I moderni strumenti di osservabilità LLM mirano a fornire una panoramica dettagliata di ogni azione all'interno delle app basate su LLM. Ciò include il tracciamento di ogni chiamata LLM, ogni interazione con gli strumenti e ogni passaggio intermedio che appare in una catena di ragionamento agentico. La capacità di osservare l'intero flusso di lavoro dal prompt alla risposta finale aiuta i team a rilevare comportamenti imprevisti e a comprendere come i modelli LLM prendono decisioni.
Anche l'analisi dei costi e dei token è diventata essenziale. Il monitoraggio in tempo reale dell'utilizzo dei token aiuta le organizzazioni a mantenere l'efficienza dei costi ed evitare picchi di spesa imprevisti. I team possono suddividere l'utilizzo dei token per fornitore, modello, funzionalità o percorso applicativo per comprendere come i diversi componenti contribuiscono ai costi. Alcuni strumenti di osservabilità consentono di confrontare più fornitori LLM fianco a fianco, aiutando nelle decisioni di performance ed efficienza dei costi quando si instradano le richieste tra LLM open-source e opzioni proprietarie.
In tutto l'ecosistema, gli strumenti di osservabilità inquadrano costantemente l'osservabilità LLM come un requisito per gestire le applicazioni LLM su larga scala. I team che si affidano a flussi di lavoro di agenti hanno bisogno di visibilità su come il modello si muove attraverso il ragionamento multi-step e su come ogni decisione influisce sulle prestazioni del modello. L'osservabilità aiuta a garantire risposte di alta qualità costanti, a rilevare tempestivamente i guasti e a mantenere la fiducia degli utenti.
Un altro tema è la necessità di gestire i costi operativi. Il monitoraggio dell'utilizzo dei token, della memoria e delle metriche di utilizzo delle risorse aiuta le organizzazioni a controllare la spesa mantenendo prestazioni ed efficienza dei costi. L'osservabilità rivela anche i colli di bottiglia delle prestazioni che influenzano la soddisfazione degli utenti e le prestazioni dell'applicazione.
Infine, l'osservabilità LLM è importante perché le organizzazioni fanno sempre più affidamento sui modelli LLM per funzioni critiche. Con l'espansione di questi sistemi, gli strumenti di monitoraggio devono essere agnostici rispetto al framework, in grado di integrarsi con piattaforme open-source e capaci di fornire approfondimenti su più servizi. Ciò supporta un deployment sicuro, riduce i problemi di sicurezza e aiuta i team a comprendere gli output del modello in un contesto operativo più ampio.
Cita questa ricerca
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{ermut2026,
author = {Ermut, Sıla and Şipi, Nazlı},
title = {{LLM Strumenti di osservabilità: Weights & Biases, Langsmith}},
year = {2026},
month = jun,
howpublished = {\url{https://aimultiple.com/llm-observability}},
note = {AIMultiple. Consultato il 9 Giugno 2026}
}








Sii il primo a commentare
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.