Abbiamo testato 16 modelli sulla progettazione di un benchmark in text-to-SQL e tool calling. Ogni modello ha creato un benchmark per argomento, per un totale di 32 proposte. Nessuna proposta ha superato ogni criterio della rubrica. Gli agenti sono riusciti a creare ed eseguire test, ma nessuno ha dimostrato sia un test con risposta vuota sia un test con risposta corretta del proprio scorer.
Punteggi della progettazione del benchmark
Text-to-SQL trasforma una domanda in linguaggio naturale in una query di database. Il tool calling seleziona una funzione e ne compila gli argomenti.
Abbiamo valutato ogni proposta in base a una rubrica che gli agenti non hanno visto. La rubrica text-to-SQL vale 78 punti e quella del tool calling ne vale 74. I punteggi mostrano la percentuale di punti applicabili della rubrica. Le etichette delle barre sono arrotondate ai numeri interi.
- Text-to-SQL: Claude Opus 5 e Grok 4.6 si equivalgono con il 78,2%. Quando ricampioniamo i criteri della rubrica, il 95% centrale dei loro ranghi si colloca tra il 1st e il 5.
- Tool calling: GPT 5.6 Sol guida con il 74,3%. Il 95% centrale dei suoi ranghi ricampionati si colloca tra il 1st e il 4. Gli intervalli dei ranghi derivano dal ricampionamento dei criteri della rubrica.
Tra i 16 modelli, i punteggi dei due argomenti sono correlati a 0.42 (Pearson). Il punteggio medio combina due rubriche con criteri diversi, quindi non è un confronto omogeneo.
Controlli di qualità mancanti
Nessuna proposta ha superato questi quattro controlli:
- Test con risposta vuota: Le risposte vuote passano attraverso lo scorer. Uno scorer funzionante dovrebbe assegnare un punteggio vicino allo zero.
- Test con risposta corretta: Le risposte di riferimento passano attraverso tutte le fasi di estrazione e valutazione. Uno scorer funzionante dovrebbe assegnare il punteggio pieno.
- Test con riferimento mancante: I casi vengono ripetuti senza lo schema del database o le definizioni degli strumenti.
- Obiettivo di difficoltà: Il modello più forte dovrebbe ottenere tra il 40% e il 60%. Ha ottenuto un punteggio superiore al 60% in 30 proposte su 32.
Altre venti proposte non hanno raggiunto il divario richiesto di almeno 20 punti tra il modello più forte e quello più debole.
- Calibrazione: Due proposte hanno superato il controllo di calibrazione: GLM 5.3 in text-to-SQL e Claude Opus 5 nel tool calling. Per superarlo, una proposta doveva conservare le revisioni e spiegarle dopo aver mancato l'obiettivo di difficoltà.
- Previsioni: Sei proposte su 32 hanno superato il controllo delle previsioni. Per superarlo era necessario indicare i modelli migliori e peggiori e collocare almeno due dei quattro punteggi all'interno degli intervalli previsti. Ogni agente ha anche previsto l'intervallo di punteggio e il rango di un quinto modello tenuto fuori. Due proposte hanno azzeccato entrambi: Gemini 3.8 Flash e Grok 4.6, entrambe in text-to-SQL.
- Affermazioni non supportate: Ventidue rapporti su 32 non hanno superato il controllo del panel di giudici per le affermazioni prive di prove a supporto.
Costo e tempo
I dati sui costi coprono 16 modelli e quelli sui tempi trascorsi coprono 15. Il grafico utilizza i 15 con entrambi i dati, escludendo Grok 4.6 perché la sua durata non è stata registrata.
I costi riguardano l'inferenza dell'agente autore per argomento, inclusi i tentativi registrati. Escludono le chiamate API effettuate dai programmi benchmark generati, quindi sottostimano il costo completo di creazione ed esecuzione di un benchmark.
Le esecuzioni utilizzano programmi agente diversi e includono tentativi di sostituzione. I dati non possono mostrare se una maggiore spesa o esecuzioni più lunghe portino a punteggi più alti.
Gli intervalli di punteggio ottenuti ricampionando i criteri della rubrica sono in media larghi 32.7 punti. Escludono la variazione che ripetute esecuzioni di creazione aggiungerebbero.
Cosa hanno fatto bene i modelli
Ogni riga di risultato nelle 32 proposte principali rimanda a una risposta salvata del modello. Rieseguendo lo scorer di ciascuna proposta su quelle risposte salvate si è riprodotta la relativa tabella dei risultati. La valutazione è ripetibile, ma la riproduzione non autentica le risposte salvate.
Abbiamo eliminato e corrotto separatamente alcuni file di risposta campionati. Tutti i 32 scorer hanno modificato il proprio output e hanno distinto una risposta eliminata da una corrotta. Il test non verifica ogni regola di valutazione.
Ventidue rapporti su 32 non hanno superato il controllo del panel per le affermazioni non supportate.
Cosa significano i risultati per l'IT agentico
Nelle operazioni IT, un agente IA legge lo stato di un sistema e agisce su di esso, ad esempio installando una patch o riavviando un servizio. Un controllo separato deve poi confermare che l'azione abbia funzionato. I test di controllo dello scorer in questo benchmark svolgono lo stesso ruolo per la valutazione: confermano che lo scorer funzioni prima che i suoi risultati vengano utilizzati. Nessuna delle 32 proposte principali ha superato questi test.
Questo benchmark riguarda text-to-SQL e tool calling. Non è un test di patching, smistamento dei ticket o altre attività IT.
Testiamo separatamente gli strumenti di gestione IT, su sistemi live. Risultati selezionati:
Piattaforme IT agentiche
I 16 modelli in questo benchmark sono LLMs. Le piattaforme descritte di seguito non lo sono. Si collocano al di sopra di tali modelli e aggiungono dati IT, flussi di lavoro e controlli.
Un sistema agentico decide il passo successivo in base allo stato che osserva, mentre l'automazione basata su regole segue passi stabiliti in anticipo. I prodotti IT combinano le due cose, quindi ogni voce di seguito indica quale parte è quale.
Creatio
Creatio esegue agenti IA all'interno di una piattaforma CRM e di workflow, così un agente agisce sui record dell'azienda piuttosto che su una trascrizione di chat.
Modelli: OpenAI, Azure OpenAI, o qualsiasi provider supportato dalla libreria LiteLLM, inclusi i modelli sui server dell'azienda. Ogni agente può usarne uno diverso.
I team creano i propri agenti: Un agente viene definito nell'interfaccia, non nel codice: le sue istruzioni, poi cosa non deve fare, quali dati non può raggiungere, quali competenze può chiamare e quali azioni può compiere su un record.
Gli agenti di coding creano le app: Claude Code, Codex e GitHub Copilot si collegano alla piattaforma tramite un plugin, competenze degli agenti e MCP strumenti, e possono creare modelli dati, pagine, regole di business e dati di test.
ServiceNow
ServiceNow è una piattaforma di gestione dei servizi IT (ITSM).
Modelli: L'orchestrazione degli agenti può essere eseguita su Azure OpenAI, Claude su AWS, Google Gemini o Now LLM, il modello proprio di ServiceNow.
Conferma prima dell'azione: Gli agenti ITSM possono essere avviati manualmente dal pannello Now Assist oppure essere eseguiti automaticamente quando un record viene creato o aggiornato. Gli amministratori decidono quali azioni richiedono la conferma di una persona.
NinjaOne
NinjaOne è una piattaforma di gestione degli endpoint che copre monitoraggio, patching, backup e accesso remoto.
Modelli: NinjaOne non documenta una scelta di modello per le sue funzionalità IA. Queste vengono eseguite come parte della piattaforma, a differenza delle opzioni sopra, dove un amministratore sceglie il provider.
Rischio delle patch valutato in base ai report della community: Patch Intelligence IA esamina la telemetria dei vendor e i report pubblici di altri amministratori sugli aggiornamenti di Windows, poi segnala gli aggiornamenti che hanno rotto i sistemi altrove e sintetizza il contesto. Le altre piattaforme in questa sezione leggono i record dell'azienda stessa; questa funzione legge ciò che è accaduto in altre aziende.
Rilevamento delle CVE senza scansione: Il modulo di vulnerabilità identifica le CVE dalla telemetria del software analizzata nel cloud di NinjaOne, quindi nessuna scansione viene eseguita sull'endpoint e i risultati passano al modulo di patching per la correzione.
Metodologia
Il compito
Per ogni argomento, ogni modello ha ricevuto lo stesso prompt fisso. Il prompt chiedeva all'agente di:
- scegliere un argomento aziendale,
- scrivere almeno 24 casi di test suddivisi in quattro categorie,
- scrivere un runner (il programma che invia i casi ai modelli) e uno scorer (il programma che valuta le risposte),
- eseguire quattro modelli indicati due volte su ciascun caso.
Un quinto modello è stato tenuto fuori. L'agente ne ha previsto prima i risultati e poi lo ha testato.
Il prompt chiedeva a ciascun agente di decidere quali standard di qualità deve avere un benchmark prima della pubblicazione e di dimostrare di averli rispettati. Il prompt non indicava l'obiettivo numerico di difficoltà né menzionava alcun test dello scorer.
Agenti e proposte
Le proposte sono state eseguite tra luglio e settembre 2026. La maggior parte ha utilizzato opencode, un programma agente che fornisce al modello una shell e un file system.
La versione precedente copriva 14 modelli e 28 proposte. I nostri dati storici includono anche sette modelli più vecchi che non sono più nel roster.
Abbiamo anche eseguito cinque configurazioni pilota per GPT 5.5, ottenendo 10 proposte aggiuntive. I loro prompt differiscono dal compito principale, quindi i grafici le escludono. In totale, questo aggiornamento include 42 proposte e ne valuta 40. Due proposte pilota non soddisfacevano la dimensione minima del dataset, quindi il panel di giudici non le ha valutate.
Valutazione
Il codice controlla i file inviati, ricostruisce i database, riesegue gli scorer e confronta le righe dei risultati con i file di risposta. Un panel di modelli valuta i criteri che richiedono interpretazione. Il codice inviato viene eseguito in una copia isolata senza accesso alla rete.
Escludiamo una riesecuzione dal vivo delle chiamate campionate ai modelli per ogni proposta perché i runner hanno interfacce diverse e alcuni non dispongono di configurazioni di provider utilizzabili. Senza questo criterio, le rubriche totalizzano 78 punti per text-to-SQL e 74 per il tool calling.
Tutte le 32 proposte nei grafici superano i controlli richiesti su file e dimensione del dataset. I prompt del compito non sono stati modificati per questo aggiornamento e i risultati utilizzano una proposta mantenuta per modello e argomento.
Test di controllo dello scorer
Il test con riferimento mancante verifica se i modelli possono rispondere senza le informazioni che dovrebbero essere necessarie. Se ottengono comunque buoni punteggi, le domande potrebbero rivelare la risposta, oppure i modelli potrebbero aver visto i dati durante l'addestramento. Un punteggio elevato da solo non prova né l'una né l'altra possibilità.
Un prompt pilota ha nominato tutti e tre i test dello scorer e quel pilota li ha eseguiti in entrambi gli argomenti. La riesecuzione dei relativi file di test salvati senza accesso alla rete ha riprodotto i numeri registrati.
I prompt per le 32 proposte principali lasciavano questi test all'agente e nessuna di quelle proposte ha superato alcuno dei tre. Un solo prompt nello studio ha nominato i test, quindi il loro effetto tra i modelli resta non testato.
Il panel di giudici
GPT 5.6 Sol e Claude Opus 5 valutano ogni criterio inviato al panel. Quando non sono d'accordo, Grok 4.6 esprime il voto decisivo.
I giudici operano a temperatura 0 (l'impostazione meno casuale), con un elevato sforzo di ragionamento e un limite di 32.000 token. Se un giudice restituisce JSON incompleto o non valido, non viene registrato alcun verdetto e la chiamata viene ritentata.
Su 672 criteri, inclusi i piloti, i due giudici principali sono stati in disaccordo su 195. Sol ha superato il 54,8% e Opus l'82,6%. Grok ha superato 133 dei criteri contestati.
Anche i vendor dei giudici hanno valutato proposte in questo benchmark: quattro da OpenAI, quattro da Anthropic e una da xAI. I prompt dei giudici omettono i nomi degli autori e rimuovono i percorsi dei file che potrebbero identificare un modello. Lo stile di scrittura può comunque rivelare l'autore.
Sulle proposte di vendor diversi da OpenAI e Anthropic, Sol ottiene 13.9 punti in meno di Opus. Sulle proposte di OpenAI, il divario era di 9.1 punti, ovvero 4.8 punti più piccolo. Sulle proposte scritte da Anthropic, il vantaggio di Opus su Sol è di 0.1 punti più piccolo rispetto al lavoro di altri vendor. I prompt pilota differiscono, quindi l'audit non stabilisce favoritismi. Grok giudica solo le controversie, comprese quelle relative alle proprie proposte, e i suoi voti sono esclusi da questo audit.
Intervalli
Gli intervalli di punteggio e il 95% centrale delle posizioni in classifica utilizzano 4.000 estrazioni accoppiate di criteri della rubrica con reimmissione. Ogni proposta viene rivalutata sugli stessi criteri estratti delle altre nel suo argomento. Gli intervalli descrivono la dipendenza dalla rubrica ed escludono l'incertezza dovuta al campionamento del compito e alla variabilità tra esecuzioni. Le correlazioni sono di Pearson.
Cita questo benchmark
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{kalelioglu2026,
author = {Kalelioğlu, Berk and Alper, Şevval},
title = {{IT agentico: gli agenti IA possono progettare un benchmark}},
year = {2026},
month = sep,
howpublished = {\url{https://aimultiple.com/agentic-it}},
note = {AIMultiple. Consultato il 18 settembre 2026}
}Risultati e timestamp di 21 punti dati. Scarica i dati di sintesi mostrati nei grafici e nelle tabelle di questo articolo come file ZIP contenente 2 file CSV e un README.
Vuoi i dati granulari che ci stanno dietro? Passa a Premium
Şevval si concentra su strumenti di programmazione IA, agenti IA e tecnologie quantistiche.
Sii il primo a commentare
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.