Le aziende usano gli LLM ogni giorno per le loro attività regolari. Per trovare gli LLM più convenienti, abbiamo progettato AIM Enterprise, un benchmark aziendale agentico, in cui abbiamo utilizzato 69 attività aziendali reali tra strategia, marketing, HR, vendite e operazioni.
Risultati del benchmark
- Opus 5 ha ottenuto un punteggio più alto in 39 attività e Astra in 30. I primi quattro, con Claude Fable 5.1 e Grok 4.6, si estendono per 2.9 punti.
- Astra ha guidato in 23 attività, Opus 5 in 22 e Fable 5.1 in 16.
- Claude Fable 5.1 ha battuto Claude Fable 5 in 63 delle 69 attività e ha totalizzato in media 7.2 punti in più. GPT 6 Astra ha totalizzato in media 8.8 punti in più rispetto a GPT 5.6 Sol e lo ha battuto in 61.
- Claude Sonnet 5 costa $1,23 per attività. Gemini 3.8 Flash ha totalizzato 1.5 punti in più a $0,61, e Grok 4.6 ha totalizzato 13 punti in più a $1.09.
Costo e punteggio
- GPT 6 Astra e Claude Opus 5 costano all'incirca lo stesso, $1,76 e $1,73 per attività, e distano 1.6 punti.
- GPT 5.6 Luna ha totalizzato 45.2 a $0,016 per attività, 18.7 punti sotto Claude Opus 5 a meno dell'uno per cento del suo costo.
- GPT 5.6 Sol totalizza 53.5 a $0,167 per attività. Grok 4.6 totalizza 7.5 punti in più e costa 6.5 volte tanto.
- Claude Fable 5.1 è il modello più costoso nel grafico a $3,19 per attività e totalizza 1.8 punti in meno di Claude Opus 5, che costa $1.73.
- Tra i 16 modelli presenti nel grafico, il costo per attività e il punteggio hanno una correlazione di 0.68. Il tempo mediano per attività e il punteggio hanno una correlazione di 0.04. Il modello più veloce, Inkling Small a 66 secondi per attività, si classifica ultimo.
Disaccordo dei giudici
Due modelli giudici hanno valutato ogni file che ha superato i controlli. Nel 32,7% dei punteggi individuali i due differivano di più di un quarto della scala e nessuno ha riesaminato quelle righe.
Entrambi i giudici hanno inserito gli stessi quattro setup nelle prime quattro posizioni e gli stessi due in fondo; 12 delle 17 configurazioni si classificano in modo diverso per ciascun giudice.
Ciascun giudice ha messo al primo posto il modello della propria azienda. GPT 5.6 Sol ha classificato GPT 6 Astra al primo posto e Claude Opus 5 al secondo; Opus 5 ha classificato sé stesso al primo posto e Astra al quarto. L'ordine pubblicato combina entrambe le classifiche.
Benchmark AIM Marketing
Lo stesso metodo viene applicato al lavoro di marketing: individuare le offerte che un concorrente pubblica e che AIMultiple non pubblica, creare un elenco di account più adatti e produrre una presentazione commerciale personalizzata. Ogni attività riceve un punteggio da 0 a 100 e il punteggio complessivo è la media delle tre. Un audit della reputazione del sito web si svolge parallelamente e viene riportato su assi propri, poiché non ha un punteggio massimo fisso.
Risultati completi: il benchmark di marketing agentico.
Benchmark AIM IT
Dodici modelli hanno eseguito ciascuno due volte un compito di progettazione di benchmark, inventando un benchmark, costruendolo ed eseguendo quattro modelli al suo interno. Nessuno dei 24 tentativi ha superato tutti i criteri e sei dei controlli della griglia di valutazione non sono stati superati da nessuno di essi. Claude Opus 5 ha guidato nel text-to-SQL con 78.2 e Kimi K3 nelle chiamate di strumenti con 74.3.
Risultati completi: gli LLM possono progettare un benchmark.
Benchmark AIM VC
A tredici modelli presenti nel grafico è stato chiesto di identificare i clienti di un'azienda con prove datate, in tre aziende target. Claude Opus 5 ha ottenuto 89.1 su 100 e Claude Fable 5 85.0, e quei due sono stati gli unici a rimanere sopra 76 in tutti e tre i target valutati. La maggior parte degli altri ha ottenuto il punteggio più basso nel target i cui clienti compaiono nella pubblicità dei podcast piuttosto che nelle pagine indicizzate.
Risultati completi: il benchmark della lista clienti.
Piattaforme aziendali agentiche
Le aziende possono anche usare gli LLM attraverso software aziendali. Le piattaforme seguenti collegano modelli di fornitori come OpenAI, Anthropic e Google a record CRM, flussi di lavoro e agenti predefiniti.
Creatio
Creatio è una piattaforma CRM e di flussi di lavoro con agenti IA predefiniti.
Agenti per reparto: Gli agenti disponibili dipendono dalle app installate da un'azienda. Esempi:
- Agente di vendita: arricchisce i dati degli account, compila i campi delle opportunità dopo le riunioni Zoom e prepara i nuovi incontri.
- Agente di conoscenza: redige articoli per la knowledge base a partire dai casi risolti.
- Agente di segmentazione: trasforma le descrizioni del pubblico in linguaggio naturale in segmenti di marketing.
Un modello separato per ogni agente, inclusi quelli self-hosted: Ogni agente o sotto-agente può usare il proprio modello. Le opzioni supportate sono OpenAI, Azure OpenAI e i provider supportati da LiteLLM, inclusi i modelli sull'infrastruttura aziendale. Gli scenari degli agenti richiedono almeno una finestra di contesto da 40.000 token e la chiamata di funzioni.
Salesforce Agentforce
Agentforce è il livello agentico del CRM di Salesforce.
Modelli: Gli agenti usano modelli abilitati da Salesforce dei partner, tra cui Anthropic, Google e OpenAI. Le aziende possono anche collegare il proprio account LLM e il modello predefinito di un agente può essere modificato.
Einstein Trust Layer: Le chiamate ai modelli passano attraverso un livello che Salesforce dichiara includere rilevamento di tossicità, accordi di zero conservazione dei dati e difesa contro la prompt injection.
Passaggio a una persona: “Trasferimento a un agente umano” è una delle azioni che un agente può scegliere. Ciò consente a una conversazione di passare a una persona quando un processo non può tollerare errori.
Microsoft Copilot Studio
Copilot Studio è lo strumento di Microsoft per creare agenti per Microsoft 365 e Power Platform.
Modelli: I modelli OpenAI sono predefiniti. I creatori possono anche aggiungere modelli esterni di Anthropic, xAI o Mistral.
Etichette di produzione: Microsoft contrassegna alcuni modelli come sperimentali o in anteprima e sconsiglia di usarli in produzione. Gli agenti pubblicati che usano questi modelli vengono comunque fatturati a tariffe standard.
Fallback: Se un amministratore disattiva i modelli Anthropic, gli agenti costruiti su di essi passano automaticamente al modello OpenAI predefinito.
Metodologia
Le 69 attività sono state scritte dal fondatore di AIMultiple sulla base di decisioni aziendali reali e mappate sugli ID dell'APQC Process Classification Framework.1
Coprono strategia (16 attività), marketing (15), HR (7), vendite (6), operazioni (5), IT e finanza (4 ciascuno) e sette aree minori. Ogni attività indica il file che richiede: un results.csv con un elenco fisso di colonne, in genere 10 righe e 8 colonne, con una regola esplicita per ogni campo intero.
Come sono stati eseguiti i modelli
Sedici modelli sono stati eseguiti in 17 configurazioni, dove una configurazione è un modello in esecuzione tramite un programma agente. Otto sono stati eseguiti su opencode 1.15.13 tramite OpenRouter. Gli altri nove hanno usato Claude Code, Codex o Grok Build, i programmi agente dei rispettivi fornitori. Tutti sono stati fatturati tramite abbonamenti.
Fable 5.1 è stato eseguito su Claude Code 2.1.258 mentre le altre tre configurazioni Claude sono state eseguite su 2.1.220; Astra è stato eseguito su Codex 0.153.4 mentre le tre configurazioni GPT 5.6 sono state eseguite su 0.146.0. Gemini 3.8 Flash è stato eseguito sulla stessa build opencode delle altre.
Ogni configurazione ha ricevuto lo stesso prompt congelato, accesso web live tramite un'API di scraping e un limite di un'ora. I prompt non sono mai stati ottimizzati per modello e le griglie di valutazione non hanno mai raggiunto la macchina che ha eseguito le attività.
Nessuno ha scelto un livello di ragionamento. Ogni configurazione è stata eseguita con il valore predefinito del suo programma agente, e i valori predefiniti non sono un unico livello:
Claude Code imposta di default il livello alto su ogni modello che ha eseguito. Codex invia il valore predefinito del catalogo di ciascun modello: basso per GPT 5.6 Sol e medio per Luna, Terra e GPT 6 Astra. Grok Build ha eseguito Grok 4.6 in alto. opencode lascia il livello al provider, quindi le sue otto configurazioni sono state eseguite con il valore predefinito di OpenRouter per ciascun modello.
Un livello di ragionamento predefinito più alto non si è accompagnato a un punteggio più alto. Nel grafico con 16 modelli, i tre modelli il cui livello predefinito è superiore ad alto si classificano 9, 11 e 14: GLM 5.3 a max, Qwen 3.8 Max a xhigh e Kimi K3 a max. Claude Sonnet 5 è stato eseguito sia con una CLI del fornitore sia con opencode e ha ottenuto 47.9 e 47.5.
Ogni dato di costo qui riportato è ricalcolato dall'uso registrato dei token ai prezzi di listino di OpenRouter congelati il 27 agosto 2026. I token di ragionamento sono prezzati come token di output, che è il modo in cui OpenRouter li fattura. GPT 6 Astra e Gemini 3.8 Flash si sono aggiunti in seguito e usano le tariffe di OpenRouter lette il 5 settembre 2026; Claude Fable 5.1 usa le tariffe pubblicate da Anthropic della stessa data, perché OpenRouter non lo elenca.
I costi di Claude Code applicano anche tre regole pubblicate da Anthropic che un listino prezzi piatto non include. La cache dei prompt di un'ora costa il doppio della tariffa di input, mentre una cache di cinque minuti costa 1.25 volte la tariffa di input. La ricerca web costa $10 ogni mille richieste. Il sotto-agente Haiku 4.5 che Claude Code esegue insieme al modello principale è incluso.
I dati di costo riportati dai programmi agente non sono confrontabili. Ogni esecuzione è avvenuta tramite abbonamento, quindi nessuna configurazione ha un costo per singola esecuzione. Quando un programma segnala un costo, prezza i propri token rispetto al proprio listino. opencode utilizza un listino prezzi predefinito. Grok Build usa un listino xAI pari a circa un terzo della tariffa pubblica. Codex non riporta nulla. Claude Code ha prezzato Sonnet 5 a $3 e $15 per milione di token, la tariffa di Claude Sonnet 4.6, mentre Sonnet 5 costa $2 e $10.
Le esecuzioni hanno prodotto 1.140 file su 1.173 coppie configurazione-compito. Un file mancante riceve punteggio zero e non viene rieseguito, a meno che l'esecuzione non abbia raggiunto il limite di un'ora o si sia conclusa con un errore del provider del modello; ogni eccezione consente un nuovo tentativo.
Cinque esecuzioni si sono bloccate e quattro hanno completato al nuovo tentativo. Diciotto esecuzioni si sono concluse con un errore del provider, un 502 o un 504 dall'API oppure una risposta danneggiata. Una aveva già scritto il proprio file; le altre 17 sono state rieseguite e 16 hanno completato. Un'esecuzione ha incontrato sia il limite di tempo sia un errore del provider.
Otto esecuzioni di Qwen 3.8 Max si sono concluse quando il controllo anti-loop di opencode ha impedito al modello di ripetere la stessa chiamata di strumento una terza volta. Nessun'altra configurazione ha attivato il controllo. Quelle esecuzioni non sono state rieseguite e quattro di esse non hanno prodotto alcun file. Ogni file è stato valutato una sola volta, quindi nessun risultato deriva dalla scelta del migliore tra due tentativi.
Come funzionano i controlli e i giudici
I controlli deterministici vengono eseguiti per primi e nessun giudice vede un file che non li supera: insieme di colonne e numero di righe, parsing RFC 4180,2
formattazione degli interi, nessuna cella vuota, nessuna riga duplicata e ordinamento dove il compito lo richiede.
Un file che non supera i controlli riceve zero punti invece di essere scartato. MiniMax M3 ha fallito in 8 dei 64 file consegnati, sei dei quali perché il CSV non era analizzabile, e GPT 5.6 Luna e GPT 5.6 Terra hanno fallito in un caso ciascuno. Rimuovendo ogni compito in cui una qualsiasi configurazione ha ottenuto zero restano 38 compiti e lo stesso leader.
I 1.130 file che hanno superato i controlli sono andati a due giudici: GPT 5.6 Sol tramite la CLI Codex e Claude Opus 5 tramite la CLI Claude Code, entrambi con un livello di ragionamento alto e accesso web live.
Ogni colonna del file viene inviata a un proprio sotto-agente, che vede le risposte di quella colonna da ogni modello e nient'altro, con ID di riga anonimi mescolati separatamente per ciascun giudice. Il giudice classifica quelle risposte l'una contro l'altra e non può considerare uguali due risposte qualsiasi. Le due classifiche vengono poi combinate sommando la posizione di ciascuna risposta sotto ciascun giudice. Ciò ha prodotto 93.490 punteggi.
Con i nomi dei modelli visibili, Sol ha classificato le risposte GPT 8.4 punti percentili sopra il punto in cui le ha classificate Opus, e Opus ha classificato le risposte Anthropic 4.9 punti percentili sopra il punto in cui le ha classificate Sol. Nell'esecuzione anonimizzata alla base di questa classifica, Sol ha classificato GPT 6 Astra al primo posto e Opus ha classificato Claude Opus 5 al primo posto.
Come funziona il punteggio
Il punteggio di un modello è la somma delle medie delle sue colonne, riscalata in modo che il totale massimo possibile sia 100. Tale limite dipende da quanti modelli hanno superato i controlli, ed è per questo che questi punteggi sono confrontabili solo all'interno di questo benchmark e da nessun'altra parte.
Per verificare quanto la classifica dipenda dalla selezione dei compiti, abbiamo ricalcolato la classifica 4.000 volte, ogni volta su una nuova selezione casuale dei 69 compiti. Ciò misura solo la sensibilità ai compiti. Non misura quanto una nuova esecuzione dello stesso compito sposterebbe un punteggio, perché nessun compito è stato valutato due volte.
Il quarto più difficile è composto da 17 compiti, quelli con il punteggio medio più basso in tutte le 17 configurazioni. Cinque compiti sono in parità per gli ultimi quattro posti e Opus 5 ha la media più alta in tutte e cinque le selezioni possibili. Questa regola è stata fissata prima che venisse calcolata la posizione di qualsiasi modello in quei compiti.
Dieci dei 16 modelli compaiono anche nei benchmark precedenti. I loro punteggi non sono confrontabili tra benchmark, perché ciascuno stabilisce la propria scala.
Ogni configurazione qui è valutata in base alla posizione rispetto ai modelli contro cui è stata eseguita, quindi eliminare una configurazione cambia tutti gli altri punteggi. Per lo stesso motivo questi punteggi non sono confrontabili con l'esecuzione precedente di questo benchmark, che ha valutato un campo diverso. Solo l'ordine delle configurazioni può essere confrontato tra le esecuzioni.
Gemini 3.7 Flash è stato eseguito in questo campo ed è stato eliminato quando Gemini 3.8 Flash ha completato, in base alla regola secondo cui un modello esce una volta che il suo successore è stato eseguito. La stessa regola ha ritirato Grok 4.5 e GLM 5.2.
FAQ
Non sulla base di queste evidenze. La scala è relativa, quindi anche il punteggio massimo di 63.9 significa solo che le risposte di un modello si sono classificate sopra le altre, e le righe in cui i due modelli di valutazione sono in sostanziale disaccordo non sono state riesaminate. I fornitori che costruiscono questo tipo di agente sono elencati nella nostra analisi delle aziende di intelligenza artificiale enterprise e AIMultiple automatizza processi come questi.
Sette di loro ottengono un punteggio tra 45.2 e 49.4, più vicini di quanto 69 compiti possano separare. Anche i primi quattro sono entro 2.9 punti l'uno dall'altro. Il benchmark separa i modelli forti da quelli deboli; ricampionare i compiti riordina entrambi i gruppi.
Un modello è stato eseguito con entrambi i programmi in questa esecuzione, e ha ottenuto 47.9 con Claude Code e 47.5 con opencode. Un solo confronto non fornisce una risposta generale. I grafici mostrano il risultato di Claude Code. La configurazione opencode ha letto 4.5 volte più contesto memorizzato in cache e ha prodotto 1.2 volte più token di output, incluso il ragionamento. È costata $1,59 per compito, rispetto a $1,23 per Claude Code, la cui cifra include già un sotto-agente che opencode non esegue.
Cita questo benchmark
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{kalelioglu2026,
author = {Kalelioğlu, Berk},
title = {{AIM Enterprise: benchmark aziendale agentico}},
year = {2026},
month = sep,
howpublished = {\url{https://aimultiple.com/agentic-enterprise}},
note = {AIMultiple. Consultato il 17 settembre 2026}
}Risultati e timestamp di 33 punti dati. Scarica i dati di sintesi mostrati nei grafici e nelle tabelle di questo articolo come file ZIP contenente 2 file CSV e un README.
Vuoi i dati granulari che ci stanno dietro? Passa a Premium
Registro delle modifiche
1 aggiornamentiAggiunta alla sezione metodologia una tabella dello sforzo di ragionamento per modello e programma agente.
Sii il primo a commentare
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.