Servizi
Contattaci

AIM Enterprise: Benchmark aziendale agentico

Berk Kalelioğlu
Berk Kalelioğlu
aggiornato il 14 ago. 2026

Le aziende usano LLM ogni giorno per le loro attività abituali. Per trovare i LLM più convenienti, abbiamo progettato AIM Enterprise, un benchmark aziendale agentico, dove abbiamo utilizzato 69 attività aziendali in diverse categorie.

Risultati del benchmark delle attività aziendali

Loading Chart

Ogni modello ha consegnato un file per attività. I punteggi sono relativi: i giudici classificano ogni risposta rispetto alle altre risposte per la stessa attività, quindi il punteggio medio è 50 per impostazione. Un 55 significa che le risposte di un modello si sono classificate sopra la maggior parte delle altre, non che il 55% del suo lavoro fosse corretto.

Due modelli si sono distinti nettamente. Claude Opus 5 ha ottenuto 66.4 e GPT 5.6 Sol 62.4, oltre 7 punti sopra la configurazione al terzo posto. Il loro vantaggio non dipende da quali attività abbiamo scelto: abbiamo ricalcolato la classifica 4.000 volte su selezioni casuali delle 69 attività, e quei due hanno mantenuto il primo e il secondo posto ogni volta.

I successivi nove modelli hanno ottenuto punteggi tra 51.4 e 55.3. Sessantanove attività non possono distinguere punteggi così vicini, quindi il loro ordine cambia a seconda di quali attività vengono conteggiate. Kimi K3 è l'eccezione in quel gruppo, classificandosi sopra Claude Sonnet 5 nel 94% dei ricalcoli.

Opus 5 ha vinto anche le attività più difficili. Abbiamo preso le 17 attività con il punteggio medio più basso tra tutte le 16 configurazioni, fissate da tale regola prima che fosse calcolata la posizione di chiunque su di esse, e Opus 5 ha superato tutte le altre 15 configurazioni in quel sottoinsieme.

Opus 5 non ha attività deboli. Il suo punteggio migliore, 80.6, è il più alto mai registrato, e il peggiore, 52.9, batte comunque una risposta media. Ha ottenuto più di 60 su 62 delle 69 attività ed è arrivato primo su 43 di esse. GPT 5.6 Sol ha vinto 13 attività e nessun altro modello ne ha vinte più di quattro.

I due modelli di valutazione non erano d'accordo su quale dei leader dovesse arrivare primo. Ognuno ha messo in cima il modello della propria azienda, quindi l'ordine pubblicato combina entrambe le classifiche.

Costo e punteggio

Il costo riguarda le 11 configurazioni fatturate per esecuzione. Cinque configurazioni, compresi entrambi i leader, sono state eseguite su abbonamenti che non registrano alcun addebito per esecuzione.

La configurazione a pagamento con il punteggio migliore è anche la più economica. GPT 5.6 Luna ha ottenuto 55.3 a $0.032 per attività, appena sotto DeepSeek V4 Flash a $0.033. Claude Sonnet 5 ha ottenuto 53.2 a $1.46, che è 46 volte il costo e 2.1 punti in meno.

Pagare di più serve a poco qui. Tra le 11 configurazioni a pagamento, la correlazione tra costo per attività e punteggio è 0.48. Kimi K3 a $0.92 e Qwen 3.8 Max a $0.74 hanno ottenuto punteggi nella stessa fascia di Luna a $0.03.

Un'esecuzione veloce è un segnale di allarme, ma una lenta non dimostra nulla. Tra tutte le 16 configurazioni, la correlazione tra tempo per attività e punteggio è 0.55 e le quattro più veloci erano quattro dei cinque punteggi più bassi. Inkling Small ha completato un'attività in 49 secondi ed è arrivato penultimo. Tra i nove modelli raccolti a metà classifica, che hanno impiegato tra 127 e 569 secondi, quella correlazione scende a −0.06.

I costi sono quelli fatturati dal harness al suo listino prezzi incluso, non un preventivo. I prezzi di listino dei provider sono nel nostro confronto dei prezzi degli LLM. I tentativi falliti contano nel totale di un modello ma non nella sua cifra per attività, e i due valori differiscono maggiormente per Grok 4.5: $26.14 spesi contro $22.84 di esecuzioni consegnate.

Disaccordo tra i giudici

Due modelli hanno valutato ogni file e spesso non erano d'accordo. In circa un terzo dei punteggi individuali i due sono finiti a più di un quarto di scala di distanza, e nessuno ha esaminato quelle righe.

Erano d'accordo sulle estremità ma non sul centro. Entrambi hanno messo Opus 5 e GPT 5.6 Sol sopra tutti gli altri, ma 11 delle 16 configurazioni si collocano in una posizione diversa a seconda di quale modello di valutazione si segua.

Ogni attività è stata eseguita una volta e valutata una volta. Un modello che non ha prodotto alcun file è stato eseguito di nuovo, ma nessun file è mai stato valutato due volte, quindi nessun risultato è derivato dalla scelta del migliore tra due tentativi.

Una settantesima attività, un playbook per la gestione delle richieste, è esclusa da ogni dato qui. Il suo file di input era mancante al momento dell'esecuzione e solo una configurazione ha mai prodotto un file per essa.

Benchmark AIM Marketing

Lo stesso metodo viene applicato al lavoro di marketing: trovare le offerte che un concorrente pubblica e che AIMultiple non pubblica, costruire un elenco di account più adatti e produrre una presentazione di vendita personalizzata. Ogni attività riceve un punteggio da 0 a 100 e il punteggio complessivo è la media delle tre. Un audit della reputazione del sito web viene eseguito accanto a esse ed è riportato sui propri assi, perché non ha un punteggio massimo fisso.

Risultati completi: il benchmark di marketing agentico.

Lascia che il nostro team automatizzi uno dei tuoi processi aziendali con agenti IA, gratuitamente.
Automatizza un processo

Benchmark AIM IT

A dodici modelli è stato chiesto di inventare un benchmark, costruirlo ed eseguire quattro modelli su di esso, due volte ciascuno. Nessuno dei 24 tentativi ha superato ogni criterio e sei controlli della rubrica non sono stati superati da nessuno di essi. Claude Opus 5 è stato il migliore nel text-to-SQL con 78.2 e Kimi K3 nel tool calling con 74.3.

Risultati completi: gli LLM possono progettare un benchmark.

Benchmark AIM VC

A tredici modelli è stato chiesto di indicare i clienti di un'azienda con prove datate, su tre aziende target. Claude Opus 5 ha ottenuto 89.1 su 100 e Claude Fable 5 85.0, e questi due sono stati gli unici a rimanere sopra 76 su tutti e tre i target. La maggior parte degli altri è crollata sul target i cui clienti sono citati nelle sponsorizzazioni dei podcast piuttosto che nelle pagine indicizzate.

Risultati completi: il benchmark dell'elenco clienti.

Non perderti i nostri benchmark e approfondimenti basati sui dati. Il pulsante apre Google; selezionare AIMultiple conferma che desideri vedere AIMultiple più spesso nei risultati di ricerca di Google.
GoogleAggiungi come fonte preferita

Metodologia

Le 69 attività sono state scritte dal fondatore di AIMultiple sulla base di decisioni aziendali reali e mappate agli ID dell'APQC Process Classification Framework.

1

Coprono strategia (16 attività), marketing (15), risorse umane (7), vendite (6), operazioni (5), IT e finanza (4 ciascuno) e sette aree minori. Ogni attività indica il proprio deliverable: un results.csv con un elenco fisso di colonne, in genere 10 righe e 8 colonne, con una regola esplicita per ogni campo intero.

Come sono stati eseguiti i modelli

Tredici modelli sono stati eseguiti in 16 configurazioni, dove una configurazione è un modello sotto un programma agente. Undici sono stati eseguiti su opencode 1.15.13 tramite OpenRouter. Gli altri sono stati eseguiti sui programmi agente forniti dai rispettivi fornitori, Claude Code e Codex, fatturati sugli abbonamenti.

Ogni configurazione ha ricevuto lo stesso prompt congelato, accesso web in tempo reale tramite una API di scraping e un limite di due ore. I prompt non sono mai stati ottimizzati per modello e le rubriche di valutazione non hanno mai raggiunto la macchina che ha eseguito le attività.

Ciò ha prodotto 1.104 file, uno per modello per attività. Sei configurazioni opencode hanno mancato 25 celle al primo passaggio perché la ricerca dei file dell'agente ha percorso percorsi che la propria sandbox si è poi rifiutata di aprire, bloccando l'esecuzione. Rieseguire quelle 25 in una directory isolata le ha recuperate tutte, quindi la consegna viene riportata sia come tasso al primo passaggio sia come tasso finale. Contando ogni riavvio, 83 delle 759 celle con record di utilizzo hanno richiesto più di un tentativo.

Come funzionano i controlli e i giudici

I controlli deterministici vengono eseguiti per primi e nessun giudice vede un file che non li supera: insieme di colonne e numero di righe, parsing RFC 4180,

2

formattazione degli interi, nessuna cella vuota, nessuna riga duplicata e ordine di ordinamento dove l'attività lo richiede.

Un file che fallisce riceve zero invece di essere scartato, perché un file che nessuno può analizzare è un risultato. DeepSeek V4 Flash ha fallito su 6 dei suoi 69 file, Inkling Small su 2, MiniMax M3 e GPT 5.6 Terra su uno ciascuno. Rimuovendo ogni attività in cui una qualsiasi configurazione ha fallito, i due leader e la forma complessiva restano intatti.

I 1.094 file che hanno superato i controlli sono andati a due giudici: GPT 5.6 Sol tramite Codex CLI e Claude Opus 5 tramite Claude Code CLI, entrambi con sforzo di ragionamento elevato e accesso web in tempo reale.

Ogni colonna del deliverable va al proprio sottoagente, che vede le risposte di quella colonna da ogni modello e nient'altro, con ID di riga anonimi mescolati separatamente per ogni giudice. Il giudice classifica quelle risposte l'una contro l'altra e non può considerare uguali due risposte. Le due classifiche vengono quindi combinate sommando la posizione di ogni risposta sotto ciascun giudice. Ciò ha prodotto 90.530 punteggi.

L'anonimizzazione non è puramente estetica. Misurata con i nomi dei modelli visibili, Sol ha classificato le risposte di GPT 8.4 percentili sopra il punto in cui le ha classificate Opus, e Opus ha classificato le risposte di Anthropic 4.9 percentili sopra il punto in cui le ha classificate Sol. Ciò non elimina l'effetto: le esecuzioni dietro questa classifica sono state anonimizzate e ciascun giudice ha comunque messo al primo posto la configurazione della propria azienda.

Come funziona il punteggio

Il punteggio di un modello è la somma delle medie delle sue colonne, riscalata in modo che il totale più alto possibile sia 100. Tale tetto dipende da quanti modelli hanno superato i controlli, motivo per cui questi punteggi si confrontano all'interno di questo benchmark e da nessun'altra parte.

Per verificare quanto la classifica dipenda dalla selezione delle attività, abbiamo ricalcolato la classifica 4.000 volte, ogni volta su una nuova selezione casuale delle 69 attività. Ciò misura solo la sensibilità alle attività. Non misura quanto una nuova esecuzione della stessa attività sposterebbe un punteggio, perché nessuna attività è stata valutata due volte.

Il quarto più difficile è rappresentato dalle 17 attività con il punteggio medio più basso tra tutte le 16 configurazioni. Tale regola è stata fissata prima che fosse calcolata la posizione di qualsiasi modello su quelle attività.

Dodici dei 13 modelli qui presenti vengono eseguiti anche negli altri benchmark sopra, quindi il loro ordine si mantiene lungo la serie. I numeri no, perché ogni benchmark imposta la propria scala.

Questo benchmark non può essere ridotto come gli altri. Ogni punteggio è una posizione relativa ai modelli contro cui è stato eseguito, quindi eliminare una configurazione ricalcolerebbe tutte le altre invece di rimuovere una barra. Qwen 3.8 Max viene eseguito solo in questo benchmark e rimane nel grafico per questo motivo.

FAQ

Non sulla base di queste prove. La scala è relativa, quindi anche il punteggio massimo di 66.4 indica solo che le risposte di un modello si sono classificate sopra le altre, e le righe in cui i due modelli di valutazione sono sostanzialmente in disaccordo non sono state riesaminate. I fornitori che costruiscono questo tipo di agente sono elencati nella nostra analisi delle aziende di IA per le imprese, e AIMultiple automatizza processi come questi.

Perché nove di loro sono davvero vicini e 69 attività non possono separare differenze inferiori a circa 1.5 punti. Il benchmark distingue i modelli forti da quelli deboli, non un modello di metà classifica dall'altro.

Non per la qualità dell'output, nei tre casi che abbiamo potuto testare. Tre modelli sono stati eseguiti ciascuno sotto due programmi agente e nessuna coppia è differita di più di 0.83 punti. La differenza è emersa invece nelle operazioni: solo le configurazioni opencode hanno perso celle a causa di un conflitto con la sandbox, e solo i programmi fatturati su abbonamento non hanno lasciato alcun record di utilizzo.

Cita questa ricerca

Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.

Berk Kalelioğlu (2026) - "AIM Enterprise: Benchmark aziendale agentico". Pubblicato online su AIMultiple.com. Consultato il 14 Agosto 2026, da: https://aimultiple.com/agentic-enterprise [Risorsa online]

Kalelioğlu, B. (2026, 14 Agosto). AIM Enterprise: Benchmark aziendale agentico. AIMultiple. https://aimultiple.com/agentic-enterprise

@misc{kalelioglu2026,
  author = {Kalelioğlu, Berk},
  title  = {{AIM Enterprise: Benchmark aziendale agentico}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/agentic-enterprise}},
  note   = {AIMultiple. Consultato il 14 Agosto 2026}
}
Berk Kalelioğlu
Berk Kalelioğlu
Ricercatore di IA
Berk è un Ricercatore di IA presso AIMultiple, concentrandosi su sistemi di IA agentica e modelli linguistici.
Visualizza il profilo completo

Sii il primo a commentare

Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.

0/450