Modelli di IA
I modelli di intelligenza artificiale effettuano previsioni basandosi sui dati di addestramento. Possono funzionare in qualsiasi ambito, come numeri, testo o contenuti multimediali.
LLM Quota di mercato: Confronta utilizzo e adozione
Abbiamo analizzato la quota di mercato degli LLM combinando dati basati sull'utilizzo e stime delle visite web per mostrare come la domanda di modelli linguistici di grandi dimensioni sia distribuita tra i laboratori di IA e le applicazioni di IA. Leggi la metodologia per vedere come abbiamo misurato e calcolato questi risultati. Gli Stati Uniti…
AIM-Decision: Jev contro Kev contro LLMs
I modelli decisionali, detti anche modelli System One,1 scelgono l’azione successiva di un agente in un unico passaggio invece di generare testo token per token. Per verificare se possono rendere l’automazione del browser più economica rispetto agli LLM, abbiamo eseguito tre modelli decisionali e due LLM, Gemini 3.8 Flash e GPT-6 Astra, sugli stessi 50…
Benchmark di 40+ LLM nella finanza: Claude Fable 5 e GPT-5.6 Sol
Abbiamo valutato gli LLM su 238 domande difficili del benchmark FinanceReasoning (Tang et al.).1 Questo sottoinsieme riguarda i compiti di ragionamento finanziario più impegnativi, valutando ragionamenti quantitativi complessi e a più passaggi che coinvolgono concetti e formule finanziarie. La nostra valutazione ha utilizzato una progettazione personalizzata dei prompt e criteri di punteggio basati su accuratezza…
Confronto tra modelli di IA multimodali sul ragionamento visivo
Abbiamo sottoposto a benchmark 15 modelli di IA multimodali leader sul ragionamento visivo utilizzando 200 domande basate su elementi visivi. La valutazione era composta da due tracce: 100 domande di comprensione dei grafici per testare l'interpretazione delle visualizzazioni di dati, e 100 domande di logica visiva per valutare il riconoscimento di pattern e il ragionamento…
Grandi modelli multimodali (LMM) vs LLMs
Abbiamo valutato le prestazioni dei modelli multimodali di grandi dimensioni (LMM) in compiti di ragionamento finanziario utilizzando un dataset accuratamente selezionato. Analizzando un sottoinsieme di campioni finanziari di alta qualità, valutiamo le capacità dei modelli nell'elaborare e ragionare con dati multimodali nel dominio finanziario. La sezione metodologia fornisce approfondimenti dettagliati sul dataset e sul framework…
LLM Calcolatore VRAM per il self-hosting
Il self-hosting di un LLM significa eseguire l'inferenza su hardware controllato dall'operatore anziché tramite un'API di terze parti, il che cambia il profilo di costi, controllo dei dati e privacy. Il fatto che un modello possa girare dipende interamente dalla memoria. Il calcolatore stima la VRAM o la memoria unificata necessaria a un modello per…
IT agentico: gli agenti IA possono progettare un benchmark
Abbiamo testato 16 modelli sulla progettazione di un benchmark in text-to-SQL e tool calling. Ogni modello ha creato un benchmark per argomento, per un totale di 32 proposte. Nessuna proposta ha superato ogni criterio della rubrica. Gli agenti sono riusciti a creare ed eseguire test, ma nessuno ha dimostrato sia un test con risposta vuota…
AIM Enterprise: benchmark aziendale agentico
Le aziende usano gli LLM ogni giorno per le loro attività regolari. Per trovare gli LLM più convenienti, abbiamo progettato AIM Enterprise, un benchmark aziendale agentico, in cui abbiamo utilizzato 69 attività aziendali reali tra strategia, marketing, HR, vendite e operazioni. Due modelli giudici hanno valutato ogni file che ha superato i controlli. Nel 32,7%…
Il futuro dei grandi modelli linguistici
Scopri il futuro dei grandi modelli linguistici approfondendo approcci promettenti, come l'auto-addestramento, la verifica dei fatti e la competenza sparsa, che potrebbero affrontare i limiti degli LLM. Confronto del tasso di successo degli LLM Claude Sonnet 4.6 ha guidato il benchmark con un punteggio complessivo di 0.748, con le varianti base e thinking a pari…
World Foundation Models: 10 Casi d'Uso
Addestrare robot e veicoli autonomi (AV) nel mondo fisico può essere costoso, dispendioso in termini di tempo e rischioso. I World Foundation Models offrono un'alternativa scalabile consentendo simulazioni realistiche degli ambienti del mondo reale. Questi modelli accelerano lo sviluppo e la distribuzione nella robotica, nei veicoli autonomi e in altri settori, riducendo la dipendenza dai…