Premium
Servizi
Premium

Modelli di IA

I modelli di intelligenza artificiale effettuano previsioni basandosi sui dati di addestramento. Possono funzionare in qualsiasi ambito, come numeri, testo o contenuti multimediali.

Esplora :categoria

Text-to-SQL: Confronto dell'accuratezza degli LLM

LLM
Benchmark
25 set

Abbiamo eseguito 36 grandi modelli linguistici su 759 domande di BIRD-SQL, ciascun modello scrivendo SQL contro un database che doveva identificare da solo tra 11 candidati. Ogni query analizzabile è stata eseguita sul database reale e il suo set di risultati confrontato con il set di risultati della query gold di BIRD. Le query mancanti,…

Per saperne di più
LLM
Approfondimento
25 set

LLM Quota di mercato: Confronta utilizzo e adozione

Abbiamo analizzato la quota di mercato degli LLM combinando dati basati sull'utilizzo e stime delle visite web per mostrare come la domanda di modelli linguistici di grandi dimensioni sia distribuita tra i laboratori di IA e le applicazioni di IA. Leggi la metodologia per vedere come abbiamo misurato e calcolato questi risultati. Gli Stati Uniti…

Modelli di IA
Benchmark
24 set

AIM-Decision: Jev contro Kev contro LLMs

I modelli decisionali, detti anche modelli System One,1 scelgono l’azione successiva di un agente in un unico passaggio invece di generare testo token per token. Per verificare se possono rendere l’automazione del browser più economica rispetto agli LLM, abbiamo eseguito tre modelli decisionali e due LLM, Gemini 3.8 Flash e GPT-6 Astra, sugli stessi 50…

LLM
Benchmark
24 set

Benchmark di 40+ LLM nella finanza: Claude Fable 5 e GPT-5.6 Sol

Abbiamo valutato gli LLM su 238 domande difficili del benchmark FinanceReasoning (Tang et al.).1 Questo sottoinsieme riguarda i compiti di ragionamento finanziario più impegnativi, valutando ragionamenti quantitativi complessi e a più passaggi che coinvolgono concetti e formule finanziarie. La nostra valutazione ha utilizzato una progettazione personalizzata dei prompt e criteri di punteggio basati su accuratezza…

LLM
Benchmark
21 set

Confronto tra modelli di IA multimodali sul ragionamento visivo

Abbiamo sottoposto a benchmark 15 modelli di IA multimodali leader sul ragionamento visivo utilizzando 200 domande basate su elementi visivi. La valutazione era composta da due tracce: 100 domande di comprensione dei grafici per testare l'interpretazione delle visualizzazioni di dati, e 100 domande di logica visiva per valutare il riconoscimento di pattern e il ragionamento…

LLM
Approfondimento
21 set

Grandi modelli multimodali (LMM) vs LLMs

Abbiamo valutato le prestazioni dei modelli multimodali di grandi dimensioni (LMM) in compiti di ragionamento finanziario utilizzando un dataset accuratamente selezionato. Analizzando un sottoinsieme di campioni finanziari di alta qualità, valutiamo le capacità dei modelli nell'elaborare e ragionare con dati multimodali nel dominio finanziario. La sezione metodologia fornisce approfondimenti dettagliati sul dataset e sul framework…

LLM
Approfondimento
21 set

LLM Calcolatore VRAM per il self-hosting

Il self-hosting di un LLM significa eseguire l'inferenza su hardware controllato dall'operatore anziché tramite un'API di terze parti, il che cambia il profilo di costi, controllo dei dati e privacy. Il fatto che un modello possa girare dipende interamente dalla memoria. Il calcolatore stima la VRAM o la memoria unificata necessaria a un modello per…

LLM
Benchmark
18 set

IT agentico: gli agenti IA possono progettare un benchmark

Abbiamo testato 16 modelli sulla progettazione di un benchmark in text-to-SQL e tool calling. Ogni modello ha creato un benchmark per argomento, per un totale di 32 proposte. Nessuna proposta ha superato ogni criterio della rubrica. Gli agenti sono riusciti a creare ed eseguire test, ma nessuno ha dimostrato sia un test con risposta vuota…

LLM
Benchmark
17 set

AIM Enterprise: benchmark aziendale agentico

Le aziende usano gli LLM ogni giorno per le loro attività regolari. Per trovare gli LLM più convenienti, abbiamo progettato AIM Enterprise, un benchmark aziendale agentico, in cui abbiamo utilizzato 69 attività aziendali reali tra strategia, marketing, HR, vendite e operazioni. Due modelli giudici hanno valutato ogni file che ha superato i controlli. Nel 32,7%…

LLM
Approfondimento
17 set

Il futuro dei grandi modelli linguistici

Scopri il futuro dei grandi modelli linguistici approfondendo approcci promettenti, come l'auto-addestramento, la verifica dei fatti e la competenza sparsa, che potrebbero affrontare i limiti degli LLM. Confronto del tasso di successo degli LLM Claude Sonnet 4.6 ha guidato il benchmark con un punteggio complessivo di 0.748, con le varianti base e thinking a pari…

Modelli di IA
Approfondimento
15 set

World Foundation Models: 10 Casi d'Uso

Addestrare robot e veicoli autonomi (AV) nel mondo fisico può essere costoso, dispendioso in termini di tempo e rischioso. I World Foundation Models offrono un'alternativa scalabile consentendo simulazioni realistiche degli ambienti del mondo reale. Questi modelli accelerano lo sviluppo e la distribuzione nella robotica, nei veicoli autonomi e in altri settori, riducendo la dipendenza dai…