Modelli di IA
I modelli di intelligenza artificiale effettuano previsioni basandosi sui dati di addestramento. Possono funzionare in qualsiasi ambito, come numeri, testo o contenuti multimediali.
World Foundation Models: 10 Casi d'Uso
Addestrare robot e veicoli autonomi (AV) nel mondo fisico può essere costoso, dispendioso in termini di tempo e rischioso. I World Foundation Models offrono un'alternativa scalabile consentendo simulazioni realistiche degli ambienti del mondo reale. Questi modelli accelerano lo sviluppo e la distribuzione nella robotica, nei veicoli autonomi e in altri settori, riducendo la dipendenza dai…
LLM Calcolatore VRAM per il self-hosting
Il self-hosting di un LLM significa eseguire l'inferenza su hardware controllato dall'operatore anziché tramite un'API di terze parti, il che cambia il profilo di costi, controllo dei dati e privacy. Il fatto che un modello possa girare dipende interamente dalla memoria. Il calcolatore stima la VRAM o la memoria unificata necessaria a un modello per…
LLM Prezzi: Confronto tra i migliori 15+ provider
Il pricing degli LLM si estende su quattro ordini di grandezza: i modelli più economici sono stati lanciati a meno di $0,03 per milione di token, mentre i modelli di ragionamento di frontiera sono stati lanciati fino a $262.50. Il grafico seguente tiene traccia dei prezzi di lancio: ogni punto rappresenta il prezzo medio dei…
Automazione LLM: i 7 migliori strumenti e 8 casi di studio
L'automazione LLM si riferisce al passaggio a strumenti di automazione intelligente che sfruttano gli LLM, inclusi agenti IA, LLM fine-tuned e modelli RAG per automatizzare e coordinare le attività. Scopri cos'è l'automazione LLM, le sue principali applicazioni reali e i principali strumenti: Large language models nell'automazione sono un approccio sistematico che combina l'elaborazione del linguaggio…
LLM Orchestrazione: 22 Framework e Gateway
Ottimizzare l'orchestrazione LLM è fondamentale per migliorare le prestazioni mantenendo sotto controllo l'uso delle risorse. Per valutare come si comportano nella pratica i diversi approcci di orchestrazione, abbiamo eseguito dei benchmark: Scopri una selezione di strumenti di orchestrazione LLM, tra cui framework per sviluppatori e gateway aziendali: L'orchestrazione LLM implica la gestione e l'integrazione di…
AIM Enterprise: benchmark enterprise agentico
Le imprese usano gli LLM ogni giorno per le loro attività ordinarie. Per trovare gli LLM più convenienti, abbiamo progettato AIM Enterprise, un benchmark enterprise agentico, in cui abbiamo utilizzato 69 attività aziendali reali tra strategia, marketing, HR, vendite e operations. Due judge model hanno valutato ogni file e spesso non erano d'accordo. In circa…
Text-to-SQL: Confronto dell'accuratezza degli LLM
Abbiamo eseguito 36 grandi modelli linguistici su 759 domande di BIRD-SQL, ciascun modello scrivendo SQL contro un database che doveva identificare da solo tra 11 candidati. Ogni query analizzabile è stata eseguita sul database reale e il suo set di risultati confrontato con il set di risultati della query gold di BIRD. Le query mancanti,…
Benchmark sulla classificazione delle serie temporali: modelli foundation vs metodi classici
Abbiamo confrontato 13 metodi di classificazione delle serie temporali, dai modelli foundation preaddestrati per serie temporali a una baseline a 22 feature del 2019, su 33 dataset UCR/UEA con un unico protocollo congelato. Si tratta di 14.638 celle registrate metodo-dataset-ricampionamento, 11.874 delle quali valutate. Il grafico confronta 12 metodi sui 15 dataset univariati che tutti…
LLM Parameters: GPT-5 High, Medium, Low and Minimal
Alcuni LLM, come la famiglia GPT-5 di OpenAI, sono disponibili in diverse versioni (ad esempio, GPT-5, GPT-5-mini e GPT-5-nano) e con varie impostazioni dei parametri, tra cui alto, medio, basso e minimo. Di seguito, esploriamo le differenze tra queste versioni del modello raccogliendo le loro prestazioni sui benchmark e i costi per eseguire i benchmark.…
HALC-Bench: LLM Allucinazione su benchmark di recupero a lungo contesto
HALC-Bench (benchmark di allucinazione di LLM su recupero a lungo contesto) misura la resistenza di un grande modello linguistico a fabbricare prove per una metrica che non esiste nel documento di destinazione, utilizzando 3 pagliai posizionati all'inizio, a metà e alla fine della finestra di contesto del modello, con 204 domande. claude-fable-5 ha risposto correttamente…