Modelli di IA
I modelli di intelligenza artificiale effettuano previsioni basandosi sui dati di addestramento. Possono funzionare in qualsiasi ambito, come numeri, testo o contenuti multimediali.
Confronto dei modelli fondazionali relazionali
Abbiamo confrontato SAP-RPT-1-OSS con il gradient boosting (LightGBM, CatBoost) su 17 dataset tabulari che coprono lo spettro semantico-numerico, tabelle piccole/ad alta semantica, dataset aziendali misti e grandi dataset numerici a bassa semantica. Il nostro obiettivo è misurare dove i priori semantici pre-addestrati di un LLM relazionale possano offrire vantaggi rispetto ai modelli ad albero tradizionali…
I modelli linguistici di grandi dimensioni nella cybersecurity
Abbiamo valutato 7 modelli linguistici di grandi dimensioni in 9 domini di cybersecurity utilizzando SecBench, un benchmark su larga scala e multi-formato per attività di sicurezza. Abbiamo testato ciascun modello su 44.823 domande a scelta multipla (MCQ) e 3.087 domande a risposta breve (SAQ), coprendo sicurezza dei dati, gestione delle identità e degli accessi, sicurezza…
LLM Leggi di scaling: analisi di ricercatori IA
Large language models prevedono il token successivo in base ai pattern appresi dai dati testuali. Il termine leggi di scaling di LLM si riferisce a regolarità empiriche che collegano le prestazioni del model alla quantità di calcolo, ai dati di addestramento e ai parametri del model utilizzati durante l'addestramento. Per comprendere come queste relazioni influenzino…
Confronta 9 Large Language Models in ambito sanitario
Abbiamo valutato 9 LLM utilizzando il dataset MedQA, un benchmark di esami clinici di livello universitario derivato dalle domande USMLE. Ogni model ha risposto agli stessi scenari clinici a scelta multipla utilizzando un prompt standardizzato, consentendo un confronto diretto dell'accuratezza. Abbiamo inoltre registrato la latenza per domanda dividendo il tempo di esecuzione totale per il…
Simulazione del pubblico: gli LLM possono prevedere il comportamento umano?
Nel marketing, valutare con quanta precisione gli LLM prevedono il comportamento umano è fondamentale per valutare la loro efficacia nell'anticipare le esigenze del pubblico e riconoscere i rischi di disallineamento, comunicazione inefficace o influenza non intenzionale. La simulazione del pubblico con gli LLM consente la modellazione di pubblici virtuali, aiutando le organizzazioni ad anticipare le…
HALC-Bench: Allucinazione degli LLM nel benchmark di recupero a contesto lungo
HALC-Bench (Allucinazione degli LLM nel benchmark di recupero a contesto lungo) misura la resistenza di un modello linguistico di grandi dimensioni a fabbricare prove per una metrica che non esiste nel documento di destinazione, utilizzando 3 pagliai posizionati all'inizio, al centro e alla fine della finestra di contesto del modello, con 204 domande. claude-fable-5 ha…
Gateway IA per OpenAI: alternative a OpenRouter
Abbiamo confrontato OpenRouter, SambaNova, TogetherAI, Groq e IA/ML API su tre indicatori (latenza del primo token, latenza totale e numero di token in output), con 300 test utilizzando prompt brevi (circa 18 token) e prompt lunghi (circa 203 token) per la latenza totale. Se prevedi di utilizzare uno di questi gateway IA, puoi: In questo…
Migliori fornitori di LLM API a tariffa fissa
I fornitori di LLM a tariffa fissa vendono un utilizzo illimitato del modello a un prezzo mensile fisso invece di fatturare a token. Questo modello si è diffuso perché le sessioni di coding agentico possono utilizzare decine di milioni di token, rendendo difficile prevedere una fattura a consumo. Pochissimi fornitori offrono una vera tariffa fissa;…
LLM Strumenti di osservabilità: Weights & Biases, Langsmith
Le applicazioni LLM si sono espanse da chat a turno singolo ad agenti multi-step che usano strumenti, interrogano database e si coordinano con altri model, rendendo il loro comportamento più difficile da interpretare. L'osservabilità LLM fornisce visibilità continua su questi flussi di lavoro complessi, aiutando le organizzazioni a monitorare la qualità, rilevare i guasti, risolvere…
Confronta i Large Vision Models: GPT-4o vs YOLOv8n
I large vision models (LVM) possono automatizzare e migliorare i compiti visivi come il rilevamento dei difetti, la diagnosi medica e il monitoraggio ambientale. Abbiamo effettuato il benchmark di tre model di object detection: YOLOv8n, DETR e GPT-4o Vision, su 1.000 immagini ciascuno, misurando metriche come mAP@0.5, velocità di inference, FLOPs e numero di parametri.…