Premium
Servizi
Premium

Benchmark di 40+ LLM nella finanza: Claude Fable 5 e GPT-5.6 Sol

We evaluated 50+ LLMs in finance on 238 hard questions from the FinanceReasoning benchmark to identify which models excel at complex financial reasoning tasks.

Ekrem Sarı
Ekrem Sarı
aggiornato il 28 set. 2026
Caricamento del grafico

Abbiamo valutato gli LLM su 238 domande difficili del benchmark FinanceReasoning (Tang et al.).1 Questo sottoinsieme riguarda i compiti di ragionamento finanziario più impegnativi, valutando ragionamenti quantitativi complessi e a più passaggi che coinvolgono concetti e formule finanziarie. La nostra valutazione ha utilizzato una progettazione personalizzata dei prompt e criteri di punteggio basati su accuratezza e consumo di token.

Per una spiegazione dettagliata di come sono state calcolate queste metriche e del framework utilizzato per questa valutazione, consulta la nostra metodologia del benchmark finanziario.

Risultati: qual è il miglior LLM per la finanza?

Modelli di fascia alta (accuratezza >83%):

gpt-5.6-sol-pro raggiunge la più alta accuratezza del benchmark con il 90,76%, con 385.886 token a $16,35 per esecuzione, 0.42 punti sopra gpt-5.6-sol.

gpt-5.6-sol ottiene un'accuratezza del 90,34% con 117.735 token a $3,85 per esecuzione. È a pari merito con claude-fable-5 (90,34%) per la seconda più alta accuratezza, a $3,85 contro i $10,05 di fable-5 e 117.735 token contro 183.258. Nessun modello con accuratezza pari o superiore alla sua viene eseguito a un costo inferiore.

claude-fable-5 ottiene un'accuratezza del 90,34% con 183.258 token. È stato il primo modello a superare il 90% su questo benchmark (10 giugno) ed è a pari merito con gpt-5.6-sol al 90,34%, a $10,05 per esecuzione contro i $3,85 di gpt-5.6-sol.

claude-opus-4.8 ottiene un'accuratezza del 89,08% con 113.434 token, il terzo risultato più costoso e il minor numero di token in output tra i modelli sopra l'88%.

gpt-5-2025-08-07 ottiene un'accuratezza del 88,23% con 829.720 token.

claude-opus-4.6 ottiene un'accuratezza del 87,82% con 164.369 token, un'accuratezza quasi ai vertici con il 20% del numero di token di gpt-5.

gpt-5-mini-2025-08-07 raggiunge un'accuratezza del 87,39% con 595.505 token.

gemini-3.5-flash raggiunge un'accuratezza del 86,97% con 1.191.757 token, la più alta accuratezza nella linea Flash di Google e il maggior consumatore di token della famiglia.

claude-sonnet-5 ottiene un'accuratezza del 86,97% con 414.668 token. Eguaglia gemini-3.5-flash fino al decimale spendendo 414.668 token contro 1.191.757, a $4,33 per esecuzione contro $10.83.

gpt-5.6-terra ottiene un'accuratezza del 86,97% con 121.936 token a $1,99 per esecuzione. Si unisce a claude-sonnet-5 e gemini-3.5-flash al 86,97%, con il minor numero di token e il costo più basso dei tre (121.936 token e $1,99, contro 414.668 / $4,33 e 1.191.757 / $10,83). gpt-5-mini-2025-08-07 rimane più economico e più accurato ($1,21, 87,39%).

gemini-3.1-pro-preview ottiene un'accuratezza del 86,55% con 475.148 token, superiore al suo predecessore gemini-3-pro-preview (86,13%) con il 35% di token in meno (730.759 token).

glm-5.2 ottiene un'accuratezza del 86,13% con 735.988 token. Migliora glm-4.5 (64,29%) di 21.84 punti, il balzo più grande tra due versioni di una stessa famiglia di modelli nel benchmark. Il successivo più grande è di 3.79 punti.

gemini-3-pro-preview e gpt-5.2 sono a pari merito con un'accuratezza del 86,13%. gpt-5.2 la raggiunge con 247.660 token, circa tre volte meno token in output rispetto a gemini-3-pro-preview con 730.759 token.

claude-opus-4.7 ottiene un'accuratezza del 85,29% con 103.268 token, il modello più efficiente in termini di token nella fascia alta (37% di token in output in meno rispetto a claude-opus-4.6, superando la soglia dell'83%).

Modelli di buon livello (accuratezza 80-83%):

grok-4.3 raggiunge un'accuratezza del 84,87% con 309.781 token, il miglior risultato di xAI nel benchmark e un recupero rispetto al precedente grok-4-0709.

claude-opus-4.5 ottiene un'accuratezza del 84,03% con 144.505 token.

claude-sonnet-4.6 e gemini-3-flash-preview sono a pari merito con un'accuratezza del 83,61%. Claude Sonnet 4.6 utilizza 161.035 token, mentre Gemini 3 Flash Preview la raggiunge con 118.530 token, il minor numero di token tra i modelli sopra l'83%.

kimi-k2.5 ottiene un'accuratezza del 82,77% con 877.868 token, il consumo più alto in questa fascia di prestazioni.

Fascia intermedia (accuratezza 70-80%):

o3-pro-2025-06-10 (78,15% di accuratezza, 473.659 token) e kimi-k2 (78,15% di accuratezza, 100.323 token) sono a pari merito, e kimi-k2 utilizza il 79% di token in meno. Seguono o3-mini-2025-01-31 (77,31% di accuratezza, 376.929 token), gpt-5-nano-2025-08-07 (76,89% di accuratezza, 1.028.909 token) e claude-sonnet-4-20250514 (76,05% di accuratezza, 135.462 token).

Modelli con prestazioni basse (accuratezza <70%):

claude-3-5-sonnet-20241022 (67,65% di accuratezza, 90.103 token) e gpt-oss-20b (67,65% di accuratezza, 515.041 token) guidano questa fascia. Seguono gemini-2.5-flash (65,55% di accuratezza, 286.603 token), glm-4.5 (64,29% di accuratezza, 692.662 token) e gpt-4.1-nano-2025-04-14 (63,45% di accuratezza, 171.096 token).

Approfondimenti sulle prestazioni:

Il consumo di token non è correlato all'accuratezza. deepseek-r1-0528 ha consumato il maggior numero di token (1.251.064) con un'accuratezza del 62,18%, mentre claude-opus-4-20250514 ha ottenuto l'80,25% con 132.274 token. L'efficienza dei token varia anche tra i modelli ad alta accuratezza: gemini-3-flash-preview raggiunge l'83,61% con 118.530 token, mentre kimi-k2.5 spende 877.868 token per l'82,77% (7.4x i token per 0.84 punti in meno di accuratezza).

La tabella sopra presenta altri benchmark di modelli di intelligenza artificiale, inclusi quelli utilizzati per questo benchmark.

Costo per esecuzione del benchmark

I soli token in output non determinano la spesa, poiché le tariffe dei token in input e in output differiscono di un ordine di grandezza presso la maggior parte dei provider. Abbiamo calcolato il costo in dollari dell'esecuzione di ciascun modello sulle 238 domande utilizzando la tariffa per token indicata dal provider al momento dell'esecuzione.

Costo più basso nella fascia di frontiera: gemini-3-flash-preview raggiunge un'accuratezza del 83,61% per $0,39, il costo in dollari più basso nella fascia di accuratezza >83%. grok-4.3 segue a $0,86 per l'84,87%.

La soglia del 90,34% viene raggiunta a un costo inferiore: gpt-5.6-sol eguaglia il 90,34% di claude-fable-5 a $3,85 per esecuzione contro i $10,05 di fable-5, pari al 38% del costo di fable-5. gpt-5.6-sol-pro registra la più alta accuratezza del benchmark, 90,76%, a $16,35 per esecuzione. claude-opus-4.8 rimane il modello più economico a superare l'88%, a $3,28 per l'89,08%.

Ragionamento premium a prezzo premium: o1-pro è il modello più costoso del benchmark a $381 per un'accuratezza del 80,67% (a causa delle tariffe di $150/M per l'input e $600/M per l'output). o3-pro costa $39,23 per il 78,15%, o1 costa $46,59 per il 74,79%. Nessuno rientra nella fascia alta e tutti e tre si collocano sotto claude-opus-4.7 in termini di accuratezza a un costo più di 10x superiore.

Costo e accuratezza della fascia economica: gpt-oss-120b raggiunge un'accuratezza dell'81,09% a $0,06 totali, l'esecuzione più economica del benchmark, a 1.91 punti dalla soglia dell'83%. llama-4-maverick raggiunge il 75,21% a $0.10. Per carichi di lavoro in cui un'accuratezza dell'80% è sufficiente, questi modelli costano meno dell'1% dei modelli di punta di frontiera.

Tabella completa dei risultati dei LLM nella finanza

La tabella seguente elenca ogni modello del benchmark con l'accuratezza misurata, i token in output e il costo per esecuzione, oltre al costo di una risposta corretta.

Metodologia del benchmark di ragionamento finanziario

Il nostro benchmark fornisce una valutazione trasparente e riproducibile delle prestazioni dei LLM su compiti complessi di ragionamento finanziario.

Configurazione del test e corpus di dati

  • Suite di benchmark: Abbiamo utilizzato i dati, il codice e gli script di valutazione del benchmark FinanceReasoning, selezionato per la sua attenzione ai problemi finanziari quantitativi e inferenziali.
  • Corpus di conoscenza e interrogazioni di test: Abbiamo concentrato la nostra analisi sul sottoinsieme difficile, composto da 238 domande impegnative. Come definito dal benchmark, ogni punto dati include:
    1. Una domanda che richiede deduzioni logiche e numeriche a più passaggi.
    2. Un contesto, che spesso contiene informazioni dense presentate in formati strutturati come le tabelle Markdown (ad esempio bilanci, dati sulla performance azionaria).
    3. Una risposta di riferimento definitiva per una valutazione oggettiva.
  • Tipologie di interrogazioni illustrative: La difficoltà del benchmark deriva dalla richiesta ai modelli di gestire compiti di ragionamento finanziario diversi e complessi. Per illustrare questa ampiezza, evidenziamo due esempi rappresentativi dal set di test:

Esempio: Ragionamento algoritmico e su serie temporali (analisi tecnica)

Contesto: Un investitore sta analizzando… i prezzi delle azioni negli ultimi 25 giorni… per calcolare il Canale di Keltner utilizzando un periodo EMA di 10 giorni e un periodo ATR di 10 giorni, con un moltiplicatore di 1.5…

Domanda: Qual è il valore dell'ultima banda superiore nel Canale di Keltner…? Rispondere con due cifre decimali.

Questa interrogazione verifica la capacità di un modello di agire come analista quantitativo:

  1. Scomporre un indicatore composito: Riconoscere che il "Canale di Keltner" deriva da altri due indicatori complessi:
    • La media mobile esponenziale (EMA)
    • La media vera del range (ATR).
  2. Implementare la logica algoritmica: Implementare correttamente gli algoritmi iterativi per EMA e ATR da zero su una serie temporale di 25 punti dati.
  3. Sintetizzare i risultati: Combinare i valori calcolati secondo la formula finale del Canale di Keltner (Banda Superiore = EMA + (Moltiplicatore × ATR)).

Principi fondamentali di valutazione

  • Chiamate API isolate e standardizzate: Per ciascun modello, abbiamo condotto la valutazione in modo programmatico tramite i rispettivi endpoint API (ad es. OpenRouter, OpenAI). Questo ha garantito che ogni modello ricevesse esattamente lo stesso input in condizioni identiche, eliminando la variabilità delle interazioni con l'interfaccia utente.
  • Generazione libera: Non abbiamo vincolato i modelli a un formato a scelta multipla. Al contrario, sono stati invitati tramite prompt a generare una risposta completa e in forma gratuito, consentendo una valutazione più autentica delle loro capacità di ragionamento.
  • Prompting Chain-of-Thought (CoT): Per far emergere e valutare il processo di ragionamento dei modelli, abbiamo adottato una strategia di prompting Chain-of-Thought (CoT). Il prompt di sistema ha esplicitamente istruito ciascun modello a "pensare prima al problema passo dopo passo" prima di concludere con una risposta finale. Questo approccio consente un'analisi più approfondita di come un modello giunge alla conclusione, oltre l'output finale.

Metriche di valutazione e framework

Abbiamo utilizzato il framework di valutazione completamente automatizzato del benchmark FinanceReasoning per valutare gli output dei modelli. Questo framework è progettato per misurare sia la correttezza concettuale sia il costo computazionale.

1. Metrica primaria: accuratezza

Questa metrica risponde alla domanda critica: "Il modello riesce a risolvere correttamente il problema finanziario?" Il processo di punteggio prevede una pipeline sofisticata in due fasi:

  • Fase 1: estrazione della risposta basata su LLM: L'output grezzo di un modello è testo non strutturato contenente sia il ragionamento sia una risposta finale. Per estrarre in modo affidabile il valore numerico o booleano, abbiamo utilizzato un modello supervisore (anthropic/claude-sonnet-4.5) come parser.
  • Fase 2: confronto basato sulla tolleranza: Una semplice "corrispondenza esatta" non è sufficiente per i problemi numerici. Pertanto, la risposta estratta è stata confrontata in modo programmatico con la verità di riferimento. Lo script applica una soglia di tolleranza numerica (una differenza relativa dello 0,2%) per gestire in modo equo le piccole variazioni dovute a virgola mobile o arrotondamento, garantendo che le soluzioni concettualmente corrette siano considerate corrette.

2. Metrica secondaria: consumo di token

Questa metrica risponde alla domanda: "Quanto è costoso dal punto di vista computazionale per il modello risolvere questi problemi?" Misura il costo totale associato alla generazione delle 238 risposte.

  • Calcolo dei token: Per ogni chiamata API abbiamo raccolto prompt_tokens e completion_tokens dall'oggetto usage del provider. Il punteggio token per modello è la somma dei completion_tokens in tutte le 238 domande. Riportiamo i token di completamento (non i token totali) perché l'input è quasi costante tra i modelli che condividono lo stesso dataset (66k-92k token di input per esecuzione a seconda del tokenizzatore).
  • Calcolo del costo: Abbiamo calcolato il costo in dollari come prompt_tokens × prompt_price_per_M + completion_tokens × completion_price_per_M, sommato su tutte le 238 domande. I prezzi sono le tariffe per token indicate dall'endpoint OpenRouter /api/v1/models al momento dell'esecuzione del modello.

Questo approccio a due metriche, fornito dal benchmark FinanceReasoning stesso, consente una valutazione olistica, bilanciando la capacità pura di risoluzione dei problemi di un modello (accuratezza) con la sua efficienza operativa (consumo di token).

Lascia che il nostro team automatizzi uno dei tuoi processi aziendali con agenti IA, gratuitamente.
Automatizza un processo

Ragionamento finanziario con generazione aumentata da recupero (RAG)

Per superare i modelli autonomi, abbiamo progettato e implementato un RAG framework personalizzato e distinto dall'implementazione originale del benchmark. Il nostro approccio si basa su uno stack moderno di database vettoriali (Qdrant) per fornire ai LLM conoscenze pertinenti e specifiche del dominio al momento dell'inferenza, aiutandoli a risolvere problemi che vanno oltre i loro dati di addestramento. Lo abbiamo testato su gpt-4o-mini per misurarne l'impatto.

Risultati e analisi: il compromesso del RAG

L'introduzione del RAG ha avuto un impatto significativo e misurabile sulle prestazioni di gpt-4o-mini.

Punti chiave della valutazione del RAG:

  • Miglioramento significativo dell'accuratezza: Il RAG ha migliorato in modo dimostrabile la capacità del modello di risolvere problemi, aumentando l'accuratezza di oltre 10 punti percentuali. Ciò conferma che fornire contesto esterno e pertinente è molto efficace per compiti di ragionamento complessi e specifici del dominio.
  • Il costo dell'accuratezza: Questo guadagno di prestazioni è arrivato a un costo elevato. Il consumo totale di token è aumentato di quasi x18 e il tempo di esecuzione totale è aumentato di x20. Ciò è dovuto alle chiamate API aggiuntive per l'embedding e, soprattutto, ai prompt molto più ampi e complessi che il LLM deve elaborare.
  • Implicazioni per i modelli più grandi: I risultati di gpt-4o-mini suggeriscono che, sebbene il RAG possa sbloccare prestazioni più elevate, applicare questo metodo a modelli più grandi e costosi come GPT-4o o Claude Opus sarà sostanzialmente più costoso e dispendioso in termini di tempo. Ciò evidenzia il compromesso critico tra accuratezza, costo e latenza nella progettazione di sistemi di intelligenza artificiale finanziaria di livello produzione.

Metodologia RAG per il ragionamento finanziario

La nostra pipeline RAG è costruita su uno stack moderno che utilizza Qdrant come database vettoriale e il modello text-embedding-3-small di OpenAI per generare rappresentazioni vettoriali semantiche. Il processo è composto da due fasi principali: una fase di indicizzazione offline e una fase di recupero-generazione online.

1. Indicizzazione del corpus di conoscenza

  • Creazione del corpus: Abbiamo curato una base di conoscenza specializzata da due fonti fornite dal benchmark:
    1. Documenti finanziari: Una raccolta di articoli (financial_documents.json) che spiegano vari concetti e termini finanziari.
    2. Funzioni finanziarie: Una libreria di funzioni Python pronte all'uso (functions-article-all.json) progettate per risolvere calcoli finanziari specifici.
  • Suddivisione intelligente e embedding: Per preparare questo corpus a un recupero efficiente, ogni documento e funzione è stato elaborato e indicizzato:
    1. Suddivisione in chunk: I documenti sono stati segmentati in chunk più piccoli e semanticamente coerenti in base alle loro sezioni. Ogni funzione Python è stata trattata come un singolo chunk atomico. Ciò garantisce che il contesto recuperato sia mirato e pertinente.
    2. Embedding: Ogni chunk è stato poi convertito in un vettore di 1536 dimensioni utilizzando il modello text-embedding-3-small.
    3. Indicizzazione: Questi vettori sono stati indicizzati in due raccolte separate all'interno della nostra istanza locale di Qdrant (financial_documents_openai_small e financial_functions_openai_small), ottimizzate per la ricerca per similarità del coseno.

2. Inferenza basata su RAG

Per ciascuna delle 238 domande, il processo di ragionamento del modello è stato potenziato con i seguenti passaggi automatizzati:

  1. Generazione degli embedding (chiamate API 1 e 2): La query dell'utente (domanda + contesto) è stata convertita in un vettore di embedding. Ciò ha richiesto due chiamate all'API di embedding di OpenAI per preparare le ricerche in entrambe le raccolte.
  2. Recupero da più fonti: Il vettore della query è stato utilizzato per eseguire una ricerca semantica simultanea in entrambe le raccolte Qdrant al fine di recuperare le informazioni più pertinenti:
    • I 3 chunk di documenti più pertinenti dalla raccolta financial_documents.
    • Le 2 funzioni Python più pertinenti dalla raccolta financial_functions.
  3. Integrazione nel prompt: I documenti e le funzioni recuperati sono stati inseriti dinamicamente nel prompt, creando un ricco "pacchetto informativo" consapevole del contesto. Ciò ha aumentato significativamente la dimensione del prompt di input (da ~300-500 token a ~3.000-5.000+ token).
  4. Generazione della risposta finale (chiamata API 3): Questo prompt aumentato è stato inviato al modello gpt-4o-mini per generare la risposta finale e ragionata.

LLM nella finanza: limiti del benchmark

Il nostro benchmark, sebbene completo, è soggetto a diversi limiti fondamentali:

  • Rischio di contaminazione dei dati: È possibile che questi modelli siano stati addestrati sul dataset del benchmark poiché il dataset è pubblico. Ciò potrebbe portare a punteggi gonfiati, rendendo difficile valutare la reale capacità di ragionamento.
  • Analisi RAG su un singolo modello: La valutazione RAG è stata eseguita su un solo modello (gpt-4o-mini), quindi i compromessi osservati tra prestazioni e costi potrebbero non valere per tutti gli altri modelli.

Conclusione

Il nostro benchmark di 40+ modelli su compiti complessi di ragionamento finanziario mostra quanto segue:

gpt-5.6-sol-pro raggiunge la più alta accuratezza del benchmark con il 90,76%, 385.886 token a $16,35 per esecuzione. gpt-5.6-sol e claude-fable-5 sono a pari merito al 90,34%.

gpt-5.6-sol eguaglia il 90,34% di claude-fable-5 a $3,85 per esecuzione contro i $10,05 di fable-5, il costo più basso nella fascia di accuratezza del 90,34%.

claude-opus-4.8 ottiene il 89,08% con 113.434 token per $3,28, superiore a gpt-5-2025-08-07 (88,23%) con circa 7x in meno di token di output e meno della metà del costo ($3,28 contro $8,38), e rimane il modello più economico con accuratezza superiore all'88%.

claude-opus-4.6 (87,82%, 164.369 token) e gpt-5-mini-2025-08-07 (87,39%, 595.505 token) raggiungono un'accuratezza quasi ai vertici. gpt-5.6-terra raggiunge l'86,97% a $1,99, il costo più basso tra i tre modelli a pari merito a tale accuratezza.

gemini-3.1-pro-preview (86,55%) è superiore a gemini-3-pro-preview (86,13%) con il 35% di token in meno, quindi gli aggiornamenti iterativi possono migliorare sia l'accuratezza sia l'efficienza.

gemini-3-flash-preview raggiunge l'83,61% con 118.530 token a $0,39, e gpt-5.2 raggiunge l'86,13% con 247.660 token.

Il RAG ha aumentato l'accuratezza di gpt-4o-mini di 10.08 punti al costo di 17.7x i token e 20x la latenza.

Non perderti i nostri benchmark e approfondimenti basati sui dati. Il pulsante apre Google; selezionare AIMultiple conferma che desideri vedere AIMultiple più spesso nei risultati di ricerca di Google.
GoogleAggiungi come fonte preferita

Registro delle modifiche

Aggiungiamo modelli a questo benchmark a ogni nuova release.

9 settembre 2026

  • OpenAI: GPT-6 Astra (openai/gpt-6-astra).
  • Anthropic: Claude Fable 5.1 (anthropic/claude-fable-5.1)

10 luglio 2026

  • OpenAI: GPT-5.6 Sol (openai/gpt-5.6-sol)
  • OpenAI: GPT-5.6 Terra (openai/gpt-5.6-terra)
  • OpenAI: GPT-5.6 Sol Pro (openai/gpt-5.6-sol-pro)

30 giugno 2026

  • Anthropic: Claude Sonnet 5 (anthropic/claude-sonnet-5)

22 giugno 2026

  • Zhipu IA: GLM-5.2 (z-ai/glm-5.2)

10 giugno 2026

  • Anthropic: Claude Fable 5 (anthropic/claude-fable-5)

2 giugno 2026

  • Anthropic: Claude Opus 4.8 (anthropic/claude-opus-4.8)

22 maggio 2026

  • Google: Gemini 3.5 Flash (google/gemini-3.5-flash)
  • xAI: Grok 4.3 (x-ai/grok-4.3)
  • Aggiunta la colonna del costo per esecuzione del benchmark e l'interruttore del grafico accuratezza-costo. Metodologia aggiornata con la formula per il calcolo dei costi e la modifica dell'estrattore di risposte (claude-sonnet-4.5)

20 aprile 2026

  • Anthropic: Claude Opus 4.7 (anthropic/claude-opus-4.7)

20 febbraio 2026

  • Google: Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview)
  • Anthropic: Claude Sonnet 4.6 (anthropic/claude-sonnet-4.6)

6 febbraio 2026

  • Anthropic: Claude Opus 4.6 (anthropic/claude-opus-4.6)
  • Anthropic: Claude Opus 4.5 (anthropic/claude-opus-4.5)
  • Anthropic: Claude Sonnet 4.5 (anthropic/claude-sonnet-4.5)
  • Google: Gemini 3 Pro Preview (google/gemini-3-pro-preview)
  • Google: Gemini 3 Flash Preview (google/gemini-3-flash-preview)
  • OpenAI: GPT-5.2 (openai/gpt-5.2)
  • Moonshot IA: Kimi K2.5 (moonshotai/kimi-k2.5)

Approfondimenti

L'analisi finanziaria può riferirsi a molteplici capacità, come l'analisi azionaria, l'interpretazione del diritto finanziario e il ragionamento finanziario. Nel nostro benchmark ci siamo concentrati specificamente sul ragionamento finanziario, mentre altre attività sono trattate in articoli separati:

  • LLM per l'analisi azionaria: Questi modelli aiutano a elaborare dati di mercato, report aziendali e notizie per individuare opportunità di investimento. (Vedi l'analisi completa qui: Trading azionario basato sull'IA)
  • IA per il diritto finanziario: Alcuni LLM possono interpretare regolamenti finanziari, contratti e requisiti di conformità per supportare le attività legale-finanziarie. (Consulta il nostro elenco di strumenti di IA legale qui: Strumenti di IA legale)

FAQ

Un LLM (modello linguistico di grandi dimensioni) nella finanza è un modello di intelligenza artificiale che utilizza tecniche di elaborazione del linguaggio naturale per eseguire analisi finanziarie complesse, gestione della conformità e comprensione dei documenti. Questi modelli aiutano le istituzioni finanziarie a orientarsi tra normativa finanziaria, requisiti normativi e le esigenze dinamiche del settore finanziario.

Chatbot intelligenti:
LLM-driven virtual assistants enable financial firms to provide automated, 24/7 customer support by handling routine queries and onboarding tasks without human intervention. This reduces wait times and improves customer satisfaction while freeing human agents for complex issues.

Consulenza e analisi:
Le banche di investimento utilizzano i LLM per analizzare tendenze di mercato, notizie finanziarie e dati dei clienti. Questi modelli assimilano grandi volumi di informazioni non strutturate, consentendo ai consulenti di offrire consulenza personalizzata sugli investimenti e gestione del portafoglio con approfondimenti in tempo reale.

Analisi dei documenti normativi:
Studi legali e istituzioni finanziarie impiegano i LLM per elaborare documenti normativi densi come i documenti SEC. Questi modelli estraggono informazioni chiave e riassumono i report, riducendo il tempo di revisione manuale e aiutando le aziende a rimanere conformi alle normative in evoluzione

Rilevamento delle frodi:
LLM analizzano vasti dataset finanziari in tempo reale per rilevare modelli di transazioni sospette e tattiche di frode emergenti. Le loro capacità di apprendimento continuo consentono un'identificazione delle frodi più rapida e accurata rispetto ai metodi tradizionali.

Automazione legale e di conformità:
Studi legali e team di conformità utilizzano i LLM per esaminare contratti, interpretare leggi bancarie e verificare la conformità normativa. L'automazione di queste attività riduce i tempi di revisione e i costi legali, garantendo al contempo il rispetto delle complesse normative finanziarie.

Domande e risposte sui documenti e riconoscimento delle entità nominate (NER):
Le istituzioni finanziarie impiegano i LLM per rispondere alle domande degli investitori estraendo dati da report finanziari e call sugli utili. Il NER consente la marcatura automatica di nomi di aziende, ticker azionari (simboli di negoziazione di classe) ed entità regolamentate, semplificando il recupero dei dati.

Efficienza e automazione: I LLM automatizzano le analisi di routine (ad esempio riassumere report sugli utili, elaborare prestiti o documenti), facendo risparmiare ore agli analisti e riducendo gli errori.

Assistenza clienti 24/7: Gli assistenti virtuali e i chatbot basati su LLM possono gestire le richieste dei clienti 24 ore su 24 con risposte conversazionali, migliorando l'esperienza e la soddisfazione del cliente.

Consulenza finanziaria personalizzata: Analizzando la storia e il profilo di rischio del cliente, i LLM forniscono consulenza finanziaria o di investimento su misura.

Rilevamento delle frodi e gestione del rischio: I LLM esaminano grandi dataset di transazioni per individuare anomalie o modelli di frode, adattandosi alle nuove tattiche di truffa e contribuendo a costruire profili di rischio.

Conformità e reporting: I LLM redigono automaticamente report normativi, estraggono fatti rilevanti per le policy e aiutano a interpretare leggi e regolamenti finanziari complessi ai fini della conformità.

Sì, esistono diversi modelli specifici del dominio per la finanza. Ad esempio, BloombergGPT è progettato per supportare la regolamentazione finanziaria, i mercati dei capitali e la gestione della conformità elaborando grandi dataset finanziari, inclusi documenti della borsa valori nazionale e documenti normativi.

Altri modelli come FinBERT e FinGPT si concentrano sul diritto finanziario, sul diritto bancario internazionale e sulla consulenza finanziaria personalizzata, adattando i modelli linguistici di grandi dimensioni al vocabolario specializzato della finanza, come i simboli di negoziazione di classe e i testi normativi.

Il ragionamento finanziario è la capacità di analizzare i dati finanziari per prendere decisioni aziendali o di investimento informate.

Le attività principali includono:
– Analizzare i bilanci (profitto, flusso di cassa, stato patrimoniale)
– Budget e previsioni
– Valutare gli investimenti (VAN, TIR, ROI)
– Gestire flusso di cassa e liquidità
– Valutare i rischi finanziari e gli indici di performance

Cita questo benchmark

Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.

Ekrem Sarı (2026) - "Benchmark di 40+ LLM nella finanza: Claude Fable 5 e GPT-5.6 Sol". Pubblicato online su AIMultiple.com. Consultato il 28 settembre 2026, da: https://aimultiple.com/finance-llm [Risorsa online]

Sarı, E. (2026, 28 settembre). Benchmark di 40+ LLM nella finanza: Claude Fable 5 e GPT-5.6 Sol. AIMultiple. https://aimultiple.com/finance-llm

@misc{sari2026,
  author = {Sarı, Ekrem},
  title  = {{Benchmark di 40+ LLM nella finanza: Claude Fable 5 e GPT-5.6 Sol}},
  year   = {2026},
  month  = sep,
  howpublished    = {\url{https://aimultiple.com/finance-llm}},
  note   = {AIMultiple. Consultato il 28 settembre 2026}
}
Scarica tutti i dati

Risultati e timestamp di 58 punti dati. Scarica i dati di sintesi mostrati nei grafici e nelle tabelle di questo articolo come file ZIP contenente 2 file CSV.

Ultimo aggiornamento: 28 settembre 2026
Scarica

Vuoi i dati granulari che ci stanno dietro? Passa a Premium

Ekrem Sarı
Ekrem Sarı
Ricercatore IA
Ekrem è un Ricercatore IA e Data Scientist presso AIMultiple. Progetta ed esegue benchmark pratici per sistemi di IA e LLM.
Visualizza il profilo completo

Sii il primo a commentare

Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.

0/450