Avaliamos 40+ LLMs em finanças em 238 perguntas difíceis do benchmark FinanceReasoning para identificar quais modelos se destacam em tarefas complexas de raciocínio financeiro, como análise de demonstrações, previsões e cálculos de índices.
Visão geral do benchmark financeiro de LLMs
Avaliamos LLMs em 238 perguntas difíceis do benchmark FinanceReasoning (Tang et al.).1 Este subconjunto tem como alvo as tarefas de raciocínio financeiro mais desafiadoras, avaliando o raciocínio quantitativo complexo e de múltiplas etapas envolvendo conceitos e fórmulas financeiras. Nossa avaliação empregou um design de prompt personalizado e critérios de pontuação de precisão e consumo de tokens.
Para uma explicação detalhada de como essas métricas foram calculadas e do framework utilizado para esta avaliação, consulte nossa metodologia do benchmark financeiro.
Resultados: Qual LLM é o melhor para finanças?
Desempenhos de primeira linha (>83% de precisão):
gpt-5.6-sol-pro atinge a maior precisão do benchmark com 90.76% com 385,886 tokens a $16.35 por execução, 0.42 pontos acima do gpt-5.6-sol.
gpt-5.6-sol obtém 90.34% de precisão com 117,735 tokens a $3.85 por execução. Empata com claude-fable-5 (90.34%) pela segunda maior precisão, a $3.85 contra $10.05 do fable-5 e 117,735 tokens contra 183,258. Nenhum modelo com precisão igual ou superior funciona com custo mais baixo.
claude-fable-5 obtém 90.34% de precisão com 183,258 tokens. Foi o primeiro modelo a ultrapassar 90% neste benchmark (10 de junho) e empata com gpt-5.6-sol em 90.34%, a $10.05 por execução contra $3.85 do gpt-5.6-sol.
claude-opus-4.8 obtém 89.08% de precisão com 113,434 tokens, o terceiro maior resultado com o menor número de tokens de saída entre os modelos acima de 88%.
gpt-5-2025-08-07 obtém 88.23% de precisão com 829,720 tokens.
claude-opus-4.6 obtém 87.82% de precisão com 164,369 tokens, precisão quase no topo com 20% da contagem de tokens do gpt-5.
gpt-5-mini-2025-08-07 atinge 87.39% de precisão com 595,505 tokens.
gemini-3.5-flash atinge 86.97% de precisão com 1,191,757 tokens, a maior precisão na linha Flash do Google e o maior consumidor de tokens da família.
claude-sonnet-5 obtém 86.97% de precisão com 414,668 tokens. Iguala gemini-3.5-flash até a casa decimal gastando 414,668 tokens contra 1,191,757, a $4.33 por execução contra $10.83.
gpt-5.6-terra obtém 86.97% de precisão com 121,936 tokens a $1.99 por execução. Junta-se a claude-sonnet-5 e gemini-3.5-flash em 86.97%, com a menor contagem de tokens e custo dos três (121,936 tokens e $1.99, contra 414,668 / $4.33 e 1,191,757 / $10.83). gpt-5-mini-2025-08-07 permanece mais barato e mais preciso ($1.21, 87.39%).
gemini-3.1-pro-preview obtém 86.55% de precisão com 475,148 tokens, acima do seu antecessor gemini-3-pro-preview (86.13%) com 35% menos tokens (730,759 tokens).
glm-5.2 obtém 86.13% de precisão com 735,988 tokens. Melhora em relação ao glm-4.5 (64.29%) em 21.84 pontos, o maior salto entre duas versões de uma mesma família de modelos no benchmark. O segundo maior é de 3.79 pontos.
gemini-3-pro-preview e gpt-5.2 empatam em 86.13% de precisão. O gpt-5.2 atinge esse valor com 247,660 tokens, cerca de três vezes menos tokens de saída do que o gemini-3-pro-preview com 730,759 tokens.
claude-opus-4.7 obtém 85.29% de precisão com 103,268 tokens, o modelo mais eficiente em tokens no nível superior (37% menos tokens de saída do que o claude-opus-4.6 superando o limiar de 83%).
Desempenhos fortes (80-83% de precisão):
grok-4.3 atinge 84.87% de precisão com 309,781 tokens, o melhor resultado da xAI no benchmark e uma recuperação em relação ao anterior grok-4-0709.
claude-opus-4.5 obtém 84.03% de precisão com 144,505 tokens.
claude-sonnet-4.6 e gemini-3-flash-preview empatam em 83.61% de precisão. O Claude Sonnet 4.6 usa 161,035 tokens, enquanto o Gemini 3 Flash Preview atinge esse valor com 118,530 tokens, a menor contagem de tokens entre os modelos acima de 83%.
kimi-k2.5 obtém 82.77% de precisão com 877,868 tokens, o maior consumo neste nível de desempenho.
Nível intermediário (70-80% de precisão):
o3-pro-2025-06-10 (78.15% de precisão, 473,659 tokens) e kimi-k2 (78.15% de precisão, 100,323 tokens) empatam, e o kimi-k2 usa 79% menos tokens. o3-mini-2025-01-31 (77.31% de precisão, 376,929 tokens), gpt-5-nano-2025-08-07 (76.89% de precisão, 1,028,909 tokens) e claude-sonnet-4-20250514 (76.05% de precisão, 135,462 tokens) vêm em seguida.
Desempenhos baixos (<70% de precisão):
claude-3-5-sonnet-20241022 (67.65% de precisão, 90,103 tokens) e gpt-oss-20b (67.65% de precisão, 515,041 tokens) lideram este nível. gemini-2.5-flash (65.55% de precisão, 286,603 tokens), glm-4.5 (64.29% de precisão, 692,662 tokens) e gpt-4.1-nano-2025-04-14 (63.45% de precisão, 171,096 tokens) vêm em seguida.
Insights de desempenho:
O consumo de tokens não acompanha a precisão. O deepseek-r1-0528 consumiu mais tokens (1,251,064) com 62.18% de precisão, enquanto o claude-opus-4-20250514 obteve 80.25% com 132,274 tokens. A eficiência de tokens também varia entre modelos de alta precisão: o gemini-3-flash-preview atinge 83.61% com 118,530 tokens, enquanto o kimi-k2.5 gasta 877,868 tokens para 82.77% (7.4x mais tokens para 0.84 pontos a menos de precisão).
A tabela acima apresenta outros benchmarks de modelos de IA, incluindo aqueles utilizados para este benchmark.
Custo por execução do benchmark
Os tokens de saída por si só não determinam o gasto, já que as taxas de tokens de entrada e de saída diferem em uma ordem de magnitude na maioria dos provedores. Calculamos o custo em dólares da execução de cada modelo nas 238 perguntas usando a taxa por token listada pelo provedor no momento da execução.
Menor custo no nível de fronteira: o gemini-3-flash-preview atinge 83.61% de precisão por $0.39, o menor custo em dólares na faixa de precisão >83%. O grok-4.3 vem em seguida com $0.86 para 84.87%.
O nível de 90.34% é alcançado com um custo mais baixo: o gpt-5.6-sol iguala os 90.34% do claude-fable-5 a $3.85 por execução contra $10.05 do fable-5, a 38% do custo do fable-5. O gpt-5.6-sol-pro registra a maior precisão do benchmark, 90.76%, a $16.35 por execução. O claude-opus-4.8 continua sendo o modelo mais barato a superar 88%, a $3.28 para 89.08%.
Raciocínio premium com preço premium: o o1-pro é o modelo de maior custo no benchmark, a $381 para 80.67% de precisão (devido às taxas de $150/M de entrada e $600/M de saída). O o3-pro custa $39.23 para 78.15%, o o1 custa $46.59 para 74.79%. Nenhum supera o nível superior e todos os três ficam abaixo do claude-opus-4.7 em precisão, com mais de 10x o seu custo.
Custo e precisão do nível econômico: o gpt-oss-120b atinge 81.09% de precisão a $0.06 no total, a execução mais barata do benchmark, a 1.91 pontos do limiar de 83%. O llama-4-maverick atinge 75.21% a $0.10. Para cargas de trabalho em que 80% de precisão é suficiente, esses modelos custam menos de 1% dos carros-chefe de fronteira.
Metodologia do benchmark de raciocínio financeiro
Nosso benchmark fornece uma avaliação transparente e reproduzível do desempenho de LLMs em tarefas complexas de raciocínio financeiro.
Configuração do teste e corpus de dados
- Suíte de benchmark: Usamos os dados, código e scripts de avaliação do benchmark FinanceReasoning, selecionado por seu foco em problemas financeiros quantitativos e inferenciais.
- Corpus de conhecimento e consultas de teste: Concentramos nossa análise no subconjunto difícil, composto por 238 perguntas desafiadoras. Conforme definido pelo benchmark, cada ponto de dados inclui:
- Uma pergunta que exige dedução lógica e numérica de múltiplas etapas.
- Um contexto, que frequentemente contém informações densas apresentadas em formatos estruturados como tabelas Markdown (por exemplo, balanços patrimoniais, dados de desempenho de ações).
- Uma resposta de referência definitiva para pontuação objetiva.
- Tipos de consultas ilustrativas: A dificuldade do benchmark decorre de sua exigência de que os modelos lidem com tarefas de raciocínio financeiro diversas e complexas. Para ilustrar essa amplitude, destacamos dois exemplos representativos do conjunto de teste:
Exemplo: Raciocínio algorítmico e de séries temporais (análise técnica)
Contexto: Um investidor está analisando… preços de ações nos últimos 25 dias… para calcular o Canal de Keltner usando um período EMA de 10 dias e um período ATR de 10 dias, com um multiplicador de 1.5…
Pergunta: Qual é o valor da última banda superior no Canal de Keltner…? Responda com duas casas decimais.
Esta consulta testa a capacidade de um modelo de atuar como analista quantitativo ao:
- Desconstruir um indicador composto: Reconhecer que o "Canal de Keltner" é derivado de dois outros indicadores complexos:
- A média móvel exponencial (EMA)
- O average true range (ATR).
- Implementar lógica algorítmica: Implementar corretamente os algoritmos iterativos para EMA e ATR do zero em uma série temporal de 25 pontos de dados.
- Sintetizar resultados: Combinar os valores calculados de acordo com a fórmula final do Canal de Keltner (Banda Superior = EMA + (Multiplicador × ATR)).
Princípios fundamentais de avaliação
- Chamadas de API isoladas e padronizadas: Para cada modelo, realizamos a avaliação programaticamente por meio de seus respectivos API endpoints (por exemplo, OpenRouter, OpenAI). Isso garantiu que cada modelo recebesse exatamente a mesma entrada em condições idênticas, eliminando a variabilidade das interações na interface.
- Geração de forma livre: Não restringimos os modelos a um formato de múltipla escolha. Em vez disso, eles foram instruídos a gerar uma resposta abrangente e de forma gratuito, permitindo uma avaliação mais autêntica de suas capacidades de raciocínio.
- Prompting Chain-of-Thought (CoT): Para elicitar e avaliar o processo de raciocínio dos modelos, empregamos uma estratégia de prompting Chain-of-Thought (CoT). O prompt do sistema instruiu explicitamente cada modelo a "primeiro pensar no problema passo a passo" antes de concluir com uma resposta final. Essa abordagem permite uma análise mais profunda de como um modelo chega à sua conclusão, além do resultado final.
Métricas e framework de avaliação
Utilizamos o próprio framework de avaliação totalmente automatizado do benchmark FinanceReasoning para pontuar os resultados dos modelos. Este framework é projetado para medir tanto a correção conceitual quanto o custo computacional.
1. Métrica primária: Precisão
Esta métrica responde à pergunta crítica: "O modelo consegue resolver corretamente o problema financeiro?" O processo de pontuação envolve um pipeline sofisticado de duas etapas:
- Etapa 1: Extração de resposta baseada em LLM: O resultado bruto de um modelo é texto não estruturado contendo tanto o raciocínio quanto uma resposta final. Para analisar de forma confiável o valor numérico ou booleano, usamos um modelo supervisor (anthropic/claude-sonnet-4.5) como parser.
- Etapa 2: Comparação baseada em tolerância: Uma simples "correspondência exata" é insuficiente para problemas numéricos. Portanto, a resposta extraída foi comparada programaticamente com a referência. O script aplica um limiar de tolerância numérica (uma diferença relativa de 0.2%) para lidar de forma justa com pequenas variações de ponto flutuante ou arredondamento, garantindo que soluções conceitualmente corretas sejam marcadas como corretas.
2. Métrica secundária: Consumo de tokens
Esta métrica responde à pergunta: "Quão caro computacionalmente é para o modelo resolver esses problemas?" Ela mede o custo total associado à geração das 238 respostas.
- Cálculo de tokens: Para cada chamada de API, coletamos prompt_tokens e completion_tokens do objeto de uso do provedor. A pontuação de tokens por modelo é a soma dos completion_tokens em todas as 238 perguntas. Relatamos os tokens de conclusão (não os tokens totais) porque a entrada é quase constante entre os modelos que compartilham o mesmo dataset (66k-92k tokens de entrada por execução, dependendo do tokenizer).
- Cálculo de custo: Calculamos o custo em dólares como prompt_tokens × prompt_price_per_M + completion_tokens × completion_price_per_M, somados em todas as 238 perguntas. Os preços são as taxas por token listadas no endpoint /api/v1/models do OpenRouter no momento em que o modelo foi executado.
Esta abordagem de duas métricas, fornecida pelo próprio benchmark FinanceReasoning, permite uma avaliação holística, equilibrando a capacidade bruta de resolução de problemas de um modelo (precisão) com sua eficiência operacional (consumo de tokens).
Raciocínio financeiro com Retrieval-Augmented Generation (RAG)
Para superar os modelos autônomos, projetamos e implementamos um framework de RAG personalizado, distinto da implementação original do benchmark. Nossa abordagem é construída sobre um stack moderno de banco de dados vetorial (Qdrant) para fornecer aos LLMs conhecimento relevante e específico do domínio no momento da inferência, ajudando-os a resolver problemas além de seus dados de treinamento. Testamos isso no gpt-4o-mini para medir seu impacto.
Resultados e análise: O trade-off do RAG
A introdução do RAG teve um impacto significativo e mensurável no desempenho do gpt-4o-mini.
Principais conclusões da avaliação de RAG:
- Melhoria significativa na precisão: O RAG melhorou comprovadamente a capacidade de resolução de problemas do modelo, aumentando a precisão em mais de 10 pontos percentuais. Isso confirma que fornecer contexto externo relevante é altamente eficaz para tarefas complexas de raciocínio específicas de domínio.
- O custo da precisão: Este ganho de desempenho veio com um alto custo. O consumo total de tokens aumentou em quase x18 e o tempo total de execução aumentou em x20. Isso se deve às chamadas adicionais de API para embedding e, mais importante, aos prompts muito maiores e mais complexos que o LLM precisa processar.
- Implicações para modelos maiores: Os resultados do gpt-4o-mini sugerem que, embora o RAG possa desbloquear maior desempenho, aplicar esse método a modelos maiores e mais caros como GPT-4o ou Claude Opus será substancialmente mais caro e demorado. Isso destaca o trade-off crítico entre precisão, custo e latência no design de sistemas de IA financeira em nível de produção.
Metodologia de RAG para raciocínio financeiro
Nosso pipeline de RAG é construído sobre um stack moderno usando o Qdrant como banco de dados vetorial e o modelo text-embedding-3-small da OpenAI para gerar representações vetoriais semânticas. O processo consiste em duas fases principais: uma fase de indexação offline e uma fase de recuperação-geração online.
1. Indexação do corpus de conhecimento
- Criação do corpus: Curamos uma base de conhecimento especializada a partir de duas fontes fornecidas pelo benchmark:
- Documentos financeiros: Uma coleção de artigos (financial_documents.json) explicando vários conceitos e termos financeiros.
- Funções financeiras: Uma biblioteca de funções Python prontas para uso (functions-article-all.json) projetadas para resolver cálculos financeiros específicos.
- Chunking e embedding inteligentes: Para preparar este corpus para recuperação eficiente, cada documento e função foi processado e indexado:
- Chunking: Os documentos foram segmentados em chunks menores e semanticamente coerentes com base em suas seções. Cada função Python foi tratada como um único chunk atômico. Isso garante que o contexto recuperado seja focado e relevante.
- Embedding: Cada chunk foi então convertido em um vetor de 1536 dimensões usando o modelo text-embedding-3-small.
- Indexação: Esses vetores foram indexados em duas coleções separadas dentro da nossa instância local do Qdrant (financial_documents_openai_small e financial_functions_openai_small), otimizadas para busca por similaridade de cosseno.
2. Inferência com RAG
Para cada uma das 238 perguntas, o processo de raciocínio do modelo foi aumentado com as seguintes etapas automatizadas:
- Geração de embedding (chamadas de API 1 e 2): A consulta do usuário (pergunta + contexto) foi convertida em um vetor de embedding. Isso exigiu duas chamadas à API de embedding da OpenAI para preparar as buscas em ambas as coleções.
- Recuperação de múltiplas fontes: O vetor de consulta foi usado para realizar uma busca semântica em ambas as coleções do Qdrant simultaneamente para recuperar as informações mais relevantes:
- Os 3 chunks de documentos mais relevantes da coleção financial_documents.
- As 2 funções Python mais relevantes da coleção financial_functions.
- Aumento do prompt: Os documentos e funções recuperados foram injetados dinamicamente no prompt, criando um "pacote de informações" rico e consciente do contexto. Isso aumentou significativamente o tamanho do prompt de entrada (de ~300-500 tokens para ~3,000-5,000+ tokens).
- Geração da resposta final (chamada de API 3): Este prompt aumentado foi enviado ao modelo gpt-4o-mini para gerar a resposta final e fundamentada.
Limitações do benchmark de LLMs em finanças
Nosso benchmark, embora abrangente, está sujeito a várias limitações importantes:
- Risco de contaminação de dados: É possível que esses modelos tenham sido treinados com o dataset do benchmark, já que o dataset é público. Isso poderia levar a pontuações infladas, dificultando a avaliação da verdadeira capacidade de raciocínio.
- Análise de RAG em modelo único: A avaliação de RAG foi realizada em um modelo (gpt-4o-mini), portanto os trade-offs observados entre desempenho e custo podem não se aplicar a todos os outros modelos.
Conclusão
Nosso benchmark de 40+ modelos em tarefas complexas de raciocínio financeiro mostra o seguinte:
O gpt-5.6-sol-pro atinge a maior precisão do benchmark com 90.76% com 385,886 tokens a $16.35 por execução. O gpt-5.6-sol e o claude-fable-5 empatam em 90.34%.
O gpt-5.6-sol iguala os 90.34% do claude-fable-5 a $3.85 por execução contra $10.05 do fable-5, o menor custo no nível de precisão de 90.34%.
O claude-opus-4.8 obtém 89.08% com 113,434 tokens por $3.28, acima do gpt-5-2025-08-07 (88.23%) com cerca de 7x menos tokens de saída e menos da metade do custo ($3.28 vs $8.38), e continua sendo o modelo mais barato acima de 88% de precisão.
O claude-opus-4.6 (87.82%, 164,369 tokens) e o gpt-5-mini-2025-08-07 (87.39%, 595,505 tokens) atingem precisão quase no topo. O gpt-5.6-terra atinge 86.97% a $1.99, o menor custo entre os três modelos empatados nessa precisão.
O gemini-3.1-pro-preview (86.55%) está acima do gemini-3-pro-preview (86.13%) com 35% menos tokens, mostrando que atualizações iterativas podem melhorar tanto a precisão quanto a eficiência.
O gemini-3-flash-preview atinge 83.61% com 118,530 tokens a $0.39, e o gpt-5.2 atinge 86.13% com 247,660 tokens.
O RAG aumentou a precisão do gpt-4o-mini em 10.08 pontos ao custo de 17.7x mais tokens e 20x mais latência.
Registro de alterações
Adicionamos modelos a este benchmark a cada novo lançamento.
10 de julho de 2026
- OpenAI: GPT-5.6 Sol (openai/gpt-5.6-sol)
- OpenAI: GPT-5.6 Terra (openai/gpt-5.6-terra)
- OpenAI: GPT-5.6 Sol Pro (openai/gpt-5.6-sol-pro)
30 de junho de 2026
- Anthropic: Claude Sonnet 5 (anthropic/claude-sonnet-5)
22 de junho de 2026
- Zhipu IA: GLM-5.2 (z-ai/glm-5.2)
10 de junho de 2026
- Anthropic: Claude Fable 5 (anthropic/claude-fable-5)
2 de junho de 2026
- Anthropic: Claude Opus 4.8 (anthropic/claude-opus-4.8)
22 de maio de 2026
- Google: Gemini 3.5 Flash (google/gemini-3.5-flash)
- xAI: Grok 4.3 (x-ai/grok-4.3)
- Adicionada a coluna de custo por execução do benchmark e a alternância do gráfico precisão vs custo. Metodologia atualizada com a fórmula de cálculo de custo e a alteração do extrator de resposta (claude-sonnet-4.5)
20 de abril de 2026
- Anthropic: Claude Opus 4.7 (anthropic/claude-opus-4.7)
20 de fevereiro de 2026
- Google: Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview)
- Anthropic: Claude Sonnet 4.6 (anthropic/claude-sonnet-4.6)
6 de fevereiro de 2026
- Anthropic: Claude Opus 4.6 (anthropic/claude-opus-4.6)
- Anthropic: Claude Opus 4.5 (anthropic/claude-opus-4.5)
- Anthropic: Claude Sonnet 4.5 (anthropic/claude-sonnet-4.5)
- Google: Gemini 3 Pro Preview (google/gemini-3-pro-preview)
- Google: Gemini 3 Flash Preview (google/gemini-3-flash-preview)
- OpenAI: GPT-5.2 (openai/gpt-5.2)
- Moonshot IA: Kimi K2.5 (moonshotai/kimi-k2.5)
Leitura adicional
A análise financeira pode se referir a múltiplas capacidades, como análise de ações, interpretação de legislação financeira e raciocínio financeiro. Em nosso benchmark, focamos especificamente no raciocínio financeiro, enquanto outras tarefas são abordadas em artigos separados:
- LLM para análise de ações: Esses modelos ajudam a processar dados de mercado, relatórios de empresas e notícias para identificar oportunidades de investimento. (Veja a análise completa aqui: IA-based Stock Trading)
- IA para legislação financeira: Alguns LLMs podem interpretar regulamentações financeiras, contratos e requisitos de conformidade para auxiliar tarefas jurídico-financeiras. (Veja nossa lista de ferramentas de IA jurídica aqui: Legal IA Tools)
Perguntas frequentes
Um LLM (large language model) em finanças é um modelo de IA que usa técnicas de processamento de linguagem natural para realizar análises financeiras complexas, gestão de conformidade e compreensão de documentos. Esses modelos ajudam instituições financeiras a navegar pela legislação financeira, requisitos regulatórios e pelas demandas dinâmicas do setor financeiro.
Chatbots inteligentes:
Assistentes virtuais baseados em LLM permitem que empresas financeiras forneçam suporte ao cliente automatizado 24/7, lidando com consultas rotineiras e tarefas de integração sem intervenção humana. Isso reduz os tempos de espera e melhora a satisfação do cliente, liberando os agentes humanos para questões complexas.
Consultoria e análise:
Bancos de investimento usam LLMs para analisar tendências de mercado, notícias financeiras e dados de clientes. Esses modelos digerem grandes volumes de informações não estruturadas, permitindo que os consultores forneçam consultoria de investimento personalizada e gestão de portfólio com insights em tempo real.
Análise de documentos regulatórios:
Escritórios de advocacia e instituições financeiras empregam LLMs para processar documentos regulatórios densos, como arquivamentos na SEC. Esses modelos extraem informações-chave e resumem relatórios, reduzindo o tempo de revisão manual e ajudando as empresas a permanecerem em conformidade com regulamentações em evolução.
Detecção de fraudes:
LLMs analisam vastos datasets financeiros em tempo real para detectar padrões de transações suspeitas e táticas emergentes de fraude. Suas capacidades de aprendizado contínuo permitem uma identificação de fraudes mais rápida e precisa do que os métodos tradicionais.
Automação jurídica e de conformidade:
Escritórios de advocacia e equipes de conformidade usam LLMs para revisar contratos, interpretar leis bancárias e verificar a conformidade regulatória. Automatizar essas tarefas reduz o tempo de revisão e os custos jurídicos, garantindo a adesão a regulamentações financeiras complexas.
Perguntas e respostas sobre documentos e Named Entity Recognition (NER):
Instituições financeiras implantam LLMs para responder a perguntas de investidores extraindo dados de relatórios financeiros e teleconferências de resultados. O NER permite a marcação automática de nomes de empresas, tickers de ações (class trading symbols) e entidades regulatórias, agilizando a recuperação de dados.
Eficiência e automação: LLMs automatizam análises rotineiras (por exemplo, resumir relatórios de resultados, processar empréstimos ou arquivamentos), economizando horas de analistas e reduzindo erros.
Atendimento ao cliente 24/7: Assistentes virtuais de IA e chatbots baseados em LLMs podem lidar com consultas de clientes 24 horas por dia com respostas conversacionais, melhorando a experiência e a satisfação do cliente.
Consultoria financeira personalizada: Ao analisar o histórico e o perfil de risco de um cliente, os LLMs fornecem consultoria financeira ou de investimento personalizada.
Detecção de fraudes e gestão de riscos: LLMs vasculham grandes datasets de transações para identificar anomalias ou padrões de fraude, adaptando-se a novas táticas de golpes e ajudando a construir perfis de risco.
Conformidade e relatórios: LLMs redigem automaticamente relatórios regulatórios, extraem fatos relevantes para políticas e ajudam a interpretar leis e regulamentações financeiras complexas para conformidade.
Sim, existem vários modelos maiores e específicos de domínio para finanças. Por exemplo, o BloombergGPT é projetado para auxiliar na regulamentação financeira, mercados de capitais e gestão de conformidade, processando grandes datasets financeiros, incluindo documentos de bolsas de valores nacionais e arquivamentos regulatórios.
Outros modelos como FinBERT e FinGPT focam em legislação financeira, direito bancário internacional e consultoria financeira personalizada, adaptando large language models ao vocabulário especializado de finanças, como class trading symbols e textos regulatórios.
Raciocínio financeiro é a capacidade de analisar dados financeiros para tomar decisões informadas de negócios ou investimentos.
As principais tarefas incluem:
– Analisar demonstrações financeiras (lucro, fluxo de caixa, balanço patrimonial)
– Orçamento e previsão
– Avaliar investimentos (VPL, TIR, ROI)
– Gerenciar fluxo de caixa e liquidez
– Avaliar riscos financeiros e índices de desempenho
Cite este benchmark
Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.
@misc{sari2026,
author = {Sarı, Ekrem},
title = {{Benchmark de 40+ LLMs em Finanças: Claude Fable 5 & GPT-5.6 Sol}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/finance-llm}},
note = {AIMultiple. Acessado em 10 Julho 2026}
}Resultados e carimbos de data/hora de 52 pontos de dados. Baixe os dados utilizados neste artigo como um arquivo ZIP contendo um arquivo CSV e um README.
Seja o primeiro a comentar
Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.