Benchmark de 40+ LLMs em Finanças: Claude Fable 5 & GPT-5.6 Sol
We evaluated 40+ LLMs in finance on 238 hard questions from the FinanceReasoning benchmark to identify which models excel at complex financial reasoning tasks.
Avaliamos LLMs em 238 perguntas difíceis do benchmark FinanceReasoning (Tang et al.).1 Este subconjunto tem como alvo as tarefas de raciocínio financeiro mais desafiadoras, avaliando raciocínio quantitativo complexo e de múltiplas etapas envolvendo conceitos e fórmulas financeiras. Nossa avaliação empregou um design de prompt personalizado e critérios de pontuação de precisão e consumo de tokens.
Para uma explicação detalhada de como essas métricas foram calculadas e o framework usado para esta avaliação, consulte nossa metodologia de benchmark financeiro.
Resultados: Qual LLM é o melhor para finanças?
Desempenhos de nível superior (>83% de precisão):
gpt-5.6-sol-pro atinge a maior precisão do benchmark com 90.76% com 385.886 tokens a $16,35 por execução, 0.42 pontos acima do gpt-5.6-sol.
gpt-5.6-sol pontua 90.34% de precisão com 117.735 tokens a $3,85 por execução. Ele empata com o claude-fable-5 (90.34%) pela segunda maior precisão, a $3,85 contra $10,05 do fable-5 e 117.735 tokens contra 183.258. Nenhum model com precisão igual ou superior à sua é executado a um custo menor.
claude-fable-5 pontua 90.34% de precisão com 183.258 tokens. Foi o primeiro model a passar de 90% neste benchmark (junho de 10) e empata com o gpt-5.6-sol em 90.34%, a $10,05 por execução contra $3,85 do gpt-5.6-sol.
claude-opus-4.8 pontua 89.08% de precisão com 113.434 tokens, o terceiro resultado com maior custo e a menor contagem de tokens de saída entre models acima de 88%.
gpt-5-2025-08-07 pontua 88.23% de precisão com 829.720 tokens.
claude-opus-4.6 pontua 87.82% de precisão com 164.369 tokens, precisão quase no topo com 20% da contagem de tokens do gpt-5.
gpt-5-mini-2025-08-07 atinge 87.39% de precisão com 595.505 tokens.
gemini-3.5-flash atinge 86.97% de precisão com 1.191.757 tokens, a maior precisão na linha Flash do Google e o maior consumidor de tokens da família.
claude-sonnet-5 pontua 86.97% de precisão com 414.668 tokens. Ele iguala o gemini-3.5-flash até a casa decimal enquanto gasta 414.668 tokens contra 1.191.757, a $4,33 por execução contra $10.83.
gpt-5.6-terra pontua 86.97% de precisão com 121.936 tokens a $1,99 por execução. Ele se junta ao claude-sonnet-5 e ao gemini-3.5-flash em 86.97%, com a menor contagem de tokens e custo dos três (121.936 tokens e $1,99, contra 414.668 / $4,33 e 1.191.757 / $10,83). O gpt-5-mini-2025-08-07 continua mais barato e mais preciso ($1,21, 87.39%).
gemini-3.1-pro-preview pontua 86.55% de precisão com 475.148 tokens, acima do seu antecessor gemini-3-pro-preview (86.13%) com 35% menos tokens (730.759 tokens).
glm-5.2 pontua 86.13% de precisão com 735.988 tokens. Ele melhora em relação ao glm-4.5 (64.29%) em 21.84 pontos, o maior salto entre duas versões de uma mesma família de models no benchmark. O próximo maior é de 3.79 pontos.
gemini-3-pro-preview e gpt-5.2 empatam com 86.13% de precisão. O gpt-5.2 atinge isso com 247.660 tokens, cerca de três vezes menos tokens de saída do que o gemini-3-pro-preview com 730.759 tokens.
claude-opus-4.7 pontua 85.29% de precisão com 103.268 tokens, o model mais eficiente em tokens no nível superior (37% menos tokens de saída do que o claude-opus-4.6, ultrapassando o limite de 83%).
Desempenhos fortes (80-83% de precisão):
grok-4.3 atinge 84.87% de precisão com 309.781 tokens, o resultado mais forte da xAI no benchmark e uma recuperação em relação ao grok-4-0709 anterior.
claude-opus-4.5 pontua 84.03% de precisão com 144.505 tokens.
claude-sonnet-4.6 e gemini-3-flash-preview empatam com 83.61% de precisão. O Claude Sonnet 4.6 usa 161.035 tokens, enquanto o Gemini 3 Flash Preview atinge isso com 118.530 tokens, a menor contagem de tokens entre models acima de 83%.
kimi-k2.5 pontua 82.77% de precisão com 877.868 tokens, o maior consumo neste nível de desempenho.
Nível intermediário (70-80% de precisão):
o3-pro-2025-06-10 (78.15% de precisão, 473.659 tokens) e kimi-k2 (78.15% de precisão, 100.323 tokens) empatam, e o kimi-k2 usa 79% menos tokens. Em seguida vêm o3-mini-2025-01-31 (77.31% de precisão, 376.929 tokens), gpt-5-nano-2025-08-07 (76.89% de precisão, 1.028.909 tokens) e claude-sonnet-4-20250514 (76.05% de precisão, 135.462 tokens).
Desempenhos baixos (<70% de precisão):
claude-3-5-sonnet-20241022 (67.65% de precisão, 90.103 tokens) e gpt-oss-20b (67.65% de precisão, 515.041 tokens) lideram este nível. Em seguida vêm gemini-2.5-flash (65.55% de precisão, 286.603 tokens), glm-4.5 (64.29% de precisão, 692.662 tokens) e gpt-4.1-nano-2025-04-14 (63.45% de precisão, 171.096 tokens).
Insights de desempenho:
O consumo de tokens não acompanha a precisão. O deepseek-r1-0528 consumiu mais tokens (1.251.064) com 62.18% de precisão, enquanto o claude-opus-4-20250514 pontuou 80.25% com 132.274 tokens. A eficiência de tokens também varia entre models de alta precisão: o gemini-3-flash-preview atinge 83.61% com 118.530 tokens, enquanto o kimi-k2.5 gasta 877.868 tokens para 82.77% (7.4x os tokens para 0.84 pontos a menos de precisão).
A tabela acima apresenta outros benchmarks de models de IA, incluindo aqueles utilizados para este benchmark.
Custo por execução do benchmark
Os tokens de saída por si só não determinam o gasto, já que as taxas de tokens de entrada e de saída diferem em uma ordem de magnitude na maioria dos provedores. Calculamos o custo em dólar de executar cada model nas 238 perguntas usando a taxa por token listada pelo provedor no momento da execução.
Menor custo no nível de fronteira: o gemini-3-flash-preview atinge 83.61% de precisão por $0,39, o menor custo em dólar na faixa de precisão >83%. O grok-4.3 vem em seguida com $0,86 para 84.87%.
O nível de 90.34% é alcançado a um custo menor: o gpt-5.6-sol iguala os 90.34% do claude-fable-5 a $3,85 por execução contra $10,05 do fable-5, a 38% do custo do fable-5. O gpt-5.6-sol-pro registra a maior precisão do benchmark, 90.76%, a $16,35 por execução. O claude-opus-4.8 continua sendo o model mais barato a superar 88%, a $3,28 para 89.08%.
Raciocínio premium a preço premium: o o1-pro é o model de maior custo no benchmark a $381 para 80.67% de precisão (impulsionado pelas taxas de $150/M de entrada e $600/M de saída). O o3-pro custa $39,23 para 78.15%, o o1 custa $46,59 para 74.79%. Nenhum supera o nível superior, e os três ficam abaixo do claude-opus-4.7 em precisão a mais de 10x o seu custo.
Custo e precisão no nível econômico: o gpt-oss-120b atinge 81.09% de precisão com um total de $0,06, a execução mais barata do benchmark, a 1.91 pontos do limite de 83%. O llama-4-maverick atinge 75.21% a $0.10. Para cargas de trabalho em que 80% de precisão é suficiente, esses models custam menos de 1% dos principais models de fronteira.
Tabela completa de resultados de LLM em finanças
A tabela abaixo lista cada model no benchmark com sua precisão medida, tokens de saída e custo por execução, além do custo de uma resposta correta.
Metodologia de benchmark de raciocínio financeiro
Nosso benchmark fornece uma avaliação transparente e reproduzível do desempenho de LLMs em tarefas complexas de raciocínio financeiro.
Configuração de teste & corpus de dados
- Suíte de benchmark: Usamos os dados, código e scripts de avaliação do benchmark FinanceReasoning, selecionado por seu foco em problemas financeiros quantitativos e inferenciais.
- Corpus de conhecimento & consultas de teste: Focamos nossa análise no subconjunto difícil, composto por 238 perguntas desafiadoras. Conforme definido pelo benchmark, cada ponto de dados inclui:
- Uma pergunta que exige dedução lógica e numérica em várias etapas.
- Um contexto, que geralmente contém informações densas apresentadas em formatos estruturados como tabelas Markdown (por exemplo, balanços patrimoniais, dados de desempenho de ações).
- Uma resposta de referência definitiva para pontuação objetiva.
- Tipos de consulta ilustrativos: A dificuldade do benchmark decorre da exigência de que os models lidem com tarefas de raciocínio financeiro diversas e complexas. Para ilustrar essa amplitude, destacamos dois exemplos representativos do conjunto de testes:
Exemplo: Raciocínio algorítmico & de séries temporais (análise técnica)
Contexto: Um investidor está analisando… os preços das ações nos últimos 25 dias… para calcular o Canal de Keltner usando um período de EMA de 10 dias e um período de ATR de 10 dias, com um multiplicador de 1.5…
Pergunta: Qual é o valor da última banda superior no Canal de Keltner…? Responda com duas casas decimais.
Esta consulta testa a capacidade de um model de atuar como analista quantitativo ao:
- Desconstruindo um indicador composto: Reconhecendo que o “Canal de Keltner” é derivado de dois outros indicadores complexos:
- A média móvel exponencial (EMA)
- A faixa verdadeira média (ATR).
- Implementando lógica algorítmica: Implementando corretamente os algoritmos iterativos para EMA e ATR do zero ao longo de uma série temporal de 25 pontos de dados.
- Sintetizando resultados: Combinando os valores calculados de acordo com a fórmula final do Canal de Keltner (Banda Superior = EMA + (Multiplicador × ATR)).
Princípios centrais de avaliação
- Chamadas de API isoladas e padronizadas: Para cada model, conduzimos a avaliação programaticamente por meio de seus respectivos endpoints de API (por exemplo, OpenRouter, OpenAI). Isso garantiu que cada model recebesse exatamente a mesma entrada sob condições idênticas, eliminando a variabilidade das interações com a IU.
- Geração de forma livre: Não restringimos os models a um formato de múltipla escolha. Em vez disso, eles foram instruídos a gerar uma resposta abrangente e free-form, permitindo uma avaliação mais autêntica de suas capacidades de raciocínio.
- Prompting de Cadeia de Pensamento (CoT): Para eliciar e avaliar o processo de raciocínio dos models, empregamos uma estratégia de prompting de Cadeia de Pensamento (CoT). O prompt de sistema instruiu explicitamente cada model a “primeiro pensar no problema passo a passo” antes de concluir com uma resposta final. Essa abordagem permite uma análise mais profunda de como um model chega à sua conclusão, além da saída final.
Métricas de avaliação & framework
Utilizamos o framework de avaliação totalmente automatizado do próprio benchmark FinanceReasoning para pontuar as saídas dos models. Esse framework foi projetado para medir tanto a correção conceitual quanto o custo computacional.
1. Métrica primária: Precisão
Esta métrica responde à pergunta crítica: “O model consegue resolver corretamente o problema financeiro?” O processo de pontuação envolve uma pipeline sofisticada de duas etapas:
- Etapa 1: Extração de resposta baseada em LLM: A saída bruta de um model é texto não estruturado contendo tanto o raciocínio quanto a resposta final. Para analisar de forma confiável o valor numérico ou booleano, usamos um model supervisor (anthropic/claude-sonnet-4.5) como parser.
- Etapa 2: Comparação baseada em tolerância: Uma simples “correspondência exata” é insuficiente para problemas numéricos. Portanto, a resposta extraída foi comparada programaticamente com a referência. O script aplica um limite de tolerância numérica (uma diferença relativa de 0.2%) para lidar de forma justa com pequenas variações de ponto flutuante ou arredondamento, garantindo que soluções conceitualmente corretas sejam marcadas como corretas.
2. Métrica secundária: Consumo de tokens
Esta métrica responde à pergunta: “Qual é o custo computacional para o model resolver esses problemas?” Ela mede o custo total associado à geração das 238 respostas.
- Cálculo de tokens: Para cada chamada de API, coletamos prompt_tokens e completion_tokens do objeto de uso do provedor. A pontuação de tokens por model é a soma dos completion_tokens em todas as 238 perguntas. Relatamos tokens de conclusão (não tokens totais) porque a entrada é quase constante entre models que compartilham o mesmo dataset (66k-92k tokens de entrada por execução, dependendo do tokenizer).
- Cálculo de custo: Calculamos o custo em dólar como prompt_tokens × prompt_price_per_M + completion_tokens × completion_price_per_M, somado em todas as 238 perguntas. Os preços são as taxas por token listadas no endpoint /api/v1/models do OpenRouter no momento em que o model foi executado.
Essa abordagem de duas métricas, fornecida pelo próprio benchmark FinanceReasoning, permite uma avaliação holística, equilibrando a capacidade bruta de resolução de problemas de um model (precisão) com sua eficiência operacional (consumo de tokens).
Raciocínio financeiro com Geração Aumentada por Recuperação (RAG)
Para superar models autônomos, projetamos e implementamos um framework de RAG personalizado, distinto da implementação original do benchmark. Nossa abordagem é construída em uma stack moderna de banco de dados vetorial (Qdrant) para fornecer aos LLMs conhecimento relevante e específico do domínio no momento da inference, ajudando-os a resolver problemas além de seus dados de treinamento. Testamos isso no gpt-4o-mini para medir seu impacto.
Resultados e análise: O trade-off do RAG
A introdução do RAG teve um impacto significativo e mensurável no desempenho do gpt-4o-mini.
Principais conclusões da avaliação do RAG:
- Melhoria significativa de precisão: O RAG melhorou comprovadamente a capacidade de resolução de problemas do model, aumentando a precisão em mais de 10 pontos percentuais. Isso confirma que fornecer contexto externo relevante é altamente eficaz para tarefas de raciocínio complexas e específicas do domínio.
- O custo da precisão: Esse ganho de desempenho veio com um alto custo. O consumo total de tokens aumentou quase x18, e o tempo total de execução aumentou x20. Isso se deve às chamadas adicionais de API para embedding e, mais importante, aos prompts muito maiores e mais complexos que o LLM deve processar.
- Implicações para models maiores: Os resultados do gpt-4o-mini sugerem que, embora o RAG possa desbloquear maior desempenho, aplicar esse método a models maiores e mais caros como GPT-4o ou Claude Opus será substancialmente mais caro e demorado. Isso destaca o trade-off crítico entre precisão, custo e latência no projeto de sistemas de IA financeira de nível de produção.
Metodologia de RAG para raciocínio financeiro
Nossa pipeline de RAG é construída em uma stack moderna usando Qdrant como banco de dados vetorial e o model text-embedding-3-small da OpenAI para gerar representações vetoriais semânticas. O processo consiste em duas fases principais: uma fase de indexação offline e uma fase de recuperação-geração online.
1. Indexação do corpus de conhecimento
- Criação do corpus: Curamos uma base de conhecimento especializada a partir de duas fontes fornecidas pelo benchmark:
- Documentos financeiros: Uma coleção de artigos (financial_documents.json) explicando vários conceitos e termos financeiros.
- Funções financeiras: Uma biblioteca de funções Python prontas para uso (functions-article-all.json) projetadas para resolver cálculos financeiros específicos.
- Chunking inteligente & embedding: Para preparar esse corpus para recuperação eficiente, cada documento e função foi processado e indexado:
- Chunking: Os documentos foram segmentados em chunks menores e semanticamente coerentes com base em suas seções. Cada função Python foi tratada como um único chunk atômico. Isso garante que o contexto recuperado seja focado e relevante.
- Embedding: Cada chunk foi então convertido em um vetor de 1536 dimensões usando o model text-embedding-3-small.
- Indexação: Esses vetores foram indexados em duas coleções separadas dentro da nossa instância local do Qdrant (financial_documents_openai_small e financial_functions_openai_small), otimizadas para busca por similaridade de cosseno.
2. Inference com RAG
Para cada uma das 238 perguntas, o processo de raciocínio do model foi aumentado com as seguintes etapas automatizadas:
- Geração de embedding (chamadas de API 1 e 2): A consulta do usuário (pergunta + contexto) foi convertida em um vetor de embedding. Isso exigiu duas chamadas à API de embedding da OpenAI para preparar as buscas em ambas as coleções.
- Recuperação de múltiplas fontes: O vetor de consulta foi usado para realizar uma busca semântica em ambas as coleções do Qdrant simultaneamente para recuperar as informações mais relevantes:
- Os 3 chunks de documentos mais relevantes da coleção financial_documents.
- As 2 funções Python mais relevantes da coleção financial_functions.
- Aumento do prompt: Os documentos e funções recuperados foram injetados dinamicamente no prompt, criando um “pacote de informações” rico e sensível ao contexto. Isso aumentou significativamente o tamanho do prompt de entrada (de ~300-500 tokens para ~3.000-5.000+ tokens).
- Geração da resposta final (chamada de API 3): Esse prompt aumentado foi enviado ao model gpt-4o-mini para gerar a resposta final e fundamentada.
Limitações do benchmark de LLMs em finanças
Nosso benchmark, embora abrangente, está sujeito a várias limitações importantes:
- Risco de contaminação de dados: É possível que esses models tenham sido treinados no dataset do benchmark, uma vez que o dataset é público. Isso pode levar a pontuações infladas, dificultando a avaliação da verdadeira capacidade de raciocínio.
- Análise de RAG com um único model: A avaliação do RAG foi realizada em um model (gpt-4o-mini), portanto, os trade-offs observados entre desempenho e custo podem não se aplicar a todos os outros models.
Conclusão
Nosso benchmark de 40+ models em tarefas complexas de raciocínio financeiro mostra o seguinte:
O gpt-5.6-sol-pro atinge a maior precisão do benchmark com 90.76% com 385.886 tokens a $16,35 por execução. O gpt-5.6-sol e o claude-fable-5 empatam em 90.34%.
O gpt-5.6-sol iguala os 90.34% do claude-fable-5 a $3,85 por execução contra $10,05 do fable-5, o menor custo no nível de precisão de 90.34%.
O claude-opus-4.8 pontua 89.08% com 113.434 tokens por $3,28, acima do gpt-5-2025-08-07 (88.23%) com cerca de 7x menos tokens de saída e menos da metade do custo ($3,28 vs $8,38), e continua sendo o model mais barato acima de 88% de precisão.
O claude-opus-4.6 (87.82%, 164.369 tokens) e o gpt-5-mini-2025-08-07 (87.39%, 595.505 tokens) atingem precisão quase no topo. O gpt-5.6-terra atinge 86.97% a $1,99, o menor custo entre os três models empatados nessa precisão.
O gemini-3.1-pro-preview (86.55%) está acima do gemini-3-pro-preview (86.13%) com 35% menos tokens, portanto, atualizações iterativas podem melhorar tanto a precisão quanto a eficiência.
O gemini-3-flash-preview atinge 83.61% com 118.530 tokens a $0,39, e o gpt-5.2 atinge 86.13% com 247.660 tokens.
O RAG aumentou a precisão do gpt-4o-mini em 10.08 pontos a um custo de 17.7x os tokens e 20x a latência.
Registro de alterações
Adicionamos models a este benchmark a cada nova versão.
9 de setembro de 2026
- OpenAI: GPT-6 Astra (openai/gpt-6-astra).
- Anthropic: Claude Fable 5.1 (anthropic/claude-fable-5.1)
10 de julho de 2026
- OpenAI: GPT-5.6 Sol (openai/gpt-5.6-sol)
- OpenAI: GPT-5.6 Terra (openai/gpt-5.6-terra)
- OpenAI: GPT-5.6 Sol Pro (openai/gpt-5.6-sol-pro)
30 de junho de 2026
- Anthropic: Claude Sonnet 5 (anthropic/claude-sonnet-5)
22 de junho de 2026
- Zhipu IA: GLM-5.2 (z-ai/glm-5.2)
10 de junho de 2026
- Anthropic: Claude Fable 5 (anthropic/claude-fable-5)
2 de junho de 2026
- Anthropic: Claude Opus 4.8 (anthropic/claude-opus-4.8)
22 de maio de 2026
- Google: Gemini 3.5 Flash (google/gemini-3.5-flash)
- xAI: Grok 4.3 (x-ai/grok-4.3)
- Adicionada a coluna de custo por execução do benchmark e o alternador do gráfico de precisão vs. custo. Metodologia atualizada com a fórmula de cálculo de custo e a mudança do extrator de respostas (claude-sonnet-4.5)
20 de abril de 2026
- Anthropic: Claude Opus 4.7 (anthropic/claude-opus-4.7)
20 de fevereiro de 2026
- Google: Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview)
- Anthropic: Claude Sonnet 4.6 (anthropic/claude-sonnet-4.6)
6 de fevereiro de 2026
- Anthropic: Claude Opus 4.6 (anthropic/claude-opus-4.6)
- Anthropic: Claude Opus 4.5 (anthropic/claude-opus-4.5)
- Anthropic: Claude Sonnet 4.5 (anthropic/claude-sonnet-4.5)
- Google: Gemini 3 Pro Preview (google/gemini-3-pro-preview)
- Google: Gemini 3 Flash Preview (google/gemini-3-flash-preview)
- OpenAI: GPT-5.2 (openai/gpt-5.2)
- Moonshot IA: Kimi K2.5 (moonshotai/kimi-k2.5)
Leitura adicional
A análise financeira pode se referir a múltiplas capacidades, como análise de ações, interpretação de direito financeiro e raciocínio financeiro. Em nosso benchmark, focamos especificamente no raciocínio financeiro, enquanto outras tarefas são abordadas em artigos separados:
- LLM para análise de ações: Esses models ajudam a processar dados de mercado, relatórios de empresas e notícias para identificar oportunidades de investimento. (Veja a análise completa aqui: IA-based Stock Trading)
- IA de direito financeiro: Alguns LLMs podem interpretar regulamentos financeiros, contratos e requisitos de conformidade para auxiliar em tarefas jurídico-financeiras. (Veja nossa lista de ferramentas de IA jurídica aqui: Legal IA Tools)
Perguntas frequentes
Um LLM (large language model) em finanças é um model de IA que usa técnicas de processamento de linguagem natural para realizar análises financeiras complexas, gestão de conformidade e compreensão de documentos. Esses models ajudam as instituições financeiras a navegar pelo direito financeiro, requisitos regulatórios e as demandas dinâmicas da indústria financeira.
Chatbots inteligentes:
Assistentes virtuais orientados por LLM permitem que empresas financeiras forneçam suporte automatizado ao cliente 24/7, lidando com consultas rotineiras e tarefas de integração sem intervenção humana. Isso reduz os tempos de espera e melhora a satisfação do cliente, liberando agentes humanos para questões complexas.
Consultoria & análise:
Bancos de investimento usam LLMs para analisar tendências de mercado, notícias financeiras e dados de clientes. Esses models digerem grandes volumes de informações não estruturadas, permitindo que consultores forneçam aconselhamento de investimento personalizado e gestão de portfólio com insights em tempo real.
Análise de documentos regulatórios:
Escritórios de advocacia e instituições financeiras empregam LLMs para processar documentos regulatórios densos, como registros na SEC. Esses models extraem informações-chave e resumem relatórios, reduzindo o tempo de revisão manual e ajudando as empresas a permanecer em conformidade com regulamentações em evolução.
Detecção de fraudes:
LLMs analisam vastos datasets financeiros em tempo real para detectar padrões de transações suspeitas e táticas emergentes de fraude. Suas capacidades de aprendizado contínuo permitem identificação de fraudes mais rápida e precisa do que os métodos tradicionais.
Automação jurídica e de conformidade:
Escritórios de advocacia e equipes de conformidade usam LLMs para revisar contratos, interpretar leis bancárias e verificar conformidade regulatória. Automatizar essas tarefas reduz o tempo de revisão e os custos jurídicos, garantindo aderência a regulamentações financeiras complexas.
Perguntas e respostas sobre documentos e Reconhecimento de Entidades Nomeadas (NER):
Instituições financeiras implantam LLMs para responder perguntas de investidores extraindo dados de relatórios financeiros e teleconferências de resultados. O NER permite a marcação automática de nomes de empresas, tickers de ações (símbolos de negociação de classe) e entidades regulatórias, agilizando a recuperação de dados.
Eficiência e automação: LLMs automatizam análises rotineiras (por exemplo, resumir relatórios de resultados, processar empréstimos ou registros), economizando horas de analistas e reduzindo erros.
Atendimento ao cliente 24/7: Assistentes virtuais de IA e chatbots alimentados por LLMs podem lidar com consultas de clientes 24 horas por dia com respostas conversacionais, melhorando a experiência e a satisfação do cliente.
Aconselhamento financeiro personalizado: Ao analisar o histórico e o perfil de risco de um cliente, os LLMs fornecem aconselhamento financeiro ou de investimento sob medida.
Detecção de fraudes & gestão de riscos: LLMs vasculham grandes datasets de transações para identificar anomalias ou padrões de fraude, adaptando-se a novas táticas de golpes e ajudando a construir perfis de risco.
Conformidade & relatórios: LLMs redigem automaticamente relatórios regulatórios, extraem fatos relevantes para políticas e ajudam a interpretar leis e regulamentações financeiras complexas para conformidade.
Sim, existem vários models de domínio específico maiores para finanças. Por exemplo, o BloombergGPT foi projetado para auxiliar na regulação financeira, mercados de capitais e gestão de conformidade, processando grandes datasets financeiros, incluindo documentos da bolsa de valores nacional e registros regulatórios.
Outros models como FinBERT e FinGPT focam em direito financeiro, direito bancário internacional e aconselhamento financeiro personalizado, adaptando large language models ao vocabulário especializado de finanças, como símbolos de negociação de classe e textos regulatórios.
Raciocínio financeiro é a capacidade de analisar dados financeiros para tomar decisões de negócios ou investimento informadas.
As principais tarefas incluem:
– Analisar demonstrações financeiras (lucro, fluxo de caixa, balanço patrimonial)
– Orçamento e previsão
– Avaliar investimentos (VPL, TIR, ROI)
– Gerenciar fluxo de caixa e liquidez
– Avaliar riscos financeiros e índices de desempenho
Cite este benchmark
Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.
@misc{sari2026,
author = {Sarı, Ekrem},
title = {{Benchmark de 40+ LLMs em Finanças: Claude Fable 5 & GPT-5.6 Sol}},
year = {2026},
month = sep,
howpublished = {\url{https://aimultiple.com/finance-llm}},
note = {AIMultiple. Acessado em 9 Setembro 2026}
}Resultados e carimbos de data/hora de 58 pontos de dados. Baixe os dados resumidos exibidos nos gráficos e tabelas deste artigo como um arquivo ZIP contendo 2 arquivos CSV.
Quer os dados granulares por trás disso? Assine o Premium
Seja o primeiro a comentar
Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.