Serviços
Contate-nos

Benchmark de 40+ LLMs em Finanças: Claude Fable 5 & GPT-5.6 Sol

We evaluated 40+ LLMs in finance on 238 hard questions from the FinanceReasoning benchmark to identify which models excel at complex financial reasoning tasks.

Ekrem Sarı
Ekrem Sarı
atualizado em 11 ago. 2026
Loading Chart

Avaliamos LLMs em 238 questões difíceis do benchmark FinanceReasoning (Tang et al.).1 Este subconjunto tem como alvo as tarefas de raciocínio financeiro mais desafiadoras, avaliando raciocínio quantitativo complexo e em várias etapas envolvendo conceitos e fórmulas financeiras. Nossa avaliação empregou um design de prompt personalizado e critérios de pontuação de precisão e consumo de tokens.

Para uma explicação detalhada de como essas métricas foram calculadas e do framework usado nesta avaliação, consulte nossa metodologia de benchmark financeiro.

Resultados: Qual LLM é o melhor para finanças?

Desempenhos de primeira linha (precisão >83%):

gpt-5.6-sol-pro atinge a maior precisão do benchmark, 90.76%, com 385.886 tokens a $16.35 por execução, 0.42 ponto acima de gpt-5.6-sol.

gpt-5.6-sol obtém 90.34% de precisão com 117.735 tokens a $3.85 por execução. Ele empata com claude-fable-5 (90.34%) pela segunda maior precisão, a $3.85 contra $10.05 do fable-5 e 117.735 tokens contra 183.258. Nenhum modelo com precisão igual ou superior é executado a um custo menor.

claude-fable-5 obtém 90.34% de precisão com 183.258 tokens. Foi o primeiro modelo a ultrapassar 90% neste benchmark (10 de junho) e empata com gpt-5.6-sol em 90.34%, a $10.05 por execução contra $3.85 do gpt-5.6-sol.

claude-opus-4.8 obtém 89.08% de precisão com 113.434 tokens, o terceiro resultado mais caro e a menor contagem de tokens de saída entre os modelos acima de 88%.

gpt-5-2025-08-07 obtém 88.23% de precisão com 829.720 tokens.

claude-opus-4.6 obtém 87.82% de precisão com 164.369 tokens, precisão quase no topo com 20% da contagem de tokens do gpt-5.

gpt-5-mini-2025-08-07 atinge 87.39% de precisão com 595.505 tokens.

gemini-3.5-flash atinge 86.97% de precisão com 1.191.757 tokens, a maior precisão da linha Flash do Google e o maior consumidor de tokens da família.

claude-sonnet-5 obtém 86.97% de precisão com 414.668 tokens. Ele iguala gemini-3.5-flash até a casa decimal, gastando 414.668 tokens contra 1.191.757, a $4.33 por execução contra $10.83.

gpt-5.6-terra obtém 86.97% de precisão com 121.936 tokens a $1.99 por execução. Junta-se a claude-sonnet-5 e gemini-3.5-flash em 86.97%, com a menor contagem de tokens e custo dos três (121.936 tokens e $1.99, contra 414.668 / $4.33 e 1.191.757 / $10.83). gpt-5-mini-2025-08-07 permanece mais barato e mais preciso ($1.21, 87.39%).

gemini-3.1-pro-preview obtém 86.55% de precisão com 475.148 tokens, acima de seu antecessor gemini-3-pro-preview (86.13%) com 35% menos tokens (730.759 tokens).

glm-5.2 obtém 86.13% de precisão com 735.988 tokens. Ele melhora em relação ao glm-4.5 (64.29%) em 21.84 pontos, o maior salto entre duas versões de uma mesma família de modelos no benchmark. O próximo maior salto é de 3.79 pontos.

gemini-3-pro-preview e gpt-5.2 empatam em 86.13% de precisão. O gpt-5.2 atinge isso com 247.660 tokens, cerca de três vezes menos tokens de saída do que o gemini-3-pro-preview, com 730.759 tokens.

claude-opus-4.7 obtém 85.29% de precisão com 103.268 tokens, o modelo mais eficiente em tokens do nível superior (37% menos tokens de saída que o claude-opus-4.6, ao mesmo tempo que supera o limite de 83%).

Desempenhos fortes (precisão de 80-83%):

grok-4.3 atinge 84.87% de precisão com 309.781 tokens, o resultado mais forte da xAI no benchmark e uma recuperação em relação ao grok-4-0709 anterior.

claude-opus-4.5 obtém 84.03% de precisão com 144.505 tokens.

claude-sonnet-4.6 e gemini-3-flash-preview empatam em 83.61% de precisão. O Claude Sonnet 4.6 usa 161.035 tokens, enquanto o Gemini 3 Flash Preview atinge isso com 118.530 tokens, a menor contagem de tokens entre os modelos acima de 83%.

kimi-k2.5 obtém 82.77% de precisão com 877.868 tokens, o maior consumo nesta faixa de desempenho.

Nível intermediário (precisão de 70-80%):

o3-pro-2025-06-10 (78.15% de precisão, 473.659 tokens) e kimi-k2 (78.15% de precisão, 100.323 tokens) empatam, e o kimi-k2 usa 79% menos tokens. o3-mini-2025-01-31 (77.31% de precisão, 376.929 tokens), gpt-5-nano-2025-08-07 (76.89% de precisão, 1.028.909 tokens) e claude-sonnet-4-20250514 (76.05% de precisão, 135.462 tokens) vêm em seguida.

Desempenhos baixos (precisão inferior a 70%):

claude-3-5-sonnet-20241022 (67.65% de precisão, 90.103 tokens) e gpt-oss-20b (67.65% de precisão, 515.041 tokens) lideram esta faixa. gemini-2.5-flash (65.55% de precisão, 286.603 tokens), glm-4.5 (64.29% de precisão, 692.662 tokens) e gpt-4.1-nano-2025-04-14 (63.45% de precisão, 171.096 tokens) vêm em seguida.

Análises de desempenho:

O consumo de tokens não acompanha a precisão. O deepseek-r1-0528 consumiu a maior quantidade de tokens (1.251.064) com 62.18% de precisão, enquanto o claude-opus-4-20250514 marcou 80.25% com 132.274 tokens. A eficiência de tokens também varia entre modelos de alta precisão: o gemini-3-flash-preview atinge 83.61% com 118.530 tokens, enquanto o kimi-k2.5 gasta 877.868 tokens para 82.77% (7.4x os tokens para 0.84 ponto a menos de precisão).

A tabela acima apresenta outros benchmarks de modelos de IA, incluindo os utilizados para este benchmark.

Custo por execução do benchmark

Os tokens de saída por si só não determinam o gasto, pois as taxas de token de entrada e de token de saída diferem em uma ordem de magnitude na maioria dos provedores. Calculamos o custo em dólares de executar cada modelo nas 238 perguntas usando a taxa por token listada pelo provedor no momento da execução.

Menor custo na faixa de fronteira: o gemini-3-flash-preview atinge 83.61% de precisão por $0.39, o menor custo em dólares na banda de precisão >83%. O grok-4.3 vem em seguida com $0.86 para 84.87%.

A faixa de 90.34% é alcançada a um custo menor: o gpt-5.6-sol iguala os 90.34% do claude-fable-5 a $3.85 por execução contra $10.05 do fable-5, a 38% do custo do fable-5. O gpt-5.6-sol-pro registra a maior precisão do benchmark, 90.76%, a $16.35 por execução. O claude-opus-4.8 permanece o modelo mais barato a superar 88%, a $3.28 para 89.08%.

Raciocínio premium a preço premium: o o1-pro é o modelo de maior custo no benchmark, a $381 para 80.67% de precisão (impulsionado por taxas de $150/M de entrada e $600/M de saída). O o3-pro custa $39.23 para 78.15%, e o o1 custa $46.59 para 74.79%. Nenhum supera a faixa superior, e os três ficam abaixo do claude-opus-4.7 em precisão a mais de 10x o custo dele.

Custo e precisão da faixa de orçamento: o gpt-oss-120b atinge 81.09% de precisão a um custo total de $0.06, a execução mais barata do benchmark, a 1.91 ponto do limite de 83%. O llama-4-maverick atinge 75.21% a $0.10. Para cargas de trabalho em que 80% de precisão é suficiente, esses modelos custam menos de 1% dos principais modelos de fronteira.

Metodologia do benchmark de raciocínio financeiro

Nosso benchmark fornece uma avaliação transparente e reproduzível do desempenho do LLM em tarefas complexas de raciocínio financeiro.

Configuração do teste e corpus de dados

  • Suíte de benchmark: Usamos os dados, o código e os scripts de avaliação do benchmark FinanceReasoning, selecionado por seu foco em problemas financeiros quantitativos e inferenciais.
  • Corpus de conhecimento e consultas de teste: Concentramos nossa análise no subconjunto difícil, composto por 238 perguntas desafiadoras. Conforme definido pelo benchmark, cada ponto de dados inclui:
    1. Uma pergunta que exige dedução lógica e numérica em várias etapas.
    2. Um contexto, que muitas vezes contém informações densas apresentadas em formatos estruturados, como tabelas Markdown (por exemplo, balanços patrimoniais, dados de desempenho de ações).
    3. Uma resposta de referência definitiva para pontuação objetiva.
  • Tipos de consultas ilustrativos: A dificuldade do benchmark decorre da exigência de os modelos lidarem com tarefas de raciocínio financeiro diversas e complexas. Para ilustrar essa amplitude, destacamos dois exemplos representativos do conjunto de teste:

Exemplo: Raciocínio algorítmico e de séries temporais (análise técnica)

Contexto: Um investidor está analisando… os preços das ações nos últimos 25 dias… para calcular o Canal de Keltner usando um período de EMA de 10 dias e um período de ATR de 10 dias, com um multiplicador de 1.5…

Pergunta: Qual é o valor da última banda superior no Canal de Keltner…? Responda com duas casas decimais.

Esta consulta testa a capacidade de um modelo de atuar como analista quantitativo por meio de:

  1. Decompor um indicador composto: Reconhecer que o “Canal de Keltner” é derivado de dois outros indicadores complexos:
    • A média móvel exponencial (EMA)
    • A média verdadeira de amplitude (ATR).
  2. Implementar lógica algorítmica: Implementar corretamente os algoritmos iterativos para EMA e ATR do zero ao longo de uma série temporal de 25 pontos de dados.
  3. Sintetizar resultados: Combinar os valores calculados de acordo com a fórmula final do Canal de Keltner (Banda Superior = EMA + (Multiplicador × ATR)).

Princípios fundamentais de avaliação

  • Chamadas de API isoladas e padronizadas: Para cada modelo, conduzimos a avaliação programaticamente por meio de seus respectivos endpoints de API (por exemplo, OpenRouter, OpenAI). Isso garantiu que cada modelo recebesse exatamente a mesma entrada em condições idênticas, eliminando a variabilidade das interações com a interface.
  • Geração de forma livre: Não restringimos os modelos a um formato de múltipla escolha. Em vez disso, eles foram orientados a gerar uma resposta abrangente e de forma gratuito, permitindo uma avaliação mais autêntica de suas capacidades de raciocínio.
  • Prompting de Chain-of-Thought (CoT): Para extrair e avaliar o processo de raciocínio dos modelos, empregamos uma estratégia de prompting de Chain-of-Thought (CoT). O prompt do sistema instruiu explicitamente cada modelo a “primeiro pensar no problema passo a passo” antes de concluir com uma resposta final. Essa abordagem permite uma análise mais profunda de como um modelo chega à sua conclusão, além do resultado final.

Métricas de avaliação e framework

Utilizamos o framework de avaliação totalmente automatizado do próprio benchmark FinanceReasoning para pontuar as saídas dos modelos. Esse framework foi projetado para medir tanto a correção conceitual quanto o custo computacional.

1. Métrica primária: Precisão

Esta métrica responde à pergunta crítica: “O modelo consegue resolver corretamente o problema financeiro?” O processo de pontuação envolve um pipeline sofisticado de duas etapas:

  • Etapa 1: Extração de resposta baseada em LLM: A saída bruta de um modelo é um texto não estruturado contendo tanto o raciocínio quanto uma resposta final. Para analisar com confiabilidade o valor numérico ou booleano, usamos um modelo supervisor (anthropic/claude-sonnet-4.5) como parser.
  • Etapa 2: Comparação baseada em tolerância: Uma simples “correspondência exata” é insuficiente para problemas numéricos. Portanto, a resposta extraída foi comparada programaticamente com a referência. O script aplica um limiar de tolerância numérica (uma diferença relativa de 0.2%) para lidar de forma justa com pequenas variações de ponto flutuante ou arredondamento, garantindo que soluções conceitualmente corretas sejam marcadas como corretas.

2. Métrica secundária: Consumo de tokens

Esta métrica responde à pergunta: “Quão caro computacionalmente é para o modelo resolver esses problemas?” Ela mede o custo total associado à geração das 238 respostas.

  • Cálculo de tokens: Para cada chamada de API, coletamos prompt_tokens e completion_tokens do objeto de uso do provedor. A pontuação de tokens por modelo é a soma de completion_tokens em todas as 238 perguntas. Relatamos os completion tokens (não o total de tokens) porque a entrada é quase constante entre modelos que compartilham o mesmo dataset (66k-92k tokens de entrada por execução, dependendo do tokenizador).
  • Cálculo de custo: Calculamos o custo em dólares como prompt_tokens × prompt_price_per_M + completion_tokens × completion_price_per_M, somado em todas as 238 perguntas. Os preços são as taxas por token listadas no endpoint /api/v1/models do OpenRouter no momento em que o modelo foi executado.

Essa abordagem de duas métricas, fornecida pelo próprio benchmark FinanceReasoning, permite uma avaliação holística, equilibrando a capacidade bruta de resolução de problemas de um modelo (precisão) com sua eficiência operacional (consumo de tokens).

Raciocínio financeiro com geração aumentada por recuperação (RAG)

Para superar modelos independentes, projetamos e implementamos um RAG framework personalizado, distinto da implementação original do benchmark. Nossa abordagem é construída sobre uma pilha moderna de banco de dados vetorial (Qdrant) para fornecer aos LLMs conhecimento relevante e específico do domínio no momento da inferência, ajudando-os a resolver problemas além dos dados de treinamento. Testamos isso no gpt-4o-mini para medir seu impacto.

Resultados e análise: O trade-off do RAG

A introdução do RAG teve um impacto significativo e mensurável no desempenho do gpt-4o-mini.

Principais conclusões da avaliação do RAG:

  • Melhoria significativa de precisão: O RAG comprovadamente melhorou a capacidade de resolução de problemas do modelo, aumentando a precisão em mais de 10 pontos percentuais. Isso confirma que fornecer contexto externo relevante é altamente eficaz para tarefas complexas de raciocínio em domínios específicos.
  • O custo da precisão: Esse ganho de desempenho veio a um custo alto. O consumo total de tokens aumentou em quase x18, e o tempo total de execução aumentou em x20. Isso se deve às chamadas adicionais de API para embedding e, mais importante, aos prompts muito maiores e mais complexos que o LLM precisa processar.
  • Implicações para modelos maiores: Os resultados do gpt-4o-mini sugerem que, embora o RAG possa liberar desempenho superior, aplicar esse método a modelos maiores e mais caros, como GPT-4o ou Claude Opus, será substancialmente mais caro e demorado. Isso destaca o trade-off crítico entre precisão, custo e latência no projeto de sistemas de IA financeira de nível de produção.

Metodologia de RAG para raciocínio financeiro

Nosso pipeline de RAG é construído sobre uma pilha moderna usando o Qdrant como banco de dados vetorial e o modelo text-embedding-3-small da OpenAI para gerar representações vetoriais semânticas. O processo consiste em duas fases principais: uma fase de indexação offline e uma fase de recuperação-geração online.

1. Indexação do corpus de conhecimento

  • Criação do corpus: Curamos uma base de conhecimento especializada a partir de duas fontes fornecidas pelo benchmark:
    1. Documentos financeiros: Uma coleção de artigos (financial_documents.json) explicando vários conceitos e termos financeiros.
    2. Funções financeiras: Uma biblioteca de funções Python prontas para uso (functions-article-all.json) projetadas para resolver cálculos financeiros específicos.
  • Chunking e embedding inteligentes: Para preparar esse corpus para recuperação eficiente, cada documento e função foi processado e indexado:
    1. Chunking: Os documentos foram segmentados em chunks menores e semanticamente coerentes com base em suas seções. Cada função Python foi tratada como um único chunk atômico. Isso garante que o contexto recuperado seja focado e relevante.
    2. Embedding: Cada chunk foi então convertido em um vetor de 1536 dimensões usando o modelo text-embedding-3-small.
    3. Indexação: Esses vetores foram indexados em duas coleções separadas dentro da nossa instância local do Qdrant (financial_documents_openai_small e financial_functions_openai_small), otimizada para busca por similaridade de cosseno.

2. Inferência potencializada por RAG

Para cada uma das 238 perguntas, o processo de raciocínio do modelo foi aumentado com as seguintes etapas automatizadas:

  1. Geração de embedding (chamadas de API 1 e 2): A consulta do usuário (pergunta + contexto) foi convertida em um vetor de embedding. Isso exigiu duas chamadas à API de embedding da OpenAI para preparar as buscas nas duas coleções.
  2. Recuperação de múltiplas fontes: O vetor de consulta foi usado para realizar uma busca semântica simultânea nas duas coleções do Qdrant para recuperar as informações mais relevantes:
    • Os 3 chunks de documentos mais relevantes da coleção financial_documents.
    • As 2 funções Python mais relevantes da coleção financial_functions.
  3. Aumento do prompt: Os documentos e funções recuperados foram injetados dinamicamente no prompt, criando um “pacote de informações” rico e sensível ao contexto. Isso aumentou significativamente o tamanho do prompt de entrada (de ~300-500 tokens para ~3.000-5.000+ tokens).
  4. Geração da resposta final (chamada de API 3): Esse prompt aumentado foi enviado ao modelo gpt-4o-mini para gerar a resposta final e fundamentada.
Deixe nossa equipe automatizar um dos seus processos de negócio com agentes de IA, gratuitamente.
Automatizar um processo

Limitações do benchmark de LLMs em finanças

Nosso benchmark, embora abrangente, está sujeito a várias limitações importantes:

  • Risco de contaminação de dados: É possível que esses modelos tenham sido treinados no dataset do benchmark, já que o dataset é público. Isso pode levar a pontuações infladas, dificultando a avaliação da verdadeira capacidade de raciocínio.
  • Análise de RAG em um único modelo: A avaliação do RAG foi realizada em um único modelo (gpt-4o-mini), portanto os trade-offs observados entre desempenho e custo podem não se aplicar a todos os outros modelos.

Conclusão

Nosso benchmark de 40+ modelos em tarefas complexas de raciocínio financeiro mostra o seguinte:

O gpt-5.6-sol-pro atinge a maior precisão do benchmark, 90.76%, com 385.886 tokens a $16.35 por execução. O gpt-5.6-sol e o claude-fable-5 empatam em 90.34%.

O gpt-5.6-sol iguala os 90.34% do claude-fable-5 a $3.85 por execução contra $10.05 do fable-5, o menor custo na faixa de precisão de 90.34%.

O claude-opus-4.8 obtém 89.08% com 113.434 tokens por $3.28, acima do gpt-5-2025-08-07 (88.23%) com cerca de 7x menos tokens de saída e menos da metade do custo ($3.28 vs $8.38), e permanece o modelo mais barato acima de 88% de precisão.

O claude-opus-4.6 (87.82%, 164.369 tokens) e o gpt-5-mini-2025-08-07 (87.39%, 595.505 tokens) atingem precisão quase no topo. O gpt-5.6-terra atinge 86.97% a $1.99, o menor custo entre os três modelos empatados nessa precisão.

O gemini-3.1-pro-preview (86.55%) está acima do gemini-3-pro-preview (86.13%) com 35% menos tokens, portanto atualizações iterativas podem melhorar tanto a precisão quanto a eficiência.

O gemini-3-flash-preview atinge 83.61% com 118.530 tokens a $0.39, e o gpt-5.2 atinge 86.13% com 247.660 tokens.

O RAG aumentou a precisão do gpt-4o-mini em 10.08 pontos a um custo de 17.7x os tokens e 20x a latência.

Registro de alterações

Adicionamos modelos a este benchmark a cada novo lançamento.

10 de julho de 2026

  • OpenAI: GPT-5.6 Sol (openai/gpt-5.6-sol)
  • OpenAI: GPT-5.6 Terra (openai/gpt-5.6-terra)
  • OpenAI: GPT-5.6 Sol Pro (openai/gpt-5.6-sol-pro)

30 de junho de 2026

  • Anthropic: Claude Sonnet 5 (anthropic/claude-sonnet-5)

22 de junho de 2026

  • Zhipu IA: GLM-5.2 (z-ai/glm-5.2)

10 de junho de 2026

  • Anthropic: Claude Fable 5 (anthropic/claude-fable-5)

2 de junho de 2026

  • Anthropic: Claude Opus 4.8 (anthropic/claude-opus-4.8)

22 de maio de 2026

  • Google: Gemini 3.5 Flash (google/gemini-3.5-flash)
  • xAI: Grok 4.3 (x-ai/grok-4.3)
  • Adicionada a coluna de custo por execução do benchmark e a alternância do gráfico de precisão versus custo. Metodologia atualizada com a fórmula de cálculo de custo e a mudança do extrator de respostas (claude-sonnet-4.5)

20 de abril de 2026

  • Anthropic: Claude Opus 4.7 (anthropic/claude-opus-4.7)

20 de fevereiro de 2026

  • Google: Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview)
  • Anthropic: Claude Sonnet 4.6 (anthropic/claude-sonnet-4.6)

6 de fevereiro de 2026

  • Anthropic: Claude Opus 4.6 (anthropic/claude-opus-4.6)
  • Anthropic: Claude Opus 4.5 (anthropic/claude-opus-4.5)
  • Anthropic: Claude Sonnet 4.5 (anthropic/claude-sonnet-4.5)
  • Google: Gemini 3 Pro Preview (google/gemini-3-pro-preview)
  • Google: Gemini 3 Flash Preview (google/gemini-3-flash-preview)
  • OpenAI: GPT-5.2 (openai/gpt-5.2)
  • Moonshot IA: Kimi K2.5 (moonshotai/kimi-k2.5)
Não perca os nossos benchmarks e insights baseados em dados. O botão abre o Google; selecionar a AIMultiple confirma que deseja ver a AIMultiple com mais frequência nos resultados de pesquisa do Google.
GoogleAdicionar como fonte preferencial

Leitura adicional

A análise financeira pode se referir a várias capacidades, como análise de ações, interpretação de direito financeiro e raciocínio financeiro. Em nosso benchmark, focamos especificamente no raciocínio financeiro, enquanto outras tarefas são abordadas em artigos separados:

  • LLM para análise de ações: Esses modelos ajudam a processar dados de mercado, relatórios de empresas e notícias para identificar oportunidades de investimento. (Veja a análise completa aqui: Negociação de Ações Baseada em IA)
  • IA de direito financeiro: Alguns LLMs podem interpretar regulamentações financeiras, contratos e requisitos de conformidade para auxiliar tarefas jurídico-financeiras. (Veja nossa lista de ferramentas de IA jurídica aqui: Ferramentas de IA Jurídica)

Perguntas frequentes

Um LLM (modelo de linguagem de grande porte) em finanças é um modelo de IA que usa técnicas de processamento de linguagem natural para realizar análises financeiras complexas, gestão de conformidade e compreensão de documentos. Esses modelos ajudam as instituições financeiras a navegar pelo direito financeiro, pelos requisitos regulatórios e pelas demandas dinâmicas do setor financeiro.

Chatbots inteligentes:
Assistentes virtuais baseados em LLM permitem que empresas financeiras ofereçam suporte ao cliente automatizado 24/7, lidando com consultas rotineiras e tarefas de integração sem intervenção humana. Isso reduz os tempos de espera e melhora a satisfação do cliente, liberando agentes humanos para questões complexas.

Consultoria e análise:
Bancos de investimento usam LLMs para analisar tendências de mercado, notícias financeiras e dados de clientes. Esses modelos digerem grandes volumes de informações não estruturadas, permitindo que consultores forneçam aconselhamento de investimento personalizado e gestão de portfólio com insights em tempo real.

Análise de documentos regulatórios:
Escritórios de advocacia e instituições financeiras empregam LLMs para processar documentos regulatórios densos, como arquivamentos na SEC. Esses modelos extraem informações-chave e resumem relatórios, reduzindo o tempo de revisão manual e ajudando as empresas a permanecerem em conformidade com regulamentações em evolução.

Detecção de fraudes:
Os LLMs analisam vastos datasets financeiros em tempo real para detectar padrões suspeitos de transações e táticas emergentes de fraude. Suas capacidades de aprendizado contínuo permitem uma identificação de fraudes mais rápida e precisa do que os métodos tradicionais.

Automação jurídica e de conformidade:
Escritórios de advocacia e equipes de conformidade usam LLMs para revisar contratos, interpretar leis bancárias e verificar a conformidade regulatória. Automatizar essas tarefas reduz o tempo de revisão e os custos jurídicos, garantindo ao mesmo tempo a adesão a regulamentações financeiras complexas.

Perguntas e respostas sobre documentos e reconhecimento de entidades nomeadas (NER):
Instituições financeiras usam LLMs para responder a perguntas de investidores extraindo dados de relatórios financeiros e de teleconferências de resultados. O NER permite a marcação automática de nomes de empresas, tickers de ações (símbolos de negociação de classe) e entidades regulatórias, agilizando a recuperação de dados.

Eficiência e automação: Os LLMs automatizam análises rotineiras (por exemplo, resumir relatórios de resultados, processar empréstimos ou registros), economizando horas de analistas e reduzindo erros.

Atendimento ao cliente 24/7: Assistentes virtuais de IA e chatbots alimentados por LLMs podem lidar com consultas de clientes ininterruptamente com respostas conversacionais, melhorando a experiência e a satisfação do cliente.

Aconselhamento financeiro personalizado: Ao analisar o histórico e o perfil de risco de um cliente, os LLMs fornecem aconselhamento financeiro ou de investimento personalizado.

Detecção de fraudes e gestão de riscos: Os LLMs analisam grandes datasets de transações para identificar anomalias ou padrões de fraude, adaptando-se a novas táticas de golpes e ajudando a construir perfis de risco.

Conformidade e relatórios: Os LLMs redigem automaticamente relatórios regulatórios, extraem fatos relevantes para políticas e ajudam a interpretar leis e regulamentações financeiras complexas para conformidade.

Sim, existem vários modelos maiores específicos de domínio para finanças. Por exemplo, o BloombergGPT foi projetado para auxiliar na regulamentação financeira, nos mercados de capitais e na gestão de conformidade, processando grandes datasets financeiros, incluindo documentos da bolsa de valores nacional e registros regulatórios.

Outros modelos como FinBERT e FinGPT concentram-se em direito financeiro, direito bancário internacional e aconselhamento financeiro personalizado, adaptando modelos de linguagem de grande porte ao vocabulário especializado de finanças, como símbolos de negociação de classe e textos regulatórios.

Raciocínio financeiro é a capacidade de analisar dados financeiros para tomar decisões de negócios ou investimentos informadas.

Principais tarefas incluem:
– Analisar demonstrações financeiras (lucro, fluxo de caixa, balanço patrimonial)
– Orçamento e previsão
– Avaliar investimentos (VPL, TIR, ROI)
– Gerir fluxo de caixa e liquidez
– Avaliar riscos financeiros e índices de desempenho

Cite este benchmark

Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.

Ekrem Sarı (2026) - "Benchmark de 40+ LLMs em Finanças: Claude Fable 5 & GPT-5.6 Sol". Publicado on-line em AIMultiple.com. Acessado em 11 Agosto 2026, em: https://aimultiple.com/finance-llm [Recurso on-line]

Sarı, E. (2026, 11 Agosto). Benchmark de 40+ LLMs em Finanças: Claude Fable 5 & GPT-5.6 Sol. AIMultiple. https://aimultiple.com/finance-llm

@misc{sari2026,
  author = {Sarı, Ekrem},
  title  = {{Benchmark de 40+ LLMs em Finanças: Claude Fable 5 & GPT-5.6 Sol}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/finance-llm}},
  note   = {AIMultiple. Acessado em 11 Agosto 2026}
}
Baixar todos os dados

Resultados e carimbos de data/hora de 52 pontos de dados. Baixe os dados utilizados neste artigo como um arquivo ZIP contendo um arquivo CSV e um README.

Última atualização: 14 Agosto 2026
Baixar
Ekrem Sarı
Ekrem Sarı
Pesquisador de IA
Ekrem é Pesquisador de IA e Analista de Dados na AIMultiple. Ele projeta e executa benchmarks práticos para sistemas de IA e LLM.
Ver perfil completo

Seja o primeiro a comentar

Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.

0/450