Services
Contactez-nous

Benchmark de 40+ LLMs en finance: Claude Fable 5 & GPT-5.6 Sol

Ekrem Sarı
Ekrem Sarı
mis à jour le 10 juil. 2026

Nous avons évalué 40+ LLMs en finance sur 238 questions difficiles du benchmark FinanceReasoning afin d'identifier les modèles qui excellent dans les tâches de raisonnement financier complexes telles que l'analyse des états financiers, les prévisions et les calculs de ratios.

Aperçu du benchmark des LLMs en finance

Loading Chart

Nous avons évalué les LLMs sur 238 questions difficiles du benchmark FinanceReasoning (Tang et al.).1 Ce sous-ensemble cible les tâches de raisonnement financier les plus difficiles, évaluant un raisonnement quantitatif complexe en plusieurs étapes impliquant des concepts et des formules financières. Notre évaluation a utilisé une conception de prompt personnalisée et des critères de notation basés sur la précision et la consommation de tokens.

Pour une explication détaillée de la manière dont ces métriques ont été calculées et du cadre utilisé pour cette évaluation, veuillez consulter notre méthodologie du benchmark financier.

Résultats : Quel LLM est le meilleur pour la finance ?

Performances de premier plan (>83 % de précision) :

gpt-5.6-sol-pro atteint la plus haute précision du benchmark avec 90,76 % et 385,886 tokens pour $16.35 par exécution, soit 0,42 point au-dessus de gpt-5.6-sol.

gpt-5.6-sol obtient une précision de 90,34 % avec 117,735 tokens pour $3.85 par exécution. Il égale claude-fable-5 (90,34 %) pour la deuxième meilleure précision, avec $3.85 contre 10.05 $ pour fable-5 et 117,735 tokens contre 183,258. Aucun modèle à cette précision ou supérieure n'a un coût inférieur.

claude-fable-5 obtient une précision de 90,34 % avec 183,258 tokens. Il a été le premier modèle à dépasser 90 % sur ce benchmark (juin 10) et égale gpt-5.6-sol à 90,34 %, à $10.05 par exécution contre 3.85 $ pour gpt-5.6-sol.

claude-opus-4.8 obtient une précision de 89,08 % avec 113,434 tokens, le troisième résultat le plus coûteux et le plus faible nombre de tokens de sortie parmi les modèles au-dessus de 88 %.

gpt-5-2025-08-07 obtient une précision de 88,23 % avec 829,720 tokens.

claude-opus-4.6 obtient une précision de 87,82 % avec 164,369 tokens, une précision proche du sommet avec 20 % du nombre de tokens de gpt-5.

gpt-5-mini-2025-08-07 atteint une précision de 87,39 % avec 595,505 tokens.

gemini-3.5-flash atteint une précision de 86,97 % avec 1,191,757 tokens, la meilleure précision de la gamme Flash de Google et la plus grande consommation de tokens de la famille.

claude-sonnet-5 obtient une précision de 86,97 % avec 414,668 tokens. Il égale gemini-3.5-flash à la décimale près tout en utilisant 414,668 tokens contre 1,191,757, à $4.33 par exécution contre $10.83.

gpt-5.6-terra obtient une précision de 86,97 % avec 121,936 tokens pour $1.99 par exécution. Il rejoint claude-sonnet-5 et gemini-3.5-flash à 86,97 %, avec le plus faible nombre de tokens et le coût le plus bas des trois (121,936 tokens et $1.99, contre 414,668 / $4.33 et 1,191,757 / $10.83). gpt-5-mini-2025-08-07 reste moins cher et plus précis ($1.21, 87,39 %).

gemini-3.1-pro-preview obtient une précision de 86,55 % avec 475,148 tokens, surpassant son prédécesseur gemini-3-pro-preview (86,13 %) avec 35 % de tokens en moins (730,759 tokens).

glm-5.2 obtient une précision de 86,13 % avec 735,988 tokens. Il améliore glm-4.5 (64,29 %) de 21,84 points, le plus grand bond entre deux versions d'une même famille de modèles du benchmark. Le second plus grand est de 3,79 points.

gemini-3-pro-preview et gpt-5.2 sont à égalité à 86,13 % de précision. gpt-5.2 l'atteint avec 247,660 tokens, soit environ trois fois moins de tokens de sortie que gemini-3-pro-preview à 730,759 tokens.

claude-opus-4.7 obtient une précision de 85,29 % avec 103,268 tokens, le modèle plus économe en tokens du peloton de tête (37 % de tokens de sortie en moins que claude-opus-4.6 tout en dépassant le seuil de 83 %).

Performances solides (80-83 % de précision) :

grok-4.3 atteint une précision de 84,87 % avec 309,781 tokens, le meilleur résultat de xAI dans le benchmark et une reprise après l'ancien grok-4-0709.

claude-opus-4.5 obtient une précision de 84,03 % avec 144,505 tokens.

claude-sonnet-4.6 et gemini-3-flash-preview sont à égalité à 83,61 % de précision. Claude Sonnet 4.6 utilise 161,035 tokens, tandis que Gemini 3 Flash Preview l'atteint avec 118,530 tokens, le plus faible nombre de tokens parmi les modèles au-dessus de 83 %.

kimi-k2.5 obtient une précision de 82,77 % avec 877,868 tokens, la plus forte consommation de cette catégorie de performances.

Catégorie intermédiaire (70-80 % de précision) :

o3-pro-2025-06-10 (78,15 % de précision, 473,659 tokens) et kimi-k2 (78,15 % de précision, 100,323 tokens) sont à égalité, et kimi-k2 utilise 79 % de tokens en moins. o3-mini-2025-01-31 (77,31 % de précision, 376,929 tokens), gpt-5-nano-2025-08-07 (76,89 % de précision, 1,028,909 tokens), et claude-sonnet-4-20250514 (76,05 % de précision, 135,462 tokens) suivent.

Performances faibles (<70 % de précision) :

claude-3-5-sonnet-20241022 (67,65 % de précision, 90,103 tokens) et gpt-oss-20b (67,65 % de précision, 515,041 tokens) dominent cette catégorie. gemini-2.5-flash (65,55 % de précision, 286,603 tokens), glm-4.5 (64,29 % de précision, 692,662 tokens), et gpt-4.1-nano-2025-04-14 (63,45 % de précision, 171,096 tokens) suivent.

Aperçu des performances :

La consommation de tokens n'est pas corrélée à la précision. deepseek-r1-0528 a consommé le plus de tokens (1,251,064) pour une précision de 62,18 %, tandis que claude-opus-4-20250514 a obtenu 80,25 % avec 132,274 tokens. L'efficacité en tokens varie également parmi les modèles à haute précision : gemini-3-flash-preview atteint 83,61 % avec 118,530 tokens, tandis que kimi-k2.5 utilise 877,868 tokens pour 82,77 % (7.4x plus de tokens pour 0,84 point de précision en moins).

Le tableau ci-dessus présente d'autres benchmarks de modèles d'IA, y compris ceux utilisés pour ce benchmark.

Coût par exécution du benchmark

Les tokens de sortie seuls ne déterminent pas les dépenses, car les tarifs des tokens d'entrée et de sortie diffèrent d'un ordre de grandeur chez la plupart des fournisseurs. Nous avons calculé le coût en dollars de l'exécution de chaque modèle sur les 238 questions en utilisant le tarif par token indiqué par le fournisseur au moment de l'exécution.

Coût le plus bas dans la catégorie des modèles de pointe : gemini-3-flash-preview atteint 83,61 % de précision pour $0.39, le coût en dollars le plus bas dans la tranche de précision >83 %. grok-4.3 suit à $0.86 pour 84,87 %.

Le palier des 90,34 % est atteint à un coût inférieur : gpt-5.6-sol égale les 90,34 % de claude-fable-5 à $3.85 par exécution contre $10.05 pour fable-5, soit 38 % du coût de fable-5. gpt-5.6-sol-pro enregistre la précision la plus élevée du benchmark, 90,76 %, à $16.35 par exécution. claude-opus-4.8 reste le modèle moins cher à dépasser 88 %, à $3.28 pour 89,08 %.

Raisonnement premium à prix premium : o1-pro est le modèle plus coûteux du benchmark à $381 pour 80,67 % de précision (en raison des tarifs de $150/M en entrée et $600/M en sortie). o3-pro coûte $39.23 pour 78,15 %, o1 coûte $46.59 pour 74,79 %. Aucun n'atteint le peloton de tête, et tous les trois se situent en dessous de claude-opus-4.7 en précision pour plus de 10x son coût.

Coût et précision de la catégorie budget : gpt-oss-120b atteint 81,09 % de précision pour un coût total de $0.06, l'exécution la moins chère du benchmark, à 1,91 point du seuil de 83 %. llama-4-maverick atteint 75,21 % à $0.10. Pour les charges de travail où une précision de 80 % est suffisante, ces modèles coûtent moins de 1 % des modèles phares de pointe.

Méthodologie du benchmark de raisonnement financier

Notre benchmark offre une évaluation transparente et reproductible des performances des LLM sur des tâches complexes de raisonnement financier.

Configuration du test et corpus de données

  • Suite de benchmark : Nous avons utilisé les données, le code et les scripts d'évaluation du benchmark FinanceReasoning, sélectionné pour sa focalisation sur les problèmes financiers quantitatifs et inférentiels.
  • Corpus de connaissances & requêtes de test : Nous avons concentré notre analyse sur le sous-ensemble difficile, comprenant 238 questions difficiles. Comme défini par le benchmark, chaque point de données comprend :
    1. Une question nécessitant une déduction logique et numérique en plusieurs étapes.
    2. Un contexte, qui contient souvent des informations denses présentées dans des formats structurés comme des tableaux Markdown (par exemple, bilans, données de performance boursière).
    3. Une réponse de référence définitive pour une notation objective.
  • Types de requêtes illustratifs : La difficulté du benchmark provient de son exigence que les modèles traitent des tâches de raisonnement financier diverses et complexes. Pour illustrer cette étendue, nous mettons en évidence deux exemples représentatifs de l'ensemble de test :

Exemple : Raisonnement algorithmique et sur séries temporelles (analyse technique)

Contexte : Un investisseur analyse… les prix des actions sur les 25 derniers jours… pour calculer le canal de Keltner en utilisant une période EMA de 10 jours et une période ATR de 10 jours, avec un multiplicateur de 1,5…

Question : Quelle est la valeur de la dernière bande supérieure du canal de Keltner… ? Répondez à deux décimales près.

Cette requête teste la capacité d'un modèle à agir comme un analyste quantitatif en :

  1. Décomposer un indicateur composite : Reconnaître que le « canal de Keltner » est dérivé de deux autres indicateurs complexes :
    • La moyenne mobile exponentielle (EMA)
    • La plage vraie moyenne (ATR).
  2. Implémenter une logique algorithmique : Implémenter correctement les algorithmes itératifs pour l'EMA et l'ATR à partir de zéro sur une série temporelle de 25 points de données.
  3. Synthétiser les résultats : Combiner les valeurs calculées selon la formule finale du canal de Keltner (Bande supérieure = EMA + (Multiplicateur × ATR)).

Principes fondamentaux d'évaluation

  • Appels API isolés et standardisés : Pour chaque modèle, nous avons réalisé l'évaluation de manière programmatique via leurs points de terminaison API respectifs (par exemple, OpenRouter, OpenAI). Cela a garanti que chaque modèle recevait exactement la même entrée dans des conditions identiques, éliminant ainsi la variabilité liée aux interactions avec l'interface utilisateur.
  • Génération libre : Nous n'avons pas contraint les modèles à un format à choix multiples. Au lieu de cela, ils ont été invités à générer une réponse complète et libre, permettant une évaluation plus authentique de leurs capacités de raisonnement.
  • Amorçage par chaîne de pensée (CoT) : Pour susciter et évaluer le processus de raisonnement des modèles, nous avons employé une stratégie d'amorçage par chaîne de pensée (CoT). Le prompt système a explicitement demandé à chaque modèle de « d'abord réfléchir au problème étape par étape » avant de conclure par une réponse finale. Cette approche permet une analyse plus approfondie de la manière dont un modèle arrive à sa conclusion, au-delà de la sortie finale.

Métriques d'évaluation et cadre

Nous avons utilisé le cadre d'évaluation entièrement automatisé du benchmark FinanceReasoning pour noter les sorties des modèles. Ce cadre est conçu pour mesurer à la fois la justesse conceptuelle et le coût computationnel.

1. Métrique principale : Précision

Cette métrique répond à la question cruciale : « Le modèle peut-il résoudre correctement le problème financier ? » Le processus de notation implique un pipeline sophistiqué en deux étapes :

  • Étape 1 : Extraction de la réponse basée sur un LLM : La sortie brute d'un modèle est un texte non structuré contenant à la fois le raisonnement et une réponse finale. Pour extraire de manière fiable la valeur numérique ou booléenne, nous avons utilisé un modèle superviseur (anthropic/claude-sonnet-4.5) comme analyseur.
  • Étape 2 : Comparaison basée sur la tolérance : Une simple « correspondance exacte » est insuffisante pour les problèmes numériques. Par conséquent, la réponse extraite a été comparée de manière programmatique à la vérité terrain. Le script applique un seuil de tolérance numérique (une différence relative de 0.2 %) pour gérer équitablement les variations mineures de virgule flottante ou d'arrondi, garantissant que les solutions conceptuellement correctes sont marquées comme exactes.

2. Métrique secondaire : Consommation de tokens

Cette métrique répond à la question : « À quel point le modèle est-il coûteux en calcul pour résoudre ces problèmes ? » Elle mesure le coût total associé à la génération des 238 réponses.

  • Calcul des tokens : Pour chaque appel API, nous avons collecté prompt_tokens et completion_tokens à partir de l'objet d'utilisation du fournisseur. Le score de tokens par modèle est la somme des completion_tokens sur l'ensemble des 238 questions. Nous rapportons les tokens de complétion (et non le total) car l'entrée est presque constante entre les modèles partageant le même ensemble de données (66k-92k tokens d'entrée par exécution selon le tokenizer).
  • Calcul du coût : Nous avons calculé le coût en dollars comme suit : prompt_tokens × prix_par_M_de_prompt + completion_tokens × prix_par_M_de_complétion, additionné sur les 238 questions. Les prix sont les tarifs par token indiqués par le point de terminaison /api/v1/models de OpenRouter au moment où le modèle a été exécuté.

Cette approche à deux métriques, fournie par le benchmark FinanceReasoning lui-même, permet une évaluation holistique, équilibrant la capacité brute de résolution de problèmes d'un modèle (précision) par rapport à son efficacité opérationnelle (consommation de tokens).

Laissez notre équipe automatiser l'un de vos processus métier avec des agents IA, gratuitement.
Automatiser un processus

Raisonnement financier avec la génération augmentée par récupération (RAG)

Pour surpasser les modèles autonomes, nous avons conçu et implémenté un framework RAG personnalisé, distinct de l'implémentation originale du benchmark. Notre approche repose sur une pile moderne de bases de données vectorielles (Qdrant) pour fournir aux LLMs des connaissances pertinentes et spécifiques au domaine au moment de l'inférence, les aidant à résoudre des problèmes au-delà de leurs données d'entraînement. Nous avons testé cela sur gpt-4o-mini pour mesurer son impact.

Résultats et analyse : le compromis RAG

L'introduction du RAG a eu un impact significatif et mesurable sur les performances de gpt-4o-mini.

Points clés de l'évaluation RAG :

  • Amélioration significative de la précision : Le RAG a nettement amélioré la capacité de résolution de problèmes du modèle, augmentant la précision de plus de 10 points de pourcentage. Cela confirme que fournir un contexte externe pertinent est très efficace pour les tâches de raisonnement complexes et spécifiques à un domaine.
  • Le coût de la précision : Ce gain de performance s'est accompagné d'un coût élevé. La consommation totale de tokens a augmenté de près de x18, et le temps d'exécution total a été multiplié par x20. Cela est dû aux appels API supplémentaires pour l'embedding et, surtout, aux prompts beaucoup plus volumineux et complexes que le LLM doit traiter.
  • Implications pour les modèles plus grands : Les résultats de gpt-4o-mini suggèrent que, bien que le RAG puisse débloquer des performances plus élevées, l'application de cette méthode à des modèles plus grands et plus coûteux comme GPT-4o ou Claude Opus sera considérablement plus coûteuse et plus longue. Cela met en évidence le compromis critique entre précision, coût et latence dans la conception de systèmes d'IA financiers de qualité production.

Méthodologie du raisonnement financier avec RAG

Notre pipeline RAG repose sur une pile moderne utilisant Qdrant comme base de données vectorielle et le modèle text-embedding-3-small de OpenAI pour générer des représentations vectorielles sémantiques. Le processus se compose de deux phases principales : une phase d'indexation hors ligne et une phase de récupération-génération en ligne.

1. Indexation du corpus de connaissances

  • Création du corpus : Nous avons constitué une base de connaissances spécialisée à partir de deux sources fournies par le benchmark :
    1. Documents financiers : Une collection d'articles (financial_documents.json) expliquant divers concepts et termes financiers.
    2. Fonctions financières : Une bibliothèque de fonctions Python prêtes à l'emploi (functions-article-all.json) conçues pour résoudre des calculs financiers spécifiques.
  • Découpage intelligent & embedding : Pour préparer ce corpus à une récupération efficace, chaque document et fonction a été traité et indexé :
    1. Découpage : Les documents ont été segmentés en blocs plus petits et sémantiquement cohérents en fonction de leurs sections. Chaque fonction Python a été traitée comme un bloc atomique unique. Cela garantit que le contexte récupéré est ciblé et pertinent.
    2. Embedding : Chaque bloc a ensuite été converti en un vecteur de dimension 1536 à l'aide du modèle text-embedding-3-small.
    3. Indexation : Ces vecteurs ont été indexés dans deux collections distinctes au sein de notre instance Qdrant locale (financial_documents_openai_small et financial_functions_openai_small), optimisées pour la recherche par similarité cosinus.

2. Inférence assistée par RAG

Pour chacune des 238 questions, le processus de raisonnement du modèle a été augmenté des étapes automatisées suivantes :

  1. Génération d'embedding (appels API 1 & 2) : La requête de l'utilisateur (question + contexte) a été convertie en un vecteur d'embedding. Cela a nécessité deux appels à l'API d'embedding de OpenAI pour préparer les recherches dans les deux collections.
  2. Récupération multi-source : Le vecteur de la requête a été utilisé pour effectuer une recherche sémantique simultanée dans les deux collections Qdrant afin de récupérer les informations les plus pertinentes :
    • Les 3 blocs de documents les plus pertinents de la collection financial_documents.
    • Les 2 fonctions Python les plus pertinentes de la collection financial_functions.
  3. Augmentation du prompt : Les documents et fonctions récupérés ont été injectés dynamiquement dans le prompt, créant un « paquet d'informations » riche et contextuel. Cela a considérablement augmenté la taille du prompt d'entrée (de ~300-500 tokens à ~3,000-5,000+ tokens).
  4. Génération de la réponse finale (appel API 3) : Ce prompt augmenté a été envoyé au modèle gpt-4o-mini pour générer la réponse finale raisonnée.

Limites du benchmark des LLMs en finance

Notre benchmark, bien que complet, est soumis à plusieurs limitations clés :

  • Risque de contamination des données : Il est possible que ces modèles aient été entraînés sur le jeu de données du benchmark, car celui-ci est public. Cela pourrait conduire à des scores gonflés, rendant la véritable capacité de raisonnement difficile à évaluer.
  • Analyse RAG sur un seul modèle : L'évaluation RAG a été réalisée sur un seul modèle (gpt-4o-mini), de sorte que les compromis observés entre performance et coût peuvent ne pas s'appliquer à tous les autres modèles.

Conclusion

Notre benchmark de 40+ modèles sur des tâches complexes de raisonnement financier montre ce qui suit :

gpt-5.6-sol-pro atteint la précision la plus élevée du benchmark avec 90,76 % et 385,886 tokens pour $16.35 par exécution. gpt-5.6-sol et claude-fable-5 sont à égalité à 90,34 %.

gpt-5.6-sol égale les 90,34 % de claude-fable-5 à $3.85 par exécution contre $10.05 pour fable-5, le coût le plus bas au palier de précision 90,34 %.

claude-opus-4.8 obtient 89,08 % avec 113,434 tokens pour $3.28, dépassant gpt-5-2025-08-07 (88,23 %) avec environ 7x moins de tokens de sortie et moins de la moitié du coût ($3.28 contre $8.38), et reste le modèle le moins cher au-dessus de 88 % de précision.

claude-opus-4.6 (87,82 %, 164,369 tokens) et gpt-5-mini-2025-08-07 (87,39 %, 595,505 tokens) atteignent une précision proche du sommet. gpt-5.6-terra atteint 86,97 % à $1.99, le coût le plus bas parmi les trois modèles à égalité à cette précision.

gemini-3.1-pro-preview (86,55 %) est au-dessus de gemini-3-pro-preview (86,13 %) avec 35 % de tokens en moins, ce qui montre que les mises à jour itératives peuvent améliorer à la fois la précision et l'efficacité.

gemini-3-flash-preview atteint 83,61 % avec 118,530 tokens pour $0.39, et gpt-5.2 atteint 86,13 % avec 247,660 tokens.

Le RAG a augmenté la précision de gpt-4o-mini de 10,08 points au prix de 17.7x plus de tokens et de 20x la latence.

Ne manquez pas nos benchmarks et analyses basées sur les données. Le bouton ouvre Google ; sélectionner AIMultiple confirme que vous souhaitez voir AIMultiple plus souvent dans les résultats de recherche Google.
GoogleAjouter comme source préférée

Journal des modifications

Nous ajoutons des modèles à ce benchmark à chaque nouvelle version.

Juillet 10 2026

  • OpenAI: GPT-5.6 Sol (openai/gpt-5.6-sol)
  • OpenAI: GPT-5.6 Terra (openai/gpt-5.6-terra)
  • OpenAI: GPT-5.6 Sol Pro (openai/gpt-5.6-sol-pro)

Juin 30 2026

  • Anthropic: Claude Sonnet 5 (anthropic/claude-sonnet-5)

Juin 22 2026

  • Zhipu IA: GLM-5.2 (z-ai/glm-5.2)

Juin 10 2026

  • Anthropic: Claude Fable 5 (anthropic/claude-fable-5)

2 juin 2026

  • Anthropic: Claude Opus 4.8 (anthropic/claude-opus-4.8)

Mai 22 2026

  • Google: Gemini 3.5 Flash (google/gemini-3.5-flash)
  • xAI: Grok 4.3 (x-ai/grok-4.3)
  • Ajout de la colonne coût par exécution du benchmark et du basculement du graphique précision-coût. Méthodologie mise à jour avec la formule de calcul du coût et le changement de l'extracteur de réponse (claude-sonnet-4.5)

Avril 20 2026

  • Anthropic: Claude Opus 4.7 (anthropic/claude-opus-4.7)

Février 20 2026

  • Google: Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview)
  • Anthropic: Claude Sonnet 4.6 (anthropic/claude-sonnet-4.6)

6 février 2026

  • Anthropic: Claude Opus 4.6 (anthropic/claude-opus-4.6)
  • Anthropic: Claude Opus 4.5 (anthropic/claude-opus-4.5)
  • Anthropic: Claude Sonnet 4.5 (anthropic/claude-sonnet-4.5)
  • Google: Gemini 3 Pro Preview (google/gemini-3-pro-preview)
  • Google: Gemini 3 Flash Preview (google/gemini-3-flash-preview)
  • OpenAI: GPT-5.2 (openai/gpt-5.2)
  • Moonshot IA: Kimi K2.5 (moonshotai/kimi-k2.5)

Pour en savoir plus

L'analyse financière peut faire référence à de multiples capacités, telles que l'analyse boursière, l'interprétation du droit financier et le raisonnement financier. Dans notre benchmark, nous sommes concentrés spécifiquement sur le raisonnement financier, tandis que d'autres tâches sont couvertes dans des articles séparés :

  • LLM pour l'analyse boursière : Ces modèles aident à traiter les données de marché, les rapports d'entreprise et les actualités pour identifier des opportunités d'investissement. (Voir l'analyse complète ici : IA-based Stock Trading)
  • IA du droit financier : Certains LLMs peuvent interpréter les réglementations financières, les contrats et les exigences de conformité pour assister les tâches juridico-financières. (Voir notre liste d'outils d'IA juridique ici : Legal IA Tools)

FAQ

Un LLM (modèle de langage large) en finance est un modèle d'IA qui utilise des techniques de traitement du langage naturel pour effectuer des analyses financières complexes, la gestion de la conformité et la compréhension de documents. Ces modèles aident les institutions financières à naviguer dans le droit financier, les exigences réglementaires et les demandes dynamiques du secteur financier.

Chatbots intelligents :
LLM-driven virtual assistants enable financial firms to provide automated, 24/7 customer support by handling routine queries and onboarding tasks without human intervention. This reduces wait times and improves customer satisfaction while freeing human agents for complex issues.

Conseil & analyse :
Les banques d'investissement utilisent les LLMs pour analyser les tendances du marché, les actualités financières et les données clients. Ces modèles digèrent de grands volumes d'informations non structurées, permettant aux conseillers de fournir des conseils en investissement personnalisés et une gestion de portefeuille avec des informations en temps réel.

Analyse de documents réglementaires :
Les cabinets d'avocats et les institutions financières utilisent les LLMs pour traiter des documents réglementaires denses comme les déclarations à la SEC. Ces modèles extraient les informations clés et résument les rapports, réduisant le temps d'examen manuel et aidant les entreprises à rester conformes aux réglementations en évolution.

Détection de fraude :
Les LLMs analysent de vastes ensembles de données financières en temps réel pour détecter des schémas de transactions suspects et les nouvelles tactiques de fraude. Leurs capacités d'apprentissage continu permettent une identification plus rapide et plus précise des fraudes que les méthodes traditionnelles.

Automatisation juridique et conformité :
Les cabinets d'avocats et les équipes de conformité utilisent les LLMs pour examiner les contrats, interpréter les lois bancaires et vérifier la conformité réglementaire. L'automatisation de ces tâches réduit le temps d'examen et les coûts juridiques tout en garantissant le respect des réglementations financières complexes.

Questions-réponses sur documents et reconnaissance d'entités nommées (NER) :
Les institutions financières déploient des LLMs pour répondre aux questions des investisseurs en extrayant des données des rapports financiers et des appels sur les résultats. La NER permet le marquage automatique des noms d'entreprises, des symboles boursiers (symboles de cotation) et des entités réglementaires, rationalisant ainsi la récupération des données.

Efficacité et automatisation : Les LLMs automatisent les analyses de routine (par exemple, résumer les rapports sur les résultats, traiter les prêts ou les dépôts), économisant des heures d'analyste et réduisant les erreurs.

Service client 24h/24 et 7j/7 : Les assistants virtuels et chatbots alimentés par des LLMs peuvent traiter les requêtes des clients 24 heures sur 24 avec des réponses conversationnelles, améliorant l'expérience et la satisfaction client.

Conseils financiers personnalisés : En analysant l'historique et le profil de risque d'un client, les LLMs fournissent des conseils financiers ou d'investissement sur mesure.

Détection de fraude & gestion des risques : Les LLMs passent au crible de grands ensembles de données de transactions pour repérer des anomalies ou des schémas de fraude, s'adaptant aux nouvelles tactiques d'escroquerie et aidant à établir des profils de risque.

Conformité & reporting : Les LLMs rédigent automatiquement des rapports réglementaires, extraient des faits pertinents pour les politiques et aident à analyser les lois et réglementations financières complexes pour la conformité.

Oui, plusieurs modèles spécifiques au domaine de plus grande envergure existent pour la finance. Par exemple, BloombergGPT est conçu pour aider à la réglementation financière, aux marchés des capitaux et à la gestion de la conformité en traitant de grands ensembles de données financières, y compris des documents provenant des bourses de valeurs nationales et des dépôts réglementaires.

D'autres modèles comme FinBERT et FinGPT se concentrent sur le droit financier, le droit bancaire international et les conseils financiers personnalisés, adaptant les modèles de langage large au vocabulaire spécialisé de la finance tel que les symboles de cotation boursière et les textes réglementaires.

Le raisonnement financier est la capacité à analyser des données financières pour prendre des décisions commerciales ou d'investissement éclairées.

Les principales tâches incluent :
– Analyse des états financiers (profit, flux de trésorerie, bilan)
– Budgétisation et prévisions
– Évaluation des investissements (VAN, TRI, ROI)
– Gestion des flux de trésorerie et des liquidités
– Évaluation des risques financiers et des ratios de performance

Citez ce benchmark

Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.

Ekrem Sarı (2026) - "Benchmark de 40+ LLMs en finance: Claude Fable 5 & GPT-5.6 Sol". Publié en ligne sur AIMultiple.com. Consulté le 10 Juillet 2026, à : https://aimultiple.com/finance-llm [Ressource en ligne]

Sarı, E. (2026, 10 Juillet). Benchmark de 40+ LLMs en finance: Claude Fable 5 & GPT-5.6 Sol. AIMultiple. https://aimultiple.com/finance-llm

@misc{sari2026,
  author = {Sarı, Ekrem},
  title  = {{Benchmark de 40+ LLMs en finance: Claude Fable 5 & GPT-5.6 Sol}},
  year   = {2026},
  month  = jul,
  howpublished    = {\url{https://aimultiple.com/finance-llm}},
  note   = {AIMultiple. Consulté le 10 Juillet 2026}
}
Télécharger toutes les données

Résultats et horodatages de 52 points de données. Téléchargez les données utilisées dans cet article sous forme de fichier ZIP contenant un fichier CSV et un README.

Dernière mise à jour : 6 Juillet 2026
Télécharger
Ekrem Sarı
Ekrem Sarı
Chercheur en IA
Ekrem est chercheur en IA et analyste de données chez AIMultiple. Il conçoit et exécute des benchmarks pratiques pour les systèmes d'IA et de LLM.
Voir le profil complet

Soyez le premier à commenter

Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.

0/450