Benchmark de 40+ LLM en finance: Claude Fable 5 & GPT-5.6 Sol
We evaluated 40+ LLMs in finance on 238 hard questions from the FinanceReasoning benchmark to identify which models excel at complex financial reasoning tasks.
Nous avons évalué les LLM sur 238 questions difficiles du benchmark FinanceReasoning (Tang et al.).1 Ce sous-ensemble cible les tâches de raisonnement financier les plus difficiles, en évaluant le raisonnement quantitatif complexe à plusieurs étapes impliquant des concepts et des formules financiers. Notre évaluation a utilisé une conception de prompt personnalisée et des critères de notation basés sur l’exactitude et la consommation de tokens.
Pour une explication détaillée de la façon dont ces métriques ont été calculées et du framework utilisé pour cette évaluation, veuillez consulter notre méthodologie de benchmark financier.
Résultats : quel LLM est le meilleur pour la finance ?
Performeurs de premier plan (> 83 % d’exactitude) :
gpt-5.6-sol-pro atteint la plus haute exactitude du benchmark à 90.76 % avec 385 886 tokens pour 16.35 $ par exécution, soit 0.42 point au-dessus de gpt-5.6-sol.
gpt-5.6-sol obtient une exactitude de 90.34 % avec 117 735 tokens pour 3.85 $ par exécution. Il est à égalité avec claude-fable-5 (90.34 %) pour la deuxième meilleure exactitude, à 3.85 $ contre 10.05 $ pour fable-5 et 117 735 tokens contre 183 258. Aucun modèle à exactitude égale ou supérieure ne fonctionne à un coût inférieur.
claude-fable-5 obtient une exactitude de 90.34 % avec 183 258 tokens. Il a été le premier modèle à dépasser 90 % sur ce benchmark (juin 10) et est à égalité avec gpt-5.6-sol à 90.34 %, à raison de 10.05 $ par exécution contre 3.85 $ pour gpt-5.6-sol.
claude-opus-4.8 obtient une exactitude de 89.08 % avec 113 434 tokens, soit le troisième résultat le plus coûteux et le plus faible nombre de tokens de sortie parmi les modèles dépassant 88 %.
gpt-5-2025-08-07 obtient une exactitude de 88.23 % avec 829 720 tokens.
claude-opus-4.6 obtient une exactitude de 87.82 % avec 164 369 tokens, une exactitude proche des meilleurs avec 20 % du nombre de tokens de gpt-5.
gpt-5-mini-2025-08-07 atteint une exactitude de 87.39 % avec 595 505 tokens.
gemini-3.5-flash atteint une exactitude de 86.97 % avec 1 191 757 tokens, la plus haute exactitude de la gamme Flash de Google et le plus grand consommateur de tokens de la famille.
claude-sonnet-5 obtient une exactitude de 86.97 % avec 414 668 tokens. Il égale gemini-3.5-flash à la décimale près tout en consommant 414 668 tokens contre 1 191 757, pour 4.33 $ par exécution contre 10.83 $.
gpt-5.6-terra obtient une exactitude de 86.97 % avec 121 936 tokens pour 1.99 $ par exécution. Il rejoint claude-sonnet-5 et gemini-3.5-flash à 86.97 %, avec le plus petit nombre de tokens et le coût le plus bas des trois (121 936 tokens et 1.99 $, contre 414 668 / 4.33 $ et 1 191 757 / 10.83 $). gpt-5-mini-2025-08-07 reste moins cher et plus précis (1.21 $, 87.39 %).
gemini-3.1-pro-preview obtient une exactitude de 86.55 % avec 475 148 tokens, dépassant son prédécesseur gemini-3-pro-preview (86.13 %) avec 35 % de tokens en moins (730 759 tokens).
glm-5.2 obtient une exactitude de 86.13 % avec 735 988 tokens. Il améliore glm-4.5 (64.29 %) de 21.84 points, la plus grande progression entre deux versions d’une même famille de modèles du benchmark. La suivante est de 3.79 points.
gemini-3-pro-preview et gpt-5.2 sont à égalité à une exactitude de 86.13 %. gpt-5.2 l’atteint avec 247 660 tokens, soit environ trois fois moins de tokens de sortie que gemini-3-pro-preview avec 730 759 tokens.
claude-opus-4.7 obtient une exactitude de 85.29 % avec 103 268 tokens, le modèle plus économe en tokens du premier groupe (37 % de tokens de sortie en moins que claude-opus-4.6 tout en dépassant le seuil de 83 %).
Performeurs solides (exactitude de 80 à 83 %) :
grok-4.3 atteint une exactitude de 84.87 % avec 309 781 tokens, le meilleur résultat de xAI dans le benchmark et un redressement par rapport à grok-4-0709.
claude-opus-4.5 obtient une exactitude de 84.03 % avec 144 505 tokens.
claude-sonnet-4.6 et gemini-3-flash-preview sont à égalité à une exactitude de 83.61 %. Claude Sonnet 4.6 utilise 161 035 tokens, tandis que Gemini 3 Flash Preview l’atteint avec 118 530 tokens, le plus faible nombre de tokens parmi les modèles dépassant 83 %.
kimi-k2.5 obtient une exactitude de 82.77 % avec 877 868 tokens, la consommation la plus élevée de cette catégorie de performance.
Tier intermédiaire (exactitude de 70 à 80 %) :
o3-pro-2025-06-10 (exactitude de 78.15 %, 473 659 tokens) et kimi-k2 (exactitude de 78.15 %, 100 323 tokens) sont à égalité, et kimi-k2 utilise 79 % de tokens en moins. o3-mini-2025-01-31 (exactitude de 77.31 %, 376 929 tokens), gpt-5-nano-2025-08-07 (exactitude de 76.89 %, 1 028 909 tokens) et claude-sonnet-4-20250514 (exactitude de 76.05 %, 135 462 tokens) suivent.
Performeurs faibles (exactitude inférieure à 70 %) :
claude-3-5-sonnet-20241022 (exactitude de 67.65 %, 90 103 tokens) et gpt-oss-20b (exactitude de 67.65 %, 515 041 tokens) dominent cette catégorie. gemini-2.5-flash (exactitude de 65.55 %, 286 603 tokens), glm-4.5 (exactitude de 64.29 %, 692 662 tokens) et gpt-4.1-nano-2025-04-14 (exactitude de 63.45 %, 171 096 tokens) suivent.
Aperçu des performances :
La consommation de tokens n’est pas corrélée à l’exactitude. deepseek-r1-0528 a consommé le plus de tokens (1 251 064) pour une exactitude de 62.18 %, tandis que claude-opus-4-20250514 a obtenu 80.25 % avec 132 274 tokens. L’efficacité en tokens varie aussi parmi les modèles à forte exactitude : gemini-3-flash-preview atteint 83.61 % avec 118 530 tokens, tandis que kimi-k2.5 dépense 877 868 tokens pour 82.77 % (7.4x fois plus de tokens pour 0.84 point d’exactitude en moins).
Le tableau ci-dessus présente d’autres benchmarks de modèles d’IA, y compris ceux utilisés pour ce benchmark.
Coût par exécution du benchmark
Les tokens de sortie seuls ne déterminent pas les dépenses, car les tarifs des tokens d’entrée et de sortie diffèrent d’un ordre de grandeur chez la plupart des fournisseurs. Nous avons calculé le coût en dollars de l’exécution de chaque modèle sur les 238 questions en utilisant le tarif par token indiqué par le fournisseur au moment de l’exécution.
Coût le plus bas dans le niveau frontière : gemini-3-flash-preview atteint une exactitude de 83.61 % pour 0.39 $, le coût en dollars le plus bas dans la tranche d’exactitude > 83 %. grok-4.3 suit à 0.86 $ pour 84.87 %.
Le niveau de 90.34 % est atteint à moindre coût : gpt-5.6-sol égale le score de claude-fable-5 de 90.34 % à 3.85 $ par exécution contre 10.05 $ pour fable-5, soit 38 % du coût de fable-5. gpt-5.6-sol-pro enregistre la plus haute exactitude du benchmark, 90.76 %, à 16.35 $ par exécution. claude-opus-4.8 reste le modèle moins cher à dépasser 88 %, à 3.28 $ pour 89.08 %.
Raisonnement premium à prix premium : o1-pro est le modèle plus coûteux du benchmark à 381 $ pour une exactitude de 80.67 % (en raison des tarifs de 150 $/M en entrée et de 600 $/M en sortie). o3-pro coûte 39.23 $ pour 78.15 %, o1 coûte 46.59 $ pour 74.79 %. Aucun n’atteint le niveau supérieur, et tous les trois se situent en dessous de claude-opus-4.7 en exactitude pour un coût plus de 10x supérieur.
Coût et exactitude de la catégorie budget : gpt-oss-120b atteint une exactitude de 81.09 % pour un total de 0.06 $, l’exécution la moins chère du benchmark, à 1.91 point du seuil de 83 %. llama-4-maverick atteint 75.21 % à 0.10 $. Pour les charges de travail où une exactitude de 80 % suffit, ces modèles coûtent moins de 1 % des modèles frontières phares.
Méthodologie du benchmark de raisonnement financier
Notre benchmark fournit une évaluation transparente et reproductible des performances des LLM sur des tâches complexes de raisonnement financier.
Configuration du test et corpus de données
- Suite de benchmark : Nous avons utilisé les données, le code et les scripts d’évaluation du benchmark FinanceReasoning, sélectionné pour l’accent mis sur les problèmes financiers quantitatifs et inférentiels.
- Corpus de connaissances et requêtes de test : Nous avons concentré notre analyse sur le sous-ensemble difficile, comprenant 238 questions exigeantes. Tel que défini par le benchmark, chaque point de données comprend :
- Une question exigeant une déduction logique et numérique en plusieurs étapes.
- Un contexte, qui contient souvent des informations denses présentées dans des formats structurés comme des tableaux Markdown (par exemple, bilans comptables, données de performance boursière).
- Une réponse de vérité terrain définitive pour une notation objective.
- Types de requêtes illustratifs : La difficulté du benchmark vient de l’exigence pour les modèles de gérer des tâches de raisonnement financier diverses et complexes. Pour illustrer cette diversité, nous mettons en avant deux exemples représentatifs du jeu de test :
Exemple : raisonnement algorithmique et sur séries temporelles (analyse technique)
Contexte : Un investisseur analyse… les cours des actions sur les 25 derniers jours… pour calculer le canal de Keltner en utilisant une période EMA de 10 jours et une période ATR de 10 jours, avec un multiplicateur de 1.5…
Question : Quelle est la valeur de la dernière bande supérieure du canal de Keltner… ? Répondez à deux décimales près.
Cette requête teste la capacité d’un modèle à agir en tant qu’analyste quantitatif en :
- Décomposer un indicateur composite : reconnaître que le « canal de Keltner » est dérivé de deux autres indicateurs complexes :
- La moyenne mobile exponentielle (EMA)
- La fourchette réelle moyenne (ATR).
- Implémenter la logique algorithmique : implémenter correctement les algorithmes itératifs pour l’EMA et l’ATR à partir de zéro sur une série temporelle de 25 points de données.
- Synthétiser les résultats : combiner les valeurs calculées selon la formule finale du canal de Keltner (Bande supérieure = EMA + (Multiplicateur × ATR)).
Principes fondamentaux de l’évaluation
- Appels API isolés et standardisés : Pour chaque modèle, nous avons réalisé l’évaluation par programmation via leurs endpoints API respectifs (par exemple, OpenRouter, OpenAI). Cela a garanti que chaque modèle a reçu exactement la même entrée dans des conditions identiques, éliminant la variabilité liée aux interactions avec l’interface utilisateur.
- Génération libre : Nous n’avons pas limité les modèles à un format à choix multiples. Au lieu de cela, ils ont été invités à générer une réponse complète, de forme gratuit, permettant une évaluation plus authentique de leurs capacités de raisonnement.
- Prompting par chaîne de pensée (CoT) : Pour susciter et évaluer le processus de raisonnement des modèles, nous avons employé une stratégie de prompting par chaîne de pensée (CoT). Le prompt système a explicitement demandé à chaque modèle de « d’abord réfléchir au problème étape par étape » avant de conclure par une réponse finale. Cette approche permet une analyse plus approfondie de la façon dont un modèle parvient à sa conclusion, au-delà de la sortie finale.
Métriques d’évaluation et framework
Nous avons utilisé le framework d’évaluation entièrement automatisé du benchmark FinanceReasoning pour noter les sorties des modèles. Ce framework est conçu pour mesurer à la fois la justesse conceptuelle et le coût computationnel.
1. Métrique principale : exactitude
Cette métrique répond à la question cruciale : « Le modèle peut-il résoudre correctement le problème financier ? » Le processus de notation implique un pipeline sophistiqué en deux étapes :
- Étape 1 : extraction de réponse basée sur un LLM : La sortie brute d’un modèle est un texte non structuré contenant à la fois le raisonnement et une réponse finale. Pour analyser de manière fiable la valeur numérique ou booléenne, nous avons utilisé un modèle superviseur (anthropic/claude-sonnet-4.5) comme analyseur.
- Étape 2 : comparaison basée sur la tolérance : Une simple « correspondance exacte » est insuffisante pour les problèmes numériques. Par conséquent, la réponse extraite a été comparée par programme à la vérité terrain. Le script applique un seuil de tolérance numérique (une différence relative de 0.2 %) pour gérer équitablement les variations mineures de virgule flottante ou d’arrondi, garantissant que les solutions conceptuellement correctes sont marquées comme justes.
2. Métrique secondaire : consommation de tokens
Cette métrique répond à la question : « Quel est le coût computationnel pour le modèle de résoudre ces problèmes ? » Elle mesure le coût total associé à la génération des 238 réponses.
- Calcul des tokens : Pour chaque appel API, nous avons collecté prompt_tokens et completion_tokens à partir de l’objet d’utilisation du fournisseur. Le score en tokens par modèle est la somme des completion_tokens sur l’ensemble des 238 questions. Nous rapportons les tokens de complétion (et non les tokens totaux) car l’entrée est presque constante entre les modèles qui partagent le même dataset (66k-92k tokens d’entrée par exécution selon le tokenizer).
- Calcul du coût : Nous avons calculé le coût en dollars comme suit : prompt_tokens × prompt_price_per_M + completion_tokens × completion_price_per_M, additionné sur l’ensemble des 238 questions. Les prix sont les tarifs par token indiqués par l’endpoint /api/v1/models de OpenRouter au moment de l’exécution du modèle.
Cette approche à deux métriques, fournie par le benchmark FinanceReasoning lui-même, permet une évaluation holistique, en équilibrant la capacité brute de résolution de problèmes d’un modèle (l’exactitude) et son efficacité opérationnelle (la consommation de tokens).
Raisonnement financier avec la génération augmentée par récupération (RAG)
Pour surpasser les modèles autonomes, nous avons conçu et mis en œuvre un RAG framework personnalisé, distinct de l’implémentation originale du benchmark. Notre approche repose sur une pile moderne de base de données vectorielle (Qdrant) pour fournir aux LLM des connaissances pertinentes et spécifiques au domaine au moment de l’inference, les aidant à résoudre des problèmes au-delà de leurs données d’entraînement. Nous l’avons testé sur gpt-4o-mini pour mesurer son impact.
Résultats et analyse : le compromis du RAG
L’introduction du RAG a eu un impact significatif et mesurable sur les performances de gpt-4o-mini.
Principaux enseignements de l’évaluation du RAG :
- Amélioration significative de l’exactitude : le RAG a nettement amélioré la capacité de résolution de problèmes du modèle, augmentant l’exactitude de plus de 10 points de pourcentage. Cela confirme que fournir un contexte externe pertinent est très efficace pour les tâches de raisonnement complexes et spécifiques à un domaine.
- Le coût de l’exactitude : ce gain de performance s’est fait à un coût élevé. La consommation totale de tokens a augmenté de près de x18, et le temps d’exécution total a augmenté de x20. Cela est dû aux appels API supplémentaires pour l’embedding et, surtout, aux prompts beaucoup plus volumineux et complexes que le LLM doit traiter.
- Implications pour les modèles plus grands : les résultats de gpt-4o-mini suggèrent que, si le RAG peut débloquer des performances supérieures, appliquer cette méthode à des modèles plus grands et plus coûteux comme GPT-4o ou Claude Opus sera nettement plus coûteux et plus long. Cela met en évidence le compromis critique entre exactitude, coût et latence dans la conception de systèmes d’IA financiers de qualité production.
Méthodologie de raisonnement financier avec RAG
Notre pipeline RAG est construit sur une pile moderne utilisant Qdrant comme base de données vectorielle et le modèle text-embedding-3-small d’OpenAI pour générer des représentations vectorielles sémantiques. Le processus se compose de deux phases principales : une phase d’indexation hors ligne et une phase de récupération-génération en ligne.
1. Indexation du corpus de connaissances
- Création du corpus : Nous avons constitué une base de connaissances spécialisée à partir de deux sources fournies par le benchmark :
- Documents financiers : une collection d’articles (financial_documents.json) expliquant divers concepts et termes financiers.
- Fonctions financières : une bibliothèque de fonctions Python prêtes à l’emploi (functions-article-all.json) conçues pour résoudre des calculs financiers spécifiques.
- Chunking et embedding intelligents : Pour préparer ce corpus à une récupération efficace, chaque document et fonction a été traité et indexé :
- Chunking : Les documents ont été segmentés en blocs plus petits et sémantiquement cohérents en fonction de leurs sections. Chaque fonction Python a été traitée comme un seul bloc atomique. Cela garantit que le contexte récupéré est ciblé et pertinent.
- Embedding : Chaque bloc a ensuite été converti en un vecteur à 1536 dimensions en utilisant le modèle text-embedding-3-small.
- Indexation : Ces vecteurs ont été indexés dans deux collections distinctes au sein de notre instance locale de Qdrant (financial_documents_openai_small et financial_functions_openai_small), optimisées pour la recherche par similarité cosinus.
2. Inference alimentée par RAG
Pour chacune des 238 questions, le processus de raisonnement du modèle a été augmenté avec les étapes automatisées suivantes :
- Génération d’embedding (appels API 1 & 2) : La requête de l’utilisateur (question + contexte) a été convertie en un vecteur d’embedding. Cela a nécessité deux appels à l’API d’embedding d’OpenAI pour préparer les recherches dans les deux collections.
- Récupération multi-sources : Le vecteur de requête a été utilisé pour effectuer une recherche sémantique simultanée dans les deux collections Qdrant afin de récupérer les informations les plus pertinentes :
- Les 3 blocs de documents les plus pertinents de la collection financial_documents.
- Les 2 fonctions Python les plus pertinentes de la collection financial_functions.
- Augmentation du prompt : Les documents et fonctions récupérés ont été injectés dynamiquement dans le prompt, créant un « paquet d’informations » riche et contextuel. Cela a considérablement augmenté la taille du prompt d’entrée (de ~300-500 tokens à ~3 000-5 000+ tokens).
- Génération de la réponse finale (appel API 3) : Ce prompt augmenté a été envoyé au modèle gpt-4o-mini pour générer la réponse finale et raisonnée.
Limites du benchmark des LLM en finance
Notre benchmark, bien que complet, est soumis à plusieurs limites clés :
- Risque de contamination des données : il est possible que ces modèles aient été entraînés sur le dataset du benchmark, car celui-ci est public. Cela pourrait conduire à des scores gonflés, rendant difficile l’évaluation de la véritable capacité de raisonnement.
- Analyse du RAG sur un seul modèle : l’évaluation du RAG a été réalisée sur un seul modèle (gpt-4o-mini), de sorte que les compromis observés entre performances et coût peuvent ne pas s’appliquer à tous les autres modèles.
Conclusion
Notre benchmark de 40+ modèles sur des tâches complexes de raisonnement financier montre ce qui suit :
gpt-5.6-sol-pro atteint la plus haute exactitude du benchmark à 90.76 % avec 385 886 tokens pour 16.35 $ par exécution. gpt-5.6-sol et claude-fable-5 sont à égalité à 90.34 %.
gpt-5.6-sol égale le score de claude-fable-5 de 90.34 % à 3.85 $ par exécution contre 10.05 $ pour fable-5, soit le coût le plus bas du niveau d’exactitude de 90.34 %.
claude-opus-4.8 obtient une exactitude de 89.08 % avec 113 434 tokens pour 3.28 $, au-dessus de gpt-5-2025-08-07 (88.23 %) avec environ 7x moins de tokens de sortie et moins de la moitié du coût (3.28 $ contre 8.38 $), et reste le modèle le moins cher au-dessus de 88 % d’exactitude.
claude-opus-4.6 (87.82 %, 164 369 tokens) et gpt-5-mini-2025-08-07 (87.39 %, 595 505 tokens) atteignent une exactitude proche des meilleurs. gpt-5.6-terra atteint 86.97 % à 1.99 $, le coût le plus bas parmi les trois modèles à égalité à cette exactitude.
gemini-3.1-pro-preview (86.55 %) dépasse gemini-3-pro-preview (86.13 %) avec 35 % de tokens en moins, de sorte que les mises à jour itératives peuvent améliorer à la fois l’exactitude et l’efficacité.
gemini-3-flash-preview atteint 83.61 % avec 118 530 tokens pour 0.39 $, et gpt-5.2 atteint 86.13 % avec 247 660 tokens.
Le RAG a augmenté l’exactitude de gpt-4o-mini de 10.08 points au prix de 17.7x plus de tokens et de 20x plus de latence.
Journal des modifications
Nous ajoutons des modèles à ce benchmark à chaque nouvelle version.
juillet 10 2026
- OpenAI : GPT-5.6 Sol (openai/gpt-5.6-sol)
- OpenAI : GPT-5.6 Terra (openai/gpt-5.6-terra)
- OpenAI : GPT-5.6 Sol Pro (openai/gpt-5.6-sol-pro)
juin 30 2026
- Anthropic : Claude Sonnet 5 (anthropic/claude-sonnet-5)
juin 22 2026
- Zhipu IA : GLM-5.2 (z-ai/glm-5.2)
juin 10 2026
- Anthropic : Claude Fable 5 (anthropic/claude-fable-5)
2 juin 2026
- Anthropic : Claude Opus 4.8 (anthropic/claude-opus-4.8)
mai 22 2026
- Google : Gemini 3.5 Flash (google/gemini-3.5-flash)
- xAI : Grok 4.3 (x-ai/grok-4.3)
- Ajout de la colonne du coût par exécution du benchmark et du bouton de basculement du graphique exactitude vs coût. Méthodologie mise à jour avec la formule de calcul du coût et le changement d’extracteur de réponse (claude-sonnet-4.5)
avril 20 2026
- Anthropic : Claude Opus 4.7 (anthropic/claude-opus-4.7)
février 20 2026
- Google : Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview)
- Anthropic : Claude Sonnet 4.6 (anthropic/claude-sonnet-4.6)
6 février 2026
- Anthropic : Claude Opus 4.6 (anthropic/claude-opus-4.6)
- Anthropic : Claude Opus 4.5 (anthropic/claude-opus-4.5)
- Anthropic : Claude Sonnet 4.5 (anthropic/claude-sonnet-4.5)
- Google : Gemini 3 Pro Preview (google/gemini-3-pro-preview)
- Google : Gemini 3 Flash Preview (google/gemini-3-flash-preview)
- OpenAI : GPT-5.2 (openai/gpt-5.2)
- Moonshot IA : Kimi K2.5 (moonshotai/kimi-k2.5)
Pour en savoir plus
L’analyse financière peut désigner plusieurs capacités, telles que l’analyse boursière, l’interprétation du droit financier et le raisonnement financier. Dans notre benchmark, nous sommes concentrés spécifiquement sur le raisonnement financier, tandis que d’autres tâches sont couvertes dans des articles distincts :
- LLM pour l’analyse boursière : Ces modèles aident à traiter les données de marché, les rapports d’entreprise et les actualités afin d’identifier des opportunités d’investissement. (Voir l’analyse complète ici : Trading d’actions basé sur l’IA)
- IA de droit financier : Certains LLM peuvent interpréter les réglementations financières, les contrats et les exigences de conformité pour assister les tâches juridico-financières. (Voir notre liste d’outils d’IA juridique ici : Outils d’IA juridique)
FAQ
Un LLM (large language model) en finance est un modèle d’IA qui utilise des techniques de traitement du langage naturel pour effectuer des analyses financières complexes, la gestion de la conformité et la compréhension de documents. Ces modèles aident les institutions financières à naviguer dans le droit financier, les exigences réglementaires et les demandes dynamiques du secteur financier.
Chatbots intelligents :
Les assistants virtuels pilotés par LLM permettent aux entreprises financières de fournir un support client automatisé 24/7 en traitant les requêtes courantes et les tâches d’intégration sans intervention humaine. Cela réduit les temps d’attente et améliore la satisfaction client tout en libérant les agents humains pour les problèmes complexes.
Conseil et analyse :
Les banques d’investissement utilisent les LLM pour analyser les tendances du marché, les actualités financières et les données clients. Ces modèles digèrent de grands volumes d’informations non structurées, permettant aux conseillers de fournir des conseils d’investissement personnalisés et une gestion de portefeuille avec des informations en temps réel.
Analyse de documents réglementaires :
Les cabinets d’avocats et les institutions financières utilisent des LLM pour traiter des documents réglementaires denses comme les dépôts auprès de la SEC. Ces modèles extraient des informations clés et résument les rapports, réduisant le temps de révision manuelle et aidant les entreprises à rester conformes aux réglementations en évolution.
Détection de fraude :
Les LLM analysent de vastes datasets financiers en temps réel pour détecter des schémas de transactions suspects et des tactiques de fraude émergentes. Leurs capacités d’apprentissage continu permettent une identification de la fraude plus rapide et plus précise que les méthodes traditionnelles.
Automatisation juridique et de conformité :
Les cabinets d’avocats et les équipes de conformité utilisent des LLM pour examiner les contrats, interpréter les lois bancaires et vérifier la conformité réglementaire. L’automatisation de ces tâches réduit le temps de révision et les coûts juridiques tout en garantissant le respect des réglementations financières complexes.
Questions-réponses sur documents et reconnaissance d’entités nommées (NER) :
Les institutions financières déploient des LLM pour répondre aux questions des investisseurs en extrayant des données de rapports financiers et d’appels de résultats. La NER permet le marquage automatique des noms d’entreprises, des symboles boursiers (class trading symbols) et des entités réglementaires, rationalisant la récupération des données.
Efficacité et automatisation : les LLM automatisent les analyses de routine (par exemple, résumer les rapports de résultats, traiter les prêts ou les dépôts), économisant des heures d’analyste et réduisant les erreurs.
Service client 24/7 : les assistants virtuels et les chatbots alimentés par des LLM peuvent traiter les demandes des clients 24 heures sur 24 avec des réponses conversationnelles, améliorant l’expérience et la satisfaction client.
Conseils financiers personnalisés : en analysant l’historique et le profil de risque d’un client, les LLM fournissent des conseils financiers ou d’investissement sur mesure.
Détection de fraude et gestion des risques : les LLM passent au crible de grands datasets de transactions pour repérer des anomalies ou des schémas de fraude, s’adaptant aux nouvelles tactiques d’escroquerie et aidant à établir des profils de risque.
Conformité et reporting : les LLM rédigent automatiquement des rapports réglementaires, extraient des faits pertinents pour les politiques et aident à analyser le droit financier et les réglementations complexes pour la conformité.
Oui, plusieurs grands modèles spécifiques au domaine existent pour la finance. Par exemple, BloombergGPT est conçu pour aider à la réglementation financière, aux marchés de capitaux et à la gestion de la conformité en traitant de grands datasets financiers comprenant des documents provenant de la bourse nationale et des dépôts réglementaires.
D’autres modèles comme FinBERT et FinGPT se concentrent sur le droit financier, le droit bancaire international et les conseils financiers personnalisés, adaptant les large language models au vocabulaire spécialisé de la finance tel que les symboles de négociation de classes (class trading symbols) et les textes réglementaires.
Le raisonnement financier est la capacité à analyser des données financières pour prendre des décisions commerciales ou d’investissement éclairées.
Principales tâches :
– Analyser les états financiers (bénéfice, flux de trésorerie, bilan)
– Budgétisation et prévisions
– Évaluation des investissements (VAN, TRI, ROI)
– Gérer les flux de trésorerie et la liquidité
– Évaluer les risques financiers et les ratios de performance
Citez ce benchmark
Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.
@misc{sari2026,
author = {Sarı, Ekrem},
title = {{Benchmark de 40+ LLM en finance: Claude Fable 5 & GPT-5.6 Sol}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/finance-llm}},
note = {AIMultiple. Consulté le 11 Août 2026}
}Résultats et horodatages de 55 points de données. Téléchargez les données utilisées dans cet article sous forme de fichier ZIP contenant 2 fichiers CSV et un README.
Soyez le premier à commenter
Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.