Benchmark de 40+ LLMs en finance: Claude Fable 5 & GPT-5.6 Sol
We evaluated 50+ LLMs in finance on 238 hard questions from the FinanceReasoning benchmark to identify which models excel at complex financial reasoning tasks.
Nous avons évalué des LLMs sur 238 questions difficiles du benchmark FinanceReasoning (Tang et al.).1 Ce sous-ensemble cible les tâches de raisonnement financier les plus difficiles, évaluant un raisonnement quantitatif complexe en plusieurs étapes impliquant des concepts et des formules financières. Notre évaluation a utilisé une conception de prompt personnalisée et des critères de notation basés sur la précision et la consommation de tokens.
Pour une explication détaillée de la manière dont ces métriques ont été calculées et du framework utilisé pour cette évaluation, veuillez consulter notre méthodologie de benchmark financier.
Résultats : Quel LLM est le meilleur pour la finance ?
Performants de premier plan (précision >83 %) :
gpt-5.6-sol-pro atteint la précision la plus élevée du benchmark à 90,76 % avec 385 886 tokens pour 16,35 $ par exécution, soit 0,42 point au-dessus de gpt-5.6-sol.
gpt-5.6-sol obtient une précision de 90,34 % avec 117 735 tokens pour 3,85 $ par exécution. Il est à égalité avec claude-fable-5 (90,34 %) pour la deuxième meilleure précision, à 3,85 $ contre 10,05 $ pour fable-5 et 117 735 tokens contre 183 258. Aucun modèle avec une précision égale ou supérieure n'a un coût plus bas.
claude-fable-5 obtient une précision de 90,34 % avec 183 258 tokens. C'est le premier modèle à dépasser 90 % sur ce benchmark (10 juin) et est à égalité avec gpt-5.6-sol à 90,34 %, à 10,05 $ par exécution contre 3,85 $ pour gpt-5.6-sol.
claude-opus-4.8 obtient une précision de 89,08 % avec 113 434 tokens, le troisième résultat le plus coûteux et le nombre de tokens de sortie le plus bas parmi les modèles au-dessus de 88 %.
gpt-5-2025-08-07 obtient une précision de 88,23 % avec 829 720 tokens.
claude-opus-4.6 obtient une précision de 87,82 % avec 164 369 tokens, une précision presque optimale à 20 % du nombre de tokens de gpt-5.
gpt-5-mini-2025-08-07 atteint une précision de 87,39 % avec 595 505 tokens.
gemini-3.5-flash atteint une précision de 86,97 % avec 1 191 757 tokens, la précision la plus élevée de la gamme Flash de Google et le plus gros consommateur de tokens de la famille.
claude-sonnet-5 obtient une précision de 86,97 % avec 414 668 tokens. Il correspond à gemini-3.5-flash à la décimale près tout en dépensant 414 668 tokens contre 1 191 757, à 4,33 $ par exécution contre 10,83 $.
gpt-5.6-terra obtient une précision de 86,97 % avec 121 936 tokens pour 1,99 $ par exécution. Il rejoint claude-sonnet-5 et gemini-3.5-flash à 86,97 %, avec le nombre de tokens et le coût les plus bas des trois (121 936 tokens et 1,99 $, contre 414 668 / 4,33 $ et 1 191 757 / 10,83 $). gpt-5-mini-2025-08-07 reste moins cher et plus précis (1,21 $, 87,39 %).
gemini-3.1-pro-preview obtient une précision de 86,55 % avec 475 148 tokens, au-dessus de son prédécesseur gemini-3-pro-preview (86,13 %) avec 35 % de tokens en moins (730 759 tokens).
glm-5.2 obtient une précision de 86,13 % avec 735 988 tokens. Il s'améliore par rapport à glm-4.5 (64,29 %) de 21,84 points, le plus grand écart entre deux versions d'une même famille de modèles du benchmark. Le suivant est de 3,79 points.
gemini-3-pro-preview et gpt-5.2 sont à égalité à 86,13 % de précision. gpt-5.2 l'atteint avec 247 660 tokens, soit environ trois fois moins de tokens de sortie que gemini-3-pro-preview à 730 759 tokens.
claude-opus-4.7 obtient une précision de 85,29 % avec 103 268 tokens, le modèle plus économe en tokens du premier plan (37 % de tokens de sortie en moins que claude-opus-4.6 tout en franchissant le seuil de 83 %).
Bons performants (précision 80-83 %) :
grok-4.3 atteint une précision de 84,87 % avec 309 781 tokens, le meilleur résultat de xAI dans le benchmark et une reprise par rapport au précédent grok-4-0709.
claude-opus-4.5 obtient une précision de 84,03 % avec 144 505 tokens.
claude-sonnet-4.6 et gemini-3-flash-preview sont à égalité à 83,61 % de précision. Claude Sonnet 4.6 utilise 161 035 tokens, tandis que Gemini 3 Flash Preview l'atteint avec 118 530 tokens, le nombre de tokens le plus bas parmi les modèles au-dessus de 83 %.
kimi-k2.5 obtient une précision de 82,77 % avec 877 868 tokens, la consommation la plus élevée de ce niveau de performance.
Niveau intermédiaire (précision 70-80 %) :
o3-pro-2025-06-10 (précision de 78,15 %, 473 659 tokens) et kimi-k2 (précision de 78,15 %, 100 323 tokens) sont à égalité, et kimi-k2 utilise 79 % de tokens en moins. o3-mini-2025-01-31 (précision de 77,31 %, 376 929 tokens), gpt-5-nano-2025-08-07 (précision de 76,89 %, 1 028 909 tokens) et claude-sonnet-4-20250514 (précision de 76,05 %, 135 462 tokens) suivent.
Performants faibles (précision <70 %) :
claude-3-5-sonnet-20241022 (précision de 67,65 %, 90 103 tokens) et gpt-oss-20b (précision de 67,65 %, 515 041 tokens) mènent ce niveau. gemini-2.5-flash (précision de 65,55 %, 286 603 tokens), glm-4.5 (précision de 64,29 %, 692 662 tokens) et gpt-4.1-nano-2025-04-14 (précision de 63,45 %, 171 096 tokens) suivent.
Aperçus de performance :
La consommation de tokens ne suit pas la précision. deepseek-r1-0528 a consommé le plus de tokens (1 251 064) à 62,18 % de précision, tandis que claude-opus-4-20250514 a obtenu 80,25 % avec 132 274 tokens. L'efficacité des tokens varie également parmi les modèles de haute précision : gemini-3-flash-preview atteint 83,61 % avec 118 530 tokens, tandis que kimi-k2.5 dépense 877 868 tokens pour 82,77 % (7,4x les tokens pour 0,84 point de précision en moins).
Le tableau ci-dessus présente d'autres benchmarks de modèles d'IA, y compris ceux utilisés pour ce benchmark.
Coût par exécution de benchmark
Les tokens de sortie seuls ne déterminent pas les dépenses, car les tarifs des tokens d'entrée et de sortie diffèrent d'un ordre de grandeur chez la plupart des fournisseurs. Nous avons calculé le coût en dollars de l'exécution de chaque modèle sur les 238 questions en utilisant les tarifs par token indiqués par le fournisseur au moment de l'exécution.
Coût le plus bas dans le niveau frontalier : gemini-3-flash-preview atteint une précision de 83,61 % pour 0,39 $, le coût en dollars le plus bas dans la bande de précision >83 %. grok-4.3 suit à 0,86 $ pour 84,87 %.
Le niveau 90,34 % est atteint à moindre coût : gpt-5.6-sol égale les 90,34 % de claude-fable-5 à 3,85 $ par exécution contre 10,05 $ pour fable-5, soit 38 % du coût de fable-5. gpt-5.6-sol-pro enregistre la précision la plus élevée du benchmark, 90,76 %, à 16,35 $ par exécution. claude-opus-4.8 reste le modèle moins cher à franchir 88 %, à 3,28 $ pour 89,08 %.
Raisonnement premium à prix premium : o1-pro est le modèle plus coûteux du benchmark à 381 $ pour une précision de 80,67 % (en raison de tarifs de 150 $/M en entrée et 600 $/M en sortie). o3-pro coûte 39,23 $ pour 78,15 %, o1 coûte 46,59 $ pour 74,79 %. Aucun ne franchit le premier plan, et tous les trois sont en dessous de claude-opus-4.7 en précision pour plus de 10x son coût.
Coût et précision de la gamme économique : gpt-oss-120b atteint une précision de 81,09 % pour un total de 0,06 $, l'exécution la moins chère du benchmark, à 1,91 point du seuil de 83 %. llama-4-maverick atteint 75,21 % à 0,10 $. Pour les charges de travail où une précision de 80 % est suffisante, ces modèles coûtent moins de 1 % des modèles phares frontaliers.
Tableau complet des résultats des LLM en finance
Le tableau ci-dessous répertorie chaque modèle du benchmark avec sa précision mesurée, ses tokens de sortie et son coût par exécution, plus le coût d'une réponse correcte.
Méthodologie du benchmark de raisonnement financier
Notre benchmark fournit une évaluation transparente et reproductible des performances des LLM sur des tâches complexes de raisonnement financier.
Configuration du test et corpus de données
- Suite de benchmark : Nous avons utilisé les données, le code et les scripts d'évaluation du benchmark FinanceReasoning, sélectionné pour son accent sur les problèmes financiers quantitatifs et inférentiels.
- Corpus de connaissances et requêtes de test : Nous avons concentré notre analyse sur le sous-ensemble difficile, comprenant 238 questions difficiles. Tel que défini par le benchmark, chaque point de données comprend :
- Une question nécessitant une déduction logique et numérique en plusieurs étapes.
- Un contexte, qui contient souvent des informations denses présentées dans des formats structurés comme des tableaux Markdown (par exemple, bilans, données de performance boursière).
- Une réponse de vérité terrain définitive pour une notation objective.
- Types de requêtes illustratifs : La difficulté du benchmark provient de son exigence pour les modèles de gérer des tâches de raisonnement financier diverses et complexes. Pour illustrer cette étendue, nous mettons en évidence deux exemples représentatifs de l'ensemble de test :
Exemple : Raisonnement algorithmique et de séries temporelles (analyse technique)
Contexte : Un investisseur analyse… les prix des actions au cours des 25 derniers jours… pour calculer le canal de Keltner en utilisant une période EMA de 10 jours et une période ATR de 10 jours, avec un multiplicateur de 1,5…
Question : Quelle est la valeur de la dernière bande supérieure du canal de Keltner… ? Répondez à deux décimales près.
Cette requête teste la capacité d'un modèle à agir comme un analyste quantitatif en :
- Déconstruire un indicateur composite : Reconnaître que le « canal de Keltner » est dérivé de deux autres indicateurs complexes :
- La moyenne mobile exponentielle (EMA)
- La plage vraie moyenne (ATR).
- Mettre en œuvre une logique algorithmique : Implémenter correctement les algorithmes itératifs pour l'EMA et l'ATR à partir de zéro sur une série temporelle de 25 points de données.
- Synthétiser les résultats : Combiner les valeurs calculées selon la formule finale du canal de Keltner (bande supérieure = EMA + (multiplicateur × ATR)).
Principes fondamentaux de l'évaluation
- Appels API isolés et standardisés : Pour chaque modèle, nous avons effectué l'évaluation par programmation via leurs points de terminaison API respectifs (par exemple, OpenRouter, OpenAI). Cela a garanti que chaque modèle recevait exactement les mêmes entrées dans des conditions identiques, éliminant la variabilité des interactions avec l'interface utilisateur.
- Génération libre : Nous n'avons pas contraint les modèles à un format à choix multiples. Au lieu de cela, ils ont été invités à générer une réponse complète et libre, permettant une évaluation plus authentique de leurs capacités de raisonnement.
- Prompting par chaîne de pensée (CoT) : Pour susciter et évaluer le processus de raisonnement des modèles, nous avons utilisé une stratégie de prompting par chaîne de pensée (CoT). Le prompt système demandait explicitement à chaque modèle de « d'abord réfléchir au problème étape par étape » avant de conclure par une réponse finale. Cette approche permet une analyse plus approfondie de la manière dont un modèle parvient à sa conclusion, au-delà de la sortie finale.
Métriques d'évaluation et framework
Nous avons utilisé le framework d'évaluation entièrement automatisé du benchmark FinanceReasoning pour noter les sorties des modèles. Ce framework est conçu pour mesurer à la fois l'exactitude conceptuelle et le coût de calcul.
1. Métrique principale : Précision
Cette métrique répond à la question critique : « Le modèle peut-il résoudre correctement le problème financier ? » Le processus de notation implique un pipeline sophistiqué en deux étapes :
- Étape 1 : Extraction de réponse basée sur le LLM : La sortie brute d'un modèle est un texte non structuré contenant à la fois le raisonnement et une réponse finale. Pour analyser de manière fiable la valeur numérique ou booléenne, nous avons utilisé un modèle superviseur (claude-sonnet-4.5) comme analyseur.
- Étape 2 : Comparaison basée sur la tolérance : Une simple « correspondance exacte » est insuffisante pour les problèmes numériques. Par conséquent, la réponse extraite a été comparée par programmation à la vérité terrain. Le script applique un seuil de tolérance numérique (une différence relative de 0,2 %) pour gérer équitablement les variations mineures de virgule flottante ou d'arrondi, garantissant que les solutions conceptuellement valides sont marquées comme correctes.
2. Métrique secondaire : Consommation de tokens
Cette métrique répond à la question : « Quel est le coût de calcul pour le modèle pour résoudre ces problèmes ? » Elle mesure le coût total associé à la génération des 238 réponses.
- Calcul des tokens : Pour chaque appel API, nous avons collecté les prompt_tokens et completion_tokens de l'objet d'utilisation du fournisseur. Le score de tokens par modèle est la somme des completion_tokens sur l'ensemble des 238 questions. Nous rapportons les tokens de complétion (et non le total des tokens) car l'entrée est presque constante entre les modèles qui partagent le même dataset (66k-92k tokens d'entrée par exécution selon le tokeniseur).
- Calcul du coût : Nous avons calculé le coût en dollars comme suit : prompt_tokens × prompt_price_per_M + completion_tokens × completion_price_per_M, additionnés sur l'ensemble des 238 questions. Les prix sont les tarifs par token indiqués sur le point de terminaison OpenRouter /api/v1/models au moment de l'exécution du modèle.
Cette approche à deux métriques, fournie par le benchmark FinanceReasoning lui-même, permet une évaluation holistique, équilibrant la capacité brute de résolution de problèmes (précision) d'un modèle par rapport à son efficacité opérationnelle (consommation de tokens).
Raisonnement financier avec génération augmentée de récupération (RAG)
Pour surpasser les modèles autonomes, nous avons conçu et mis en œuvre un RAG framework personnalisé distinct de l'implémentation originale du benchmark. Notre approche repose sur une pile moderne de base de données vectorielle (Qdrant) pour fournir aux LLMs des connaissances pertinentes et spécifiques au domaine au moment de l'inférence, les aidant à résoudre des problèmes au-delà de leurs données d'entraînement. Nous avons testé cela sur gpt-4o-mini pour mesurer son impact.
Résultats et analyse : le compromis RAG
L'introduction du RAG a eu un impact significatif et mesurable sur les performances de gpt-4o-mini.
Points clés à retenir de l'évaluation RAG :
- Amélioration significative de la précision : RAG a manifestement amélioré la capacité de résolution de problèmes du modèle, augmentant la précision de plus de 10 points de pourcentage. Cela confirme que fournir un contexte externe pertinent est très efficace pour les tâches de raisonnement complexes et spécifiques au domaine.
- Le coût de la précision : Ce gain de performance s'est fait à un coût élevé. La consommation totale de tokens a augmenté de près de x18, et le temps d'exécution total a augmenté de x20. Cela est dû aux appels API supplémentaires pour l'embedding et, plus important encore, aux prompts considérablement plus volumineux et plus complexes que le LLM doit traiter.
- Implications pour les modèles plus grands : Les résultats de gpt-4o-mini suggèrent que si le RAG peut débloquer des performances plus élevées, appliquer cette méthode à des modèles plus grands et plus coûteux comme GPT-4o ou Claude Opus sera considérablement plus coûteux et plus long. Cela met en évidence le compromis critique entre précision, coût et latence dans la conception de systèmes d'IA financière de qualité production.
Méthodologie RAG pour le raisonnement financier
Notre pipeline RAG est construit sur une pile moderne utilisant Qdrant comme base de données vectorielle et le modèle text-embedding-3-small d'OpenAI pour générer des représentations vectorielles sémantiques. Le processus se compose de deux phases principales : une phase d'indexation hors ligne et une phase de récupération-génération en ligne.
1. Indexation du corpus de connaissances
- Création du corpus : Nous avons constitué une base de connaissances spécialisée à partir de deux sources fournies par le benchmark :
- Documents financiers : Une collection d'articles (financial_documents.json) expliquant divers concepts et termes financiers.
- Fonctions financières : Une bibliothèque de fonctions Python prêtes à l'emploi (functions-article-all.json) conçues pour résoudre des calculs financiers spécifiques.
- Découpage intelligent et embedding : Pour préparer ce corpus à une récupération efficace, chaque document et fonction a été traité et indexé :
- Découpage : Les documents ont été segmentés en morceaux plus petits et sémantiquement cohérents en fonction de leurs sections. Chaque fonction Python a été traitée comme un seul morceau atomique. Cela garantit que le contexte récupéré est ciblé et pertinent.
- Embedding : Chaque morceau a ensuite été converti en un vecteur de 1536 dimensions à l'aide du modèle text-embedding-3-small.
- Indexation : Ces vecteurs ont été indexés dans deux collections distinctes au sein de notre instance locale Qdrant (financial_documents_openai_small et financial_functions_openai_small), optimisées pour la recherche de similarité cosinus.
2. Inférence alimentée par RAG
Pour chacune des 238 questions, le processus de raisonnement du modèle a été augmenté avec les étapes automatisées suivantes :
- Génération d'embedding (appels API 1 & 2) : La requête de l'utilisateur (question + contexte) a été convertie en vecteur d'embedding. Cela a nécessité deux appels à l'API d'embedding d'OpenAI pour préparer les recherches dans les deux collections.
- Récupération multi-sources : Le vecteur de requête a été utilisé pour effectuer une recherche sémantique simultanée dans les deux collections Qdrant afin de récupérer les informations les plus pertinentes :
- Les 3 morceaux de documents les plus pertinents de la collection financial_documents.
- Les 2 fonctions Python les plus pertinentes de la collection financial_functions.
- Augmentation du prompt : Les documents et fonctions récupérés ont été injectés dynamiquement dans le prompt, créant un « paquet d'informations » riche et contextuel. Cela a considérablement augmenté la taille du prompt d'entrée (de ~300-500 tokens à ~3 000-5 000+ tokens).
- Génération de la réponse finale (appel API 3) : Ce prompt augmenté a été envoyé au modèle gpt-4o-mini pour générer la réponse finale raisonnée.
Limites du benchmark des LLMs en finance
Notre benchmark, bien que complet, est soumis à plusieurs limites clés :
- Risque de contamination des données : Il est possible que ces modèles aient été entraînés sur le dataset du benchmark puisque celui-ci est public. Cela pourrait conduire à des scores gonflés, rendant la véritable capacité de raisonnement difficile à évaluer.
- Analyse RAG sur un seul modèle : L'évaluation RAG a été effectuée sur un seul modèle (gpt-4o-mini), de sorte que les compromis observés entre performance et coût peuvent ne pas s'appliquer à tous les autres modèles.
Conclusion
Notre benchmark de 40+ modèles sur des tâches complexes de raisonnement financier montre ce qui suit :
gpt-5.6-sol-pro atteint la précision la plus élevée du benchmark à 90,76 % avec 385 886 tokens pour 16,35 $ par exécution. gpt-5.6-sol et claude-fable-5 sont à égalité à 90,34 %.
gpt-5.6-sol égale les 90,34 % de claude-fable-5 à 3,85 $ par exécution contre 10,05 $ pour fable-5, le coût le plus bas au niveau de précision de 90,34 %.
claude-opus-4.8 obtient 89,08 % avec 113 434 tokens pour 3,28 $, au-dessus de gpt-5-2025-08-07 (88,23 %) avec environ 7x moins de tokens de sortie et moins de la moitié du coût (3,28 $ contre 8,38 $), et reste le modèle le moins cher au-dessus de 88 % de précision.
claude-opus-4.6 (87,82 %, 164 369 tokens) et gpt-5-mini-2025-08-07 (87,39 %, 595 505 tokens) atteignent une précision presque optimale. gpt-5.6-terra atteint 86,97 % à 1,99 $, le coût le plus bas parmi les trois modèles à égalité à cette précision.
gemini-3.1-pro-preview (86,55 %) est au-dessus de gemini-3-pro-preview (86,13 %) avec 35 % de tokens en moins, donc les mises à jour itératives peuvent améliorer à la fois la précision et l'efficacité.
gemini-3-flash-preview atteint 83,61 % avec 118 530 tokens pour 0,39 $, et gpt-5.2 atteint 86,13 % avec 247 660 tokens.
RAG a augmenté la précision de gpt-4o-mini de 10,08 points au prix de 17,7x les tokens et 20x la latence.
Journal des modifications
Nous ajoutons des modèles à ce benchmark à chaque nouvelle version.
9 septembre 2026
- OpenAI : GPT-6 Astra (openai/gpt-6-astra).
- Anthropic : Claude Fable 5.1 (anthropic/claude-fable-5.1)
10 juillet 2026
- OpenAI : GPT-5.6 Sol (openai/gpt-5.6-sol)
- OpenAI : GPT-5.6 Terra (openai/gpt-5.6-terra)
- OpenAI : GPT-5.6 Sol Pro (openai/gpt-5.6-sol-pro)
30 juin 2026
- Anthropic : Claude Sonnet 5 (anthropic/claude-sonnet-5)
22 juin 2026
- Zhipu IA : GLM-5.2 (z-ai/glm-5.2)
10 juin 2026
- Anthropic : Claude Fable 5 (anthropic/claude-fable-5)
2 juin 2026
- Anthropic : Claude Opus 4.8 (anthropic/claude-opus-4.8)
22 mai 2026
- Google : Gemini 3.5 Flash (google/gemini-3.5-flash)
- xAI : Grok 4.3 (x-ai/grok-4.3)
- Ajout de la colonne coût-par-exécution-de-benchmark et du basculement du graphique précision-vs-coût. Méthodologie mise à jour avec la formule de calcul des coûts et le changement d'extracteur de réponse (claude-sonnet-4.5)
20 avril 2026
- Anthropic : Claude Opus 4.7 (anthropic/claude-opus-4.7)
20 février 2026
- Google : Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview)
- Anthropic : Claude Sonnet 4.6 (anthropic/claude-sonnet-4.6)
6 février 2026
- Anthropic : Claude Opus 4.6 (anthropic/claude-opus-4.6)
- Anthropic : Claude Opus 4.5 (anthropic/claude-opus-4.5)
- Anthropic : Claude Sonnet 4.5 (anthropic/claude-sonnet-4.5)
- Google : Gemini 3 Pro Preview (google/gemini-3-pro-preview)
- Google : Gemini 3 Flash Preview (google/gemini-3-flash-preview)
- OpenAI : GPT-5.2 (openai/gpt-5.2)
- Moonshot IA : Kimi K2.5 (moonshotai/kimi-k2.5)
Lectures complémentaires
L'analyse financière peut faire référence à de multiples capacités, telles que l'analyse boursière, l'interprétation du droit financier et le raisonnement financier. Dans notre benchmark, nous sommes concentrés spécifiquement sur le raisonnement financier, tandis que d'autres tâches sont couvertes dans des articles séparés :
- LLM pour l'analyse boursière : Ces modèles aident à traiter les données de marché, les rapports d'entreprise et les actualités pour identifier les opportunités d'investissement. (Voir l'analyse complète ici : IA-based Stock Trading)
- IA pour le droit financier : Certains LLMs peuvent interpréter les réglementations financières, les contrats et les exigences de conformité pour aider aux tâches juridico-financières. (Voir notre liste d'outils d'IA juridique ici : Legal IA Tools)
FAQ
Un LLM (LLM) en finance est un modèle d'IA qui utilise des techniques de traitement du langage naturel pour effectuer des analyses financières complexes, la gestion de la conformité et la compréhension de documents. Ces modèles aident les institutions financières à naviguer dans le droit financier, les exigences réglementaires et les demandes dynamiques de l'industrie financière.
Chatbots intelligents :
Les assistants virtuels pilotés par LLM permettent aux entreprises financières de fournir un support client automatisé 24/7 en traitant les requêtes courantes et les tâches d'intégration sans intervention humaine. Cela réduit les temps d'attente et améliore la satisfaction client tout en libérant les agents humains pour les problèmes complexes.
Conseil et analyse :
Les banques d'investissement utilisent des LLMs pour analyser les tendances du marché, les actualités financières et les données clients. Ces modèles digèrent de grands volumes d'informations non structurées, permettant aux conseillers de fournir des conseils d'investissement personnalisés et une gestion de portefeuille avec des informations en temps réel.
Analyse de documents réglementaires :
Les cabinets d'avocats et les institutions financières utilisent des LLMs pour traiter des documents réglementaires denses comme les dépôts auprès de la SEC. Ces modèles extraient des informations clés et résument les rapports, réduisant le temps de révision manuelle et aidant les entreprises à rester conformes aux réglementations en évolution.
Détection de fraude :
Les LLMs analysent de vastes datasets financiers en temps réel pour détecter les schémas de transaction suspects et les tactiques de fraude émergentes. Leurs capacités d'apprentissage continu permettent une identification de la fraude plus rapide et plus précise que les méthodes traditionnelles.
Automatisation juridique et de conformité :
Les cabinets d'avocats et les équipes de conformité utilisent des LLMs pour examiner les contrats, interpréter les lois bancaires et vérifier la conformité réglementaire. L'automatisation de ces tâches réduit le temps de révision et les coûts juridiques tout en garantissant le respect des réglementations financières complexes.
Questions-réponses sur documents et reconnaissance d'entités nommées (NER) :
Les institutions financières déploient des LLMs pour répondre aux questions des investisseurs en extrayant des données des rapports financiers et des appels de résultats. Le NER permet le marquage automatique des noms d'entreprises, des symboles boursiers (class trading symbols) et des entités réglementaires, rationalisant la récupération des données.
Efficacité et automatisation : Les LLMs automatisent les analyses de routine (par exemple, résumer les rapports sur les résultats, traiter les prêts ou les dépôts), économisant des heures d'analyste et réduisant les erreurs.
Service client 24/7 : Les assistants virtuels et chatbots d'IA alimentés par des LLMs peuvent traiter les requêtes des clients 24 heures sur 24 avec des réponses conversationnelles, améliorant l'expérience et la satisfaction client.
Conseils financiers personnalisés : En analysant l'historique et le profil de risque d'un client, les LLMs fournissent des conseils financiers ou d'investissement sur mesure.
Détection de fraude et gestion des risques : Les LLMs passent au crible de grands datasets de transactions pour repérer les anomalies ou les schémas de fraude, s'adaptant aux nouvelles tactiques d'escroquerie et aidant à établir des profils de risque.
Conformité et reporting : Les LLMs rédigent automatiquement des rapports réglementaires, extraient des faits pertinents pour les politiques et aident à analyser le droit et les réglementations financières complexes pour la conformité.
Oui, plusieurs modèles spécifiques au domaine plus vastes existent pour la finance. Par exemple, BloombergGPT est conçu pour aider à la réglementation financière, aux marchés de capitaux et à la gestion de la conformité en traitant de grands datasets financiers comprenant des documents de la bourse nationale des valeurs et des dépôts réglementaires.
D'autres modèles comme FinBERT et FinGPT se concentrent sur le droit financier, le droit bancaire international et les conseils financiers personnalisés, adaptant les grands modèles de langage au vocabulaire spécialisé de la finance tel que les symboles boursiers et les textes réglementaires.
Le raisonnement financier est la capacité d'analyser des données financières pour prendre des décisions commerciales ou d'investissement éclairées.
Les principales tâches comprennent :
– Analyser les états financiers (bénéfice, flux de trésorerie, bilan)
– Établir un budget et des prévisions
– Évaluer les investissements (VAN, TRI, ROI)
– Gérer les flux de trésorerie et les liquidités
– Évaluer les risques financiers et les ratios de performance
Citez ce benchmark
Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.
@misc{sari2026,
author = {Sarı, Ekrem},
title = {{Benchmark de 40+ LLMs en finance: Claude Fable 5 & GPT-5.6 Sol}},
year = {2026},
month = sep,
howpublished = {\url{https://aimultiple.com/finance-llm}},
note = {AIMultiple. Consulté le 28 septembre 2026}
}Résultats et horodatages de 58 points de données. Téléchargez les données de synthèse présentées dans les graphiques et les tableaux de cet article sous forme de fichier ZIP contenant 2 fichiers CSV.
Vous voulez les données détaillées derrière ? Rejoindre Premium
Soyez le premier à commenter
Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.