Premium
Dienstleistungen
Premium

Benchmark von 40+ LLMs im Finanzwesen: Claude Fable 5 & GPT-5.6 Sol

We evaluated 40+ LLMs in finance on 238 hard questions from the FinanceReasoning benchmark to identify which models excel at complex financial reasoning tasks.

Ekrem Sarı
Ekrem Sarı
aktualisiert am 24. Sept. 2026
Diagramm wird geladen

Wir haben LLMs anhand von 238 schwierigen Fragen aus dem FinanceReasoning-Benchmark (Tang et al.) evaluiert.1 Diese Teilmenge zielt auf die anspruchsvollsten Aufgaben zum finanziellen Denken ab und bewertet komplexe, mehrstufige quantitative Schlussfolgerungen mit Finanzkonzepten und -formeln. Unsere Evaluierung verwendete ein eigenes Prompt-Design und Bewertungskriterien für Genauigkeit und Token-Verbrauch.

Eine detaillierte Erklärung, wie diese Metriken berechnet wurden und welches Framework für diese Evaluierung verwendet wurde, finden Sie in unserer Finanz-Benchmark-Methodik.

Ergebnisse: Welcher LLM ist der beste für Finanzen?

Top-Tier-Performer (>83 % Genauigkeit):

gpt-5.6-sol-pro erreicht mit 90,76 % die höchste Genauigkeit des Benchmarks, mit 385.886 Tokens zu $16,35 pro Lauf und liegt 0.42 Punkte über gpt-5.6-sol.

gpt-5.6-sol erreicht eine Genauigkeit von 90,34 % mit 117.735 Tokens zu $3,85 pro Lauf. Es liegt gleichauf mit claude-fable-5 (90,34 %) auf dem zweiten Platz der Genauigkeit, mit $3,85 gegenüber fable-5s $10,05 und 117.735 Tokens gegenüber 183.258. Kein Modell mit gleicher oder höherer Genauigkeit läuft zu geringeren Kosten.

claude-fable-5 erreicht eine Genauigkeit von 90,34 % mit 183.258 Tokens. Es war das erste Modell, das in diesem Benchmark die 90 % überschritten hat (Juni 10), und liegt mit 90,34 % gleichauf mit gpt-5.6-sol, bei $10,05 pro Lauf gegenüber gpt-5.6-sols $3.85.

claude-opus-4.8 erreicht eine Genauigkeit von 89,08 % mit 113.434 Tokens, das dritthöchste Ergebnis bei den Kosten und die niedrigste Output-Token-Anzahl unter Modellen über 88 %.

gpt-5-2025-08-07 erreicht eine Genauigkeit von 88,23 % mit 829.720 Tokens.

claude-opus-4.6 erreicht eine Genauigkeit von 87,82 % mit 164.369 Tokens, eine Genauigkeit nahe der Spitze bei 20 % der Token-Anzahl von gpt-5.

gpt-5-mini-2025-08-07 erreicht eine Genauigkeit von 87,39 % mit 595.505 Tokens.

gemini-3.5-flash erreicht eine Genauigkeit von 86,97 % mit 1.191.757 Tokens, die höchste Genauigkeit in der Flash-Reihe von Google und der größte Token-Verbraucher der Familie.

claude-sonnet-5 erreicht eine Genauigkeit von 86,97 % mit 414.668 Tokens. Es gleicht gemini-3.5-flash bis auf die Dezimalstelle, während es 414.668 Tokens gegenüber 1.191.757 ausgibt, zu $4,33 pro Lauf gegenüber $10.83.

gpt-5.6-terra erreicht eine Genauigkeit von 86,97 % mit 121.936 Tokens zu $1,99 pro Lauf. Es gesellt sich zu claude-sonnet-5 und gemini-3.5-flash bei 86,97 %, mit der niedrigsten Token-Anzahl und den niedrigsten Kosten der drei (121.936 Tokens und $1,99, gegenüber 414.668 / $4,33 und 1.191.757 / $10,83). gpt-5-mini-2025-08-07 bleibt günstiger und genauer ($1,21, 87,39 %).

gemini-3.1-pro-preview erreicht eine Genauigkeit von 86,55 % mit 475.148 Tokens, über seinem Vorgänger gemini-3-pro-preview (86,13 %) bei 35 % weniger Tokens (730.759 Tokens).

glm-5.2 erreicht eine Genauigkeit von 86,13 % mit 735.988 Tokens. Es verbessert sich gegenüber glm-4.5 (64,29 %) um 21.84 Punkte, der größte Sprung zwischen zwei Versionen einer Modellfamilie im Benchmark. Der zweitgrößte beträgt 3.79 Punkte.

gemini-3-pro-preview und gpt-5.2 liegen mit einer Genauigkeit von 86,13 % gleichauf. gpt-5.2 erreicht dies mit 247.660 Tokens, etwa dreimal weniger Output-Tokens als gemini-3-pro-preview mit 730.759 Tokens.

claude-opus-4.7 erreicht eine Genauigkeit von 85,29 % mit 103.268 Tokens, das token-effizienteste Modell in der Spitzengruppe (37 % weniger Output-Tokens als claude-opus-4.6, während es die 83 %-Schwelle überschreitet).

Starke Performer (80-83 % Genauigkeit):

grok-4.3 erreicht eine Genauigkeit von 84,87 % mit 309.781 Tokens, das stärkste Ergebnis von xAI im Benchmark und eine Erholung gegenüber dem früheren grok-4-0709.

claude-opus-4.5 erreicht eine Genauigkeit von 84,03 % mit 144.505 Tokens.

claude-sonnet-4.6 und gemini-3-flash-preview liegen mit einer Genauigkeit von 83,61 % gleichauf. Claude Sonnet 4.6 verbraucht 161.035 Tokens, während Gemini 3 Flash Preview diese mit 118.530 Tokens erreicht, die niedrigste Token-Anzahl unter Modellen über 83 %.

kimi-k2.5 erreicht eine Genauigkeit von 82,77 % mit 877.868 Tokens, der höchste Verbrauch in dieser Leistungsstufe.

Mittlere Stufe (70-80 % Genauigkeit):

o3-pro-2025-06-10 (78,15 % Genauigkeit, 473.659 Tokens) und kimi-k2 (78,15 % Genauigkeit, 100.323 Tokens) liegen gleichauf, und kimi-k2 verbraucht 79 % weniger Tokens. o3-mini-2025-01-31 (77,31 % Genauigkeit, 376.929 Tokens), gpt-5-nano-2025-08-07 (76,89 % Genauigkeit, 1.028.909 Tokens) und claude-sonnet-4-20250514 (76,05 % Genauigkeit, 135.462 Tokens) folgen.

Niedrige Performer (<70 % Genauigkeit):

claude-3-5-sonnet-20241022 (67,65 % Genauigkeit, 90.103 Tokens) und gpt-oss-20b (67,65 % Genauigkeit, 515.041 Tokens) führen diese Stufe an. gemini-2.5-flash (65,55 % Genauigkeit, 286.603 Tokens), glm-4.5 (64,29 % Genauigkeit, 692.662 Tokens) und gpt-4.1-nano-2025-04-14 (63,45 % Genauigkeit, 171.096 Tokens) folgen.

Leistungserkenntnisse:

Der Token-Verbrauch korreliert nicht mit der Genauigkeit. deepseek-r1-0528 verbrauchte die meisten Tokens (1.251.064) bei einer Genauigkeit von 62,18 %, während claude-opus-4-20250514 80,25 % mit 132.274 Tokens erreichte. Die Token-Effizienz variiert auch unter sehr genauen Modellen: gemini-3-flash-preview erreicht 83,61 % mit 118.530 Tokens, während kimi-k2.5 877.868 Tokens für 82,77 % aufwendet (7.4x die Tokens für 0.84 Punkte weniger Genauigkeit).

Die obige Tabelle zeigt weitere KI-Modell-Benchmarks, einschließlich derer, die für diesen Benchmark verwendet wurden.

Kosten pro Benchmark-Lauf

Output-Tokens allein bestimmen nicht die Ausgaben, da sich die Raten für Input-Tokens und Output-Tokens bei den meisten Anbietern um eine Größenordnung unterscheiden. Wir berechneten die Dollar-Kosten für den Lauf jedes Modells bei den 238 Fragen anhand der zum Laufzeitpunkt angegebenen Token-Raten des Anbieters.

Niedrigste Kosten in der Frontier-Klasse: gemini-3-flash-preview erreicht 83,61 % Genauigkeit für $0,39, die niedrigsten Dollar-Kosten im Genauigkeitsbereich >83 %. grok-4.3 folgt mit $0,86 für 84,87 %.

Die 90,34 %-Stufe wird zu geringeren Kosten erreicht: gpt-5.6-sol erreicht die 90,34 % von claude-fable-5 zu $3,85 pro Lauf gegenüber fable-5s $10,05, also zu 38 % der Kosten von fable-5. gpt-5.6-sol-pro verzeichnet mit 90,76 % die höchste Genauigkeit des Benchmarks, zu $16,35 pro Lauf. claude-opus-4.8 bleibt das günstigste Modell, das die 88 %-Marke überschreitet, zu $3,28 für 89,08 %.

Premium-Denkleistung zu Premium-Preisen: o1-pro ist mit $381 für eine Genauigkeit von 80,67 % das teuerste Modell im Benchmark (bedingt durch Raten von $150/M Input und $600/M Output). o3-pro kostet $39,23 für 78,15 %, o1 kostet $46,59 für 74,79 %. Keines erreicht die Spitzengruppe, und alle drei liegen bei der Genauigkeit unter claude-opus-4.7, während sie mehr als das 10x dessen Kosten verursachen.

Kosten und Genauigkeit der Budget-Klasse: gpt-oss-120b erreicht eine Genauigkeit von 81,09 % für insgesamt $0,06, der günstigste Lauf im Benchmark, und liegt innerhalb von 1.91 Punkten an der 83 %-Schwelle. llama-4-maverick erreicht 75,21 % für $0.10. Für Workloads, bei denen eine Genauigkeit von 80 % ausreicht, kosten diese Modelle weniger als 1 % der Frontier-Flaggschiffe.

Vollständige Ergebnistabelle der Finanz-LLMs

Die folgende Tabelle führt jedes Modell im Benchmark mit seiner gemessenen Genauigkeit, den Output-Tokens und den Kosten pro Lauf sowie den Kosten für eine richtige Antwort auf.

Methodik des Benchmarks für finanzielles Denken

Unser Benchmark bietet eine transparente und reproduzierbare Evaluierung der LLM-Leistung bei komplexen Aufgaben des finanziellen Denkens.

Testaufbau & Datenkorpus

  • Benchmark-Suite: Wir verwendeten die Daten, den Code und die Evaluierungsskripte des FinanceReasoning-Benchmarks, ausgewählt aufgrund seines Fokus auf quantitative und inferenzielle Finanzprobleme.
  • Wissenskorpus & Testabfragen: Wir konzentrierten unsere Analyse auf die schwierige Teilmenge, die 238 anspruchsvolle Fragen umfasst. Wie im Benchmark definiert, umfasst jeder Datenpunkt:
    1. Eine Frage, die mehrstufige logische und numerische Ableitungen erfordert.
    2. Einen Kontext, der oft dichte Informationen in strukturierten Formaten wie Markdown-Tabellen enthält (z. B. Bilanzen, Aktienkursdaten).
    3. Eine eindeutige Ground-Truth-Antwort für die objektive Bewertung.
  • Veranschaulichende Abfragetypen: Die Schwierigkeit des Benchmarks beruht darauf, dass Modelle vielfältige und komplexe Aufgaben des finanziellen Denkens bewältigen müssen. Um diese Bandbreite zu veranschaulichen, greifen wir zwei repräsentative Beispiele aus dem Testset heraus:

Beispiel: Algorithmisches & Zeitreihen-Denken (technische Analyse)

Kontext: Ein Anleger analysiert … Aktienkurse der letzten 25 Tage … um den Keltner-Kanal zu berechnen, unter Verwendung eines 10-Tage-EMA-Zeitraums und eines 10-Tage-ATR-Zeitraums, mit einem Multiplikator von 1.5 …

Frage: Wie lautet der Wert des letzten oberen Bandes im Keltner-Kanal …? Geben Sie die Antwort auf zwei Dezimalstellen an.

Diese Abfrage testet die Fähigkeit eines Modells, als quantitativer Analyst zu agieren, indem es:

  1. Zerlegung eines zusammengesetzten Indikators: Erkennen, dass der „Keltner-Kanal“ aus zwei anderen komplexen Indikatoren abgeleitet wird:
    • Der exponentiell gleitende Durchschnitt (EMA)
    • Der durchschnittliche wahre Bereich (ATR).
  2. Implementierung algorithmischer Logik: Korrekte Implementierung der iterativen Algorithmen für EMA und ATR von Grund auf über eine Zeitreihe von 25 Datenpunkten.
  3. Synthese der Ergebnisse: Kombination der berechneten Werte gemäß der endgültigen Keltner-Kanal-Formel (Oberes Band = EMA + (Multiplikator × ATR)).

Grundlegende Evaluierungsprinzipien

  • Isolierte & standardisierte API-Aufrufe: Für jedes Modell führten wir die Evaluierung programmgesteuert über seine jeweiligen API-Endpunkte durch (z. B. OpenRouter, OpenAI). Dadurch wurde sichergestellt, dass jedes Modell exakt dieselbe Eingabe unter identischen Bedingungen erhielt, wodurch Variabilität durch UI-Interaktionen ausgeschlossen wurde.
  • Freiform-Generierung: Wir beschränkten die Modelle nicht auf ein Multiple-Choice-Format. Stattdessen wurden sie aufgefordert, eine umfassende, free-Form-Antwort zu generieren, was eine authentischere Bewertung ihrer Denkfähigkeiten ermöglichte.
  • Chain-of-Thought (CoT)-Prompting: Um Denkprozesse der Modelle hervorzurufen und zu bewerten, verwendeten wir eine Chain-of-Thought (CoT)-Prompting-Strategie. Der System-Prompt wies jedes Modell ausdrücklich an, „das Problem zuerst Schritt für Schritt zu durchdenken“, bevor es eine endgültige Antwort gibt. Dieser Ansatz ermöglicht eine tiefere Analyse, wie ein Modell zu seinem Ergebnis gelangt, über die endgültige Ausgabe hinaus.

Evaluierungsmetriken & -framework

Wir nutzten das vollautomatische Evaluierungs-Framework des FinanceReasoning-Benchmarks, um die Modellausgaben zu bewerten. Dieses Framework ist darauf ausgelegt, sowohl konzeptionelle Korrektheit als auch Rechenkosten zu messen.

1. Primäre Metrik: Genauigkeit

Diese Metrik beantwortet die entscheidende Frage: „Kann das Modell das Finanzproblem korrekt lösen?“ Der Bewertungsprozess umfasst eine ausgeklügelte zweistufige Pipeline:

  • Schritt 1: LLM-basierte Antwort-Extraktion: Die Rohausgabe eines Modells ist unstrukturierter Text, der sowohl die Argumentation als auch eine endgültige Antwort enthält. Um den numerischen oder booleschen Wert zuverlässig zu analysieren, verwendeten wir ein Supervisor-Modell (anthropic/claude-sonnet-4.5) als Parser.
  • Schritt 2: Toleranzbasierter Vergleich: Ein einfacher „Exaktvergleich“ reicht für numerische Probleme nicht aus. Daher wurde die extrahierte Antwort programmgesteuert mit der Ground Truth verglichen. Das Skript wendet eine numerische Toleranzschwelle an (eine relative Abweichung von 0,2 %), um kleine Fließkomma- oder Rundungsabweichungen fair zu behandeln und sicherzustellen, dass konzeptionell richtige Lösungen als korrekt markiert werden.

2. Sekundäre Metrik: Token-Verbrauch

Diese Metrik beantwortet die Frage: „Wie rechenintensiv ist es für das Modell, diese Probleme zu lösen?“ Sie misst die Gesamtkosten, die mit der Generierung der 238 Antworten verbunden sind.

  • Token-Berechnung: Für jeden API-Aufruf erfassten wir prompt_tokens und completion_tokens aus dem Nutzungsobjekt des Anbieters. Der Token-Wert pro Modell ist die Summe der completion_tokens über alle 238 Fragen. Wir berichten Completion-Tokens (nicht Gesamt-Tokens), da die Eingabe bei Modellen, die denselben Datensatz nutzen, nahezu konstant ist (66k-92k Input-Tokens pro Lauf, abhängig vom Tokenizer).
  • Kostenberechnung: Wir berechneten die Dollar-Kosten als prompt_tokens × prompt_price_per_M + completion_tokens × completion_price_per_M, summiert über alle 238 Fragen. Die Preise sind die zum Laufzeitpunkt des Modells angegebenen Token-Raten vom OpenRouter-Endpunkt /api/v1/models.

Dieser zweigleisige Ansatz, der vom FinanceReasoning-Benchmark selbst bereitgestellt wird, ermöglicht eine ganzheitliche Bewertung, die reine Problemlösungsfähigkeit eines Modells (Genauigkeit) gegen seine operative Effizienz (Token-Verbrauch) abwägt.

Lassen Sie unser Team einen Ihrer Geschäftsprozesse kostenlos mit KI-Agenten automatisieren.
Einen Prozess automatisieren

Finanzielles Denken mit Retrieval-Augmented Generation (RAG)

Um eigenständige Modelle zu übertreffen, haben wir ein eigenes RAG-Framework entworfen und implementiert, das sich von der ursprünglichen Implementierung des Benchmarks unterscheidet. Unser Ansatz basiert auf einem modernen Vektordatenbank-Stack (Qdrant), um LLMs zur Inferenzzeit mit relevantem, domänenspezifischem Wissen zu versorgen, damit sie Probleme lösen können, die über ihre Trainingsdaten hinausgehen. Wir testeten dies mit gpt-4o-mini, um die Auswirkungen zu messen.

Ergebnisse und Analyse: Der RAG-Kompromiss

Die Einführung von RAG hatte erhebliche und messbare Auswirkungen auf die Leistung von gpt-4o-mini.

Wichtigste Erkenntnisse aus der RAG-Evaluierung:

  • Deutliche Genauigkeitsverbesserung: RAG verbesserte nachweislich die Problemlösungsfähigkeit des Modells und steigerte die Genauigkeit um über 10 Prozentpunkte. Dies bestätigt, dass die Bereitstellung von externem, relevantem Kontext bei komplexen, domänenspezifischen Denkaufgaben äußerst wirksam ist.
  • Die Kosten der Genauigkeit: Dieser Leistungsgewinn war mit hohen Kosten verbunden. Der Gesamt-Token-Verbrauch stieg um fast das 18-fache, und die Gesamtausführungszeit um das 20-fache. Dies ist auf die zusätzlichen API-Aufrufe für das Embedding und, was wichtiger ist, auf die sehr viel größeren und komplexeren Prompts zurückzuführen, die das LLM verarbeiten muss.
  • Auswirkungen auf größere Modelle: Die Ergebnisse von gpt-4o-mini deuten darauf hin, dass RAG zwar höhere Leistung ermöglichen kann, die Anwendung dieser Methode auf größere, teurere Modelle wie GPT-4o oder Claude Opus jedoch wesentlich kostspieliger und zeitaufwendiger sein wird. Dies unterstreicht den entscheidenden Kompromiss zwischen Genauigkeit, Kosten und Latenz beim Entwurf produktionsreifer Finanz-KI-Systeme.

Methodik des RAG für finanzielles Denken

Unsere RAG-Pipeline basiert auf einem modernen Stack mit Qdrant als Vektordatenbank und dem text-embedding-3-small-Modell von OpenAI zum Erzeugen semantischer Vektorrepräsentationen. Der Prozess besteht aus zwei Hauptphasen: einer Offline-Indexierungsphase und einer Online-Abruf-und-Generierungsphase.

1. Indexierung des Wissenskorpus

  • Korpuserstellung: Wir kuratierten eine spezialisierte Wissensbasis aus zwei vom Benchmark bereitgestellten Quellen:
    1. Finanzdokumente: Eine Sammlung von Artikeln (financial_documents.json), die verschiedene Finanzkonzepte und -begriffe erklären.
    2. Finanzfunktionen: Eine Bibliothek gebrauchsfertiger Python-Funktionen (functions-article-all.json), die zum Lösen spezifischer Finanzberechnungen entwickelt wurden.
  • Intelligentes Chunking & Embedding: Um diesen Korpus für einen effizienten Abruf vorzubereiten, wurde jedes Dokument und jede Funktion verarbeitet und indexiert:
    1. Chunking: Dokumente wurden auf der Grundlage ihrer Abschnitte in kleinere, semantisch kohärente Chunks segmentiert. Jede Python-Funktion wurde als ein einziger atomarer Chunk behandelt. Dadurch wird sichergestellt, dass der abgerufene Kontext fokussiert und relevant ist.
    2. Embedding: Jeder Chunk wurde anschließend mithilfe des Modells text-embedding-3-small in einen 1536-dimensionalen Vektor umgewandelt.
    3. Indexierung: Diese Vektoren wurden in zwei getrennte Sammlungen innerhalb unserer lokalen Qdrant-Instanz indexiert (financial_documents_openai_small und financial_functions_openai_small), optimiert für die Kosinus-Ähnlichkeitssuche.

2. RAG-gestützte Inferenz

Für jede der 238 Fragen wurde der Denkprozess des Modells durch die folgenden automatisierten Schritte ergänzt:

  1. Embedding-Generierung (API-Aufrufe 1 & 2): Die Anfrage des Nutzers (Frage + Kontext) wurde in einen Embedding-Vektor umgewandelt. Dazu waren zwei Aufrufe der Embedding-API von OpenAI erforderlich, um die Suche in beiden Sammlungen vorzubereiten.
  2. Abruf aus mehreren Quellen: Der Abfragevektor wurde verwendet, um gleichzeitig eine semantische Suche in beiden Qdrant-Sammlungen durchzuführen, um die relevantesten Informationen abzurufen:
    • Die 3 relevantesten Dokument-Chunks aus der Sammlung financial_documents.
    • Die 2 relevantesten Python-Funktionen aus der Sammlung financial_functions.
  3. Prompt-Erweiterung: Die abgerufenen Dokumente und Funktionen wurden dynamisch in den Prompt eingefügt und bildeten ein reichhaltiges, kontextbewusstes „Informationspaket“. Dadurch vergrößerte sich der Input-Prompt erheblich (von ~300-500 Tokens auf ~3.000-5.000+ Tokens).
  4. Generierung der endgültigen Antwort (API-Aufruf 3): Dieser erweiterte Prompt wurde an das Modell gpt-4o-mini gesendet, um die endgültige, begründete Antwort zu generieren.

LLMs im Finanzwesen: Benchmark-Grenzen

Unser Benchmark ist zwar umfassend, unterliegt jedoch mehreren wichtigen Einschränkungen:

  • Risiko der Datenkontamination: Es ist möglich, dass diese Modelle auf dem Datensatz des Benchmarks trainiert wurden, da der Datensatz öffentlich ist. Dies könnte zu überhöhten Bewertungen führen und die tatsächliche Denkfähigkeit schwer einschätzbar machen.
  • Analyse eines einzelnen Modells mit RAG: Die RAG-Evaluierung wurde mit einem einzigen Modell (gpt-4o-mini) durchgeführt, sodass die beobachteten Kompromisse zwischen Leistung und Kosten möglicherweise nicht auf alle anderen Modelle übertragbar sind.

Fazit

Unser Benchmark mit 40+ Modellen bei komplexen Aufgaben des finanziellen Denkens zeigt Folgendes:

gpt-5.6-sol-pro erreicht mit 90,76 % die höchste Genauigkeit des Benchmarks, mit 385.886 Tokens zu $16,35 pro Lauf. gpt-5.6-sol und claude-fable-5 liegen bei 90,34 % gleichauf.

gpt-5.6-sol erreicht die 90,34 % von claude-fable-5 zu $3,85 pro Lauf gegenüber fable-5s $10,05, die niedrigsten Kosten in der Genauigkeitsstufe 90,34 %.

claude-opus-4.8 erreicht 89,08 % mit 113.434 Tokens für $3,28, über gpt-5-2025-08-07 (88,23 %) mit etwa 7x weniger Output-Tokens und weniger als der Hälfte der Kosten ($3,28 gegenüber $8,38) und bleibt das günstigste Modell über 88 % Genauigkeit.

claude-opus-4.6 (87,82 %, 164.369 Tokens) und gpt-5-mini-2025-08-07 (87,39 %, 595.505 Tokens) erreichen eine Genauigkeit nahe der Spitze. gpt-5.6-terra erreicht 86,97 % zu $1,99, die niedrigsten Kosten unter den drei Modellen, die bei dieser Genauigkeit gleichauf liegen.

gemini-3.1-pro-preview (86,55 %) liegt über gemini-3-pro-preview (86,13 %) mit 35 % weniger Tokens, sodass iterative Aktualisierungen sowohl Genauigkeit als auch Effizienz verbessern können.

gemini-3-flash-preview erreicht 83,61 % mit 118.530 Tokens zu $0,39, und gpt-5.2 erreicht 86,13 % mit 247.660 Tokens.

RAG erhöhte die Genauigkeit von gpt-4o-mini um 10.08 Punkte, bei Kosten von 17.7x den Tokens und 20x der Latenz.

Verpassen Sie nicht unsere Benchmarks und datengestützten Erkenntnisse. Die Schaltfläche öffnet Google; die Auswahl von AIMultiple bestätigt, dass Sie AIMultiple häufiger in den Google-Suchergebnissen sehen möchten.
GoogleAls bevorzugte Quelle hinzufügen

Änderungsprotokoll

Wir ergänzen diesen Benchmark mit jeder neuen Version um Modelle.

9. September 2026

  • OpenAI: GPT-6 Astra (openai/gpt-6-astra).
  • Anthropic: Claude Fable 5.1 (anthropic/claude-fable-5.1)

10. Juli 2026

  • OpenAI: GPT-5.6 Sol (openai/gpt-5.6-sol)
  • OpenAI: GPT-5.6 Terra (openai/gpt-5.6-terra)
  • OpenAI: GPT-5.6 Sol Pro (openai/gpt-5.6-sol-pro)

30. Juni 2026

  • Anthropic: Claude Sonnet 5 (anthropic/claude-sonnet-5)

22. Juni 2026

  • Zhipu KI: GLM-5.2 (z-ai/glm-5.2)

10. Juni 2026

  • Anthropic: Claude Fable 5 (anthropic/claude-fable-5)

2. Juni 2026

  • Anthropic: Claude Opus 4.8 (anthropic/claude-opus-4.8)

22. Mai 2026

  • Google: Gemini 3.5 Flash (google/gemini-3.5-flash)
  • xAI: Grok 4.3 (x-ai/grok-4.3)
  • Spalte „Kosten pro Benchmark-Lauf“ und Umschalter für das Diagramm „Genauigkeit vs. Kosten“ hinzugefügt. Methodik um die Kostenberechnungsformel und die Änderung des Antwort-Extraktors (claude-sonnet-4.5) aktualisiert.

20. April 2026

  • Anthropic: Claude Opus 4.7 (anthropic/claude-opus-4.7)

20. Februar 2026

  • Google: Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview)
  • Anthropic: Claude Sonnet 4.6 (anthropic/claude-sonnet-4.6)

6. Februar 2026

  • Anthropic: Claude Opus 4.6 (anthropic/claude-opus-4.6)
  • Anthropic: Claude Opus 4.5 (anthropic/claude-opus-4.5)
  • Anthropic: Claude Sonnet 4.5 (anthropic/claude-sonnet-4.5)
  • Google: Gemini 3 Pro Preview (google/gemini-3-pro-preview)
  • Google: Gemini 3 Flash Preview (google/gemini-3-flash-preview)
  • OpenAI: GPT-5.2 (openai/gpt-5.2)
  • Moonshot KI: Kimi K2.5 (moonshotai/kimi-k2.5)

Weiterführende Informationen

Finanzanalyse kann sich auf mehrere Fähigkeiten beziehen, etwa Aktienanalyse, Interpretation des Finanzrechts und finanzielles Denken. In unserem Benchmark haben wir uns gezielt auf das finanzielle Denken konzentriert, während andere Aufgaben in separaten Artikeln behandelt werden:

  • LLM für die Aktienanalyse: Diese Modelle helfen bei der Verarbeitung von Marktdaten, Unternehmensberichten und Nachrichten, um Anlagechancen zu identifizieren. (Vollständige Analyse hier: KI-basierter Aktienhandel)
  • KI für das Finanzrecht: Einige LLMs können Finanzvorschriften, Verträge und Compliance-Anforderungen interpretieren, um juristisch-finanzielle Aufgaben zu unterstützen. (Unsere Liste der Legal-Tech-KI-Tools finden Sie hier: Legal KI Tools)

FAQs

Ein LLM (Large Language Model) im Finanzwesen ist ein KI-Modell, das Techniken der natürlichen Sprachverarbeitung nutzt, um komplexe Finanzanalysen, Compliance-Management und Dokumentenverständnis durchzuführen. Diese Modelle helfen Finanzinstituten, sich im Finanzrecht, bei regulatorischen Anforderungen und den dynamischen Anforderungen der Finanzbranche zurechtzufinden.

Intelligente Chatbots:
LLM-gesteuerte virtuelle Assistenten ermöglichen Finanzunternehmen einen automatisierten 24/7-Kundensupport, indem sie Routineanfragen und Onboarding-Aufgaben ohne menschliches Eingreifen bearbeiten. Dies verkürzt Wartezeiten und verbessert die Kundenzufriedenheit, während menschliche Mitarbeiter für komplexe Anliegen entlastet werden.

Beratung & Analyse:
Investmentbanken nutzen LLMs, um Markttrends, Finanznachrichten und Kundendaten zu analysieren. Diese Modelle verarbeiten große Mengen unstrukturierter Informationen und ermöglichen es Beratern, personalisierte Anlageempfehlungen und Portfolio-Management mit Echtzeit-Einblicken zu liefern.

Analyse regulatorischer Dokumente:
Anwaltskanzleien und Finanzinstitute setzen LLMs ein, um dichte regulatorische Dokumente wie SEC-Einreichungen zu verarbeiten. Diese Modelle extrahieren wichtige Informationen und fassen Berichte zusammen, was den manuellen Prüfaufwand reduziert und Unternehmen hilft, angesichts sich weiterentwickelnder Vorschriften konform zu bleiben.

Betrugserkennung:
LLMs analysieren riesige Finanzdatensätze in Echtzeit, um verdächtige Transaktionsmuster und neue Betrugsmethoden zu erkennen. Ihre kontinuierlichen Lernfähigkeiten ermöglichen eine schnellere und genauere Betrugserkennung als herkömmliche Methoden.

Automatisierung von Recht und Compliance:
Anwaltskanzleien und Compliance-Teams nutzen LLMs, um Verträge zu prüfen, Bankengesetze zu interpretieren und die Einhaltung gesetzlicher Vorschriften zu überprüfen. Die Automatisierung dieser Aufgaben reduziert Prüfzeit und Rechtskosten und gewährleistet zugleich die Einhaltung komplexer Finanzvorschriften.

Dokument-Q&A und Named Entity Recognition (NER):
Finanzinstitute setzen LLMs ein, um Fragen von Anlegern zu beantworten, indem sie Daten aus Finanzberichten und Earnings Calls extrahieren. NER ermöglicht das automatische Taggen von Firmennamen, Aktienkürzeln (Klassen-Handelssymbolen) und regulatorischen Einheiten und optimiert so den Datenabruf.

Effizienz und Automatisierung: LLMs automatisieren Routineanalysen (z. B. Zusammenfassen von Gewinnberichten, Bearbeiten von Krediten oder Einreichungen), sparen Analystenstunden und reduzieren Fehler.

24/7-Kundenservice: KI-gestützte virtuelle Assistenten und Chatbots, die von LLMs angetrieben werden, können Kundenanfragen rund um die Uhr mit konversationellen Antworten bearbeiten und so Kundenerlebnis und -zufriedenheit verbessern.

Personalisierte Finanzberatung: Durch die Analyse der Historie und des Risikoprofils eines Kunden liefern LLMs maßgeschneiderte Finanz- oder Anlageberatung.

Betrugserkennung & Risikomanagement: LLMs durchforsten große Transaktionsdatensätze, um Anomalien oder Betrugsmuster zu erkennen, passen sich neuen Betrugsmethoden an und helfen bei der Erstellung von Risikoprofilen.

Compliance & Berichterstattung: LLMs erstellen automatisch Regulierungsberichte, extrahieren politikrelevante Fakten und helfen, komplexes Finanzrecht und Vorschriften für die Compliance zu analysieren.

Ja, es gibt mehrere größere domänenspezifische Modelle für das Finanzwesen. Beispielsweise ist BloombergGPT darauf ausgelegt, bei Finanzregulierung, Kapitalmärkten und Compliance-Management zu helfen, indem es große Finanzdatensätze verarbeitet, darunter Dokumente der nationalen Wertpapierbörse und Regulierungsunterlagen.

Andere Modelle wie FinBERT und FinGPT konzentrieren sich auf Finanzrecht, internationales Bankrecht und personalisierte Finanzberatung, indem sie Large Language Models an das spezialisierte Finanzvokabular anpassen, etwa Klassen-Handelssymbole und regulatorische Texte.

Finanzielles Denken ist die Fähigkeit, Finanzdaten zu analysieren, um fundierte Geschäfts- oder Investitionsentscheidungen zu treffen.

Zu den wichtigsten Aufgaben gehören:
– Analyse von Finanzberichten (Gewinn, Cashflow, Bilanz)
– Budgetierung und Prognose
– Bewertung von Investitionen (NPV, IRR, ROI)
– Management von Cashflow und Liquidität
– Bewertung finanzieller Risiken und Leistungskennzahlen

Zitieren Sie diesen Benchmark

Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.

Ekrem Sarı (2026) - "Benchmark von 40+ LLMs im Finanzwesen: Claude Fable 5 & GPT-5.6 Sol". Online veröffentlicht auf AIMultiple.com. Abgerufen am 24. September 2026, von: https://aimultiple.com/finance-llm [Online-Ressource]

Sarı, E. (2026, 24. September). Benchmark von 40+ LLMs im Finanzwesen: Claude Fable 5 & GPT-5.6 Sol. AIMultiple. https://aimultiple.com/finance-llm

@misc{sari2026,
  author = {Sarı, Ekrem},
  title  = {{Benchmark von 40+ LLMs im Finanzwesen: Claude Fable 5 & GPT-5.6 Sol}},
  year   = {2026},
  month  = sep,
  howpublished    = {\url{https://aimultiple.com/finance-llm}},
  note   = {AIMultiple. Abgerufen am 24. September 2026}
}
Alle Daten herunterladen

Ergebnisse und Zeitstempel von 58 Datenpunkten. Laden Sie die Zusammenfassungsdaten aus den Diagrammen und Tabellen dieses Artikels als ZIP-Datei herunter, die 2 CSV-Dateien enthält.

Zuletzt aktualisiert: 26. September 2026
Herunterladen

Möchten Sie die granularen Daten dahinter? Premium beitreten

Ekrem Sarı
Ekrem Sarı
KI-Forscher
Ekrem ist KI-Forscher und Datenwissenschaftler bei AIMultiple. Er entwirft und führt praxisnahe Benchmarks für KI- und LLM-Systeme durch.
Vollständiges Profil anzeigen

Seien Sie der Erste, der kommentiert

Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.

0/450