Dienstleistungen
Kontaktieren

Benchmark von 40+ LLMs im Finanzwesen: Claude Fable 5 & GPT-5.6 Sol

Ekrem Sarı
Ekrem Sarı
aktualisiert am 10. Juli 2026

Wir haben 40+ LLMs im Finanzwesen anhand von 238 schwierigen Fragen aus dem FinanceReasoning-Benchmark evaluiert, um herauszufinden, welche Modelle bei komplexen Finanzlogik-Aufgaben wie Bilanzanalyse, Prognosen und Kennzahlenberechnungen hervorragend sind.

LLM-Finanzbenchmark-Überblick

Loading Chart

Wir haben LLMs auf 238 schwierigen Fragen aus dem FinanceReasoning-Benchmark (Tang et al.) evaluiert.1 Diese Untergruppe zielt auf die anspruchsvollsten Finanzlogik-Aufgaben ab und bewertet komplexe, mehrstufige quantitative Schlussfolgerungen mit Finanzkonzepten und -formeln. Unsere Evaluierung verwendete ein eigenes Prompt-Design und bewertete Genauigkeit und Token-Verbrauch.

Eine detaillierte Erklärung zur Berechnung dieser Metriken und zum verwendeten Rahmen für diese Evaluierung finden Sie in unserer Finanz-Benchmark-Methodik.

Ergebnisse: Welcher LLM ist der beste für das Finanzwesen?

Spitzenreiter (>83% Genauigkeit):

gpt-5.6-sol-pro erreicht mit 90.76% die höchste Genauigkeit des Benchmarks und verbraucht dabei 385,886 Tokens zu $16.35 pro Durchlauf, 0.42 Punkte über gpt-5.6-sol.

gpt-5.6-sol erreicht eine Genauigkeit von 90.34% mit 117,735 Tokens zu $3.85 pro Durchlauf. Es teilt sich den zweiten Platz bei der Genauigkeit mit claude-fable-5 (90.34%), kostet $3.85 gegenüber $10.05 von Fable-5 und verbraucht 117,735 Tokens gegenüber 183,258. Kein Modell auf oder über diesem Genauigkeitsniveau arbeitet zu geringeren Kosten.

claude-fable-5 erreicht eine Genauigkeit von 90.34% mit 183,258 Tokens. Es war das erste Modell, das die 90%-Marke in diesem Benchmark überschritt (10. Juni) und liegt gleichauf mit gpt-5.6-sol bei 90.34%, zu $10.05 pro Durchlauf gegenüber $3.85 von gpt-5.6-sol.

claude-opus-4.8 erzielt eine Genauigkeit von 89.08% mit 113,434 Tokens, das drittteuerste Ergebnis und die geringste Anzahl an Ausgabe-Tokens unter den Modellen mit über 88%.

gpt-5-2025-08-07 erzielt eine Genauigkeit von 88.23% mit 829,720 Tokens.

claude-opus-4.6 erzielt eine Genauigkeit von 87.82% mit 164,369 Tokens, nahezu Spitzengenauigkeit bei nur 20% der Token-Zahl von gpt-5.

gpt-5-mini-2025-08-07 erreicht 87.39% Genauigkeit mit 595,505 Tokens.

gemini-3.5-flash erreicht 86.97% Genauigkeit mit 1,191,757 Tokens, die höchste Genauigkeit in der Flash-Reihe von Google und der größte Token-Verbraucher dieser Familie.

claude-sonnet-5 erzielt eine Genauigkeit von 86.97% mit 414,668 Tokens. Es entspricht gemini-3.5-flash bis auf die Nachkommastelle, verbraucht dabei 414,668 Tokens gegenüber 1,191,757 und kostet $4.33 pro Durchlauf gegenüber $10.83.

gpt-5.6-terra erzielt eine Genauigkeit von 86.97% mit 121,936 Tokens zu $1.99 pro Durchlauf. Es gesellt sich zu claude-sonnet-5 und gemini-3.5-flash bei 86.97%, mit der geringsten Token-Zahl und den niedrigsten Kosten der drei (121,936 Tokens und $1.99 gegenüber 414,668 / $4.33 und 1,191,757 / $10.83). gpt-5-mini-2025-08-07 bleibt günstiger und genauer ($1.21, 87.39%).

gemini-3.1-pro-preview erzielt eine Genauigkeit von 86.55% mit 475,148 Tokens, liegt damit über seinem Vorgänger gemini-3-pro-preview (86.13%) und verbraucht dabei 35% weniger Tokens (730,759 Tokens).

glm-5.2 erzielt eine Genauigkeit von 86.13% mit 735,988 Tokens. Es verbessert glm-4.5 (64.29%) um 21.84 Punkte, der größte Sprung zwischen zwei Versionen einer Modellfamilie im Benchmark. Der nächstgrößere beträgt 3.79 Punkte.

gemini-3-pro-preview und gpt-5.2 liegen gleichauf bei 86.13% Genauigkeit. gpt-5.2 erreicht dies mit 247,660 Tokens, etwa dreimal weniger Ausgabe-Tokens als gemini-3-pro-preview mit 730,759 Tokens.

claude-opus-4.7 erzielt eine Genauigkeit von 85.29% mit 103,268 Tokens, das token-effizienteste Modell in der Spitzengruppe (37% weniger Ausgabe-Tokens als claude-opus-4.6, während die 83%-Schwelle überschritten wird).

Starke Performer (80-83% Genauigkeit):

grok-4.3 erreicht 84.87% Genauigkeit mit 309,781 Tokens, das beste xAI-Ergebnis im Benchmark und eine Erholung gegenüber dem früheren grok-4-0709.

claude-opus-4.5 erzielt eine Genauigkeit von 84.03% mit 144,505 Tokens.

claude-sonnet-4.6 und gemini-3-flash-preview liegen gleichauf bei 83.61% Genauigkeit. Claude Sonnet 4.6 verbraucht 161,035 Tokens, während Gemini 3 Flash Preview dies mit 118,530 Tokens erreicht, der niedrigsten Token-Zahl unter Modellen über 83%.

kimi-k2.5 erzielt eine Genauigkeit von 82.77% mit 877,868 Tokens, dem höchsten Verbrauch in dieser Leistungsklasse.

Mittelfeld (70-80% Genauigkeit):

o3-pro-2025-06-10 (78.15% Genauigkeit, 473,659 Tokens) und kimi-k2 (78.15% Genauigkeit, 100,323 Tokens) liegen gleichauf, wobei kimi-k2 79% weniger Tokens verbraucht. o3-mini-2025-01-31 (77.31% Genauigkeit, 376,929 Tokens), gpt-5-nano-2025-08-07 (76.89% Genauigkeit, 1,028,909 Tokens) und claude-sonnet-4-20250514 (76.05% Genauigkeit, 135,462 Tokens) folgen.

Niedrige Performer (<70% Genauigkeit):

claude-3-5-sonnet-20241022 (67.65% Genauigkeit, 90,103 Tokens) und gpt-oss-20b (67.65% Genauigkeit, 515,041 Tokens) führen diese Gruppe an. gemini-2.5-flash (65.55% Genauigkeit, 286,603 Tokens), glm-4.5 (64.29% Genauigkeit, 692,662 Tokens) und gpt-4.1-nano-2025-04-14 (63.45% Genauigkeit, 171,096 Tokens) folgen.

Leistungserkenntnisse:

Der Token-Verbrauch korreliert nicht mit der Genauigkeit. deepseek-r1-0528 verbrauchte die meisten Tokens (1,251,064) bei einer Genauigkeit von 62.18%, während claude-opus-4-20250514 80.25% mit 132,274 Tokens erzielte. Die Token-Effizienz variiert auch bei Modellen mit hoher Genauigkeit: gemini-3-flash-preview erreicht 83.61% mit 118,530 Tokens, während kimi-k2.5 877,868 Tokens für 82.77% aufwendet (7.4x Tokens für 0.84 Punkte weniger Genauigkeit).

Die obige Tabelle zeigt weitere KI-Modell-Benchmarks, einschließlich derer, die für diesen Benchmark verwendet wurden.

Kosten pro Benchmark-Durchlauf

Ausgabe-Tokens allein bestimmen nicht die Ausgaben, da sich die Raten für Eingabe- und Ausgabe-Tokens bei den meisten Anbietern um eine Größenordnung unterscheiden. Wir haben die Dollar-Kosten für den Durchlauf jedes Modells bei den 238 Fragen anhand des zum Zeitpunkt der Ausführung gültigen Token-Preises des Anbieters berechnet.

Niedrigste Kosten in der Spitzengruppe: gemini-3-flash-preview erreicht 83.61% Genauigkeit für $0.39, die niedrigsten Dollar-Kosten im Genauigkeitsbereich >83%. grok-4.3 folgt mit $0.86 für 84.87%.

Die 90.34%-Stufe wird zu geringeren Kosten erreicht: gpt-5.6-sol erreicht die gleichen 90.34% wie claude-fable-5 für $3.85 pro Durchlauf gegenüber $10.05 von Fable-5, also zu 38% der Kosten von Fable-5. gpt-5.6-sol-pro verzeichnet die höchste Genauigkeit des Benchmarks, 90.76%, zu $16.35 pro Durchlauf. claude-opus-4.8 bleibt das günstigste Modell über der 88%-Marke, mit $3.28 für 89.08%.

Premium-Logik zum Premium-Preis: o1-pro ist das kostspieligste Modell im Benchmark mit $381 für eine Genauigkeit von 80.67% (verursacht durch $150/Mio. Eingabe- und $600/Mio. Ausgabe-Token-Raten). o3-pro kostet $39.23 für 78.15%, o1 kostet $46.59 für 74.79%. Keines erreicht die Spitzengruppe, und alle drei liegen in der Genauigkeit unter claude-opus-4.7 bei mehr als dem 10x der Kosten.

Budget-Kosten und Genauigkeit: gpt-oss-120b erreicht 81.09% Genauigkeit zu $0.06 Gesamtkosten, der günstigste Durchlauf des Benchmarks, nur 1.91 Punkte von der 83%-Schwelle entfernt. llama-4-maverick erreicht 75.21% zu $0.10. Für Workloads, bei denen 80% Genauigkeit ausreicht, kosten diese Modelle weniger als 1% der Flaggschiffe der Spitzenklasse.

Finanzlogik-Benchmark-Methodik

Unser Benchmark bietet eine transparente und reproduzierbare Bewertung der Leistung von LLMs bei komplexen Finanzlogik-Aufgaben.

Test-Setup & Datenkorpus

  • Benchmark-Suite: Wir haben die Daten, den Code und die Evaluierungsskripte des FinanceReasoning-Benchmarks verwendet, der aufgrund seines Fokus auf quantitative und inferentielle Finanzprobleme ausgewählt wurde.
  • Wissenskorpus & Testabfragen: Wir konzentrierten unsere Analyse auf die schwierige Teilmenge, die 238 anspruchsvolle Fragen umfasst. Gemäß der Benchmark-Definition enthält jeder Datenpunkt:
    1. Eine Frage, die mehrstufige logische und numerische Schlussfolgerungen erfordert.
    2. Einen Kontext, der oft dichte Informationen in strukturierten Formaten wie Markdown-Tabellen (z.B. Bilanzen, Aktien-Performance-Daten) enthält.
    3. Eine definitive Ground-Truth-Antwort für eine objektive Bewertung.
  • Beispielhafte Fragetypen: Die Schwierigkeit des Benchmarks liegt darin, dass die Modelle vielfältige und komplexe Finanzlogik-Aufgaben bewältigen müssen. Um diese Bandbreite zu veranschaulichen, heben wir zwei repräsentative Beispiele aus dem Testsatz hervor:

Beispiel: Algorithmisches & Zeitreihen-Denken (technische Analyse)

Kontext: Ein Anleger analysiert… Aktienkurse der letzten 25 Tage… um den Keltner-Kanal mit einem 10-Tage-EMA-Zeitraum und einem 10-Tage-ATR-Zeitraum sowie einem Multiplikator von 1.5 zu berechnen…

Frage: Wie lautet der Wert des letzten oberen Bandes im Keltner-Kanal…? Antwort auf zwei Dezimalstellen.

Diese Abfrage testet die Fähigkeit eines Modells, als quantitativer Analyst zu fungieren, durch:

  1. Dekonstruktion eines zusammengesetzten Indikators: Erkennen, dass der „Keltner-Kanal“ aus zwei anderen komplexen Indikatoren abgeleitet wird:
    • Dem exponentiell gleitenden Durchschnitt (EMA)
    • Der durchschnittlichen wahren Spanne (ATR).
  2. Implementierung algorithmischer Logik: Korrektes Umsetzen der iterativen Algorithmen für sowohl EMA als auch ATR von Grund auf über eine Zeitreihe von 25 Datenpunkten.
  3. Synthese der Ergebnisse: Kombination der berechneten Werte gemäß der endgültigen Keltner-Kanal-Formel (Oberes Band = EMA + (Multiplikator × ATR)).

Kernprinzipien der Evaluierung

  • Isolierte & standardisierte API-Aufrufe: Für jedes Modell führten wir die Evaluierung programmatisch über die jeweiligen API-Endpunkte durch (z.B. OpenRouter, OpenAI). Dies stellte sicher, dass jedes Modell unter identischen Bedingungen genau dieselbe Eingabe erhielt, wodurch Variabilität durch UI-Interaktionen ausgeschlossen wurde.
  • Freiform-Generierung: Wir schränkten die Modelle nicht auf ein Multiple-Choice-Format ein. Stattdessen wurden sie aufgefordert, eine umfassende, freie Antwort zu generieren, was eine authentischere Bewertung ihrer Denkfähigkeiten ermöglicht.
  • Chain-of-Thought (CoT)-Prompting: Um den Denkprozess der Modelle zu elicieren und zu bewerten, verwendeten wir eine Chain-of-Thought (CoT)-Prompting-Strategie. Der System-Prompt wies jedes Modell explizit an, „zuerst Schritt für Schritt über das Problem nachzudenken“, bevor es eine endgültige Antwort gab. Dieser Ansatz erlaubt eine tiefere Analyse, wie ein Modell zu seiner Schlussfolgerung kommt, jenseits der Endausgabe.

Evaluierungsmetriken & Rahmen

Wir nutzten das vollautomatisierte Evaluierungs-Framework des FinanceReasoning-Benchmarks selbst, um die Modellantworten zu bewerten. Dieses Framework misst sowohl konzeptionelle Korrektheit als auch Rechenkosten.

1. Primäre Metrik: Genauigkeit

Diese Metrik beantwortet die entscheidende Frage: „Kann das Modell das Finanzproblem korrekt lösen?“ Der Bewertungsprozess umfasst eine ausgefeilte zweistufige Pipeline:

  • Schritt 1: LLM-basierte Antwort-Extraktion: Die Rohausgabe eines Modells ist unstrukturierter Text, der sowohl Schlussfolgerungen als auch eine finale Antwort enthält. Um den numerischen oder booleschen Wert zuverlässig zu parsen, verwendeten wir ein Supervisor-Modell (anthropic/claude-sonnet-4.5) als Parser.
  • Schritt 2: Toleranzbasierter Vergleich: Ein einfacher „Exact Match“ ist bei numerischen Problemen unzureichend. Daher wurde die extrahierte Antwort programmatisch mit der Ground Truth verglichen. Das Skript wendet eine numerische Toleranzschwelle (eine relative Abweichung von 0.2%) an, um geringfügige Gleitkomma- oder Rundungsvariationen fair zu behandeln und sicherzustellen, dass konzeptionell korrekte Lösungen als richtig gewertet werden.

2. Sekundäre Metrik: Token-Verbrauch

Diese Metrik beantwortet die Frage: „Wie rechenintensiv ist es für das Modell, diese Probleme zu lösen?“ Sie misst die Gesamtkosten für die Generierung der 238 Antworten.

  • Token-Berechnung: Für jeden API-Aufruf erfassten wir prompt_tokens und completion_tokens aus dem Usage-Objekt des Anbieters. Der Token-Score pro Modell ist die Summe der completion_tokens über alle 238 Fragen. Wir berichten completion_tokens (nicht Gesamt-Tokens), da die Eingabe über Modelle mit demselben Datensatz nahezu konstant ist (66k-92k Eingabe-Tokens pro Durchlauf, je nach Tokenizer).
  • Kostenberechnung: Wir berechneten die Dollar-Kosten als prompt_tokens × prompt_price_per_M + completion_tokens × completion_price_per_M, summiert über alle 238 Fragen. Die Preise sind die angegebenen Token-Raten des OpenRouter /api/v1/models-Endpunkts zum Zeitpunkt der Modellausführung.

Dieser vom FinanceReasoning-Benchmark selbst bereitgestellte Zwei-Metriken-Ansatz ermöglicht eine ganzheitliche Bewertung, die reine Problemlösungsfähigkeit eines Modells (Genauigkeit) mit seiner betrieblichen Effizienz (Token-Verbrauch) abwägt.

Lassen Sie unser Team einen Ihrer Geschäftsprozesse kostenlos mit KI-Agenten automatisieren.
Einen Prozess automatisieren

Finanzlogik mit Retrieval-Augmented Generation (RAG)

Um eigenständige Modelle zu übertreffen, entwarfen und implementierten wir ein eigenes RAG-Framework, das sich von der ursprünglichen Implementierung des Benchmarks unterscheidet. Unser Ansatz basiert auf einem modernen Vektordatenbank-Stack (Qdrant), um LLMs zur Inferenzzeit relevantes, domänenspezifisches Wissen bereitzustellen und ihnen zu helfen, Probleme zu lösen, die über ihre Trainingsdaten hinausgehen. Wir testeten dies an gpt-4o-mini, um die Auswirkungen zu messen.

Ergebnisse und Analyse: Der RAG-Kompromiss

Die Einführung von RAG hatte einen signifikanten und messbaren Einfluss auf die Leistung von gpt-4o-mini.

Wichtige Erkenntnisse aus der RAG-Evaluierung:

  • Deutliche Genauigkeitssteigerung: RAG verbesserte die Problemlösungsfähigkeit des Modells nachweislich und steigerte die Genauigkeit um über 10 Prozentpunkte. Dies bestätigt, dass die Bereitstellung externer, relevanter Kontexte für komplexe, domänenspezifische Denkaufgaben hochwirksam ist.
  • Der Preis der Genauigkeit: Dieser Leistungsgewinn ging mit hohen Kosten einher. Der Gesamt-Token-Verbrauch stieg um fast das 18-fache und die Gesamtausführungszeit um das 20-fache. Dies ist auf die zusätzlichen API-Aufrufe für Embeddings und vor allem auf die wesentlich größeren und komplexeren Prompts zurückzuführen, die das LLM verarbeiten muss.
  • Implikationen für größere Modelle: Die Ergebnisse von gpt-4o-mini legen nahe, dass RAG zwar eine höhere Leistung freisetzen kann, die Anwendung dieser Methode auf größere, teurere Modelle wie GPT-4o oder Claude Opus jedoch wesentlich kostspieliger und zeitaufwändiger sein wird. Dies unterstreicht den entscheidenden Kompromiss zwischen Genauigkeit, Kosten und Latenz beim Entwurf produktionsreifer Finanz-KI-Systeme.

RAG-Methodik für Finanzlogik

Unsere RAG-Pipeline basiert auf einem modernen Stack mit Qdrant als Vektordatenbank und dem OpenAI-Modell text-embedding-3-small zur Generierung semantischer Vektorrepräsentationen. Der Prozess besteht aus zwei Hauptphasen: einer Offline-Indizierungsphase und einer Online-Retrieval-Generierungsphase.

1. Indizierung des Wissenskorpus

  • Korpuserstellung: Wir kuratierten eine spezialisierte Wissensbasis aus zwei vom Benchmark bereitgestellten Quellen:
    1. Finanzdokumente: Eine Sammlung von Artikeln (financial_documents.json), die verschiedene Finanzkonzepte und -begriffe erklären.
    2. Finanzfunktionen: Eine Bibliothek mit gebrauchsfertigen Python-Funktionen (functions-article-all.json), die zur Lösung spezifischer Finanzberechnungen entwickelt wurden.
  • Intelligentes Chunking & Embedding: Um diesen Korpus für eine effiziente Abfrage vorzubereiten, wurde jedes Dokument und jede Funktion verarbeitet und indiziert:
    1. Chunking: Dokumente wurden in kleinere, semantisch kohärente Abschnitte basierend auf ihren Abschnitten segmentiert. Jede Python-Funktion wurde als ein einziger atomarer Chunk behandelt. Dies stellt sicher, dass der abgerufene Kontext fokussiert und relevant ist.
    2. Embedding: Jeder Chunk wurde dann mithilfe des text-embedding-3-small-Modells in einen 1536-dimensionalen Vektor umgewandelt.
    3. Indizierung: Diese Vektoren wurden in zwei separaten Kollektionen innerhalb unserer lokalen Qdrant-Instanz (financial_documents_openai_small und financial_functions_openai_small) indiziert, optimiert für die Kosinus-Ähnlichkeitssuche.

2. RAG-gestützte Inferenz

Für jede der 238 Fragen wurde der Denkprozess des Modells durch die folgenden automatisierten Schritte erweitert:

  1. Embedding-Generierung (API-Aufrufe 1 & 2): Die Benutzeranfrage (Frage + Kontext) wurde in einen Embedding-Vektor umgewandelt. Dies erforderte zwei Aufrufe der OpenAI-Embedding-API, um die Suche in beiden Kollektionen vorzubereiten.
  2. Multi-Source-Retrieval: Der Abfragevektor wurde verwendet, um eine semantische Suche in beiden Qdrant-Kollektionen gleichzeitig durchzuführen, um die relevantesten Informationen abzurufen:
    • Die 3 relevantesten Dokument-Chunks aus der financial_documents-Kollektion.
    • Die 2 relevantesten Python-Funktionen aus der financial_functions-Kollektion.
  3. Prompt-Erweiterung: Die abgerufenen Dokumente und Funktionen wurden dynamisch in den Prompt eingefügt, wodurch ein reichhaltiges, kontextbewusstes „Informationspaket“ entstand. Dies erhöhte die Eingabe-Prompt-Größe erheblich (von ~300-500 Tokens auf ~3,000-5,000+ Tokens).
  4. Endgültige Antwortgenerierung (API-Aufruf 3): Dieser erweiterte Prompt wurde an das gpt-4o-mini-Modell gesendet, um die endgültige, begründete Antwort zu generieren.

Einschränkungen des LLM-Finanz-Benchmarks

Unser Benchmark unterliegt trotz seines Umfangs mehreren wesentlichen Einschränkungen:

  • Risiko der Datenkontamination: Es ist möglich, dass diese Modelle mit dem Datensatz des Benchmarks trainiert wurden, da der Datensatz öffentlich ist. Dies könnte zu überhöhten Punktzahlen führen und die wahre Denkfähigkeit schwer beurteilbar machen.
  • Einzelmodell-RAG-Analyse: Die RAG-Evaluierung wurde an einem Modell durchgeführt (gpt-4o-mini), sodass die beobachteten Kompromisse zwischen Leistung und Kosten möglicherweise nicht auf alle anderen Modelle übertragbar sind.

Fazit

Unser Benchmark von 40+ Modellen bei komplexen Finanzlogik-Aufgaben zeigt Folgendes:

gpt-5.6-sol-pro erreicht die höchste Genauigkeit des Benchmarks mit 90.76% bei 385,886 Tokens zu $16.35 pro Durchlauf. gpt-5.6-sol und claude-fable-5 liegen gleichauf bei 90.34%.

gpt-5.6-sol erreicht die gleichen 90.34% wie claude-fable-5 für $3.85 pro Durchlauf gegenüber $10.05 von Fable-5, die niedrigsten Kosten auf der 90.34%-Genauigkeitsstufe.

claude-opus-4.8 erzielt 89.08% mit 113,434 Tokens für $3.28, über gpt-5-2025-08-07 (88.23%) bei etwa 7x weniger Ausgabe-Tokens und weniger als der Hälfte der Kosten ($3.28 vs. $8.38) und bleibt das günstigste Modell über 88% Genauigkeit.

claude-opus-4.6 (87.82%, 164,369 Tokens) und gpt-5-mini-2025-08-07 (87.39%, 595,505 Tokens) erreichen nahezu Spitzengenauigkeit. gpt-5.6-terra erreicht 86.97% zu $1.99, die niedrigsten Kosten unter den drei Modellen, die bei dieser Genauigkeit liegen.

gemini-3.1-pro-preview (86.55%) liegt über gemini-3-pro-preview (86.13%) bei 35% weniger Tokens, sodass iterative Aktualisierungen sowohl Genauigkeit als auch Effizienz verbessern können.

gemini-3-flash-preview erreicht 83.61% mit 118,530 Tokens zu $0.39, und gpt-5.2 erreicht 86.13% mit 247,660 Tokens.

RAG steigerte die Genauigkeit von gpt-4o-mini um 10.08 Punkte, allerdings um den Preis des 17.7-fachen der Tokens und der 20-fachen Latenz.

Verpassen Sie nicht unsere Benchmarks und datengestützten Erkenntnisse. Die Schaltfläche öffnet Google; die Auswahl von AIMultiple bestätigt, dass Sie AIMultiple häufiger in den Google-Suchergebnissen sehen möchten.
GoogleAls bevorzugte Quelle hinzufügen

Änderungsprotokoll

Wir fügen dem Benchmark mit jeder neuen Veröffentlichung Modelle hinzu.

10. Juli 2026

  • OpenAI: GPT-5.6 Sol (openai/gpt-5.6-sol)
  • OpenAI: GPT-5.6 Terra (openai/gpt-5.6-terra)
  • OpenAI: GPT-5.6 Sol Pro (openai/gpt-5.6-sol-pro)

30. Juni 2026

  • Anthropic: Claude Sonnet 5 (anthropic/claude-sonnet-5)

22. Juni 2026

  • Zhipu KI: GLM-5.2 (z-ai/glm-5.2)

10. Juni 2026

  • Anthropic: Claude Fable 5 (anthropic/claude-fable-5)

2. Juni 2026

  • Anthropic: Claude Opus 4.8 (anthropic/claude-opus-4.8)

22. Mai 2026

  • Google: Gemini 3.5 Flash (google/gemini-3.5-flash)
  • xAI: Grok 4.3 (x-ai/grok-4.3)
  • Spalte Kosten pro Benchmark-Durchlauf und Umschalter für Genauigkeits-Kosten-Diagramm hinzugefügt. Methodik um Kostenberechnungsformel und den Antwort-Extraktor-Wechsel (claude-sonnet-4.5) ergänzt.

20. April 2026

  • Anthropic: Claude Opus 4.7 (anthropic/claude-opus-4.7)

20. Februar 2026

  • Google: Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview)
  • Anthropic: Claude Sonnet 4.6 (anthropic/claude-sonnet-4.6)

6. Februar 2026

  • Anthropic: Claude Opus 4.6 (anthropic/claude-opus-4.6)
  • Anthropic: Claude Opus 4.5 (anthropic/claude-opus-4.5)
  • Anthropic: Claude Sonnet 4.5 (anthropic/claude-sonnet-4.5)
  • Google: Gemini 3 Pro Preview (google/gemini-3-pro-preview)
  • Google: Gemini 3 Flash Preview (google/gemini-3-flash-preview)
  • OpenAI: GPT-5.2 (openai/gpt-5.2)
  • Moonshot KI: Kimi K2.5 (moonshotai/kimi-k2.5)

Weiterführende Informationen

Finanzanalyse kann sich auf verschiedene Fähigkeiten beziehen, wie Aktienanalyse, Auslegung von Finanzrecht und Finanzlogik. In unserem Benchmark haben wir uns speziell auf Finanzlogik konzentriert, während andere Aufgaben in separaten Artikeln behandelt werden:

  • LLM für die Aktienanalyse: Diese Modelle helfen bei der Verarbeitung von Marktdaten, Unternehmensberichten und Nachrichten, um Anlagechancen zu identifizieren. (Siehe vollständige Analyse hier: KI-basierter Aktienhandel)
  • Finanzrecht-KI: Einige LLMs können Finanzvorschriften, Verträge und Compliance-Anforderungen interpretieren, um juristisch-finanzielle Aufgaben zu unterstützen. (Siehe unsere Liste von Legal-KI-Tools hier: Legal KI Tools)

FAQs

Ein LLM (Large Language Model) im Finanzwesen ist ein KI-Modell, das Techniken der natürlichen Sprachverarbeitung nutzt, um komplexe Finanzanalysen, Compliance-Management und Dokumentenverständnis durchzuführen. Diese Modelle unterstützen Finanzinstitute bei der Navigation durch Finanzrecht, regulatorische Anforderungen und die dynamischen Anforderungen der Finanzbranche.

Intelligente Chatbots:
LLM-gesteuerte virtuelle Assistenten ermöglichen es Finanzunternehmen, automatisierten, 24/7-Kundenservice anzubieten, indem sie Routineanfragen und Onboarding-Aufgaben ohne menschliches Eingreifen bearbeiten. Dies reduziert Wartezeiten und verbessert die Kundenzufriedenheit, während menschliche Agenten für komplexe Probleme frei werden.

Beratung & Analyse:
Investmentbanken nutzen LLMs, um Markttrends, Finanznachrichten und Kundendaten zu analysieren. Diese Modelle verarbeiten große Mengen unstrukturierter Informationen und ermöglichen es Beratern, personalisierte Anlageberatung und Portfoliomanagement mit Echtzeit-Einblicken anzubieten.

Analyse regulatorischer Dokumente:
Anwaltskanzleien und Finanzinstitute setzen LLMs ein, um dichte regulatorische Dokumente wie SEC-Einreichungen zu verarbeiten. Diese Modelle extrahieren Schlüsselinformationen und fassen Berichte zusammen, wodurch der manuelle Prüfaufwand reduziert und Unternehmen bei der Einhaltung sich ändernder Vorschriften unterstützt werden.

Betrugserkennung:
LLMs analysieren riesige Finanzdatensätze in Echtzeit, um verdächtige Transaktionsmuster und neue Betrugsmethoden zu erkennen. Ihre kontinuierlichen Lernfähigkeiten ermöglichen eine schnellere und genauere Betrugserkennung als herkömmliche Methoden.

Automatisierung von Recht und Compliance:
Rechtsabteilungen und Compliance-Teams nutzen LLMs, um Verträge zu prüfen, Bankengesetze zu interpretieren und die Einhaltung gesetzlicher Vorschriften zu überprüfen. Die Automatisierung dieser Aufgaben reduziert Prüfzeiten und Rechtskosten und gewährleistet gleichzeitig die Einhaltung komplexer Finanzvorschriften.

Dokumenten-Q&A und Named Entity Recognition (NER):
Finanzinstitute setzen LLMs ein, um Fragen von Investoren zu beantworten, indem sie Daten aus Finanzberichten und Earnings Calls extrahieren. NER ermöglicht das automatische Tagging von Unternehmensnamen, Aktientickern (class trading symbols) und regulatorischen Entitäten, was die Datenabfrage vereinfacht.

Effizienz und Automatisierung: LLMs automatisieren Routineanalysen (z. B. Zusammenfassen von Earnings Reports, Bearbeitung von Krediten oder Einreichungen), sparen Analystenzeit und reduzieren Fehler.

24/7-Kundenservice: KI-gestützte virtuelle Assistenten und Chatbots auf Basis von LLMs können Kundenanfragen rund um die Uhr mit dialogorientierten Antworten bearbeiten und so Kundenerlebnis und -zufriedenheit verbessern.

Personalisierte Finanzberatung: Durch die Analyse der Kundenhistorie und des Risikoprofils liefern LLMs maßgeschneiderte Finanz- oder Anlageberatung.

Betrugserkennung & Risikomanagement: LLMs durchforsten große Transaktionsdatensätze, um Anomalien oder Betrugsmuster zu erkennen, passen sich neuen Betrugstaktiken an und helfen beim Aufbau von Risikoprofilen.

Compliance & Berichterstattung: LLMs erstellen automatisch regulatorische Berichte, extrahieren richtlinienrelevante Fakten und helfen bei der Analyse komplexer Finanzgesetze und -vorschriften für die Compliance.

Ja, es gibt mehrere größere domänenspezifische Modelle für das Finanzwesen. BloombergGPT ist beispielsweise darauf ausgelegt, Finanzregulierung, Kapitalmärkte und Compliance-Management zu unterstützen, indem es große Finanzdatensätze verarbeitet, einschließlich Dokumenten der nationalen Wertpapierbörsen und regulatorischer Einreichungen.

Andere Modelle wie FinBERT und FinGPT konzentrieren sich auf Finanzrecht, internationales Bankrecht und personalisierte Finanzberatung und passen Large Language Models an das spezialisierte Vokabular des Finanzwesens an, wie z. B. class trading symbols und regulatorische Texte.

Finanzlogik ist die Fähigkeit, Finanzdaten zu analysieren, um fundierte Geschäfts- oder Investitionsentscheidungen zu treffen.

Zu den wichtigsten Aufgaben gehören:
– Analyse von Jahresabschlüssen (Gewinn, Cashflow, Bilanz)
– Budgetierung und Prognose
– Bewertung von Investitionen (NPV, IRR, ROI)
– Management von Cashflow und Liquidität
– Bewertung finanzieller Risiken und Leistungskennzahlen

Zitieren Sie diesen Benchmark

Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.

Ekrem Sarı (2026) - "Benchmark von 40+ LLMs im Finanzwesen: Claude Fable 5 & GPT-5.6 Sol". Online veröffentlicht auf AIMultiple.com. Abgerufen am 10. Juli 2026, von: https://aimultiple.com/finance-llm [Online-Ressource]

Sarı, E. (2026, 10. Juli). Benchmark von 40+ LLMs im Finanzwesen: Claude Fable 5 & GPT-5.6 Sol. AIMultiple. https://aimultiple.com/finance-llm

@misc{sari2026,
  author = {Sarı, Ekrem},
  title  = {{Benchmark von 40+ LLMs im Finanzwesen: Claude Fable 5 & GPT-5.6 Sol}},
  year   = {2026},
  month  = jul,
  howpublished    = {\url{https://aimultiple.com/finance-llm}},
  note   = {AIMultiple. Abgerufen am 10. Juli 2026}
}
Alle Daten herunterladen

Ergebnisse und Zeitstempel von 52 Datenpunkten. Laden Sie die in diesem Artikel verwendeten Daten als ZIP-Datei herunter, die eine CSV-Datei und eine README enthält.

Zuletzt aktualisiert: 6. Juli 2026
Herunterladen
Ekrem Sarı
Ekrem Sarı
KI-Forscher
Ekrem ist ein KI-Forscher und Datenanalyst bei AIMultiple. Er entwirft und führt praktische Benchmarks für KI- und LLM-Systeme durch.
Vollständiges Profil anzeigen

Seien Sie der Erste, der kommentiert

Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.

0/450