Premium
Hizmetler
Premium

Finans Alanında 40+ LLM Kıyaslaması: Claude Fable 5 ve GPT-5.6 Sol

We evaluated 40+ LLMs in finance on 238 hard questions from the FinanceReasoning benchmark to identify which models excel at complex financial reasoning tasks.

Ekrem Sarı
Ekrem Sarı
Güncellenme tarihi: 24 Eyl 2026
Grafik Yükleniyor

LLM'leri FinanceReasoning kıyaslamasındaki 238 zor soru üzerinde değerlendirdik (Tang ve ark.).1 Bu alt küme, en zorlu finansal muhakeme görevlerini hedefler; finansal kavramları ve formülleri içeren karmaşık, çok adımlı nicel akıl yürütmeyi değerlendirir. Değerlendirmemizde özel bir prompt tasarımı ve doğruluk ile token tüketimi puanlama kriterleri kullanılmıştır.

Bu metriklerin nasıl hesaplandığına ve bu değerlendirme için kullanılan framework'e ilişkin ayrıntılı açıklama için lütfen finansal kıyaslama metodolojimize bakın.

Sonuçlar: Finans için en iyi LLM hangisi?

Üst düzey performans gösterenler (>%83 doğruluk):

gpt-5.6-sol-pro kıyaslamanın en yüksek doğruluğuna %90,76 ile, 385.886 token ve $16,35 çalıştırma başına maliyetle ulaşır; gpt-5.6-sol'un 0.42 puan üzerindedir.

gpt-5.6-sol 117.735 token ve $3,85 çalıştırma başına maliyetle %90,34 doğruluk elde eder. İkinci en yüksek doğruluk için claude-fable-5 (%90,34) ile eşit durumdadır; $3,85 karşılığında fable-5'in $10,05 ve 117.735 token karşılığında 183.258. Onun doğruluğunda veya üzerindeki hiçbir model daha düşük maliyetle çalışmaz.

claude-fable-5 183.258 token ile %90,34 doğruluk elde eder. Bu kıyaslamada %90 barajını geçen ilk modeldir (Haziran 10) ve gpt-5.6-sol ile %90,34'ta eşit durumdadır; çalıştırma başına $10,05 ile gpt-5.6-sol'un $3,85'ine karşı.

claude-opus-4.8 113.434 token ile %89,08 doğruluk elde eder; bu, üçüncü en yüksek maliyetli sonuç ve %88 üzerindeki modeller arasında en düşük çıktı token sayısıdır.

gpt-5-2025-08-07 829.720 token ile %88,23 doğruluk elde eder.

claude-opus-4.6 164.369 token ile %87,82 doğruluk elde eder; bu, gpt-5'in token sayısının %20'si kadarıyla en üst düzeye yakın doğruluktur.

gpt-5-mini-2025-08-07 595.505 token ile %87,39 doğruluk elde eder.

gemini-3.5-flash 1.191.757 token ile %86,97 doğruluk elde eder; bu, Google'ın Flash serisindeki en yüksek doğruluk ve ailenin en yoğun token kullanıcısıdır.

claude-sonnet-5 414.668 token ile %86,97 doğruluk elde eder. gemini-3.5-flash ile ondalık haneye kadar aynı doğruluğu yakalar; 414.668 token karşılığında 1.191.757 token ve çalıştırma başına $4,33 karşılığında $10.83.

gpt-5.6-terra 121.936 token ve $1,99 çalıştırma başına maliyetle %86,97 doğruluk elde eder. claude-sonnet-5 ve gemini-3.5-flash ile %86,97'ta birleşir; üçü arasında en düşük token sayısı ve maliyetle (121.936 token ve $1,99, 414.668 / $4,33 ve 1.191.757 / $10,83'e karşı). gpt-5-mini-2025-08-07 daha ucuz ve daha yüksek doğrulukta kalır ($1,21, %87,39).

gemini-3.1-pro-preview 475.148 token ile %86,55 doğruluk elde eder; önceki modeli gemini-3-pro-preview (%86,13) seviyesinin %35 daha az token ile üzerindedir (730.759 token).

glm-5.2 735.988 token ile %86,13 doğruluk elde eder. glm-4.5'e (%64,29) göre 21.84 puan iyileşir; bu, kıyaslamadaki bir model ailesinin iki sürümü arasındaki en büyük sıçramadır. Bir sonraki en büyük sıçrama 3.79 puandır.

gemini-3-pro-preview ve gpt-5.2 %86,13 doğrulukta eşit durumdadır. gpt-5.2 buna 247.660 token ile ulaşır; bu, 730.759 token kullanan gemini-3-pro-preview'e göre yaklaşık üç kat daha az çıktı token'ıdır.

claude-opus-4.7 103.268 token ile %85,29 doğruluk elde eder; üst düzeydeki en token verimli modeldir (%83 eşiğini aşarken claude-opus-4.6'dan %37 daha az çıktı token üretir).

Güçlü performans gösterenler (80-%83 doğruluk):

grok-4.3 309.781 token ile %84,87 doğruluk elde eder; bu, xAI'nin kıyaslamadaki en güçlü sonucu ve daha önceki grok-4-0709 modelinden bir toparlanmadır.

claude-opus-4.5 144.505 token ile %84,03 doğruluk elde eder.

claude-sonnet-4.6 ve gemini-3-flash-preview %83,61 doğrulukta eşit durumdadır. Claude Sonnet 4.6 161.035 token kullanırken, Gemini 3 Flash Preview buna 118.530 token ile ulaşır; bu, %83 üzerindeki modeller arasında en düşük token sayısıdır.

kimi-k2.5 877.868 token ile %82,77 doğruluk elde eder; bu performans düzeyindeki en yüksek tüketimdir.

Orta düzey (70-%80 doğruluk):

o3-pro-2025-06-10 (%78,15 doğruluk, 473.659 token) ve kimi-k2 (%78,15 doğruluk, 100.323 token) eşit durumdadır ve kimi-k2 %79 daha az token kullanır. o3-mini-2025-01-31 (%77,31 doğruluk, 376.929 token), gpt-5-nano-2025-08-07 (%76,89 doğruluk, 1.028.909 token) ve claude-sonnet-4-20250514 (%76,05 doğruluk, 135.462 token) onları takip eder.

Düşük performans gösterenler (<%70 doğruluk):

claude-3-5-sonnet-20241022 (%67,65 doğruluk, 90.103 token) ve gpt-oss-20b (%67,65 doğruluk, 515.041 token) bu düzeye öncülük eder. gemini-2.5-flash (%65,55 doğruluk, 286.603 token), glm-4.5 (%64,29 doğruluk, 692.662 token) ve gpt-4.1-nano-2025-04-14 (%63,45 doğruluk, 171.096 token) onları takip eder.

Performans içgörüleri:

Token tüketimi doğruluğu takip etmez. deepseek-r1-0528 %62,18 doğrulukta en fazla token tüketti (1.251.064); buna karşılık claude-opus-4-20250514 132.274 token ile %80,25 doğruluk elde etti. Token verimliliği yüksek doğruluklu modeller arasında da değişir: gemini-3-flash-preview 118.530 token ile %83,61 doğruluğa ulaşırken kimi-k2,5 %82,77 için 877.868 token harcar (0.84 puan daha az doğruluk için 7.4x token).

Yukarıdaki tablo, bu kıyaslama için kullanılanlar dahil diğer yapay zeka modeli kıyaslamalarını gösterir.

Kıyaslama çalıştırması başına maliyet

Çıktı token'ları tek başına harcamayı belirlemez; çünkü çoğu sağlayıcıda girdi token ve çıktı token ücretleri bir büyüklük mertebesi kadar farklıdır. Her modelin 238 soru üzerindeki çalıştırma maliyetini, sağlayıcının çalıştırma sırasındaki listelenmiş token başına ücretini kullanarak dolar cinsinden hesapladık.

Sınır düzeyindeki en düşük maliyet: gemini-3-flash-preview %83,61 doğruluğa $0,39 ile ulaşır; bu, >%83 doğruluk bandındaki en düşük dolar maliyetidir. grok-4,3 %84,87 için $0,86 ile onu takip eder.

%90,34 düzeyine daha düşük maliyetle ulaşılır: gpt-5.6-sol, claude-fable-5'in %90,34 doğruluğunu $3,85 çalıştırma başına maliyetle yakalar; bu, fable-5'in $10,05 maliyetinin %38'idir. gpt-5.6-sol-pro kıyaslamanın en yüksek doğruluğu olan %90,76'yi $16,35 çalıştırma başına maliyetle kaydeder. claude-opus-4.8, %89,08 için $3,28 ile %88 barajını geçen ucuz model olmayı sürdürür.

Yüksek fiyata yüksek kalitede muhakeme: o1-pro, %80,67 doğruluk için $381 ile kıyaslamadaki en yüksek maliyetli modeldir (bu maliyet, $150/M girdi ve $600/M çıktı ücretlerinden kaynaklanır). o3-pro %78,15 için $39,23, o1 %74,79 için $46,59 tutar. Hiçbiri üst düzeyi aşamaz ve üçü de doğrulukta claude-opus-4.7'in altında, maliyeti ise onun 10x üzerindedir.

Bütçe düzeyinde maliyet ve doğruluk: gpt-oss-120b toplam $0,06 maliyetle %81,09 doğruluk elde eder; bu, kıyaslamadaki en ucuz çalıştırma olup %83 eşiğinin 1.91 puan yakınındadır. llama-4-maverick $0,10 maliyetle %75,21 doğruluğa ulaşır. %80 doğruluğun yeterli olduğu iş yükleri için bu modeller, amiral gemisi modellerin maliyetinin %1'inden daha azına mal olur.

Finans LLM tam sonuçlar tablosu

Aşağıdaki tablo, kıyaslamadaki her modeli ölçülen doğruluk, çıktı token'ları ve çalıştırma başına maliyetin yanı sıra bir doğru cevabın maliyetiyle birlikte listeler.

Finansal muhakeme kıyaslama metodolojisi

Kıyaslamamız, karmaşık finansal muhakeme görevlerinde LLM performansının şeffaf ve tekrarlanabilir bir değerlendirmesini sunar.

Test kurulumu ve veri külliyatı

  • Kıyaslama seti: Nicel ve çıkarımsal finansal problemlere odaklandığı için seçilen FinanceReasoning kıyaslamasındaki veri, kod ve değerlendirme betiklerini kullandık.
  • Bilgi külliyatı ve test sorguları: Analizimizi 238 zorlu sorudan oluşan zor alt kümeye odakladık. Kıyaslamanın tanımladığı şekliyle her veri noktası şunları içerir:
    1. Çok adımlı mantıksal ve sayısal çıkarım gerektiren bir soru.
    2. Genellikle Markdown tabloları gibi yapılandırılmış biçimlerde sunulan yoğun bilgiler içeren bir bağlam (ör. bilançolar, hisse senedi performans verileri).
    3. Objektif puanlama için kesin bir doğruluk referansı cevabı.
  • Örnekleyici sorgu türleri: Kıyaslamanın zorluğu, modellerin çeşitli ve karmaşık finansal muhakeme görevlerini ele almasını gerektirmesinden kaynaklanır. Bu genişliği göstermek için test setinden iki temsili örneği öne çıkarıyoruz:

Örnek: Algoritmik ve zaman serisi muhakemesi (teknik analiz)

Bağlam: Bir yatırımcı, 10 günlük EMA periyodu ve 10 günlük ATR periyodu kullanarak, 1.5 çarpanıyla Keltner Kanalı'nı hesaplamak için son 25 gündeki hisse senedi fiyatlarını analiz ediyor…

Soru: Keltner Kanalı'ndaki son üst bandın değeri nedir…? İki ondalık basamağa göre cevaplayın.

Bu sorgu, modelin aşağıdakileri yaparak nicel bir analist gibi davranma becerisini sınar:

  1. Bileşik bir göstergenin ayrıştırılması: “Keltner Kanalı”nın iki başka karmaşık göstergeden türetildiğini fark etme:
    • Üssel hareketli ortalama (EMA)
    • Ortalama gerçek aralık (ATR).
  2. Algoritmik mantığın uygulanması: 25 veri noktalı bir zaman serisi üzerinde hem EMA hem de ATR için yinelemeli algoritmaların sıfırdan doğru şekilde uygulanması.
  3. Sonuçların sentezlenmesi: Hesaplanan değerlerin nihai Keltner Kanalı formülüne göre birleştirilmesi (Üst Bant = EMA + (Çarpan × ATR)).

Temel değerlendirme ilkeleri

  • Yalıtılmış ve standartlaştırılmış API çağrıları: Her model için değerlendirmeyi ilgili API endpoint'leri aracılığıyla programatik olarak gerçekleştirdik (örn. OpenRouter, OpenAI). Bu, her modelin aynı koşullar altında tam olarak aynı girdiyi almasını sağlayarak arayüz etkileşimlerinden kaynaklanan değişkenliği ortadan kaldırdı.
  • Serbest biçimli üretim: Modelleri çoktan seçmeli bir biçimle sınırlandırmadık. Bunun yerine, muhakeme yeteneklerinin daha özgün bir değerlendirmesine olanak tanımak için kapsamlı, free-form bir yanıt üretmeleri istendi.
  • Zincirleme Düşünce (CoT) prompting: Modellerin muhakeme sürecini ortaya çıkarmak ve değerlendirmek için bir Zincirleme Düşünce (CoT) prompting stratejisi kullandık. Sistem promptu her modele, nihai bir cevaba varmadan önce “sorun üzerinde adım adım düşünmesini” açıkça söyledi. Bu yaklaşım, modelin sonuca nasıl ulaştığının nihai çıktının ötesinde daha derinlemesine analiz edilmesini sağlar.

Değerlendirme metrikleri ve framework

Model çıktılarını puanlamak için FinanceReasoning kıyaslamasının kendi tam otomatik değerlendirme framework'ünü kullandık. Bu framework, hem kavramsal doğruluğu hem de hesaplama maliyetini ölçmek üzere tasarlanmıştır.

1. Birincil metrik: Doğruluk

Bu metrik şu kritik soruyu yanıtlar: “Model finansal problemi doğru şekilde çözebiliyor mu?” Puanlama süreci sofistike iki adımlı bir pipeline içerir:

  • Adım 1: LLM tabanlı cevap çıkarma: Modelin ham çıktısı, hem muhakeme hem de nihai bir cevap içeren yapılandırılmamış metindir. Sayısal veya boolean değeri güvenilir şekilde ayrıştırmak için denetçi modeli (anthropic/claude-sonnet-4.5) ayrıştırıcı olarak kullandık.
  • Adım 2: Toleransa dayalı karşılaştırma: Sayısal problemler için basit bir “birebir eşleşme” yetersizdir. Bu nedenle çıkarılan cevap, doğruluk referansıyla programatik olarak karşılaştırıldı. Betik, küçük kayan nokta veya yuvarlama farklılıklarını adil şekilde ele almak için sayısal tolerans eşiği (göreli fark %0,2) uygular; böylece kavramsal olarak doğru çözümler doğru olarak işaretlenir.

2. İkincil metrik: Token tüketimi

Bu metrik şu soruyu yanıtlar: “Modelin bu problemleri çözmesi hesaplama açısından ne kadar pahalı?” 238 cevabın üretilmesiyle ilişkili toplam maliyeti ölçer.

  • Token hesaplama: Her API çağrısı için sağlayıcının kullanım nesnesinden prompt_tokens ve completion_tokens değerlerini topladık. Model başına token puanı, tüm 238 sorudaki completion_tokens değerlerinin toplamıdır. Tamamlanan token'ları (toplam token'ları değil) raporluyoruz çünkü aynı dataset'i paylaşan modeller arasında girdi neredeyse sabittir (tokenizer'a bağlı olarak çalıştırma başına 66k-92k girdi token).
  • Maliyet hesaplama: Dolar maliyetini, tüm 238 soru üzerinden toplamak üzere prompt_tokens × prompt_price_per_M + completion_tokens × completion_price_per_M olarak hesapladık. Fiyatlar, modelin çalıştırıldığı sırada OpenRouter /api/v1/models endpoint'inden alınan listelenmiş token başına ücretlerdir.

FinanceReasoning kıyaslamasının kendisi tarafından sağlanan bu iki metrikli yaklaşım, modelin ham problem çözme becerisini (doğruluk) operasyonel verimliliğiyle (token tüketimi) dengeleyerek bütünsel bir değerlendirme sağlar.

Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

Retrieval Augmented Generation (RAG) ile finansal muhakeme

Bağımsız modelleri geride bırakmak için, kıyaslamanın özgün uygulamasından farklı, özel bir RAG framework'ü tasarladık ve uyguladık. Yaklaşımımız, LLM'lere inference sırasında ilgili, alana özgü bilgi sağlamak için modern bir vektör veritabanı yığınına (Qdrant) dayanır; bu da eğitim verilerinin ötesindeki problemleri çözmelerine yardımcı olur. Etkisini ölçmek için bunu gpt-4o-mini üzerinde test ettik.

Sonuçlar ve analiz: RAG ödünleşimi

RAG'in kullanılmaya başlanması, gpt-4o-mini performansı üzerinde önemli ve ölçülebilir bir etki yarattı.

RAG değerlendirmesinden çıkarılacak temel sonuçlar:

  • Önemli doğruluk artışı: RAG, modelin problem çözme yeteneğini belirgin şekilde artırarak doğruluğu 10 yüzde puanından fazla yükseltti. Bu, harici ve ilgili bağlam sağlamanın karmaşık, alana özgü muhakeme görevleri için oldukça etkili olduğunu doğrular.
  • Doğruluğun maliyeti: Bu performans kazancı yüksek bir maliyetle geldi. Toplam token tüketimi yaklaşık x18 arttı ve toplam çalıştırma süresi x20 arttı. Bunun nedeni, embedding için yapılan ek API çağrıları ve daha da önemlisi LLM'in işlemesi gereken çok daha büyük ve karmaşık promptlardır.
  • Daha büyük modeller için çıkarımlar: gpt-4o-mini sonuçları, RAG daha yüksek performansın kilidini açabilse de bu yöntemin GPT-4o veya Claude Opus gibi daha büyük ve daha pahalı modellere uygulanmasının önemli ölçüde daha maliyetli ve zaman alıcı olacağını göstermektedir. Bu, üretim düzeyinde finansal yapay zeka sistemleri tasarlarken doğruluk, maliyet ve gecikme arasındaki kritik ödünleşimi vurgular.

Finansal muhakeme RAG metodolojisi

RAG pipeline'ımız, vektör veritabanı olarak Qdrant kullanan ve anlamsal vektör temsilleri oluşturmak için OpenAI'nin text-embedding-3-small modelinden yararlanan modern bir yığın üzerine kuruludur. Süreç iki ana aşamadan oluşur: çevrimdışı bir indeksleme aşaması ve çevrimiçi bir geri getirme-üretim aşaması.

1. Bilgi külliyatı indeksleme

  • Külliyat oluşturma: Kıyaslamanın sağladığı iki kaynaktan uzmanlaşmış bir bilgi tabanı oluşturduk:
    1. Finansal belgeler: Çeşitli finansal kavramları ve terimleri açıklayan makalelerden oluşan bir koleksiyon (financial_documents.json).
    2. Finansal fonksiyonlar: Belirli finansal hesaplamaları çözmek için tasarlanmış kullanıma hazır Python fonksiyonlarından oluşan bir kütüphane (functions-article-all.json).
  • Akıllı parçalama ve embedding: Bu külliyatı verimli geri getirme için hazırlamak amacıyla her belge ve fonksiyon işlendi ve indekslendi:
    1. Parçalama: Belgeler, bölümlerine göre daha küçük, anlamsal olarak tutarlı parçalara ayrıldı. Her Python fonksiyonu tek bir atomik parça olarak ele alındı. Bu, getirilen bağlamın odaklı ve ilgili olmasını sağlar.
    2. Embedding: Her parça daha sonra text-embedding-3-small modeli kullanılarak 1536 boyutlu bir vektöre dönüştürüldü.
    3. Dizinleme: Bu vektörler, kosinüs benzerlik araması için optimize edilmiş yerel Qdrant örneğimizdeki iki ayrı koleksiyona indekslendi (financial_documents_openai_small ve financial_functions_openai_small).

2. RAG destekli inference

238 sorunun her biri için modelin muhakeme süreci aşağıdaki otomatik adımlarla zenginleştirildi:

  1. Embedding üretimi (API çağrıları 1 ve 2): Kullanıcının sorgusu (soru + bağlam) bir embedding vektörüne dönüştürüldü. Her iki koleksiyondaki aramalara hazırlanmak için OpenAI'nin embedding API'sine iki çağrı yapılması gerekti.
  2. Çok kaynaklı geri getirme: Sorgu vektörü, en ilgili bilgileri getirmek için her iki Qdrant koleksiyonunda aynı anda anlamsal arama yapmak için kullanıldı:
    • financial_documents koleksiyonundaki en ilgili 3 belge parçası.
    • financial_functions koleksiyonundaki en ilgili 2 Python fonksiyonu.
  3. Prompt zenginleştirme: Getirilen belgeler ve fonksiyonlar prompt'a dinamik olarak eklenerek zengin, bağlam farkındalıklı bir “bilgi paketi” oluşturuldu. Bu, girdi prompt boyutunu önemli ölçüde artırdı (yaklaşık 300-500 token'dan ~3.000-5.000+ token'a).
  4. Nihai cevap üretimi (API çağrısı 3): Bu zenginleştirilmiş prompt, nihai, gerekçeli cevabı üretmesi için gpt-4o-mini modeline gönderildi.

Finans kıyaslamasındaki LLM'lerin sınırlamaları

Kıyaslamamız kapsamlı olmakla birlikte birkaç temel sınırlamaya tabidir:

  • Veri kontaminasyonu riski: dataset halka açık olduğu için bu modellerin kıyaslamanın dataset'inde eğitilmiş olması mümkündür. Bu, gerçek muhakeme yeteneğinin değerlendirilmesini zorlaştırarak şişirilmiş puanlara yol açabilir.
  • Tek modelli RAG analizi: RAG değerlendirmesi tek bir model üzerinde (gpt-4o-mini) yapıldı; bu nedenle performans ile maliyet arasında gözlemlenen ödünleşimler diğer tüm modeller için geçerli olmayabilir.

Sonuç

Karmaşık finansal muhakeme görevlerinde 40+ model üzerinde yaptığımız kıyaslama şunları göstermektedir:

gpt-5.6-sol-pro kıyaslamanın en yüksek doğruluğuna %90,76 ile, 385.886 token ve $16,35 çalıştırma başına maliyetle ulaşır. gpt-5.6-sol ve claude-fable-5 %90,34'ta eşit durumdadır.

gpt-5.6-sol, claude-fable-5'in %90,34 doğruluğunu $3,85 çalıştırma başına maliyetle yakalar; bu, fable-5'in $10,05 maliyetine karşılık %90,34 doğruluk düzeyindeki en düşük maliyettir.

claude-opus-4.8 113.434 token ile $3,28 karşılığında %89,08 doğruluk elde eder; gpt-5-2025-08-07 (%88,23) modelinden yaklaşık 7x daha az çıktı token ile ve yarıdan daha az maliyetle ($3,28 vs $8,38) üzerindedir ve %88 doğruluk üzerindeki en ucuz model olmayı sürdürür.

claude-opus-4.6 (%87,82, 164.369 token) ve gpt-5-mini-2025-08-07 (%87,39, 595.505 token) en üst düzeye yakın doğruluğa ulaşır. gpt-5.6-terra $1,99 karşılığında %86,97 doğruluğa ulaşır; bu, o doğrulukta eşit olan üç model arasındaki en düşük maliyettir.

gemini-3.1-pro-preview (%86,55), gemini-3-pro-preview (%86,13) modelinin %35 daha az token ile üzerindedir; dolayısıyla yinelemeli güncellemeler hem doğruluğu hem de verimliliği artırabilir.

gemini-3-flash-preview 118.530 token ve $0,39 maliyetle %83,61 doğruluğa ulaşır ve gpt-5.2 247.660 token ile %86,13 doğruluğa ulaşır.

RAG, gpt-4o-mini'nin doğruluğunu 10.08 puan artırdı; bunun maliyeti 17.7x token ve 20x gecikme oldu.

Kıyaslamalarımızı ve veri odaklı içgörülerimizi kaçırmayın. Düğme Google'ı açar; AIMultiple'ı seçmeniz, Google arama sonuçlarında AIMultiple'ı daha sık görmek istediğinizi onaylar.
GoogleTercih edilen kaynak olarak ekle

Değişiklik günlüğü

Her yeni sürümle birlikte bu kıyaslamaya model ekliyoruz.

9 Eylül 2026

  • OpenAI: GPT-6 Astra (openai/gpt-6-astra).
  • Anthropic: Claude Fable 5.1 (anthropic/claude-fable-5.1)

10 Temmuz 2026

  • OpenAI: GPT-5.6 Sol (openai/gpt-5.6-sol)
  • OpenAI: GPT-5.6 Terra (openai/gpt-5.6-terra)
  • OpenAI: GPT-5.6 Sol Pro (openai/gpt-5.6-sol-pro)

30 Haziran 2026

  • Anthropic: Claude Sonnet 5 (anthropic/claude-sonnet-5)

22 Haziran 2026

  • Zhipu AI: GLM-5.2 (z-ai/glm-5.2)

10 Haziran 2026

  • Anthropic: Claude Fable 5 (anthropic/claude-fable-5)

2 Haziran 2026

  • Anthropic: Claude Opus 4.8 (anthropic/claude-opus-4.8)

22 Mayıs 2026

  • Google: Gemini 3.5 Flash (google/gemini-3.5-flash)
  • xAI: Grok 4.3 (x-ai/grok-4.3)
  • Kıyaslama çalıştırması başına maliyet sütunu ve doğruluk-maliyet grafiği düğmesi eklendi. Metodoloji, maliyet hesaplama formülü ve cevap çıkarıcı değişikliğiyle güncellendi (claude-sonnet-4.5)

20 Nisan 2026

  • Anthropic: Claude Opus 4.7 (anthropic/claude-opus-4.7)

20 Şubat 2026

  • Google: Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview)
  • Anthropic: Claude Sonnet 4.6 (anthropic/claude-sonnet-4.6)

6 Şubat 2026

  • Anthropic: Claude Opus 4.6 (anthropic/claude-opus-4.6)
  • Anthropic: Claude Opus 4.5 (anthropic/claude-opus-4.5)
  • Anthropic: Claude Sonnet 4.5 (anthropic/claude-sonnet-4.5)
  • Google: Gemini 3 Pro Preview (google/gemini-3-pro-preview)
  • Google: Gemini 3 Flash Preview (google/gemini-3-flash-preview)
  • OpenAI: GPT-5.2 (openai/gpt-5.2)
  • Moonshot AI: Kimi K2.5 (moonshotai/kimi-k2.5)

Ek okumalar

Finansal analiz; hisse senedi analizi, finans hukuku yorumu ve finansal muhakeme gibi birden fazla yeteneği ifade edebilir. Kıyaslamamızda özellikle finansal muhakemeye odaklandık; diğer görevler ayrı makalelerde ele alınmıştır:

  • Hisse senedi analizi için LLM: Bu modeller, yatırım fırsatlarını belirlemek amacıyla piyasa verilerini, şirket raporlarını ve haberleri işlemeye yardımcı olur. (Tam analiz için buraya bakın: AI tabanlı Hisse Senedi Ticareti)
  • Finans hukuku yapay zekası: Bazı LLM'ler finansal düzenlemeleri, sözleşmeleri ve uyumluluk gerekliliklerini yorumlayarak hukuk-finans görevlerine yardımcı olabilir. (Hukuk yapay zeka araçları listemize buradan bakın: Legal AI Tools)

SSS'ler

Finans alanındaki bir LLM (büyük dil modeli), karmaşık finansal analiz, uyumluluk yönetimi ve belge anlama işlemlerini gerçekleştirmek için doğal dil işleme tekniklerini kullanan bir yapay zeka modelidir. Bu modeller, finans kurumlarının finans hukuku, düzenleyici gereklilikler ve finans sektörünün dinamik talepleri arasında yol bulmasına yardımcı olur.

Akıllı chatbot'lar:
LLM destekli sanal asistanlar, rutin sorguları ve işe alım görevlerini insan müdahalesi olmadan ele alarak finans firmalarının otomatik 24/7 müşteri desteği sunmasını sağlar. Bu, bekleme sürelerini azaltır ve müşteri memnuniyetini artırırken insan temsilcileri karmaşık sorunlar için serbest bırakır.

Danışmanlık ve analiz:
Yatırım bankaları, piyasa eğilimlerini, finansal haberleri ve müşteri verilerini analiz etmek için LLM'leri kullanır. Bu modeller büyük miktarda yapılandırılmamış bilgiyi sindirerek danışmanların gerçek zamanlı içgörülerle kişiselleştirilmiş yatırım tavsiyesi ve portföy yönetimi sunmasını sağlar.

Düzenleyici belge analizi:
Hukuk firmaları ve finans kurumları, SEC bildirimleri gibi yoğun düzenleyici belgeleri işlemek için LLM'lerden yararlanır. Bu modeller temel bilgileri çıkarır ve raporları özetler; manuel inceleme süresini azaltır ve firmaların gelişen düzenlemelere uyumlu kalmasına yardımcı olur

Dolandırıcılık tespiti:
LLM'ler şüpheli işlem kalıplarını ve ortaya çıkan dolandırıcılık taktiklerini tespit etmek için büyük finansal dataset'leri gerçek zamanlı olarak analiz eder. Sürekli öğrenme yetenekleri, geleneksel yöntemlerden daha hızlı ve daha isabetli dolandırıcılık tanımlaması sağlar.

Hukuk ve uyumluluk otomasyonu:
Hukuk firmaları ve uyumluluk ekipleri; sözleşmeleri incelemek, bankacılık yasalarını yorumlamak ve düzenleyici uyumu doğrulamak için LLM'leri kullanır. Bu görevlerin otomatikleştirilmesi, karmaşık finansal düzenlemelere bağlılığı sağlarken inceleme süresini ve hukuk maliyetlerini azaltır.

Belge soru-cevap ve Adlandırılmış Varlık Tanıma (NER):
Finans kurumları, finansal raporlardan ve kazanç görüşmelerinden veri çıkararak yatırımcıların sorularını yanıtlamak için LLM'leri devreye alır. NER, şirket adlarının, hisse senedi kısaltmalarının (sınıf ticaret sembolleri) ve düzenleyici varlıkların otomatik etiketlenmesini sağlayarak veri erişimini kolaylaştırır.

Verimlilik ve otomasyon: LLM'ler rutin analizleri (ör. kazanç raporlarını özetleme, kredileri veya dosyalamaları işleme) otomatikleştirerek analist saatlerinden tasarruf sağlar ve hataları azaltır.

24/7 müşteri hizmeti: LLM'lerle desteklenen yapay zeka sanal asistanları ve chatbot'lar, müşteri sorgularını sohbet tarzında yanıtlarla günün her saati ele alabilir; bu da müşteri deneyimini ve memnuniyetini artırır.

Kişiselleştirilmiş finansal tavsiye: LLM'ler, müşterinin geçmişini ve risk profilini analiz ederek kişiye özel finansal veya yatırım tavsiyeleri sunar.

Dolandırıcılık tespiti ve risk yönetimi: LLM'ler, anomalileri veya dolandırıcılık kalıplarını tespit etmek için büyük işlem dataset'lerini tarar; yeni dolandırıcılık taktiklerine uyum sağlar ve risk profilleri oluşturmaya yardımcı olur.

Uyumluluk ve raporlama: LLM'ler düzenleyici raporları otomatik olarak taslaklar, politika açısından ilgili olguları çıkarır ve uyumluluk için karmaşık finans hukukunun ve düzenlemelerin ayrıştırılmasına yardımcı olur.

Evet, finans için daha büyük, alana özgü birkaç model mevcuttur. Örneğin BloombergGPT, ulusal menkul kıymetler borsası belgeleri ve düzenleyici dosyalamalar dahil büyük finansal dataset'leri işleyerek finansal düzenleme, sermaye piyasaları ve uyumluluk yönetimine yardımcı olmak üzere tasarlanmıştır.

FinBERT ve FinGPT gibi diğer modeller; finans hukuku, uluslararası bankacılık hukuku ve kişiselleştirilmiş finansal tavsiyeye odaklanır, büyük dil modellerini sınıf ticaret sembolleri ve düzenleyici metinler gibi finansın uzmanlaşmış söz dağarcığına uyarlar.

Finansal muhakeme, bilinçli iş veya yatırım kararları almak için finansal verileri analiz etme yeteneğidir.

Başlıca görevler şunlardır:
– Finansal tabloları analiz etmek (kâr, nakit akışı, bilanço)
– Bütçeleme ve tahminleme
– Yatırımları değerlendirmek (NPV, IRR, ROI)
– Nakit akışını ve likiditeyi yönetmek
– Finansal riskleri ve performans oranlarını değerlendirmek

Bu benchmarkı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Ekrem Sarı (2026) - "Finans Alanında 40+ LLM Kıyaslaması: Claude Fable 5 ve GPT-5.6 Sol". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 24 Eylül 2026, kaynak: https://aimultiple.com/finance-llm [Çevrimiçi Kaynak]

Sarı, E. (2026, 24 Eylül). Finans Alanında 40+ LLM Kıyaslaması: Claude Fable 5 ve GPT-5.6 Sol. AIMultiple. https://aimultiple.com/finance-llm

@misc{sari2026,
  author = {Sarı, Ekrem},
  title  = {{Finans Alanında 40+ LLM Kıyaslaması: Claude Fable 5 ve GPT-5.6 Sol}},
  year   = {2026},
  month  = sep,
  howpublished    = {\url{https://aimultiple.com/finance-llm}},
  note   = {AIMultiple. Erişim tarihi: 24 Eylül 2026}
}
Tüm verileri indir

58 veri noktasının sonuçları ve zaman damgaları. Bu makaledeki grafik ve tablolarda gösterilen özet verileri, 2 CSV dosyası içeren ZIP dosyası olarak indirin.

Son güncelleme: 25 Eylül 2026
İndir

Arkasındaki ayrıntılı veriyi ister misiniz? Premium'a katılın

Ekrem Sarı
Ekrem Sarı
Yapay Zeka Araştırmacısı
Ekrem, AIMultiple'da Yapay Zeka Araştırmacısı ve Veri Bilimcidir. Yapay zeka ve LLM sistemleri için uygulamalı benchmark'lar tasarlar ve yürütür.
Tam Profili Görüntüle

Yorum yapan ilk kişi olun

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450