Hizmetler
Bize Ulaşın

Finans Alanında 40+ LLM Karşılaştırması: Claude Fable 5 ve GPT-5.6 Sol

Ekrem Sarı
Ekrem Sarı
Güncellenme tarihi: 10 Tem 2026

Finans alanında 40+ LLM'i, hangi modellerin tablo analizi, tahminleme ve oran hesaplamaları gibi karmaşık finansal muhakeme görevlerinde üstün performans gösterdiğini belirlemek için FinanceReasoning karşılaştırma testindeki 238 zor soru üzerinde değerlendirdik.

LLM finans karşılaştırma testine genel bakış

Loading Chart

LLM'leri FinanceReasoning karşılaştırma testindeki (Tang ve diğerleri) 238 zor soru üzerinde değerlendirdik.1 Bu alt küme, finansal kavramları ve formülleri içeren karmaşık, çok adımlı nicel muhakemeyi değerlendirerek en zorlu finansal muhakeme görevlerini hedef alır. Değerlendirmemizde özel bir prompt tasarımı ve doğruluk ile token tüketiminden oluşan puanlama kriterleri kullanılmıştır.

Bu metriklerin nasıl hesaplandığına ve bu değerlendirme için kullanılan çerçeveye dair ayrıntılı açıklama için lütfen finansal karşılaştırma testi metodolojimize bakın.

Sonuçlar: Finans için en iyi LLM hangisi?

Üst düzey performans gösterenler (>%83 doğruluk):

gpt-5.6-sol-pro, çalıştırma başına 385.886 token ve $16,35 ile karşılaştırma testinin en yüksek doğruluğu olan %90,76'ya ulaşarak gpt-5.6-sol'un 0,42 puan üzerine çıkmıştır.

gpt-5.6-sol, çalıştırma başına 117.735 token ve $3,85 ile %90,34 doğruluk elde etmiştir. En yüksek ikinci doğrulukta claude-fable-5 (%90,34) ile eşit olup, $3,85 maliyetle fable-5'in $10,05'ine ve 117.735 token ile 183.258 tokena karşılık gelir. Bu doğrulukta veya üzerinde hiçbir model daha düşük maliyetle çalışmamaktadır.

claude-fable-5, 183.258 token ile %90,34 doğruluk elde etmiştir. Bu karşılaştırma testinde %90'ı aşan ilk modeldir (10 Haziran) ve gpt-5.6-sol ile %90,34'te eşit olup, çalıştırma başına $10,05 maliyetle gpt-5.6-sol'un $3,85'ine karşılık gelir.

claude-opus-4.8, 113.434 token ile %89,08 doğruluk elde ederek, %88 üzerindeki modeller arasında en düşük çıktı token sayısına ve üçüncü en yüksek maliyetli sonuca sahiptir.

gpt-5-2025-08-07, 829.720 token ile %88,23 doğruluk elde etmiştir.

claude-opus-4.6, 164.369 token ile %87,82 doğruluk elde ederek, gpt-5'in token sayısının %20'si ile üst sıralara yakın doğruluk sunar.

gpt-5-mini-2025-08-07, 595.505 token ile %87,39 doğruluğa ulaşır.

gemini-3.5-flash, 1.191.757 token ile %86,97 doğruluğa ulaşarak Google'ın Flash serisindeki en yüksek doğruluğu ve ailenin en yüksek token kullanıcısı olur.

claude-sonnet-5, 414.668 token ile %86,97 doğruluk elde eder. gemini-3.5-flash ile onda bire kadar eşleşirken, 414.668 token harcar (karşısında 1.191.757), çalıştırma başına $4,33 maliyetle (karşısında $10,83).

gpt-5.6-terra, çalıştırma başına 121.936 token ve $1,99 ile %86,97 doğruluk elde eder. claude-sonnet-5 ve gemini-3.5-flash ile %86,97'de buluşurken, üçü arasında en düşük token sayısı ve maliyete sahiptir (121.936 token ve $1,99, karşısında 414.668 / $4,33 ve 1.191.757 / $10,83). gpt-5-mini-2025-08-07 daha ucuz ve daha doğru kalır ($1,21, %87,39).

gemini-3.1-pro-preview, 475.148 token ile %86,55 doğruluk elde ederek öncülü gemini-3-pro-preview'in (%86,13) üzerine çıkar ve %35 daha az token kullanır (730.759 token).

glm-5.2, 735.988 token ile %86,13 doğruluk elde eder. glm-4.5'e (%64,29) göre 21,84 puan iyileşme göstererek, karşılaştırma testinde bir model ailesinin iki sürümü arasındaki en büyük sıçramayı yapar. Bir sonraki en büyük sıçrama 3,79 puandır.

gemini-3-pro-preview ve gpt-5.2, %86,13 doğrulukta eşitlenir. gpt-5.2 bu doğruluğa 247.660 token ile ulaşır, bu da gemini-3-pro-preview'in 730.759 tokenından yaklaşık üç kat daha az çıktı tokenıdır.

claude-opus-4.7, 103.268 token ile %85,29 doğruluk elde ederek üst düzeydeki en token verimli modeldir (claude-opus-4.6'dan %37 daha az çıktı tokenı ile %83 eşiğini aşar).

Güçlü performans gösterenler (80-%83 doğruluk):

grok-4.3, 309.781 token ile %84,87 doğruluğa ulaşarak xAI'ın karşılaştırma testindeki en güçlü sonucunu ve daha önceki grok-4-0709'dan bir toparlanmayı temsil eder.

claude-opus-4.5, 144.505 token ile %84,03 doğruluk elde eder.

claude-sonnet-4.6 ve gemini-3-flash-preview, %83,61 doğrulukta eşitlenir. Claude Sonnet 4.6 161.035 token kullanırken, Gemini 3 Flash Preview bu doğruluğa 118.530 token ile ulaşır; bu, %83 üzerindeki modeller arasında en düşük token sayısıdır.

kimi-k2.5, 877.868 token ile %82,77 doğruluk elde ederek bu performans kademesindeki en yüksek tüketime sahiptir.

Orta kademe (70-%80 doğruluk):

o3-pro-2025-06-10 (%78,15 doğruluk, 473.659 token) ve kimi-k2 (%78,15 doğruluk, 100.323 token) eşitlenir ve kimi-k2 %79 daha az token kullanır. o3-mini-2025-01-31 (%77,31 doğruluk, 376.929 token), gpt-5-nano-2025-08-07 (%76,89 doğruluk, 1.028.909 token) ve claude-sonnet-4-20250514 (%76,05 doğruluk, 135.462 token) onları takip eder.

Düşük performans gösterenler (<%70 doğruluk):

claude-3-5-sonnet-20241022 (%67,65 doğruluk, 90.103 token) ve gpt-oss-20b (%67,65 doğruluk, 515.041 token) bu kademenin başını çeker. gemini-2.5-flash (%65,55 doğruluk, 286.603 token), glm-4.5 (%64,29 doğruluk, 692.662 token) ve gpt-4.1-nano-2025-04-14 (%63,45 doğruluk, 171.096 token) onları takip eder.

Performans içgörüleri:

Token tüketimi doğrulukla paralel gitmez. deepseek-r1-0528, %62,18 doğrulukta en fazla token tüketirken (1.251.064), claude-opus-4-20250514, 132.274 token ile %80,25 elde etmiştir. Token verimliliği yüksek doğruluklu modeller arasında da farklılık gösterir: gemini-3-flash-preview 118.530 token ile %83,61'e ulaşırken, kimi-k2.5 %82,77 için 877.868 token harcar (0,84 puan daha az doğruluk için 7,4 kat token).

Yukarıdaki tablo, bu karşılaştırma testi için kullanılanlar da dahil olmak üzere diğer yapay zeka modeli karşılaştırma testlerini sunmaktadır.

Karşılaştırma testi çalıştırması başına maliyet

Çoğu sağlayıcıda girdi token ve çıktı token oranları bir mertebe farklılık gösterdiğinden, çıktı tokenları tek başına harcamayı belirlemez. Her modeli 238 soru üzerinde çalıştırmanın dolar maliyetini, çalıştırma anındaki sağlayıcının listelenmiş token başına oranını kullanarak hesapladık.

Üst düzey kademede en düşük maliyet: gemini-3-flash-preview, %83,61 doğruluk için $0,39 ile >%83 doğruluk bandındaki en düşük dolar maliyetine ulaşır. grok-4.3, %84,87 için $0,86 ile onu takip eder.

%90,34 kademesine daha düşük maliyetle ulaşılır: gpt-5.6-sol, claude-fable-5'in %90,34'ünü çalıştırma başına $3,85 ile eşitler (fable-5'in $10,05'ine karşı), fable-5'in maliyetinin %38'i ile. gpt-5.6-sol-pro, çalıştırma başına $16,35 ile karşılaştırma testinin en yüksek doğruluğu olan %90,76'yı kaydeder. claude-opus-4.8, %89,08 için $3,28 ile %88'i aşan en ucuz model olmaya devam eder.

Yüksek fiyata premium muhakeme: o1-pro, %80,67 doğruluk için $381 ile karşılaştırma testindeki en yüksek maliyetli modeldir ($150/M girdi ve $600/M çıktı oranlarından kaynaklanır). o3-pro, %78,15 için $39,23, o1 %74,79 için $46,59 maliyete sahiptir. Hiçbiri üst kademeyi geçemez ve üçü de claude-opus-4.7'nin doğruluk bakımından altında, maliyetinin 10 katından fazlasıyla yer alır.

Bütçe kademesi maliyet ve doğruluk: gpt-oss-120b, toplam $0,06 ile %81,09 doğruluğa ulaşarak karşılaştırma testindeki en ucuz çalıştırmayı yapar ve %83 eşiğinin 1,91 puan yakınındadır. llama-4-maverick, $0,10 ile %75,21'e ulaşır. %80 doğruluğun yeterli olduğu iş yükleri için, bu modeller üst düzey amiral gemilerinin %1'inden daha az maliyetlidir.

Finansal muhakeme karşılaştırma testi metodolojisi

Karşılaştırma testimiz, karmaşık finansal muhakeme görevlerinde LLM performansının şeffaf ve tekrarlanabilir bir değerlendirmesini sunar.

Test kurulumu ve veri külliyatı

  • Karşılaştırma testi takımı: Nicel ve çıkarımsal finansal problemlere odaklanması nedeniyle seçilen FinanceReasoning karşılaştırma testindeki veri, kod ve değerlendirme betiklerini kullandık.
  • Bilgi külliyatı ve test sorguları: Analizimizi, 238 zorlu sorudan oluşan zor alt kümeye odakladık. Karşılaştırma testinde tanımlandığı üzere, her veri noktası şunları içerir:
    1. Çok adımlı mantıksal ve sayısal çıkarım gerektiren bir soru.
    2. Genellikle Markdown tabloları gibi yapılandırılmış formatlarda sunulan yoğun bilgiler içeren bir bağlam (ör. bilançolar, hisse senedi performans verileri).
    3. Nesnel puanlama için kesin bir doğru cevap.
  • Açıklayıcı sorgu türleri: Karşılaştırma testinin zorluğu, modellerin çeşitli ve karmaşık finansal muhakeme görevlerini ele alma gerekliliğinden kaynaklanır. Bu genişliği göstermek için, test setinden iki temsili örnek sunuyoruz:

Örnek: Algoritmik ve zaman serisi muhakemesi (teknik analiz)

Bağlam: Bir yatırımcı, Keltner Kanalı'nı 10 günlük EMA periyodu ve 10 günlük ATR periyodu kullanarak, 1,5 çarpanıyla hesaplamak için son 25 gündeki hisse senedi fiyatlarını analiz etmektedir…

Soru: Keltner Kanalı'ndaki son üst bandın değeri nedir…? İki ondalık basamağa kadar cevaplayın.

Bu sorgu, bir modelin nicel bir analist olarak hareket etme becerisini şu yollarla test eder:

  1. Bileşik bir göstergenin ayrıştırılması: "Keltner Kanalı"nın diğer iki karmaşık göstergeden türetildiğinin farkına varmak:
    • Üstel hareketli ortalama (EMA)
    • Ortalama gerçek aralık (ATR).
  2. Algoritmik mantığın uygulanması: 25 veri noktasından oluşan bir zaman serisi üzerinde hem EMA hem de ATR için yinelemeli algoritmaların sıfırdan doğru şekilde uygulanması.
  3. Sonuçların sentezlenmesi: Hesaplanan değerlerin nihai Keltner Kanalı formülüne göre birleştirilmesi (Üst Bant = EMA + (Çarpan × ATR)).

Temel değerlendirme ilkeleri

  • Yalıtılmış ve standartlaştırılmış API çağrıları: Her model için, ilgili API uç noktaları aracılığıyla programlı olarak değerlendirme yaptık (ör. OpenRouter, OpenAI). Bu, her modelin tamamen aynı girdiyi özdeş koşullar altında almasını sağlayarak kullanıcı arayüzü etkileşimlerinden kaynaklanan değişkenliği ortadan kaldırdı.
  • Serbest biçimli üretim: Modelleri çoktan seçmeli bir formatla sınırlamadık. Bunun yerine, muhakeme yeteneklerinin daha özgün bir değerlendirmesine olanak tanıyan kapsamlı, serbest biçimli bir yanıt üretmeye yönlendirildiler.
  • Düşünce Zinciri (CoT) promptlaması: Modellerin muhakeme sürecini ortaya çıkarmak ve değerlendirmek için bir Düşünce Zinciri (CoT) promptlama stratejisi kullandık. Sistem promptu, her modele nihai bir cevapla sonuçlandırmadan önce "önce sorunu adım adım düşünmesini" açıkça belirtti. Bu yaklaşım, nihai çıktının ötesinde bir modelin sonucuna nasıl ulaştığına dair daha derin bir analiz sağlar.

Değerlendirme metrikleri ve çerçevesi

Model çıktılarını puanlamak için FinanceReasoning karşılaştırma testinin kendi tam otomatik değerlendirme çerçevesini kullandık. Bu çerçeve, hem kavramsal doğruluğu hem de hesaplama maliyetini ölçmek üzere tasarlanmıştır.

1. Birincil metrik: Doğruluk

Bu metrik şu kritik soruyu yanıtlar: "Model finansal problemi doğru şekilde çözebilir mi?" Puanlama süreci, iki aşamalı sofistike bir işlem hattı içerir:

  • Adım 1: LLM tabanlı cevap çıkarma: Bir modelin ham çıktısı, hem muhakeme hem de nihai cevabı içeren yapılandırılmamış metindir. Sayısal veya boolean değeri güvenilir bir şekilde ayrıştırmak için, ayrıştırıcı olarak bir denetleyici model (anthropic/claude-sonnet-4.5) kullandık.
  • Adım 2: Toleransa dayalı karşılaştırma: Sayısal problemler için basit bir "tam eşleşme" yetersizdir. Bu nedenle, çıkarılan cevap programlı olarak doğru cevapla karşılaştırıldı. Betik, küçük kayan nokta veya yuvarlama farklılıklarını adil bir şekilde ele almak için bir sayısal tolerans eşiği (%0,2 göreli fark) uygulayarak kavramsal olarak doğru çözümlerin doğru olarak işaretlenmesini sağlar.

2. İkincil metrik: Token tüketimi

Bu metrik şu soruyu yanıtlar: "Modelin bu problemleri çözmesi hesaplama açısından ne kadar maliyetlidir?" 238 cevabı üretmenin toplam maliyetini ölçer.

  • Token hesaplaması: Her API çağrısı için sağlayıcının kullanım nesnesinden prompt_tokens ve completion_tokens değerlerini topladık. Model başına token puanı, tüm 238 soru genelindeki completion_tokens toplamıdır. Tamamlama tokenlarını raporluyoruz (toplam tokenları değil), çünkü aynı veri kümesini paylaşan modeller arasında girdi neredeyse sabittir (tokenleştiriciye bağlı olarak çalıştırma başına 66 bin-92 bin girdi tokenı).
  • Maliyet hesaplaması: Dolar maliyetini, tüm 238 soru genelinde toplanarak prompt_tokens × prompt_price_per_M + completion_tokens × completion_price_per_M olarak hesapladık. Fiyatlar, model çalıştırıldığı sırada OpenRouter /api/v1/models uç noktasından alınan listelenmiş token başına oranlardır.

FinanceReasoning karşılaştırma testinin kendisi tarafından sağlanan bu iki metrikli yaklaşım, bir modelin ham problem çözme kapasitesini (doğruluk) operasyonel verimliliği (token tüketimi) ile dengeleyen bütünsel bir değerlendirmeye olanak tanır.

Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

Geri Getirme Destekli Üretim (RAG) ile finansal muhakeme

Bağımsız modelleri aşmak için, karşılaştırma testinin orijinal uygulamasından farklı özel bir RAG çerçevesi tasarladık ve uyguladık. Yaklaşımımız, çıkarım zamanında LLM'lere ilgili, alana özgü bilgi sağlamak ve eğitim verilerinin ötesindeki problemleri çözmelerine yardımcı olmak için modern bir vektör veritabanı yığını (Qdrant) üzerine inşa edilmiştir. Etkisini ölçmek için bunu gpt-4o-mini üzerinde test ettik.

Sonuçlar ve analiz: RAG ödünleşimi

RAG'ın kullanıma alınması, gpt-4o-mini'nin performansı üzerinde önemli ve ölçülebilir bir etki yarattı.

RAG değerlendirmesinden temel çıkarımlar:

  • Önemli doğruluk iyileşmesi: RAG, doğruluğu 10 yüzde puanından fazla artırarak modelin problem çözme kapasitesini belirgin şekilde geliştirdi. Bu, harici ve ilgili bağlam sağlamanın karmaşık, alana özgü muhakeme görevleri için son derece etkili olduğunu doğrular.
  • Doğruluğun maliyeti: Bu performans kazancı yüksek bir maliyetle geldi. Toplam token tüketimi yaklaşık 18 kat, toplam yürütme süresi ise 20 kat arttı. Bu, embedding için yapılan ek API çağrılarından ve daha da önemlisi, LLM'in işlemesi gereken çok daha büyük ve karmaşık promptlardan kaynaklanır.
  • Daha büyük modeller için çıkarımlar: gpt-4o-mini'den elde edilen sonuçlar, RAG'ın daha yüksek performansın kilidini açabilmesine rağmen, bu yöntemi GPT-4o veya Claude Opus gibi daha büyük, daha pahalı modellere uygulamanın önemli ölçüde daha maliyetli ve zaman alıcı olacağını göstermektedir. Bu, üretim düzeyinde finansal yapay zeka sistemleri tasarlamada doğruluk, maliyet ve gecikme arasındaki kritik ödünleşimi vurgular.

Finansal muhakeme RAG metodolojisi

RAG işlem hattımız, vektör veritabanı olarak Qdrant ve anlamsal vektör temsilleri oluşturmak için OpenAI'nin text-embedding-3-small modelini kullanan modern bir yığın üzerine inşa edilmiştir. Süreç iki ana aşamadan oluşur: çevrimdışı bir indeksleme aşaması ve çevrimiçi bir geri getirme-üretim aşaması.

1. Bilgi külliyatı indekslemesi

  • Külliyat oluşturma: Karşılaştırma testi tarafından sağlanan iki kaynaktan özel bir bilgi tabanı oluşturduk:
    1. Finansal belgeler: Çeşitli finansal kavramları ve terimleri açıklayan bir makale koleksiyonu (financial_documents.json).
    2. Finansal fonksiyonlar: Belirli finansal hesaplamaları çözmek için tasarlanmış kullanıma hazır Python fonksiyonlarından oluşan bir kütüphane (functions-article-all.json).
  • Akıllı parçalama ve embedding: Bu külliyatı verimli geri getirme için hazırlamak amacıyla, her belge ve fonksiyon işlendi ve indekslendi:
    1. Parçalama: Belgeler, bölümlerine göre daha küçük, anlamsal olarak tutarlı parçalara ayrıldı. Her Python fonksiyonu tek bir atomik parça olarak ele alındı. Bu, geri getirilen bağlamın odaklı ve ilgili olmasını sağlar.
    2. Embedding: Her parça daha sonra text-embedding-3-small modeli kullanılarak 1536 boyutlu bir vektöre dönüştürüldü.
    3. İndeksleme: Bu vektörler, kosinüs benzerlik araması için optimize edilmiş yerel Qdrant örneğimizdeki iki ayrı koleksiyona indekslendi (financial_documents_openai_small ve financial_functions_openai_small).

2. RAG destekli çıkarım

238 sorunun her biri için, modelin muhakeme süreci aşağıdaki otomatik adımlarla desteklendi:

  1. Embedding oluşturma (API çağrıları 1 ve 2): Kullanıcının sorgusu (soru + bağlam) bir embedding vektörüne dönüştürüldü. Bu, her iki koleksiyonda da arama yapmaya hazırlanmak için OpenAI'nin embedding API'sine iki çağrı gerektirdi.
  2. Çok kaynaklı geri getirme: Sorgu vektörü, en ilgili bilgileri almak için her iki Qdrant koleksiyonunda eşzamanlı olarak anlamsal arama yapmak için kullanıldı:
    • financial_documents koleksiyonundan en 3 en ilgili belge parçası.
    • financial_functions koleksiyonundan en 2 en ilgili Python fonksiyonu.
  3. Prompt zenginleştirme: Geri getirilen belgeler ve fonksiyonlar, zengin ve bağlam farkında bir "bilgi paketi" oluşturacak şekilde prompta dinamik olarak enjekte edildi. Bu, girdi prompt boyutunu önemli ölçüde artırdı (~300-500 tokenden ~3.000-5.000+ tokene).
  4. Nihai cevap üretimi (API çağrısı 3): Bu zenginleştirilmiş prompt, nihai ve gerekçeli cevabı üretmek için gpt-4o-mini modeline gönderildi.

Finans karşılaştırma testinde LLM'lerin sınırlılıkları

Karşılaştırmalı testimiz kapsamlı olmakla birlikte, birkaç temel sınırlılığa tabidir:

  • Veri bulaşması riski: Veri kümesi herkese açık olduğundan, bu modellerin karşılaştırma testinin veri kümesi üzerinde eğitilmiş olması mümkündür. Bu, şişirilmiş puanlara yol açarak gerçek muhakeme becerisinin değerlendirilmesini zorlaştırabilir.
  • Tek modelli RAG analizi: RAG değerlendirmesi tek bir model (gpt-4o-mini) üzerinde yapıldığından, performans ve maliyet arasındaki gözlemlenen ödünleşimler diğer tüm modeller için geçerli olmayabilir.

Sonuç

Karmaşık finansal muhakeme görevlerinde 40+ model üzerinde yaptığımız karşılaştırma testi şunları göstermektedir:

gpt-5.6-sol-pro, çalıştırma başına 385.886 token ve $16,35 ile karşılaştırma testinin en yüksek doğruluğu olan %90,76'ya ulaşır. gpt-5.6-sol ve claude-fable-5 %90,34'te eşitlenir.

gpt-5.6-sol, claude-fable-5'in %90,34'ünü çalıştırma başına $3,85 ile eşitler (fable-5'in $10,05'ine karşı), %90,34 doğruluk kademesindeki en düşük maliyet.

claude-opus-4.8, 113.434 token ile $3,28 karşılığında %89,08 elde ederek, gpt-5-2025-08-07'ın (%88,23) üzerinde, yaklaşık 7 kat daha az çıktı tokenı ve yarıdan az maliyetle ($3,28 karşısında $8,38) yer alır ve %88 doğruluk üzerindeki en ucuz model olmaya devam eder.

claude-opus-4.6 (%87,82, 164.369 token) ve gpt-5-mini-2025-08-07 (%87,39, 595.505 token) üst sıralara yakın doğruluk elde eder. gpt-5.6-terra, bu doğrulukta eşitlenen üç model arasında en düşük maliyetle $1,99 karşılığında %86,97'ye ulaşır.

gemini-3.1-pro-preview (%86,55), gemini-3-pro-preview'in (%86,13) üzerinde ve %35 daha az token ile yer alır, dolayısıyla yinelemeli güncellemeler hem doğruluğu hem de verimliliği artırabilir.

gemini-3-flash-preview, 118.530 token ile $0,39 karşılığında %83,61'e ulaşır ve gpt-5.2, 247.660 token ile %86,13'e ulaşır.

RAG, gpt-4o-mini'nin doğruluğunu 10,08 puan artırmış, bunun maliyeti 17,7 kat token ve 20 kat gecikme olmuştur.

Google Arama'da daha fazla kıyaslamamızı ve veri odaklı içgörülerimizi görün.
GoogleTercih edilen kaynak olarak ekle

Değişiklik günlüğü

Her yeni sürümle bu karşılaştırma testine modeller ekliyoruz.

10 Temmuz 2026

  • OpenAI: GPT-5.6 Sol (openai/gpt-5.6-sol)
  • OpenAI: GPT-5.6 Terra (openai/gpt-5.6-terra)
  • OpenAI: GPT-5.6 Sol Pro (openai/gpt-5.6-sol-pro)

30 Haziran 2026

  • Anthropic: Claude Sonnet 5 (anthropic/claude-sonnet-5)

22 Haziran 2026

  • Zhipu AI: GLM-5.2 (z-ai/glm-5.2)

10 Haziran 2026

  • Anthropic: Claude Fable 5 (anthropic/claude-fable-5)

2 Haziran 2026

  • Anthropic: Claude Opus 4.8 (anthropic/claude-opus-4.8)

22 Mayıs 2026

  • Google: Gemini 3.5 Flash (google/gemini-3.5-flash)
  • xAI: Grok 4.3 (x-ai/grok-4.3)
  • Karşılaştırma testi çalıştırması başına maliyet sütunu ve doğruluk-maliyet grafiği değiştirme düğmesi eklendi. Metodoloji, maliyet hesaplama formülü ve cevap çıkarıcı değişikliği (claude-sonnet-4.5) ile güncellendi

20 Nisan 2026

  • Anthropic: Claude Opus 4.7 (anthropic/claude-opus-4.7)

20 Şubat 2026

  • Google: Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview)
  • Anthropic: Claude Sonnet 4.6 (anthropic/claude-sonnet-4.6)

6 Şubat 2026

  • Anthropic: Claude Opus 4.6 (anthropic/claude-opus-4.6)
  • Anthropic: Claude Opus 4.5 (anthropic/claude-opus-4.5)
  • Anthropic: Claude Sonnet 4.5 (anthropic/claude-sonnet-4.5)
  • Google: Gemini 3 Pro Preview (google/gemini-3-pro-preview)
  • Google: Gemini 3 Flash Preview (google/gemini-3-flash-preview)
  • OpenAI: GPT-5.2 (openai/gpt-5.2)
  • Moonshot AI: Kimi K2.5 (moonshotai/kimi-k2.5)

İleri okuma

Finansal analiz, hisse senedi analizi, finans hukuku yorumlaması ve finansal muhakeme gibi birden fazla yeteneğe atıfta bulunabilir. Karşılaştırma testimizde özellikle finansal muhakemeye odaklandık, diğer görevler ayrı makalelerde ele alınmıştır:

  • Hisse senedi analizi için LLM: Bu modeller, yatırım fırsatlarını belirlemek için piyasa verilerini, şirket raporlarını ve haberleri işlemeye yardımcı olur. (Tam analizi burada görebilirsiniz: Yapay Zeka Tabanlı Hisse Senedi Ticareti)
  • Finans hukuku yapay zekası: Bazı LLM'ler, hukuki-finans görevlerine yardımcı olmak için finansal düzenlemeleri, sözleşmeleri ve uyumluluk gerekliliklerini yorumlayabilir. (Hukuki yapay zeka araçları listemizi burada görebilirsiniz: Hukuki Yapay Zeka Araçları)

SSS'ler

Finansta bir LLM (büyük dil modeli), karmaşık finansal analiz, uyumluluk yönetimi ve belge anlama işlemlerini gerçekleştirmek için doğal dil işleme tekniklerini kullanan bir yapay zeka modelidir. Bu modeller, finansal kurumların finans hukuku, düzenleyici gereklilikler ve finans sektörünün dinamik talepleriyle başa çıkmasına yardımcı olur.

Akıllı sohbet robotları:
LLM destekli sanal asistanlar, finansal firmaların rutin sorguları ve katılım görevlerini insan müdahalesi olmadan ele alarak otomatik, 7/24 müşteri desteği sunmasını sağlar. Bu, bekleme sürelerini azaltır ve müşteri memnuniyetini artırırken insan temsilcileri karmaşık sorunlar için serbest bırakır.

Danışmanlık ve analiz:
Yatırım bankaları, piyasa trendlerini, finansal haberleri ve müşteri verilerini analiz etmek için LLM'leri kullanır. Bu modeller, büyük hacimli yapılandırılmamış bilgiyi sindirerek danışmanların gerçek zamanlı içgörülerle kişiselleştirilmiş yatırım tavsiyesi ve portföy yönetimi sunmasını sağlar.

Düzenleyici belge analizi:
Hukuk firmaları ve finansal kurumlar, SEC başvuruları gibi yoğun düzenleyici belgeleri işlemek için LLM'leri kullanır. Bu modeller, temel bilgileri çıkarır ve raporları özetleyerek manuel inceleme süresini azaltır ve firmaların gelişen düzenlemelere uyumlu kalmasına yardımcı olur.

Dolandırıcılık tespiti:
LLM'ler, şüpheli işlem desenlerini ve ortaya çıkan dolandırıcılık taktiklerini tespit etmek için büyük finansal veri kümelerini gerçek zamanlı olarak analiz eder. Sürekli öğrenme yetenekleri, geleneksel yöntemlerden daha hızlı ve daha doğru dolandırıcılık tespiti sağlar.

Hukuki ve uyumluluk otomasyonu:
Hukuk firmaları ve uyumluluk ekipleri, sözleşmeleri incelemek, bankacılık yasalarını yorumlamak ve düzenleyici uyumluluğu doğrulamak için LLM'leri kullanır. Bu görevlerin otomatikleştirilmesi, karmaşık finansal düzenlemelere uyumu sağlarken inceleme süresini ve hukuki maliyetleri azaltır.

Belge Soru-Cevap ve Varlık İsmi Tanıma (NER):
Finansal kurumlar, finansal raporlardan ve kazanç görüşmelerinden veri çıkararak yatırımcıların sorularını yanıtlamak için LLM'leri devreye alır. NER, şirket adlarının, hisse senedi sembollerinin (sınıf ticaret sembolleri) ve düzenleyici kurumların otomatik olarak etiketlenmesini sağlayarak veri alımını kolaylaştırır.

Verimlilik ve otomasyon: LLM'ler, rutin analizleri otomatikleştirir (ör. kazanç raporlarını özetleme, kredileri veya başvuruları işleme), analist saatlerinden tasarruf sağlar ve hataları azaltır.

7/24 müşteri hizmeti: LLM'ler tarafından desteklenen yapay zeka sanal asistanları ve sohbet robotları, müşteri sorgularını günün her saati sohbete dayalı yanıtlarla ele alarak müşteri deneyimini ve memnuniyetini artırabilir.

Kişiselleştirilmiş finansal tavsiye: Bir müşterinin geçmişini ve risk profilini analiz ederek, LLM'ler kişiye özel finansal veya yatırım tavsiyesi sunar.

Dolandırıcılık tespiti ve risk yönetimi: LLM'ler, anormallikleri veya dolandırıcılık desenlerini tespit etmek için büyük işlem veri kümelerini tarar, yeni dolandırıcılık taktiklerine uyum sağlar ve risk profilleri oluşturmaya yardımcı olur.

Uyumluluk ve raporlama: LLM'ler otomatik olarak düzenleyici raporlar taslağı oluşturur, politikayla ilgili olguları çıkarır ve uyumluluk için karmaşık finans hukuku ve düzenlemelerinin ayrıştırılmasına yardımcı olur.

Evet, finans için alana özgü daha büyük modeller mevcuttur. Örneğin, BloombergGPT; ulusal menkul kıymetler borsası belgeleri ve düzenleyici başvurular dahil olmak üzere büyük finansal veri kümelerini işleyerek finansal düzenleme, sermaye piyasaları ve uyumluluk yönetimine yardımcı olmak üzere tasarlanmıştır.

FinBERT ve FinGPT gibi diğer modeller, büyük dil modellerini sınıf ticaret sembolleri ve düzenleyici metinler gibi finansın özel söz dağarcığına uyarlayarak finans hukuku, uluslararası bankacılık hukuku ve kişiselleştirilmiş finansal tavsiyeye odaklanır.

Finansal muhakeme, bilinçli iş veya yatırım kararları almak için finansal verileri analiz etme becerisidir.

Başlıca görevler şunlardır:
– Finansal tabloları analiz etme (kâr, nakit akışı, bilanço)
– Bütçeleme ve tahminleme
– Yatırımları değerlendirme (NBD, İKO, ROI)
– Nakit akışı ve likiditeyi yönetme
– Finansal riskleri ve performans oranlarını değerlendirme

Bu benchmarkı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Ekrem Sarı (2026) - "Finans Alanında 40+ LLM Karşılaştırması: Claude Fable 5 ve GPT-5.6 Sol". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 10 Temmuz 2026, kaynak: https://aimultiple.com/finance-llm [Çevrimiçi Kaynak]

Sarı, E. (2026, 10 Temmuz). Finans Alanında 40+ LLM Karşılaştırması: Claude Fable 5 ve GPT-5.6 Sol. AIMultiple. https://aimultiple.com/finance-llm

@misc{sari2026,
  author = {Sarı, Ekrem},
  title  = {{Finans Alanında 40+ LLM Karşılaştırması: Claude Fable 5 ve GPT-5.6 Sol}},
  year   = {2026},
  month  = jul,
  howpublished    = {\url{https://aimultiple.com/finance-llm}},
  note   = {AIMultiple. Erişim tarihi: 10 Temmuz 2026}
}
Tüm verileri indir

52 veri noktasının sonuçları ve zaman damgaları. Bu makalede kullanılan verileri, bir CSV dosyası ve bir README içeren ZIP dosyası olarak indirin.

Son güncelleme: 6 Temmuz 2026
İndir
Ekrem Sarı
Ekrem Sarı
Yapay Zeka Araştırmacısı
Ekrem, AIMultiple'da yapay zeka araştırmacısı olarak çalışmakta olup, akıllı otomasyon, GPU'lar, yapay zeka ajanları ve RAG çerçeveleri üzerine yoğunlaşmaktadır.
Tam Profili Görüntüle

Yorum yapan ilk kişi olun

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450