Premium
Servicios
Premium

Benchmark de 40+ LLMs en finanzas: Claude Fable 5 y GPT-5.6 Sol

We evaluated 40+ LLMs in finance on 238 hard questions from the FinanceReasoning benchmark to identify which models excel at complex financial reasoning tasks.

Ekrem Sarı
Ekrem Sarı
actualizado el 24 de sept. de 2026
Cargando gráfico

Evaluamos LLMs en 238 preguntas difíciles del benchmark FinanceReasoning (Tang et al.).1 Este subconjunto aborda las tareas de razonamiento financiero más desafiantes, evaluando razonamiento cuantitativo complejo de múltiples pasos que implica conceptos y fórmulas financieras. Nuestra evaluación empleó un diseño de prompt personalizado y criterios de puntuación de exactitud y consumo de tokens.

Para una explicación detallada de cómo se calcularon estas métricas y del framework utilizado para esta evaluación, consulte nuestra metodología del benchmark financiero.

Resultados: ¿Cuál es el mejor LLM para finanzas?

Rendimiento de nivel superior (>83 % de exactitud):

gpt-5.6-sol-pro alcanza la exactitud más alta del benchmark con un 90,76 % con 385.886 tokens a $16,35 por ejecución, 0.42 puntos por encima de gpt-5.6-sol.

gpt-5.6-sol obtiene un 90,34 % de exactitud con 117.735 tokens a $3,85 por ejecución. Empata con claude-fable-5 (90,34 %) en la segunda exactitud más alta, a $3,85 frente a los $10,05 de fable-5 y 117.735 tokens frente a 183.258. Ningún model con una exactitud igual o superior se ejecuta a un coste menor.

claude-fable-5 obtiene un 90,34 % de exactitud con 183.258 tokens. Fue el primer model en superar el 90 % en este benchmark (10 de junio) y empata con gpt-5.6-sol en el 90,34 %, a $10,05 por ejecución frente a los $3,85 de gpt-5.6-sol.

claude-opus-4.8 obtiene un 89,08 % de exactitud con 113.434 tokens, el tercer resultado con coste más alto y el menor número de tokens de salida entre los models con más del 88 %.

gpt-5-2025-08-07 obtiene un 88,23 % de exactitud con 829.720 tokens.

claude-opus-4.6 obtiene un 87,82 % de exactitud con 164.369 tokens, una exactitud casi máxima con el 20 % del número de tokens de gpt-5.

gpt-5-mini-2025-08-07 alcanza un 87,39 % de exactitud con 595.505 tokens.

gemini-3.5-flash alcanza un 86,97 % de exactitud con 1.191.757 tokens, la exactitud más alta de la línea Flash de Google y el mayor consumidor de tokens de la familia.

claude-sonnet-5 obtiene un 86,97 % de exactitud con 414.668 tokens. Iguala a gemini-3.5-flash hasta el decimal mientras gasta 414.668 tokens frente a 1.191.757, a $4,33 por ejecución frente a $10.83.

gpt-5.6-terra obtiene un 86,97 % de exactitud con 121.936 tokens a $1,99 por ejecución. Se une a claude-sonnet-5 y a gemini-3.5-flash en el 86,97 %, con el menor número de tokens y coste de los tres (121.936 tokens y $1,99, frente a 414.668 / $4,33 y 1.191.757 / $10,83). gpt-5-mini-2025-08-07 sigue siendo más barato y más exacto ($1,21, 87,39 %).

gemini-3.1-pro-preview obtiene un 86,55 % de exactitud con 475.148 tokens, por encima de su predecesor gemini-3-pro-preview (86,13 %) con un 35 % menos de tokens (730.759 tokens).

glm-5.2 obtiene un 86,13 % de exactitud con 735.988 tokens. Mejora a glm-4.5 (64,29 %) en 21.84 puntos, el mayor salto entre dos versiones de una misma familia de models en el benchmark. El siguiente mayor es de 3.79 puntos.

gemini-3-pro-preview y gpt-5.2 empatan con un 86,13 % de exactitud. gpt-5.2 lo alcanza con 247.660 tokens, aproximadamente tres veces menos tokens de salida que gemini-3-pro-preview con 730.759 tokens.

claude-opus-4.7 obtiene un 85,29 % de exactitud con 103.268 tokens, el model con mayor eficiencia de tokens del nivel superior (37 % menos tokens de salida que claude-opus-4.6 superando el umbral del 83 %).

Rendimiento sólido (80-83 % de exactitud):

grok-4.3 alcanza un 84,87 % de exactitud con 309.781 tokens, el resultado más sólido de xAI en el benchmark y una recuperación respecto al anterior grok-4-0709.

claude-opus-4.5 obtiene un 84,03 % de exactitud con 144.505 tokens.

claude-sonnet-4.6 y gemini-3-flash-preview empatan con un 83,61 % de exactitud. Claude Sonnet 4.6 usa 161.035 tokens, mientras que Gemini 3 Flash Preview lo alcanza con 118.530 tokens, el menor número de tokens entre los models con más del 83 %.

kimi-k2.5 obtiene un 82,77 % de exactitud con 877.868 tokens, el mayor consumo de este nivel de rendimiento.

Nivel intermedio (70-80 % de exactitud):

o3-pro-2025-06-10 (78,15 % de exactitud, 473.659 tokens) y kimi-k2 (78,15 % de exactitud, 100.323 tokens) empatan, y kimi-k2 usa un 79 % menos de tokens. Le siguen o3-mini-2025-01-31 (77,31 % de exactitud, 376.929 tokens), gpt-5-nano-2025-08-07 (76,89 % de exactitud, 1.028.909 tokens) y claude-sonnet-4-20250514 (76,05 % de exactitud, 135.462 tokens).

Rendimiento bajo (<70 % de exactitud):

claude-3-5-sonnet-20241022 (67,65 % de exactitud, 90.103 tokens) y gpt-oss-20b (67,65 % de exactitud, 515.041 tokens) lideran este nivel. Le siguen gemini-2.5-flash (65,55 % de exactitud, 286.603 tokens), glm-4.5 (64,29 % de exactitud, 692.662 tokens) y gpt-4.1-nano-2025-04-14 (63,45 % de exactitud, 171.096 tokens).

Conclusiones sobre el rendimiento:

El consumo de tokens no se corresponde con la exactitud. deepseek-r1-0528 consumió la mayor cantidad de tokens (1.251.064) con un 62,18 % de exactitud, mientras que claude-opus-4-20250514 obtuvo un 80,25 % con 132.274 tokens. La eficiencia de tokens también varía entre los models de alta exactitud: gemini-3-flash-preview alcanza un 83,61 % con 118.530 tokens, mientras que kimi-k2.5 gasta 877.868 tokens para un 82,77 % (7.4x los tokens para 0.84 puntos menos de exactitud).

La tabla anterior presenta otros benchmarks de models de IA, incluidos los utilizados para este benchmark.

Coste por ejecución del benchmark

Los tokens de salida por sí solos no determinan el gasto, ya que las tarifas de tokens de entrada y de salida difieren en un orden de magnitud en la mayoría de los proveedores. Calculamos el coste en dólares de ejecutar cada model en las 238 preguntas utilizando la tarifa por token indicada por el proveedor en el momento de la ejecución.

Coste más bajo en el nivel frontera: gemini-3-flash-preview alcanza un 83,61 % de exactitud por $0,39, el coste en dólares más bajo de la franja de exactitud superior al >83 %. grok-4.3 le sigue con $0,86 para un 84,87 %.

El nivel del 90,34 % se alcanza a un coste menor: gpt-5.6-sol iguala el 90,34 % de claude-fable-5 a $3,85 por ejecución frente a los $10,05 de fable-5, es decir, al 38 % del coste de fable-5. gpt-5.6-sol-pro registra la exactitud más alta del benchmark, 90,76 %, a $16,35 por ejecución. claude-opus-4.8 sigue siendo el model más barato que supera el 88 %, a $3,28 para un 89,08 %.

Razonamiento premium a precio premium: o1-pro es el model de mayor coste del benchmark con $381 para un 80,67 % de exactitud (impulsado por tarifas de $150/M de entrada y $600/M de salida). o3-pro cuesta $39,23 para un 78,15 %, o1 cuesta $46,59 para un 74,79 %. Ninguno supera el nivel superior y los tres quedan por debajo de claude-opus-4.7 en exactitud a más de 10x su coste.

Coste y exactitud del nivel económico: gpt-oss-120b alcanza un 81,09 % de exactitud por $0,06 en total, la ejecución más barata del benchmark, a 1.91 puntos del umbral del 83 %. llama-4-maverick alcanza un 75,21 % por $0.10. Para cargas de trabajo donde basta un 80 % de exactitud, estos models cuestan menos del 1 % de los buques insignia de vanguardia.

Tabla completa de resultados de LLM financieros

La siguiente tabla enumera todos los models del benchmark con su exactitud medida, tokens de salida y coste por ejecución, además del coste de una respuesta correcta.

Metodología del benchmark de razonamiento financiero

Nuestro benchmark proporciona una evaluación transparente y reproducible del rendimiento de los LLM en tareas complejas de razonamiento financiero.

Configuración de la prueba y corpus de datos

  • Suite de benchmark: Usamos los datos, el código y los scripts de evaluación del benchmark FinanceReasoning, seleccionado por su enfoque en problemas financieros cuantitativos e inferenciales.
  • Corpus de conocimiento y consultas de prueba: Centramos nuestro análisis en el subconjunto difícil, que comprende 238 preguntas desafiantes. Tal como define el benchmark, cada punto de datos incluye:
    1. Una pregunta que requiere deducción lógica y numérica de varios pasos.
    2. Un contexto, que a menudo contiene información densa presentada en formatos estructurados como tablas Markdown (por ejemplo, balances, datos de rendimiento bursátil).
    3. Una respuesta de referencia definitiva para una puntuación objetiva.
  • Tipos de consultas ilustrativas: La dificultad del benchmark proviene de su exigencia de que los models manejen tareas de razonamiento financiero diversas y complejas. Para ilustrar esta amplitud, destacamos dos ejemplos representativos del conjunto de prueba:

Ejemplo: Razonamiento algorítmico y de series temporales (análisis técnico)

Contexto: Un inversor está analizando… los precios de las acciones durante los últimos 25 días… para calcular el Canal de Keltner utilizando un período EMA de 10 días y un período ATR de 10 días, con un multiplicador de 1.5…

Pregunta: ¿Cuál es el valor de la última banda superior del Canal de Keltner…? Responda con dos decimales.

Esta consulta evalúa la capacidad de un model para actuar como analista cuantitativo mediante:

  1. Descomponer un indicador compuesto: Reconocer que el “Canal de Keltner” se deriva de otros dos indicadores complejos:
    • La media móvil exponencial (EMA)
    • El rango verdadero promedio (ATR).
  2. Implementar la lógica algorítmica: Implementar correctamente los algoritmos iterativos tanto de la EMA como del ATR desde cero sobre una serie temporal de 25 puntos de datos.
  3. Sintetizar los resultados: Combinar los valores calculados según la fórmula final del Canal de Keltner (Banda superior = EMA + (Multiplicador × ATR)).

Principios básicos de evaluación

  • Llamadas API aisladas y estandarizadas: Para cada model, realizamos la evaluación de forma programática a través de sus respectivos endpoints de API (p. ej., OpenRouter, OpenAI). Esto garantizó que cada model recibiera exactamente la misma entrada en condiciones idénticas, eliminando la variabilidad de las interacciones con la interfaz.
  • Generación libre: No limitamos los models a un formato de opción múltiple. En su lugar, se les pidió que generaran una respuesta completa y de forma libre, lo que permite una evaluación más auténtica de sus capacidades de razonamiento.
  • Prompting de cadena de pensamiento (CoT): Para provocar y evaluar el proceso de razonamiento de los models, empleamos una estrategia de prompting de cadena de pensamiento (CoT). El prompt de sistema indicó explícitamente a cada model que “primero pensara en el problema paso a paso” antes de concluir con una respuesta final. Este enfoque permite un análisis más profundo de cómo un model llega a su conclusión, más allá de la salida final.

Métricas de evaluación y framework

Utilizamos el framework de evaluación totalmente automatizado del benchmark FinanceReasoning para puntuar las salidas de los models. Este framework está diseñado para medir tanto la corrección conceptual como el coste computacional.

1. Métrica principal: Exactitud

Esta métrica responde a la pregunta crítica: «¿Puede el model resolver correctamente el problema financiero?». El proceso de puntuación implica un pipeline sofisticado de dos pasos:

  • Paso 1: Extracción de respuestas basada en LLM: La salida bruta de un model es texto no estructurado que contiene tanto el razonamiento como una respuesta final. Para analizar de forma fiable el valor numérico o booleano, utilizamos un model supervisor (anthropic/claude-sonnet-4.5) como analizador.
  • Paso 2: Comparación basada en tolerancia: Una simple «coincidencia exacta» es insuficiente para problemas numéricos. Por lo tanto, la respuesta extraída se comparó programáticamente con la verdad de referencia. El script aplica un umbral de tolerancia numérica (una diferencia relativa del 0,2 %) para manejar de forma justa pequeñas variaciones de coma flotante o redondeo, garantizando que las soluciones conceptualmente sólidas se marquen como correctas.

2. Métrica secundaria: Consumo de tokens

Esta métrica responde a la pregunta: «¿Cuán costoso computacionalmente es para el model resolver estos problemas?». Mide el coste total asociado a la generación de las 238 respuestas.

  • Cálculo de tokens: Para cada llamada a la API recopilamos prompt_tokens y completion_tokens del objeto de uso del proveedor. La puntuación de tokens por model es la suma de los completion_tokens en todas las 238 preguntas. Informamos de los tokens de finalización (no de los tokens totales) porque la entrada es casi constante entre los models que comparten el mismo dataset (66k-92k tokens de entrada por ejecución según el tokenizador).
  • Cálculo del coste: Calculamos el coste en dólares como prompt_tokens × prompt_price_per_M + completion_tokens × completion_price_per_M, sumado en todas las 238 preguntas. Los precios son las tarifas por token indicadas en el endpoint /api/v1/models de OpenRouter en el momento en que se ejecutó el model.

Este enfoque de dos métricas, proporcionado por el propio benchmark FinanceReasoning, permite una evaluación holística que equilibra la capacidad bruta de resolución de problemas de un model (exactitud) con su eficiencia operativa (consumo de tokens).

Deja que nuestro equipo automatice uno de tus procesos de negocio con agentes de IA, sin coste alguno.
Automatizar un proceso

Razonamiento financiero con generación aumentada por recuperación (RAG)

Para superar a los models independientes, diseñamos e implementamos un RAG framework personalizado distinto de la implementación original del benchmark. Nuestro enfoque se basa en una pila moderna de bases de datos vectoriales (Qdrant) para suministrar a los LLMs conocimiento relevante y específico del dominio en el momento de la inferencia, ayudándolos a resolver problemas más allá de sus datos de entrenamiento. Lo probamos en gpt-4o-mini para medir su impacto.

Resultados y análisis: el equilibrio de RAG

La introducción de RAG tuvo un impacto significativo y medible en el rendimiento de gpt-4o-mini.

Conclusiones clave de la evaluación de RAG:

  • Mejora significativa de la exactitud: RAG mejoró de forma demostrable la capacidad de resolución de problemas del model, aumentando la exactitud en más de 10 puntos porcentuales. Esto confirma que proporcionar contexto externo y relevante es muy eficaz para tareas de razonamiento complejas y específicas del dominio.
  • El coste de la exactitud: Esta mejora de rendimiento tuvo un coste elevado. El consumo total de tokens aumentó casi x18 y el tiempo total de ejecución aumentó x20. Esto se debe a las llamadas adicionales a la API para la generación de embeddings y, sobre todo, a los prompts mucho más grandes y complejos que el LLM debe procesar.
  • Implicaciones para models más grandes: Los resultados de gpt-4o-mini sugieren que, si bien RAG puede desbloquear un mayor rendimiento, aplicar este método a models más grandes y costosos como GPT-4o o Claude Opus será sustancialmente más costoso y lento. Esto pone de relieve el equilibrio crítico entre exactitud, coste y latencia en el diseño de sistemas de IA financieros de grado de producción.

Metodología de RAG para razonamiento financiero

Nuestro pipeline de RAG se basa en una pila moderna que utiliza Qdrant como base de datos vectorial y el model text-embedding-3-small de OpenAI para generar representaciones vectoriales semánticas. El proceso consta de dos fases principales: una fase de indexación fuera de línea y una fase de recuperación-generación en línea.

1. Indexación del corpus de conocimiento

  • Creación del corpus: Curamos una base de conocimiento especializada a partir de dos fuentes proporcionadas por el benchmark:
    1. Documentos financieros: Una colección de artículos (financial_documents.json) que explican diversos conceptos y términos financieros.
    2. Funciones financieras: Una biblioteca de funciones Python listas para usar (functions-article-all.json) diseñadas para resolver cálculos financieros específicos.
  • Segmentación inteligente e embedding: Para preparar este corpus para una recuperación eficiente, se procesó e indexó cada documento y función:
    1. Segmentación: Los documentos se dividieron en fragmentos más pequeños y semánticamente coherentes según sus secciones. Cada función Python se trató como un único fragmento atómico. Esto garantiza que el contexto recuperado sea centrado y relevante.
    2. Embedding: A continuación, cada fragmento se convirtió en un vector de 1536 dimensiones utilizando el model text-embedding-3-small.
    3. Indexación: Estos vectores se indexaron en dos colecciones separadas dentro de nuestra instancia local de Qdrant (financial_documents_openai_small y financial_functions_openai_small), optimizadas para la búsqueda por similitud coseno.

2. Inferencia potenciada por RAG

Para cada una de las 238 preguntas, el proceso de razonamiento del model se aumentó con los siguientes pasos automatizados:

  1. Generación de embeddings (llamadas API 1 y 2): La consulta del usuario (pregunta + contexto) se convirtió en un vector de embedding. Esto requirió dos llamadas a la API de embedding de OpenAI para preparar las búsquedas en ambas colecciones.
  2. Recuperación de múltiples fuentes: El vector de consulta se utilizó para realizar una búsqueda semántica simultánea en ambas colecciones de Qdrant y recuperar la información más relevante:
    • Los 3 fragmentos de documento más relevantes de la colección financial_documents.
    • Las 2 funciones Python más relevantes de la colección financial_functions.
  3. Aumento del prompt: Los documentos y funciones recuperados se inyectaron dinámicamente en el prompt, creando un “paquete de información” rico y consciente del contexto. Esto aumentó significativamente el tamaño del prompt de entrada (de ~300-500 tokens a ~3.000-5.000+ tokens).
  4. Generación de la respuesta final (llamada API 3): Este prompt aumentado se envió al model gpt-4o-mini para generar la respuesta final razonada.

Limitaciones del benchmark de LLMs en finanzas

Nuestro benchmark, aunque exhaustivo, está sujeto a varias limitaciones clave:

  • Riesgo de contaminación de datos: Es posible que estos models se hayan entrenado con el dataset del benchmark, ya que el dataset es público. Esto podría inflar las puntuaciones y dificultar la evaluación de la verdadera capacidad de razonamiento.
  • Análisis de RAG en un único model: La evaluación de RAG se realizó en un solo model (gpt-4o-mini), por lo que los equilibrios observados entre rendimiento y coste pueden no aplicarse a todos los demás models.

Conclusión

Nuestro benchmark de 40+ models en tareas complejas de razonamiento financiero muestra lo siguiente:

gpt-5.6-sol-pro alcanza la exactitud más alta del benchmark con un 90,76 % y 385.886 tokens a $16,35 por ejecución. gpt-5.6-sol y claude-fable-5 empatan con un 90,34 %.

gpt-5.6-sol iguala el 90,34 % de claude-fable-5 a $3,85 por ejecución frente a los $10,05 de fable-5, el coste más bajo del nivel de exactitud del 90,34 %.

claude-opus-4.8 obtiene un 89,08 % con 113.434 tokens por $3,28, por encima de gpt-5-2025-08-07 (88,23 %) con aproximadamente 7x menos tokens de salida y menos de la mitad del coste ($3,28 frente a $8,38), y sigue siendo el model más barato por encima del 88 % de exactitud.

claude-opus-4.6 (87,82 %, 164.369 tokens) y gpt-5-mini-2025-08-07 (87,39 %, 595.505 tokens) alcanzan una exactitud casi máxima. gpt-5.6-terra alcanza un 86,97 % por $1,99, el coste más bajo entre los tres models empatados en esa exactitud.

gemini-3.1-pro-preview (86,55 %) está por encima de gemini-3-pro-preview (86,13 %) con un 35 % menos de tokens, por lo que las actualizaciones iterativas pueden mejorar tanto la exactitud como la eficiencia.

gemini-3-flash-preview alcanza un 83,61 % con 118.530 tokens por $0,39, y gpt-5.2 alcanza un 86,13 % con 247.660 tokens.

RAG aumentó la exactitud de gpt-4o-mini en 10.08 puntos a costa de 17.7x los tokens y 20x la latencia.

No te pierdas nuestros análisis comparativos e insights basados en datos. El botón abre Google; seleccionar AIMultiple confirma que deseas ver AIMultiple con más frecuencia en los resultados de búsqueda de Google.
GoogleAñadir como fuente preferida

Registro de cambios

Añadimos models a este benchmark con cada nueva versión.

9 de septiembre de 2026

  • OpenAI: GPT-6 Astra (openai/gpt-6-astra).
  • Anthropic: Claude Fable 5.1 (anthropic/claude-fable-5.1)

10 de julio de 2026

  • OpenAI: GPT-5.6 Sol (openai/gpt-5.6-sol)
  • OpenAI: GPT-5.6 Terra (openai/gpt-5.6-terra)
  • OpenAI: GPT-5.6 Sol Pro (openai/gpt-5.6-sol-pro)

30 de junio de 2026

  • Anthropic: Claude Sonnet 5 (anthropic/claude-sonnet-5)

22 de junio de 2026

  • Zhipu IA: GLM-5.2 (z-ai/glm-5.2)

10 de junio de 2026

  • Anthropic: Claude Fable 5 (anthropic/claude-fable-5)

2 de junio de 2026

  • Anthropic: Claude Opus 4.8 (anthropic/claude-opus-4.8)

22 de mayo de 2026

  • Google: Gemini 3.5 Flash (google/gemini-3.5-flash)
  • xAI: Grok 4.3 (x-ai/grok-4.3)
  • Añadida la columna de coste por ejecución del benchmark y el conmutador del gráfico exactitud frente a coste. Metodología actualizada con la fórmula de cálculo del coste y el cambio del extractor de respuestas (claude-sonnet-4.5)

20 de abril de 2026

  • Anthropic: Claude Opus 4.7 (anthropic/claude-opus-4.7)

20 de febrero de 2026

  • Google: Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview)
  • Anthropic: Claude Sonnet 4.6 (anthropic/claude-sonnet-4.6)

6 de febrero de 2026

  • Anthropic: Claude Opus 4.6 (anthropic/claude-opus-4.6)
  • Anthropic: Claude Opus 4.5 (anthropic/claude-opus-4.5)
  • Anthropic: Claude Sonnet 4.5 (anthropic/claude-sonnet-4.5)
  • Google: Gemini 3 Pro Preview (google/gemini-3-pro-preview)
  • Google: Gemini 3 Flash Preview (google/gemini-3-flash-preview)
  • OpenAI: GPT-5.2 (openai/gpt-5.2)
  • Moonshot IA: Kimi K2.5 (moonshotai/kimi-k2.5)

Lecturas adicionales

El análisis financiero puede referirse a múltiples capacidades, como el análisis bursátil, la interpretación del derecho financiero y el razonamiento financiero. En nuestro benchmark nos centramos específicamente en el razonamiento financiero, mientras que otras tareas se tratan en artículos separados:

  • LLM para el análisis bursátil: Estos models ayudan a procesar datos de mercado, informes de empresas y noticias para identificar oportunidades de inversión. (Consulte el análisis completo aquí: IA-based Stock Trading)
  • IA para derecho financiero: Algunos LLMs pueden interpretar regulaciones financieras, contratos y requisitos de cumplimiento para ayudar en tareas jurídico-financieras. (Consulte nuestra lista de herramientas de IA jurídica aquí: Legal IA Tools)

Preguntas frecuentes

Un LLM (large language model) en finanzas es un model de IA que utiliza técnicas de procesamiento del lenguaje natural para realizar análisis financieros complejos, gestión del cumplimiento y comprensión de documentos. Estos models ayudan a las instituciones financieras a navegar por el derecho financiero, los requisitos regulatorios y las demandas dinámicas de la industria financiera.

Chatbots inteligentes:
Los asistentes virtuales basados en LLM permiten a las empresas financieras ofrecer soporte al cliente automatizado 24/7 gestionando consultas rutinarias y tareas de incorporación sin intervención humana. Esto reduce los tiempos de espera y mejora la satisfacción del cliente, al tiempo que libera a los agentes humanos para cuestiones complejas.

Asesoramiento y análisis:
Los bancos de inversión utilizan LLMs para analizar tendencias del mercado, noticias financieras y datos de clientes. Estos models digieren grandes volúmenes de información no estructurada, lo que permite a los asesores ofrecer asesoramiento de inversión personalizado y gestión de carteras con información en tiempo real.

Análisis de documentos regulatorios:
Los despachos de abogados y las instituciones financieras emplean LLMs para procesar documentos regulatorios densos, como las presentaciones ante la SEC. Estos models extraen información clave y resumen informes, lo que reduce el tiempo de revisión manual y ayuda a las empresas a cumplir con normativas en evolución

Detección de fraude:
Los LLMs analizan vastos datasets financieros en tiempo real para detectar patrones de transacciones sospechosas y tácticas de fraude emergentes. Su capacidad de aprendizaje continuo permite una identificación del fraude más rápida y precisa que con los métodos tradicionales.

Automatización legal y de cumplimiento:
Los despachos de abogados y los equipos de cumplimiento utilizan LLMs para revisar contratos, interpretar leyes bancarias y verificar el cumplimiento normativo. La automatización de estas tareas reduce el tiempo de revisión y los costes legales, al tiempo que garantiza el cumplimiento de normativas financieras complejas.

Preguntas y respuestas sobre documentos y reconocimiento de entidades nombradas (NER):
Las instituciones financieras despliegan LLMs para responder preguntas de los inversores extrayendo datos de informes financieros y llamadas de resultados. NER permite el etiquetado automático de nombres de empresas, tickers bursátiles (símbolos de negociación de clase) y entidades reguladoras, agilizando la recuperación de datos.

Eficiencia y automatización: Los LLMs automatizan análisis rutinarios (p. ej., resumir informes de resultados, procesar préstamos o presentaciones), ahorrando horas de analista y reduciendo errores.

Atención al cliente 24/7: Los asistentes virtuales de IA y los chatbots basados en LLMs pueden gestionar consultas de clientes durante todo el día con respuestas conversacionales, mejorando la experiencia y la satisfacción del cliente.

Asesoramiento financiero personalizado: Al analizar el historial y el perfil de riesgo de un cliente, los LLMs ofrecen asesoramiento financiero o de inversión a medida.

Detección de fraude y gestión de riesgos: Los LLMs examinan grandes datasets de transacciones para detectar anomalías o patrones de fraude, adaptándose a nuevas tácticas de estafa y ayudando a elaborar perfiles de riesgo.

Cumplimiento e informes: Los LLMs redactan automáticamente informes regulatorios, extraen hechos relevantes para las políticas y ayudan a analizar leyes y regulaciones financieras complejas para el cumplimiento.

Sí, existen varios models de dominio específico más grandes para las finanzas. Por ejemplo, BloombergGPT está diseñado para ayudar con la regulación financiera, los mercados de capitales y la gestión del cumplimiento procesando grandes datasets financieros, incluidos documentos de la bolsa de valores nacional y presentaciones regulatorias.

Otros models como FinBERT y FinGPT se centran en el derecho financiero, el derecho bancario internacional y el asesoramiento financiero personalizado, adaptando los large language models al vocabulario especializado de las finanzas, como los símbolos de negociación de clase y los textos regulatorios.

El razonamiento financiero es la capacidad de analizar datos financieros para tomar decisiones empresariales o de inversión informadas.

Las principales tareas incluyen:
– Analizar estados financieros (beneficios, flujo de caja, balance)
– Presupuestación y previsión
– Evaluar inversiones (VAN, TIR, ROI)
– Gestionar el flujo de caja y la liquidez
– Evaluar riesgos financieros y ratios de rendimiento

Cita este benchmark

Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.

Ekrem Sarı (2026) - "Benchmark de 40+ LLMs en finanzas: Claude Fable 5 y GPT-5.6 Sol". Publicado en línea en AIMultiple.com. Recuperado el 24 de septiembre de 2026, de: https://aimultiple.com/finance-llm [Recurso en línea]

Sarı, E. (2026, 24 de septiembre). Benchmark de 40+ LLMs en finanzas: Claude Fable 5 y GPT-5.6 Sol. AIMultiple. https://aimultiple.com/finance-llm

@misc{sari2026,
  author = {Sarı, Ekrem},
  title  = {{Benchmark de 40+ LLMs en finanzas: Claude Fable 5 y GPT-5.6 Sol}},
  year   = {2026},
  month  = sep,
  howpublished    = {\url{https://aimultiple.com/finance-llm}},
  note   = {AIMultiple. Recuperado el 24 de septiembre de 2026}
}
Descargar todos los datos

Resultados y marcas de tiempo de 58 puntos de datos. Descargue los datos resumidos que se muestran en los gráficos y las tablas de este artículo como un archivo ZIP que contiene 2 archivos CSV.

Última actualización: 25 de septiembre de 2026
Descargar

¿Quieres los datos granulares que hay detrás? Únete a Premium

Ekrem Sarı
Ekrem Sarı
Investigador de IA
Ekrem es investigador de IA y científico de datos en AIMultiple. Diseña y ejecuta benchmarks prácticos para sistemas de IA y LLM.
Ver perfil completo

Sé el primero en comentar

Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.

0/450