Servicios
Contáctanos

Benchmark de 40+ LLMs en Finanzas: Claude Fable 5 y GPT-5.6 Sol

We evaluated 40+ LLMs in finance on 238 hard questions from the FinanceReasoning benchmark to identify which models excel at complex financial reasoning tasks.

Ekrem Sarı
Ekrem Sarı
actualizado el 11 de ago. de 2026
Loading Chart

Evaluamos LLMs en 238 preguntas difíciles del benchmark FinanceReasoning (Tang et al.).1 Este subconjunto se centra en las tareas de razonamiento financiero más desafiantes, evaluando el razonamiento cuantitativo complejo de varios pasos que involucra conceptos y fórmulas financieras. Nuestra evaluación empleó un diseño de prompt personalizado y criterios de puntuación de precisión y consumo de tokens.

Para una explicación detallada de cómo se calcularon estas métricas y el framework utilizado para esta evaluación, consulte nuestra metodología de benchmark financiero.

Resultados: ¿Qué LLM es el mejor para finanzas?

Modelos de primer nivel (precisión >83 %):

gpt-5.6-sol-pro alcanza la mayor precisión del benchmark con un 90.76 % con 385.886 tokens a $16.35 por ejecución, 0.42 puntos por encima de gpt-5.6-sol.

gpt-5.6-sol obtiene una precisión del 90.34 % con 117.735 tokens a $3.85 por ejecución. Empata con claude-fable-5 (90.34 %) en la segunda mayor precisión, a $3.85 frente a los $10.05 de fable-5 y 117.735 tokens frente a 183.258. Ningún model con una precisión igual o superior se ejecuta a un coste menor.

claude-fable-5 obtiene una precisión del 90.34 % con 183.258 tokens. Fue el primer model en superar el 90 % en este benchmark (10 de junio) y empata con gpt-5.6-sol en 90.34 %, a $10.05 por ejecución frente a los $3.85 de gpt-5.6-sol.

claude-opus-4.8 obtiene una precisión del 89.08 % con 113.434 tokens, el tercer resultado con mayor coste y el menor recuento de tokens de salida entre los models con una precisión superior al 88 %.

gpt-5-2025-08-07 obtiene una precisión del 88.23 % con 829.720 tokens.

claude-opus-4.6 obtiene una precisión del 87.82 % con 164.369 tokens, una precisión casi superior con el 20 % del recuento de tokens de gpt-5.

gpt-5-mini-2025-08-07 alcanza una precisión del 87.39 % con 595.505 tokens.

gemini-3.5-flash alcanza una precisión del 86.97 % con 1.191.757 tokens, la mayor precisión de la línea Flash de Google y el mayor consumidor de tokens de la familia.

claude-sonnet-5 obtiene una precisión del 86.97 % con 414.668 tokens. Iguala a gemini-3.5-flash hasta el decimal mientras gasta 414.668 tokens frente a 1.191.757, a $4.33 por ejecución frente a $10.83.

gpt-5.6-terra obtiene una precisión del 86.97 % con 121.936 tokens a $1.99 por ejecución. Se une a claude-sonnet-5 y a gemini-3.5-flash en el 86.97 %, con el menor recuento de tokens y coste de los tres (121.936 tokens y $1.99, frente a 414.668 / $4.33 y 1.191.757 / $10.83). gpt-5-mini-2025-08-07 sigue siendo más barato y preciso ($1.21, 87.39 %).

gemini-3.1-pro-preview obtiene una precisión del 86.55 % con 475.148 tokens, por encima de su predecesor gemini-3-pro-preview (86.13 %) con un 35 % menos de tokens (730.759 tokens).

glm-5.2 obtiene una precisión del 86.13 % con 735.988 tokens. Mejora a glm-4.5 (64.29 %) en 21.84 puntos, el mayor salto entre dos versiones de una misma familia de models en el benchmark. El siguiente mayor es de 3.79 puntos.

gemini-3-pro-preview y gpt-5.2 empatan con una precisión del 86.13 %. gpt-5.2 la alcanza con 247.660 tokens, aproximadamente tres veces menos tokens de salida que gemini-3-pro-preview con 730.759 tokens.

claude-opus-4.7 obtiene una precisión del 85.29 % con 103.268 tokens, el model más eficiente en tokens del nivel superior (37 % menos de tokens de salida que claude-opus-4.6 superando el umbral del 83 %).

Modelos fuertes (precisión 80-83 %):

grok-4.3 alcanza una precisión del 84.87 % con 309.781 tokens, el resultado más sólido de xAI en el benchmark y una recuperación frente al anterior grok-4-0709.

claude-opus-4.5 obtiene una precisión del 84.03 % con 144.505 tokens.

claude-sonnet-4.6 y gemini-3-flash-preview empatan con una precisión del 83.61 %. Claude Sonnet 4.6 utiliza 161.035 tokens, mientras que Gemini 3 Flash Preview la alcanza con 118.530 tokens, el menor recuento de tokens entre los models con una precisión superior al 83 %.

kimi-k2.5 obtiene una precisión del 82.77 % con 877.868 tokens, el mayor consumo de esta franja de rendimiento.

Franja media (precisión 70-80 %):

o3-pro-2025-06-10 (78.15 % de precisión, 473.659 tokens) y kimi-k2 (78.15 % de precisión, 100.323 tokens) empatan, y kimi-k2 usa un 79 % menos de tokens. o3-mini-2025-01-31 (77.31 % de precisión, 376.929 tokens), gpt-5-nano-2025-08-07 (76.89 % de precisión, 1.028.909 tokens) y claude-sonnet-4-20250514 (76.05 % de precisión, 135.462 tokens) le siguen.

Modelos de bajo rendimiento (<70 % de precisión):

claude-3-5-sonnet-20241022 (67.65 % de precisión, 90.103 tokens) y gpt-oss-20b (67.65 % de precisión, 515.041 tokens) lideran esta franja. gemini-2.5-flash (65.55 % de precisión, 286.603 tokens), glm-4.5 (64.29 % de precisión, 692.662 tokens) y gpt-4.1-nano-2025-04-14 (63.45 % de precisión, 171.096 tokens) le siguen.

Perspectivas de rendimiento:

El consumo de tokens no sigue la precisión. deepseek-r1-0528 consumió la mayor cantidad de tokens (1.251.064) con una precisión del 62.18 %, mientras que claude-opus-4-20250514 obtuvo un 80.25 % con 132.274 tokens. La eficiencia de tokens también varía entre los models de alta precisión: gemini-3-flash-preview alcanza un 83.61 % con 118.530 tokens, mientras que kimi-k2.5 gasta 877.868 tokens para un 82.77 % (7.4x los tokens para 0.84 puntos menos de precisión).

La tabla anterior presenta otros benchmarks de IA models, incluidos los utilizados para este benchmark.

Coste por ejecución del benchmark

Los tokens de salida por sí solos no determinan el gasto, ya que las tarifas de tokens de entrada y de salida difieren en un orden de magnitud en la mayoría de los proveedores. Calculamos el coste en dólares de ejecutar cada model en las 238 preguntas utilizando la tarifa por token indicada por el proveedor en el momento de la ejecución.

Menor coste en el nivel de vanguardia: gemini-3-flash-preview alcanza una precisión del 83.61 % por $0.39, el menor coste en dólares de la franja de precisión >83 %. grok-4.3 le sigue con $0.86 para un 84.87 %.

La franja del 90.34 % se alcanza con un coste menor: gpt-5.6-sol iguala el 90.34 % de claude-fable-5 a $3.85 por ejecución frente a los $10.05 de fable-5, al 38 % del coste de fable-5. gpt-5.6-sol-pro registra la mayor precisión del benchmark, 90.76 %, a $16.35 por ejecución. claude-opus-4.8 sigue siendo el model más barato que supera el 88 %, a $3.28 para un 89.08 %.

Razonamiento premium a precio premium: o1-pro es el model de mayor coste del benchmark con $381 para una precisión del 80.67 % (impulsado por tarifas de $150/M de entrada y $600/M de salida). o3-pro cuesta $39.23 para un 78.15 %, o1 cuesta $46.59 para un 74.79 %. Ninguno supera el nivel superior, y los tres se sitúan por debajo de claude-opus-4.7 en precisión a más de 10x su coste.

Coste y precisión de la franja económica: gpt-oss-120b alcanza una precisión del 81.09 % con un coste total de $0.06, la ejecución más barata del benchmark, a 1.91 puntos del umbral del 83 %. llama-4-maverick alcanza un 75.21 % por $0.10. Para cargas de trabajo en las que una precisión del 80 % es suficiente, estos models cuestan menos del 1 % de los buques insignia de la vanguardia.

Metodología del benchmark de razonamiento financiero

Nuestro benchmark ofrece una evaluación transparente y reproducible del rendimiento de los LLM en tareas complejas de razonamiento financiero.

Configuración de la prueba y corpus de datos

  • Suite de benchmark: Usamos los datos, el código y los scripts de evaluación del benchmark FinanceReasoning, seleccionado por su enfoque en problemas financieros cuantitativos e inferenciales.
  • Corpus de conocimiento y consultas de prueba: Centramos nuestro análisis en el subconjunto difícil, que comprende 238 preguntas desafiantes. Según la definición del benchmark, cada punto de datos incluye:
    1. Una pregunta que requiere deducción lógica y numérica de varios pasos.
    2. Un contexto, que a menudo contiene información densa presentada en formatos estructurados como tablas Markdown (por ejemplo, balances, datos de rendimiento bursátil).
    3. Una respuesta de referencia definitiva para una puntuación objetiva.
  • Tipos de consultas ilustrativas: La dificultad del benchmark radica en su exigencia de que los models manejen tareas de razonamiento financiero diversas y complejas. Para ilustrar esta amplitud, destacamos dos ejemplos representativos del conjunto de pruebas:

Ejemplo: Razonamiento algorítmico y de series temporales (análisis técnico)

Contexto: Un inversor está analizando… precios de acciones durante los últimos 25 días… para calcular el Canal de Keltner utilizando un período EMA de 10 días y un período ATR de 10 días, con un multiplicador de 1.5…

Pregunta: ¿Cuál es el valor de la última banda superior del Canal de Keltner…? Responda con dos decimales.

Esta consulta evalúa la capacidad de un model para actuar como analista cuantitativo mediante:

  1. Deconstruir un indicador compuesto: Reconocer que el “Canal de Keltner” se deriva de otros dos indicadores complejos:
    • La media móvil exponencial (EMA)
    • El rango verdadero promedio (ATR).
  2. Implementar la lógica algorítmica: Implementar correctamente los algoritmos iterativos tanto de EMA como de ATR desde cero a lo largo de una serie temporal de 25 puntos de datos.
  3. Sintetizar los resultados: Combinar los valores calculados según la fórmula final del Canal de Keltner (banda superior = EMA + (multiplicador × ATR)).

Principios básicos de evaluación

  • Llamadas de API aisladas y estandarizadas: Para cada model, realizamos la evaluación de forma programática a través de sus respectivos endpoints de API (por ejemplo, OpenRouter, OpenAI). Esto garantizó que cada model recibiera exactamente la misma entrada en condiciones idénticas, eliminando la variabilidad de las interacciones de la interfaz de usuario.
  • Generación libre: No limitamos los models a un formato de opción múltiple. En su lugar, se les pidió que generaran una respuesta exhaustiva en formato gratis-form, lo que permite una evaluación más auténtica de sus capacidades de razonamiento.
  • Prompting de cadena de pensamiento (CoT): Para obtener y evaluar el proceso de razonamiento de los models, empleamos una estrategia de prompting de cadena de pensamiento (CoT). El prompt del sistema instruyó explícitamente a cada model a “pensar primero en el problema paso a paso” antes de concluir con una respuesta final. Este enfoque permite un análisis más profundo de cómo un model llega a su conclusión, más allá del resultado final.

Métricas de evaluación y framework

Utilizamos el framework de evaluación totalmente automatizado del benchmark FinanceReasoning para puntuar las salidas de los models. Este framework está diseñado para medir tanto la corrección conceptual como el coste computacional.

1. Métrica principal: Precisión

Esta métrica responde a la pregunta crítica: “¿Puede el model resolver correctamente el problema financiero?” El proceso de puntuación implica un pipeline sofisticado de dos pasos:

  • Paso 1: Extracción de respuestas basada en LLM: La salida bruta de un model es texto no estructurado que contiene tanto el razonamiento como una respuesta final. Para analizar de forma fiable el valor numérico o booleano, utilizamos un model supervisor (anthropic/claude-sonnet-4.5) como analizador.
  • Paso 2: Comparación basada en tolerancia: Una simple “coincidencia exacta” es insuficiente para los problemas numéricos. Por lo tanto, la respuesta extraída se comparó programáticamente con la referencia. El script aplica un umbral de tolerancia numérica (una diferencia relativa del 0.2 %) para manejar de manera justa las pequeñas variaciones de coma flotante o redondeo, garantizando que las soluciones conceptualmente correctas se marquen como correctas.

2. Métrica secundaria: Consumo de tokens

Esta métrica responde a la pregunta: “¿Cuán costoso computacionalmente es para el model resolver estos problemas?” Mide el coste total asociado a la generación de las 238 respuestas.

  • Cálculo de tokens: Para cada llamada a la API recopilamos prompt_tokens y completion_tokens del objeto de uso del proveedor. La puntuación de tokens por model es la suma de completion_tokens en todas las 238 preguntas. Informamos de los tokens de finalización (no de los tokens totales) porque la entrada es casi constante entre los models que comparten el mismo dataset (66k-92k tokens de entrada por ejecución según el tokenizador).
  • Cálculo del coste: Calculamos el coste en dólares como prompt_tokens × prompt_price_per_M + completion_tokens × completion_price_per_M, sumado en todas las 238 preguntas. Los precios son las tarifas por token indicadas en el endpoint /api/v1/models de OpenRouter en el momento en que se ejecutó el model.

Este enfoque de dos métricas, proporcionado por el propio benchmark FinanceReasoning, permite una evaluación holística que equilibra la capacidad bruta de resolución de problemas de un model (precisión) con su eficiencia operativa (consumo de tokens).

Razonamiento financiero con generación aumentada por recuperación (RAG)

Para superar a los models independientes, diseñamos e implementamos un RAG framework personalizado distinto de la implementación original del benchmark. Nuestro enfoque se basa en una pila moderna de base de datos vectorial (Qdrant) para proporcionar a los LLMs conocimiento relevante y específico del dominio en tiempo de inferencia, ayudándoles a resolver problemas más allá de sus datos de entrenamiento. Lo probamos en gpt-4o-mini para medir su impacto.

Resultados y análisis: la compensación de RAG

La introducción de RAG tuvo un impacto significativo y medible en el rendimiento de gpt-4o-mini.

Conclusiones clave de la evaluación de RAG:

  • Mejora significativa de la precisión: RAG mejoró de forma demostrable la capacidad de resolución de problemas del model, aumentando la precisión en más de 10 puntos porcentuales. Esto confirma que proporcionar contexto externo relevante es muy eficaz para tareas de razonamiento complejas y específicas de un dominio.
  • El coste de la precisión: Esta ganancia de rendimiento tuvo un coste elevado. El consumo total de tokens aumentó casi x18, y el tiempo total de ejecución aumentó x20. Esto se debe a las llamadas adicionales a la API para embedding y, más importante, a los prompts mucho más grandes y complejos que el LLM debe procesar.
  • Implicaciones para models más grandes: Los resultados de gpt-4o-mini sugieren que, si bien RAG puede desbloquear un mayor rendimiento, aplicar este método a models más grandes y costosos como GPT-4o o Claude Opus será sustancialmente más costoso y requerirá más tiempo. Esto pone de relieve el equilibrio crítico entre precisión, coste y latencia en el diseño de sistemas financieros de IA de grado de producción.

Metodología de RAG para razonamiento financiero

Nuestro pipeline de RAG está construido sobre una pila moderna que utiliza Qdrant como base de datos vectorial y el model text-embedding-3-small de OpenAI para generar representaciones vectoriales semánticas. El proceso consta de dos fases principales: una fase de indexación offline y una fase de recuperación-generación online.

1. Indexación del corpus de conocimiento

  • Creación del corpus: Curamos una base de conocimiento especializada a partir de dos fuentes proporcionadas por el benchmark:
    1. Documentos financieros: Una colección de artículos (financial_documents.json) que explican diversos conceptos y términos financieros.
    2. Funciones financieras: Una biblioteca de funciones Python listas para usar (functions-article-all.json) diseñadas para resolver cálculos financieros específicos.
  • Segmentación inteligente y embedding: Para preparar este corpus para una recuperación eficiente, cada documento y función fue procesado e indexado:
    1. Segmentación: Los documentos se segmentaron en fragmentos más pequeños y semánticamente coherentes según sus secciones. Cada función Python se trató como un único fragmento atómico. Esto garantiza que el contexto recuperado sea centrado y relevante.
    2. Embedding: Luego, cada fragmento se convirtió en un vector de 1536 dimensiones utilizando el model text-embedding-3-small.
    3. Indexación: Estos vectores se indexaron en dos colecciones separadas dentro de nuestra instancia local de Qdrant (financial_documents_openai_small y financial_functions_openai_small), optimizadas para la búsqueda por similitud de coseno.

2. Inferencia potenciada por RAG

Para cada una de las 238 preguntas, el proceso de razonamiento del model se amplió con los siguientes pasos automatizados:

  1. Generación de embedding (llamadas a la API 1 y 2): La consulta del usuario (pregunta + contexto) se convirtió en un vector de embedding. Esto requirió dos llamadas a la API de embedding de OpenAI para preparar las búsquedas en ambas colecciones.
  2. Recuperación de múltiples fuentes: El vector de consulta se utilizó para realizar una búsqueda semántica simultánea en ambas colecciones de Qdrant para recuperar la información más relevante:
    • Los 3 fragmentos de documentos más relevantes de la colección financial_documents.
    • Las 2 funciones Python más relevantes de la colección financial_functions.
  3. Aumento del prompt: Los documentos y funciones recuperados se inyectaron dinámicamente en el prompt, creando un “paquete de información” rico y consciente del contexto. Esto aumentó significativamente el tamaño del prompt de entrada (de ~300-500 tokens a ~3.000-5.000+ tokens).
  4. Generación de la respuesta final (llamada a la API 3): Este prompt aumentado se envió al model gpt-4o-mini para generar la respuesta final razonada.
Deja que nuestro equipo automatice uno de tus procesos de negocio con agentes de IA, sin coste alguno.
Automatizar un proceso

Limitaciones del benchmark de LLMs en finanzas

Nuestro benchmark, aunque completo, está sujeto a varias limitaciones clave:

  • Riesgo de contaminación de datos: Es posible que estos models hayan sido entrenados con el dataset del benchmark, ya que el dataset es público. Esto podría dar lugar a puntuaciones infladas, lo que dificulta evaluar la verdadera capacidad de razonamiento.
  • Análisis de RAG con un único model: La evaluación de RAG se realizó en un único model (gpt-4o-mini), por lo que las compensaciones observadas entre rendimiento y coste pueden no aplicarse a todos los demás models.

Conclusión

Nuestro benchmark de 40+ models en tareas complejas de razonamiento financiero muestra lo siguiente:

gpt-5.6-sol-pro alcanza la mayor precisión del benchmark con un 90.76 % con 385.886 tokens a $16.35 por ejecución. gpt-5.6-sol y claude-fable-5 empatan con un 90.34 %.

gpt-5.6-sol iguala el 90.34 % de claude-fable-5 a $3.85 por ejecución frente a los $10.05 de fable-5, el menor coste de la franja de precisión del 90.34 %.

claude-opus-4.8 obtiene un 89.08 % con 113.434 tokens por $3.28, por encima de gpt-5-2025-08-07 (88.23 %) con aproximadamente 7x menos tokens de salida y menos de la mitad del coste ($3.28 frente a $8.38), y sigue siendo el model más barato con una precisión superior al 88 %.

claude-opus-4.6 (87.82 %, 164.369 tokens) y gpt-5-mini-2025-08-07 (87.39 %, 595.505 tokens) alcanzan una precisión casi superior. gpt-5.6-terra alcanza un 86.97 % a $1.99, el menor coste entre los tres models empatados en esa precisión.

gemini-3.1-pro-preview (86.55 %) está por encima de gemini-3-pro-preview (86.13 %) con un 35 % menos de tokens, por lo que las actualizaciones iterativas pueden mejorar tanto la precisión como la eficiencia.

gemini-3-flash-preview alcanza un 83.61 % con 118.530 tokens a $0.39, y gpt-5.2 alcanza un 86.13 % con 247.660 tokens.

RAG aumentó la precisión de gpt-4o-mini en 10.08 puntos a un coste de 17.7x los tokens y 20x la latencia.

Registro de cambios

Añadimos models a este benchmark con cada nueva versión.

10 de julio de 2026

  • OpenAI: GPT-5.6 Sol (openai/gpt-5.6-sol)
  • OpenAI: GPT-5.6 Terra (openai/gpt-5.6-terra)
  • OpenAI: GPT-5.6 Sol Pro (openai/gpt-5.6-sol-pro)

30 de junio de 2026

  • Anthropic: Claude Sonnet 5 (anthropic/claude-sonnet-5)

22 de junio de 2026

  • Zhipu IA: GLM-5.2 (z-ai/glm-5.2)

10 de junio de 2026

  • Anthropic: Claude Fable 5 (anthropic/claude-fable-5)

2 de junio de 2026

  • Anthropic: Claude Opus 4.8 (anthropic/claude-opus-4.8)

22 de mayo de 2026

  • Google: Gemini 3.5 Flash (google/gemini-3.5-flash)
  • xAI: Grok 4.3 (x-ai/grok-4.3)
  • Se añadió la columna de coste por ejecución del benchmark y el conmutador del gráfico de precisión frente a coste. Metodología actualizada con la fórmula de cálculo de costes y el cambio del extractor de respuestas (claude-sonnet-4.5)

20 de abril de 2026

  • Anthropic: Claude Opus 4.7 (anthropic/claude-opus-4.7)

20 de febrero de 2026

  • Google: Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview)
  • Anthropic: Claude Sonnet 4.6 (anthropic/claude-sonnet-4.6)

6 de febrero de 2026

  • Anthropic: Claude Opus 4.6 (anthropic/claude-opus-4.6)
  • Anthropic: Claude Opus 4.5 (anthropic/claude-opus-4.5)
  • Anthropic: Claude Sonnet 4.5 (anthropic/claude-sonnet-4.5)
  • Google: Gemini 3 Pro Preview (google/gemini-3-pro-preview)
  • Google: Gemini 3 Flash Preview (google/gemini-3-flash-preview)
  • OpenAI: GPT-5.2 (openai/gpt-5.2)
  • Moonshot IA: Kimi K2.5 (moonshotai/kimi-k2.5)
No te pierdas nuestros análisis comparativos e insights basados en datos. El botón abre Google; seleccionar AIMultiple confirma que deseas ver AIMultiple con más frecuencia en los resultados de búsqueda de Google.
GoogleAñadir como fuente preferida

Lecturas adicionales

El análisis financiero puede referirse a múltiples capacidades, como el análisis bursátil, la interpretación del derecho financiero y el razonamiento financiero. En nuestro benchmark, nos centramos específicamente en el razonamiento financiero, mientras que otras tareas se tratan en artículos separados:

  • LLM para el análisis bursátil: Estos models ayudan a procesar datos de mercado, informes de empresas y noticias para identificar oportunidades de inversión. (Consulte el análisis completo aquí: IA-based Stock Trading)
  • IA de derecho financiero: Algunos LLMs pueden interpretar regulaciones financieras, contratos y requisitos de cumplimiento para ayudar en tareas jurídico-financieras. (Consulte nuestra lista de herramientas de IA legal aquí: Herramientas de IA legal)

Preguntas frecuentes

Un LLM (large language model) en finanzas es un model de IA que utiliza técnicas de procesamiento del lenguaje natural para realizar análisis financiero complejo, gestión de cumplimiento y comprensión de documentos. Estos models ayudan a las instituciones financieras a navegar por el derecho financiero, los requisitos normativos y las demandas dinámicas de la industria financiera.

Chatbots inteligentes:
LLM-driven virtual assistants enable financial firms to provide automated, 24/7 customer support by handling routine queries and onboarding tasks without human intervention. This reduces wait times and improves customer satisfaction while freeing human agents for complex issues.

Asesoramiento y análisis:
Los bancos de inversión utilizan LLMs para analizar las tendencias del mercado, las noticias financieras y los datos de los clientes. Estos models digieren grandes volúmenes de información no estructurada, lo que permite a los asesores ofrecer asesoramiento de inversión personalizado y gestión de carteras con información en tiempo real.

Análisis de documentos regulatorios:
Los bufetes de abogados y las instituciones financieras emplean LLMs para procesar documentos regulatorios densos, como las presentaciones ante la SEC. Estos models extraen información clave y resumen informes, lo que reduce el tiempo de revisión manual y ayuda a las empresas a cumplir con las normativas en evolución.

Detección de fraude:
Los LLMs analizan grandes datasets financieros en tiempo real para detectar patrones de transacciones sospechosas y tácticas de fraude emergentes. Sus capacidades de aprendizaje continuo permiten una identificación del fraude más rápida y precisa que los métodos tradicionales.

Automatización legal y de cumplimiento:
Los bufetes de abogados y los equipos de cumplimiento utilizan LLMs para revisar contratos, interpretar leyes bancarias y verificar el cumplimiento normativo. Automatizar estas tareas reduce el tiempo de revisión y los costes legales, al tiempo que garantiza el cumplimiento de normativas financieras complejas.

Preguntas y respuestas sobre documentos y reconocimiento de entidades nombradas (NER):
Las instituciones financieras implementan LLMs para responder a las preguntas de los inversores extrayendo datos de informes financieros y llamadas de resultados. NER permite el etiquetado automático de nombres de empresas, tickers bursátiles (símbolos de negociación de clase) y entidades reguladoras, agilizando la recuperación de datos.

Eficiencia y automatización: Los LLMs automatizan análisis rutinarios (por ejemplo, resumir informes de resultados, procesar préstamos o presentaciones), ahorrando horas de analista y reduciendo errores.

Atención al cliente 24/7: Los asistentes virtuales y chatbots de IA impulsados por LLMs pueden atender las consultas de los clientes durante todo el día con respuestas conversacionales, mejorando la experiencia y la satisfacción del cliente.

Asesoramiento financiero personalizado: Al analizar el historial y el perfil de riesgo de un cliente, los LLMs ofrecen asesoramiento financiero o de inversión personalizado.

Detección de fraude y gestión de riesgos: Los LLMs examinan grandes datasets de transacciones para detectar anomalías o patrones de fraude, adaptándose a nuevas tácticas de estafa y ayudando a crear perfiles de riesgo.

Cumplimiento e informes: Los LLMs redactan automáticamente informes regulatorios, extraen hechos relevantes para las políticas y ayudan a analizar leyes y normativas financieras complejas para el cumplimiento.

Sí, existen varios models específicos del dominio más grandes para las finanzas. Por ejemplo, BloombergGPT está diseñado para ayudar con la regulación financiera, los mercados de capitales y la gestión de cumplimiento mediante el procesamiento de grandes datasets financieros, incluidos documentos de la bolsa de valores nacional y presentaciones regulatorias.

Otros models como FinBERT y FinGPT se centran en el derecho financiero, el derecho bancario internacional y el asesoramiento financiero personalizado, adaptando los large language models al vocabulario especializado de las finanzas, como los símbolos de negociación de clase y los textos regulatorios.

El razonamiento financiero es la capacidad de analizar datos financieros para tomar decisiones empresariales o de inversión informadas.

Las principales tareas incluyen:
– Analizar estados financieros (beneficios, flujo de caja, balance)
– Presupuestar y hacer previsiones
– Evaluar inversiones (NPV, IRR, ROI)
– Gestionar el flujo de caja y la liquidez
– Evaluar riesgos financieros y ratios de rendimiento

Cita este benchmark

Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.

Ekrem Sarı (2026) - "Benchmark de 40+ LLMs en Finanzas: Claude Fable 5 y GPT-5.6 Sol". Publicado en línea en AIMultiple.com. Recuperado el 11 de Agosto de 2026, de: https://aimultiple.com/finance-llm [Recurso en línea]

Sarı, E. (2026, 11 de Agosto). Benchmark de 40+ LLMs en Finanzas: Claude Fable 5 y GPT-5.6 Sol. AIMultiple. https://aimultiple.com/finance-llm

@misc{sari2026,
  author = {Sarı, Ekrem},
  title  = {{Benchmark de 40+ LLMs en Finanzas: Claude Fable 5 y GPT-5.6 Sol}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/finance-llm}},
  note   = {AIMultiple. Recuperado el 11 de Agosto de 2026}
}
Descargar todos los datos

Resultados y marcas de tiempo de 52 puntos de datos. Descargue los datos utilizados en este artículo como un archivo ZIP que contiene un archivo CSV y un README.

Última actualización: 14 de Agosto de 2026
Descargar
Ekrem Sarı
Ekrem Sarı
Investigador de IA
Ekrem es investigador de IA y analista de datos en AIMultiple. Diseña y ejecuta benchmarks prácticos para sistemas de IA y LLM.
Ver perfil completo

Sé el primero en comentar

Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.

0/450