Servicios
Contáctanos

Comparativa de 40+ LLMs en Finanzas: Claude Fable 5 & GPT-5.6 Sol

Ekrem Sarı
Ekrem Sarı
actualizado el 10 de jul. de 2026

Evaluamos 40+ LLMs en finanzas en 238 preguntas difíciles del benchmark FinanceReasoning para identificar qué modelos destacan en tareas complejas de razonamiento financiero como análisis de estados financieros, pronósticos y cálculos de ratios.

Resumen de la comparativa de LLMs en finanzas

Loading Chart

Evaluamos LLMs en 238 preguntas difíciles del benchmark FinanceReasoning (Tang et al.).1 Este subconjunto aborda las tareas de razonamiento financiero más desafiantes, evaluando el razonamiento cuantitativo complejo de varios pasos que involucra conceptos y fórmulas financieras. Nuestra evaluación empleó un diseño de prompt personalizado y criterios de puntuación basados en precisión y consumo de tokens.

Para una explicación detallada de cómo se calcularon estas métricas y el marco utilizado para esta evaluación, consulte nuestra metodología de comparativa financiera.

Resultados: ¿Qué LLM es el mejor para finanzas?

Mejor rendimiento (>83% de precisión):

gpt-5.6-sol-pro alcanza la mayor precisión del benchmark con un 90.76% y 385,886 tokens a $16.35 por ejecución, 0.42 puntos por encima de gpt-5.6-sol.

gpt-5.6-sol obtiene un 90.34% de precisión con 117,735 tokens a $3.85 por ejecución. Empata con claude-fable-5 (90.34%) en la segunda precisión más alta, a $3.85 frente a los $10.05 de fable-5 y 117,735 tokens contra 183,258. Ningún modelo con una precisión igual o superior funciona a menor coste.

claude-fable-5 obtiene un 90.34% de precisión con 183,258 tokens. Fue el primer modelo en superar el 90% en este benchmark (10 de junio) y empata con gpt-5.6-sol en 90.34%, a $10.05 por ejecución frente a los $3.85 de gpt-5.6-sol.

claude-opus-4.8 obtiene un 89.08% de precisión con 113,434 tokens, el tercer resultado más caro y la menor cantidad de tokens de salida entre los modelos por encima del 88%.

gpt-5-2025-08-07 obtiene un 88.23% de precisión con 829,720 tokens.

claude-opus-4.6 obtiene un 87.82% de precisión con 164,369 tokens, precisión casi superior con un 20% del recuento de tokens de gpt-5.

gpt-5-mini-2025-08-07 alcanza un 87.39% de precisión con 595,505 tokens.

gemini-3.5-flash alcanza un 86.97% de precisión con 1,191,757 tokens, la mayor precisión de la línea Flash de Google y el mayor usuario de tokens de la familia.

claude-sonnet-5 obtiene un 86.97% de precisión con 414,668 tokens. Iguala a gemini-3.5-flash hasta el decimal, gastando 414,668 tokens contra 1,191,757, a $4.33 por ejecución frente a $10.83.

gpt-5.6-terra obtiene un 86.97% de precisión con 121,936 tokens a $1.99 por ejecución. Se une a claude-sonnet-5 y gemini-3.5-flash en el 86.97%, con el menor recuento de tokens y coste de los tres (121,936 tokens y $1.99, contra 414,668 / $4.33 y 1,191,757 / $10.83). gpt-5-mini-2025-08-07 sigue siendo más barato y preciso ($1.21, 87.39%).

gemini-3.1-pro-preview obtiene un 86.55% de precisión con 475,148 tokens, por encima de su predecesor gemini-3-pro-preview (86.13%) con un 35% menos de tokens (730,759 tokens).

glm-5.2 obtiene un 86.13% de precisión con 735,988 tokens. Mejora a glm-4.5 (64.29%) en 21.84 puntos, el mayor salto entre dos versiones de una misma familia de modelos del benchmark. El siguiente mayor es de 3.79 puntos.

gemini-3-pro-preview y gpt-5.2 empatan con un 86.13% de precisión. gpt-5.2 lo alcanza con 247,660 tokens, aproximadamente tres veces menos tokens de salida que gemini-3-pro-preview con 730,759 tokens.

claude-opus-4.7 obtiene un 85.29% de precisión con 103,268 tokens, el modelo más eficiente en tokens del escalón superior (37% menos tokens de salida que claude-opus-4.6 y por encima del umbral del 83%).

Rendimiento sólido (80-83% de precisión):

grok-4.3 alcanza un 84.87% de precisión con 309,781 tokens, el mejor resultado de xAI en el benchmark y una recuperación respecto al anterior grok-4-0709.

claude-opus-4.5 obtiene un 84.03% de precisión con 144,505 tokens.

claude-sonnet-4.6 y gemini-3-flash-preview empatan con un 83.61% de precisión. Claude Sonnet 4.6 utiliza 161,035 tokens, mientras que Gemini 3 Flash Preview lo alcanza con 118,530 tokens, el menor recuento de tokens entre los modelos por encima del 83%.

kimi-k2.5 obtiene un 82.77% de precisión con 877,868 tokens, el mayor consumo de este nivel de rendimiento.

Nivel medio (70-80% de precisión):

o3-pro-2025-06-10 (78.15% de precisión, 473,659 tokens) y kimi-k2 (78.15% de precisión, 100,323 tokens) empatan, y kimi-k2 usa un 79% menos de tokens. o3-mini-2025-01-31 (77.31% de precisión, 376,929 tokens), gpt-5-nano-2025-08-07 (76.89% de precisión, 1,028,909 tokens) y claude-sonnet-4-20250514 (76.05% de precisión, 135,462 tokens) siguen.

Bajo rendimiento (<70% de precisión):

claude-3-5-sonnet-20241022 (67.65% de precisión, 90,103 tokens) y gpt-oss-20b (67.65% de precisión, 515,041 tokens) lideran este nivel. gemini-2.5-flash (65.55% de precisión, 286,603 tokens), glm-4.5 (64.29% de precisión, 692,662 tokens) y gpt-4.1-nano-2025-04-14 (63.45% de precisión, 171,096 tokens) siguen.

Información sobre el rendimiento:

El consumo de tokens no va a la par con la precisión. deepseek-r1-0528 consumió la mayor cantidad de tokens (1,251,064) con un 62.18% de precisión, mientras que claude-opus-4-20250514 obtuvo un 80.25% con 132,274 tokens. La eficiencia de tokens también varía entre los modelos de alta precisión: gemini-3-flash-preview alcanza un 83.61% con 118,530 tokens, mientras que kimi-k2.5 gasta 877,868 tokens para un 82.77% (7.4x los tokens por 0.84 puntos menos de precisión).

La tabla anterior presenta otras comparativas de modelos de IA, incluidas las utilizadas para este benchmark.

Coste por ejecución del benchmark

Los tokens de salida por sí solos no determinan el gasto, ya que las tarifas de tokens de entrada y salida difieren en un orden de magnitud en la mayoría de los proveedores. Calculamos el coste en dólares de ejecutar cada modelo en las 238 preguntas utilizando la tarifa por token indicada por el proveedor en el momento de la ejecución.

Menor coste en el nivel frontera: gemini-3-flash-preview alcanza un 83.61% de precisión por $0.39, el menor coste en dólares en la banda de precisión >83%. grok-4.3 le sigue con $0.86 para un 84.87%.

El nivel del 90.34% se alcanza a un coste menor: gpt-5.6-sol iguala el 90.34% de claude-fable-5 a $3.85 por ejecución frente a los $10.05 de fable-5, un 38% del coste de fable-5. gpt-5.6-sol-pro registra la mayor precisión del benchmark, 90.76%, a $16.35 por ejecución. claude-opus-4.8 sigue siendo el modelo más barato en superar el 88%, a $3.28 para un 89.08%.

Razonamiento premium a precio premium: o1-pro es el modelo de mayor coste en el benchmark, con $381 para un 80.67% de precisión (impulsado por tarifas de $150/M de entrada y $600/M de salida). o3-pro cuesta $39.23 para un 78.15%, o1 cuesta $46.59 para un 74.79%. Ninguno alcanza el nivel superior, y los tres quedan por debajo de claude-opus-4.7 en precisión a un coste más de 10x mayor.

Coste y precisión de nivel económico: gpt-oss-120b alcanza un 81.09% de precisión con un total de $0.06, la ejecución más barata del benchmark, a 1.91 puntos del umbral del 83%. llama-4-maverick alcanza un 75.21% a $0.10. Para cargas de trabajo donde un 80% de precisión es suficiente, estos modelos cuestan menos del 1% de los buques insignia de vanguardia.

Metodología de la comparativa de razonamiento financiero

Nuestra comparativa proporciona una evaluación transparente y reproducible del rendimiento de los LLM en tareas complejas de razonamiento financiero.

Configuración de la prueba y corpus de datos

  • Suite de benchmark: Utilizamos los datos, el código y los scripts de evaluación del benchmark FinanceReasoning, seleccionado por su enfoque en problemas financieros cuantitativos e inferenciales.
  • Corpus de conocimiento y consultas de prueba: Centramos nuestro análisis en el subconjunto difícil, compuesto por 238 preguntas desafiantes. Tal como lo define el benchmark, cada punto de datos incluye:
    1. Una pregunta que requiere deducción lógica y numérica de varios pasos.
    2. Un contexto, que a menudo contiene información densa presentada en formatos estructurados como tablas Markdown (p. ej., balances, datos de rendimiento bursátil).
    3. Una respuesta de referencia definitiva para una puntuación objetiva.
  • Tipos de consulta ilustrativos: La dificultad del benchmark proviene de su exigencia de que los modelos manejen tareas de razonamiento financiero diversas y complejas. Para ilustrar esta amplitud, destacamos dos ejemplos representativos del conjunto de prueba:

Ejemplo: Razonamiento algorítmico y de series temporales (análisis técnico)

Contexto: Un inversor está analizando… los precios de las acciones de los últimos 25 días… para calcular el Canal de Keltner utilizando un período EMA de 10 días y un período ATR de 10 días, con un multiplicador de 1.5…

Pregunta: ¿Cuál es el valor de la última banda superior del Canal de Keltner…? Responda con dos decimales.

Esta consulta pone a prueba la capacidad de un modelo para actuar como analista cuantitativo mediante:

  1. Descomponer un indicador compuesto: Reconocer que el “Canal de Keltner” se deriva de otros dos indicadores complejos:
    • La media móvil exponencial (EMA)
    • El rango verdadero promedio (ATR).
  2. Implementar lógica algorítmica: Implementar correctamente los algoritmos iterativos tanto para EMA como para ATR desde cero sobre una serie temporal de 25 puntos de datos.
  3. Sintetizar resultados: Combinar los valores calculados según la fórmula final del Canal de Keltner (Banda Superior = EMA + (Multiplicador × ATR)).

Principios básicos de evaluación

  • Llamadas a la API aisladas y estandarizadas: Para cada modelo, realizamos la evaluación de forma programática a través de sus respectivos API endpoints (p. ej., OpenRouter, OpenAI). Esto garantizó que cada modelo recibiera exactamente la misma entrada en condiciones idénticas, eliminando la variabilidad de las interacciones de la interfaz de usuario.
  • Generación de forma libre: No limitamos los modelos a un formato de opción múltiple. En su lugar, se les pidió que generaran una respuesta completa y de forma libre, lo que permite una evaluación más auténtica de sus capacidades de razonamiento.
  • Indicación de Cadena de Pensamiento (CoT): Para provocar y evaluar el proceso de razonamiento de los modelos, empleamos una estrategia de prompting de Cadena de Pensamiento (CoT). El prompt del sistema indicaba explícitamente a cada modelo que “primero pensara en el problema paso a paso” antes de concluir con una respuesta final. Este enfoque permite un análisis más profundo de cómo un modelo llega a su conclusión, más allá del resultado final.

Métricas y marco de evaluación

Utilizamos el propio marco de evaluación totalmente automatizado del benchmark FinanceReasoning para puntuar los resultados de los modelos. Este marco está diseñado para medir tanto la corrección conceptual como el coste computacional.

1. Métrica principal: Precisión

Esta métrica responde a la pregunta crítica: “¿Puede el modelo resolver correctamente el problema financiero?” El proceso de puntuación implica un sofisticado pipeline de dos pasos:

  • Paso 1: Extracción de respuestas basada en LLM: La salida bruta de un modelo es texto no estructurado que contiene tanto el razonamiento como la respuesta final. Para analizar de forma fiable el valor numérico o booleano, utilizamos un modelo supervisor (anthropic/claude-sonnet-4.5) como analizador.
  • Paso 2: Comparación basada en tolerancia: Una simple “coincidencia exacta” es insuficiente para problemas numéricos. Por lo tanto, la respuesta extraída se comparó programáticamente con la verdad de referencia. El script aplica un umbral de tolerancia numérica (una diferencia relativa del 0.2%) para manejar de forma justa las pequeñas variaciones de punto flotante o redondeo, asegurando que las soluciones conceptualmente sólidas se marquen como correctas.

2. Métrica secundaria: Consumo de tokens

Esta métrica responde a la pregunta: “¿Cuán costoso computacionalmente es para el modelo resolver estos problemas?” Mide el coste total asociado con la generación de las 238 respuestas.

  • Cálculo de tokens: Para cada llamada a la API, recopilamos prompt_tokens y completion_tokens del objeto de uso del proveedor. La puntuación de tokens por modelo es la suma de los completion_tokens en las 238 preguntas. Informamos de los tokens de finalización (no del total de tokens) porque la entrada es casi constante entre los modelos que comparten el mismo conjunto de datos (66k-92k tokens de entrada por ejecución según el tokenizador).
  • Cálculo del coste: Calculamos el coste en dólares como prompt_tokens × prompt_price_per_M + completion_tokens × completion_price_per_M, sumado en las 238 preguntas. Los precios son las tarifas por token indicadas en el endpoint /api/v1/models de OpenRouter en el momento en que se ejecutó el modelo.

Este enfoque de dos métricas, proporcionado por el propio benchmark FinanceReasoning, permite una evaluación holística, equilibrando la capacidad bruta de resolución de problemas (precisión) de un modelo con su eficiencia operativa (consumo de tokens).

Deja que nuestro equipo automatice uno de tus procesos de negocio con agentes de IA, sin coste alguno.
Automatizar un proceso

Razonamiento financiero con Generación Aumentada por Recuperación (RAG)

Para superar a los modelos independientes, diseñamos e implementamos un RAG framework personalizado distinto de la implementación original del benchmark. Nuestro enfoque se basa en una pila moderna de bases de datos vectoriales (Qdrant) para suministrar a los LLMs conocimientos relevantes y específicos del dominio en el momento de la inferencia, ayudándoles a resolver problemas más allá de sus datos de entrenamiento. Probamos esto en gpt-4o-mini para medir su impacto.

Resultados y análisis: El equilibrio del RAG

La introducción del RAG tuvo un impacto significativo y medible en el rendimiento de gpt-4o-mini.

Conclusiones clave de la evaluación del RAG:

  • Mejora significativa de la precisión: El RAG mejoró de forma demostrable la capacidad de resolución de problemas del modelo, aumentando la precisión en más de 10 puntos porcentuales. Esto confirma que proporcionar contexto externo relevante es muy eficaz para tareas de razonamiento complejas y específicas del dominio.
  • El coste de la precisión: Esta ganancia de rendimiento tuvo un alto coste. El consumo total de tokens se incrementó casi 18 veces, y el tiempo total de ejecución aumentó 20 veces. Esto se debe a las llamadas adicionales a la API para la incrustación y, lo que es más importante, a los prompts mucho más grandes y complejos que el LLM debe procesar.
  • Implicaciones para modelos más grandes: Los resultados de gpt-4o-mini sugieren que, si bien el RAG puede desbloquear un mayor rendimiento, aplicar este método a modelos más grandes y caros como GPT-4o o Claude Opus será sustancialmente más costoso y llevará más tiempo. Esto pone de relieve el equilibrio crítico entre precisión, coste y latencia en el diseño de sistemas de IA financieros de grado de producción.

Metodología del RAG para razonamiento financiero

Nuestro pipeline de RAG se basa en una pila moderna que utiliza Qdrant como base de datos vectorial y el modelo text-embedding-3-small de OpenAI para generar representaciones vectoriales semánticas. El proceso consta de dos fases principales: una fase de indexación offline y una fase de recuperación-generación online.

1. Indexación del corpus de conocimiento

  • Creación del corpus: Seleccionamos una base de conocimiento especializada a partir de dos fuentes proporcionadas por el benchmark:
    1. Documentos financieros: Una colección de artículos (financial_documents.json) que explican diversos conceptos y términos financieros.
    2. Funciones financieras: Una biblioteca de funciones Python listas para usar (functions-article-all.json) diseñadas para resolver cálculos financieros específicos.
  • Fragmentación inteligente e incrustación: Para preparar este corpus para una recuperación eficiente, cada documento y función se procesó e indexó:
    1. Fragmentación: Los documentos se segmentaron en fragmentos más pequeños y semánticamente coherentes según sus secciones. Cada función Python se trató como un único fragmento atómico. Esto garantiza que el contexto recuperado sea enfocado y relevante.
    2. Incrustación: A continuación, cada fragmento se convirtió en un vector de 1536 dimensiones utilizando el modelo text-embedding-3-small.
    3. Indexación: Estos vectores se indexaron en dos colecciones separadas dentro de nuestra instancia local de Qdrant (financial_documents_openai_small y financial_functions_openai_small), optimizadas para la búsqueda por similitud de coseno.

2. Inferencia potenciada por RAG

Para cada una de las 238 preguntas, el proceso de razonamiento del modelo se aumentó con los siguientes pasos automatizados:

  1. Generación de incrustación (llamadas a la API 1 y 2): La consulta del usuario (pregunta + contexto) se convirtió en un vector de incrustación. Esto requirió dos llamadas a la API de incrustación de OpenAI para preparar las búsquedas en ambas colecciones.
  2. Recuperación de múltiples fuentes: El vector de consulta se utilizó para realizar una búsqueda semántica simultánea en ambas colecciones de Qdrant para recuperar la información más relevante:
    • Los 3 fragmentos de documentos más relevantes de la colección financial_documents.
    • Las 2 funciones Python más relevantes de la colección financial_functions.
  3. Aumento del prompt: Los documentos y funciones recuperados se inyectaron dinámicamente en el prompt, creando un “paquete de información” rico y contextualizado. Esto aumentó significativamente el tamaño del prompt de entrada (de ~300-500 tokens a ~3,000-5,000+ tokens).
  4. Generación de la respuesta final (llamada a la API 3): Este prompt aumentado se envió al modelo gpt-4o-mini para generar la respuesta final razonada.

Limitaciones de la comparativa de LLMs en finanzas

Nuestra comparativa, aunque exhaustiva, está sujeta a varias limitaciones clave:

  • Riesgo de contaminación de datos: Es posible que estos modelos hayan sido entrenados con el conjunto de datos del benchmark, ya que éste es público. Esto podría dar lugar a puntuaciones infladas, lo que dificulta la evaluación de la verdadera capacidad de razonamiento.
  • Análisis de RAG con un solo modelo: La evaluación del RAG se realizó en un solo modelo (gpt-4o-mini), por lo que las compensaciones observadas entre rendimiento y coste pueden no aplicarse a todos los demás modelos.

Conclusión

Nuestra comparativa de más de 40 modelos en tareas complejas de razonamiento financiero muestra lo siguiente:

gpt-5.6-sol-pro alcanza la mayor precisión del benchmark con un 90.76% y 385,886 tokens a $16.35 por ejecución. gpt-5.6-sol y claude-fable-5 empatan en 90.34%.

gpt-5.6-sol iguala el 90.34% de claude-fable-5 a $3.85 por ejecución frente a los $10.05 de fable-5, el menor coste en el nivel de precisión del 90.34%.

claude-opus-4.8 obtiene un 89.08% con 113,434 tokens por $3.28, por encima de gpt-5-2025-08-07 (88.23%) con aproximadamente 7x menos tokens de salida y menos de la mitad de coste ($3.28 vs $8.38), y sigue siendo el modelo más barato por encima del 88% de precisión.

claude-opus-4.6 (87.82%, 164,369 tokens) y gpt-5-mini-2025-08-07 (87.39%, 595,505 tokens) alcanzan una precisión casi superior. gpt-5.6-terra alcanza el 86.97% a $1.99, el menor coste entre los tres modelos empatados en esa precisión.

gemini-3.1-pro-preview (86.55%) está por encima de gemini-3-pro-preview (86.13%) con un 35% menos de tokens, por lo que las actualizaciones iterativas pueden mejorar tanto la precisión como la eficiencia.

gemini-3-flash-preview alcanza un 83.61% con 118,530 tokens a $0.39, y gpt-5.2 alcanza un 86.13% con 247,660 tokens.

El RAG elevó la precisión de gpt-4o-mini en 10.08 puntos a un coste de 17.7x en tokens y 20x en latencia.

No te pierdas nuestros análisis comparativos e insights basados en datos. El botón abre Google; seleccionar AIMultiple confirma que deseas ver AIMultiple con más frecuencia en los resultados de búsqueda de Google.
GoogleAñadir como fuente preferida

Registro de cambios

Agregamos modelos a esta comparativa con cada nueva versión.

10 de julio de 2026

  • OpenAI: GPT-5.6 Sol (openai/gpt-5.6-sol)
  • OpenAI: GPT-5.6 Terra (openai/gpt-5.6-terra)
  • OpenAI: GPT-5.6 Sol Pro (openai/gpt-5.6-sol-pro)

30 de junio de 2026

  • Anthropic: Claude Sonnet 5 (anthropic/claude-sonnet-5)

22 de junio de 2026

  • Zhipu IA: GLM-5.2 (z-ai/glm-5.2)

10 de junio de 2026

  • Anthropic: Claude Fable 5 (anthropic/claude-fable-5)

2 de junio de 2026

  • Anthropic: Claude Opus 4.8 (anthropic/claude-opus-4.8)

22 de mayo de 2026

  • Google: Gemini 3.5 Flash (google/gemini-3.5-flash)
  • xAI: Grok 4.3 (x-ai/grok-4.3)
  • Se añadió la columna de coste por ejecución del benchmark y el botón para alternar el gráfico de precisión frente a coste. Metodología actualizada con la fórmula de cálculo de costes y el cambio del extractor de respuestas (claude-sonnet-4.5)

20 de abril de 2026

  • Anthropic: Claude Opus 4.7 (anthropic/claude-opus-4.7)

20 de febrero de 2026

  • Google: Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview)
  • Anthropic: Claude Sonnet 4.6 (anthropic/claude-sonnet-4.6)

6 de febrero de 2026

  • Anthropic: Claude Opus 4.6 (anthropic/claude-opus-4.6)
  • Anthropic: Claude Opus 4.5 (anthropic/claude-opus-4.5)
  • Anthropic: Claude Sonnet 4.5 (anthropic/claude-sonnet-4.5)
  • Google: Gemini 3 Pro Preview (google/gemini-3-pro-preview)
  • Google: Gemini 3 Flash Preview (google/gemini-3-flash-preview)
  • OpenAI: GPT-5.2 (openai/gpt-5.2)
  • Moonshot IA: Kimi K2.5 (moonshotai/kimi-k2.5)

Lecturas adicionales

El análisis financiero puede referirse a múltiples capacidades, como el análisis de acciones, la interpretación de la ley financiera y el razonamiento financiero. En nuestra comparativa, nos centramos específicamente en el razonamiento financiero, mientras que otras tareas se tratan en artículos separados:

  • LLM para análisis de acciones: Estos modelos ayudan a procesar datos de mercado, informes de empresas y noticias para identificar oportunidades de inversión. (Consulte el análisis completo aquí: IA-based Stock Trading)
  • IA para derecho financiero: Algunos LLMs pueden interpretar regulaciones financieras, contratos y requisitos de cumplimiento para ayudar en tareas legales-financieras. (Consulte nuestra lista de herramientas de IA legal aquí: Herramientas de IA legal)

Preguntas frecuentes

Un LLM (LLM) en finanzas es un modelo de IA que utiliza técnicas de procesamiento del lenguaje natural para realizar análisis financieros complejos, gestión de cumplimiento y comprensión de documentos. Estos modelos ayudan a las instituciones financieras a navegar por la legislación financiera, los requisitos regulatorios y las demandas dinámicas de la industria financiera.

Chatbots inteligentes:
Los asistentes virtuales impulsados por LLM permiten a las empresas financieras ofrecer atención al cliente automatizada las 24/7, gestionando consultas rutinarias y tareas de incorporación sin intervención humana. Esto reduce los tiempos de espera y mejora la satisfacción del cliente, al tiempo que libera a los agentes humanos para cuestiones complejas.

Asesoramiento y análisis:
Los bancos de inversión utilizan LLMs para analizar tendencias del mercado, noticias financieras y datos de clientes. Estos modelos digieren grandes volúmenes de información no estructurada, lo que permite a los asesores ofrecer asesoramiento de inversión personalizado y gestión de carteras con información en tiempo real.

Análisis de documentos regulatorios:
Los bufetes de abogados y las instituciones financieras emplean LLMs para procesar documentos regulatorios densos como los informes de la SEC. Estos modelos extraen información clave y resumen informes, reduciendo el tiempo de revisión manual y ayudando a las empresas a mantenerse al día con las regulaciones en evolución.

Detección de fraudes:
Los LLMs analizan vastos conjuntos de datos financieros en tiempo real para detectar patrones de transacciones sospechosas y tácticas de fraude emergentes. Sus capacidades de aprendizaje continuo permiten una identificación de fraudes más rápida y precisa que los métodos tradicionales.

Automatización legal y de cumplimiento:
Los bufetes de abogados y los equipos de cumplimiento utilizan LLMs para revisar contratos, interpretar leyes bancarias y verificar el cumplimiento normativo. Automatizar estas tareas reduce el tiempo de revisión y los costes legales, al tiempo que garantiza el cumplimiento de regulaciones financieras complejas.

Preguntas y respuestas sobre documentos y Reconocimiento de Entidades Nombradas (NER):
Las instituciones financieras implementan LLMs para responder preguntas de los inversores extrayendo datos de informes financieros y llamadas de resultados. El NER permite el etiquetado automático de nombres de empresas, tickers bursátiles (símbolos de clase de negociación) y entidades regulatorias, agilizando la recuperación de datos.

Eficiencia y automatización: Los LLMs automatizan el análisis rutinario (p. ej., resumir informes de ganancias, procesar préstamos o presentaciones), ahorrando horas de analista y reduciendo errores.

Atención al cliente 24/7: Los asistentes virtuales y chatbots con IA impulsados por LLMs pueden gestionar consultas de clientes las 24 horas del día con respuestas conversacionales, mejorando la experiencia y satisfacción del cliente.

Asesoramiento financiero personalizado: Al analizar el historial y el perfil de riesgo de un cliente, los LLMs ofrecen asesoramiento financiero o de inversión a medida.

Detección de fraudes y gestión de riesgos: Los LLMs examinan grandes conjuntos de datos de transacciones para detectar anomalías o patrones de fraude, adaptándose a nuevas tácticas de estafa y ayudando a construir perfiles de riesgo.

Cumplimiento e informes: Los LLMs redactan automáticamente informes regulatorios, extraen hechos relevantes para las políticas y ayudan a analizar leyes y regulaciones financieras complejas para el cumplimiento.

Sí, existen varios modelos de dominio específico más grandes para finanzas. Por ejemplo, BloombergGPT está diseñado para ayudar con la regulación financiera, los mercados de capitales y la gestión de cumplimiento mediante el procesamiento de grandes conjuntos de datos financieros, incluidos documentos de la bolsa de valores nacional y presentaciones regulatorias.

Otros modelos como FinBERT y FinGPT se centran en el derecho financiero, el derecho bancario internacional y el asesoramiento financiero personalizado, adaptando los grandes modelos de lenguaje al vocabulario especializado de las finanzas, como los símbolos de clase de negociación y los textos regulatorios.

El razonamiento financiero es la capacidad de analizar datos financieros para tomar decisiones informadas de negocio o inversión.

Las principales tareas incluyen:
– Analizar estados financieros (beneficios, flujo de caja, balance)
– Presupuestar y pronosticar
– Evaluar inversiones (VAN, TIR, ROI)
– Gestionar el flujo de caja y la liquidez
– Evaluar riesgos financieros y ratios de rendimiento

Cita este benchmark

Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.

Ekrem Sarı (2026) - "Comparativa de 40+ LLMs en Finanzas: Claude Fable 5 & GPT-5.6 Sol". Publicado en línea en AIMultiple.com. Recuperado el 10 de Julio de 2026, de: https://aimultiple.com/finance-llm [Recurso en línea]

Sarı, E. (2026, 10 de Julio). Comparativa de 40+ LLMs en Finanzas: Claude Fable 5 & GPT-5.6 Sol. AIMultiple. https://aimultiple.com/finance-llm

@misc{sari2026,
  author = {Sarı, Ekrem},
  title  = {{Comparativa de 40+ LLMs en Finanzas: Claude Fable 5 & GPT-5.6 Sol}},
  year   = {2026},
  month  = jul,
  howpublished    = {\url{https://aimultiple.com/finance-llm}},
  note   = {AIMultiple. Recuperado el 10 de Julio de 2026}
}
Descargar todos los datos

Resultados y marcas de tiempo de 52 puntos de datos. Descargue los datos utilizados en este artículo como un archivo ZIP que contiene un archivo CSV y un README.

Última actualización: 6 de Julio de 2026
Descargar
Ekrem Sarı
Ekrem Sarı
Investigador de IA
Ekrem es Investigador de IA y Analista de Datos en AIMultiple. Diseña y ejecuta evaluaciones comparativas prácticas para sistemas de IA y LLM.
Ver perfil completo

Sé el primero en comentar

Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.

0/450