Negociación de acciones basada en IA: ¿Qué herramienta de IA generativa es mejor?
Las herramientas LLM se han utilizado en la negociación de acciones basada en IA desde su aparición.1
Probé 20 modelos de IA generativa en una única tarea de predicción difícil: predecir el rendimiento anormal acumulado (CAR) de 3 días de 132 acciones después de un evento inesperado, utilizando únicamente la información a nivel de empresa proporcionada en el prompt.
- El modelo ChatGPT 5 Thinking (74 %) y el modelo Gemini 2.5 Pro (71 %) lograron el mejor rendimiento.
- Más información no ayuda a aumentar el rendimiento.
Rendimiento de las herramientas impulsadas por IA
Para más detalles sobre el benchmark, lea la sección de metodología del benchmark de negociación de acciones.
Cómo razonaron los modelos
Todos los modelos convergieron en la misma explicación de dos fuerzas sobre lo que sucede cuando fallece un directivo familiar:
- Pérdida de capital humano: si el fallecido generaba los rendimientos, la muerte destruye algo que la empresa no puede reemplazar rápidamente. CAR negativo.
- Alivio del atrincheramiento: si la empresa tenía un rendimiento inferior bajo un directivo al que el control familiar hacía intocable, la muerte hace lo que el mercado de control corporativo no pudo. CAR positivo.
El marco no es lo que separa a los modelos. Lo que los separa es dónde establecen los puntos de corte, qué variable desempata y con qué facilidad dejan un caso en la categoría neutral. Las secciones siguientes registran únicamente esas diferencias.
Versiones actuales
GPT 5.5 Instant
Clasifica primero el rol del fallecido (CEO por encima de presidente y de títulos honoríficos), y luego analiza la concentración accionarial, ROE/ROA, apalancamiento y las implicaciones generales de la transición de gobierno corporativo.
Es el único modelo del conjunto que no publicó umbrales, ponderaciones ni orden de arbitraje.
DeepSeek V3.2 (Instant y Deep Think)
Puntuaciones idénticas con y sin razonamiento extendido.
DeepSeek interpreta la propiedad familiar en la dirección opuesta a la mayoría del grupo: una participación alta indica compromiso con una transición fluida y empuja hacia positivo o neutral, mientras que otros modelos interpretan la misma concentración como riesgo de sucesión.
Trata el tamaño de la empresa y una muerte no repentina como evidencia de que ya existe maquinaria de transición, lo que asigna esos casos a 0.
Claude Fable 5.1
El modelo ponderó dos efectos opuestos de la literatura sobre la muerte de ejecutivos:
- la pérdida de un responsable clave de decisiones (negativo)
- la eliminación de un controlador atrincherado (positivo).
Asignó −1 a los CEO y presidentes activos de empresas rentables con control familiar concentrado, +1 a los líderes de empresas con pérdidas o estancadas donde la participación familiar era alta, y 0 a ejecutivos jubilados, roles periféricos, empresas muy grandes y casos con datos financieros faltantes.
Claude Opus 5 High
Toma la rentabilidad como eje principal y luego aplica moduladores multiplicativos: rol (CEO en activo ×1.20 hasta emérito ×0.30), apalancamiento superior al 55 % (−0.80), plantilla superior a 100.000 (×0.75) y sector (intensivo en relaciones ×1.15, materias primas ×0.80).
Dos características le son exclusivas:
- Condiciona la propiedad al mercado de control local: por encima del 75 % es +0.40 en jurisdicciones donde las adquisiciones son viables y −0.50 donde la sucesión es dinástica, y aplica un ajuste independiente de protección al inversor por país.
- Impone dos restricciones estrictas: las cifras brutas de activos, ingresos y deuda se descartan por no ser comparables entre 24 monedas, dejando solo ratios y plantillas; y un +1 exige una rentabilidad por debajo de la mediana, ya que sin un bajo rendimiento no hay nada que la muerte pueda aliviar.
Claude Fable 5
Antepone el rol y es explícito en su fundamento en la literatura de estudios de eventos sobre la muerte de ejecutivos. Descarta los 18 casos ceremoniales antes de puntuar nada, luego trata los roles periféricos como 0 con una excepción: un asiento familiar en el consejo con una participación ≥ 75 %, donde la muerte afloja el bloque de control.
Un CEO o presidente activo se asigna por defecto −1 y cambia a +1 con un resultado neto o ROE negativos, o con una participación muy alta acompañada de rendimientos mediocres. La rama de presidente activo es el único lugar del benchmark donde un modelo considera explícitamente que dos fuerzas se anulan en lugar de elegir la mayor: un desempeño medio en un rol de supervisión se puntúa 0 porque la pérdida de administración y la mejora del gobierno corporativo se compensan.
Gemini 3.1 Pro
El conjunto de umbrales más laxos entre los modelos actuales.
Un rol crítico más un ROE > 10 % o un ROA > 5 % produce −1; cualquier bajo rendimiento previo, resultado neto, ROA o ROE negativos produce +1; todo lo demás es 0.
Ambas condiciones direccionales se activan fácilmente, por lo que pocos casos sobreviven en la categoría neutral.
Modelos anteriores
GPT 5 Thinking model
El modelo más preciso y el único que etiqueta por rango relativo con un requisito de margen en lugar de umbrales absolutos. Construye dos índices continuos de puntuación z:
- Índice de concentración del liderazgo (LCI), más alto = más probable sustancialmente negativo:
LCI = 0.40·z(role_importance) + 0.30·z(family_control) + 0.20·z(financial_strength) − 0.10·z(size) - Índice de potencial de renovación (RPI), más alto = más probable sustancialmente positivo:
RPI = 0.40·(−z(financial_strength)) + 0.25·z(leverage) − 0.20·z(family_control) − 0.10·z(size) + 0.05·z(liquidity_stress)
Una etiqueta direccional solo se emite cuando un índice se sitúa en el 30 % superior de la muestra y supera al otro en al menos 0.5 unidades z. Ese requisito de margen es lo que mantiene el valor predeterminado en 0, y es la diferencia estructural más clara entre este modelo y los que aparecen a continuación.
Gemini 2.5 Pro
La misma arquitectura de dos índices con una puerta mucho más estricta: el 5 % superior de la muestra en lugar del 30 % superior.
- Índice de vulnerabilidad (VI):
0.40·z(family_control) + 0.35·(−z(financial_strength)) + 0.20·z(leverage) − 0.05·z(size) - Índice de catalizador de recuperación (TCI):
0.50·(−z(financial_strength)) + 0.25·z(family_control) − 0.15·z(leverage) − 0.10·z(size)
El control familiar entra en ambos índices con signo positivo, de modo que la concentración de la propiedad por sí sola no puede elegir una dirección; la rentabilidad rompe el empate. La etiqueta positiva exige además que el TCI supere al VI en 0.5 unidades z.
GPT 5.4 Instant
Utiliza la rentabilidad como señal principal y no publica puntos de corte. Negativo cuando el fallecido ocupaba un rol operativo central en una empresa sana y de capital cerrado; positivo cuando la rentabilidad era más débil o el apalancamiento mayor y la profundidad de la sucesión familiar parecía disponible; neutral cuando el rol era ceremonial o las señales se compensaban.
GPT 5.4 Thinking
Mismos datos que 5.4 Instant, con una diferencia estructural: la centralidad del rol se exige en ambas direcciones, por lo que un rol periférico no puede producir ninguna etiqueta direccional. El tamaño de la empresa también obtiene por sí solo un neutral; una empresa lo bastante grande como para absorber el cambio se puntúa 0 independientemente del desempeño.
Claude Opus 4.8 Medium
Lógica central: dos fuerzas opuestas impulsan la reacción:
(+) Alivio del atrincheramiento: la muerte de un directivo atrincherado o de bajo rendimiento puede activar el mercado de control y aumentar las esperanzas de recuperación.
(-) Pérdida de capital humano: la muerte de un propietario-directivo que aporta valor destruye habilidades difíciles de reemplazar y crea riesgo de sucesión.
(0) Sin sorpresa: los títulos ceremoniales o de jubilado, los roles puros de consejo o los casos atenuados o compensados no producen una reacción significativa.
Reglas de decisión:
- Emérito/honorífico -> 0 (retirado).
- Miembro del consejo/director, rentable -> 0; con pérdidas -> +1 (sacudida).
- Ejecutivo activo + pérdidas/ROA<1 -> +1 (alivio/opcionalidad).
- Ejecutivo activo + fuerte (ROA>=mediana & ROE>=10 & NI>0) & propiedad>=60 % -> -1 (administrador perdido).
- Ejecutivo activo + fuerte pero propiedad<60 % -> 0 (colchón de supervisión).
- Señal media / faltante / rol desconocido -> 0.
GPT 5 Pro
De nuevo dos índices, pero construidos a partir de propiedad y apalancamiento en lugar del rol, que no aparece en ninguna de las fórmulas.
- Índice de riesgo de persona clave (KPRI):
0.40·z(ownership) + 0.30·z(leverage) − 0.20·z(size) + 0.10·z(profitability) - Índice de potencial de recuperación (TPI):
0.40·(−z(profitability)) + 0.20·z(leverage) − 0.20·z(ownership) − 0.10·z(size) + 0.10·z(AP/assets)
Los filtros son los mismos que los de GPT 5 Thinking: 30 % superior más un margen de 0.5 unidades z. Eliminar el rol del índice es la fuente más probable de la brecha de 18 puntos entre ambos.
Gemini 3 Flash
Plantea las dos fuerzas como teorías contrapuestas y asigna puntos de corte explícitos de ROA: por encima del 10 %, el líder se valora como una estrella y la muerte es −1; por debajo del 3 %, la muerte se interpreta como una apertura para una gestión profesional y se puntúa +1; la banda de 3–10 % y todos los roles no activos son 0.
Gemini 3 Thinking
El mismo diseño de puntos de corte aún más separados: −1 por encima de un ROA del 12 %, +1 por debajo del 2,5 %, lo que amplía la banda neutral de los siete puntos de Flash a casi diez.
Claude Sonnet 4.2
El único sistema de puntos aditivo con ponderaciones y puntos de corte absolutos publicados (≥ +0.90 → +1, ≤ −0.70 → −1).
Puntúa seis dimensiones:
- prominencia del rol
- ROA
- resultado neto y EBITDA
- ROE
- propiedad familiar
- apalancamiento
La ponderación es deliberadamente asimétrica. Un ROA negativo por sí solo vale +1.2, y una pérdida neta y un EBITDA negativo añaden +0.6 y +0.5 adicionales, mientras que la mayor penalización por rol disponible, un CEO o presidente activo, es solo −0.6.
Por tanto, las dificultades financieras pueden anular la identidad del fallecido, algo que ningún otro modelo del conjunto permite.
GPT 4o
Las condiciones se enumeran sin un orden de arbitraje, por lo que los casos que cumplen dos reglas no tienen una resolución definida. También se aparta del grupo en los roles periféricos: un miembro del consejo o VP se puntúa +1, donde casi todos los
Claude Sonnet 4.6
Dos índices de puntuación z al estilo de GPT 5 Thinking: una puntuación de disrupción de la sucesión, que pondera rol, propiedad, desempeño, deuda y plantilla, y un índice de renovación del gobierno corporativo, que pondera debilidad del desempeño, dispersión de la propiedad y calidad institucional.
Es el único modelo que lo hace desde el campo de la sede central. La etiqueta positiva exige que el índice de renovación supere la puntuación de disrupción por un margen fijo de puntos.
DeepSeek V3
La estructura de tres factores que V3.2 refinó posteriormente, como rol, salud financiera y propiedad, pero sin la lectura de la propiedad como estabilizador. Una propiedad alta más un rol clave amplifica la predicción negativa. Cabe señalar por separado que el modelo estimó su propia precisión en aproximadamente 65 %, más del doble de su puntuación real.
Gemini 2.5 Flash
El resultado más bajo y el único con un techo autoinfligido. El modelo concluyó que el prompt no contenía información suficiente para identificar casos positivos y no emitió ninguna etiqueta +1, colapsando un problema de tres clases en dos y perdiendo todos los casos positivos de la muestra.
Precisión del modelo con información ampliada
La segunda ronda añade diez campos a nivel de persona a los mismos 132 casos: si el fallecido seguía trabajando, la generación posterior al fundador, la condición de fundador, la antigüedad, la edad al fallecer, muerte repentina frente a enfermedad, y cuatro recuentos de hijos y parejas.
El efecto agregado es casi nulo. La precisión media entre estos 13 modelos pasa del 54,8 % al 55,2 %. Lo que oculta la media es una amplia dispersión de respuestas individuales:
- Claude Fable 5 es el que más gana, 16 puntos, y es el único modelo cuya información adicional lo traslada de cerca del final del grupo a los cuatro primeros. Su lógica de la primera ronda se basaba casi por completo en el cargo y la rentabilidad; los campos de la segunda ronda aportan exactamente lo que le faltaba a ese árbol: si la persona seguía trabajando y si la muerte fue repentina.
- Gemini 3.1 Pro (+10) y Gemini 3 Thinking (+9) también mejoran sustancialmente, al igual que DeepSeek V3.2 Deep Think (+6).
- GPT 5.4 Instant pierde 17 puntos, el mayor movimiento en cualquier dirección. Claude Sonnet 4.2 (−7) y GPT 5.4 Thinking (−6) también caen.
- La mejor puntuación de la segunda ronda (64 %) es inferior a la mejor puntuación de la primera ronda en el mismo grupo (69 %). Más información no elevó el techo; comprimió el rango.
Metodología del benchmark de negociación de acciones basada en IA
Prompting
El benchmark evalúa si las herramientas de IA generativa pueden predecir las reacciones del mercado de valores ante un evento inesperado, a partir de fundamentos empresariales dados. La configuración se basa en datos de Tanyeri & Alp (2023)2 y Arslan & Tanyeri-Günsur (2026):3
Cada herramienta de IA recibe una instantánea de información a nivel de empresa para la primera ronda:
Información financiera
- Tamaño del activo
- Tamaño del patrimonio
- Beneficio antes de intereses, impuestos, depreciaciones y amortizaciones (EBITDA)
- Resultado neto
- Ingresos anuales
- Deuda a largo y corto plazo
- Cuentas por pagar
- Rentabilidad financiera (ROE)
- Rentabilidad sobre activos (ROA)
Otra información
- Participación de la propiedad familiar
- País de la sede y de cotización bursátil
- Número de empleados
- Industria/sector
No se proporciona el nombre de la empresa ni otros identificadores.
En la segunda ronda, se añade además la siguiente información:
- si el fallecido estaba trabajando en el momento de la muerte
- la generación del fallecido posterior al fundador de la empresa
- si el fallecido era el fundador
- la antigüedad del fallecido en la empresa
- la edad del fallecido en el momento de la muerte
- si el fallecido murió repentinamente o después de una enfermedad
- el número de hijos que tiene el fallecido
- el número de hijas que tiene el fallecido
- el número de hijos varones que tiene el fallecido
- el número de parejas que tuvo el fallecido
Pregunta principal
Con la información anterior, se pide a cada solución de IA que prediga si los rendimientos anormales acumulados (CAR) de 3 días de 132 empresas serán:
- Significativamente positivos
- Significativamente negativos
- No significativos
El CAR mide cómo responden los mercados financieros al evento. Un CAR positivo indica que los operadores bursátiles perciben el evento como creador de valor; un CAR negativo, como destructor de valor; y un CAR no significativo, como neutral.
Muestreo
El dataset incluye 132 eventos de fallecimiento en 109 empresas familiares que cotizan en bolsa en 24 países. Todas las empresas se clasifican entre las 500 mayores empresas familiares.
Medición del rendimiento
El benchmark se basa en análisis técnicos previos de los precios de las acciones. Para cada empresa, se ha calculado el CAR de 3 días y se ha clasificado como:
- Significativamente positivo
- Significativamente negativo
- No significativo
Las predicciones de la IA se comparan con los valores históricos del CAR. La precisión se mide como el porcentaje de predicciones correctas realizadas por cada solución de IA generativa.
Lecturas adicionales
- Benchmark de finanzas con IA agéntica: FinRobot vs FinRL vs FinGPT
- Principales plataformas de investigación financiera con IA para inversores
- Benchmark de capital riesgo con IA: agentes de IA en tareas reales de capital riesgo
Preguntas frecuentes
Aunque los seleccionadores de acciones con IA y las herramientas impulsadas por IA pueden ayudar a identificar patrones y reducir el sesgo emocional, la negociación de acciones sigue conllevando riesgos. Los operadores activos deben combinar las capacidades de la IA con su propia investigación, el desarrollo de estrategias y el conocimiento de las condiciones del mercado para tomar decisiones mejor informadas.
La IA puede ser útil en la negociación de acciones porque puede analizar grandes cantidades de datos de mercado, datos históricos e información en tiempo real más rápido que los humanos. Los bots de trading con IA y los bots de trading impulsados por IA utilizan algoritmos de trading, indicadores técnicos y análisis fundamental para detectar tendencias del mercado, generar señales de trading y ejecutar operaciones. Pueden ayudar a los operadores bursátiles con ideas de operaciones, análisis de carteras y gestión de riesgos en múltiples clases de activos.
La IA puede ayudar en la negociación de acciones al analizar datos de mercado, datos históricos y datos en tiempo real más rápido que los humanos. Los bots de trading con IA utilizan algoritmos de trading, análisis técnico y análisis fundamental para generar señales de trading y ejecutar operaciones. Pueden detectar tendencias del mercado, reaccionar rápidamente a las noticias y ofrecer ideas de operaciones. Por ejemplo, los bots de trading con IA pueden reaccionar a los comunicados de prensa o a las actas de la Fed en cuestión de segundos, algo que ningún operador humano puede igualar.4Sin embargo, la negociación de acciones basada en IA también conlleva riesgos, especialmente durante la volatilidad del mercado, cuando los bots de trading de acciones pueden desencadenar ventas en manada. Las herramientas impulsadas por IA pueden ofrecer información valiosa, pero tomar decisiones informadas sigue requiriendo la propia investigación, la gestión de riesgos y el conocimiento de las condiciones del mercado.
Cita este benchmark
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{phd2026,
author = {PhD., Ezgi Arslan,},
title = {{Negociación de acciones basada en IA: ¿Qué herramienta de IA generativa es mejor?}},
year = {2026},
month = sep,
howpublished = {\url{https://aimultiple.com/ai-based-stock-trading}},
note = {AIMultiple. Recuperado el 3 de septiembre de 2026}
}Registro de cambios
4 actualizacionesSe añadió Claude Fable 5.1 a los modelos de IA generativa probados.
Se añadió la sección "Cómo razonaron los modelos" que explica el marco CAR de dos fuerzas.
Añadida una sección de versiones actuales sobre GPT 5.5 Instant, Claude Opus 4.8, DeepSeek V3.2 y Gemini 3.1 Pro.
Se añadieron los modelos GPT 5.4 Instant y GPT 5.4 Thinking a la sección Versiones actuales.

Sé el primero en comentar
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.