Pruebas de benchmark de análisis de sentimiento: ChatGPT, Claude y Qwen
Lograr un etiquetado preciso de emociones y sentimientos, así como detectar ironía, odio y ofensividad, sigue siendo un desafío que requiere más pruebas y refinamiento. Probamos 10 large language models en cinco tareas de sentimiento: emoción, odio, ironía, ofensividad y sentimiento. Los clasificamos por su precisión promedio en las cinco.
Los resultados destacan claras diferencias entre las herramientas:
- GPT 5.5 obtuvo la mejor precisión general (80 %),
- Minimax M2.7 (72 %) registró el rendimiento general más bajo.
Resultados experimentales: benchmark de análisis de sentimiento
Clasificación: Las herramientas se clasifican según sus tasas de precisión promedio agregadas en todas las categorías evaluadas: emoción, odio, ironía, ofensividad y sentimiento.
Para más detalles, lea la metodología de nuestro benchmark.
Precisión general
Al combinar todas las tareas, las puntuaciones totales de precisión de los models ofrecen una visión integral de sus capacidades:
- GPT 5.5 ocupó el primer lugar con un 80 %. Nunca bajó de 73 % en ninguna tarea, lo que lo convirtió en el model más consistente de la prueba.
- Claude Sonnet 4.6 quedó segundo con un 79 %. Obtuvo el resultado individual más alto del benchmark: 82 % en odio.
- Qwen 3.6 Plus y ChatGPT 5.4 mini empataron en el tercer lugar con un 78 %. ChatGPT 5.4 mini es el model más pequeño cerca de la cima, sin embargo lideró la detección de ofensividad y empató en el primer lugar en ironía.
- Kimi k2.6 obtuvo 77 %, con resultados regulares y sin una tarea claramente débil.
- Gemini 3.1-pro y GLM 5.1 empataron con un 76 %. Gemini 3.1-pro empató en el primer lugar en detección de emociones, pero quedó bajo en odio.
- Claude Opus 4.8 obtuvo 74 %. Se vio frenado por la detección de emociones (68 %), su categoría más débil.
- Gemini 3.5 Flash obtuvo 73 %. Su resultado en odio (65 %) fue el más bajo de esa tarea.
- Minimax M2.7 quedó último con un 72 %. Obtuvo las puntuaciones más bajas en emoción, ironía y ofensividad.
1. Detección de emociones
La detección de emociones es una tarea difícil dentro del análisis de sentimiento; a menudo exige que los models disciernan señales sutiles en el lenguaje. Así se desempeñaron los models:
- GPT 5.5 y Gemini 3.1-pro empataron en el primer lugar con un 80 %.
- Qwen 3.6 Plus siguió con un 79 %.
- Kimi k2.6 obtuvo 78 % y GLM 5.1 obtuvo 77 %.
- ChatGPT 5.4 mini alcanzó 76 % y Claude Sonnet 4.6 alcanzó 75 %.
- Gemini 3.5 Flash obtuvo 73 %.
- Claude Opus 4.8 obtuvo 68 %.
- Minimax M2.7 obtuvo la puntuación más baja con un 66 %.
La detección de emociones tuvo una amplia dispersión: 14 puntos entre los models de arriba y los de abajo. Esto la convierte en una de las dos tareas que más claramente separan a los models.
2. Detección de odio
Detectar contenido de odio es crucial para la clasificación de sentimiento en Twitter y otras tareas de moderación. Los resultados revelaron diferencias notables:
- Claude Sonnet 4.6 lideró con un 82 %, la puntuación individual más alta del benchmark.
- GPT 5.5 siguió de cerca con un 80 %.
- Qwen 3.6 Plus obtuvo 77 %.
- Kimi k2.6 y GLM 5.1 ambos obtuvieron 76 %.
- Minimax M2.7 obtuvo 75 %.
- ChatGPT 5.4 mini obtuvo 72 %.
- Gemini 3.1-pro y Claude Opus 4.8 ambos obtuvieron 71 %.
- Gemini 3.5 Flash obtuvo la puntuación más baja con un 65 %.
La detección de odio tuvo la mayor dispersión de todas las tareas: 17 puntos. Si la moderación es su caso de uso, elija entre los primeros de esta columna en lugar de basarse en la clasificación promedio.
3. Detección de ironía
La detección de ironía es un área donde la evaluación semántica desempeña un papel fundamental. Ambos models ofrecieron un alto rendimiento en el benchmark de análisis de sentimiento, pero GPT-4o se destacó como el líder claro:
- GPT 5.5, Claude Sonnet 4.6, Qwen 3.6 Plus y ChatGPT 5.4 mini empataron en el primer lugar con un 91 %.
- Gemini 3.1-pro, GLM 5.1 y Gemini 3.5 Flash cada uno obtuvo 87 %.
- Claude Opus 4.8 obtuvo 86 % y Kimi k2.6 obtuvo 85 %.
- Minimax M2.7 obtuvo la puntuación más baja con un 82 %.
Esta fue la tarea más fácil del conjunto. Incluso la puntuación más baja fue 82 %. Para trabajos que dependen de captar ironía o sarcasmo, cualquiera de estos models es un punto de partida seguro.
4. Detección de ofensividad
Detectar contenido ofensivo es fundamental para mantener comunidades en línea sanas. Los rendimientos de los models en el benchmark de análisis de sentimiento en esta tarea fueron los siguientes:
- ChatGPT 5.4 mini lideró con un 75 %.
- GPT 5.5 obtuvo 73 %, y Claude Sonnet 4.6 obtuvo 72 %. Claude Opus 4.8 obtuvo 70 %.
- Qwen 3.6 Plus, Kimi k2.6, Gemini 3.1-pro y GLM 5.1 todos obtuvieron 69 %.
- Gemini 3.5 Flash obtuvo 68 %.
- Minimax M2.7 obtuvo la puntuación más baja con un 65 %.
Ningún model alcanzó 76 % en la métrica de ofensividad. Todo el grupo se situó entre 65 % y 75 %. El contexto impulsa esta tarea, y los casos límite del dataset hacen tropezar a todos los models.
5. Análisis de sentimiento
La tarea general de análisis de sentimiento se centró en clasificar los datos en sentimientos positivos, negativos y neutrales. Las puntuaciones de precisión para esta tarea variaron significativamente entre los models:
- GPT 5.5, Qwen 3.6 Plus, ChatGPT 5.4 mini y Gemini 3.1-pro empataron en el primer lugar con un 75 %.
- Kimi k2.6, Claude Opus 4.8, Gemini 3.5 Flash y Minimax M2.7 todos obtuvieron 74 %.
- Claude Sonnet 4.6 obtuvo 73 %.
- GLM 5.1 obtuvo la puntuación más baja con un 72 %.
El rango completo fue de 3 puntos, de 72 % a 75 %. Ningún model manejó bien el sentimiento de tres clases. Si el proyecto necesita etiquetas fiables positivas, negativas y neutrales, ninguno de estos models está listo para funcionar sin una revisión humana.
Observaciones y conclusiones
Las tareas no son igual de difíciles
La ironía fue fácil para todos los models (82 % a 91 %). El sentimiento y la ofensividad fueron difíciles para todos los models, con todas las puntuaciones entre 65 % y 75 %. Elija un model para la tarea que realmente tiene, no por su clasificación promedio.
La emoción y el odio separan mejor a los models
Estas dos tareas tuvieron las mayores brechas de puntuación: 14 y 17 puntos. Si su caso de uso es el seguimiento de emociones o la moderación, la elección del model importa más aquí que en cualquier otro lugar.
Un promedio alto puede ocultar una tarea débil
GPT 5.5 quedó primero en general y se mantuvo fuerte en todos los ámbitos. Pero Claude Opus 4.8 quedó octavo en general, con un 86 % en ironía. Lea la columna de su tarea, no el promedio.
Dataset y metodología del benchmark
Dataset de análisis
Usamos el dataset TweetEval, creado para el análisis de sentimiento en mensajes reales de Twitter.1 Forma parte del trabajo de la Association for Computational Linguistics (ACL) sobre evaluación semántica. El dataset incluye conjuntos de entrenamiento y prueba preetiquetados en cinco tipos de tareas:
- Detección de emociones: asignar el sentimiento en un tuit, como ira, alegría, optimismo o tristeza. Ejemplo de tuit y etiqueta: “#Deppression es real. Las parejas de personas #depressed realmente no entienden la profundidad con la que nos afectan. Suma #anxiety y lo empeora” está etiquetado como triste.2
- Detección de odio: marcar discursos de odio en un tuit. Ejemplo de tuit y etiqueta: “Trump quiere deportar a extranjeros ilegales con ‘sin jueces ni casos judiciales’ #MeToo Estoy firmemente detrás de esta acción La idea de que alguien que ingresa ilegalmente a un país y no muestra respeto por sus leyes deba ser protegido por las mismas leyes es ¡ridículo! #DeportThemAll” está etiquetado como odioso.3
- Detección de ironía: detectar la intención irónica. Ejemplo de tuit y etiqueta: “Las personas que les dicen a las personas con ansiedad que ‘dejen de preocuparse por eso’ son mi tipo favorito de personas #not #educateyourself” está etiquetado como ironía.4
- Detección de ofensividad: clasificar tuits con lenguaje ofensivo. Ejemplo de tuit y etiqueta: “#ConstitutionDay Es muy extraño que los conservadores de la derecha alternativa digan que estamos arruinando la constitución porque queremos #GunControlNow pero ellos son los que arruinan la constitución al molestarse porque vienen extranjeros a esta tierra que no son blancos y quieren vivir” está etiquetado como ofensivo.5
- Clasificación de sentimiento: asignar una etiqueta positiva, negativa o neutral. Ejemplo de tuit y etiqueta: “No puedo esperar a probar esto: Google Earth VR; esto realmente es el futuro de la exploración…” está etiquetado como positivo.6
Estas tareas se alinean con enfoques reales de aprendizaje automático, lo que las hace ideales para evaluar los resultados experimentales de los dos models.
Models evaluados
Probamos 10 large language models, todos a través de la OpenRouter API para que la configuración fuera la misma para cada uno:
GPT 5.5, ChatGPT 5.4 mini, Claude Sonnet 4.6, Claude Opus 4.8, Gemini 3.1-pro, Gemini 3.5 Flash, Qwen 3.6 Plus, Kimi k2.6, GLM 5.1 y Minimax M2.7.
Configuración experimental
Mantuvimos todos los ajustes iguales en los 10 models.
Muestra
Usamos los primeros 200 tuits del conjunto de prueba oficial de cada tarea, con las etiquetas de referencia del dataset. Los mismos 200 tuits se enviaron a todos los models, por lo que la comparación es equitativa.
Prompts
Usamos prompts zero-shot: una instrucción simple de la tarea y el tuit sin procesar, sin ejemplos resueltos. El model devolvió una etiqueta y nada más.
Escribimos los prompts para que no revelaran nada. No nombramos el benchmark, no llamamos al model “anotador” ni insinuamos que estaba siendo calificado. Nombrar la prueba puede cambiar la forma en que responde un model, por lo que lo omitimos. El prompt de emoción, por ejemplo, pedía al model que eligiera una de las opciones: ira, alegría, optimismo o tristeza, y que respondiera con esa palabra.
Ajustes de generación
Ajustamos la temperatura a 0, lo que hace que la salida sea tan estable como lo permite el model. Fijamos el límite de tokens en 4.096. Un límite alto es importante para los models de razonamiento: con un límite pequeño gastan todo el presupuesto en razonamiento oculto y devuelven una respuesta vacía. El espacio adicional les permite terminar de razonar y aun así imprimir la etiqueta. Los models que no razonan responden con una sola palabra corta, por lo que el límite no cuesta nada allí.
Lectura de las respuestas
Asignamos cada respuesta a una etiqueta en pasos: primero una coincidencia exacta, luego una lista corta de sinónimos (por ejemplo, “feliz” se asigna a alegría) y después una búsqueda de cualquier etiqueta dentro de una respuesta más larga. Las respuestas que no pudimos leer se contaron como incorrectas.
Métrica
La puntuación de cada tarea no es la precisión bruta. Utilizamos la métrica que los autores de TweetEval establecieron para cada tarea:
- Emoción: macro-F1
- Sentimiento: macro-recall
- Odio: macro-F1
- Ironía: F1 de la clase de ironía
- Ofensividad: macro-F1
Macro-F1 y macro-recall ponderan cada clase por igual, sin importar la frecuencia con la que aparezca. Esta es la elección correcta aquí porque clases como el odio o la ironía son poco frecuentes, y la precisión simple permitiría que un model pareciera bueno al elegir siempre la etiqueta común. La columna del promedio es la media de estas cinco puntuaciones.
Fiabilidad
Algunos models alcanzaron los límites de velocidad durante la ejecución y perdieron algunas llamadas. Volvimos a ejecutar las filas fallidas a baja velocidad para evitar los límites y repetimos esto hasta que no falló nada. Los resultados finales no tienen llamadas fallidas ni respuestas ilegibles.
Limitaciones de la configuración
Usamos una muestra de 200 tuits de cada conjunto de prueba, no el conjunto completo, por lo que estos números no coinciden con la tabla de clasificación publicada de TweetEval. La comparación entre nuestros 10 models sigue siendo válida, porque todos los models vieron los mismos tuits.
La muestra de 200 tuits es fija, no aleatoria, por lo que es reproducible pero no una muestra aleatoria. Cada tarea también usó un único prompt a temperatura 0. Un prompt diferente, o ejemplos few-shot, desplazaría las cifras absolutas.
Usamos datasets con etiquetas de referencia públicas. Esto conlleva un riesgo de contaminación, cuando un model ha visto las etiquetas durante el entrenamiento. No podemos descartarlo, pero las puntuaciones estuvieron lejos de ser perfectas, lo que sugiere que no fue un factor importante. Para la próxima versión, planeamos probar tuits cuyas etiquetas no se han publicado.
Dado que la muestra es de 200 tuits por tarea, las brechas pequeñas conllevan ruido de muestreo. Tratamos una diferencia de uno a dos puntos como un empate en lugar de una clasificación.
Qué model elegir
Las puntuaciones completas están en la tabla anterior. Esta sección es más breve: relaciona necesidades comunes con el model que se ajusta.
- Mejor opción integral: GPT 5.5. Quedó primero y se mantuvo fuerte en todas las tareas, por lo que es la opción segura cuando tu trabajo combina varias tareas de sentimiento.
- Moderación de contenido y discurso de odio: Claude Sonnet 4.6. Obtuvo la puntuación más alta de todos los models en odio. GPT 5.5 es un segundo muy cercano.
- Detección de lenguaje ofensivo con presupuesto limitado: ChatGPT 5.4 mini. Lideró la ofensividad e igualó las mejores puntuaciones de ironía, algo poco habitual para un model más pequeño y económico.
- Seguimiento de emociones y sentimiento: Gemini 3.1-pro o Qwen 3.6 Plus. Ambos se sitúan en la parte superior de estas dos columnas. Úselos para trabajos de estado de ánimo y opinión en lugar de moderación.
- Ironía y sarcasmo: casi cualquier model aquí. Las puntuaciones fueron de 82 % a 91 %, por lo que esta tarea rara vez determina la elección. Elija el model más barato que satisfaga sus otras necesidades.
- Uso constante y de propósito general: Kimi k2.6. Ninguna tarea destacada, pero tampoco ninguna débil.
- Úselo con precaución para trabajos de alto riesgo: Gemini 3.5 Flash y Minimax M2.7 quedaron al final. Gemini 3.5 Flash fue el más débil en discurso de odio, así que evítelo especialmente para moderación.
Un recordatorio que recorre todo esto: lea la columna de su tarea, no el promedio. Un model puede quedar en la mitad de la tabla en general y aun así liderar la única tarea que le importa.
Lecturas adicionales
- Herramientas de análisis de sentimiento de código abierto
- Principales herramientas de IA emocional evaluadas
- Métodos para el análisis de sentimiento en audio
Cita este benchmark
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{phd2026,
author = {PhD., Ezgi Arslan,},
title = {{Pruebas de benchmark de análisis de sentimiento: ChatGPT, Claude y Qwen}},
year = {2026},
month = sep,
howpublished = {\url{https://aimultiple.com/sentiment-analysis-benchmark}},
note = {AIMultiple. Recuperado el 1 de Septiembre de 2026}
}Registro de cambios
6 actualizaciones- 2025
Se añadió ChatGPT 5.o, Claude 4.5 y Grok 4 a la sección Resultados experimentales: evaluación comparativa del análisis de sentimientos.
Reemplazados los modelos en la sección de metodología de análisis.
Se añadieron ChatGPT 4.5, Claude 3.7 y DeepSeek V3 a la lista de modelos probados.
Se reemplazó ChatGPT 4.0 por GPT-4o en la sección de metodología.
- 2024
Eliminada la sección "Precisión general" del final del documento.
Eliminada la sección "Conjunto de datos de referencia y metodología".
Sé el primero en comentar
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.