Serviços
Contate-nos

Principais Ferramentas de IA Emocional Testadas

Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
atualizado em 27 ago. 2026

Testamos 12 large language models com capacidade de visão em 70 fotografias de rostos rotuladas, cinco vezes cada, para avaliar com que precisão identificam a emoção em um rosto humano. A pontuação mais alta é 67%, nenhum par de models no teste é estatisticamente distinguível, e o grupo lê raiva em 22%.

Além disso, exploramos dez ferramentas líderes de IA emocional e compartilhamos nossas percepções práticas.

Benchmark de reconhecimento de emoções

Loading Chart

Cada model viu as mesmas 70 imagens cinco vezes, uma imagem por solicitação, em 4.200 chamadas e 4.195 classificações válidas. Consulte a metodologia para o conjunto de rótulos e as regras de pontuação.

Resultados do benchmark de reconhecimento de emoções

As pontuações variam de 51% a 67%, e nenhum par de models se separa. Comparando cada par na resposta que cada model deu com mais frequência ao longo de suas cinco passadas, quatro dos 66 testes exatos de McNemar têm valores-p não corrigidos abaixo de 0.05, e nenhum sobrevive à correção de Holm. Com 70 imagens, a diferença de 16 pontos entre o primeiro e o último é uma faixa, e a ordem dentro dela não tem significado.

A melhor pontuação não melhorou de forma mensurável em sete meses.

GPT o4 Mini High marcou 69% nessas mesmas 70 imagens em janeiro de 2026 em uma única passada, em comparação com 67% do Gemini 3.7 Flash ao longo de cinco passadas. As duas execuções usaram versões diferentes do código de teste, então a diferença de 1.5 ponto não é um declínio; é um resultado que não se moveu.

Precisão por emoção

As sete emoções não falham juntas:

  • Felicidade: lida corretamente 89% das vezes em toda a coorte
  • Medo: 38%
  • Raiva: 22%, e a emoção com menor pontuação para 10 dos 12 models

A raiva fica oito pontos acima do chute. Classes balanceadas colocam um chute aleatório em 14.3%, portanto:

  • A raiva supera o acaso em oito pontos; a felicidade o supera em 75 %
  • O melhor model em raiva atinge 34%

Nada obriga um model a atingir a linha de base: dois pontuam zero quando a imagem é ocultada.

Models também discordam de si mesmos. Ao serem perguntados sobre a mesma imagem cinco vezes:

  • MiniMax M3 repete sua própria resposta mais comum 81% das vezes
  • Claude Fable 5 a repete 97% das vezes

Um número de uma única passada nessa tarefa, portanto, carrega o model e a variação entre execuções ao mesmo tempo.

Essa instabilidade desaparece nas imagens que a coorte erra. Três imagens não obtiveram respostas corretas de nenhum model em nenhuma das cinco passadas (60 respostas), zero correspondências.

Os models não se dispersaram pelas seis etiquetas restantes. Eles convergiram em uma:

  • Imagem rotulada como raiva: tristeza em 59 de 60
  • Imagem rotulada como medo: tristeza em 47 de 60 respostas

Uma convergência tão apertada entre 12 models independentes aponta tanto para o rótulo quanto para os models.

Custo, latência e precisão

O custo varia 62x em toda a coorte, enquanto a precisão varia 16 pontos.

  • GPT-5.6 Luna classifica 1.000 imagens por $0,06 e pontua 53%
  • Claude Fable 5 cobra $3,83 pelas mesmas 1.000 e pontua 63%.

Esses dez pontos não sobrevivem à correção de Holm.

Respostas mais lentas não pontuam melhor.

  • Qwen3.8 Max leva em média 14.5 segundos por imagem, com percentil 95 de 46 segundos, e pontua 63%
  • Claude Sonnet 5 leva em média 3.1 segundos e pontua 64%

O número é o tempo de ida e volta através do OpenRouter, então inclui o roteamento, bem como a deliberação do próprio model, mas uma variação de 4x em uma resposta de uma palavra é grande demais para vir apenas do roteamento.

Metodologia do benchmark de reconhecimento de emoções

Cada model recebe uma imagem e a mesma instrução: escolha exatamente uma palavra de uma lista de sete emoções. Os rótulos são “feliz”, “triste”, “zangado”, “medo”, “nojo”, “surpresa” e “neutro”, embaralhados a cada solicitação para que nenhum rótulo mantenha uma posição fixa.

Uma resposta conta como correta somente se corresponder exatamente ao rótulo do dataset. Qualquer outra coisa, incluindo uma frase, uma recusa ou uma palavra fora da lista, é registrada como resposta inválida e não é pontuada como correta. Cinco das 4.200 chamadas foram inválidas: MiniMax M3 devolveu uma palavra truncada quatro vezes, e Kimi K3 respondeu com um parágrafo uma vez.

Cada model é chamado através do OpenRouter, uma imagem por solicitação, sem histórico de conversa e sem prompt por fornecedor. Isso importa mais do que parece:

Em uma execução anterior neste dataset, alguns models foram chamados através de suas APIs de fornecedor e outros via OpenRouter, e cada model do OpenRouter pontuou entre 7% e 21%, enquanto cada model direto-API pontuou entre 51% e 63%.

Para confirmar que as imagens chegam aos models, executamos o mesmo prompt com a imagem removida:

  • Cada model ganha entre 37 e 64 pontos quando a imagem está presente.
  • Sem ela, oito dos doze ficam dentro de um ponto da linha de base de 14.3%, e sete deles respondem com um único rótulo para todos os 70 itens.
  • Claude Fable 5 se recusa a adivinhar em todos os 70, e Claude Sonnet 5 em 68 deles, então ambos pontuam zero.

Dataset

Usamos uma parte do dataset Facial Emotion Detection, que inclui um conjunto de imagens rotuladas mostrando diferentes emoções humanas.1 Cada imagem continha expressões faciais representando estados emocionais comuns, como felicidade, tristeza, raiva, medo e surpresa.

Custo

O orçamento de conclusão é de 16.000 tokens para cada model, e os tokens de raciocínio são retirados dele.

Qwen3.8 Max é o único model que chega perto disso: em uma imagem, seu gasto de raciocínio variou de 297 a 2.115 tokens em chamadas repetidas, e duas de suas respostas foram cortadas completamente em um orçamento anterior de 4.000 tokens.

As duas respostas truncadas foram executadas novamente com o orçamento mais amplo, porque uma resposta que atinge o limite do orçamento reflete o orçamento e não o model. Nenhum outro model da coorte excedeu 300 tokens de raciocínio.

Limitações conhecidas

Cinco das 70 imagens carregam um rótulo que todos os 12 models contradizem e, em três delas, nenhum model produziu o rótulo em nenhuma passada. A concordância entre models não prova que um rótulo esteja errado, uma vez que os models são correlacionados em vez de anotadores independentes, mas significa que nenhum model deve ser esperado para se aproximar de 100% neste conjunto.

Executamos todo o benchmark duas vezes. Duas execuções independentes de cinco passadas dos mesmos 12 models nas mesmas 70 imagens, sob as mesmas configurações:

  • Cada model se move em média 1.2 pontos e, no extremo, 4.9 pontos
  • Nove dos doze models mudam de posição entre as duas execuções
  • Três posições se mantêm: primeira, segunda e última

Repetir o experimento chega ao mesmo lugar que os testes de significância, sem executar um teste.

Três coisas que esta execução não estabelece:

  • Os testes relatam falha em detectar uma diferença, não equivalência. Nenhum par de models é mostrado como igual; eles são mostrados como não separados neste tamanho de amostra.
  • Uma fotografia com um rótulo ground-truth é uma tarefa de laboratório. Nomear a emoção em um rosto parado não é o mesmo problema que interpretar um cliente em uma chamada de suporte.
  • Os dois produtos dedicados de IA emocional anteriormente cobertos neste benchmark, Hume e Imentiv IA, não estão nesta execução. Estamos testando novamente ambos e publicaremos suas pontuações sob as mesmas regras de pontuação dos models.

Comparação de ferramentas de computação afetiva

Hume Expression Measurement

Hume Expression Measurement é uma ferramenta de IA emocional que ajuda a identificar e medir emoções humanas. Funciona por meio de um único aplicativo e usa quatro tipos de dados: voz, imagens, vídeo e expressões faciais. Together, esses oferecem uma visão mais profunda e detalhada de como as pessoas expressam emoções.

Experiência na vida real

Este software de reconhecimento de emoções pode não ser sempre 100% preciso, mas captura nuances emocionais de forma eficaz, especialmente por meio de padrões de fala. No entanto, não é perfeito. Às vezes, pode não detectar emoções básicas em explosões vocais. Ainda assim, os resultados emocionais muitas vezes parecem realistas e cheios de nuances.

O Hume é melhor para usuários que desejam uma visão detalhada e responsiva do comportamento emocional, não rótulos simples como “feliz” ou “triste”. O aplicativo web para o software de reconhecimento de emoções é extremamente fácil de usar.

Principais recursos

  • O software fornece uma análise em tempo real de emoções, sentimento e toxicidade para um determinado texto.

Figura 1. Análise de texto para emoções do Hume Expression Measurement

Figura 2. Análise de texto para sentimento do Hume Expression Measurement

Para mais informações sobre análise de sentimento, confira nossos artigos sobre análise de sentimento.

  • Este software de reconhecimento de emoções também detecta emoções em vídeos, imagens e documentos de áudio. Os usuários podem enviar documentos ou preferir usar a própria câmera e os alto-falantes para a detecção de emoções.

O Hume analisa fala, imagens e vídeos usando vários recursos:

  • Expressão facial: Detecta movimentos faciais para entender emoções faciais como alegria, raiva ou tristeza.
  • Explosão vocal: Mede como alguém soa, seja calmo, animado, estressado etc.
  • Prosódia da fala: Rastreia mudanças de tom, altura e ritmo. Isso ajuda a identificar o tom emocional do que alguém está dizendo.

Figura 3. Análise de vídeo do Hume Expression Measurement para prosódia da fala

Mangold Observation Studio

O Mangold Observation Studio é uma plataforma abrangente projetada para pesquisas avançadas baseadas em sensores. Ele reúne muitas fontes de dados, vídeo, áudio, expressões faciais, sinais fisiológicos e muito mais em um sistema sincronizado.

Principais recursos

  • Gravação de vídeo e tela: Captura o comportamento dos participantes e a atividade da tela para contexto completo.
  • Integração de sensores: Suporta EEG, rastreamento ocular, frequência cardíaca, resposta da pele e atividade muscular.
  • Análise de fala: Converte palavras faladas em texto automaticamente.
  • Pesquisas e anotações: Adicione feedback dos participantes ou marque momentos importantes durante as sessões.
  • Design multimodal: Ao contrário de ferramentas que se concentram em um tipo de dado (como expressão facial), o Mangold combina mais de 120 tipos de sensores em uma plataforma.
  • Configuração escalável: Suporta participantes e dispositivos ilimitados ao mesmo tempo, com gravações sincronizadas no tempo.
  • Controle total da rede: Todos os dispositivos podem ser gerenciados a partir de uma estação central.
  • Modular e personalizável: Os pesquisadores podem criar sua própria configuração e integrar com ferramentas externas usando uma API.

Visage SDK

O Visage SDK é um software de reconhecimento de emoções faciais que ajuda as empresas a rastrear e analisar rostos em tempo real. Utiliza visão computacional avançada para entender as emoções, a idade, o gênero e a identidade das pessoas.

Principais recursos

  • Suporte online & offline: Funciona tanto online (na nuvem) quanto offline (no seu dispositivo), então você nem sempre depende de uma conexão com a internet.
  • Privacidade em primeiro lugar: Garante que nenhum dado pessoal, como nomes ou fotos, seja armazenado ou processado sem o seu consentimento.
  • Integração com Unity: Integra-se ao Unity para criar filtros de rosto ou experiências interativas em jogos.

Aplicações

  • Provas virtuais: Use o reconhecimento facial para permitir que os clientes experimentem óculos, maquiagem ou outros produtos virtualmente.
  • Monitoramento do motorista: Detecta comportamentos inseguros ao dirigir, como sonolência ou distração, para aumentar a segurança nas estradas.
  • Monitoramento de passageiros: Rastreia o bem-estar dos passageiros em carros ou no transporte público para melhorar a segurança e o conforto.
  • Realidade aumentada (AR): Crie experiências divertidas e envolventes, como filtros de beleza ou máscaras faciais realistas para redes sociais ou aplicativos.

Imentiv IA

O Imentiv IA é um software de detecção de emoções que ajuda os usuários a entender como as pessoas se sentem, falam e se comportam em conteúdo de vídeo, áudio e texto. Ele combina inteligência artificial com experiência psicológica para analisar emoções e personalidade humanas em tempo real.

Experiência na vida real:

O Imentiv IA ajuda os usuários a analisar emoções em conteúdo de vídeo. Você pode enviar um vídeo completo ou focar em um quadro específico. A ferramenta observa expressões faciais, tom de voz e transcrição para entender sinais emocionais.

A análise parece precisa e cobre uma ampla gama de sinais emocionais. Além das percepções básicas, a plataforma também oferece avaliações psicológicas. Elas podem ser agendadas por meio de um sistema de consultas.

Figura 4. Análise de traços de personalidade do Imentiv IA

Principais recursos

  • Análise multimodal: Analisa vídeo, áudio e texto juntos. Isso dá uma visão mais completa das reações emocionais.
  • Rastreamento de rosto e voz: Detecta múltiplos rostos em cada quadro do vídeo. Associa vozes a rostos ou as analisa separadamente. Mostra qual pessoa está falando e quando.
  • Gráfico de emoções: Mostra emoções faciais em tempo real em um gráfico circular dinâmico. A Roda das Emoções oferece uma visualização clara de como as emoções mudam.
  • Análise de traços de personalidade: Usa o model OCEAN (Abertura, Conscienciosidade, Extroversão, Amabilidade, Neuroticismo) para resumir os traços de personalidade das pessoas no vídeo. Os resultados são exibidos como um gráfico de barras simples com código de cores.
  • Revisão de psicólogos: Psicólogos treinados revisam os resultados da IA para encontrar vieses ocultos e gatilhos emocionais. Isso agrega uma percepção valiosa à análise da IA.
Deixe nossa equipe automatizar um dos seus processos de negócio com agentes de IA, gratuitamente.
Automatizar um processo

RightFlow

O RightFlow é uma ferramenta de IA emocional que analisa expressões faciais para entender como as pessoas se sentem durante sua experiência com uma marca. Ele ajuda as empresas a capturar emoções como felicidade, raiva, medo ou surpresa para melhorar marketing, atendimento ao cliente e design de produtos.

Principais recursos

  • Detecção de zonas quentes: Identifica onde as pessoas passam tempo e o que chama a atenção.
  • Contagem de pessoas: Rastreia quantas pessoas interagem com um espaço ou produto.
  • Análise demográfica: Captura idade e gênero para entender as diferenças do público.
  • Análise de atenção: Mede o movimento da cabeça e dos olhos para saber no que os clientes se concentram.

Ao contrário de ferramentas focadas na detecção de emoções, o RightFlow combina dados emocionais com contagem de clientes, rastreamento demográfico e recursos de segurança física. É projetado para espaços públicos, lojas ou eventos onde a análise em tempo real e sem contato-free é importante.

MoodMe Face IA Emotion Detection Engine

O Face IA Engine da MoodMe é uma ferramenta que lê expressões faciais para detectar emoções em tempo real. Funciona diretamente no dispositivo do usuário, sem necessidade de conexão com a internet ou processamento em nuvem.

Principais recursos

  • Detecção demográfica: O mecanismo pode estimar gênero, idade, etnia e tipo de cabelo. Isso ajuda os aplicativos a entender melhor quem está interagindo com eles.
  • Correspondência facial: O MoodMe inclui uma ferramenta integrada para identificação facial. Ele pode associar um rosto a modelos armazenados localmente para verificações de identidade seguras.
  • Imparcial e inclusivo: A IA é treinada em dados diversos para evitar favorecer qualquer grupo. Isso garante resultados mais justos em diferentes rostos e expressões.
  • Privacidade em primeiro lugar: Todo o processamento acontece no dispositivo do usuário. Os rostos nunca são armazenados nem enviados para a nuvem. Isso protege a privacidade e atende a regulamentações rigorosas de dados.
Não perca os nossos benchmarks e insights baseados em dados. O botão abre o Google; selecionar a AIMultiple confirma que deseja ver a AIMultiple com mais frequência nos resultados de pesquisa do Google.
GoogleAdicionar como fonte preferencial

Affectiva AFFDEX

O The Smart Eye Group fornece software para análise de emoções e produtos com design vestível. O Affectiva AFFDEX 2.0 é um conjunto de ferramentas voltado para analisar as expressões faciais de indivíduos em tempo real. Ele é projetado para analisar unidades de ação facial (AU) e a pose da cabeça para rastrear rostos e detectar emoções.

Principais recursos

  • Rastreamento de múltiplos rostos: A ferramenta pode processar vários rostos ao mesmo tempo.
  • Expressão facial: O AFFDEX 2.0 reconhece 9 emoções básicas a partir de pontos de referência faciais (por exemplo, cantos externos dos olhos, ponta do nariz e queixo). A ferramenta não processa a fala para categorizar emoções.
  • Taxa de piscadas: Detecta algumas outras métricas expressivas faciais (por exemplo, piscadas, valência e atenção).

Hume Empathic Voice Interface (EVI)

O Empathic Voice Interface (EVI) da Hume é um sistema de IA de fala para fala que torna as conversas mais humanas. Ele permite que os usuários criem, clonem e controlem vozes que respondem em tempo real com emoção e personalidade.

Experiência na vida real

Nos testes, as conversas com o EVI pareceram naturais e envolventes. A detecção de emoções funcionou bem. Os usuários puderam orientar o tom e o cenário, embora esse recurso nem sempre funcionasse perfeitamente.

Em resumo, o Empathic Voice Interface da Hume combina resposta rápida, profundidade emocional e alto controle, fazendo com que as conversas com IA soem mais próximas da interação humana real. A interface web da plataforma de conversação é simples e intuitiva de usar.

Figura 6. Análise da conversa do Hume EVI com IA

Principais recursos

  • Voz personalizada: Suporta mais de 100.000 vozes personalizadas, cada uma com características únicas. Você pode até criar vozes como uma “matriarca britânica calmante” ou um “músico caribenho animado” digitando um prompt.
  • Clone uma voz: Envie uma amostra de áudio para criar uma versão digital da sua própria voz.
  • Conversas em tempo real: Responde em cerca de 300 milissegundos, quase tão rápido quanto um humano.

Hume Octave

O Hume Octave é um model de linguagem baseado em voz que entende o significado por trás das palavras. A empresa afirma que ele ajuda a criar conversas com melhor emoção, ritmo e tom.

Experiência na vida real

O Octave frequentemente encontrava a voz certa para um prompt. Ele ajudou a melhorar as descrições de voz e combinou bem os tons. No entanto, a voz final às vezes soava plana ou artificial, como uma atuação fraca. Ainda assim, a ferramenta mostrou forte potencial para capturar diferentes estilos de fala.

Em resumo, o Hume Octave traz significado à voz. Ele ajuda os usuários a criar uma fala mais realista e expressiva que se encaixa tanto nas palavras quanto no momento, e é fácil de usar.

Principais recursos

  • Baixa latência: Começa a falar em 200 milissegundos com o Modo Instantâneo.
  • Vozes personalizadas: Crie vozes do zero, use sua própria voz ou escolha entre muitas opções prontas.
  • Controle de expressão: Adicione instruções no estilo de atuação para moldar como a voz entrega cada linha.
  • Vozes únicas: Com um prompt simples, crie vozes como um “camponês medieval sarcástico” ou um “professor de ciências calmo”.

Revoicer

O Revoicer é um software de texto para voz com tecnologia de IA e reconhecimento de emoções que transforma texto escrito em narrações realistas. Ele afirma criar conteúdo de áudio com tons emocionais que soam mais humanos e menos como tecnologia de IA emocional.

Principais recursos

  • Vozes emocionais: O Revoicer pode falar em tons como alegre, triste, zangado, amigável, sussurrante ou animado.
  • Amplo suporte a idiomas: Funciona em inglês e em mais de 40 outros idiomas, incluindo francês, alemão, árabe e mandarim.
  • Opções personalizadas: Os usuários podem alterar o tom, a velocidade e a entonação da voz. Também podem adicionar pausas ou enfatizar palavras específicas.
  • Muitas vozes: A ferramenta oferece mais de 80 vozes, incluindo vozes masculinas, femininas e infantis. Os usuários também podem escolher entre diferentes sotaques do inglês, como americano, britânico, australiano ou indiano.

Critérios de avaliação

Para avaliar cada ferramenta de IA emocional de forma justa, usamos o mesmo conjunto de critérios em todas as plataformas. Eles incluem:

  • Precisão da detecção de emoções: O quão bem a ferramenta identifica emoções como felicidade, raiva ou surpresa a partir de expressões faciais, voz ou texto.
  • Capacidades multimodais: Se a ferramenta consegue analisar vários tipos de entrada (por exemplo, vídeo, áudio, texto) juntos ou separadamente.
  • Facilidade de uso: O quão intuitiva é a interface para usuários não técnicos, incluindo a configuração e o uso diário.
  • Feedback em tempo real: Se a plataforma consegue fornecer percepções instantâneas durante interações ao vivo ou gravações.
  • Profundidade das percepções: Qualidade e detalhe das análises emocionais, incluindo padrões comportamentais, rastreamento de atenção e detalhamentos demográficos.

Leituras adicionais

Cite este benchmark

Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.

Ezgi Arslan, PhD. (2026) - "Principais Ferramentas de IA Emocional Testadas". Publicado on-line em AIMultiple.com. Acessado em 27 Agosto 2026, em: https://aimultiple.com/emotion-ai-tools [Recurso on-line]

PhD., E. A. (2026, 27 Agosto). Principais Ferramentas de IA Emocional Testadas. AIMultiple. https://aimultiple.com/emotion-ai-tools

@misc{phd2026,
  author = {PhD., Ezgi Arslan,},
  title  = {{Principais Ferramentas de IA Emocional Testadas}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/emotion-ai-tools}},
  note   = {AIMultiple. Acessado em 27 Agosto 2026}
}
Baixar todos os dados

Resultados e carimbos de data/hora de 22 pontos de dados. Baixe os dados utilizados neste artigo como um arquivo ZIP contendo 2 arquivos CSV e um README.

Última atualização: 17 Agosto 2026
Baixar

Registro de alterações

3 atualizações
  1. 2026

    Substituída a seção MorphCast MyMoodScan por uma seção sobre a Affectiva AFFDEX.

  2. Resultados de benchmark atualizados para reconhecimento de emoções.

  3. 2025

    Adicionado um benchmark sobre reconhecimento de emoções à seção de comparação de ferramentas de computação afetiva.

Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
Analista da Indústria
Ezgi possui um doutorado em Administração de Empresas com especialização em finanças e atua como Analista da Indústria na AIMultiple. Ela conduz pesquisas e insights na interseção entre tecnologia e negócios, com experiência em sustentabilidade, análise de pesquisas e de sentimento, aplicações de agentes de IA em finanças, otimização de mecanismos de resposta, gerenciamento de firewall e tecnologias de compras.
Ver perfil completo

Seja o primeiro a comentar

Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.

0/450