Services
Contactez-nous

Top 7 des méthodes d'analyse de sentiment audio

Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
mis à jour le 3 juil. 2026

Alors que le nombre de consommateurs augmente et que les données des utilisateurs s'accumulent quotidiennement, une explosion des données n'est pas surprenante. Les entreprises utilisent la collecte de données et l'analyse pour améliorer les ventes, les informations clients ou la réputation de la marque. Même si les données vocales sont le feedback le plus direct que les entreprises reçoivent de leurs clients, elles négligent souvent son importance.

Pour mieux comprendre comment les clients évaluent les produits & services, découvrez comment analyser le sentiment dans les fichiers audio, et les huit principales méthodes que les entreprises peuvent mettre en œuvre :

Qu'est-ce que l'analyse de sentiment audio ?

Les méthodes traditionnelles d'analyse de sentiment reposent principalement sur des textes écrits tels que des avis, des retours, des enquêtes, etc. Cependant, comme le langage humain est complexe, des nuances telles que l'ironie, le sarcasme ou les intentions ne sont pas toujours facilement comprises dans le contenu écrit.

Le ton acoustique dans les fichiers audio transporte des informations plus riches et donne de meilleurs aperçus des sentiments.1 Les informations de sentiment peuvent être recueillies à partir de diverses caractéristiques vocales, telles que2

  • la hauteur tonale
  • le volume
  • le ton de la voix
  • d'autres mesures liées à la fréquence

Ainsi, les émotions peuvent être mieux reconnues en combinant l'analyse du ton de la parole et du contenu écrit qu'en considérant uniquement les retours écrits.

Ces dernières années, les entreprises ont commencé à mettre en œuvre des méthodes d'analyse de sentiment audio pour mieux comprendre les sentiments de leurs clients et leur offrir une meilleure expérience.

Comment fonctionne l'analyse de sentiment audio ?

Figure 1. Une comparaison simplifiée de l'analyse de sentiment sur contenu écrit et multimodale (texte + audio)

Ici, vous pouvez voir l'importance de prendre en compte les sources audio lors de l'analyse du sentiment. Lorsque la voix est prise en compte, le sentiment global change dans l'analyse de sentiment audio.

Source : CM-BERT: Cross-Modal BERT for Text-Audio Sentiment Analysis.3

Les étapes de l'analyse de sentiment audio sont :

1. Collecte de l'audio

Collecte des enregistrements audio

Commencez par collecter des enregistrements audio. Vous pouvez utiliser des enregistrements en direct, des fichiers préenregistrés ou des contenus audio provenant de plateformes en ligne.

Assurance de la qualité

Un audio clair est essentiel. Essayez de réduire les bruits de fond et de maintenir un son net. Assurez-vous également que vos données sont diversifiées : différentes voix, tonalités et émotions aideront votre modèle à mieux apprendre.

Prétraitement

Une fois collecté, nettoyez l'audio. Cela inclut la suppression du bruit, l'ajustement du volume et la coupure des silences. Ces étapes préparent l'audio pour les phases suivantes.

2. Transcription en texte

Conversion de l'audio en texte

Les outils de reconnaissance vocale transforment les paroles en texte. Le OpenAI Whisper reste un choix courant, mais les versions actuelles, telles que large-v3 et le plus rapide large-v3-turbo, ont remplacé la version de 2022 que la plupart des guides citent encore. Des options plus récentes, dont les modèles de transcription GPT-4o d'OpenAI, ajoutent une étiquetage automatique des locuteurs. Cela supprime le besoin d'un outil séparé pour distinguer la voix d'un agent de celle d'un client dans un appel enregistré.

Nettoyage du texte

Le texte transcrit peut nécessiter une mise en forme. Vous pouvez supprimer la ponctuation superflue, mettre tous les mots en minuscules ou nettoyer les caractères spéciaux.

3. Choix du modèle

Choisissez un modèle qui fonctionne bien avec l'audio et le texte. Certains modèles sont entraînés sur un langage émotionnel ou parlé. Optez pour un modèle offrant une bonne précision et une bonne flexibilité.

4. Interprétation et utilisation des résultats

Comprendre les résultats

Utilisez les données pour savoir comment les gens se sentent. C'est utile dans des domaines comme le service client, le marketing et les retours publics.

Visualisation des résultats

Affichez les scores de sentiment dans des graphiques, des tableaux ou des tableaux de bord. Cela aide à visualiser rapidement le ton émotionnel de l'audio.

7 méthodes pour mener une analyse de sentiment audio

Il existe sept principales méthodes pour mener une analyse de sentiment audio.

1- Reconnaissance automatique de la parole (ASR)

Figure 2. Un exemple de fonctionnement de l'ASR

Voici une image montrant comment fonctionne la reconnaissance automatique de la parole et comment elle contribue à l'analyse de sentiment audio.

Source : Sentiment extraction from natural audio streams4

Processus : l'ASR transcrit les phrases parlées en texte à l'aide de la reconnaissance vocale. Le texte transcrit est ensuite analysé pour le sentiment à l'aide de techniques de traitement du langage naturel (NLP).

Exemple : Dans les centres d'appels, l'ASR peut transcrire les conversations des clients, permettant aux modèles d'analyse de sentiment de déterminer le sentiment global de l'interaction.

2- WaveNet (Analyse brute de la forme d'onde audio)

Processus : WaveNet analyse directement les formes d'onde audio brutes pour extraire des caractéristiques audio à l'aide de réseaux neuronaux profonds. Cette méthode ne nécessite pas de transcription audio et peut capturer des détails infimes dans le signal audio. C'est une méthode probabiliste qui offre des résultats à la pointe de l'état de l'art avec un jeu de données multimodal (texte+audio).

Exemple : WaveNet peut détecter différentes émotions à partir du ton et de la hauteur de l'audio, fournissant une bonne représentation de l'état émotionnel du locuteur.

WaveNet a été principalement conçu pour générer de la parole, pas pour évaluer le sentiment. Les équipes effectuant aujourd'hui des travaux de sentiment basés sur des formes d'onde brutes se tournent plus souvent vers des encodeurs auto-supervisés tels que Wav2Vec 2.0 ou HuBERT, entraînés spécifiquement pour représenter à la fois le contenu de la parole et les indices vocaux comme le ton.5 L'idée centrale de WaveNet, apprendre directement à partir de la forme d'onde plutôt que de caractéristiques préfabriquées, reste valable. Le modèle spécifique a été largement remplacé par ces encodeurs plus récents.

3- Représentations d'encodeur bidirectionnel multimodal à partir de transformateurs (CM-BERT)

Figure 3. L'architecture du réseau CM-BERT

La figure montre comment fonctionnent les représentations d'encodeur bidirectionnel multimodal à partir de transformateurs. Comme il s'agit d'un cadre multimodal, il peut comparer les informations provenant de différentes modalités telles que l'analyse de sentiment textuel et audio.

Source : CM-BERT: Cross-Modal BERT for Text-Audio Sentiment Analysis.6

Processus : L'approche CM-BERT repose sur l'interaction entre le texte et l'audio et ajuste dynamiquement le poids des mots en comparant les informations issues de différentes modalités. Elle utilise des modèles d'apprentissage automatique pour analyser à la fois le signal audio et sa transcription, en exploitant les forces des deux modalités.

Exemple : Dans un projet analysant des enregistrements audio de podcasts, CM-BERT peut fournir des informations sur le sentiment exprimé à la fois dans les mots prononcés et dans les caractéristiques audio.

4- Coefficients cepstraux en échelle de Mel (MFCCs)

Processus : Les MFCCs sont utilisés pour représenter le spectre de puissance à court terme du son. Ils sont extraits des enregistrements audio et utilisés comme caractéristiques pour les modèles d'analyse de sentiment.

Exemple : En analysant les MFCCs, les modèles d'apprentissage automatique peuvent reconnaître différents états émotionnels dans les fichiers audio, tels que la joie, la tristesse ou la colère.

Les MFCCs restent un ensemble de caractéristiques léger et rapide, et continuent d'être un choix raisonnable pour les équipes disposant de budgets de calcul limités. Des modèles auto-supervisés plus récents, comme Wav2Vec 2.0, HuBERT et emotion2vec, surpassent désormais les systèmes basés sur les MFCCs dans la plupart des benchmarks publiés, car ils apprennent les caractéristiques directement à partir de l'audio brut plutôt que de s'appuyer sur une formule fixe.7 Les équipes cherchant la meilleure précision ont tendance à choisir l'un de ces modèles à la place.

5- Analyse des caractéristiques prosodiques

Processus : Cette méthode analyse les caractéristiques prosodiques comme l'intonation, l'accentuation et le rythme de la parole. Ces caractéristiques sont cruciales pour comprendre le ton émotionnel dans les enregistrements audio.

Exemple : L'analyse des caractéristiques prosodiques peut être utilisée dans les interactions du service client pour identifier le stress ou la frustration dans la voix d'un client, contribuant ainsi à améliorer l'interface utilisateur et les stratégies de réponse.

6- Réseaux neuronaux profonds (DNNs)

Processus : Les DNNs peuvent être entraînés sur de grands ensembles de données d'enregistrements audio pour reconnaître des motifs et classer les sentiments. Ils sont capables d'apprendre des représentations complexes des données audio.

Exemple : Les DNNs peuvent être utilisés dans des projets d'analyse de sentiment où une grande précision est requise, comme dans les publications audio sur les médias sociaux pour évaluer l'opinion publique.

emotion2vec, publié en 2024 et activement maintenu jusqu'en 2026, est un modèle open source spécifiquement entraîné pour extraire des signaux émotionnels de l'audio brut.8 Il fonctionne sur un seul GPU, est free d'utilisation, et est devenu une référence courante dans la recherche sur les émotions vocales : le rôle que joue Whisper pour la transcription.

7- Réseaux de neurones récurrents (RNNs) et réseaux à mémoire à court terme long (LSTM)

Figure 4. Réseaux de neurones récurrents avec deux couches cachées

Source : Classification and prediction of wave chaotic systems with machine learning techniques.9

Processus : Les RNNs et les LSTMs sont conçus pour traiter des données séquentielles, ce qui les rend appropriés pour analyser les dépendances temporelles dans les signaux audio. Ils peuvent capturer la progression des émotions.

Exemple : Dans l'analyse de longs enregistrements audio tels que des entretiens ou des discours, les RNNs et les LSTMs peuvent suivre l'évolution du sentiment tout au long du fichier audio.

8- Grands modèles audio-langagiers (LALMs)

Processus : Un grand modèle audio-langagier lit l'audio et le texte en une seule passe, au sein d'un seul modèle. Les anciennes méthodes divisaient le travail en deux : un modèle transforme la parole en texte, et un modèle séparé lit ce texte pour le sentiment. Diviser le travail fait perdre des informations ; un « C'est super » dit sur un ton plat et monocorde peut être perçu comme positif lorsque seuls les mots sont notés. Un grand modèle audio-langagier conserve le ton, le rythme et le choix des mots ensemble, il détecte donc ce décalage.

Des exemples en production en 2026 incluent GPT-4o Audio d'OpenAI, Gemini 2.5 de Google, et Qwen2.5-Omni d'Alibaba. Chacun accepte directement un clip audio et renvoie une transcription, une étiquette d'émotion, ou les deux, sans exposer une étape de transcription séparée.

Exemple : Une plateforme de support achemine un appel client directement vers l'un de ces modèles. Il renvoie une transcription, un score de sentiment et une note sur les moments où le ton a changé pendant l'appel, le tout en une seule passe sur l'audio.

Compromis : Ces modèles coûtent plus cher à exécuter par minute d'audio que les modèles plus petits et spécialisés. Les équipes traitant des volumes d'appels élevés exécutent souvent un modèle open source léger, comme emotion2vec, en première passe, puis envoient les appels signalés vers un modèle plus grand pour une analyse plus fine.10

article.automate_process_description
article.automate_process_button

Top 8 des applications de l'analyse de sentiment audio

L'analyse de sentiment audio a un large éventail d'applications dans divers domaines, améliorant les processus et fournissant des informations précieuses dans tous les secteurs.

1- Centres d'appels

Dans les centres d'appels, l'analyse de sentiment audio est utilisée pour analyser les interactions avec les clients. En effectuant une analyse de sentiment sur les enregistrements audio, les entreprises peuvent déterminer le sentiment exprimé lors des appels, qu'il soit positif, négatif ou neutre. Ces informations peuvent aider à améliorer le service client en :

  • Identifiant les problèmes : Détecter précocement les sentiments négatifs permet aux agents de centre d'appels de répondre plus efficacement aux préoccupations des clients.
  • À des fins de formation : Comprendre les états émotionnels des clients pendant les appels peut être utilisé pour former les agents, améliorant ainsi leur capacité à gérer différentes émotions.
  • Assurance qualité : Les résultats de l'analyse de sentiment peuvent être utilisés pour surveiller et maintenir la qualité du service, garantissant une satisfaction client constante.

2- Reconnaissance des émotions

La détection de différentes émotions dans les enregistrements audio peut considérablement améliorer les interfaces utilisateur et créer des systèmes d'IA plus empathiques. La reconnaissance des émotions par l'analyse de sentiment audio implique :

  • Expériences personnalisées : Adapter les réponses en fonction des émotions détectées pour offrir une expérience utilisateur plus personnalisée et engageante.
  • Applications de santé mentale : Le suivi des états émotionnels peut aider dans les applications de santé mentale en reconnaissant des signes de stress, d'anxiété ou de dépression dans les enregistrements audio.
  • Assistants virtuels : Améliorer les interactions des assistants virtuels en leur permettant de répondre de manière plus appropriée au ton émotionnel de l'utilisateur.

3- Études de marché

Dans les études de marché, l'analyse de sentiment audio de fichiers audio provenant de groupes de discussion ou de retours clients peut fournir des informations précieuses. En analysant les sentiments dans les réponses parlées, les entreprises peuvent :

  • Comprendre les préférences des consommateurs : Obtenir des informations sur les opinions des clients à propos des produits ou services, aidant les entreprises à prendre des décisions éclairées.
  • Développement de produits : Utiliser les données de sentiment pour guider le développement et l'amélioration des produits en fonction des retours clients.
  • Perception de la marque : Surveiller et analyser le sentiment du public envers une marque, permettant aux entreprises d'ajuster leurs stratégies en conséquence.

4- Surveillance des médias sociaux

L'analyse de sentiment audio peut également être appliquée aux fichiers audio de podcasts ou de contenus vidéo partagés sur les plateformes de médias sociaux. Cette application aide à :

  • Analyse de l'opinion publique : Analyser les sentiments dans les contenus parlés pour évaluer l'opinion publique sur divers sujets.
  • Stratégie de contenu : Influencer les stratégies de création de contenu en comprenant les réactions émotionnelles du public face à différents types de contenu.
  • Analyse des tendances : Identifier les tendances et sentiments émergents dans les conversations sur les médias sociaux, permettant aux entreprises de garder une longueur d'avance dans leurs efforts marketing.

5- Santé

Dans le secteur de la santé, l'analyse de sentiment audio peut être appliquée aux interactions patient-médecin, aux consultations de télémédecine et aux retours des patients. Cela peut conduire à :

  • Amélioration des soins aux patients : Comprendre les émotions des patients peut aider les prestataires de soins de santé à offrir des soins plus empathiques et personnalisés.
  • Détection précoce de conditions : Reconnaître les changements dans l'état émotionnel d'un patient peut aider à la détection précoce de problèmes de santé mentale ou d'autres conditions.
  • Satisfaction des patients : Analyser les retours des patients pour améliorer la qualité des services de santé et garantir la satisfaction des patients.

6- Éducation

Dans le milieu éducatif, l'analyse de sentiment audio peut être utilisée pour analyser les interactions des étudiants, les retours des enseignants et les discussions en classe. Cela peut soutenir :

  • Engagement des étudiants : Comprendre les réponses émotionnelles des étudiants peut aider les éducateurs à ajuster leurs méthodes d'enseignement pour maintenir l'engagement des étudiants.
  • Suivi des performances : Surveiller le sentiment dans les retours des étudiants peut fournir des informations sur l'efficacité des programmes éducatifs et des stratégies d'enseignement.
  • Soutien émotionnel : Identifier les étudiants qui pourraient avoir besoin d'un soutien émotionnel supplémentaire, permettant une intervention rapide.

7- Industrie du divertissement

L'industrie du divertissement peut tirer parti de l'analyse de sentiment audio pour analyser les réactions du public aux films, à la musique et à d'autres contenus médiatiques. Cela peut mener à :

  • Amélioration du contenu : Utiliser les résultats de l'analyse de sentiment pour améliorer les scénarios, les dialogues et le contenu global en fonction des réactions du public.
  • Stratégies marketing : Adapter les campagnes marketing pour mieux résonner avec les réponses émotionnelles du public.
  • Engagement du public : Créer un contenu plus engageant et émotionnellement résonnant en comprenant les sentiments du public.

8- Ressources humaines

Dans les ressources humaines, l'analyse de sentiment audio peut être appliquée aux retours des employés, aux entretiens et aux évaluations de performance. Cela peut améliorer :

  • Satisfaction des employés : Analyser les sentiments dans les retours des employés pour améliorer les conditions de travail et répondre aux préoccupations.
  • Processus de recrutement : Comprendre les réponses émotionnelles des candidats pendant les entretiens pour prendre de meilleures décisions d'embauche.
  • Gestion des performances : Utiliser les données de sentiment pour soutenir les évaluations de performance et fournir un retour constructif.

Règles à connaître avant de déployer l'analyse de sentiment audio dans l'UE

La loi européenne sur l'IA interdit un usage spécifique de cette technologie : déduire les émotions d'un employé à partir de sa voix au travail. Cette interdiction, relevant de l'Article 5(1)(f), fait partie des dispositions sur les pratiques interdites de la loi et s'applique depuis le 2 février 2025.11 Les régulateurs nationaux, y compris la CNIL, ont publié des orientations sur la préparation à l'application de la loi à mesure que le reste de la loi entre en vigueur : les règles relatives à l'IA à usage général sont entrées en vigueur en août 2025, et la plupart des dispositions restantes seront pleinement applicables le 2 août 2026.

Ce qui est interdit

  • Lire les émotions à partir de la voix, du visage ou d'autres signaux biométriques d'un employé pendant les tâches professionnelles, les entretiens ou les évaluations de performance.

Ce qui n'est pas couvert par l'interdiction

  • Les systèmes qui transcrivent une réunion en texte.
  • Les systèmes axés sur la sécurité, tels que les outils de détection de la fatigue du conducteur.

Les deux exceptions

  • Usage médical.
  • Usage de sécurité.
  • Évaluer le niveau de stress d'un agent de service client à des fins de coaching ne relève d'aucune de ces exceptions.

L'usage en contact client est traité différemment : Lire l'humeur d'un client lors d'un appel d'assistance n'est pas interdit par le droit de l'UE. En dehors de l'interdiction sur le lieu de travail et l'éducation, cependant, certains déploiements de reconnaissance des émotions peuvent encore être qualifiés de à haut risque au titre d'une autre partie de la loi (Annexe III) et peuvent déclencher des obligations de transparence supplémentaires en vertu de l'Article 50. La classification dépend du déploiement spécifique, pas du cas d'usage dans son ensemble.12

Sanctions : Les amendes pour violation de l'interdiction sur le lieu de travail peuvent atteindre 35 millions d'euros ou 7% du chiffre d'affaires annuel mondial de l'entreprise, le montant le plus élevé étant retenu.13 Avant même que cette interdiction n'existe, l'autorité de protection des données de la Hongrie a ordonné à une banque d'arrêter d'analyser le ton de la voix des employés en vertu de règles distinctes du RGPD, dans ce qui est maintenant connu comme l'affaire Budapest Bank : un signe que les régulateurs considéraient cela comme un problème au regard de l'ancienne législation sur la vie privée.14

Ce que cela signifie pour les méthodes ci-dessus

  • Évaluer le sentiment des clients dans un centre d'appels reste possible dans toute l'UE, sous réserve des contrôles de haut risque et de transparence mentionnés ci-dessus.
  • Appliquer la même évaluation à la voix d'un agent, pour suivre l'humeur ou le stress pendant un service, est interdit en vertu de l'Article 5(1)(f), sauf si l'exception médicale ou de sécurité s'applique.
  • Les cas d'usage liés aux entretiens et aux évaluations de performance, mentionnés dans la section des ressources humaines ci-dessus, sont généralement purement et simplement interdits plutôt que simplement à haut risque. Traitez-les comme hors limites dans les déploiements dans l'UE sans justification médicale ou de sécurité confirmée, et non comme un « examiner avant de lancer ».
Découvrez davantage de nos benchmarks et analyses basées sur les données dans la recherche Google.
GoogleAjouter comme source préférée

Quel est le succès des outils d'analyse de sentiment audio ?

Un benchmark de 2025, AHELM, a testé la façon dont les grands modèles audio-langagiers gèrent spécifiquement la détection des émotions, parmi neuf autres tâches de compréhension audio.15 Gemini 2.5 Pro de Google menait le groupe globalement, remportant cinq des dix catégories, y compris la détection des émotions. Aucun modèle ne dominait toutes les catégories. Le choix d'un modèle dépend encore du cas d'usage spécifique, pas d'un seul classement.

Une expérience de benchmarking en 2026 a évalué dans quelle mesure les modèles modernes détectent le sentiment directement à partir des signaux de parole.16 Les résultats montrent que l'analyse de sentiment audio peut capturer des indices émotionnels tels que le ton, la hauteur et la vitesse de parole. Ces indices sont souvent perdus lorsque la parole est convertie en texte.

L'étude a testé plusieurs modèles de parole bien connus, dont HuBERT,17 Wav2Vec,18 et Whisper.19 Lorsque les modèles analysaient de courtes phrases prononcées avec des tonalités émotionnelles différentes, les performances étaient relativement bonnes. La précision variait de 78–91%, ce qui indique que ces modèles peuvent détecter des signaux émotionnels clairs dans une parole contrôlée.

Cependant, les performances ont chuté lorsque les modèles ont été testés sur des phrases plus complexes et variées. Dans ces cas, la précision est tombée à environ 54–60%. Les modèles ont rencontré des difficultés parce que le sens des phrases, le style du locuteur et le contexte variaient davantage.

Dans l'ensemble, les résultats suggèrent que les outils d'analyse de sentiment audio peuvent bien fonctionner lorsque les indices émotionnels sont clairs. Cependant, leurs performances diminuent dans les conversations réalistes. Pour cette raison, de nombreux systèmes combinent les signaux audio et l'analyse de texte pour améliorer la fiabilité.

Lectures complémentaires

Citer cette recherche

Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.

Ezgi Arslan, PhD. (2026) - "Top 7 des méthodes d'analyse de sentiment audio". Publié en ligne sur AIMultiple.com. Consulté le 3 Juillet 2026, à : https://aimultiple.com/audio-sentiment-analysis [Ressource en ligne]

PhD., E. A. (2026, 3 Juillet). Top 7 des méthodes d'analyse de sentiment audio. AIMultiple. https://aimultiple.com/audio-sentiment-analysis

@misc{phd2026,
  author = {PhD., Ezgi Arslan,},
  title  = {{Top 7 des méthodes d'analyse de sentiment audio}},
  year   = {2026},
  month  = jul,
  howpublished    = {\url{https://aimultiple.com/audio-sentiment-analysis}},
  note   = {AIMultiple. Consulté le 3 Juillet 2026}
}

Liens de référence

1.
APA PsycNet
2.
Towards Discriminative Representation Learning for Speech Emotion Recognition | IJCAI
3.
CM-BERT | Proceedings of the 28th ACM International Conference on Multimedia
4.
Cerrar este diálogo
5.
Speaker Emotion Recognition: Leveraging Self-Supervised Models for Feature Extraction Using Wav2Vec2 and HuBERT
6.
CM-BERT | Proceedings of the 28th ACM International Conference on Multimedia
7.
https://www.isca-archive.org/interspeech_2025/uniyal25_interspeech.pdf
8.
Speech emotion recognition using fine-tuned Wav2vec2.0 and neural controlled differential equations classifier - PMC
9.
[1908.04716] Classification and prediction of wave chaotic systems with machine learning techniques
arXiv preprint arXiv:1908.04716
10.
emotion2vec (emotion2vec)
11.
EU AI Act Article 5: The Complete Guide to Prohibited AI Practices – eyreACT: AI Compliance Automation Platform
12.
Article 5: Prohibited AI Practices | EU Artificial Intelligence Act
13.
Article 99: Penalties | AI Act Service Desk
14.
https://cjc.eui.eu/data/data/data?idPermanent=858&triial=1
15.
AHELM: A Holistic Evaluation of Audio-Language Models
16.
Sentiment Analysis with Text and Audio Using AWS Generative AI Services: Approaches, Challenges, and Solutions | Artificial Intelligence
17.
[2106.07447] HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units
18.
[2006.11477] wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations
19.
GitHub - openai/whisper: Robust Speech Recognition via Large-Scale Weak Supervision · GitHub
Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
Analyste du secteur
Ezgi est titulaire d'un doctorat en administration des affaires, spécialisée en finance, et travaille comme analyste sectorielle chez AIMultiple. Elle mène des recherches et produit des analyses à l'intersection de la technologie et du commerce, et son expertise couvre le développement durable, les enquêtes et l'analyse des sentiments, les applications d'agents d'IA en finance, l'optimisation des moteurs de réponse, la gestion des pare-feu et les technologies d'approvisionnement.
Voir le profil complet

Soyez le premier à commenter

Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.

0/450