Améliorer la détection de la toxicité des propos multilingues grâce à l'alignement parole-texte
Author
Venue
Interspeech 2024
Abstract
La classification de la toxicité vocale repose en grande partie sur le contenu sémantique de la parole. Nous proposons un nouveau cadre qui utilise l'apprentissage intermodal pour intégrer l'encodage sémantique du texte dans un classificateur de toxicité vocale à étiquettes multiples pendant l'entraînement. Cela nous permet d'intégrer des informations textuelles pendant l'entraînement tout en ne nécessitant que des données audio lors de l'inférence. Nous évaluons ce classificateur sur des ensembles de données à grande échelle présentant des caractéristiques du monde réel afin de valider l'efficacité de ce cadre. Grâce à des études d'ablation, nous démontrons que les encodages sémantiques de texte à usage général sont riches et alignés avec la parole à des fins de classification de la toxicité. En menant des expériences à grande échelle sur plusieurs langues, nous montrons des améliorations dans la classification de la toxicité vocale sur cinq langues et différentes catégories de toxicité.
