Le contenu de ce site a été traduit à l'aide de l'intelligence artificielle (IA) ou d'une technologie de traduction automatique, et peut contenir des erreurs.

Skip to content
Safety & Civility
Artificial Intelligence
Speech & Audio

Améliorer la détection de la toxicité des propos multilingues grâce à l'alignement parole-texte

View Publication

Author

Joseph Liu (Roblox), Mahesh Kumar Nandwana (Roblox), Janne Pylkkönen (Roblox), Hannes Heikinheimo (Roblox), Morgan McGuire (Roblox)

Venue

Interspeech 2024

Abstract

La classification de la toxicité vocale repose en grande partie sur le contenu sémantique de la parole. Nous proposons un nouveau cadre qui utilise l'apprentissage intermodal pour intégrer l'encodage sémantique du texte dans un classificateur de toxicité vocale à étiquettes multiples pendant l'entraînement. Cela nous permet d'intégrer des informations textuelles pendant l'entraînement tout en ne nécessitant que des données audio lors de l'inférence. Nous évaluons ce classificateur sur des ensembles de données à grande échelle présentant des caractéristiques du monde réel afin de valider l'efficacité de ce cadre. Grâce à des études d'ablation, nous démontrons que les encodages sémantiques de texte à usage général sont riches et alignés avec la parole à des fins de classification de la toxicité. En menant des expériences à grande échelle sur plusieurs langues, nous montrons des améliorations dans la classification de la toxicité vocale sur cinq langues et différentes catégories de toxicité.