Miglioramento del rilevamento della tossicità delle voci multilingue con l'allineamento voce-testo
Author
Venue
Interspeech 2024
Abstract
La classificazione della tossicità vocale si basa in larga misura sul contenuto semantico del discorso. Proponiamo un nuovo framework che utilizza l'apprendimento cross-modale per integrare l'incorporamento semantico del testo in un classificatore multilabel della tossicità vocale durante l'addestramento. Ciò ci consente di incorporare informazioni testuali durante l'addestramento, pur richiedendo solo l'audio durante l'inferenza. Valutiamo questo classificatore su set di dati su larga scala con caratteristiche del mondo reale per convalidare l'efficacia di questo framework. Attraverso studi di ablazione, dimostriamo che gli embedding testuali semantici generici sono ricchi e allineati con il parlato ai fini della classificazione della tossicità. Conducendo esperimenti su più lingue su larga scala, mostriamo miglioramenti nella classificazione della tossicità vocale in cinque lingue e diverse categorie di tossicità.
