I contenuti di questo sito sono stati tradotti mediante intelligenza artificiale (IA) o tecnologia di traduzione automatica e potrebbero contenere errori.

Skip to content
Safety & Civility
Artificial Intelligence
Speech & Audio

Miglioramento del rilevamento della tossicità delle voci multilingue con l'allineamento voce-testo

View Publication

Author

Joseph Liu (Roblox), Mahesh Kumar Nandwana (Roblox), Janne Pylkkönen (Roblox), Hannes Heikinheimo (Roblox), Morgan McGuire (Roblox)

Venue

Interspeech 2024

Abstract

La classificazione della tossicità vocale si basa in larga misura sul contenuto semantico del discorso. Proponiamo un nuovo framework che utilizza l'apprendimento cross-modale per integrare l'incorporamento semantico del testo in un classificatore multilabel della tossicità vocale durante l'addestramento. Ciò ci consente di incorporare informazioni testuali durante l'addestramento, pur richiedendo solo l'audio durante l'inferenza. Valutiamo questo classificatore su set di dati su larga scala con caratteristiche del mondo reale per convalidare l'efficacia di questo framework. Attraverso studi di ablazione, dimostriamo che gli embedding testuali semantici generici sono ricchi e allineati con il parlato ai fini della classificazione della tossicità. Conducendo esperimenti su più lingue su larga scala, mostriamo miglioramenti nella classificazione della tossicità vocale in cinque lingue e diverse categorie di tossicità.