Ulepszanie wykrywania toksyczności wypowiedzi wielojęzycznych dzięki dopasowaniu mowy do tekstu
Author
Venue
Interspeech 2024
Abstract
Klasyfikacja toksyczności wypowiedzi w dużym stopniu opiera się na treści semantycznej mowy. Proponujemy nowatorską strukturę, która wykorzystuje uczenie międzymodalowe do integracji osadzenia semantycznego tekstu w wieloklasowym klasyfikatorze toksyczności mowy podczas szkolenia. Umożliwia to uwzględnienie informacji tekstowych podczas szkolenia, a jednocześnie wymaga jedynie danych audio podczas wnioskowania. Oceniamy ten klasyfikator na dużych zbiorach danych o cechach rzeczywistych, aby zweryfikować skuteczność tej struktury. Poprzez badania ablacyjne wykazujemy, że uniwersalne semantyczne osadzenia tekstowe są bogate i dostosowane do mowy dla celów klasyfikacji toksyczności. Przeprowadzając eksperymenty w wielu językach na dużą skalę, wykazujemy poprawę w klasyfikacji toksyczności głosu w pięciu językach i różnych kategoriach toksyczności.
