2022

Anbruch der Transformer-Ära in der Sprach-Emotionserkennung: Schließen der Valenzlücke

J. Wagner, A. Triantafyllopoulos, H. Wierstorf, M. Schmitt, F. Eyben, B. W. Schuller, F. Burkhardt

Jüngste Fortschritte bei transformatorbasierten Architekturen, die in selbstüberwachter Weise vortrainiert sind, haben sich bei verschiedenen Aufgaben des maschinellen Lernens als sehr vielversprechend erwiesen. Im Audiobereich wurden solche Architekturen auch erfolgreich im Bereich der Sprach-Emotionserkennung (SER) eingesetzt. In den bisherigen Arbeiten wurde jedoch der Einfluss der Modellgröße und der Vortrainingsdaten auf die nachgelagerte Leistung nicht bewertet, und es wurde nur begrenzt auf Generalisierung, Robustheit, Fairness und Effizienz geachtet. Der vorliegende Beitrag führt eine gründliche Analyse dieser Aspekte an mehreren vortrainierten Varianten von wav2vec 2.0 und HuBERT durch.
16. März 2022, CC BY-NC-SA 4.0

Eine wissenschaftliche Veröffentlichung der audEERING GmbH.
Mehr Infos auf unserer Forschungsseite