Audio2Gestures: Generating Diverse Gestures from Speech Audio with Conditional Variational Autoencoders
Generating conversational gestures from speech audio is challenging due to the inherent one-to-many mapping be-tween audio and body motions. Conventional CNNs/RNNs assume one-to-one mapping, and thus tend to predict the average of all possible target motions, resulting in plain/boring motions during...
Gespeichert in:
| Veröffentlicht in: | Proceedings / IEEE International Conference on Computer Vision S. 11273 - 11282 |
|---|---|
| Hauptverfasser: | , , , , , , |
| Format: | Tagungsbericht |
| Sprache: | Englisch |
| Veröffentlicht: |
IEEE
01.10.2021
|
| Schlagworte: | |
| ISSN: | 2380-7504 |
| Online-Zugang: | Volltext |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Schreiben Sie den ersten Kommentar!