Distributed Audio-Visual Parsing Based On Multimodal Transformer and Deep Joint Source Channel Coding

Audio-visual parsing (AVP) is a newly emerged multimodal perception task, which detects and classifies audio-visual events in video. However, most existing AVP networks only use a simple attention mechanism to guide audio-visual multimodal events, and are implemented in a single end. This makes it u...

Celý popis

Uloženo v:

Podrobná bibliografie
Vydáno v:	Proceedings of the ... IEEE International Conference on Acoustics, Speech and Signal Processing (1998) s. 4623 - 4627
Hlavní autoři:	Wang, Penghong, Li, Jiahui, Ma, Mengyao, Fan, Xiaopeng
Médium:	Konferenční příspěvek
Jazyk:	angličtina
Vydáno:	IEEE 23.05.2022
Témata:	Channel coding Decoding deep joint source channel coding distributed audio-visual parsing network multimodal transformer Signal processing algorithms Speech coding Training Transformers Visualization
ISSN:	2379-190X
On-line přístup:	Získat plný text
Tagy:	Přidat tag Žádné tagy, Buďte první, kdo vytvoří štítek k tomuto záznamu!

Buďte první, kdo okomentuje tento záznam!