CLUE: Contrastive language-guided learning for referring video object segmentation

Referring video object segmentation (R-VOS), the task of separating the object described by a natural language query from the video frames, has become increasingly critical with recent advances in multi-modal understanding. Existing approaches are mainly visual-dominant in both representation-learni...

Celý popis

Uloženo v:
Podrobná bibliografie
Vydáno v:Pattern recognition letters Ročník 178; s. 115 - 121
Hlavní autoři: Gao, Qiqi, Zhong, Wanjun, Li, Jie, Zhao, Tiejun
Médium: Journal Article
Jazyk:angličtina
Vydáno: Elsevier B.V 01.02.2024
Témata:
ISSN:0167-8655, 1872-7344
On-line přístup:Získat plný text
Tagy: Přidat tag
Žádné tagy, Buďte první, kdo vytvoří štítek k tomuto záznamu!
Buďte první, kdo okomentuje tento záznam!
Nejprve se musíte přihlásit.