CLUE: Contrastive language-guided learning for referring video object segmentation

Referring video object segmentation (R-VOS), the task of separating the object described by a natural language query from the video frames, has become increasingly critical with recent advances in multi-modal understanding. Existing approaches are mainly visual-dominant in both representation-learni...

Ausführliche Beschreibung

Gespeichert in:
Bibliographische Detailangaben
Veröffentlicht in:Pattern recognition letters Jg. 178; S. 115 - 121
Hauptverfasser: Gao, Qiqi, Zhong, Wanjun, Li, Jie, Zhao, Tiejun
Format: Journal Article
Sprache:Englisch
Veröffentlicht: Elsevier B.V 01.02.2024
Schlagworte:
ISSN:0167-8655, 1872-7344
Online-Zugang:Volltext
Tags: Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!