Cross-Modal Object Tracking via Modality-Aware Fusion Network and A Large-Scale Dataset

Liu, Lei; Zhang, Mengya; Li, Cheng; Li, Chenglong; Tang, Jin

Computer Science > Computer Vision and Pattern Recognition

arXiv:2312.14446 (cs)

[Submitted on 22 Dec 2023]

Title:Cross-Modal Object Tracking via Modality-Aware Fusion Network and A Large-Scale Dataset

Authors:Lei Liu, Mengya Zhang, Cheng Li, Chenglong Li, Jin Tang

View PDF HTML (experimental)

Abstract:Visual tracking often faces challenges such as invalid targets and decreased performance in low-light conditions when relying solely on RGB image sequences. While incorporating additional modalities like depth and infrared data has proven effective, existing multi-modal imaging platforms are complex and lack real-world applicability. In contrast, near-infrared (NIR) imaging, commonly used in surveillance cameras, can switch between RGB and NIR based on light intensity. However, tracking objects across these heterogeneous modalities poses significant challenges, particularly due to the absence of modality switch signals during tracking. To address these challenges, we propose an adaptive cross-modal object tracking algorithm called Modality-Aware Fusion Network (MAFNet). MAFNet efficiently integrates information from both RGB and NIR modalities using an adaptive weighting mechanism, effectively bridging the appearance gap and enabling a modality-aware target representation. It consists of two key components: an adaptive weighting module and a modality-specific representation module......

Comments:	In Peer Review
Subjects:	Computer Vision and Pattern Recognition (cs.CV)
Cite as:	arXiv:2312.14446 [cs.CV]
	(or arXiv:2312.14446v1 [cs.CV] for this version)
	https://doi.org/10.48550/arXiv.2312.14446

Submission history

From: Chenglong Li [view email]
[v1] Fri, 22 Dec 2023 05:22:33 UTC (29,790 KB)

Computer Science > Computer Vision and Pattern Recognition

Title:Cross-Modal Object Tracking via Modality-Aware Fusion Network and A Large-Scale Dataset

Submission history

Access Paper:

References & Citations

Bookmark

Bibliographic and Citation Tools

Code, Data and Media Associated with this Article

Demos

Recommenders and Search Tools

arXivLabs: experimental projects with community collaborators

Computer Science > Computer Vision and Pattern Recognition

Title:Cross-Modal Object Tracking via Modality-Aware Fusion Network and A Large-Scale Dataset

Submission history

Access Paper:

References & Citations

BibTeX formatted citation

Bookmark

Bibliographic and Citation Tools

Code, Data and Media Associated with this Article

Demos

Recommenders and Search Tools

arXivLabs: experimental projects with community collaborators