{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,25]],"date-time":"2026-03-25T06:13:53Z","timestamp":1774419233355,"version":"3.50.1"},"publisher-location":"Singapore","reference-count":47,"publisher":"Springer Nature Singapore","isbn-type":[{"value":"9789819609000","type":"print"},{"value":"9789819609017","type":"electronic"}],"license":[{"start":{"date-parts":[[2024,12,8]],"date-time":"2024-12-08T00:00:00Z","timestamp":1733616000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,12,8]],"date-time":"2024-12-08T00:00:00Z","timestamp":1733616000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-981-96-0901-7_23","type":"book-chapter","created":{"date-parts":[[2024,12,7]],"date-time":"2024-12-07T07:54:58Z","timestamp":1733558098000},"page":"394-411","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":2,"title":["3D Prompt Learning for\u00a0RGB-D Tracking"],"prefix":"10.1007","author":[{"given":"Bocen","family":"Li","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yunzhi","family":"Zhuge","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Shan","family":"Jiang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Lijun","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yifan","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Huchuan","family":"Lu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2024,12,8]]},"reference":[{"key":"23_CR1","doi-asserted-by":"crossref","unstructured":"Bhat, G., Danelljan, M., Gool, L.V., Timofte, R.: Learning discriminative model prediction for tracking. In: Proceedings of the IEEE\/CVF international conference on computer vision. pp. 6182\u20136191 (2019)","DOI":"10.1109\/ICCV.2019.00628"},{"key":"23_CR2","doi-asserted-by":"crossref","unstructured":"Carion, N., Massa, F., Synnaeve, G., Usunier, N., Kirillov, A., Zagoruyko, S.: End-to-end object detection with transformers. In: European conference on computer vision. pp. 213\u2013229. Springer (2020)","DOI":"10.1007\/978-3-030-58452-8_13"},{"key":"23_CR3","first-page":"16664","volume":"35","author":"S Chen","year":"2022","unstructured":"Chen, S., Ge, C., Tong, Z., Wang, J., Song, Y., Wang, J., Luo, P.: Adaptformer: Adapting vision transformers for scalable visual recognition. Adv. Neural. Inf. Process. Syst. 35, 16664\u201316678 (2022)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"23_CR4","doi-asserted-by":"crossref","unstructured":"Chen, X., Peng, H., Wang, D., Lu, H., Hu, H.: Seqtrack: Sequence to sequence learning for visual object tracking. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition. pp. 14572\u201314581 (2023)","DOI":"10.1109\/CVPR52729.2023.01400"},{"key":"23_CR5","doi-asserted-by":"crossref","unstructured":"Chen, X., Yan, B., Zhu, J., Wang, D., Yang, X., Lu, H.: Transformer tracking. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition. pp. 8126\u20138135 (2021)","DOI":"10.1109\/CVPR46437.2021.00803"},{"key":"23_CR6","doi-asserted-by":"crossref","unstructured":"Chen, Y.H., Wang, C.Y., Yang, C.Y., Chang, H.S., Lin, Y.L., Chuang, Y.Y., Liao, H.Y.M.: Neighbortrack: Improving single object tracking by bipartite matching with neighbor tracklets. arXiv preprint arXiv:2211.06663 (2022)","DOI":"10.1109\/CVPRW59228.2023.00542"},{"key":"23_CR7","doi-asserted-by":"crossref","unstructured":"Cui, Y., Jiang, C., Wang, L., Wu, G.: Mixformer: End-to-end tracking with iterative mixed attention. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition. pp. 13608\u201313618 (2022)","DOI":"10.1109\/CVPR52688.2022.01324"},{"key":"23_CR8","doi-asserted-by":"crossref","unstructured":"Dai, K., Zhao, J., Wang, L., Wang, D., Li, J., Lu, H., Qian, X., Yang, X.: Video annotation for visual tracking via selection and refinement. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision. pp. 10296\u201310305 (2021)","DOI":"10.1109\/ICCV48922.2021.01013"},{"key":"23_CR9","unstructured":"Dosovitskiy, A., Beyer, L., Kolesnikov, A., Weissenborn, D., Zhai, X., Unterthiner, T., Dehghani, M., Minderer, M., Heigold, G., Gelly, S., et\u00a0al.: An image is worth 16x16 words: Transformers for image recognition at scale. arXiv preprint arXiv:2010.11929 (2020)"},{"key":"23_CR10","doi-asserted-by":"crossref","unstructured":"Fan, H., Lin, L., Yang, F., Chu, P., Deng, G., Yu, S., Bai, H., Xu, Y., Liao, C., Ling, H.: Lasot: A high-quality benchmark for large-scale single object tracking. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition. pp. 5374\u20135383 (2019)","DOI":"10.1109\/CVPR.2019.00552"},{"key":"23_CR11","doi-asserted-by":"crossref","unstructured":"He, J., Wang, Y., Wang, L., Lu, H., Luo, B., He, J.Y., Lan, J.P., Geng, Y., Xie, X.: Towards deeply unified depth-aware panoptic segmentation with bi-directional guidance learning. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision. pp. 4111\u20134121 (2023)","DOI":"10.1109\/ICCV51070.2023.00380"},{"key":"23_CR12","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: Proceedings of the IEEE conference on computer vision and pattern recognition. pp. 770\u2013778 (2016)","DOI":"10.1109\/CVPR.2016.90"},{"issue":"5","key":"23_CR13","doi-asserted-by":"publisher","first-page":"1562","DOI":"10.1109\/TPAMI.2019.2957464","volume":"43","author":"L Huang","year":"2019","unstructured":"Huang, L., Zhao, X., Huang, K.: Got-10k: A large high-diversity benchmark for generic object tracking in the wild. IEEE Trans. Pattern Anal. Mach. Intell. 43(5), 1562\u20131577 (2019)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"23_CR14","doi-asserted-by":"crossref","unstructured":"Jia, M., Tang, L., Chen, B.C., Cardie, C., Belongie, S., Hariharan, B., Lim, S.N.: Visual prompt tuning. In: European Conference on Computer Vision. pp. 709\u2013727. Springer (2022)","DOI":"10.1007\/978-3-031-19827-4_41"},{"key":"23_CR15","unstructured":"Jie, S., Deng, Z.H.: Convolutional bypasses are better vision transformer adapters. arXiv preprint arXiv:2207.07039 (2022)"},{"key":"23_CR16","unstructured":"Kristan, M., Leonardis, A., Matas, J., Felsberg, M., Pflugfelder, R., K\u00e4m\u00e4r\u00e4inen, J.K., Chang, H.J., Danelljan, M., Zajc, L.\u010c., Luke\u017ei\u010d, A., et\u00a0al.: The tenth visual object tracking vot2022 challenge results. In: European Conference on Computer Vision. pp. 431\u2013460. Springer (2022)"},{"key":"23_CR17","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"547","DOI":"10.1007\/978-3-030-68238-5_39","volume-title":"Computer Vision \u2013 ECCV 2020 Workshops","author":"M Kristan","year":"2020","unstructured":"Kristan, M., et al.: The Eighth Visual Object Tracking VOT2020 Challenge Results. In: Bartoli, A., Fusiello, A. (eds.) ECCV 2020. LNCS, vol. 12539, pp. 547\u2013601. Springer, Cham (2020). https:\/\/doi.org\/10.1007\/978-3-030-68238-5_39"},{"key":"23_CR18","unstructured":"Kristan, M., Matas, J., Leonardis, A., Felsberg, M., Pflugfelder, R., K\u00e4m\u00e4r\u00e4inen, J.K., Chang, H.J., Danelljan, M., Cehovin, L., Luke\u017ei\u010d, A., et\u00a0al.: The ninth visual object tracking vot2021 challenge results. In: Proceedings of the IEEE\/CVF international conference on computer vision. pp. 2711\u20132738 (2021)"},{"issue":"11","key":"23_CR19","doi-asserted-by":"publisher","first-page":"2137","DOI":"10.1109\/TPAMI.2016.2516982","volume":"38","author":"M Kristan","year":"2016","unstructured":"Kristan, M., Matas, J., Leonardis, A., Voj\u00ed\u0159, T., Pflugfelder, R., Fernandez, G., Nebehay, G., Porikli, F., \u010cehovin, L.: A novel performance evaluation methodology for single-target trackers. IEEE Trans. Pattern Anal. Mach. Intell. 38(11), 2137\u20132155 (2016)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"23_CR20","doi-asserted-by":"crossref","unstructured":"Li, Y., et\u00a0al.: Bevdepth: Acquisition of reliable depth for multi-view 3d object detection. In: AAAI (2023)","DOI":"10.1609\/aaai.v37i2.25233"},{"key":"23_CR21","first-page":"16743","volume":"35","author":"L Lin","year":"2022","unstructured":"Lin, L., Fan, H., Zhang, Z., Xu, Y., Ling, H.: Swintrack: A simple and strong baseline for transformer tracking. Adv. Neural. Inf. Process. Syst. 35, 16743\u201316754 (2022)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"issue":"9","key":"23_CR22","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3560815","volume":"55","author":"P Liu","year":"2023","unstructured":"Liu, P., Yuan, W., Fu, J., Jiang, Z., Hayashi, H., Neubig, G.: Pre-train, prompt, and predict: A systematic survey of prompting methods in natural language processing. ACM Comput. Surv. 55(9), 1\u201335 (2023)","journal-title":"ACM Comput. Surv."},{"key":"23_CR23","doi-asserted-by":"crossref","unstructured":"Lukezic, A., Kart, U., Kapyla, J., Durmush, A., Kamarainen, J.K., Matas, J., Kristan, M.: Cdtb: A color and depth visual object tracking dataset and benchmark. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision. pp. 10013\u201310022 (2019)","DOI":"10.1109\/ICCV.2019.01011"},{"key":"23_CR24","doi-asserted-by":"crossref","unstructured":"Muller, M., Bibi, A., Giancola, S., Alsubaihi, S., Ghanem, B.: Trackingnet: A large-scale dataset and benchmark for object tracking in the wild. In: Proceedings of the European conference on computer vision (ECCV). pp. 300\u2013317 (2018)","DOI":"10.1007\/978-3-030-01246-5_19"},{"key":"23_CR25","doi-asserted-by":"crossref","unstructured":"Qian, Y., Yan, S., Luke\u017ei\u010d, A., Kristan, M., K\u00e4m\u00e4r\u00e4inen, J.K., Matas, J.: Dal: A deep depth-aware long-term tracker. In: 2020 25th International Conference on Pattern Recognition (ICPR). pp. 7825\u20137832. IEEE (2021)","DOI":"10.1109\/ICPR48806.2021.9412984"},{"key":"23_CR26","doi-asserted-by":"crossref","unstructured":"Rombach, R., Blattmann, A., Lorenz, D., Esser, P., Ommer, B.: High-resolution image synthesis with latent diffusion models. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition. pp. 10684\u201310695 (2022)","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"23_CR27","unstructured":"Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A.N., Kaiser, \u0141., Polosukhin, I.: Attention is all you need. Advances in neural information processing systems 30 (2017)"},{"key":"23_CR28","doi-asserted-by":"crossref","unstructured":"Wang, C., Xu, C., Cui, Z., Zhou, L., Zhang, T., Zhang, X., Yang, J.: Cross-modal pattern-propagation for rgb-t tracking. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition. pp. 7064\u20137073 (2020)","DOI":"10.1109\/CVPR42600.2020.00709"},{"key":"23_CR29","doi-asserted-by":"crossref","unstructured":"Wang, L., Wang, Y., Wang, L., Zhan, Y., Wang, Y., Lu, H.: Can scale-consistent monocular depth be learned in a self-supervised scale-invariant manner? In: Proceedings of the IEEE\/CVF international conference on computer vision. pp. 12727\u201312736 (2021)","DOI":"10.1109\/ICCV48922.2021.01249"},{"key":"23_CR30","unstructured":"Wang, X., Li, J., Zhu, L., Zhang, Z., Chen, Z., Li, X., Wang, Y., Tian, Y., Wu, F.: Visevent: Reliable object tracking via collaboration of frame and event flows. arXiv preprint arXiv:2108.05015 (2021)"},{"issue":"5","key":"23_CR31","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3326362","volume":"38","author":"Y Wang","year":"2019","unstructured":"Wang, Y., Sun, Y., Liu, Z., Sarma, S.E., Bronstein, M.M., Solomon, J.M.: Dynamic graph cnn for learning on point clouds. ACM Transactions on Graphics (tog) 38(5), 1\u201312 (2019)","journal-title":"ACM Transactions on Graphics (tog)"},{"key":"23_CR32","doi-asserted-by":"crossref","unstructured":"Wei, X., Bai, Y., Zheng, Y., Shi, D., Gong, Y.: Autoregressive visual tracking. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition. pp. 9697\u20139706 (2023)","DOI":"10.1109\/CVPR52729.2023.00935"},{"key":"23_CR33","doi-asserted-by":"crossref","unstructured":"Wu, Q., Yang, T., Liu, Z., Wu, B., Shan, Y., Chan, A.B.: Dropmae: Masked autoencoders with spatial-attention dropout for tracking tasks. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition. pp. 14561\u201314571 (2023)","DOI":"10.1109\/CVPR52729.2023.01399"},{"key":"23_CR34","doi-asserted-by":"crossref","unstructured":"Wu, Z., Zheng, J., Ren, X., Vasluianu, F.A., Ma, C., Paudel, D.P., Van\u00a0Gool, L., Timofte, R.: Single-model and any-modality for video object tracking. arXiv preprint arXiv:2311.15851 (2023)","DOI":"10.1109\/CVPR52733.2024.01812"},{"key":"23_CR35","doi-asserted-by":"crossref","unstructured":"Xiao, Y., Yang, M., Li, C., Liu, L., Tang, J.: Attribute-based progressive fusion network for rgbt tracking. In: Proceedings of the AAAI Conference on Artificial Intelligence. vol.\u00a036, pp. 2831\u20132838 (2022)","DOI":"10.1609\/aaai.v36i3.20187"},{"key":"23_CR36","doi-asserted-by":"crossref","unstructured":"Yan, B., Peng, H., Fu, J., Wang, D., Lu, H.: Learning spatio-temporal transformer for visual tracking. In: Proceedings of the IEEE\/CVF international conference on computer vision. pp. 10448\u201310457 (2021)","DOI":"10.1109\/ICCV48922.2021.01028"},{"key":"23_CR37","doi-asserted-by":"crossref","unstructured":"Yan, S., Yang, J., K\u00e4pyl\u00e4, J., Zheng, F., Leonardis, A., K\u00e4m\u00e4r\u00e4inen, J.K.: Depthtrack: Unveiling the power of rgbd tracking. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision. pp. 10725\u201310733 (2021)","DOI":"10.1109\/ICCV48922.2021.01055"},{"key":"23_CR38","doi-asserted-by":"crossref","unstructured":"Yang, J., Li, Z., Zheng, F., Leonardis, A., Song, J.: Prompting for multi-modal tracking. In: Proceedings of the 30th ACM International Conference on Multimedia. pp. 3492\u20133500 (2022)","DOI":"10.1145\/3503161.3547851"},{"key":"23_CR39","doi-asserted-by":"crossref","unstructured":"Ye, B., Chang, H., Ma, B., Shan, S., Chen, X.: Joint feature learning and relation modeling for tracking: A one-stream framework. In: European Conference on Computer Vision. pp. 341\u2013357. Springer (2022)","DOI":"10.1007\/978-3-031-20047-2_20"},{"key":"23_CR40","doi-asserted-by":"crossref","unstructured":"Zhang, J., Yang, X., Fu, Y., Wei, X., Yin, B., Dong, B.: Object tracking by jointly exploiting frame and event domain. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision. pp. 13043\u201313052 (2021)","DOI":"10.1109\/ICCV48922.2021.01280"},{"key":"23_CR41","doi-asserted-by":"crossref","unstructured":"Zhang, L., Agrawala, M.: Adding conditional control to text-to-image diffusion models. arXiv preprint arXiv:2302.05543 (2023)","DOI":"10.1109\/ICCV51070.2023.00355"},{"key":"23_CR42","doi-asserted-by":"publisher","first-page":"3335","DOI":"10.1109\/TIP.2021.3060862","volume":"30","author":"P Zhang","year":"2021","unstructured":"Zhang, P., Zhao, J., Bo, C., Wang, D., Lu, H., Yang, X.: Jointly modeling motion and appearance cues for robust rgb-t tracking. IEEE Trans. Image Process. 30, 3335\u20133347 (2021)","journal-title":"IEEE Trans. Image Process."},{"issue":"9","key":"23_CR43","doi-asserted-by":"publisher","first-page":"2536","DOI":"10.1007\/s11263-021-01487-3","volume":"129","author":"Y Zhang","year":"2021","unstructured":"Zhang, Y., Wang, L., Wang, D., Qi, J., Lu, H.: Learning regression and verification networks for robust long-term tracking. Int. J. Comput. Vision 129(9), 2536\u20132547 (2021)","journal-title":"Int. J. Comput. Vision"},{"key":"23_CR44","doi-asserted-by":"crossref","unstructured":"Zhao, H., Chen, J., Wang, L., Lu, H.: Arkittrack: a new diverse dataset for tracking using mobile rgb-d data. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition. pp. 5126\u20135135 (2023)","DOI":"10.1109\/CVPR52729.2023.00496"},{"key":"23_CR45","doi-asserted-by":"crossref","unstructured":"Zhou, J., Wang, L., Lu, H., Huang, K., Shi, X., Liu, B.: Mvsalnet: Multi-view augmentation for rgb-d salient object detection. In: European Conference on Computer Vision. pp. 270\u2013287. Springer (2022)","DOI":"10.1007\/978-3-031-19818-2_16"},{"key":"23_CR46","doi-asserted-by":"crossref","unstructured":"Zhu, J., Lai, S., Chen, X., Wang, D., Lu, H.: Visual prompt multi-modal tracking. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition. pp. 9516\u20139526 (2023)","DOI":"10.1109\/CVPR52729.2023.00918"},{"key":"23_CR47","doi-asserted-by":"crossref","unstructured":"Zhu, X.F., Xu, T., Tang, Z., Wu, Z., Liu, H., Yang, X., Wu, X.J., Kittler, J.: Rgbd1k: A large-scale dataset and benchmark for rgb-d object tracking. In: Proceedings of the AAAI Conference on Artificial Intelligence. vol.\u00a037, pp. 3870\u20133878 (2023)","DOI":"10.1609\/aaai.v37i3.25500"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ACCV 2024"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-981-96-0901-7_23","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,12,7]],"date-time":"2024-12-07T08:15:41Z","timestamp":1733559341000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-981-96-0901-7_23"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,12,8]]},"ISBN":["9789819609000","9789819609017"],"references-count":47,"URL":"https:\/\/doi.org\/10.1007\/978-981-96-0901-7_23","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,12,8]]},"assertion":[{"value":"8 December 2024","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ACCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Asian Conference on Computer Vision","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Hanoi","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Vietnam","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"8 December 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"12 December 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"17","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"accv2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}