{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,21]],"date-time":"2026-05-21T10:05:32Z","timestamp":1779357932826,"version":"3.51.4"},"reference-count":112,"publisher":"Springer Science and Business Media LLC","issue":"4","license":[{"start":{"date-parts":[[2026,3,7]],"date-time":"2026-03-07T00:00:00Z","timestamp":1772841600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2026,3,7]],"date-time":"2026-03-07T00:00:00Z","timestamp":1772841600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100012166","name":"National Key R&D Program of China","doi-asserted-by":"crossref","award":["No.2023YFB4502804"],"award-info":[{"award-number":["No.2023YFB4502804"]}],"id":[{"id":"10.13039\/501100012166","id-type":"DOI","asserted-by":"crossref"}]},{"DOI":"10.13039\/501100014219","name":"National Science Fund for Distinguished Young Scholars","doi-asserted-by":"publisher","award":["No.62025603"],"award-info":[{"award-number":["No.62025603"]}],"id":[{"id":"10.13039\/501100014219","id-type":"DOI","asserted-by":"publisher"}]},{"name":"National Natural Science Fund for Young Scholars of China","award":["No. 62302411"],"award-info":[{"award-number":["No. 62302411"]}]},{"DOI":"10.13039\/501100002858","name":"China Postdoctoral Science Foundation","doi-asserted-by":"publisher","award":["No. 2023M732948"],"award-info":[{"award-number":["No. 2023M732948"]}],"id":[{"id":"10.13039\/501100002858","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Natural Science Foundation of Fujian Province of China","award":["No.2021J01002, No.2022J06001"],"award-info":[{"award-number":["No.2021J01002, No.2022J06001"]}]},{"name":"CCF-NetEase ThunderFire Innovation Research Funding","award":["NO. CCF-Netease 202301"],"award-info":[{"award-number":["NO. CCF-Netease 202301"]}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["No. U21B2037, No. U22B2051, No. 62072389, No. 624B2118"],"award-info":[{"award-number":["No. U21B2037, No. U22B2051, No. 62072389, No. 624B2118"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2026,4]]},"DOI":"10.1007\/s11263-025-02699-7","type":"journal-article","created":{"date-parts":[[2026,3,7]],"date-time":"2026-03-07T15:55:54Z","timestamp":1772898954000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["CoP: Chain of Perception for Referring 3D Instance Segmentation"],"prefix":"10.1007","volume":"134","author":[{"given":"Yiwei","family":"Ma","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jiayi","family":"Ji","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhipeng","family":"Qian","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3912-9306","authenticated-orcid":false,"given":"Xiaoshuai","family":"Sun","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Rongrong","family":"Ji","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2026,3,7]]},"reference":[{"key":"2699_CR1","doi-asserted-by":"crossref","unstructured":"Achlioptas, P., Abdelreheem, A., Xia, F., Elhoseiny, M., & Guibas, L. (2020). Referit3d: Neural listeners for fine-grained 3d object identification in real-world scenes. In: Computer Vision\u2013ECCV 2020: 16th European Conference, Glasgow, UK, August 23\u201328, 2020, Proceedings, Part I 16, pp. 422\u2013440. Springer.","DOI":"10.1007\/978-3-030-58452-8_25"},{"issue":"5","key":"2699_CR2","doi-asserted-by":"publisher","first-page":"1483","DOI":"10.1109\/TPAMI.2019.2956516","volume":"43","author":"Z Cai","year":"2019","unstructured":"Cai, Z., & Vasconcelos, N. (2019). Cascade r-cnn: High quality object detection and instance segmentation. IEEE transactions on pattern analysis and machine intelligence, 43(5), 1483\u20131498.","journal-title":"IEEE transactions on pattern analysis and machine intelligence"},{"issue":"3","key":"2699_CR3","doi-asserted-by":"publisher","first-page":"3798","DOI":"10.1109\/TPAMI.2022.3180564","volume":"45","author":"J Cao","year":"2022","unstructured":"Cao, J., Pang, Y., Anwer, R. M., Cholakkal, H., Khan, F. S., & Shao, L. (2022). Sipmaskv2: Enhanced fast image and video instance segmentation. IEEE Transactions on Pattern Analysis and Machine Intelligence, 45(3), 3798\u20133812.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"2699_CR4","doi-asserted-by":"crossref","unstructured":"Chen, D. Z., Chang, A. X., & Nie\u00dfner, M. (2020). Scanrefer: 3d object localization in rgb-d scans using natural language. In: European Conference on Computer Vision, pp. 202\u2013221. Springer.","DOI":"10.1007\/978-3-030-58565-5_13"},{"issue":"8","key":"2699_CR5","doi-asserted-by":"publisher","first-page":"9339","DOI":"10.1109\/TPAMI.2023.3248294","volume":"45","author":"Y Cheng","year":"2023","unstructured":"Cheng, Y., Wei, F., Bao, J., Chen, D., & Zhang, W. (2023). Adpl: Adaptive dual path learning for domain adaptation of semantic segmentation. IEEE Transactions on Pattern Analysis and Machine Intelligence, 45(8), 9339\u20139356.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"2699_CR6","doi-asserted-by":"crossref","unstructured":"Cho, K., Van Merri\u00ebnboer, B., Gulcehre, C., Bahdanau, D., Bougares, F., Schwenk, H., & Bengio, Y. (2014). Learning phrase representations using rnn encoder-decoder for statistical machine translation. arXiv preprint arXiv:1406.1078.","DOI":"10.3115\/v1\/D14-1179"},{"key":"2699_CR7","unstructured":"Chung, J., Gulcehre, C., Cho, K., & Bengio, Y. (2014). Empirical evaluation of gated recurrent neural networks on sequence modeling. arXiv preprint arXiv:1412.3555"},{"key":"2699_CR8","doi-asserted-by":"crossref","unstructured":"Dai, A., Chang, A. X., Savva, M., Halber, M., Funkhouser, T., & Nie\u00dfner, M. (2017). Scannet: Richly-annotated 3d reconstructions of indoor scenes. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 5828\u20135839.","DOI":"10.1109\/CVPR.2017.261"},{"key":"2699_CR9","doi-asserted-by":"crossref","unstructured":"Damen, D., Doughty, H., Farinella, G. M., Furnari, A., Kazakos, E., Ma, J., Moltisanti, D., Munro, J., Perrett, T., & Price, W., et al. (2022). Rescaling egocentric vision: Collection, pipeline and challenges for epic-kitchens-100. International Journal of Computer Vision, 1\u201323.","DOI":"10.1007\/s11263-021-01531-2"},{"issue":"11","key":"2699_CR10","doi-asserted-by":"publisher","first-page":"13636","DOI":"10.1109\/TPAMI.2023.3296823","volume":"45","author":"J Deng","year":"2023","unstructured":"Deng, J., Yang, Z., Liu, D., Chen, T., Zhou, W., Zhang, Y., Li, H., & Ouyang, W. (2023). Transvg++: End-to-end visual grounding with language conditioned vision transformer. IEEE Transactions on Pattern Analysis and Machine Intelligence, 45(11), 13636\u201313652.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"2699_CR11","doi-asserted-by":"publisher","first-page":"742","DOI":"10.1109\/TPAMI.1986.4767855","volume":"6","author":"A-M Derouault","year":"1986","unstructured":"Derouault, A.-M., & Merialdo, B. (1986). Natural language modeling for phoneme-to-text transcription. IEEE Transactions on Pattern Analysis and Machine Intelligence, 6, 742\u2013749.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"2699_CR12","unstructured":"Devlin, J., Chang, M.-W., Lee, K., & Toutanova, K. (2018). Bert: Pre-training of deep bidirectional transformers for language understanding. arXiv preprint arXiv:1810.04805."},{"issue":"6","key":"2699_CR13","doi-asserted-by":"publisher","first-page":"7900","DOI":"10.1109\/TPAMI.2022.3217852","volume":"45","author":"H Ding","year":"2022","unstructured":"Ding, H., Liu, C., Wang, S., & Jiang, X. (2022). Vlt: Vision-language transformer and query generation for referring segmentation. IEEE Transactions on Pattern Analysis and Machine Intelligence, 45(6), 7900\u20137916.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"issue":"8","key":"2699_CR14","first-page":"4065","volume":"44","author":"J Dong","year":"2021","unstructured":"Dong, J., Li, X., Xu, C., Yang, X., Yang, G., Wang, X., & Wang, M. (2021). Dual encoding for video retrieval by text. IEEE Transactions on Pattern Analysis and Machine Intelligence, 44(8), 4065\u20134080.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"issue":"1","key":"2699_CR15","doi-asserted-by":"publisher","first-page":"85","DOI":"10.2991\/ijcis.d.200120.001","volume":"13","author":"S Du","year":"2020","unstructured":"Du, S., Li, T., Gong, X., & Horng, S.-J. (2020). A hybrid method for traffic flow forecasting using multimodal deep learning. International journal of computational intelligence systems, 13(1), 85\u201397.","journal-title":"International journal of computational intelligence systems"},{"key":"2699_CR16","doi-asserted-by":"crossref","unstructured":"Engelmann, F., Bokeloh, M., Fathi, A., Leibe, B., & Nie\u00dfner, M. (2020). 3d-mpa: Multi-proposal aggregation for 3d semantic instance segmentation. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 9031\u20139040.","DOI":"10.1109\/CVPR42600.2020.00905"},{"key":"2699_CR17","doi-asserted-by":"crossref","unstructured":"Feng, G., Hu, Z., Zhang, L., & Lu, H. (2021). Encoder fusion network with co-attention embedding for referring image segmentation. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 15506\u201315515.","DOI":"10.1109\/CVPR46437.2021.01525"},{"key":"2699_CR18","doi-asserted-by":"crossref","unstructured":"Gao, P., Geng, S., Zhang, R., Ma, T., Fang, R., Zhang, Y., Li, H., & Qiao, Y. (2023). Clip-adapter: Better vision-language models with feature adapters. International Journal of Computer Vision, 1\u201315.","DOI":"10.1007\/s11263-023-01891-x"},{"key":"2699_CR19","doi-asserted-by":"crossref","unstructured":"Girshick, R. (2015). Fast r-cnn. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 1440\u20131448.","DOI":"10.1109\/ICCV.2015.169"},{"key":"2699_CR20","doi-asserted-by":"crossref","unstructured":"Graham, B., Engelcke, M., & Van Der Maaten, L. (2018). 3d semantic segmentation with submanifold sparse convolutional networks. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 9224\u20139232.","DOI":"10.1109\/CVPR.2018.00961"},{"issue":"1","key":"2699_CR21","first-page":"845","volume":"21","author":"J Guo","year":"2020","unstructured":"Guo, J., He, H., He, T., Lausen, L., Li, M., Lin, H., Shi, X., Wang, C., Xie, J., Zha, S., et al. (2020). Gluoncv and gluonnlp: Deep learning in computer vision and natural language processing. The Journal of Machine Learning Research, 21(1), 845\u2013851.","journal-title":"The Journal of Machine Learning Research"},{"key":"2699_CR22","doi-asserted-by":"crossref","unstructured":"He, S., & Ding, H. (2024). Refmask3d: Language-guided transformer for 3d referring segmentation. In: Proceedings of the 32nd ACM International Conference on Multimedia, pp. 8316\u20138325.","DOI":"10.1145\/3664647.3680998"},{"key":"2699_CR23","doi-asserted-by":"crossref","unstructured":"He, S., Ding, H., Jiang, X., & Wen, B. (2024). Segpoint: Segment any point cloud via large language model. In: European Conference on Computer Vision, pp. 349\u2013367. Springer.","DOI":"10.1007\/978-3-031-72670-5_20"},{"key":"2699_CR24","doi-asserted-by":"crossref","unstructured":"He, T., Shen, C., & Van Den Hengel, A. (2021). Dyco3d: Robust instance segmentation of 3d point clouds through dynamic convolution. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 354\u2013363.","DOI":"10.1109\/CVPR46437.2021.00042"},{"key":"2699_CR25","doi-asserted-by":"crossref","unstructured":"He, T., Yin, W., Shen, C., & Hengel, A. (2022). Pointinst3d: Segmenting 3d instances by points. In: European Conference on Computer Vision, pp. 286\u2013302. Springer.","DOI":"10.1007\/978-3-031-20062-5_17"},{"key":"2699_CR26","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., & Sun, J. (2016). Deep residual learning for image recognition. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 770\u2013778.","DOI":"10.1109\/CVPR.2016.90"},{"key":"2699_CR27","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1109\/TPAMI.2022.3216926","volume":"01","author":"T He","year":"2022","unstructured":"He, T., Shen, C., & Hengel, A. (2022). Dynamic convolution for 3d point cloud instance segmentation. IEEE Transactions on Pattern Analysis & Machine Intelligence, 01, 1\u201314.","journal-title":"IEEE Transactions on Pattern Analysis & Machine Intelligence"},{"issue":"2","key":"2699_CR28","doi-asserted-by":"publisher","first-page":"684","DOI":"10.1109\/TPAMI.2019.2911066","volume":"44","author":"R Hong","year":"2019","unstructured":"Hong, R., Liu, D., Mo, X., He, X., & Zhang, H. (2019). Learning to compose and reason with language tree structures for visual grounding. IEEE transactions on pattern analysis and machine intelligence, 44(2), 684\u2013696.","journal-title":"IEEE transactions on pattern analysis and machine intelligence"},{"key":"2699_CR29","doi-asserted-by":"crossref","unstructured":"Hou, J., Dai, A., & Nie\u00dfner, M. (2019). 3d-sis: 3d semantic instance segmentation of rgb-d scans. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 4421\u20134430.","DOI":"10.1109\/CVPR.2019.00455"},{"key":"2699_CR30","doi-asserted-by":"crossref","unstructured":"Hu, Z., Feng, G., Sun, J., Zhang, L., & Lu, H. (2020). Bi-directional relationship inferring network for referring image segmentation. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 4424\u20134433.","DOI":"10.1109\/CVPR42600.2020.00448"},{"key":"2699_CR31","doi-asserted-by":"crossref","unstructured":"Hu, R., Rohrbach, M., & Darrell, T. (2016). Segmentation from natural language expressions. In: Computer Vision\u2013ECCV 2016: 14th European Conference, Amsterdam, The Netherlands, October 11\u201314, 2016, Proceedings, Part I 14, pp. 108\u2013124. Springer.","DOI":"10.1007\/978-3-319-46448-0_7"},{"key":"2699_CR32","doi-asserted-by":"crossref","unstructured":"Hu, J., Shen, L., & Sun, G. (2018). Squeeze-and-excitation networks. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 7132\u20137141.","DOI":"10.1109\/CVPR.2018.00745"},{"key":"2699_CR33","doi-asserted-by":"publisher","first-page":"8805","DOI":"10.1109\/TMM.2023.3241802","volume":"25","author":"G Hua","year":"2023","unstructured":"Hua, G., Liao, M., Tian, S., Zhang, Y., & Zou, W. (2023). Multiple relational learning network for joint referring expression comprehension and segmentation. IEEE Transactions on Multimedia, 25, 8805\u20138816.","journal-title":"IEEE Transactions on Multimedia"},{"key":"2699_CR34","doi-asserted-by":"crossref","unstructured":"Huang, S., Hui, T., Liu, S., Li, G., Wei, Y., Han, J., Liu, L., & Li, B. (2020). Referring image segmentation via cross-modal progressive comprehension. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 10488\u201310497.","DOI":"10.1109\/CVPR42600.2020.01050"},{"key":"2699_CR35","doi-asserted-by":"publisher","first-page":"1610","DOI":"10.1609\/aaai.v35i2.16253","volume":"35","author":"P-H Huang","year":"2021","unstructured":"Huang, P.-H., Lee, H.-H., Chen, H.-T., & Liu, T.-L. (2021). Text-guided graph neural networks for referring 3d instance segmentation. Proceedings of the AAAI Conference on Artificial Intelligence, 35, 1610\u20131618.","journal-title":"Proceedings of the AAAI Conference on Artificial Intelligence"},{"issue":"9","key":"2699_CR36","doi-asserted-by":"publisher","first-page":"2822","DOI":"10.1109\/TCSVT.2018.2870740","volume":"29","author":"J Huang","year":"2018","unstructured":"Huang, J., Zhou, W., Li, H., & Li, W. (2018). Attention-based 3d-cnns for large-vocabulary sign language recognition. IEEE Transactions on Circuits and Systems for Video Technology, 29(9), 2822\u20132832.","journal-title":"IEEE Transactions on Circuits and Systems for Video Technology"},{"key":"2699_CR37","doi-asserted-by":"publisher","first-page":"3244","DOI":"10.1109\/TPAMI.2022.3194555","volume":"47","author":"Z Hu","year":"2022","unstructured":"Hu, Z., Bai, X., Shang, J., Zhang, R., Dong, J., Wang, X., Sun, G., Fu, H., & Tai, C.-L. (2022). Voxel-mesh network for geodesic-aware 3d semantic segmentation of indoor scenes. IEEE Transactions on Pattern Analysis and Machine Intelligence, 47, 3244\u20133256.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"2699_CR38","doi-asserted-by":"crossref","unstructured":"Hui, T., Liu, S., Huang, S., Li, G., Yu, S., Zhang, F., & Han, J. (2020). Linguistic structure guided context modeling for referring image segmentation. In: Computer Vision\u2013ECCV 2020: 16th European Conference, Glasgow, UK, August 23\u201328, 2020, Proceedings, Part X 16, pp. 59\u201375. Springer","DOI":"10.1007\/978-3-030-58607-2_4"},{"issue":"11","key":"2699_CR39","first-page":"8338","volume":"44","author":"Q Hu","year":"2021","unstructured":"Hu, Q., Yang, B., Xie, L., Rosa, S., Guo, Y., Wang, Z., Trigoni, N., & Markham, A. (2021). Learning semantic segmentation of large-scale point clouds with random sampling. IEEE Transactions on Pattern Analysis and Machine Intelligence, 44(11), 8338\u20138354.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"2699_CR40","doi-asserted-by":"crossref","unstructured":"Jain, A., Gkanatsios, N., Mediratta, I., & Fragkiadaki, K. (2022). Bottom up top down detection transformers for language grounding in images and point clouds. In: European Conference on Computer Vision, pp. 417\u2013433. Springer.","DOI":"10.1007\/978-3-031-20059-5_24"},{"issue":"2","key":"2699_CR41","doi-asserted-by":"publisher","first-page":"1533","DOI":"10.1109\/TPAMI.2022.3159589","volume":"45","author":"M Jaritz","year":"2022","unstructured":"Jaritz, M., Vu, T.-H., De Charette, R., Wirbel, \u00c9., & P\u00e9rez, P. (2022). Cross-modal learning for domain adaptation in 3d semantic segmentation. IEEE Transactions on Pattern Analysis and Machine Intelligence, 45(2), 1533\u20131544.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"2699_CR42","doi-asserted-by":"crossref","unstructured":"Jiang, H., Lin, Y., Han, D., Song, S., & Huang, G. (2022). Pseudo-q: Generating pseudo language queries for visual grounding. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 15513\u201315523.","DOI":"10.1109\/CVPR52688.2022.01507"},{"key":"2699_CR43","doi-asserted-by":"crossref","unstructured":"Jiang, L., Zhao, H., Shi, S., Liu, S., Fu, C.-W., & Jia, J. (2020). Pointgroup: Dual-set point grouping for 3d instance segmentation. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 4867\u20134876.","DOI":"10.1109\/CVPR42600.2020.00492"},{"key":"2699_CR44","doi-asserted-by":"crossref","unstructured":"Jing, Y., Kong, T., Wang, W., Wang, L., Li, L., & Tan, T. (2021). Locate then segment: A strong pipeline for referring image segmentation. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 9858\u20139867.","DOI":"10.1109\/CVPR46437.2021.00973"},{"key":"2699_CR45","doi-asserted-by":"crossref","unstructured":"Kamath, A., Singh, M., LeCun, Y., Synnaeve, G., Misra, I., & Carion, N. (2021). Mdetr-modulated detection for end-to-end multi-modal understanding. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp. 1780\u20131790.","DOI":"10.1109\/ICCV48922.2021.00180"},{"issue":"8","key":"2699_CR46","doi-asserted-by":"publisher","first-page":"10197","DOI":"10.1109\/TPAMI.2023.3246174","volume":"45","author":"L Ke","year":"2023","unstructured":"Ke, L., Tai, Y.-W., & Tang, C.-K. (2023). Occlusion-aware instance segmentation via bilayer network architectures. IEEE Transactions on Pattern Analysis and Machine Intelligence, 45(8), 10197\u201310211.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"2699_CR47","unstructured":"Kingma, D. P., & Ba, J. (2014). Adam: A method for stochastic optimization. arXiv preprint arXiv:1412.6980."},{"issue":"1","key":"2699_CR48","doi-asserted-by":"publisher","first-page":"79","DOI":"10.1214\/aoms\/1177729694","volume":"22","author":"S Kullback","year":"1951","unstructured":"Kullback, S., & Leibler, R. A. (1951). On information and sufficiency. The Annals of Mathematical Statistics, 22(1), 79\u201386.","journal-title":"The Annals of Mathematical Statistics"},{"issue":"11","key":"2699_CR49","doi-asserted-by":"publisher","first-page":"2278","DOI":"10.1109\/5.726791","volume":"86","author":"Y Lecun","year":"1998","unstructured":"Lecun, Y., Bottou, L., Bengio, Y., & Haffner, P. (1998). Gradient-based learning applied to document recognition. Proceedings of the IEEE, 86(11), 2278\u20132324. https:\/\/doi.org\/10.1109\/5.726791","journal-title":"Proceedings of the IEEE"},{"key":"2699_CR50","doi-asserted-by":"publisher","first-page":"4266","DOI":"10.1109\/TIP.2022.3181516","volume":"31","author":"Y Liao","year":"2022","unstructured":"Liao, Y., Zhang, A., Chen, Z., Hui, T., & Liu, S. (2022). Progressive language-customized visual feature learning for one-stage visual grounding. IEEE Transactions on Image Processing, 31, 4266\u20134277.","journal-title":"IEEE Transactions on Image Processing"},{"key":"2699_CR51","doi-asserted-by":"publisher","first-page":"1922","DOI":"10.1109\/TMM.2021.3074008","volume":"24","author":"L Lin","year":"2021","unstructured":"Lin, L., Yan, P., Xu, X., Yang, S., Zeng, K., & Li, G. (2021). Structured attention network for referring image segmentation. IEEE Transactions on Multimedia, 24, 1922\u20131932.","journal-title":"IEEE Transactions on Multimedia"},{"key":"2699_CR52","first-page":"19652","volume":"34","author":"M Li","year":"2021","unstructured":"Li, M., & Sigal, L. (2021). Referring transformer: A one-step approach to multi-task visual grounding. Advances in neural information processing systems, 34, 19652\u201319664.","journal-title":"Advances in neural information processing systems"},{"issue":"10","key":"2699_CR53","doi-asserted-by":"publisher","first-page":"5999","DOI":"10.1109\/TCSVT.2023.3263468","volume":"33","author":"H Li","year":"2023","unstructured":"Li, H., Sun, M., Xiao, J., Lim, E. G., & Zhao, Y. (2023). Fully and weakly supervised referring expression segmentation with end-to-end learning. IEEE Transactions on Circuits and Systems for Video Technology, 33(10), 5999\u20136012.","journal-title":"IEEE Transactions on Circuits and Systems for Video Technology"},{"issue":"12","key":"2699_CR54","doi-asserted-by":"publisher","first-page":"9904","DOI":"10.1109\/TPAMI.2021.3132068","volume":"44","author":"Z Li","year":"2021","unstructured":"Li, Z., Sun, Y., Zhang, L., & Tang, J. (2021). Ctnet: Context-based tandem network for semantic segmentation. IEEE Transactions on Pattern Analysis and Machine Intelligence, 44(12), 9904\u20139917.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"2699_CR55","doi-asserted-by":"crossref","unstructured":"Liu, C., Ding, H., & Jiang, X. (2023). Gres: Generalized referring expression segmentation. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 23592\u201323601.","DOI":"10.1109\/CVPR52729.2023.02259"},{"key":"2699_CR56","doi-asserted-by":"crossref","unstructured":"Liu, H., Lin, A., Han, X., Yang, L., Yu, Y., & Cui, S. (2021). Refer-it-in-rgbd: A bottom-up approach for 3d visual grounding in rgbd images. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 6032\u20136041.","DOI":"10.1109\/CVPR46437.2021.00597"},{"key":"2699_CR57","doi-asserted-by":"crossref","unstructured":"Liu, C., Lin, Z., Shen, X., Yang, J., Lu, X., & Yuille, A. (2017). Recurrent multimodal interaction for referring image segmentation. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 1271\u20131280.","DOI":"10.1109\/ICCV.2017.143"},{"key":"2699_CR58","doi-asserted-by":"crossref","unstructured":"Liu, X., Xu, X., Li, J., Zhang, Q., Wang, X., Sebe, N., & Ma, L. (2024). Less: Label-efficient and single-stage referring 3d segmentation. arXiv preprint arXiv:2410.13294.","DOI":"10.52202\/079017-0356"},{"key":"2699_CR59","doi-asserted-by":"publisher","first-page":"3054","DOI":"10.1109\/TIP.2023.3277791","volume":"32","author":"C Liu","year":"2023","unstructured":"Liu, C., Ding, H., Zhang, Y., & Jiang, X. (2023). Multi-modal mutual attention and iterative interaction for referring image segmentation. IEEE Transactions on Image Processing, 32, 3054\u20133065.","journal-title":"IEEE Transactions on Image Processing"},{"issue":"9","key":"2699_CR60","first-page":"4761","volume":"44","author":"S Liu","year":"2021","unstructured":"Liu, S., Hui, T., Huang, S., Wei, Y., Li, B., & Li, G. (2021). Cross-modal progressive comprehension for referring segmentation. IEEE Transactions on Pattern Analysis and Machine Intelligence, 44(9), 4761\u20134775.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"issue":"5","key":"2699_CR61","doi-asserted-by":"publisher","first-page":"2491","DOI":"10.1109\/TCSVT.2022.3223725","volume":"33","author":"D Liu","year":"2022","unstructured":"Liu, D., Zhou, P., Xu, Z., Wang, H., & Li, R. (2022). Few-shot temporal sentence grounding via memory-guided semantic learning. IEEE Transactions on Circuits and Systems for Video Technology, 33(5), 2491\u20132505.","journal-title":"IEEE Transactions on Circuits and Systems for Video Technology"},{"key":"2699_CR62","doi-asserted-by":"crossref","unstructured":"Long, J., Shelhamer, E., & Darrell, T. (2015). Fully convolutional networks for semantic segmentation. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 3431\u20133440.","DOI":"10.1109\/CVPR.2015.7298965"},{"key":"2699_CR63","doi-asserted-by":"crossref","unstructured":"Luo, J., Fu, J., Kong, X., Gao, C., Ren, H., Shen, H., Xia, H., & Liu, S. (2022). 3d-sps: Single-stage 3d visual grounding via referred point progressive selection. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 16454\u201316463.","DOI":"10.1109\/CVPR52688.2022.01596"},{"key":"2699_CR64","doi-asserted-by":"crossref","unstructured":"Luo, G., Zhou, Y., Ji, R., Sun, X., Su, J., Lin, C.-W., & Tian, Q. (2020). Cascade grouped attention network for referring expression segmentation. In: Proceedings of the 28th ACM International Conference on Multimedia, pp. 1274\u20131282.","DOI":"10.1145\/3394171.3414006"},{"key":"2699_CR65","doi-asserted-by":"crossref","unstructured":"Luo, G., Zhou, Y., Sun, X., Cao, L., Wu, C., Deng, C., & Ji, R. (2020). Multi-task collaborative network for joint referring expression comprehension and segmentation. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 10034\u201310043.","DOI":"10.1109\/CVPR42600.2020.01005"},{"key":"2699_CR66","doi-asserted-by":"publisher","first-page":"23","DOI":"10.1007\/s11263-020-01359-2","volume":"129","author":"J Ma","year":"2021","unstructured":"Ma, J., Jiang, X., Fan, A., Jiang, J., & Yan, J. (2021). Image matching from handcrafted to deep features: A survey. International Journal of Computer Vision, 129, 23\u201379.","journal-title":"International Journal of Computer Vision"},{"key":"2699_CR67","doi-asserted-by":"crossref","unstructured":"Margffoy-Tuay, E., P\u00e9rez, J. C., Botero, E., & Arbel\u00e1ez, P. (2018). Dynamic multimodal instance segmentation guided by natural language queries. In: Proceedings of the European Conference on Computer Vision (ECCV), pp. 630\u2013645.","DOI":"10.1007\/978-3-030-01252-6_39"},{"issue":"3","key":"2699_CR68","doi-asserted-by":"publisher","first-page":"1378","DOI":"10.1109\/TCSVT.2021.3069848","volume":"32","author":"H Mei","year":"2021","unstructured":"Mei, H., Liu, Y., Wei, Z., Zhou, D., Wei, X., Zhang, Q., & Yang, X. (2021). Exploring dense context for salient object detection. IEEE Transactions on Circuits and Systems for Video Technology, 32(3), 1378\u20131389.","journal-title":"IEEE Transactions on Circuits and Systems for Video Technology"},{"key":"2699_CR69","unstructured":"Nair, V., & Hinton, G. E. (2010). Rectified linear units improve restricted boltzmann machines. In: Proceedings of the 27th International Conference on Machine Learning (ICML-10), pp. 807\u2013814."},{"key":"2699_CR70","doi-asserted-by":"crossref","unstructured":"Ngo, T.D., Hua, B.-S., & Nguyen, K. (2023). Isbnet: a 3d point cloud instance segmentation network with instance-aware sampling and box-aware dynamic convolution. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 13550\u201313559.","DOI":"10.1109\/CVPR52729.2023.01302"},{"issue":"1","key":"2699_CR71","first-page":"347","volume":"43","author":"Y Niu","year":"2019","unstructured":"Niu, Y., Zhang, H., Lu, Z., & Chang, S.-F. (2019). Variational context: Exploiting visual and textual context for grounding referring expressions. IEEE transactions on pattern analysis and machine intelligence, 43(1), 347\u2013359.","journal-title":"IEEE transactions on pattern analysis and machine intelligence"},{"key":"2699_CR72","doi-asserted-by":"crossref","unstructured":"Pham, Q.-H., Nguyen, T., Hua, B.-S., Roig, G., & Yeung, S.-K. (2019). Jsis3d: Joint semantic-instance segmentation of 3d point clouds with multi-task pointwise networks and multi-value conditional random fields. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 8827\u20138836.","DOI":"10.1109\/CVPR.2019.00903"},{"key":"2699_CR73","doi-asserted-by":"crossref","unstructured":"Qian, Z., Ma, Y., Lin, Z., Ji, J., Zheng, X., Sun, X., & Ji, R. (2024). Multi-branch collaborative learning network for 3d visual grounding. In: European Conference on Computer Vision, pp. 381\u2013398. Springer.","DOI":"10.1007\/978-3-031-72952-2_22"},{"key":"2699_CR74","unstructured":"Radford, A., Kim, J.W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., & Clark, J., et al. (2021). Learning transferable visual models from natural language supervision. In: International Conference on Machine Learning, pp. 8748\u20138763. PMLR."},{"key":"2699_CR75","doi-asserted-by":"crossref","unstructured":"Redmon, J., Divvala, S., Girshick, R., & Farhadi, A. (2016). You only look once: Unified, real-time object detection. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 779\u2013788.","DOI":"10.1109\/CVPR.2016.91"},{"issue":"3","key":"2699_CR76","doi-asserted-by":"publisher","first-page":"1157","DOI":"10.1109\/TCSVT.2021.3126591","volume":"33","author":"J Ren","year":"2021","unstructured":"Ren, J., Hu, X., Zhu, L., Xu, X., Xu, Y., Wang, W., Deng, Z., & Heng, P.-A. (2021). Deep texture-aware features for camouflaged object detection. IEEE Transactions on Circuits and Systems for Video Technology, 33(3), 1157\u20131167.","journal-title":"IEEE Transactions on Circuits and Systems for Video Technology"},{"key":"2699_CR77","unstructured":"Roh, J., Desingh, K., Farhadi, A., & Fox, D. (2022). Languagerefer: Spatial-language model for 3d visual grounding. In: Conference on Robot Learning, pp. 1046\u20131056. PMLR."},{"issue":"1","key":"2699_CR78","doi-asserted-by":"publisher","first-page":"61","DOI":"10.1109\/TNN.2008.2005605","volume":"20","author":"F Scarselli","year":"2008","unstructured":"Scarselli, F., Gori, M., Tsoi, A. C., Hagenbuchner, M., & Monfardini, G. (2008). The graph neural network model. IEEE transactions on neural networks, 20(1), 61\u201380.","journal-title":"IEEE transactions on neural networks"},{"issue":"3","key":"2699_CR79","doi-asserted-by":"publisher","first-page":"379","DOI":"10.1002\/j.1538-7305.1948.tb01338.x","volume":"27","author":"CE Shannon","year":"1948","unstructured":"Shannon, C. E. (1948). A mathematical theory of communication. The Bell system technical journal, 27(3), 379\u2013423.","journal-title":"The Bell system technical journal"},{"key":"2699_CR80","doi-asserted-by":"crossref","unstructured":"Shi, H., Li, H., Meng, F., & Wu, Q. (2018). Key-word-aware network for referring expression image segmentation. In: Proceedings of the European Conference on Computer Vision (ECCV), pp. 38\u201354.","DOI":"10.1007\/978-3-030-01231-1_3"},{"key":"2699_CR81","doi-asserted-by":"publisher","first-page":"154","DOI":"10.1007\/s11263-012-0547-2","volume":"100","author":"M Sun","year":"2012","unstructured":"Sun, M., Bao, S. Y., & Savarese, S. (2012). Object detection using geometrical context feedback. International journal of computer vision, 100, 154\u2013169.","journal-title":"International journal of computer vision"},{"key":"2699_CR82","doi-asserted-by":"crossref","unstructured":"Tang, J., Zheng, G., Shi, C., & Yang, S. (2023). Contrastive grouping with transformer for referring image segmentation. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 23570\u201323580.","DOI":"10.1109\/CVPR52729.2023.02257"},{"issue":"5","key":"2699_CR83","doi-asserted-by":"publisher","first-page":"1239","DOI":"10.1007\/s11263-019-01188-y","volume":"128","author":"A Valada","year":"2020","unstructured":"Valada, A., Mohan, R., & Burgard, W. (2020). Self-supervised model adaptation for multimodal semantic segmentation. International Journal of Computer Vision, 128(5), 1239\u20131285.","journal-title":"International Journal of Computer Vision"},{"key":"2699_CR84","unstructured":"Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, \u0141., & Polosukhin, I. (2017). Attention is all you need. Advances in neural information processing systems30."},{"issue":"4","key":"2699_CR85","doi-asserted-by":"publisher","first-page":"652","DOI":"10.1109\/TPAMI.2016.2587640","volume":"39","author":"O Vinyals","year":"2016","unstructured":"Vinyals, O., Toshev, A., Bengio, S., & Erhan, D. (2016). Show and tell: Lessons learned from the 2015 mscoco image captioning challenge. IEEE transactions on pattern analysis and machine intelligence, 39(4), 652\u2013663.","journal-title":"IEEE transactions on pattern analysis and machine intelligence"},{"key":"2699_CR86","doi-asserted-by":"crossref","unstructured":"Vu, T., Kim, K., Luu, T. M., Nguyen, T., & Yoo, C. D. (2022). Softgroup for 3d instance segmentation on point clouds. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 2708\u20132717.","DOI":"10.1109\/CVPR52688.2022.00273"},{"key":"2699_CR87","doi-asserted-by":"crossref","unstructured":"Wang, Z., Lu, Y., Li, Q., Tao, X., Guo, Y., Gong, M., & Liu, T. (2022). Cris: Clip-driven referring image segmentation. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 11686\u201311695.","DOI":"10.1109\/CVPR52688.2022.01139"},{"issue":"3","key":"2699_CR88","doi-asserted-by":"publisher","first-page":"1019","DOI":"10.1109\/TCSVT.2022.3208256","volume":"33","author":"Z Wang","year":"2022","unstructured":"Wang, Z., Gou, Y., Li, J., Zhu, L., & Shen, H. T. (2022). Language-augmented pixel embedding for generalized zero-shot learning. IEEE Transactions on Circuits and Systems for Video Technology, 33(3), 1019\u20131030.","journal-title":"IEEE Transactions on Circuits and Systems for Video Technology"},{"issue":"11","key":"2699_CR89","first-page":"8587","volume":"44","author":"X Wang","year":"2021","unstructured":"Wang, X., Zhang, R., Shen, C., Kong, T., & Li, L. (2021). Solo: A simple framework for instance segmentation. IEEE transactions on pattern analysis and machine intelligence, 44(11), 8587\u20138601.","journal-title":"IEEE transactions on pattern analysis and machine intelligence"},{"key":"2699_CR90","doi-asserted-by":"crossref","unstructured":"Wu, Y., Cheng, X., Zhang, R., Cheng, Z., & Zhang, J. (2023). Eda: Explicit text-decoupling and dense alignment for 3d visual grounding. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 19231\u201319242.","DOI":"10.1109\/CVPR52729.2023.01843"},{"key":"2699_CR91","doi-asserted-by":"crossref","unstructured":"Wu, C., Liu, Y., Ji, J., Ma, Y., Wang, H., Luo, G., Ding, H., Sun, X., & Ji, R. (2024). 3D-GRES: Generalized 3D Referring Expression Segmentation. arXiv:2407.20664.","DOI":"10.1145\/3664647.3680841"},{"key":"2699_CR92","doi-asserted-by":"crossref","unstructured":"Wu, Y., Shi, M., Du, S., Lu, H., Cao, Z., & Zhong, W. (2022). 3d instances as 1d kernels. In: European Conference on Computer Vision, pp. 235\u2013252. Springer.","DOI":"10.1007\/978-3-031-19818-2_14"},{"key":"2699_CR93","doi-asserted-by":"publisher","first-page":"5940","DOI":"10.1609\/aaai.v38i6.28408","volume":"38","author":"C Wu","year":"2024","unstructured":"Wu, C., Ma, Y., Chen, Q., Wang, H., Luo, G., Ji, J., & Sun, X. (2024). 3d-stmn: Dependency-driven superpoint-text matching network for end-to-end 3d referring expression segmentation. Proceedings of the AAAI Conference on Artificial Intelligence, 38, 5940\u20135948.","journal-title":"Proceedings of the AAAI Conference on Artificial Intelligence"},{"issue":"7","key":"2699_CR94","doi-asserted-by":"publisher","first-page":"9004","DOI":"10.1109\/TPAMI.2023.3237740","volume":"45","author":"B Xie","year":"2023","unstructured":"Xie, B., Li, S., Li, M., Liu, C. H., Huang, G., & Wang, G. (2023). Sepico: Semantic-guided pixel contrast for domain adaptive semantic segmentation. IEEE Transactions on Pattern Analysis and Machine Intelligence, 45(7), 9004\u20139021.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"2699_CR95","doi-asserted-by":"crossref","unstructured":"Xu, L., Huang, M. H., Shang, X., Yuan, Z., Sun, Y., & Liu, J. (2023). Meta compositional referring expression segmentation. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 19478\u201319487.","DOI":"10.1109\/CVPR52729.2023.01866"},{"key":"2699_CR96","doi-asserted-by":"crossref","unstructured":"Yang, S., Li, G., & Yu, Y. (2019). Cross-modal relationship inference for grounding referring expressions. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 4145\u20134154.","DOI":"10.1109\/CVPR.2019.00427"},{"key":"2699_CR97","unstructured":"Yang, B., Wang, J., Clark, R., Hu, Q., Wang, S., Markham, A., & Trigoni, N. (2019). Learning object bounding boxes for 3d instance segmentation on point clouds. Advances in Neural Information Processing Systems32."},{"key":"2699_CR98","doi-asserted-by":"crossref","unstructured":"Yang, Z., Wang, J., Tang, Y., Chen, K., Zhao, H., & Torr, P. H. (2022). Lavt: Language-aware vision transformer for referring image segmentation. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 18155\u201318165.","DOI":"10.1109\/CVPR52688.2022.01762"},{"key":"2699_CR99","doi-asserted-by":"crossref","unstructured":"Yang, S., Xia, M., Li, G., Zhou, H.-Y., & Yu, Y. (2021). Bottom-up shift and reasoning for referring image segmentation. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 11266\u201311275.","DOI":"10.1109\/CVPR46437.2021.01111"},{"key":"2699_CR100","doi-asserted-by":"crossref","unstructured":"Yang, Z., Zhang, S., Wang, L., & Luo, J. (2021). Sat: 2d semantics assisted training for 3d visual grounding. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp. 1856\u20131866.","DOI":"10.1109\/ICCV48922.2021.00187"},{"key":"2699_CR101","doi-asserted-by":"crossref","unstructured":"Ye, L., Rochan, M., Liu, Z., & Wang, Y. (2019). Cross-modal self-attention network for referring image segmentation. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 10502\u201310511.","DOI":"10.1109\/CVPR.2019.01075"},{"issue":"6","key":"2699_CR102","doi-asserted-by":"publisher","first-page":"7696","DOI":"10.1109\/TPAMI.2022.3225323","volume":"45","author":"S Ye","year":"2022","unstructured":"Ye, S., Chen, D., Han, S., & Liao, J. (2022). Robust point cloud segmentation with noisy annotations. IEEE Transactions on Pattern Analysis and Machine Intelligence, 45(6), 7696\u20137710.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"issue":"7","key":"2699_CR103","first-page":"3719","volume":"44","author":"L Ye","year":"2021","unstructured":"Ye, L., Rochan, M., Liu, Z., Zhang, X., & Wang, Y. (2021). Referring segmentation in images and videos with cross-modal self-attention network. IEEE Transactions on Pattern Analysis and Machine Intelligence, 44(7), 3719\u20133732.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"2699_CR104","doi-asserted-by":"crossref","unstructured":"Yi, L., Zhao, W., Wang, H., Sung, M., & Guibas, L. J. (2019). Gspn: Generative shape proposal network for 3d instance segmentation in point cloud. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 3947\u20133956.","DOI":"10.1109\/CVPR.2019.00407"},{"key":"2699_CR105","doi-asserted-by":"crossref","unstructured":"Yu, L., Lin, Z., Shen, X., Yang, J., Lu, X., Bansal, M., & Berg, T. L. (2018). Mattnet: Modular attention network for referring expression comprehension. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 1307\u20131315.","DOI":"10.1109\/CVPR.2018.00142"},{"key":"2699_CR106","doi-asserted-by":"crossref","unstructured":"Yuan, Z., Yan, X., Liao, Y., Zhang, R., Wang, S., Li, Z., & Cui, S. (2021). Instancerefer: Cooperative holistic understanding for visual grounding on point clouds through instance multi-level contextual referring. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp. 1791\u20131800.","DOI":"10.1109\/ICCV48922.2021.00181"},{"key":"2699_CR107","doi-asserted-by":"crossref","unstructured":"Zhang, Y., Gong, Z., & Chang, A. X. (2023). Multi3drefer: Grounding text description to multiple 3d objects. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp. 15225\u201315236.","DOI":"10.1109\/ICCV51070.2023.01397"},{"key":"2699_CR108","doi-asserted-by":"publisher","first-page":"3069","DOI":"10.1007\/s11263-021-01513-4","volume":"129","author":"Y Zhang","year":"2021","unstructured":"Zhang, Y., Wang, C., Wang, X., Zeng, W., & Liu, W. (2021). Fairmot: On the fairness of detection and re-identification in multiple object tracking. International Journal of Computer Vision, 129, 3069\u20133087.","journal-title":"International Journal of Computer Vision"},{"key":"2699_CR109","doi-asserted-by":"crossref","unstructured":"Zhao, W., Yan, Y., Yang, C., Ye, J., Yang, X., & Huang, K. (2022). Divide and conquer: 3d point cloud instance segmentation with point-wise binarization. arXiv preprint arXiv:2207.11209.","DOI":"10.1109\/ICCV51070.2023.00058"},{"issue":"9","key":"2699_CR110","doi-asserted-by":"publisher","first-page":"2337","DOI":"10.1007\/s11263-022-01653-1","volume":"130","author":"K Zhou","year":"2022","unstructured":"Zhou, K., Yang, J., Loy, C. C., & Liu, Z. (2022). Learning to prompt for vision-language models. International Journal of Computer Vision, 130(9), 2337\u20132348.","journal-title":"International Journal of Computer Vision"},{"key":"2699_CR111","doi-asserted-by":"crossref","unstructured":"Zhu, C., Zhou, Y., Shen, Y., Luo, G., Pan, X., Lin, M., Chen, C., Cao, L., Sun, X., & Ji, R. (2022). Seqtr: A simple yet universal network for visual grounding. In: European Conference on Computer Vision, pp. 598\u2013615. Springer.","DOI":"10.1007\/978-3-031-19833-5_35"},{"issue":"3","key":"2699_CR112","doi-asserted-by":"publisher","first-page":"1589","DOI":"10.1109\/TPAMI.2021.3138337","volume":"46","author":"Y Zhu","year":"2021","unstructured":"Zhu, Y., Zhang, Z., Wu, C., Zhang, Z., He, T., Zhang, H., Manmatha, R., Li, M., & Smola, A. J. (2021). Improving semantic segmentation via efficient self-training. IEEE transactions on pattern analysis and machine intelligence, 46(3), 1589\u20131602.","journal-title":"IEEE transactions on pattern analysis and machine intelligence"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-025-02699-7.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11263-025-02699-7","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-025-02699-7.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,5,21]],"date-time":"2026-05-21T09:08:02Z","timestamp":1779354482000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11263-025-02699-7"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,3,7]]},"references-count":112,"journal-issue":{"issue":"4","published-print":{"date-parts":[[2026,4]]}},"alternative-id":["2699"],"URL":"https:\/\/doi.org\/10.1007\/s11263-025-02699-7","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,3,7]]},"assertion":[{"value":"21 February 2024","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"2 September 2025","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"7 March 2026","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare that the research was conducted in the absence of any commercial or financial relationships that could be construed as a potential conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Competing Interests"}},{"value":"The authors have no relevant ethics approval to disclose.","order":3,"name":"Ethics","group":{"name":"EthicsHeading","label":"Ethics Approval"}},{"value":"All authors agreed to participate in this work and made clear contributions.","order":4,"name":"Ethics","group":{"name":"EthicsHeading","label":"Consent to Participate"}},{"value":"All authors agreed with the content that all gave explicit consent to submit and that they obtained consent from the responsible authorities at the institute\/organization where the work has been carried out.","order":5,"name":"Ethics","group":{"name":"EthicsHeading","label":"Consent for Publication"}},{"value":"The code will be publicly available after acceptance.","order":6,"name":"Ethics","group":{"name":"EthicsHeading","label":"Code Availability"}}],"article-number":"169"}}