{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,3]],"date-time":"2026-03-03T14:58:28Z","timestamp":1772549908461,"version":"3.50.1"},"publisher-location":"New York, NY, USA","reference-count":95,"publisher":"ACM","license":[{"start":{"date-parts":[[2020,10,12]],"date-time":"2020-10-12T00:00:00Z","timestamp":1602460800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2020,10,12]]},"DOI":"10.1145\/3394171.3413647","type":"proceedings-article","created":{"date-parts":[[2020,10,12]],"date-time":"2020-10-12T13:10:18Z","timestamp":1602508218000},"page":"934-954","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":22,"title":["RGB2LIDAR"],"prefix":"10.1145","author":[{"given":"Niluthpol Chowdhury","family":"Mithun","sequence":"first","affiliation":[{"name":"SRI International, Princeton, NJ, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Karan","family":"Sikka","sequence":"additional","affiliation":[{"name":"SRI International, Princeton, NJ, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Han-Pang","family":"Chiu","sequence":"additional","affiliation":[{"name":"SRI International, Princeton, NJ, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Supun","family":"Samarasekera","sequence":"additional","affiliation":[{"name":"SRI International, Princeton, NJ, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Rakesh","family":"Kumar","sequence":"additional","affiliation":[{"name":"SRI International, Princeton, NJ, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2020,10,12]]},"reference":[{"key":"e_1_3_2_2_1_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00523"},{"key":"e_1_3_2_2_2_1","volume-title":"Asian Conference on Computer Vision. 178--195","author":"Arandjelovi\u0107 Relja","year":"2014","unstructured":"Relja Arandjelovi\u0107 and Andrew Zisserman . 2014 . Visual vocabulary with a semantic twist . In Asian Conference on Computer Vision. 178--195 . Relja Arandjelovi\u0107 and Andrew Zisserman. 2014. Visual vocabulary with a semantic twist. In Asian Conference on Computer Vision. 178--195."},{"key":"e_1_3_2_2_3_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2015.7140088"},{"key":"e_1_3_2_2_4_1","doi-asserted-by":"publisher","DOI":"10.1109\/TVCG.2015.2459772"},{"key":"e_1_3_2_2_5_1","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-011-0458-7"},{"key":"e_1_3_2_2_6_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2012.6224716"},{"key":"e_1_3_2_2_7_1","volume-title":"SegNet: A Deep Convolutional Encoder-Decoder Architecture for Image Segmentation","author":"Badrinarayanan Vijay","year":"2017","unstructured":"Vijay Badrinarayanan , Alex Kendall , and Roberto Cipolla . 2017. SegNet: A Deep Convolutional Encoder-Decoder Architecture for Image Segmentation . IEEE Transactions on Pattern Analysis and Machine Intelligence ( 2017 ). Vijay Badrinarayanan, Alex Kendall, and Roberto Cipolla. 2017. SegNet: A Deep Convolutional Encoder-Decoder Architecture for Image Segmentation. IEEE Transactions on Pattern Analysis and Machine Intelligence (2017)."},{"key":"e_1_3_2_2_8_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2014.508"},{"key":"e_1_3_2_2_9_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCVW.2015.137"},{"key":"e_1_3_2_2_10_1","volume-title":"Cross-Modal Image-Text Retrieval with Semantic Consistency. In ACM International Conference on Multimedia. 1749--1757","author":"Chen Hui","year":"2019","unstructured":"Hui Chen , Guiguang Ding , Zijia Lin , Sicheng Zhao , and Jungong Han . 2019 . Cross-Modal Image-Text Retrieval with Semantic Consistency. In ACM International Conference on Multimedia. 1749--1757 . Hui Chen, Guiguang Ding, Zijia Lin, Sicheng Zhao, and Jungong Han. 2019. Cross-Modal Image-Text Retrieval with Semantic Consistency. In ACM International Conference on Multimedia. 1749--1757."},{"key":"e_1_3_2_2_11_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.168"},{"key":"e_1_3_2_2_12_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2017.7989366"},{"key":"e_1_3_2_2_13_1","volume-title":"Convolutional neural network-based place recognition. arXiv preprint arXiv:1411.1509","author":"Chen Zetao","year":"2014","unstructured":"Zetao Chen , Obadiah Lam , Adam Jacobson , and Michael Milford . 2014. Convolutional neural network-based place recognition. arXiv preprint arXiv:1411.1509 ( 2014 ). Zetao Chen, Obadiah Lam, Adam Jacobson, and Michael Milford. 2014. Convolutional neural network-based place recognition. arXiv preprint arXiv:1411.1509 (2014)."},{"key":"e_1_3_2_2_14_1","volume-title":"Augmented Reality Driving Using Semantic Geo-Registration. In IEEE Conference on Virtual Reality and 3D User Interfaces. IEEE, 423--430","author":"Chiu Han-Pang","year":"2018","unstructured":"Han-Pang Chiu , Varun Murali , Ryan Villamil , G Drew Kessler , Supun Samarasekera , and Rakesh Kumar . 2018 . Augmented Reality Driving Using Semantic Geo-Registration. In IEEE Conference on Virtual Reality and 3D User Interfaces. IEEE, 423--430 . Han-Pang Chiu, Varun Murali, Ryan Villamil, G Drew Kessler, Supun Samarasekera, and Rakesh Kumar. 2018. Augmented Reality Driving Using Semantic Geo-Registration. In IEEE Conference on Virtual Reality and 3D User Interfaces. IEEE, 423--430."},{"key":"e_1_3_2_2_15_1","doi-asserted-by":"publisher","DOI":"10.1109\/WACV.2018.00191"},{"key":"e_1_3_2_2_16_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-15549-9_49"},{"key":"e_1_3_2_2_17_1","volume-title":"The Cityscapes Dataset for Semantic Urban Scene Understanding. In IEEE Conference on Computer Vision and Pattern Recognition.","author":"Cordts Marius","year":"2016","unstructured":"Marius Cordts , Mohamed Omran , Sebastian Ramos , Timo Rehfeld , Markus Enzweiler , Rodrigo Benenson , Uwe Franke , Stefan Roth , and Bernt Schiele . 2016 . The Cityscapes Dataset for Semantic Urban Scene Understanding. In IEEE Conference on Computer Vision and Pattern Recognition. Marius Cordts, Mohamed Omran, Sebastian Ramos, Timo Rehfeld, Markus Enzweiler, Rodrigo Benenson, Uwe Franke, Stefan Roth, and Bernt Schiele. 2016. The Cityscapes Dataset for Semantic Urban Scene Understanding. In IEEE Conference on Computer Vision and Pattern Recognition."},{"key":"e_1_3_2_2_18_1","volume-title":"International Conference on Machine Learning. 3--10","author":"Cummins Mark J","year":"2010","unstructured":"Mark J Cummins and Paul M Newman . 2010 . Fab-map: Appearance-based place recognition and mapping using a learned visual vocabulary model . In International Conference on Machine Learning. 3--10 . Mark J Cummins and Paul M Newman. 2010. Fab-map: Appearance-based place recognition and mapping using a learned visual vocabulary model. In International Conference on Machine Learning. 3--10."},{"key":"e_1_3_2_2_19_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00269"},{"key":"e_1_3_2_2_20_1","volume-title":"Word2VisualVec: Image and Video to Sentence Matching by Visual Feature Prediction. arXiv preprint arXiv:1604.06838","author":"Dong Jianfeng","year":"2016","unstructured":"Jianfeng Dong , Xirong Li , and Cees GM Snoek . 2016. Word2VisualVec: Image and Video to Sentence Matching by Visual Feature Prediction. arXiv preprint arXiv:1604.06838 ( 2016 ). Jianfeng Dong, Xirong Li, and Cees GM Snoek. 2016. Word2VisualVec: Image and Video to Sentence Matching by Visual Feature Prediction. arXiv preprint arXiv:1604.06838 (2016)."},{"key":"e_1_3_2_2_21_1","volume-title":"VSE: Improved Visual-Semantic Embeddings. In British Machine Vision Conference.","author":"Faghri Fartash","year":"2018","unstructured":"Fartash Faghri , David J Fleet , Jamie Ryan Kiros , and Sanja Fidler . 2018 . VSE: Improved Visual-Semantic Embeddings. In British Machine Vision Conference. Fartash Faghri, David J Fleet, Jamie Ryan Kiros, and Sanja Fidler. 2018. VSE: Improved Visual-Semantic Embeddings. In British Machine Vision Conference."},{"key":"e_1_3_2_2_22_1","doi-asserted-by":"publisher","DOI":"10.1109\/TBME.2012.2205687"},{"key":"e_1_3_2_2_23_1","volume-title":"et almbox","author":"Frome Andrea","year":"2013","unstructured":"Andrea Frome , Greg S Corrado , Jon Shlens , Samy Bengio , Jeff Dean , Tomas Mikolov , et almbox . 2013 . Devise : A deep visual-semantic embedding model. In Advances in neural information processing systems. 2121--2129. Andrea Frome, Greg S Corrado, Jon Shlens, Samy Bengio, Jeff Dean, Tomas Mikolov, et almbox. 2013. Devise: A deep visual-semantic embedding model. In Advances in neural information processing systems. 2121--2129."},{"key":"e_1_3_2_2_24_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.robot.2014.11.009"},{"key":"e_1_3_2_2_25_1","volume-title":"International journal of computer vision","author":"Gong Yunchao","year":"2014","unstructured":"Yunchao Gong , Qifa Ke , Michael Isard , and Svetlana Lazebnik . 2014. A multi-view embedding space for modeling internet images, tags, and their semantics . International journal of computer vision , Vol. 106 , 2 ( 2014 ), 210--233. Yunchao Gong, Qifa Ke, Michael Isard, and Svetlana Lazebnik. 2014. A multi-view embedding space for modeling internet images, tags, and their semantics. International journal of computer vision, Vol. 106, 2 (2014), 210--233."},{"key":"e_1_3_2_2_26_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.309"},{"key":"e_1_3_2_2_27_1","volume-title":"net: A new large-scale point cloud classification benchmark. arXiv preprint arXiv:1704.03847","author":"Hackel Timo","year":"2017","unstructured":"Timo Hackel , Nikolay Savinov , Lubor Ladicky , Jan D Wegner , Konrad Schindler , and Marc Pollefeys . 2017. Semantic3d. net: A new large-scale point cloud classification benchmark. arXiv preprint arXiv:1704.03847 ( 2017 ). Timo Hackel, Nikolay Savinov, Lubor Ladicky, Jan D Wegner, Konrad Schindler, and Marc Pollefeys. 2017. Semantic3d. net: A new large-scale point cloud classification benchmark. arXiv preprint arXiv:1704.03847 (2017)."},{"key":"e_1_3_2_2_28_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2008.4587784"},{"key":"e_1_3_2_2_29_1","doi-asserted-by":"publisher","DOI":"10.5244\/C.31.143"},{"key":"e_1_3_2_2_30_1","volume-title":"CVM-Net: Cross-View Matching Network for Image-Based Ground-to-Aerial Geo-Localization. In IEEE Conference on Computer Vision and Pattern Recognition.","author":"Hu Sixing","year":"2018","unstructured":"Sixing Hu , Mengdan Feng , Rang MH Nguyen , and G Hee Lee . 2018 . CVM-Net: Cross-View Matching Network for Image-Based Ground-to-Aerial Geo-Localization. In IEEE Conference on Computer Vision and Pattern Recognition. Sixing Hu, Mengdan Feng, Rang MH Nguyen, and G Hee Lee. 2018. CVM-Net: Cross-View Matching Network for Image-Based Ground-to-Aerial Geo-Localization. In IEEE Conference on Computer Vision and Pattern Recognition."},{"key":"e_1_3_2_2_31_1","volume-title":"Learning Social Image Embedding with Deep Multimodal Attention Networks. In Thematic Workshops of ACM Multimedia. ACM, 460--468","author":"Huang Feiran","year":"2017","unstructured":"Feiran Huang , Xiaoming Zhang , Zhoujun Li , Tao Mei , Yueying He , and Zhonghua Zhao . 2017 . Learning Social Image Embedding with Deep Multimodal Attention Networks. In Thematic Workshops of ACM Multimedia. ACM, 460--468 . Feiran Huang, Xiaoming Zhang, Zhoujun Li, Tao Mei, Yueying He, and Zhonghua Zhao. 2017. Learning Social Image Embedding with Deep Multimodal Attention Networks. In Thematic Workshops of ACM Multimedia. ACM, 460--468."},{"key":"e_1_3_2_2_32_1","volume-title":"Learning Robust Visual-Semantic Embeddings. In IEEE Conference on Computer Vision and Pattern Recognition. 3571--3580","author":"Hubert Tsai Yao-Hung","year":"2017","unstructured":"Yao-Hung Hubert Tsai , Liang-Kang Huang , and Ruslan Salakhutdinov . 2017 . Learning Robust Visual-Semantic Embeddings. In IEEE Conference on Computer Vision and Pattern Recognition. 3571--3580 . Yao-Hung Hubert Tsai, Liang-Kang Huang, and Ruslan Salakhutdinov. 2017. Learning Robust Visual-Semantic Embeddings. In IEEE Conference on Computer Vision and Pattern Recognition. 3571--3580."},{"key":"e_1_3_2_2_33_1","volume-title":"et almbox","author":"Huval Brody","year":"2015","unstructured":"Brody Huval , Tao Wang , Sameep Tandon , Jeff Kiske , Will Song , Joel Pazhayampallil , Mykhaylo Andriluka , Pranav Rajpurkar , Toki Migimatsu , Royce Cheng-Yue , et almbox . 2015 . An empirical evaluation of deep learning on highway driving. arXiv preprint arXiv:1504.01716 (2015). Brody Huval, Tao Wang, Sameep Tandon, Jeff Kiske, Will Song, Joel Pazhayampallil, Mykhaylo Andriluka, Pranav Rajpurkar, Toki Migimatsu, Royce Cheng-Yue, et almbox. 2015. An empirical evaluation of deep learning on highway driving. arXiv preprint arXiv:1504.01716 (2015)."},{"key":"e_1_3_2_2_34_1","unstructured":"Andrej Karpathy Armand Joulin and Fei-Fei Li. 2014. Deep fragment embeddings for bidirectional image sentence mapping. In Advances in Neural Information Processing Systems. 1889--1897.  Andrej Karpathy Armand Joulin and Fei-Fei Li. 2014. Deep fragment embeddings for bidirectional image sentence mapping. In Advances in Neural Information Processing Systems. 1889--1897."},{"key":"e_1_3_2_2_35_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298932"},{"key":"e_1_3_2_2_36_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.181"},{"key":"e_1_3_2_2_37_1","volume-title":"Unifying visual-semantic embeddings with multimodal neural language models. arXiv preprint arXiv:1411.2539","author":"Kiros Ryan","year":"2014","unstructured":"Ryan Kiros , Ruslan Salakhutdinov , and Richard S Zemel . 2014. Unifying visual-semantic embeddings with multimodal neural language models. arXiv preprint arXiv:1411.2539 ( 2014 ). Ryan Kiros, Ruslan Salakhutdinov, and Richard S Zemel. 2014. Unifying visual-semantic embeddings with multimodal neural language models. arXiv preprint arXiv:1411.2539 (2014)."},{"key":"e_1_3_2_2_38_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7299073"},{"key":"e_1_3_2_2_39_1","volume-title":"arXiv preprint arXiv:1804.07755","author":"Lample Guillaume","year":"2018","unstructured":"Guillaume Lample , Myle Ott , Alexis Conneau , Ludovic Denoyer , and Marc'Aurelio Ranzato . 2018. Phrase-Based & Neural Unsupervised Machine Translation . arXiv preprint arXiv:1804.07755 ( 2018 ). Guillaume Lample, Myle Ott, Alexis Conneau, Ludovic Denoyer, and Marc'Aurelio Ranzato. 2018. Phrase-Based & Neural Unsupervised Machine Translation. arXiv preprint arXiv:1804.07755 (2018)."},{"key":"e_1_3_2_2_40_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00479"},{"key":"e_1_3_2_2_41_1","doi-asserted-by":"publisher","DOI":"10.1109\/IVS.2013.6629483"},{"key":"e_1_3_2_2_42_1","first-page":"1","article-title":"Map-Based Precision Vehicle Localization in Urban Environments","volume":"4","author":"Levinson Jesse","year":"2007","unstructured":"Jesse Levinson , Michael Montemerlo , and Sebastian Thrun . 2007 . Map-Based Precision Vehicle Localization in Urban Environments .. In Robotics: Science and Systems III , Vol. 4. 1 -- 8 . Jesse Levinson, Michael Montemerlo, and Sebastian Thrun. 2007. Map-Based Precision Vehicle Localization in Urban Environments.. In Robotics: Science and Systems III, Vol. 4. 1--8.","journal-title":"Robotics: Science and Systems III"},{"key":"e_1_3_2_2_43_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-33718-5_2"},{"key":"e_1_3_2_2_44_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00218"},{"key":"e_1_3_2_2_45_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2013.120"},{"key":"e_1_3_2_2_46_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7299135"},{"key":"e_1_3_2_2_47_1","doi-asserted-by":"publisher","DOI":"10.1109\/TRO.2015.2496823"},{"key":"e_1_3_2_2_48_1","volume-title":"International Conference on Learning Representations Workshops.","author":"Mahmood Faisal","year":"2019","unstructured":"Faisal Mahmood , Wenhao Xu , Nicholas J Durr , Jeremiah W Johnson , and Alan Yuille . 2019 . Structured Prediction using cGANs with Fusion Discriminator . In International Conference on Learning Representations Workshops. Faisal Mahmood, Wenhao Xu, Nicholas J Durr, Jeremiah W Johnson, and Alan Yuille. 2019. Structured Prediction using cGANs with Fusion Discriminator. In International Conference on Learning Representations Workshops."},{"key":"e_1_3_2_2_49_1","volume-title":"International Conference on Learning Representations","author":"Mao Junhua","year":"2015","unstructured":"Junhua Mao , Wei Xu , Yi Yang , Jiang Wang , Zhiheng Huang , and Alan Yuille . 2015 . Deep captioning with multimodal recurrent neural networks (m-rnn) . International Conference on Learning Representations (2015). Junhua Mao, Wei Xu, Yi Yang, Jiang Wang, Zhiheng Huang, and Alan Yuille. 2015. Deep captioning with multimodal recurrent neural networks (m-rnn). International Conference on Learning Representations (2015)."},{"key":"e_1_3_2_2_50_1","doi-asserted-by":"publisher","DOI":"10.1109\/WACV.2013.6475048"},{"key":"e_1_3_2_2_51_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW.2015.7301395"},{"key":"e_1_3_2_2_52_1","volume-title":"Learning Joint Embedding with Multimodal Cues for Cross-Modal Video-Text Retrieval. In International Conference on Multimedia Retrieval (ICMR). ACM, 19--27","author":"Mithun Niluthpol Chowdhury","year":"2018","unstructured":"Niluthpol Chowdhury Mithun , Juncheng Li , Florian Metze , and Amit K Roy-Chowdhury . 2018 a. Learning Joint Embedding with Multimodal Cues for Cross-Modal Video-Text Retrieval. In International Conference on Multimedia Retrieval (ICMR). ACM, 19--27 . Niluthpol Chowdhury Mithun, Juncheng Li, Florian Metze, and Amit K Roy-Chowdhury. 2018a. Learning Joint Embedding with Multimodal Cues for Cross-Modal Video-Text Retrieval. In International Conference on Multimedia Retrieval (ICMR). ACM, 19--27."},{"key":"e_1_3_2_2_53_1","volume-title":"International Journal of Multimedia Information Retrieval","author":"Mithun Niluthpol Chowdhury","year":"2019","unstructured":"Niluthpol Chowdhury Mithun , Juncheng Li , Florian Metze , and Amit K Roy-Chowdhury . 2019. Joint embeddings with multimodal cues for video-text retrieval . International Journal of Multimedia Information Retrieval ( 2019 ), 1--16. Niluthpol Chowdhury Mithun, Juncheng Li, Florian Metze, and Amit K Roy-Chowdhury. 2019. Joint embeddings with multimodal cues for video-text retrieval. International Journal of Multimedia Information Retrieval (2019), 1--16."},{"key":"e_1_3_2_2_54_1","volume-title":"Webly Supervised Joint Embedding for Cross-Modal Image-Text Retrieval. In ACM International Conference on Multimedia.","author":"Mithun Niluthpol Chowdhury","year":"2018","unstructured":"Niluthpol Chowdhury Mithun , Rameswar Panda , Evangelos Papalexakis , and Amit Roy-Chowdhury . 2018 b. Webly Supervised Joint Embedding for Cross-Modal Image-Text Retrieval. In ACM International Conference on Multimedia. Niluthpol Chowdhury Mithun, Rameswar Panda, Evangelos Papalexakis, and Amit Roy-Chowdhury. 2018b. Webly Supervised Joint Embedding for Cross-Modal Image-Text Retrieval. In ACM International Conference on Multimedia."},{"key":"e_1_3_2_2_55_1","volume-title":"Learning Long-Term Invariant Features for Vision-Based Localization. In IEEE Winter Conference on Applications of Computer Vision. 2038--2047","author":"Mithun Niluthpol Chowdhury","year":"2018","unstructured":"Niluthpol Chowdhury Mithun , Cody Simons , Robert Casey , Stefan Hilligardt , and Amit Roy-Chowdhury . 2018 c. Learning Long-Term Invariant Features for Vision-Based Localization. In IEEE Winter Conference on Applications of Computer Vision. 2038--2047 . Niluthpol Chowdhury Mithun, Cody Simons, Robert Casey, Stefan Hilligardt, and Amit Roy-Chowdhury. 2018c. Learning Long-Term Invariant Features for Vision-Based Localization. In IEEE Winter Conference on Applications of Computer Vision. 2038--2047."},{"key":"e_1_3_2_2_56_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2017.7989305"},{"key":"e_1_3_2_2_57_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2017.09.013"},{"key":"e_1_3_2_2_58_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.118"},{"key":"e_1_3_2_2_59_1","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2007.4286565"},{"key":"e_1_3_2_2_60_1","volume-title":"IEEE\/RSJ International Conference on Intelligent Robots and Systems. 3829--3836","author":"Pronobis Andrzej","year":"2006","unstructured":"Andrzej Pronobis , Barbara Caputo , Patric Jensfelt , and Henrik I Christensen . 2006 . A discriminative approach to robust visual place recognition . In IEEE\/RSJ International Conference on Intelligent Robots and Systems. 3829--3836 . Andrzej Pronobis, Barbara Caputo, Patric Jensfelt, and Henrik I Christensen. 2006. A discriminative approach to robust visual place recognition. In IEEE\/RSJ International Conference on Intelligent Robots and Systems. 3829--3836."},{"key":"e_1_3_2_2_61_1","volume-title":"VLocNet: Deep multitask learning for semantic visual localization and odometry. arXiv preprint arXiv:1804.08366","author":"Radwan Noha","year":"2018","unstructured":"Noha Radwan , Abhinav Valada , and Wolfram Burgard . 2018. VLocNet: Deep multitask learning for semantic visual localization and odometry. arXiv preprint arXiv:1804.08366 ( 2018 ). Noha Radwan, Abhinav Valada, and Wolfram Burgard. 2018. VLocNet: Deep multitask learning for semantic visual localization and odometry. arXiv preprint arXiv:1804.08366 (2018)."},{"key":"e_1_3_2_2_62_1","volume-title":"IEEE Conference on Computer Vision and Pattern Recognition Workshops. 806--813","author":"Razavian Sharif","unstructured":"Sharif Razavian , H. Azizpour , J. Sullivan , and S. Carlsson . 2014. CNN features off-the-shelf: an astounding baseline for recognition . In IEEE Conference on Computer Vision and Pattern Recognition Workshops. 806--813 . Sharif Razavian, H. Azizpour, J. Sullivan, and S. Carlsson. 2014. CNN features off-the-shelf: an astounding baseline for recognition. In IEEE Conference on Computer Vision and Pattern Recognition Workshops. 806--813."},{"key":"e_1_3_2_2_63_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00056"},{"key":"e_1_3_2_2_64_1","first-page":"1306","article-title":"Semantic place classification of indoor environments with mobile robots using boosting","volume":"5","author":"Rottmann Axel","year":"2005","unstructured":"Axel Rottmann , \u00d3scar Mart'inez Mozos , Cyrill Stachniss , and Wolfram Burgard . 2005 . Semantic place classification of indoor environments with mobile robots using boosting . In AAAI , Vol. 5. 1306 -- 1311 . Axel Rottmann, \u00d3scar Mart'inez Mozos, Cyrill Stachniss, and Wolfram Burgard. 2005. Semantic place classification of indoor environments with mobile robots using boosting. In AAAI, Vol. 5. 1306--1311.","journal-title":"AAAI"},{"key":"e_1_3_2_2_65_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2011.6126302"},{"key":"e_1_3_2_2_66_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.654"},{"key":"e_1_3_2_2_67_1","volume-title":"Semantic Visual Localization. In IEEE Conference on Computer Vision and Pattern Recognition.","author":"Sch\u00f6nberger Johannes L","year":"2018","unstructured":"Johannes L Sch\u00f6nberger , Marc Pollefeys , Andreas Geiger , and Torsten Sattler . 2018 . Semantic Visual Localization. In IEEE Conference on Computer Vision and Pattern Recognition. Johannes L Sch\u00f6nberger, Marc Pollefeys, Andreas Geiger, and Torsten Sattler. 2018. Semantic Visual Localization. In IEEE Conference on Computer Vision and Pattern Recognition."},{"key":"e_1_3_2_2_68_1","volume-title":"British Machine Vision Conference.","author":"Seymour Zachary","year":"2019","unstructured":"Zachary Seymour , Karan Sikka , Han-Pang Chiu , Supun Samarasekera , and Rakesh Kumar . 2019 . Semantically-Aware Attentive Neural Embeddings for Long-Term 2D Visual Localization . In British Machine Vision Conference. Zachary Seymour, Karan Sikka, Han-Pang Chiu, Supun Samarasekera, and Rakesh Kumar. 2019. Semantically-Aware Attentive Neural Embeddings for Long-Term 2D Visual Localization. In British Machine Vision Conference."},{"key":"e_1_3_2_2_69_1","unstructured":"Yujiao Shi Liu Liu Xin Yu and Hongdong Li. 2019. Spatial-Aware Feature Aggregation for Cross-View Image based Geo-Localization. In Advances in Neural Information Processing Systems. 10090--10100.  Yujiao Shi Liu Liu Xin Yu and Hongdong Li. 2019. Spatial-Aware Feature Aggregation for Cross-View Image based Geo-Localization. In Advances in Neural Information Processing Systems. 10090--10100."},{"key":"e_1_3_2_2_70_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.97"},{"key":"e_1_3_2_2_71_1","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2015.7353986"},{"key":"e_1_3_2_2_72_1","volume-title":"Place recognition with ConvNet landmarks: Viewpoint-robust, condition-robust, training-free","author":"Sunderhauf Niko","year":"2015","unstructured":"Niko Sunderhauf , Sareh Shirazi , Adam Jacobson , Feras Dayoub , Edward Pepperell , Ben Upcroft , and Michael Milford . 2015. Place recognition with ConvNet landmarks: Viewpoint-robust, condition-robust, training-free . Robotics : Science and Systems XII ( 2015 ). Niko Sunderhauf, Sareh Shirazi, Adam Jacobson, Feras Dayoub, Edward Pepperell, Ben Upcroft, and Michael Milford. 2015. Place recognition with ConvNet landmarks: Viewpoint-robust, condition-robust, training-free. Robotics: Science and Systems XII (2015)."},{"key":"e_1_3_2_2_73_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.216"},{"key":"e_1_3_2_2_74_1","volume-title":"Semantic Match Consistency for Long-Term Visual Localization. In European Conference on Computer Vision. 383--399","author":"Toft Carl","year":"2018","unstructured":"Carl Toft , Erik Stenborg , Lars Hammarstrand , Lucas Brynte , Marc Pollefeys , Torsten Sattler , and Fredrik Kahl . 2018 . Semantic Match Consistency for Long-Term Visual Localization. In European Conference on Computer Vision. 383--399 . Carl Toft, Erik Stenborg, Lars Hammarstrand, Lucas Brynte, Marc Pollefeys, Torsten Sattler, and Fredrik Kahl. 2018. Semantic Match Consistency for Long-Term Visual Localization. In European Conference on Computer Vision. 383--399."},{"key":"e_1_3_2_2_75_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.541"},{"key":"e_1_3_2_2_76_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.309"},{"key":"e_1_3_2_2_77_1","volume-title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking. In ACM International Conference on Multimedia. 12--20","author":"Wang Tan","year":"2019","unstructured":"Tan Wang , Xing Xu , Yang Yang , Alan Hanjalic , Heng Tao Shen , and Jingkuan Song . 2019 . Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking. In ACM International Conference on Multimedia. 12--20 . Tan Wang, Xing Xu, Yang Yang, Alan Hanjalic, Heng Tao Shen, and Jingkuan Song. 2019. Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking. In ACM International Conference on Multimedia. 12--20."},{"key":"e_1_3_2_2_78_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01252-6_9"},{"key":"e_1_3_2_2_79_1","volume-title":"PointSeg: Real-Time Semantic Segmentation Based on 3D LiDAR Point Cloud. arXiv preprint arXiv:1807.06288","author":"Wang Yuan","year":"2018","unstructured":"Yuan Wang , Tianyue Shi , Peng Yun , Lei Tai , and Ming Liu . 2018. PointSeg: Real-Time Semantic Segmentation Based on 3D LiDAR Point Cloud. arXiv preprint arXiv:1807.06288 ( 2018 ). Yuan Wang, Tianyue Shi, Peng Yun, Lei Tai, and Ming Liu. 2018. PointSeg: Real-Time Semantic Segmentation Based on 3D LiDAR Point Cloud. arXiv preprint arXiv:1807.06288 (2018)."},{"key":"e_1_3_2_2_80_1","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2014.6942558"},{"key":"e_1_3_2_2_81_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.451"},{"key":"e_1_3_2_2_82_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00677"},{"key":"e_1_3_2_2_83_1","volume-title":"IEEE Conference on Computer Vision and Pattern Recognition. 1--8.","author":"Wu Jianixn","year":"2008","unstructured":"Jianixn Wu and James M Rehg . 2008 . Where am I: Place instance and category recognition using spatial PACT . In IEEE Conference on Computer Vision and Pattern Recognition. 1--8. Jianixn Wu and James M Rehg. 2008. Where am I: Place instance and category recognition using spatial PACT. In IEEE Conference on Computer Vision and Pattern Recognition. 1--8."},{"key":"e_1_3_2_2_84_1","volume-title":"Learning Fragment Self-Attention Embeddings for Image-Text Matching. In ACM International Conference on Multimedia. 2088--2096","author":"Wu Yiling","year":"2019","unstructured":"Yiling Wu , Shuhui Wang , Guoli Song , and Qingming Huang . 2019 b . Learning Fragment Self-Attention Embeddings for Image-Text Matching. In ACM International Conference on Multimedia. 2088--2096 . Yiling Wu, Shuhui Wang, Guoli Song, and Qingming Huang. 2019 b. Learning Fragment Self-Attention Embeddings for Image-Text Matching. In ACM International Conference on Multimedia. 2088--2096."},{"key":"e_1_3_2_2_85_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.451"},{"key":"e_1_3_2_2_86_1","volume-title":"Billion-scale semi-supervised learning for image classification. arXiv preprint arXiv:1905.00546","author":"Yalniz I Zeki","year":"2019","unstructured":"I Zeki Yalniz , Herv\u00e9 J\u00e9gou , Kan Chen , Manohar Paluri , and Dhruv Mahajan . 2019. Billion-scale semi-supervised learning for image classification. arXiv preprint arXiv:1905.00546 ( 2019 ). I Zeki Yalniz, Herv\u00e9 J\u00e9gou, Kan Chen, Manohar Paluri, and Dhruv Mahajan. 2019. Billion-scale semi-supervised learning for image classification. arXiv preprint arXiv:1905.00546 (2019)."},{"key":"e_1_3_2_2_87_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298781"},{"key":"e_1_3_2_2_88_1","volume-title":"Tensor Fusion Network for Multimodal Sentiment Analysis. In Conference on Empirical Methods in Natural Language Processing. 1103--1114","author":"Zadeh Amir","year":"2017","unstructured":"Amir Zadeh , Minghai Chen , Soujanya Poria , Erik Cambria , and Louis-Philippe Morency . 2017 . Tensor Fusion Network for Multimodal Sentiment Analysis. In Conference on Empirical Methods in Natural Language Processing. 1103--1114 . Amir Zadeh, Minghai Chen, Soujanya Poria, Erik Cambria, and Louis-Philippe Morency. 2017. Tensor Fusion Network for Multimodal Sentiment Analysis. In Conference on Empirical Methods in Natural Language Processing. 1103--1114."},{"key":"e_1_3_2_2_89_1","volume-title":"Wide residual networks. arXiv preprint arXiv:1605.07146","author":"Zagoruyko Sergey","year":"2016","unstructured":"Sergey Zagoruyko and Nikos Komodakis . 2016. Wide residual networks. arXiv preprint arXiv:1605.07146 ( 2016 ). Sergey Zagoruyko and Nikos Komodakis. 2016. Wide residual networks. arXiv preprint arXiv:1605.07146 (2016)."},{"key":"e_1_3_2_2_90_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.660"},{"key":"e_1_3_2_2_91_1","volume-title":"Dual-Path Convolutional Image-Text Embedding. arXiv preprint arXiv:1711.05535","author":"Zheng Zhedong","year":"2017","unstructured":"Zhedong Zheng , Liang Zheng , Michael Garrett , Yi Yang , and Yi-Dong Shen . 2017. Dual-Path Convolutional Image-Text Embedding. arXiv preprint arXiv:1711.05535 ( 2017 ). Zhedong Zheng, Liang Zheng, Michael Garrett, Yi Yang, and Yi-Dong Shen. 2017. Dual-Path Convolutional Image-Text Embedding. arXiv preprint arXiv:1711.05535 (2017)."},{"key":"e_1_3_2_2_92_1","volume-title":"Places: A 10 million Image Database for Scene Recognition","author":"Zhou Bolei","year":"2017","unstructured":"Bolei Zhou , Agata Lapedriza , Aditya Khosla , Aude Oliva , and Antonio Torralba . 2017 . Places: A 10 million Image Database for Scene Recognition . IEEE Transactions on Pattern Analysis and Machine Intelligence ( 2017). Bolei Zhou, Agata Lapedriza, Aditya Khosla, Aude Oliva, and Antonio Torralba. 2017. Places: A 10 million Image Database for Scene Recognition. IEEE Transactions on Pattern Analysis and Machine Intelligence (2017)."},{"key":"e_1_3_2_2_93_1","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-018-1140-0"},{"key":"e_1_3_2_2_94_1","doi-asserted-by":"publisher","DOI":"10.1145\/3240508.3240525"},{"key":"e_1_3_2_2_95_1","volume-title":"British Machine Vision Conference.","author":"Zolanvari SM","year":"2019","unstructured":"SM Zolanvari , Susana Ruano , Aakanksha Rana , Alan Cummins , Rogerio Eduardo da Silva , Morteza Rahbar , and Aljosa Smolic . 2019 . DublinCity: Annotated LiDAR Point Cloud and its Applications . In British Machine Vision Conference. SM Zolanvari, Susana Ruano, Aakanksha Rana, Alan Cummins, Rogerio Eduardo da Silva, Morteza Rahbar, and Aljosa Smolic. 2019. DublinCity: Annotated LiDAR Point Cloud and its Applications. In British Machine Vision Conference."}],"event":{"name":"MM '20: The 28th ACM International Conference on Multimedia","location":"Seattle WA USA","acronym":"MM '20","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 28th ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3394171.3413647","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3394171.3413647","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T20:47:15Z","timestamp":1750193235000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3394171.3413647"}},"subtitle":["Towards Solving Large-Scale Cross-Modal Visual Localization"],"short-title":[],"issued":{"date-parts":[[2020,10,12]]},"references-count":95,"alternative-id":["10.1145\/3394171.3413647","10.1145\/3394171"],"URL":"https:\/\/doi.org\/10.1145\/3394171.3413647","relation":{},"subject":[],"published":{"date-parts":[[2020,10,12]]},"assertion":[{"value":"2020-10-12","order":2,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}