{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,18]],"date-time":"2026-07-18T16:05:01Z","timestamp":1784390701058,"version":"3.55.0"},"publisher-location":"Cham","reference-count":59,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783031198410","type":"print"},{"value":"9783031198427","type":"electronic"}],"license":[{"start":{"date-parts":[[2022,1,1]],"date-time":"2022-01-01T00:00:00Z","timestamp":1640995200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2022,1,1]],"date-time":"2022-01-01T00:00:00Z","timestamp":1640995200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2022]]},"DOI":"10.1007\/978-3-031-19842-7_19","type":"book-chapter","created":{"date-parts":[[2022,10,22]],"date-time":"2022-10-22T12:12:59Z","timestamp":1666440779000},"page":"321-337","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":4,"title":["Object Manipulation via\u00a0Visual Target Localization"],"prefix":"10.1007","author":[{"given":"Kiana","family":"Ehsani","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ali","family":"Farhadi","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Aniruddha","family":"Kembhavi","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Roozbeh","family":"Mottaghi","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2022,10,23]]},"reference":[{"key":"19_CR1","unstructured":"Anderson, P., et al.: On evaluation of embodied navigation agents. arXiv (2018)"},{"key":"19_CR2","doi-asserted-by":"crossref","unstructured":"Anderson, P., et al.: Vision-and-language navigation: interpreting visually-grounded navigation instructions in real environments. In: CVPR (2018)","DOI":"10.1109\/CVPR.2018.00387"},{"key":"19_CR3","unstructured":"Batra, D., et al.: Rearrangement: a challenge for embodied AI. arXiv (2020)"},{"key":"19_CR4","unstructured":"Batra, D., et al.: ObjectNav revisited: on evaluation of embodied agents navigating to objects. arXiv (2020)"},{"key":"19_CR5","doi-asserted-by":"crossref","unstructured":"Chang, L.Y., Srinivasa, S.S., Pollard, N.S.: Planning pre-grasp manipulation for transport tasks. In: ICRA (2010)","DOI":"10.1109\/ROBOT.2010.5509651"},{"key":"19_CR6","unstructured":"Chaplot, D.S., Gandhi, D.P., Gupta, A., Salakhutdinov, R.R.: Object goal navigation using goal-oriented semantic exploration. In: NeurIPS (2020)"},{"key":"19_CR7","unstructured":"Choi, S., Zhou, Q.Y., Koltun, V.: Robust reconstruction of indoor scenes. In: CVPR (2015)"},{"key":"19_CR8","doi-asserted-by":"crossref","unstructured":"Danielczuk, M., Mousavian, A., Eppner, C., Fox, D.: Object rearrangement using learned implicit collision functions. In: ICRA (2021)","DOI":"10.1109\/ICRA48506.2021.9561516"},{"key":"19_CR9","doi-asserted-by":"crossref","unstructured":"Das, A., Datta, S., Gkioxari, G., Lee, S., Parikh, D., Batra, D.: Embodied question answering. In: CVPR (2018)","DOI":"10.1109\/CVPR.2018.00008"},{"key":"19_CR10","unstructured":"Datta, S., Maksymets, O., Hoffman, J., Lee, S., Batra, D., Parikh, D.: Integrating egocentric localization for more realistic point-goal navigation agents. In: CoRL (2020)"},{"key":"19_CR11","doi-asserted-by":"crossref","unstructured":"Ehsani, K., et al.: ManipulaTHOR: a framework for visual object manipulation. In: CVPR (2021)","DOI":"10.1109\/CVPR46437.2021.00447"},{"key":"19_CR12","unstructured":"Gan, C., et al.: ThreeDWorld: a platform for interactive multi-modal physical simulation. In: NeurIPS (dataset track) (2021)"},{"key":"19_CR13","doi-asserted-by":"crossref","unstructured":"Garrett, C.R., Lozano-Perez, T., Kaelbling, L.P.: FFRob: leveraging symbolic planning for efficient task and motion planning. Int. J. Robot. Res. 37, 104\u2013136 (2018)","DOI":"10.1177\/0278364917739114"},{"key":"19_CR14","doi-asserted-by":"crossref","unstructured":"Gordon, D., et al.: IQA: visual question answering in interactive environments. In: CVPR (2018)","DOI":"10.1109\/CVPR.2018.00430"},{"key":"19_CR15","doi-asserted-by":"crossref","unstructured":"Gupta, A., Dollar, P., Girshick, R.: LVIS: a dataset for large vocabulary instance segmentation. In: CVPR (2019)","DOI":"10.1109\/CVPR.2019.00550"},{"key":"19_CR16","doi-asserted-by":"crossref","unstructured":"Gupta, S., Davidson, J., Levine, S., Sukthankar, R., Malik, J.: Cognitive mapping and planning for visual navigation. In: CVPR (2017)","DOI":"10.1109\/CVPR.2017.769"},{"key":"19_CR17","doi-asserted-by":"crossref","unstructured":"He, K., Gkioxari, G., Doll\u00e1r, P., Girshick, R.B.: Mask R-CNN (2017)","DOI":"10.1109\/ICCV.2017.322"},{"key":"19_CR18","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.90"},{"key":"19_CR19","doi-asserted-by":"crossref","unstructured":"Huang, E., Jia, Z., Mason, M.T.: Large-scale multi-object rearrangement. In: ICRA (2019)","DOI":"10.1109\/ICRA.2019.8793946"},{"key":"19_CR20","doi-asserted-by":"crossref","unstructured":"Hwang, Y.K., Ahuja, N.: Gross motion planning-a survey. ACM Comput. Surv. (CSUR) 24, 219\u2013291 (1992)","DOI":"10.1145\/136035.136037"},{"key":"19_CR21","doi-asserted-by":"crossref","unstructured":"James, S., Ma, Z., Arrojo, D.R., Davison, A.J.: RLBench: the robot learning benchmark & learning environment. IEEE Robot. Autom. Lett. 5, 3019\u20133026 (2020)","DOI":"10.1109\/LRA.2020.2974707"},{"key":"19_CR22","doi-asserted-by":"crossref","unstructured":"Kaelbling, L.P., Lozano-P\u00e9rez, T.: Integrated task and motion planning in belief space. Int. J. Robot. Res. 32, 1194\u20131227 (2013)","DOI":"10.1177\/0278364913484072"},{"key":"19_CR23","doi-asserted-by":"crossref","unstructured":"King, J.E., Cognetti, M., Srinivasa, S.S.: Rearrangement planning using object-centric and robot-centric action spaces. In: ICRA (2016)","DOI":"10.1109\/ICRA.2016.7487583"},{"key":"19_CR24","unstructured":"Kolve, E., et al.: AI2-THOR: an interactive 3D environment for visual AI. arXiv (2017)"},{"key":"19_CR25","doi-asserted-by":"crossref","unstructured":"Krontiris, A., Bekris, K.E.: Dealing with difficult instances of object rearrangement. In: RSS (2015)","DOI":"10.15607\/RSS.2015.XI.045"},{"key":"19_CR26","doi-asserted-by":"crossref","unstructured":"Lozano-P\u00e9rez, T., Jones, J.L., Mazer, E., O\u2019Donnell, P.A.: Task-level planning of pick-and-place robot motions. Computer 22, 21\u201329 (1989)","DOI":"10.1109\/2.16222"},{"key":"19_CR27","unstructured":"Mahler, J., Goldberg, K.: Learning deep policies for robot bin picking by simulating robust grasping sequences. In: CoRL (2017)"},{"key":"19_CR28","doi-asserted-by":"crossref","unstructured":"Marza, P., Matignon, L., Simonin, O., Wolf, C.: Teaching agents how to map: spatial reasoning for multi-object navigation. arXiv (2021)","DOI":"10.1109\/IROS47612.2022.9982216"},{"key":"19_CR29","unstructured":"Mirowski, P.W., et al.: Learning to navigate in complex environments. In: ICLR (2017)"},{"key":"19_CR30","doi-asserted-by":"crossref","unstructured":"Misra, D., Bennett, A., Blukis, V., Niklasson, E., Shatkhin, M., Artzi, Y.: Mapping instructions to actions in 3D environments with visual goal prediction. In: EMNLP (2018)","DOI":"10.18653\/v1\/D18-1287"},{"key":"19_CR31","unstructured":"Mu, T., et al.: ManiSkill: generalizable manipulation skill benchmark with large-scale demonstrations. In: NeurIPS (dataset track) (2021)"},{"key":"19_CR32","unstructured":"Murali, A., et al.: PyroBot: an open-source robotics framework for research and benchmarking. arXiv (2019)"},{"key":"19_CR33","doi-asserted-by":"crossref","unstructured":"Nedunuri, S., Prabhu, S., Moll, M., Chaudhuri, S., Kavraki, L.E.: SMT-based synthesis of integrated task and motion plans from plan outlines. In: ICRA (2014)","DOI":"10.1109\/ICRA.2014.6906924"},{"key":"19_CR34","doi-asserted-by":"crossref","unstructured":"Nieuwenhuisen, M., et al.: Mobile bin picking with an anthropomorphic service robot. In: ICRA (2013)","DOI":"10.1109\/ICRA.2013.6630892"},{"key":"19_CR35","unstructured":"Puig, X., et al.: Watch-and-help: a challenge for social perception and human-AI collaboration. In: International Conference on Learning Representations (2021). https:\/\/openreview.net\/forum?id=w_7JMpGZRh0"},{"key":"19_CR36","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"400","DOI":"10.1007\/978-3-030-58558-7_24","volume-title":"Computer Vision \u2013 ECCV 2020","author":"SK Ramakrishnan","year":"2020","unstructured":"Ramakrishnan, S.K., Al-Halah, Z., Grauman, K.: Occupancy anticipation for efficient exploration and navigation. In: Vedaldi, A., Bischof, H., Brox, T., Frahm, J.-M. (eds.) ECCV 2020. LNCS, vol. 12350, pp. 400\u2013418. Springer, Cham (2020). https:\/\/doi.org\/10.1007\/978-3-030-58558-7_24"},{"key":"19_CR37","doi-asserted-by":"crossref","unstructured":"Russakovsky, O., et al.: ImageNet large scale visual recognition challenge. IJCV 115, 211\u2013252 (2015)","DOI":"10.1007\/s11263-015-0816-y"},{"key":"19_CR38","unstructured":"Savinov, N., Dosovitskiy, A., Koltun, V.: Semi-parametric topological memory for navigation. In: ICLR (2018)"},{"key":"19_CR39","doi-asserted-by":"crossref","unstructured":"Savva, M., et al.: Habitat: a platform for embodied AI research. In: ICCV (2019)","DOI":"10.1109\/ICCV.2019.00943"},{"key":"19_CR40","doi-asserted-by":"crossref","unstructured":"Shen, B., et al.: iGibson, a simulation environment for interactive tasks in large realistic scenes. In: IROS (2021)","DOI":"10.1109\/IROS51168.2021.9636667"},{"key":"19_CR41","doi-asserted-by":"crossref","unstructured":"Shi, W., et al.: Real-time single image and video super-resolution using an efficient sub-pixel convolutional neural network. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.207"},{"key":"19_CR42","doi-asserted-by":"crossref","unstructured":"Shridhar, M., et al.: Alfred: a benchmark for interpreting grounded instructions for everyday tasks. In: CVPR (2020)","DOI":"10.1109\/CVPR42600.2020.01075"},{"key":"19_CR43","unstructured":"Srivastava, S., et al.: Behavior: benchmark for everyday household activities in virtual, interactive, and ecological environments. arXiv:abs\/2108.03332 (2021)"},{"key":"19_CR44","doi-asserted-by":"crossref","unstructured":"Stilman, M., Schamburek, J.U., Kuffner, J., Asfour, T.: Manipulation planning among movable obstacles. In: ICRA (2007)","DOI":"10.1109\/ROBOT.2007.363986"},{"key":"19_CR45","unstructured":"Szot, A., et al.: Habitat 2.0: training home assistants to rearrange their habitat. In: NeurIPS (2021)"},{"key":"19_CR46","doi-asserted-by":"crossref","unstructured":"Weihs, L., Deitke, M., Kembhavi, A., Mottaghi, R.: Visual room rearrangement. In: CVPR (2021)","DOI":"10.1109\/CVPR46437.2021.00586"},{"key":"19_CR47","unstructured":"Wijmans, E., et al.: DD-PPO: learning near-perfect PointGoal navigators from 2.5 billion frames. In: ICLR (2020)"},{"key":"19_CR48","doi-asserted-by":"crossref","unstructured":"Wortsman, M., Ehsani, K., Rastegari, M., Farhadi, A., Mottaghi, R.: Learning to learn how to learn: self-adaptive visual navigation using meta-learning. In: CVPR (2019)","DOI":"10.1109\/CVPR.2019.00691"},{"key":"19_CR49","doi-asserted-by":"crossref","unstructured":"Xia, F., et al.: Interactive Gibson benchmark: a benchmark for interactive navigation in cluttered environments. IEEE Robot. Autom. Lett. 5, 713\u2013720 (2020)","DOI":"10.1109\/LRA.2020.2965078"},{"key":"19_CR50","doi-asserted-by":"crossref","unstructured":"Xia, F., et al.: ReLMoGen: leveraging motion generation in reinforcement learning for mobile manipulation. In: ICRA (2021)","DOI":"10.1109\/ICRA48506.2021.9561315"},{"key":"19_CR51","doi-asserted-by":"crossref","unstructured":"Xiang, F., et al.: SAPIEN: a simulated part-based interactive environment. In: CVPR (2020)","DOI":"10.1109\/CVPR42600.2020.01111"},{"key":"19_CR52","unstructured":"Yang, W., Wang, X., Farhadi, A., Gupta, A., Mottaghi, R.: Visual semantic navigation using scene priors. In: ICLR (2019)"},{"key":"19_CR53","doi-asserted-by":"crossref","unstructured":"Yen-Chen, L., Zeng, A., Song, S., Isola, P., Lin, T.Y.: Learning to see before learning to act: visual pre-training for manipulation. In: ICRA (2020)","DOI":"10.1109\/ICRA40945.2020.9197331"},{"key":"19_CR54","unstructured":"Yu, T., et al.: Meta-world: a benchmark and evaluation for multi-task and meta reinforcement learning. In: CoRL (2019)"},{"key":"19_CR55","doi-asserted-by":"crossref","unstructured":"Zeng, A., et al.: Robotic pick-and-place of novel objects in clutter with multi-affordance grasping and cross-domain image matching. In: ICRA (2018)","DOI":"10.1109\/ICRA.2018.8461044"},{"key":"19_CR56","doi-asserted-by":"crossref","unstructured":"Zeng, K.H., Weihs, L., Farhadi, A., Mottaghi, R.: Pushing it out of the way: interactive visual navigation. In: CVPR (2021)","DOI":"10.1109\/CVPR46437.2021.00974"},{"key":"19_CR57","doi-asserted-by":"crossref","unstructured":"Zhao, X., Agrawal, H., Batra, D., Schwing, A.G.: The surprising effectiveness of visual odometry techniques for embodied PointGoal navigation. arXiv (2021)","DOI":"10.1109\/ICCV48922.2021.01582"},{"key":"19_CR58","doi-asserted-by":"crossref","unstructured":"Zhu, Y., et al.: Target-driven visual navigation in indoor scenes using deep reinforcement learning. In: ICRA (2017)","DOI":"10.1109\/ICRA.2017.7989381"},{"key":"19_CR59","unstructured":"Zhu, Y., Wong, J., Mandlekar, A., Mart\u00edn-Mart\u00edn, R.: Robosuite: a modular simulation framework and benchmark for robot learning. arXiv (2020)"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ECCV 2022"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-19842-7_19","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,3,13]],"date-time":"2024-03-13T19:05:34Z","timestamp":1710356734000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-19842-7_19"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022]]},"ISBN":["9783031198410","9783031198427"],"references-count":59,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-19842-7_19","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2022]]},"assertion":[{"value":"23 October 2022","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ECCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"European Conference on Computer Vision","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Tel Aviv","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Israel","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2022","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"23 October 2022","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"27 October 2022","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"17","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"eccv2022","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/eccv2022.ecva.net\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Double-blind","order":1,"name":"type","label":"Type","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"CMT","order":2,"name":"conference_management_system","label":"Conference Management System","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"5804","order":3,"name":"number_of_submissions_sent_for_review","label":"Number of Submissions Sent for Review","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"1645","order":4,"name":"number_of_full_papers_accepted","label":"Number of Full Papers Accepted","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"0","order":5,"name":"number_of_short_papers_accepted","label":"Number of Short Papers Accepted","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"28% - The value is computed by the equation \"Number of Full Papers Accepted \/ Number of Submissions Sent for Review * 100\" and then rounded to a whole number.","order":6,"name":"acceptance_rate_of_full_papers","label":"Acceptance Rate of Full Papers","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"3.21","order":7,"name":"average_number_of_reviews_per_paper","label":"Average Number of Reviews per Paper","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"3.91","order":8,"name":"average_number_of_papers_per_reviewer","label":"Average Number of Papers per Reviewer","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"Yes","order":9,"name":"external_reviewers_involved","label":"External Reviewers Involved","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}}]}}