{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,8,30]],"date-time":"2025-08-30T17:03:49Z","timestamp":1756573429107,"version":"3.40.3"},"publisher-location":"Cham","reference-count":42,"publisher":"Springer Nature Switzerland","isbn-type":[{"type":"print","value":"9783031727740"},{"type":"electronic","value":"9783031727757"}],"license":[{"start":{"date-parts":[[2024,9,30]],"date-time":"2024-09-30T00:00:00Z","timestamp":1727654400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,9,30]],"date-time":"2024-09-30T00:00:00Z","timestamp":1727654400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-3-031-72775-7_1","type":"book-chapter","created":{"date-parts":[[2024,9,29]],"date-time":"2024-09-29T07:01:50Z","timestamp":1727593310000},"page":"1-18","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":3,"title":["Recursive Visual Programming"],"prefix":"10.1007","author":[{"given":"Jiaxin","family":"Ge","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Sanjay","family":"Subramanian","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Baifeng","family":"Shi","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Roei","family":"Herzig","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Trevor","family":"Darrell","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2024,9,30]]},"reference":[{"key":"1_CR1","doi-asserted-by":"crossref","unstructured":"Andreas, J., Rohrbach, M., Darrell, T., Klein, D.: Neural module networks. In: 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 39\u201348 (2015). https:\/\/api.semanticscholar.org\/CorpusID:5276660","DOI":"10.1109\/CVPR.2016.12"},{"key":"1_CR2","doi-asserted-by":"crossref","unstructured":"Andreas, J., Rohrbach, M., Darrell, T., Klein, D.: Learning to compose neural networks for question answering. ArXiv abs\/1601.01705 (2016). https:\/\/api.semanticscholar.org\/CorpusID:3130692","DOI":"10.18653\/v1\/N16-1181"},{"key":"1_CR3","doi-asserted-by":"crossref","unstructured":"Antol, S., et al.: VQA: visual question answering. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 2425\u20132433 (2015)","DOI":"10.1109\/ICCV.2015.279"},{"key":"1_CR4","doi-asserted-by":"crossref","unstructured":"Besta, M., et al.: Graph of thoughts: solving elaborate problems with large language models (2024)","DOI":"10.1609\/aaai.v38i16.29720"},{"key":"1_CR5","doi-asserted-by":"crossref","unstructured":"Bogin, B., Gupta, S., Gardner, M., Berant, J.: COVR: a test-bed for visually grounded compositional generalization with real images. ArXiv abs\/2109.10613 (2021). https:\/\/api.semanticscholar.org\/CorpusID:237592834","DOI":"10.18653\/v1\/2021.emnlp-main.774"},{"key":"1_CR6","unstructured":"Brown, T., et al.: Language models are few-shot learners. In: Larochelle, H., Ranzato, M., Hadsell, R., Balcan, M., Lin, H. (eds.) Advances in Neural Information Processing Systems, vol.\u00a033, pp. 1877\u20131901. Curran Associates, Inc. (2020). https:\/\/proceedings.neurips.cc\/paper\/2020\/file\/1457c0d6bfcb4967418bfb8ac142f64a-Paper.pdf"},{"key":"1_CR7","doi-asserted-by":"crossref","unstructured":"Buch, S., Eyzaguirre, C., Gaidon, A., Wu, J., Fei-Fei, L., Niebles, J.C.: Revisiting the \u201cVideo\u201d in video-language understanding. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2022)","DOI":"10.1109\/CVPR52688.2022.00293"},{"key":"1_CR8","unstructured":"Chen, M., et al.: Evaluating large language models trained on code. ArXiv abs\/2107.03374 (2021). https:\/\/api.semanticscholar.org\/CorpusID:235755472"},{"key":"1_CR9","unstructured":"Chen, W., Ma, X., Wang, X., Cohen, W.W.: Program of thoughts prompting: disentangling computation from reasoning for numerical reasoning tasks. Trans. Mach. Learn. Res. (2023)"},{"key":"1_CR10","unstructured":"Chen, X., Lin, M., Sch\u00e4rli, N., Zhou, D.: Teaching large language models to self-debug. arXiv preprint arXiv:2304.05128 (2023)"},{"key":"1_CR11","unstructured":"Cheng, Z., et al.: Binding language models in symbolic languages. ArXiv abs\/2210.02875 (2022). https:\/\/api.semanticscholar.org\/CorpusID:252734772"},{"key":"1_CR12","unstructured":"Cho, J., Zala, A., Bansal, M.: Visual programming for text-to-image generation and evaluation. NeurIPS (2023)"},{"key":"1_CR13","unstructured":"Gao, L., et al.: PAL: program-aided language models. arXiv preprint arXiv:2211.10435 (2022)"},{"key":"1_CR14","doi-asserted-by":"crossref","unstructured":"Gupta, T., Kembhavi, A.: Visual programming: Compositional visual reasoning without training. In: 2023 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 14953\u201314962 (2022). https:\/\/api.semanticscholar.org\/CorpusID:253734854","DOI":"10.1109\/CVPR52729.2023.01436"},{"key":"1_CR15","doi-asserted-by":"crossref","unstructured":"Hu, R., Andreas, J., Rohrbach, M., Darrell, T., Saenko, K.: Learning to reason: end-to-end module networks for visual question answering. In: 2017 IEEE International Conference on Computer Vision (ICCV), pp. 804\u2013813 (2017). https:\/\/api.semanticscholar.org\/CorpusID:18682","DOI":"10.1109\/ICCV.2017.93"},{"key":"1_CR16","doi-asserted-by":"crossref","unstructured":"Hudson, D.A., Manning, C.D.: GQA: a new dataset for real-world visual reasoning and compositional question answering. In: 2019 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 6693\u20136702 (2019). https:\/\/api.semanticscholar.org\/CorpusID:152282269","DOI":"10.1109\/CVPR.2019.00686"},{"key":"1_CR17","doi-asserted-by":"crossref","unstructured":"Hudson, D.A., Manning, C.D.: GQA: a new dataset for real-world visual reasoning and compositional question answering. In: 2019 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 6693\u20136702 (2019). https:\/\/api.semanticscholar.org\/CorpusID:152282269","DOI":"10.1109\/CVPR.2019.00686"},{"key":"1_CR18","unstructured":"Hudson, D.A., Manning, C.D.: Learning by abstraction: the neural state machine. In: Neural Information Processing Systems (2019). https:\/\/api.semanticscholar.org\/CorpusID:195847902"},{"key":"1_CR19","unstructured":"Kim, W., Son, B., Kim, I.: ViLT: vision-and-language transformer without convolution or region supervision. In: International Conference on Machine Learning (2021). https:\/\/api.semanticscholar.org\/CorpusID:231839613"},{"key":"1_CR20","unstructured":"Li, L.H., Yatskar, M., Yin, D., Hsieh, C.J., Chang, K.W.: VisualBERT: a simple and performant baseline for vision and language. ArXiv abs\/1908.03557 (2019). https:\/\/api.semanticscholar.org\/CorpusID:199528533"},{"key":"1_CR21","unstructured":"Liang, J., et al.: Code as policies: language model programs for embodied control. ArXiv preprint arXiv:2209.07753 (2022)"},{"key":"1_CR22","doi-asserted-by":"crossref","unstructured":"Liu, F., Emerson, G.E.T., Collier, N.: Visual spatial reasoning. Trans. Assoc. Comput. Linguist. 11, 635\u2013651 (2022). https:\/\/api.semanticscholar.org\/CorpusID:248496506","DOI":"10.1162\/tacl_a_00566"},{"key":"1_CR23","unstructured":"Lu, P., et al.: Chameleon: plug-and-play compositional reasoning with large language models. arXiv preprint arXiv:2304.09842 (2023)"},{"key":"1_CR24","unstructured":"Ma, Y.J., et al.: Eureka: human-level reward design via coding large language models. arXiv preprint arXiv: Arxiv-2310.12931 (2023)"},{"key":"1_CR25","doi-asserted-by":"publisher","unstructured":"Madaan, A., Zhou, S., Alon, U., Yang, Y., Neubig, G.: Language models of code are few-shot commonsense learners. In: Goldberg, Y., Kozareva, Z., Zhang, Y. (eds.) Proceedings of the 2022 Conference on Empirical Methods in Natural Language Processing, pp. 1384\u20131403. Association for Computational Linguistics, Abu Dhabi, United Arab Emirates (2022). https:\/\/doi.org\/10.18653\/v1\/2022.emnlp-main.90","DOI":"10.18653\/v1\/2022.emnlp-main.90"},{"key":"1_CR26","doi-asserted-by":"crossref","unstructured":"Marino, K., Rastegari, M., Farhadi, A., Mottaghi, R.: OK-VQA: a visual question answering benchmark requiring external knowledge. In: 2019 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 3190\u20133199 (2019). https:\/\/api.semanticscholar.org\/CorpusID:173991173","DOI":"10.1109\/CVPR.2019.00331"},{"key":"1_CR27","unstructured":"OpenAI: GPT-4 technical report. ArXiv abs\/2303.08774 (2023). https:\/\/api.semanticscholar.org\/CorpusID:257532815"},{"key":"1_CR28","unstructured":"Press, O., Zhang, M., Min, S., Schmidt, L., Smith, N.A., Lewis, M.: Measuring and narrowing the compositionality gap in language models. ArXiv abs\/2210.03350 (2022). https:\/\/api.semanticscholar.org\/CorpusID:252762102"},{"key":"1_CR29","doi-asserted-by":"crossref","unstructured":"Subramanian, S., et al.: Obtaining faithful interpretations from compositional neural networks. In: Annual Meeting of the Association for Computational Linguistics (2020). https:\/\/api.semanticscholar.org\/CorpusID:218487535","DOI":"10.18653\/v1\/2020.acl-main.495"},{"key":"1_CR30","doi-asserted-by":"publisher","unstructured":"Subramanian, S., et al.: Modular visual question answering via code generation. In: Rogers, A., Boyd-Graber, J., Okazaki, N. (eds.) Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics (Volume 2: Short Papers), pp. 747\u2013761. Association for Computational Linguistics, Toronto, Canada (Jul 2023). https:\/\/doi.org\/10.18653\/v1\/2023.acl-short.65, https:\/\/aclanthology.org\/2023.acl-short.65","DOI":"10.18653\/v1\/2023.acl-short.65"},{"key":"1_CR31","doi-asserted-by":"crossref","unstructured":"Sur\u2019is, D., Menon, S., Vondrick, C.: ViperGPT: visual inference via python execution for reasoning. ArXiv abs\/2303.08128 (2023). https:\/\/api.semanticscholar.org\/CorpusID:257505358","DOI":"10.1109\/ICCV51070.2023.01092"},{"key":"1_CR32","doi-asserted-by":"crossref","unstructured":"Suzgun, M., et\u00a0al.: Challenging big-bench tasks and whether chain-of-thought can solve them. arXiv preprint arXiv:2210.09261 (2022)","DOI":"10.18653\/v1\/2023.findings-acl.824"},{"key":"1_CR33","unstructured":"Touvron, H., et al.: LLaMA: open and efficient foundation language models. ArXiv abs\/2302.13971 (2023). https:\/\/api.semanticscholar.org\/CorpusID:257219404"},{"key":"1_CR34","doi-asserted-by":"crossref","unstructured":"Wang, X., Li, S., Ji, H.: Code4Struct: code generation for few-shot structured prediction from natural language. arXiv preprint arXiv:2210.12810 (2022)","DOI":"10.18653\/v1\/2023.acl-long.202"},{"key":"1_CR35","first-page":"8483","volume":"35","author":"Z Wang","year":"2022","unstructured":"Wang, Z., et al.: Language models with image descriptors are strong few-shot video-language learners. Adv. Neural. Inf. Process. Syst. 35, 8483\u20138497 (2022)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"1_CR36","doi-asserted-by":"crossref","unstructured":"Xiao, J., Shang, X., Yao, A., Chua, T.S.: Next-qa: next phase of question-answering to explaining temporal actions. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 9777\u20139786 (2021)","DOI":"10.1109\/CVPR46437.2021.00965"},{"key":"1_CR37","doi-asserted-by":"crossref","unstructured":"Yang, K., Klein, D., Peng, N., Tian, Y.: DOC: improving long story coherence with detailed outline control. In: Annual Meeting of the Association for Computational Linguistics (2023). https:\/\/api.semanticscholar.org\/CorpusID:254877751","DOI":"10.18653\/v1\/2023.acl-long.190"},{"key":"1_CR38","unstructured":"Yao, S., et al.: Tree of thoughts: deliberate problem solving with large language models. arXiv preprint arXiv:2305.10601 (2023)"},{"key":"1_CR39","unstructured":"Ye, Q., et al.: HiTeA: hierarchical temporal-aware video-language pre-training. ArXiv abs\/2212.14546 (2022). https:\/\/api.semanticscholar.org\/CorpusID:255340506"},{"key":"1_CR40","unstructured":"Yu, W., et al.: Language to rewards for robotic skill synthesis. Arxiv preprint arXiv:2306.08647 (2023)"},{"key":"1_CR41","doi-asserted-by":"crossref","unstructured":"Zhang, P., et al.: VinVL: revisiting visual representations in vision-language models. In: 2021 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 5575\u20135584 (2021). https:\/\/api.semanticscholar.org\/CorpusID:235692795","DOI":"10.1109\/CVPR46437.2021.00553"},{"key":"1_CR42","unstructured":"Zhou, D., et al.: Least-to-most prompting enables complex reasoning in large language models. ArXiv abs\/2205.10625 (2022). https:\/\/api.semanticscholar.org\/CorpusID:248986239"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ECCV 2024"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-72775-7_1","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,9,29]],"date-time":"2024-09-29T07:36:15Z","timestamp":1727595375000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-72775-7_1"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,9,30]]},"ISBN":["9783031727740","9783031727757"],"references-count":42,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-72775-7_1","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"type":"print","value":"0302-9743"},{"type":"electronic","value":"1611-3349"}],"subject":[],"published":{"date-parts":[[2024,9,30]]},"assertion":[{"value":"30 September 2024","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ECCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"European Conference on Computer Vision","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Milan","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Italy","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"29 September 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"4 October 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"18","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"eccv2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/eccv2024.ecva.net\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}