{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,2,26]],"date-time":"2026-02-26T15:21:55Z","timestamp":1772119315642,"version":"3.50.1"},"publisher-location":"New York, NY, USA","reference-count":44,"publisher":"ACM","license":[{"start":{"date-parts":[[2019,10,15]],"date-time":"2019-10-15T00:00:00Z","timestamp":1571097600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2019,10,15]]},"DOI":"10.1145\/3343031.3350925","type":"proceedings-article","created":{"date-parts":[[2019,10,21]],"date-time":"2019-10-21T16:32:26Z","timestamp":1571675546000},"page":"1202-1210","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":41,"title":["CRA-Net"],"prefix":"10.1145","author":[{"given":"Liang","family":"Peng","sequence":"first","affiliation":[{"name":"University of Electronic Science and Tenchnology of China, Chengdu, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yang","family":"Yang","sequence":"additional","affiliation":[{"name":"University of Electronic Science and Tenchnology of China, Chengdu, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zheng","family":"Wang","sequence":"additional","affiliation":[{"name":"University of Electronic Science and Tenchnology of China, Chengdu, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xiao","family":"Wu","sequence":"additional","affiliation":[{"name":"Southwest Jiaotong University, Chengdu, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zi","family":"Huang","sequence":"additional","affiliation":[{"name":"The University of Queensland, Queensland, Australia"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2019,10,15]]},"reference":[{"key":"e_1_3_2_1_1_1","volume-title":"Bottom-Up and Top-Down Attention for Image Captioning and Visual Question Answering. In International Conference on Computer Vision and Pattern Recogintion. 6077--6086","author":"Anderson Peter","year":"2018"},{"key":"e_1_3_2_1_2_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.279"},{"key":"e_1_3_2_1_3_1","volume-title":"MUTAN: Multimodal Tucker Fusion for Visual Question Answering. In International Conference on Computer Vision. 2612--2620","author":"Ben-Younes Hedi","year":"2017"},{"key":"e_1_3_2_1_4_1","doi-asserted-by":"publisher","DOI":"10.1109\/TCYB.2018.2831447"},{"key":"e_1_3_2_1_5_1","doi-asserted-by":"publisher","DOI":"10.1145\/2964284.2967258"},{"key":"e_1_3_2_1_6_1","volume-title":"MR-NET: Exploiting Mutual Relation for Visual Relationship Detection. In AAAI Conference on Artificial Intelligence. 8110--8117","author":"Bin Yi","year":"2019"},{"key":"e_1_3_2_1_7_1","doi-asserted-by":"publisher","DOI":"10.1145\/3123266.3123391"},{"key":"e_1_3_2_1_8_1","volume-title":"MUREL: Multimodal Relational Reasoning for Visual Question Answering. arXiv preprint arXiv:1902.09487","author":"Cadene Remi","year":"2019"},{"key":"e_1_3_2_1_9_1","volume-title":"Dzmitry Bahdanau, and Yoshua Bengio.","author":"Cho Kyunghyun","year":"2014"},{"key":"e_1_3_2_1_10_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D16-1044"},{"key":"e_1_3_2_1_11_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.670"},{"key":"e_1_3_2_1_12_1","volume-title":"Visual Spatial Attention Network for Relationship Detection. In ACM International Conference on Multimedia. 510--518","author":"Han Chaojun","year":"2018"},{"key":"e_1_3_2_1_13_1","doi-asserted-by":"publisher","DOI":"10.1162\/neco.1997.9.8.1735"},{"key":"e_1_3_2_1_14_1","volume-title":"Multimodal Learning and Reasoning for Visual Question Answering. In Conference and Workshop on Neural Information Processing Systems. 551--562","author":"Ilievski Ilija","year":"2017"},{"key":"e_1_3_2_1_15_1","volume-title":"International Conference on Computer Vision and Pattern Recogintion. 770--778","author":"He"},{"key":"e_1_3_2_1_16_1","unstructured":"Simonyan K and Zisserman A. 2014. Very deep convolutional networks for large-scale image recognition. arXiv preprint arXiv:1409.1556 (2014).  Simonyan K and Zisserman A. 2014. Very deep convolutional networks for large-scale image recognition. arXiv preprint arXiv:1409.1556 (2014)."},{"key":"e_1_3_2_1_17_1","volume-title":"Bilinear Attention Networks. In Conference and Workshop on Neural Information Processing Systems. 1571--1581","author":"Kim Jin-Hwa","year":"2018"},{"key":"e_1_3_2_1_18_1","volume-title":"International Conference on Learning Representations .","author":"Kim Jin-Hwa","year":"2017"},{"key":"e_1_3_2_1_19_1","volume-title":"Adam: A method for stochastic optimization. arXiv preprint arXiv:1412.6980","author":"Kingma Diederik P","year":"2014"},{"key":"e_1_3_2_1_20_1","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-016-0981-7"},{"key":"e_1_3_2_1_21_1","volume-title":"Conference and Workshop on Neural Information Processing Systems . 4655--4663","author":"Li Ruiyu","year":"2016"},{"key":"e_1_3_2_1_22_1","volume-title":"Beyond RNNs: Positional Self-Attention with Co-Attention for Video Question Answering. In AAAI Conference on Artificial Intelligence. 8658--8665","author":"Li Xiangpeng","year":"2019"},{"key":"e_1_3_2_1_23_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"e_1_3_2_1_24_1","volume-title":"Feature Enhancement in Attention for Visual Question Answering. In International Joint Conference on Artificial Intelligence. 4216--4222","author":"Lin Yuetan","year":"2018"},{"key":"e_1_3_2_1_25_1","volume-title":"Hierarchical Co-Attention for Visual Question Answering. In Conference and Workshop on Neural Information Processing Systems. 289--297","author":"Lu Jiasen","year":"2016"},{"key":"e_1_3_2_1_26_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.232"},{"key":"e_1_3_2_1_27_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00637"},{"key":"e_1_3_2_1_28_1","volume-title":"Learning Conditioned Graph Structures for Interpretable Visual Question Answering. In Conference and Workshop on Neural Information Processing Systems. 8334--8343","author":"Norcliffe-Brown Will","year":"2018"},{"key":"e_1_3_2_1_29_1","doi-asserted-by":"publisher","DOI":"10.1007\/s11042-018-6389-3"},{"key":"e_1_3_2_1_30_1","volume-title":"Europeon Conference on Computer Vision. 552--567","author":"Qing Li","year":"2018"},{"key":"e_1_3_2_1_31_1","volume-title":"Conference and Workshop on Neural Information Processing Systems. 901--909","author":"Salimans Tim","year":"2016"},{"key":"e_1_3_2_1_32_1","volume-title":"Conference and Workshop on Neural Information Processing Systems. 4967--4976","author":"Santoro Adam","year":"2017"},{"key":"e_1_3_2_1_33_1","volume-title":"Chain of Reasoning for Visual Question Answering. In Conference and Workshop on Neural Information Processing Systems. 273--283","author":"Wu Chenfei","year":"2018"},{"key":"e_1_3_2_1_34_1","doi-asserted-by":"publisher","DOI":"10.1145\/3240508.3240513"},{"key":"e_1_3_2_1_35_1","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2018.2855422"},{"key":"e_1_3_2_1_36_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.10"},{"key":"e_1_3_2_1_37_1","volume-title":"Multi-modal Learning with Prior Visual Relation Reasoning. arXiv preprint arXiv:1812.09681","author":"Yang Zhuoqian","year":"2018"},{"key":"e_1_3_2_1_38_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.446"},{"key":"e_1_3_2_1_39_1","volume-title":"Multi-modal Factorized Bilinear Pooling with Co-Attention Learning for Visual Question Answering. International Conference on Computer Vision","author":"Yu Zhou","year":"2017"},{"key":"e_1_3_2_1_40_1","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2018.2817340"},{"key":"e_1_3_2_1_41_1","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2018.2855415"},{"key":"e_1_3_2_1_42_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-68155-9_20"},{"key":"e_1_3_2_1_43_1","volume-title":"International Conference on Learning Representations .","author":"Zhang Yan","year":"2018"},{"key":"e_1_3_2_1_44_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.71"}],"event":{"name":"MM '19: The 27th ACM International Conference on Multimedia","location":"Nice France","acronym":"MM '19","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 27th ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3343031.3350925","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3343031.3350925","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T23:13:17Z","timestamp":1750201997000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3343031.3350925"}},"subtitle":["Composed Relation Attention Network for Visual Question Answering"],"short-title":[],"issued":{"date-parts":[[2019,10,15]]},"references-count":44,"alternative-id":["10.1145\/3343031.3350925","10.1145\/3343031"],"URL":"https:\/\/doi.org\/10.1145\/3343031.3350925","relation":{},"subject":[],"published":{"date-parts":[[2019,10,15]]},"assertion":[{"value":"2019-10-15","order":2,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}