{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,16]],"date-time":"2026-07-16T05:08:37Z","timestamp":1784178517287,"version":"3.55.0"},"publisher-location":"New York, NY, USA","reference-count":55,"publisher":"ACM","license":[{"start":{"date-parts":[[2022,10,10]],"date-time":"2022-10-10T00:00:00Z","timestamp":1665360000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"DOI":"10.13039\/501100002858","name":"China Postdoctoral Science Foundation","doi-asserted-by":"publisher","award":["BX2021055,2021M690027"],"award-info":[{"award-number":["BX2021055,2021M690027"]}],"id":[{"id":"10.13039\/501100002858","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Dongguan Songshan Lake Introduction Program of Leading Innovative and Entrepreneurial Talents","award":["N\/A"],"award-info":[{"award-number":["N\/A"]}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62102070,U20B2063"],"award-info":[{"award-number":["62102070,U20B2063"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2022,10,10]]},"DOI":"10.1145\/3503161.3548184","type":"proceedings-article","created":{"date-parts":[[2022,10,10]],"date-time":"2022-10-10T15:43:12Z","timestamp":1665416592000},"page":"3253-3261","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":11,"title":["Non-Autoregressive Cross-Modal Coherence Modelling"],"prefix":"10.1145","author":[{"given":"Yi","family":"Bin","sequence":"first","affiliation":[{"name":"University of Electronic Science and Technology of China, Chengdu, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Wenhao","family":"Shi","sequence":"additional","affiliation":[{"name":"University of Electronic Science and Technology of China, Chengdu, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jipeng","family":"Zhang","sequence":"additional","affiliation":[{"name":"The Hong Kong University of Science and Technology, Hong Kong SAR, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yujuan","family":"Ding","sequence":"additional","affiliation":[{"name":"The Hong Kong Polytechnic University, Hong Kong SAR, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yang","family":"Yang","sequence":"additional","affiliation":[{"name":"University of Electronic Science and Technology of China &amp; Institute of Electronic and Information Engineering of UESTC in Guangdong, Chengdu, Dongguan, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Heng Tao","family":"Shen","sequence":"additional","affiliation":[{"name":"University of Electronic Science and Technology of China &amp; Peng Cheng Laboratory, Chengdu, Shenzhen, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2022,10,10]]},"reference":[{"key":"e_1_3_2_2_1_1","doi-asserted-by":"crossref","unstructured":"Samuel Albanie Arsha Nagrani Andrea Vedaldi and Andrew Zisserman. 2018. Emotion recognition in speech using cross-modal transfer in the wild. In ACM Multimedia. 292--301. Samuel Albanie Arsha Nagrani Andrea Vedaldi and Andrew Zisserman. 2018. Emotion recognition in speech using cross-modal transfer in the wild. In ACM Multimedia. 292--301.","DOI":"10.1145\/3240508.3240578"},{"key":"e_1_3_2_2_2_1","unstructured":"Humam Alwassel Dhruv Mahajan Bruno Korbar Lorenzo Torresani Bernard Ghanem and Du Tran. 2020. Self-supervised learning by cross-modal audio-video clustering. In NeurIPS. 9758--9770. Humam Alwassel Dhruv Mahajan Bruno Korbar Lorenzo Torresani Bernard Ghanem and Du Tran. 2020. Self-supervised learning by cross-modal audio-video clustering. In NeurIPS. 9758--9770."},{"key":"e_1_3_2_2_3_1","volume-title":"Vqa: Visual question answering. In ICCV. 2425--2433.","author":"Antol Stanislaw","year":"2015","unstructured":"Stanislaw Antol , Aishwarya Agrawal , Jiasen Lu , Margaret Mitchell , Dhruv Batra , C Lawrence Zitnick , and Devi Parikh . 2015 . Vqa: Visual question answering. In ICCV. 2425--2433. Stanislaw Antol, Aishwarya Agrawal, Jiasen Lu, Margaret Mitchell, Dhruv Batra, C Lawrence Zitnick, and Devi Parikh. 2015. Vqa: Visual question answering. In ICCV. 2425--2433."},{"key":"e_1_3_2_2_4_1","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2017.2753232"},{"key":"e_1_3_2_2_5_1","volume-title":"Kyung Hyun Cho, and Yoshua Bengio","author":"Bahdanau Dzmitry","year":"2015","unstructured":"Dzmitry Bahdanau , Kyung Hyun Cho, and Yoshua Bengio . 2015 . Neural machine translation by jointly learning to align and translate. In ICLR. Dzmitry Bahdanau, Kyung Hyun Cho, and Yoshua Bengio. 2015. Neural machine translation by jointly learning to align and translate. In ICLR."},{"key":"e_1_3_2_2_6_1","doi-asserted-by":"publisher","DOI":"10.1162\/coli.2008.34.1.1"},{"key":"e_1_3_2_2_7_1","unstructured":"Regina Barzilay and Lillian Lee. 2004. Catching the Drift: Probabilistic Content Models with Applications to Generation and Summarization. In HLT-NAACL. 113--120. Regina Barzilay and Lillian Lee. 2004. Catching the Drift: Probabilistic Content Models with Applications to Generation and Summarization. In HLT-NAACL. 113--120."},{"key":"e_1_3_2_2_8_1","first-page":"52","article-title":"Entity slot filling for visual captioning","volume":"32","author":"Bin Yi","year":"2021","unstructured":"Yi Bin , Yujuan Ding , Bo Peng , Liang Peng , Yang Yang , and Tat-Seng Chua . 2021 . Entity slot filling for visual captioning . IEEE TCSVT , Vol. 32 , 1 (2021), 52 -- 62 . Yi Bin, Yujuan Ding, Bo Peng, Liang Peng, Yang Yang, and Tat-Seng Chua. 2021. Entity slot filling for visual captioning. IEEE TCSVT, Vol. 32, 1 (2021), 52--62.","journal-title":"IEEE TCSVT"},{"key":"e_1_3_2_2_9_1","doi-asserted-by":"crossref","unstructured":"Yi Bin Yang Yang Jie Zhou Zi Huang and Heng Tao Shen. 2017. Adaptively attending to visual attributes and linguistic knowledge for captioning. In ACM Multimedia. 1345--1353. Yi Bin Yang Yang Jie Zhou Zi Huang and Heng Tao Shen. 2017. Adaptively attending to visual attributes and linguistic knowledge for captioning. In ACM Multimedia. 1345--1353.","DOI":"10.1145\/3123266.3123391"},{"key":"e_1_3_2_2_10_1","doi-asserted-by":"crossref","unstructured":"Tanner Bohn Yining Hu Jinhang Zhang and Charles Ling. 2019. Learning Sentence Embeddings for Coherence Modelling and Beyond. In RANLP. 151--160. Tanner Bohn Yining Hu Jinhang Zhang and Charles Ling. 2019. Learning Sentence Embeddings for Coherence Modelling and Beyond. In RANLP. 151--160.","DOI":"10.26615\/978-954-452-056-4_018"},{"key":"e_1_3_2_2_11_1","doi-asserted-by":"crossref","unstructured":"Yue Cao Mingsheng Long Jianmin Wang Qiang Yang and Philip S Yu. 2016. Deep visual-semantic hashing for cross-modal retrieval. In SIGKDD. 1445--1454. Yue Cao Mingsheng Long Jianmin Wang Qiang Yang and Philip S Yu. 2016. Deep visual-semantic hashing for cross-modal retrieval. In SIGKDD. 1445--1454.","DOI":"10.1145\/2939672.2939812"},{"key":"e_1_3_2_2_12_1","volume-title":"Neural sentence ordering. arXiv preprint arXiv:1607.06952","author":"Chen Xinchi","year":"2016","unstructured":"Xinchi Chen , Xipeng Qiu , and Xuanjing Huang . 2016. Neural sentence ordering. arXiv preprint arXiv:1607.06952 ( 2016 ). Xinchi Chen, Xipeng Qiu, and Xuanjing Huang. 2016. Neural sentence ordering. arXiv preprint arXiv:1607.06952 (2016)."},{"key":"e_1_3_2_2_13_1","volume-title":"Dzmitry Bahdanau, Fethi Bougares, Holger Schwenk, and Yoshua Bengio.","author":"Cho Kyunghyun","year":"2014","unstructured":"Kyunghyun Cho , Bart van Merrienboer , cC aglar G\u00fclcc ehre , Dzmitry Bahdanau, Fethi Bougares, Holger Schwenk, and Yoshua Bengio. 2014 . Learning Phrase Representations using RNN Encoder-Decoder for Statistical Machine Translation. In EMNLP. Kyunghyun Cho, Bart van Merrienboer, cC aglar G\u00fclcc ehre, Dzmitry Bahdanau, Fethi Bougares, Holger Schwenk, and Yoshua Bengio. 2014. Learning Phrase Representations using RNN Encoder-Decoder for Statistical Machine Translation. In EMNLP."},{"key":"e_1_3_2_2_14_1","unstructured":"Baiyun Cui Yingming Li Ming Chen and Zhongfei Zhang. 2018. Deep attentive sentence ordering network. In EMNLP. 4340--4349. Baiyun Cui Yingming Li Ming Chen and Zhongfei Zhang. 2018. Deep attentive sentence ordering network. In EMNLP. 4340--4349."},{"key":"e_1_3_2_2_15_1","unstructured":"Baiyun Cui Yingming Li and Zhongfei Zhang. 2020. BERT-enhanced Relational Sentence Ordering Network. In EMNLP. 6310--6320. Baiyun Cui Yingming Li and Zhongfei Zhang. 2020. BERT-enhanced Relational Sentence Ordering Network. In EMNLP. 6310--6320."},{"key":"e_1_3_2_2_16_1","doi-asserted-by":"crossref","unstructured":"Fangxiang Feng Xiaojie Wang and Ruifan Li. 2014. Cross-modal retrieval with correspondence autoencoder. In ACM Multimedia. 7--16. Fangxiang Feng Xiaojie Wang and Ruifan Li. 2014. Cross-modal retrieval with correspondence autoencoder. In ACM Multimedia. 7--16.","DOI":"10.1145\/2647868.2654902"},{"key":"e_1_3_2_2_17_1","volume-title":"End-to-end neural sentence ordering using pointer network. arXiv preprint arXiv:1611.04953","author":"Gong Jingjing","year":"2016","unstructured":"Jingjing Gong , Xinchi Chen , Xipeng Qiu , and Xuanjing Huang . 2016. End-to-end neural sentence ordering using pointer network. arXiv preprint arXiv:1611.04953 ( 2016 ). Jingjing Gong, Xinchi Chen, Xipeng Qiu, and Xuanjing Huang. 2016. End-to-end neural sentence ordering using pointer network. arXiv preprint arXiv:1611.04953 (2016)."},{"key":"e_1_3_2_2_18_1","unstructured":"Jiatao Gu James Bradbury Caiming Xiong Victor O. K. Li and Richard Socher. 2018. Non-Autoregressive Neural Machine Translation. In ICLR. Jiatao Gu James Bradbury Caiming Xiong Victor O. K. Li and Richard Socher. 2018. Non-Autoregressive Neural Machine Translation. In ICLR."},{"key":"e_1_3_2_2_19_1","doi-asserted-by":"crossref","unstructured":"Xiang Guan Guoqing Wang Xing Xu and Yi Bin. 2021. Learning Hierarchal Channel Attention for Fine-grained Visual Classification. In ACM Multimedia. 5011--5019. Xiang Guan Guoqing Wang Xing Xu and Yi Bin. 2021. Learning Hierarchal Channel Attention for Fine-grained Visual Classification. In ACM Multimedia. 5011--5019.","DOI":"10.1145\/3474085.3475184"},{"key":"e_1_3_2_2_20_1","doi-asserted-by":"crossref","unstructured":"Saurabh Gupta Judy Hoffman and Jitendra Malik. 2016. Cross modal distillation for supervision transfer. In CVPR. 2827--2836. Saurabh Gupta Judy Hoffman and Jitendra Malik. 2016. Cross modal distillation for supervision transfer. In CVPR. 2827--2836.","DOI":"10.1109\/CVPR.2016.309"},{"key":"e_1_3_2_2_21_1","unstructured":"Kaiming He Xiangyu Zhang Shaoqing Ren and Jian Sun. 2016. Deep residual learning for image recognition. In CVPR. 770--778. Kaiming He Xiangyu Zhang Shaoqing Ren and Jian Sun. 2016. Deep residual learning for image recognition. In CVPR. 770--778."},{"key":"e_1_3_2_2_22_1","volume-title":"Long short-term memory. Neural computation","author":"Hochreiter Sepp","year":"1997","unstructured":"Sepp Hochreiter and J\u00fcrgen Schmidhuber . 1997. Long short-term memory. Neural computation , Vol. 9 , 8 ( 1997 ), 1735--1780. Sepp Hochreiter and J\u00fcrgen Schmidhuber. 1997. Long short-term memory. Neural computation, Vol. 9, 8 (1997), 1735--1780."},{"key":"e_1_3_2_2_23_1","unstructured":"Ting-Hao (Kenneth) Huang Francis Ferraro Nasrin Mostafazadeh Ishan Misra Aishwarya Agrawal Jacob Devlin Ross B. Girshick Xiaodong He Pushmeet Kohli Dhruv Batra C. Lawrence Zitnick Devi Parikh Lucy Vanderwende Michel Galley and Margaret Mitchell. 2016. Visual Storytelling. In NAACL-HLT. 1233--1239. Ting-Hao (Kenneth) Huang Francis Ferraro Nasrin Mostafazadeh Ishan Misra Aishwarya Agrawal Jacob Devlin Ross B. Girshick Xiaodong He Pushmeet Kohli Dhruv Batra C. Lawrence Zitnick Devi Parikh Lucy Vanderwende Michel Galley and Margaret Mitchell. 2016. Visual Storytelling. In NAACL-HLT. 1233--1239."},{"key":"e_1_3_2_2_24_1","volume-title":"Kingma and Jimmy Ba","author":"Diederik","year":"2015","unstructured":"Diederik P. Kingma and Jimmy Ba . 2015 . Adam : A Method for Stochastic Optimization. In ICLR. Diederik P. Kingma and Jimmy Ba. 2015. Adam: A Method for Stochastic Optimization. In ICLR."},{"key":"e_1_3_2_2_25_1","unstructured":"Bruno Korbar Du Tran and Lorenzo Torresani. 2018. Cooperative learning of audio and video models from self-supervised synchronization. In NeurIPS. 7774--7785. Bruno Korbar Du Tran and Lorenzo Torresani. 2018. Cooperative learning of audio and video models from self-supervised synchronization. In NeurIPS. 7774--7785."},{"key":"e_1_3_2_2_26_1","volume-title":"Bryan McCann, Caiming Xiong, and Richard Socher.","author":"Kry'sci'nski Wojciech","year":"2019","unstructured":"Wojciech Kry'sci'nski , Nitish Shirish Keskar , Bryan McCann, Caiming Xiong, and Richard Socher. 2019 . Neural Text Summarization: A Critical Evaluation. In EMNLP-IJCNLP. 540--551. Wojciech Kry'sci'nski, Nitish Shirish Keskar, Bryan McCann, Caiming Xiong, and Richard Socher. 2019. Neural Text Summarization: A Critical Evaluation. In EMNLP-IJCNLP. 540--551."},{"key":"e_1_3_2_2_27_1","doi-asserted-by":"crossref","unstructured":"Pawan Kumar Dhanajit Brahma Harish Karnick and Piyush Rai. 2020. Deep Attentive Ranking Networks for Learning to Order Sentences.. In AAAI. 8115--8122. Pawan Kumar Dhanajit Brahma Harish Karnick and Piyush Rai. 2020. Deep Attentive Ranking Networks for Learning to Order Sentences.. In AAAI. 8115--8122.","DOI":"10.1609\/aaai.v34i05.6323"},{"key":"e_1_3_2_2_28_1","doi-asserted-by":"crossref","unstructured":"Mirella Lapata. 2003. Probabilistic text structuring: Experiments with sentence ordering. In ACL. 545--552. Mirella Lapata. 2003. Probabilistic text structuring: Experiments with sentence ordering. In ACL. 545--552.","DOI":"10.3115\/1075096.1075165"},{"key":"e_1_3_2_2_29_1","first-page":"3226","article-title":"Semi-heterogeneous three-way joint embedding network for sketch-based image retrieval","volume":"30","author":"Lei Jianjun","year":"2019","unstructured":"Jianjun Lei , Yuxin Song , Bo Peng , Zhanyu Ma , Ling Shao , and Yi-Zhe Song . 2019 . Semi-heterogeneous three-way joint embedding network for sketch-based image retrieval . IEEE TCSVT , Vol. 30 , 9 (2019), 3226 -- 3237 . Jianjun Lei, Yuxin Song, Bo Peng, Zhanyu Ma, Ling Shao, and Yi-Zhe Song. 2019. Semi-heterogeneous three-way joint embedding network for sketch-based image retrieval. IEEE TCSVT, Vol. 30, 9 (2019), 3226--3237.","journal-title":"IEEE TCSVT"},{"key":"e_1_3_2_2_30_1","doi-asserted-by":"crossref","unstructured":"Jiwei Li and Eduard Hovy. 2014. A model of coherence based on distributed sentence representation. In EMNLP. 2039--2048. Jiwei Li and Eduard Hovy. 2014. A model of coherence based on distributed sentence representation. In EMNLP. 2039--2048.","DOI":"10.3115\/v1\/D14-1218"},{"key":"e_1_3_2_2_31_1","volume-title":"Neural net models for open-domain discourse coherence. arXiv preprint arXiv:1606.01545","author":"Li Jiwei","year":"2016","unstructured":"Jiwei Li and Dan Jurafsky . 2016. Neural net models for open-domain discourse coherence. arXiv preprint arXiv:1606.01545 ( 2016 ). Jiwei Li and Dan Jurafsky. 2016. Neural net models for open-domain discourse coherence. arXiv preprint arXiv:1606.01545 (2016)."},{"key":"e_1_3_2_2_32_1","unstructured":"Yunzhu Li Jun-Yan Zhu Russ Tedrake and Antonio Torralba. 2019. Connecting touch and vision via cross-modal prediction. In CVPR. 10609--10618. Yunzhu Li Jun-Yan Zhu Russ Tedrake and Antonio Torralba. 2019. Connecting touch and vision via cross-modal prediction. In CVPR. 10609--10618."},{"key":"e_1_3_2_2_33_1","volume-title":"AAAI","volume":"32","author":"Logeswaran Lajanugen","year":"2018","unstructured":"Lajanugen Logeswaran , Honglak Lee , and Dragomir Radev . 2018 . Sentence ordering and coherence modeling using recurrent neural networks . In AAAI , Vol. 32 . Lajanugen Logeswaran, Honglak Lee, and Dragomir Radev. 2018. Sentence ordering and coherence modeling using recurrent neural networks. In AAAI, Vol. 32."},{"key":"e_1_3_2_2_34_1","doi-asserted-by":"publisher","DOI":"10.1145\/3503927"},{"key":"e_1_3_2_2_35_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.neunet.2020.02.022"},{"key":"e_1_3_2_2_36_1","doi-asserted-by":"crossref","unstructured":"Liang Peng Shuangji Yang Yi Bin and Guoqing Wang. 2021. Progressive graph attention network for video question answering. In ACM Multimedia. 2871--2879. Liang Peng Shuangji Yang Yi Bin and Guoqing Wang. 2021. Progressive graph attention network for video question answering. In ACM Multimedia. 2871--2879.","DOI":"10.1145\/3474085.3475193"},{"key":"e_1_3_2_2_37_1","volume-title":"Glove: Global vectors for word representation. In EMNLP. 1532--1543.","author":"Pennington Jeffrey","year":"2014","unstructured":"Jeffrey Pennington , Richard Socher , and Christopher D Manning . 2014 . Glove: Global vectors for word representation. In EMNLP. 1532--1543. Jeffrey Pennington, Richard Socher, and Christopher D Manning. 2014. Glove: Global vectors for word representation. In EMNLP. 1532--1543."},{"key":"e_1_3_2_2_38_1","doi-asserted-by":"crossref","unstructured":"Shrimai Prabhumoye Ruslan Salakhutdinov and Alan W Black. 2020. Topological Sort for Sentence Ordering. In ACL. 2783--2792. Shrimai Prabhumoye Ruslan Salakhutdinov and Alan W Black. 2020. Topological Sort for Sentence Ordering. In ACL. 2783--2792.","DOI":"10.18653\/v1\/2020.acl-main.248"},{"key":"e_1_3_2_2_39_1","doi-asserted-by":"publisher","DOI":"10.1002\/wcs.12"},{"key":"e_1_3_2_2_40_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-11752-2_15"},{"key":"e_1_3_2_2_41_1","doi-asserted-by":"publisher","DOI":"10.1109\/TKDE.2020.2970050"},{"key":"e_1_3_2_2_42_1","unstructured":"Ashish Vaswani Noam Shazeer Niki Parmar Jakob Uszkoreit Llion Jones Aidan N Gomez \u0141ukasz Kaiser and Illia Polosukhin. 2017a. Attention is all you need. In NeurIPS. 5998--6008. Ashish Vaswani Noam Shazeer Niki Parmar Jakob Uszkoreit Llion Jones Aidan N Gomez \u0141ukasz Kaiser and Illia Polosukhin. 2017a. Attention is all you need. In NeurIPS. 5998--6008."},{"key":"e_1_3_2_2_43_1","unstructured":"Ashish Vaswani Noam Shazeer Niki Parmar Jakob Uszkoreit Llion Jones Aidan N. Gomez Lukasz Kaiser and Illia Polosukhin. 2017b. Attention is All you Need. In NeurIPS. 5998--6008. Ashish Vaswani Noam Shazeer Niki Parmar Jakob Uszkoreit Llion Jones Aidan N. Gomez Lukasz Kaiser and Illia Polosukhin. 2017b. Attention is All you Need. In NeurIPS. 5998--6008."},{"key":"e_1_3_2_2_44_1","unstructured":"Oriol Vinyals Samy Bengio and Manjunath Kudlur. 2016. Order matters: Sequence to sequence for sets. In ICLR. Oriol Vinyals Samy Bengio and Manjunath Kudlur. 2016. Order matters: Sequence to sequence for sets. In ICLR."},{"key":"e_1_3_2_2_45_1","unstructured":"Oriol Vinyals Meire Fortunato and Navdeep Jaitly. 2015. Pointer networks. In NeurIPS. 2692--2700. Oriol Vinyals Meire Fortunato and Navdeep Jaitly. 2015. Pointer networks. In NeurIPS. 2692--2700."},{"key":"e_1_3_2_2_46_1","doi-asserted-by":"crossref","unstructured":"Bokun Wang Yang Yang Xing Xu Alan Hanjalic and Heng Tao Shen. 2017. Adversarial cross-modal retrieval. In ACM Multimedia. 154--162. Bokun Wang Yang Yang Xing Xu Alan Hanjalic and Heng Tao Shen. 2017. Adversarial cross-modal retrieval. In ACM Multimedia. 154--162.","DOI":"10.1145\/3123266.3123326"},{"key":"e_1_3_2_2_47_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v33i01.33017184"},{"key":"e_1_3_2_2_48_1","first-page":"1","article-title":"Survey on Deep Multi-modal Data Analytics","volume":"17","author":"Wang Yang","year":"2021","unstructured":"Yang Wang . 2021 . Survey on Deep Multi-modal Data Analytics : Collaboration, Rivalry, and Fusion. ACM TOMM , Vol. 17 , 1s (2021), 1 -- 25 . Yang Wang. 2021. Survey on Deep Multi-modal Data Analytics: Collaboration, Rivalry, and Fusion. ACM TOMM, Vol. 17, 1s (2021), 1--25.","journal-title":"Collaboration, Rivalry, and Fusion. ACM TOMM"},{"key":"e_1_3_2_2_49_1","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2021.3088863"},{"key":"e_1_3_2_2_50_1","volume-title":"ICML. PMLR","author":"Xu Kelvin","year":"2015","unstructured":"Kelvin Xu , Jimmy Ba , Ryan Kiros , Kyunghyun Cho , Aaron Courville , Ruslan Salakhudinov , Rich Zemel , and Yoshua Bengio . 2015 . Show, attend and tell: Neural image caption generation with visual attention . In ICML. PMLR , 2048--2057. Kelvin Xu, Jimmy Ba, Ryan Kiros, Kyunghyun Cho, Aaron Courville, Ruslan Salakhudinov, Rich Zemel, and Yoshua Bengio. 2015. Show, attend and tell: Neural image caption generation with visual attention. In ICML. PMLR, 2048--2057."},{"key":"e_1_3_2_2_51_1","volume-title":"Joint feature synthesis and embedding: Adversarial cross-modal retrieval revisited","author":"Xu Xing","year":"2020","unstructured":"Xing Xu , Kaiyi Lin , Yang Yang , Alan Hanjalic , and Heng Tao Shen . 2020. Joint feature synthesis and embedding: Adversarial cross-modal retrieval revisited . IEEE TPAMI ( 2020 ). Xing Xu, Kaiyi Lin, Yang Yang, Alan Hanjalic, and Heng Tao Shen. 2020. Joint feature synthesis and embedding: Adversarial cross-modal retrieval revisited. IEEE TPAMI (2020)."},{"key":"e_1_3_2_2_52_1","first-page":"5600","article-title":"Video captioning by adversarial LSTM","volume":"27","author":"Yang Yang","year":"2018","unstructured":"Yang Yang , Jie Zhou , Jiangbo Ai , Yi Bin , Alan Hanjalic , Heng Tao Shen , and Yanli Ji . 2018 . Video captioning by adversarial LSTM . IEEE TIP , Vol. 27 , 11 (2018), 5600 -- 5611 . Yang Yang, Jie Zhou, Jiangbo Ai, Yi Bin, Alan Hanjalic, Heng Tao Shen, and Yanli Ji. 2018. Video captioning by adversarial LSTM. IEEE TIP, Vol. 27, 11 (2018), 5600--5611.","journal-title":"IEEE TIP"},{"key":"e_1_3_2_2_53_1","doi-asserted-by":"crossref","unstructured":"Yongjing Yin Fandong Meng Jinsong Su Yubin Ge Linfeng Song Jie Zhou and Jiebo Luo. 2020. Enhancing Pointer Network for Sentence Ordering with Pairwise Ordering Predictions.. In AAAI. 9482--9489. Yongjing Yin Fandong Meng Jinsong Su Yubin Ge Linfeng Song Jie Zhou and Jiebo Luo. 2020. Enhancing Pointer Network for Sentence Ordering with Pairwise Ordering Predictions.. In AAAI. 9482--9489.","DOI":"10.1609\/aaai.v34i05.6492"},{"key":"e_1_3_2_2_54_1","volume-title":"Graph-based neural sentence ordering","author":"Yin Yongjing","unstructured":"Yongjing Yin , Linfeng Song , Jinsong Su , Jiali Zeng , Chulun Zhou , and Jiebo Luo . 2019. Graph-based neural sentence ordering . In IJCAI. AAAI Press , 5387--5393. Yongjing Yin, Linfeng Song, Jinsong Su, Jiali Zeng, Chulun Zhou, and Jiebo Luo. 2019. Graph-based neural sentence ordering. In IJCAI. AAAI Press, 5387--5393."},{"key":"e_1_3_2_2_55_1","doi-asserted-by":"crossref","unstructured":"Pengpeng Zeng Haonan Zhang Jingkuan Song and Lianli Gao. 2022. S2 Transformer for Image Captioning. In IJCAI. Pengpeng Zeng Haonan Zhang Jingkuan Song and Lianli Gao. 2022. S2 Transformer for Image Captioning. In IJCAI.","DOI":"10.24963\/ijcai.2022\/224"}],"event":{"name":"MM '22: The 30th ACM International Conference on Multimedia","location":"Lisboa Portugal","acronym":"MM '22","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 30th ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3503161.3548184","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3503161.3548184","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T19:00:20Z","timestamp":1750186820000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3503161.3548184"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022,10,10]]},"references-count":55,"alternative-id":["10.1145\/3503161.3548184","10.1145\/3503161"],"URL":"https:\/\/doi.org\/10.1145\/3503161.3548184","relation":{},"subject":[],"published":{"date-parts":[[2022,10,10]]},"assertion":[{"value":"2022-10-10","order":2,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}