{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,30]],"date-time":"2026-06-30T02:55:23Z","timestamp":1782788123340,"version":"3.54.5"},"publisher-location":"New York, NY, USA","reference-count":51,"publisher":"ACM","license":[{"start":{"date-parts":[[2020,10,12]],"date-time":"2020-10-12T00:00:00Z","timestamp":1602460800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"name":"National Research Foundation Singapore"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2020,10,12]]},"DOI":"10.1145\/3394171.3413765","type":"proceedings-article","created":{"date-parts":[[2020,10,12]],"date-time":"2020-10-12T13:10:18Z","timestamp":1602508218000},"page":"1132-1141","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":22,"title":["Multi-modal Cooking Workflow Construction for Food Recipes"],"prefix":"10.1145","author":[{"given":"Liang-Ming","family":"Pan","sequence":"first","affiliation":[{"name":"National University of Singapore, Singapore, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jingjing","family":"Chen","sequence":"additional","affiliation":[{"name":"Fudan University, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jianlong","family":"Wu","sequence":"additional","affiliation":[{"name":"Fudan University, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shaoteng","family":"Liu","sequence":"additional","affiliation":[{"name":"Xi'an Jiaotong University, Xi'an, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Chong-Wah","family":"Ngo","sequence":"additional","affiliation":[{"name":"City University of Hong Kong, Hong Kong, Hong Kong"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Min-Yen","family":"Kan","sequence":"additional","affiliation":[{"name":"National University of Singapore, Singapore, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yugang","family":"Jiang","sequence":"additional","affiliation":[{"name":"Fudan University, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Tat-Seng","family":"Chua","sequence":"additional","affiliation":[{"name":"National university of Singapore, Singapore, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2020,10,12]]},"reference":[{"key":"e_1_3_2_2_1_1","first-page":"446","article-title":"Food-101 - Mining Discriminative Components with Random Forests","volume":"8694","author":"Bossard Lukas","year":"2014","unstructured":"Lukas Bossard , Matthieu Guillaumin , and Luc Van Gool . 2014 . Food-101 - Mining Discriminative Components with Random Forests . In Proceedings of ECCV , Vol. 8694. 446 -- 461 . Lukas Bossard, Matthieu Guillaumin, and Luc Van Gool. 2014. Food-101 - Mining Discriminative Components with Random Forests. In Proceedings of ECCV, Vol. 8694. 446--461.","journal-title":"Proceedings of ECCV"},{"key":"e_1_3_2_2_2_1","doi-asserted-by":"publisher","DOI":"10.1145\/3209978.3210036"},{"key":"e_1_3_2_2_3_1","doi-asserted-by":"publisher","DOI":"10.1145\/3209978.3210036"},{"key":"e_1_3_2_2_4_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i07.6626"},{"key":"e_1_3_2_2_5_1","volume-title":"Proceedings of ACM-MM. 1771--1779","author":"Ngo Chong-Wah","year":"2017","unstructured":"Jing-jing Chen, Chong-Wah Ngo , and Tat-Seng Chua . 2017 a. Cross-modal recipe retrieval with rich food attributes . In Proceedings of ACM-MM. 1771--1779 . Jing-jing Chen, Chong-Wah Ngo, and Tat-Seng Chua. 2017a. Cross-modal recipe retrieval with rich food attributes. In Proceedings of ACM-MM. 1771--1779."},{"key":"e_1_3_2_2_6_1","volume-title":"Proceedings of AAAI.","author":"Chen Jing-Jing","year":"2017","unstructured":"Jing-Jing Chen , Liangming Pan , Zhipeng Wei , Xiang Wang , Chong-Wah Ngo , and Tat-Seng Chua . 2017 b. Zero-shot Ingredient Recognition by Multi-Relational Graph Convolutional Network . In Proceedings of AAAI. Jing-Jing Chen, Liangming Pan, Zhipeng Wei, Xiang Wang, Chong-Wah Ngo, and Tat-Seng Chua. 2017b. Zero-shot Ingredient Recognition by Multi-Relational Graph Convolutional Network. In Proceedings of AAAI."},{"key":"e_1_3_2_2_7_1","volume-title":"Proceedings of ICLR.","author":"Chung Junyoung","year":"2017","unstructured":"Junyoung Chung , Sungjin Ahn , and Yoshua Bengio . 2017 . Hierarchical Multiscale Recurrent Neural Networks . In Proceedings of ICLR. Junyoung Chung, Sungjin Ahn, and Yoshua Bengio. 2017. Hierarchical Multiscale Recurrent Neural Networks. In Proceedings of ICLR."},{"key":"e_1_3_2_2_8_1","volume-title":"Proceedings of NAACL-HLT. 4171--4186","author":"Devlin Jacob","year":"2019","unstructured":"Jacob Devlin , Ming-Wei Chang , Kenton Lee , and Kristina Toutanova . 2019 . BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding . In Proceedings of NAACL-HLT. 4171--4186 . Jacob Devlin, Ming-Wei Chang, Kenton Lee, and Kristina Toutanova. 2019. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. In Proceedings of NAACL-HLT. 4171--4186."},{"key":"e_1_3_2_2_9_1","first-page":"866","article-title":"Modeling concept dependencies in a scientific corpus","volume":"1","author":"Gordon Jonathan","year":"2016","unstructured":"Jonathan Gordon , Linhong Zhu , Aram Galstyan , Prem Natarajan , and Gully Burns . 2016 . Modeling concept dependencies in a scientific corpus . In Proceedings of ACL , Vol. 1. 866 -- 875 . Jonathan Gordon, Linhong Zhu, Aram Galstyan, Prem Natarajan, and Gully Burns. 2016. Modeling concept dependencies in a scientific corpus. In Proceedings of ACL, Vol. 1. 866--875.","journal-title":"Proceedings of ACL"},{"key":"e_1_3_2_2_10_1","doi-asserted-by":"publisher","DOI":"10.1145\/1101149.1101228"},{"key":"e_1_3_2_2_11_1","doi-asserted-by":"publisher","DOI":"10.1145\/3077136.3080686"},{"key":"e_1_3_2_2_12_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.90"},{"key":"e_1_3_2_2_13_1","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2016.2614861"},{"key":"e_1_3_2_2_14_1","doi-asserted-by":"publisher","DOI":"10.1162\/neco.1997.9.8.1735"},{"key":"e_1_3_2_2_15_1","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2018.2814339"},{"key":"e_1_3_2_2_16_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D15-1090"},{"key":"e_1_3_2_2_17_1","volume-title":"Improving structural analysis of cooking recipe text. IEICE technical report. Data engineering","author":"Karikome Shihono","year":"2012","unstructured":"Shihono Karikome and Atsushi Fujii . 2012. Improving structural analysis of cooking recipe text. IEICE technical report. Data engineering , Vol. 112 , 75 ( 2012 ), 43--48. Shihono Karikome and Atsushi Fujii. 2012. Improving structural analysis of cooking recipe text. IEICE technical report. Data engineering, Vol. 112, 75 (2012), 43--48."},{"key":"e_1_3_2_2_18_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D15-1114"},{"key":"e_1_3_2_2_19_1","volume-title":"Supervised Multimodal Bitransformers for Classifying Images and Text. In NeurIPS 2019 Workshop on Visually Grounded Interaction and Language (ViGIL).","author":"Kiela Douwe","year":"2019","unstructured":"Douwe Kiela , Suvrat Bhooshan , Hamed Firooz , and Davide Testuggine . 2019 . Supervised Multimodal Bitransformers for Classifying Images and Text. In NeurIPS 2019 Workshop on Visually Grounded Interaction and Language (ViGIL). Douwe Kiela, Suvrat Bhooshan, Hamed Firooz, and Davide Testuggine. 2019. Supervised Multimodal Bitransformers for Classifying Images and Text. In NeurIPS 2019 Workshop on Visually Grounded Interaction and Language (ViGIL)."},{"key":"e_1_3_2_2_20_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D15-1193"},{"key":"e_1_3_2_2_21_1","volume-title":"Proceedings of AAAI.","author":"Liang Chen","year":"2017","unstructured":"Chen Liang , Jianbo Ye , Zhaohui Wu , Bart Pursel , and C Lee Giles . 2017 . Recovering concept prerequisite relations from university course dependencies . In Proceedings of AAAI. Chen Liang, Jianbo Ye, Zhaohui Wu, Bart Pursel, and C Lee Giles. 2017. Recovering concept prerequisite relations from university course dependencies. In Proceedings of AAAI."},{"key":"e_1_3_2_2_22_1","doi-asserted-by":"publisher","DOI":"10.1007\/s00778-010-0198-2"},{"key":"e_1_3_2_2_23_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00929"},{"key":"e_1_3_2_2_24_1","volume-title":"Recipe1M: A Dataset for Learning Cross-Modal Embeddings for Cooking Recipes and Food Images. CoRR","author":"Javier Mar'i","year":"2018","unstructured":"Javier Mar'i n, Aritro Biswas , Ferda Ofli , Nicholas Hynes , Amaia Salvador , Yusuf Aytar , Ingmar Weber , and Antonio Torralba . 2018. Recipe1M: A Dataset for Learning Cross-Modal Embeddings for Cooking Recipes and Food Images. CoRR , Vol. abs\/ 1810 .06553 ( 2018 ). Javier Mar'i n, Aritro Biswas, Ferda Ofli, Nicholas Hynes, Amaia Salvador, Yusuf Aytar, Ingmar Weber, and Antonio Torralba. 2018. Recipe1M: A Dataset for Learning Cross-Modal Embeddings for Cooking Recipes and Food Images. CoRR, Vol. abs\/1810.06553 (2018)."},{"key":"e_1_3_2_2_25_1","volume-title":"Recipe1M: A Dataset for Learning Cross-Modal Embeddings for Cooking Recipes and Food Images","author":"Marin Javier","year":"2019","unstructured":"Javier Marin , Aritro Biswas , Ferda Ofli , Nicholas Hynes , Amaia Salvador , Yusuf Aytar , Ingmar Weber , and Antonio Torralba . 2019. Recipe1M: A Dataset for Learning Cross-Modal Embeddings for Cooking Recipes and Food Images . IEEE Trans. Pattern Anal. Mach. Intell . ( 2019 ). Javier Marin, Aritro Biswas, Ferda Ofli, Nicholas Hynes, Amaia Salvador, Yusuf Aytar, Ingmar Weber, and Antonio Torralba. 2019. Recipe1M: A Dataset for Learning Cross-Modal Embeddings for Cooking Recipes and Food Images. IEEE Trans. Pattern Anal. Mach. Intell. (2019)."},{"key":"e_1_3_2_2_26_1","doi-asserted-by":"publisher","DOI":"10.1145\/2390821.2390830"},{"key":"e_1_3_2_2_27_1","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2017.2759499"},{"key":"e_1_3_2_2_28_1","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2016.2639382"},{"key":"e_1_3_2_2_29_1","volume-title":"Proceedings of LREC. 2370--2377","author":"Mori Shinsuke","year":"2014","unstructured":"Shinsuke Mori , Hirokuni Maeta , Yoko Yamakata , and Tetsuro Sasada . 2014 . Flow Graph Corpus from Recipe Texts .. In Proceedings of LREC. 2370--2377 . Shinsuke Mori, Hirokuni Maeta, Yoko Yamakata, and Tetsuro Sasada. 2014. Flow Graph Corpus from Recipe Texts.. In Proceedings of LREC. 2370--2377."},{"key":"e_1_3_2_2_30_1","volume-title":"Whelan","author":"Mullery Sean","year":"2018","unstructured":"Sean Mullery and Paul F . Whelan . 2018 . Batch Normalization in the final layer of generative networks. CoRR , Vol. abs\/ 1805 .07389 (2018). Sean Mullery and Paul F. Whelan. 2018. Batch Normalization in the final layer of generative networks. CoRR, Vol. abs\/1805.07389 (2018)."},{"key":"e_1_3_2_2_31_1","first-page":"1447","article-title":"Prerequisite relation learning for concepts in moocs","volume":"1","author":"Pan Liangming","year":"2017","unstructured":"Liangming Pan , Chengjiang Li , Juanzi Li , and Jie Tang . 2017 a. Prerequisite relation learning for concepts in moocs . In Proceedings of ACL , Vol. 1. 1447 -- 1456 . Liangming Pan, Chengjiang Li, Juanzi Li, and Jie Tang. 2017a. Prerequisite relation learning for concepts in moocs. In Proceedings of ACL, Vol. 1. 1447--1456.","journal-title":"Proceedings of ACL"},{"key":"e_1_3_2_2_32_1","volume-title":"Proceedings of IJCNLP. 875--884","author":"Pan Liangming","year":"2017","unstructured":"Liangming Pan , Xiaochen Wang , Chengjiang Li , Juanzi Li , and Jie Tang . 2017 b. Course Concept Extraction in MOOCs via Embedding-Based Graph Propagation . In Proceedings of IJCNLP. 875--884 . Liangming Pan, Xiaochen Wang, Chengjiang Li, Juanzi Li, and Jie Tang. 2017b. Course Concept Extraction in MOOCs via Embedding-Based Graph Propagation. In Proceedings of IJCNLP. 875--884."},{"key":"e_1_3_2_2_33_1","volume-title":"Manning","author":"Pennington Jeffrey","year":"2014","unstructured":"Jeffrey Pennington , Richard Socher , and Christopher D . Manning . 2014 . Glove : Global Vectors for Word Representation. In Proceedings of EMNLP. 1532--1543. Jeffrey Pennington, Richard Socher, and Christopher D. Manning. 2014. Glove: Global Vectors for Word Representation. In Proceedings of EMNLP. 1532--1543."},{"key":"e_1_3_2_2_34_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.01070"},{"key":"e_1_3_2_2_35_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.327"},{"key":"e_1_3_2_2_36_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.327"},{"key":"e_1_3_2_2_37_1","volume-title":"Workshop on Building Educational Applications Using NLP. 307--315","author":"Talukdar Partha Pratim","year":"2012","unstructured":"Partha Pratim Talukdar and William W Cohen . 2012 . Crowdsourced comprehension: predicting prerequisite structure in wikipedia . In Workshop on Building Educational Applications Using NLP. 307--315 . Partha Pratim Talukdar and William W Cohen. 2012. Crowdsourced comprehension: predicting prerequisite structure in wikipedia. In Workshop on Building Educational Applications Using NLP. 307--315."},{"key":"e_1_3_2_2_39_1","volume-title":"Proceedings of NIPS. 6000--6010","author":"Vaswani Ashish","year":"2017","unstructured":"Ashish Vaswani , Noam Shazeer , Niki Parmar , Jakob Uszkoreit , Llion Jones , Aidan N. Gomez , Lukasz Kaiser , and Illia Polosukhin . 2017 . Attention is All you Need . In Proceedings of NIPS. 6000--6010 . Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Lukasz Kaiser, and Illia Polosukhin. 2017. Attention is All you Need. In Proceedings of NIPS. 6000--6010."},{"key":"e_1_3_2_2_40_1","volume-title":"Pointer Networks. In Proceedings of NIPS. 2692--2700","author":"Vinyals Oriol","year":"2015","unstructured":"Oriol Vinyals , Meire Fortunato , and Navdeep Jaitly . 2015 . Pointer Networks. In Proceedings of NIPS. 2692--2700 . Oriol Vinyals, Meire Fortunato, and Navdeep Jaitly. 2015. Pointer Networks. In Proceedings of NIPS. 2692--2700."},{"key":"e_1_3_2_2_41_1","volume-title":"Proceedings of the ICCBR 2011 Workshops. 207--216","author":"Walter Kirstin","year":"2011","unstructured":"Kirstin Walter , Mirjam Minor , and Ralph Bergmann . 2011 . Workflow extraction from cooking recipes . In Proceedings of the ICCBR 2011 Workshops. 207--216 . Kirstin Walter, Mirjam Minor, and Ralph Bergmann. 2011. Workflow extraction from cooking recipes. In Proceedings of the ICCBR 2011 Workshops. 207--216."},{"key":"e_1_3_2_2_42_1","volume-title":"Hoi","author":"Wang Hao","year":"2019","unstructured":"Hao Wang , Doyen Sahoo , Chenghao Liu , Ee-Peng Lim , and Steven C. H . Hoi . 2019 . Learning Cross-Modal Embeddings With Adversarial Networks for Cooking Recipes and Food Images. In Proceedings of CVPR. 11572--11581. Hao Wang, Doyen Sahoo, Chenghao Liu, Ee-Peng Lim, and Steven C. H. Hoi. 2019. Learning Cross-Modal Embeddings With Adversarial Networks for Cooking Recipes and Food Images. In Proceedings of CVPR. 11572--11581."},{"key":"e_1_3_2_2_43_1","doi-asserted-by":"publisher","DOI":"10.1145\/1367497.1367629"},{"key":"e_1_3_2_2_44_1","doi-asserted-by":"publisher","DOI":"10.1145\/2983323.2983725"},{"key":"e_1_3_2_2_45_1","doi-asserted-by":"publisher","DOI":"10.1109\/ISM.2010.44"},{"key":"e_1_3_2_2_46_1","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2015.2438717"},{"key":"e_1_3_2_2_47_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICMEW.2016.7574705"},{"key":"e_1_3_2_2_48_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICMEW.2016.7574705"},{"key":"e_1_3_2_2_49_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-03260-3_21"},{"key":"e_1_3_2_2_50_1","doi-asserted-by":"publisher","DOI":"10.1527\/tjsai.WII-F"},{"key":"e_1_3_2_2_51_1","doi-asserted-by":"publisher","DOI":"10.1145\/2684822.2685292"},{"key":"e_1_3_2_2_52_1","volume-title":"Corso","author":"Zhou Luowei","year":"2018","unstructured":"Luowei Zhou , Chenliang Xu , and Jason J . Corso . 2018 . Towards Automatic Learning of Procedures From Web Instructional Videos. In Proceedings of AAAI. 7590--7598. Luowei Zhou, Chenliang Xu, and Jason J. Corso. 2018. Towards Automatic Learning of Procedures From Web Instructional Videos. In Proceedings of AAAI. 7590--7598."}],"event":{"name":"MM '20: The 28th ACM International Conference on Multimedia","location":"Seattle WA USA","acronym":"MM '20","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 28th ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3394171.3413765","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3394171.3413765","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T22:01:17Z","timestamp":1750197677000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3394171.3413765"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020,10,12]]},"references-count":51,"alternative-id":["10.1145\/3394171.3413765","10.1145\/3394171"],"URL":"https:\/\/doi.org\/10.1145\/3394171.3413765","relation":{},"subject":[],"published":{"date-parts":[[2020,10,12]]},"assertion":[{"value":"2020-10-12","order":2,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}