{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,26]],"date-time":"2026-07-26T05:30:59Z","timestamp":1785043859744,"version":"3.55.0"},"reference-count":229,"publisher":"Springer Science and Business Media LLC","issue":"7","license":[{"start":{"date-parts":[[2022,11,29]],"date-time":"2022-11-29T00:00:00Z","timestamp":1669680000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2022,11,29]],"date-time":"2022-11-29T00:00:00Z","timestamp":1669680000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["Nos.61976247"],"award-info":[{"award-number":["Nos.61976247"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Sichuan Science and Technology Program","award":["NO.2021YFG0312"],"award-info":[{"award-number":["NO.2021YFG0312"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Artif Intell Rev"],"published-print":{"date-parts":[[2023,7]]},"DOI":"10.1007\/s10462-022-10332-z","type":"journal-article","created":{"date-parts":[[2022,11,29]],"date-time":"2022-11-29T07:30:29Z","timestamp":1669707029000},"page":"6661-6704","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":19,"title":["Deep learning on multi-view sequential data: a survey"],"prefix":"10.1007","volume":"56","author":[{"given":"Zhuyang","family":"Xie","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yan","family":"Yang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yiling","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jie","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shengdong","family":"Du","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2022,11,29]]},"reference":[{"key":"10332_CR1","first-page":"10360","volume":"33","author":"M Abavisani","year":"2020","unstructured":"Abavisani M, Naghizadeh A, Metaxas D, Patel V (2020) Deep subspace clustering with data augmentation. Adv Neural Inf Process Syst 33:10360\u201310370","journal-title":"Adv Neural Inf Process Syst"},{"key":"10332_CR2","doi-asserted-by":"crossref","first-page":"103547","DOI":"10.1016\/j.jbi.2020.103547","volume":"110","author":"B Agyemang","year":"2020","unstructured":"Agyemang B, Wu W-P, Kpiebaareh MY, Lei Z, Nanor E, Chen L (2020) Multi-view self-attention for interpretable drug-target interaction prediction. J Biomed Inform 110:103547","journal-title":"J Biomed Inform"},{"key":"10332_CR3","doi-asserted-by":"crossref","unstructured":"Akhtar MS, Chauhan DS, Ghosal D, Poria S, Ekbal A, Bhattacharyya P (2019) Multi-task learning for multi-modal emotion recognition and sentiment analysis. In: NAACL-HLT (1)","DOI":"10.18653\/v1\/N19-1034"},{"key":"10332_CR4","doi-asserted-by":"crossref","unstructured":"Akman A, Coppock H, Gaskell A, Tzirakis P, Jones L, Schuller BW (2021) Evaluating the covid-19 identification resnet (cider) on the interspeech covid-19 from audio challenges. https:\/\/arXiv.org\/2107.14549","DOI":"10.3389\/fdgth.2022.789980"},{"key":"10332_CR5","unstructured":"Alam MM, Torgo L, Bifet A (2021) A survey on spatio-temporal data analytics systems. https:\/\/arXiv.org\/2103.09883"},{"key":"10332_CR6","unstructured":"Andrew G, Arora R, Bilmes J, Livescu K (2013) Deep canonical correlation analysis. In: International Conference on Machine Learning. PMLR, pp 1247\u20131255"},{"issue":"4","key":"10332_CR7","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1145\/3161602","volume":"51","author":"G Atluri","year":"2018","unstructured":"Atluri G, Karpatne A, Kumar V (2018) Spatio-temporal data mining: a survey of problems and methods. ACM Comput Surv (CSUR) 51(4):1\u201341","journal-title":"ACM Comput Surv (CSUR)"},{"key":"10332_CR8","unstructured":"Aytar Y, Vondrick C, Torralba A (2017) See, hear, and read: Deep aligned representations. https:\/\/arXiv.org\/1706.00932"},{"issue":"12","key":"10332_CR9","doi-asserted-by":"crossref","first-page":"2481","DOI":"10.1109\/TPAMI.2016.2644615","volume":"39","author":"V Badrinarayanan","year":"2017","unstructured":"Badrinarayanan V, Kendall A, Cipolla R (2017) Segnet: a deep convolutional encoder-decoder architecture for image segmentation. IEEE Trans Pattern Anal Mach Intell 39(12):2481\u20132495","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"10332_CR10","unstructured":"Bahdanau D, Cho K, Bengio Y (2014) Neural machine translation by jointly learning to align and translate. https:\/\/arXiv.org\/1409.0473"},{"key":"10332_CR11","doi-asserted-by":"crossref","unstructured":"Bai L, Yao L, Kanhere SS, Wang X, Liu W, Yang Z (2019) Spatio-temporal graph convolutional and recurrent networks for citywide passenger demand prediction. In: Proceedings of the 28th ACM International Conference on Information and Knowledge Management, pp 2293\u20132296","DOI":"10.1145\/3357384.3358097"},{"key":"10332_CR12","first-page":"17804","volume":"33","author":"L Bai","year":"2020","unstructured":"Bai L, Yao L, Li C, Wang X, Wang C (2020) Adaptive graph convolutional recurrent network for traffic forecasting. Adv Neural Inf Process Syst 33:17804\u201317815","journal-title":"Adv Neural Inf Process Syst"},{"issue":"7","key":"10332_CR13","doi-asserted-by":"crossref","first-page":"485","DOI":"10.3390\/ijgi10070485","volume":"10","author":"J Bai","year":"2021","unstructured":"Bai J, Zhu J, Song Y, Zhao L, Hou Z, Du R, Li H (2021) A3t-gcn: attention temporal graph convolutional network for traffic forecasting. ISPRS Int J Geo-Inf 10(7):485","journal-title":"ISPRS Int J Geo-Inf"},{"issue":"2","key":"10332_CR14","doi-asserted-by":"crossref","first-page":"423","DOI":"10.1109\/TPAMI.2018.2798607","volume":"41","author":"T Baltru\u0161aitis","year":"2018","unstructured":"Baltru\u0161aitis T, Ahuja C, Morency L-P (2018) Multimodal machine learning: a survey and taxonomy. IEEE Trans Pattern Anal Mach Intell 41(2):423\u2013443","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"10332_CR15","doi-asserted-by":"crossref","first-page":"519","DOI":"10.1016\/j.ymssp.2016.05.041","volume":"82","author":"D Barraza-Barraza","year":"2017","unstructured":"Barraza-Barraza D, Tercero-G\u00f3mez VG, Beruvides MG, Lim\u00f3n-Robles J (2017) An adaptive arx model to estimate the rul of aluminum plates based on its crack growth. Mech Syst Signal Process 82:519\u2013536","journal-title":"Mech Syst Signal Process"},{"issue":"3","key":"10332_CR16","doi-asserted-by":"crossref","first-page":"195","DOI":"10.26599\/BDMA.2021.9020003","volume":"4","author":"Y Bie","year":"2021","unstructured":"Bie Y, Yang Y (2021) A multitask multiview neural network for end-to-end aspect-based sentiment analysis. Big Data Min Anal 4(3):195\u2013207","journal-title":"Big Data Min Anal"},{"key":"10332_CR17","unstructured":"Brousmiche M, Rouat J, Dupont S (2021) Multi-level attention fusion network for audio-visual event recognition. https:\/\/arXiv.org\/2106.06736"},{"key":"10332_CR18","doi-asserted-by":"crossref","first-page":"85","DOI":"10.1016\/j.ins.2021.07.003","volume":"578","author":"Y Cai","year":"2021","unstructured":"Cai Y, Zeng M, Cai Z, Liu X, Zhang Z (2021) Graph regularized residual subspace clustering network for hyperspectral image clustering. Inf Sci 578:85\u2013101","journal-title":"Inf Sci"},{"issue":"3","key":"10332_CR19","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1145\/1961189.1961199","volume":"2","author":"C-C Chang","year":"2011","unstructured":"Chang C-C, Lin C-J (2011) Libsvm: a library for support vector machines. ACM Trans Intell Syst Technol (TIST) 2(3):1\u201327","journal-title":"ACM Trans Intell Syst Technol (TIST)"},{"key":"10332_CR20","doi-asserted-by":"crossref","unstructured":"Chen C, Hu J, Meng Q, Zhang Y (2011) Short-time traffic flow prediction with arima-garch model. In: 2011 IEEE Intelligent Vehicles Symposium (IV). IEEE, pp 607\u2013612","DOI":"10.1109\/IVS.2011.5940418"},{"key":"10332_CR21","doi-asserted-by":"crossref","unstructured":"Chen M, Wang S, Liang PP, Baltru\u0161aitis T, Zadeh A, Morency L-P (2017) Multimodal sentiment analysis with word-level fusion and reinforcement learning. In: Proceedings of the 19th ACM International Conference on Multimodal Interaction, pp 163\u2013171","DOI":"10.1145\/3136755.3136801"},{"key":"10332_CR22","unstructured":"Chen J, Xu X, Wu Y, Zheng H (2018) Gc-lstm: Graph convolution embedded lstm for dynamic link prediction. https:\/\/arXiv.org\/1812.04206"},{"key":"10332_CR23","doi-asserted-by":"crossref","unstructured":"Chen C, Li K, Teo SG, Zou X, Wang K, Wang J, Zeng Z (2019) Gated residual recurrent graph neural networks for traffic prediction. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 33, pp 485\u2013492","DOI":"10.1609\/aaai.v33i01.3301485"},{"issue":"4","key":"10332_CR24","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1145\/3385414","volume":"14","author":"C Chen","year":"2020","unstructured":"Chen C, Li K, Teo SG, Zou X, Li K, Zeng Z (2020a) Citywide traffic flow prediction based on multiple gated spatio-temporal convolutional neural networks. ACM Trans Knowl Discov from Data (TKDD) 14(4):1\u201323","journal-title":"ACM Trans Knowl Discov from Data (TKDD)"},{"key":"10332_CR25","doi-asserted-by":"crossref","unstructured":"Chen W, Chen L, Xie Y, Cao W, Gao Y, Feng X (2020b) Multi-range attentive bicomponent graph convolutional network for traffic forecasting. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 34, pp 3529\u20133536","DOI":"10.1609\/aaai.v34i04.5758"},{"key":"10332_CR26","unstructured":"Chen W, Wang W, Liu L, Lew MS (2020c) New ideas and trends in deep multimodal content understanding: a review. https:\/\/arXiv.org\/2010.08189"},{"key":"10332_CR27","doi-asserted-by":"crossref","unstructured":"Chen Z, Shi M, Zhang X, Ying H (2021a) Asm2tv: An adaptive semi-supervised multi-task multi-view learning framework. https:\/\/arXiv.org\/2105.08643","DOI":"10.1609\/aaai.v36i6.20584"},{"key":"10332_CR28","unstructured":"Chen M, Du Y, Zhang Y, Qian S, Wang C (2021b) Semi-supervised learning with multi-head co-training. https:\/\/arXiv.org\/2107.04795"},{"key":"10332_CR29","unstructured":"Chen L, Xu J, Wu B, Qian Y, Du Z, Li Y, Zhang Y (2021c) Group-aware graph neural network for nationwide city air quality forecasting. https:\/\/arXiv.org\/2108.12238"},{"key":"10332_CR30","doi-asserted-by":"crossref","unstructured":"Cheng J, Dong L, Lapata M (2016) Long short-term memory-networks for machine reading. arXiv preprint https:\/\/arXiv.org\/1601.06733","DOI":"10.18653\/v1\/D16-1053"},{"key":"10332_CR31","doi-asserted-by":"crossref","unstructured":"Cheng W, Shen Y, Zhu Y, Huang L (2018) A neural attention model for urban air quality inference: Learning the weights of monitoring stations. In: Thirty-second AAAI Conference on Artificial Intelligence","DOI":"10.1609\/aaai.v32i1.11871"},{"key":"10332_CR32","doi-asserted-by":"crossref","unstructured":"Choe J, Im S, Rameau F, Kang M, Kweon IS (2021) Volumefusion: Deep depth fusion for 3d scene reconstruction. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp 16086\u201316095","DOI":"10.1109\/ICCV48922.2021.01578"},{"key":"10332_CR33","unstructured":"Civitarese DS, Szwarcman D, Zadrozny B, Watson C (2021) Extreme precipitation seasonal forecast using a transformer neural network. https:\/\/arXiv.org\/2107.06846"},{"key":"10332_CR34","unstructured":"Coppock H, Gaskell A, Tzirakis P, Baird A, Jones L, Schuller BW (2021) End-2-end covid-19 detection from breath & cough audio. https:\/\/arXiv.org\/2102.08359"},{"key":"10332_CR35","doi-asserted-by":"crossref","unstructured":"Delbrouck J-B, Tits N, Brousmiche M, Dupont S (2020) A transformer-based joint-encoding for emotion recognition and sentiment analysis. https:\/\/arXiv.org\/2006.15955","DOI":"10.18653\/v1\/2020.challengehml-1.1"},{"key":"10332_CR36","unstructured":"Devlin J, Chang M-W, Lee K, Toutanova K (2018) Bert: pre-training of deep bidirectional transformers for language understanding. https:\/\/arXiv.org\/1810.04805"},{"key":"10332_CR37","doi-asserted-by":"crossref","first-page":"2412","DOI":"10.1109\/TKDE.2019.2954510","volume":"33","author":"S Du","year":"2019","unstructured":"Du S, Li T, Yang Y, Horng S-J (2019) Deep air quality forecasting using hybrid deep learning framework. IEEE Trans Knowl Data Eng 33:2412","journal-title":"IEEE Trans Knowl Data Eng"},{"key":"10332_CR38","doi-asserted-by":"crossref","unstructured":"Du Y, Wang J, Feng W, Pan S, Qin T, Xu R, Wang C (2021) Adarnn: Adaptive learning and forecasting of time series. In: Proceedings of the 30th ACM International Conference on Information & Knowledge Management, pp 402\u2013411","DOI":"10.1145\/3459637.3482315"},{"key":"10332_CR39","unstructured":"Dumpala SH, Sheikh I, Chakraborty R, Kopparapu SK (2019) Audio-visual fusion for sentiment classification using cross-modal autoencoder. In: 32nd Conference on Neural Information Processing Systems (NIPS 2018), pp 1\u20134"},{"key":"10332_CR40","doi-asserted-by":"crossref","unstructured":"Ertugrul AM, Lin Y-R, Taskaya-Temizel T (2019) Castnet: Community-attentive spatio-temporal networks for opioid overdose forecasting. https:\/\/arXiv.org\/1905.04714","DOI":"10.1007\/978-3-030-46133-1_26"},{"key":"10332_CR41","doi-asserted-by":"crossref","unstructured":"Fadadu S, Pandey S, Hegde D, Shi Y, Chou F-C, Djuric N, Vallespi-Gonzalez C (2022) Multi-view fusion of sensor data for improved perception and prediction in autonomous driving. In: Proceedings of the IEEE\/CVF Winter Conference on Applications of Computer Vision, pp 2349\u20132357","DOI":"10.1109\/WACV51458.2022.00335"},{"key":"10332_CR42","doi-asserted-by":"crossref","unstructured":"Fang S, Zhang Q, Meng G, Xiang S, Pan C (2019) Gstnet: global spatial-temporal network for traffic flow prediction. In: IJCAI, pp 2286\u20132293","DOI":"10.24963\/ijcai.2019\/317"},{"issue":"1","key":"10332_CR43","doi-asserted-by":"crossref","first-page":"602","DOI":"10.1080\/21642583.2014.956265","volume":"2","author":"K Fawagreh","year":"2014","unstructured":"Fawagreh K, Gaber MM, Elyan E (2014) Random forests: from early developments to recent advancements. Syst Sci Control Eng Open Access J 2(1):602\u2013609","journal-title":"Syst Sci Control Eng Open Access J"},{"key":"10332_CR44","unstructured":"Feng C-M, Yan Y, Chen G, Fu H, Xu Y, Shao L (2021) Accelerated multi-modal mr imaging with transformers. https:\/\/arXiv.org\/2106.14248"},{"key":"10332_CR45","first-page":"55","volume":"28","author":"E Ferenstein","year":"2004","unstructured":"Ferenstein E, Gasowski M (2004) Modelling stock returns with ar-garch processes. SORT Stat Oper Res Trans 28:55\u201368","journal-title":"SORT Stat Oper Res Trans"},{"key":"10332_CR46","doi-asserted-by":"crossref","unstructured":"Geng X, Li Y, Wang L, Zhang L, Yang Q, Ye J, Liu Y (2019) Spatiotemporal multi-graph convolution network for ride-hailing demand forecasting. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 33, pp 3656\u20133663","DOI":"10.1609\/aaai.v33i01.33013656"},{"key":"10332_CR47","doi-asserted-by":"crossref","unstructured":"Geng Y, Han Z, Zhang C, Hu Q (2021) Uncertainty-aware multi-view representation learning. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 35, pp 7545\u20137553","DOI":"10.1609\/aaai.v35i9.16924"},{"key":"10332_CR48","doi-asserted-by":"crossref","unstructured":"Girshick R (2015) Fast r-cnn. In: Proceedings of the IEEE International Conference on Computer Vision, pp 1440\u20131448","DOI":"10.1109\/ICCV.2015.169"},{"key":"10332_CR49","doi-asserted-by":"crossref","unstructured":"Gu Y, Yang K, Fu S, Chen S, Li X, Marsic I (2018) Multimodal affective analysis using hierarchical attention strategy with word-level alignment. In: Proceedings of the Conference. Association for Computational Linguistics. Meeting, vol. 2018. NIH Public Access, p 2225","DOI":"10.18653\/v1\/P18-1207"},{"key":"10332_CR50","doi-asserted-by":"crossref","first-page":"1441","DOI":"10.1109\/TNSRE.2021.3098968","volume":"29","author":"A Guillot","year":"2021","unstructured":"Guillot A, Thorey V (2021) Robustsleepnet: transfer learning for automated sleep staging at scale. IEEE Trans Neural Syst Rehabil Eng 29:1441\u20131451","journal-title":"IEEE Trans Neural Syst Rehabil Eng"},{"issue":"10","key":"10332_CR51","doi-asserted-by":"crossref","first-page":"3913","DOI":"10.1109\/TITS.2019.2906365","volume":"20","author":"S Guo","year":"2019","unstructured":"Guo S, Lin Y, Li S, Chen Z, Wan H (2019a) Deep spatial-temporal 3d convolutional neural networks for traffic data forecasting. IEEE Trans Intell Transp Syst 20(10):3913\u20133926","journal-title":"IEEE Trans Intell Transp Syst"},{"key":"10332_CR52","doi-asserted-by":"crossref","unstructured":"Guo S, Lin Y, Feng N, Song C, Wan H (2019b) Attention based spatial-temporal graph convolutional networks for traffic flow forecasting. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 33, pp 922\u2013929","DOI":"10.1609\/aaai.v33i01.3301922"},{"key":"10332_CR53","doi-asserted-by":"publisher","DOI":"10.1109\/TITS.2020.3019497","author":"K Guo","year":"2020","unstructured":"Guo K, Hu Y, Qian Z, Sun Y, Gao J, Yin B (2020) Dynamic graph convolution network for traffic forecasting based on latent network of Laplace matrix estimation. IEEE Trans Intell Transp Syst. https:\/\/doi.org\/10.1109\/TITS.2020.3019497","journal-title":"IEEE Trans Intell Transp Syst"},{"key":"10332_CR54","doi-asserted-by":"crossref","unstructured":"Hackel T, Savinov N, Ladicky L, Wegner JD, Schindler K, Pollefeys M (2017) SEMANTIC3D.NET: a new large-scale point cloud classification benchmark. In: ISPRS Annals of the Photogrammetry, Remote Sensing and Spatial Information Sciences, vol. IV-1-W1, pp 91\u201398","DOI":"10.5194\/isprs-annals-IV-1-W1-91-2017"},{"key":"10332_CR55","doi-asserted-by":"crossref","unstructured":"Han W, Chen H, Gelbukh A, Zadeh A, Morency L-P, Poria S (2021a) Bi-bimodal modality fusion for correlation-controlled multimodal sentiment analysis. In: Proceedings of the 2021 International Conference on Multimodal Interaction, pp 6\u201315","DOI":"10.1145\/3462244.3479919"},{"key":"10332_CR56","doi-asserted-by":"crossref","unstructured":"Han W, Chen H, Poria S (2021b) Improving multimodal fusion with hierarchical mutual information maximization for multimodal sentiment analysis. In: Proceedings of the 2021 Conference on Empirical Methods in Natural Language Processing, pp 9180\u20139192","DOI":"10.18653\/v1\/2021.emnlp-main.723"},{"key":"10332_CR57","doi-asserted-by":"crossref","unstructured":"Han Q, Lu D, Chen R (2021c) Fine-grained air quality inference via multi-channel attention model. In: IJCAI, pp 2512\u20132518","DOI":"10.24963\/ijcai.2021\/346"},{"key":"10332_CR58","unstructured":"Han Z, Zhang C, Fu H, Zhou JT (2021d) Trusted multi-view classification. https:\/\/arXiv.org\/2102.02051"},{"key":"10332_CR59","doi-asserted-by":"crossref","unstructured":"Hasan MK, Lee S, Rahman W, Zadeh A, Mihalcea R, Morency L-P, Hoque E (2021) Humor knowledge enriched transformer for understanding multimodal humor. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 35, pp 12972\u201312980","DOI":"10.1609\/aaai.v35i14.17534"},{"key":"10332_CR60","doi-asserted-by":"crossref","unstructured":"Hazarika D, Zimmermann R, Poria S (2020) Misa: Modality-invariant and-specific representations for multimodal sentiment analysis. In: Proceedings of the 28th ACM International Conference on Multimedia, pp 1122\u20131131","DOI":"10.1145\/3394171.3413678"},{"key":"10332_CR61","doi-asserted-by":"crossref","unstructured":"He K, Zhang X, Ren S, Sun J (2016) Deep residual learning for image recognition. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp 770\u2013778","DOI":"10.1109\/CVPR.2016.90"},{"key":"10332_CR62","doi-asserted-by":"crossref","unstructured":"He K, Gkioxari G, Doll\u00e1r P, Girshick R (2017) Mask r-cnn. In: Proceedings of the IEEE International Conference on Computer Vision, pp 2961\u20132969","DOI":"10.1109\/ICCV.2017.322"},{"key":"10332_CR63","doi-asserted-by":"crossref","unstructured":"He K, Fan H, Wu Y, Xie S, Girshick R (2020a) Momentum contrast for unsupervised visual representation learning. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 9729\u20139738","DOI":"10.1109\/CVPR42600.2020.00975"},{"key":"10332_CR64","doi-asserted-by":"crossref","unstructured":"He Y, Wang C, Li N, Zeng Z (2020b) Attention and memory-augmented networks for dual-view sequential learning. In: Proceedings of the 26th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining, pp 125\u2013134","DOI":"10.1145\/3394486.3403055"},{"key":"10332_CR65","doi-asserted-by":"crossref","first-page":"162","DOI":"10.1007\/978-1-4612-4380-9_14","volume-title":"Breakthroughs in statistics","author":"H Hotelling","year":"1992","unstructured":"Hotelling H (1992) Relations between two sets of variates. In: Kotz S, Johnson NL (eds) Breakthroughs in statistics. Springer, Berlin, pp 162\u2013190"},{"issue":"5","key":"10332_CR66","doi-asserted-by":"crossref","first-page":"2191","DOI":"10.1109\/TITS.2014.2311123","volume":"15","author":"W Huang","year":"2014","unstructured":"Huang W, Song G, Hong H, Xie K (2014) Deep architecture for traffic flow prediction: deep belief networks with multitask learning. IEEE Trans Intell Transp Syst 15(5):2191\u20132201","journal-title":"IEEE Trans Intell Transp Syst"},{"key":"10332_CR67","doi-asserted-by":"crossref","unstructured":"Huang C, Zhang J, Zheng Y, Chawla NV (2018) Deepcrime: Attentive hierarchical recurrent networks for crime prediction. In: Proceedings of the 27th ACM International Conference on Information and Knowledge Management, pp 1423\u20131432","DOI":"10.1145\/3269206.3271793"},{"key":"10332_CR68","doi-asserted-by":"crossref","first-page":"107015","DOI":"10.1016\/j.patcog.2019.107015","volume":"97","author":"S Huang","year":"2020","unstructured":"Huang S, Kang Z, Xu Z (2020a) Auto-weighted multi-view clustering via deep matrix decomposition. Pattern Recogn 97:107015","journal-title":"Pattern Recogn"},{"key":"10332_CR69","doi-asserted-by":"crossref","unstructured":"Huang R, Huang C, Liu Y, Dai G, Kong W (2020b) Lsgcn: long short-term traffic prediction with graph convolutional networks. In: IJCAI, pp 2355\u20132361","DOI":"10.24963\/ijcai.2020\/326"},{"key":"10332_CR70","unstructured":"Ioffe S, Szegedy C (2015) Batch normalization: Accelerating deep network training by reducing internal covariate shift. In: International Conference on Machine Learning. PMLR, pp 448\u2013456"},{"key":"10332_CR71","unstructured":"Islam T, Goldwasser D (2021) Twitter user representation using weakly supervised graph embedding. https:\/\/arXiv.org\/2108.08988"},{"key":"10332_CR72","unstructured":"Ismail AA, Hasan M, Ishtiaq F (2020) Improving multimodal accuracy through modality pre-training and attention. https:\/\/arXiv.org\/2011.06102"},{"key":"10332_CR73","doi-asserted-by":"crossref","first-page":"13","DOI":"10.1016\/j.njas.2013.11.002","volume":"68","author":"PZ Janjua","year":"2014","unstructured":"Janjua PZ, Samad G, Khan N (2014) Climate change and wheat production in Pakistan: an autoregressive distributed lag approach. NJAS Wageningen J Life Sci 68:13\u201319","journal-title":"NJAS Wageningen J Life Sci"},{"key":"10332_CR74","unstructured":"Ji P, Zhang T, Li H, Salzmann M, Reid I (2017) Deep subspace clustering networks. Adv Neural Inf Process Syst 30"},{"key":"10332_CR75","doi-asserted-by":"crossref","unstructured":"Jia Z, Lin Y, Wang J, Zhou R, Ning X, He Y, Zhao Y (2020) Graphsleepnet: adaptive spatial-temporal graph convolutional networks for sleep stage classification. In: IJCAI, pp 1324\u20131330","DOI":"10.24963\/ijcai.2020\/184"},{"key":"10332_CR76","doi-asserted-by":"crossref","first-page":"1977","DOI":"10.1109\/TNSRE.2021.3110665","volume":"29","author":"Z Jia","year":"2021","unstructured":"Jia Z, Lin Y, Wang J, Ning X, He Y, Zhou R, Zhou Y, Li-wei HL (2021a) Multi-view spatial-temporal graph convolutional networks with domain generalization for sleep stage classification. IEEE Trans Neural Syst Rehabil Eng 29:1977\u20131986","journal-title":"IEEE Trans Neural Syst Rehabil Eng"},{"key":"10332_CR77","doi-asserted-by":"crossref","unstructured":"Jia Z, Lin Y, Wang J, Wang X, Xie P, Zhang Y (2021b) Salientsleepnet: Multimodal salient wave detection network for sleep staging. https:\/\/arXiv.org\/2105.13864","DOI":"10.24963\/ijcai.2021\/360"},{"key":"10332_CR78","doi-asserted-by":"crossref","unstructured":"Kan M, Shan S, Chen X (2016) Multi-view deep network for cross-view classification. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp 4847\u20134855","DOI":"10.1109\/CVPR.2016.524"},{"issue":"9","key":"10332_CR79","doi-asserted-by":"crossref","first-page":"1185","DOI":"10.1109\/10.867928","volume":"47","author":"B Kemp","year":"2000","unstructured":"Kemp B, Zwinderman AH, Tuk B, Kamphuisen HA, Oberye JJ (2000) Analysis of a sleep-dependent neuronal feedback loop: the slow-wave microcontinuity of the eeg. IEEE Trans Biomed Eng 47(9):1185\u20131194","journal-title":"IEEE Trans Biomed Eng"},{"issue":"1","key":"10332_CR80","doi-asserted-by":"crossref","first-page":"233","DOI":"10.1007\/s13042-021-01394-6","volume":"13","author":"GA Khan","year":"2022","unstructured":"Khan GA, Hu J, Li T, Diallo B, Zhao Y (2022a) Multi-view low rank sparse representation method for three-way clustering. Int J Mach Learn Cybern 13(1):233\u2013253","journal-title":"Int J Mach Learn Cybern"},{"issue":"3","key":"10332_CR81","doi-asserted-by":"crossref","first-page":"677","DOI":"10.1007\/s13042-021-01307-7","volume":"13","author":"GA Khan","year":"2022","unstructured":"Khan GA, Hu J, Li T, Diallo B, Wang H (2022b) Multi-view data clustering via non-negative matrix factorization with manifold regularization. Int J Mach Learn Cybern 13(3):677\u2013689","journal-title":"Int J Mach Learn Cybern"},{"key":"10332_CR82","doi-asserted-by":"crossref","unstructured":"Khanehzar S, Cohn T, Mikolajczak G, Turpin A, Frermann L (2021) Framing unpacked: A semi-supervised interpretable multi-view model of media frames. https:\/\/arXiv.org\/2104.11030","DOI":"10.18653\/v1\/2021.naacl-main.174"},{"key":"10332_CR83","doi-asserted-by":"crossref","unstructured":"Kim D, Tsai Y-H, Zhuang B, Yu X, Sclaroff S, Saenko K, Chandraker M (2021) Learning cross-modal contrastive features for video domain adaptation. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp 13618\u201313627","DOI":"10.1109\/ICCV48922.2021.01336"},{"key":"10332_CR84","unstructured":"Kipf TN, Welling M (2016) Semi-supervised classification with graph convolutional networks. https:\/\/arXiv.org\/1609.02907"},{"key":"10332_CR85","unstructured":"Kiros R, Salakhutdinov R, Zemel R (2014) Multimodal neural language models. In: International Conference on Machine Learning. PMLR, pp 595\u2013603"},{"key":"10332_CR86","doi-asserted-by":"crossref","unstructured":"Laddha A, Gautam S, Palombo S, Pandey S, Vallespi-Gonzalez C (2021) Mvfusenet: Improving end-to-end object detection and motion forecasting through multi-view fusion of lidar data. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 2865\u20132874","DOI":"10.1109\/CVPRW53098.2021.00321"},{"key":"10332_CR87","doi-asserted-by":"crossref","unstructured":"Le H, Tran T, Venkatesh S (2018) Dual memory neural computer for asynchronous two-view sequential learning. In: Proceedings of the 24th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining, pp 1637\u20131645","DOI":"10.1145\/3219819.3219981"},{"key":"10332_CR88","doi-asserted-by":"crossref","unstructured":"Liang PP, Liu Z, Zadeh A, Morency L-P (2018a) Multimodal language analysis with recurrent multistage fusion. https:\/\/arxiv.org\/1808.03920","DOI":"10.18653\/v1\/D18-1014"},{"key":"10332_CR89","doi-asserted-by":"crossref","unstructured":"Liang PP, Zadeh A, Morency LP (2018b) Multimodal local-global ranking fusion for emotion recognition. In: the 2018","DOI":"10.1145\/3242969.3243019"},{"key":"10332_CR90","doi-asserted-by":"crossref","unstructured":"Liang Y, Ouyang K, Jing L, Ruan S, Liu Y, Zhang J, Rosenblum DS, Zheng Y (2019) Urbanfm: Inferring fine-grained urban flows. In: Proceedings of the 25th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining, pp 3132\u20133142","DOI":"10.1145\/3292500.3330646"},{"key":"10332_CR91","doi-asserted-by":"crossref","unstructured":"Liao B, Zhang J, Wu C, McIlwraith D, Chen T, Yang S, Guo Y, Wu F (2018) Deep sequence learning with auxiliary information for traffic prediction. In: Proceedings of the 24th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining, pp 537\u2013546","DOI":"10.1145\/3219819.3219895"},{"key":"10332_CR92","unstructured":"Li Y, Moura JM (2019) Forecaster: a graph transformer for forecasting spatial and time-dependent data. https:\/\/arXiv.org\/1909.04019"},{"key":"10332_CR93","unstructured":"Li Y, Yu R, Shahabi C, Liu Y (2017) Diffusion convolutional recurrent neural network: Data-driven traffic forecasting. https:\/\/arXiv.org\/1707.01926"},{"key":"10332_CR94","doi-asserted-by":"crossref","unstructured":"Li Z, Wang Q, Tao Z, Gao Q, Yang Z, et al (2019) Deep adversarial multi-view clustering network. In: IJCAI, pp 2952\u20132958","DOI":"10.24963\/ijcai.2019\/409"},{"key":"10332_CR95","unstructured":"Li Z, Wang H, Li J (2020) Auto-mvcnn: neural architecture search for multi-view 3d shape recognition. https:\/\/arXiv.org\/2012.05493"},{"key":"10332_CR96","doi-asserted-by":"crossref","unstructured":"Lin T-Y, Doll\u00e1r P, Girshick R, He K, Hariharan B, Belongie S (2017) Feature pyramid networks for object detection. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp 2117\u20132125","DOI":"10.1109\/CVPR.2017.106"},{"key":"10332_CR97","doi-asserted-by":"crossref","unstructured":"Lin Y, Chiang Y-Y, Franklin M, Eckel SP, Ambite JL (2020) Building autocorrelation-aware representations for fine-scale spatiotemporal prediction. In: 2020 IEEE International Conference on Data Mining (ICDM). IEEE, pp 352\u2013361","DOI":"10.1109\/ICDM50108.2020.00044"},{"key":"10332_CR98","doi-asserted-by":"crossref","unstructured":"Liu W, Anguelov D, Erhan D, Szegedy C, Reed S, Fu C-Y, Berg AC (2016a) Ssd: single shot multibox detector. In: European Conference on Computer Vision. Springer, pp 21\u201337","DOI":"10.1007\/978-3-319-46448-0_2"},{"key":"10332_CR99","unstructured":"Liu Y, Zheng Y, Liang Y, Liu S, Rosenblum DS (2016b) Urban water quality prediction based on multi-task multi-view learning"},{"key":"10332_CR100","doi-asserted-by":"crossref","unstructured":"Liu Z, Shen Y, Lakshminarasimhan VB, Liang PP, Zadeh A, Morency L-P (2018) Efficient low-rank multimodal fusion with modality-specific factors. https:\/\/arXiv.org\/1806.00064","DOI":"10.18653\/v1\/P18-1209"},{"key":"10332_CR101","doi-asserted-by":"crossref","unstructured":"Liu S, Fan H, Qian S, Chen Y, Ding W, Wang Z (2021) Hit: Hierarchical transformer with momentum contrast for video-text retrieval. https:\/\/arXiv.org\/2103.15049","DOI":"10.1109\/ICCV48922.2021.01170"},{"key":"10332_CR102","doi-asserted-by":"crossref","unstructured":"Long J, Shelhamer E, Darrell T (2015) Fully convolutional networks for semantic segmentation. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp 3431\u20133440","DOI":"10.1109\/CVPR.2015.7298965"},{"issue":"9","key":"10332_CR103","doi-asserted-by":"crossref","first-page":"1044","DOI":"10.1016\/j.cageo.2007.07.010","volume":"34","author":"GY Lu","year":"2008","unstructured":"Lu GY, Wong DW (2008) An adaptive inverse-distance weighting spatial interpolation technique. Comput Geosci 34(9):1044\u20131055","journal-title":"Comput Geosci"},{"key":"10332_CR104","doi-asserted-by":"crossref","unstructured":"Lu Y-J, Li C-T (2020) Agstn: learning attention-adjusted graph spatio-temporal networks for short-term urban sensor value forecasting. In: 2020 IEEE International Conference on Data Mining (ICDM). IEEE, pp 1148\u20131153","DOI":"10.1109\/ICDM50108.2020.00140"},{"issue":"8","key":"10332_CR105","doi-asserted-by":"crossref","first-page":"3184","DOI":"10.1109\/TITS.2019.2924903","volume":"21","author":"J Lv","year":"2019","unstructured":"Lv J, Sun Q, Li Q, Moreira-Matias L (2019) Multi-scale and multi-scope convolutional neural networks for destination prediction of trajectories. IEEE Trans Intell Transp Syst 21(8):3184\u20133195","journal-title":"IEEE Trans Intell Transp Syst"},{"key":"10332_CR106","doi-asserted-by":"crossref","unstructured":"Ma T, Xiao C, Zhou J, Wang F (2018) Drug similarity integration through attentive multi-view graph auto-encoders. https:\/\/arXiv.org\/1804.10850","DOI":"10.24963\/ijcai.2018\/483"},{"issue":"3","key":"10332_CR229","doi-asserted-by":"publisher","first-page":"2302","DOI":"10.1609\/aaai.v35i3.16330","volume":"35","author":"Mengmeng Ma","year":"2021","unstructured":"Ma, M., Ren, J., Zhao, L., Tulyakov, S., Wu, C., & Peng, X. (2021). SMIL: Multimodal Learning with Severely Missing Modality. Proceedings of the AAAI Conference on Artificial Intelligence, 35(3), 2302\u20132310","journal-title":"Proceedings of the AAAI Conference on Artificial Intelligence"},{"issue":"1","key":"10332_CR107","doi-asserted-by":"crossref","first-page":"122","DOI":"10.1109\/TMM.2019.2925966","volume":"22","author":"S Mai","year":"2019","unstructured":"Mai S, Xing S, Hu H (2019) Locally confined modality fusion network with a global perspective for multimodal human affective computing. IEEE Trans Multimedia 22(1):122\u2013137","journal-title":"IEEE Trans Multimedia"},{"key":"10332_CR108","doi-asserted-by":"crossref","unstructured":"Mai S, Hu H, Xing S (2020) Modality to modality translation: An adversarial representation learning and graph fusion network for multimodal fusion. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 34, pp 164\u2013172","DOI":"10.1609\/aaai.v34i01.5347"},{"key":"10332_CR109","unstructured":"Mai S, Zeng Y, Zheng S, Hu H (2021) Hybrid contrastive learning of tri-modal representation for multimodal sentiment analysis. https:\/\/arXiv.org\/2109.01797"},{"issue":"7","key":"10332_CR110","doi-asserted-by":"crossref","first-page":"2875","DOI":"10.1109\/TNNLS.2020.3008496","volume":"32","author":"L Mao","year":"2020","unstructured":"Mao L, Sun S (2020) Multiview variational sparse gaussian processes. IEEE Trans Neural Netw Learn Syst 32(7):2875\u20132885","journal-title":"IEEE Trans Neural Netw Learn Syst"},{"issue":"13","key":"10332_CR111","first-page":"61","volume":"2016","author":"JD Mazimpaka","year":"2016","unstructured":"Mazimpaka JD, Timpf S (2016) Trajectory data mining: a review of methods and applications. J Spatial Inf Sci 2016(13):61\u201399","journal-title":"J Spatial Inf Sci"},{"key":"10332_CR112","unstructured":"Mikolov T, Chen K, Corrado G, Dean J (2013) Efficient estimation of word representations in vector space. https:\/\/arXiv.org\/1301.3781"},{"key":"10332_CR113","doi-asserted-by":"crossref","unstructured":"Nessiem MA, Mohamed MM, Coppock H, Gaskell A, Schuller BW (2021) Detecting covid-19 from breathing and coughing sounds using deep neural networks. In: 2021 IEEE 34th International Symposium on Computer-Based Medical Systems (CBMS). IEEE, pp 183\u2013188","DOI":"10.1109\/CBMS52027.2021.00069"},{"key":"10332_CR114","doi-asserted-by":"crossref","unstructured":"Okawa M, Iwata T, Kurashima T, Tanaka Y, Toda H, Ueda N (2019) Deep mixture point processes: spatio-temporal event prediction with rich contextual information. In: Proceedings of the 25th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining, pp 373\u2013383","DOI":"10.1145\/3292500.3330937"},{"key":"10332_CR115","unstructured":"Olesen AN, Jennum P, Mignot E, Sorensen HB (2021) Msed: a multi-modal sleep event detection model for clinical sleep analysis. https:\/\/arXiv.org\/2101.02530"},{"key":"10332_CR116","doi-asserted-by":"crossref","first-page":"184","DOI":"10.1016\/j.cam.2018.07.008","volume":"346","author":"C Ord\u00f3\u00f1ez","year":"2019","unstructured":"Ord\u00f3\u00f1ez C, Lasheras FS, Roca-Pardi\u00f1as J, de Cos Juez FJ (2019) A hybrid arima-svm model for the study of the remaining useful life of aircraft engines. J Comput Appl Math 346:184\u2013191","journal-title":"J Comput Appl Math"},{"key":"10332_CR117","doi-asserted-by":"crossref","unstructured":"Ouyang X, Yang Y, Zhang Y, Zhou W (2021) Spatial-temporal dynamic graph convolution neural network for air quality prediction. In: 2021 International Joint Conference on Neural Networks (IJCNN). IEEE, pp 1\u20138","DOI":"10.1109\/IJCNN52387.2021.9534167"},{"key":"10332_CR118","doi-asserted-by":"crossref","unstructured":"Pan Z, Liang Y, Wang W, Yu Y, Zheng Y, Zhang J (2019) Urban traffic prediction from spatio-temporal data using deep meta learning. In: Proceedings of the 25th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining, pp 1720\u20131730","DOI":"10.1145\/3292500.3330884"},{"key":"10332_CR119","doi-asserted-by":"crossref","unstructured":"Patel ZB, Purohit P, Patel HM, Sahni S, Batra N (2022) Accurate and scalable gaussian processes for fine-grained air quality inference. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 36, pp 12080\u201312088","DOI":"10.1609\/aaai.v36i11.21467"},{"key":"10332_CR120","doi-asserted-by":"crossref","unstructured":"Pennington J, Socher R, Manning CD (2014) Glove: global vectors for word representation. In: Proceedings of the 2014 Conference on Empirical Methods in Natural Language Processing (EMNLP), pp 1532\u20131543","DOI":"10.3115\/v1\/D14-1162"},{"key":"10332_CR121","doi-asserted-by":"crossref","unstructured":"P\u00e9rez-R\u00faa J-M, Vielzeuf V, Pateux S, Baccouche M, Jurie F (2019) Mfas: multimodal fusion architecture search. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 6966\u20136975","DOI":"10.1109\/CVPR.2019.00713"},{"issue":"2","key":"10332_CR122","doi-asserted-by":"crossref","first-page":"546","DOI":"10.1016\/j.ymssp.2009.08.004","volume":"24","author":"HT Pham","year":"2010","unstructured":"Pham HT, Yang B-S (2010) Estimation and forecasting of machine health condition using arma\/garch model. Mech Syst Signal Process 24(2):546\u2013558","journal-title":"Mech Syst Signal Process"},{"key":"10332_CR123","doi-asserted-by":"crossref","unstructured":"Pham H, Manzini T, Liang PP, Poczos B (2018) Seq2seq2sentiment: Multimodal sequence to sequence models for sentiment analysis. https:\/\/arXiv.org\/1807.03915","DOI":"10.18653\/v1\/W18-3308"},{"key":"10332_CR124","doi-asserted-by":"crossref","unstructured":"Pham H, Liang PP, Manzini T, Morency L-P, P\u00f3czos B (2019) Found in translation: Learning robust joint representations by cyclic translations between modalities. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 33, pp 6892\u20136899","DOI":"10.1609\/aaai.v33i01.33016892"},{"issue":"3","key":"10332_CR125","doi-asserted-by":"crossref","first-page":"400","DOI":"10.1109\/TNSRE.2019.2896659","volume":"27","author":"H Phan","year":"2019","unstructured":"Phan H, Andreotti F, Cooray N, Ch\u00e9n OY, De Vos M (2019) Seqsleepnet: end-to-end hierarchical recurrent neural network for sequence-to-sequence automatic sleep staging. IEEE Trans Neural Syst Rehabil Eng 27(3):400\u2013410","journal-title":"IEEE Trans Neural Syst Rehabil Eng"},{"key":"10332_CR126","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2021.3070057","author":"H Phan","year":"2021","unstructured":"Phan H, Ch\u00e9n OY, Tran MC, Koch P, Mertins A, De Vos M (2021) Xsleepnet: multi-view sequential model for automatic sleep staging. IEEE Trans Pattern Anal Mach Intell. https:\/\/doi.org\/10.1109\/TPAMI.2021.3070057","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"10332_CR127","doi-asserted-by":"crossref","first-page":"2456","DOI":"10.1109\/TBME.2022.3147187","volume":"69","author":"H Phan","year":"2022","unstructured":"Phan H, Mikkelsen KB, Chen O, Koch P, Mertins A, De Vos M (2022) Sleeptransformer: automatic sleep staging with interpretability and uncertainty quantification. IEEE Trans Biomed Eng 69:2456","journal-title":"IEEE Trans Biomed Eng"},{"issue":"4","key":"10332_CR128","doi-asserted-by":"crossref","first-page":"1305","DOI":"10.1109\/JBHI.2020.3025900","volume":"25","author":"M Piriyajitakonkij","year":"2020","unstructured":"Piriyajitakonkij M, Warin P, Lakhan P, Leelaarporn P, Kumchaiseemak N, Suwajanakorn S, Pianpanit T, Niparnan N, Mukhopadhyay SC, Wilaiprasitporn T (2020) Sleepposenet: multi-view learning for sleep postural transition recognition using uwb. IEEE J Biomed Health Inform 25(4):1305\u20131314","journal-title":"IEEE J Biomed Health Inform"},{"key":"10332_CR129","doi-asserted-by":"crossref","unstructured":"Poria S, Cambria E, Hazarika D, Mazumder N, Zadeh A, Morency L-P (2017) Multi-level multiple attentions for contextual multimodal sentiment analysis. In: 2017 IEEE International Conference on Data Mining (ICDM). IEEE, pp 1033\u20131038","DOI":"10.1109\/ICDM.2017.134"},{"key":"10332_CR130","doi-asserted-by":"crossref","first-page":"107404","DOI":"10.1016\/j.patcog.2020.107404","volume":"106","author":"X Qin","year":"2020","unstructured":"Qin X, Zhang Z, Huang C, Dehghan M, Zaiane OR, Jagersand M (2020) U2-net: going deeper with nested u-structure for salient object detection. Pattern Recogn 106:107404","journal-title":"Pattern Recogn"},{"key":"10332_CR131","doi-asserted-by":"crossref","unstructured":"Rahate A, Walambe R, Ramanna S, Kotecha K (2021) Multimodal co-learning: challenges, applications with datasets, recent advances and future directions. https:\/\/arXiv.org\/2107.13782","DOI":"10.1016\/j.inffus.2021.12.003"},{"key":"10332_CR132","doi-asserted-by":"crossref","unstructured":"Rahman W, Hasan MK, Lee S, Zadeh A, Mao C, Morency L-P, Hoque E (2020) Integrating multimodal information in large pretrained transformers. In: Proceedings of the Conference. Association for Computational Linguistics. Meeting, vol. 2020. NIH Public Access, p 2359","DOI":"10.18653\/v1\/2020.acl-main.214"},{"issue":"6","key":"10332_CR133","doi-asserted-by":"crossref","first-page":"96","DOI":"10.1109\/MSP.2017.2738401","volume":"34","author":"D Ramachandram","year":"2017","unstructured":"Ramachandram D, Taylor GW (2017) Deep multimodal learning: a survey on recent advances and trends. IEEE Signal Process Mag 34(6):96\u2013108","journal-title":"IEEE Signal Process Mag"},{"key":"10332_CR134","unstructured":"Rayhan Y, Hashem T (2020) Aist: An interpretable attention-based deep learning model for crime prediction. https:\/\/arxiv.org\/arXiv:2012.08713"},{"key":"10332_CR135","doi-asserted-by":"crossref","unstructured":"Redmon J, Divvala S, Girshick R, Farhadi A (2016) You only look once: unified, real-time object detection. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp 779\u2013788","DOI":"10.1109\/CVPR.2016.91"},{"key":"10332_CR136","first-page":"91","volume":"28","author":"S Ren","year":"2015","unstructured":"Ren S, He K, Girshick R, Sun J (2015) Faster r-cnn: towards real-time object detection with region proposal networks. Adv Neural Inf Process Syst 28:91\u201399","journal-title":"Adv Neural Inf Process Syst"},{"key":"10332_CR137","doi-asserted-by":"crossref","unstructured":"Ronneberger O, Fischer P, Brox T (2015) U-net: convolutional networks for biomedical image segmentation. In: International Conference on Medical Image Computing and Computer-assisted Intervention. Springer, pp 234\u2013241","DOI":"10.1007\/978-3-319-24574-4_28"},{"key":"10332_CR138","doi-asserted-by":"crossref","unstructured":"Salama U, Chen X, Yao L, Paik H-Y, Wang X (2021) Deep multi-view spatio-temporal network for urban crime prediction. In: Australasian Database Conference. Springer, pp 50\u201361","DOI":"10.1007\/978-3-030-69377-0_5"},{"key":"10332_CR139","unstructured":"Sasaki Y, Harada K, Yamasaki S, Onizuka M (2021) Airex: Neural network-based approach for air quality inference in unmonitored cities. https:\/\/arXiv.org\/2108.07120"},{"key":"10332_CR140","doi-asserted-by":"crossref","first-page":"4909","DOI":"10.1109\/TITS.2020.2983651","volume":"22","author":"X Shi","year":"2020","unstructured":"Shi X, Qi H, Shen Y, Wu G, Yin B (2020) A spatial-temporal attention approach for traffic prediction. IEEE Trans Intell Transp Syst 22:4909","journal-title":"IEEE Trans Intell Transp Syst"},{"key":"10332_CR141","doi-asserted-by":"crossref","unstructured":"Song C, Lin Y, Guo S, Wan H (2020) Spatial-temporal synchronous graph convolutional networks: A new framework for spatial-temporal network data forecasting. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 34, pp 914\u2013921","DOI":"10.1609\/aaai.v34i01.5438"},{"key":"10332_CR142","unstructured":"Stec A, Klabjan D (2018) Forecasting crime with deep learning. https:\/\/arXiv.org\/1806.01486"},{"key":"10332_CR143","unstructured":"Summaira J, Li X, Shoib AM, Li S, Abdul J (2021) Recent advances and trends in multimodal deep learning: a review. https:\/\/arXiv.org\/2105.11087"},{"issue":"8","key":"10332_CR144","doi-asserted-by":"crossref","first-page":"2682","DOI":"10.1109\/TPAMI.2020.2974203","volume":"43","author":"S Sun","year":"2020","unstructured":"Sun S, Zong D (2020) Lcbm: a multi-view probabilistic model for multi-label classification. IEEE Trans Pattern Anal Mach Intell 43(8):2682\u20132696","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"issue":"8","key":"10332_CR145","doi-asserted-by":"crossref","first-page":"2407","DOI":"10.1016\/j.patcog.2015.02.028","volume":"48","author":"S Sun","year":"2015","unstructured":"Sun S, Zhao J, Gao Q (2015) Modeling and recognizing human trajectories with beta process hidden Markov models. Pattern Recogn 48(8):2407\u20132417","journal-title":"Pattern Recogn"},{"issue":"2","key":"10332_CR146","doi-asserted-by":"crossref","first-page":"421","DOI":"10.3390\/s20020421","volume":"20","author":"S Sun","year":"2020","unstructured":"Sun S, Wu H, Xiang L (2020a) City-wide traffic flow forecasting using a deep convolutional neural network. Sensors 20(2):421","journal-title":"Sensors"},{"key":"10332_CR147","doi-asserted-by":"publisher","DOI":"10.1109\/TKDE.2020.3008774","author":"J Sun","year":"2020","unstructured":"Sun J, Zhang J, Li Q, Yi X, Liang Y, Zheng Y (2020b) Predicting citywide crowd flows in irregular regions using multi-view graph convolutional networks. IEEE Trans Knowl Data Eng. https:\/\/doi.org\/10.1109\/TKDE.2020.3008774","journal-title":"IEEE Trans Knowl Data Eng"},{"key":"10332_CR148","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2020.3041591","author":"S Sun","year":"2020","unstructured":"Sun S, Dong Z, Zhao J (2020c) Conditional random fields for multiview sequential data modeling. IEEE Trans Neural Netw Learn Syst. https:\/\/doi.org\/10.1109\/TNNLS.2020.3041591","journal-title":"IEEE Trans Neural Netw Learn Syst"},{"issue":"12","key":"10332_CR149","doi-asserted-by":"crossref","first-page":"4453","DOI":"10.1109\/TPAMI.2020.3001433","volume":"43","author":"S Sun","year":"2020","unstructured":"Sun S, Dong W, Liu Q (2020d) Multi-view representation learning with deep gaussian processes. IEEE Trans Pattern Anal Mach Intell 43(12):4453\u20134468","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"10332_CR150","doi-asserted-by":"crossref","unstructured":"Sun Z, Sarma P, Sethares W, Liang Y (2020e) Learning relationships between text, audio, and video via deep canonical correlation for multimodal language analysis. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 34, pp 8992\u20138999","DOI":"10.1609\/aaai.v34i05.6431"},{"key":"10332_CR151","doi-asserted-by":"crossref","unstructured":"Supratak A, Guo Y (2020) Tinysleepnet: an efficient deep learning model for sleep stage scoring based on raw single-channel eeg. In: 2020 42nd Annual International Conference of the IEEE Engineering in Medicine & Biology Society (EMBC). IEEE, pp 641\u2013644","DOI":"10.1109\/EMBC44109.2020.9176741"},{"issue":"11","key":"10332_CR152","doi-asserted-by":"crossref","first-page":"1998","DOI":"10.1109\/TNSRE.2017.2721116","volume":"25","author":"A Supratak","year":"2017","unstructured":"Supratak A, Dong H, Wu C, Guo Y (2017) Deepsleepnet: a model for automatic sleep stage scoring based on raw single-channel eeg. IEEE Trans Neural Syst Rehabil Eng 25(11):1998\u20132008","journal-title":"IEEE Trans Neural Syst Rehabil Eng"},{"key":"10332_CR153","unstructured":"Sutskever I, Vinyals O, Le QV (2014) Sequence to sequence learning with neural networks. In: Advances in Neural Information Processing Systems, pp 3104\u20133112"},{"issue":"1","key":"10332_CR154","doi-asserted-by":"crossref","first-page":"37","DOI":"10.1080\/00031305.2017.1380080","volume":"72","author":"SJ Taylor","year":"2018","unstructured":"Taylor SJ, Letham B (2018) Forecasting at scale. Am Stat 72(1):37\u201345","journal-title":"Am Stat"},{"key":"10332_CR155","doi-asserted-by":"crossref","unstructured":"Tian Y, Li D, Xu C (2020) Unified multisensory perception: Weakly-supervised audio-visual video parsing. In: Computer Vision\u2013ECCV 2020: 16th European Conference, Glasgow, UK, August 23\u201328, 2020, Proceedings, Part III 16. Springer, pp 436\u2013454","DOI":"10.1007\/978-3-030-58580-8_26"},{"key":"10332_CR156","doi-asserted-by":"crossref","unstructured":"Torres C, Fragoso V, Hammond SD, Fried JC, Manjunath B (2016) Eye-cu: Sleep pose classification for healthcare using multimodal multiview data. In: 2016 IEEE Winter Conference on Applications of Computer Vision (WACV). IEEE, pp 1\u20139","DOI":"10.1109\/WACV.2016.7477610"},{"key":"10332_CR157","doi-asserted-by":"crossref","unstructured":"Tran L, Liu X, Zhou J, Jin R (2017) Missing modalities imputation via cascaded residual autoencoder. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp 1405\u20131414","DOI":"10.1109\/CVPR.2017.528"},{"key":"10332_CR158","unstructured":"Tsai Y-HH, Liang PP, Zadeh A, Morency L-P, Salakhutdinov R (2018) Learning factorized multimodal representations. https:\/\/arXiv.org\/1806.06176"},{"key":"10332_CR159","doi-asserted-by":"crossref","unstructured":"Tsai Y-HH, Bai S, Liang PP, Kolter JZ, Morency L-P, Salakhutdinov R (2019) Multimodal transformer for unaligned multimodal language sequences. In: Proceedings of the Conference. Association for Computational Linguistics. Meeting, vol. 2019, p 6558. NIH Public Access","DOI":"10.18653\/v1\/P19-1656"},{"key":"10332_CR160","unstructured":"Vaswani A, Shazeer N, Parmar N, Uszkoreit J, Jones L, Gomez AN, Kaiser \u0141, Polosukhin I (2017) Attention is all you need. In: Advances in Neural Information Processing Systems, pp 5998\u20136008"},{"key":"10332_CR161","doi-asserted-by":"crossref","unstructured":"Veiga T, Ljunggren E, Bach K, Akselsen S (2021) Blind calibration of air quality wireless sensor networks using deep neural networks. In: 2021 IEEE International Conference on Omni-Layer Intelligent Systems (COINS). IEEE, pp 1\u20136","DOI":"10.1109\/COINS51742.2021.9524276"},{"key":"10332_CR162","unstructured":"Veli\u010dkovi\u0107 P, Cucurull G, Casanova A, Romero A, Lio P, Bengio Y (2017) Graph attention networks. https:\/\/arXiv.org\/1710.10903"},{"key":"10332_CR163","doi-asserted-by":"crossref","unstructured":"Verma S, Wang J, Ge Z, Shen R, Jin F, Wang Y, Chen F, Liu W (2020) Deep-hoseq: deep higher order sequence fusion for multimodal sentiment analysis. In: 2020 IEEE International Conference on Data Mining (ICDM). IEEE, pp 561\u2013570","DOI":"10.1109\/ICDM50108.2020.00065"},{"key":"10332_CR164","doi-asserted-by":"crossref","first-page":"73","DOI":"10.1016\/j.dss.2018.07.003","volume":"113","author":"L Vomfell","year":"2018","unstructured":"Vomfell L, H\u00e4rdle WK, Lessmann S (2018) Improving crime count forecasts using twitter and taxi data. Decis Support Syst 113:73\u201385","journal-title":"Decis Support Syst"},{"issue":"1s","key":"10332_CR165","first-page":"1","volume":"17","author":"Y Wang","year":"2021","unstructured":"Wang Y (2021) Survey on deep multi-modal data analytics: collaboration, rivalry, and fusion. ACM Trans Multimedia Comput Commun Appl (TOMM) 17(1s):1\u201325","journal-title":"ACM Trans Multimedia Comput Commun Appl (TOMM)"},{"key":"10332_CR166","unstructured":"Wang W, Arora R, Livescu K, Bilmes J (2015) On deep multi-view representation learning. In: International Conference on Machine Learning. PMLR, pp 1083\u20131092"},{"key":"10332_CR167","doi-asserted-by":"crossref","unstructured":"Wang D, Cao W, Li J, Ye J (2017) Deepsd: Supply-demand prediction for online car-hailing services using deep neural networks. In: 2017 IEEE 33rd International Conference on Data Engineering (ICDE), pp 243\u2013254. IEEE","DOI":"10.1109\/ICDE.2017.83"},{"issue":"6","key":"10332_CR168","doi-asserted-by":"crossref","first-page":"949","DOI":"10.1007\/s11401-019-0168-y","volume":"40","author":"B Wang","year":"2019","unstructured":"Wang B, Yin P, Bertozzi AL, Brantingham PJ, Osher SJ, Xin J (2019a) Deep learning for real-time crime forecasting and its ternarization. Chin Ann Math Ser B 40(6):949\u2013966","journal-title":"Chin Ann Math Ser B"},{"key":"10332_CR169","doi-asserted-by":"crossref","unstructured":"Wang B, Lu J, Yan Z, Luo H, Li T, Zheng Y, Zhang G (2019b) Deep uncertainty quantification: A machine learning approach for weather forecasting. In: Proceedings of the 25th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining, pp 2087\u20132095","DOI":"10.1145\/3292500.3330704"},{"key":"10332_CR170","doi-asserted-by":"crossref","unstructured":"Wang Y, Shen Y, Liu Z, Liang PP, Zadeh A, Morency L-P (2019c) Words can shift: Dynamically adjusting word representations using nonverbal behaviors. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 33, pp 7216\u20137223","DOI":"10.1609\/aaai.v33i01.33017216"},{"key":"10332_CR171","doi-asserted-by":"crossref","first-page":"107075","DOI":"10.1016\/j.patcog.2019.107075","volume":"98","author":"J Wang","year":"2020","unstructured":"Wang J, Wang W, Wang L, Wang Z, Feng DD, Tan T (2020a) Learning visual relationship and context-aware attention for image captioning. Pattern Recogn 98:107075","journal-title":"Pattern Recogn"},{"key":"10332_CR172","doi-asserted-by":"crossref","first-page":"3483","DOI":"10.1109\/TMM.2020.3025666","volume":"23","author":"Q Wang","year":"2020","unstructured":"Wang Q, Cheng J, Gao Q, Zhao G, Jiao L (2020b) Deep multi-view subspace clustering with unified and discriminative learning. IEEE Trans Multimedia 23:3483\u20133493","journal-title":"IEEE Trans Multimedia"},{"key":"10332_CR173","doi-asserted-by":"crossref","first-page":"305","DOI":"10.1109\/TIP.2020.3036717","volume":"30","author":"Q Wang","year":"2020","unstructured":"Wang Q, Lian H, Sun G, Gao Q, Jiao L (2020c) Icmsc: incomplete cross-modal subspace clustering. IEEE Trans Image Process 30:305\u2013317","journal-title":"IEEE Trans Image Process"},{"key":"10332_CR174","doi-asserted-by":"publisher","DOI":"10.1109\/TKDE.2020.3025580","author":"S Wang","year":"2020","unstructured":"Wang S, Cao J, Yu P (2020d) Deep learning for spatio-temporal data mining: a survey. IEEE Trans Knowl Data Eng. https:\/\/doi.org\/10.1109\/TKDE.2020.3025580","journal-title":"IEEE Trans Knowl Data Eng"},{"key":"10332_CR175","doi-asserted-by":"crossref","unstructured":"Wang X, Ma Y, Wang Y, Jin W, Yu J (2020e) Traffic flow prediction via spatial temporal graph neural network. In: WWW \u201920: The Web Conference 2020","DOI":"10.1145\/3366423.3380186"},{"key":"10332_CR176","doi-asserted-by":"crossref","unstructured":"Wang S, Miao H, Chen H, Huang Z (2020f) Multi-task adversarial spatial-temporal networks for crowd flow prediction. In: Proceedings of the 29th ACM International Conference on Information & Knowledge Management, pp 1555\u20131564","DOI":"10.1145\/3340531.3412054"},{"key":"10332_CR177","doi-asserted-by":"crossref","unstructured":"Wang Z, Wan Z, Wan X (2020g) Transmodality: an end2end fusion method with transformer for multimodal sentiment analysis. In: Proceedings of The Web Conference 2020, pp 2514\u20132520","DOI":"10.1145\/3366423.3380000"},{"key":"10332_CR178","unstructured":"Wang C, Lin Z, Yang X, Sun J, Yue M, Shahabi C (2021) Hagen: Homophily-aware graph convolutional recurrent network for crime forecasting. https:\/\/arXiv.org\/2109.12846"},{"key":"10332_CR179","doi-asserted-by":"crossref","unstructured":"Wang J, Yang Y, Liu K, Xie P, Liu X (2022) Instance-guided multi-modal fake news detection with dynamic intra- and inter-modality fusion. In: PAKDD, pp 510\u2013521","DOI":"10.1007\/978-3-031-05933-9_40"},{"key":"10332_CR180","doi-asserted-by":"crossref","unstructured":"Wu Y, Yang Y (2021) Exploring heterogeneous clues for weakly-supervised audio-visual video parsing. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 1326\u20131335","DOI":"10.1109\/CVPR46437.2021.00138"},{"key":"10332_CR181","doi-asserted-by":"crossref","unstructured":"Wu X, Huang C, Zhang C, Chawla NV (2020) Hierarchically structured transformer networks for fine-grained spatial event forecasting. In: Proceedings of The Web Conference 2020, pp 2320\u20132330","DOI":"10.1145\/3366423.3380296"},{"key":"10332_CR182","doi-asserted-by":"crossref","unstructured":"Wu J, Jiang Z, Wen S, Men A, Wang H (2021) Rethinking the constraints of multimodal fusion: case study in weakly-supervised audio-visual video parsing. https:\/\/arXiv.org\/2105.14430","DOI":"10.1109\/CVPR46437.2021.00138"},{"key":"10332_CR183","doi-asserted-by":"crossref","unstructured":"Xia L, Huang C, Xu Y, Dai P, Bo L, Zhang X, Chen T (2021) Spatial-temporal sequential hypergraph network for crime prediction with dynamic multiplex relation learning. In: IJCAI, pp 1631\u20131637","DOI":"10.24963\/ijcai.2021\/225"},{"key":"10332_CR184","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1016\/j.neunet.2021.10.006","volume":"145","author":"W Xia","year":"2022","unstructured":"Xia W, Wang S, Yang M, Gao Q, Han J, Gao X (2022) Multi-view graph embedding clustering network: joint self-supervision and block diagonal representation. Neural Netw 145:1\u20139","journal-title":"Neural Netw"},{"key":"10332_CR185","unstructured":"Xingjian S, Chen Z, Wang H, Yeung D-Y, Wong W-K, Woo W-c (2015) Convolutional lstm network: A machine learning approach for precipitation nowcasting. In: Advances in Neural Information Processing Systems, pp 802\u2013810"},{"key":"10332_CR186","doi-asserted-by":"crossref","unstructured":"Xu H, Zhang H, Han K, Wang Y, Peng Y, Li X (2019) Learning alignment for multimodal emotion recognition from speech. https:\/\/arXiv.org\/1909.05645","DOI":"10.21437\/Interspeech.2019-3247"},{"key":"10332_CR187","doi-asserted-by":"crossref","unstructured":"Xu Z, So DR, Dai AM (2021) Mufasa: Multimodal fusion architecture search for electronic health records. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 35, pp 10532\u201310540","DOI":"10.1609\/aaai.v35i12.17260"},{"issue":"10","key":"10332_CR188","doi-asserted-by":"crossref","first-page":"2371","DOI":"10.1109\/TNNLS.2016.2574840","volume":"28","author":"H-F Yang","year":"2016","unstructured":"Yang H-F, Dillon TS, Chen Y-PP (2016) Optimized structure of the traffic flow forecasting model with a deep learning approach. IEEE Trans Neural Netw Learn Syst 28(10):2371\u20132381","journal-title":"IEEE Trans Neural Netw Learn Syst"},{"key":"10332_CR189","doi-asserted-by":"crossref","unstructured":"Yang B, Luo W, Urtasun R (2018) Pixor: Real-time 3d object detection from point clouds. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp 7652\u20137660","DOI":"10.1109\/CVPR.2018.00798"},{"key":"10332_CR190","doi-asserted-by":"crossref","unstructured":"Yang J, Wang Y, Yi R, Zhu Y, Rehman A, Zadeh A, Poria S, Morency L-P (2020) Mtgat: multimodal temporal graph attention networks for unaligned human multimodal language sequences. https:\/\/arXiv.org\/2010.11985","DOI":"10.18653\/v1\/2021.naacl-main.79"},{"key":"10332_CR191","doi-asserted-by":"crossref","unstructured":"Yao H, Wu F, Ke J, Tang X, Jia Y, Lu S, Gong P, Ye J, Li Z (2018) Deep multi-view spatial-temporal network for taxi demand prediction. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 32","DOI":"10.1609\/aaai.v32i1.11836"},{"key":"10332_CR192","doi-asserted-by":"crossref","unstructured":"Yao H, Liu Y, Wei Y, Tang X, Li Z (2019a) Learning from multiple cities: a meta-learning approach for spatial-temporal prediction. In: The World Wide Web Conference, pp 2181\u20132191","DOI":"10.1145\/3308558.3313577"},{"key":"10332_CR193","doi-asserted-by":"crossref","unstructured":"Yao H, Tang X, Wei H, Zheng G, Li Z (2019b) Revisiting spatial-temporal similarity: A deep learning framework for traffic prediction. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 33, pp 5668\u20135675","DOI":"10.1609\/aaai.v33i01.33015668"},{"key":"10332_CR194","doi-asserted-by":"crossref","unstructured":"Yi X, Zhang J, Wang Z, Li T, Zheng Y (2018) Deep distributed fusion network for air quality prediction. In: Proceedings of the 24th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining, pp 965\u2013973","DOI":"10.1145\/3219819.3219822"},{"issue":"9","key":"10332_CR195","doi-asserted-by":"crossref","first-page":"3442","DOI":"10.1109\/TNNLS.2019.2944664","volume":"31","author":"J Yin","year":"2019","unstructured":"Yin J, Sun S (2019) Multiview uncorrelated locality preserving projection. IEEE Trans Neural Netw Learn Syst 31(9):3442\u20133455","journal-title":"IEEE Trans Neural Netw Learn Syst"},{"key":"10332_CR196","doi-asserted-by":"crossref","first-page":"42","DOI":"10.1016\/j.neucom.2020.11.038","volume":"428","author":"X Yin","year":"2021","unstructured":"Yin X, Wu G, Wei J, Shen Y, Qi H, Yin B (2021a) Multi-stage attention spatial-temporal graph networks for traffic prediction. Neurocomputing 428:42\u201353","journal-title":"Neurocomputing"},{"key":"10332_CR197","unstructured":"Yin Y, Huang S, Zhang X, Dou D (2021b) Bm-nas: Bilevel multimodal neural architecture search. https:\/\/arXiv.org\/2104.09379"},{"key":"10332_CR198","doi-asserted-by":"crossref","unstructured":"Yu B, Yin H, Zhu Z (2017) Spatio-temporal graph convolutional networks: A deep learning framework for traffic forecasting. https:\/\/arXiv.org\/1709.04875","DOI":"10.24963\/ijcai.2018\/505"},{"key":"10332_CR199","doi-asserted-by":"crossref","unstructured":"Yu Z, Cui Y, Yu J, Wang M, Tao D, Tian Q (2020a) Deep multimodal neural architecture search. In: Proceedings of the 28th ACM International Conference on Multimedia, pp 3743\u20133752","DOI":"10.1145\/3394171.3413977"},{"key":"10332_CR200","doi-asserted-by":"crossref","unstructured":"Yu W, Xu H, Meng F, Zhu Y, Ma Y, Wu J, Zou J, Yang K (2020b) Ch-sims: A chinese multimodal sentiment analysis dataset with fine-grained annotation of modality. In: Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics, pp 3718\u20133727","DOI":"10.18653\/v1\/2020.acl-main.343"},{"key":"10332_CR201","doi-asserted-by":"crossref","unstructured":"Yu J, Cheng Y, Zhao R-W, Feng R, Zhang Y (2021a) Mm-pyramid: Multimodal pyramid attentional network for audio-visual event localization and video parsing. https:\/\/arXiv.org\/2111.12374","DOI":"10.1145\/3503161.3547869"},{"key":"10332_CR202","doi-asserted-by":"crossref","unstructured":"Yu W, Xu H, Yuan Z, Wu J (2021b) Learning modality-specific representations with self-supervised multi-task learning for multimodal sentiment analysis. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 35, pp 10790\u201310797","DOI":"10.1609\/aaai.v35i12.17289"},{"key":"10332_CR203","doi-asserted-by":"crossref","unstructured":"Yuan Z, Zhou X, Yang T (2018) Hetero-convlstm: A deep learning approach to traffic accident prediction on heterogeneous spatio-temporal data. In: Proceedings of the 24th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining, pp 984\u2013992","DOI":"10.1145\/3219819.3219922"},{"issue":"16","key":"10332_CR204","first-page":"1","volume":"20","author":"Y Yuan","year":"2019","unstructured":"Yuan Y, Jia K, Ma F, Xun G, Wang Y, Su L, Zhang A (2019) A hybrid self-attention deep learning framework for multivariate sleep stage classification. BMC Bioinform 20(16):1\u201310","journal-title":"BMC Bioinform"},{"key":"10332_CR205","unstructured":"Zadeh A, Zellers R, Pincus E, Morency L-P (2016) Mosi: multimodal corpus of sentiment intensity and subjectivity analysis in online opinion videos. https:\/\/arXiv.org\/1606.06259"},{"key":"10332_CR206","doi-asserted-by":"crossref","unstructured":"Zadeh A, Chen M, Poria S, Cambria E, Morency L-P (2017) Tensor fusion network for multimodal sentiment analysis. https:\/\/arXiv.org\/1707.07250","DOI":"10.18653\/v1\/D17-1115"},{"key":"10332_CR207","unstructured":"Zadeh AB, Liang PP, Poria S, Cambria E, Morency L-P (2018a) Multimodal language analysis in the wild: Cmu-mosei dataset and interpretable dynamic fusion graph. In: Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics, vol. 1: Long Papers, pp 2236\u20132246"},{"key":"10332_CR208","doi-asserted-by":"crossref","unstructured":"Zadeh A, Liang PP, Mazumder N, Poria S, Cambria E, Morency L-P (2018b) Memory fusion network for multi-view sequential learning. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 32","DOI":"10.1609\/aaai.v32i1.12021"},{"key":"10332_CR209","doi-asserted-by":"crossref","unstructured":"Zadeh A, Liang PP, Poria S, Vij P, Cambria E, Morency L-P (2018c) Multi-attention recurrent network for human communication comprehension. In: Thirty-Second AAAI Conference on Artificial Intelligence","DOI":"10.1609\/aaai.v32i1.12024"},{"key":"10332_CR210","unstructured":"Zadeh A, Mao C, Shi K, Zhang Y, Liang PP, Poria S, Morency L-P (2019) Factorized multimodal transformer for multimodal sequential learning. rint https:\/\/arXiv.org\/1911.09826"},{"key":"10332_CR211","doi-asserted-by":"crossref","unstructured":"Zhang J, Zheng Y, Qi D, Li R, Yi X (2016) Dnn-based prediction model for spatio-temporal data. In: Proceedings of the 24th ACM SIGSPATIAL International Conference on Advances in Geographic Information Systems, pp 1\u20134","DOI":"10.1145\/2996913.2997016"},{"key":"10332_CR212","doi-asserted-by":"crossref","unstructured":"Zhang J, Zheng Y, Qi D (2017) Deep spatio-temporal residual networks for citywide crowd flows prediction. In: Thirty-first AAAI Conference on Artificial Intelligence","DOI":"10.1609\/aaai.v31i1.10735"},{"issue":"10","key":"10332_CR213","doi-asserted-by":"crossref","first-page":"1351","DOI":"10.1093\/jamia\/ocy064","volume":"25","author":"G-Q Zhang","year":"2018","unstructured":"Zhang G-Q, Cui L, Mueller R, Tao S, Kim M, Rueschman M, Mariani S, Mobley D, Redline S (2018) The national sleep research resource: towards a sleep data commons. J Am Med Inform Assoc 25(10):1351\u20131358","journal-title":"J Am Med Inform Assoc"},{"issue":"3","key":"10332_CR214","doi-asserted-by":"crossref","first-page":"468","DOI":"10.1109\/TKDE.2019.2891537","volume":"32","author":"J Zhang","year":"2019","unstructured":"Zhang J, Zheng Y, Sun J, Qi D (2019) Flow prediction in spatio-temporal networks based on multitask deep learning. IEEE Trans Knowl Data Eng 32(3):468\u2013478","journal-title":"IEEE Trans Knowl Data Eng"},{"key":"10332_CR215","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2020.3037734","author":"C Zhang","year":"2020","unstructured":"Zhang C, Cui Y, Han Z, Zhou JT, Fu H, Hu Q (2020) Deep partial multi-view learning. IEEE Trans Pattern Anal Mach Intell. https:\/\/doi.org\/10.1109\/TPAMI.2020.3037734","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"10332_CR216","doi-asserted-by":"crossref","first-page":"6895","DOI":"10.1007\/s10489-020-02074-8","volume":"51","author":"Y Zhang","year":"2021","unstructured":"Zhang Y, Yang Y, Zhou W, Wang H, Ouyang X (2021a) Multi-city traffic flow forecasting via multi-task learning. Appl Intell 51:6895","journal-title":"Appl Intell"},{"key":"10332_CR217","doi-asserted-by":"crossref","unstructured":"Zhang M, Li T, Li Y, Hui P (2021b) Multi-view joint graph representation learning for urban region embedding. In: Proceedings of the Twenty-Ninth International Conference on International Joint Conferences on Artificial Intelligence, pp 4431\u20134437","DOI":"10.24963\/ijcai.2020\/611"},{"issue":"7","key":"10332_CR218","doi-asserted-by":"crossref","first-page":"2014","DOI":"10.1109\/TITS.2016.2515105","volume":"17","author":"J Zhao","year":"2016","unstructured":"Zhao J, Sun S (2016a) High-order gaussian process dynamical models for traffic flow prediction. IEEE Trans Intell Transp Syst 17(7):2014\u20132019","journal-title":"IEEE Trans Intell Transp Syst"},{"issue":"1","key":"10332_CR219","first-page":"4134","volume":"17","author":"J Zhao","year":"2016","unstructured":"Zhao J, Sun S (2016b) Variational dependent multi-output gaussian process dynamical systems. J Mach Learn Res 17(1):4134\u20134169","journal-title":"J Mach Learn Res"},{"key":"10332_CR220","doi-asserted-by":"crossref","first-page":"43","DOI":"10.1016\/j.inffus.2017.02.007","volume":"38","author":"J Zhao","year":"2017","unstructured":"Zhao J, Xie X, Xu X, Sun S (2017a) Multi-view learning overview: recent progress and new challenges. Inf Fusion 38:43\u201354","journal-title":"Inf Fusion"},{"key":"10332_CR221","doi-asserted-by":"crossref","unstructured":"Zhao H, Ding Z, Fu Y (2017b) Multi-view clustering via deep matrix factorization. In: Thirty-first AAAI Conference on Artificial Intelligence","DOI":"10.1609\/aaai.v31i1.10867"},{"key":"10332_CR222","doi-asserted-by":"crossref","unstructured":"Zhao H, Shi J, Qi X, Wang X, Jia J (2017c) Pyramid scene parsing network. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp 2881\u20132890","DOI":"10.1109\/CVPR.2017.660"},{"issue":"9","key":"10332_CR223","doi-asserted-by":"crossref","first-page":"3848","DOI":"10.1109\/TITS.2019.2935152","volume":"21","author":"L Zhao","year":"2019","unstructured":"Zhao L, Song Y, Zhang C, Liu Y, Wang P, Lin T, Deng M, Li H (2019) T-gcn: a temporal graph convolutional network for traffic prediction. IEEE Trans Intell Transp Syst 21(9):3848\u20133858","journal-title":"IEEE Trans Intell Transp Syst"},{"key":"10332_CR224","doi-asserted-by":"crossref","unstructured":"Zheng C, Fan X, Wang C, Qi J (2020) Gman: a graph multi-attention network for traffic prediction. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 34, pp 1234\u20131241","DOI":"10.1609\/aaai.v34i01.5477"},{"key":"10332_CR225","doi-asserted-by":"crossref","unstructured":"Zheng L, Cheng Y, Yang H, Cao N, He J (2021) Deep co-attention network for multi-view subspace learning. In: Proceedings of the Web Conference 2021, pp 1528\u20131539","DOI":"10.1145\/3442381.3449801"},{"key":"10332_CR226","unstructured":"Zhong H, Yin C, Wu X, Luo J, He J (2020) Airrl: A reinforcement learning approach to urban air quality inference. https:\/\/arXiv.org\/2003.12205"},{"key":"10332_CR227","doi-asserted-by":"crossref","unstructured":"Zhou Y, Tuzel O (2018) Voxelnet: End-to-end learning for point cloud based 3d object detection. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp 4490\u20134499","DOI":"10.1109\/CVPR.2018.00472"},{"key":"10332_CR228","doi-asserted-by":"crossref","first-page":"106286","DOI":"10.1016\/j.knosys.2020.106286","volume":"205","author":"W Zhou","year":"2020","unstructured":"Zhou W, Yang Y, Zhang Y, Wang D, Zhang X (2020) Deep flexible structured spatial-temporal model for taxi capacity prediction. Knowl-Based Syst 205:106286","journal-title":"Knowl-Based Syst"}],"updated-by":[{"DOI":"10.1007\/s10462-022-10367-2","type":"correction","label":"Correction","source":"publisher","updated":{"date-parts":[[2022,12,19]],"date-time":"2022-12-19T00:00:00Z","timestamp":1671408000000}}],"container-title":["Artificial Intelligence Review"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10462-022-10332-z.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s10462-022-10332-z\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10462-022-10332-z.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,4,9]],"date-time":"2025-04-09T14:14:55Z","timestamp":1744208095000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s10462-022-10332-z"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022,11,29]]},"references-count":229,"journal-issue":{"issue":"7","published-print":{"date-parts":[[2023,7]]}},"alternative-id":["10332"],"URL":"https:\/\/doi.org\/10.1007\/s10462-022-10332-z","relation":{"correction":[{"id-type":"doi","id":"10.1007\/s10462-022-10367-2","asserted-by":"object"}]},"ISSN":["0269-2821","1573-7462"],"issn-type":[{"value":"0269-2821","type":"print"},{"value":"1573-7462","type":"electronic"}],"subject":[],"published":{"date-parts":[[2022,11,29]]},"assertion":[{"value":"29 November 2022","order":1,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"19 December 2022","order":2,"name":"change_date","label":"Change Date","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"Correction","order":3,"name":"change_type","label":"Change Type","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"A Correction to this paper has been published:","order":4,"name":"change_details","label":"Change Details","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"https:\/\/doi.org\/10.1007\/s10462-022-10367-2","URL":"https:\/\/doi.org\/10.1007\/s10462-022-10367-2","order":5,"name":"change_details","label":"Change Details","group":{"name":"ArticleHistory","label":"Article History"}}]}}