{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T16:54:28Z","timestamp":1777654468659,"version":"3.51.4"},"reference-count":51,"publisher":"Springer Science and Business Media LLC","issue":"3","license":[{"start":{"date-parts":[[2018,5,3]],"date-time":"2018-05-03T00:00:00Z","timestamp":1525305600000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["World Wide Web"],"published-print":{"date-parts":[[2019,5]]},"DOI":"10.1007\/s11280-018-0548-3","type":"journal-article","created":{"date-parts":[[2018,5,3]],"date-time":"2018-05-03T07:43:15Z","timestamp":1525333395000},"page":"1325-1341","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":73,"title":["Multimodal deep representation learning for video classification"],"prefix":"10.1007","volume":"22","author":[{"given":"Haiman","family":"Tian","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yudong","family":"Tao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Samira","family":"Pouyanfar","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-9209-390X","authenticated-orcid":false,"given":"Shu-Ching","family":"Chen","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Mei-Ling","family":"Shyu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2018,5,3]]},"reference":[{"issue":"6","key":"548_CR1","doi-asserted-by":"publisher","first-page":"345","DOI":"10.1007\/s00530-010-0182-0","volume":"16","author":"PK Atrey","year":"2010","unstructured":"Atrey, P.K., Hossain, M.A., El Saddik, A., Kankanhalli, M.S.: Multimodal fusion for multimedia analysis: a survey. Multimed.Syst. 16(6), 345\u2013379 (2010)","journal-title":"Multimed.Syst."},{"issue":"1","key":"548_CR2","first-page":"9","volume":"3","author":"SC Chen","year":"2000","unstructured":"Chen, S.C., Shyu, M.L., Kashyap, R.L.: Augmented transition network as a semantic model for video data. Int. J. Network. Inf. Syst. Special Issue Video Data 3 (1), 9\u201325 (2000)","journal-title":"Int. J. Network. Inf. Syst. Special Issue Video Data"},{"key":"548_CR3","doi-asserted-by":"crossref","unstructured":"Chen, S.C., Shyu, M.L., Chen, M., Zhang, C.: A decision tree-based multimodal data mining framework for soccer goal detection. In: IEEE International conference on multimedia and expo, pp. 265\u2013268 (2004)","DOI":"10.1109\/ICME.2004.1394176"},{"key":"548_CR4","doi-asserted-by":"crossref","unstructured":"Chen, S.C., Shyu, M.L., Zhang, C.: Innovative shot boundary detection for video indexing. Video Data Manag. Inf. Retriev, 217\u2013236 (2005)","DOI":"10.4018\/978-1-59140-571-9.ch009"},{"key":"548_CR5","doi-asserted-by":"crossref","unstructured":"Chen, M., Chen, S.C., Shyu, M.L., Zhang, C.: Video event mining via multimodal content analysis and classification. In: Petrushin, V. A., Khan, L. (eds.) Multimedia Data Mining and Knowledge Discovery, pp. 234\u2013258. Springer, London (2007)","DOI":"10.1007\/978-1-84628-799-2_12"},{"issue":"2","key":"548_CR6","doi-asserted-by":"publisher","first-page":"228","DOI":"10.1109\/TSMCC.2008.2007257","volume":"39","author":"X Chen","year":"2009","unstructured":"Chen, X., Zhang, C., Chen, S.C., Rubin, S.: A human-centered multiple instance learning framework for semantic video retrieval. IEEE Trans. Syst. Man Cybern. Part C (Appl. Rev.) 39(2), 228\u2013233 (2009)","journal-title":"IEEE Trans. Syst. Man Cybern. Part C (Appl. Rev.)"},{"issue":"4","key":"548_CR7","first-page":"61","volume":"4","author":"C Chen","year":"2013","unstructured":"Chen, C., Zhu, Q., Lin, L., Shyu, M.L.: Web media semantic concept retrieval via tag removal and model fusion. ACM Trans. Intell. Syst. Technol. 4(4), 61 (2013)","journal-title":"ACM Trans. Intell. Syst. Technol."},{"issue":"3\u20134","key":"548_CR8","doi-asserted-by":"publisher","first-page":"197","DOI":"10.1561\/2000000039","volume":"7","author":"L Deng","year":"2014","unstructured":"Deng, L., Yu, D., et al.: Deep learning: Methods and applications. Foundations and Trends\u00ae;, in Signal Processing 7(3\u20134), 197\u2013387 (2014)","journal-title":"Foundations and Trends\u00ae;, in Signal Processing"},{"issue":"2","key":"548_CR9","doi-asserted-by":"publisher","first-page":"274","DOI":"10.1109\/TITB.2009.2037317","volume":"14","author":"A Fleury","year":"2010","unstructured":"Fleury, A., Vacher, M., Noury, N: SVM-based multimodal classification of activities of daily living in health smart homes: sensors, algorithms, and first experimental results. IEEE Trans. Inf. Technol. Biomed. 14(2), 274\u2013283 (2010)","journal-title":"IEEE Trans. Inf. Technol. Biomed."},{"issue":"5","key":"548_CR10","doi-asserted-by":"publisher","first-page":"602","DOI":"10.1016\/j.neunet.2005.06.042","volume":"18","author":"A Graves","year":"2005","unstructured":"Graves, A., Schmidhuber, J.: Framewise phoneme classification with bidirectional lstm and other neural network architectures. Neural Netw. 18(5), 602\u2013610 (2005)","journal-title":"Neural Netw."},{"key":"548_CR11","doi-asserted-by":"crossref","unstructured":"Ha, H.Y., Yang, Y., Pouyanfar, S., Tian, H., Chen, S.C.: Correlation-based deep learning for multimedia semantic concept detection. In: International Conference on Web Information Systems Engineering, pp. 473\u2013487 (2015)","DOI":"10.1007\/978-3-319-26187-4_43"},{"key":"548_CR12","unstructured":"Hannun, A.Y., Case, C., Casper, J., Catanzaro, B., Diamos, G., Elsen, E., Prenger, R., Satheesh, S., Sengupta, S., Coates, A., Ng, A.Y.: Deep speech: scaling up end-to-end speech recognition. CoRR arXiv: 1412.5567 (2014)"},{"key":"548_CR13","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: IEEE Conference on Computer Vision and Pattern Recognition, pp. 770\u2013778 (2016)","DOI":"10.1109\/CVPR.2016.90"},{"key":"548_CR14","unstructured":"Johnson, R., Zhang, T.: Supervised and semi-supervised text categorization using lstm for region embeddings. In: International Conference on Machine Learning, pp. 526\u2013534. JMLR.org (2016)"},{"issue":"2","key":"548_CR15","doi-asserted-by":"publisher","first-page":"99","DOI":"10.1007\/s12193-015-0195-2","volume":"10","author":"SE Kahou","year":"2016","unstructured":"Kahou, S.E., Bouthillier, X., Lamblin, P., Gulcehre, C., Michalski, V., Konda, K., Jean, S., Froumenty, P., Dauphin, Y., Boulanger-Lewandowski, N., et al.: Emonets: multimodal deep learning approaches for emotion recognition in video. J. Multimodal User Interf. 10(2), 99\u2013111 (2016)","journal-title":"J. Multimodal User Interf."},{"key":"548_CR16","doi-asserted-by":"crossref","unstructured":"Karpathy, A., Toderici, G., Shetty, S., Leung, T., Sukthankar, R., Fei-Fei, L.: Large-scale video classification with convolutional neural networks. In: IEEE Conference on Computer Vision and Pattern Recognition, pp. 1725\u20131732 (2014)","DOI":"10.1109\/CVPR.2014.223"},{"key":"548_CR17","doi-asserted-by":"crossref","unstructured":"Kim, Y.: Convolutional neural networks for sentence classification. In: Conference on Empirical Methods in Natural Language Processing, pp. 1746\u20131751. ACL (2014)","DOI":"10.3115\/v1\/D14-1181"},{"key":"548_CR18","unstructured":"Krizhevsky, A., Sutskever, I., Hinton, G.E.: Imagenet classification with deep convolutional neural networks. In: Advances in Neural Information Processing Systems, pp. 1097\u20131105 (2012)"},{"issue":"1","key":"548_CR19","doi-asserted-by":"publisher","first-page":"333","DOI":"10.1007\/s11042-013-1391-2","volume":"71","author":"Z Lan","year":"2014","unstructured":"Lan, Z., Bao, L., Yu, S., Liu, W., Hauptmann, A.G.: Multimedia classification and event detection using double fusion. Multimed. Tools Appl. 71(1), 333\u2013347 (2014)","journal-title":"Multimed. Tools Appl."},{"issue":"7553","key":"548_CR20","doi-asserted-by":"publisher","first-page":"436","DOI":"10.1038\/nature14539","volume":"521","author":"Y LeCun","year":"2015","unstructured":"LeCun, Y., Bengio, Y., Hinton, G.: Deep learning. Nature 521(7553), 436\u2013444 (2015)","journal-title":"Nature"},{"issue":"1","key":"548_CR21","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3017678","volume":"50","author":"T Li","year":"2017","unstructured":"Li, T., Xie, N., Zeng, C., Zhou, W., Zheng, L., Jiang, Y., Yang, Y., Ha, H., Xue, W., Huang, Y., Chen, S., Navlakha, J. K., Iyengar, S. S.: Data-driven techniques in disaster information management. ACM Comput. Surv. 50 (1), 1 (2017)","journal-title":"ACM Comput. Surv."},{"issue":"1","key":"548_CR22","first-page":"37","volume":"1","author":"L Lin","year":"2012","unstructured":"Lin, L., Shyu, M.L.: Weighted association rule mining for video semantic detection. Methods Innov. Multimed. Database Content Manag. 1(1), 37\u201354 (2012)","journal-title":"Methods Innov. Multimed. Database Content Manag."},{"key":"548_CR23","doi-asserted-by":"crossref","unstructured":"Meng, T., Shyu, M.L.: Leveraging concept association network for multimedia rare concept mining and retrieval. In: IEEE International Conference on Multimedia and Expo, pp. 860\u2013865 (2012)","DOI":"10.1109\/ICME.2012.134"},{"key":"548_CR24","doi-asserted-by":"crossref","unstructured":"Morency, L.P., Mihalcea, R., Doshi, P.: Towards multimodal sentiment analysis: harvesting opinions from the Web. In: International Conference on Multimodal Interfaces, pp. 169\u2013176. ACM (2011)","DOI":"10.1145\/2070481.2070509"},{"issue":"10","key":"548_CR25","doi-asserted-by":"publisher","first-page":"4241","DOI":"10.1016\/j.eswa.2013.01.019","volume":"40","author":"MM Mostafa","year":"2013","unstructured":"Mostafa, M.M.: More than words: social networks\u2019 text mining for consumer brand sentiments. Expert Syst. Appl. 40(10), 4241\u20134251 (2013)","journal-title":"Expert Syst. Appl."},{"key":"548_CR26","doi-asserted-by":"crossref","unstructured":"Pantic, M., Sebe, N., Cohn, J.F., Huang, T.: Affective multimodal human-computer interaction. In: ACM International Conference on Multimedia, pp. 669\u2013676. ACM (2005)","DOI":"10.1145\/1101149.1101299"},{"key":"548_CR27","doi-asserted-by":"crossref","unstructured":"Pennington, J., Socher, R., Manning, C.D.: Glove: global vectors for word representation. In: Conference on Empirical Methods in Natural Language Processing, pp. 1532\u20131543. ACL (2014)","DOI":"10.3115\/v1\/D14-1162"},{"key":"548_CR28","doi-asserted-by":"crossref","unstructured":"Potharaju, R., Carbunar, B., Azimpourkivi, M., Vasudevan, V., Iyengar, S.: Infiltrating social network accounts: attacks and defenses. In: Chang, C. H., Potkonjak, M. (eds.) Secure System Design and Trustable Computing, pp. 457\u2013485. Springer, Cham (2016)","DOI":"10.1007\/978-3-319-14971-4_15"},{"key":"548_CR29","doi-asserted-by":"crossref","unstructured":"Pouyanfar, S., Chen, S.C.: Semantic concept detection using weighted discretization multiple correspondence analysis for disaster information management. In: International Conference on Information Reuse and Integration, pp. 556\u2013564 (2016)","DOI":"10.1109\/IRI.2016.82"},{"issue":"01","key":"548_CR30","doi-asserted-by":"publisher","first-page":"85","DOI":"10.1142\/S1793351X17400050","volume":"11","author":"S Pouyanfar","year":"2017","unstructured":"Pouyanfar, S., Chen, S.C.: Automatic video event detection for imbalance data using enhanced ensemble deep learning. Int. J. Semant. Comput. 11(01), 85\u2013109 (2017)","journal-title":"Int. J. Semant. Comput."},{"issue":"1","key":"548_CR31","doi-asserted-by":"publisher","first-page":"10:1","DOI":"10.1145\/3150226","volume":"51","author":"S Pouyanfar","year":"2018","unstructured":"Pouyanfar, S., Yang, Y., Chen, S.C., Shyu, M.L., Iyengar, S.S.: Multimedia big data analytics: a survey. ACM Comput. Surv. 51(1), 10:1\u201310:34 (2018)","journal-title":"ACM Comput. Surv."},{"key":"548_CR32","unstructured":"Reyes, M.E.P., Pouyanfar, S., Zheng, H.C., Ha, H.Y., Chen, S.C.: Multimedia data management for disaster situation awareness. In: International Symposium on Sensor Networks, Systems and Security. Springer (2017)"},{"key":"548_CR33","doi-asserted-by":"crossref","unstructured":"Rosenthal, S., Farra, N., Nakov, P.: SemEval-2017 task 4: sentiment analysis in Twitter. In: International Workshop on Semantic Evaluation, pp. 502\u2013518 (2017)","DOI":"10.18653\/v1\/S17-2088"},{"key":"548_CR34","doi-asserted-by":"crossref","unstructured":"Scott, J.: Social network analysis. SAGE (2017)","DOI":"10.4135\/9781529716597"},{"issue":"7","key":"548_CR35","doi-asserted-by":"publisher","first-page":"1551","DOI":"10.1017\/S026357471400085X","volume":"33","author":"H Shahbazi","year":"2015","unstructured":"Shahbazi, H., Jamshidi, K., Monadjemi, A.H., Manoochehri, H.E.: Training oscillatory neural networks using natural gradient particle swarm optimization. Robotica 33(7), 1551\u20131567 (2015)","journal-title":"Robotica"},{"issue":"3","key":"548_CR36","doi-asserted-by":"publisher","first-page":"319","DOI":"10.1007\/PL00011671","volume":"3","author":"ML Shyu","year":"2001","unstructured":"Shyu, M.L., Chen, S.C., Kashyap, R.L.: Generalized affinity-based association rule mining for multimedia database queries. Knowl. Inf. Syst. 3(3), 319\u2013337 (2001)","journal-title":"Knowl. Inf. Syst."},{"key":"548_CR37","unstructured":"Shyu, M.L., Sarinnapakorn, K., Kuruppu-Appuhamilage, I., Chen, S.C., Chang, L., Goldring, T.: Handling nominal features in anomaly intrusion detection problems. In: International Workshop on Research Issues in Data Engineering: Stream Data Mining and Applications, pp. 55\u201362 (2005)"},{"key":"548_CR38","doi-asserted-by":"crossref","unstructured":"Szegedy, C., Ioffe, S., Vanhoucke, V., Alemi, A.A.: Inception-v4, Inception-ResNet and the impact of residual connections on learning. In: AAAI Conference on Artificial Intelligence, pp. 4278\u20134284. AAAI Press (2017)","DOI":"10.1609\/aaai.v31i1.11231"},{"key":"548_CR39","doi-asserted-by":"crossref","unstructured":"Szegedy, C., Liu, W., Jia, Y., Sermanet, P., Reed, S., Anguelov, D., Erhan, D., Vanhoucke, V., Rabinovich, A.: Going deeper with convolutions. In: IEEE Conference on Computer Vision and Pattern Recognition, pp. 1\u20139 (2015)","DOI":"10.1109\/CVPR.2015.7298594"},{"key":"548_CR40","doi-asserted-by":"crossref","unstructured":"Szegedy, C., Vanhoucke, V., Ioffe, S., Shlens, J., Wojna, Z.: Rethinking the inception architecture for computer vision. In: IEEE Conference on Computer Vision and Pattern Recognition, pp. 2818\u20132826 (2016)","DOI":"10.1109\/CVPR.2016.308"},{"key":"548_CR41","unstructured":"Takahashi, N., Gygli, M., Gool, L.V.: AENet: Learning deep audio features for video analysis. CoRR arXiv: 1701.00599 (2017)"},{"key":"548_CR42","doi-asserted-by":"crossref","unstructured":"Tian, H., Chen, S.C.: MCA-NN: Multiple correspondence analysis based neural network for disaster information detection. In: IEEE International Conference on Multimedia Big Data, pp. 268\u2013275 (2017)","DOI":"10.1109\/BigMM.2017.30"},{"key":"548_CR43","doi-asserted-by":"crossref","unstructured":"Tian, H., Chen, S.C.: A video-aided semantic analytics system for disaster information integration. In: IEEE International Conference on Multimedia Big Data, pp. 242\u2013243 (2017)","DOI":"10.1109\/BigMM.2017.31"},{"issue":"3","key":"548_CR44","doi-asserted-by":"publisher","first-page":"93","DOI":"10.1109\/MMUL.2015.61","volume":"22","author":"Y Tian","year":"2015","unstructured":"Tian, Y., Chen, S.C., Shyu, M.L., Huang, T., Sheu, P., Del Bimbo, A.: Multimedia big data. IEEE MultiMedia 22(3), 93\u201395 (2015)","journal-title":"IEEE MultiMedia"},{"key":"548_CR45","doi-asserted-by":"crossref","unstructured":"Tian, H., Chen, S.C., Rubin, S.H., Grefe, W.K.: FA-MCADF: Feature affinity based multiple correspondence analysis and decision fusion framework for disaster information management. In: IEEE International Conference on Information Reuse and Integration, pp. 198\u2013206 (2017)","DOI":"10.1109\/IRI.2017.20"},{"key":"548_CR46","doi-asserted-by":"crossref","unstructured":"Vosoughi, S., Vijayaraghavan, P., Roy, D.: Tweet2vec: learning tweet embeddings using character-level CNN-LSTM encoder-decoder. In: International ACM SIGIR Conference on Research and Development in Information Retrieval, pp. 1041\u20131044. ACM (2016)","DOI":"10.1145\/2911451.2914762"},{"key":"548_CR47","doi-asserted-by":"publisher","first-page":"70","DOI":"10.1016\/j.neucom.2015.06.112","volume":"204","author":"H Xue","year":"2016","unstructured":"Xue, H., Liu, Y., Cai, D., He, X.: Tracking people in rgbd videos using deep learning and motion clues. Neurocomputing 204, 70\u201376 (2016)","journal-title":"Neurocomputing"},{"key":"548_CR48","doi-asserted-by":"crossref","unstructured":"Yan, Y., Zhu, Q., Shyu, M.L., Chen, S.C.: Classifier fusion by judgers on spark clusters for multimedia big data classification Qual. Softw. Through Reuse Integr., pp. 91\u2013108. Springer, Cham (2016)","DOI":"10.1007\/978-3-319-56157-8_5"},{"key":"548_CR49","doi-asserted-by":"crossref","unstructured":"Yang, Y., Lu, W., Domack, J., Li, T., Chen, S.C., Luis, S., Navlakha, J.K.: MADIS: A multimedia-aided disaster information integration system for emergency management. In: International Conference on Collaborative Computing: Networking, Applications and Worksharing, pp. 233\u2013241. IEEE (2012)","DOI":"10.4108\/icst.collaboratecom.2012.250525"},{"key":"548_CR50","doi-asserted-by":"crossref","unstructured":"Yang, Y., Pouyanfar, S., Tian, H., Chen, M., Chen, S.C., Shyu, M.L.: IF-MCA: Importance factor-based multiple correspondence analysis for multimedia data analytics. IEEE Transactions on Multimedia (2017)","DOI":"10.1109\/TMM.2017.2760623"},{"issue":"3","key":"548_CR51","doi-asserted-by":"publisher","first-page":"856","DOI":"10.1016\/j.neuroimage.2011.01.008","volume":"55","author":"D Zhang","year":"2011","unstructured":"Zhang, D., Wang, Y., Zhou, L., Yuan, H., Shen, D.: Multimodal classification of Alzheimer\u2019s disease and mild cognitive impairment. Neuroimage 55(3), 856\u2013867 (2011)","journal-title":"Neuroimage"}],"container-title":["World Wide Web"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11280-018-0548-3.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s11280-018-0548-3\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11280-018-0548-3.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,7,4]],"date-time":"2025-07-04T02:32:28Z","timestamp":1751596348000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s11280-018-0548-3"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2018,5,3]]},"references-count":51,"journal-issue":{"issue":"3","published-print":{"date-parts":[[2019,5]]}},"alternative-id":["548"],"URL":"https:\/\/doi.org\/10.1007\/s11280-018-0548-3","relation":{},"ISSN":["1386-145X","1573-1413"],"issn-type":[{"value":"1386-145X","type":"print"},{"value":"1573-1413","type":"electronic"}],"subject":[],"published":{"date-parts":[[2018,5,3]]},"assertion":[{"value":"15 December 2017","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"9 March 2018","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"15 March 2018","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"3 May 2018","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}