{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,10,27]],"date-time":"2025-10-27T16:23:53Z","timestamp":1761582233419,"version":"3.37.3"},"reference-count":52,"publisher":"Springer Science and Business Media LLC","issue":"2","license":[{"start":{"date-parts":[[2022,11,9]],"date-time":"2022-11-09T00:00:00Z","timestamp":1667952000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2022,11,9]],"date-time":"2022-11-09T00:00:00Z","timestamp":1667952000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Knowl Inf Syst"],"published-print":{"date-parts":[[2023,2]]},"DOI":"10.1007\/s10115-022-01775-5","type":"journal-article","created":{"date-parts":[[2022,11,9]],"date-time":"2022-11-09T19:11:25Z","timestamp":1668021085000},"page":"921-943","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":4,"title":["Bold driver and static restart fused adaptive momentum for visual question answering"],"prefix":"10.1007","volume":"65","author":[{"given":"Shengdong","family":"Li","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Chuanwen","family":"Luo","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8540-4586","authenticated-orcid":false,"given":"Yuqing","family":"Zhu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Weili","family":"Wu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2022,11,9]]},"reference":[{"key":"1775_CR1","doi-asserted-by":"crossref","unstructured":"Anderson P, He X, Buehler C et\u00a0al (2018) Bottom-up and top-down attention for image captioning and visual question answering. In: CVPR 2018, pp 6077\u20136086. Salt Lake City, USA","DOI":"10.1109\/CVPR.2018.00636"},{"key":"1775_CR2","doi-asserted-by":"crossref","unstructured":"Antol S, Agrawal A, Lu J et\u00a0al (2015) Vqa: visual question answering. In: ICCV 2015, pp 4\u201331. Santiago, Chile","DOI":"10.1109\/ICCV.2015.279"},{"key":"1775_CR3","unstructured":"Behera A, Wharton Z, Hewage P et\u00a0al (2021) Context-aware attentional pooling (CAP) for fine-grained visual classification. In: AAAI 2021, pp 1\u201317. New York, USA"},{"key":"1775_CR4","doi-asserted-by":"crossref","unstructured":"Belinkov Y, Durrani N, Dalvi F et\u00a0al (2017) What do neural machine translation models learn about morphology. In: ACL 2017, pp 861\u2013872. Vancouver, Canada","DOI":"10.18653\/v1\/P17-1080"},{"key":"1775_CR5","doi-asserted-by":"crossref","unstructured":"Ben-Younes H, Cadene R, Cord M et\u00a0al (2017) Mutan: multimodal tucker fusion for visual question answering. In: ICCV 2017, pp 2631\u2013263. Venice, Italy","DOI":"10.1109\/ICCV.2017.285"},{"key":"1775_CR6","doi-asserted-by":"crossref","unstructured":"Ben-Younes H, Cadene R, Thome N et\u00a0al (2019) Block: bilinear superdiagonal fusion for visual question answering and visual relationship detection. In: AAAI 2019, pp 8102\u20138109. Honolulu, USA","DOI":"10.1609\/aaai.v33i01.33018102"},{"key":"1775_CR7","first-page":"227","volume":"68","author":"JS Bridle","year":"1989","unstructured":"Bridle JS (1989) Probabilistic interpretation of feedforward classification network outputs, with relationships to statistical pattern recognition. Neurocomputing 68:227\u2013236","journal-title":"Neurocomputing"},{"key":"1775_CR8","doi-asserted-by":"crossref","unstructured":"Cadene R, Ben-Younes H, Cord M et\u00a0al (2019) Murel: multimodal relational reasoning for visual question answering. In: CVPR 2019, pp 1989\u20131998. Long Beach, USA","DOI":"10.1109\/CVPR.2019.00209"},{"key":"1775_CR9","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2021.3135655","author":"J Cao","year":"2022","unstructured":"Cao J, Qin X, Zhao S et al (2022) Bilateral cross-modality graph matching attention for feature fusion in visual question answering. IEEE Trans Neural Netw Learn Syst. https:\/\/doi.org\/10.1109\/TNNLS.2021.3135655","journal-title":"IEEE Trans Neural Netw Learn Syst"},{"key":"1775_CR10","doi-asserted-by":"publisher","DOI":"10.3115\/v1\/W14-4012","author":"K Cho","year":"2014","unstructured":"Cho K, Merrienboer BV, Bahdanau D et al (2014) On the properties of neural machine translation: encoder-decoder approaches. Comput Sci. https:\/\/doi.org\/10.3115\/v1\/W14-4012","journal-title":"Comput Sci"},{"issue":"3","key":"1775_CR11","doi-asserted-by":"publisher","first-page":"715","DOI":"10.1007\/s10208-013-9150-3","volume":"15","author":"BO Donoghue","year":"2015","unstructured":"Donoghue BO, Candes E (2015) Adaptive restart for accelerated gradient schemes. Found Comput Math 15(3):715\u2013732","journal-title":"Found Comput Math"},{"key":"1775_CR12","doi-asserted-by":"crossref","unstructured":"Gao P, Jiang Z, You H et\u00a0al (2019) Dynamic fusion with intra- and inter-modality attention flow for visual question answering. In: CVPR 2019, pp 4321\u20134330. Long Beach, USA","DOI":"10.1109\/CVPR.2019.00680"},{"key":"1775_CR13","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2021.3104937","author":"D Guo","year":"2022","unstructured":"Guo D, Xu C, Tao D (2022) Bilinear graph networks for visual question answering. IEEE Trans Neural Netw Learn Syst. https:\/\/doi.org\/10.1109\/TNNLS.2021.3104937","journal-title":"IEEE Trans Neural Netw Learn Syst"},{"key":"1775_CR14","doi-asserted-by":"crossref","unstructured":"He K, Zhang X, Ren S et\u00a0al (2016) Deep residual learning for image recognition. In: CVPR 2016, pp 770\u2013778. Las Vegas, USA","DOI":"10.1109\/CVPR.2016.90"},{"issue":"8","key":"1775_CR15","doi-asserted-by":"publisher","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","volume":"9","author":"S Hochreiter","year":"1997","unstructured":"Hochreiter S, Schmidhuber J (1997) Long short-term memory. Neural Comput 9(8):1735\u20131780","journal-title":"Neural Comput"},{"key":"1775_CR16","doi-asserted-by":"crossref","unstructured":"Hu R, Andreas J, Rohrbach M et\u00a0al (2017) Learning to reason: end-to-end module networks for visual question answering. In: ICCV 2017, pp 804\u2013813. Venice, Italy","DOI":"10.1109\/ICCV.2017.93"},{"key":"1775_CR17","doi-asserted-by":"publisher","first-page":"3","DOI":"10.1016\/j.cviu.2017.06.005","volume":"163","author":"K Kafle","year":"2017","unstructured":"Kafle K, Kanan C (2017) Visual question answering: datasets, algorithms, and future challenges. Comput Vis Image Underst 163:3\u201320","journal-title":"Comput Vis Image Underst"},{"key":"1775_CR18","unstructured":"Kim JH, Jun J, Zhang BT (2018) Bilinear attention networks. In: NeurIPS 2018, pp 1571\u20131581. Montreal, Canada"},{"key":"1775_CR19","unstructured":"Kim JH, Lee SW, Kwak DH et\u00a0al (2016) Multimodal residual learning for visual QA. In: NeurIPS 2016, pp 361\u2013369. Barcelona, Spain"},{"key":"1775_CR20","unstructured":"Kingma DP, Ba J (2015) Adam: a method for stochastic optimization. In: ICLR 2015, pp 1\u201315. Santiago, Chile"},{"key":"1775_CR21","unstructured":"Krizhevsky A (2009) Learning multiple layers of features from tiny images. Master\u2019s thesis, University of Toronto, Toronto, Canada. http:\/\/www.cs.toronto.edu\/~kriz\/learning-features-2009-TR.pdf"},{"key":"1775_CR22","unstructured":"Krizhevsky A (2013) the cifar-10 and cifar-100 datasets. http:\/\/www.cs.toronto.edu\/~kriz\/cifar.html"},{"key":"1775_CR23","unstructured":"Krizhevsky A, Sutskever I, Hinton GE (2012) Imagenet classification with deep convolutional neural networks. In: NeurIPS 2012, pp 1097\u20131105. Lake Tahoe, USA"},{"issue":"11","key":"1775_CR24","doi-asserted-by":"publisher","first-page":"2278","DOI":"10.1109\/5.726791","volume":"86","author":"Y Lecun","year":"1998","unstructured":"Lecun Y, Bottou L (1998) Gradient-based learning applied to document recognition. Proc IEEE 86(11):2278\u20132324","journal-title":"Proc IEEE"},{"key":"1775_CR25","unstructured":"Li G, Su H, Zhu W (2017) Incorporating external knowledge to answer open-domain visual questions with dynamic memory networks. In: CVPR 2017. Honolulu, USA. arXiv:1712.00733v1"},{"key":"1775_CR26","doi-asserted-by":"crossref","unstructured":"Li G, Wang X, Zhu W (2020) Boosting visual question answering with context-aware knowledge aggregation. In: ACM MM 2020, pp 1227\u20131235. Seattle, USA","DOI":"10.1145\/3394171.3413943"},{"key":"1775_CR27","doi-asserted-by":"crossref","unstructured":"Li S, Lv X (2019) Momentum based on adaptive bold driver. In: ICME 2019, pp 1828\u20131833. Shanghai, China","DOI":"10.1109\/ICME.2019.00314"},{"issue":"5","key":"1775_CR28","first-page":"1092","volume":"56","author":"S Li","year":"2019","unstructured":"Li S, Lv X (2019) Static restart stochastic gradient descent algorithm based on image question answering. J Comput Res Develop 56(5):1092\u20131100","journal-title":"J Comput Res Develop"},{"key":"1775_CR29","unstructured":"Loshchilov I, Hutter F (2017) Sgdr: stochastic gradient descent with warm restarts. In: ICLR 2017, pp 1\u201316. Toulon, France"},{"key":"1775_CR30","doi-asserted-by":"crossref","unstructured":"Ma L, Lu Z, Li H (2016) Learning to answer questions from image using convolutional neural network. In: AAAI 2016, pp 3567\u20133573. Phoenix, USA","DOI":"10.1609\/aaai.v30i1.10442"},{"key":"1775_CR31","doi-asserted-by":"crossref","unstructured":"Niu Y, Tang K, Zhang H et\u00a0al (2021) Counterfactual vqa: A cause-effect look at language bias. In: CVPR 2021, pp 12700\u201312710. Online","DOI":"10.1109\/CVPR46437.2021.01251"},{"key":"1775_CR32","unstructured":"Orr G, Schraudolph N, Cummins F (2016) Momentum and learning rate adaptation. http:\/\/www.willamette.edu\/~gorr\/classes\/cs449\/momrate.html"},{"issue":"18","key":"1775_CR33","first-page":"1","volume":"12","author":"N Ouyang","year":"2020","unstructured":"Ouyang N, Huang Q, Li P et al (2020) Suppressing biased samples for robust vqa. IEEE Trans Multimed 12(18):1\u201312","journal-title":"IEEE Trans Multimed"},{"issue":"4","key":"1775_CR34","first-page":"1644","volume":"34","author":"L Peng","year":"2022","unstructured":"Peng L, Yang Y, Zhang X et al (2022) Answer again: Improving vqa with cascaded-answering model. IEEE Trans Knowl Data Eng 34(4):1644\u20131655","journal-title":"IEEE Trans Knowl Data Eng"},{"issue":"5","key":"1775_CR35","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1016\/0041-5553(64)90137-5","volume":"4","author":"BT Polyak","year":"1964","unstructured":"Polyak BT (1964) Some methods of speeding up the convergence of iteration methods. USSR Comput Math Math Phys 4(5):1\u201317","journal-title":"USSR Comput Math Math Phys"},{"issue":"1","key":"1775_CR36","first-page":"241","volume":"12","author":"MJD Powell","year":"1977","unstructured":"Powell MJD (1977) Restart procedures for the conjugate gradient method. IEEE Trans Multimed 12(1):241\u2013254","journal-title":"IEEE Trans Multimed"},{"issue":"1","key":"1775_CR37","doi-asserted-by":"publisher","first-page":"145","DOI":"10.1016\/S0893-6080(98)00116-6","volume":"12","author":"N Qian","year":"1999","unstructured":"Qian N (1999) On the momentum term in gradient descent learning algorithms. Neural Netw 12(1):145\u2013151","journal-title":"Neural Netw"},{"key":"1775_CR38","unstructured":"Ren M, Kiros R, Zemel R (2015) Exploring models and data for image question answering. In: NeurIPS 2015, pp 2953\u20132961. Montreal, Canada"},{"issue":"3","key":"1775_CR39","doi-asserted-by":"publisher","first-page":"400","DOI":"10.1214\/aoms\/1177729586","volume":"22","author":"H Robbins","year":"1951","unstructured":"Robbins H, Monro S (1951) A stochastic approximation method. Ann Math Stat 22(3):400\u2013407","journal-title":"Ann Math Stat"},{"key":"1775_CR40","first-page":"318","volume":"1","author":"DE Rumelhart","year":"1986","unstructured":"Rumelhart DE, Hinton GE, Williams RJ (1986) Learning internal representations by error propagation. Parallel Distrib Porcess Explor Microstruct Cognit 1:318\u2013362","journal-title":"Parallel Distrib Porcess Explor Microstruct Cognit"},{"key":"1775_CR41","unstructured":"Simonyan K, Zisserman A (2015) Very deep convolutional networks for large-scale image recognition. In: ICLR 2015, pp 1\u201314. Santiago, Chile"},{"key":"1775_CR42","unstructured":"Sutskever I, Martens J, Dahl G et\u00a0al (2013) On the importance of initialization and momentum in deep learning. In: ICML 2013, pp 1139\u20131147. Atlanta, USA"},{"key":"1775_CR43","doi-asserted-by":"crossref","unstructured":"Szegedy C, Liu W, Jia Y et\u00a0al (2015) Going deeper with convolutions. In: CVPR 2015, pp 1\u20139. Boston, USA","DOI":"10.1109\/CVPR.2015.7298594"},{"issue":"2","key":"1775_CR44","first-page":"26","volume":"4","author":"T Tieleman","year":"2012","unstructured":"Tieleman T, Hinton GE (2012) Lecture 6.5-rmsprop: divide the gradient by a running average of its recent magnitude. COURSERA Neural Netw Mach Learn 4(2):26\u201331","journal-title":"COURSERA Neural Netw Mach Learn"},{"issue":"10","key":"1775_CR45","doi-asserted-by":"publisher","first-page":"2413","DOI":"10.1109\/TPAMI.2017.2754246","volume":"40","author":"P Wang","year":"2018","unstructured":"Wang P, Wu Q, Shen C et al (2018) Fvqa: fact-based visual question answering. IEEE Trans Pattern Anal Mach Intell 40(10):2413\u20132427","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"issue":"12","key":"1775_CR46","doi-asserted-by":"publisher","first-page":"1342","DOI":"10.1109\/34.735807","volume":"20","author":"C Williams","year":"1999","unstructured":"Williams C, Barber D (1999) Bayesian classification with gaussian processes. IEEE Trans Pattern Anal Mach Intell 20(12):1342\u20131351","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"1775_CR47","doi-asserted-by":"crossref","unstructured":"Wu C, Liu J, Wang X et\u00a0al (2019) Differential networks for visual question answering. In: AAAI 2019, pp 8997\u20139004. Honolulu, USA","DOI":"10.1609\/aaai.v33i01.33018997"},{"key":"1775_CR48","doi-asserted-by":"publisher","first-page":"21","DOI":"10.1016\/j.cviu.2017.05.001","volume":"163","author":"Q Wu","year":"2017","unstructured":"Wu Q, Teney D, Wang P et al (2017) Visual question answering: a survey of methods and datasets. Comput Vis Image Underst 163:21\u201341","journal-title":"Comput Vis Image Underst"},{"key":"1775_CR49","doi-asserted-by":"crossref","unstructured":"Yang Z, He X, Gao J et\u00a0al (2016) Stacked attention networks for image question answering. In: CVPR 2016, pp 21\u201329. Las Vegas, USA","DOI":"10.1109\/CVPR.2016.10"},{"key":"1775_CR50","doi-asserted-by":"crossref","unstructured":"Yu Z, Yu J, Cui Y et\u00a0al (2019) Deep modular co-attention networks for visual question answering. In: CVPR 2019, pp 6282\u20136290. Long Beach, USA","DOI":"10.1109\/CVPR.2019.00644"},{"key":"1775_CR51","doi-asserted-by":"crossref","unstructured":"Yu Z, Yu J, Fan J et\u00a0al (2017) Multi-modal factorized bilinear pooling with co-attention learning for visual question answering. In: ICCV 2017. Venice, Italy. arXiv:1708.01471v1","DOI":"10.1109\/ICCV.2017.202"},{"key":"1775_CR52","unstructured":"Zeiler MD (2012) Adadelta: an adaptive learning rate method. arXiv:1212.5701v1"}],"container-title":["Knowledge and Information Systems"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10115-022-01775-5.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s10115-022-01775-5\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10115-022-01775-5.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,1,19]],"date-time":"2023-01-19T19:46:14Z","timestamp":1674157574000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s10115-022-01775-5"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022,11,9]]},"references-count":52,"journal-issue":{"issue":"2","published-print":{"date-parts":[[2023,2]]}},"alternative-id":["1775"],"URL":"https:\/\/doi.org\/10.1007\/s10115-022-01775-5","relation":{},"ISSN":["0219-1377","0219-3116"],"issn-type":[{"type":"print","value":"0219-1377"},{"type":"electronic","value":"0219-3116"}],"subject":[],"published":{"date-parts":[[2022,11,9]]},"assertion":[{"value":"19 July 2021","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"5 October 2022","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"9 October 2022","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"9 November 2022","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}