{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,24]],"date-time":"2026-06-24T11:38:09Z","timestamp":1782301089751,"version":"3.54.5"},"reference-count":43,"publisher":"Springer Science and Business Media LLC","issue":"8","license":[{"start":{"date-parts":[[2022,8,10]],"date-time":"2022-08-10T00:00:00Z","timestamp":1660089600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2022,8,10]],"date-time":"2022-08-10T00:00:00Z","timestamp":1660089600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["No.61802253"],"award-info":[{"award-number":["No.61802253"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Appl Intell"],"published-print":{"date-parts":[[2023,4]]},"DOI":"10.1007\/s10489-022-04022-0","type":"journal-article","created":{"date-parts":[[2022,8,10]],"date-time":"2022-08-10T04:02:49Z","timestamp":1660104169000},"page":"9621-9633","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":4,"title":["Transformer networks with adaptive inference for scene graph generation"],"prefix":"10.1007","volume":"53","author":[{"given":"Yini","family":"Wang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yongbin","family":"Gao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Wenjun","family":"Yu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ruyan","family":"Guo","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Weibing","family":"Wan","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shuqun","family":"Yang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Bo","family":"Huang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2022,8,10]]},"reference":[{"key":"4022_CR1","doi-asserted-by":"crossref","unstructured":"Yao T, Pan Y, Li Y, Mei T (2018) Exploring visual relationship for image captioning, pp 684\u2013699","DOI":"10.1007\/978-3-030-01264-9_42"},{"key":"4022_CR2","doi-asserted-by":"crossref","unstructured":"Gao L, Wang B, Wang W (2018) Image captioning with scene-graph based semantic concepts. In: Proceedings of the 2018 10th international conference on machine learning and computing, pp 225\u2013229","DOI":"10.1145\/3195106.3195114"},{"key":"4022_CR3","doi-asserted-by":"crossref","unstructured":"Armeni I, He Z-Y, Gwak JY, Zamir AR, Fischer M, Malik J, Savarese S (2019) 3d Scene graph: A structure for unified semantics, 3d space, and camera. In: Proceedings of the IEEE\/CVF international conference on computer vision, pp 5664\u20135673","DOI":"10.1109\/ICCV.2019.00576"},{"key":"4022_CR4","unstructured":"Chaoyi Z, Yu J, Song Y, Cai W (2021) Exploiting edge-oriented reasoning for 3d point-based scene graph analysis. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 9705\u20139715"},{"issue":"6","key":"4022_CR5","doi-asserted-by":"publisher","first-page":"1137","DOI":"10.1109\/TPAMI.2016.2577031","volume":"39","author":"S Ren","year":"2016","unstructured":"Ren S, He K, Girshick R , Sun J (2016) Faster r-cnn: towards real-time object detection with region proposal networks. IEEE Trans Pattern Anal Mach Intell 39(6):1137\u20131149","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"4022_CR6","doi-asserted-by":"crossref","unstructured":"Dai X, Chen Y, Xiao B, Chen D, Liu M, Yuan L, Zhang L (2021) Dynamic head: Unifying object detection heads with attentions. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 7373\u20137382","DOI":"10.1109\/CVPR46437.2021.00729"},{"key":"4022_CR7","doi-asserted-by":"crossref","unstructured":"Zou C, Wang B, Hu Y, Liu J, Wu Q, Zhao Y, Li B, Zhang C, Zhang C, Wei Y et al (2021) End-to-end human object interaction detection with hoi transformer. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 11825\u201311834","DOI":"10.1109\/CVPR46437.2021.01165"},{"key":"4022_CR8","doi-asserted-by":"crossref","unstructured":"Wang T, Yang T, Danelljan M, Khan FS, Zhang X, Su J (2020) Learning human-object interaction detection using interaction. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 4116\u20134125","DOI":"10.1109\/CVPR42600.2020.00417"},{"key":"4022_CR9","doi-asserted-by":"publisher","first-page":"233","DOI":"10.1016\/j.eswa.2018.03.056","volume":"105","author":"HF Nweke","year":"2018","unstructured":"Nweke HF, Teh YW, Al-Garadi MA, Alo UR (2018) Deep learning algorithms for human activity recognition using mobile and wearable sensor networks: State of the art and research challenges. Expert Syst Appl 105:233\u2013261","journal-title":"Expert Syst Appl"},{"issue":"4","key":"4022_CR10","first-page":"1","volume":"54","author":"K Chen","year":"2021","unstructured":"Chen K, Zhang D, Yao L, Guo B, Yu Z (2021) Deep learning for sensor-based human activity recognition: Overview, challenges, and opportunities. ACM Comput Surv (CSUR) 54(4):1\u201340","journal-title":"ACM Comput Surv (CSUR)"},{"key":"4022_CR11","doi-asserted-by":"crossref","unstructured":"Zellers R, Yatskar M, Thomson S (2018) Neural motifs: Scene graph parsing with global context, pp 5831\u20135840","DOI":"10.1109\/CVPR.2018.00611"},{"key":"4022_CR12","doi-asserted-by":"crossref","unstructured":"Chen L, Zhang H, Xiao J, He X, Pu S, Chang S (2019) Counterfactual critic multi-agent training for scene graph generation. In: Proceedings of the IEEE\/CVF international conference on computer vision, pp 4613\u20134623","DOI":"10.1109\/ICCV.2019.00471"},{"key":"4022_CR13","unstructured":"Woo S, Kim D, Cho D, Kweon IS (2018) Linknet: Relational embedding for scene graph. Adv Neural Inf Process, Syst, 31,2018"},{"key":"4022_CR14","unstructured":"Vaswani A, Shazeer N, Parmar N, Uszkoreit J, Jones L, Gomez AN, Kaiser L, Polosukhin I (2017) Attention is all you need. arXiv:1706.03762"},{"issue":"6","key":"4022_CR15","doi-asserted-by":"publisher","first-page":"1245","DOI":"10.1109\/TMM.2017.2648498","volume":"19","author":"B Zhao","year":"2017","unstructured":"Zhao B, Wu X, Feng J, Peng Q, Yan S (2017) Diversified visual attention networks for fine-grained object classification. IEEE Trans Multimedia 19(6):1245\u20131256","journal-title":"IEEE Trans Multimedia"},{"key":"4022_CR16","unstructured":"Xiao T, Xu Y, Yang K, Zhang J, Peng Y, Zhang Z (2015) The application of two-level attention models in deep convolutional neural network for fine-grained image classification, pp 842\u2013 850"},{"key":"4022_CR17","doi-asserted-by":"crossref","unstructured":"Kolesnikov A, Kuznetsova A, Lampert C, Ferrari V (2019) Detecting visual relationships using box. In: Proceedings of the IEEE\/CVF international conference on computer vision workshops, pp 0\u20130","DOI":"10.1109\/ICCVW.2019.00217"},{"key":"4022_CR18","doi-asserted-by":"crossref","unstructured":"Yang J, Lu J, Lee S, Batra D, Parikh D (2018) Graph r-cnn for scene graph generation, pp 670\u2013685","DOI":"10.1007\/978-3-030-01246-5_41"},{"key":"4022_CR19","doi-asserted-by":"crossref","unstructured":"Liu A-A, Tian H, Xu N, Nie W, Zhang Y, Kankanhalli M (2021) Toward region-aware attention learning for scene graph generation. IEEE Trans Neural Netw Learn Syst","DOI":"10.1109\/TNNLS.2021.3086066"},{"key":"4022_CR20","doi-asserted-by":"crossref","unstructured":"Xu D, Zhu Y, Choy CB, Fei-Fei L (2017) Scene graph generation by iterative message passing, pp 5410\u20135419","DOI":"10.1109\/CVPR.2017.330"},{"key":"4022_CR21","doi-asserted-by":"crossref","unstructured":"Li Y, Ouyang W, Zhou B, Wang K, Wang X (2017) Scene graph generation from objects, phrases and region captions, pp 1261\u20131270","DOI":"10.1109\/ICCV.2017.142"},{"key":"4022_CR22","doi-asserted-by":"crossref","unstructured":"Dai B, Zhang Y, Lin D (2017) Detecting visual relationships with deep relational networks, pp 3076\u20133086","DOI":"10.1109\/CVPR.2017.352"},{"key":"4022_CR23","doi-asserted-by":"crossref","unstructured":"Lin X, Ding C, Zeng J, Tao D (2020) Gps-net: Graph property sensing network for scene graph generation, pp 3746\u20133753","DOI":"10.1109\/CVPR42600.2020.00380"},{"key":"4022_CR24","unstructured":"Herzig R, Raboh M, Chechik G, Berant J, Globerson A (2018) Mapping images to scene graphs with permutation-invariant structured prediction. Adv Neural Inf Process Syst, 31, 2018"},{"key":"4022_CR25","doi-asserted-by":"crossref","unstructured":"Tang K, Zhang H, Wu B, Luo W, Liu W (2019) Learning to compose dynamic tree structures for visual contexts, pp 6619\u20136628","DOI":"10.1109\/CVPR.2019.00678"},{"key":"4022_CR26","doi-asserted-by":"crossref","unstructured":"Chen T, Yu W, Chen R, Lin L (2019) Knowledge-embedded routing network for scene graph generation, pp 6163\u20136171","DOI":"10.1109\/CVPR.2019.00632"},{"key":"4022_CR27","doi-asserted-by":"crossref","unstructured":"Zhang J, Shih KJ, Elgammal A, Tao A, Catanzaro B (2019) Graphical contrastive losses for scene graph parsing, pp 11535\u201311543","DOI":"10.1109\/CVPR.2019.01180"},{"key":"4022_CR28","doi-asserted-by":"crossref","unstructured":"Lu Y, Rai H, Chang J, Knyazev B, Yu G, Shekhar S, Taylor GW, Volkovs M (2021) Context-aware scene graph generation with seq2seq transformers. In: Proceedings of the IEEE\/CVF international conference on computer vision, pp 15931\u201315941","DOI":"10.1109\/ICCV48922.2021.01563"},{"key":"4022_CR29","unstructured":"Lafferty J, McCallum A, Pereira FCN (2001) Conditional random fields: Probabilistic models for segmenting and labeling sequence data"},{"key":"4022_CR30","doi-asserted-by":"crossref","unstructured":"Tang K, Niu Y, Huang J, Shi J, Zhang H (2020) Unbiased scene graph generation from biased training","DOI":"10.1109\/CVPR42600.2020.00377"},{"key":"4022_CR31","doi-asserted-by":"crossref","unstructured":"Guo Y, Gao L, Wang X, Hu Y, Xing X u, Xu L u, Shen Heng Tao (2021) From general to informative scene graph generation via balance adjustment. In: Proceedings of the IEEE\/CVF international conference on computer vision, pp 16383\u201316392","DOI":"10.1109\/ICCV48922.2021.01607"},{"key":"4022_CR32","doi-asserted-by":"crossref","unstructured":"Xie S, Girshick R, Doll\u00e1r P, Tu Z, He K (2017) Aggregated residual transformations for deep neural networks, pp 1492\u20131500","DOI":"10.1109\/CVPR.2017.634"},{"key":"4022_CR33","doi-asserted-by":"crossref","unstructured":"Lin TY, Doll\u00e1r P, Girshick R, He K, Hariharan B, Belongie S (2017) Feature pyramid networks for object detection, pp 2117\u20132125","DOI":"10.1109\/CVPR.2017.106"},{"key":"4022_CR34","unstructured":"Zhang Y, Hare J, Pr\u00fcgel-Bennett A (2018) Learning to count objects in natural images for visual question answering. arXiv:1802.05766"},{"issue":"1","key":"4022_CR35","doi-asserted-by":"publisher","first-page":"32","DOI":"10.1007\/s11263-016-0981-7","volume":"123","author":"R Krishna","year":"2017","unstructured":"Krishna R, Zhu Y, Groth O, Johnson J, Hata K , Kravitz J, Chen S, Kalantidis Y, Li LJ, Shamma DA et al (2017) Visual genome: Connecting language and vision using crowdsourced dense image annotations. Int J Comput Vis 123(1):32\u201373","journal-title":"Int J Comput Vis"},{"issue":"7","key":"4022_CR36","doi-asserted-by":"publisher","first-page":"1956","DOI":"10.1007\/s11263-020-01316-z","volume":"128","author":"A Kuznetsova","year":"2020","unstructured":"Kuznetsova A, Rom H, Alldrin N, Uijlings J, Krasin I, Pont-Tuset J, Kamali S, Popov S, Malloci M, Kolesnikov A et al (2020) The open images dataset v4. Int J Comput Vis 128 (7):1956\u20131981","journal-title":"Int J Comput Vis"},{"key":"4022_CR37","doi-asserted-by":"crossref","unstructured":"Lu C, Krishna R, Bernstein M, Fei-Fei L (2016) Visual relationship detection with language priors. pp 852\u2013869. Springer","DOI":"10.1007\/978-3-319-46448-0_51"},{"key":"4022_CR38","doi-asserted-by":"crossref","unstructured":"Pennington J, Socher R, Christopher DM (2014) Glove: Global vectors for word representation, pp 1532\u20131543","DOI":"10.3115\/v1\/D14-1162"},{"key":"4022_CR39","unstructured":"Newell A, Deng J (2017)"},{"key":"4022_CR40","doi-asserted-by":"publisher","first-page":"108367","DOI":"10.1016\/j.patcog.2021.108367","volume":"123","author":"H Zhou","year":"2022","unstructured":"Zhou H, Yang Y, Luo T, Zhang J, Li S (2022) A unified deep sparse graph attention network for scene graph generation. Pattern Recognit 123:108367","journal-title":"Pattern Recognit"},{"key":"4022_CR41","doi-asserted-by":"crossref","unstructured":"Li Y, Ouyang W, Wang X (2017) Vip-cnn: A visual phrase reasoning convolutional neural network for visual relationship detection 2, 2017. arXiv:1702.07191","DOI":"10.1109\/CVPR.2017.766"},{"key":"4022_CR42","doi-asserted-by":"crossref","unstructured":"Zhang H, Kyaw Z, Chang SF, Chua TS (2017) Visual translation embedding network for visual relation detection, pp 5532\u20135540","DOI":"10.1109\/CVPR.2017.331"},{"key":"4022_CR43","doi-asserted-by":"crossref","unstructured":"Liang X, Lee L, Xing EP (2017) Deep variation-structured reinforcement learning for visual relationship and attribute detection, pp 848\u2013857","DOI":"10.1109\/CVPR.2017.469"}],"container-title":["Applied Intelligence"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10489-022-04022-0.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s10489-022-04022-0\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10489-022-04022-0.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,4,30]],"date-time":"2023-04-30T09:28:19Z","timestamp":1682846899000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s10489-022-04022-0"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022,8,10]]},"references-count":43,"journal-issue":{"issue":"8","published-print":{"date-parts":[[2023,4]]}},"alternative-id":["4022"],"URL":"https:\/\/doi.org\/10.1007\/s10489-022-04022-0","relation":{},"ISSN":["0924-669X","1573-7497"],"issn-type":[{"value":"0924-669X","type":"print"},{"value":"1573-7497","type":"electronic"}],"subject":[],"published":{"date-parts":[[2022,8,10]]},"assertion":[{"value":"20 July 2022","order":1,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"10 August 2022","order":2,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}