{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,3,26]],"date-time":"2025-03-26T11:10:23Z","timestamp":1742987423287,"version":"3.40.3"},"publisher-location":"Singapore","reference-count":45,"publisher":"Springer Nature Singapore","isbn-type":[{"type":"print","value":"9789819785100"},{"type":"electronic","value":"9789819785117"}],"license":[{"start":{"date-parts":[[2024,11,3]],"date-time":"2024-11-03T00:00:00Z","timestamp":1730592000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,11,3]],"date-time":"2024-11-03T00:00:00Z","timestamp":1730592000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-981-97-8511-7_15","type":"book-chapter","created":{"date-parts":[[2024,11,2]],"date-time":"2024-11-02T05:02:28Z","timestamp":1730523748000},"page":"201-215","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["OCR-Aware Scene Graph Generation Via\u00a0Multi-modal Object Representation Enhancement and\u00a0Logical Bias Learning"],"prefix":"10.1007","author":[{"given":"Xinyu","family":"Zhou","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zihan","family":"Ji","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Anna","family":"Zhu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2024,11,3]]},"reference":[{"doi-asserted-by":"crossref","unstructured":"Almaz\u00e1n, J., Gordo, A., Forn\u00e9s, A., Valveny, E.: Word spotting and recognition with embedded attributes. IEEE TPAMI, pp. 2552\u20132566 (2014)","key":"15_CR1","DOI":"10.1109\/TPAMI.2014.2339814"},{"key":"15_CR2","first-page":"135","volume":"5","author":"P Bojanowski","year":"2017","unstructured":"Bojanowski, P., Grave, E., Joulin, A., Mikolov, T.: Enriching word vectors with subword information. Trans. ACL 5, 135\u2013146 (2017)","journal-title":"Trans. ACL"},{"doi-asserted-by":"crossref","unstructured":"Chen, T., Yu, W., Chen, R., Lin, L.: Knowledge-embedded routing network for scene graph generation. In: CVPR (2019)","key":"15_CR3","DOI":"10.1109\/CVPR.2019.00632"},{"issue":"9","key":"15_CR4","doi-asserted-by":"publisher","first-page":"11169","DOI":"10.1109\/TPAMI.2023.3268066","volume":"45","author":"Y Cong","year":"2023","unstructured":"Cong, Y., Yang, M.Y., Rosenhahn, B.: Reltr: relation transformer for scene graph generation. IEEE TPAMI 45(9), 11169\u201311183 (2023)","journal-title":"IEEE TPAMI"},{"doi-asserted-by":"crossref","unstructured":"Dai, J., Qi, H., Xiong, Y., Li, Y., Zhang, G., Hu, H., Wei, Y.: Deformable convolutional networks. In: ICCV (2017)","key":"15_CR5","DOI":"10.1109\/ICCV.2017.89"},{"doi-asserted-by":"crossref","unstructured":"Dess\u00ec, R., Bevilacqua, M., Gualdoni, E., Rakotonirina, N.C., Franzon, F., Baroni, M.: Cross-domain image captioning with discriminative finetuning. In: CVPR (2023)","key":"15_CR6","DOI":"10.1109\/CVPR52729.2023.00670"},{"doi-asserted-by":"crossref","unstructured":"Dong, X., Gan, T., Song, X., Wu, J., Cheng, Y., Nie, L.: Stacked hybrid-attention and group collaborative learning for unbiased scene graph generation. In: CVPR (2022)","key":"15_CR7","DOI":"10.1109\/CVPR52688.2022.01882"},{"doi-asserted-by":"crossref","unstructured":"Gao, D., Li, K., Wang, R., Shan, S., Chen, X.: Multi-modal graph neural network for joint reasoning on vision and scene text. In: CVPR (2020)","key":"15_CR8","DOI":"10.1109\/CVPR42600.2020.01276"},{"unstructured":"Geirhos, R., Rubisch, P., Michaelis, C., Bethge, M., Wichmann, F.A., Brendel, W.: Imagenet-trained CNNS are Biased Towards Texture; Increasing Shape Bias Improves Accuracy and Robustness (2018). arXiv:1811.12231","key":"15_CR9"},{"unstructured":"Glymour, M., Pearl, J., Jewell, N.P.: Causal Inference in Statistics: A Primer. Wiley (2016)","key":"15_CR10"},{"doi-asserted-by":"crossref","unstructured":"Johnson, J., Krishna, R., Stark, M., Li, L.J., Shamma, D., Bernstein, M., Fei-Fei, L.: Image retrieval using scene graphs. In: CVPR (2015)","key":"15_CR11","DOI":"10.1109\/CVPR.2015.7298990"},{"doi-asserted-by":"crossref","unstructured":"Kim, E.S., Kang, W.Y., On, K.W., Heo, Y.J., Zhang, B.T.: Hypergraph attention networks for multimodal learning. In: CVPR (2020)","key":"15_CR12","DOI":"10.1109\/CVPR42600.2020.01459"},{"doi-asserted-by":"crossref","unstructured":"Kirillov, A., Mintun, E., Ravi, N., Mao, H., Rolland, C., Gustafson, L., Xiao, T., Whitehead, S., Berg, A.C., Lo, W.Y. et\u00a0al.: Segment anything. In: ICCV (2023)","key":"15_CR13","DOI":"10.1109\/ICCV51070.2023.00371"},{"key":"15_CR14","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2023.127052","volume":"566","author":"H Li","year":"2024","unstructured":"Li, H., Zhu, G., Zhang, L., Jiang, Y., Dang, Y., Hou, H., Shen, P., Zhao, X., Shah, S.A.A., Bennamoun, M.: Scene graph generation: a comprehensive survey. Neurocomputing 566, 127052 (2024)","journal-title":"Neurocomputing"},{"doi-asserted-by":"crossref","unstructured":"Li, R., Zhang, S., Wan, B., He, X.: Bipartite graph network with adaptive message passing for unbiased scene graph generation. In: CVPR (2021)","key":"15_CR15","DOI":"10.1109\/CVPR46437.2021.01096"},{"doi-asserted-by":"crossref","unstructured":"Li, W., Zhang, H., Bai, Q., Zhao, G., Jiang, N., Yuan, X.: Ppdl: predicate probability distribution based loss for unbiased scene graph generation. In: CVPR (2022)","key":"15_CR16","DOI":"10.1109\/CVPR52688.2022.01884"},{"doi-asserted-by":"crossref","unstructured":"Lin, X., Ding, C., Zhang, J., Zhan, Y., Tao, D.: Ru-net: regularized unrolling network for scene graph generation. In: CVPR (2022)","key":"15_CR17","DOI":"10.1109\/CVPR52688.2022.01885"},{"doi-asserted-by":"crossref","unstructured":"Ma, F., Zhou, Y., Rao, F., Zhang, Y., Sun, X.: Image captioning with multi-context synthetic data. In: AAAI (2024)","key":"15_CR18","DOI":"10.1609\/aaai.v38i5.28203"},{"doi-asserted-by":"crossref","unstructured":"Mafla, A., Rezende, R.S., Gomez, L., Larlus, D., Karatzas, D.: Stacmr: scene-text aware cross-modal retrieval. In: WACV, pp. 2220\u20132230 (2021)","key":"15_CR19","DOI":"10.1109\/WACV48630.2021.00227"},{"doi-asserted-by":"crossref","unstructured":"Nguyen, M.D., Nguyen, B.T., Gurrin, C.: A Deep Local and Global Scene-Graph Matching for Image-Text Retrieval (2021). arXiv:2106.02400","key":"15_CR20","DOI":"10.3233\/FAIA210049"},{"doi-asserted-by":"crossref","unstructured":"Pan, X., Ge, C., Lu, R., Song, S., Chen, G., Huang, Z., Huang, G.: On the integration of self-attention and convolution. In: CVPR (2022)","key":"15_CR21","DOI":"10.1109\/CVPR52688.2022.00089"},{"unstructured":"Pearl, J., Mackenzie, D.: The book of why: the new science of cause and effect. Basic Books (2018)","key":"15_CR22"},{"doi-asserted-by":"crossref","unstructured":"Qian, T., Chen, J., Chen, S., Wu, B., Jiang, Y.G.: Scene graph refinement network for visual question answering. IEEE Trans. Multimedia (2022)","key":"15_CR23","DOI":"10.1109\/TMM.2022.3169065"},{"unstructured":"Ren, S., He, K., Girshick, R., Sun, J.: Faster r-CNN: towards real-time object detection with region proposal networks. NeurIPS 28 (2015)","key":"15_CR24"},{"doi-asserted-by":"crossref","unstructured":"Sidorov, O., Hu, R., Rohrbach, M., Singh, A.: Textcaps: a dataset for image captioning with reading comprehension. In: ECCV (2020)","key":"15_CR25","DOI":"10.1007\/978-3-030-58536-5_44"},{"doi-asserted-by":"crossref","unstructured":"Simon, H.A.: Bounded rationality. Utility and Probability, pp. 15\u201318 (1990)","key":"15_CR26","DOI":"10.1007\/978-1-349-20568-4_5"},{"doi-asserted-by":"crossref","unstructured":"Tang, K., Niu, Y., Huang, J., Shi, J., Zhang, H.: Unbiased scene graph generation from biased training. In: CVPR (2020)","key":"15_CR27","DOI":"10.1109\/CVPR42600.2020.00377"},{"doi-asserted-by":"crossref","unstructured":"Tang, K., Zhang, H., Wu, B., Luo, W., Liu, W.: Learning to compose dynamic tree structures for visual contexts. In: CVPR (2019)","key":"15_CR28","DOI":"10.1109\/CVPR.2019.00678"},{"unstructured":"Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A.N., Kaiser, \u0141., Polosukhin, I.: Attention is all you need. NeurIPS (2017)","key":"15_CR29"},{"doi-asserted-by":"crossref","unstructured":"Xie, S., Girshick, R., Doll\u00e1r, P., Tu, Z., He, K.: Aggregated residual transformations for deep neural networks. In: CVPR (2017)","key":"15_CR30","DOI":"10.1109\/CVPR.2017.634"},{"doi-asserted-by":"crossref","unstructured":"Xu, D., Zhu, Y., Choy, C.B., Fei-Fei, L.: Scene graph generation by iterative message passing. In: CVPR (2017)","key":"15_CR31","DOI":"10.1109\/CVPR.2017.330"},{"unstructured":"Xu, Y., Zhang, Q., Zhang, J., Tao, D.: Vitae: vision transformer advanced by exploring intrinsic inductive bias. NeurIPS, pp. 28522\u201328535 (2021)","key":"15_CR32"},{"doi-asserted-by":"crossref","unstructured":"Yan, S., Shen, C., Jin, Z., Huang, J., Jiang, R., Chen, Y., Hua, X.S.: Pcpl: predicate-correlation perception learning for unbiased scene graph generation. In: ACMM (2020)","key":"15_CR33","DOI":"10.1145\/3394171.3413722"},{"doi-asserted-by":"crossref","unstructured":"Yang, G., Zhang, J., Zhang, Y., Wu, B., Yang, Y.: Probabilistic modeling of semantic ambiguity for scene graph generation. In: CVPR (2021)","key":"15_CR34","DOI":"10.1109\/CVPR46437.2021.01234"},{"doi-asserted-by":"crossref","unstructured":"Yang, J., Lu, J., Lee, S., Batra, D., Parikh, D.: Graph r-CNN for scene graph generation. In: ECCV (2018)","key":"15_CR35","DOI":"10.1007\/978-3-030-01246-5_41"},{"doi-asserted-by":"crossref","unstructured":"Yang, J., Ang, Y.Z., Guo, Z., Zhou, K., Zhang, W., Liu, Z.: Panoptic scene graph generation. In: ECCV (2022)","key":"15_CR36","DOI":"10.1007\/978-3-031-19812-0_11"},{"doi-asserted-by":"crossref","unstructured":"Yang, X., Liu, Y., Wang, X.: Reformer: the relational transformer for image captioning. In: ACMM (2022)","key":"15_CR37","DOI":"10.1145\/3503161.3548409"},{"doi-asserted-by":"crossref","unstructured":"Ye, J., Chen, Z., Liu, J., Du, B.: Textfusenet: scene text detection with richer fused features. In: IJCAI (2020)","key":"15_CR38","DOI":"10.24963\/ijcai.2020\/72"},{"doi-asserted-by":"crossref","unstructured":"Yin, G., Sheng, L., Liu, B., Yu, N., Wang, X., Shao, J., Loy, C.C.: Zoom-net: mining deep feature interactions for visual relationship recognition. In: ECCV (2018)","key":"15_CR39","DOI":"10.1007\/978-3-030-01219-9_20"},{"doi-asserted-by":"crossref","unstructured":"Zareian, A., Karaman, S., Chang, S.F.: Bridging knowledge graphs to generate scene graphs. In: ECCV. Springer (2020)","key":"15_CR40","DOI":"10.1007\/978-3-030-58592-1_36"},{"doi-asserted-by":"crossref","unstructured":"Zellers, R., Yatskar, M., Thomson, S., Choi, Y.: Neural motifs: Scene graph parsing with global context. In: CVPR (2018)","key":"15_CR41","DOI":"10.1109\/CVPR.2018.00611"},{"doi-asserted-by":"crossref","unstructured":"Zhang, A., Yao, Y., Chen, Q., Ji, W., Liu, Z., Sun, M., Chua, T.S.: Fine-grained scene graph generation with data transfer. In: ECCV (2022)","key":"15_CR42","DOI":"10.1007\/978-3-031-19812-0_24"},{"key":"15_CR43","doi-asserted-by":"publisher","first-page":"300","DOI":"10.1007\/s11263-023-01880-0","volume":"132","author":"T Zheng","year":"2023","unstructured":"Zheng, T., Chen, Z., Fang, S., Xie, H., Jiang, Y.G.: Cdistnet: perceiving multi-domain character distance for robust text recognition. IJCV 132, 300\u2013318 (2023)","journal-title":"IJCV"},{"doi-asserted-by":"crossref","unstructured":"Zhou, B., Khosla, A., Lapedriza, A., Oliva, A., Torralba, A.: Learning deep features for discriminative localization. In: CVPR (2016)","key":"15_CR44","DOI":"10.1109\/CVPR.2016.319"},{"doi-asserted-by":"crossref","unstructured":"Zhou, X., Li, S., Chen, H., Zhu, A.: Disentangled OCR: a more granular information for \u201ctext\u201d-to-image retrieval. In: PRCV (2022)","key":"15_CR45","DOI":"10.1007\/978-3-031-18907-4_40"}],"container-title":["Lecture Notes in Computer Science","Pattern Recognition and Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-981-97-8511-7_15","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,11,2]],"date-time":"2024-11-02T05:07:57Z","timestamp":1730524077000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-981-97-8511-7_15"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,11,3]]},"ISBN":["9789819785100","9789819785117"],"references-count":45,"URL":"https:\/\/doi.org\/10.1007\/978-981-97-8511-7_15","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"type":"print","value":"0302-9743"},{"type":"electronic","value":"1611-3349"}],"subject":[],"published":{"date-parts":[[2024,11,3]]},"assertion":[{"value":"3 November 2024","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"PRCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Chinese Conference on Pattern Recognition and Computer Vision  (PRCV)","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Urumqi","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"China","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"18 October 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"20 October 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"7","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"ccprcv2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"http:\/\/2024.prcv.cn\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}