{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,25]],"date-time":"2026-08-25T03:13:10Z","timestamp":1787627590205,"version":"build-2736575974"},"reference-count":54,"publisher":"Springer Science and Business Media LLC","issue":"8-9","license":[{"start":{"date-parts":[[2020,7,30]],"date-time":"2020-07-30T00:00:00Z","timestamp":1596067200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2020,7,30]],"date-time":"2020-07-30T00:00:00Z","timestamp":1596067200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2020,9]]},"DOI":"10.1007\/s11263-020-01353-8","type":"journal-article","created":{"date-parts":[[2020,7,30]],"date-time":"2020-07-30T07:42:44Z","timestamp":1596094964000},"page":"2146-2165","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":29,"title":["Multi-task Compositional Network for Visual Relationship Detection"],"prefix":"10.1007","volume":"128","author":[{"given":"Yibing","family":"Zhan","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jun","family":"Yu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ting","family":"Yu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Dacheng","family":"Tao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2020,7,30]]},"reference":[{"key":"1353_CR1","doi-asserted-by":"crossref","unstructured":"Chen, T., Yu, W., Chen, R., & Lin, L. (2019). Knowledge-embedded routing network for scene graph generation. In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 6163\u20136171).","DOI":"10.1109\/CVPR.2019.00632"},{"key":"1353_CR2","unstructured":"Chen, X., & Gupta, A. (2017). An implementation of faster rcnn with study for region sampling. arXiv preprint arXiv:1702.02138"},{"key":"1353_CR3","doi-asserted-by":"crossref","unstructured":"Desai, C., & Ramanan, D. (2012). Detecting actions, poses, and objects with relational phraselets. In European conference on computer vision (pp 158\u2013172). Springer.","DOI":"10.1007\/978-3-642-33765-9_12"},{"key":"1353_CR4","unstructured":"Du\u00a0Plessis, M., Niu, G., & Sugiyama, M. (2015). Convex formulation for learning from positive and unlabeled data. In International conference on machine learning (pp. 1386\u20131394)."},{"key":"1353_CR5","doi-asserted-by":"publisher","unstructured":"Fang, H., Gupta, S., Iandola, F., Srivastava, R.K., Deng, L., Dollar, P., Gao, J., He, X., Mitchell, M., Platt, J.C., Zitnick, C.L., & Zweig, G. (2015). From captions to visual concepts and back. In 2015 IEEE conference on computer vision and pattern recognition (CVPR) (vol\u00a000, pp. 1473\u20131482). https:\/\/doi.org\/10.1109\/CVPR.2015.7298754.","DOI":"10.1109\/CVPR.2015.7298754"},{"key":"1353_CR6","doi-asserted-by":"publisher","unstructured":"Farhadi, A., & Sadeghi, M. A. (2011). Recognition using visual phrases. In CVPR 2011(CVPR) (vol\u00a000, pp. 1745\u20131752). https:\/\/doi.org\/10.1109\/CVPR.2011.5995711.","DOI":"10.1109\/CVPR.2011.5995711"},{"key":"1353_CR7","doi-asserted-by":"crossref","unstructured":"Galleguillos, C., Rabinovich, A., & Belongie, S. (2008). Object categorization using co-occurrence, location and appearance. In IEEE conference on computer vision and pattern recognition, 2008 (pp. 1\u20138). CVPR 2008, IEEE.","DOI":"10.1109\/CVPR.2008.4587799"},{"key":"1353_CR8","doi-asserted-by":"crossref","unstructured":"Girshick, R., Donahue, J., Darrell, T., & Malik, J. (2014). Rich feature hierarchies for accurate object detection and semantic segmentation. In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 580\u2013587).","DOI":"10.1109\/CVPR.2014.81"},{"issue":"3","key":"1353_CR9","doi-asserted-by":"publisher","first-page":"300","DOI":"10.1007\/s11263-008-0140-x","volume":"80","author":"S Gould","year":"2008","unstructured":"Gould, S., Rodgers, J., Cohen, D., Elidan, G., & Koller, D. (2008). Multi-class segmentation with relative location prior. International Journal of Computer Vision, 80(3), 300\u2013316.","journal-title":"International Journal of Computer Vision"},{"key":"1353_CR10","doi-asserted-by":"crossref","unstructured":"Gu, J., Zhao, H., Lin, Z., Li, S., Cai, J., & Ling, M. (2019). Scene graph generation with external knowledge and image reconstruction. In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 1969\u20131978).","DOI":"10.1109\/CVPR.2019.00207"},{"key":"1353_CR11","doi-asserted-by":"crossref","unstructured":"Han, C., Shen, F., Liu, L., & Yang, Y. (2018). Shen HT (2018) Visual spatial attention network for relationship detection. In ACM multimedia conference on multimedia conference, ACM (pp. 510\u2013518).","DOI":"10.1145\/3240508.3240611"},{"key":"1353_CR12","unstructured":"Hsieh, C.J., Natarajan, N., & Dhillon, I.S. (2015). Pu learning for matrix completion. In ICML (pp. 2445\u20132453)."},{"key":"1353_CR13","doi-asserted-by":"crossref","unstructured":"Hu, H., Gu, J., Zhang, Z., Dai, J., & Wei, Y. (2018). Relation networks for object detection. In The IEEE conference on computer vision and pattern recognition (CVPR).","DOI":"10.1109\/CVPR.2018.00378"},{"key":"1353_CR14","doi-asserted-by":"crossref","unstructured":"Jae\u00a0Hwang, S., Ravi, SN., Tao, Z., Kim, H.J., Collins, M.D., & Singh, V. (2018). Tensorize, factorize and regularize: Robust visual relationship learning. In The IEEE conference on computer vision and pattern recognition (CVPR).","DOI":"10.1109\/CVPR.2018.00112"},{"key":"1353_CR15","doi-asserted-by":"crossref","unstructured":"Kaji, H., Yamaguchi, H., & Sugiyama, M. (2018). Multi task learning with positive and unlabeled data and its application to mental state prediction. In 2018 IEEE international conference on acoustics, speech and signal processing (ICASSP), IEEE (pp. 2301\u20132305).","DOI":"10.1109\/ICASSP.2018.8462108"},{"key":"1353_CR16","doi-asserted-by":"crossref","unstructured":"Kanehira, A., & Harada, T. (2016). Multi-label ranking from positive and unlabeled data. In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 5138\u20135146).","DOI":"10.1109\/CVPR.2016.555"},{"issue":"3","key":"1353_CR17","doi-asserted-by":"publisher","first-page":"350","DOI":"10.1007\/s11263-016-0982-6","volume":"123","author":"Y Kong","year":"2017","unstructured":"Kong, Y., & Fu, Y. (2017). Max-margin heterogeneous information machine for rgb-d action recognition. International Journal of Computer Vision, 123(3), 350\u2013371.","journal-title":"International Journal of Computer Vision"},{"issue":"1","key":"1353_CR18","doi-asserted-by":"publisher","first-page":"32","DOI":"10.1007\/s11263-016-0981-7","volume":"123","author":"R Krishna","year":"2017","unstructured":"Krishna, R., Zhu, Y., Groth, O., Johnson, J., Hata, K., Kravitz, J., et al. (2017). Visual genome: Connecting language and vision using crowdsourced dense image annotations. International Journal of Computer Vision, 123(1), 32\u201373.","journal-title":"International Journal of Computer Vision"},{"key":"1353_CR19","doi-asserted-by":"crossref","unstructured":"Li, X. L., Yu, P. S., Liu, B., & Ng, S. K. (2009). Positive unlabeled learning for data stream classification. In Proceedings of the 2009 SIAM international conference on data mining, SIAM (pp. 259\u2013270).","DOI":"10.1137\/1.9781611972795.23"},{"key":"1353_CR20","doi-asserted-by":"crossref","unstructured":"Li, Y., Ouyang, W., Wang, X., & Tang, X. (2017a). Vip-cnn: Visual phrase guided convolutional neural network. In Computer vision and pattern recognition (pp. 7244\u20137253).","DOI":"10.1109\/CVPR.2017.766"},{"key":"1353_CR21","doi-asserted-by":"crossref","unstructured":"Li, Y., Ouyang, W., Zhou, B., Wang, K., & Wang, X. (2017b). Scene graph generation from objects, phrases and region captions. In Proceedings of the IEEE international conference on computer vision (pp. 1261\u20131270).","DOI":"10.1109\/ICCV.2017.142"},{"key":"1353_CR22","doi-asserted-by":"crossref","unstructured":"Liang, K., Guo, Y., Chang, H., & Chen, X. (2018). Visual relationship detection with deep structural ranking. In AAAI Conference on artificial intelligence.","DOI":"10.1609\/aaai.v32i1.12274"},{"key":"1353_CR23","doi-asserted-by":"crossref","unstructured":"Liang, X., Lee, L., & Xing, E. P. (2017). Deep variation-structured reinforcement learning for visual relationship and attribute detection. In Computer vision and pattern recognition (pp. 4408\u20134417).","DOI":"10.1109\/CVPR.2017.469"},{"key":"1353_CR24","doi-asserted-by":"crossref","unstructured":"Lin, T. Y., Goyal, P., Girshick, R., He, K., & Doll\u00e1r, P. (2017). Focal loss for dense object detection. In Proceedings of the IEEE international conference on computer vision (pp. 2980\u20132988).","DOI":"10.1109\/ICCV.2017.324"},{"key":"1353_CR25","doi-asserted-by":"crossref","unstructured":"Liu, W., Anguelov, D., Erhan, D., Szegedy, C., Reed, S., Fu, C. Y., et al. (2016). Ssd: Single shot multibox detector. In European conference on computer vision (pp. 21\u201337). Springer.","DOI":"10.1007\/978-3-319-46448-0_2"},{"key":"1353_CR26","doi-asserted-by":"crossref","unstructured":"Lu, C., Krishna, R., Bernstein, M. S., & Feifei, L. (2016). Visual relationship detection with language priors. In European conference on computer vision (pp. 852\u2013869).","DOI":"10.1007\/978-3-319-46448-0_51"},{"key":"1353_CR27","doi-asserted-by":"crossref","unstructured":"Misra, I., Shrivastava, A., Gupta, A., & Hebert, M. (2016). Cross-stitch networks for multi-task learning. In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 3994\u20134003).","DOI":"10.1109\/CVPR.2016.433"},{"issue":"1","key":"1353_CR28","doi-asserted-by":"publisher","first-page":"14","DOI":"10.1007\/s11263-016-0890-9","volume":"120","author":"W Ouyang","year":"2016","unstructured":"Ouyang, W., Zeng, X., & Wang, X. (2016). Learning mutual visibility relationship for pedestrian detection with a deep model. International Journal of Computer Vision, 120(1), 14\u201327.","journal-title":"International Journal of Computer Vision"},{"issue":"2","key":"1353_CR29","doi-asserted-by":"publisher","first-page":"217","DOI":"10.1007\/s11263-016-0901-x","volume":"118","author":"C Palmero","year":"2016","unstructured":"Palmero, C., Clap\u00e9s, A., Bahnsen, C., M\u00f8gelmose, A., Moeslund, T. B., & Escalera, S. (2016). Multi-modal rgb-depth-thermal human body segmentation. International Journal of Computer Vision, 118(2), 217\u2013239.","journal-title":"International Journal of Computer Vision"},{"key":"1353_CR30","doi-asserted-by":"crossref","unstructured":"Pennington, J., Socher, R., & Manning, C. (2014). Glove: Global vectors for word representation. In Proceedings of the 2014 conference on empirical methods in natural language processing (EMNLP) (pp. 1532\u20131543).","DOI":"10.3115\/v1\/D14-1162"},{"key":"1353_CR31","doi-asserted-by":"crossref","unstructured":"Peyre, J., Laptev, I., Schmid, C., & Sivic, J. (2017). Weakly-supervised learning of visual relations. In international conference on computer vision (pp. 5189\u20135198).","DOI":"10.1109\/ICCV.2017.554"},{"key":"1353_CR32","unstructured":"Platanios, E., Poon, H., Mitchell, T. M., & Horvitz, E. J. (2017). Estimating accuracy from unlabeled data: A probabilistic logic approach. In Advances in neural information processing systems (pp. 4361\u20134370)."},{"key":"1353_CR33","doi-asserted-by":"crossref","unstructured":"Redmon, J., Divvala, S., Girshick, R., & Farhadi, A. (2016). You only look once: Unified, real-time object detection. In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 779\u2013788).","DOI":"10.1109\/CVPR.2016.91"},{"key":"1353_CR34","doi-asserted-by":"publisher","first-page":"1137","DOI":"10.1109\/TPAMI.2016.2577031","volume":"6","author":"S Ren","year":"2017","unstructured":"Ren, S., He, K., Girshick, R., & Sun, J. (2017). Faster r-cnn: Towards real-time object detection with region proposal networks. IEEE Transactions on Pattern Analysis & Machine Intelligence, 6, 1137\u20131149.","journal-title":"IEEE Transactions on Pattern Analysis & Machine Intelligence"},{"key":"1353_CR35","unstructured":"Ruder, S. (2017). An overview of multi-task learning in deep neural networks. arXiv preprint arXiv:1706.05098"},{"key":"1353_CR36","unstructured":"Sansone, E., De Natale, F. G., & Zhou, Z. H. (2018). Efficient training for positive unlabeled learning. In IEEE Transactions on pattern analysis and machine intelligence."},{"key":"1353_CR37","unstructured":"Simonyan, K., & Zisserman, A. (2014). Very deep convolutional networks for large-scale image recognition. arXiv preprint arXiv:1409.1556"},{"key":"1353_CR38","doi-asserted-by":"crossref","unstructured":"Xu, D., Zhu, Y., Choy, C.B., & Fei-Fei, L. (2017). Scene graph generation by iterative message passing. In Proceedings of the IEEE conference on computer vision and pattern recognition (vol.\u00a02).","DOI":"10.1109\/CVPR.2017.330"},{"key":"1353_CR39","doi-asserted-by":"crossref","unstructured":"Yang, X., Zhang, H., & Cai, J. (2018). Shuffle-then-assemble: learning object-agnostic visual relationship features. arXiv preprint arXiv:1808.00171","DOI":"10.1007\/978-3-030-01258-8_3"},{"key":"1353_CR40","doi-asserted-by":"crossref","unstructured":"Yao, T., Pan, Y., Li, Y., & Mei, T. (2018). Exploring visual relationship for image captioning. In Proceedings of the European conference on computer vision (ECCV) (pp. 684\u2013699).","DOI":"10.1007\/978-3-030-01264-9_42"},{"key":"1353_CR41","doi-asserted-by":"crossref","unstructured":"Yin, G., Sheng, L., Liu, B., Yu, N., Wang, X., Shao, J., & Loy, C.C. (2018). Zoom-net: Mining deep feature interactions for visual relationship recognition. arXiv preprint arXiv:1807.04979","DOI":"10.1007\/978-3-030-01219-9_20"},{"key":"1353_CR42","doi-asserted-by":"crossref","unstructured":"Yu, R., Li, A., Morariu, V. I., & Davis, L. S. (2017). Visual relationship detection with internal and external linguistic knowledge distillation. In International conference on computer vision (pp. 1068\u20131076).","DOI":"10.1109\/ICCV.2017.121"},{"key":"1353_CR43","doi-asserted-by":"crossref","unstructured":"Yu, Z., Yu, J., Fan, J., & Tao, D. (2017). Multi-modal factorized bilinear pooling with co-attention learning for visual question answering. In Proceedings of the IEEE international conference on computer vision (pp. 1821\u20131830).","DOI":"10.1109\/ICCV.2017.202"},{"key":"1353_CR44","first-page":"1","volume":"99","author":"Z Yu","year":"2018","unstructured":"Yu, Z., Yu, J., Xiang, C., Fan, J., & Tao, D. (2018). Beyond bilinear: Generalized multimodal factorized high-order pooling for visual question answering. IEEE Transactions on Neural Networks and Learning Systems, 99, 1\u201313.","journal-title":"IEEE Transactions on Neural Networks and Learning Systems"},{"key":"1353_CR45","doi-asserted-by":"crossref","unstructured":"Zhan, Y., Yu, J., Yu, T., & Tao, D. (2019). On exploring undetermined relationships for visual relationship detection. In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 5128\u20135137).","DOI":"10.1109\/CVPR.2019.00527"},{"key":"1353_CR46","doi-asserted-by":"crossref","unstructured":"Zhang, H., Kyaw, Z., Chang, S., & Chua, T. (2017a). Visual translation embedding network for visual relation detection. In Computer vision and pattern recognition (pp. 3107\u20133115).","DOI":"10.1109\/CVPR.2017.331"},{"key":"1353_CR47","doi-asserted-by":"crossref","unstructured":"Zhang, H., Kyaw, Z., Yu, J., & Chang, S. (2017b). Ppr-fcn: Weakly supervised visual relation detection via parallel pairwise r-fcn. In International conference on computer vision (pp. 4243\u20134251).","DOI":"10.1109\/ICCV.2017.454"},{"key":"1353_CR48","doi-asserted-by":"publisher","first-page":"9185","DOI":"10.1609\/aaai.v33i01.33019185","volume":"33","author":"J Zhang","year":"2019","unstructured":"Zhang, J., Kalantidis, Y., Rohrbach, M., Paluri, M., Elgammal, A., & Elhoseiny, M. (2019a). Large-scale visual relationship understanding. Proceedings of the AAAI Conference on Artificial Intelligence, 33, 9185\u20139194.","journal-title":"Proceedings of the AAAI Conference on Artificial Intelligence"},{"key":"1353_CR49","doi-asserted-by":"crossref","unstructured":"Zhang, J., Shih, K. J., Elgammal, A., Tao, A., & Catanzaro, B. (2019b). Graphical contrastive losses for scene graph parsing. In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 11535\u201311543).","DOI":"10.1109\/CVPR.2019.01180"},{"issue":"10","key":"1353_CR50","doi-asserted-by":"publisher","first-page":"1499","DOI":"10.1109\/LSP.2016.2603342","volume":"23","author":"K Zhang","year":"2016","unstructured":"Zhang, K., Zhang, Z., Li, Z., & Qiao, Y. (2016). Joint face detection and alignment using multitask cascaded convolutional networks. IEEE Signal Processing Letters, 23(10), 1499\u20131503.","journal-title":"IEEE Signal Processing Letters"},{"key":"1353_CR51","doi-asserted-by":"crossref","unstructured":"Zhang, X., & LeCun, Y. (2017). Universum prescription: Regularization using unlabeled data. In AAAI (pp. 2907\u20132913).","DOI":"10.1609\/aaai.v31i1.10768"},{"key":"1353_CR52","unstructured":"Zhou, J. T., Pan, S. J., Mao, Q., & Tsang, I. W. (2012). Multi-view positive and unlabeled learning. In Asian conference on machine learning (pp. 555\u2013570)."},{"key":"1353_CR53","doi-asserted-by":"crossref","unstructured":"Zhu, Y., & Jiang, S. (2018). Deep structured learning for visual relationship detection. In AAAI Conference on artificial intelligence.","DOI":"10.1609\/aaai.v32i1.12271"},{"key":"1353_CR54","doi-asserted-by":"crossref","unstructured":"Zhuang, B., Liu, L., Shen, C., & Reid, I. (2017). Towards context-aware interaction recognition for visual relationship detection. In Proceedings of the IEEE international conference on computer vision (pp. 589\u2013598).","DOI":"10.1109\/ICCV.2017.71"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-020-01353-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11263-020-01353-8\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-020-01353-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,11,5]],"date-time":"2022-11-05T04:02:27Z","timestamp":1667620947000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11263-020-01353-8"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020,7,30]]},"references-count":54,"journal-issue":{"issue":"8-9","published-print":{"date-parts":[[2020,9]]}},"alternative-id":["1353"],"URL":"https:\/\/doi.org\/10.1007\/s11263-020-01353-8","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2020,7,30]]},"assertion":[{"value":"7 March 2019","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"5 July 2020","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"30 July 2020","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}