{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,8]],"date-time":"2026-04-08T16:58:25Z","timestamp":1775667505908,"version":"3.50.1"},"reference-count":48,"publisher":"Springer Science and Business Media LLC","issue":"10","license":[{"start":{"date-parts":[[2024,6,21]],"date-time":"2024-06-21T00:00:00Z","timestamp":1718928000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,6,21]],"date-time":"2024-06-21T00:00:00Z","timestamp":1718928000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["SIViP"],"published-print":{"date-parts":[[2024,9]]},"DOI":"10.1007\/s11760-024-03383-y","type":"journal-article","created":{"date-parts":[[2024,6,21]],"date-time":"2024-06-21T15:01:47Z","timestamp":1718982107000},"page":"7171-7182","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":5,"title":["GCAM: Gaussian and causal-attention model of food fine-grained recognition"],"prefix":"10.1007","volume":"18","author":[{"given":"Guohang","family":"Zhuang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yue","family":"Hu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Tianxing","family":"Yan","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jiazhan","family":"Gao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2024,6,21]]},"reference":[{"key":"3383_CR1","doi-asserted-by":"publisher","first-page":"2643","DOI":"10.1109\/ACCESS.2018.2879117","volume":"7","author":"R Yunus","year":"2018","unstructured":"Yunus, R., Arif, O., Afzal, H., Amjad, M.F., Abbas, H., Bokhari, H.N., Haider, S.T., Zafar, N., Nawaz, R.: A framework to estimate the nutritional value of food in real time using deep learning techniques. IEEE Access 7, 2643\u20132652 (2018)","journal-title":"IEEE Access"},{"key":"3383_CR2","doi-asserted-by":"crossref","unstructured":"Mezgec, S. and Seljak, B.K.: Using deep learning for food and beverage image recognition. In: 2019 IEEE International Conference on Big Data (Big Data), pp. 5149\u20135151. IEEE (2019)","DOI":"10.1109\/BigData47090.2019.9006181"},{"key":"3383_CR3","doi-asserted-by":"publisher","first-page":"91","DOI":"10.1007\/s41095-015-0017-1","volume":"1","author":"P Hall","year":"2015","unstructured":"Hall, P., Cai, H., Wu, Q., Corradi, T.: Cross-depiction problem: recognition and synthesis of photographs and artwork. Comput. Vis. Media 1, 91\u2013103 (2015)","journal-title":"Comput. Vis. Media"},{"key":"3383_CR4","doi-asserted-by":"crossref","unstructured":"Rao, Y., Chen, G., Lu, J., Zhou, J.: Counterfactual attention learning for fine-grained visual categorization and re-identification. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp. 1025\u20131034 (2021)","DOI":"10.1109\/ICCV48922.2021.00106"},{"issue":"5","key":"3383_CR5","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3329168","volume":"52","author":"W Min","year":"2019","unstructured":"Min, W., Jiang, S., Liu, L., Rui, Y., Jain, R.: A survey on food computing. ACM Comput. Surv. (CSUR) 52(5), 1\u201336 (2019)","journal-title":"ACM Comput. Surv. (CSUR)"},{"key":"3383_CR6","doi-asserted-by":"crossref","unstructured":"Ojala, T., Pietikainen, M., Harwood, D.: Performance evaluation of texture measures with classification based on kullback discrimination of distributions. In: Proceedings of 12th international conference on pattern recognition, vol.\u00a01, pp. 582\u2013585. IEEE (1994)","DOI":"10.1109\/ICPR.1994.576366"},{"key":"3383_CR7","doi-asserted-by":"crossref","unstructured":"Dalal, N., Triggs, B.: Histograms of oriented gradients for human detection. In: 2005 IEEE Computer Society Conference on Computer Vision and Pattern Recognition (CVPR\u201905), vol.\u00a01, pp. 886\u2013893. IEEE (2005)","DOI":"10.1109\/CVPR.2005.177"},{"key":"3383_CR8","doi-asserted-by":"crossref","unstructured":"Lowe, D.G.: Object recognition from local scale-invariant features. In: Proceedings of the 7th IEEE International Conference on Computer Vision, vol.\u00a02, pp. 1150\u20131157. IEEE (1999)","DOI":"10.1109\/ICCV.1999.790410"},{"key":"3383_CR9","doi-asserted-by":"crossref","unstructured":"Kagaya, H., Aizawa, K., Ogawa, M.: Food detection and recognition using convolutional neural network. In: Proceedings of the 22nd ACM International Conference on Multimedia, pp. 1085\u20131088 (2014)","DOI":"10.1145\/2647868.2654970"},{"key":"3383_CR10","doi-asserted-by":"crossref","unstructured":"Ming, Z.Y., Chen, J., Cao, Y., Forde, C., Ngo, C.W., Chua, T.S.: Food photo recognition for dietary tracking: System and experiment. In: MultiMedia Modeling: 24th International Conference, MMM 2018, Bangkok, Thailand, February 5\u20137, 2018, Proceedings, Part II 24, pp. 129\u2013141. Springer (2018)","DOI":"10.1007\/978-3-319-73600-6_12"},{"key":"3383_CR11","doi-asserted-by":"publisher","first-page":"364","DOI":"10.1016\/j.compag.2019.04.019","volume":"162","author":"J Steinbrener","year":"2019","unstructured":"Steinbrener, J., Posch, K., Leitner, R.: Hyperspectral fruit and vegetable classification using convolutional neural networks. Comput. Electron. Agric. 162, 364\u2013372 (2019)","journal-title":"Comput. Electron. Agric."},{"key":"3383_CR12","doi-asserted-by":"crossref","unstructured":"Martinel, N., Foresti, G.L., Micheloni, C.: Wide-slice residual networks for food recognition. In: 2018 IEEE Winter Conference on Applications of Computer Vision (WACV), pp. 567\u2013576. IEEE (2018)","DOI":"10.1109\/WACV.2018.00068"},{"key":"3383_CR13","doi-asserted-by":"publisher","first-page":"1514","DOI":"10.1109\/TIP.2020.3045639","volume":"30","author":"J Chen","year":"2020","unstructured":"Chen, J., Zhu, B., Ngo, C.W., Chua, T.S., Jiang, Y.G.: A study of multi-task and region-wise deep learning for food ingredient recognition. IEEE Trans. Image Process. 30, 1514\u20131526 (2020)","journal-title":"IEEE Trans. Image Process."},{"key":"3383_CR14","doi-asserted-by":"crossref","unstructured":"Qiu, C., Zhou, W.: A survey of recent advances in CNN-based fine-grained visual categorization. In: 2020 IEEE 20th International Conference on Communication Technology (ICCT), pp. 1377\u20131384. IEEE (2020)","DOI":"10.1109\/ICCT50939.2020.9295723"},{"issue":"1s","key":"3383_CR15","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3418215","volume":"17","author":"Z Lv","year":"2021","unstructured":"Lv, Z., Qiao, L., Singh, A.K., Wang, Q.: Fine-grained visual computing based on deep learning. ACM Trans. Multimedia Comput. Commun. Appl. 17(1s), 1\u201319 (2021)","journal-title":"ACM Trans. Multimedia Comput. Commun. Appl."},{"key":"3383_CR16","first-page":"1","volume":"19","author":"H Meng","year":"2022","unstructured":"Meng, H., Tian, Y., Ling, Y., Li, T.: Fine-grained ship recognition for complex background based on global to local and progressive learning. IEEE Geosci. Remote Sens. Lett. 19, 1\u20135 (2022)","journal-title":"IEEE Geosci. Remote Sens. Lett."},{"key":"3383_CR17","doi-asserted-by":"crossref","unstructured":"Hou, S., Feng, Y., Wang, Z.: Vegfru: a domain-specific dataset for fine-grained visual categorization. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 541\u2013549 (2017)","DOI":"10.1109\/ICCV.2017.66"},{"key":"3383_CR18","unstructured":"Hu, T., Qi, H., Huang, Q., Lu, Y.: See better before looking closer: weakly supervised data augmentation network for fine-grained visual classification. arXiv preprint arXiv:1901.09891 (2019)"},{"key":"3383_CR19","doi-asserted-by":"crossref","unstructured":"Liu, Z., Lin, Y., Cao, Y., Hu, H., Wei, Y., Zhang, Z., Lin, S., Guo, B.: Swin transformer: Hierarchical vision transformer using shifted windows. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp. 10012\u201310022 (2021)","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"3383_CR20","doi-asserted-by":"crossref","unstructured":"Duan, K., Bai, S., Xie, L., Qi, H., Huang, Q., Tian, Q.: Centernet: keypoint triplets for object detection. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp. 6569\u20136578 (2019)","DOI":"10.1109\/ICCV.2019.00667"},{"key":"3383_CR21","doi-asserted-by":"crossref","unstructured":"Li, J., Bian, S., Zeng, A., Wang, C., Pang, B., Liu, W., Lu, C.: Human pose regression with residual log-likelihood estimation. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp. 11025\u201311034 (2021)","DOI":"10.1109\/ICCV48922.2021.01084"},{"key":"3383_CR22","unstructured":"Krizhevsky, A., Sutskever, I., Hinton, G.E.: Imagenet classification with deep convolutional neural networks. Adv. Neural Inf. Process. Syst. 25 (2012)"},{"key":"3383_CR23","doi-asserted-by":"crossref","unstructured":"Szegedy, C., Liu, W., Jia, Y., Sermanet, P., Reed, S., Anguelov, D., Erhan, D., Vanhoucke, V., Rabinovich, A.: Going deeper with convolutions. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 1\u20139 (2015)","DOI":"10.1109\/CVPR.2015.7298594"},{"key":"3383_CR24","doi-asserted-by":"publisher","first-page":"116663","DOI":"10.1109\/ACCESS.2020.3005150","volume":"8","author":"CS Won","year":"2020","unstructured":"Won, C.S.: Multi-scale CNN for fine-grained image recognition. IEEE Access 8, 116663\u2013116674 (2020)","journal-title":"IEEE Access"},{"key":"3383_CR25","doi-asserted-by":"crossref","unstructured":"Liu, C., Cao, Y., Luo, Y., Chen, G., Vokkarane, V., Ma, Y.: Deepfood: deep learning-based food image recognition for computer-aided dietary assessment. In: Inclusive Smart Cities and Digital Health: 14th International Conference on Smart Homes and Health Telematics, ICOST 2016, Wuhan, China, May 25\u201327, 2016. Proceedings, vol. 14, pp. 37\u201348. Springer (2016)","DOI":"10.1007\/978-3-319-39601-9_4"},{"key":"3383_CR26","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 770\u2013778 (2016)","DOI":"10.1109\/CVPR.2016.90"},{"key":"3383_CR27","doi-asserted-by":"crossref","unstructured":"Hassannejad, H., Matrella, G., Ciampolini, P., De Munari, I., Mordonini, M., Cagnoni, S.: Food image recognition using very deep convolutional networks. In: Proceedings of the 2nd International Workshop on Multimedia Assisted Dietary Management, pp. 41\u201349 (2016)","DOI":"10.1145\/2986035.2986042"},{"key":"3383_CR28","doi-asserted-by":"crossref","unstructured":"Huang, G., Liu, Z., Van Der Maaten, L., Weinberger, K.Q.: Densely connected convolutional networks. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 4700\u20134708 (2017)","DOI":"10.1109\/CVPR.2017.243"},{"key":"3383_CR29","doi-asserted-by":"crossref","unstructured":"Hu, J., Shen, L., Sun, G.: Squeeze-and-excitation networks. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 7132\u20137141 (2018)","DOI":"10.1109\/CVPR.2018.00745"},{"key":"3383_CR30","doi-asserted-by":"crossref","unstructured":"Martinel, N., Foresti, G.L., Micheloni, C.: Wide-slice residual networks for food recognition. In: 2018 IEEE Winter Conference on Applications of Computer Vision (WACV), pp. 567\u2013576. IEEE (2018)","DOI":"10.1109\/WACV.2018.00068"},{"key":"3383_CR31","doi-asserted-by":"crossref","unstructured":"Yang, Z., Luo, T., Wang, D., Hu, Z., Gao, J., Wang, L.: Learning to navigate for fine-grained classification. In: Proceedings of the European Conference on Computer Vision (ECCV), pp. 420\u2013435 (2018)","DOI":"10.1007\/978-3-030-01264-9_26"},{"key":"3383_CR32","doi-asserted-by":"crossref","unstructured":"Du, R., Chang, D., Bhunia, A.K., Xie, J., Ma, Z., Song, Y.Z., Guo, J.: Fine-grained visual classification via progressive multi-granularity training of jigsaw patches. In: European Conference on Computer Vision, pp. 153\u2013168. Springer (2020)","DOI":"10.1007\/978-3-030-58565-5_10"},{"key":"3383_CR33","doi-asserted-by":"crossref","unstructured":"Chen, Y., Bai, Y., Zhang, W., Mei, T.: Destruction and construction learning for fine-grained image recognition. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 5157\u20135166 (2019)","DOI":"10.1109\/CVPR.2019.00530"},{"key":"3383_CR34","doi-asserted-by":"crossref","unstructured":"Xu, Q., Wang, J., Jiang, B., Luo, B.: Fine-grained visual classification via internal ensemble learning transformer. IEEE Trans. Multimedia (2023). https:\/\/doi.org\/10.1109\/TMM.2023.3244340","DOI":"10.1109\/TMM.2023.3244340"},{"issue":"4","key":"3383_CR35","doi-asserted-by":"publisher","first-page":"10695","DOI":"10.1007\/s11042-023-15800-4","volume":"83","author":"R Nijhawan","year":"2024","unstructured":"Nijhawan, R., Sinha, G., Batra, A., Kumar, M., Sharma, H.: Vtnet+ handcrafted based approach for food cuisines classification. Multimedia Tools Appl. 83(4), 10695\u201310715 (2024)","journal-title":"Multimedia Tools Appl."},{"issue":"2","key":"3383_CR36","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1007\/s00530-024-01297-w","volume":"30","author":"R Zhang","year":"2024","unstructured":"Zhang, R., Ouyang, D., He, L., Kuang, L., Bai, H.: Recognize after early fusion: the Chinese food recognition based on the alignment of image and ingredients. Multimedia Syst. 30(2), 1\u201311 (2024)","journal-title":"Multimedia Syst."},{"key":"3383_CR37","doi-asserted-by":"crossref","unstructured":"Chen, J., Ngo, C.W.: Deep-based ingredient recognition for cooking recipe retrieval. In: Proceedings of the 24th ACM International Conference on Multimedia, pp. 32\u201341 (2016)","DOI":"10.1145\/2964284.2964315"},{"key":"3383_CR38","doi-asserted-by":"crossref","unstructured":"Bossard, L., Guillaumin, M., Van Gool, L.: Food-101\u2014mining discriminative components with random forests. In: Computer Vision\u2013ECCV 2014: 13th European Conference, Zurich, Switzerland, September 6\u201312, 2014, Proceedings, Part VI 13, pp. 446\u2013461. Springer (2014)","DOI":"10.1007\/978-3-319-10599-4_29"},{"key":"3383_CR39","doi-asserted-by":"crossref","unstructured":"Kawano, Y., Yanai, K.: Automatic expansion of a food image dataset leveraging existing categories with domain adaptation. In: Computer Vision-ECCV 2014 Workshops: Zurich, Switzerland, September 6\u20137 and 12, 2014, Proceedings, Part III 13, pages 3\u201317. Springer (2015)","DOI":"10.1007\/978-3-319-16199-0_1"},{"key":"3383_CR40","doi-asserted-by":"publisher","DOI":"10.1016\/j.engappai.2024.108248","volume":"133","author":"J-H Kim","year":"2024","unstructured":"Kim, J.-H., Kim, N., Won, C.S.: Global-local feature learning for fine-grained food classification based on Swin transformer. Eng. Appl. Artif. Intell. 133, 108248 (2024)","journal-title":"Eng. Appl. Artif. Intell."},{"key":"3383_CR41","doi-asserted-by":"crossref","unstructured":"Fu, J., Zheng, H., Mei, T.: Look closer to see better: recurrent attention convolutional neural network for fine-grained image recognition. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 4438\u20134446 (2017)","DOI":"10.1109\/CVPR.2017.476"},{"key":"3383_CR42","doi-asserted-by":"crossref","unstructured":"Zheng, H., Fu, J., Mei, T., Luo, J.: Learning multi-attention convolutional neural network for fine-grained image recognition. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 5209\u20135217 (2017)","DOI":"10.1109\/ICCV.2017.557"},{"key":"3383_CR43","unstructured":"Hu, T., Qi H., Huang, Q., Lu, Y.: See better before looking closer: weakly supervised data augmentation network for fine-grained visual classification. arXiv preprint arXiv:1901.09891 (1901)"},{"key":"3383_CR44","doi-asserted-by":"crossref","unstructured":"Chen, Y., Bai, Y., Zhang, W., Mei, T.: Destruction and construction learning for fine-grained image recognition. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 5157\u20135166 (2019)","DOI":"10.1109\/CVPR.2019.00530"},{"key":"3383_CR45","first-page":"13130","volume":"34","author":"P Zhuang","year":"2020","unstructured":"Zhuang, P., Wang, Y., Qiao, Y.: Learning attentive pairwise interaction for fine-grained classification. Proc. AAAI Confer. Artif. Intell. 34, 13130\u201313137 (2020)","journal-title":"Proc. AAAI Confer. Artif. Intell."},{"key":"3383_CR46","doi-asserted-by":"crossref","unstructured":"Long, Z., McCreadie, R., Camarasa, G.A., Meng, Z.: Lacvit: a label-aware contrastive fine-tuning framework for vision transformers. In: ICASSP 2024-2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 5275\u20135279. IEEE (2024)","DOI":"10.1109\/ICASSP48485.2024.10447982"},{"key":"3383_CR47","doi-asserted-by":"crossref","unstructured":"Yang, S., Jin, Y., Lei, J., Zhang, S.: Multi-directional guidance network for fine-grained visual classification. Vis. Comput. 1\u201312 (2024). https:\/\/doi.org\/10.1007\/s00371-023-03226-w","DOI":"10.1007\/s00371-023-03226-w"},{"key":"3383_CR48","unstructured":"Wah, C., Branson, S., Welinder, P., Perona, P., Belongie, S.: The caltech-ucsd birds-200-2011 dataset (2011)"}],"container-title":["Signal, Image and Video Processing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11760-024-03383-y.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11760-024-03383-y\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11760-024-03383-y.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,8,10]],"date-time":"2024-08-10T06:22:36Z","timestamp":1723270956000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11760-024-03383-y"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,6,21]]},"references-count":48,"journal-issue":{"issue":"10","published-print":{"date-parts":[[2024,9]]}},"alternative-id":["3383"],"URL":"https:\/\/doi.org\/10.1007\/s11760-024-03383-y","relation":{"has-preprint":[{"id-type":"doi","id":"10.21203\/rs.3.rs-4134165\/v1","asserted-by":"object"}]},"ISSN":["1863-1703","1863-1711"],"issn-type":[{"value":"1863-1703","type":"print"},{"value":"1863-1711","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,6,21]]},"assertion":[{"value":"20 March 2024","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"19 May 2024","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"14 June 2024","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"21 June 2024","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare that they have no Conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}},{"value":"This article received written informed consent from all authors.","order":3,"name":"Ethics","group":{"name":"EthicsHeading","label":"Ethical and informed consent for data used"}}]}}