{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,3,27]],"date-time":"2025-03-27T19:37:53Z","timestamp":1743104273515,"version":"3.40.3"},"publisher-location":"Cham","reference-count":42,"publisher":"Springer Nature Switzerland","isbn-type":[{"type":"print","value":"9783031716010"},{"type":"electronic","value":"9783031716027"}],"license":[{"start":{"date-parts":[[2024,1,1]],"date-time":"2024-01-01T00:00:00Z","timestamp":1704067200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,1,1]],"date-time":"2024-01-01T00:00:00Z","timestamp":1704067200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2024]]},"DOI":"10.1007\/978-3-031-71602-7_17","type":"book-chapter","created":{"date-parts":[[2024,9,19]],"date-time":"2024-09-19T22:26:04Z","timestamp":1726784764000},"page":"195-207","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Leveraging Transformers for\u00a0Weakly Supervised Object Localization in\u00a0Unconstrained Videos"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-8066-6907","authenticated-orcid":false,"given":"Shakeeb","family":"Murtaza","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7601-8640","authenticated-orcid":false,"given":"Marco","family":"Pedersoli","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4817-8161","authenticated-orcid":false,"given":"Aydin","family":"Sarraf","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6116-7945","authenticated-orcid":false,"given":"Eric","family":"Granger","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2024,9,19]]},"reference":[{"key":"17_CR1","doi-asserted-by":"crossref","unstructured":"Belharbi, S., Ben\u00a0Ayed, I., McCaffrey, L., Granger, E.: TCAM: temporal class activation maps for object localization in weakly-labeled unconstrained videos. In: WACV (2023)","DOI":"10.1109\/WACV56688.2023.00022"},{"key":"17_CR2","doi-asserted-by":"crossref","unstructured":"Belharbi, S., Murtaza, S., Pedersoli, M., Ayed, I.B., McCaffrey, L., Granger, E.: CoLo-CAM: class activation mapping for object co-localization in weakly-labeled unconstrained videos. CoRR abs\/2303.09044 (2023)","DOI":"10.1109\/WACV56688.2023.00022"},{"key":"17_CR3","doi-asserted-by":"crossref","unstructured":"Belharbi, S., Sarraf, A., Pedersoli, M., Ben\u00a0Ayed, I., McCaffrey, L., Granger, E.: F-CAM: full resolution class activation maps via guided parametric upscaling. In: WACV (2022)","DOI":"10.1109\/WACV51458.2022.00378"},{"key":"17_CR4","doi-asserted-by":"publisher","DOI":"10.1017\/CBO9780511804441","volume-title":"Convex Optimization","author":"S Boyd","year":"2004","unstructured":"Boyd, S., Vandenberghe, L.: Convex Optimization. Cambridge University Press, Cambridge (2004)"},{"key":"17_CR5","doi-asserted-by":"crossref","unstructured":"Caron, M., et al.: Emerging properties in self-supervised vision transformers. In: ICCV (2021)","DOI":"10.1109\/ICCV48922.2021.00951"},{"key":"17_CR6","doi-asserted-by":"crossref","unstructured":"Chang, X., Yang, Y., Long, G., Zhang, C., Hauptmann, A.G.: Dynamic concept composition for zero-example event detection. In: AAAI (2016)","DOI":"10.1609\/aaai.v30i1.10474"},{"key":"17_CR7","doi-asserted-by":"crossref","unstructured":"Chattopadhyay, A., Sarkar, A., Howlader, P., Balasubramanian, V.N.: Grad-CAM++: generalized gradient-based visual explanations for deep convolutional networks. In: WACV (2018)","DOI":"10.1109\/WACV.2018.00097"},{"key":"17_CR8","doi-asserted-by":"crossref","unstructured":"Chen, Y., Cao, Y., Hu, H., Wang, L.: Memory enhanced global-local aggregation for video object detection. In: CVPR (2020)","DOI":"10.1109\/CVPR42600.2020.01035"},{"issue":"9","key":"17_CR9","doi-asserted-by":"publisher","first-page":"1279","DOI":"10.1007\/s11263-019-01183-3","volume":"127","author":"I Croitoru","year":"2019","unstructured":"Croitoru, I., Bogolin, S.V., Leordeanu, M.: Unsupervised learning of foreground object segmentation. IJCV 127(9), 1279\u20131302 (2019)","journal-title":"IJCV"},{"issue":"3","key":"17_CR10","doi-asserted-by":"publisher","first-page":"275","DOI":"10.1007\/s11263-012-0538-3","volume":"100","author":"T Deselaers","year":"2012","unstructured":"Deselaers, T., Alexe, B., Ferrari, V.: Weakly supervised localization and learning with generic knowledge. IJCV 100(3), 275\u2013293 (2012)","journal-title":"IJCV"},{"key":"17_CR11","doi-asserted-by":"crossref","unstructured":"Durand, T., Mordan, T., Thome, N., Cord, M.: WILDCAT: weakly supervised learning of deep convnets for image classification, pointwise localization and segmentation. In: CVPR (2017)","DOI":"10.1109\/CVPR.2017.631"},{"key":"17_CR12","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"568","DOI":"10.1007\/978-3-319-66179-7_65","volume-title":"Medical Image Computing and Computer Assisted Intervention \u2013 MICCAI 2017","author":"X Feng","year":"2017","unstructured":"Feng, X., Yang, J., Laine, A.F., Angelini, E.D.: Discriminative localization in CNNs for weakly-supervised segmentation of pulmonary nodules. In: Descoteaux, M., Maier-Hein, L., Franz, A., Jannin, P., Collins, D.L., Duchesne, S. (eds.) MICCAI 2017. LNCS, vol. 10435, pp. 568\u2013576. Springer, Cham (2017). https:\/\/doi.org\/10.1007\/978-3-319-66179-7_65"},{"key":"17_CR13","unstructured":"Fu, R., Hu, Q., Dong, X., Guo, Y., Gao, Y., Li, B.: Axiom-based Grad-CAM: towards accurate visualization and explanation of CNNs. In: BMVC (2020)"},{"key":"17_CR14","doi-asserted-by":"crossref","unstructured":"Haller, E., Leordeanu, M.: Unsupervised object segmentation in video by efficient selection of highly probable positive features. In: ICCV (2017)","DOI":"10.1109\/ICCV.2017.544"},{"key":"17_CR15","first-page":"5875","volume":"30","author":"P Jiang","year":"2021","unstructured":"Jiang, P., Zhang, C., Hou, Q., Cheng, M., Wei, Y.: LayerCAM: exploring hierarchical class activation maps for localization. TIP 30, 5875\u20135888 (2021)","journal-title":"TIP"},{"issue":"11","key":"17_CR16","doi-asserted-by":"publisher","first-page":"2327","DOI":"10.1109\/TPAMI.2016.2551239","volume":"38","author":"V Kalogeiton","year":"2016","unstructured":"Kalogeiton, V., Ferrari, V., Schmid, C.: Analysing domain shift factors between videos and images for object detection. TPAMI 38(11), 2327\u20132334 (2016)","journal-title":"TPAMI"},{"key":"17_CR17","doi-asserted-by":"crossref","unstructured":"Koh, Y.J., Jang, W., Kim, C.: POD: discovering primary objects in videos based on evolutionary refinement of object recurrence, background, and primary object models. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.121"},{"key":"17_CR18","doi-asserted-by":"crossref","unstructured":"Lee, Y., Kim, J., Grauman, K.: Key-segments for video object segmentation. In: ICCV (2011)","DOI":"10.1109\/ICCV.2011.6126471"},{"key":"17_CR19","doi-asserted-by":"crossref","unstructured":"Lin, Y., et al.: CLIP is also an efficient segmenter: a text-driven approach for weakly supervised semantic segmentation. In: CVPR, pp. 15305\u201315314 (2023)","DOI":"10.1109\/CVPR52729.2023.01469"},{"key":"17_CR20","doi-asserted-by":"crossref","unstructured":"Liu, X., Tao, D., Song, M., Ruan, Y., Chen, C., Bu, J.: Weakly supervised multiclass video segmentation. In: CVPR (2014)","DOI":"10.1109\/CVPR.2014.15"},{"key":"17_CR21","doi-asserted-by":"crossref","unstructured":"L\u00fcddecke, T., Ecker, A.: Image segmentation using text and image prompts. In: CVPR, pp. 7086\u20137096 (2022)","DOI":"10.1109\/CVPR52688.2022.00695"},{"key":"17_CR22","doi-asserted-by":"publisher","DOI":"10.1016\/j.artint.2020.103448","volume":"293","author":"W Luo","year":"2021","unstructured":"Luo, W., Xing, J., Milan, A., Zhang, X., Liu, W., Kim, T.: Multiple object tracking: a literature review. Artif. Intell. 293, 103448 (2021)","journal-title":"Artif. Intell."},{"key":"17_CR23","doi-asserted-by":"crossref","unstructured":"Manen, S., Guillaumin, M., Gool, L.V.: Prime object proposals with randomized prim\u2019s algorithm. In: ICCV (2013)","DOI":"10.1109\/ICCV.2013.315"},{"key":"17_CR24","unstructured":"Murtaza, S., Belharbi, S., Pedersoli, M., Sarraf, A., Granger, E.: Constrained sampling for class-agnostic weakly supervised object localization. In: MAIS (2022)"},{"key":"17_CR25","doi-asserted-by":"publisher","DOI":"10.1016\/j.imavis.2023.104838","volume":"140","author":"S Murtaza","year":"2023","unstructured":"Murtaza, S., Belharbi, S., Pedersoli, M., Sarraf, A., Granger, E.: DiPS: discriminative pseudo-label sampling with self-supervised transformers for weakly supervised object localization. IVC 140, 104838 (2023)","journal-title":"IVC"},{"key":"17_CR26","doi-asserted-by":"crossref","unstructured":"Murtaza, S., Belharbi, S., Pedersoli, M., Sarraf, A., Granger, E.: Discriminative sampling of proposals in self-supervised transformers for weakly supervised object localization. In: WACV (2023)","DOI":"10.1109\/WACVW58289.2023.00021"},{"key":"17_CR27","unstructured":"Omeiza, D., Speakman, S., Cintas, C., Weldemariam, K.: Smooth Grad-CAM++: an enhanced inference level visualization technique for deep convolutional neural network models. CoRR abs\/1908.01224 (2019)"},{"issue":"1","key":"17_CR28","doi-asserted-by":"publisher","first-page":"62","DOI":"10.1109\/TSMC.1979.4310076","volume":"9","author":"N Otsu","year":"1979","unstructured":"Otsu, N.: A threshold selection method from gray-level histograms. IEEE Trans. Syst. Man Cybern. 9(1), 62\u201366 (1979)","journal-title":"IEEE Trans. Syst. Man Cybern."},{"key":"17_CR29","doi-asserted-by":"crossref","unstructured":"Prest, A., Leistner, C., Civera, J., Schmid, C., Ferrari, V.: Learning object class detectors from weakly annotated video. In: CVPR (2012)","DOI":"10.1109\/CVPR.2012.6248065"},{"key":"17_CR30","unstructured":"Radford, A., et al.: Learning transferable visual models from natural language supervision. In: ICML, pp. 8748\u20138763. PMLR (2021)"},{"key":"17_CR31","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1016\/j.imavis.2016.08.015","volume":"56","author":"M Rochan","year":"2016","unstructured":"Rochan, M., Rahman, S., Bruce, N.D.B., Wang, Y.: Weakly supervised object localization and segmentation in videos. IVC 56, 1\u201312 (2016)","journal-title":"IVC"},{"issue":"3","key":"17_CR32","doi-asserted-by":"publisher","first-page":"309","DOI":"10.1145\/1015706.1015720","volume":"23","author":"C Rother","year":"2004","unstructured":"Rother, C., Kolmogorov, V., Blake, A.: \u201cGrabCut\u2019\u2019: interactive foreground extraction using iterated graph cuts. ACM Trans. Graph. 23(3), 309\u2013314 (2004)","journal-title":"ACM Trans. Graph."},{"key":"17_CR33","doi-asserted-by":"crossref","unstructured":"Selvaraju, R.R., Cogswell, M., Das, A., Vedantam, R., Parikh, D., Batra, D.: Grad-CAM: visual explanations from deep networks via gradient-based localization. In: ICCV (2017)","DOI":"10.1109\/ICCV.2017.74"},{"key":"17_CR34","doi-asserted-by":"crossref","unstructured":"Tang, K., Sukthankar, R., Yagnik, J., Fei-Fei, L.: Discriminative segment annotation in weakly labeled video. In: CVPR (2013)","DOI":"10.1109\/CVPR.2013.321"},{"key":"17_CR35","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"524","DOI":"10.1007\/978-3-030-01270-0_31","volume-title":"Computer Vision \u2013 ECCV 2018","author":"M Tang","year":"2018","unstructured":"Tang, M., Perazzi, F., Djelouah, A., Ayed, I.B., Schroers, C., Boykov, Y.: On regularized losses for weakly-supervised CNN segmentation. In: Ferrari, V., Hebert, M., Sminchisescu, C., Weiss, Y. (eds.) ECCV 2018. LNCS, vol. 11220, pp. 524\u2013540. Springer, Cham (2018). https:\/\/doi.org\/10.1007\/978-3-030-01270-0_31"},{"key":"17_CR36","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"388","DOI":"10.1007\/978-3-319-46493-0_24","volume-title":"Computer Vision \u2013 ECCV 2016","author":"P Tokmakov","year":"2016","unstructured":"Tokmakov, P., Alahari, K., Schmid, C.: Weakly-supervised semantic segmentation using motion cues. In: Leibe, B., Matas, J., Sebe, N., Welling, M. (eds.) ECCV 2016. LNCS, vol. 9908, pp. 388\u2013404. Springer, Cham (2016). https:\/\/doi.org\/10.1007\/978-3-319-46493-0_24"},{"key":"17_CR37","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"760","DOI":"10.1007\/978-3-319-46493-0_46","volume-title":"Computer Vision \u2013 ECCV 2016","author":"Y-H Tsai","year":"2016","unstructured":"Tsai, Y.-H., Zhong, G., Yang, M.-H.: Semantic co-segmentation in videos. In: Leibe, B., Matas, J., Sebe, N., Welling, M. (eds.) ECCV 2016. LNCS, vol. 9908, pp. 760\u2013775. Springer, Cham (2016). https:\/\/doi.org\/10.1007\/978-3-319-46493-0_46"},{"key":"17_CR38","doi-asserted-by":"publisher","DOI":"10.1016\/j.ijleo.2020.166251","volume":"229","author":"S Umer","year":"2021","unstructured":"Umer, S., Dawood, H., Yousaf, M.H., Dawood, H., Ahmad, H.: Efficient foreground object segmentation from video by probability weighted moments. Optik 229, 166251 (2021)","journal-title":"Optik"},{"issue":"4","key":"17_CR39","first-page":"1746","volume":"26","author":"D Zhang","year":"2017","unstructured":"Zhang, D., Han, J., Jiang, L., Ye, S., Chang, X.: Revealing event saliency in unconstrained video collection. TIP 26(4), 1746\u20131758 (2017)","journal-title":"TIP"},{"issue":"2","key":"17_CR40","doi-asserted-by":"publisher","first-page":"475","DOI":"10.1109\/TPAMI.2018.2881114","volume":"42","author":"D Zhang","year":"2020","unstructured":"Zhang, D., Han, J., Yang, L., Xu, D.: SPFTN: a joint learning framework for localizing and segmenting objects in weakly labeled videos. TPAMI 42(2), 475\u2013489 (2020)","journal-title":"TPAMI"},{"key":"17_CR41","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"551","DOI":"10.1007\/978-3-319-10584-0_36","volume-title":"Computer Vision \u2013 ECCV 2014","author":"D Zhang","year":"2014","unstructured":"Zhang, D., Javed, O., Shah, M.: Video object co-segmentation by regulated maximum weight cliques. In: Fleet, D., Pajdla, T., Schiele, B., Tuytelaars, T. (eds.) ECCV 2014. LNCS, vol. 8695, pp. 551\u2013566. Springer, Cham (2014). https:\/\/doi.org\/10.1007\/978-3-319-10584-0_36"},{"key":"17_CR42","doi-asserted-by":"crossref","unstructured":"Zhou, B., Khosla, A., Lapedriza, A., Oliva, A., Torralba, A.: Learning deep features for discriminative localization. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.319"}],"container-title":["Lecture Notes in Computer Science","Artificial Neural Networks in Pattern Recognition"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-71602-7_17","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,11,28]],"date-time":"2024-11-28T12:46:44Z","timestamp":1732798004000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-71602-7_17"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024]]},"ISBN":["9783031716010","9783031716027"],"references-count":42,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-71602-7_17","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"type":"print","value":"0302-9743"},{"type":"electronic","value":"1611-3349"}],"subject":[],"published":{"date-parts":[[2024]]},"assertion":[{"value":"19 September 2024","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ANNPR","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"IAPR Workshop on Artificial Neural Networks in Pattern Recognition","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Montreal, QC","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Canada","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"10 October 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"12 October 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"11","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"annpr2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/users.encs.concordia.ca\/~annpr24\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}