{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,11,15]],"date-time":"2025-11-15T07:34:05Z","timestamp":1763192045726,"version":"3.45.0"},"reference-count":62,"publisher":"IEEE","license":[{"start":{"date-parts":[[2025,6,30]],"date-time":"2025-06-30T00:00:00Z","timestamp":1751241600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,6,30]],"date-time":"2025-06-30T00:00:00Z","timestamp":1751241600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100017607","name":"Shenzhen Fundamental Research Program","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100017607","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,6,30]]},"DOI":"10.1109\/ijcnn64981.2025.11227548","type":"proceedings-article","created":{"date-parts":[[2025,11,14]],"date-time":"2025-11-14T18:46:15Z","timestamp":1763145975000},"page":"1-8","source":"Crossref","is-referenced-by-count":0,"title":["Multi-scale Weight-residual Transformer for Uniand Multi-modal Representation Learning"],"prefix":"10.1109","author":[{"given":"Dingxin","family":"Cheng","sequence":"first","affiliation":[{"name":"Shenzhen Research Institute of Shandong University,Shenzhen,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jiawei","family":"Gu","sequence":"additional","affiliation":[{"name":"Shandong University,School of Mechanical, Electrical &amp; Information Engineering"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Kang","family":"Xie","sequence":"additional","affiliation":[{"name":"Key Lab of Information Network Security Ministry of Public Security"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Mengyue","family":"Zhang","sequence":"additional","affiliation":[{"name":"The 54th Research Institute of China Electronics Technology Group Corporation"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Gang","family":"Wang","sequence":"additional","affiliation":[{"name":"The 54th Research Institute of China Electronics Technology Group Corporation"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Bin","family":"Jiang","sequence":"additional","affiliation":[{"name":"Shenzhen Research Institute of Shandong University,Shenzhen,China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","article-title":"An image is worth 16x16 words: Transformers for image recognition at scale","author":"Dosovitskiy","year":"2021","journal-title":"ICLR"},{"doi-asserted-by":"publisher","key":"ref2","DOI":"10.1109\/ICCV48922.2021.00061"},{"doi-asserted-by":"publisher","key":"ref3","DOI":"10.1109\/ICCV48922.2021.00986"},{"doi-asserted-by":"publisher","key":"ref4","DOI":"10.1109\/ICCV48922.2021.01172"},{"doi-asserted-by":"publisher","key":"ref5","DOI":"10.1109\/ICCV48922.2021.00009"},{"year":"2021","author":"Chu","article-title":"Conditional positional encodings for vision transformers","key":"ref6"},{"key":"ref7","article-title":"Pvtv2: Improved baselines with pyramid vision transformer","author":"Wang","year":"2021","journal-title":"CoRR"},{"key":"ref8","first-page":"9355","article-title":"Twins: Revisiting the design of spatial attention in vision transformers","author":"Chu","year":"2021","journal-title":"NeurIPS"},{"key":"ref9","article-title":"Regionvit: Regional-to-local attention for vision trans-formers","author":"Chen","year":"2022","journal-title":"ICLR"},{"doi-asserted-by":"publisher","key":"ref10","DOI":"10.1109\/ICCV48922.2021.00041"},{"key":"ref11","first-page":"4052","article-title":"Image transformer","author":"Parmar","year":"2018","journal-title":"ICML"},{"doi-asserted-by":"publisher","key":"ref12","DOI":"10.1109\/CVPR.2017.683"},{"doi-asserted-by":"publisher","key":"ref13","DOI":"10.48550\/ARXIV.1807.06521"},{"doi-asserted-by":"publisher","key":"ref14","DOI":"10.48550\/ARXIV.1706.03762"},{"key":"ref15","first-page":"33","article-title":"Pyramid methods in image processing","volume":"29","author":"Adelson","year":"1984","journal-title":"RCA Engineer"},{"doi-asserted-by":"publisher","key":"ref16","DOI":"10.1109\/34.56205"},{"doi-asserted-by":"publisher","key":"ref17","DOI":"10.1109\/CVPR.2018.00813"},{"doi-asserted-by":"publisher","key":"ref18","DOI":"10.1109\/ACCESS.2020.3010063"},{"doi-asserted-by":"publisher","key":"ref19","DOI":"10.1007\/978-3-319-10590-1_53"},{"key":"ref20","article-title":"Mobilenets: Efficient convolutional neural net-works for mobile vision applications","author":"Howard","year":"2017","journal-title":"CoRR"},{"doi-asserted-by":"publisher","key":"ref21","DOI":"10.1109\/CVPR.2009.5206848"},{"year":"2009","author":"Krizhevsky","article-title":"Learning multiple layers of features from tiny images","key":"ref22"},{"doi-asserted-by":"publisher","key":"ref23","DOI":"10.1109\/ICVGIP.2008.47"},{"key":"ref24","first-page":"10 347","article-title":"Training data-efficient image transformers & distillation through attention","author":"Touvron","year":"2021","journal-title":"ICML"},{"doi-asserted-by":"publisher","key":"ref25","DOI":"10.1007\/978-0-387-30164-8_251"},{"doi-asserted-by":"publisher","key":"ref26","DOI":"10.1109\/CVPR.2015.7298594"},{"doi-asserted-by":"publisher","key":"ref27","DOI":"10.1109\/CVPR.2016.308"},{"doi-asserted-by":"publisher","key":"ref28","DOI":"10.1609\/aaai.v34i07.7000"},{"doi-asserted-by":"publisher","key":"ref29","DOI":"10.1007\/978-3-030-58589-1_27"},{"doi-asserted-by":"publisher","key":"ref30","DOI":"10.1109\/ICCV.2017.563"},{"doi-asserted-by":"publisher","key":"ref31","DOI":"10.1109\/ICCV.2017.83"},{"doi-asserted-by":"publisher","key":"ref32","DOI":"10.1109\/CVPR52729.2023.01428"},{"doi-asserted-by":"publisher","key":"ref33","DOI":"10.1145\/3503161.3547976"},{"doi-asserted-by":"publisher","key":"ref34","DOI":"10.1109\/CVPR52688.2022.01511"},{"doi-asserted-by":"publisher","key":"ref35","DOI":"10.1609\/aaai.v36i3.20263"},{"doi-asserted-by":"publisher","key":"ref36","DOI":"10.1007\/978-3-031-19830-4_41"},{"doi-asserted-by":"publisher","key":"ref37","DOI":"10.18653\/v1\/2023.acl-long.794"},{"doi-asserted-by":"publisher","key":"ref38","DOI":"10.1109\/CVPR52688.2022.00520"},{"doi-asserted-by":"publisher","key":"ref39","DOI":"10.1109\/ICCV48922.2021.00060"},{"key":"ref40","article-title":"Token merging: Your vit but faster","author":"Bolya","year":"2023","journal-title":"ICLR"},{"doi-asserted-by":"publisher","key":"ref41","DOI":"10.1109\/CVPR52729.2023.00208"},{"doi-asserted-by":"publisher","key":"ref42","DOI":"10.1109\/ICCV51070.2023.01574"},{"doi-asserted-by":"publisher","key":"ref43","DOI":"10.1109\/CVPR52733.2024.01490"},{"doi-asserted-by":"publisher","key":"ref44","DOI":"10.18653\/v1\/2020.acl-main.585"},{"doi-asserted-by":"publisher","key":"ref45","DOI":"10.1609\/aaai.v35i3.16285"},{"doi-asserted-by":"publisher","key":"ref46","DOI":"10.1109\/CVPR46437.2021.00834"},{"doi-asserted-by":"publisher","key":"ref47","DOI":"10.1109\/ICCV48922.2021.00711"},{"doi-asserted-by":"publisher","key":"ref48","DOI":"10.1109\/TIP.2021.3058614"},{"doi-asserted-by":"publisher","key":"ref49","DOI":"10.1145\/3394171.3413967"},{"key":"ref50","article-title":"Look closer to ground better: Weakly-supervised temporal grounding of sentence in video","author":"Chen","year":"2020","journal-title":"CoRR"},{"doi-asserted-by":"publisher","key":"ref51","DOI":"10.1109\/TMM.2021.3096087"},{"doi-asserted-by":"publisher","key":"ref52","DOI":"10.1109\/ICCV48922.2021.00150"},{"doi-asserted-by":"publisher","key":"ref53","DOI":"10.1145\/3503161.3548004"},{"doi-asserted-by":"publisher","key":"ref54","DOI":"10.1109\/WACV56688.2023.00257"},{"doi-asserted-by":"publisher","key":"ref55","DOI":"10.1016\/j.imavis.2024.105168"},{"key":"ref56","first-page":"13 988","article-title":"Clip-it! language-guided video summarization","author":"Narasimhan","year":"2021","journal-title":"NeurIPS"},{"doi-asserted-by":"publisher","key":"ref57","DOI":"10.1525\/9780520940420-020"},{"doi-asserted-by":"publisher","key":"ref58","DOI":"10.1609\/aaai.v31i1.10958"},{"doi-asserted-by":"publisher","key":"ref59","DOI":"10.1109\/CVPR42600.2020.01065"},{"doi-asserted-by":"publisher","key":"ref60","DOI":"10.1109\/TCSVT.2022.3150959"},{"doi-asserted-by":"publisher","key":"ref61","DOI":"10.1007\/978-3-030-58589-1_27"},{"doi-asserted-by":"publisher","key":"ref62","DOI":"10.1145\/3404835.3462874"}],"event":{"name":"2025 International Joint Conference on Neural Networks (IJCNN)","start":{"date-parts":[[2025,6,30]]},"location":"Rome, Italy","end":{"date-parts":[[2025,7,5]]}},"container-title":["2025 International Joint Conference on Neural Networks (IJCNN)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11227166\/11227148\/11227548.pdf?arnumber=11227548","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,11,15]],"date-time":"2025-11-15T07:32:01Z","timestamp":1763191921000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11227548\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,6,30]]},"references-count":62,"URL":"https:\/\/doi.org\/10.1109\/ijcnn64981.2025.11227548","relation":{},"subject":[],"published":{"date-parts":[[2025,6,30]]}}}