{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2024,10,30]],"date-time":"2024-10-30T01:09:53Z","timestamp":1730250593390,"version":"3.28.0"},"reference-count":48,"publisher":"IEEE","license":[{"start":{"date-parts":[[2023,2,10]],"date-time":"2023-02-10T00:00:00Z","timestamp":1675987200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2023,2,10]],"date-time":"2023-02-10T00:00:00Z","timestamp":1675987200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2023,2,10]]},"DOI":"10.1109\/icmre56789.2023.10106583","type":"proceedings-article","created":{"date-parts":[[2023,4,26]],"date-time":"2023-04-26T17:57:20Z","timestamp":1682531840000},"page":"84-85","source":"Crossref","is-referenced-by-count":0,"title":["Similarity Contrastive Capsule Transformation for Image-Text Matching"],"prefix":"10.1109","author":[{"given":"Bin","family":"Zhang","sequence":"first","affiliation":[{"name":"State Grid Digital Technology Holding Co., Ltd\/State Grid Xiongan Financial Technology Group Co., Ltd,Technology Research Institute (Artificial Intelligence Laboratory),Tianjin,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ximin","family":"Sun","sequence":"additional","affiliation":[{"name":"State Grid Digital Technology Holding Co., Ltd\/State Grid Xiongan Financial Technology Group Co., Ltd,Technology Research Institute (Artificial Intelligence Laboratory),Tianjin,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xiaoming","family":"Li","sequence":"additional","affiliation":[{"name":"STATE GRID ECOMMERCE TECHNOLOGY CO.,LTD,Technology Research Institute (Artificial Intelligence Laboratory),Tianjin,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Shuai","family":"Wang","sequence":"additional","affiliation":[{"name":"STATE GRID ECOMMERCE TECHNOLOGY CO.,LTD,Technology Research Institute (Artificial Intelligence Laboratory),Tianjin,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Dan","family":"Liu","sequence":"additional","affiliation":[{"name":"STATE GRID ECOMMERCE TECHNOLOGY CO.,LTD,Technology Research Institute (Artificial Intelligence Laboratory),Tianjin,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jiangkai","family":"Jia","sequence":"additional","affiliation":[{"name":"STATE GRID ECOMMERCE TECHNOLOGY CO.,LTD,Technology Research Institute (Artificial Intelligence Laboratory),Tianjin,China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.442"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00996"},{"key":"ref12","article-title":"Similarity Reasoning and Filtration for Image-Text Matching","author":"diao","year":"2021","journal-title":"Technical Report"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00110"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2018.2797921"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-016-0981-7"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00750"},{"article-title":"Deep fragment embeddings for bidirectional image sentence mapping","year":"2014","author":"karpathy","key":"ref36"},{"article-title":"Dense and diverse capsule networks: Making the capsules learn better","year":"2018","author":"phaye","key":"ref31"},{"article-title":"Cappronet: Deep feature learning via orthogonal projections onto capsule subspaces","year":"2018","author":"zhang","key":"ref30"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01093"},{"article-title":"Capsules for object segmentation","year":"2018","author":"lalonde","key":"ref33"},{"article-title":"Unifying visual-semantic embeddings with multimodal neural language models","year":"2014","author":"kiros","key":"ref10"},{"article-title":"Videocapsulenet: A simplified network for action detection","year":"2018","author":"duarte","key":"ref32"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/TETCI.2019.2892755"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/MIPR49039.2020.00042"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1145\/3240508.3240521"},{"article-title":"Attention-based models for speech recognition","year":"2015","author":"chorowski","key":"ref39"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01246-5_42"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/78.650093"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01093"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00645"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.232"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00591"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00208"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2018.2797921"},{"key":"ref26","first-page":"4904","article-title":"Scaling up visual and vision-language representation learning with noisy text supervision[C]","author":"jia","year":"2021","journal-title":"International Conference on Machine Learning"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01267"},{"article-title":"Multi-Grained Vision Language Pre-Training: Aligning Texts with Visual Concepts[J]","year":"2021","author":"zeng","key":"ref25"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00475"},{"key":"ref20","article-title":"Similarity Reasoning and Filtration for Image-Text Matching","author":"diao","year":"2021","journal-title":"Technical Report"},{"article-title":"Deep fragment embeddings for bidirectional image sentence mapping","year":"2014","author":"karpathy","key":"ref42"},{"key":"ref41","first-page":"740","article-title":"Microsoft coco: Common objects in context","author":"lin","year":"2014","journal-title":"European Conference on Computer Vision"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00585"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00636"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00645"},{"key":"ref43","doi-asserted-by":"crossref","first-page":"1137","DOI":"10.1109\/TPAMI.2016.2577031","article-title":"Faster R-CNN: Towards Real- Time Object Detection with Region Proposal Networks","volume":"39","author":"ren","year":"2017","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"article-title":"Dynamic routing between capsules","year":"2017","author":"sabour","key":"ref28"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00512"},{"key":"ref29","article-title":"Matrix capsules with EM routing","author":"hinton","year":"2018","journal-title":"International Conference on Learning Representations"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01225-0_13"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298932"},{"article-title":"Deep captioning with multimodal recurrent neural networks (m-rnn)","year":"2014","author":"mao","key":"ref9"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00143"},{"key":"ref3","article-title":"Visual question answering using deep learning: A survey and performance analysis","author":"srivastava","year":"2020","journal-title":"Computer Vision and Image Processing 5th International Conference CVIP 2020"},{"article-title":"Vse++: Improving visual-semantic embeddings with hard negatives","year":"2017","author":"faghri","key":"ref6"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.541"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.303"}],"event":{"name":"2023 9th International Conference on Mechatronics and Robotics Engineering (ICMRE)","start":{"date-parts":[[2023,2,10]]},"location":"Shenzhen, China","end":{"date-parts":[[2023,2,12]]}},"container-title":["2023 9th International Conference on Mechatronics and Robotics Engineering (ICMRE)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/10106514\/10106515\/10106583.pdf?arnumber=10106583","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,5,15]],"date-time":"2023-05-15T17:47:24Z","timestamp":1684172844000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10106583\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,2,10]]},"references-count":48,"URL":"https:\/\/doi.org\/10.1109\/icmre56789.2023.10106583","relation":{},"subject":[],"published":{"date-parts":[[2023,2,10]]}}}