{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,4]],"date-time":"2026-04-04T04:08:44Z","timestamp":1775275724229,"version":"3.50.1"},"reference-count":53,"publisher":"Springer Science and Business Media LLC","issue":"3","license":[{"start":{"date-parts":[[2023,4,28]],"date-time":"2023-04-28T00:00:00Z","timestamp":1682640000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2023,4,28]],"date-time":"2023-04-28T00:00:00Z","timestamp":1682640000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100012165","name":"Key Technologies Research and Development Program","doi-asserted-by":"publisher","award":["Grant number: 2020AAA0108103"],"award-info":[{"award-number":["Grant number: 2020AAA0108103"]}],"id":[{"id":"10.13039\/501100012165","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100019233","name":"Chongqing Institute of Green and Intelligent Technology, Chinese Academy of Sciences","doi-asserted-by":"publisher","award":["C2021002"],"award-info":[{"award-number":["C2021002"]}],"id":[{"id":"10.13039\/501100019233","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Vis Comput"],"published-print":{"date-parts":[[2024,3]]},"DOI":"10.1007\/s00371-023-02851-9","type":"journal-article","created":{"date-parts":[[2023,4,28]],"date-time":"2023-04-28T19:02:19Z","timestamp":1682708539000},"page":"1327-1337","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":5,"title":["MAIM: a mixer MLP architecture for image matching"],"prefix":"10.1007","volume":"40","author":[{"given":"Zhiwei","family":"Shen","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7678-3123","authenticated-orcid":false,"given":"Bin","family":"Kong","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xiaoyu","family":"Dong","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2023,4,28]]},"reference":[{"key":"2851_CR1","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-020-01385-0","author":"Y Jin","year":"2020","unstructured":"Jin, Y., Mishkin, D., Mishchuk, A., Matas, J., Fua, P., Yi, K.M., Trulls, E.: Image-matching across wide baselines: from paper to practice. Int. J. Comput. Vis. (2020). https:\/\/doi.org\/10.1007\/s11263-020-01385-0","journal-title":"Int. J. Comput. Vis."},{"key":"2851_CR2","doi-asserted-by":"publisher","unstructured":"Yi, K.M., Trulls, E., Lepetit, V., Fua. P.: LIFT: Learned invariant feature transform. In: ECCV, pp.467\u2013483. (2016). https:\/\/doi.org\/10.1007\/978-3-319-46466-4_28.","DOI":"10.1007\/978-3-319-46466-4_28"},{"key":"2851_CR3","doi-asserted-by":"publisher","unstructured":"DeTone, D., Malisiewicz, T., Rabi-novich, A.: Toward geometric deep slam. In: CVPRW. https:\/\/doi.org\/10.48550\/arXiv.1707.07410.","DOI":"10.48550\/arXiv.1707.07410"},{"key":"2851_CR4","doi-asserted-by":"crossref","unstructured":"DeTone, D., Malisiewicz, T., Rabi-Novich, A.: SuperPoint: self-supervised interest point detection and description. In: CVPRW, pp. 224\u2013236. (2018)","DOI":"10.1109\/CVPRW.2018.00060"},{"key":"2851_CR5","doi-asserted-by":"crossref","unstructured":"Zafrir, O., Boudoukh, G., Izsak, P., Wasserblat, M.: Q8BERT: quantized 8bit BERT. In: CoRR. (2019). https:\/\/arxiv.org\/abs\/1910.06188","DOI":"10.1109\/EMC2-NIPS53020.2019.00016"},{"key":"2851_CR6","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2010.11929","author":"A Dosovitskiy","year":"2021","unstructured":"Dosovitskiy, A., Beyer, L., Kolesnikov, A., Weissenborn, D., Zhai, X., Unterthiner, T., Dehghani, M., Minderer, M., Heigold, G., Gelly, S., Uszkoreit, J., Houlsby, N.: An image is worth 16\u00d716 words: transformers for image recognition at scale. Int. Conf. Learn. Represent. (2021). https:\/\/doi.org\/10.48550\/arXiv.2010.11929","journal-title":"Int. Conf. Learn. Represent."},{"key":"2851_CR7","unstructured":"Touvron, H., Cord, M., Douze, M., Massa, F., Sablayrolles, A., J'egou, H.: Training data-efficient image transformers and distillation through attention. In: International Conference on Machine Learning. (2021)"},{"key":"2851_CR8","doi-asserted-by":"crossref","unstructured":"Sarlin, P.E., DeTone, D., Malisiewicz, T., Rabinovich, A.: SuperGlue: learning feature matching with graph neural networks. In: CVPR. (2020)","DOI":"10.1109\/CVPR42600.2020.00499"},{"key":"2851_CR9","first-page":"6187","volume-title":"COTR: Correspondence Transformer for Matching Across Images","author":"W Jiang","year":"2021","unstructured":"Jiang, W., Trulls, E., Hosang, J., Tagliasacchi, A., Yi, K.M.: COTR: Correspondence Transformer for Matching Across Images, pp. 6187\u20136197. IEEE Publications, New York (2021)"},{"key":"2851_CR10","doi-asserted-by":"publisher","unstructured":"Sun, J., Shen, Z., Wang, Y., Bao, H., Zhou, X.: Loftr: detector-free local feature matching with transformers. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 8918\u20138927. (2021). https:\/\/doi.org\/10.1109\/CVPR46437.2021.00881.","DOI":"10.1109\/CVPR46437.2021.00881"},{"key":"2851_CR11","unstructured":"Vaswani, A., Shazeer, N., Parmar, N., Reit, J.U., Jones, L., Gomez, A.N., Kaiser, L., Polosukhin I.: Attention is all you need. In: NeurIPS. (2017)"},{"key":"2851_CR12","doi-asserted-by":"crossref","unstructured":"Ummenhofer, B., Zhou, H., Uhrig, J., Mayer, N., Ilg, E., Dosovitskiy, A., Brox, T.: Conference on computer vision and pattern recognition, depth and motion network for learning monocular stereo, demon, p. 2. (2017)","DOI":"10.1109\/CVPR.2017.596"},{"key":"2851_CR13","unstructured":"Lan, Z., Chen, M., Goodman, S., Gimpel, K., Sharma, P., Soricut, R.: ALBERT: a lite BERT for self-supervised learning of language representations. (2020). https:\/\/arxiv.org\/abs\/1909.11942"},{"key":"2851_CR14","unstructured":"Tolstikhin, I.O., Houlsby, N., Kolesnikov, A., Beyer, L., Zhai, X., Unterthiner, T., Yung, J., Keysers, D., Uszkoreit, J., Lucic, M., Dosovitskiy, A.: MLP-mixer: an all-MLP architecture for vision. In: Neural Information Processing Systems. (2021)"},{"key":"2851_CR15","unstructured":"Mnih, A., Hinton. G.E.: A scalable hierarchical dis-tributed language model. In: NIPS, pp. 1081\u20131088. (2009)"},{"key":"2851_CR16","unstructured":"Truong, P et al.: GOCor: Bringing globally optimized correspondence volumes into your neural network. Adv. Neural Inf. Process. Syst. https:\/\/arxiv.org\/abs\/2009.07823"},{"key":"2851_CR17","doi-asserted-by":"publisher","unstructured":"Wang, H., Zhu, Y., Green, B., Adam, H., Yuille, A., Chen, L.-C.: Axial-deeplab: stand-alone axial-attention for panoptic segmentation. In: ECCV, vol. 3, pp. 108\u2013126. (2020). https:\/\/doi.org\/10.1007\/978-3-030-58548-8_7","DOI":"10.1007\/978-3-030-58548-8_7"},{"key":"2851_CR18","doi-asserted-by":"crossref","unstructured":"Cavalli, L., Larsson, V., Oswald, M.R., Sattler, T., Pollefeys, M.: Handcrafted Outlier Detection Revisited.In: European Conference on Computer Vision. Springer, Cham, (2020)","DOI":"10.1007\/978-3-030-58529-7_45"},{"key":"2851_CR19","doi-asserted-by":"crossref","unstructured":"Rublee, E., Rabaud, V., Konolige, K., Bradski. G.: ORB: An efficient alternative to SIFT or SURF. In: ICCV. (2011)","DOI":"10.1109\/ICCV.2011.6126544"},{"key":"2851_CR20","doi-asserted-by":"publisher","first-page":"91","DOI":"10.1023\/B:VISI.0000029664.99615.94","volume":"60","author":"DG Lowe","year":"2004","unstructured":"Lowe, D.G.: Distinctive image features from scale-invariant keypoints. Int. J. Comput. Vis. 60, 91\u2013110 (2004). https:\/\/doi.org\/10.1023\/B:VISI.0000029664.99615.94","journal-title":"Int. J. Comput. Vis."},{"key":"2851_CR21","doi-asserted-by":"publisher","unstructured":"Revaud, J., Weinzaepfel, P., Souza, C.D., Pion, N., Csurka, G., Cabon, Y., Humen-berger, M.: R2D2: repeatable and reliable detector and descriptor. In: NeurIPS. (2019). https:\/\/doi.org\/10.48550\/arXiv.1906.06195","DOI":"10.48550\/arXiv.1906.06195"},{"key":"2851_CR22","doi-asserted-by":"publisher","unstructured":"Dusmanu, M., Rocco, I., Pajdla, T., Pollefeys, M., Sivic, J., Torii, A., Sattler, T.: D2-Net: A trainable CNN for joint detection and description of local features. In: CVPR. (2019). https:\/\/doi.org\/10.48550\/arXiv.1905.03561","DOI":"10.48550\/arXiv.1905.03561"},{"key":"2851_CR23","unstructured":"Liu, Y., Shen, Z., Lin, Z., Peng, S., Bao, H., Zhou, X.: GIFT: learning transformation-invariant dense visual descriptors via group cnns. In: NeurIPS. (2019)"},{"key":"2851_CR24","doi-asserted-by":"crossref","unstructured":"Luo, Z., Zhou, L., Bai, X., Chen, H., Zhang, J., Yao, Y., Li, S., Fang, T., Quan, L.: ASLFeat: Learning local features of accurate shape and localization. In: CVPR, pp. 6589\u20136598. (2020)","DOI":"10.1109\/CVPR42600.2020.00662"},{"key":"2851_CR25","unstructured":"M. Tyszkiewicz, P. Fua, E. Trulls. DISK: Learning local features with policy gradient. NeurIPS. (2020)."},{"issue":"5","key":"2851_CR26","doi-asserted-by":"publisher","first-page":"978","DOI":"10.1109\/TPAMI.2010.147","volume":"33","author":"C Liu","year":"2010","unstructured":"Liu, C., Yuen, J., Torralba, A.: SIFT flow: dense correspondence across scenes and its applications. IEEE Trans. Pattern Anal. Mach. Intell. 33(5), 978\u2013994 (2010). https:\/\/doi.org\/10.1109\/TPAMI.2010.147","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"2851_CR27","unstructured":"Choy, C.B., Gwak, J.Y., Savarese, S., Chandraker, M.: Universal correspondence network. In: NeurIPS. (2016)."},{"key":"2851_CR28","doi-asserted-by":"crossref","unstructured":"T. Schmidt, R. Newcombe, D. Fox. Self-supervised visual descriptor learning for dense correspondence. RAL. (2016)","DOI":"10.1109\/LRA.2016.2634089"},{"key":"2851_CR29","unstructured":"Clark, K., Luong, M.T., Le, Q.V., Manning, C.D.: ELECTRA: pre-training text encoders as discriminators rather than generators. In: International Conference on Learning Representations. (2020). https:\/\/arxiv.org\/abs\/2003.10555."},{"key":"2851_CR30","first-page":"246","volume":"5","author":"F Morin","year":"2005","unstructured":"Morin, F., Bengio, Y.: Hierarchical probabilistic neural network language model. Aistats 5, 246\u2013252 (2005)","journal-title":"Aistats"},{"key":"2851_CR31","doi-asserted-by":"crossref","unstructured":"Truong, P., Danelljan, M., Timofte, R.: GLU-Net: global-local universal network for dense flow and correspondences. In: Conference on Computer Vision and Pattern Recognition, pp. 6258\u20136268. (2020)","DOI":"10.1109\/CVPR42600.2020.00629"},{"key":"2851_CR32","doi-asserted-by":"crossref","unstructured":"Carion, N., Massa, F., Synnaeve, G., Usunier, N., Kirillov, A., Zagoruyko, S.: End-to-end object detection with transformers. In: ECCV. (2020)","DOI":"10.1007\/978-3-030-58452-8_13"},{"key":"2851_CR33","unstructured":"Li, X., Han, K., Li, S., Prisacariu, V.: Dual- resolution correspondence networks. In: NeurIPS. (2020)"},{"key":"2851_CR34","doi-asserted-by":"crossref","unstructured":"Ranftl, R., Koltun, V.: Deep fundamental matrix estimation. In: ECCV. (2018)","DOI":"10.1007\/978-3-030-01246-5_18"},{"key":"2851_CR35","doi-asserted-by":"crossref","unstructured":"Yi, K.M., Trulls, E., Ono, Y., Lepetit, V., Salzmann, M., Fua, P.: Learning to find good correspondences. In: CVPR, pp. 2666\u20132674. (2018)","DOI":"10.1109\/CVPR.2018.00282"},{"key":"2851_CR36","doi-asserted-by":"crossref","first-page":"5314","DOI":"10.1109\/TPAMI.2022.3206148","volume":"45","author":"H Touvron","year":"2021","unstructured":"Touvron, H et al.: ResMLP: feedforward networks for image classification with data-efficient training. IEEE Trans. Pattern Anal. Mach. Intell. 45, 5314\u20135321 (2021)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"2851_CR37","unstructured":"Tan, Y., Li, X., Cai, Y., Sun M., Li, P.: S2-MLPv2: improved spatial-shift MLP architecture for vision. (2021). https:\/\/arxiv.org\/abs\/2108.01072"},{"key":"2851_CR38","doi-asserted-by":"publisher","DOI":"10.1016\/j.knosys.2022.109792","volume":"258","author":"H Zhang","year":"2022","unstructured":"Zhang, H., Dong, Z., Li, Bo., He, S.: Multi-Scale MLP-Mixer for image classification. Knowl. Based Syst. 258, 109792 (2022)","journal-title":"Knowl. Based Syst."},{"key":"2851_CR39","doi-asserted-by":"crossref","unstructured":"Tu, Z., Talebi, H., Zhang, H., Yang, F., Milanfar, P., Conrad Bovik A., Li, Y.: MAXIM: multi-axis MLP for image processing. In: 2022 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 5759\u20135770. (2022)","DOI":"10.1109\/CVPR52688.2022.00568"},{"key":"2851_CR40","unstructured":"Kaiming, H., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 770\u2013778. (2016)"},{"key":"2851_CR41","doi-asserted-by":"crossref","unstructured":"Wang, Q., Zhou, X., Hariharan, B., Snavely, N.: Learning feature descriptors using camera pose supervision. (2020). https:\/\/arxiv.org\/abs\/2004.13324","DOI":"10.1007\/978-3-030-58452-8_44"},{"key":"2851_CR42","doi-asserted-by":"crossref","unstructured":"Li, Z., Snavely, N.: Megadepth: learning single-view depth prediction from internet photos. In: CVPR. (2018)","DOI":"10.1109\/CVPR.2018.00218"},{"key":"2851_CR43","unstructured":"Phototourism Challenge, CVPR 2019 Image-Matching Workshop. https:\/\/image-matching-workshop.github.io. Accessed 8 Nov 2019"},{"key":"2851_CR44","doi-asserted-by":"crossref","unstructured":"Sch\u00f6nberger, J.L., Frahm, J.-M.: Structure-from-motion revisited. In: CVPR. (2016)","DOI":"10.1109\/CVPR.2016.445"},{"key":"2851_CR45","doi-asserted-by":"crossref","unstructured":"Goodman, J.: Classes for fast maximum entropy training. In: 2001 IEEE International Conference on Acoustics, Speech, and Signal Processing. Proceedings (Cat. No.01CH37221), vol. 1, pp. 561\u2013564. IEEE (2001)","DOI":"10.1109\/ICASSP.2001.940893"},{"key":"2851_CR46","doi-asserted-by":"crossref","unstructured":"Rocco, I., Arandjelovi\u00b4c, R., Sivic, J.: Efficient neighbourhood consensus networks via submanifold sparse convolutions. In: ECCV. (2020)","DOI":"10.1007\/978-3-030-58545-7_35"},{"key":"2851_CR47","doi-asserted-by":"crossref","unstructured":"Dai, A., Chang, A.X., Savva, M., Halber, M., Funkhouser, T., Nie\u00dfner, M.: ScanNet: richly-annotated 3d reconstructions of indoor scenes. In: CVPR, pp. 5828\u20135839. (2017)","DOI":"10.1109\/CVPR.2017.261"},{"key":"2851_CR48","doi-asserted-by":"crossref","unstructured":"Brachmann, E., Rother, C.: Neural-guided RANSAC: learning where to sample model hypotheses. In: ICCV, pp. 4322\u20134331. (2019)","DOI":"10.1109\/ICCV.2019.00442"},{"key":"2851_CR49","doi-asserted-by":"crossref","unstructured":"Zhang, J., Sun, D., Luo, Z., Yao, A., Zhou, L., Shen, T., Chen, Y., Quan, L., Liao, H.: Learning two-view correspondences and geometry using order-aware network. In: ICCV, pp. 5845\u20135854. (2019)","DOI":"10.1109\/ICCV.2019.00594"},{"key":"2851_CR50","doi-asserted-by":"crossref","unstructured":"Bian, J.W., Lin, W.-Y., Matsushita, Y., Yeung, S.-K., Nguyen, T.-D., Cheng, M.M.: GMS: grid-based motion statistics for fast, ultra-robust feature correspondence. In: CVPR, pp. 4181\u20134190. (2017)","DOI":"10.1109\/CVPR.2017.302"},{"key":"2851_CR51","doi-asserted-by":"publisher","unstructured":"Luo, Z., Shen, T., Zhou, L., Zhang, J., Yao, Y., Li, S., Fang, T., Quan, L.: ContextDesc: local descriptor augmentation with cross-modality context. In: 2019 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 2527\u20132536. (2019). https:\/\/doi.org\/10.1109\/CVPR.2019.00263","DOI":"10.1109\/CVPR.2019.00263"},{"key":"2851_CR52","unstructured":"Ono, Y., Trulls, E., Fua, P., Moo Yi, K.: LF-Net: learning local features from images. In: NeurIPS, pp. 5828\u20132839. (2018)"},{"key":"2851_CR53","unstructured":"Katharopoulos, A., Vyas, A., Pappas, N., Fleuret, F.: Transformers are RNNs: fast autoregressive transformers with linear attention. In: ICML. (2020)"}],"container-title":["The Visual Computer"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00371-023-02851-9.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s00371-023-02851-9\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00371-023-02851-9.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,10,19]],"date-time":"2024-10-19T12:44:42Z","timestamp":1729341882000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s00371-023-02851-9"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,4,28]]},"references-count":53,"journal-issue":{"issue":"3","published-print":{"date-parts":[[2024,3]]}},"alternative-id":["2851"],"URL":"https:\/\/doi.org\/10.1007\/s00371-023-02851-9","relation":{},"ISSN":["0178-2789","1432-2315"],"issn-type":[{"value":"0178-2789","type":"print"},{"value":"1432-2315","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023,4,28]]},"assertion":[{"value":"21 March 2023","order":1,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"28 April 2023","order":2,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors have no relevant financial or non-financial interests to disclose.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflicts of interest"}}]}}