{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,7]],"date-time":"2026-07-07T15:57:30Z","timestamp":1783439850612,"version":"3.54.6"},"reference-count":109,"publisher":"Springer Science and Business Media LLC","issue":"11","license":[{"start":{"date-parts":[[2023,7,5]],"date-time":"2023-07-05T00:00:00Z","timestamp":1688515200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0"},{"start":{"date-parts":[[2023,7,5]],"date-time":"2023-07-05T00:00:00Z","timestamp":1688515200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0"}],"funder":[{"DOI":"10.13039\/501100001774","name":"University of Sydney","doi-asserted-by":"crossref","id":[{"id":"10.13039\/501100001774","id-type":"DOI","asserted-by":"crossref"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2023,11]]},"abstract":"<jats:title>Abstract<\/jats:title><jats:p>Recent studies have shown promising results on joint learning of local feature detectors and descriptors. To address the lack of ground-truth keypoint supervision, previous methods mainly inject appropriate knowledge about keypoint attributes into the network to facilitate model learning. In this paper, inspired by traditional corner detectors, we develop an end-to-end deep network, named Deep Corner, which adds a local similarity-based keypoint measure into a plain convolutional network. Deep Corner enables finding reliable keypoints and thus benefits the learning of the distinctive descriptors. Moreover, to improve keypoint localization, we first study previous multi-level keypoint detection strategies and then develop a multi-level U-Net architecture, where the similarity of features at multiple levels can be exploited effectively. Finally, to improve the invariance of descriptors, we propose a feature self-transformation operation, which transforms the learned features adaptively according to the specific local information. The experimental results on several tasks and comprehensive ablation studies demonstrate the effectiveness of our method and the involved components.<\/jats:p>","DOI":"10.1007\/s11263-023-01837-3","type":"journal-article","created":{"date-parts":[[2023,7,5]],"date-time":"2023-07-05T19:01:32Z","timestamp":1688583692000},"page":"2908-2932","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":11,"title":["Deep Corner"],"prefix":"10.1007","volume":"131","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-0682-8645","authenticated-orcid":false,"given":"Shanshan","family":"Zhao","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Mingming","family":"Gong","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1139-4183","authenticated-orcid":false,"given":"Haimei","family":"Zhao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6595-7661","authenticated-orcid":false,"given":"Jing","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7225-5449","authenticated-orcid":false,"given":"Dacheng","family":"Tao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2023,7,5]]},"reference":[{"key":"1837_CR1","doi-asserted-by":"crossref","unstructured":"Arandjelovi\u0107, R., & Zisserman, A. (2012). Three things everyone should know to improve object retrieval. In 2012 IEEE conference on computer vision and pattern recognition IEEE (pp. 2911\u20132918).","DOI":"10.1109\/CVPR.2012.6248018"},{"key":"1837_CR2","doi-asserted-by":"crossref","unstructured":"Balntas, V., Lenc, K., Vedaldi, A., & Mikolajczyk, K. (2017). Hpatches: A benchmark and evaluation of handcrafted and learned local descriptors. In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 5173\u20135182).","DOI":"10.1109\/CVPR.2017.410"},{"key":"1837_CR3","doi-asserted-by":"crossref","unstructured":"Balntas, V., Riba, E., Ponsa, D., & Mikolajczyk, K. (2016). Learning local feature descriptors with triplets and shallow convolutional neural networks. In Bmvc vol. 1 (p. 3).","DOI":"10.5244\/C.30.119"},{"key":"1837_CR4","doi-asserted-by":"crossref","unstructured":"Barroso-Laguna, A., Riba, E., Ponsa, D., & Mikolajczyk, K. (2019). Key.net: Keypoint detection by handcrafted and learned cnn filters. In Proceedings of the IEEE\/CVF international conference on computer vision (ICCV)","DOI":"10.1109\/ICCV.2019.00593"},{"key":"1837_CR5","unstructured":"Barroso-Laguna, A., Verdie, Y., Busam, B., & Mikolajczyk, K. (2020). Hdd-net: Hybrid detector descriptor with mutual interactive learning. In Proceedings of the Asian conference on computer vision."},{"key":"1837_CR6","doi-asserted-by":"crossref","unstructured":"Bay, H., Tuytelaars, T., & Van\u00a0Gool, L. (2006). Surf: Speeded up robust features. In European conference on computer vision. Springer, (pp. 404\u2013417).","DOI":"10.1007\/11744023_32"},{"key":"1837_CR7","doi-asserted-by":"crossref","unstructured":"Bhowmik, A., Gumhold, S., Rother, C., & Brachmann, E. (2020). Reinforced feature points: Optimizing feature detection and description for a high-level task. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition (pp. 4948\u20134957).","DOI":"10.1109\/CVPR42600.2020.00500"},{"key":"1837_CR8","unstructured":"Bian, J. W., Wu, Y. H., Zhao, J., Liu, Y., Zhang, L., Cheng, M. M., & Reid, I. (2019). An evaluation of feature matchers for fundamental matrix estimation. In British machine vision conference (BMVC)."},{"key":"1837_CR9","doi-asserted-by":"crossref","unstructured":"Choy, C., Park, J., & Koltun, V. (2019). Fully convolutional geometric features. In Proceedings of the IEEE\/CVF international conference on computer vision (pp. 8958\u20138966).","DOI":"10.1109\/ICCV.2019.00905"},{"key":"1837_CR10","unstructured":"Christiansen, P. H., Kragh, M. F., Brodskiy, Y., & Karstoft, H. (2019). Unsuperpoint: End-to-end unsupervised interest point detector and descriptor. arXiv preprint arXiv:1907.04011."},{"key":"1837_CR11","doi-asserted-by":"crossref","unstructured":"Chum, O., Werner, T., & Matas, J. (2005). Two-view geometry estimation unaffected by a dominant plane. In 2005 IEEE computer society conference on computer vision and pattern recognition (CVPR\u201905), vol\u00a01 (pp. 772\u2013779) vol. 1, 10.1109\/CVPR.2005.354.","DOI":"10.1109\/CVPR.2005.354"},{"key":"1837_CR12","doi-asserted-by":"crossref","unstructured":"DeTone, D., Malisiewicz, T., & Rabinovich, A. (2018). Superpoint: Self-supervised interest point detection and description. In Proceedings of the IEEE conference on computer vision and pattern recognition workshops (pp. 224\u2013236).","DOI":"10.1109\/CVPRW.2018.00060"},{"key":"1837_CR13","doi-asserted-by":"crossref","unstructured":"Dusmanu, M., Schonberger, J. L., Sinha, S. N., & Pollefeys, M. (2021). Privacy-preserving image features via adversarial affine subspace embeddings. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition (pp. 14267\u201314277).","DOI":"10.1109\/CVPR46437.2021.01404"},{"key":"1837_CR14","doi-asserted-by":"crossref","unstructured":"Dusmanu, M., Rocco, I., Pajdla, T., Pollefeys, M., Sivic, J., Torii, A., & Sattler, T. (2019). D2-net: A trainable CNN for joint description and detection of local features. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition (pp. 8092\u20138101).","DOI":"10.1109\/CVPR.2019.00828"},{"key":"1837_CR15","doi-asserted-by":"crossref","unstructured":"Ebel, P., Mishchuk, A., Yi, K. M., Fua, P., & Trulls, E. (2019a). Beyond Cartesian representations for local descriptors. In Proceedings of the IEEE\/CVF international conference on computer vision (ICCV).","DOI":"10.1109\/ICCV.2019.00034"},{"key":"1837_CR16","doi-asserted-by":"crossref","unstructured":"Ebel, P., Mishchuk, A., Yi, K. M., Fua, P., & Trulls, E. (2019b). Beyond cartesian representations for local descriptors. In Proceedings of the IEEE\/CVF international conference on computer vision (pp. 253\u2013262).","DOI":"10.1109\/ICCV.2019.00034"},{"issue":"6","key":"1837_CR17","doi-asserted-by":"publisher","first-page":"381","DOI":"10.1145\/358669.358692","volume":"24","author":"MA Fischler","year":"1981","unstructured":"Fischler, M. A., & Bolles, R. C. (1981). Random sample consensus: A paradigm for model fitting with applications to image analysis and automated cartography. Communications of the ACM, 24(6), 381\u2013395.","journal-title":"Communications of the ACM"},{"key":"1837_CR18","doi-asserted-by":"crossref","unstructured":"Geiger, A., Lenz, P., & Urtasun, R. (2012). Are we ready for autonomous driving? The kitti vision benchmark suite. In 2012 IEEE conference on computer vision and pattern recognition, IEEE (pp. 3354\u20133361).","DOI":"10.1109\/CVPR.2012.6248074"},{"key":"1837_CR19","doi-asserted-by":"crossref","unstructured":"Girshick, R., Donahue, J., Darrell, T., & Malik, J. (2014). Rich feature hierarchies for accurate object detection and semantic segmentation. In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 580\u2013587).","DOI":"10.1109\/CVPR.2014.81"},{"key":"1837_CR20","unstructured":"Gou, J., Yu, B., Maybank, S. J., & Tao, D. (2020). Knowledge distillation: A survey. arXiv preprint arXiv:2006.05525."},{"key":"1837_CR21","first-page":"10","volume":"15","author":"CG Harris","year":"1988","unstructured":"Harris, C. G., Stephens, M., et al. (1988). A combined corner and edge detector. Alvey Vision Conference Citeseer, 15, 10\u20135244.","journal-title":"Alvey Vision Conference Citeseer"},{"key":"1837_CR22","doi-asserted-by":"crossref","unstructured":"He, K., Lu, Y., & Sclaroff, S. (2018). Local descriptors optimized for average precision. In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 596\u2013605).","DOI":"10.1109\/CVPR.2018.00069"},{"key":"1837_CR23","doi-asserted-by":"crossref","unstructured":"Heinly, J., Schonberger, J. L., Dunn, E., & Frahm, J. M. (2015). Reconstructing the world* in six days*(as captured by the yahoo 100 million image dataset). In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 3287\u20133295).","DOI":"10.1109\/CVPR.2015.7298949"},{"key":"1837_CR24","unstructured":"Hinton, G., Vinyals, O., & Dean, J. (2015). Distilling the knowledge in a neural network. arXiv preprint arXiv:1503.02531."},{"key":"1837_CR25","unstructured":"Jaderberg, M., Simonyan, K., Zisserman, A., & Kavukcuoglu, K. (2015). Spatial transformer networks. arXiv preprint arXiv:1506.02025."},{"issue":"2","key":"1837_CR26","doi-asserted-by":"publisher","first-page":"517","DOI":"10.1007\/s11263-020-01385-0","volume":"129","author":"Y Jin","year":"2021","unstructured":"Jin, Y., Mishkin, D., Mishchuk, A., Matas, J., Fua, P., Yi, K. M., & Trulls, E. (2021). Image matching across wide baselines: From paper to practice. International Journal of Computer Vision, 129(2), 517\u2013547. https:\/\/doi.org\/10.1007\/s11263-020-01385-0","journal-title":"International Journal of Computer Vision"},{"key":"1837_CR27","unstructured":"Jung, Y., Nizam, N. S. S. B. A., & Lee, S. C. (2023). Local feature extraction from salient regions by feature map transformation. arXiv preprint arXiv:2301.10413."},{"key":"1837_CR28","doi-asserted-by":"crossref","unstructured":"Keller, M., Chen, Z., Maffra, F., Schmuck, P., & Chli, M. (2018). Learning deep descriptors with scale-aware triplet networks. In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 2762\u20132770).","DOI":"10.1109\/CVPR.2018.00292"},{"issue":"4","key":"1837_CR29","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3072959.3073599","volume":"36","author":"A Knapitsch","year":"2017","unstructured":"Knapitsch, A., Park, J., Zhou, Q. Y., & Koltun, V. (2017). Tanks and temples: Benchmarking large-scale scene reconstruction. ACM Transactions on Graphics (ToG), 36(4), 1\u201313.","journal-title":"ACM Transactions on Graphics (ToG)"},{"key":"1837_CR30","first-page":"1097","volume":"25","author":"A Krizhevsky","year":"2012","unstructured":"Krizhevsky, A., Sutskever, I., & Hinton, G. E. (2012). Imagenet classification with deep convolutional neural networks. Advances in Neural Information Processing Systems, 25, 1097\u20131105.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"1837_CR31","doi-asserted-by":"crossref","unstructured":"Lee, J., Kim, B., & Cho, M. (2022). Self-supervised equivariant learning for oriented keypoint detection. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition (pp. 4847\u20134857).","DOI":"10.1109\/CVPR52688.2022.00480"},{"key":"1837_CR32","doi-asserted-by":"crossref","unstructured":"Li, J., Li, G., & Li, T. H. (2022). Attention guided invariance selection for local feature descriptors. ICASSP 2022\u20132022 IEEE international conference on acoustics (pp. 2215\u20132219). IEEE: Speech and Signal Processing (ICASSP).","DOI":"10.1109\/ICASSP43922.2022.9746419"},{"key":"1837_CR33","doi-asserted-by":"crossref","unstructured":"Li, K., Wang, L., Liu, L., Ran, Q., Xu, K., & Guo, Y. (2022b). Decoupling makes weakly supervised local feature better. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition (pp. 15838\u201315848).","DOI":"10.1109\/CVPR52688.2022.01538"},{"key":"1837_CR34","doi-asserted-by":"crossref","unstructured":"Lin, T. Y., Doll\u00e1r, P., Girshick, R., He, K., Hariharan, B., & Belongie, S. (2017). Feature pyramid networks for object detection. In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 2117\u20132125).","DOI":"10.1109\/CVPR.2017.106"},{"key":"1837_CR35","doi-asserted-by":"publisher","first-page":"15","DOI":"10.1007\/978-3-642-33718-5_2","volume-title":"Computer Vision\u2013ECCV 2012: 12th European Conference on Computer Vision, Florence, Italy, October 7-13, 2012, Proceedings, Part I","author":"Y Li","year":"2012","unstructured":"Li, Y., Snavely, N., Huttenlocher, D., & Fua, P. (2012). Worldwide Pose Estimation Using 3D Point Clouds. In A. Fitzgibbon, S. Lazebnik, P. Perona, Y. Sato, & C. Schmid (Eds.), Computer Vision\u2013ECCV 2012: 12th European Conference on Computer Vision, Florence, Italy, October 7-13, 2012, Proceedings, Part I (pp. 15\u201329). Berlin, Heidelberg: Springer Berlin Heidelberg. https:\/\/doi.org\/10.1007\/978-3-642-33718-5_2"},{"key":"1837_CR36","doi-asserted-by":"publisher","unstructured":"Liu, X., Meng, C., Tian, F. P., & Feng, W. (2021). Dgd-net: Local descriptor guided keypoint detection network. In: 2021 IEEE international conference on multimedia and expo (ICME) (pp. 1\u20136). https:\/\/doi.org\/10.1109\/ICME51207.2021.9428406.","DOI":"10.1109\/ICME51207.2021.9428406"},{"key":"1837_CR37","doi-asserted-by":"crossref","unstructured":"Long, J., Shelhamer, E., & Darrell, T. (2015). Fully convolutional networks for semantic segmentation. In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 3431\u20133440).","DOI":"10.1109\/CVPR.2015.7298965"},{"issue":"2","key":"1837_CR38","doi-asserted-by":"publisher","first-page":"91","DOI":"10.1023\/B:VISI.0000029664.99615.94","volume":"60","author":"DG Lowe","year":"2004","unstructured":"Lowe, D. G. (2004). Distinctive image features from scale-invariant keypoints. International Journal of Computer Vision, 60(2), 91\u2013110. https:\/\/doi.org\/10.1023\/B:VISI.0000029664.99615.94","journal-title":"International Journal of Computer Vision"},{"key":"1837_CR39","doi-asserted-by":"crossref","unstructured":"Luo, Z., Shen, T., Zhou, L., Zhang, J., Yao, Y., Li, S., Fang, T., & Quan, L. (2019). Contextdesc: Local descriptor augmentation with cross-modality context. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition (pp. 2527\u20132536).","DOI":"10.1109\/CVPR.2019.00263"},{"key":"1837_CR40","doi-asserted-by":"crossref","unstructured":"Luo, Z., Zhou, L., Bai, X., Chen, H., Zhang, J., Yao, Y., Li, S., Fang, T., & Quan, L. (2020). Aslfeat: Learning local features of accurate shape and localization. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition (pp. 6589\u20136598).","DOI":"10.1109\/CVPR42600.2020.00662"},{"key":"1837_CR41","doi-asserted-by":"publisher","first-page":"170","DOI":"10.1007\/978-3-030-01240-3_11","volume-title":"Computer Vision\u2013ECCV 2018: 15th European Conference, Munich, Germany, September 8\u201314, 2018, Proceedings, Part IX","author":"Z Luo","year":"2018","unstructured":"Luo, Z., Shen, T., Zhou, L., Zhu, S., Zhang, R., Yao, Y., Fang, T., & Quan, L. (2018). GeoDesc: Learning Local Descriptors by Integrating Geometry Constraints. In V. Ferrari, M. Hebert, C. Sminchisescu, & Y. Weiss (Eds.), Computer Vision\u2013ECCV 2018: 15th European Conference, Munich, Germany, September 8\u201314, 2018, Proceedings, Part IX (pp. 170\u2013185). Cham: Springer International Publishing. https:\/\/doi.org\/10.1007\/978-3-030-01240-3_11"},{"key":"1837_CR42","doi-asserted-by":"crossref","unstructured":"Mai, G., Cao, K., Yuen, P. C., & Jain, A. K. (2018). On the reconstruction of face images from deep face templates. IEEE Transactions on Pattern Analysis and Machine Intelligence. 41(5), 1188\u20131202.","DOI":"10.1109\/TPAMI.2018.2827389"},{"issue":"1","key":"1837_CR43","doi-asserted-by":"publisher","first-page":"63","DOI":"10.1023\/B:VISI.0000027790.02288.f2","volume":"60","author":"K Mikolajczyk","year":"2004","unstructured":"Mikolajczyk, K., & Mikolajczyk, K. (2004). Scale & affine invariant interest point detectors. International Journal of Computer Vision, 60(1), 63\u201386. https:\/\/doi.org\/10.1023\/B:VISI.0000027790.02288.f2","journal-title":"International Journal of Computer Vision"},{"issue":"10","key":"1837_CR44","doi-asserted-by":"publisher","first-page":"1615","DOI":"10.1109\/TPAMI.2005.188","volume":"27","author":"K Mikolajczyk","year":"2005","unstructured":"Mikolajczyk, K., & Schmid, C. (2005). A performance evaluation of local descriptors. IEEE Transactions on Pattern Analysis and Machine Intelligence, 27(10), 1615\u20131630.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"1837_CR45","unstructured":"Mishchuk, A., Mishkin, D., Radenovic, F., & Matas, J. (2017). Working hard to know your neighbor\u2019s margins: Local descriptor learning loss. arXiv preprint arXiv:1705.10872."},{"key":"1837_CR46","doi-asserted-by":"publisher","first-page":"287","DOI":"10.1007\/978-3-030-01240-3_18","volume-title":"Computer Vision\u2013ECCV 2018: 15th European Conference, Munich, Germany, September 8\u201314, 2018, Proceedings, Part IX","author":"D Mishkin","year":"2018","unstructured":"Mishkin, D., Radenovi\u0107, F., & Matas, J. (2018). Repeatability Is Not Enough: Learning Affine Regions via Discriminability. In V. Ferrari, M. Hebert, C. Sminchisescu, & Y. Weiss (Eds.), Computer Vision\u2013ECCV 2018: 15th European Conference, Munich, Germany, September 8\u201314, 2018, Proceedings, Part IX (pp. 287\u2013304). Cham: Springer International Publishing. https:\/\/doi.org\/10.1007\/978-3-030-01240-3_18"},{"key":"1837_CR47","unstructured":"Moravec, H. P. (1977). Techniques towards automatic visual obstacle avoidance. In Proceedings of the 5th international joint conference on artificial intelligence. Cambridge, MA, USA, August (pp. 22\u201325)."},{"key":"1837_CR48","doi-asserted-by":"crossref","unstructured":"Ng, T., Kim, H. J., Lee, V. T., DeTone, D., Yang, T. Y., Shen, T., Ilg, E., Balntas, V., Mikolajczyk, K., & Sweeney, C. (2022). Ninjadesc: Content-concealing visual descriptors via adversarial learning. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition (pp. 12797\u201312807).","DOI":"10.1109\/CVPR52688.2022.01246"},{"key":"1837_CR49","doi-asserted-by":"crossref","unstructured":"Noh, H., Araujo, A., Sim, J., Weyand, T., & Han, B. (2017). Large-scale image retrieval with attentive deep local features. In Proceedings of the IEEE international conference on computer vision (pp. 3456\u20133465).","DOI":"10.1109\/ICCV.2017.374"},{"key":"1837_CR50","unstructured":"Ono, Y., Trulls, E., Fua, P., & Yi, K. M. (2018). Lf-net: Learning local features from images. In Proceedings of the 32nd international conference on neural information processing systems (pp. 6237\u20136247)."},{"key":"1837_CR51","doi-asserted-by":"publisher","first-page":"707","DOI":"10.1007\/978-3-030-58536-5_42","volume-title":"Computer Vision\u2013ECCV 2020: 16th European Conference, Glasgow, UK, August 23\u201328, 2020, Proceedings, Part II","author":"R Pautrat","year":"2020","unstructured":"Pautrat, R., Larsson, V., Oswald, M. R., & Pollefeys, M. (2020). Online Invariance Selection for Local Feature Descriptors. In A. Vedaldi, H. Bischof, T. Brox, & J.-M. Frahm (Eds.), Computer Vision\u2013ECCV 2020: 16th European Conference, Glasgow, UK, August 23\u201328, 2020, Proceedings, Part II (pp. 707\u2013724). Cham: Springer International Publishing. https:\/\/doi.org\/10.1007\/978-3-030-58536-5_42"},{"key":"1837_CR52","unstructured":"Potje, G., Martins, R., Chamone, F., & Nascimento, E. (2021). Extracting deformation-aware local features by learning to deform. Advances in Neural Information Processing Systems p. 34."},{"key":"1837_CR53","doi-asserted-by":"crossref","unstructured":"Radenovi\u0107. F., Tolias, G., & Chum, O. (2016). CNN image retrieval learns from bow: Unsupervised fine-tuning with hard examples. In European conference on computer vision. Springer (pp. 3\u201320).","DOI":"10.1007\/978-3-319-46448-0_1"},{"key":"1837_CR54","doi-asserted-by":"crossref","unstructured":"Revaud, J., Leroy, V., Weinzaepfel, P., & Chidlovskii, B. (2022). Pump: Pyramidal and uniqueness matching priors for unsupervised learning of local descriptors. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition (pp. 3926\u20133936).","DOI":"10.1109\/CVPR52688.2022.00390"},{"key":"1837_CR55","unstructured":"Revaud, J., Weinzaepfel, P., de\u00a0Souza, C. R., & Humenberger, M. (2019). R2D2: Repeatable and reliable detector and descriptor. In NeurIPS."},{"key":"1837_CR56","doi-asserted-by":"publisher","unstructured":"Richardson, A., & Olson, E. (2013). Learning convolutional filters for interest point detection. In 2013 IEEE international conference on robotics and automation (pp. 631\u2013637). https:\/\/doi.org\/10.1109\/ICRA.2013.6630639.","DOI":"10.1109\/ICRA.2013.6630639"},{"key":"1837_CR57","doi-asserted-by":"crossref","unstructured":"Ronneberger, O., Fischer, P., & Brox, T. (2015). U-net: Convolutional networks for biomedical image segmentation. In International conference on medical image computing and computer-assisted intervention. Springer (pp. 234\u2013241).","DOI":"10.1007\/978-3-319-24574-4_28"},{"key":"1837_CR58","doi-asserted-by":"crossref","unstructured":"Santellani, E., Sormann, C., Rossi, M., Kuhn, A., & Fraundorfer, F. (2022). Md-net: Multi-detector for local feature extraction. In 2022 26th International conference on pattern recognition (ICPR). IEEE (pp. 3944\u20133951).","DOI":"10.1109\/ICPR56361.2022.9956504"},{"key":"1837_CR59","doi-asserted-by":"crossref","unstructured":"Sarlin, P. E., DeTone, D., Malisiewicz, T., & Rabinovich, A. (2020). Superglue: Learning feature matching with graph neural networks. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition (pp. 4938\u20134947).","DOI":"10.1109\/CVPR42600.2020.00499"},{"key":"1837_CR60","doi-asserted-by":"crossref","unstructured":"Sattler, T., Weyand, T., Leibe, B., & Kobbelt, L. (2012). Image retrieval for image-based localization revisited. In BMVC, vol. 1 (p. 4).","DOI":"10.5244\/C.26.76"},{"key":"1837_CR61","doi-asserted-by":"crossref","unstructured":"Savinov, N., Seki, A., Ladicky, L., Sattler, T., & Pollefeys, M. (2017). Quad-networks: Unsupervised learning to rank for interest point detection. In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 1822\u20131830).","DOI":"10.1109\/CVPR.2017.418"},{"key":"1837_CR62","doi-asserted-by":"crossref","unstructured":"Sch\u00f6nberger, J. L., Zheng, E., Frahm, J. M., & Pollefeys, M. (2016). Pixelwise view selection for unstructured multi-view stereo. In European conference on computer Vision. Springer (pp. 501\u2013518).","DOI":"10.1007\/978-3-319-46487-9_31"},{"key":"1837_CR63","doi-asserted-by":"crossref","unstructured":"Schonberger, J. L., & Frahm, J. M. (2016). Structure-from-motion revisited. In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 4104\u20134113).","DOI":"10.1109\/CVPR.2016.445"},{"key":"1837_CR64","doi-asserted-by":"crossref","unstructured":"Schonberger, J. L., Hardmeier, H., Sattler, T., & Pollefeys, M. (2017). Comparative evaluation of hand-crafted and learned local features. In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 1482\u20131491).","DOI":"10.1109\/CVPR.2017.736"},{"key":"1837_CR65","unstructured":"Shen, T., Luo, Z., Zhou, L., Zhang, R., Zhu, S., Fang, T., & Quan, L. (2018). Matchable image retrieval by learning from surface reconstruction. In The Asian conference on computer vision (ACCV)."},{"key":"1837_CR66","doi-asserted-by":"crossref","unstructured":"Shen, X., Wang, C., Li, X., Yu, Z., Li, J., Wen, C., Cheng, M., & He, Z. (2019). Rf-net: An end-to-end image matching network based on receptive field. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition (pp. 8132\u20138140).","DOI":"10.1109\/CVPR.2019.00832"},{"key":"1837_CR67","unstructured":"Shi, J., et\u00a0al. (1994). Good features to track. In 1994 Proceedings of IEEE conference on computer vision and pattern recognition. IEEE (pp. 593\u2013600)."},{"issue":"8","key":"1837_CR68","doi-asserted-by":"publisher","first-page":"3204","DOI":"10.1109\/TIP.2013.2259834","volume":"22","author":"PL Shui","year":"2013","unstructured":"Shui, P. L., & Zhang, W. C. (2013). Corner detection and classification using anisotropic directional derivative representations. IEEE Transactions on Image Processing, 22(8), 3204\u20133218.","journal-title":"IEEE Transactions on Image Processing"},{"key":"1837_CR69","unstructured":"Simonyan, K., & Zisserman, A. (2015). Very deep convolutional networks for large-scale image recognition. In International conference on learning representations."},{"key":"1837_CR70","doi-asserted-by":"crossref","unstructured":"Simo-Serra, E., Trulls, E., Ferraz, L., Kokkinos, I., Fua, P., & Moreno-Noguer, F. (2015). Discriminative learning of deep convolutional feature point descriptors. In Proceedings of the IEEE international conference on computer vision (pp. 118\u2013126).","DOI":"10.1109\/ICCV.2015.22"},{"key":"1837_CR71","doi-asserted-by":"crossref","unstructured":"Siqueira, H., Ruhkamp, P., Halfaoui, I., Karmann, M., & Urfalioglu, O. (2022). Looking beyond corners: Contrastive learning of visual representations for keypoint detection and description extraction. In 2022 international joint conference on neural networks (IJCNN). IEEE (pp. 1\u20138).","DOI":"10.1109\/IJCNN55064.2022.9892803"},{"key":"1837_CR72","doi-asserted-by":"crossref","unstructured":"Sivic, Z. (2003). Video google: A text retrieval approach to object matching in videos. In Proceedings ninth IEEE international conference on computer vision (pp. 1470\u20131477) vol. 2 |DOIurl10.1109\/ICCV.2003.1238663.","DOI":"10.1109\/ICCV.2003.1238663"},{"key":"1837_CR73","doi-asserted-by":"crossref","unstructured":"Sturm, J., Engelhard, N., Endres, F., Burgard, W., & Cremers, D. (2012). A benchmark for the evaluation of RGB-D slam systems. In 2012 IEEE\/RSJ international conference on intelligent robots and systems. IEEE (pp. 573\u2013580).","DOI":"10.1109\/IROS.2012.6385773"},{"key":"1837_CR74","doi-asserted-by":"crossref","unstructured":"Sun, J., Shen, Z., Wang, Y., Bao, H., & Zhou, X. (2021). Loftr: Detector-free local feature matching with transformers. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition (pp. 8922\u20138931).","DOI":"10.1109\/CVPR46437.2021.00881"},{"key":"1837_CR75","doi-asserted-by":"crossref","unstructured":"Sun, S., Park, U., Sun, S., & Liu, R. (2022b). Fusion representation learning for keypoint detection and description. The Visual Computer pp 1\u201310.","DOI":"10.1007\/s00371-022-02689-7"},{"key":"1837_CR76","doi-asserted-by":"crossref","unstructured":"Sun, J., Zhu, J., & Ji, L. (2022a). Shared coupling-bridge for weakly supervised local feature learning. arXiv preprint arXiv:2212.07047.","DOI":"10.1109\/TMM.2023.3278172"},{"key":"1837_CR77","doi-asserted-by":"crossref","unstructured":"Suwanwimolkul, S., Komorita, S., & Tasaka, K. (2021). Learning of low-level feature keypoints for accurate and robust detection. In Proceedings of the IEEE\/CVF winter conference on applications of computer vision (pp. 2262\u20132271).","DOI":"10.1109\/WACV48630.2021.00231"},{"issue":"7","key":"1837_CR78","doi-asserted-by":"publisher","first-page":"1455","DOI":"10.1109\/TPAMI.2016.2598331","volume":"39","author":"L Sv\u00e4rm","year":"2017","unstructured":"Sv\u00e4rm, L., Enqvist, O., Kahl, F., & Oskarsson, M. (2017). City-scale localization for cameras with known vertical direction. IEEE Transactions on Pattern Analysis and Machine Intelligence, 39(7), 1455\u20131461. https:\/\/doi.org\/10.1109\/TPAMI.2016.2598331","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"1837_CR79","doi-asserted-by":"crossref","unstructured":"Tian, Y., Balntas, V., Ng, T., Barroso-Laguna, A., Demiris, Y., & Mikolajczyk, K. (2020a). D2d: Keypoint extraction with describe to detect approach. In Proceedings of the Asian conference on computer vision.","DOI":"10.1007\/978-3-030-69535-4_14"},{"key":"1837_CR80","unstructured":"Tian, Y., Barroso\u00a0Laguna, A., Ng, T., Balntas, V., & Mikolajczyk, K. (2020b). Hynet: Learning local descriptor with hybrid similarity measure and triplet loss. Advances in Neural Information Processing Systems 33."},{"key":"1837_CR81","doi-asserted-by":"crossref","unstructured":"Tian, Y., Fan, B., & Wu, F. (2017). L2-net: Deep learning of discriminative patch descriptor in euclidean space. In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 661\u2013669).","DOI":"10.1109\/CVPR.2017.649"},{"key":"1837_CR82","doi-asserted-by":"crossref","unstructured":"Tian, Y., Yu, X., Fan, B., Wu, F., Heijnen, H., & Balntas, V. (2019). Sosnet: Second order similarity regularization for local descriptor learning. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition (pp. 11016\u201311025).","DOI":"10.1109\/CVPR.2019.01127"},{"issue":"2","key":"1837_CR83","doi-asserted-by":"publisher","first-page":"75","DOI":"10.1016\/S0262-8856(97)00056-5","volume":"16","author":"M Trajkovi\u0107","year":"1998","unstructured":"Trajkovi\u0107, M., & Hedley, M. (1998). Fast corner detection. Image and Vision Computing, 16(2), 75\u201387.","journal-title":"Image and Vision Computing"},{"key":"1837_CR84","unstructured":"Tyszkiewicz, M., Fua, P., & Trulls, E. (2020). Disk: Learning local features with policy gradient. Advances in Neural Information Processing Systems 33."},{"key":"1837_CR85","unstructured":"Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A.N., Kaiser, \u0141., & Polosukhin, I. (2017). Attention is all you need. Advances in Neural Information Processing Systems 30."},{"key":"1837_CR86","doi-asserted-by":"crossref","unstructured":"Verdie, Y., Yi, K., Fua, P., & Lepetit, V. (2015). Tilde: A temporally invariant learned detector. In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 5279\u20135288).","DOI":"10.1109\/CVPR.2015.7299165"},{"key":"1837_CR87","doi-asserted-by":"crossref","unstructured":"Wang, Z., Li, X., & Li, Z. (2021). Local representation is not enough: Soft point-wise transformer for descriptor and detector of local features. In Proceedings of the thirtieth international joint conference on artificial intelligence, IJCAI 2021, virtual event\/Montreal, Canada, 19\u201327 August 2021 ijcai.org (pp. 1150\u20131156).","DOI":"10.24963\/ijcai.2021\/159"},{"key":"1837_CR88","doi-asserted-by":"crossref","unstructured":"Wang, X., Liu, Z., Hu, Y., Xi, W., Yu, W., & Zou, D. (2022d). Featurebooster: Boosting feature descriptors with a lightweight neural network. arXiv preprint arXiv:2211.15069.","DOI":"10.1109\/CVPR52729.2023.00737"},{"key":"1837_CR89","unstructured":"Wang, C., Zhang, G., Cheng, Z., & Zhou, W. (2022c). Rethinking low-level features for interest point detection and description. In Proceedings of the Asian conference on computer vision (pp. 2059\u20132074)."},{"key":"1837_CR90","doi-asserted-by":"crossref","unstructured":"Wang, C., Xu, R., Xu, S., Meng, W., & Zhang, X. (2022a). Cndesc: Cross normalization for local descriptors learning. IEEE Transactions on Multimedia.","DOI":"10.1109\/TMM.2022.3169331"},{"key":"1837_CR91","doi-asserted-by":"publisher","first-page":"2388","DOI":"10.1609\/aaai.v36i2.20138","volume":"36","author":"C Wang","year":"2022","unstructured":"Wang, C., Xu, R., Zhang, Y., Xu, S., Meng, W., Fan, B., & Zhang, X. (2022). Mtldesc: Looking wider to describe better. Proceedings of the AAAI Conference on Artificial Intelligence, 36, 2388\u20132396.","journal-title":"Proceedings of the AAAI Conference on Artificial Intelligence"},{"key":"1837_CR92","doi-asserted-by":"crossref","unstructured":"Wang, Q., Zhou, X., Hariharan, B., & Snavely, N. (2020). Learning feature descriptors using camera pose supervision. In European conference on computer vision. Springer (pp. 757\u2013774).","DOI":"10.1007\/978-3-030-58452-8_44"},{"key":"1837_CR93","doi-asserted-by":"crossref","unstructured":"Weinzaepfel, P., & J\u00e9gou H, P\u00e9rez, P. (2011). Reconstructing an image from its local descriptors. In CVPR 2011. IEEE (pp. 337\u2013344).","DOI":"10.1109\/CVPR.2011.5995616"},{"key":"1837_CR94","doi-asserted-by":"crossref","unstructured":"Wiles, O., Ehrhardt, S., & Zisserman, A. (2021). Co-attention for conditioned image matching. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition (pp. 15920\u201315929).","DOI":"10.1109\/CVPR46437.2021.01566"},{"key":"1837_CR95","doi-asserted-by":"crossref","unstructured":"Wilson, K., & Snavely, N. (2014). Robust global translations with 1dsfm. In European conference on computer vision. Springer (pp. 61\u201375).","DOI":"10.1007\/978-3-319-10578-9_5"},{"key":"1837_CR96","unstructured":"Yang, T. Y., Nguyen, D. K., Heijnen, H., & Balntas, V. (2020). Ur2kid: Unifying retrieval, keypoint detection, and keypoint description without local correspondence supervision. arXiv preprint arXiv:2001.07252."},{"issue":"1","key":"1837_CR97","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1007\/s00138-021-01266-7","volume":"33","author":"N Yang","year":"2022","unstructured":"Yang, N., Han, Y., Fang, J., Zhong, W., & Xu, A. (2022). Up-net: Unique keypoint description and detection net. Machine Vision and Applications, 33(1), 1\u201313.","journal-title":"Machine Vision and Applications"},{"issue":"11","key":"1837_CR98","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1007\/s11432-021-3364-5","volume":"65","author":"P Yan","year":"2022","unstructured":"Yan, P., Tan, Y., & Tai, Y. (2022). Repeatable adaptive keypoint detection via self-supervised learning. Science China Information Sciences, 65(11), 1\u201325.","journal-title":"Science China Information Sciences"},{"key":"1837_CR99","doi-asserted-by":"crossref","unstructured":"Yi, K. M., Trulls, E., Lepetit, V., & Fua, P. (2016a). Lift: Learned invariant feature transform. In European conference on computer vision. Springer (pp. 467\u2013483).","DOI":"10.1007\/978-3-319-46466-4_28"},{"key":"1837_CR100","doi-asserted-by":"crossref","unstructured":"Yi, K. M., Verdie, Y., Fua, P., & Lepetit, V. (2016b). Learning to assign orientations to feature points. In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 107\u2013116).","DOI":"10.1109\/CVPR.2016.19"},{"key":"1837_CR101","doi-asserted-by":"crossref","unstructured":"Yi, K. M., Verdie, Y., Fua, P., & Lepetit, V. (2016c). Learning to assign orientations to feature points. In Proceedings of the IEEE conference on computer vision and pattern recognition (CVPR).","DOI":"10.1109\/CVPR.2016.19"},{"key":"1837_CR102","unstructured":"Zhang, Y., Wang, J., Xu, S., Liu, X., & Zhang, X. (2020). Mlifeat: Multi-level information fusion based deep local features. In Proceedings of the Asian conference on computer vision."},{"key":"1837_CR103","doi-asserted-by":"crossref","unstructured":"Zhang, X., Yu, F. X., Karaman, S., & Chang, S. F. (2017). Learning discriminative and transformation covariant local feature detectors. In Proceedings of the IEEE conference on computer vision and pattern recognition (CVPR).","DOI":"10.1109\/CVPR.2017.523"},{"issue":"2","key":"1837_CR104","doi-asserted-by":"publisher","first-page":"161","DOI":"10.1023\/A:1007941100561","volume":"27","author":"Z Zhang","year":"1998","unstructured":"Zhang, Z. (1998). Determining the epipolar geometry and its uncertainty: A review. International Journal of Computer Vision, 27(2), 161\u2013195.","journal-title":"International Journal of Computer Vision"},{"key":"1837_CR105","doi-asserted-by":"crossref","unstructured":"Zhang, Z., Sattler, T., & Scaramuzza, D. (2021). Reference pose generation for long-term visual localization via learned features and view synthesis. International Journal of Computer Vision, 129(4), 821\u2013844.","DOI":"10.1007\/s11263-020-01399-8"},{"key":"1837_CR106","doi-asserted-by":"crossref","unstructured":"Zhang, W., Sun, C., & Gao, Y. (2023). Image intensity variation information for interest point detection. IEEE Transactions on Pattern Analysis and Machine Intelligence.","DOI":"10.1109\/TPAMI.2023.3240129"},{"key":"1837_CR107","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2022.3155927","author":"X Zhao","year":"2022","unstructured":"Zhao, X., Wu, X., Miao, J., Chen, W., Chen, P. C. Y., & Li, Z. (2022). Alike: Accurate and lightweight keypoint detection and descriptor extraction. IEEE Transactions on Multimedia. https:\/\/doi.org\/10.1109\/TMM.2022.3155927","journal-title":"IEEE Transactions on Multimedia"},{"key":"1837_CR108","unstructured":"Zhao, Z., Zhai, Y., Chen, B. M., & Liu, P. (2022b). Balf: Simple and efficient blur aware local feature detector. arXiv preprint arXiv:2211.14731."},{"key":"1837_CR109","doi-asserted-by":"crossref","unstructured":"Zhu, X., Hu, H., Lin, S., & Dai, J. (2019). Deformable convnets v2: More deformable, better results. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition (pp. 9308\u20139316).","DOI":"10.1109\/CVPR.2019.00953"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-023-01837-3.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11263-023-01837-3\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-023-01837-3.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,10,23]],"date-time":"2024-10-23T18:22:59Z","timestamp":1729707779000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11263-023-01837-3"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,7,5]]},"references-count":109,"journal-issue":{"issue":"11","published-print":{"date-parts":[[2023,11]]}},"alternative-id":["1837"],"URL":"https:\/\/doi.org\/10.1007\/s11263-023-01837-3","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023,7,5]]},"assertion":[{"value":"1 October 2022","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"6 June 2023","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"5 July 2023","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}