{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,16]],"date-time":"2026-07-16T03:48:15Z","timestamp":1784173695710,"version":"3.55.0"},"reference-count":35,"publisher":"IEEE","license":[{"start":{"date-parts":[[2024,10,27]],"date-time":"2024-10-27T00:00:00Z","timestamp":1729987200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2024,10,27]],"date-time":"2024-10-27T00:00:00Z","timestamp":1729987200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2024,10,27]]},"DOI":"10.1109\/icip51287.2024.10647744","type":"proceedings-article","created":{"date-parts":[[2024,9,27]],"date-time":"2024-09-27T18:34:45Z","timestamp":1727462085000},"page":"582-588","source":"Crossref","is-referenced-by-count":6,"title":["Segment Any Object Model (SAOM): Real-To-Simulation Fine-Tuning Strategy For Multi-Class Multi-Instance Segmentation"],"prefix":"10.1109","author":[{"given":"Mariia","family":"Khan","sequence":"first","affiliation":[{"name":"Edith Cowan University (ECU),School of Science,Australia"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yue","family":"Qiu","sequence":"additional","affiliation":[{"name":"AIST,Artificial Intelligence Research Center (AIRC),Japan"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yuren","family":"Cong","sequence":"additional","affiliation":[{"name":"Institute for Information Processing, Leibniz University of Hannover (LUH),Germany"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Bodo","family":"Rosenhahn","sequence":"additional","affiliation":[{"name":"Institute for Information Processing, Leibniz University of Hannover (LUH),Germany"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jumana","family":"Abu-Khalaf","sequence":"additional","affiliation":[{"name":"Edith Cowan University (ECU),School of Science,Australia"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"David","family":"Suter","sequence":"additional","affiliation":[{"name":"Edith Cowan University (ECU),School of Science,Australia"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00142"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1038\/s41467-024-44824-z"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00643"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00371"},{"key":"ref5","first-page":"1877","article-title":"Language models are few-shot learners","volume":"33","author":"Brown","year":"2020","journal-title":"Advances in neural information processing systems"},{"key":"ref6","article-title":"Llama: Open and efficient foundation language models","author":"Touvron","year":"2023","journal-title":"arXiv preprint arXiv:2302.13971"},{"key":"ref7","article-title":"Segment everything everywhere all at once","author":"Zou","year":"2023","journal-title":"arXiv preprint arXiv:2304.06718"},{"key":"ref8","article-title":"Seggpt: Segmenting everything in context","author":"Wang","year":"2023","journal-title":"arXiv preprint arXiv:2304.03284"},{"key":"ref9","article-title":"Segment anything is not always perfect: An investigation of sam on different real-world applications","author":"Ji","year":"2023","journal-title":"arXiv preprint arXiv:2304.05750"},{"key":"ref10","article-title":"Instruct2act: Mapping multi-modality instructions to robotic actions with large language model","author":"Huang","year":"2023","journal-title":"arXiv preprint arXiv:2305.11176"},{"key":"ref11","article-title":"Ai2-thor: An interactive 3d environment for visual ai","author":"Kolve","year":"2017","journal-title":"arXiv preprint arXiv:1712.05474"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00943"},{"key":"ref13","article-title":"Threedworld: A platform for interactive multi-modal physical simulation","author":"Gan","year":"2020","journal-title":"arXiv preprint arXiv:2007.04954"},{"key":"ref14","article-title":"Chalet: Cornell house agent learning environment","author":"Yan","year":"2018","journal-title":"arXiv preprint arXiv:1801.07357"},{"key":"ref15","article-title":"Vrkitchen: an interactive 3d virtual environment for task-oriented learning","author":"Gao","year":"2019","journal-title":"arXiv preprint arXiv:1903.05757"},{"key":"ref16","article-title":"igibson 2.0: Objectcentric simulation for robot learning of everyday household tasks","author":"Li","year":"2021","journal-title":"arXiv preprint arXiv:2108.03272"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00843"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.3390\/app10051555"},{"key":"ref19","article-title":"Edit everything: A text-guided generative system for images editing","author":"Xie","year":"2023","journal-title":"arXiv preprint arXiv:2304.14006"},{"key":"ref20","article-title":"Can sam segment anything? when sam meets camouflaged object detection","author":"Tang","year":"2023","journal-title":"arXiv preprint arXiv:2304.04709"},{"key":"ref21","article-title":"Segment anything model (sam) meets glass: Mirror and transparent objects cannot be easily detected","author":"Han","year":"2023","journal-title":"arXiv preprint arXiv:2305.00278"},{"key":"ref22","article-title":"Caption anything: Interactive image description with diverse multimodal controls","author":"Wang","year":"2023","journal-title":"arXiv preprint arXiv:2305.02677"},{"key":"ref23","article-title":"Worldafford: Affordance grounding based on natural language instructions","author":"Chen","year":"2024","journal-title":"arXiv preprint arXiv:2405.12461"},{"key":"ref24","article-title":"Anything3d: Towards single-view anything reconstruction in the wild","author":"Shen","year":"2023","journal-title":"arXiv preprint arXiv:2304.10261"},{"key":"ref25","article-title":"Online robot navigation and and manipulation with distilled vision-language models","author":"Liu","year":"2024","journal-title":"arXiv preprint arXiv:2401.17083"},{"key":"ref26","article-title":"Sampath: A segment anything model for semantic segmentation in digital pathology","author":"Zhang","year":"2023","journal-title":"arXiv preprint arXiv:2307.09570"},{"key":"ref27","article-title":"Ladder fine-tuning approach for sam integrating complementary network","author":"Chai","year":"2023","journal-title":"arXiv preprint arXiv:2306.12737"},{"key":"ref28","article-title":"Adaptive low rank adaptation of segment anything to salient object detection","author":"Cui","year":"2023","journal-title":"arXiv preprint arXiv:2308.05426"},{"key":"ref29","article-title":"Aquasam: Underwater image foreground segmentation","author":"Xu","year":"2023","journal-title":"arXiv preprint arXiv:2308.04218"},{"key":"ref30","article-title":"Personalize segment anything model with one shot","author":"Zhang","year":"2023","journal-title":"arXiv preprint arXiv:2305.03048"},{"key":"ref31","article-title":"Semantic-sam: Segment and recognize anything at any granularity","author":"Li","year":"2023","journal-title":"arXiv preprint arXiv:2307.04767"},{"key":"ref32","article-title":"Open-vocabulary sam: Segment and recognize twenty-thousand classes interactively","author":"Yuan","year":"2024","journal-title":"arXiv preprint arXiv:2401.02955"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00586"},{"key":"ref34","article-title":"An image is worth 16 \u00d7 16 words: Transformers for image recognition at scale","author":"Dosovitskiy","year":"2020","journal-title":"arXiv preprint arXiv:2010.11929"},{"key":"ref35","article-title":"Decoupled weight decay regularization","author":"Loshchilov","year":"2017","journal-title":"arXiv preprint arXiv:1711.05101"}],"event":{"name":"2024 IEEE International Conference on Image Processing (ICIP)","location":"Abu Dhabi, United Arab Emirates","start":{"date-parts":[[2024,10,27]]},"end":{"date-parts":[[2024,10,30]]}},"container-title":["2024 IEEE International Conference on Image Processing (ICIP)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/10647221\/10647122\/10647744.pdf?arnumber=10647744","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,9,28]],"date-time":"2024-09-28T05:36:37Z","timestamp":1727501797000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10647744\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,10,27]]},"references-count":35,"URL":"https:\/\/doi.org\/10.1109\/icip51287.2024.10647744","relation":{},"subject":[],"published":{"date-parts":[[2024,10,27]]}}}