{"as_of":"2026-08-10T07:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cb3bceec9e66c68e14774add98f094c6501f9a304404a21f81a24f76556e613e","coverage":[{"denominator":113,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T11:52:14.978847Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.02548/citation-record","integrity":"/paper/2502.02548/integrity","json":"/paper/2502.02548/citation-record.json","paper":"/paper/2502.02548"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.562340Z","title":"https://huggingface","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.562340Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:0050d2511e796e373fb66e2c52f2175249a9157cae3aaefa67b6fab44bbd29fd","observation_id":"00e19b1d-8dcb-4811-945b-7b9a620ece04","resolution":{"observed_at":"2026-08-09T11:52:14.562340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-09T11:52:14.567886Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.567886Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:81b8f3df4d89f48c6aff3a1e7aae027d71876ad7a8ececc245803e646f1162a0","observation_id":"0de5cbea-bd04-4fda-8e9d-fbbf712568fe","resolution":{"observed_at":"2026-08-09T11:52:14.567886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.572923Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.572923Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:c5b8bc09a5d4c026a089c23249ed28d0b81ac9cb8a68242781f5bcdbededca46","observation_id":"0e29b170-02c0-4df9-bfb0-671e370e82f9","resolution":{"observed_at":"2026-08-09T11:52:14.572923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.577648Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.577648Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:6df5bdfaf16a4b9ee06c8926a38abd049de7a2df762eebb6e38771e8985c7de8","observation_id":"3e1d639c-f057-45ae-9757-e97df963a3fd","resolution":{"observed_at":"2026-08-09T11:52:14.577648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-09T11:52:14.581601Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.581601Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:7c1ba54cdf7445088576ee9d37b307c1f8b071dd06ca5ccfd916d9c47599f953","observation_id":"4c4b582d-deda-451e-a389-2e911d10581c","resolution":{"observed_at":"2026-08-09T11:52:14.581601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-09T11:52:14.586476Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.586476Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:3052a0aedfb0b504ba3bae81cb9cfa9297e37f42920d7931296526710181e7c4","observation_id":"0ba80f78-5e9c-4d59-b1a4-d70e6a00b12e","resolution":{"observed_at":"2026-08-09T11:52:14.586476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.590946Z","title":"Arkitscenes: A diverse real-world dataset for 3d indoor scene understanding using mobile rgb-d data","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.590946Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:e31a4cae943631a76c96cd6c73240c5dacb1ad7c43e3940aac253e15e57806e7","observation_id":"3639b949-16f6-4b95-9744-eef372a2b615","resolution":{"observed_at":"2026-08-09T11:52:14.590946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.595991Z","title":"Audiolm: A language modeling approach to audio generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.595991Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:b0d5b9733fe7b3af5bfe03041d9d0ec8ff98fb4fefdeca56d0600260c06d7b45","observation_id":"29b0a2c2-4039-427f-8956-128928764e1c","resolution":{"observed_at":"2026-08-09T11:52:14.595991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.600157Z","title":"Large-scale machine learning with stochas- tic gradient descent","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.600157Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:ca55262548be2a46ee31b3ddbac603fbd7e146059b35b81a628fc9109713e871","observation_id":"d8d940d8-b557-43f7-b49d-8964fbdf988e","resolution":{"observed_at":"2026-08-09T11:52:14.600157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-09T11:52:14.604539Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.604539Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:fc99baf6864ccdfe102c33e0d2a2e32fe31fd883b2020aa471732384b82ba4f4","observation_id":"ad369f0b-c399-48fa-95d1-ffc270cccd52","resolution":{"observed_at":"2026-08-09T11:52:14.604539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.609153Z","title":"Coyo-700m: Image-text pair dataset","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.609153Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:35fcd890180db4cce26f4da010083c01f62a12fe98280c47fe04a3745e01e293","observation_id":"14e98da3-0684-481e-b882-6cfd28da27f6","resolution":{"observed_at":"2026-08-09T11:52:14.609153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.613366Z","title":"End- to-end object detection with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.613366Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:15bfc1aa45384de1c38e32e6de0740c528d2c74984376eccd3281e37d5d2e631","observation_id":"221ae02b-dd6b-4cb6-81c1-a3bb34e3218c","resolution":{"observed_at":"2026-08-09T11:52:14.613366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.617847Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.617847Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:eaa98bd2db4607e442ef402d6f416b15145847e4f9bf6312d8c7b288b16d2dd6","observation_id":"52057327-0ffd-42f7-ae4d-bb2d7947d518","resolution":{"observed_at":"2026-08-09T11:52:14.617847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.622107Z","title":"Matterport3d: Learning from rgb-d data in indoor environments","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.622107Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:f41aced79791bd7b06de40b7ccb6bf1bc656cd556b473a8ed2d8469d80ddd419","observation_id":"a12d3e7a-41c0-4542-990d-1f922873e342","resolution":{"observed_at":"2026-08-09T11:52:14.622107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.626298Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.626298Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:bb76bef4d2c740317e929114cd08bd799f5eb1a87dea9dea23f70797545a56fd","observation_id":"0b88250b-1c5f-434a-9913-e08b0c1daf13","resolution":{"observed_at":"2026-08-09T11:52:14.626298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.630797Z","title":"Pali: A jointly-scaled multilingual language-image model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.630797Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:bcd51561f1999c0652f7de3cd53e07c42736323183aa25302873e96e47cd9fae","observation_id":"c003712d-e347-4713-aeb7-707cc7e791a3","resolution":{"observed_at":"2026-08-09T11:52:14.630797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.634940Z","title":"Per-pixel classification is not all you need for semantic segmentation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.634940Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:6674661114f2ff3fb4cc9ae688c08c5d870283440b98b38a121173c4450cb842","observation_id":"bfe2f05f-8f82-4f3c-94e2-f244efeae5c5","resolution":{"observed_at":"2026-08-09T11:52:14.634940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.639318Z","title":"Masked-attention mask transformer for universal image segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.639318Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:ca29815225d3c3e58a860051d07d2876d6574ce62f2b1244f7ac80eac79340df","observation_id":"f96db358-1b11-4f9d-b955-f74a13d91fa5","resolution":{"observed_at":"2026-08-09T11:52:14.639318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.643885Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.643885Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:3fc1b2491f89376c6b8c97b84587ef278ca363f1bcac6bf02a1a28e1b2d69030","observation_id":"2f5ad14a-f21c-4b58-9ee0-b4ff22b0adde","resolution":{"observed_at":"2026-08-09T11:52:14.643885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.648054Z","title":"Cat- seg: Cost aggregation for open-vocabulary semantic seg- mentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.648054Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:d3e4c1cde4c5d0e83b7f17ed9ea944fda641fa532cd20ae484568ee6c0d9565c","observation_id":"6dd0943b-d02f-406f-a495-24fdc474956f","resolution":{"observed_at":"2026-08-09T11:52:14.648054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.652521Z","title":"4d spatio-temporal convnets: Minkowski convolutional neural networks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.652521Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:853739d0a02bf675cd60476b1bb4da62fc5e9e354766fcb14f4e1bcba18b9f1f","observation_id":"0cd8e49c-106c-4e32-8721-6a31597b6b33","resolution":{"observed_at":"2026-08-09T11:52:14.652521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.656602Z","title":"Scaling instruction- finetuned language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.656602Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:94cbe023cf96faf5d035b03f83eda9ec355c3aa720a834a87f6f2efa6ff67298","observation_id":"4fef109b-e5a2-4649-af72-6c41e31eaafb","resolution":{"observed_at":"2026-08-09T11:52:14.656602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.660694Z","title":"Pointcept: A codebase for point cloud perception research","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.660694Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:197053a76def40b1d1e51e523cbaa81a44ece42a371122bd55721e867e1cf10a","observation_id":"cf04d106-fd56-40a3-a7d0-198382c3c0c7","resolution":{"observed_at":"2026-08-09T11:52:14.660694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.664581Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.664581Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:81d82612dd5b578fb34251f1bdc6773a294a372f352d3c256d2f2ef5aab6a15b","observation_id":"dcbaa040-18d9-4e97-9961-aa7248af709c","resolution":{"observed_at":"2026-08-09T11:52:14.664581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.668572Z","title":"Procthor: Large-scale embodied ai using procedural generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.668572Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:3758688eadb2feeee20196bbefd7d145eee86284aaf804a3c2044a507855a954","observation_id":"853ff7e2-95c8-42b9-907e-7b55d17ea351","resolution":{"observed_at":"2026-08-09T11:52:14.668572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.672837Z","title":"Pengi: An audio language model for audio tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.672837Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:db76ecc8def72f6e9fa7184aeccf0ad38ddc49a5694b7a9f778cec1ed44257ba","observation_id":"a9b89b0c-746c-44c2-9241-9152b147eca2","resolution":{"observed_at":"2026-08-09T11:52:14.672837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.677012Z","title":"Pla: Language-driven open- vocabulary 3d scene understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.677012Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:051c135650985daa9d2c742f911fffc5b1a2c6bfc595b02de0f6f7951f8fc655","observation_id":"874ef941-752f-4003-b50c-849466114b63","resolution":{"observed_at":"2026-08-09T11:52:14.677012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-09T11:52:14.681025Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.681025Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:cc68f7c7ceaaca116ad104d08dd4b9404600ddb01230f7c70764d932b602c5ef","observation_id":"90edc446-c1b2-4171-a472-a8a6645caadf","resolution":{"observed_at":"2026-08-09T11:52:14.681025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.685595Z","title":"Efficient graph-based image segmentation","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.685595Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:fdeedda93e33d931d237727bb15c4a3fd1220f579bf156936c5087a450a79038","observation_id":"d2a0e2a6-2a47-4af7-a4d8-2eaa6b1782f0","resolution":{"observed_at":"2026-08-09T11:52:14.685595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.689680Z","title":"Dat- acomp: In search of the next generation of multimodal datasets","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.689680Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:f9966d1339833ff1685c3fa31b209ec1066579411fff67d4debd0c568aa2b378","observation_id":"e7bb280a-4088-4615-a105-42f71715cb38","resolution":{"observed_at":"2026-08-09T11:52:14.689680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.693601Z","title":"Scal- ing open-vocabulary image segmentation with image-level labels","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.693601Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:86f51e4e3b7cb7efa22ee7a22557a3329009b9ca8d2095b0bf6042a71c3cf2e1","observation_id":"affb818f-864c-437a-8742-acb3439b38eb","resolution":{"observed_at":"2026-08-09T11:52:14.693601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.697384Z","title":"Imagebind one embedding space to bind them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.697384Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:134de3cbec60632cdca7c1e368777173dc4f7e7013241f1dd16c0b25c4c3de13","observation_id":"82c286eb-35b4-447f-9fd1-96c11635699c","resolution":{"observed_at":"2026-08-09T11:52:14.697384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.701027Z","title":"3d semantic segmentation with submanifold sparse convolutional networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.701027Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:c25ec48ac21486bf6c25e10a123f708a681ca3958c1a599e8207a2f28b5fa110","observation_id":"80b722c7-3dac-4852-8e14-757d560df0e8","resolution":{"observed_at":"2026-08-09T11:52:14.701027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.705118Z","title":"Open- vocabulary object detection via vision and language knowl- edge distillation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.705118Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:ae37191d11991cac2e925d810161b8880e33b70b29df2f1b8a631a9613507b23","observation_id":"275aa17b-4b30-422c-8f52-a1ebc99847df","resolution":{"observed_at":"2026-08-09T11:52:14.705118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02330","last_updated":"2024-03-04T18:58:08Z","snapshot_observed_at":"2026-08-04T19:14:19.335752Z","submitted_at":"2024-03-04T18:58:08Z","title":"RegionGPT: Towards Region Understanding Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02330","snapshot_observed_at":"2026-08-09T11:52:14.708786Z","title":"Regiongpt: Towards region understanding vision lan- guage model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.708786Z"},"links":{"cited_paper":"/paper/2403.02330","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:2d91b55dd83e0499dfc6ef506ea46edc90fdcaa6817c73a486bd63206a077da5","observation_id":"29f12a23-69f1-4df5-9e6f-7afb377fbebb","resolution":{"observed_at":"2026-08-09T11:52:14.708786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.712783Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.712783Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:9410267b87b0409ab207021bfbd34ca1b9591ffa5fedad8b5a152645ef18706e","observation_id":"06895320-52ee-4f98-90a0-bc1db054f058","resolution":{"observed_at":"2026-08-09T11:52:14.712783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.716714Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.716714Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:ad064e4ad3d479c8de43a0327ac0c54d5469ed8980edbdae5df3b30292b6b674","observation_id":"a3949f46-5039-46ba-9463-e09527f2f633","resolution":{"observed_at":"2026-08-09T11:52:14.716714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.720613Z","title":"Scaling up vision-language pre-training for image captioning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.720613Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:363a10a661e3187edbc062d9ba986ab4190df6ab1006f72e1e277bfddc5dd59f","observation_id":"cecbf8e7-2c25-4899-93dc-25671c5a93bb","resolution":{"observed_at":"2026-08-09T11:52:14.720613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.724428Z","title":"An Embodied Generalist Agent in 3D World, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.724428Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:2464cb983731c6cf578ce3e0aac814972b0e5c0076186a71cde7e9b21e59a9d9","observation_id":"a74ad816-a918-4526-bef7-94ef9b703b70","resolution":{"observed_at":"2026-08-09T11:52:14.724428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:16.263203Z","title":"Segment3d: Learning fine-grained class-agnostic 3d segmentation without manual labels","venue":null,"work_id":"9250efd7-d6ad-4510-8832-717250508967","year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.728313Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:3e9c89118f8cbd53b86e1b6cba46166997a2c0ed70ee3a028133c4d4ed2557a6","observation_id":"cfc6e54a-bb57-437c-9fab-32911b613dc9","resolution":{"observed_at":"2026-08-09T11:52:16.268078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:16.248009Z","title":"Open-set image tagging with multi-grained text supervision","venue":null,"work_id":"ef52bc41-0b2f-4e91-9b35-81a89267ca03","year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.732287Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:2d0b6b77dd85b9aa766f7bb552f4315ba05d650b5c608c411479ded991ba256c","observation_id":"bfa33195-a310-44db-ab51-a169911857d5","resolution":{"observed_at":"2026-08-09T11:52:16.252677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:16.232814Z","title":"Openins3d: Snap and lookup for 3d open-vocabulary instance segmentation","venue":null,"work_id":"4c3ccba2-fe4e-436a-b859-4a35c0e3ea92","year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.737048Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:d47ecd7a8290815d11b226d8cd08fc90d3b6a15612472976e10c22128efe2503","observation_id":"daf2bf4e-38a0-4e7a-8daa-9dfb26f4a3d0","resolution":{"observed_at":"2026-08-09T11:52:16.237410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.741058Z","title":"Oneformer: One transformer to rule universal image segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.741058Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:190cfe6dcdb62a4acd99263897d098d7377daf28219edb001be3285caea4773e","observation_id":"b9c9593d-abe8-4039-91b1-fee9aa4083a0","resolution":{"observed_at":"2026-08-09T11:52:14.741058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:16.205291Z","title":"Scen- eVerse: Scaling 3D Vision-Language Learning for Grounded Scene Understanding, 2024","venue":null,"work_id":"f97ec307-d39d-4505-bb81-5d5c1241bd06","year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.745098Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:76c67d204c332af41315049482bcf2e8138f33c1f215b843f14c92c3bf9cb02b","observation_id":"4a45b972-ec9e-4c94-aa03-1ec35f0ccc6b","resolution":{"observed_at":"2026-08-09T11:52:16.210733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.749054Z","title":"Scaling up visual and vision-language representa- tion learning with noisy text supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.749054Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:7867558dc35851cf04ec2e5845288068dc86007d0bebb7b9e7d24f4affdbcd41","observation_id":"e412da27-9b92-4f97-a127-2174cc369ab5","resolution":{"observed_at":"2026-08-09T11:52:14.749054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-09T11:52:14.753930Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.753930Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:fad2132e328a2d5bdb4a4c89a811315591b07a690bcf77d5799ecbb597d180ae","observation_id":"97cd7bfa-79b8-40f6-83a8-69edb7645e72","resolution":{"observed_at":"2026-08-09T11:52:14.753930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-09T11:52:14.758083Z","title":"Mixtral of experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.758083Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:907327ba3eacae1e64afe402bf866d4efb8a199efa13ccf66e5f0919fc08b8ff","observation_id":"a96f6ac5-9a3b-4aa2-b53e-1f4f34c88b0c","resolution":{"observed_at":"2026-08-09T11:52:14.758083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:16.178537Z","title":"Open-vocabulary 3d semantic segmentation with foundation models","venue":null,"work_id":"93bb877a-d879-4aa4-a015-53d5b9201bb4","year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.762576Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:14acc81df2f15bc0f5fe9df1b474a23dbf1725bdfc3e933ac210a50755132646","observation_id":"42d0e6dc-74c8-426e-a0cf-35e1a991544c","resolution":{"observed_at":"2026-08-09T11:52:16.183318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:16.163359Z","title":"In defense of lazy visual grounding for open-vocabulary semantic segmentation","venue":null,"work_id":"f8015df8-f2c6-4cb4-9eb7-5a6e53458fdf","year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.766649Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:9b54311e9e87c0591e758eda6b13ca79875dd43e4989d53c0508235e1e542cf5","observation_id":"917ac727-ee91-446c-8584-4546bcfa6273","resolution":{"observed_at":"2026-08-09T11:52:16.167880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:16.149063Z","title":"Segment any- thing","venue":null,"work_id":"5ce378b8-009f-463e-9629-39363b313320","year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.770955Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:51aa1bfa96a66383a5f55a8776e942957ae8e3dea9aed3f7774a6b989b61df8b","observation_id":"8d77640e-e6b6-4ee5-a438-891fe4fa787c","resolution":{"observed_at":"2026-08-09T11:52:16.153388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:16.133902Z","title":"Language-driven semantic seg- mentation","venue":null,"work_id":"e1b4d87f-d4fb-4636-97b5-b53417413176","year":2022},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.775337Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:75c5bff0f7e7884cd0232312bb3a13be6fee387044f7a53c76064b39a257474e","observation_id":"4c119a91-cee5-4b8d-ac9f-154d3a7c83aa","resolution":{"observed_at":"2026-08-09T11:52:16.138563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:16.118326Z","title":"Semantic-sam: Segment and recognize anything at any gran- ularity","venue":null,"work_id":"5447de0f-ca94-4d42-8651-0af0b4c03102","year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.779553Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:2635d7c9223f229b3e9dbaa3bb135c6155eb980307afc9c695ff8f0ed3d67a16","observation_id":"66a26ccf-570b-4106-bad7-c82817705a69","resolution":{"observed_at":"2026-08-09T11:52:16.122887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:16.102813Z","title":null,"venue":null,"work_id":"219ded9b-bdda-4d94-95a1-b2732ae9d327","year":2022},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.783713Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:736be895c3586d62f3b0415692dda23fcb698882b26877b051c38e7a94873451","observation_id":"bd214a08-26b4-432c-a489-3fb65d964819","resolution":{"observed_at":"2026-08-09T11:52:16.107193Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:16.084833Z","title":null,"venue":null,"work_id":"9a77fb3e-ca32-402f-9d5f-7a10477c8e45","year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.788044Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:9fc7af114935932656ebb8ba352ea6a3114591219242f32273b500872635ce5f","observation_id":"4d3bdca8-f72a-4e4d-8435-bdcf36ef16e2","resolution":{"observed_at":"2026-08-09T11:52:16.090482Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08478","last_updated":"2024-06-18T11:47:26Z","snapshot_observed_at":"2026-07-06T18:29:49.284504Z","submitted_at":"2024-06-12T17:59:07Z","title":"What If We Recaption Billions of Web Images with LLaMA-3?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08478","snapshot_observed_at":"2026-08-09T11:52:14.792125Z","title":"What if we recaption billions of web images with llama-3? arXiv preprint arXiv:2406.08478,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.792125Z"},"links":{"cited_paper":"/paper/2406.08478","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:7a06513a8880af59b00ed29fb5ac1cc46b35e357e1601d58e9a32fa5426433d2","observation_id":"7d1262d9-2858-43e1-ad4d-6566f6f7459e","resolution":{"observed_at":"2026-08-09T11:52:14.792125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:16.068824Z","title":"Open-vocabulary semantic segmentation with mask-adapted clip","venue":null,"work_id":"f06d483f-12b7-45c7-a2c0-9b2486d69570","year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.796758Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:d5cc81d7370deebffc399dbc33eb1d45b50e1a5d1c0ea8c4482d93fdfa5c1e9b","observation_id":"8d8d16bd-341f-4c4e-84f8-b04f7a8fb787","resolution":{"observed_at":"2026-08-09T11:52:16.073384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:16.053328Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"999e6f1f-941a-4b56-9b53-c645dd6219c1","year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.801329Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:ac63ad4a471a11c690c79b0eed33764d74d082def6931c7f024fa3d139ba6d5b","observation_id":"cafe5ede-5d40-403f-86f5-78a1cc20a36f","resolution":{"observed_at":"2026-08-09T11:52:16.057811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:16.038324Z","title":"Visual instruction tuning","venue":null,"work_id":"4483c6a8-2051-431f-bf3f-8f4402d6357d","year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.805634Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:353d43de6fb4e32f8def5d92e138af051b7e814ca3e7878fb4db7ff647ad9c2c","observation_id":"62176497-bbee-443c-b9d7-63956413a7b2","resolution":{"observed_at":"2026-08-09T11:52:16.042655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-09T11:52:14.809674Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.809674Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:6a5be5ec830bbb815efcff0f2e2a82adac8811521b53ac228a8da43e6b786de3","observation_id":"944f78de-385d-4098-9ecf-8240a8a9d096","resolution":{"observed_at":"2026-08-09T11:52:14.809674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:16.022498Z","title":"Mmscan: A multi-modal 3d scene dataset with hierarchical grounded language annotations","venue":null,"work_id":"82d8e7d1-c22c-42e9-b7d7-2d128c01e829","year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.813845Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:60c68aa19eb799b88ac20ff3b58ef73e831cb34bc3a2b2a907e332342de667b8","observation_id":"a038eb75-8d16-46f8-a685-26915a8ddbf2","resolution":{"observed_at":"2026-08-09T11:52:16.027246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:16.006900Z","title":"Multiscan: Scalable rgbd scanning for 3d environments with articulated objects","venue":null,"work_id":"61dfbb27-e8ef-411b-b458-95cdab313ee2","year":2022},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.817951Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:c390fa5012d57dae6c00a51c02331bf99f970319561628f37bcdd4b75620247b","observation_id":"8a65f695-9d47-4f26-9e95-0e56413c5246","resolution":{"observed_at":"2026-08-09T11:52:16.011839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.821919Z","title":"V-net: Fully convolutional neural networks for volumetric medical image segmentation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.821919Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:707d758f1307277b6092f013e20a3ca3e3354c05637b14bf36a6cbf2c3a89bc8","observation_id":"0ef770a6-86a3-494f-bfaa-2c53ab59a942","resolution":{"observed_at":"2026-08-09T11:52:14.821919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.978055Z","title":"Silc: Improving vision language pretraining with self-distillation","venue":null,"work_id":"2e7c2cbd-53ce-465d-bb88-815e951848f9","year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.826052Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:db0326d190a204ce65c35d93c77255525e0650f6c6d593131d2ab9a1a5bed340","observation_id":"4f8d6c61-81f5-4fba-bf9e-c89c1417b0c3","resolution":{"observed_at":"2026-08-09T11:52:15.983110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.962298Z","title":"Isbnet: a 3d point cloud instance segmentation network with instance- aware sampling and box-aware dynamic convolution","venue":null,"work_id":"73ac636c-53e5-4834-9494-4c88453dfed9","year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.830000Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:c76de970196f3de119be67c1f3aef076abbeab69dbdc3592ed55f3878914e554","observation_id":"d331ff8d-a1fd-4598-8940-d1f297e3f0e6","resolution":{"observed_at":"2026-08-09T11:52:15.967578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.946851Z","title":"Open3dis: Open-vocabulary 3d instance segmentation with 2d mask guidance","venue":null,"work_id":"e2ef6d23-23bb-43e8-96ed-8b39b124f757","year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.833920Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:f4ac8c4c29dc7e86e2dbaa0e5acf2fe2ae879062bf391ed9862e4e69291da1c1","observation_id":"52f7004c-a463-42a1-bf5f-11bcb7e40aa8","resolution":{"observed_at":"2026-08-09T11:52:15.951605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.838076Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.838076Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:2dddbebf5cf1554bd3431e64192d4b674a0b709a9a32eaef537b59de83ab2d82","observation_id":"db49205e-1102-46ab-ae86-1f6b00356dcc","resolution":{"observed_at":"2026-08-09T11:52:14.838076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.922685Z","title":null,"venue":null,"work_id":"a8b6e378-dd09-46d8-b921-3330eebe8b67","year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.842102Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:6ab16231bc2cd6525ba22b85377c6a12e50ff27cd7447355d32a05a386149d02","observation_id":"437c7dd3-6051-45ba-9b30-a6969133c011","resolution":{"observed_at":"2026-08-09T11:52:15.926916Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.906814Z","title":"Openscene: 3d scene understanding with open vocabularies","venue":null,"work_id":"e2298f09-4085-4e4b-9558-0d2a46d1a6a1","year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.846000Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:48c68a253ca44269b9a4acb33407e34b290994ca5ace8d5d2f386c175bce3386","observation_id":"227a1564-54f1-4295-aa9e-21da05878fa6","resolution":{"observed_at":"2026-08-09T11:52:15.911926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-09T11:52:14.850056Z","title":"Kosmos-2: Ground- ing multimodal large language models to the world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.850056Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:f8c8e88be4ed227165ba2d0c1ed142b6de8512bbaae341839912df5654ff004c","observation_id":"e3969332-b124-442c-9ea3-239664801938","resolution":{"observed_at":"2026-08-09T11:52:14.850056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.890427Z","title":"Language models are un- supervised multitask learners","venue":null,"work_id":"bde96e0a-34a1-4e0c-9ae0-f784368fae2e","year":2019},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.854046Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:d7baf8520b6f3beef01b83ee38f7bc8c14cd2789c9ce68aae281e72263cd355c","observation_id":"22966ade-2886-49b3-abe2-24aae0b57603","resolution":{"observed_at":"2026-08-09T11:52:15.895454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.858027Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.858027Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:a0a1ef72e9791a67dbfa34ae153d872629a811458fd24c79ec3aef4de1ce6189","observation_id":"de4e563d-3480-4b5d-8558-0a78c389876e","resolution":{"observed_at":"2026-08-09T11:52:14.858027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.863566Z","title":"Habitat-matterport 3d dataset (hm3d): 1000 large-scale 3d environments for embodied ai","venue":null,"work_id":"380c849c-3706-4d7a-903b-fc340215d45e","year":2021},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.862319Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:3f7886e2c3c219cfe85cc110389412930bb4f478f3ab3124d79449c29d9c6f02","observation_id":"dbc9ddaf-8ff0-46df-b640-d0ec3ed21df0","resolution":{"observed_at":"2026-08-09T11:52:15.868396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.848111Z","title":"Denseclip: Language-guided dense prediction with context- aware prompting","venue":null,"work_id":"140bee28-f67a-47c8-a775-44aa0aecb873","year":2022},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.866163Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:123870365e601fe0774da1a9ca93f0e664711ebfc149cb4514584d3f0f9a4bcf","observation_id":"7e015112-44c9-4cd7-b4a4-ab2e5fb1ec0d","resolution":{"observed_at":"2026-08-09T11:52:15.852879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.833738Z","title":"Glamm: Pixel grounding large multimodal model","venue":null,"work_id":"acc52872-7bfd-483e-ba86-94a5b83272a1","year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.870527Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:72ffd3f42124e0d802f5b9ff0045bde4a955241f268db7ff19c56286f369d9b7","observation_id":"680b86ee-8ea0-4327-b090-2a045849b70e","resolution":{"observed_at":"2026-08-09T11:52:15.838090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-09T11:52:14.874411Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.874411Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:b81aab72538e67ef20282652c1bf1d03e2cafce77ec508c3a9784ae573582074","observation_id":"da088572-6e7b-41b3-bd14-4a7eebcd8b9d","resolution":{"observed_at":"2026-08-09T11:52:14.874411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14159","last_updated":"2024-01-25T13:12:09Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:12:09Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14159","snapshot_observed_at":"2026-08-09T11:52:14.878648Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.878648Z"},"links":{"cited_paper":"/paper/2401.14159","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:f5dda85d586930966188c3f7f23b6ddcfe0c21f11cbc6f86e7848b341a9ded25","observation_id":"bea92ce4-0e2f-48d5-bfc5-03a1add15019","resolution":{"observed_at":"2026-08-09T11:52:14.878648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.882773Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.882773Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:dee3ef6e6a8cf4bfbdffe34b71da442f692bd9e14c7bac02d8aaff0ecb9096bd","observation_id":"7479ea9b-c09b-45e0-9c16-0c470f089aaf","resolution":{"observed_at":"2026-08-09T11:52:14.882773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.807899Z","title":"Language- grounded indoor 3d semantic segmentation in the wild","venue":null,"work_id":"e0486d35-cad3-4c06-9293-12945ace6909","year":2022},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.887128Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:1e0dffa5bc38776e1e1d1b095ad3ebaf093fa7d5c4aeadee8a51c91b82a83f33","observation_id":"0ac63485-9b44-4471-86aa-71f807630c69","resolution":{"observed_at":"2026-08-09T11:52:15.812509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-07T01:18:02.068918Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-08-09T11:52:14.891226Z","title":"Audiopalm: A large language model that can speak and listen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.891226Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:e08302289cc528ff4a091135c239b3a45515cf0b5133c93bf315d2f786bbeb7c","observation_id":"b75cad6e-adb1-4754-95cd-024c8708cfb9","resolution":{"observed_at":"2026-08-09T11:52:14.891226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.791804Z","title":"A multi-view stereo benchmark with high- resolution images and multi-camera videos","venue":null,"work_id":"1a608b47-8745-4b19-bd4e-2c61d32388be","year":2017},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.895671Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:82fa81442f8193f1b3ff5086bab9f7a56ef52865e4a2fd30ffdae8730a82ece7","observation_id":"eba8f216-4af8-4c68-a3f2-efbf85eb62a0","resolution":{"observed_at":"2026-08-09T11:52:15.796445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.776771Z","title":"Laion-5b: An open large-scale dataset for train- ing next generation image-text models","venue":null,"work_id":"628994bc-2e75-4948-8595-0185c294cee8","year":2022},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.899890Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:d1bea3d5d6a59822dd03fe48c7a04cdaecd5b763db6400cef129de9c2ecdbfd6","observation_id":"bd752179-a75a-4e49-ba6f-49596dfcaea6","resolution":{"observed_at":"2026-08-09T11:52:15.781293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.761668Z","title":"Mask3d: Mask trans- former for 3d semantic instance segmentation","venue":null,"work_id":"a3cd6352-4fd2-494a-9e49-ab5a7414e2ba","year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.904387Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:ac4c0ee5e8785506e7b4e8c26f942006b13f6174074266b0414a6d50b2f93708","observation_id":"d72dade2-eaf3-41b5-99fb-0a94abe84dc8","resolution":{"observed_at":"2026-08-09T11:52:15.766568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.746822Z","title":"Clip-fields: Weakly supervised semantic fields for robotic memory","venue":null,"work_id":"ecd8e68b-57cb-4ddb-8e7f-660ddde3b1b6","year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.908510Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:c0556b3f7ddcfe2cf3f13d8ca42765133f4be1d29f7d56152bce31a5cf4e41a8","observation_id":"23570bcc-5127-4d60-a5d3-c548bbd66bc3","resolution":{"observed_at":"2026-08-09T11:52:15.751438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.731916Z","title":"Super-convergence: Very fast training of neural networks using large learning rates","venue":null,"work_id":"bb5d7e48-125b-4371-b053-2579d5df89eb","year":null},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.912701Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:33e7a209dcf0bb522cb37bb42b6a184620554c79e902d7c60f5d7b8e4cc3a873","observation_id":"2ba6bcdc-5af8-442d-adf5-0b97d7c0c9fc","resolution":{"observed_at":"2026-08-09T11:52:15.736995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.916736Z","title":"Denois- ing diffusion implicit models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.916736Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:07ccedf5cbc37ab30b7c592c02b363aa6ab3143561daa5ff464670ed22a85051","observation_id":"9053103e-006e-4379-8a24-b4af73fafbb2","resolution":{"observed_at":"2026-08-09T11:52:14.916736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.707877Z","title":"Score-based generative modeling through stochastic differential equa- tions","venue":null,"work_id":"527b1d3b-090d-41c6-87f2-04cca12cba5c","year":2021},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.920752Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:61cbdc699bedd0117ed6ee3e24eb5e6e4c2f3244d9b713bd9388f6a9c5bcba34","observation_id":"6e7b02f5-b163-4c87-a68f-c672a457b773","resolution":{"observed_at":"2026-08-09T11:52:15.712154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.693610Z","title":"Open- mask3d: open-vocabulary 3d instance segmentation","venue":null,"work_id":"1f1efb6e-79c7-4069-8a7a-d2f7a3e9380d","year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.924759Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:549693511e9c3cb27456b5128d58c1c95edc90d26c86617f803004ade475c75c","observation_id":"dc84ceaa-8ca9-4668-ae2d-b27557d85d5b","resolution":{"observed_at":"2026-08-09T11:52:15.697981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-09T11:52:14.928740Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.928740Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:14c4cd5484e7b7cdd59e182a4e6a7aed0b4e0168ffc2b4f04309ecf642c6c7fe","observation_id":"90173931-af52-49d2-824e-73679f5b0cc6","resolution":{"observed_at":"2026-08-09T11:52:14.928740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-09T11:52:14.933150Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of con- text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.933150Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:ed17db05b3dcf9da1a1c4644c269de21b439d9fd1eb1e8d540fefb3394161fa4","observation_id":"af2fa7ac-9477-476a-a3d5-343a25669593","resolution":{"observed_at":"2026-08-09T11:52:14.933150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-09T11:52:14.937675Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.937675Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:fe8d0d9e27f9102ac465a20d1bd8e492a9e4261cc3253508c92c783efac41b96","observation_id":"3713a9ab-650f-44a5-9ac9-244e55a82ef9","resolution":{"observed_at":"2026-08-09T11:52:14.937675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-09T11:52:14.942007Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.942007Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:0108ef2d365a9947c3aa194eb60fa472c2dab6d3a91b774d88a33ec1dd681317","observation_id":"f4414da6-319f-434a-9e94-603cb6c7a9c9","resolution":{"observed_at":"2026-08-09T11:52:14.942007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.679837Z","title":"Rio: 3d object instance re- localization in changing indoor environments","venue":null,"work_id":"5dba5176-eb8a-4537-beca-9fc060016ef3","year":2019},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.946399Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:f6a88159b1972802fce3744ad90f6727ce350e07c8ae1489d452f41a5ed3ac8e","observation_id":"188efec1-78d5-45b2-b1e5-ce0fcf114127","resolution":{"observed_at":"2026-08-09T11:52:15.684118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.665826Z","title":"Ofa: Unifying architectures, tasks, and modalities through a simple sequence-to-sequence learn- ing framework","venue":null,"work_id":"5fc3485b-7be5-48ce-92ab-b63930fd4226","year":2022},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.950455Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:6dda2c1a4b48b927bbd4e85f693ceae24d8c9afddebd45fa90989b37fda160ad","observation_id":"6a5fa897-59a9-4aa5-9e79-71927bfd4a50","resolution":{"observed_at":"2026-08-09T11:52:15.670541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.651353Z","title":"EmbodiedScan: A Holistic Multi-Modal 3D Perception Suite Towards Embodied AI, 2023","venue":null,"work_id":"1a3fc77d-1a26-4b05-837d-1b3eda5de4e5","year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.954462Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:2e11c6364be6625e48f36bbb05ec1c16de1e54d3086038d0980404f620392003","observation_id":"36b75abf-d93b-40da-a930-dae7958998e8","resolution":{"observed_at":"2026-08-09T11:52:15.655917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09718","last_updated":"2024-07-21T20:50:06Z","snapshot_observed_at":"2026-07-06T16:07:49.197575Z","submitted_at":"2023-08-18T17:59:57Z","title":"Towards Large-scale 3D Representation Learning with Multi-dataset Point Prompt Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09718","snapshot_observed_at":"2026-08-09T11:52:14.958546Z","title":"Towards large- scale 3d representation learning with multi-dataset point prompt training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.958546Z"},"links":{"cited_paper":"/paper/2308.09718","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:3e8641e0f14493a2e9b93abb464358f8f2a0ad8b883dade899e336d335af4a0c","observation_id":"1e765161-49db-4cfa-b061-16ce0c0d2cd3","resolution":{"observed_at":"2026-08-09T11:52:14.958546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.636969Z","title":"Groupvit: Semantic segmentation emerges from text supervision","venue":null,"work_id":"1410ba11-0985-4d2e-a121-1772b34c7d69","year":2022},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.962797Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:3b791f1b811c80000bcd280a2396c73c615ea2e84c306279fcb3eb015f349a73","observation_id":"6d02b364-431b-4fcb-9a34-24d44812b2f1","resolution":{"observed_at":"2026-08-09T11:52:15.641360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-09T11:52:14.966702Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.966702Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:05da954b4f156db8bdd8b2a5c16d0ee12ab9e8c2241965793935e0e5717fb626","observation_id":"8efbfbf8-8e95-46fb-9a5c-67288c2bc6d8","resolution":{"observed_at":"2026-08-09T11:52:14.966702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.622072Z","title":"Regionplc: Regional point-language contrastive learning for open-world 3d scene understanding","venue":null,"work_id":"0e2411f8-7a12-4426-80f2-acffa2145dc4","year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.971103Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:257bee9d4c9bcd98ff118ea729b81ec917875b94cd486f19deb7b4e5d06b7390","observation_id":"9b00930e-bdc8-4255-a703-030886c09744","resolution":{"observed_at":"2026-08-09T11:52:15.627270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.607972Z","title":"Scannet++: A high-fidelity dataset of 3d in- door scenes","venue":null,"work_id":"8909cba9-78e3-4cc7-aea8-60abb2871064","year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.975066Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:ec827d0c63032afb18f980df635dc65a18c2a7d4fd2434ed403d74eca50332db","observation_id":"3b50bde3-04dd-4cc0-8a10-3c8987d93792","resolution":{"observed_at":"2026-08-09T11:52:15.612383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.593616Z","title":"Sai3d: Segment any instance in 3d scenes","venue":null,"work_id":"3ee213cb-2e2e-4208-983f-32eec6111aca","year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.978847Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:0be235cf6eb506e8d4cdd7b5b859fd30e7d37f592b970150eee670f3861f0072","observation_id":"5879e755-4333-4f1e-968f-6e636d3a7a22","resolution":{"observed_at":"2026-08-09T11:52:15.598253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T03:02:09.680267Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":63,"verified_exact":0,"verified_fuzzy":37},"total_outbound_references":113},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 113 outbound references and 0 inbound Pith citation observations for arXiv:2502.02548."}