{"as_of":"2026-08-22T08:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d05441345e0afcee3520c6d147870dd7474476293c81514522ff8d30d94496f4","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T16:46:10.072459Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.13243/citation-record","integrity":"/paper/2411.13243/integrity","json":"/paper/2411.13243/citation-record.json","paper":"/paper/2411.13243"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:09.835898Z","title":"3d semantic parsing of large-scale indoor spaces","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.835898Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:d70530923d8496575414d796512effdf245ad06e59518bbb93649040d99587d5","observation_id":"cf1a2954-5bf4-4875-b748-477ce9e0d64c","resolution":{"observed_at":"2026-08-12T16:46:09.835898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:09.841512Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.841512Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:f3cb88c72d006cbe2fbcd2a32f71d4e6a69f4198b75cc4207287b71f213d4bc3","observation_id":"78a22aa5-8226-45e1-8b61-3f5f734538fb","resolution":{"observed_at":"2026-08-12T16:46:09.841512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.781373Z","title":"Masked-attention mask transformer for universal image segmentation","venue":null,"work_id":"4e37d31c-6d9a-44f0-996e-ea61da34204d","year":2022},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.846666Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:1758ee9498e1de677072854e95d508a0bc6513d435b1804503303ba8b6b9d8fc","observation_id":"7f36bd1a-307a-4595-8e54-35d1243464f8","resolution":{"observed_at":"2026-08-12T16:46:10.786369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.764533Z","title":"Per-pixel classification is not all you need for semantic segmentation","venue":null,"work_id":"7ecf42d6-0864-4c2f-91a1-fa555f76c82f","year":2021},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.851979Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:222f974a36ae12b68be67173e8e2962c7042283be3d897a4dc9673aeb2958a09","observation_id":"558d4a84-abc6-47f0-b362-5249f61db796","resolution":{"observed_at":"2026-08-12T16:46:10.769872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.749266Z","title":"Transductive zero-shot learning for 3d point cloud classification","venue":null,"work_id":"e76bd8ce-89d5-467d-9c7c-473c5bb57dd0","year":2020},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.857085Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:f10e8417c98fbfe71e6669f37a97d900e61b5e0a09bddd0176d37213a4206e57","observation_id":"857ed3f8-de2b-469a-b7f1-25dbbf8bdc2b","resolution":{"observed_at":"2026-08-12T16:46:10.754268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11797","last_updated":"2024-03-31T11:53:55Z","snapshot_observed_at":"2026-08-18T03:21:27.251226Z","submitted_at":"2023-03-21T12:28:21Z","title":"CAT-Seg: Cost Aggregation for Open-Vocabulary Semantic Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11797","snapshot_observed_at":"2026-08-12T16:46:09.861897Z","title":"Cat-seg: Cost aggregation for open-vocabulary semantic segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.861897Z"},"links":{"cited_paper":"/paper/2303.11797","citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:92d02f5a0e85451a3ba43dea35f9c0032246c7c6b030e1f8a3d075a439177521","observation_id":"11d8c0be-a93f-452b-acb4-bfe4445bf919","resolution":{"observed_at":"2026-08-12T16:46:09.861897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.733882Z","title":"4d spatio-temporal convnets: Minkowski convolutional neural networks","venue":null,"work_id":"1fcedfa4-60e6-4fc2-85b9-c2f004a2f69a","year":2019},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.867561Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:cd0cb2b6908468bb0f2f3a77e41867b6353c91ba80a85058defbf2bef51bb40c","observation_id":"721146ed-8144-491d-9086-aaa2a1988be3","resolution":{"observed_at":"2026-08-12T16:46:10.738908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:09.871855Z","title":"Spconv: Spatially sparse convolution library","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.871855Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:30b47bdf7bb7222c77f6f03c87f0b9fccacb2b0f55c73db1ca51913ef3aee98c","observation_id":"83eb9f6b-6e09-4c81-a1ba-d9d7c3f3e2b1","resolution":{"observed_at":"2026-08-12T16:46:09.871855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:09.876484Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.876484Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:2fa124420b1db5fdd4bbe72bba4a16233c4467c73e4cfc183205bd7ea68813ea","observation_id":"b822299a-bca6-46ac-ba91-9d1bbdf56dd3","resolution":{"observed_at":"2026-08-12T16:46:09.876484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.699275Z","title":"Decoupling zero-shot semantic segmen- tation","venue":null,"work_id":"1f45867a-23db-413a-bfa0-cc7437701a46","year":2022},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.881197Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:0d18576f4c6093ac165e2a8691229ae979e8b77f9d5b5902ed3aa58faf3a5618","observation_id":"efd47bee-b905-467c-9dc8-1e812a919cf2","resolution":{"observed_at":"2026-08-12T16:46:10.704441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:09.885601Z","title":"Pla: Language-driven open-vocabulary 3d scene understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.885601Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:b5dad77584728cf9ff0a3f8eda48f1438203cdf3c9cc7748355af4a99507e734","observation_id":"dcf081a5-4de0-44a2-b913-ffb064558750","resolution":{"observed_at":"2026-08-12T16:46:09.885601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.673541Z","title":"Open-vocabulary universal image segmentation with maskclip","venue":null,"work_id":"463cfe97-ae13-4c37-b907-2e7970db5988","year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.890230Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:dcc6923a13151f2c8d3318f66d744b32671b00aa0425ecd1c2e214f8a07b7027","observation_id":"ea3da3bf-6a19-47d2-b36d-189d3cc877cb","resolution":{"observed_at":"2026-08-12T16:46:10.678562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.657419Z","title":"Scaling open-vocabulary image segmen- tation with image-level labels","venue":null,"work_id":"450b2006-a2c8-4c96-af4d-685f8b6b2ab1","year":2022},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.894688Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:91e1b4fa4801deb4e209c1a2a4e4fff1723a0d3ea61cdd52f1b09f172830aebd","observation_id":"d060d7ef-3829-4316-9136-70ade5a9db14","resolution":{"observed_at":"2026-08-12T16:46:10.662409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-12T16:46:09.898818Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.898818Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:8f0788eda671b938cc88df96ba9258d53eeb31a1f9ec7f68cbe58c2a951a171e","observation_id":"e5f36373-22e4-4d0a-8927-2f1f0ca5b3ce","resolution":{"observed_at":"2026-08-12T16:46:09.898818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.11514","last_updated":"2022-12-06T11:09:39Z","snapshot_observed_at":"2026-08-16T16:43:52.556191Z","submitted_at":"2022-07-23T13:10:25Z","title":"Semantic Abstraction: Open-World 3D Scene Understanding from 2D Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.11514","snapshot_observed_at":"2026-08-12T16:46:09.903856Z","title":"Semantic abstraction: Open-world 3d scene understanding from 2d vision-language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.903856Z"},"links":{"cited_paper":"/paper/2207.11514","citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:0b877ce44834a383f8105a1c339c042527e33738065787c418fe95d8437b9260","observation_id":"9a355519-75d1-4bb9-9e98-f979e2d83829","resolution":{"observed_at":"2026-08-12T16:46:09.903856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11395","last_updated":"2024-04-21T03:26:27Z","snapshot_observed_at":"2026-08-16T14:25:51.104958Z","submitted_at":"2024-01-21T04:13:58Z","title":"UniM-OV3D: Uni-Modality Open-Vocabulary 3D Scene Understanding with Fine-Grained Feature Representation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11395","snapshot_observed_at":"2026-08-12T16:46:09.908857Z","title":"Unim-ov3d: Uni-modality open- vocabulary 3d scene understanding with fine-grained feature representation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.908857Z"},"links":{"cited_paper":"/paper/2401.11395","citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:6896d75cac2717d5fb0b04db73bb406e994a179e21d5046aeb8edacead47796a","observation_id":"1ad8db9a-f275-43a1-af8e-67e9ed00dcbc","resolution":{"observed_at":"2026-08-12T16:46:09.908857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-08-17T00:44:11.103098Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-12T16:46:09.913908Z","title":"Prompt-to-prompt image editing with cross attention control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.913908Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:297a29ee766375a1e018677714002323b4c366efc8a41317506d6f2325672f60","observation_id":"0f93fb09-3cd1-4cad-958b-cfe34be54ea7","resolution":{"observed_at":"2026-08-12T16:46:09.913908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.642426Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"7febca92-ac4b-411c-a346-86654c25bd82","year":2020},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.919063Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:b90438d4e949e5844cc3ae53c8febbe084e692111092d2919d664cf8c86744ae","observation_id":"80fb5555-0805-41b3-b501-bfb86c64254c","resolution":{"observed_at":"2026-08-12T16:46:10.647307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:09.923653Z","title":"Clip2point: Transfer clip to point cloud classification with image-depth pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.923653Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:3f7907ce5a08bd8f3eb59fb93a6d1bb016c3d46224f659e09310ee8dc0eb8ce2","observation_id":"dab2d84f-8365-4fc7-a82a-dbc632566b50","resolution":{"observed_at":"2026-08-12T16:46:09.923653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.618033Z","title":"Open-vocabulary 3d semantic segmentation with foundation models","venue":null,"work_id":"98e2735b-f8c0-4d96-b633-67a15acafc89","year":2024},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.928234Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:993b5dfc9ceb94594760a7691b092e7bf7459b2abd316ac7418eccbc6d6428ce","observation_id":"62cfd89d-462a-499a-b6f1-6203bb873b54","resolution":{"observed_at":"2026-08-12T16:46:10.622689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09316","last_updated":"2024-09-30T03:17:39Z","snapshot_observed_at":"2026-08-18T18:36:22.241993Z","submitted_at":"2023-06-15T17:51:28Z","title":"Diffusion Models for Open-Vocabulary Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09316","snapshot_observed_at":"2026-08-12T16:46:09.932975Z","title":"Diffusion models for zero-shot open-vocabulary segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.932975Z"},"links":{"cited_paper":"/paper/2306.09316","citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:ceeed23f6eb66ae5d6bde6edf88a0b65615970c0ee89fdaa6c73b352ee7cc93b","observation_id":"609eb4ee-0363-47ab-915a-ce8ad7489197","resolution":{"observed_at":"2026-08-12T16:46:09.932975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:09.937672Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.937672Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:281aa076045e72519972b5c50090954631227804bf9b2dda10e01c4629c14a7d","observation_id":"ce77b63d-a1f3-4478-8f2a-52061a56d790","resolution":{"observed_at":"2026-08-12T16:46:09.937672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.03546","last_updated":"2022-04-03T03:33:43Z","snapshot_observed_at":"2026-08-01T06:14:31.660540Z","submitted_at":"2022-01-10T18:59:10Z","title":"Language-driven Semantic Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.03546","snapshot_observed_at":"2026-08-12T16:46:09.941912Z","title":"Language- driven semantic segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.941912Z"},"links":{"cited_paper":"/paper/2201.03546","citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:9c33411c1640eb06cc6efa6bf77c68a5805963ce75a7464ffa429ebc5c5e6f0d","observation_id":"39e53374-2591-465a-91eb-1659c74ed2d4","resolution":{"observed_at":"2026-08-12T16:46:09.941912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07547","last_updated":"2024-09-03T03:20:54Z","snapshot_observed_at":"2026-08-17T16:50:23.036090Z","submitted_at":"2023-04-15T12:52:23Z","title":"TagCLIP: Improving Discrimination Ability of Open-Vocabulary Semantic Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07547","snapshot_observed_at":"2026-08-12T16:46:09.946613Z","title":"Tagclip: Improving discrimination ability of open-vocabulary semantic segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.946613Z"},"links":{"cited_paper":"/paper/2304.07547","citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:64a34900dc326258793cf55f3d750ba7b991e08ea7515fed45934d411bebaf3b","observation_id":"52d6224d-8473-404d-976d-a8d9d99b8466","resolution":{"observed_at":"2026-08-12T16:46:09.946613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.593182Z","title":"Guiding text-to-image diffusion model towards grounded generation","venue":null,"work_id":"f0e9f0fa-93ad-42b9-8ff9-742f6ae6deb7","year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.951597Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:582fbd4c603e16f166a681d7f2b78dbf407361827071f34f5db152533e468e2b","observation_id":"fc44eab2-f161-4e25-aa9f-037048dc1e9d","resolution":{"observed_at":"2026-08-12T16:46:10.598419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.578151Z","title":"Magic3d: High-resolution text-to-3d content creation","venue":null,"work_id":"152905c3-aa4e-4bc5-8baa-4bf5bdba0946","year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.955911Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:9b0da1fb567f3294cac9cf365fbc71bef6f03ad0ad71c37a14825051371c5562","observation_id":"64846e98-c1f8-4e76-b350-034dbd85ba83","resolution":{"observed_at":"2026-08-12T16:46:10.582927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14093","last_updated":"2024-01-09T17:09:47Z","snapshot_observed_at":"2026-08-18T09:44:34.958088Z","submitted_at":"2023-05-23T14:16:49Z","title":"Weakly Supervised 3D Open-vocabulary Segmentation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14093","snapshot_observed_at":"2026-08-12T16:46:09.960220Z","title":"3d open-vocabulary segmentation with foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.960220Z"},"links":{"cited_paper":"/paper/2305.14093","citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:08ecfed887d8834b9ace3c79ed080064da39f425b7560917c3608a752283e1d1","observation_id":"19c529cf-e808-47ab-b667-9314e3f8ea13","resolution":{"observed_at":"2026-08-12T16:46:09.960220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.563152Z","title":"Segment any point cloud sequences by distilling vision foundation models","venue":null,"work_id":"40e7565f-cc1d-42de-8d2a-9185495425b9","year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.964909Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:1f835bb1a2be36fd5809955cb1df8af239b592ec28731a8e90f20e00871f2c61","observation_id":"7077cfea-7048-4b40-b00e-047fd27ca418","resolution":{"observed_at":"2026-08-12T16:46:10.568087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-12T16:46:09.969515Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.969515Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:edd977a26dc583d73692818a21e8feebda7ead9a046429859e830a40ab18e99d","observation_id":"27448eb0-aeb7-43a9-93c4-9fbc36512e56","resolution":{"observed_at":"2026-08-12T16:46:09.969515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.15138","last_updated":"2022-10-27T02:57:26Z","snapshot_observed_at":"2026-08-19T12:32:06.442383Z","submitted_at":"2022-10-27T02:57:26Z","title":"Open-vocabulary Semantic Segmentation with Frozen Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2210.15138","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.15138","snapshot_observed_at":"2026-08-12T16:46:10.177483Z","title":"Open-vocabulary Semantic Segmentation with Frozen Vision-Language Models","venue":"cs.CV","work_id":"b538b066-9cc3-4ba0-9ae0-62b72e97e0a2","year":2022},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.974385Z"},"links":{"cited_paper":"/paper/2210.15138","citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:37efd462ef47d322282a6f1ebd5a03bd49365c1a3c411319ceff967d42f873e9","observation_id":"395aba57-d766-42d7-873b-cb4d2912e21b","resolution":{"observed_at":"2026-08-12T16:46:10.182714Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.547981Z","title":"Generative zero-shot learning for semantic segmentation of 3d point clouds","venue":null,"work_id":"0bdba249-c7b0-472f-a748-068b4095b675","year":2021},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.978968Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:827ea85925c00da55bfcd87d9162ca57a5be628a6d5a8454fc5bb8c1f41eb787","observation_id":"eac43e42-c907-41be-928d-0f8f12efa93e","resolution":{"observed_at":"2026-08-12T16:46:10.553002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:09.983560Z","title":"Nerf: Representing scenes as neural radiance fields for view synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.983560Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:1b0ebc08568c4189416440f95fd1a15108f74bf5bb03abfbb475764632129077","observation_id":"5dd0dbd7-89bc-4da2-bd26-15f2e8b8e4bb","resolution":{"observed_at":"2026-08-12T16:46:09.983560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-12T16:46:09.987758Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.987758Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:f0aacf5c95e5045ec6a91dcdc61728f06af11d44dee2622a6169456eb9353772","observation_id":"7ba131b5-fb58-4b05-8bdc-28e47a8432b9","resolution":{"observed_at":"2026-08-12T16:46:09.987758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:09.993708Z","title":"Openscene: 3d scene understanding with open vocabularies","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.993708Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:f161d8a787aebb1475041423ee6b7ec6eb1c0f12253908d0b581151524df42bc","observation_id":"0b2204d1-82d8-403f-9f6d-1d93b0da5614","resolution":{"observed_at":"2026-08-12T16:46:09.993708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.514448Z","title":"Dreamfusion: Text-to-3d using 2d diffusion","venue":null,"work_id":"43a4d4ad-6205-4493-9e8b-1e3b72612112","year":2022},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.998127Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:85e62e63efa0768977f5b7eeb9b4e09d9af2ba95f684569d321fa82eef5d0f49","observation_id":"eff91478-3e75-408c-bdb3-659c1841506e","resolution":{"observed_at":"2026-08-12T16:46:10.519250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.003200Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:10.003200Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:116a80841b7b313ad3b7c73473bf376b87d83b6923b733732912000ab968da17","observation_id":"a5f85f7f-74aa-48fa-8f51-5fd6ca11687b","resolution":{"observed_at":"2026-08-12T16:46:10.003200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.007716Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:10.007716Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:617e01b89dc93f12fdd4cb242b6e298097171e5cfc8894575e701cf46a0e8b63","observation_id":"93103c53-289e-4781-9f83-f5c2f706ebd1","resolution":{"observed_at":"2026-08-12T16:46:10.007716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.012269Z","title":"Language-grounded indoor 3d semantic segmentation in the wild","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:10.012269Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:c9ecbfaa2a5f75fd6941a7e8fae1d151cd3e96533cd4c9114f3d9ffa67b44840","observation_id":"5f773dd6-48f4-4386-964b-6e205659d548","resolution":{"observed_at":"2026-08-12T16:46:10.012269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.469902Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":"b46dfac5-dedb-42f1-9ea0-97ab866fb0a9","year":2022},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:10.017134Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:4282211372f21b176c4b6eecc546f3e0886fe3833e8efab5673c1d8721c45f9c","observation_id":"5828134d-e411-40d1-97c9-7e6bb1c6729e","resolution":{"observed_at":"2026-08-12T16:46:10.474877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.454311Z","title":"Dreamgaussian: Generative gaussian splatting for efficient 3d content creation","venue":null,"work_id":"494c7fc0-7379-482f-bccd-0e2c31227c3c","year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:10.022245Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:296a55b6b576858ee0f50886219a8b476089518317fef2d01fe047251cb84999","observation_id":"c446b89e-62ed-4580-aed1-8e2b4e6153ed","resolution":{"observed_at":"2026-08-12T16:46:10.459203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.438865Z","title":"Diffumask: Synthesizing images with pixel-level annotations for semantic segmentation using diffusion models","venue":null,"work_id":"377bb58e-160a-43ac-8c80-364a3c8d44d1","year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:10.026793Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:b82d8dbc0335ae568e7c7ef6136c158a68213bde52ea275ec284ba8a525cec68","observation_id":"0a64c565-b35d-4415-8c8b-44523533772f","resolution":{"observed_at":"2026-08-12T16:46:10.443737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10035","last_updated":"2024-03-25T16:00:01Z","snapshot_observed_at":"2026-08-21T15:35:11.968765Z","submitted_at":"2023-12-15T18:59:59Z","title":"Point Transformer V3: Simpler, Faster, Stronger","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10035","snapshot_observed_at":"2026-08-12T16:46:10.031420Z","title":"Point transformer v3: Simpler, faster, stronger","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:10.031420Z"},"links":{"cited_paper":"/paper/2312.10035","citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:18514ffbd5f3c2f3c5a7f25e0ddbaf944332cdb305b0d9a798f7c0a35ef3d35f","observation_id":"1a8875c1-c52a-43e6-ab82-b6701ee2bbdf","resolution":{"observed_at":"2026-08-12T16:46:10.031420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.423764Z","title":"Point transformer v2: Grouped vector attention and partition-based pooling","venue":null,"work_id":"79925c61-a51b-4f1b-8687-2fff48b88dd8","year":2022},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:10.036429Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:41f9bbad03c4082f5d3a428f726ae23eefd21da2357281a97ce2556740451386","observation_id":"3d8920c5-7953-46fd-9a1e-21730a93cf52","resolution":{"observed_at":"2026-08-12T16:46:10.428777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02402","last_updated":"2024-04-03T03:45:38Z","snapshot_observed_at":"2026-08-21T03:54:54.268907Z","submitted_at":"2024-01-04T18:39:32Z","title":"3D Open-Vocabulary Panoptic Segmentation with 2D-3D Vision-Language Distillation","version":3},"cited_work":{"arxiv_id":"2401.02402","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.02402","snapshot_observed_at":"2026-08-12T16:46:10.124977Z","title":"3D Open-Vocabulary Panoptic Segmentation with 2D-3D Vision-Language Distillation","venue":"cs.CV","work_id":"bd59b5b3-3f93-4f72-b118-44438c5fe63a","year":2024},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:10.041152Z"},"links":{"cited_paper":"/paper/2401.02402","citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:a5fe44dc0352293eb6474042e544a68d0765b82445b00e71a9ecb27ac57419e4","observation_id":"ef8baa7b-3fbc-47c3-9165-7d2b2eee86a2","resolution":{"observed_at":"2026-08-12T16:46:10.131526Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.045841Z","title":"Open-vocabulary panoptic segmentation with text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:10.045841Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:646252b7a0c53898e939e2a0ae949319ea5b8340ed4774586d10e4c38c7ed446","observation_id":"dac75b9e-69b9-4853-92eb-f52db788d026","resolution":{"observed_at":"2026-08-12T16:46:10.045841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.398767Z","title":"Side adapter network for open-vocabulary semantic segmentation","venue":null,"work_id":"b57ef7a2-1f9c-4765-ae8a-a0be27bfa745","year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:10.050407Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:c6a1723c3f75f29724aae12df5d1559b59e9e4f29e40087ed594f8d92bd64946","observation_id":"03402bea-bfa2-402e-ae9a-2c662e1c0345","resolution":{"observed_at":"2026-08-12T16:46:10.403769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00962","last_updated":"2024-05-05T04:44:55Z","snapshot_observed_at":"2026-08-16T15:43:13.162538Z","submitted_at":"2023-04-03T13:30:04Z","title":"RegionPLC: Regional Point-Language Contrastive Learning for Open-World 3D Scene Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.00962","snapshot_observed_at":"2026-08-12T16:46:10.054878Z","title":"Regionplc: Regional point-language contrastive learning for open-world 3d scene understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:10.054878Z"},"links":{"cited_paper":"/paper/2304.00962","citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:6cfcf041d731d22b6342fd88641f13cb7918da0ef910cba6b9d7ac0b6b43aac3","observation_id":"689b8e2e-4542-48bd-8dce-93e5a4082c8c","resolution":{"observed_at":"2026-08-12T16:46:10.054878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.383594Z","title":"Vit-gpt2 image captioning","venue":null,"work_id":"b32a33b3-094a-4007-bfa0-6f9aee633163","year":null},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:10.059407Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:051c1718e896df3698435ab596c4c7d597301261b0368530c80c583b2332e91a","observation_id":"b7a64b4e-a6dd-4b62-ad84-357088974853","resolution":{"observed_at":"2026-08-12T16:46:10.388705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.368539Z","title":"Clip-fo3d: Learning free open-world 3d scene representations from 2d dense clip","venue":null,"work_id":"86fea09c-4eb8-426a-9604-1b2abdc6ff37","year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:10.063707Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:4f82ad2b472e766629c81394982f9b8f0c30b7d2b6fb2f6a638b141d1119d14e","observation_id":"ab28d98a-0014-4cbd-9097-9372a76f5ca7","resolution":{"observed_at":"2026-08-12T16:46:10.373333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.067942Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:10.067942Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:7690a190e03556ad734c568f31e50b9864672d64685ba08bb7d4630ed794604c","observation_id":"c7d84e53-af3b-4033-a054-292f1cff11ed","resolution":{"observed_at":"2026-08-12T16:46:10.067942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.343977Z","title":"Point transformer","venue":null,"work_id":"f57864d3-b242-4687-8f0f-e9bb93da72c5","year":2021},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:10.072459Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:c49aadbf6b91f387ced8245b12a8a35e4c0d951fc15fc44c5323f01ebc124990","observation_id":"247efaf2-45f9-4e37-913c-a97bce88aaf8","resolution":{"observed_at":"2026-08-12T16:46:10.348859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":2,"verified_fuzzy":22},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2411.13243."}