{"as_of":"2026-08-20T13:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dc1f5953048fb8a58a84657e3e0074a86d7c8f9c1b633463eef10fc8024f2606","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:37:21.425460Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-15T13:51:30.008232Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T00:37:29.656433Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"cited_work":{"arxiv_id":"2507.07781","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07781","snapshot_observed_at":"2026-07-03T00:37:29.656433Z","title":"Surprise3d: A dataset for spatial under- standing and reasoning in complex 3d scenes","venue":null,"work_id":"4f8fa950-aac2-4ade-aab2-b371a451b874","year":2025},"citing_paper":{"arxiv_id":"2512.06774","last_updated":"2026-04-09T06:38:35Z","snapshot_observed_at":"2026-08-14T14:16:49.546372Z","submitted_at":"2025-12-07T10:26:35Z","title":"RDSplat: Robust Watermarking for 3D Gaussian Splatting Against 2D and 3D Diffusion Editing","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-17T00:33:29.282349Z"},"links":{"cited_paper":"/paper/2507.07781","citing_paper":"/paper/2512.06774"},"observation_digest":"sha256:a3dc69e02cde1ac6d7b60e66ae649b7232cb07c351d14e1bb8b07a48dea1c848","observation_id":"6a07e2e5-fa18-4df6-a88c-1e53ebdf9428","resolution":{"observed_at":"2026-05-17T00:33:44.661273Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07781","snapshot_observed_at":"2026-07-15T13:51:30.008232Z","title":"arXiv preprint arXiv:2507.07781 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.06445","last_updated":"2026-07-08T07:22:50Z","snapshot_observed_at":"2026-08-15T10:30:17.445130Z","submitted_at":"2026-03-06T16:37:15Z","title":"What if? Emulative Simulation with World Models for Situated Reasoning","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-15T13:51:30.008232Z"},"links":{"cited_paper":"/paper/2507.07781","citing_paper":"/paper/2603.06445"},"observation_digest":"sha256:5bc6e5faa5acbd2dd799b9dd2731e083535137b47271cd1112a2a230946f0548","observation_id":"f83cbea5-9f4e-44d1-bdd0-89ab94a8b873","resolution":{"observed_at":"2026-07-15T13:51:30.008232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"cited_work":{"arxiv_id":"2507.07781","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07781","snapshot_observed_at":"2026-07-03T00:37:29.656433Z","title":"Surprise3d: A dataset for spatial under- standing and reasoning in complex 3d scenes","venue":null,"work_id":"4f8fa950-aac2-4ade-aab2-b371a451b874","year":2025},"citing_paper":{"arxiv_id":"2606.08952","last_updated":"2026-06-08T02:55:05Z","snapshot_observed_at":"2026-08-16T10:45:53.459163Z","submitted_at":"2026-06-08T02:55:05Z","title":"AlloSpatial: Agentic Harness Framework for Spatial Reasoning in Foundation Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T17:08:22.609095Z"},"links":{"cited_paper":"/paper/2507.07781","citing_paper":"/paper/2606.08952"},"observation_digest":"sha256:04af22d4698680a05f9455c32ddee1190a4b6ed9cbfcc4099286667062238401","observation_id":"bba1b6d4-3609-4ea9-a515-fc025b6adf68","resolution":{"observed_at":"2026-07-03T00:37:29.657958Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07781","snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"arXiv preprint arXiv:2507.07781 (2025) 5","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-08-08T07:19:59.145714Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"cited_paper":"/paper/2507.07781","citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:18f44ec7b55dee27f075b5112d6cac953317e924e8ec260a5e2ba47d74670a2e","observation_id":"e147e5dc-eb09-4b09-b902-16ed734977d4","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07781","snapshot_observed_at":"2026-07-11T23:56:52.009530Z","title":"Surprise3d: A dataset for spatial understanding and reasoning in complex 3d scenes.arXiv preprint arXiv:2507.07781,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03789","last_updated":"2026-07-04T09:32:13Z","snapshot_observed_at":"2026-08-15T21:28:39.498694Z","submitted_at":"2026-07-04T09:32:13Z","title":"G$^2$TAM: Geometry Grounded Track Anything Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T23:56:52.009530Z"},"links":{"cited_paper":"/paper/2507.07781","citing_paper":"/paper/2607.03789"},"observation_digest":"sha256:3558810f7e737eeadfd999ec110100e2779c2f5916033867d9c8b9eb0e4d5a7b","observation_id":"01684f2e-885d-4528-b5d0-182573a6ee2e","resolution":{"observed_at":"2026-07-11T23:56:52.009530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.07781/citation-record","integrity":"/paper/2507.07781/integrity","json":"/paper/2507.07781/citation-record.json","paper":"/paper/2507.07781"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:26.595031Z","title":"Scanents3d: Exploiting phrase-to-3d-object correspondences for improved visio-linguistic models in 3d scenes.WACV, 2022","venue":null,"work_id":"950d23d4-2c6a-4a37-8e11-5d8220f9d6b0","year":2022},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.114837Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:3886ec5b01a462790720af88158e36895f14bc122a64a45b4380fa3e845372da","observation_id":"9376cfc3-aed9-4cf8-83f9-69393bdf2cb9","resolution":{"observed_at":"2026-08-06T18:37:26.624177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:26.450946Z","title":"Referit3d: Neural listeners for fine-grained 3d object identification in real-world scenes","venue":null,"work_id":"08edd833-808b-48b1-b025-e2d43c5d4cad","year":2020},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.120880Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:9913e6f39e43354dda8041359961be079acd60544b3f1f7c6b973e188038c2f6","observation_id":"d8b9af87-1faa-4dd8-b234-3bcb510b0aef","resolution":{"observed_at":"2026-08-06T18:37:26.491641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:21.126873Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.126873Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:ae8a524fc8620da5f16a6ea0351d10572a2303e52f17c74cbeaa28c4a610c7de","observation_id":"1b40e861-a928-4ed0-997f-f53026a46edb","resolution":{"observed_at":"2026-08-06T18:37:21.126873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15558","last_updated":"2025-05-19T17:59:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-18T22:06:58Z","title":"Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15558","snapshot_observed_at":"2026-08-06T18:37:21.133258Z","title":"Cosmos-reason1: From physical common sense to embodied reasoning.arXiv preprint arXiv:2503.15558, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.133258Z"},"links":{"cited_paper":"/paper/2503.15558","citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:3fb445d4bbdd7a0332efb2b582006d72dae3cdd3b6bfda3ede1d0beea302f7ad","observation_id":"b7e840de-bc4e-4b8c-901a-a6f8dc94ff4b","resolution":{"observed_at":"2026-08-06T18:37:21.133258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:26.268019Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language","venue":null,"work_id":"4571e130-9c5e-4223-bbe9-b44df5d2fc34","year":2020},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.139122Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:d4d4b3992c4d74ad2e1414e1d84da111c32797dbb8068c82f1fbe2b3bee1b7e4","observation_id":"543dca29-9e36-4ef3-9fa9-ac2c3d0652e9","resolution":{"observed_at":"2026-08-06T18:37:26.323272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:26.104277Z","title":null,"venue":null,"work_id":"0983dae8-d498-4252-a1da-5ab9bcb9d9bf","year":2020},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.145147Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:366a50cab399e31426c7027b4fcbd6e9a7d0ea06d78bb6da741a0ac17e56ab66","observation_id":"7aa50b6c-d6c4-4909-84da-bdd7a04867a1","resolution":{"observed_at":"2026-08-06T18:37:26.181776Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:25.951617Z","title":"Towards label-free scene understanding by vision foundation models","venue":null,"work_id":"9624b03c-9e0f-4bcf-a024-8e24ca745613","year":2023},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.151006Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:2457a3a0e1790a5f67a03ea1fc8f0068f30ba5a7d6d6892f11a45ff281287615","observation_id":"a49de642-bb8a-4a85-ab87-769d11004151","resolution":{"observed_at":"2026-08-06T18:37:26.042482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:25.862126Z","title":"Clip2scene: Towards label-efficient 3d scene understanding by clip","venue":null,"work_id":"2c70bd8d-1b0c-4196-85ca-48097743fb66","year":2023},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.156005Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:aca619e39a0c3564366deeeb5775d8baca5006d70e1068bdb30ea3c4bd1b499e","observation_id":"bf533800-795b-499b-937b-7d9eb46bb329","resolution":{"observed_at":"2026-08-06T18:37:25.903944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00326","last_updated":"2024-12-31T07:55:35Z","snapshot_observed_at":"2026-08-18T00:13:46.392371Z","submitted_at":"2024-12-31T07:55:35Z","title":"OVGaussian: Generalizable 3D Gaussian Segmentation with Open Vocabularies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00326","snapshot_observed_at":"2026-08-06T18:37:21.160848Z","title":"Ovgaussian: Generalizable 3d gaussian segmentation with open vocabularies.arXiv preprint arXiv:2501.00326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.160848Z"},"links":{"cited_paper":"/paper/2501.00326","citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:8a2804ce3f8da12a9ec241ff78ff564c085d2c3a6d7ae1e79f80e3f30cf271d9","observation_id":"4148b6cc-5b0e-4a17-aed6-75c5f3173d47","resolution":{"observed_at":"2026-08-06T18:37:21.160848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09923","last_updated":"2023-09-29T04:03:28Z","snapshot_observed_at":"2026-08-19T17:29:16.978766Z","submitted_at":"2022-10-18T15:06:54Z","title":"Zero-shot point cloud segmentation by transferring geometric primitives","version":3},"cited_work":{"arxiv_id":"2210.09923","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.09923","snapshot_observed_at":"2026-08-06T18:37:22.279454Z","title":"Zero-shot point cloud segmentation by transferring geometric primitives","venue":"cs.CV","work_id":"4c29163e-e183-47c0-b216-2917fcee8837","year":2022},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.166231Z"},"links":{"cited_paper":"/paper/2210.09923","citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:36feae021d4e0ee9f9cda22a048d7bec3bf83ea54c38e45d9955443449fe897c","observation_id":"c6b1ba35-5ff8-42c0-bb3c-8e907b4ee5c9","resolution":{"observed_at":"2026-08-06T18:37:22.363226Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:25.730206Z","title":"Bridging language and geometric primitives for zero-shot point cloud segmentation","venue":null,"work_id":"05fd29cc-94ed-4144-9c71-a1dff4a6a8f4","year":2023},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.171663Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:b81a8af652b7b8e6d1c8001b42fd5cc9683acd7c7ce71d6abb81bde7ab794873","observation_id":"241bf559-752a-4323-ac7b-128ab4e7f507","resolution":{"observed_at":"2026-08-06T18:37:25.784832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:25.620397Z","title":"Ll3da: Visual interactive instruction tuning for omni-3d understanding reasoning and planning","venue":null,"work_id":"e5916786-f4cf-4406-ba90-14a571f11981","year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.176775Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:e555ee7b015ba3be38658cb1d3bc039e5e814641a85f943187c4d2e420757480","observation_id":"b452f0b8-dea8-4990-ad3f-496a7d70925b","resolution":{"observed_at":"2026-08-06T18:37:25.684857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19326","last_updated":"2024-05-29T17:56:07Z","snapshot_observed_at":"2026-08-16T13:48:05.061996Z","submitted_at":"2024-05-29T17:56:07Z","title":"Reasoning3D -- Grounding and Reasoning in 3D: Fine-Grained Zero-Shot Open-Vocabulary 3D Reasoning Part Segmentation via Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19326","snapshot_observed_at":"2026-08-06T18:37:21.181823Z","title":"Reasoning3d–grounding and reasoning in 3d: Fine-grained zero-shot open-vocabulary 3d reasoning part segmentation via large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.181823Z"},"links":{"cited_paper":"/paper/2405.19326","citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:cc0027be6f9a17948169f84a3498694e4f7807f0b251a62ef26a08a17241db14","observation_id":"b292152c-adad-48cc-b2e8-98a6979bbdb0","resolution":{"observed_at":"2026-08-06T18:37:21.181823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10370","last_updated":"2024-11-18T08:29:08Z","snapshot_observed_at":"2026-08-18T13:34:10.935081Z","submitted_at":"2024-05-16T18:03:41Z","title":"Grounded 3D-LLM with Referent Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10370","snapshot_observed_at":"2026-08-06T18:37:21.187570Z","title":"Grounded 3d-llm with referent tokens.arXiv preprint arXiv: 2405.10370, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.187570Z"},"links":{"cited_paper":"/paper/2405.10370","citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:1c7bbe8cdcafb0b4edd4afb7119be72cb7c6e1fe0d6ddc7aca7a63c12781ea0e","observation_id":"93c3ecf0-d3c8-466b-af6a-67e62075dabd","resolution":{"observed_at":"2026-08-06T18:37:21.187570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:25.498152Z","title":null,"venue":null,"work_id":"ab1695fc-5419-41e5-b2c8-88240ad1b32c","year":2022},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.193512Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:c2ac3469e5c8fa91127750d59d40680274195d32d2dbb330eabf67795e5c96db","observation_id":"3d085221-29a1-4e6c-a68a-63ec232906cd","resolution":{"observed_at":"2026-08-06T18:37:25.545431Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:25.278276Z","title":"Segpoint: Segment any point cloud via large language model","venue":null,"work_id":"6c4cdd81-4530-4cb7-9a79-23ab18d85ef9","year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.199440Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:e8284bfdde9e3384f7fc3912e19fe443e8486bd2b4e14b3662fab8671a2b3220","observation_id":"b5a4291c-4900-4b9b-9bad-50c7e71bef18","resolution":{"observed_at":"2026-08-06T18:37:25.369542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:25.174914Z","title":"3d concept learning and reasoning from multi-view images","venue":null,"work_id":"b6e397f6-6f8c-4e4a-8341-18af7d228d41","year":2023},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.205237Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:d1019156c04f5c6cbd1e59013c72bc2e5690b85c15e4354c71ad6f83cd925354","observation_id":"1c0ae59c-f287-4a9d-b403-2c10bf660c0b","resolution":{"observed_at":"2026-08-06T18:37:25.223082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:25.035409Z","title":"3d-llm: injecting the 3d world into large language models","venue":null,"work_id":"e49d406d-6618-417f-8c23-6ddf4254f850","year":2023},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.211899Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:c9ef39daf1589d659900ac22c020ec81e8c7390baeb467972dbd8e6bec74045c","observation_id":"88a24fde-1d8c-443a-8169-e0f0c819eac2","resolution":{"observed_at":"2026-08-06T18:37:25.076517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:24.879065Z","title":"Chat-scene: Bridging 3d scene and large language models with object identifiers","venue":null,"work_id":"cd266851-4567-4b01-9716-a5fb0b4f3172","year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.217983Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:ae6421e855bb7bf7d2d9904177879bd5d113fd1f2da52a6526f5f9ff250cbc5c","observation_id":"38fc496f-7a4c-4614-af2a-f2a6eef7d609","resolution":{"observed_at":"2026-08-06T18:37:24.930825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:24.725751Z","title":"An embodied generalist agent in 3d world","venue":null,"work_id":"12351df4-0f01-4513-a406-8f1924e6b2ff","year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.224453Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:f2ee31fa0e3ceb4b97356922f87ec420ce88afca1a59c83a28a4f0f365935bda","observation_id":"f7ee941a-0953-47fe-822d-78787c2cc680","resolution":{"observed_at":"2026-08-06T18:37:24.808362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:21.231214Z","title":"Mllm-for3d: Adapting multimodal large language model for 3d reasoning segmentation.arXiv preprint arXiv:2503.18135, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.231214Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:47879f81a9cc2d616f053cb3ff0f60741135abb7ad4f403107db4d67358f6669","observation_id":"66773a7b-6149-40a1-9c5a-b97c8fc6ddeb","resolution":{"observed_at":"2026-08-06T18:37:21.231214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:24.607556Z","title":"Mllm-for3d: Adapting multimodal large language model for 3d reasoning segmentation, 2025","venue":null,"work_id":"b98b8107-4240-4380-9536-a4699e2d4c0d","year":2025},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.237038Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:a45bd2ce0e9b23f20a668d7f0aa41547993b7ea8b41f20c24bb7a71ea4b06665","observation_id":"7600b532-ee8d-4d1b-8f5d-8ae1bade0159","resolution":{"observed_at":"2026-08-06T18:37:24.674946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17427","last_updated":"2025-02-09T07:32:21Z","snapshot_observed_at":"2026-08-19T10:11:45.966960Z","submitted_at":"2024-05-27T17:59:41Z","title":"Reason3D: Searching and Reasoning 3D Segmentation via Large Language Model","version":2},"cited_work":{"arxiv_id":"2405.17427","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.17427","snapshot_observed_at":"2026-08-06T18:37:21.949316Z","title":"Reason3D: Searching and Reasoning 3D Segmentation via Large Language Model","venue":"cs.CV","work_id":"a736f669-d2a0-4c16-a856-6c1ee7249e57","year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.243530Z"},"links":{"cited_paper":"/paper/2405.17427","citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:8a7c093770d76439024f446bb102d2b775e48324eb301128bbadf9136d14836d","observation_id":"042d3286-fb21-4c1f-ab19-3971b06480f7","resolution":{"observed_at":"2026-08-06T18:37:22.046731Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:24.485936Z","title":"Text-guided graph neural networks for referring 3d instance segmentation.AAAI, 35(2):1610–1618, May 2021","venue":null,"work_id":"7255d11e-81c6-473f-93fa-43c7efcb8113","year":2021},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.255021Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:84992040728cd920d8538316c7236918a489e2862f3dbb07759698856d8fb8a3","observation_id":"2d6570b7-2cda-4a48-95c0-ecf1afc66378","resolution":{"observed_at":"2026-08-06T18:37:24.529985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:24.341251Z","title":"Dense object grounding in 3d scenes.ACM Multimedia, 2023","venue":null,"work_id":"c0d773ea-ce8e-4404-baa1-a4f91e740fab","year":2023},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.261876Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:50cd7d3f6860585b46ece5aa8f8c75124785be7a9433b90e8a827dd60b19531f","observation_id":"d9ac1b62-ec57-42e0-8d96-4246995d0ff7","resolution":{"observed_at":"2026-08-06T18:37:24.383244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:24.189958Z","title":"Sceneverse: Scaling 3d vision-language learning for grounded scene understanding","venue":null,"work_id":"826b112b-1936-4bda-b73a-6f838470118d","year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.267560Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:39dab6d87984047cd3c966ccba177e3296dc71fb7f4c3d55b9457be704429433","observation_id":"4471163f-cb6b-4db4-89ab-5737e3b369ce","resolution":{"observed_at":"2026-08-06T18:37:24.255373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13927","last_updated":"2025-08-03T11:03:07Z","snapshot_observed_at":"2026-08-16T01:48:31.510204Z","submitted_at":"2024-11-21T08:22:45Z","title":"Multimodal 3D Reasoning Segmentation with Complex Scenes","version":4},"cited_work":{"arxiv_id":"2411.13927","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.13927","snapshot_observed_at":"2026-08-06T18:37:21.795325Z","title":"Multimodal 3D Reasoning Segmentation with Complex Scenes","venue":"cs.CV","work_id":"92cd1fdc-5b0b-4430-a232-07c741097f01","year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.273496Z"},"links":{"cited_paper":"/paper/2411.13927","citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:c043509377559c5deb32d6f614dc8782c00d478170d5078c0cce518ab3a6cbaf","observation_id":"c9d89ce4-7ef4-476e-a7ca-79ec368e6539","resolution":{"observed_at":"2026-08-06T18:37:21.860973Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:24.031160Z","title":"Intent3d: 3d object detection in rgb-d scans based on human intention","venue":null,"work_id":"f449583c-2626-4ae4-a73c-d428fd9b9ee9","year":2025},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.280081Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:83cda51e9e9d4975187df397eb407ce1c025fe0263417e0a9344a686196e209a","observation_id":"6c0c30db-6c45-4dbf-bf87-63ee7a7f99dd","resolution":{"observed_at":"2026-08-06T18:37:24.091965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:23.896557Z","title":"M3dbench: Towards omni 3d assistant with interleaved multi-modal instructions","venue":null,"work_id":"247937d6-ffbe-4305-8561-d9a255ac6dd0","year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.288173Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:3acbf87683afe07ede549aa0f59b25b650d5d2723121e9e30ac5eda46eb147b2","observation_id":"83c48785-f887-4b67-be35-c9b7c3c962ab","resolution":{"observed_at":"2026-08-06T18:37:23.955399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03201","last_updated":"2024-01-16T16:39:57Z","snapshot_observed_at":"2026-08-16T14:29:26.932807Z","submitted_at":"2024-01-06T12:20:18Z","title":"3DMIT: 3D Multi-modal Instruction Tuning for Scene Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03201","snapshot_observed_at":"2026-08-06T18:37:21.293763Z","title":"3dmit: 3d multi-modal instruction tuning for scene understanding.arXiv preprint arXiv:2401.03201, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.293763Z"},"links":{"cited_paper":"/paper/2401.03201","citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:243ca14aa9c96fd56d2a528326a39ab2bc50fb801cb7996397c13985db7bcbf0","observation_id":"362f372f-b1d3-4e5f-a3aa-0d1015d2618b","resolution":{"observed_at":"2026-08-06T18:37:21.293763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:23.762062Z","title":"Multi-modal situated reasoning in 3d scenes.NeurIPS, 2024","venue":null,"work_id":"423eb0d2-c55c-44ff-bc33-3849720b0cdb","year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.299608Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:b4fbf890d4dc84b0fcaef1b044d17dce53cf995cd9055a7fe9e2282968384aef","observation_id":"b948b5bd-2019-432c-820e-060b18784fe6","resolution":{"observed_at":"2026-08-06T18:37:23.821728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:23.557981Z","title":"See more and know more: Zero-shot point cloud segmentation via multi-modal visual data","venue":null,"work_id":"3f7629bc-143d-4c4c-b6df-84843bf58bba","year":2023},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.307224Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:3e72a781cb4d1beeb8884202504537f00c5dc5e1db28b4b702126bc35d979b1d","observation_id":"e141879a-7cc9-41f9-bcd1-4302cbbbcea4","resolution":{"observed_at":"2026-08-06T18:37:23.645328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:21.314108Z","title":"3dsrbench: A comprehensive 3d spatial reasoning benchmark.arXiv preprint arXiv:2412.07825, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.314108Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:d947639fa2738f8be33b36171e44fd3f0d7219b9376e26d3f7e001ea16f97b17","observation_id":"346a79c3-8c57-4270-93cb-b5eba08d6163","resolution":{"observed_at":"2026-08-06T18:37:21.314108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:21.319192Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.319192Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:0db20603bfae3ff3d1b89b94323d6b7ecb00681ff4d7ff8f71f149af8ba5d6bb","observation_id":"99404787-2c76-42ee-98e0-c7d6561e17b2","resolution":{"observed_at":"2026-08-06T18:37:21.319192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:23.360434Z","title":"X-refseg3d: Enhancing referring 3d instance segmentation via structured cross-modal graph neural networks","venue":null,"work_id":"1a0386f5-70e2-474c-a0fa-3b770a9b2411","year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.324456Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:a3eff8b80f694500a7700d7f7722c32161ff2e79ded4266a438e798c04c8e973","observation_id":"fd250474-66e0-431b-bd7d-d4b83e2ddde7","resolution":{"observed_at":"2026-08-06T18:37:23.395769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:23.235602Z","title":"Fully convolutional networks for semantic segmentation.IEEE TPAMI, 39(4):640–651, 2017","venue":null,"work_id":"abd149fb-16f6-48ad-84b8-b25aefde0ef6","year":2017},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.330745Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:5001cfa02607cb936489aa104bf01ae67cccaf2b11b7ebeb3f8a821c1fd9e341","observation_id":"181c2de8-7ad0-41ba-9f83-b112b78c4865","resolution":{"observed_at":"2026-08-06T18:37:23.282816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:23.117563Z","title":"Embodiedscan: A holistic multi-modal 3d perception suite towards embodied ai","venue":null,"work_id":"f6af8f32-3b93-413a-a373-8cd041254a85","year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.337102Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:4a12000274aad1080a220fe0a9edae110daab4231f00b3942895bded8ffdd3f8","observation_id":"644d44f1-f96e-423b-b35c-a0403c355991","resolution":{"observed_at":"2026-08-06T18:37:23.182958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08769","last_updated":"2023-08-17T03:52:15Z","snapshot_observed_at":"2026-08-20T07:15:08.903665Z","submitted_at":"2023-08-17T03:52:15Z","title":"Chat-3D: Data-efficiently Tuning Large Language Model for Universal Dialogue of 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08769","snapshot_observed_at":"2026-08-06T18:37:21.344604Z","title":"Chat-3d: Data- efficiently tuning large language model for universal dialogue of 3d scenes.arXiv preprint arXiv:2308.08769, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.344604Z"},"links":{"cited_paper":"/paper/2308.08769","citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:9f3672f2c2c6b74dfbb457c754476c6ad9d35d335ad2d842854b5a618facceb0","observation_id":"3770243f-952a-4a6c-94dd-05f355ed0d06","resolution":{"observed_at":"2026-08-06T18:37:21.344604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:22.993886Z","title":"3d-stmn: Dependency-driven superpoint-text matching network for end-to-end 3d referring expression segmentation","venue":null,"work_id":"b91c0461-cea6-42b6-9abe-4aeb4ac94b3b","year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.352680Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:1b3ee5c0005e17ce5b897fc82409c62b392dd3b6a55026c93eeccfe5048bcbae","observation_id":"b23ebd52-1067-4957-95b2-552b4f7e0a31","resolution":{"observed_at":"2026-08-06T18:37:23.052030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:22.875672Z","title":"Com- prehensive visual question answering on point clouds through compositional scene manipulation, 2023","venue":null,"work_id":"bd83d47f-34c2-45f4-99d4-720d711db301","year":2023},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.360014Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:8a9d34b1031082264db7a1982dad7e7b84941fdf23f77db44c745d3f7813489d","observation_id":"eac10f64-5bb7-472e-a662-ba3269557217","resolution":{"observed_at":"2026-08-06T18:37:22.908862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:22.745191Z","title":"Fouhey, and Joyce Chai","venue":null,"work_id":"b637344d-a084-4b23-a2b6-f6e5045fba6b","year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.367267Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:d3a7b993ac2356dd27f131b1d58b8a7f9ee8d9144820df86bbf1f46b978ea200","observation_id":"c2c71b5d-d935-4927-bd90-1dc2685e2feb","resolution":{"observed_at":"2026-08-06T18:37:22.814955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:21.375086Z","title":"Scannet++: A high-fidelity dataset of 3d indoor scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.375086Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:97495c677379cb7d1b37200e5574505bbb1f2f4db10946954ba7b0eb9f0dbdc2","observation_id":"e9854bb2-90b6-42a3-b153-64c907f4714c","resolution":{"observed_at":"2026-08-06T18:37:21.375086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17044","last_updated":"2025-03-21T11:00:12Z","snapshot_observed_at":"2026-08-16T12:47:59.541438Z","submitted_at":"2025-03-21T11:00:12Z","title":"ExCap3D: Expressive 3D Scene Understanding via Object Captioning with Varying Detail","version":1},"cited_work":{"arxiv_id":"2503.17044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.17044","snapshot_observed_at":"2026-08-06T18:37:21.578219Z","title":"ExCap3D: Expressive 3D Scene Understanding via Object Captioning with Varying Detail","venue":"cs.CV","work_id":"6b7dc670-9ad5-4dcd-9125-818245ad9961","year":2025},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.381545Z"},"links":{"cited_paper":"/paper/2503.17044","citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:264f02a4f0aa2182c92ec6cab57cc8232fb54b2f0fb196ff09cb64a46b507add","observation_id":"30d36a3c-73ef-4ec8-8854-6d3fbf77c3c3","resolution":{"observed_at":"2026-08-06T18:37:21.594527Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.01821","last_updated":"2023-05-27T10:03:34Z","snapshot_observed_at":"2026-08-16T16:48:20.320329Z","submitted_at":"2022-07-05T05:50:12Z","title":"Toward Explainable and Fine-Grained 3D Grounding through Referring Textual Phrases","version":2},"cited_work":{"arxiv_id":"2207.01821","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.01821","snapshot_observed_at":"2026-08-06T18:37:21.527535Z","title":"Toward Explainable and Fine-Grained 3D Grounding through Referring Textual Phrases","venue":"cs.CV","work_id":"8bde4fd7-103b-49cc-b86a-18685ccc8187","year":2022},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.389400Z"},"links":{"cited_paper":"/paper/2207.01821","citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:c04131df00d5744d4966d30ead769a819ea2813a8748d5bd5af8dbba14341fdb","observation_id":"6a899754-8dde-43f0-912c-07f2f9f8c2bb","resolution":{"observed_at":"2026-08-06T18:37:21.542408Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03540","last_updated":"2024-11-05T22:42:41Z","snapshot_observed_at":"2026-08-20T01:14:19.619807Z","submitted_at":"2024-11-05T22:42:41Z","title":"VLA-3D: A Dataset for 3D Semantic Scene Understanding and Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03540","snapshot_observed_at":"2026-08-06T18:37:21.399482Z","title":"Vla-3d: A dataset for 3d semantic scene understanding and navigation.arXiv preprint arXiv: 2411.03540, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.399482Z"},"links":{"cited_paper":"/paper/2411.03540","citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:a17cc65fe1ecd7bbfd0860503ffb3ae119a45bd7d86b7de008a494bf7061acfb","observation_id":"4253dfeb-ddb6-4e97-9581-e8379f3a1fde","resolution":{"observed_at":"2026-08-06T18:37:21.399482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01525","last_updated":"2024-07-17T07:07:43Z","snapshot_observed_at":"2026-08-16T13:38:01.438808Z","submitted_at":"2024-07-01T17:59:35Z","title":"ScanReason: Empowering 3D Visual Grounding with Reasoning Capabilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01525","snapshot_observed_at":"2026-08-06T18:37:21.413309Z","title":"Scanreason: Empowering 3d visual grounding with reasoning capabilities.arXiv preprint arXiv: 2407.01525, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.413309Z"},"links":{"cited_paper":"/paper/2407.01525","citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:c3ef9158a13d8971cd1a481a4d0f4a0db5f9cc0310ed913f7f3a23dbc3d7449a","observation_id":"869ee334-947e-452a-a4cf-0c9bcf0a93f8","resolution":{"observed_at":"2026-08-06T18:37:21.413309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:22.517789Z","title":"3d-vista: Pre-trained transformer for 3d vision and text alignment","venue":null,"work_id":"5e5c1521-a764-4f27-bc7b-5597a52c5b28","year":2023},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.425460Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:d744288ffc1d6992bbbc2fcaeda4468b0e6943c42294b6ef3f84992abb6d0895","observation_id":"773e9acc-2f00-4620-961d-89669b1f0225","resolution":{"observed_at":"2026-08-06T18:37:22.621098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T01:06:41.101612Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":5,"verified_fuzzy":27},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 5 inbound Pith citation observations for arXiv:2507.07781."}