{"as_of":"2026-08-15T12:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:52b5159239e0db94a42c1eabf4507f89d21abe0d87660162cf24a175c4d018da","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T21:29:55.361232Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T16:55:42.535955Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T11:54:09.182489Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04380","snapshot_observed_at":"2026-08-11T16:55:42.535955Z","title":"Embodiedocc: Embodied 3d occu- pancy prediction for vision-based online scene understand- ing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09627","last_updated":"2024-12-12T18:59:59Z","snapshot_observed_at":"2026-08-14T07:24:23.254068Z","submitted_at":"2024-12-12T18:59:59Z","title":"Doe-1: Closed-Loop Autonomous Driving with Large World Model","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T16:55:42.535955Z"},"links":{"cited_paper":"/paper/2412.04380","citing_paper":"/paper/2412.09627"},"observation_digest":"sha256:b1b159a3be95af7e675a09442db159040b2ef8891b16f61898addd25a3667290","observation_id":"1970862a-68ae-409d-9ce8-bb055d41e1af","resolution":{"observed_at":"2026-08-11T16:55:42.535955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04380","snapshot_observed_at":"2026-08-10T11:29:47.312913Z","title":"Embod- iedocc: Embodied 3d occupancy prediction for vision-based online scene understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16684","last_updated":"2025-01-28T03:41:24Z","snapshot_observed_at":"2026-08-14T16:47:54.954738Z","submitted_at":"2025-01-28T03:41:24Z","title":"SliceOcc: Indoor 3D Semantic Occupancy Prediction with Vertical Slice Representation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T11:29:47.312913Z"},"links":{"cited_paper":"/paper/2412.04380","citing_paper":"/paper/2501.16684"},"observation_digest":"sha256:6933a4cbadc913b929237b205b779e460a9e83e8afd298d1a16e74998809826b","observation_id":"74097d88-9543-4e8a-9390-5dec998ab59e","resolution":{"observed_at":"2026-08-10T11:29:47.312913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04380","snapshot_observed_at":"2026-08-07T13:56:21.776114Z","title":"Embodiedocc: Embodied 3d occupancy prediction for vision-based online scene understanding.arXiv preprint arXiv:2412.04380, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20610","last_updated":"2025-05-27T01:17:10Z","snapshot_observed_at":"2026-08-09T13:43:30.735436Z","submitted_at":"2025-05-27T01:17:10Z","title":"OmniIndoor3D: Comprehensive Indoor 3D Reconstruction","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:21.776114Z"},"links":{"cited_paper":"/paper/2412.04380","citing_paper":"/paper/2505.20610"},"observation_digest":"sha256:0b6d3527a76765b195893e745d0bae77b1a3e12a8f319da5ed03bc5a79675fd0","observation_id":"4bcd17e8-c2ea-4774-a1a9-d87991094cda","resolution":{"observed_at":"2026-08-07T13:56:21.776114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"cited_work":{"arxiv_id":"2412.04380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04380","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Embodiedocc: Embodied 3d occu- pancy prediction for vision-based online scene understand- ing","venue":null,"work_id":"a230eaf7-bf5a-465f-94a5-c45ea471ec1e","year":2024},"citing_paper":{"arxiv_id":"2507.11539","last_updated":"2026-03-31T10:04:45Z","snapshot_observed_at":"2026-08-13T06:20:07.628557Z","submitted_at":"2025-07-15T17:59:57Z","title":"Streaming 4D Visual Geometry Transformer","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T22:58:18.929748Z"},"links":{"cited_paper":"/paper/2412.04380","citing_paper":"/paper/2507.11539"},"observation_digest":"sha256:b824cc47dbef6a0bea54123e1bcfe99bde28c4427f1df66d9442e6c632904c99","observation_id":"f332ed82-0197-4eb5-8205-c95e06fbdb4b","resolution":{"observed_at":"2026-05-15T22:58:19.021742Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04380","snapshot_observed_at":"2026-08-06T13:49:07.884297Z","title":"Embodiedocc: Embodied 3d occupancy prediction for vision-based online scene understanding.arXiv preprint arXiv:2412.04380,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20217","last_updated":"2025-07-29T02:24:52Z","snapshot_observed_at":"2026-08-13T02:38:13.182950Z","submitted_at":"2025-07-27T10:47:00Z","title":"Humanoid Occupancy: Enabling A Generalized Multimodal Occupancy Perception System on Humanoid Robots","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T13:49:07.884297Z"},"links":{"cited_paper":"/paper/2412.04380","citing_paper":"/paper/2507.20217"},"observation_digest":"sha256:12e77e58943844c08a340d97f8f7efb3567c93b3223adcd469bc8714084ad9bb","observation_id":"a9a1d682-1934-441b-813e-89c875690b9d","resolution":{"observed_at":"2026-08-06T13:49:07.884297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"cited_work":{"arxiv_id":"2412.04380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04380","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Embodiedocc: Embodied 3d occu- pancy prediction for vision-based online scene understand- ing","venue":null,"work_id":"a230eaf7-bf5a-465f-94a5-c45ea471ec1e","year":2024},"citing_paper":{"arxiv_id":"2602.22667","last_updated":"2026-05-18T07:52:01Z","snapshot_observed_at":"2026-08-14T16:47:58.233802Z","submitted_at":"2026-02-26T06:37:43Z","title":"Monocular Open Vocabulary Occupancy Prediction for Indoor Scenes","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-21T11:50:37.423645Z"},"links":{"cited_paper":"/paper/2412.04380","citing_paper":"/paper/2602.22667"},"observation_digest":"sha256:bfa3729b5f14ea7b123bce3cf14ef09f7039e1e6d3aab149699170a2abf00714","observation_id":"33cff886-b3ec-4136-b7d5-3e40830aa709","resolution":{"observed_at":"2026-05-21T11:54:09.184803Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"cited_work":{"arxiv_id":"2412.04380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04380","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Embodiedocc: Embodied 3d occu- pancy prediction for vision-based online scene understand- ing","venue":null,"work_id":"a230eaf7-bf5a-465f-94a5-c45ea471ec1e","year":2024},"citing_paper":{"arxiv_id":"2604.13476","last_updated":"2026-04-26T03:48:21Z","snapshot_observed_at":"2026-08-13T11:45:08.505724Z","submitted_at":"2026-04-15T04:58:23Z","title":"RobotPan: A 360$^\\circ$ Surround-View Robotic Vision System for Embodied Perception","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T13:25:18.100623Z"},"links":{"cited_paper":"/paper/2412.04380","citing_paper":"/paper/2604.13476"},"observation_digest":"sha256:ececf15c1cd8546ec76a4ffa30b28b8e030a11a11b490a71e7ca767c1afe8374","observation_id":"56e37aba-9d7f-4dbd-8e11-d76ce0cdd0f4","resolution":{"observed_at":"2026-05-10T13:25:25.647936Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"cited_work":{"arxiv_id":"2412.04380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04380","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Embodiedocc: Embodied 3d occu- pancy prediction for vision-based online scene understand- ing","venue":null,"work_id":"a230eaf7-bf5a-465f-94a5-c45ea471ec1e","year":2024},"citing_paper":{"arxiv_id":"2604.27578","last_updated":"2026-04-30T08:30:25Z","snapshot_observed_at":"2026-08-14T16:47:56.150338Z","submitted_at":"2026-04-30T08:30:25Z","title":"World2Minecraft: Occupancy-Driven Simulated Scenes Construction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-07T08:01:12.571480Z"},"links":{"cited_paper":"/paper/2412.04380","citing_paper":"/paper/2604.27578"},"observation_digest":"sha256:bccbc9a7463b6ac8b69c179383145b8920c5e48f9a801b2e92f04dd8286f1073","observation_id":"998cce05-e22e-44d2-86a4-10fffaf85f15","resolution":{"observed_at":"2026-05-12T10:06:27.363433Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.04380/citation-record","integrity":"/paper/2412.04380/integrity","json":"/paper/2412.04380/citation-record.json","paper":"/paper/2412.04380"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:56.119801Z","title":"Semantic scene com- pletion via integrating instances and scene in-the-loop","venue":null,"work_id":"71d3d573-cc82-4458-a4c0-2ceb9143408d","year":2021},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.091302Z"},"links":{"citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:694daf76353e4f5d2b6c2e010bd16d016a95917c95b67b2664139285c3c04a97","observation_id":"22e0f445-8913-43af-9568-4a1316e303ec","resolution":{"observed_at":"2026-08-11T21:29:56.123580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:56.108307Z","title":"Monoscene: Monoc- ular 3d semantic scene completion","venue":null,"work_id":"640a13f6-22e9-4897-a2e7-0a756d5d004b","year":2022},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.095342Z"},"links":{"citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:3b6af3531b35a46db01e9e525164fb1823ecc87e3c4b4c75f0b06400c764a5a3","observation_id":"0a363bbf-5bef-4cb3-a24d-b58e0c88fb01","resolution":{"observed_at":"2026-08-11T21:29:56.112042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:55.099553Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.099553Z"},"links":{"citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:438434966a404389e75b46937073a3a3bf8e52a8b7c5c7ceb730fcbee2073df5","observation_id":"e1fe07af-2421-4f56-9731-d545ce3890ff","resolution":{"observed_at":"2026-08-11T21:29:55.099553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:56.089571Z","title":"Scancomplete: Large- scale scene completion and semantic segmentation for 3d scans","venue":null,"work_id":"d587ef48-225c-4a16-a10e-2d2397517f3b","year":2018},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.104647Z"},"links":{"citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:2dcab8f0cf73705a96041c690e947789cfe8186b7401b7f334a5d63507b5c7fa","observation_id":"235e0a30-a6d7-44d8-a535-a4d30628b73d","resolution":{"observed_at":"2026-08-11T21:29:56.093849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11247","last_updated":"2026-05-13T03:31:24Z","snapshot_observed_at":"2026-08-06T04:07:06.773895Z","submitted_at":"2024-03-17T15:41:35Z","title":"Compact 3D Gaussian Splatting For Dense Visual SLAM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11247","snapshot_observed_at":"2026-08-11T21:29:55.108707Z","title":"Compact 3d gaussian splatting for dense visual slam","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.108707Z"},"links":{"cited_paper":"/paper/2403.11247","citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:aaa0d26bb427c2859531568bbbcc2eb6bdeafac95c4c1f0800d7ba2f20f79f10","observation_id":"658d1682-ac5a-4cb2-8a4a-4c81baa8f166","resolution":{"observed_at":"2026-08-11T21:29:55.108707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01283","last_updated":"2023-12-03T04:55:32Z","snapshot_observed_at":"2026-08-13T05:11:06.198239Z","submitted_at":"2023-12-03T04:55:32Z","title":"Deeper into Self-Supervised Monocular Indoor Depth Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01283","snapshot_observed_at":"2026-08-11T21:29:55.114287Z","title":"Deeper into self-supervised monocular indoor depth estimation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.114287Z"},"links":{"cited_paper":"/paper/2312.01283","citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:4ac94ea5cc69d2e5663668a5dfe87b84f46219a124492f6686f9133c4f7e457d","observation_id":"322924ac-14c3-4486-b4b1-0809ffa8393c","resolution":{"observed_at":"2026-08-11T21:29:55.114287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12365","last_updated":"2024-05-13T19:06:48Z","snapshot_observed_at":"2026-08-13T00:50:44.324755Z","submitted_at":"2024-03-19T02:22:21Z","title":"GaussianFlow: Splatting Gaussian Dynamics for 4D Content Creation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12365","snapshot_observed_at":"2026-08-11T21:29:55.119975Z","title":"Gaussianflow: Splatting gaussian dynamics for 4d content creation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.119975Z"},"links":{"cited_paper":"/paper/2403.12365","citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:834e58b0810e84a2ff17ea837d9778c5e45fc52069f5aeb7eec879f7056f82cf","observation_id":"19b8c5f0-43fc-44fa-b5d6-9f4a7b3bcf10","resolution":{"observed_at":"2026-08-11T21:29:55.119975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:56.078112Z","title":"Two stream 3d semantic scene completion","venue":null,"work_id":"f118821f-ac13-43b7-b56a-5a81bd0dcea1","year":2019},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.124936Z"},"links":{"citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:9f3bbacc021deb537dca4aae667609cb24aec13ebb8c96ff3670cc0b1ebc71b8","observation_id":"b1e6f4c8-e8dc-43db-9929-50b5d86b503a","resolution":{"observed_at":"2026-08-11T21:29:56.081826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:55.129158Z","title":"3d semantic segmentation with submanifold sparse convolutional networks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.129158Z"},"links":{"citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:b0348b28b97bc27f3f32e4ef2f206c1e9c3eed995064b76119db4a0b5ebe1721","observation_id":"0ca97ae6-3afc-468e-b975-03387ba8060a","resolution":{"observed_at":"2026-08-11T21:29:55.129158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14554","last_updated":"2024-03-21T16:53:03Z","snapshot_observed_at":"2026-08-13T00:48:31.957643Z","submitted_at":"2024-03-21T16:53:03Z","title":"Gaussian Frosting: Editable Complex Radiance Fields with Real-Time Rendering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14554","snapshot_observed_at":"2026-08-11T21:29:55.133922Z","title":"Gaussian frosting: Editable complex radiance fields with real-time rendering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.133922Z"},"links":{"cited_paper":"/paper/2403.14554","citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:019e9f7ecf1792e27d630e9b4a4bcf13b55ba44fbc4af8f9337b7bea31fc43d2","observation_id":"2605e5f3-7366-4c1e-8290-59ad16877001","resolution":{"observed_at":"2026-08-11T21:29:55.133922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:55.138717Z","title":"Tri-perspective view for vision-based 3d se- mantic occupancy prediction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.138717Z"},"links":{"citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:436226e8dcdc1b07ce314e1e1c89a7300f19034438e1057d2ef3e62c70306e3c","observation_id":"3161beee-64b4-4805-bcca-74d2889952a5","resolution":{"observed_at":"2026-08-11T21:29:55.138717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:56.045318Z","title":"Selfocc: Self-supervised vision-based 3d oc- cupancy prediction","venue":null,"work_id":"7c711414-a936-4085-8bba-85cedbe910c4","year":2024},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.143076Z"},"links":{"citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:66cd1194084ee8b3ecd91c5bd753499dbb45c25f97e7f69cad965df65efedb17","observation_id":"67e3713c-52b8-4d0a-a2f5-2aad09d1f664","resolution":{"observed_at":"2026-08-11T21:29:56.052815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:56.034344Z","title":"Gaussianformer: Scene as gaussians for vision-based 3d semantic occupancy prediction","venue":null,"work_id":"37807a11-17cd-464c-a6e8-10e6d0f5568f","year":2025},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.147124Z"},"links":{"citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:0e898e223f048de9ee436dd130c2b037513b6481cc117ee39c58fbdfa2c7e69a","observation_id":"9663b9cd-8411-445d-b9d7-9e5c66b00b36","resolution":{"observed_at":"2026-08-11T21:29:56.037857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:56.023101Z","title":"Semantically-aware spatio-temporal rea- soning agent for vision-and-language navigation in continu- ous environments","venue":null,"work_id":"2cee53db-ffe3-4e4f-9805-a0972263ce8f","year":2022},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.151246Z"},"links":{"citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:7f3da4ea5a3faaf92bd4283779987adb7d7bf529a4cf7b4bab918e05eeb2af26","observation_id":"1a31806a-48ff-465d-9729-92b939fe952f","resolution":{"observed_at":"2026-08-11T21:29:56.027323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:56.011973Z","title":"3d gaussian splatting for real-time radiance field rendering","venue":null,"work_id":"8696743f-6d9e-427a-a2f7-19d1745918f4","year":2023},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.155391Z"},"links":{"citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:e6a31b9eff750327e3d84ef6e9d5bfefa25b9e1d050726a03bb8a04d79c3f4fc","observation_id":"68986cbd-a507-4eeb-9370-80cd185588b7","resolution":{"observed_at":"2026-08-11T21:29:56.015702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:55.999934Z","title":"Unidet3d: Multi- dataset indoor 3d object detection","venue":null,"work_id":"b17c1f6f-4c1c-4234-85b9-4cfa719e8fbc","year":2025},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.160031Z"},"links":{"citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:a801679bc869e4aa5920e80dec4521f8653e89e075217ce03440cc38d65ed593","observation_id":"f992290f-401a-4e3a-9334-483a01e92225","resolution":{"observed_at":"2026-08-11T21:29:56.004592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:55.985376Z","title":"Instance-aware exploration-verification- exploitation for instance imagegoal navigation","venue":null,"work_id":"2ef091e4-e19f-4754-b589-51dd99fc3c1e","year":2024},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.163961Z"},"links":{"citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:00aa80064d464aa1fca98a126798ad4d081bb5f45bf555f226533034888c249f","observation_id":"525e9773-f7ed-4158-803f-f77e88ac79e4","resolution":{"observed_at":"2026-08-11T21:29:55.990429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:55.970718Z","title":"Rgbd based dimensional decomposi- tion residual network for 3d semantic scene completion","venue":null,"work_id":"8123bfbd-4180-41d9-ab25-0010c24c50ca","year":2019},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.167835Z"},"links":{"citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:adfaecedcd396e148313a4898bd1f4b34af4d90ae292ea8ed62e05a61b95b662","observation_id":"f90d932d-0ee0-4ed5-9519-604d2e869336","resolution":{"observed_at":"2026-08-11T21:29:55.974936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:55.951700Z","title":"Depth based semantic scene completion with position importance aware loss","venue":null,"work_id":"5be1c92f-58a8-4417-b76e-885c20e9032b","year":2019},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.172462Z"},"links":{"citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:d648f35ff105391cc7b582fc3b5fd2777834c2ed55875c5c3ef681f5a0fa1590","observation_id":"9f299ed4-3b95-425f-8cc3-41ddd2288660","resolution":{"observed_at":"2026-08-11T21:29:55.958303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:55.939466Z","title":"Sgs-slam: Se- mantic gaussian splatting for neural dense slam","venue":null,"work_id":"95caa9fc-86da-46d1-8721-1aa9e7507f54","year":2025},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.176634Z"},"links":{"citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:f8e039de05c63cf748947d02d3be70a230bcbf4a4935f1979ad0d027aa26684c","observation_id":"ac15fa0a-09c0-40d0-8461-27a144efbd6a","resolution":{"observed_at":"2026-08-11T21:29:55.943433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:55.925436Z","title":"V oxformer: Sparse voxel transformer for camera- based 3d semantic scene completion","venue":null,"work_id":"c8cd81cb-e095-4e55-bcea-c2365ebfa703","year":2023},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.180988Z"},"links":{"citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:b1c1db4f76a9412960b70a44acf5eb0bc3de1567061fd13fb463f12e3090beb9","observation_id":"d057e5ab-e7d3-4a2f-86cb-4141628fe98b","resolution":{"observed_at":"2026-08-11T21:29:55.930127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01492","last_updated":"2023-07-04T05:55:54Z","snapshot_observed_at":"2026-08-14T23:33:23.220819Z","submitted_at":"2023-07-04T05:55:54Z","title":"FB-OCC: 3D Occupancy Prediction based on Forward-Backward View Transformation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01492","snapshot_observed_at":"2026-08-11T21:29:55.185061Z","title":"Fb-occ: 3d occupancy prediction based on forward-backward view transformation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.185061Z"},"links":{"cited_paper":"/paper/2307.01492","citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:eb84f9f19cdf77c58dcb2fa7518a85af3088b0fa7adec3d6e13450d21328a5c4","observation_id":"7a89b67d-3244-444e-9527-74162ddac332","resolution":{"observed_at":"2026-08-11T21:29:55.185061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:55.189170Z","title":"Focal loss for dense object detection","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.189170Z"},"links":{"citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:8bf3e8fc7fd19c724050267d4e48e9b530adcbabc502e438c2aa0096e4dfd502","observation_id":"2f6756a7-9557-461b-a7b0-41d693ed76e1","resolution":{"observed_at":"2026-08-11T21:29:55.189170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11613","last_updated":"2024-04-17T17:59:53Z","snapshot_observed_at":"2026-08-14T16:58:29.064136Z","submitted_at":"2024-04-17T17:59:53Z","title":"InFusion: Inpainting 3D Gaussians via Learning Depth Completion from Diffusion Prior","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11613","snapshot_observed_at":"2026-08-11T21:29:55.193079Z","title":"Infusion: Inpainting 3d gaussians via learn- ing depth completion from diffusion prior","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.193079Z"},"links":{"cited_paper":"/paper/2404.11613","citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:b0b09ad4e73db703f4000c1fd778ad4189568489316f7752acc9b6b4c3d50d5d","observation_id":"c6142670-2d85-4a7a-9830-738402c0f050","resolution":{"observed_at":"2026-08-11T21:29:55.193079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-08-11T21:29:55.197385Z","title":"Sgdr: Stochas- tic gradient descent with warm restarts","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.197385Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:8dfbe5a5677e8aa7aef5c93ff15550c3b55a636a0f71f8e0ff6c9e81097b1247","observation_id":"57dff516-f009-4a72-879b-846e2d49137a","resolution":{"observed_at":"2026-08-11T21:29:55.197385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-11T21:29:55.201446Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.201446Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:547733b84b34a3847524dcf770d3630cfcc019727780c4bd89324351a47bfa9f","observation_id":"f6614d5b-2308-4a84-9a31-c49268d72448","resolution":{"observed_at":"2026-08-11T21:29:55.201446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:55.905293Z","title":"3d geometry-aware deformable gaussian splatting for dynamic view synthesis","venue":null,"work_id":"988cc8d1-676a-48c9-af63-3158edd900e9","year":2024},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.205770Z"},"links":{"citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:87c8c100056078837d3456c55bd3cb7e2bf7ab13ab13b416557bee5b399c5bb9","observation_id":"e908c915-0b24-4c62-ae0c-068430d033cb","resolution":{"observed_at":"2026-08-11T21:29:55.909818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09401","last_updated":"2025-06-09T07:53:16Z","snapshot_observed_at":"2026-08-12T23:43:17.748374Z","submitted_at":"2024-06-13T17:59:30Z","title":"MMScan: A Multi-Modal 3D Scene Dataset with Hierarchical Grounded Language Annotations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09401","snapshot_observed_at":"2026-08-11T21:29:55.209758Z","title":"Mmscan: A multi-modal 3d scene dataset with hierarchical grounded language annota- tions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.209758Z"},"links":{"cited_paper":"/paper/2406.09401","citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:aadf5a3e06325fe1528292a14841b37b4615fc0573c4c6697c4b9c339f5efb08","observation_id":"995eef7d-b09c-4c69-b567-da4c74d59daf","resolution":{"observed_at":"2026-08-11T21:29:55.209758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05154","last_updated":"2024-05-21T08:21:52Z","snapshot_observed_at":"2026-08-14T12:51:24.647145Z","submitted_at":"2024-03-08T08:42:23Z","title":"GSEdit: Efficient Text-Guided Editing of 3D Objects via Gaussian Splatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05154","snapshot_observed_at":"2026-08-11T21:29:55.214240Z","title":"Gsedit: Efficient text-guided edit- ing of 3d objects via gaussian splatting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.214240Z"},"links":{"cited_paper":"/paper/2403.05154","citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:9c606890e24cde33cbd41273c5a1f524fe9142b76fa8b6882eceb46eab01ab82","observation_id":"466e276e-50e7-4235-8834-5e51e65166df","resolution":{"observed_at":"2026-08-11T21:29:55.214240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:55.891208Z","title":"Pointnet: Deep learning on point sets for 3d classification and segmentation","venue":null,"work_id":"d52ebabe-2c44-4aef-b7f8-576ab447712d","year":2017},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.218410Z"},"links":{"citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:09afbd8dea922e58d0dd9a88294c72e2920125cdced07c012f229870f8bc6731","observation_id":"41438fd7-ded9-432b-a8bd-cdcca628242c","resolution":{"observed_at":"2026-08-11T21:29:55.896502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:55.222460Z","title":"Deep hough voting for 3d object detection in point clouds","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.222460Z"},"links":{"citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:085e11edcc7e1e78ab0790c493f3c458a349d4ab14b4c0a4d8f8641dc89e3a01","observation_id":"ac3d888c-2c50-4baa-8b48-321578916752","resolution":{"observed_at":"2026-08-11T21:29:55.222460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:55.866564Z","title":"Mopa: Modular object nav- igation with pointgoal agents","venue":null,"work_id":"0e5aa081-74c4-4100-b24e-99052d841875","year":null},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.228546Z"},"links":{"citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:1c67551bc34dbb28b930fe6f5079369cc13468417d8158a2e8676f7becab9155","observation_id":"ff0a8609-aecf-4aa3-b066-e7084040a2f4","resolution":{"observed_at":"2026-08-11T21:29:55.872265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:55.853460Z","title":"Semantic scene completion using local deep implicit functions on lidar data","venue":null,"work_id":"3fdc321d-8058-4341-851d-8f747d5be6b5","year":2021},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.232412Z"},"links":{"citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:6a823aa764babd6b9ba294de272116fbb4343a21e0cb9ab9372ce02967083685","observation_id":"9eef2d33-c081-4862-a135-c88323506dd0","resolution":{"observed_at":"2026-08-11T21:29:55.858390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:55.841025Z","title":"Fcaf3d: Fully convolutional anchor-free 3d object detection","venue":null,"work_id":"9d4d88f8-ef35-4020-be5f-3dc95ff267e1","year":2022},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.236196Z"},"links":{"citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:518b1f256c6abaa09c7ae6a8104db7ee47fb753c06242ef95c0ae7555cc057f5","observation_id":"ed6b3468-84fa-4921-94a3-ed632c627946","resolution":{"observed_at":"2026-08-11T21:29:55.845517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:55.829783Z","title":"Indoor segmentation and support inference from rgbd images","venue":null,"work_id":"1707bb5d-469c-4ba0-85fc-6ee03f5a656e","year":2012},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.239906Z"},"links":{"citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:21d9f2473965c733dceb6feadf293f143d8ae899d1206e2926e5b2840b4c5e7e","observation_id":"b789f9ed-33e3-4894-b5bb-9ade66ed178b","resolution":{"observed_at":"2026-08-11T21:29:55.833062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12784","last_updated":"2024-04-19T10:47:53Z","snapshot_observed_at":"2026-08-13T00:26:09.114340Z","submitted_at":"2024-04-19T10:47:53Z","title":"Contrastive Gaussian Clustering: Weakly Supervised 3D Scene Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12784","snapshot_observed_at":"2026-08-11T21:29:55.243461Z","title":"Contrastive gaussian clustering: Weakly supervised 3d scene segmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.243461Z"},"links":{"cited_paper":"/paper/2404.12784","citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:2b6962950dbcc70c824ba3ca1f7ff8d6eeff866f306a24b1b382c90dc9ebf363","observation_id":"984f3e68-1c94-4e9e-9c7e-f3585f92360f","resolution":{"observed_at":"2026-08-11T21:29:55.243461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:55.247469Z","title":"Semantic scene comple- tion from a single depth image","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.247469Z"},"links":{"citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:03ab24b468fec125f39aa8485ace6487c1fc9ee08de36b4f0c6598514ab9bf9a","observation_id":"d0ff1c3d-2f0a-462e-adff-b2982054f3bf","resolution":{"observed_at":"2026-08-11T21:29:55.247469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:55.808737Z","title":"3dgstream: On-the-fly training of 3d gaussians for efficient streaming of photo-realistic free- viewpoint videos","venue":null,"work_id":"bcc8873b-bb76-488b-868b-3a60647fd059","year":2024},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.251242Z"},"links":{"citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:041c14968da02afd67072de9553d33329013af45a05e7e4313c152cc9c3afadc","observation_id":"ebf33004-f4fa-4b40-a1d3-d23923b7cc35","resolution":{"observed_at":"2026-08-11T21:29:55.813239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:55.796488Z","title":"Efficientnet: Rethinking model scaling for convolutional neural networks","venue":null,"work_id":"973ecb5a-1788-42fc-a63b-8bd584151669","year":2019},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.254552Z"},"links":{"citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:69019967d424e94daac2088d90e2b03f95db1cb2a07706efc1a96f88414b4316","observation_id":"3260d7a6-9d49-4833-9b06-2d4a3420a019","resolution":{"observed_at":"2026-08-11T21:29:55.800675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:55.784251Z","title":"Scene as occupancy","venue":null,"work_id":"0992a9d1-d27e-4e0b-b346-d6976788dde0","year":2023},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.258421Z"},"links":{"citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:35577477fdda2b8c9bb273b4278e150ff9b9a3579d4290cd3548dc3b98815037","observation_id":"57143924-bb67-4402-9cac-0e4ae363b6ee","resolution":{"observed_at":"2026-08-11T21:29:55.788261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:55.772387Z","title":"Softgroup for 3d instance segmentation on point clouds","venue":null,"work_id":"35e22cf8-0c8f-44a3-ab93-9c41aded4867","year":2022},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.262600Z"},"links":{"citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:4200c10d76004781658f22e757405076df26e10d00fecb51fdcc94a76f30538d","observation_id":"e00aa464-6d1a-4937-8417-a2579a366f3e","resolution":{"observed_at":"2026-08-11T21:29:55.776682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:55.761403Z","title":"Ca- group3d: Class-aware grouping for 3d object detection on point clouds","venue":null,"work_id":"4556c72a-855c-45e4-b78b-2f6ad6d81fcb","year":2022},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.266721Z"},"links":{"citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:f5d01923a369fd3bef506dc28ebfc0aa7b3097389e9cfac70755b7e30836eaae","observation_id":"3eee022e-9249-42d8-b927-ead0dad8ef23","resolution":{"observed_at":"2026-08-11T21:29:55.764744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20337","last_updated":"2024-05-30T17:59:42Z","snapshot_observed_at":"2026-08-15T09:09:03.918938Z","submitted_at":"2024-05-30T17:59:42Z","title":"OccSora: 4D Occupancy Generation Models as World Simulators for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20337","snapshot_observed_at":"2026-08-11T21:29:55.271120Z","title":"Occsora: 4d occupancy generation models as world simulators for au- tonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.271120Z"},"links":{"cited_paper":"/paper/2405.20337","citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:8464f51604fb5804ba4b2189922a904f652f44fb3aa122caf330a83087b13720","observation_id":"673faf33-fff9-4cb7-bbb8-f8562285e8f9","resolution":{"observed_at":"2026-08-11T21:29:55.271120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:55.748509Z","title":"Embodiedscan: A holistic multi-modal 3d perception suite towards embodied ai","venue":null,"work_id":"38148485-cb0f-4c09-ad7a-cc47fcc246d9","year":2024},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.275175Z"},"links":{"citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:0b75b711e2e8383889e55bb62e4793b1c2f8866bd1ffae9ceb74b4493e1f596e","observation_id":"7eeb1207-1d97-4144-9779-fc6ba392b832","resolution":{"observed_at":"2026-08-11T21:29:55.753270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03991","last_updated":"2023-03-07T15:43:39Z","snapshot_observed_at":"2026-08-14T23:33:42.941315Z","submitted_at":"2023-03-07T15:43:39Z","title":"OpenOccupancy: A Large Scale Benchmark for Surrounding Semantic Occupancy Perception","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03991","snapshot_observed_at":"2026-08-11T21:29:55.279231Z","title":"Openoccupancy: A large scale benchmark for surrounding semantic occupancy perception","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.279231Z"},"links":{"cited_paper":"/paper/2303.03991","citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:00f21bdf0ccc3ca6879cbae4cefc74626ea492a73a63db63600a53fdcbbaa482","observation_id":"5a5f2b91-abf6-4ccd-ac49-d8b66718494d","resolution":{"observed_at":"2026-08-11T21:29:55.279231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:55.733132Z","title":"Surroundocc: Multi-camera 3d occu- pancy prediction for autonomous driving","venue":null,"work_id":"35bd8015-30cb-4376-8a0c-ad11a92e0c18","year":2023},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.283681Z"},"links":{"citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:c2fadd1cd9b6188dd2c92bb38f3ae71a400c9c08698580ee2fe46eb20cd5c267","observation_id":"1172fbc3-f65b-4f32-8ccc-179d2c960278","resolution":{"observed_at":"2026-08-11T21:29:55.738831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:55.714380Z","title":"Scfusion: Real-time incremental scene recon- struction with semantic completion","venue":null,"work_id":"dcd903b2-64d4-433f-aed5-2da41b9e939b","year":2020},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.287748Z"},"links":{"citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:b97fcfb2ef81fbe47a0d7ecd6f7347eb00a83d0206cdd5c9b0bbede2db58ee48","observation_id":"01bc4135-2709-4211-af41-148b44cf3ff5","resolution":{"observed_at":"2026-08-11T21:29:55.719018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11453","last_updated":"2025-02-19T03:20:12Z","snapshot_observed_at":"2026-08-13T00:52:15.589537Z","submitted_at":"2024-03-18T04:01:26Z","title":"Hybrid Explicit Representation for Ultra-Realistic Head Avatars","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11453","snapshot_observed_at":"2026-08-11T21:29:55.291693Z","title":"Bridging 3d gaussian and mesh for freeview video rendering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.291693Z"},"links":{"cited_paper":"/paper/2403.11453","citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:62078880c2397779eaf20d248cc43d506ac969a2eb20be734f12e5f147ce5305","observation_id":"311e27d0-12d6-4d2a-9071-da4e3692b8bb","resolution":{"observed_at":"2026-08-11T21:29:55.291693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06974","last_updated":"2024-03-11T17:57:41Z","snapshot_observed_at":"2026-08-13T00:57:21.804797Z","submitted_at":"2024-03-11T17:57:41Z","title":"Memory-based Adapters for Online 3D Scene Perception","version":1},"cited_work":{"arxiv_id":"2403.06974","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.06974","snapshot_observed_at":"2026-08-11T21:29:55.489100Z","title":"Memory-based Adapters for Online 3D Scene Perception","venue":"cs.CV","work_id":"aeb7fed1-ec97-402b-9362-9d7d86f24ebc","year":2024},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.295725Z"},"links":{"cited_paper":"/paper/2403.06974","citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:ac66105c8bd84736a957136165133166fa491ad3afea6afa0fed9f2f15c1b5b5","observation_id":"a302b76f-bd7b-4ba2-8e6d-4d6e73332771","resolution":{"observed_at":"2026-08-11T21:29:55.495585Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:55.700813Z","title":"Gs-slam: Dense visual slam with 3d gaussian splatting","venue":null,"work_id":"2c58d468-6f90-4988-88a8-229832c040f7","year":2024},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.299785Z"},"links":{"citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:07ac9f88240b193a0db0eba97a21398bcc3d5ff83eab0a9fab22584a993b2994","observation_id":"2746768c-1351-4720-a161-37cf8cbda488","resolution":{"observed_at":"2026-08-11T21:29:55.705312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09414","last_updated":"2024-10-20T11:24:09Z","snapshot_observed_at":"2026-07-06T18:30:32.982860Z","submitted_at":"2024-06-13T17:59:56Z","title":"Depth Anything V2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09414","snapshot_observed_at":"2026-08-11T21:29:55.303928Z","title":"Depth any- thing v2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.303928Z"},"links":{"cited_paper":"/paper/2406.09414","citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:2a8e8d0a7cb548575abb1c2a0424856e34940a3e11a5f947a67e9e9d84c9f967","observation_id":"0b14ccca-8558-465b-9db0-b07a15c55787","resolution":{"observed_at":"2026-08-11T21:29:55.303928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14197","last_updated":"2025-01-17T06:46:00Z","snapshot_observed_at":"2026-08-13T14:29:23.996445Z","submitted_at":"2024-08-26T11:53:09Z","title":"Driving in the Occupancy World: Vision-Centric 4D Occupancy Forecasting and Planning via World Models for Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14197","snapshot_observed_at":"2026-08-11T21:29:55.308633Z","title":"Driving in the occupancy world: Vision-centric 4d occupancy forecast- ing and planning via world models for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.308633Z"},"links":{"cited_paper":"/paper/2408.14197","citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:53f53a4dce926d4a18419fe841e45f03d323c3e96e35463ca76bf78eb75b0165","observation_id":"f14f9a2c-bfac-45c7-8ff4-0ae845f79432","resolution":{"observed_at":"2026-08-11T21:29:55.308633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20720","last_updated":"2025-08-05T21:54:39Z","snapshot_observed_at":"2026-08-14T23:51:36.352863Z","submitted_at":"2024-12-30T05:30:26Z","title":"4D Gaussian Splatting: Modeling Dynamic Scenes with Native 4D Primitives","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20720","snapshot_observed_at":"2026-08-11T21:29:55.313145Z","title":"4d gaussian splatting: Model- ing dynamic scenes with native 4d primitives.arXiv preprint arXiv:2412.20720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.313145Z"},"links":{"cited_paper":"/paper/2412.20720","citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:401797fbdd72ba43576b2f0862a3f50f709a8ed2191549bd17ba706c112cd2ea","observation_id":"d9fdf8f0-3c9d-4ee5-886c-68cb75828c8d","resolution":{"observed_at":"2026-08-11T21:29:55.313145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:55.688549Z","title":"Ndc-scene: Boost monocular 3d semantic scene completion in normalized de- vice coordinates space","venue":null,"work_id":"d6641532-9567-44cd-89ea-5c54256bf8ad","year":2023},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.317592Z"},"links":{"citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:dbc7faead799b3b5342169a58c6eb90346628df545dd84ab524302480db3be96","observation_id":"0d9149df-e9c4-45e3-8ec7-f7007399f04a","resolution":{"observed_at":"2026-08-11T21:29:55.692916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:55.676107Z","title":"Gspn: Generative shape proposal network for 3d instance segmentation in point cloud","venue":null,"work_id":"3f08c9bd-63e6-4163-8d9d-e2ae030388a9","year":2019},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.344771Z"},"links":{"citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:7874e1f27fd7997fc065adab4d848b01a56c2412c6f755462027457b15fde9ab","observation_id":"269baacc-29a0-4f05-82a8-0f3cbffdfd37","resolution":{"observed_at":"2026-08-11T21:29:55.679659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11730","last_updated":"2024-07-17T02:37:07Z","snapshot_observed_at":"2026-08-12T23:21:05.587770Z","submitted_at":"2024-07-16T13:50:40Z","title":"Monocular Occupancy Prediction for Scalable Indoor Scenes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11730","snapshot_observed_at":"2026-08-11T21:29:55.349230Z","title":"Monocular occupancy prediction for scalable indoor scenes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.349230Z"},"links":{"cited_paper":"/paper/2407.11730","citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:f17e48855ef19687e6d8026544ecb63a40db050c311078e786f2a148b222dbd2","observation_id":"ebe57228-c652-4821-a58a-5194e8488060","resolution":{"observed_at":"2026-08-11T21:29:55.349230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10070","last_updated":"2024-03-22T17:59:09Z","snapshot_observed_at":"2026-08-13T09:56:16.972857Z","submitted_at":"2023-12-06T10:47:53Z","title":"Gaussian-SLAM: Photo-realistic Dense SLAM with Gaussian Splatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10070","snapshot_observed_at":"2026-08-11T21:29:55.353474Z","title":"Gaussian-slam: Photo-realistic dense slam with gaus- sian splatting","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.353474Z"},"links":{"cited_paper":"/paper/2312.10070","citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:ab0a1b2a5d31d86cebfb4269036a4497f713933e176f15ffdc18ab668cd7a792","observation_id":"9e2e1430-1ef3-488e-bebc-144f27c9381f","resolution":{"observed_at":"2026-08-11T21:29:55.353474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:55.357158Z","title":"Occworld: Learning a 3d occupancy world model for autonomous driving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.357158Z"},"links":{"citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:23200517a38e8668fedd176855d18d619af20c7b14c5f0ac7e0d80201b3f4ab4","observation_id":"e949d46b-3d7c-489b-ba66-38681c617458","resolution":{"observed_at":"2026-08-11T21:29:55.357158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16896","last_updated":"2023-08-31T17:57:17Z","snapshot_observed_at":"2026-08-15T07:12:37.786821Z","submitted_at":"2023-08-31T17:57:17Z","title":"PointOcc: Cylindrical Tri-Perspective View for Point-based 3D Semantic Occupancy Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16896","snapshot_observed_at":"2026-08-11T21:29:55.361232Z","title":"Pointocc: Cylindrical tri-perspective view for point-based 3d semantic occupancy prediction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.361232Z"},"links":{"cited_paper":"/paper/2308.16896","citing_paper":"/paper/2412.04380"},"observation_digest":"sha256:f03046ab6ce8db643775511a7d0d1d02f534328e526dfece31291a5221b274b7","observation_id":"df034f61-82be-4367-99fa-3abe968c5f8f","resolution":{"observed_at":"2026-08-11T21:29:55.361232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.04380","last_updated":"2025-08-25T05:59:30Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T00:06:05.851429Z","submitted_at":"2024-12-05T17:57:09Z","title":"EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":1,"verified_fuzzy":31},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 8 inbound Pith citation observations for arXiv:2412.04380."}