{"as_of":"2026-08-09T04:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e69cd6ab7967267bda90038fb0350b226675fa83fd18806e241d4395adbccb48","coverage":[{"denominator":96,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":96,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:02:33.215747Z","state":"measured"},{"denominator":98,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":98,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T19:54:57.184897Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T19:03:08.599602Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04047","snapshot_observed_at":"2026-08-05T19:54:57.184897Z","title":"Move to understand a 3d scene: Bridging visual grounding and exploration for efficient and versatile embod- ied navigation.arXiv preprint arXiv:2507.04047, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11476","last_updated":"2025-08-15T13:44:56Z","snapshot_observed_at":"2026-08-07T16:52:47.993111Z","submitted_at":"2025-08-15T13:44:56Z","title":"SPG: Style-Prompting Guidance for Style-Specific Content Creation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:57.184897Z"},"links":{"cited_paper":"/paper/2507.04047","citing_paper":"/paper/2508.11476"},"observation_digest":"sha256:af1619e9e5b482b92afac2dc6f0b7de63294af050694a96234eb666aa0afd7ee","observation_id":"8b12b765-c17c-4532-8932-0c2f5ffe3a7d","resolution":{"observed_at":"2026-08-05T19:54:57.184897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"cited_work":{"arxiv_id":"2507.04047","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.04047","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Move to understand a 3d scene: Bridging visual grounding and exploration for efficient and versatile embodied navigation","venue":null,"work_id":"0e2bb609-bbd8-4c6c-b14d-5b1c3d3c8775","year":2025},"citing_paper":{"arxiv_id":"2604.03139","last_updated":"2026-04-03T16:01:58Z","snapshot_observed_at":"2026-08-09T03:44:47.080013Z","submitted_at":"2026-04-03T16:01:58Z","title":"FSUNav: A Cerebrum-Cerebellum Architecture for Fast, Safe, and Universal Zero-Shot Goal-Oriented Navigation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T18:58:48.779518Z"},"links":{"cited_paper":"/paper/2507.04047","citing_paper":"/paper/2604.03139"},"observation_digest":"sha256:673f0c87795fc191b135bbdcf43a834e5a235b1ef196a04bc1f5c2575e53c275","observation_id":"7363683b-1a7a-41e1-8f77-a918c1574094","resolution":{"observed_at":"2026-05-13T19:03:08.600996Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.04047/citation-record","integrity":"/paper/2507.04047/integrity","json":"/paper/2507.04047/citation-record.json","paper":"/paper/2507.04047"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:31.156912Z","title":"Scanents3d: Exploit- ing phrase-to-3d-object correspondences for improved visio- linguistic models in 3d scenes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:31.156912Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:9337ce74ab6883e2f20fd0a43f27a2126f65053fd12fdd8613142cac20789e37","observation_id":"e2a31111-e2e4-4890-a72a-2b5fe7745999","resolution":{"observed_at":"2026-08-06T20:02:31.156912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:31.251850Z","title":"Referit3d: Neural listeners for fine-grained 3d object identification in real-world scenes","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:31.251850Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:cc544cd44b3ffce0ab1ed66e26b941fe89955d8d1a8321005b98dac9d85f4ae5","observation_id":"7f2de7b2-1a14-431d-a5c8-30bbdd9a6843","resolution":{"observed_at":"2026-08-06T20:02:31.251850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:31.317126Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:31.317126Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:71dcd5895f54f4241a3458b56c0a8058988d4516f2a877d223095e25a9346ea3","observation_id":"d4f365fa-c59c-42b1-9e52-546e5375435c","resolution":{"observed_at":"2026-08-06T20:02:31.317126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:31.434833Z","title":"Do as i can, not as i say: Grounding language in robotic affordances","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:31.434833Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:97a6be05e14ce828bdf53db389433cd8e4f6349f158f6d5bf4892481e76346d7","observation_id":"c49bc4df-6ccb-4a9e-9bbe-fd1b50ea2390","resolution":{"observed_at":"2026-08-06T20:02:31.434833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:31.497301Z","title":"3djcg: A unified framework for joint dense captioning and visual grounding on 3d point clouds","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:31.497301Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:6d45208f628a6c9bb1f289e7f376788e19c8e28efb23620150fd5697e1d25b25","observation_id":"bb7ccfdb-041b-411f-993c-23f9995f6668","resolution":{"observed_at":"2026-08-06T20:02:31.497301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:31.605674Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:31.605674Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:f388daddd9908d808f3b2f16155bad5b29bf101d650e1307d5523eab674ed940","observation_id":"f9dddfbd-8cbb-48ea-b292-57527f9aadad","resolution":{"observed_at":"2026-08-06T20:02:31.605674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:31.679473Z","title":"Object goal naviga- tion using goal-oriented semantic exploration","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:31.679473Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:62b0978bf54e976e98996a9020d4c5b98904ba2d970ba2eb9681c8c35d0bab28","observation_id":"deda0b58-fc06-49a7-b970-3e239931f8ae","resolution":{"observed_at":"2026-08-06T20:02:31.679473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:31.763679Z","title":"Object goal navi- gation using goal-oriented semantic exploration","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:31.763679Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:1cea821d31e9edf08e83b835908a3128a3093d9c9f6ed9ecd1724f52027cf4d6","observation_id":"b823c8a9-85dc-4284-8432-c24334a7769b","resolution":{"observed_at":"2026-08-06T20:02:31.763679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:31.842833Z","title":"Scanrefer: 3d object localization in rgb-d scans using natu- ral language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:31.842833Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:ffac61175c30fe076281821828fb6b5b8fd3da665725e6751a65e5bf3388c5e2","observation_id":"86802e41-5707-4c97-87d5-a88d5deb6b24","resolution":{"observed_at":"2026-08-06T20:02:31.842833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:31.924326Z","title":"Language conditioned spatial relation reasoning for 3d object grounding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:31.924326Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:05cc48082ccd252023f1351de0aa1c282f1d4a078ae81345a839bcf5c5c196c6","observation_id":"06333299-344d-4207-b617-3a79b9607d6c","resolution":{"observed_at":"2026-08-06T20:02:31.924326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:32.014240Z","title":"Ll3da: Visual interactive instruction tuning for omni-3d understand- ing reasoning and planning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.014240Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:7a905f34b6e78d989a8487b628ef847a3401569dd4286826ec28486fa3af6472","observation_id":"778803a5-506f-493f-99d9-949b414b8d32","resolution":{"observed_at":"2026-08-06T20:02:32.014240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:32.057605Z","title":"Scan2cap: Context-aware dense captioning in rgb- d scans","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.057605Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:8a357c1ccbc1a3495199aef1acf86f7f6934087e4686f43a763fe20aada51183","observation_id":"e4822169-e117-457f-8f5d-242e6d091ec3","resolution":{"observed_at":"2026-08-06T20:02:32.057605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:32.194145Z","title":"Unit3d: A unified trans- former for 3d dense captioning and visual grounding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.194145Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:0808e445309154058646c4ee432c5f5b352815696358cc79c27ff2a676a5a1bf","observation_id":"26c200ce-8196-49a5-a404-ede974461053","resolution":{"observed_at":"2026-08-06T20:02:32.194145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:32.284849Z","title":"Schwing, Alexan- der Kirillov, and Rohit Girdhar","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.284849Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:75dae74652869cc89c173dcd93467207b82bca8a5cf94896c4729ee3615ae334","observation_id":"96a42d0e-704e-4d5e-b86c-f82703300d84","resolution":{"observed_at":"2026-08-06T20:02:32.284849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:32.391830Z","title":"4d spatio-temporal convnets: Minkowski convolutional neural networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.391830Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:1b9306a11cfd9a1ec783fb85a5678c027a4ac9e86759e369333844f8b43bd713","observation_id":"ed1e8638-0b8a-4a26-9984-d39ecfa84001","resolution":{"observed_at":"2026-08-06T20:02:32.391830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:32.507880Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.507880Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:569a275b44fd11297cbd021c4f51af8a56ec19c777191909ce73f7bc46d2b577","observation_id":"17ccbf1e-189e-4f93-b408-cafceb94bcaf","resolution":{"observed_at":"2026-08-06T20:02:32.507880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.658244Z","title":"Embodied question answer- ing","venue":null,"work_id":"b8bc263a-b12d-4018-9f0f-76d63cc9f494","year":2018},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.605207Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:337780257304ad935f4246edb6ff0055d62cea57aedc70d9cc72dd82a492040a","observation_id":"23dd4bc8-824e-48b8-99bd-72233555fe15","resolution":{"observed_at":"2026-08-06T20:02:34.662553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.644143Z","title":"A survey of embodied ai: From simulators to research tasks","venue":null,"work_id":"baa51a08-58f7-4ab3-88a8-549c454a4a70","year":2022},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.730308Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:45ca6cb955869f3ceaec6ea9280cf598cdafc72a4abbc0f406039784b1cefedb","observation_id":"fec0ec8e-b139-451f-b6b8-91dcf8ba2993","resolution":{"observed_at":"2026-08-06T20:02:34.648665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14401","last_updated":"2025-05-23T21:41:56Z","snapshot_observed_at":"2026-08-06T15:59:05.107483Z","submitted_at":"2024-12-18T23:15:41Z","title":"The One RING: a Robotic Indoor Navigation Generalist","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14401","snapshot_observed_at":"2026-08-06T20:02:32.828420Z","title":"The one ring: a robotic indoor navigation generalist","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.828420Z"},"links":{"cited_paper":"/paper/2412.14401","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:765dc33117c075ce8649056fb41ff885bec3e62bf71c445e0d7a6d7252f9077a","observation_id":"6db28803-3cf2-4251-ad77-654dcd228b67","resolution":{"observed_at":"2026-08-06T20:02:32.828420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.628659Z","title":"Spoc: Imitating short- est paths in simulation enables effective navigation and ma- nipulation in the real world","venue":null,"work_id":"5f5116c6-fdfd-4b97-9bdf-d7fd2738bc1a","year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.859253Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:9709cd2652e32f68444ee528bc4a8982448f849bfad202863a17ecb8236d82fc","observation_id":"4a984db5-a1cb-4e85-842d-0a3a593d6b52","resolution":{"observed_at":"2026-08-06T20:02:34.633572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00358","last_updated":"2025-01-09T03:25:24Z","snapshot_observed_at":"2026-08-08T02:45:12.912568Z","submitted_at":"2024-12-31T09:22:38Z","title":"Embodied VideoAgent: Persistent Memory from Egocentric Videos and Embodied Sensors Enables Dynamic Scene Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00358","snapshot_observed_at":"2026-08-06T20:02:32.864163Z","title":"Embodied videoagent: Persis- tent memory from egocentric videos and embodied sen- sors enables dynamic scene understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.864163Z"},"links":{"cited_paper":"/paper/2501.00358","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:408e9e026ae568bafa3417b94be5ec6da4c28e61c4757677dc3485046f2393d5","observation_id":"713006fa-6b05-414d-a629-451cd2717320","resolution":{"observed_at":"2026-08-06T20:02:32.864163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.613926Z","title":"Efficient graph-based image segmentation","venue":null,"work_id":"0f77a1a6-69c0-4095-81a1-e07a06989954","year":2004},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.869619Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:f78607403ebb420f260ebfc084f9b3770f82e44fa4a50c16295620d82de9e3e4","observation_id":"07a13e23-4b26-4210-91eb-1174c07e9df7","resolution":{"observed_at":"2026-08-06T20:02:34.618261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.599288Z","title":"Cows on pasture: Base- lines and benchmarks for language-driven zero-shot object navigation","venue":null,"work_id":"6fe604d3-a144-4ae2-a0d2-ab70abeacf7d","year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.873766Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:0784be243609f952de99125dc9918e5ad4e0ff55e63709c84b358e1d89e49ccb","observation_id":"1a3fd2f0-a809-4758-ad4d-a2be5e0be2cc","resolution":{"observed_at":"2026-08-06T20:02:34.604356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.585357Z","title":"Scaling open-vocabulary image segmentation with image- level labels","venue":null,"work_id":"16506f23-9d06-464b-b2b9-bff823714940","year":2022},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.878891Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:9d6bea2d0e11a6618018df40df9ac1e328c8eb4ed1f38ed8632efd737cabfdbc","observation_id":"8c68ce8f-f0a4-4e70-9234-da915752a457","resolution":{"observed_at":"2026-08-06T20:02:34.589762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.571316Z","title":"Conceptgraphs: Open-vocabulary 3d scene graphs for per- ception and planning","venue":null,"work_id":"9ac16c48-fdf1-4737-8328-12309d818d25","year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.883132Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:6d2aae8293ce100fcd801449b056f7d73d531b68b443c1bea523673c2f792ae4","observation_id":"45f432e4-e104-4efe-9322-2a706db8a7fa","resolution":{"observed_at":"2026-08-06T20:02:34.575555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.556752Z","title":"Viewrefer: Grasp the multi-view knowledge for 3d visual grounding","venue":null,"work_id":"0afd5c8c-be38-480a-98fc-2608da4c2c3b","year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.887401Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:af92ed834f7215acc51e2e8f7225f622e0b6d5d4d23d3465eeea5b1fd3309f23","observation_id":"adf93ba6-943c-4359-bfef-d23cc8551d51","resolution":{"observed_at":"2026-08-06T20:02:34.561287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.542052Z","title":"Transrefer3d: Entity-and- relation aware transformer for fine-grained 3d visual ground- ing","venue":null,"work_id":"a0b38533-dab0-4e12-bb32-f7caa4370dde","year":2021},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.891844Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:f1908db6ee5fda7758b23461b98809f86252ef3ef1c483ed515b02c9cf7c785e","observation_id":"7d587f8b-2923-40f4-8826-daaabe53f5d4","resolution":{"observed_at":"2026-08-06T20:02:34.546556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.527279Z","title":"Vln bert: A recurrent vision- and-language bert for navigation","venue":null,"work_id":"37f47850-15e0-4cb2-b806-17a5e6af1816","year":null},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.896182Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:6689aa3d36f3d8163beb7f8d414a5339ec4d8fa2d40d3d3f6fd8be02c785f4af","observation_id":"0a0a1021-5c64-4d71-8425-ea1db88b305a","resolution":{"observed_at":"2026-08-06T20:02:34.531842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.510783Z","title":"3d-llm: In- jecting the 3d world into large language models","venue":null,"work_id":"fa22017c-d213-4eea-9628-a35bb586824d","year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.901425Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:a3d54c8ac40918bf7c00cba1853377fa8396668f2896dea9e37500d795a4eb9d","observation_id":"d4c652b4-9733-408a-8d2e-c5eb0468f7ee","resolution":{"observed_at":"2026-08-06T20:02:34.515695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.493517Z","title":"A real-time occupancy map from multiple video streams","venue":null,"work_id":"5c99ac42-5c41-4e4a-93df-931f22247636","year":1999},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.906117Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:259063f066d60c261449b97bca16a59d214c436bc9960c6ac0a9ce128a23ae65","observation_id":"7f29a1b4-1c1e-4eb9-955e-9b9381b77dcd","resolution":{"observed_at":"2026-08-06T20:02:34.498323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.475938Z","title":"An embodied generalist agent in 3d world","venue":null,"work_id":"3fce9eb9-595e-467c-b6cf-9dd218879788","year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.910518Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:ffd821e35cbf5df577e2683363f474d5521fd0eb12289d18e5402f25b519332a","observation_id":"9f43c2d6-7681-47f4-b4a6-54b61de930e7","resolution":{"observed_at":"2026-08-06T20:02:34.481002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.459292Z","title":"Language models as zero-shot planners: Ex- tracting actionable knowledge for embodied agents","venue":null,"work_id":"bc8e5669-4866-4c63-8b01-a8f220e6ef74","year":2022},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.914903Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:69ed10bc179e3bd2cdc0f5f422711c9495b9350d5c5df4eace348cdbe188dd0a","observation_id":"4c5594b4-3ee3-422a-b71b-7dba27b78f5f","resolution":{"observed_at":"2026-08-06T20:02:34.463894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.443566Z","title":"V oxposer: Composable 3d value maps for robotic manipulation with language models","venue":null,"work_id":"7c3e2521-3ec9-4265-b70d-b52dfa3cfcd6","year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.919522Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:9bda2949f80320314a7614db98179670d01bf3b76a16a704fa05dcc0d37fe6dd","observation_id":"143deb32-0c82-488b-81f8-15730725a8d9","resolution":{"observed_at":"2026-08-06T20:02:34.448269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.428272Z","title":"Bottom up top down detection transform- ers for language grounding in images and point clouds","venue":null,"work_id":"18329468-f01f-47fc-8dce-5265a2cc770c","year":2022},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.924413Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:24c86e0be129c04a3a62c91346a3e6af694b169d9cccb9278737590b6bd5eabd","observation_id":"39bbe7cb-7eaf-46c9-a293-620806b5320b","resolution":{"observed_at":"2026-08-06T20:02:34.433025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.412610Z","title":"Conceptfusion: Open-set multi- modal 3d mapping","venue":null,"work_id":"f77575a0-fb25-4440-a79e-45c836ff5429","year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.929001Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:ad10362eb8ce148cb29abfdfc021805a78d9c20b1e86b15888433f4423358389","observation_id":"8f216072-19fc-4d8f-9511-ee0f109fc652","resolution":{"observed_at":"2026-08-06T20:02:34.417777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.397324Z","title":"Sceneverse: Scaling 3d vision-language learning for grounded scene understanding","venue":null,"work_id":"a0a6ef23-c425-47db-9166-d676f09a1c03","year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.934381Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:743ec98b3bd2ca0241baa79c3ed994a1e652282a64b3c673456f5c4c4b9f4a27","observation_id":"e52ef426-8946-4d81-856e-63b42e949343","resolution":{"observed_at":"2026-08-06T20:02:34.402368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.381864Z","title":"Goat-bench: A benchmark for multi-modal lifelong navigation","venue":null,"work_id":"9aed0ca2-79e1-4946-b24e-88ca416c04e5","year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.939241Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:084555c218cbd3dcf3afe0c0ab9c01a8f899d98746f12e70cd6ddf871e42c232","observation_id":"b46b61ae-463b-42ff-a9ca-487841e009f3","resolution":{"observed_at":"2026-08-06T20:02:34.386201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.366988Z","title":"Realfred: An em- bodied instruction following benchmark in photo-realistic environments","venue":null,"work_id":"7014e382-5166-43c4-8fb1-dd6987fe5f67","year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.943797Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:e53d96f5e011644538b31281c4bcdff50c34c32c4119bf5ff50b075b63939692","observation_id":"9eeaf62f-5c89-4be2-be2a-02d3f7d04fb8","resolution":{"observed_at":"2026-08-06T20:02:34.371553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.352419Z","title":"Segment anything","venue":null,"work_id":"3883ed5f-892f-4a02-85e2-3a0c81d7578c","year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.948191Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:ce15a9ff466fd00ea0da5ff2b76ef287e520027f763b8f70d5b4e78960de3f19","observation_id":"30f6df15-b03d-4f0c-b060-014a2e9d8e01","resolution":{"observed_at":"2026-08-06T20:02:34.357025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13430","last_updated":"2022-10-31T12:36:18Z","snapshot_observed_at":"2026-07-06T13:56:50.670071Z","submitted_at":"2022-09-27T14:36:16Z","title":"UniCLIP: Unified Framework for Contrastive Language-Image Pre-training","version":2},"cited_work":{"arxiv_id":"2209.13430","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.13430","snapshot_observed_at":"2026-08-06T20:02:33.571355Z","title":"UniCLIP: Unified Framework for Contrastive Language-Image Pre-training","venue":"cs.CV","work_id":"0445b6ce-e489-463e-b52d-4dba2578dc1a","year":2022},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.952478Z"},"links":{"cited_paper":"/paper/2209.13430","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:7ccd66771a7c3ce221b79db1b77e5716ffb5684fb98820251579af6018a88aaa","observation_id":"b1919572-cd83-449d-826b-e48b8505acfe","resolution":{"observed_at":"2026-08-06T20:02:33.577190Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.338211Z","title":"Less is more: Clipbert for video-and-language learning via sparse sampling","venue":null,"work_id":"f97d4c73-8773-49de-9c5f-033afbf51b36","year":2021},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.956776Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:201e66e5547efb4595b8e5a6f683875eda1863229d5fb20527f0c5a7f9c27d93","observation_id":"8207f357-d3b8-407e-a437-96f5b9a07aa8","resolution":{"observed_at":"2026-08-06T20:02:34.342337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09227","last_updated":"2024-03-14T09:48:36Z","snapshot_observed_at":"2026-08-06T09:37:53.788323Z","submitted_at":"2024-03-14T09:48:36Z","title":"BEHAVIOR-1K: A Human-Centered, Embodied AI Benchmark with 1,000 Everyday Activities and Realistic Simulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09227","snapshot_observed_at":"2026-08-06T20:02:32.960840Z","title":"Behavior-1k: A human-centered, embodied ai benchmark with 1,000 everyday activities and realistic simulation.arXiv preprint arXiv:2403.09227, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.960840Z"},"links":{"cited_paper":"/paper/2403.09227","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:32b9e222388ac36effe64f4b985ff559f916a904b4ab44f94db038af501f3930","observation_id":"ad92fa97-2683-4468-9993-289fb62236ff","resolution":{"observed_at":"2026-08-06T20:02:32.960840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-06T20:02:32.966191Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.966191Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:5213e6d6f3b89921a771aaff6896ce4acc3826418b3f02d93b3c7c44911fb9aa","observation_id":"7d582015-4573-4d72-90f1-53a9abbd8ed0","resolution":{"observed_at":"2026-08-06T20:02:32.966191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.323485Z","title":"Panoptic segformer: Delving deeper into panoptic segmen- tation with transformers","venue":null,"work_id":"15a2cf2c-651b-4cb1-a385-e40f613d32b9","year":2022},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.971408Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:df40aaa750efa6cfce6b4e81b1e3ea3e837696a2bc93113100a456d0cad31361","observation_id":"2a1c475a-e27f-4406-9282-799d56d74131","resolution":{"observed_at":"2026-08-06T20:02:34.328116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.307514Z","title":"Code as policies: Language model programs for embodied con- trol","venue":null,"work_id":"1e51ae58-27a9-4e9d-9f02-024a7cc64c66","year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.975605Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:f27b5e40ff161d17f4204d89ad3b6eb1c26f128da12edeb2e5bec19ae1174c4c","observation_id":"53c90110-e900-4bf6-b726-6d8daf6d9d1e","resolution":{"observed_at":"2026-08-06T20:02:34.312598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07376","last_updated":"2025-03-22T11:04:36Z","snapshot_observed_at":"2026-07-06T17:43:05.793351Z","submitted_at":"2024-03-12T07:27:02Z","title":"NavCoT: Boosting LLM-Based Vision-and-Language Navigation via Learning Disentangled Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07376","snapshot_observed_at":"2026-08-06T20:02:32.980063Z","title":"Navcot: Boosting llm-based vision-and- language navigation via learning disentangled reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.980063Z"},"links":{"cited_paper":"/paper/2403.07376","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:7750643e5fb197d62add79b6f721a76e5960afd2ca5599a9a23a64250c55018e","observation_id":"b986deef-cc20-4681-a7cf-88509af4eabd","resolution":{"observed_at":"2026-08-06T20:02:32.980063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06886","last_updated":"2025-08-25T02:20:09Z","snapshot_observed_at":"2026-08-06T16:04:56.349386Z","submitted_at":"2024-07-09T14:14:47Z","title":"Aligning Cyber Space with Physical World: A Comprehensive Survey on Embodied AI","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06886","snapshot_observed_at":"2026-08-06T20:02:32.984728Z","title":"Aligning cyber space with physical world: A comprehensive survey on embodied ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.984728Z"},"links":{"cited_paper":"/paper/2407.06886","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:4fa877d63c041f578215d9a29c1625a3ed8d66f2831c1f30851dd1d13bfd3f30","observation_id":"2d1902b8-80a2-4ddf-90eb-aa605a81c199","resolution":{"observed_at":"2026-08-06T20:02:32.984728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.291087Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":"5eb5faea-2f0b-4587-9caf-725a4e74d157","year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.989899Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:075b3f43cd796d10117159d01b78a5c58dbdfc58c4180f0edba4d1a23a0241a3","observation_id":"c545085f-88f9-4e78-bb8c-50e4337486a6","resolution":{"observed_at":"2026-08-06T20:02:34.296444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.256455Z","title":"Zson: Zero-shot object-goal navigation using multimodal goal embeddings","venue":null,"work_id":"0951475b-54cd-4496-87b0-f584dbabcaa5","year":null},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.994814Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:f377cb46cfb96419c944c2312989fd3d67295f0ad304334e461e31f7a450dbb8","observation_id":"41653663-ad6f-4d35-8548-2f546cc1f18e","resolution":{"observed_at":"2026-08-06T20:02:34.280449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.178107Z","title":"Openeqa: Embodied question answering in the era of foun- dation models","venue":null,"work_id":"33ef26e2-f8a2-4b41-806e-1e7fe7e555aa","year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.999861Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:aa76b9b683677597a62cd890c2e8d7abba8776322384ed723ebd6cfb801e35ea","observation_id":"e621b6db-fe2c-4a9d-8df8-dbfe3a847b75","resolution":{"observed_at":"2026-08-06T20:02:34.211271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.124372Z","title":"Openeqa: Embodied question answering in the era of foun- dation models","venue":null,"work_id":"ada04085-ed97-43ba-9263-cb671a0b00b5","year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.005435Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:8f40d23be34c4cb9cda1ae9dffdf282c37cae8ead536d1389dbcc63f218ab58b","observation_id":"9b824185-5025-4395-aca8-665e709e9b42","resolution":{"observed_at":"2026-08-06T20:02:34.152079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.109732Z","title":"Spatial memory","venue":null,"work_id":"efcd65ee-96df-4458-be7f-f0d42825d597","year":1977},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.010136Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:da3c1fe1501a966599998d0738fd32eba7ce9262f26a630c62cc231350988382","observation_id":"bb3fbf5b-e554-44e3-9818-b6a3b50163c3","resolution":{"observed_at":"2026-08-06T20:02:34.114012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-06T20:02:33.014670Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.014670Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:3e271cb1a96b38ff33be024002b3389bf5553d39fadb00d6621dcd174fd99c6a","observation_id":"6da5b11a-36a1-404a-b98c-a3b75be6c88e","resolution":{"observed_at":"2026-08-06T20:02:33.014670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.092974Z","title":"Teach: Task-driven embodied agents that chat","venue":null,"work_id":"1e788eee-0f52-4e19-a4da-b9392f0f0eb0","year":2022},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.019013Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:652eaaee79cf7863e8c1795b144095fc77904f2bcf08f04356ba082e4de07bdf","observation_id":"729ec64a-1e53-4c9e-af84-67004af85111","resolution":{"observed_at":"2026-08-06T20:02:34.099440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.078508Z","title":"Openscene: 3d scene understanding with open vocabularies","venue":null,"work_id":"7665623f-88d8-44fe-a8b6-8b31c0fc2a4f","year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.023557Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:e2ce92cc4c3dd4ac6146a94bc822e0d0d1f2833cca48eb716398ee0402ac2778","observation_id":"91e13b98-5db9-4a06-b856-b57512660a26","resolution":{"observed_at":"2026-08-06T20:02:34.082872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.062282Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"5875ff52-1e47-49e6-95be-cd73d53f8e60","year":2021},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.028017Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:caf08d127b0947d2554dc4cde21db6167fb6e47c4f864b56ffad75e0db6333d1","observation_id":"0bb53d3a-b4fb-4ce6-a6bd-76e809f22e22","resolution":{"observed_at":"2026-08-06T20:02:34.067457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.047429Z","title":"Pirlnav: Pretraining with imitation and rl finetuning for objectnav","venue":null,"work_id":"e3ad6a10-3410-4834-896c-a2b054fe1194","year":null},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.032520Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:fcdf547bc9567cea0ee952c892e2ae86f8ee9df329066bf3fce40d7de21da3a8","observation_id":"8337e663-f1b0-4a05-9243-ec3752d2a8ee","resolution":{"observed_at":"2026-08-06T20:02:34.051867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.031961Z","title":"Sayplan: Ground- ing large language models using 3d scene graphs for scalable task planning","venue":null,"work_id":"e81f624b-6472-4a88-b64d-1837d451cf8c","year":null},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.037520Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:ec51d001c94f4a26f4a2976b0b34b2b2357361792fcb20e0951615d3dbd507b0","observation_id":"738a7c9a-cb3b-4a08-b6fb-3f9a641194f3","resolution":{"observed_at":"2026-08-06T20:02:34.036765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15941","last_updated":"2024-07-07T19:40:31Z","snapshot_observed_at":"2026-08-07T02:26:46.173562Z","submitted_at":"2024-03-23T22:04:03Z","title":"Explore until Confident: Efficient Exploration for Embodied Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15941","snapshot_observed_at":"2026-08-06T20:02:33.042822Z","title":"Explore until confi- dent: Efficient exploration for embodied question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.042822Z"},"links":{"cited_paper":"/paper/2403.15941","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:c299cd6a210fdafd538054c9f0ef64a50d4b37c190d3c8ed9e6725c211518949","observation_id":"841e3bdb-4be8-4196-9e45-3ab0b52d98ca","resolution":{"observed_at":"2026-08-06T20:02:33.042822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.014186Z","title":"Language- grounded indoor 3d semantic segmentation in the wild","venue":null,"work_id":"19d5ab0c-9aa4-4b37-9d51-940b367a3403","year":2022},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.047240Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:a80ad0346171999f4b0041ddc5c1150cf9c0c06d3d3e0b5aedc7103346625026","observation_id":"2bd1b137-7252-436e-90e0-50c9dee394da","resolution":{"observed_at":"2026-08-06T20:02:34.019320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.997927Z","title":"Habitat: A plat- form for embodied ai research","venue":null,"work_id":"df56599a-1930-4c1a-a5e3-60272c5a3df4","year":2019},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.051322Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:f721890abe3625d78a472800dfc546af88915c1a1556cd8392944501a4c9d2eb","observation_id":"acc76002-445d-4d6a-a6a7-d62271306133","resolution":{"observed_at":"2026-08-06T20:02:34.002845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T20:02:33.055692Z","title":"Proximal policy optimization algo- rithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.055692Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:36325a6051d28bcf6845ead0d6d45c43e9c6c16724e4dc6db3837e8c3bd51651","observation_id":"7bc365d5-0260-4142-b6f4-cb24fdbc7afd","resolution":{"observed_at":"2026-08-06T20:02:33.055692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.982018Z","title":"Mask3d: Mask trans- former for 3d semantic instance segmentation","venue":null,"work_id":"64f8c760-d9ba-42b3-8ad2-cb11b2b61365","year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.059795Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:efef40439efa35aac2a830bdbe299846bf10c476d7dda7f66369c5431751a4d2","observation_id":"46baae52-902b-4d3a-bb2d-173f6c84d29a","resolution":{"observed_at":"2026-08-06T20:02:33.987323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.966141Z","title":"Alfred: A benchmark for interpreting grounded instructions for everyday tasks","venue":null,"work_id":"d421b206-d188-41ce-b632-2b5c0b38e492","year":2020},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.064643Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:9ace543f7a66efa965492ebb510b4b5c6ba2721550a72877211c4c7083b0647a","observation_id":"0a686420-7872-4d1c-a62c-54e40f39f5ea","resolution":{"observed_at":"2026-08-06T20:02:33.971219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.949915Z","title":"Llm-planner: Few-shot grounded planning for embodied agents with large language models","venue":null,"work_id":"4f093713-923a-47c6-8a14-65df18616c46","year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.069207Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:672d82182a4273e0cd225bf1b4146dc357d43593c6c4befe1442a23e771771b8","observation_id":"170add76-540e-4418-8d40-8792d0b32b8c","resolution":{"observed_at":"2026-08-06T20:02:33.954645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.073653Z","title":"Habitat 2.0: Training home assistants to rearrange their habitat","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.073653Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:af4ad68e10616fb1e649c0c8606728bc934301cebfb2ba7e28ee5f6226da86a9","observation_id":"9bf74e8c-1c66-4fcf-9d3e-71c08d19150b","resolution":{"observed_at":"2026-08-06T20:02:33.073653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.922475Z","title":"Sumner, Marc Pollefeys, Federico Tombari, and Francis Engelmann","venue":null,"work_id":"dbc18998-1bc0-4903-9f09-1d553fdd83f3","year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.078435Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:1d14908378eb9baa0629413564eacd222e4c6b20d4a4669683ee451cfbe2e5b6","observation_id":"c9530d43-f3e2-4889-b87e-9045a8cd09d1","resolution":{"observed_at":"2026-08-06T20:02:33.927417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.907078Z","title":"Rio: 3d object instance re- localization in changing indoor environments","venue":null,"work_id":"055fb120-1ea6-41c1-b615-6a5a9561c454","year":2019},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.083330Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:41dc201969af2f5f0a1848199433e17dd999bd0bad38e70de51b016b3233de98","observation_id":"c9361746-d768-4873-a170-e937b6194819","resolution":{"observed_at":"2026-08-06T20:02:33.911980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.890825Z","title":"Embodiedscan: A holistic multi- modal 3d perception suite towards embodied ai","venue":null,"work_id":"528c9a99-c7df-438e-aba4-5a97d5abea0f","year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.088684Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:4c06ec47c959feb7a948cb8e8f2e8a2a86f8dfef70f79cb73439aebd5b332a5b","observation_id":"c3958155-876a-4424-a8c8-c14914faa310","resolution":{"observed_at":"2026-08-06T20:02:33.895603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00357","last_updated":"2020-01-20T04:18:58Z","snapshot_observed_at":"2026-08-03T16:21:22.610677Z","submitted_at":"2019-11-01T13:07:37Z","title":"DD-PPO: Learning Near-Perfect PointGoal Navigators from 2.5 Billion Frames","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.00357","snapshot_observed_at":"2026-08-06T20:02:33.094358Z","title":"Dd-ppo: Learning near-perfect pointgoal navigators from 2.5 billion frames","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.094358Z"},"links":{"cited_paper":"/paper/1911.00357","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:48acde52031a99f8ae1aa437659ec001d272b7b93640551e0bc0766c57115c20","observation_id":"9840311b-3a6c-44c1-b628-fe68e2d051ac","resolution":{"observed_at":"2026-08-06T20:02:33.094358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.875508Z","title":"Ver: Scaling on- policy rl leads to the emergence of navigation in embodied rearrangement","venue":null,"work_id":"85238850-f3e1-498f-8c7b-69312b6aeb48","year":2022},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.099421Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:ef7bf9b9acc7dc38fb1b2a8bbe7503e66a594533db8ff3e0d898a818638f9058","observation_id":"d855c8e7-24ce-4c92-bf00-1cde8f9bce5c","resolution":{"observed_at":"2026-08-06T20:02:33.880023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.860444Z","title":"Scenegraphfusion: Incre- mental 3d scene graph prediction from rgb-d sequences","venue":null,"work_id":"3469ca6d-fa0e-4802-847c-7d40542080fb","year":2021},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.103822Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:283e746fb1b222744d03da0197cbeef8204fe6d3b95035b4a6bce729512f6955","observation_id":"c4dbf192-0e51-4d22-9090-66021d4bdc9b","resolution":{"observed_at":"2026-08-06T20:02:33.865248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11811","last_updated":"2025-02-12T05:16:17Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:57:06Z","title":"EmbodiedSAM: Online Segment Any 3D Thing in Real Time","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11811","snapshot_observed_at":"2026-08-06T20:02:33.108579Z","title":"Embodiedsam: Online segment any 3d thing in real time","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.108579Z"},"links":{"cited_paper":"/paper/2408.11811","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:11ec6f96fa241a717fc6e623296abf3cef9436ab182007a2e8e321fbb74b46b9","observation_id":"73cebb80-6c31-4bd7-be82-84128aef8574","resolution":{"observed_at":"2026-08-06T20:02:33.108579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.845305Z","title":"Habitat-matterport 3d semantics dataset","venue":null,"work_id":"713fc755-e03d-429b-a436-8d90e53cc4ad","year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.113772Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:3010b2afb0f0f67278de4c9d2ddf9f9e0b3febe365f8ddf83e46f877131fbbde","observation_id":"8f204022-07ac-431f-b824-1607b07efda7","resolution":{"observed_at":"2026-08-06T20:02:33.850264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.830733Z","title":"Frontier-based exploration using multiple robots","venue":null,"work_id":"6e007051-fbd3-4328-94c3-591b998b30a5","year":1998},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.118819Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:cdbacabf4e20d93707fde224c5acdc599f3ddc2dc2fedf30a226c923a14562a8","observation_id":"66540fd2-5ebc-42da-8a41-49a9ceb41a84","resolution":{"observed_at":"2026-08-06T20:02:33.835273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14171","last_updated":"2025-07-02T21:00:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:54Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14171","snapshot_observed_at":"2026-08-06T20:02:33.123605Z","title":"Thinking in space: How mul- timodal large language models see, remember, and recall spaces","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.123605Z"},"links":{"cited_paper":"/paper/2412.14171","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:47ab79df374b84629531ddcd3adb5c78be7451bff881cb136e64415ccbfadebf","observation_id":"1525a073-ef2b-44c6-bb44-cf0d9203795b","resolution":{"observed_at":"2026-08-06T20:02:33.123605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.815096Z","title":"3d-mem: 3d scene memory for embodied exploration and reasoning","venue":null,"work_id":"76b6a90f-c585-4b01-9ef0-bb7e29e40f30","year":2025},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.128531Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:9ab96e2227e9ea2e976ebf08410b68a94140c532dda2caf158d7cbce7277e55a","observation_id":"6b28ee52-6bb1-45e5-a211-0a0961a5e8fc","resolution":{"observed_at":"2026-08-06T20:02:33.819523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.799362Z","title":"Vlfm: Vision-language frontier maps for zero-shot semantic navigation","venue":null,"work_id":"85e39bb8-c267-46a5-af0a-1e65c4abdd9c","year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.133341Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:a2c6187f284b57fcaba45029dc25275114846898604ae79228eb2e911b15d864","observation_id":"f7902776-3426-4812-ba1d-835c3e02c367","resolution":{"observed_at":"2026-08-06T20:02:33.804490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.781576Z","title":"Hm3d-ovon: A dataset and bench- mark for open-vocabulary object goal navigation","venue":null,"work_id":"f73db1a8-026f-4f59-b7c5-d4ca600d357b","year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.138214Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:0c65de2da7b41eb7fa5222e4e85d887da684ffe543b2f58b44060ea3e53a55fe","observation_id":"e846a639-0e12-4c7f-96d5-1bab80731938","resolution":{"observed_at":"2026-08-06T20:02:33.788045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.764807Z","title":"Frontier semantic exploration for visual target navigation","venue":null,"work_id":"8646af87-9661-4faa-aaa4-7050d77df109","year":null},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.142761Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:2a3d8c0b03fdde41ab3064833ab76ad629a5d6e319cc3d0e9b2785e25ce0443e","observation_id":"0e5784ad-8c37-4039-8d60-94a6b91f6d0e","resolution":{"observed_at":"2026-08-06T20:02:33.770186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.750239Z","title":"Instancere- fer: Cooperative holistic understanding for visual ground- ing on point clouds through instance multi-level contextual referring","venue":null,"work_id":"8998baef-e153-4ca9-b4d5-d7a65f245faa","year":2021},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.147218Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:a3bed1444ffb86af1084bd8f9bc72bac03398fc4038e50a6a427dfc10f524871","observation_id":"aae9a2f4-215d-4950-8a5f-1f54cf5c022c","resolution":{"observed_at":"2026-08-06T20:02:33.754549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20083","last_updated":"2024-06-28T17:51:10Z","snapshot_observed_at":"2026-07-06T18:38:38.104034Z","submitted_at":"2024-06-28T17:51:10Z","title":"PoliFormer: Scaling On-Policy RL with Transformers Results in Masterful Navigators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20083","snapshot_observed_at":"2026-08-06T20:02:33.151309Z","title":"Poliformer: Scaling on-policy rl with transformers results in masterful navigators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.151309Z"},"links":{"cited_paper":"/paper/2406.20083","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:8713da562a3617d23993d2bddf0d303aa82b32f60ee9ba3a1358999997b97b59","observation_id":"2609d05e-91ce-4d80-b285-5d697180c3b5","resolution":{"observed_at":"2026-08-06T20:02:33.151309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06224","last_updated":"2025-02-06T10:14:36Z","snapshot_observed_at":"2026-08-06T17:32:08.916929Z","submitted_at":"2024-12-09T05:55:55Z","title":"Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06224","snapshot_observed_at":"2026-08-06T20:02:33.155998Z","title":"Uni-navid: A video-based vision- language-action model for unifying embodied navigation tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.155998Z"},"links":{"cited_paper":"/paper/2412.06224","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:1936ab24fe7d68733923508fedc2a2869c64831105d61524e97c3470f81ff011","observation_id":"583e3afd-8e7f-47ef-9722-8da0e9f8a503","resolution":{"observed_at":"2026-08-06T20:02:33.155998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10714","last_updated":"2023-05-18T05:25:40Z","snapshot_observed_at":"2026-07-06T15:29:05.031168Z","submitted_at":"2023-05-18T05:25:40Z","title":"Vision-Language Pre-training with Object Contrastive Learning for 3D Scene Understanding","version":1},"cited_work":{"arxiv_id":"2305.10714","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.10714","snapshot_observed_at":"2026-08-06T20:02:33.327427Z","title":"Vision-Language Pre-training with Object Contrastive Learning for 3D Scene Understanding","venue":"cs.CV","work_id":"f300b264-c085-495c-989f-d0b1524a419d","year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.160598Z"},"links":{"cited_paper":"/paper/2305.10714","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:8dee864f87d3e37279c65960da5d22d8635cf2cda25b80b6cddfc5975f551647","observation_id":"6063f092-66ec-41ba-84c4-cb0f6f1045a0","resolution":{"observed_at":"2026-08-06T20:02:33.334560Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.735417Z","title":"Multi3drefer: Grounding text description to multiple 3d objects","venue":null,"work_id":"b7135663-f688-420e-8057-e2677c319d81","year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.165673Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:37b15e3cc51ce3a2c77f37ba6057317d9079f75edd2ca428f4e2881f4f6919f3","observation_id":"5f9780c8-10d5-4986-8f9a-4d97c8147ca9","resolution":{"observed_at":"2026-08-06T20:02:33.740367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.719084Z","title":"Microsoft kinect sensor and its effect","venue":null,"work_id":"a450e5b3-0dc6-47a6-9db4-835248e19082","year":2012},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.170543Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:ea6980ec603bbaf7ad371e215e365c170204cee1584e106ec749c8874b1ae40b","observation_id":"f7906a49-1d19-4666-ad00-b2842a1db9ca","resolution":{"observed_at":"2026-08-06T20:02:33.723322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04034","last_updated":"2025-03-08T01:37:47Z","snapshot_observed_at":"2026-08-03T22:29:46.696330Z","submitted_at":"2024-08-07T18:30:18Z","title":"Task-oriented Sequential Grounding and Navigation in 3D Scenes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04034","snapshot_observed_at":"2026-08-06T20:02:33.174687Z","title":"Task-oriented sequen- tial grounding and navigation in 3d scenes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.174687Z"},"links":{"cited_paper":"/paper/2408.04034","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:eb622ab93a594babc5c335496c6bc9c34972faca2a848569ae99ebfd2f11aabf","observation_id":"f7fba5c5-b1d6-49a2-a672-f6d67140bc4e","resolution":{"observed_at":"2026-08-06T20:02:33.174687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.702844Z","title":"To- wards explainable 3d grounded visual question answering: A new benchmark and strong baseline","venue":null,"work_id":"ed853e0b-c9b1-47c3-9411-1eb707b5ad64","year":2022},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.179080Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:eecf877c6e0dc212706ca512c5c5711da69318f5b3e68b257df9a6981ae6dabe","observation_id":"b0f133cb-4108-4947-b1fc-836c269d090e","resolution":{"observed_at":"2026-08-06T20:02:33.708124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12156","last_updated":"2023-06-21T10:08:29Z","snapshot_observed_at":"2026-07-06T15:45:01.961896Z","submitted_at":"2023-06-21T10:08:29Z","title":"Fast Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12156","snapshot_observed_at":"2026-08-06T20:02:33.183289Z","title":"Fast segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.183289Z"},"links":{"cited_paper":"/paper/2306.12156","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:b566c6f84511ae183d14fb3a21dfd8408807271b59c1e2ecf6fceb190e0398cb","observation_id":"a10528fa-1096-4e34-adf2-8d1bfbaa1104","resolution":{"observed_at":"2026-08-06T20:02:33.183289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-05T20:54:58.855446Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-06T20:02:33.187976Z","title":"3d-vla: A 3d vision-language-action generative world model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.187976Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:32378972877ab64eeee86e38ff09ebc75d987fc3c4391845fbd4082b9d6ff7fe","observation_id":"c0dbc718-15b3-4fef-ba94-993a9eaf9604","resolution":{"observed_at":"2026-08-06T20:02:33.187976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.686564Z","title":"Dual memory units with uncertainty regulation for weakly supervised video anomaly detection","venue":null,"work_id":"5a32577b-9ab5-4538-b3ab-81552967977b","year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.193178Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:6bb123773c8c033f0c172ff54fa041db1538a3601998a951537ec69d28a153d7","observation_id":"83388a1b-427e-42dd-a5f5-0aa425a01d7c","resolution":{"observed_at":"2026-08-06T20:02:33.690761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.671242Z","title":"Scanreason: Empowering 3d visual grounding with reasoning capabilities","venue":null,"work_id":"8ae8ad39-8b3a-4de9-901b-8496fb3e3f9c","year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.197976Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:6ad85bb1333df746841ffd69375615709553858f134771db1f3213bc528890fb","observation_id":"96ec4986-1805-49e8-ad9c-1def13a40b0b","resolution":{"observed_at":"2026-08-06T20:02:33.676105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.655021Z","title":"3d-vista: Pre-trained transformer for 3d vision and text alignment","venue":null,"work_id":"fec06f34-28b0-4dfb-a42c-7fbd57196606","year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.202562Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:036cb1c206bf0c85b73049b32ecb6408b15cfb30b8ec422c49a9d1df968f4609","observation_id":"d4465aff-60cc-4572-b653-dfdb711f5ee1","resolution":{"observed_at":"2026-08-06T20:02:33.660133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.639535Z","title":"Unifying 3d vision-language understanding via prompt- able queries","venue":null,"work_id":"c5d2eba3-1f49-4488-96fb-56f5b87e410f","year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.206561Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:b83e3e22e23665bbc07d82ac36ac519b28e571fa58dcbfd0d5bd14f5a1c93e8c","observation_id":"225f2ccb-d3ce-4433-9dbc-f8934a0e1169","resolution":{"observed_at":"2026-08-06T20:02:33.644142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10402","last_updated":"2024-12-05T21:52:20Z","snapshot_observed_at":"2026-08-05T15:17:25.165764Z","submitted_at":"2024-12-05T21:52:20Z","title":"TANGO: Training-free Embodied AI Agents for Open-world Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10402","snapshot_observed_at":"2026-08-06T20:02:33.210895Z","title":"Tango: Training-free embodied ai agents for open-world tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.210895Z"},"links":{"cited_paper":"/paper/2412.10402","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:cb2dba2e866ca12a722511b43261b7ddbfcac2faa3360acf3aae0954362d4636","observation_id":"17a85cb1-9423-4a72-994e-4fc5374ca733","resolution":{"observed_at":"2026-08-06T20:02:33.210895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.623543Z","title":"Generalized decoding for pixel, image, and language","venue":null,"work_id":"f3c52909-a0d7-406f-bcb7-5a092dcebdf2","year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.215747Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:58616d38b3f949ff35061a79fdffad78c93b4a858783a1551a6f483d461059c7","observation_id":"be143c56-3127-4de0-84c2-0274233b3c85","resolution":{"observed_at":"2026-08-06T20:02:33.628398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T02:20:41.204736Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation"},"reference_resolution":{"displayed":96,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":2,"verified_fuzzy":59},"total_outbound_references":96},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 96 of 96 outbound references and 2 inbound Pith citation observations for arXiv:2507.04047."}