{"as_of":"2026-08-09T19:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:43d21aa787c01c6de28ee4a0496d3a54112fcea0d514b3d5aa8466126dfe3c9c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":53,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T15:04:10.941000Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T21:10:08.552638Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":"2306.14846","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-07-04T21:10:08.552638Z","title":"ViNT: A foundation model for visual navigation","venue":null,"work_id":"41c011a1-665d-4cf7-a0d9-59604241df87","year":2023},"citing_paper":{"arxiv_id":"2310.06114","last_updated":"2024-09-26T17:14:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-09T19:42:22Z","title":"Learning Interactive Real-World Simulators","version":3},"reference_index":166,"source":"arxiv_source","source_observed_at":"2026-05-16T02:15:18.265190Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2310.06114"},"observation_digest":"sha256:f9d90cd575a34f79bf246f3fde3f99b419691612a752658ccb65a2735ebcc4c0","observation_id":"b36a4887-8aca-4a60-b288-7bcdea25da7f","resolution":{"observed_at":"2026-05-16T02:15:18.607033Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":"2306.14846","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-07-04T21:10:08.552638Z","title":"ViNT: A foundation model for visual navigation","venue":null,"work_id":"41c011a1-665d-4cf7-a0d9-59604241df87","year":2023},"citing_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-11T05:51:18.508352Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2403.12945"},"observation_digest":"sha256:6a489eac507dded7f557d85c3df60e589efe69dc18302b7d799613c83887ce96","observation_id":"5d2783ab-23b6-40cb-9504-886ea939271e","resolution":{"observed_at":"2026-05-11T05:51:18.813272Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":"2306.14846","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-07-04T21:10:08.552638Z","title":"ViNT: A foundation model for visual navigation","venue":null,"work_id":"41c011a1-665d-4cf7-a0d9-59604241df87","year":2023},"citing_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-11T00:26:15.163358Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2405.12213"},"observation_digest":"sha256:dd98a633e467acf2c2f124d001c9714d876dde5670797f21033618c9a4fb6bf5","observation_id":"39e852db-8e93-4270-83bb-5c330482b405","resolution":{"observed_at":"2026-05-11T00:26:15.361975Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":"2306.14846","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-07-04T21:10:08.552638Z","title":"ViNT: A foundation model for visual navigation","venue":null,"work_id":"41c011a1-665d-4cf7-a0d9-59604241df87","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:b25e3b7e3ef0ef13bae7e41434882ffafcf634cc9f39643a0378c27b16bf0281","observation_id":"e8386bbb-770c-46cf-8bb5-82a311ab90b0","resolution":{"observed_at":"2026-05-10T14:46:36.428955Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":"2306.14846","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-07-04T21:10:08.552638Z","title":"ViNT: A foundation model for visual navigation","venue":null,"work_id":"41c011a1-665d-4cf7-a0d9-59604241df87","year":2023},"citing_paper":{"arxiv_id":"2501.14377","last_updated":"2026-04-10T10:10:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T10:24:39Z","title":"Dream to Fly: Model-Based Reinforcement Learning for Vision-Based Drone Flight","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-23T04:53:33.503100Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2501.14377"},"observation_digest":"sha256:673c28ab7120b9799d54422407dbefef95a062cf0200fbf1aa44a48f4e60cc1a","observation_id":"66941f01-0ffd-4c08-a963-5caaf9c79c81","resolution":{"observed_at":"2026-05-23T04:55:25.130017Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-08-08T15:04:10.941000Z","title":"Vint: A foundation model for visual navigation.arXiv preprint arXiv:2306.14846, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06575","last_updated":"2025-02-10T15:44:34Z","snapshot_observed_at":"2026-08-09T01:57:08.368112Z","submitted_at":"2025-02-10T15:44:34Z","title":"Predictive Red Teaming: Breaking Policies Without Breaking Robots","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:10.941000Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2502.06575"},"observation_digest":"sha256:771951233ffac515004145305ca3e50bf63d15a39256ad1fa1ed0873cea610ad","observation_id":"f825b08a-225c-4e22-a183-1b4b4ed3de42","resolution":{"observed_at":"2026-08-08T15:04:10.941000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":"2306.14846","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-07-04T21:10:08.552638Z","title":"ViNT: A foundation model for visual navigation","venue":null,"work_id":"41c011a1-665d-4cf7-a0d9-59604241df87","year":2023},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:b6a1bdbece7a1d1af4fe5fe46c34dc9a16bf5b8ef36a65fd9fe823b62cf26d60","observation_id":"e8dedf86-1f6a-465f-977c-2584ea469877","resolution":{"observed_at":"2026-05-22T18:05:00.947021Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-08-07T00:25:04.971498Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14233","last_updated":"2025-06-17T06:46:15Z","snapshot_observed_at":"2026-08-08T12:41:42.352203Z","submitted_at":"2025-06-17T06:46:15Z","title":"Narrate2Nav: Real-Time Visual Navigation with Implicit Language Reasoning in Human-Centric Environments","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:04.971498Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2506.14233"},"observation_digest":"sha256:9fdfc64f52a87ae1e1950acc48988b39263a6b68131e59195650fa52ac1c8111","observation_id":"45463947-70e1-4228-b576-c606f23ff2f8","resolution":{"observed_at":"2026-08-07T00:25:04.971498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-08-06T23:28:39.314742Z","title":"Vint: A foundation model for visual navigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18268","last_updated":"2025-06-23T03:52:35Z","snapshot_observed_at":"2026-08-09T15:26:50.981829Z","submitted_at":"2025-06-23T03:52:35Z","title":"ThermalLoc: A Vision Transformer-Based Approach for Robust Thermal Camera Relocalization in Large-Scale Environments","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:39.314742Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2506.18268"},"observation_digest":"sha256:45fdaa1de8c1bc54f29e9dbf5bb13e4a9f191ff8ad2c1f6a7b3dacee4192eb34","observation_id":"a3b9629b-edf7-4985-9bd4-aee7a3b1c63a","resolution":{"observed_at":"2026-08-06T23:28:39.314742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-08-06T22:21:12.361685Z","title":"In: 7th Annual Conference 18 on Robot Learning (2023).https://arxiv.org/abs/2306.14846","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21853","last_updated":"2025-09-07T09:44:32Z","snapshot_observed_at":"2026-08-08T23:09:09.540288Z","submitted_at":"2025-06-27T02:08:40Z","title":"Skill-Nav: Enhanced Navigation with Versatile Quadrupedal Locomotion via Waypoint Interface","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:12.361685Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2506.21853"},"observation_digest":"sha256:0aae5f48ad1ae46f61796f3cca351f1b30c7e5c9e6d683f228298bbc2aed1ab9","observation_id":"d53be860-d51d-44f6-871f-14939fd49404","resolution":{"observed_at":"2026-08-06T22:21:12.361685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-08-06T22:45:25.667794Z","title":"Vint: A foundation model for visual navigation.arXiv preprint arXiv:2306.14846, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02929","last_updated":"2025-06-26T05:57:06Z","snapshot_observed_at":"2026-08-09T14:03:50.335818Z","submitted_at":"2025-06-26T05:57:06Z","title":"OBSER: Object-Based Sub-Environment Recognition for Zero-Shot Environmental Inference","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:45:25.667794Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2507.02929"},"observation_digest":"sha256:965cf1454f57ef772ccc96213074c8236ae4c78dcac19e73e77c56c15df83f42","observation_id":"3f906f59-76aa-43b6-89d6-5a93af40085e","resolution":{"observed_at":"2026-08-06T22:45:25.667794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-08-06T19:47:16.219197Z","title":"arXiv preprint arXiv:2306.14846 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04686","last_updated":"2025-07-07T06:08:21Z","snapshot_observed_at":"2026-08-08T15:24:54.779927Z","submitted_at":"2025-07-07T06:08:21Z","title":"MOSU: Autonomous Long-range Robot Navigation with Multi-modal Scene Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:16.219197Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2507.04686"},"observation_digest":"sha256:7b9767104afad3c2064da89a07e01872b1a2a50d4d0b8a3c594615e5db35455f","observation_id":"b5c086d3-636b-4df9-96a8-81861f380df6","resolution":{"observed_at":"2026-08-06T19:47:16.219197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-08-06T14:59:03.607088Z","title":"Gnm: A general navigation model to drive any robot","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17220","last_updated":"2025-07-23T05:34:20Z","snapshot_observed_at":"2026-08-09T08:17:15.380321Z","submitted_at":"2025-07-23T05:34:20Z","title":"PIG-Nav: Key Insights for Pretrained Image Goal Navigation Models","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T14:59:03.607088Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2507.17220"},"observation_digest":"sha256:9998f8ed20ef2d6c420981977e991cc71a62ddac42e45ccb1828d14c44b9acd4","observation_id":"86a39f3a-db25-45be-881c-7c321934740d","resolution":{"observed_at":"2026-08-06T14:59:03.607088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-08-06T12:11:28.510190Z","title":"Gnm: A general navigation model to drive any robot","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.22028","last_updated":"2026-06-10T18:51:39Z","snapshot_observed_at":"2026-08-06T12:11:27.307033Z","submitted_at":"2025-07-29T17:26:10Z","title":"From Seeing to Experiencing: Scaling Navigation Foundation Models with Reinforcement Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T12:11:28.510190Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2507.22028"},"observation_digest":"sha256:c464ecded76957a65da970ac572236115d7bc8bc5b16b7ead4b3fd0311c71929","observation_id":"0abed561-5e51-4d04-a671-9199c4446750","resolution":{"observed_at":"2026-08-06T12:11:28.510190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-08-06T05:41:41.942248Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:41.942248Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:5e1bb47b3a2da9e5865829982203ad0d0a376be3cd61820c5f4e799939dc7808","observation_id":"c4176d68-2e40-4bfe-a753-303db470432b","resolution":{"observed_at":"2026-08-06T05:41:41.942248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-08-05T19:06:27.032727Z","title":"ViNT: A foundation model for visual navigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.13446","last_updated":"2026-06-08T21:52:42Z","snapshot_observed_at":"2026-08-07T21:58:57.623091Z","submitted_at":"2025-08-19T02:01:06Z","title":"CAST: Counterfactual Labels Improve Instruction Following in Vision-Language-Action Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:27.032727Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2508.13446"},"observation_digest":"sha256:5c6f7c5c0590ed96a9d31e97de3ce963757b8cca1438d925f27e012e4517ea44","observation_id":"97f304a3-34f0-48be-b5d6-64447c219eee","resolution":{"observed_at":"2026-08-05T19:06:27.032727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-08-05T11:21:05.054748Z","title":"Vint: A foundation model for visual navigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02983","last_updated":"2025-09-03T03:43:12Z","snapshot_observed_at":"2026-08-05T11:21:02.796416Z","submitted_at":"2025-09-03T03:43:12Z","title":"DUViN: Diffusion-Based Underwater Visual Navigation via Knowledge-Transferred Depth Features","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T11:21:05.054748Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2509.02983"},"observation_digest":"sha256:f9c4d154a6f23f49d211adf0a69d56924975a21576034ab9bde2232dff4b6959","observation_id":"296f0711-4772-4115-b7eb-e037b94a6f41","resolution":{"observed_at":"2026-08-05T11:21:05.054748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-08-04T12:37:54.645609Z","title":"Vint: A foundation model for visual navigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03142","last_updated":"2026-06-29T05:31:52Z","snapshot_observed_at":"2026-08-06T16:54:48.653237Z","submitted_at":"2025-10-03T16:15:09Z","title":"MM-Nav: Multi-View VLA Model for Robust Visual Navigation via Multi-Expert Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T12:37:54.645609Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2510.03142"},"observation_digest":"sha256:7cdcfb37a864d05f669a255e60a99d877ff4b0b24b6537d703cb4b6c57116dc9","observation_id":"dec2dce5-537b-40d7-a202-44debc262802","resolution":{"observed_at":"2026-08-04T12:37:54.645609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":"2306.14846","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-07-04T21:10:08.552638Z","title":"ViNT: A foundation model for visual navigation","venue":null,"work_id":"41c011a1-665d-4cf7-a0d9-59604241df87","year":2023},"citing_paper":{"arxiv_id":"2511.11931","last_updated":"2026-04-21T18:25:36Z","snapshot_observed_at":"2026-07-06T22:35:51.341917Z","submitted_at":"2025-11-14T23:13:34Z","title":"MATT-Diff: Multimodal Active Target Tracking by Diffusion Policy","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-17T21:41:44.772556Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2511.11931"},"observation_digest":"sha256:ee74c8e6d7d585351afdcad89ecf8728e011d1704e4912d9c2eaffa7f1049d02","observation_id":"47d1f422-b9d8-42dd-a79c-d98119105243","resolution":{"observed_at":"2026-05-17T21:42:07.427047Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":"2306.14846","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-07-04T21:10:08.552638Z","title":"ViNT: A foundation model for visual navigation","venue":null,"work_id":"41c011a1-665d-4cf7-a0d9-59604241df87","year":2023},"citing_paper":{"arxiv_id":"2511.18525","last_updated":"2026-04-08T17:07:41Z","snapshot_observed_at":"2026-08-05T07:57:02.315085Z","submitted_at":"2025-11-23T16:35:51Z","title":"Splatblox: Traversability-Aware Gaussian Splatting for Outdoor Robot Navigation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-17T06:03:45.608023Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2511.18525"},"observation_digest":"sha256:1938cad6fe8bf30777a0883cd179410ff6f869912fd3849ec5f85f90e09c1b7f","observation_id":"c8d781ae-5875-47a1-9c8f-d70f6e7285ea","resolution":{"observed_at":"2026-05-17T06:04:09.042373Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-08-03T20:24:36.804719Z","title":"Serve Robotics Inc","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20216","last_updated":"2026-07-06T07:24:30Z","snapshot_observed_at":"2026-08-08T17:46:47.791950Z","submitted_at":"2025-11-25T11:42:28Z","title":"CostNav: A Navigation Benchmark for Real-World Economic-Cost Evaluation of Physical AI Agents","version":7},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T20:24:36.804719Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2511.20216"},"observation_digest":"sha256:ec3832bd4e6dd3d6672ff881e4ccc946c5a522f10eb6a8e4b43e686ec7022f45","observation_id":"90e2115f-e72e-4b12-a315-776551a94066","resolution":{"observed_at":"2026-08-03T20:24:36.804719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":"2306.14846","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-07-04T21:10:08.552638Z","title":"ViNT: A foundation model for visual navigation","venue":null,"work_id":"41c011a1-665d-4cf7-a0d9-59604241df87","year":2023},"citing_paper":{"arxiv_id":"2512.02535","last_updated":"2026-04-30T01:12:10Z","snapshot_observed_at":"2026-07-06T22:37:31.360740Z","submitted_at":"2025-12-02T09:00:12Z","title":"AID: Agent Intent from Diffusion for Multi-Agent Informative Path Planning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-17T02:55:11.396778Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2512.02535"},"observation_digest":"sha256:ff4d0e6fe6d7e1f70e4c46742f397207f92b64eaac2dcf72efdbdaa4c98f06b2","observation_id":"02abab78-1ada-49a4-9146-9cf470127c0d","resolution":{"observed_at":"2026-05-17T02:58:55.122084Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-08-02T21:56:35.817252Z","title":"Vint: A foundation model for visual navigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.18803","last_updated":"2026-07-02T13:59:22Z","snapshot_observed_at":"2026-08-08T10:57:09.906822Z","submitted_at":"2026-02-21T11:33:00Z","title":"Learning to Localize Reference Trajectories in Image-Space for Visual Navigation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T21:56:35.817252Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2602.18803"},"observation_digest":"sha256:30735f3eff8d6b2967c59e82446a9fc522711770cd927ebbdfb2e7314320f3f4","observation_id":"6f3df3c4-ee9c-4659-895a-90074b0e39e1","resolution":{"observed_at":"2026-08-02T21:56:35.817252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-07-15T13:10:42.531155Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.07578","last_updated":"2026-05-30T06:39:45Z","snapshot_observed_at":"2026-08-05T18:43:17.874266Z","submitted_at":"2026-03-08T10:32:21Z","title":"Approximate Imitation Learning for Event-based Quadrotor Flight in Cluttered Environments","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-15T13:10:42.531155Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2603.07578"},"observation_digest":"sha256:4fd5f6d48409bfe97359f49e7190c5273e9cef02a1a63aaa35505b4d421c294e","observation_id":"4e8c844d-bbf4-41cf-ad0b-672e941a9e7c","resolution":{"observed_at":"2026-07-15T13:10:42.531155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-07-15T12:07:05.640150Z","title":"Vint: A foundation model for visual navigation.arXiv preprint arXiv:2306.14846, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.09241","last_updated":"2026-06-26T11:58:42Z","snapshot_observed_at":"2026-07-15T12:07:03.818843Z","submitted_at":"2026-03-10T06:16:23Z","title":"RAE-NWM: Navigation World Model in Dense Visual Representation Space","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-15T12:07:05.640150Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2603.09241"},"observation_digest":"sha256:c70ee75541aca1eab3841492ca6b34340e54bdd13cea6f8eaade61d3295ca328","observation_id":"b8a1c452-39d6-4731-8b11-86af9a830586","resolution":{"observed_at":"2026-07-15T12:07:05.640150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":"2306.14846","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-07-04T21:10:08.552638Z","title":"ViNT: A foundation model for visual navigation","venue":null,"work_id":"41c011a1-665d-4cf7-a0d9-59604241df87","year":2023},"citing_paper":{"arxiv_id":"2604.02829","last_updated":"2026-04-03T07:50:53Z","snapshot_observed_at":"2026-08-02T08:40:10.293795Z","submitted_at":"2026-04-03T07:50:53Z","title":"STRNet: Visual Navigation with Spatio-Temporal Representation through Dynamic Graph Aggregation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-13T20:11:36.717810Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2604.02829"},"observation_digest":"sha256:d98ce85f9648e884b96c938435b0837d3b5b07598e142ecc67b98224c8cb2120","observation_id":"8d205b90-6e6b-4ee9-aa56-d8a6bce10e5d","resolution":{"observed_at":"2026-05-13T20:13:13.493766Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":"2306.14846","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-07-04T21:10:08.552638Z","title":"ViNT: A foundation model for visual navigation","venue":null,"work_id":"41c011a1-665d-4cf7-a0d9-59604241df87","year":2023},"citing_paper":{"arxiv_id":"2604.05673","last_updated":"2026-05-27T09:34:12Z","snapshot_observed_at":"2026-08-02T18:02:37.265119Z","submitted_at":"2026-04-07T10:22:27Z","title":"Rectified Schr\\\"odinger Bridge Matching for Few-Step Visual Navigation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T19:25:36.704959Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2604.05673"},"observation_digest":"sha256:3486f6a237f907e0a4b7124c41b2f294a70d8f7430391f5fc9e45254bb8cb5c5","observation_id":"89b88992-5782-4582-8245-f78c936a7f4f","resolution":{"observed_at":"2026-05-10T23:00:48.611135Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":"2306.14846","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-07-04T21:10:08.552638Z","title":"ViNT: A foundation model for visual navigation","venue":null,"work_id":"41c011a1-665d-4cf7-a0d9-59604241df87","year":2023},"citing_paper":{"arxiv_id":"2604.07973","last_updated":"2026-04-09T08:37:20Z","snapshot_observed_at":"2026-07-06T22:57:09.435331Z","submitted_at":"2026-04-09T08:37:20Z","title":"How Far Are Large Multimodal Models from Human-Level Spatial Action? A Benchmark for Goal-Oriented Embodied Navigation in Urban Airspace","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T18:09:39.510770Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2604.07973"},"observation_digest":"sha256:c942cd273304fb4a8d0ca68dd52cc9d5f0b5a97434b553899dc447a2b56848fe","observation_id":"9cce0e6f-dd7e-4808-a0ca-ede5a09f008e","resolution":{"observed_at":"2026-05-11T05:25:57.050349Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":"2306.14846","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-07-04T21:10:08.552638Z","title":"ViNT: A foundation model for visual navigation","venue":null,"work_id":"41c011a1-665d-4cf7-a0d9-59604241df87","year":2023},"citing_paper":{"arxiv_id":"2604.16592","last_updated":"2026-04-17T17:51:46Z","snapshot_observed_at":"2026-07-06T23:03:52.631613Z","submitted_at":"2026-04-17T17:51:46Z","title":"Human Cognition in Machines: A Unified Perspective of World Models","version":1},"reference_index":147,"source":"pdf_text","source_observed_at":"2026-05-10T08:12:15.663761Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2604.16592"},"observation_digest":"sha256:7482a0275a98084469ab792e52137df7d7cd3a443dc0ca69840eca34c344255a","observation_id":"061c57a9-588c-454f-a3ff-076cadee399a","resolution":{"observed_at":"2026-05-10T08:12:26.201103Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":"2306.14846","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-07-04T21:10:08.552638Z","title":"ViNT: A foundation model for visual navigation","venue":null,"work_id":"41c011a1-665d-4cf7-a0d9-59604241df87","year":2023},"citing_paper":{"arxiv_id":"2605.11762","last_updated":"2026-05-12T08:33:38Z","snapshot_observed_at":"2026-08-02T09:21:48.103983Z","submitted_at":"2026-05-12T08:33:38Z","title":"NavOL: Navigation Policy with Online Imitation Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T05:51:53.848800Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2605.11762"},"observation_digest":"sha256:e43ddb920bbf66d50c3d1f234b95da321056580363766c94201dce1fa00bfb86","observation_id":"6ed31ce3-54cc-4393-9118-efadcf7054ab","resolution":{"observed_at":"2026-05-13T05:52:21.907111Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":"2306.14846","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-07-04T21:10:08.552638Z","title":"ViNT: A foundation model for visual navigation","venue":null,"work_id":"41c011a1-665d-4cf7-a0d9-59604241df87","year":2023},"citing_paper":{"arxiv_id":"2605.15559","last_updated":"2026-05-15T02:58:25Z","snapshot_observed_at":"2026-08-03T06:37:10.316747Z","submitted_at":"2026-05-15T02:58:25Z","title":"NavRL++: A System-Level Framework for Improving Sim-to-Real Transfer in Reinforcement Learning-Based Robot Navigation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T19:16:06.363772Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2605.15559"},"observation_digest":"sha256:83c17838cb059b038262aa567156d428d03f28dccce62f07199295ee6432b8fe","observation_id":"b7040a10-19db-4a64-9b42-018e365017f4","resolution":{"observed_at":"2026-05-20T19:18:54.542544Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":"2306.14846","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-07-04T21:10:08.552638Z","title":"ViNT: A foundation model for visual navigation","venue":null,"work_id":"41c011a1-665d-4cf7-a0d9-59604241df87","year":2023},"citing_paper":{"arxiv_id":"2605.18324","last_updated":"2026-05-18T12:42:34Z","snapshot_observed_at":"2026-07-06T23:29:14.916114Z","submitted_at":"2026-05-18T12:42:34Z","title":"Improved Baselines with Representation Autoencoders","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-20T11:40:14.358108Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2605.18324"},"observation_digest":"sha256:d0110b8547b06e115ea657c0c555af6a547b741e4b319ab1f1e7705abf6551b5","observation_id":"f1f397ed-7472-448b-a023-6c533351503d","resolution":{"observed_at":"2026-05-20T11:43:15.342413Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":"2306.14846","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-07-04T21:10:08.552638Z","title":"ViNT: A foundation model for visual navigation","venue":null,"work_id":"41c011a1-665d-4cf7-a0d9-59604241df87","year":2023},"citing_paper":{"arxiv_id":"2605.23165","last_updated":"2026-05-22T02:33:47Z","snapshot_observed_at":"2026-07-06T23:33:24.215365Z","submitted_at":"2026-05-22T02:33:47Z","title":"Autonomous Frontier-Based Exploration with VLM Guidance","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-25T04:37:35.682778Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2605.23165"},"observation_digest":"sha256:453c670a177151e61c9a37e8616feceb5f6c9b99f13f205ceef478b2f1a7cadd","observation_id":"c3d78722-6edd-4e6f-a662-480de3c89b15","resolution":{"observed_at":"2026-05-25T04:40:24.310430Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":"2306.14846","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-07-04T21:10:08.552638Z","title":"ViNT: A foundation model for visual navigation","venue":null,"work_id":"41c011a1-665d-4cf7-a0d9-59604241df87","year":2023},"citing_paper":{"arxiv_id":"2605.24578","last_updated":"2026-05-23T13:42:35Z","snapshot_observed_at":"2026-08-02T07:50:35.635060Z","submitted_at":"2026-05-23T13:42:35Z","title":"World Models as Group Actions","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:42.720825Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2605.24578"},"observation_digest":"sha256:2a98e1f55a69190811fd40893c3c7ff7e59cbc3778a5a55f3bb28aa5ef1a7f3a","observation_id":"605043c3-8d2a-4628-8f39-577c7ef2a6e2","resolution":{"observed_at":"2026-06-30T13:24:40.360069Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":"2306.14846","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-07-04T21:10:08.552638Z","title":"ViNT: A foundation model for visual navigation","venue":null,"work_id":"41c011a1-665d-4cf7-a0d9-59604241df87","year":2023},"citing_paper":{"arxiv_id":"2605.24761","last_updated":"2026-05-23T22:47:33Z","snapshot_observed_at":"2026-08-05T23:26:24.387478Z","submitted_at":"2026-05-23T22:47:33Z","title":"Drift-Resistant Navigation World Model with Anchored Epipolar Guidance","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T13:07:20.197513Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2605.24761"},"observation_digest":"sha256:15b4f8d6fc5ea14277f388f111c2afa60d4927c1642e6362e382555345be9987","observation_id":"95e3068d-ae8a-4563-b635-90a93fa1ad63","resolution":{"observed_at":"2026-06-30T13:14:40.998750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":"2306.14846","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-07-04T21:10:08.552638Z","title":"ViNT: A foundation model for visual navigation","venue":null,"work_id":"41c011a1-665d-4cf7-a0d9-59604241df87","year":2023},"citing_paper":{"arxiv_id":"2605.26239","last_updated":"2026-05-25T18:04:41Z","snapshot_observed_at":"2026-07-06T23:36:06.135765Z","submitted_at":"2026-05-25T18:04:41Z","title":"Sentinel: Embodied Cooperative Spatial Reasoning and Planning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-29T22:58:41.050531Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2605.26239"},"observation_digest":"sha256:92f128897350e8a28616cc043e5585b7e0dc12ce475100d0da94804fc3f0b4f8","observation_id":"95c14893-4724-4966-a61c-bbadeaceccd5","resolution":{"observed_at":"2026-06-29T23:04:01.451884Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":"2306.14846","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-07-04T21:10:08.552638Z","title":"ViNT: A foundation model for visual navigation","venue":null,"work_id":"41c011a1-665d-4cf7-a0d9-59604241df87","year":2023},"citing_paper":{"arxiv_id":"2605.26710","last_updated":"2026-05-26T08:52:38Z","snapshot_observed_at":"2026-08-08T08:50:53.949762Z","submitted_at":"2026-05-26T08:52:38Z","title":"Look Further: Socially-Compliant Navigation System in Residential Buildings","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-29T17:01:18.162750Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2605.26710"},"observation_digest":"sha256:95b2481e1451c13a81c785b76d711ccd76dbd320f2277e82d59480ae79a5c318","observation_id":"77733835-f772-40fe-b4c0-247fc1edec81","resolution":{"observed_at":"2026-06-29T17:03:40.865324Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":"2306.14846","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-07-04T21:10:08.552638Z","title":"ViNT: A foundation model for visual navigation","venue":null,"work_id":"41c011a1-665d-4cf7-a0d9-59604241df87","year":2023},"citing_paper":{"arxiv_id":"2605.28237","last_updated":"2026-05-27T09:50:16Z","snapshot_observed_at":"2026-08-06T23:55:29.770936Z","submitted_at":"2026-05-27T09:50:16Z","title":"POINav: Benchmarking and Enhancing Final-Meters Arrival in Real-World Vision-Language Navigation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T11:48:14.888295Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2605.28237"},"observation_digest":"sha256:60752a0c9d707211762d4ac3f0f016b621a0d1a7d2a1774f3b22b14e21c2ff14","observation_id":"657cc18f-a988-48ed-b808-8972ceb6515b","resolution":{"observed_at":"2026-06-29T11:53:23.879641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":"2306.14846","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-07-04T21:10:08.552638Z","title":"ViNT: A foundation model for visual navigation","venue":null,"work_id":"41c011a1-665d-4cf7-a0d9-59604241df87","year":2023},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:674b943d54651dd7277ef18601cef143b5ea22e9250bd723fd053f8e2da81738","observation_id":"b9f10a16-8489-4590-a084-9ff074af788f","resolution":{"observed_at":"2026-07-01T22:16:15.766063Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":"2306.14846","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-07-04T21:10:08.552638Z","title":"ViNT: A foundation model for visual navigation","venue":null,"work_id":"41c011a1-665d-4cf7-a0d9-59604241df87","year":2023},"citing_paper":{"arxiv_id":"2606.10371","last_updated":"2026-06-09T03:31:09Z","snapshot_observed_at":"2026-07-06T23:49:37.345711Z","submitted_at":"2026-06-09T03:31:09Z","title":"Test-time Adversarial Takeover: A Real-time Hijacking Interface against Robotic Diffusion Policies","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-27T13:04:32.423616Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2606.10371"},"observation_digest":"sha256:5d7ef501a2a7dd808dce4061b0c8531574a80e09b007c84e4a9446a211bad12f","observation_id":"99530b7f-5da1-4f2c-9db9-d9f6f8902c60","resolution":{"observed_at":"2026-07-03T05:47:41.602340Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":"2306.14846","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-07-04T21:10:08.552638Z","title":"ViNT: A foundation model for visual navigation","venue":null,"work_id":"41c011a1-665d-4cf7-a0d9-59604241df87","year":2023},"citing_paper":{"arxiv_id":"2606.10495","last_updated":"2026-06-09T07:18:01Z","snapshot_observed_at":"2026-08-02T10:00:24.356645Z","submitted_at":"2026-06-09T07:18:01Z","title":"Act on What You See: Unlocking Safe Social Navigation in Vision-Language-Action Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T12:52:38.764427Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2606.10495"},"observation_digest":"sha256:1651b2425a1e50fc2bb65ab6869a8ce11260b956b0027f5fdfc8147af85a3c8b","observation_id":"0a9ddb97-e826-4dbd-a98c-ce4a8a45a628","resolution":{"observed_at":"2026-07-03T06:07:41.691295Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":"2306.14846","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-07-04T21:10:08.552638Z","title":"ViNT: A foundation model for visual navigation","venue":null,"work_id":"41c011a1-665d-4cf7-a0d9-59604241df87","year":2023},"citing_paper":{"arxiv_id":"2606.12603","last_updated":"2026-06-10T19:01:31Z","snapshot_observed_at":"2026-08-07T13:05:45.178504Z","submitted_at":"2026-06-10T19:01:31Z","title":"From Imitation to Alignment: Human-Preference Flow Policies for Long-Horizon Sidewalk Navigation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T09:29:43.030058Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2606.12603"},"observation_digest":"sha256:88c683b39b63b3fb17308bee7e2db744a1bd6b6cb4be40cb816b4d58ebafcb97","observation_id":"a922ce2f-ecd0-4232-8a05-eb0f98af1726","resolution":{"observed_at":"2026-07-03T11:38:04.666292Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":"2306.14846","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-07-04T21:10:08.552638Z","title":"ViNT: A foundation model for visual navigation","venue":null,"work_id":"41c011a1-665d-4cf7-a0d9-59604241df87","year":2023},"citing_paper":{"arxiv_id":"2606.13494","last_updated":"2026-06-11T15:44:36Z","snapshot_observed_at":"2026-08-08T08:21:51.127066Z","submitted_at":"2026-06-11T15:44:36Z","title":"NavWAM: A Navigation World Action Model for Goal-Conditioned Visual Navigation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T06:30:17.719105Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2606.13494"},"observation_digest":"sha256:9d6774385a3d69c405ae42f1ad65a697ffe099af31afd1bfb9137d320e36b385","observation_id":"661ef9d2-4339-4654-9882-fbc7c1398a43","resolution":{"observed_at":"2026-07-03T15:28:34.030334Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":"2306.14846","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-07-04T21:10:08.552638Z","title":"ViNT: A foundation model for visual navigation","venue":null,"work_id":"41c011a1-665d-4cf7-a0d9-59604241df87","year":2023},"citing_paper":{"arxiv_id":"2606.20458","last_updated":"2026-06-18T16:40:07Z","snapshot_observed_at":"2026-08-07T03:20:01.050993Z","submitted_at":"2026-06-18T16:40:07Z","title":"Slow Brain, Fast Planner: Latency-Resilient VLM-Augmented Urban Navigation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T17:16:52.173943Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2606.20458"},"observation_digest":"sha256:08cafb4f0729b1dd669654c533ef5d7cb62933dbbdbdb5f5720d2cf563c7bfec","observation_id":"ec350992-313e-4f4f-aab2-a37f10debbd7","resolution":{"observed_at":"2026-07-04T04:09:33.966990Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":"2306.14846","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-07-04T21:10:08.552638Z","title":"ViNT: A foundation model for visual navigation","venue":null,"work_id":"41c011a1-665d-4cf7-a0d9-59604241df87","year":2023},"citing_paper":{"arxiv_id":"2606.24101","last_updated":"2026-06-23T03:30:20Z","snapshot_observed_at":"2026-08-02T03:37:38.259529Z","submitted_at":"2026-06-23T03:30:20Z","title":"NavWM: A Unified Navigation World Model for Foresight-Driven Planning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T00:42:30.237545Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2606.24101"},"observation_digest":"sha256:77f7d9f97c38b62722ab83e2312fea633fb2b27b39696f3a66615d3b62417793","observation_id":"afbe0154-3e88-4f32-8e4c-187e97abf4f6","resolution":{"observed_at":"2026-07-04T16:29:56.754455Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":"2306.14846","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-07-04T21:10:08.552638Z","title":"ViNT: A foundation model for visual navigation","venue":null,"work_id":"41c011a1-665d-4cf7-a0d9-59604241df87","year":2023},"citing_paper":{"arxiv_id":"2606.26047","last_updated":"2026-06-24T17:26:17Z","snapshot_observed_at":"2026-07-07T00:00:26.827253Z","submitted_at":"2026-06-24T17:26:17Z","title":"Learning Robot Visual Navigation in Crowds via Intention-Aware Scene Representations","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-25T19:06:41.116675Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2606.26047"},"observation_digest":"sha256:ce65c5b8caa0c12a440bfcc912289877814b078f55df68f3ce7fc60712bd1e59","observation_id":"0678cc9e-6dc4-469d-9dda-6fb8346f5348","resolution":{"observed_at":"2026-07-04T21:10:08.555240Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-07-14T07:33:00.386358Z","title":"ViNT: a foundation model for visual navigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11029","last_updated":"2026-07-23T08:42:52Z","snapshot_observed_at":"2026-08-09T17:38:21.760588Z","submitted_at":"2026-07-13T02:49:55Z","title":"Learning to Navigate Efficiently with Only 0.58M Trainable Parameters","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T07:33:00.386358Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2607.11029"},"observation_digest":"sha256:a79f68cb5dd951691cafdb4444e893e0b9d282a48c8180f7d5a15e64afaec72f","observation_id":"334c8c08-cd41-4ab2-8cef-b583b016dec2","resolution":{"observed_at":"2026-07-14T07:33:00.386358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-08-02T07:09:14.936674Z","title":"ViNT: a foundation model for visual navigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11029","last_updated":"2026-07-23T08:42:52Z","snapshot_observed_at":"2026-08-09T17:38:21.760588Z","submitted_at":"2026-07-13T02:49:55Z","title":"Learning to Navigate Efficiently with Only 0.58M Trainable Parameters","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T07:09:14.936674Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2607.11029"},"observation_digest":"sha256:853f58aa51129aa9d74498c3f5691dec5f1b0dfec93c0f907ddeb43185f44d94","observation_id":"6db71e94-3207-4520-889b-7cf54c88d980","resolution":{"observed_at":"2026-08-02T07:09:14.936674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-08-02T02:49:56.083126Z","title":"Vint: A foundation model for visual navigation.arXiv preprint arXiv:2306.14846, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:56.083126Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:39d32832f124a1ea81ce22e941ee4d74611578ee800fe646de11468b6ea39f7f","observation_id":"5a79a019-96fe-4527-a696-b9995511514e","resolution":{"observed_at":"2026-08-02T02:49:56.083126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-08-01T19:29:21.514289Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16956","last_updated":"2026-07-18T20:18:20Z","snapshot_observed_at":"2026-08-08T06:16:43.625119Z","submitted_at":"2026-07-18T20:18:20Z","title":"G2-Nav: Grounded and Guarded Vision-Language Costmaps for Robot Social Navigation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T19:29:21.514289Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2607.16956"},"observation_digest":"sha256:ba9e2202df77b10785090484c4c61b987bf19ed5b0a755b4397f624f7f08731c","observation_id":"7b5c56b6-b556-4e0b-841c-3128b91a13ed","resolution":{"observed_at":"2026-08-01T19:29:21.514289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-08-01T06:17:39.811308Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.21964","last_updated":"2026-07-24T04:23:21Z","snapshot_observed_at":"2026-08-05T16:26:12.692120Z","submitted_at":"2026-07-24T04:23:21Z","title":"ACME: A Multi-Cultural, Multi-Embodiment Social-Navigation Dataset","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-01T06:17:39.811308Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2607.21964"},"observation_digest":"sha256:d70c387d864c567400c26eef6c69b31706c70c8ebb9e5a181ae1603324b6c763","observation_id":"a655afa5-7faf-4430-99c7-a88d41869dba","resolution":{"observed_at":"2026-08-01T06:17:39.811308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-08-04T19:45:35.206962Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01851","last_updated":"2026-08-03T07:58:35Z","snapshot_observed_at":"2026-08-07T23:22:57.641630Z","submitted_at":"2026-08-03T07:58:35Z","title":"Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills","version":1},"reference_index":226,"source":"pdf_text","source_observed_at":"2026-08-04T19:45:35.206962Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2608.01851"},"observation_digest":"sha256:f49313d24abdf3d23a3fc9ef3e9b44ce5f9ba201febc16667dc7df719ea7470c","observation_id":"8bf941ef-1f3b-47b7-a8bc-f503debb84b3","resolution":{"observed_at":"2026-08-04T19:45:35.206962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-08-05T22:45:35.867887Z","title":"arXiv preprint arXiv:2306.14846 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03244","last_updated":"2026-08-04T07:15:45Z","snapshot_observed_at":"2026-08-08T23:18:03.914148Z","submitted_at":"2026-08-04T07:15:45Z","title":"UniNav: A Unified World-Action Diffusion Model for Visual Navigation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T22:45:35.867887Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2608.03244"},"observation_digest":"sha256:b398d5e0792125152901877fd6c42d60a8bcdecd1c8e86d66dda5f49b638b641","observation_id":"d4e6f2ed-93b4-412d-815c-fe561c056ec6","resolution":{"observed_at":"2026-08-05T22:45:35.867887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2306.14846/citation-record","integrity":"/paper/2306.14846/integrity","json":"/paper/2306.14846/citation-record.json","paper":"/paper/2306.14846"},"outbound":[],"paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 53 inbound Pith citation observations for arXiv:2306.14846."}