{"as_of":"2026-08-10T13:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cef3e1b7c886252982a662d450daefcd1617d717f1bac03fb9e4c13e9b074534","coverage":[{"denominator":79,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:44:46.477173Z","state":"measured"},{"denominator":95,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":95,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T17:31:38.957862Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T03:36:30.079609Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09839","snapshot_observed_at":"2026-08-04T17:31:38.957862Z","title":"Octonav: Towards generalist embodied navigation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-10T03:00:31.416194Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:38.957862Z"},"links":{"cited_paper":"/paper/2506.09839","citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:faef094c4a49051eff9a35f266d2e6ac137c229b19242bd6b6feecdd21912abf","observation_id":"b78c5329-05cb-4dbb-a73c-462fdf91d666","resolution":{"observed_at":"2026-08-04T17:31:38.957862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"cited_work":{"arxiv_id":"2506.09839","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09839","snapshot_observed_at":"2026-07-02T03:36:30.079609Z","title":"arXiv preprint arXiv:2506.09839 , year=","venue":null,"work_id":"4eccfbd9-d98f-4e9d-9003-4d7f30160283","year":2025},"citing_paper":{"arxiv_id":"2512.17435","last_updated":"2026-04-30T09:47:33Z","snapshot_observed_at":"2026-08-02T23:32:24.828654Z","submitted_at":"2025-12-19T10:40:16Z","title":"ImagineNav++: Prompting Vision-Language Models as Embodied Navigator through Scene Imagination","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-16T21:07:54.497999Z"},"links":{"cited_paper":"/paper/2506.09839","citing_paper":"/paper/2512.17435"},"observation_digest":"sha256:8cdcdb7e7c9a5ab2330918ed4463239c3824aff1e02395d732528355e0abe1ef","observation_id":"abbbf4c9-de12-4bb5-8a91-c6c06574a5ef","resolution":{"observed_at":"2026-05-16T21:08:32.510657Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09839","snapshot_observed_at":"2026-08-02T17:15:42.367059Z","title":"arXiv preprint arXiv:2506.09839 (2025) 16 F","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.27577","last_updated":"2026-08-01T10:28:12Z","snapshot_observed_at":"2026-08-08T02:26:12.336195Z","submitted_at":"2026-03-29T08:34:05Z","title":"Structured Observation Language for Efficient and Generalizable Vision-Language Navigation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T17:15:42.367059Z"},"links":{"cited_paper":"/paper/2506.09839","citing_paper":"/paper/2603.27577"},"observation_digest":"sha256:1a9535d73e12253b05753ebd8399beb290ffc87f3f04a7b546282c19ac34a9f4","observation_id":"7b36b6ff-9599-4b13-b066-24545df8dea2","resolution":{"observed_at":"2026-08-02T17:15:42.367059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09839","snapshot_observed_at":"2026-08-04T05:43:08.438326Z","title":"arXiv preprint arXiv:2506.09839 (2025) 16 F","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.27577","last_updated":"2026-08-01T10:28:12Z","snapshot_observed_at":"2026-08-08T02:26:12.336195Z","submitted_at":"2026-03-29T08:34:05Z","title":"Structured Observation Language for Efficient and Generalizable Vision-Language Navigation","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T05:43:08.438326Z"},"links":{"cited_paper":"/paper/2506.09839","citing_paper":"/paper/2603.27577"},"observation_digest":"sha256:33ed80bf3e5a8465dbfcd8c44085d16a67728d6a34ffded42fdca0838791de4c","observation_id":"8f00e844-36b9-4cc1-93a4-c624e59229e9","resolution":{"observed_at":"2026-08-04T05:43:08.438326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"cited_work":{"arxiv_id":"2506.09839","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09839","snapshot_observed_at":"2026-07-02T03:36:30.079609Z","title":"arXiv preprint arXiv:2506.09839 , year=","venue":null,"work_id":"4eccfbd9-d98f-4e9d-9003-4d7f30160283","year":2025},"citing_paper":{"arxiv_id":"2604.08232","last_updated":"2026-04-09T13:22:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T13:22:24Z","title":"HiRO-Nav: Hybrid ReasOning Enables Efficient Embodied Navigation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T17:01:13.350219Z"},"links":{"cited_paper":"/paper/2506.09839","citing_paper":"/paper/2604.08232"},"observation_digest":"sha256:5c7b5733fddcea23d7ba69048811e63b85d739c059c2ef9d365194508549d5e7","observation_id":"85ef3596-fb15-40cf-9559-35a679db4d98","resolution":{"observed_at":"2026-05-11T07:41:01.482558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"cited_work":{"arxiv_id":"2506.09839","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09839","snapshot_observed_at":"2026-07-02T03:36:30.079609Z","title":"arXiv preprint arXiv:2506.09839 , year=","venue":null,"work_id":"4eccfbd9-d98f-4e9d-9003-4d7f30160283","year":2025},"citing_paper":{"arxiv_id":"2604.13654","last_updated":"2026-04-15T09:20:02Z","snapshot_observed_at":"2026-07-06T23:01:37.207817Z","submitted_at":"2026-04-15T09:20:02Z","title":"Vision-and-Language Navigation for UAVs: Progress, Challenges, and a Research Roadmap","version":1},"reference_index":209,"source":"pdf_text","source_observed_at":"2026-05-10T13:48:08.135538Z"},"links":{"cited_paper":"/paper/2506.09839","citing_paper":"/paper/2604.13654"},"observation_digest":"sha256:ea3c0323891a861d3c3478ab636793f16190d347d98bae5619022709da2f467b","observation_id":"ce970f87-4d35-4692-8b7b-98a975b16808","resolution":{"observed_at":"2026-05-10T14:10:29.866845Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"cited_work":{"arxiv_id":"2506.09839","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09839","snapshot_observed_at":"2026-07-02T03:36:30.079609Z","title":"arXiv preprint arXiv:2506.09839 , year=","venue":null,"work_id":"4eccfbd9-d98f-4e9d-9003-4d7f30160283","year":2025},"citing_paper":{"arxiv_id":"2604.16298","last_updated":"2026-04-17T17:59:48Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:59:48Z","title":"FineCog-Nav: Integrating Fine-grained Cognitive Modules for Zero-shot Multimodal UAV Navigation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T08:13:12.029402Z"},"links":{"cited_paper":"/paper/2506.09839","citing_paper":"/paper/2604.16298"},"observation_digest":"sha256:ef840f1baf210612dbcbaeeefcd624e6d1310c5b6851b1f40ff44878736e74cb","observation_id":"e3aed3f3-be5a-4d2f-ae5f-451cdf370a6a","resolution":{"observed_at":"2026-05-10T08:17:37.768229Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"cited_work":{"arxiv_id":"2506.09839","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09839","snapshot_observed_at":"2026-07-02T03:36:30.079609Z","title":"arXiv preprint arXiv:2506.09839 , year=","venue":null,"work_id":"4eccfbd9-d98f-4e9d-9003-4d7f30160283","year":2025},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-07T06:30:09.945371Z"},"links":{"cited_paper":"/paper/2506.09839","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:c1f39713c254b75c0588f1ed6f8927f374308886a9aa6119ab3c52f353f5b0a0","observation_id":"cbf8bf67-d560-4eea-9f6e-d376e490212b","resolution":{"observed_at":"2026-05-12T10:21:30.029568Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"cited_work":{"arxiv_id":"2506.09839","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09839","snapshot_observed_at":"2026-07-02T03:36:30.079609Z","title":"arXiv preprint arXiv:2506.09839 , year=","venue":null,"work_id":"4eccfbd9-d98f-4e9d-9003-4d7f30160283","year":2025},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T03:12:19.414358Z"},"links":{"cited_paper":"/paper/2506.09839","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:a9e587d72b4e9ded205e2f340f3e566f91c32622509db1f132044ba0d8f523f4","observation_id":"60fd9d95-352f-4e77-85de-f1078f84f46d","resolution":{"observed_at":"2026-05-11T22:11:17.030770Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"cited_work":{"arxiv_id":"2506.09839","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09839","snapshot_observed_at":"2026-07-02T03:36:30.079609Z","title":"arXiv preprint arXiv:2506.09839 , year=","venue":null,"work_id":"4eccfbd9-d98f-4e9d-9003-4d7f30160283","year":2025},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T16:58:41.558250Z"},"links":{"cited_paper":"/paper/2506.09839","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:a578c4724a331b6c21668a8c2327088ab13f944d85da834f46fadc6bb0006ab4","observation_id":"7b23f767-33ed-4d09-81ce-71f5b7dd3559","resolution":{"observed_at":"2026-05-19T17:02:40.752250Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"cited_work":{"arxiv_id":"2506.09839","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09839","snapshot_observed_at":"2026-07-02T03:36:30.079609Z","title":"arXiv preprint arXiv:2506.09839 , year=","venue":null,"work_id":"4eccfbd9-d98f-4e9d-9003-4d7f30160283","year":2025},"citing_paper":{"arxiv_id":"2605.09441","last_updated":"2026-05-10T09:34:05Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T09:34:05Z","title":"Beyond Isolation: A Unified Benchmark for General-Purpose Navigation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T04:33:53.557357Z"},"links":{"cited_paper":"/paper/2506.09839","citing_paper":"/paper/2605.09441"},"observation_digest":"sha256:c166dfd828d1758e49e702a51327277471a6416a293f69f7fa30e5b9ee72652f","observation_id":"5b95d2be-4bef-41c4-82a9-1785cf7befc2","resolution":{"observed_at":"2026-05-12T06:06:27.501124Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"cited_work":{"arxiv_id":"2506.09839","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09839","snapshot_observed_at":"2026-07-02T03:36:30.079609Z","title":"arXiv preprint arXiv:2506.09839 , year=","venue":null,"work_id":"4eccfbd9-d98f-4e9d-9003-4d7f30160283","year":2025},"citing_paper":{"arxiv_id":"2605.22816","last_updated":"2026-05-21T17:58:26Z","snapshot_observed_at":"2026-08-03T04:05:29.788502Z","submitted_at":"2026-05-21T17:58:26Z","title":"AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T04:46:03.020800Z"},"links":{"cited_paper":"/paper/2506.09839","citing_paper":"/paper/2605.22816"},"observation_digest":"sha256:ad76e865047e9e85e33afa76c4f724256b500c1d2d2738f6ee7bffa83b9cf0fe","observation_id":"7c76c7cd-a72b-4c66-a072-775f977ba613","resolution":{"observed_at":"2026-05-22T04:46:04.580136Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"cited_work":{"arxiv_id":"2506.09839","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09839","snapshot_observed_at":"2026-07-02T03:36:30.079609Z","title":"arXiv preprint arXiv:2506.09839 , year=","venue":null,"work_id":"4eccfbd9-d98f-4e9d-9003-4d7f30160283","year":2025},"citing_paper":{"arxiv_id":"2605.23257","last_updated":"2026-05-22T05:59:36Z","snapshot_observed_at":"2026-07-06T23:33:29.550551Z","submitted_at":"2026-05-22T05:59:36Z","title":"Turning Adaptation into Assets: Cross-Domain Bridging for Online Vision-Language Navigation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-25T04:32:07.773122Z"},"links":{"cited_paper":"/paper/2506.09839","citing_paper":"/paper/2605.23257"},"observation_digest":"sha256:1070478d1792e9d3b21faebf729cf3dd1d133dbd6fbee2a66a97a504d5be8333","observation_id":"7d730583-6f5f-4d26-a99e-ba5dcdc3f055","resolution":{"observed_at":"2026-05-25T04:35:21.483188Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"cited_work":{"arxiv_id":"2506.09839","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09839","snapshot_observed_at":"2026-07-02T03:36:30.079609Z","title":"arXiv preprint arXiv:2506.09839 , year=","venue":null,"work_id":"4eccfbd9-d98f-4e9d-9003-4d7f30160283","year":2025},"citing_paper":{"arxiv_id":"2606.03682","last_updated":"2026-06-02T14:05:47Z","snapshot_observed_at":"2026-07-06T23:43:55.632508Z","submitted_at":"2026-06-02T14:05:47Z","title":"GN0: Toward a Unified Paradigm for Generation, Evaluation, and Policy Learning in Visual-Language Navigation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T09:51:00.563422Z"},"links":{"cited_paper":"/paper/2506.09839","citing_paper":"/paper/2606.03682"},"observation_digest":"sha256:1bf733bfa787208c562c14c7f45ebf46a03e8ca6eccd9bb851c35c8a2dfa6731","observation_id":"c7e2a70e-7c6a-416a-9dc8-910d22c08f73","resolution":{"observed_at":"2026-07-02T03:36:30.081591Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"cited_work":{"arxiv_id":"2506.09839","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09839","snapshot_observed_at":"2026-07-02T03:36:30.079609Z","title":"arXiv preprint arXiv:2506.09839 , year=","venue":null,"work_id":"4eccfbd9-d98f-4e9d-9003-4d7f30160283","year":2025},"citing_paper":{"arxiv_id":"2606.27871","last_updated":"2026-06-26T09:11:59Z","snapshot_observed_at":"2026-08-02T18:28:08.474220Z","submitted_at":"2026-06-26T09:11:59Z","title":"LocalNav: Distilling Frontier VLMs and Embodied RL for On-Device Object Goal Navigation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T04:46:12.483085Z"},"links":{"cited_paper":"/paper/2506.09839","citing_paper":"/paper/2606.27871"},"observation_digest":"sha256:a3aea717834fc069fca506355098c1fac87bb43e4d9e369f40c7a58b78b1795a","observation_id":"c7c473fa-8758-4b20-a9c3-f8dc0de5bae7","resolution":{"observed_at":"2026-06-29T19:13:53.621229Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09839","snapshot_observed_at":"2026-08-02T05:13:54.926100Z","title":"Octonav: Towards generalist embodied navigation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13461","last_updated":"2026-07-15T05:46:34Z","snapshot_observed_at":"2026-08-09T21:25:42.186631Z","submitted_at":"2026-07-15T05:46:34Z","title":"Joint On-and-Off Policy Learning for Vision-and-Language Navigation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T05:13:54.926100Z"},"links":{"cited_paper":"/paper/2506.09839","citing_paper":"/paper/2607.13461"},"observation_digest":"sha256:d08a101bd6399bd5daac4c8d340d9fa825e2e1ee1990d4b7927c4b8b47b25fe7","observation_id":"9984a5ca-d3e5-4c95-add8-88044a31842e","resolution":{"observed_at":"2026-08-02T05:13:54.926100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.09839/citation-record","integrity":"/paper/2506.09839/integrity","json":"/paper/2506.09839/citation-record.json","paper":"/paper/2506.09839"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:38.001786Z","title":"Object goal navigation using goal-oriented semantic exploration.Advances in Neural Information Processing Systems, 33:4247–4258, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:38.001786Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:f3428c1eb299dc92d0d9a4d90b9336acf23112a3062ebfc68a70ad066a18bf3f","observation_id":"dfcc8547-9b1c-444a-bceb-ce6c82d8bc4d","resolution":{"observed_at":"2026-08-07T04:44:38.001786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:52.071719Z","title":"Room-object entity prompting and reasoning for embodied referring expression.IEEE Transactions on Pattern Analysis and Machine Intelligence, 46(2):994–1010, 2023","venue":null,"work_id":"3ce5da35-d2cd-443e-9040-12dcc2fdba22","year":2023},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:38.114986Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:4d4aa656b9360baf3b78db5ff6fd6cef853e321a73a0bc5a4098c975ee8d24a8","observation_id":"abc46179-c6a9-49c7-8124-b2c4efea227d","resolution":{"observed_at":"2026-08-07T04:44:52.138909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:51.861928Z","title":"Sim2Real Predictivity: Does Evaluation in Simulation Predict Real-World Performance? volume 5, pages 6670–6677, 2020","venue":null,"work_id":"a8e517f1-a796-468e-803b-4529d0943248","year":2020},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:38.218326Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:b1fce7c63018b07d62462a7030c0958f7b5c4e048bdc0391465b39195fc3c6f3","observation_id":"ee282af5-7772-40d0-a1c7-74d9bbc3a236","resolution":{"observed_at":"2026-08-07T04:44:51.968341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:51.688476Z","title":"The surprising effectiveness of visual odometry techniques for embodied pointgoal navigation","venue":null,"work_id":"ff6ccc3a-a412-4cc4-9296-0101e408e9fa","year":2021},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:38.315241Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:b885710d548324cc4a8bbcc6dec0c8e4c3f5f80c097d705a42864b5452c2fae1","observation_id":"c4e5e061-7e63-43a7-9015-1aebc4fcdebc","resolution":{"observed_at":"2026-08-07T04:44:51.774976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:51.520996Z","title":"Is mapping necessary for realistic pointgoal navigation? InProceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 17232–17241, 2022","venue":null,"work_id":"b0d42ce5-f413-4f33-8bd1-5fb618a539c8","year":2022},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:38.450445Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:609d98e9bfce837799d24b12b9c41ef59224c73cffd443310e17b3d458272c95","observation_id":"10988c8a-10c7-4119-952c-83623739840b","resolution":{"observed_at":"2026-08-07T04:44:51.570067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:51.368448Z","title":"Target-driven visual navigation in indoor scenes using deep reinforcement learning","venue":null,"work_id":"cb319a05-5529-41df-9944-4fd3b2134dee","year":2017},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:38.607650Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:855293f13696a560b66ec15ea748aa9976d3ed520fe4693e98acfe1d39769234","observation_id":"c8f74db9-be45-4f45-8317-0c3524554b54","resolution":{"observed_at":"2026-08-07T04:44:51.417701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:51.257480Z","title":"Fgprompt: Fine-grained goal prompting for image-goal navigation.Advances in Neural Information Processing Systems, 36:12054– 12073, 2023","venue":null,"work_id":"84a286e0-3934-4f0b-83dd-5ad21a8f3cec","year":2023},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:38.698501Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:0da51ecfceb343bc732e4100e76f143843d120340122e64b2d875bd4aa7a6b79","observation_id":"904f2dad-de50-433e-b11d-d15183b94d8d","resolution":{"observed_at":"2026-08-07T04:44:51.291843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:51.128844Z","title":"Habitat challenge 2023.https://aihabitat.org/challenge/2023/, 2023","venue":null,"work_id":"b74ea45b-ea4b-4d00-9bcd-3cd831301690","year":2023},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:38.808736Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:fcf038bf90e8d195bb13d74481b0e64835d45b89b2df1cd86b852d2622f26048","observation_id":"10e4eba7-ffa1-446b-abda-744517d66e6f","resolution":{"observed_at":"2026-08-07T04:44:51.191497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:50.989419Z","title":"Navigating to objects specified by images","venue":null,"work_id":"60b298c9-d35d-43e3-9246-089520c8d023","year":2023},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:38.980297Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:7855d56ce1a9d24e624d9bd5c92d80b00631d65ad2609a433a616c9d588c262d","observation_id":"4c986713-196b-4f1f-8887-10a845153613","resolution":{"observed_at":"2026-08-07T04:44:51.069845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15876","last_updated":"2022-11-29T02:29:35Z","snapshot_observed_at":"2026-08-10T01:10:27.685762Z","submitted_at":"2022-11-29T02:29:35Z","title":"Instance-Specific Image Goal Navigation: Training Embodied Agents to Find Object Instances","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15876","snapshot_observed_at":"2026-08-07T04:44:39.102973Z","title":"Instance-specific image goal navigation: Training embodied agents to find object instances.arXiv preprint arXiv:2211.15876, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:39.102973Z"},"links":{"cited_paper":"/paper/2211.15876","citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:b6e7c0804d0692e3e715eba33f45c4d7a0a6992cbaca35e583bc65e7632e6ce9","observation_id":"0a3d69a3-8e12-4710-bff5-373a6db58e03","resolution":{"observed_at":"2026-08-07T04:44:39.102973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:50.862583Z","title":"Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments","venue":null,"work_id":"71d4c710-e992-4721-9e1d-f878d57010d1","year":2018},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:39.206438Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:b9d189e32e2d2781852d3b02932e38370cb975c8ed60ad1db57df69ee738f6b7","observation_id":"8c3cc993-b150-44ea-849a-254570c032c6","resolution":{"observed_at":"2026-08-07T04:44:50.937452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:50.729722Z","title":"Beyond the nav-graph: Vision-and-language navigation in continuous environments","venue":null,"work_id":"ef09abdc-b6f0-43c2-ac5a-fc7583c681d1","year":2020},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:39.342316Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:a97a0f6ae675b4d61ff5af680901612c12f681e1a340b9f89f541a566336fd24","observation_id":"e381eed6-b5ac-45f3-8f87-a525e328f902","resolution":{"observed_at":"2026-08-07T04:44:50.798169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:39.468529Z","title":"Reverie: Remote embodied visual referring expression in real indoor environments","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:39.468529Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:ced81aeebb0da80aeb17791e1d274b19f5cf22ab4defde500822366ffd3a8f33","observation_id":"d1703ae9-6730-4e1b-ac76-b7b2ddb0fb24","resolution":{"observed_at":"2026-08-07T04:44:39.468529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:39.583011Z","title":"Goat-bench: A benchmark for multi-modal lifelong navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:39.583011Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:ce9b2dd88ae2932d47b7d2bc8b12b2cf13ce885c34cb4a2610f217f1c03123a2","observation_id":"3e501ac3-46e4-4ea0-8e83-e18daeacb218","resolution":{"observed_at":"2026-08-07T04:44:39.583011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09082","last_updated":"2025-03-19T13:31:16Z","snapshot_observed_at":"2026-08-09T15:51:45.270964Z","submitted_at":"2024-12-12T09:08:13Z","title":"Towards Long-Horizon Vision-Language Navigation: Platform, Benchmark and Method","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09082","snapshot_observed_at":"2026-08-07T04:44:39.705415Z","title":"Towards long-horizon vision-language navigation: Platform, benchmark and method.arXiv preprint arXiv:2412.09082, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:39.705415Z"},"links":{"cited_paper":"/paper/2412.09082","citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:605d97588dc99fe29133effcad7a4e2ce8b0b3b32ed6a31e9fb5118e69f74764","observation_id":"231e0b52-abe2-4b1d-becc-a730dfc38153","resolution":{"observed_at":"2026-08-07T04:44:39.705415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T04:44:39.836651Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:39.836651Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:f8ff9a30bb3feb1423b88964c76aaec01e1382b29c81c922e32b7e0dc9ce538b","observation_id":"63f734c8-ea7a-4221-9ca0-a30c342d104c","resolution":{"observed_at":"2026-08-07T04:44:39.836651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:50.594669Z","title":"Instructnav: Zero-shot system for generic instruction navigation in unexplored environment","venue":null,"work_id":"681b777c-2d94-4941-a6c5-cae8ee47a61a","year":2024},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:39.986105Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:a6ae112df667b070e870dab688da5d5198fa360b498800a7998892c0b44d5d59","observation_id":"e555d561-0249-4d75-8b5e-5a963629708d","resolution":{"observed_at":"2026-08-07T04:44:50.642117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:50.481737Z","title":"Navcot: Boosting llm-based vision-and-language navigation via learning disentangled reasoning.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2025","venue":null,"work_id":"0d705d1f-5752-4efb-8a9f-b76a560a2511","year":2025},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:40.105312Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:dfae576bf0f070bd12bc9da60ddb53f686a9bd694b4c9a3068ed34a670cff948","observation_id":"a4d9c494-ab41-4da0-a749-91fdeea82cb1","resolution":{"observed_at":"2026-08-07T04:44:50.538098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:50.358203Z","title":"Enhancing large language models with rag for visual language navigation in continuous environments.Electronics, 14(5):909, 2025","venue":null,"work_id":"7475bf31-c7e9-4932-9a2f-ac3466c66584","year":2025},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:40.232247Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:41f642d0ec3d74750329e0e35d649a49758234df91f90406c600ca6217d46191","observation_id":"118df22d-a2da-4213-990a-d0c139aef3a1","resolution":{"observed_at":"2026-08-07T04:44:50.396992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:50.127618Z","title":"Llm-guided zero-shot visual object navigation with building semantic map","venue":null,"work_id":"cff36f39-c925-4f1e-9a89-9bed8f50b343","year":2025},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:40.355748Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:a6cebfbb803f251f9e6719ee9cae14a88c569cfb75f660cff48899a60a9746b2","observation_id":"48225032-2997-4ae9-ba97-b2681b2663ea","resolution":{"observed_at":"2026-08-07T04:44:50.268898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13966","last_updated":"2025-03-18T06:58:41Z","snapshot_observed_at":"2026-08-07T16:55:44.552219Z","submitted_at":"2025-03-18T06:58:41Z","title":"FlexVLN: Flexible Adaptation for Diverse Vision-and-Language Navigation Tasks","version":1},"cited_work":{"arxiv_id":"2503.13966","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13966","snapshot_observed_at":"2026-08-07T04:44:46.803804Z","title":"FlexVLN: Flexible Adaptation for Diverse Vision-and-Language Navigation Tasks","venue":"cs.CV","work_id":"b48b8c7a-92fd-4dbd-b63c-12c02e82e302","year":2025},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:40.484018Z"},"links":{"cited_paper":"/paper/2503.13966","citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:f2d2190e90f98259e61c2c765949e0a37f5a5dd139e97ab35713b92e5e26e567","observation_id":"ec2aae64-967a-449c-a11b-0caa70955600","resolution":{"observed_at":"2026-08-07T04:44:46.921863Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10630","last_updated":"2025-03-18T10:07:07Z","snapshot_observed_at":"2026-08-07T17:06:08.242112Z","submitted_at":"2025-03-13T17:59:48Z","title":"UniGoal: Towards Universal Zero-shot Goal-oriented Navigation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10630","snapshot_observed_at":"2026-08-07T04:44:40.613719Z","title":"Unigoal: Towards universal zero-shot goal-oriented navigation.arXiv preprint arXiv:2503.10630, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:40.613719Z"},"links":{"cited_paper":"/paper/2503.10630","citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:d7e2d26eee74337529b510d924c5b58d590d9e20213e4e0dd6941ac2efc152df","observation_id":"4b9c23a2-81ce-4067-ac47-8fffd76ce292","resolution":{"observed_at":"2026-08-07T04:44:40.613719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-07T04:44:40.740461Z","title":"Navila: Legged robot vision-language-action model for navigation.arXiv preprint arXiv:2412.04453, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:40.740461Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:9d738c0f3a99ed30c61e2f497be529fed6022cac3d1e318149d9cfbcf3d0da67","observation_id":"d427094e-e49b-4e57-8b62-ef3e1532db70","resolution":{"observed_at":"2026-08-07T04:44:40.740461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:49.913866Z","title":"Xia, Mehdi S","venue":null,"work_id":"24e0e0c8-1106-4f49-a73b-7ee9d434ffad","year":2023},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:40.886459Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:0e38f374021e90e000b31821286ac0354bb62240fee552504898ba3cc7b71c0f","observation_id":"6ccf7a06-21d5-41c2-b019-07043340e110","resolution":{"observed_at":"2026-08-07T04:44:50.004561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:41.021927Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:41.021927Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:ed2cb12a75b1fc68a06d3039c0c270dcf1ff807d9ae6a085a6b6d2e4c2daa1d5","observation_id":"09157422-dbab-472c-8856-33f91104ae7f","resolution":{"observed_at":"2026-08-07T04:44:41.021927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:49.735164Z","title":"Vision-language foundation models as effective robot imitators","venue":null,"work_id":"6a2ce202-6a91-43ec-acbb-0d9b42a6cdb4","year":2024},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:41.121431Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:47832b8ed772ff8bc235e9cc26feaa53778419d096c01784f523b81844376461","observation_id":"0589f4b4-f1bd-4bd0-8682-481fce62c660","resolution":{"observed_at":"2026-08-07T04:44:49.822900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:49.669891Z","title":"Navid: Video-based vlm plans the next step for vision-and-language navigation","venue":null,"work_id":"4ebe8357-9000-4e55-a30b-991e550082a2","year":2024},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:41.222878Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:fb0c6f1880b7353a38c3968f3aef8b26738f0ce0fadc743d6e5199f17bcdf909","observation_id":"3bb90421-2e03-4515-af61-25879edb7c3b","resolution":{"observed_at":"2026-08-07T04:44:49.692693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:49.597812Z","title":"Navgpt: Explicit reasoning in vision-and-language navigation with large language models","venue":null,"work_id":"64b984d2-82c1-4947-a89d-9acd541b2278","year":2024},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:41.347891Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:1e55961f23488cfaf3062ae51d9d74c483fb51333dd91e647e949cba4c12a8d3","observation_id":"77f1926a-b7ed-410c-8834-b3fee7d5a685","resolution":{"observed_at":"2026-08-07T04:44:49.633343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:41.445119Z","title":"Navgpt-2: Unleashing navigational reasoning capability for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:41.445119Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:1845e61390eaec09ff1acb7a47c8d12c4ef666f83485b998b01e10c84fdc1044","observation_id":"35e0e014-63fb-452c-8410-42d72793cfb6","resolution":{"observed_at":"2026-08-07T04:44:41.445119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:49.506256Z","title":null,"venue":null,"work_id":"5bbd6734-9171-4455-afba-ac9615c93f71","year":2024},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:41.576999Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:cc202200efd7f245f18e338e8fa38718801b4f11a3bff0152d22fe8dad616005","observation_id":"010dee1b-ebc9-4f99-b348-17eaf63ba853","resolution":{"observed_at":"2026-08-07T04:44:49.585834Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16425","last_updated":"2025-03-26T07:26:43Z","snapshot_observed_at":"2026-08-09T03:18:00.745171Z","submitted_at":"2024-11-25T14:27:55Z","title":"TopV-Nav: Unlocking the Top-View Spatial Reasoning Potential of MLLM for Zero-shot Object Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16425","snapshot_observed_at":"2026-08-07T04:44:41.658676Z","title":"Topv-nav: Unlocking the top-view spatial reasoning potential of mllm for zero-shot object navigation.arXiv preprint arXiv:2411.16425, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:41.658676Z"},"links":{"cited_paper":"/paper/2411.16425","citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:9dcbe6eba1797aecfa3cac6dab9a7d71c14c30e1b9e1d5f02c77f0b45e8d3ab0","observation_id":"5f779dcb-4e6b-4723-a6ab-c70a501efdfc","resolution":{"observed_at":"2026-08-07T04:44:41.658676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:49.405849Z","title":"Uni-navid: A video-based vision-language-action model for unifying embodied navigation tasks","venue":null,"work_id":"9b950429-c8e3-4950-bdc8-3ed54ae16ca7","year":2025},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:41.777149Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:71f226bc081f248e4e1005147992aeb6be1ea52b236f1b55f03e718a379c0eeb","observation_id":"9defc257-1f09-494e-91af-f3e1bcfb2aca","resolution":{"observed_at":"2026-08-07T04:44:49.453122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:41.910119Z","title":"Towards learning a generalist model for embodied navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:41.910119Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:ce10db259f22389b80c72359c75638de176cc278f4753ea6098360905ffb3f46","observation_id":"f0e8234c-35f5-435c-a82e-3ec5e2e09784","resolution":{"observed_at":"2026-08-07T04:44:41.910119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:49.271722Z","title":"Towards versatile embodied navigation","venue":null,"work_id":"5db96489-196b-4faa-bbce-f907e70482e5","year":2022},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:42.051547Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:76d34e3f1b1fd9a2fcfada95bbc0fc0a1c09eb3ebb443b40512e101be5a55c92","observation_id":"3b9fa229-2214-4d2b-bff1-c0a564765857","resolution":{"observed_at":"2026-08-07T04:44:49.326572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:49.182576Z","title":"Re- act: Synergizing reasoning and acting in language models","venue":null,"work_id":"1ed072b3-c4fd-4592-8565-3b4451ccb215","year":2023},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:42.172411Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:697ade2d91b85c7733c3533d38f674a16260c9f90045ce8da5af2e07953f436e","observation_id":"4107ab99-4ceb-457d-9cc2-6523ea8a0a95","resolution":{"observed_at":"2026-08-07T04:44:49.221414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:49.088583Z","title":"Topologies of reasoning: Demysti- fying chains, trees, and graphs of thoughts.CoRR, 2024","venue":null,"work_id":"610adc8c-245f-4852-b48a-29b06279a1ea","year":2024},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:42.305829Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:373934d5dbd21217650aed6d6498557b0f63bd054b3b60e2a029630b05ff6ee8","observation_id":"a18b6c7c-af51-4a50-b25f-c722cad059ce","resolution":{"observed_at":"2026-08-07T04:44:49.135984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:42.434648Z","title":"Tree of thoughts: Deliberate problem solving with large language models.Advances in neural information processing systems, 36:11809–11822, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:42.434648Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:6c7a55d7ef0e3a1b379ded72714ff1b2c2dd01e5de2603b2b181d8c69567fe29","observation_id":"aacf8274-efb9-4e32-8f66-e1aba758e74c","resolution":{"observed_at":"2026-08-07T04:44:42.434648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08291","last_updated":"2023-05-15T01:18:23Z","snapshot_observed_at":"2026-07-06T15:27:02.376191Z","submitted_at":"2023-05-15T01:18:23Z","title":"Large Language Model Guided Tree-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.08291","snapshot_observed_at":"2026-08-07T04:44:42.552699Z","title":"Large language model guided tree-of-thought.arXiv preprint arXiv:2305.08291, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:42.552699Z"},"links":{"cited_paper":"/paper/2305.08291","citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:64b89b3cc618e43e1f631eefe92ef6292ee1188d099fed202186d7b26f698503","observation_id":"d2ca2f78-659c-48c1-896a-510a2b8ac2ef","resolution":{"observed_at":"2026-08-07T04:44:42.552699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:49.013384Z","title":"Graph of thoughts: Solving elaborate problems with large language models","venue":null,"work_id":"288709f3-09e8-4151-9f95-e5a201557764","year":2024},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:42.636353Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:3d56e9a264177ae83549f16f744033359d21a544b89abf491cdb29860ed64258","observation_id":"510e51a2-c632-45b4-af0b-e53c7c99f141","resolution":{"observed_at":"2026-08-07T04:44:49.044625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:42.720512Z","title":"Chain-of-thought prompting elicits reasoning in large language models.Advances in neural information processing systems, 35:24824–24837, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:42.720512Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:191a51d034174c5a0109356c558d97e487f4eef23dfe348ee9327924e7511bdc","observation_id":"a084c417-423a-4086-8192-dc4aad0a0071","resolution":{"observed_at":"2026-08-07T04:44:42.720512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:42.878983Z","title":"Chain of thought empowers transformers to solve inherently serial problems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:42.878983Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:311d22495b73391a155323a0575d247b994b22dfc65c136d827e2ce6d0a5058b","observation_id":"5401b158-37ce-4add-9bcb-ab477f786538","resolution":{"observed_at":"2026-08-07T04:44:42.878983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09239","last_updated":"2024-09-20T21:12:25Z","snapshot_observed_at":"2026-08-10T11:51:30.801796Z","submitted_at":"2024-09-14T00:30:57Z","title":"Autoregressive + Chain of Thought = Recurrent: Recurrence's Role in Language Models' Computability and a Revisit of Recurrent Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09239","snapshot_observed_at":"2026-08-07T04:44:42.980490Z","title":"Autoregressive+ chain of thought= recurrent: Recurrence’s role in language models’ computability and a revisit of recurrent transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:42.980490Z"},"links":{"cited_paper":"/paper/2409.09239","citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:4a932d041e792ce51430e2cc4ce706e04f96aa7a730c795174a7287fd7acd4c1","observation_id":"2839888c-d812-40b1-b67d-8a7e4056038c","resolution":{"observed_at":"2026-08-07T04:44:42.980490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:43.119614Z","title":"Towards revealing the mystery behind chain of thought: a theoretical perspective.Advances in Neural Information Processing Systems, 36:70757–70798, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:43.119614Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:f1b33b9b6f649448d93fd499b7b9925664604716232d2f8f642663185dee6476","observation_id":"b4274ee8-c12e-49fc-8a6d-23b156b11ab2","resolution":{"observed_at":"2026-08-07T04:44:43.119614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T04:44:43.214872Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:43.214872Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:b96ea7ea8566a7cb5de5a45fd31a75b60f45986625511ca7fed38d20d35b1586","observation_id":"916b5ff9-9c8c-4d80-ad30-fc96a682ff20","resolution":{"observed_at":"2026-08-07T04:44:43.214872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:43.332417Z","title":"Cppo: Accelerating the training of group relative policy optimization-based reasoning models.arXiv preprint arXiv:2503.22342, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:43.332417Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:8bc73336cf6fd74f5b2938ac72d7d00e4368cf17640216bf289c905768fd347b","observation_id":"2eed3b2d-0950-434a-9779-567bf38b0d35","resolution":{"observed_at":"2026-08-07T04:44:43.332417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:48.911840Z","title":"Group robust preference optimization in reward-free rlhf.Advances in Neural Information Processing Systems, 37:37100–37137, 2024","venue":null,"work_id":"277c9abc-b25c-4d39-b3e2-58019449fc29","year":2024},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:43.452067Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:98521a1e5afb2d3281c5d75132b7de0b062eaf4c94255a2350e40da7debfe365","observation_id":"bfa9146f-1fdc-4a88-8ca6-6fa911eb6318","resolution":{"observed_at":"2026-08-07T04:44:48.945237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:43.564621Z","title":"Adaptive group policy optimization: Towards stable training and token-efficient reasoning.arXiv preprint arXiv:2503.15952, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:43.564621Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:16d01a819c45f96e518f1f3f27d79e8d15f7d36c0486dce67b816cf1c8764715","observation_id":"de1d0a35-6d81-45c3-ae11-674f1e9d4294","resolution":{"observed_at":"2026-08-07T04:44:43.564621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-07T04:44:43.661803Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models.arXiv preprint arXiv:2503.06749, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:43.661803Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:3af54c12f11fcd3c38c09df823752a9159e1e19791bfea66aeafb4079cb97eff","observation_id":"0236c5d9-d656-4853-99f1-7a704d1ad765","resolution":{"observed_at":"2026-08-07T04:44:43.661803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-07T04:44:43.771772Z","title":"Video-r1: Reinforcing video reasoning in mllms.arXiv preprint arXiv:2503.21776, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:43.771772Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:8391ea730c9586cffd882edba98b9a9c559fd50119ac59f86d6218a131f871a7","observation_id":"9f479f36-69f0-4105-b23f-50ccdc96a0cc","resolution":{"observed_at":"2026-08-07T04:44:43.771772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09641","last_updated":"2025-04-13T16:32:49Z","snapshot_observed_at":"2026-08-08T07:14:04.916356Z","submitted_at":"2025-04-13T16:32:49Z","title":"TinyLLaVA-Video-R1: Towards Smaller LMMs for Video Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09641","snapshot_observed_at":"2026-08-07T04:44:43.895513Z","title":"Tinyllava-video-r1: Towards smaller lmms for video reasoning.arXiv preprint arXiv:2504.09641, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:43.895513Z"},"links":{"cited_paper":"/paper/2504.09641","citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:0b6ec4305a1b464a4b35045c6b378391d25c90d43a025e150c1d6ed7dd7128f3","observation_id":"505ef48c-82e0-40ed-9fc6-f2d6663dd08c","resolution":{"observed_at":"2026-08-07T04:44:43.895513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:48.806386Z","title":"Matterport3d: Learning from rgb-d data in indoor environments","venue":null,"work_id":"1bc68d42-da50-40b6-9e1e-38f8f6741a2b","year":2017},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:44.010783Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:ea2265b2a6c583750c6981334ebf27cab7148fdeea9207b0b007618139e5a7a3","observation_id":"ba07a8b3-af34-4919-aab7-8986b2cf69df","resolution":{"observed_at":"2026-08-07T04:44:48.856490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:48.716833Z","title":"Habitat- matterport 3d dataset (hm3d): 1000 large-scale 3d environments for embodied ai","venue":null,"work_id":"3874e20e-0321-472a-b386-b92a6c5db3b9","year":2021},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:44.135765Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:73abbdeffb3c687356b180fee4949c6d012ae18cc8ae04ef1690f7a771f248fd","observation_id":"fb51d932-7003-40b9-808b-cb2b7a72a652","resolution":{"observed_at":"2026-08-07T04:44:48.758675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:44.228121Z","title":"Gibson env: Real-world perception for embodied agents","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:44.228121Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:5c4d46f53d20d27c0f68ee178aff75f2c06ec933cae52b31cc15e106bc50f169","observation_id":"48f193b6-66be-4437-b707-834f4b427894","resolution":{"observed_at":"2026-08-07T04:44:44.228121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:44.359174Z","title":"Procthor: Large-scale embodied ai using procedural generation.Advances in Neural Information Processing Systems, 35:5982–5994, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:44.359174Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:bc86d497b49aa353d79a5fa39bf03520d356f9c4c19a93fff4245b6495d69de8","observation_id":"80200cab-3464-48e7-aabe-fef22764034a","resolution":{"observed_at":"2026-08-07T04:44:44.359174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:48.637076Z","title":"Soon: Scenario oriented object navigation with graph-based exploration","venue":null,"work_id":"63b846f2-1207-43d8-934f-72fc52f58212","year":2021},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:44.496339Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:46708f8396bae529434c0ee9c17f406a68aa2ef9341435c5bd0e8fe242c97019","observation_id":"b9122cc4-bce9-467f-8e06-d1eded9f9c91","resolution":{"observed_at":"2026-08-07T04:44:48.664244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:44.574766Z","title":"Hm3d-ovon: A dataset and benchmark for open-vocabulary object goal navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:44.574766Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:9a4fb8509f54bc6489dbfef3fa8ed52706e7c6ed08a600f9d9c94ef3f6148e34","observation_id":"411e7695-1008-4dc0-898b-7ce778764ccf","resolution":{"observed_at":"2026-08-07T04:44:44.574766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:48.508666Z","title":"Iterative vision-and-language navigation","venue":null,"work_id":"eb4d74a3-0a76-41cb-9cac-f79142c0acd0","year":2023},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:44.660509Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:59c773db3596b7ea6408364918a5a9ea857c9f55846200342f0a128bb59860ba","observation_id":"b8474ecb-be34-481e-91b4-48340c7633d9","resolution":{"observed_at":"2026-08-07T04:44:48.564317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:44.765768Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:44.765768Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:dcbf0001c5a26e170c2da067cc264b64e31c5ce8e21a73fe53a8fbd84359957a","observation_id":"6114a86f-d7a3-409c-a462-e480d95b08c1","resolution":{"observed_at":"2026-08-07T04:44:44.765768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T04:44:44.877481Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:44.877481Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:8d4008a480521caf735ecf3a6cee63566599ac81c5e5ff51da91613b1bf4c6c7","observation_id":"e21cb600-7fd3-4f2c-8731-8f3a9510c5bc","resolution":{"observed_at":"2026-08-07T04:44:44.877481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:44.961846Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:44.961846Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:4039afaa8c5e3af7d1b59d62af504d3f848a7093e61fd27972919b7814bac43b","observation_id":"cca02f76-1333-4b66-adfc-36240b6ee653","resolution":{"observed_at":"2026-08-07T04:44:44.961846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:48.350722Z","title":"Llava-next: A strong zero-shot video understanding model","venue":null,"work_id":"4e03ec72-9dda-41b1-9a6b-2e65bcbebef0","year":2024},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:45.045405Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:076df46ae694c12fed1351f3b8e2136dc86a9286a32d3a4bf452474b9ae96ab5","observation_id":"69870892-4fa6-4fbe-86f4-22cf8f97d419","resolution":{"observed_at":"2026-08-07T04:44:48.432253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:45.127608Z","title":"Habitat: A Platform for Embodied AI Research","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:45.127608Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:43771b4b13f2474ec5a97ba729f1faefd7d5633ece03077e93679e2ac87cb50f","observation_id":"c15a36d4-8a0a-410c-8d86-d7a61888512e","resolution":{"observed_at":"2026-08-07T04:44:45.127608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:48.140683Z","title":"Room-and-object aware knowledge reasoning for remote embodied referring expression","venue":null,"work_id":"7c214750-86d0-43af-87b5-50f7b9c84048","year":2021},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:45.244760Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:7aa1c317f73eeb8ff75b0759aa80b2778234f3adc0c82a53dc269854d1985fd3","observation_id":"a18115d0-6cd4-42f5-ab55-63a2b5eaec07","resolution":{"observed_at":"2026-08-07T04:44:48.249997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:48.008147Z","title":"Bird’s-eye-view scene graph for vision-language navigation","venue":null,"work_id":"72ccdff8-e04e-4e5f-b302-6b79a913d6ad","year":2023},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:45.309400Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:219d1b1159d4f306fc5bb05cf750fa92a6fa5fbea4bf048679b19dd5c12b87c1","observation_id":"80a0a34e-6f7b-4da7-bd9e-dc9525f427a8","resolution":{"observed_at":"2026-08-07T04:44:48.082873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:47.906614Z","title":"Vision-language navigation with energy-based policy","venue":null,"work_id":"3ece7b80-15db-49b5-b3da-5fba3adb770c","year":2024},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:45.392713Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:6ea2d733887c9d1e116528ddfc8c6931b22a16f0c2ac9da52fcdfa6b83f42378","observation_id":"69eb2331-100a-4e05-acd2-b13d86435140","resolution":{"observed_at":"2026-08-07T04:44:47.953836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:47.739021Z","title":"V olumetric environment representation for vision-language navigation","venue":null,"work_id":"be6c777f-3039-42a9-8d05-d72548b05531","year":2024},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:45.468375Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:3595dce5e059d2704699f465f81f93d33457271d2bc1a09feb24d92aeed30845","observation_id":"c8386470-340b-464a-9cfe-ea95a0b13b7f","resolution":{"observed_at":"2026-08-07T04:44:47.817060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:47.595993Z","title":"Adaptive zone-aware hierarchical planner for vision-language navigation","venue":null,"work_id":"8d243980-b567-46da-b892-62892423d4ae","year":2023},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:45.534516Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:ad2339bdc60f46214266c1a6df0b8b8ce83d8b3b278567aa34479cf022c4edc1","observation_id":"01ee42f0-1ad5-45b3-9678-916a8a68a8bf","resolution":{"observed_at":"2026-08-07T04:44:47.666919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:47.409465Z","title":"Reinforced structured state-evolution for vision-language navigation","venue":null,"work_id":"345c0f40-87f6-4683-9c82-54b799537069","year":2022},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:45.609745Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:2df9ad090e005172510c0fc414f4e715cf7ddd2fe8568a5940c3087387466f89","observation_id":"acc30b8a-f6cc-42c1-998d-1304dca580fa","resolution":{"observed_at":"2026-08-07T04:44:47.505030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:47.234661Z","title":"Target-driven structured transformer planner for vision-language navigation","venue":null,"work_id":"c3516bc6-6b4d-42c7-9665-8fc08829c310","year":2022},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:45.685109Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:dd6c04c8e39af2d0b51ad19a9a5f1e9a9ae3c1238a861d34f041601b03a01c51","observation_id":"f1a78b8c-9b50-4196-bb4f-5f96429fc668","resolution":{"observed_at":"2026-08-07T04:44:47.322773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:47.080026Z","title":"Controllable navigation instruction generation with chain of thought prompting","venue":null,"work_id":"d1637c31-be8d-44e5-9f1c-9eb29acb2ab8","year":2024},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:45.739882Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:59da0779e749adfb96a02564a8a2e17ed8ed609f2ec2ed43279ff64961b76f0d","observation_id":"ae3646fb-afb0-4317-b9ca-6a6a52ee51ce","resolution":{"observed_at":"2026-08-07T04:44:47.142225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:45.793856Z","title":"Habitat 2.0: Training home assistants to rearrange their habitat","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:45.793856Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:335d3bf1a6392d8261cddf38f42be913b894645d7d84d04ba70d3d555b408251","observation_id":"b10d5461-6c4d-4032-a561-7be8213232df","resolution":{"observed_at":"2026-08-07T04:44:45.793856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13724","last_updated":"2023-10-19T17:29:17Z","snapshot_observed_at":"2026-08-02T17:55:38.209254Z","submitted_at":"2023-10-19T17:29:17Z","title":"Habitat 3.0: A Co-Habitat for Humans, Avatars and Robots","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13724","snapshot_observed_at":"2026-08-07T04:44:45.869100Z","title":"Habitat 3.0: A co-habitat for humans, avatars and robots.arXiv preprint arXiv:2310.13724, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:45.869100Z"},"links":{"cited_paper":"/paper/2310.13724","citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:3257f784c5bfa1c769bab1c0d695a626a5a1242caef453995ecd8065f02b2a42","observation_id":"0cf647a6-c2e7-4e83-b0f8-6e19fa98ac58","resolution":{"observed_at":"2026-08-07T04:44:45.869100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.06757","last_updated":"2018-07-18T03:28:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-07-18T03:28:02Z","title":"On Evaluation of Embodied Navigation Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.06757","snapshot_observed_at":"2026-08-07T04:44:45.975200Z","title":"On evaluation of embodied navigation agents.arXiv preprint arXiv:1807.06757, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:45.975200Z"},"links":{"cited_paper":"/paper/1807.06757","citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:9189996b718e3be7b7a32ace1f37044c56606ce73c3f98a907bbfc0850cd4682","observation_id":"88d092a1-444d-450b-a58c-67c2f7e2e326","resolution":{"observed_at":"2026-08-07T04:44:45.975200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.13171","last_updated":"2020-08-30T04:28:13Z","snapshot_observed_at":"2026-08-07T23:59:07.185215Z","submitted_at":"2020-06-23T17:18:54Z","title":"ObjectNav Revisited: On Evaluation of Embodied Agents Navigating to Objects","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.13171","snapshot_observed_at":"2026-08-07T04:44:46.059132Z","title":"Objectnav revisited: On evaluation of embodied agents navigating to objects.arXiv preprint arXiv:2006.13171, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:46.059132Z"},"links":{"cited_paper":"/paper/2006.13171","citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:fe87488c0625d78ba403cf60a931cdca18691da3b2f00368f700fa46631dc79c","observation_id":"1de73966-964b-4048-83d3-f602f392bdee","resolution":{"observed_at":"2026-08-07T04:44:46.059132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-07T04:44:46.157156Z","title":"Eva-clip: Improved training techniques for clip at scale.arXiv preprint arXiv:2303.15389, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:46.157156Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:e487306f6d516e381a8b744f31abdf1d4afc881fbb00e700ec1bcef802772db0","observation_id":"d6d14950-01b4-4c7c-9c93-9604ac7119ea","resolution":{"observed_at":"2026-08-07T04:44:46.157156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:46.264127Z","title":"Bert: Pre-training of deep bidi- rectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:46.264127Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:b78dd18b3c34ac5665c1194e49cc3ad2ae6f5f13029e47bc3a962e31ebdbfc9f","observation_id":"9343da8f-d0be-4914-8d5c-bd3e31ba24fc","resolution":{"observed_at":"2026-08-07T04:44:46.264127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:46.315765Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:46.315765Z"},"links":{"citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:a9c0283104a66049a4045fc2734535fd321f77626b0129305b30453210725ba4","observation_id":"7e6b2002-755c-4d90-8669-42def3f4f053","resolution":{"observed_at":"2026-08-07T04:44:46.315765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T04:44:46.398092Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:46.398092Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:a2cc36e0e531f70450bf1e71e91226c83d972ec0b3346aa32a4733dc11f32ef4","observation_id":"3020da5f-68f7-401a-b5f8-48b26552448c","resolution":{"observed_at":"2026-08-07T04:44:46.398092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-07T04:44:46.477173Z","title":"You arrive at [room name], where you observe [iconic objects]","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:46.477173Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:cfd4f7d5fc7ac7c5b9d653d59cc6a47e57ec80c3788d05c1f3cd13e94c543646","observation_id":"b92153dd-3e4e-426e-85bf-ac278814ceca","resolution":{"observed_at":"2026-08-07T04:44:46.477173Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation"},"reference_resolution":{"displayed":79,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":1,"verified_fuzzy":37},"total_outbound_references":79},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 79 of 79 outbound references and 16 inbound Pith citation observations for arXiv:2506.09839."}