{"as_of":"2026-08-14T18:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e656ef4e649d372ff06f252285b7f6a8d00d73a70b41c2985016796267e2af38","coverage":[{"denominator":122,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T21:30:18.197698Z","state":"measured"},{"denominator":179,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":179,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":79,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:34:35.040088Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T09:09:43.511252Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:a7d1805f613f586774c43e943a2f9d160c2e51d1dad6ff4deaffcd5ea2449cd2","observation_id":"fac3d417-f91f-4a1e-a41c-8d39f05ae5cc","resolution":{"observed_at":"2026-05-23T07:42:43.167538Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-11T20:17:47.689534Z","title":"Navila: Legged robot vision-language-action model for navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05893","last_updated":"2024-12-08T11:16:47Z","snapshot_observed_at":"2026-08-11T20:11:39.163516Z","submitted_at":"2024-12-08T11:16:47Z","title":"doScenes: An Autonomous Driving Dataset with Natural Language Instruction for Human Interaction and Vision-Language Navigation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T20:17:47.689534Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2412.05893"},"observation_digest":"sha256:728cbcc61dc27e5b23acb709a13b48a07c162db95dfc101eb13397e68901262f","observation_id":"87032ec4-0de6-42c4-8414-021e309234ab","resolution":{"observed_at":"2026-08-11T20:17:47.689534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:2f69fa2f5bd5ca6b11e3208d95de4f99e9ab8edcb26e5d7737d4d8b942b42f40","observation_id":"836504b2-6e5d-48a7-9dc3-fa941533a835","resolution":{"observed_at":"2026-05-11T08:52:31.934448Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:dac1b1c14ba1508fdb175a747da73e5881e68d0ee5db0b955650ee17fbb3606a","observation_id":"64d3b1c8-7ccc-47a6-9849-95ad8e8a46b4","resolution":{"observed_at":"2026-05-22T18:05:00.989303Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-07T14:22:21.019683Z","title":"Cheng, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19214","last_updated":"2025-08-28T13:09:08Z","snapshot_observed_at":"2026-08-09T00:13:16.184554Z","submitted_at":"2025-05-25T16:21:19Z","title":"Omni-Perception: Omnidirectional Collision Avoidance for Legged Locomotion in Dynamic Environments","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:21.019683Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2505.19214"},"observation_digest":"sha256:db1f667e168a1613b55270668ad05f5f5adc34fbf061cb501c2426c969cf69d2","observation_id":"6e5caf3e-bffc-4b63-a42d-14a7215d9f47","resolution":{"observed_at":"2026-08-07T14:22:21.019683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-07T13:52:05.254189Z","title":"Navila: Legged robot vision-language-action model for navigation.arXiv preprint arXiv:2412.04453, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-14T06:19:38.840063Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:05.254189Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:b5a166484483403e127610080ce251f0af55b3f8b64ca8fb303b96abd7648e56","observation_id":"c73ab88c-39f1-44a1-b111-8abc20fdbeba","resolution":{"observed_at":"2026-08-07T13:52:05.254189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-07T13:40:16.513264Z","title":"Navila: Legged robot vision-language-action model for navigation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21594","last_updated":"2025-05-27T14:55:16Z","snapshot_observed_at":"2026-08-13T18:09:56.452076Z","submitted_at":"2025-05-27T14:55:16Z","title":"Fast and Cost-effective Speculative Edge-Cloud Decoding with Early Exits","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:16.513264Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2505.21594"},"observation_digest":"sha256:32f46a741da6c179891f6465ae6801cef7783ac7b8cf78c8387df2e78c4b599c","observation_id":"59f4dc6f-7814-4d5a-8ac6-845a407fbd16","resolution":{"observed_at":"2026-08-07T13:40:16.513264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-07T12:58:39.930337Z","title":"Cheng, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-14T03:03:10.970725Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:39.930337Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:2f6edc128fd8ce0a70e1ea9cacdfded8e084e46f9f9be2c1c293e348ef56f18b","observation_id":"2eef2a0e-9ef3-4ab0-ba8c-0c7f41be2c87","resolution":{"observed_at":"2026-08-07T12:58:39.930337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-07T12:16:09.666040Z","title":"Navila: Legged robot vision-language-action model for navigation.arXiv preprint arXiv:2412.04453, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-12T21:43:57.954411Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:09.666040Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:8ee7601d6b674b58a46b38a5aae1879f6d2c7a2a354c4fd17a2b4d6811822e40","observation_id":"38816cc3-5d58-4c66-9782-0b54dcd0d5d0","resolution":{"observed_at":"2026-08-07T12:16:09.666040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-07T12:11:51.175126Z","title":"Navila: Legged robot vision-language-action model for navigation.arXiv preprint arXiv:2412.04453, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-13T11:03:42.515937Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:51.175126Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:2530888fa2ebb78f006823e78971d26626f87afafdc02c05614dc0856366de52","observation_id":"396dad35-108d-4f25-beea-2953d1be9b1d","resolution":{"observed_at":"2026-08-07T12:11:51.175126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2506.07339","last_updated":"2025-12-05T07:35:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T01:01:59Z","title":"Real-Time Execution of Action Chunking Flow Policies","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T14:18:51.613045Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2506.07339"},"observation_digest":"sha256:99cfa66cc0a2572ad28edfc18407459ba867c2db25a05c4acc3668760faa48d8","observation_id":"c65785dc-dc54-48cc-8a95-cbdfc092f495","resolution":{"observed_at":"2026-05-15T14:18:51.663506Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-07T04:44:40.740461Z","title":"Navila: Legged robot vision-language-action model for navigation.arXiv preprint arXiv:2412.04453, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-14T15:35:28.196164Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:40.740461Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:6e6ef456b4e22aa6b7a6e48975e84a8299d344e9d91b5e84d1480198741a963b","observation_id":"d427094e-e49b-4e57-8b62-ef3e1532db70","resolution":{"observed_at":"2026-08-07T04:44:40.740461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-07T00:23:00.630568Z","title":"Navila: Legged robot vision-language-action model for navigation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-09T03:57:16.083004Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:00.630568Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:8ee1173a25ce67a879bd6ca6e74cd7cd3d5c753df4104318586e2667e6f1c9d8","observation_id":"ed17b4aa-87dc-430f-a22e-7824d1b5cc3f","resolution":{"observed_at":"2026-08-07T00:23:00.630568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-06T21:59:52.812767Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-13T17:01:28.843404Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:52.812767Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:4489cbdc242d52306bb9f037fc3d487e074b613f7dd27848561c7bc55dce97ad","observation_id":"c7e8f828-9987-4e2f-887e-4330e5f0a59c","resolution":{"observed_at":"2026-08-06T21:59:52.812767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2507.01925","last_updated":"2025-07-02T17:34:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-02T17:34:52Z","title":"A Survey on Vision-Language-Action Models: An Action Tokenization Perspective","version":1},"reference_index":153,"source":"pdf_text","source_observed_at":"2026-05-17T14:08:34.893876Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2507.01925"},"observation_digest":"sha256:fcd648dc08e988c863d0072afc69afbf048e5b9952a24582ae2a039a5ed1245d","observation_id":"80347b0f-17f0-42af-ba60-2eea9961e4d0","resolution":{"observed_at":"2026-05-17T14:08:35.152944Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-06T19:01:24.035518Z","title":"Navila: Legged robot vision-language- action model for navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06747","last_updated":"2025-07-09T11:02:46Z","snapshot_observed_at":"2026-08-09T11:30:50.030286Z","submitted_at":"2025-07-09T11:02:46Z","title":"LOVON: Legged Open-Vocabulary Object Navigator","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:01:24.035518Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2507.06747"},"observation_digest":"sha256:4d45a313b6bbae885e07dd4a8167fa506c3020ea937fb8cdd05454039d5860ce","observation_id":"ce5d2b74-c720-4015-ae13-4a7af8fd3cc0","resolution":{"observed_at":"2026-08-06T19:01:24.035518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-06T18:30:47.046180Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08224","last_updated":"2025-07-20T05:22:14Z","snapshot_observed_at":"2026-08-06T18:21:12.044757Z","submitted_at":"2025-07-11T00:17:08Z","title":"Making VLMs More Robot-Friendly: Self-Critical Distillation of Low-Level Procedural Reasoning","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T18:30:47.046180Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2507.08224"},"observation_digest":"sha256:cb07dd480e977b500bc4407345a8351aec5c71688c7c72ff6e5ebd58dabe15ee","observation_id":"74ba35c4-3fda-4de6-8faf-1e5eeae78498","resolution":{"observed_at":"2026-08-06T18:30:47.046180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-06T17:33:08.649485Z","title":"Navila: Legged robot vision-language-action model for navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-14T02:29:07.333333Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.649485Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:e385bf75f5489143300a896d0ad678eeed29bba587d87a249a40325db614a3fa","observation_id":"1a6cdeb1-03f9-4203-8b30-d80f04486d72","resolution":{"observed_at":"2026-08-06T17:33:08.649485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-05T22:50:43.715480Z","title":"Cheng, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06426","last_updated":"2025-08-08T16:14:01Z","snapshot_observed_at":"2026-08-13T16:51:25.695974Z","submitted_at":"2025-08-08T16:14:01Z","title":"Shortcut Learning in Generalist Robot Policies: The Role of Dataset Diversity and Fragmentation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T22:50:43.715480Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2508.06426"},"observation_digest":"sha256:49815f47b624709814ce659538b24224e88fab7b4a6d7133c344c136ef01a184","observation_id":"0ee95326-0488-4216-a12b-b8dff9a04446","resolution":{"observed_at":"2026-08-05T22:50:43.715480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-05T22:46:42.049089Z","title":"Cheng, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06429","last_updated":"2025-08-08T16:16:43Z","snapshot_observed_at":"2026-08-09T06:56:02.033235Z","submitted_at":"2025-08-08T16:16:43Z","title":"SPARSE Data, Rich Results: Few-Shot Semi-Supervised Learning via Class-Conditioned Image Translation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T22:46:42.049089Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2508.06429"},"observation_digest":"sha256:c4bee70f5656ecb129f93729f4424f2f089e501c2a258e0a6d70b6c80864bd3c","observation_id":"a42816a0-a620-41d5-9747-aa27b76a829a","resolution":{"observed_at":"2026-08-05T22:46:42.049089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-05T20:31:07.196850Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10416","last_updated":"2025-08-14T07:39:26Z","snapshot_observed_at":"2026-08-13T05:59:34.484548Z","submitted_at":"2025-08-14T07:39:26Z","title":"CorrectNav: Self-Correction Flywheel Empowers Vision-Language-Action Navigation Model","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:07.196850Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2508.10416"},"observation_digest":"sha256:97d36cf380aab9aeaab0e34ab0a8a90a87239eecd32389b61d133c25803af8d0","observation_id":"ded1f365-b984-4087-a96d-a245e3a528f9","resolution":{"observed_at":"2026-08-05T20:31:07.196850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-05T19:54:56.869301Z","title":"Navila: Legged robot vision-language-action model for navigation.arXiv preprint arXiv:2412.04453, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11476","last_updated":"2025-08-15T13:44:56Z","snapshot_observed_at":"2026-08-13T15:11:28.203495Z","submitted_at":"2025-08-15T13:44:56Z","title":"SPG: Style-Prompting Guidance for Style-Specific Content Creation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:56.869301Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2508.11476"},"observation_digest":"sha256:e3048af664ddcd201451b7568880dc118a586def922540f83ee6c91069bcb15a","observation_id":"f291dc62-9fa7-4f61-b385-8632ae5e69f7","resolution":{"observed_at":"2026-08-05T19:54:56.869301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-05T19:06:28.436191Z","title":"NaVILA: Legged Robot Vision-Language- Action Model for Navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13446","last_updated":"2026-06-08T21:52:42Z","snapshot_observed_at":"2026-08-07T21:58:57.623091Z","submitted_at":"2025-08-19T02:01:06Z","title":"CAST: Counterfactual Labels Improve Instruction Following in Vision-Language-Action Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:28.436191Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2508.13446"},"observation_digest":"sha256:2ae3e50c95213ccb7ebb63bdc39a2af7bf50362b0245986c16602cde4cb1d8ff","observation_id":"c7b4a824-620b-40e8-989f-60541a878e8f","resolution":{"observed_at":"2026-08-05T19:06:28.436191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-05T13:54:49.258914Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00210","last_updated":"2025-08-29T19:47:25Z","snapshot_observed_at":"2026-08-14T02:37:22.845945Z","submitted_at":"2025-08-29T19:47:25Z","title":"Beyond Pixels: Introducing Geometric-Semantic World Priors for Video-based Embodied Models via Spatio-temporal Alignment","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T13:54:49.258914Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2509.00210"},"observation_digest":"sha256:9b6270f20aa74459c515a3e62d24dd57a0fd51f81bda90ddc94801d9868379f8","observation_id":"dc10f7e0-86da-404d-8597-82dfcfea904a","resolution":{"observed_at":"2026-08-05T13:54:49.258914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-05T12:59:02.133626Z","title":"Navila: Legged robot vision-language-action model for navigation.arXiv preprint arXiv:2412.04453, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:02.133626Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:0b5a36498baf2afb6310a7268aa15bc07916579f0c0d8032852f164cbe0fce45","observation_id":"347d0f17-a116-4e37-9d7f-8a777b4109dd","resolution":{"observed_at":"2026-08-05T12:59:02.133626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-04T17:31:38.800522Z","title":"Navila: Legged robot vision-language- action model for navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-10T03:00:31.416194Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:38.800522Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:5d7bf3955d4093c2204e5aedd1969ba06da3be1b271c155ffe5818d6e6b2966d","observation_id":"6eb69b24-e8c1-4332-bb3e-2b5f293abe54","resolution":{"observed_at":"2026-08-04T17:31:38.800522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2510.08547","last_updated":"2026-04-29T08:33:26Z","snapshot_observed_at":"2026-08-14T13:36:46.207293Z","submitted_at":"2025-10-09T17:55:44Z","title":"R2RGEN: Real-to-Real 3D Data Generation for Spatially Generalized Manipulation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T08:46:51.278024Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2510.08547"},"observation_digest":"sha256:3f4b5ba89886c68b4c9382c4189e942913a0f63ba8d7ec10dcdacf43ce9ffd7e","observation_id":"64ed98ce-ebd6-4121-af1d-d60f1761d8ef","resolution":{"observed_at":"2026-05-18T08:51:09.111792Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2511.17097","last_updated":"2026-04-14T15:21:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-21T09:52:07Z","title":"Progress-Think: Semantic Progress Reasoning for Vision-Language Navigation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-17T21:02:38.013115Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2511.17097"},"observation_digest":"sha256:d444cbfda87d2aeeeed3a1751ac5922b6fb45b41873488d076b1ae905cb74b8c","observation_id":"3fe1c212-e7fd-4c3c-8912-a7930b086f03","resolution":{"observed_at":"2026-05-17T21:05:15.979141Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2512.21714","last_updated":"2026-04-08T16:31:40Z","snapshot_observed_at":"2026-08-03T01:54:32.856831Z","submitted_at":"2025-12-25T15:31:24Z","title":"AstraNav-World: World Model for Foresight Control and Consistency","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T19:23:58.769472Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2512.21714"},"observation_digest":"sha256:f770529a0c4789990135112d14a12934d00963d1d10471c34f15ba224970e8d9","observation_id":"22394142-5144-4124-9272-e14f4f880d3f","resolution":{"observed_at":"2026-05-16T19:28:20.825261Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2603.07080","last_updated":"2026-04-29T05:35:06Z","snapshot_observed_at":"2026-08-11T11:49:33.350179Z","submitted_at":"2026-03-07T07:30:35Z","title":"VLN-Cache: Enabling Token Caching for VLN Models with Visual/Semantic Dynamics Awareness","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:58.269817Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2603.07080"},"observation_digest":"sha256:8f50d69c322079f3df7d9d7469d8428ee9a14e4bc5361c4d083eaa1b8a2cedae","observation_id":"9a86e709-e12f-4f98-b08b-8ebdb98f2a4a","resolution":{"observed_at":"2026-05-15T14:51:08.250364Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-02T17:15:42.360530Z","title":"arXiv preprint arXiv:2412.04453 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.27577","last_updated":"2026-08-01T10:28:12Z","snapshot_observed_at":"2026-08-13T18:59:08.475922Z","submitted_at":"2026-03-29T08:34:05Z","title":"Structured Observation Language for Efficient and Generalizable Vision-Language Navigation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T17:15:42.360530Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2603.27577"},"observation_digest":"sha256:ecdb3076a1af043209575c8a9852eb2e11b3d1ade21d4dd0371e95cfe671f456","observation_id":"5db8e094-517c-4759-b35a-d9a0eb429c3d","resolution":{"observed_at":"2026-08-02T17:15:42.360530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-04T05:43:08.245773Z","title":"arXiv preprint arXiv:2412.04453 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.27577","last_updated":"2026-08-01T10:28:12Z","snapshot_observed_at":"2026-08-13T18:59:08.475922Z","submitted_at":"2026-03-29T08:34:05Z","title":"Structured Observation Language for Efficient and Generalizable Vision-Language Navigation","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T05:43:08.245773Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2603.27577"},"observation_digest":"sha256:5e9da7c3cb87ea35cced50ca993ce6de42ae1ae3a8896b3839362ed9db3a2b2f","observation_id":"b22d2ba4-de02-411a-9a1c-08d2a5beb5fc","resolution":{"observed_at":"2026-08-04T05:43:08.245773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2604.02911","last_updated":"2026-04-03T09:27:36Z","snapshot_observed_at":"2026-08-14T07:58:08.175684Z","submitted_at":"2026-04-03T09:27:36Z","title":"Learning Task-Invariant Properties via Dreamer: Enabling Efficient Policy Transfer for Quadruped Robots","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T19:49:23.086498Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2604.02911"},"observation_digest":"sha256:f1cf07d8c4e05fa9dea2ac979b58f52e2729ab235278c102674129c01ced6eed","observation_id":"68842129-da80-4f90-be5e-25b2877a6721","resolution":{"observed_at":"2026-05-13T19:53:11.811580Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2604.08232","last_updated":"2026-04-09T13:22:24Z","snapshot_observed_at":"2026-08-11T03:15:12.857872Z","submitted_at":"2026-04-09T13:22:24Z","title":"HiRO-Nav: Hybrid ReasOning Enables Efficient Embodied Navigation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T17:01:13.350219Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2604.08232"},"observation_digest":"sha256:caa956c086450f6fca2d2acfc2a6ddad70a671cbe73a5e82639b02a867a335c9","observation_id":"36db350c-d7f4-4364-9154-3106a2bf5bec","resolution":{"observed_at":"2026-05-11T07:41:01.469951Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2604.08509","last_updated":"2026-04-09T17:50:09Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:50:09Z","title":"Visually-grounded Humanoid Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T18:10:32.710853Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2604.08509"},"observation_digest":"sha256:9951a874de5a7f600a8bad94bbe949dd1a785f69318cd9a6cc677eea9e27fa4b","observation_id":"a483cbf6-61b7-4079-acc5-4094ee500782","resolution":{"observed_at":"2026-05-11T05:21:04.468428Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2604.13654","last_updated":"2026-04-15T09:20:02Z","snapshot_observed_at":"2026-07-06T23:01:37.207817Z","submitted_at":"2026-04-15T09:20:02Z","title":"Vision-and-Language Navigation for UAVs: Progress, Challenges, and a Research Roadmap","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-10T13:48:08.135538Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2604.13654"},"observation_digest":"sha256:9a78757d0f5b338600169ed04a8db183335660b6996b9c4a1c87eefbdbbf11fc","observation_id":"f7431370-e85e-42e1-8961-779024c897df","resolution":{"observed_at":"2026-05-10T14:10:29.674502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2604.14344","last_updated":"2026-06-01T03:33:09Z","snapshot_observed_at":"2026-08-02T20:11:36.077756Z","submitted_at":"2026-04-15T18:52:50Z","title":"CART: Context-Aware Terrain Adaptation using Temporal Sequence Selection for Legged Robots","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T12:51:40.003948Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2604.14344"},"observation_digest":"sha256:1b67c505968fb30bf8b0bc15f92a05c877e38105b54c5ee624dbf4f796a5ce25","observation_id":"7b9d5fbe-234e-48c0-9b58-099b5820b2bb","resolution":{"observed_at":"2026-05-10T12:55:25.378958Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-12T20:22:05.957224Z","title":"arXiv preprint arXiv:2412.04453 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.14344","last_updated":"2026-06-01T03:33:09Z","snapshot_observed_at":"2026-08-02T20:11:36.077756Z","submitted_at":"2026-04-15T18:52:50Z","title":"CART: Context-Aware Terrain Adaptation using Temporal Sequence Selection for Legged Robots","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T20:22:05.957224Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2604.14344"},"observation_digest":"sha256:4ec7a59041e5ecf040db693d80f488243f494d8d8b65a826d837585ae876cafe","observation_id":"6266283e-8f1e-4979-9cb4-72232016f271","resolution":{"observed_at":"2026-07-12T20:22:05.957224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2604.17407","last_updated":"2026-04-19T12:30:22Z","snapshot_observed_at":"2026-08-02T21:38:53.966924Z","submitted_at":"2026-04-19T12:30:22Z","title":"Think before Go: Hierarchical Reasoning for Image-goal Navigation","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-05-10T05:43:27.972164Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2604.17407"},"observation_digest":"sha256:d78fa896edbb58b73383b1b226ac7b3bad8a3a7c56ea14e27e9122ee1e3ad4d2","observation_id":"84d45e28-7c51-45f1-8658-aac6ce8e678d","resolution":{"observed_at":"2026-05-10T05:51:10.522123Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2604.17473","last_updated":"2026-06-23T08:05:53Z","snapshot_observed_at":"2026-08-11T07:26:07.831204Z","submitted_at":"2026-04-19T15:03:38Z","title":"Dual-Anchoring: Addressing State Drift in Vision-Language Navigation","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-10T06:50:34.310831Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2604.17473"},"observation_digest":"sha256:e69b4889f3730473b5858d2459b0aaf2ebc7696eda705a038aa2a0c59d9cf161","observation_id":"fe194dbe-af9d-46ea-968b-9dbfa45f548c","resolution":{"observed_at":"2026-05-10T06:51:45.831019Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2604.27620","last_updated":"2026-04-30T09:09:40Z","snapshot_observed_at":"2026-08-11T04:56:25.116086Z","submitted_at":"2026-04-30T09:09:40Z","title":"SpaAct: Spatially-Activated Transition Learning with Curriculum Adaptation for Vision-Language Navigation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-07T05:05:33.606975Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2604.27620"},"observation_digest":"sha256:048403525db6ba042eb10bdef25aa3d1350b0a3bede10f3e48810c58a881c24f","observation_id":"163b26c4-4daa-4f7b-950c-d0651a2e70c7","resolution":{"observed_at":"2026-05-12T10:36:31.261652Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2605.09441","last_updated":"2026-05-10T09:34:05Z","snapshot_observed_at":"2026-08-11T07:41:04.520067Z","submitted_at":"2026-05-10T09:34:05Z","title":"Beyond Isolation: A Unified Benchmark for General-Purpose Navigation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T04:33:53.557357Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2605.09441"},"observation_digest":"sha256:00e23e45779bb49f7569f45823529b857b7cb5e1ea056c204be3d7519883904b","observation_id":"388dea21-e8b9-4e71-8a59-2c428a5b97e3","resolution":{"observed_at":"2026-05-12T06:06:27.549019Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2605.15517","last_updated":"2026-05-15T01:27:50Z","snapshot_observed_at":"2026-08-14T08:00:12.621745Z","submitted_at":"2026-05-15T01:27:50Z","title":"Terrain Consistent Reference-Guided RL for Humanoid Navigation Autonomy","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-19T15:22:38.188537Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2605.15517"},"observation_digest":"sha256:ea0d9da6adf6d6dc999fbafd5f3d3967e5b0580bf2d19d9a5bf325f2ef9aa558","observation_id":"b01388b8-e8c8-4d07-b0bd-accfe5ee30ea","resolution":{"observed_at":"2026-05-19T15:23:07.747403Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2605.17249","last_updated":"2026-06-04T15:16:16Z","snapshot_observed_at":"2026-08-09T11:30:43.764135Z","submitted_at":"2026-05-17T04:12:56Z","title":"SEDualVLN: A Spatially-Enhanced Dual-System for Vision-Language Navigation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T13:31:16.012419Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2605.17249"},"observation_digest":"sha256:29dc5ea4c92daa612bf34faecebe22d30215a7cf5c8c720709db081d9c3047c4","observation_id":"55735769-cfc8-49e1-91ae-76d4454c88e3","resolution":{"observed_at":"2026-05-20T13:33:19.148446Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2605.17249","last_updated":"2026-06-04T15:16:16Z","snapshot_observed_at":"2026-08-09T11:30:43.764135Z","submitted_at":"2026-05-17T04:12:56Z","title":"SEDualVLN: A Spatially-Enhanced Dual-System for Vision-Language Navigation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T19:42:41.238072Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2605.17249"},"observation_digest":"sha256:b2861973aee1e0425c2903b9981353b42ca023d6fb91c63bc938efe97dc3af51","observation_id":"84154134-46ff-4693-a428-37c25129d403","resolution":{"observed_at":"2026-06-30T19:45:00.664705Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2605.22036","last_updated":"2026-05-21T06:20:17Z","snapshot_observed_at":"2026-08-03T01:34:12.134807Z","submitted_at":"2026-05-21T06:20:17Z","title":"GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T06:45:35.920991Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2605.22036"},"observation_digest":"sha256:660fa7b738ee38001fd64094591a073cb2455de9fa363422ba64d27ed6a78224","observation_id":"20405ac0-091c-4448-8806-d39c7ef3aef3","resolution":{"observed_at":"2026-05-22T06:46:10.584337Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2605.22816","last_updated":"2026-05-21T17:58:26Z","snapshot_observed_at":"2026-08-14T02:11:16.364955Z","submitted_at":"2026-05-21T17:58:26Z","title":"AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T04:46:03.020800Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2605.22816"},"observation_digest":"sha256:44a73776b054370f863b975542d4afaade7850a449ad470f84f6dafb471f8a58","observation_id":"2120b067-32a6-4a06-8585-b872eaeb6435","resolution":{"observed_at":"2026-05-22T04:46:04.562531Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2605.25646","last_updated":"2026-05-25T09:52:58Z","snapshot_observed_at":"2026-08-11T12:48:40.145126Z","submitted_at":"2026-05-25T09:52:58Z","title":"G-DRAGON: Geospatial Reasoning and Dynamic Planning for Retrieval-Augmented Outdoor Navigation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T21:49:54.950611Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2605.25646"},"observation_digest":"sha256:83a6e36b257ba43c6da26956dba6b1cd712c266aa87972e1b98f3d75e3feab8a","observation_id":"deadbe25-e701-4ce6-8412-8e2732944916","resolution":{"observed_at":"2026-06-29T21:53:59.368576Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2605.27582","last_updated":"2026-05-26T18:52:04Z","snapshot_observed_at":"2026-08-09T15:39:57.953081Z","submitted_at":"2026-05-26T18:52:04Z","title":"Uni-LaViRA: Language-Vision-Robot Actions Translation for Unified Embodied Navigation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T17:01:20.073666Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2605.27582"},"observation_digest":"sha256:df4c574da1f249722a1ab1249e34b4da9553a2a2033eb165f793691fc8367c7a","observation_id":"0ad83405-314b-48d1-861d-db91b4970d60","resolution":{"observed_at":"2026-06-29T17:03:40.848584Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2605.28237","last_updated":"2026-05-27T09:50:16Z","snapshot_observed_at":"2026-08-06T23:55:29.770936Z","submitted_at":"2026-05-27T09:50:16Z","title":"POINav: Benchmarking and Enhancing Final-Meters Arrival in Real-World Vision-Language Navigation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T11:48:14.888295Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2605.28237"},"observation_digest":"sha256:56137d4b86a3e765ad152b8898bd7a22599d1ff6f55441067fe46cd49c9c6a08","observation_id":"7d8c41c4-e31e-4da3-bf8b-14aaa25f3361","resolution":{"observed_at":"2026-06-29T11:53:23.916822Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2606.00104","last_updated":"2026-05-26T10:03:22Z","snapshot_observed_at":"2026-08-14T04:39:06.042667Z","submitted_at":"2026-05-26T10:03:22Z","title":"PEACE: A Planner-Executor Agent with Constraint Enforcement for UAVs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T16:53:17.504094Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2606.00104"},"observation_digest":"sha256:5326fcb2d96bd67e659ca9346d4692f827e75505c6e3c2210bd8f24fdd56e260","observation_id":"1e1a8380-b7ab-4042-b09e-9aeb5418ec3e","resolution":{"observed_at":"2026-06-29T16:53:40.418154Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2606.01565","last_updated":"2026-06-01T02:11:01Z","snapshot_observed_at":"2026-08-14T11:52:35.157970Z","submitted_at":"2026-06-01T02:11:01Z","title":"Hierarchical Semantic-Augmented Navigation: Optimal Transport and Graph-Driven Reasoning for Vision-Language Navigation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T14:49:30.585724Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2606.01565"},"observation_digest":"sha256:9c618e3b9a1e14f965970ec66198b310700a5d3292fe48c5dc1883f4125980d5","observation_id":"2bd71fac-4c4b-4551-9a56-6e6f7fdb41bb","resolution":{"observed_at":"2026-07-01T22:56:20.934190Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:dc6ee90983f17fbfee289df08f4007bf73ea162caedfce7cc8437008ad6b2351","observation_id":"b79fac24-9072-4f62-8a59-08199f454518","resolution":{"observed_at":"2026-07-01T22:16:15.795177Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2606.03175","last_updated":"2026-06-03T03:34:51Z","snapshot_observed_at":"2026-08-06T03:40:21.903218Z","submitted_at":"2026-06-02T05:31:03Z","title":"Ask When It Pays: Cost-Aware Open-Ended Interaction for Instance Goal Navigation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T11:01:08.668612Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2606.03175"},"observation_digest":"sha256:1ba09ef9ccf555182fdbca0ac22bb4092ec315031191dff4530890c5e16d4521","observation_id":"c09ffcf2-259f-4859-bf6e-bc2d6c216df2","resolution":{"observed_at":"2026-07-02T02:26:26.123860Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2606.07244","last_updated":"2026-06-05T13:11:39Z","snapshot_observed_at":"2026-08-14T02:17:00.031248Z","submitted_at":"2026-06-05T13:11:39Z","title":"Beyond Waypoints: A Trajectory-Centric Waypointing Paradigm for Vision-Language Navigation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T21:40:58.329546Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2606.07244"},"observation_digest":"sha256:1eb8c3ee9e74dd0bd66a2b3ed41780fec286259382d2e2fc7aadb5e5d6aec9f3","observation_id":"d7115002-5b6a-4bdb-83f5-cbf262b684e5","resolution":{"observed_at":"2026-07-02T19:07:17.750835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2606.10495","last_updated":"2026-06-09T07:18:01Z","snapshot_observed_at":"2026-08-13T05:21:01.334976Z","submitted_at":"2026-06-09T07:18:01Z","title":"Act on What You See: Unlocking Safe Social Navigation in Vision-Language-Action Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T12:52:38.764427Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2606.10495"},"observation_digest":"sha256:243344da0235afcd568efbebc910af1263e1658e7fe2d4eb10e74899458c4448","observation_id":"17ad59cb-7c8d-4d41-9b1f-2347ee9a9ca5","resolution":{"observed_at":"2026-07-03T06:07:41.671095Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2606.12603","last_updated":"2026-06-10T19:01:31Z","snapshot_observed_at":"2026-08-07T13:05:45.178504Z","submitted_at":"2026-06-10T19:01:31Z","title":"From Imitation to Alignment: Human-Preference Flow Policies for Long-Horizon Sidewalk Navigation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T09:29:43.030058Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2606.12603"},"observation_digest":"sha256:ceda0dceb0eaec4ba399d7d7a89b5b6c2adfdf1c58d72d7d868550fdd77cff2f","observation_id":"8eabb674-170a-4a53-8da8-8543c03f3941","resolution":{"observed_at":"2026-07-03T11:38:04.652491Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2606.18426","last_updated":"2026-07-29T15:48:23Z","snapshot_observed_at":"2026-08-12T17:54:50.907822Z","submitted_at":"2026-06-16T19:21:14Z","title":"VEGA: Learning Navigation VLAs from In-the-Wild Egocentric Video with Geometric Trajectory Supervision","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T00:15:26.619238Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2606.18426"},"observation_digest":"sha256:b9c931fa01a6c27b92197789fcbcd4cdc4f113cedecf0a464ee6386eb48c7858","observation_id":"899df63f-9ade-4e5b-85f9-6121d359961f","resolution":{"observed_at":"2026-07-03T21:38:59.469725Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-02T11:03:51.561853Z","title":"Cheng, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.18426","last_updated":"2026-07-29T15:48:23Z","snapshot_observed_at":"2026-08-12T17:54:50.907822Z","submitted_at":"2026-06-16T19:21:14Z","title":"VEGA: Learning Navigation VLAs from In-the-Wild Egocentric Video with Geometric Trajectory Supervision","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T11:03:51.561853Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2606.18426"},"observation_digest":"sha256:eb449ec613dd5a37f670f30565647791ddba2a8f3241530b98a816ae307a93c0","observation_id":"cbada972-9842-43c1-b840-9bb5f6f2b4bc","resolution":{"observed_at":"2026-08-02T11:03:51.561853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2606.20458","last_updated":"2026-06-18T16:40:07Z","snapshot_observed_at":"2026-08-07T03:20:01.050993Z","submitted_at":"2026-06-18T16:40:07Z","title":"Slow Brain, Fast Planner: Latency-Resilient VLM-Augmented Urban Navigation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T17:16:52.173943Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2606.20458"},"observation_digest":"sha256:30878c1d519d309cf9b5f354cd8fe35306f154a27fdfeacd69a7168369180bf7","observation_id":"8ccd85cd-0fa4-4d8d-9ba3-6250c061aa6c","resolution":{"observed_at":"2026-07-04T04:09:33.984552Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2606.20905","last_updated":"2026-06-18T20:01:32Z","snapshot_observed_at":"2026-08-03T03:13:19.923134Z","submitted_at":"2026-06-18T20:01:32Z","title":"Vesta: A Generalist Embodied Reasoning Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T16:55:12.518255Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2606.20905"},"observation_digest":"sha256:48628f414f5b21546fcb73075b31ba557bbece68158406fd09591b26963f3381","observation_id":"091a2de6-e56a-4a62-a619-e2b06ba794e9","resolution":{"observed_at":"2026-07-04T04:29:35.757784Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2606.21398","last_updated":"2026-06-19T13:06:02Z","snapshot_observed_at":"2026-08-04T00:30:09.459045Z","submitted_at":"2026-06-19T13:06:02Z","title":"BIT-Nav: Brain-Inspired Trajectory Memory for Embodied Navigation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T13:52:31.453516Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2606.21398"},"observation_digest":"sha256:8650932b03f9bddb43ec0de45f3502586ffe4e6dd32b7ea92952e39e79881b44","observation_id":"38150bff-1b9d-4291-993b-8050aec8de85","resolution":{"observed_at":"2026-07-04T07:09:37.370731Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2606.22424","last_updated":"2026-06-23T03:11:10Z","snapshot_observed_at":"2026-08-06T19:03:46.948100Z","submitted_at":"2026-06-21T10:24:16Z","title":"FlowDec: Temporal Conditional Flow Decorruptor for Robust Continuous Vision-Language Navigation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T10:24:56.607921Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2606.22424"},"observation_digest":"sha256:727c347e0c674ab0e92fd67af0402bf4c5df09b4588d8270cb39de19eadc7b59","observation_id":"6f8c30ea-56fe-49c7-8600-cc3687652cac","resolution":{"observed_at":"2026-07-04T09:09:43.512947Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2606.27807","last_updated":"2026-06-26T07:45:45Z","snapshot_observed_at":"2026-07-07T00:01:59.695342Z","submitted_at":"2026-06-26T07:45:45Z","title":"SpikeVLA: Vision-Language-Action Models with Spiking Neural Networks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T04:42:23.040915Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2606.27807"},"observation_digest":"sha256:8ef65eb00b482c24421324ae87cf19850c8abcc7a98ef523d558562d59648752","observation_id":"c560a56e-eacc-4fe8-a460-cefc703ba6df","resolution":{"observed_at":"2026-06-29T19:33:54.613197Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2606.28760","last_updated":"2026-06-27T06:32:47Z","snapshot_observed_at":"2026-08-13T10:47:42.246220Z","submitted_at":"2026-06-27T06:32:47Z","title":"Vision-Language Models for Deployable Social Robot Navigation: Bridging Semantic Reasoning and Low-Level Control","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T09:52:51.549135Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2606.28760"},"observation_digest":"sha256:1eb367909d8469a645c400b5ba439ed7155c70a5af42bd029d60857149e851b4","observation_id":"613b6a72-ca78-421f-b77f-9dec93d39f73","resolution":{"observed_at":"2026-06-30T09:54:34.519791Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2606.30367","last_updated":"2026-06-29T14:33:03Z","snapshot_observed_at":"2026-08-06T15:33:36.109677Z","submitted_at":"2026-06-29T14:33:03Z","title":"FutureNav: Unified World-Action Modeling for Vision-and-Language Navigation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T05:05:56.065261Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2606.30367"},"observation_digest":"sha256:f6d21bd431c6fb486011dec2c438d437b4fc728c3f9c8b0064a53c8216f5d009","observation_id":"73fef3cb-f37c-4a72-9c36-98d11587368b","resolution":{"observed_at":"2026-06-30T15:54:49.928777Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2607.01754","last_updated":"2026-07-02T06:11:07Z","snapshot_observed_at":"2026-08-02T15:41:12.241586Z","submitted_at":"2026-07-02T06:11:07Z","title":"Path-level Hindsight Instructions for Semantic Exploration in Vision-Language Navigation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-03T14:04:46.400336Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2607.01754"},"observation_digest":"sha256:be0f9fc575b7697349e50bea6d89a4edf850c84e5435e8f14ca71f040a78d216","observation_id":"c132e310-40d5-4fa2-92b5-e7a178b3f5ab","resolution":{"observed_at":"2026-07-03T14:08:21.406594Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-12T04:33:48.376442Z","title":"Navila: Legged robot vision-language- action model for navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03146","last_updated":"2026-07-03T09:37:48Z","snapshot_observed_at":"2026-08-09T20:57:37.482357Z","submitted_at":"2026-07-03T09:37:48Z","title":"Exp2VLA: Enabling Vision-Language-Action for Drone Navigation from Expert Demonstrations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T04:33:48.376442Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2607.03146"},"observation_digest":"sha256:b89adb2bb55abb685dc343994ea1598c44f91525aaab7f3a0ddf4b24be88275d","observation_id":"a3f816f0-a771-4f4e-9e6b-66e40e2249b1","resolution":{"observed_at":"2026-07-12T04:33:48.376442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Navila: Legged robot vision-language-action model for navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-12T13:31:45.799876Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:16661de72332fc2129c9899301c1e3ae489cc638371a3eb0349e6d77a6992d55","observation_id":"60e3694c-c7e2-4522-8943-3ba9f774cccf","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-11T08:29:01.477958Z","title":"Navila: Legged robot vision-language-action model for navigation.arXiv preprint arXiv:2412.04453, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05122","last_updated":"2026-07-06T14:11:27Z","snapshot_observed_at":"2026-08-14T00:00:40.513858Z","submitted_at":"2026-07-06T14:11:27Z","title":"Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T08:29:01.477958Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2607.05122"},"observation_digest":"sha256:32505d94d7d70d0939c9da61be8f77061c26b7f30a84c9954fc3f78e99c28a9d","observation_id":"b6e50527-e702-4417-aa23-4552559563ad","resolution":{"observed_at":"2026-07-11T08:29:01.477958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-01T16:20:01.293615Z","title":"Navila: Legged robot vision-language-action model for navigation.arXiv preprint arXiv:2412.04453,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18042","last_updated":"2026-07-23T15:59:17Z","snapshot_observed_at":"2026-08-11T16:28:43.983398Z","submitted_at":"2026-07-20T15:11:46Z","title":"Anticipate Before Acting: Future-State-Conditioned Vision-Language Navigation","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-01T16:20:01.293615Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2607.18042"},"observation_digest":"sha256:81493b645ee88174944b4a44fb90d77b07559f97e2505874b289287ce30b54be","observation_id":"f4729f4d-613e-4a48-bbbf-f24dfdff1b23","resolution":{"observed_at":"2026-08-01T16:20:01.293615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-01T11:30:22.146055Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19880","last_updated":"2026-08-05T18:04:48Z","snapshot_observed_at":"2026-08-14T06:26:05.897761Z","submitted_at":"2026-07-22T08:10:49Z","title":"EA-Nav: Learning Safe Visual Navigation Policies with Embodiment Awareness","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T11:30:22.146055Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2607.19880"},"observation_digest":"sha256:bcdca36bb9d182ec6d6ea51f9d7e0ee0a701d70b78ce1f578450b81854c9acd1","observation_id":"4dcd7d93-6b4e-406e-a652-5bedd565ddcb","resolution":{"observed_at":"2026-08-01T11:30:22.146055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-01T06:17:39.791761Z","title":"De Heuvel J, Corral N, Kreis B, Conradi J, Driemel A and Bennewitz M (2023) Learning depth vision-based personalized robot navigation from dynamic demonstrations in virtual reality","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21964","last_updated":"2026-07-24T04:23:21Z","snapshot_observed_at":"2026-08-12T15:07:06.830141Z","submitted_at":"2026-07-24T04:23:21Z","title":"ACME: A Multi-Cultural, Multi-Embodiment Social-Navigation Dataset","version":1},"reference_index":292,"source":"pdf_text","source_observed_at":"2026-08-01T06:17:39.791761Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2607.21964"},"observation_digest":"sha256:119b96a448b3952800bb54168b2bef061fccc51af9b87adbc62c33df29e51cb3","observation_id":"7e252989-0e19-47ea-a185-1296bbc615d6","resolution":{"observed_at":"2026-08-01T06:17:39.791761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-01T06:06:22.870692Z","title":"Navila: Legged robot vision-language-action model for navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22014","last_updated":"2026-07-24T06:22:50Z","snapshot_observed_at":"2026-08-10T21:55:42.550137Z","submitted_at":"2026-07-24T06:22:50Z","title":"Zero-Shot Mission-Level Evaluation for Aerial MLLM Agents","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T06:06:22.870692Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2607.22014"},"observation_digest":"sha256:7a219a135fd7ddb476d036195e2fc0091c4571d7d991f81cd22b9da9f1210721","observation_id":"79160368-0112-47d0-b764-c75123e98fe3","resolution":{"observed_at":"2026-08-01T06:06:22.870692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-30T20:42:03.068111Z","title":"Navila: Legged robot vision-language-action model for navigation.arXiv preprint arXiv:2412.04453, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-11T15:23:54.990606Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:03.068111Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:e05f56d077377bbbb80e6de54d6c8346d259dab8f4994783b223a0e7042293c1","observation_id":"51a0af7a-2ead-4729-b06b-9357ef1cda00","resolution":{"observed_at":"2026-07-30T20:42:03.068111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-01T00:43:30.833308Z","title":"Cheng, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26148","last_updated":"2026-08-03T01:02:45Z","snapshot_observed_at":"2026-08-09T23:15:43.606415Z","submitted_at":"2026-07-28T18:00:34Z","title":"Embodied Agents Take Control: Minimal-Interface Zero-Shot Agents Rival Industrial-Scale Policies in Vision-and-Language Navigation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T00:43:30.833308Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2607.26148"},"observation_digest":"sha256:aa568b23a1b7968828470d37bbf63dece20ecdb4b6bb4586b773fecbac349cfc","observation_id":"fda33824-fdbd-4099-8d6b-0184621082ef","resolution":{"observed_at":"2026-08-01T00:43:30.833308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-04T03:24:27.168988Z","title":"Cheng, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26148","last_updated":"2026-08-03T01:02:45Z","snapshot_observed_at":"2026-08-09T23:15:43.606415Z","submitted_at":"2026-07-28T18:00:34Z","title":"Embodied Agents Take Control: Minimal-Interface Zero-Shot Agents Rival Industrial-Scale Policies in Vision-and-Language Navigation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T03:24:27.168988Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2607.26148"},"observation_digest":"sha256:6adef8a5a30f55d7408da48f7b9def02c8ee7e1fb4c25075eb6d92670db7ad56","observation_id":"b0ffe209-0598-4085-a7b1-ca7ea417fa2f","resolution":{"observed_at":"2026-08-04T03:24:27.168988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-10T11:29:20.418365Z","title":"Uni-navid: A video-based vision-language-action model for unifying embodied navigation tasks.Robotics: Science and Systems, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07267","last_updated":"2026-08-07T14:29:00Z","snapshot_observed_at":"2026-08-13T13:50:17.264747Z","submitted_at":"2026-08-07T14:29:00Z","title":"WNM-3D: A World Navigation Model with 3D Scene Conditioning for Closed-Loop VLN","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T11:29:20.418365Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2608.07267"},"observation_digest":"sha256:0fd8caa9a9b83f303b68610ca9177a0abace491610d7249afdc86717b025dbcc","observation_id":"73f86b6f-c688-413c-996f-c89124c25906","resolution":{"observed_at":"2026-08-10T11:29:20.418365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-14T04:34:35.040088Z","title":"arXiv preprint arXiv:2412.04453 (2024) 4","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08596","last_updated":"2026-08-09T09:21:47Z","snapshot_observed_at":"2026-08-14T04:27:44.206805Z","submitted_at":"2026-08-09T09:21:47Z","title":"Goal-oriented Navigation Instruction Generation with Tour Video Priors","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T04:34:35.040088Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2608.08596"},"observation_digest":"sha256:c3915508509cac9ea9caf0fa6da059e014890da9ade2a1320b7566d0971632e5","observation_id":"11c936a4-78c7-458d-821f-0029b6b698df","resolution":{"observed_at":"2026-08-14T04:34:35.040088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.04453/citation-record","integrity":"/paper/2412.04453/integrity","json":"/paper/2412.04453/citation-record.json","paper":"/paper/2412.04453"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.831508Z","title":"Vision-and- language navigation: Interpreting visually-grounded navigation instructions in real environments","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.831508Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:25d813a2d0bd8046a88f6d786f4fe0e2e11a8d73c983cffc411a4592b82697ae","observation_id":"a363256c-9a04-4119-ab42-3c5db7d6dd56","resolution":{"observed_at":"2026-08-11T21:30:17.831508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.836242Z","title":"Reinforced cross-modal match- ing and self-supervised imitation learning for vision- language navigation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.836242Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:35633de69b03186e46ea6fd207623ed6d8f42734f36e3735335751cf52cc6e72","observation_id":"d84794ca-ccd1-47a0-a619-badf00fe81af","resolution":{"observed_at":"2026-08-11T21:30:17.836242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.840331Z","title":"Learning to explore using active neural slam","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.840331Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:2f7b430190bd4b6e0abcf692ca80d4792d3483fe165d003ad9e350c590700c60","observation_id":"49ac0c45-089f-4424-9575-5f80791f90bd","resolution":{"observed_at":"2026-08-11T21:30:17.840331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.845598Z","title":"Object goal navigation using goal-oriented semantic exploration","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.845598Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:c9b230345a8143e70391af9baa6c16b35e89dc8088867a2150e29239ff9fb1b0","observation_id":"d1ff295d-4ef9-48da-9f66-c083f0067529","resolution":{"observed_at":"2026-08-11T21:30:17.845598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.851532Z","title":"Neural topological slam for visual navigation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.851532Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:88262008c1f5fffdf349e0b615f8fc8404be2bdd1ab60478cfaf40b2dad70748","observation_id":"59b44ac5-0c8f-426c-94ee-b53caf157428","resolution":{"observed_at":"2026-08-11T21:30:17.851532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.855931Z","title":"Habitat-web: Learning embodied object- search strategies from human demonstrations at scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.855931Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:f8a0fca10793a2942609278efb0a61cb009a09534f4faa2c378869df4979946d","observation_id":"91f2abfc-1957-4d3f-b9b3-9d19712f5f05","resolution":{"observed_at":"2026-08-11T21:30:17.855931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.859854Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.859854Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:57d99bacd6a6ac1c604970bb3427a7ce59d388aff211a2d11f2e243918fc6b48","observation_id":"570268ab-f4bf-47d1-9f36-89bccd297f4b","resolution":{"observed_at":"2026-08-11T21:30:17.859854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.864098Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.864098Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:278fd6f1e0d75ca0d9a48a826b66fc8e2990f8f96f1e31305b534ac4c0eea1fe","observation_id":"0115472b-3e5d-4cc9-a46a-132900ce24fa","resolution":{"observed_at":"2026-08-11T21:30:17.864098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.867800Z","title":"Open x-embodiment: Robotic learning datasets and rt-x mod- els","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.867800Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:7f0553dd1cb04850641abbf8635c747b2fb2fe981c95538822aa585b0bc87d45","observation_id":"a595661a-31d2-4e3a-9459-4973ba399154","resolution":{"observed_at":"2026-08-11T21:30:17.867800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.871382Z","title":"Spa- tialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.871382Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:be9a2fd782c666309fc6dd85763c37fc118ff9fca7a89611b73febefb6dfd4d6","observation_id":"911cf3e0-e316-4d1c-975d-f41f01f0b0b1","resolution":{"observed_at":"2026-08-11T21:30:17.871382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.874729Z","title":"Spatialrgpt: Grounded spatial reasoning in vision- language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.874729Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:97db9cc380687ab787e1d1aae8b34916bca50e12270f45e0d55ca07affbf2653","observation_id":"58830bb4-a099-408d-839b-57f9c27ccb2c","resolution":{"observed_at":"2026-08-11T21:30:17.874729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.878371Z","title":"Navid: Video-based vlm plans the next step for vision-and-language navigation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.878371Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:3247a29bfe0be88f5f0ec1c68bec4cd5f42c58a3461d25687661418fda37beca","observation_id":"05dc268e-3be0-4dc9-bf9c-9691b9a38488","resolution":{"observed_at":"2026-08-11T21:30:17.878371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.882456Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.882456Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:7d20d3b85dca41c03b06a5af6257ef6a444c04e2e8cfa4422dc401ba96743b71","observation_id":"5b737d52-472c-4fc1-b137-2d64785dd41a","resolution":{"observed_at":"2026-08-11T21:30:17.882456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.886040Z","title":"Vila-u: a unified foundation model integrating visual understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.886040Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:3cd438fd0b357ef655907e677fac5018d17eb8ccc9660ea1fda0c00bd0b3d697","observation_id":"65b3d0cb-92c5-4fb2-aafd-e039216f4add","resolution":{"observed_at":"2026-08-11T21:30:17.886040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.889655Z","title":"Vila 2: Vila augmented vila","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.889655Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:4b2cddd7ee8158942172ce82c98e4f5c62b045da0c1111f944e36ec5940b50f8","observation_id":"b722a745-26d8-4db6-8b7a-b9932ccb9d8a","resolution":{"observed_at":"2026-08-11T21:30:17.889655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.893308Z","title":"Longvila: Scaling long- context visual language models for long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.893308Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:98cdddf70ecfa5391baae28d2050420a93151a23e2a05f75b9f31dfbbe14d46e","observation_id":"378b2d1a-8f0d-4086-a726-c7c1049068d5","resolution":{"observed_at":"2026-08-11T21:30:17.893308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.897116Z","title":"X-vila: Cross-modality alignment for large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.897116Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:9d88f466fd1e820b34bbec9459522e4d16861a4d5834ad8ddd147e442beecf33","observation_id":"a369e17e-c6ee-410e-954d-16bb275b8738","resolution":{"observed_at":"2026-08-11T21:30:17.897116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.900546Z","title":"Lita: Language instructed temporal-localization assistant","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.900546Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:597add72fc2d1416876d792997c9e1f84a94ef2feccfe69eaf5dd978767db8f7","observation_id":"559cbdd2-7d62-421e-b43d-bd57471b3cae","resolution":{"observed_at":"2026-08-11T21:30:17.900546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.904040Z","title":"Nvila: Efficient frontier visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.904040Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:a372beb7c92e826058bb0c69d2ae0c132e27282fd7ac7f9fe222ef11d80784c8","observation_id":"f4dba096-e6a8-4d49-840a-16ff475015d7","resolution":{"observed_at":"2026-08-11T21:30:17.904040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.907773Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.907773Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:de349bf5ce6371cfb7b72f2b3cef58e5897899e6293ccf04b49e34ec3da54ede","observation_id":"4881a756-aa64-4b9f-a570-54e1e1b9b507","resolution":{"observed_at":"2026-08-11T21:30:17.907773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.911633Z","title":"Coyo-700m: Image-text pair dataset","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.911633Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:de9c6f4ed30967b192c7bfaf5a7f829440eb99cf5f3f06e6397d1b57d27d87f0","observation_id":"40257328-7073-4b89-9ad0-2750db60f4db","resolution":{"observed_at":"2026-08-11T21:30:17.911633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.915170Z","title":"Multimodal c4: An open, billion-scale corpus of images interleaved with text","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.915170Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:1823d6996c468786643f2a9e744e05a66333a8bc61b63d031585baba2cd1a3a1","observation_id":"9aab1108-f263-497c-9d0b-7e78489217d6","resolution":{"observed_at":"2026-08-11T21:30:17.915170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.918942Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.918942Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:7083f062a26ea4c25fcbec72a961b17b158deeabf2bc67c945941ea0a7b55903","observation_id":"b52bf830-7b78-4975-9d3e-597987ec8b1a","resolution":{"observed_at":"2026-08-11T21:30:17.918942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.922686Z","title":"Airbert: In-domain pretraining for vision-and-language navigation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.922686Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:66748720d479d75d6f6c9d090e7966d3bf057e744834fc18259165b0259a2587","observation_id":"76cb3944-cfb3-4372-a4f8-8f07b623a703","resolution":{"observed_at":"2026-08-11T21:30:17.922686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.926611Z","title":"Improving vision-and-language navigation with image-text pairs from the web","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.926611Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:c73cc39827ad8abdf3209f27d69e0ad010cd9fc59fd70626a84b365f899a1c6d","observation_id":"3c99551f-8731-44eb-930b-e39e9e20490d","resolution":{"observed_at":"2026-08-11T21:30:17.926611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.930553Z","title":"Learning vision- and-language navigation from youtube videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.930553Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:c23713a03bac1e2ae0f23d7d47a93aaf9dbfca1f1271555d63393b7cc6eb07fb","observation_id":"788944ab-8b84-4a78-b01a-50120c87446b","resolution":{"observed_at":"2026-08-11T21:30:17.930553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.933948Z","title":"Grounding image matching in 3d with mast3r","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.933948Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:ed5057a4405564dc3d7ee1ca1dc59a459426bbbce69298ac3266e304883a1595","observation_id":"dffa3edc-7555-4171-b21c-8f4f09ccac35","resolution":{"observed_at":"2026-08-11T21:30:17.933948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.937623Z","title":"Hello gpt-4o, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.937623Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:709c47cbb79b2ba4102a46a754c7cece75a99720a3a512ecf12b26516785f845","observation_id":"d3c6e179-c46f-49cf-93f9-51b690655d83","resolution":{"observed_at":"2026-08-11T21:30:17.937623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.942500Z","title":"Beyond the nav-graph: Vision and language navigation in continuous environments","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.942500Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:6f39bf4bb83797dd4a83404750adaeb75b5cb2146a2542fa8bbd30929ff657ba","observation_id":"da16f356-3b44-4ff3-b4c3-c572eb74ddeb","resolution":{"observed_at":"2026-08-11T21:30:17.942500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.945879Z","title":"Room-across-room: Multilingual vision-and-language navigation with dense spatiotem- poral grounding","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.945879Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:7534dc1d2018b228a1e644003574d7fbf2542aac50e901e6c58d5bd8b64155f9","observation_id":"4e1f93db-0c9b-4786-91b9-f6412e9ae0d0","resolution":{"observed_at":"2026-08-11T21:30:17.945879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.949478Z","title":"Learning to navigate unseen environments: Back translation with environmental dropout","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.949478Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:e5924e45035d8edc11f13a98b3eb18595237c8c60f94116b3ec6c6d81ab19e07","observation_id":"34249108-43b1-4f4b-9f12-db518486fb2b","resolution":{"observed_at":"2026-08-11T21:30:17.949478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.952702Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.952702Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:7c584782db26b788b182c5264c3566385b773246c28650558f21b04aea41860a","observation_id":"38a4a32d-5441-48b0-9719-2dfd89473c76","resolution":{"observed_at":"2026-08-11T21:30:17.952702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.956028Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.956028Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:3f7e438cebf5e169223616de6e369a778cf564bf9c26f6f3c1a59647f90812bd","observation_id":"bd9c79c8-a349-4d41-9a2b-9157de80c1be","resolution":{"observed_at":"2026-08-11T21:30:17.956028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.959008Z","title":"Video-chatgpt: Towards de- tailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.959008Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:8b03be421fee249d7ef945638b3951817e864e41911ae59477b84678cfd2f7e0","observation_id":"1fd49c3f-bff9-4ea4-8392-56ee24df0c16","resolution":{"observed_at":"2026-08-11T21:30:17.959008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.961816Z","title":"Extending regular expressions with context operators and parse extraction","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.961816Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:137d5fd82aa93c2398e836bf716eb9271d5ba1464eae51ea7ecc806e30440676","observation_id":"42287389-5a65-46e5-9e33-26d0b8e3f60a","resolution":{"observed_at":"2026-08-11T21:30:17.961816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.964732Z","title":"Orbit: A unified simulation framework for interactive robot learning environments","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.964732Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:b1542e2ad70992e68bf1d9a2d3157eb0f0219fc5eafc1f7ef65d527ba3db7920","observation_id":"27a06b9c-6ffa-4631-a160-cd3fd2058a21","resolution":{"observed_at":"2026-08-11T21:30:17.964732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.968342Z","title":"Proximal policy optimiza- tion algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.968342Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:20a3b62e81cfe8242f987f3172167e6f9e690df936546c63fcd133f593c6ce87","observation_id":"c00eb566-2ce2-43e5-bde4-a7809a56bc3c","resolution":{"observed_at":"2026-08-11T21:30:17.968342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.971318Z","title":"Learning quadrupedal locomotion over challenging terrain","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.971318Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:fedab1c7e4ab8cc69541a914a28fa3b49be36a3a89d68b780fb067791ce8de86","observation_id":"658ab226-eebe-4a8d-8709-0c0b27a14540","resolution":{"observed_at":"2026-08-11T21:30:17.971318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.974198Z","title":"Learn- ing robust perceptive locomotion for quadrupedal robots in the wild","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.974198Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:aefa27405fb2bfa65d7dd9bf3d7ba242018f1b709f6a2d68684df319dc494774","observation_id":"0a7520c2-85db-440e-8c16-b9913bcd0fe9","resolution":{"observed_at":"2026-08-11T21:30:17.974198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.978565Z","title":"Rapid locomotion via reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.978565Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:7afdfaba0c08873f837ef3bdfaf9991bcad067c71a4e9861939fcc12479d7ffa","observation_id":"a52950d2-2359-4958-b3d9-4674ea5b8aa2","resolution":{"observed_at":"2026-08-11T21:30:17.978565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.982299Z","title":"Learn- ing robust autonomous navigation and locomotion for wheeled-legged robots","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.982299Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:f48abbdc187e6bcf34e41f25986e67b697dab1d39b85b0fb3ca05efb47707055","observation_id":"4df7d7b8-2ae4-4d74-9ffe-e5fdf0dc7e83","resolution":{"observed_at":"2026-08-11T21:30:17.982299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:17.985828Z","title":"Bridging the gap between learning in discrete and continuous environments for vision-and-language navi- gation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.985828Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:6827937778c6fa20e39c089c9dd7c214a3ac653457c65a1526ec68e03f2ca9fb","observation_id":"6ed90a7e-ec21-4c97-9ff6-2e696f3c1e31","resolution":{"observed_at":"2026-08-11T21:30:17.985828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:19.172412Z","title":"Waypoint models for instruction-guided navigation in continuous environ- ments","venue":null,"work_id":"88119700-eb85-4f5b-89b3-49b96b53e7df","year":2021},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.989293Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:fc385e45a098ca823f292518622b19a4251cef051bae1377c67fb78f500b2dbd","observation_id":"47ea631a-dded-44f8-b46e-29e787c50265","resolution":{"observed_at":"2026-08-11T21:30:19.175613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:19.163455Z","title":"Sim-2-sim transfer for vision-and-language navigation in continuous environ- ments","venue":null,"work_id":"82a6f76b-9a20-4d38-b0d7-4b65dafa106d","year":2022},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.992882Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:5d44cbb20e1481ae64ef8b9b7a707f4a213bf6e18ad6725e927cf53863d22ab1","observation_id":"b09310a8-0cba-4858-a773-4d435c63cebe","resolution":{"observed_at":"2026-08-11T21:30:19.166517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:19.153246Z","title":"Gridmm: Grid memory map for vision- and-language navigation","venue":null,"work_id":"e5fb6ae5-e3ff-4e9e-8455-b841bcc460f3","year":2023},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:17.996441Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:6fa1fe1e27b206682fc2b48d4482e5a541faa461dc62c84e9b6334bae08156a9","observation_id":"febb700a-a77f-4679-8494-70247f3dca8d","resolution":{"observed_at":"2026-08-11T21:30:19.156675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:19.141758Z","title":"Learning navigational visual representations with se- mantic map supervision","venue":null,"work_id":"8a730bab-4a52-4000-b334-fe2399dc43cb","year":2023},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.000086Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:fdaddd1cf287e9e125e02c748b6ef500ef7bafe0f4fb44dfcc1d786d222e6a17","observation_id":"6fb11541-972e-441b-a928-69c4b5e022a6","resolution":{"observed_at":"2026-08-11T21:30:19.146249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:19.130258Z","title":"Dreamwalker: Mental planning for contin- uous vision-language navigation","venue":null,"work_id":"4b711c9c-980e-418c-8074-4cec1255b545","year":2023},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.004455Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:68e6cd6d191d00c182f9a04efaf15c0d82d497f01918f355755bf971c2efa770","observation_id":"43421e5f-c1da-4d46-a0be-5a344640446d","resolution":{"observed_at":"2026-08-11T21:30:19.134725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:19.118330Z","title":"1st place solutions for rxr-habitat vision-and-language nav- igation competition","venue":null,"work_id":"7b2c1b82-5e04-4963-b757-11c3aebf0423","year":2022},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.008151Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:9558a54b8c57ac37fcfc3d6f40b490a9f1724fb2fb65646e897c22c90b3f14af","observation_id":"cf8ec2cd-05bb-41d7-b2ce-91fbc1171ff4","resolution":{"observed_at":"2026-08-11T21:30:19.123027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:19.107420Z","title":"Etpnav: Evolv- ing topological planning for vision-language navigation in continuous environments","venue":null,"work_id":"b885e96a-4987-43e8-bc02-97ea24d6ad7a","year":2024},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.011594Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:c237589a53425ffbfe17460347d5aeea31c78f0216729cf2b369a4bfb97acd11","observation_id":"5d1bef50-e143-4d6c-a505-b2388fd4d18c","resolution":{"observed_at":"2026-08-11T21:30:19.111020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:19.097279Z","title":"Lookahead exploration with neural radiance representation for con- tinuous vision-language navigation","venue":null,"work_id":"68088b8d-1d8e-4b2c-9ae9-b5e7b660ae1a","year":2024},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.015078Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:357230ae0c24bf2f5230ed51b55e5c1253325737f77936458413376a4ff299e5","observation_id":"4b08ae4b-f300-4a04-a335-cc5e44873171","resolution":{"observed_at":"2026-08-11T21:30:19.100909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:19.086373Z","title":"Bevbert: Multimodal map pre-training for language-guided navigation","venue":null,"work_id":"4403d731-a05d-42ca-84d6-c2cab35ef175","year":2023},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.018877Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:a2c469e8a1f91ad8232d9391e4189becc6a0e540389ac750ab95418d48f3d616","observation_id":"dc1d74ff-aded-4e15-9399-86acae984a74","resolution":{"observed_at":"2026-08-11T21:30:19.090412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:19.075017Z","title":"Scaling data generation in vision-and-language naviga- tion","venue":null,"work_id":"fc0ffdcb-7bb5-4812-af5c-ac66f2d53d02","year":2023},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.022680Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:b16af29d571b1684e7afa9cb92dbb581b212d0bfaec6b6666dc04298f65e9cf5","observation_id":"52b2357d-cdce-48a5-a0f3-e42bebcb84e0","resolution":{"observed_at":"2026-08-11T21:30:19.079230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:19.063475Z","title":"Topological planning with transformers for vision-and-language navigation","venue":null,"work_id":"6b8b3cf9-c606-44ee-9bf7-f445f1a75c65","year":2021},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.026744Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:1f3f98c4bb8147a1de037c17efac7d34da9bac2be23551ac513840c49de4963e","observation_id":"52f18842-3c32-4575-9805-d35b1afe0491","resolution":{"observed_at":"2026-08-11T21:30:19.067347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:19.052345Z","title":"Language-aligned waypoint (law) supervision for vision-and-language navigation in continuous environments","venue":null,"work_id":"8b67168e-215f-4759-a105-b961db2f3120","year":2021},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.030545Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:eac8d211e11d1cff83bb2f4b47dc739e73ba1d7f6d4c4d9d3f73c8072d56c97a","observation_id":"a9d66aaa-8382-4724-9e11-8ad16f82b235","resolution":{"observed_at":"2026-08-11T21:30:19.055941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:19.042468Z","title":"Cross-modal map learning for vision and language navigation","venue":null,"work_id":"4da0d74f-e782-41af-97be-ae3da39bdd86","year":2022},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.034016Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:d3cd7f6b4cb8b6329fc0f7f97254e1b6a54b654421d41a2452cca008c3579650","observation_id":"10a49391-f1e2-452b-b672-65b3f8b8f1f1","resolution":{"observed_at":"2026-08-11T21:30:19.045962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:19.029608Z","title":"Weakly- supervised multi-granularity map learning for vision- and-language navigation","venue":null,"work_id":"7a9cf74f-bf39-4dd6-8081-d6754fef61f1","year":2022},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.037585Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:8405dd150a8df0836c16e2f5a9466502c43abaee17d4026fd61c3fd2493efede","observation_id":"d1fc72cf-8589-4b90-969e-a40fc9d0ffe0","resolution":{"observed_at":"2026-08-11T21:30:19.034336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:19.018735Z","title":"Affordances-oriented planning using foundation models for continuous vision-language navigation","venue":null,"work_id":"809e99e7-a73c-40f8-9f92-0910f09e3df0","year":2024},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.041249Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:0e1e3d1d6fb634c49987e6beca67608c218902e35e10e5c6152af034e5387ef9","observation_id":"a9ad9588-d3b4-4ac1-b561-84df3c3886a4","resolution":{"observed_at":"2026-08-11T21:30:19.022390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:19.007751Z","title":"Beyond the nav-graph: Vision- and-language navigation in continuous environments","venue":null,"work_id":"92e79199-d119-4d16-ac31-b9f23374fc80","year":2020},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.044935Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:1abfb9e35a28ec99404f39ccc2ec7cfcdfa14c546822e8d2ac2f9ecb31d78550","observation_id":"aed9c626-93fa-4af7-a5b5-0efefccf9468","resolution":{"observed_at":"2026-08-11T21:30:19.011844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.996473Z","title":"Li, Gaowen Liu, Mingkui Tan, and Chuang Gan","venue":null,"work_id":"f0c61691-626e-4abe-a852-9c9ea6137235","year":2023},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.048729Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:7438d309daa1a642d795c102953cfb5eb8c2facc944787280fd59a8174513ecc","observation_id":"a35b5962-e278-41b2-8d07-08a71924346f","resolution":{"observed_at":"2026-08-11T21:30:19.000309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.984875Z","title":"Towards learning a generalist model for embodied navigation","venue":null,"work_id":"bbb257c5-b434-4f2e-8bb6-c9e909a2eec1","year":2024},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.053107Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:2fce273a929a44bb0468d5d76e87e56a080860a3ccb557d400369e861ddb2e98","observation_id":"ec12e8a0-0f45-4e9b-a76f-938433fa0a4a","resolution":{"observed_at":"2026-08-11T21:30:18.989035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.971549Z","title":"Scene-llm: Extending language model for 3d visual understanding and reasoning","venue":null,"work_id":"3ce4c937-116a-4fca-bc8c-6b219a5fafc2","year":null},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.057131Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:1995c43b082e85178a440d78c146c61c9505f8d48bc210c846000aadf5aab8a4","observation_id":"fdaf41ca-a68b-48a6-93bc-1742da40723f","resolution":{"observed_at":"2026-08-11T21:30:18.976172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.959095Z","title":"An embodied generalist agent in 3d world","venue":null,"work_id":"b9367a28-21e7-4e69-9ff2-853d5c315638","year":2024},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.061045Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:e092578c3b2d3bb6832bbc698f7bae5d8c74845d4da7fccee6711281a8e7e8f4","observation_id":"c9ab142d-3c1f-4452-8626-45a16f0c55e2","resolution":{"observed_at":"2026-08-11T21:30:18.963231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.947876Z","title":"Deep modular co-attention networks for visual question answering","venue":null,"work_id":"d7d34e04-b2d8-46f5-9c96-de4e459f8e16","year":2019},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.064592Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:e470994367a89af23d30f5bd10a474e4e8cd8cf8d5b2adf74b0168d85130bee6","observation_id":"8cda76cb-cfa7-4054-a680-331f0a34d6a6","resolution":{"observed_at":"2026-08-11T21:30:18.951415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.936043Z","title":"3d-vista: Pre-trained transformer for 3d vision and text alignment","venue":null,"work_id":"91e5103d-992f-4776-b058-55d1cdec1176","year":null},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.068196Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:3d1ca0f3955dad5b1d5f3022b30061c5e5605eeb81970340bbe8bc4f3d239caf","observation_id":"a839c7b8-00c0-491e-827d-5c52b8cb752e","resolution":{"observed_at":"2026-08-11T21:30:18.939559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.924034Z","title":"3d- llm: Injecting the 3d world into large language models","venue":null,"work_id":"4ff320e7-bf75-4f68-b09e-bb1cd16ce797","year":2023},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.072384Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:078ef350f50c483050327640f3e407c36f96da671e8472bd3f5c30d263456c0c","observation_id":"c8c102a5-fd58-40aa-8a5b-ba07e1aef51e","resolution":{"observed_at":"2026-08-11T21:30:18.928179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.913068Z","title":"Ll3da: Visual interactive instruction tuning for omni-3d understanding reasoning and planning","venue":null,"work_id":"518ba58a-29fc-41b5-94df-7be855e2d36b","year":2024},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.075896Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:53baecc6a9ff6297d93aa7331a7963bd771dc6fe690582c5034d82aedb586ee9","observation_id":"bb6eca6d-821b-4875-9daf-0046ba95b65a","resolution":{"observed_at":"2026-08-11T21:30:18.916970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.901799Z","title":"Chat-scene: Bridging 3d scene and large language mod- els with object identifiers","venue":null,"work_id":"576be637-17ae-4f12-9b46-efcf34b76a33","year":2024},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.079595Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:f0e5efa1d1a112fd6596110ddf1c718889ce9d917af926046a2a31f7bc1d6e14","observation_id":"9772d1cf-c948-4466-a4c5-fd713197f4cb","resolution":{"observed_at":"2026-08-11T21:30:18.905676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.889344Z","title":"Deep whole-body control: Learning a unified policy for ma- nipulation and locomotion","venue":null,"work_id":"d6ef8648-b279-4245-bdbb-193966c1ec91","year":2022},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.083279Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:c6e978d8807a600316d84c481162abb3cce6909320236ddbca748c67fc5af257","observation_id":"b5bff175-0b86-4386-9dc5-725f84714d4b","resolution":{"observed_at":"2026-08-11T21:30:18.893437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.878438Z","title":"Habitat: A platform for embodied ai research","venue":null,"work_id":"0b0c45f1-5292-4e44-a53a-e79cff596854","year":2019},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.087220Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:02f94f5184898fcbea03c34108d192e110dd9e42b460eb72d7a4c0ba2c2d7034","observation_id":"79208f9c-74ad-4304-9292-b0b51c84219c","resolution":{"observed_at":"2026-08-11T21:30:18.882359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.866913Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":"5716c651-fcea-4b59-9bda-76f32705f952","year":2023},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.089979Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:a31ced2453adb96b21b56edb827129dad3298fae4cfa4f94e09d769881507408","observation_id":"a2436d9b-a4ef-4d8e-b8b1-7a933ff0c338","resolution":{"observed_at":"2026-08-11T21:30:18.870761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.855907Z","title":"Obstacle avoidance and naviga- tion in the real world by a seeing robot rover","venue":null,"work_id":"44c79af7-8c38-43ca-9fa7-9ac9f83923cd","year":1980},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.092970Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:ef7dcab5e0fa55d9433e53868dab878b321fdaa7836337d35e8c1df066f50633","observation_id":"817ab644-2f4d-40f9-b335-5cbaa4cb875f","resolution":{"observed_at":"2026-08-11T21:30:18.859776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.843246Z","title":"Sonar-based real-world mapping and navigation","venue":null,"work_id":"7e74f60d-c21f-4a8c-8453-81ad8febcf14","year":1987},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.096102Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:6b45524b46a9ea3aa6bb351a9fe8c64f5ba694da7b24dd4912e3a9588fc3172c","observation_id":"768bacb8-77ba-465d-bbd4-d2e010554ccc","resolution":{"observed_at":"2026-08-11T21:30:18.847566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.832311Z","title":"Robust monte carlo localization for mobile robots","venue":null,"work_id":"f443abc9-d927-4620-8a93-96cbde0014ef","year":2001},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.099092Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:d595d8214564d841569aa9a2c0b8c91c580f0a39635b9fd710c874c75dab00eb","observation_id":"c1177870-473c-4f9c-ad67-bb4c23cb61ac","resolution":{"observed_at":"2026-08-11T21:30:18.836025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.821659Z","title":"Navigating to objects in the real world","venue":null,"work_id":"c07fab15-a803-43d5-aa9a-d3990202fccf","year":2023},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.102227Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:d9284d3fdfec6b51c0805755052652f4dc137049d2f735bca9053864e7e1aa06","observation_id":"7e2754ef-6ace-4c45-8185-bf5c0fa83369","resolution":{"observed_at":"2026-08-11T21:30:18.825550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.811965Z","title":"Minerva: A second-generation museum tour-guide robot","venue":null,"work_id":"5d57aa4a-8aef-4841-91c6-d289a994b2a0","year":1999},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.105109Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:ba9d29d00d282fd4144c2a587c4f304068662170a6eccc694a00c709461ee1a0","observation_id":"4ebb8a00-e351-40d0-8e52-bbc16aaa01d6","resolution":{"observed_at":"2026-08-11T21:30:18.814922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.803236Z","title":"Kinectfusion: Real-time dense surface mapping and tracking","venue":null,"work_id":"b90c30ae-9c20-4610-ab0d-6e1d0bc04423","year":2011},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.108169Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:8d6863f00317ccf2a970e23fd2d3e2214dd31df814835d8d22fcc4c131176b11","observation_id":"ed81421a-b222-4ec5-8499-d088410b203d","resolution":{"observed_at":"2026-08-11T21:30:18.806121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.794178Z","title":"Monoslam: Real-time single camera slam","venue":null,"work_id":"782c81d6-8d13-4d3c-bcd1-af8cdd798490","year":2007},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.111431Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:13b41e7229347ed91cda1acd1f55ab2d1034380642bf0cd9a979533550cf878a","observation_id":"e555f857-e0ad-417c-a19e-4d76eaf8dd69","resolution":{"observed_at":"2026-08-11T21:30:18.797079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.783423Z","title":"Visual-inertial navigation, mapping and localization: A scalable real- time causal approach","venue":null,"work_id":"fecb053e-0b8f-4a41-882b-9454f82209f2","year":2011},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.115159Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:266590f8a6bb6aca61fe40ac4db7a35cf86ea0fe822ac98cfdda8ab49dc83c50","observation_id":"fee5065f-9262-4295-9d39-f15335605d15","resolution":{"observed_at":"2026-08-11T21:30:18.787344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.772821Z","title":"Gated-attention architectures for task-oriented language grounding","venue":null,"work_id":"899cd7ce-24cf-450a-ae1d-9e14e0f85f8c","year":2018},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.118952Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:62aee492319f9d7e559e63d7fe543be956dde21e47974e8c9e2f5e6c5a27a944","observation_id":"9fad0211-9fdc-4b78-99cf-13ab9e3ef97a","resolution":{"observed_at":"2026-08-11T21:30:18.776546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.761908Z","title":"End-to-end driving via conditional imitation learning","venue":null,"work_id":"b7e4398f-8f97-4f10-8c9a-7e5bf8c21072","year":null},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.122588Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:c6de0fa4cda721ba8d66d327017cb7bea1621e080c94bb1482bc7090fc521403","observation_id":"074665ac-1205-4171-9e32-ecb935306093","resolution":{"observed_at":"2026-08-11T21:30:18.765935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.750974Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":"aa5097f9-7996-44c2-897d-6f929770a0cf","year":2015},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.126445Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:0c8a37b171c1373a4c6a6301ab8603a4be0bc1a2ca168cf6281aeb883c0934a5","observation_id":"03f69ab1-da58-4f8c-a927-36739973faae","resolution":{"observed_at":"2026-08-11T21:30:18.754810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.740331Z","title":"Continuous control with deep reinforce- ment learning","venue":null,"work_id":"6c449bce-7815-4666-bae6-442e943fcb76","year":2015},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.130311Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:7ad9b77c5971abda037806aea76f4e21a5a22b423eedeb2fbfc3bf6ada2d196b","observation_id":"694ac538-c33d-4070-b5e4-863dc42e8d3a","resolution":{"observed_at":"2026-08-11T21:30:18.744149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.728938Z","title":"Reverie: Remote embodied visual referring expression in real indoor environments","venue":null,"work_id":"bd0012db-5fba-41e3-9ea7-5103b7982d40","year":2020},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.134064Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:c1383e0d8840554f30177e083a90e8292fd1bbbefc54590b19ad5b5a21d59454","observation_id":"88252727-b064-4087-b32e-9a5fb7e24972","resolution":{"observed_at":"2026-08-11T21:30:18.732798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.718522Z","title":"Matterport3d: Learning from rgb-d data in indoor environments","venue":null,"work_id":"62d36cdd-4236-40ed-8442-165f30eac236","year":2017},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.137801Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:bb3ae87ce9400d1dfa206bb0fe84bc1dd40c382eac7da2ffa31ebfa483610533","observation_id":"810bbb99-44e4-4bcd-8c52-c29cfc621296","resolution":{"observed_at":"2026-08-11T21:30:18.722233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.707962Z","title":"Speaker-follower models for vision-and- language navigation","venue":null,"work_id":"76d50b20-4b8d-4cc1-83d6-960c7300dcda","year":2018},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.141768Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:c34fee561379917876a43ba6d1332fc1fdd8769a1eb081116880431df30b1966","observation_id":"28b42a25-66aa-4504-8c65-cb168d0fa6b9","resolution":{"observed_at":"2026-08-11T21:30:18.711465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.697306Z","title":"Self-monitoring navigation agent via auxiliary progress estimation","venue":null,"work_id":"05e8837c-d84f-4ef9-9bc8-969388e4141c","year":2019},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.145628Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:02f8479442f69eab76c43e0c96de87185f0920dd4e39afad644aa1e55ec8e836","observation_id":"8d86520f-65b8-444b-a154-fc8dd8d0b522","resolution":{"observed_at":"2026-08-11T21:30:18.701082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.686965Z","title":"Tactical rewind: Self-correction via backtracking in vision-and-language navigation","venue":null,"work_id":"cfec4d8d-7e2b-4d73-a118-79e858c0f387","year":2019},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.149708Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:48db2ce42edf1c69891b2f4b690be296badacde196b97a2b2bb40074204cef36","observation_id":"24cac0a8-a7df-4165-a822-731150688f90","resolution":{"observed_at":"2026-08-11T21:30:18.690082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.676878Z","title":"Language and visual entity rela- tionship graph for agent navigation","venue":null,"work_id":"e3394faa-4e42-4338-8abe-63e5689bfb4e","year":2020},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.153608Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:15e381280c560cc2f6693bbb96f190619e15efa1549f967f6b3914fc9db6831c","observation_id":"c594b6ea-60dc-4d2c-8d78-9d24bf5a1478","resolution":{"observed_at":"2026-08-11T21:30:18.680363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.667050Z","title":"History aware multimodal transformer for vision-and-language navigation","venue":null,"work_id":"51f6321d-41e4-43f3-bf90-8b899a6ae4c1","year":2021},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.157221Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:17c91980f33db6349ee24c8adf9ae6a052f6ebbaf79213c27f9afa8db2582a6e","observation_id":"7b1a9998-751d-47df-801c-00a4cc314965","resolution":{"observed_at":"2026-08-11T21:30:18.670495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.655918Z","title":"Mapgpt: Map-guided prompting with adaptive path planning for vision-and- language navigation","venue":null,"work_id":"8eff4632-8b98-4710-bb8c-2d3e2f833467","year":2024},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.161044Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:f62c4b4eb736c70b3327ccf05998cd0f338c6684e90d945e79e50e05c941c463","observation_id":"f3aaaf58-9ce7-4078-9c22-983ce7e00219","resolution":{"observed_at":"2026-08-11T21:30:18.660046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.644940Z","title":"Navgpt-2: Unleashing navigational reasoning capability for large vision-language models","venue":null,"work_id":"4741e6ee-54ea-4e17-b5b5-542985480bc7","year":2024},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.164687Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:6461bf09aaddb2c6000c187d39daefe88c410dde40a0c00c3120afa5e2270bff","observation_id":"1fba79c5-22a9-4a44-91b9-ccc40f8a6136","resolution":{"observed_at":"2026-08-11T21:30:18.648783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.633493Z","title":"Robust navigation with language pretraining and stochastic sampling","venue":null,"work_id":"188e7df5-c72f-40b6-a7b1-c95d7776bad0","year":2019},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.168252Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:f3221d3a594bd328910c258f6d808da6572730ca2595bc4e0389c2317b63d880","observation_id":"eb2f9478-1a99-44ef-956a-d6ff04ee56a0","resolution":{"observed_at":"2026-08-11T21:30:18.637499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.622483Z","title":"A new path: Scaling vision-and-language navigation with synthetic instruc- tions and imitation learning","venue":null,"work_id":"91bb32bd-85a3-46a6-83fa-c3462c90482b","year":2023},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.172132Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:d818d43e7c5a602bc17d2cbb468c0bf617497f8ea848059825bfbbdc9b415703","observation_id":"ca0fbb2e-7ade-4a31-a7fc-cdca3270c246","resolution":{"observed_at":"2026-08-11T21:30:18.626468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.610676Z","title":"Hierarchical cross-modal agent for robotics vision-and-language navigation","venue":null,"work_id":"678f251c-40e2-479f-bfd7-019529e88dab","year":2021},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.175874Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:1befd688325058323f6c2ff7ccb9beb220e419716401826363f353e2946e41c0","observation_id":"590399c6-d6f6-404a-8f8a-70744b063820","resolution":{"observed_at":"2026-08-11T21:30:18.614924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.598957Z","title":"Octo: An open-source generalist robot policy","venue":null,"work_id":"df187d36-6feb-4e7e-87be-aaf377e7e238","year":2024},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.179458Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:bd343393008e7e6553bf0ebdcb0802b7b2711d4a4158e4406a94dc4d974d3571","observation_id":"f96e3868-d9cf-4090-89e3-24f4062d0c67","resolution":{"observed_at":"2026-08-11T21:30:18.602929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.588024Z","title":"Scaling cross-embodied learning: One policy for manipulation, navigation, lo- comotion and aviation","venue":null,"work_id":"cc30a192-da24-4fd3-9661-025ae6236fdd","year":2024},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.182975Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:a1d6f1c6c69dc9809879034ab26b45e8cfbcc34a1fecfcbe3217368d8b33034c","observation_id":"ead327bc-0b54-4785-84a6-aa6763529d22","resolution":{"observed_at":"2026-08-11T21:30:18.592189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.577160Z","title":"Pushing the limits of cross- embodiment learning for manipulation and navigation","venue":null,"work_id":"ccb69f4e-b74e-489f-b6e7-0d2ffec81ef8","year":2024},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.186581Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:d13c4086e345c12326e2de1ec9625fdb48c0dcb3caf93cd7f24db3b0dae3f8cc","observation_id":"8213583d-38df-4f8b-93f6-56352140919d","resolution":{"observed_at":"2026-08-11T21:30:18.580919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.566550Z","title":"Poliformer: Scaling on-policy rl with transformers results in mas- terful navigators","venue":null,"work_id":"2c70daf4-4e88-4384-918b-6393d38e5a2e","year":2024},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.190271Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:eec7da1423a3a7b4eddab755319221f9b08169d3b19fe085d4399bf8d01da574","observation_id":"61d3d485-36e4-4b27-a63d-8259bf2cd161","resolution":{"observed_at":"2026-08-11T21:30:18.570311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.554796Z","title":"Gnm: A general navigation model to drive any robot","venue":null,"work_id":"c2ced545-3748-466d-8bda-718794916961","year":2023},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.193977Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:b65ef3f9cb9cb310d80c1a242b1825446ed14e3e63b3088296606bb4cfb9558c","observation_id":"467acaa3-6b37-43ef-a20c-c5456742bbfc","resolution":{"observed_at":"2026-08-11T21:30:18.559163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:18.544727Z","title":"Nomad: Goal masked diffusion policies for navigation and exploration","venue":null,"work_id":"49300aaf-6e09-46d0-b9dd-fcb3c1c18635","year":2024},"citing_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:18.197698Z"},"links":{"citing_paper":"/paper/2412.04453"},"observation_digest":"sha256:9f2e826c49c9ebcb204d6d8f46c1808e74392c927507494e90e96c41729fbc57","observation_id":"f0ab59dc-4a01-4c91-8f96-9b5d706f4b89","resolution":{"observed_at":"2026-08-11T21:30:18.548094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":0,"verified_fuzzy":58},"total_outbound_references":122},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 100 of 122 outbound references and 79 inbound Pith citation observations for arXiv:2412.04453."}