{"as_of":"2026-08-20T23:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:58513698335a523d110223402df342c37390b10de67975ccd40019075d0bbf9e","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T07:19:46.694802Z","state":"measured"},{"denominator":82,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":82,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T03:24:25.215191Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.10383","snapshot_observed_at":"2026-08-01T00:43:27.294478Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26148","last_updated":"2026-08-03T01:02:45Z","snapshot_observed_at":"2026-08-15T19:27:05.576020Z","submitted_at":"2026-07-28T18:00:34Z","title":"Embodied Agents Take Control: Minimal-Interface Zero-Shot Agents Rival Industrial-Scale Policies in Vision-and-Language Navigation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T00:43:27.294478Z"},"links":{"cited_paper":"/paper/2607.10383","citing_paper":"/paper/2607.26148"},"observation_digest":"sha256:80ff3d9f0e693509965f16acd4787f6169af86e9f320d852555ba8b39582593a","observation_id":"25261757-7e38-47d7-8624-7e27c07703b7","resolution":{"observed_at":"2026-08-01T00:43:27.294478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.10383","snapshot_observed_at":"2026-08-04T03:24:25.215191Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26148","last_updated":"2026-08-03T01:02:45Z","snapshot_observed_at":"2026-08-15T19:27:05.576020Z","submitted_at":"2026-07-28T18:00:34Z","title":"Embodied Agents Take Control: Minimal-Interface Zero-Shot Agents Rival Industrial-Scale Policies in Vision-and-Language Navigation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T03:24:25.215191Z"},"links":{"cited_paper":"/paper/2607.10383","citing_paper":"/paper/2607.26148"},"observation_digest":"sha256:67d79373e944188be283f0521a6bdffc5682ccebd5bba41537b279e9d33b3da4","observation_id":"3a8e0699-478c-4ebc-ae1a-20becba05d77","resolution":{"observed_at":"2026-08-04T03:24:25.215191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.10383/citation-record","integrity":"/paper/2607.10383/integrity","json":"/paper/2607.10383/citation-record.json","paper":"/paper/2607.10383"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2206.11610","last_updated":"2022-06-26T14:37:08Z","snapshot_observed_at":"2026-08-20T12:45:43.845008Z","submitted_at":"2022-06-23T10:36:53Z","title":"1st Place Solutions for RxR-Habitat Vision-and-Language Navigation Competition (CVPR 2022)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.11610","snapshot_observed_at":"2026-08-02T07:19:36.808445Z","title":"1st place solutions for rxr-habitat vision-and-language navigation competition (cvpr 2022).arXiv preprint arXiv:2206.11610, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:36.808445Z"},"links":{"cited_paper":"/paper/2206.11610","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:c04db9ed5ed2248897c59e4b00e452de0babf831a4c15ea9d7e101559a45a7af","observation_id":"adb8d8a6-5568-4bf9-b57d-d7983547f11e","resolution":{"observed_at":"2026-08-02T07:19:36.808445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:36.880741Z","title":"Etpnav: Evolving topological planning for vision-language navigation in continuous environments.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:36.880741Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:10706e0d97e9cf683de745aeec09a497b5227d7b723d6d9e338a19d07a031146","observation_id":"b6304653-9a51-4724-b28a-20db22fe21ce","resolution":{"observed_at":"2026-08-02T07:19:36.880741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:36.938706Z","title":"Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:36.938706Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:1b0e6671a935265fabc68e69a067686ffc24565eae04d82217766bc99197bbe9","observation_id":"ec2a35d4-3b96-4de9-9bfe-a61f76517456","resolution":{"observed_at":"2026-08-02T07:19:36.938706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-02T07:19:36.990464Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond.arXiv preprint arXiv:2308.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:36.990464Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:002d20d81f154693853b356d75ca6989abb72d2bba1a134b8461d2d8f5e9891f","observation_id":"53affc0d-cfba-4b9c-9336-f00b74a31862","resolution":{"observed_at":"2026-08-02T07:19:36.990464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.13171","last_updated":"2020-08-30T04:28:13Z","snapshot_observed_at":"2026-08-18T16:20:55.129945Z","submitted_at":"2020-06-23T17:18:54Z","title":"ObjectNav Revisited: On Evaluation of Embodied Agents Navigating to Objects","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.13171","snapshot_observed_at":"2026-08-02T07:19:37.070208Z","title":"Objectnav revisited: On evaluation of embodied agents navigating to objects.arXiv preprint arXiv:2006.13171, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:37.070208Z"},"links":{"cited_paper":"/paper/2006.13171","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:64876b95bb5f472dfa607132e1fbd1ebb5fed65d1da1d80a7b1b20846a05a0b3","observation_id":"0f34bf93-085e-4bd1-863e-09d364244fbe","resolution":{"observed_at":"2026-08-02T07:19:37.070208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:37.117575Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:37.117575Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:cd2774bee480c4e2e5c9221f80f343e6efce5a32339c25ddc95623e66ee413b6","observation_id":"826ef829-ab27-4aef-b0e6-544bf1774399","resolution":{"observed_at":"2026-08-02T07:19:37.117575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01953","last_updated":"2025-06-02T17:59:51Z","snapshot_observed_at":"2026-08-13T09:54:33.556478Z","submitted_at":"2025-06-02T17:59:51Z","title":"Fast-in-Slow: A Dual-System Foundation Model Unifying Fast Manipulation within Slow Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01953","snapshot_observed_at":"2026-08-02T07:19:37.181342Z","title":"Fast-in-slow: A dual-system foundation model unifying fast manipulation within slow reasoning.arXiv preprint arXiv:2506.01953, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:37.181342Z"},"links":{"cited_paper":"/paper/2506.01953","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:8a01ee0804c04a8ca0bf1801d0a239546df9ef39c88ef8eb9ef4fe2d42ef1a88","observation_id":"122a4698-8e1a-4fce-917b-11a3a3fad552","resolution":{"observed_at":"2026-08-02T07:19:37.181342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:37.263414Z","title":"Affordances-oriented planning using foundation models for continuous vision-language navigation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:37.263414Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:e13a81da1c71a399a8d4519f853e95ce024f6ba28bc34b4badbd0e20d721a5f4","observation_id":"86df4f93-2068-4319-ac8f-a1a774594377","resolution":{"observed_at":"2026-08-02T07:19:37.263414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.21714","last_updated":"2026-04-08T16:31:40Z","snapshot_observed_at":"2026-08-19T16:19:12.886023Z","submitted_at":"2025-12-25T15:31:24Z","title":"AstraNav-World: World Model for Foresight Control and Consistency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.21714","snapshot_observed_at":"2026-08-02T07:19:37.335878Z","title":"Astranav-world: World model for foresight control and consistency, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:37.335878Z"},"links":{"cited_paper":"/paper/2512.21714","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:27c126cb370a3774cd6f0f3d018ad3a1050ac335164df141eb1ad0edc95e1d08","observation_id":"5125dade-d346-4bec-bbc3-7e6a973086a1","resolution":{"observed_at":"2026-08-02T07:19:37.335878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:37.400923Z","title":"Topological planning with transformers for vision-and-language navigation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:37.400923Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:996eb80c16f9b3954ac9a00c9d47e5e583810db86c352357263568d805c9251f","observation_id":"c1e8090a-5e9b-4c25-bf3f-76865e3d3d62","resolution":{"observed_at":"2026-08-02T07:19:37.400923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:37.487932Z","title":"Weakly- supervised multi-granularity map learning for vision-and-language navigation.Advances in Neural Information Processing Systems, 35:38149–38161, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:37.487932Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:afc39389a07b342bb9b3ff0ad0545c9a3ba2647ccac5b70f2611df8494aaa762","observation_id":"ebb3fbdb-5ac6-4751-a227-0b18a806e801","resolution":{"observed_at":"2026-08-02T07:19:37.487932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:37.589776Z","title":"Explore like humans: Autonomous exploration with online sg-memo construction for embodied agents,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:37.589776Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:c6ff6a6a7b2440b0ed078b6d2fd60f5d58eca1886ae2ba53084f3ae1cbf716cb","observation_id":"9525adab-4ff2-4b9a-9be7-4ae88c9da44b","resolution":{"observed_at":"2026-08-02T07:19:37.589776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:37.754962Z","title":"Socialnav: Training human-inspired foundation model for socially-aware embodied navigation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:37.754962Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:8a0492dbc8187dacc0c8fce08d5e477a13281d938355264ac372c64b047aa2f7","observation_id":"ad62a71f-2a0d-447f-b742-d70398530c9a","resolution":{"observed_at":"2026-08-02T07:19:37.754962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:37.827587Z","title":"Socialnav: Training human-inspired foundation model for socially-aware embodied navigation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:37.827587Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:644380cb48e01ebd6b76ec25028d88202302c97ed115f019f4f57113dc7b60b3","observation_id":"d4cd4a0c-1303-4220-bb7c-e8301ad32e1f","resolution":{"observed_at":"2026-08-02T07:19:37.827587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:37.918214Z","title":"Spatialrgpt: Grounded spatial reasoning in vision-language models.Advances in Neural Information Processing Systems, 37:135062–135093, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:37.918214Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:4cdc15b455ef51358ff7d4794484ed8e1b2ca6febe5d4ec4d692f6246310c51c","observation_id":"111dc39e-bfdb-495e-839a-0f743d99968b","resolution":{"observed_at":"2026-08-02T07:19:37.918214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:37.960793Z","title":"Navila: Legged robot vision-language-action model for navigation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:37.960793Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:64d58a6105d76420f16c843b4adec0c68313d7433d03476a53c6e8a7017731da","observation_id":"2816f1cb-6124-4612-887f-33fc2ba2146c","resolution":{"observed_at":"2026-08-02T07:19:37.960793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07775","last_updated":"2024-07-12T14:37:08Z","snapshot_observed_at":"2026-08-16T13:35:23.650773Z","submitted_at":"2024-07-10T15:49:07Z","title":"Mobility VLA: Multimodal Instruction Navigation with Long-Context VLMs and Topological Graphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07775","snapshot_observed_at":"2026-08-02T07:19:38.021123Z","title":"Mobility vla: Multimodal instruction navigation with long-context vlms and topological graphs.arXiv preprint arXiv:2407.07775, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:38.021123Z"},"links":{"cited_paper":"/paper/2407.07775","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:5e92c0f4ddd3e1e42e174e1cf68cb217aa35fe6dc2689a4f3102fb77d26ba125","observation_id":"b23e3ce2-1839-463e-808a-8e25af104d0d","resolution":{"observed_at":"2026-08-02T07:19:38.021123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:38.081301Z","title":"Abot-n0: Technical report on the vla foundation model for versatile embodied navigation, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:38.081301Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:e703ca41f5782a89e040ee79f4e742b7c1c337eaa95d9a286b359374940837f9","observation_id":"4601b2dd-ff75-40ca-bb6f-ae604f0de3c0","resolution":{"observed_at":"2026-08-02T07:19:38.081301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:38.136227Z","title":"Vpn: Visual prompt navigation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:38.136227Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:1a3fcde99325472458acd1e2ac20f7489a749eb90e3898e68961a9b0f80eb837","observation_id":"b3dd50d3-e7b1-43d0-88b9-d4473b4f9f1d","resolution":{"observed_at":"2026-08-02T07:19:38.136227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:38.216170Z","title":"Helix: A vision-language-action model for generalist humanoid control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:38.216170Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:86fff343bc514edfd0e4663dd1f21cb070d577e3f47975126e90fd002a143248","observation_id":"891b3320-bfeb-4dff-ad9b-346ee9c97ece","resolution":{"observed_at":"2026-08-02T07:19:38.216170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.28237","last_updated":"2026-05-27T09:50:16Z","snapshot_observed_at":"2026-08-06T23:55:29.770936Z","submitted_at":"2026-05-27T09:50:16Z","title":"POINav: Benchmarking and Enhancing Final-Meters Arrival in Real-World Vision-Language Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.28237","snapshot_observed_at":"2026-08-02T07:19:38.321058Z","title":"Poinav: Benchmarking and enhancing final-meters arrival in real-world vision-language navigation.arXiv preprint arXiv:2605.28237, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:38.321058Z"},"links":{"cited_paper":"/paper/2605.28237","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:33256540a588d38e0b2bc437d81ee6a94ca6fcd6e9082ed2858d793eab23f447","observation_id":"3bbe455c-b2ac-4aee-81e2-8f0e24068f23","resolution":{"observed_at":"2026-08-02T07:19:38.321058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:38.370727Z","title":"Vision-and-language navigation: A survey of tasks, methods, and future directions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:38.370727Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:ec2447d87cd121e2312b59a3a6538364ef557175b15447230ab18122a8a922ca","observation_id":"84dc7f60-b8c4-40fa-9c95-7575481f4859","resolution":{"observed_at":"2026-08-02T07:19:38.370727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-02T07:19:38.433524Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:38.433524Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:4e49b4ecdee01aed6a13f082fb6cc10c0766c67c84d6469bfdd9399926bcd08a","observation_id":"83394366-1244-42e5-bc9a-e593ebae063d","resolution":{"observed_at":"2026-08-02T07:19:38.433524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:38.441120Z","title":"A novel vision-based tracking algorithm for a human-following mobile robot.IEEE Transactions on Systems, Man, and Cybernetics: Systems, 47(7):1415–1427, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:38.441120Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:0a53d91c5e6574b71dc0f1d22d93276f9eec814873ccec0de0891361e2a407db","observation_id":"faec5ddf-a971-4758-bd72-5d3f25e535ab","resolution":{"observed_at":"2026-08-02T07:19:38.441120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:38.449475Z","title":"Bridging the gap between learning in discrete and continuous environments for vision-and-language navigation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:38.449475Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:46348ccb90d88582ea8bbbce96d91d261f5148449aa3d3f0e3cf1c234b66b490","observation_id":"1bfa2779-a80d-4126-a669-60a79fa00688","resolution":{"observed_at":"2026-08-02T07:19:38.449475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-02T07:19:38.498013Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:38.498013Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:ae293ebb0c2aa8f057b79ea33288f2c69fe80917017a1c95ddcbfc30c124865e","observation_id":"74343176-14e1-443d-bf2a-69a4e3d1a491","resolution":{"observed_at":"2026-08-02T07:19:38.498013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:38.592299Z","title":"A comprehensive review of recent advancements in vision-and-language navigation.Discover Computing, 29(1):167, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:38.592299Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:336ce9ba71b6dcf535aa00fb58a0715cc25af61826d1897b0f6bab1068757c9e","observation_id":"eb18c568-df6a-4dcd-b467-c79204643797","resolution":{"observed_at":"2026-08-02T07:19:38.592299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:38.749263Z","title":"Sim-2-sim transfer for vision-and-language navigation in continuous environments","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:38.749263Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:71dc12afe9ba86954642b190cbf7c4bfe51a9ad77fcb86acf2d009b24141a0a2","observation_id":"a10459ff-3da6-4574-b3a3-2d57746b6d7e","resolution":{"observed_at":"2026-08-02T07:19:38.749263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:38.893334Z","title":"Beyond the nav-graph: Vision- and-language navigation in continuous environments","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:38.893334Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:e8d987624164ba7aea872ab1dcc2d256f650886eeea04c82d1bed08a7f66f64a","observation_id":"92565456-8fbb-4f8b-ba79-4abbee239075","resolution":{"observed_at":"2026-08-02T07:19:38.893334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:39.022007Z","title":"Waypoint models for instruction-guided navigation in continuous environments","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:39.022007Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:0bf27fc495201b9ac74d42b722e90f1028e061c1968f804d4fde13ebdb39d603","observation_id":"2e19769c-7526-40be-986e-9b7f4eaa3641","resolution":{"observed_at":"2026-08-02T07:19:39.022007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:39.190648Z","title":"Room-across-room: Multilingual vision-and-language navigation with dense spatiotemporal grounding","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:39.190648Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:62eac19554dafc385d9faddeba6f95541aa9d427fe76a5e4cac2a245d194dcc9","observation_id":"302cfabe-c7cb-4ee1-a8da-240a88e2ad90","resolution":{"observed_at":"2026-08-02T07:19:39.190648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:39.270648Z","title":"Large-scale model-enhanced vision-language navigation: Recent advances, practical applications, and future challenges.Sensors, 26(7):2022, 2026","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:39.270648Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:78ae2a658059d206406698d4e2645e61d47e7c0b33b9f3f3169f4b54a3768f0f","observation_id":"394ab79b-b505-4b3b-8678-4aa890450fdc","resolution":{"observed_at":"2026-08-02T07:19:39.270648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:39.467980Z","title":"Navcot: Boosting llm-based vision-and-language navigation via learning disentangled reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:39.467980Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:7cfe9688ebce8594c7f5c87adf2a001c19abcd747efda3b86e9c000b80c73d0f","observation_id":"ad0bed1f-a59d-45a7-ae5d-5c9f82e49d7e","resolution":{"observed_at":"2026-08-02T07:19:39.467980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:39.574382Z","title":"Conflict-averse gradient descent for multi-task learning.Advances in neural information processing systems, 34:18878–18890, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:39.574382Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:81c2b593d406d0760fa9bd608eb8e0594ab3c052d675cf60b6645e799697bf26","observation_id":"156c63b7-23f7-4127-b6c8-34bb149e5a5d","resolution":{"observed_at":"2026-08-02T07:19:39.574382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:39.691873Z","title":"Navforesee: A unified vision-language world model for hierarchical planning and dual-horizon navigation prediction","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:39.691873Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:036304dda90a6670d112e45dafcee22549aeb467cc516139f3ceb5fc05f71e7d","observation_id":"50477096-bb03-49b9-8cb8-4eaab3decd3a","resolution":{"observed_at":"2026-08-02T07:19:39.691873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:39.799646Z","title":"Navforesee: A unified vision-language world model for hierarchical planning and dual-horizon navigation prediction","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:39.799646Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:ebce7614fb810d36e18fcf0d7c154f1a397dca8bf5bbf2e7cd50ae6aae4755fc","observation_id":"90a00645-7917-432c-8dd8-0bb8d514a38d","resolution":{"observed_at":"2026-08-02T07:19:39.799646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:39.883480Z","title":"Trackvla++: Unleashing reasoning and memory capabilities in vla models for embodied visual tracking.arXiv preprint arXiv:2510.07134, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:39.883480Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:2676b0989c04bc94b8cdbf787639f6d44809ed779b0026188942d6279607f05a","observation_id":"ad2bda31-0b80-4a07-b4ce-0494b10127f7","resolution":{"observed_at":"2026-08-02T07:19:39.883480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:39.946903Z","title":"Citywalker: Learning embodied urban navigation from web-scale videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:39.946903Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:1c4e6fed6f5874982521c916d2ceaa1a38ae58d1d5360b5bf7de9ccc117eab59","observation_id":"2bd60e77-0852-4b8a-8f26-986ca9ea610c","resolution":{"observed_at":"2026-08-02T07:19:39.946903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04882","last_updated":"2024-06-07T12:26:34Z","snapshot_observed_at":"2026-08-16T13:45:10.310910Z","submitted_at":"2024-06-07T12:26:34Z","title":"InstructNav: Zero-shot System for Generic Instruction Navigation in Unexplored Environment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04882","snapshot_observed_at":"2026-08-02T07:19:40.032137Z","title":"Instructnav: Zero-shot system for generic instruction navigation in unexplored environment.arXiv preprint arXiv:2406.04882, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:40.032137Z"},"links":{"cited_paper":"/paper/2406.04882","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:a215ba15f0cdf7cb801db66a58d5cb4a1284d4733cf53dd822a81db5c213f121","observation_id":"5b425577-fa8e-4f88-904d-a268d96ded91","resolution":{"observed_at":"2026-08-02T07:19:40.032137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:40.091709Z","title":"Pivot: Iterative visual prompting elicits actionable knowledge for vlms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:40.091709Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:71ad78c2a5a804df8df1b0f4441c579885c35cd0742baba66acd2bc44b2c9e64","observation_id":"f1c82efe-76e2-4865-85bc-b0e94dae1bf4","resolution":{"observed_at":"2026-08-02T07:19:40.091709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-02T07:19:40.319034Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots.arXiv preprint arXiv:2503.14734, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:40.319034Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:a5c4d8eb412e3cd7fa2353ddd0b97a1e8fca0ac0a2e225ee7fa7ca8102a3cc4d","observation_id":"187b3f55-7677-4926-9bf6-ff4120c9f179","resolution":{"observed_at":"2026-08-02T07:19:40.319034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.05377","last_updated":"2026-06-28T10:51:16Z","snapshot_observed_at":"2026-08-16T17:45:39.746974Z","submitted_at":"2026-03-05T17:02:22Z","title":"OpenFrontier: General Navigation with Visual-Language Grounded Frontiers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.05377","snapshot_observed_at":"2026-08-02T07:19:40.471855Z","title":"Openfrontier: General navigation with visual-language grounded frontiers.arXiv preprint arXiv:2603.05377, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:40.471855Z"},"links":{"cited_paper":"/paper/2603.05377","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:6f2b4f0a0d71d264c0d7a0f85961b64e81ef97a5738d2b37d2329d27b36854d8","observation_id":"1e0dc0c5-6860-45b1-8596-bf19425790df","resolution":{"observed_at":"2026-08-02T07:19:40.471855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:40.601537Z","title":"Habitat: A platform for embodied ai research","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:40.601537Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:21fc34e0c45ec5a7c3e166eb23295ea998fa06171a75e8021dc44e0bca0ceb50","observation_id":"d087e6c2-8e6a-45eb-8ee1-879b33f5ea76","resolution":{"observed_at":"2026-08-02T07:19:40.601537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:40.794162Z","title":"Gnm: A general navigation model to drive any robot","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:40.794162Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:a3772dc5c6c40b02a97305c15478ec39387f5ca08951f9111d01ebd7a766601c","observation_id":"59ddb180-bbda-45af-b020-75ea7f9aff43","resolution":{"observed_at":"2026-08-02T07:19:40.794162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:41.001578Z","title":"Vint: A foundation model for visual navigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:41.001578Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:05f02556e2e02de58ef9174f7507f471ada5fb546fa5dc83624edafa95d15da2","observation_id":"597f69b9-bd76-43ca-b68d-50b2c5ad3eac","resolution":{"observed_at":"2026-08-02T07:19:41.001578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-08-02T07:19:41.156501Z","title":"Hi robot: Open-ended instruction following with hierarchical vision-language-action models.arXiv preprint arXiv:2502.19417, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:41.156501Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:f5ad3a27e1eecce5484431dbe6128792602ce8257e9e03b35eb8a62aa1c8729e","observation_id":"7cadf22a-03b2-4143-8bf3-e1a1e5b5c8d7","resolution":{"observed_at":"2026-08-02T07:19:41.156501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-16T20:20:00.967462Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-02T07:19:41.336447Z","title":"Hume: Introducing system-2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:41.336447Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:00ca2b02ba25fc0cd5249dd62868cb8f261cd508a7ca224ff0320486fc2994ad","observation_id":"5efd68fd-27c8-462e-ab83-5827f5d3a342","resolution":{"observed_at":"2026-08-02T07:19:41.336447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:41.436082Z","title":"Nomad: Goal masked diffusion policies for navigation and exploration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:41.436082Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:d8c09a2e7433728eabd50a14f73556a796f2c528a32205f9dead964d19d087e8","observation_id":"91b3af87-24f6-42c2-9a9f-42ec0f4198b5","resolution":{"observed_at":"2026-08-02T07:19:41.436082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:41.559440Z","title":"Emma-x: An embodied multimodal action model with grounded chain of thought and look-ahead spatial reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:41.559440Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:68780975e3b9f9a89acb9c072c0144af3855d6e425d9148c3f61d6089cf5332d","observation_id":"8a3f2dc4-a7f6-4331-a51e-a42b46d0a661","resolution":{"observed_at":"2026-08-02T07:19:41.559440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:41.747678Z","title":"Robobrain 2.0 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:41.747678Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:c3327336982198c3c326ee9f8792d3d2217be4bfc0cf3a08302a39e5e6fb7d12","observation_id":"0ddff957-a98c-47dc-a4ff-74feac8f942d","resolution":{"observed_at":"2026-08-02T07:19:41.747678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:41.949051Z","title":"Robobrain 2.5: Depth in sight, time in mind.arXiv preprint arXiv:2601.14352, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:41.949051Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:7b5ec89dc81ef333bc17dd2f63dc79acaf9648f9d95477912328b8c7e547aaaf","observation_id":"146d8fdc-2eca-462f-98c9-4d0503f45d03","resolution":{"observed_at":"2026-08-02T07:19:41.949051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:42.085991Z","title":"Drivevlm: The convergence of autonomous driving and large vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:42.085991Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:5fbab6e3b2bfc76fcd1623881cafeeba6f538abcfa709843d35c8a61e64dc9a6","observation_id":"c17b63ee-6b9e-4f45-9987-cd14d64924f9","resolution":{"observed_at":"2026-08-02T07:19:42.085991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:42.224826Z","title":"Dreamwalker: Mental planning for continuous vision-language navigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:42.224826Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:c54e9f6a148053550897f613aba3daa3bcd0f4cce3b302a136c7fdf728b82405","observation_id":"66d353e3-7077-4572-b75d-540e94739956","resolution":{"observed_at":"2026-08-02T07:19:42.224826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.30280","last_updated":"2026-06-01T13:48:35Z","snapshot_observed_at":"2026-08-18T14:09:54.189121Z","submitted_at":"2026-05-28T17:36:31Z","title":"Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.30280","snapshot_observed_at":"2026-08-02T07:19:42.400030Z","title":"Qwen-vla: Unifying vision-language-action modeling across tasks, environments, and robot embodiments.arXiv preprint arXiv:2605.30280, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:42.400030Z"},"links":{"cited_paper":"/paper/2605.30280","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:9526fcb8c97bf4cd6e29209cdec9afda9511b9b1c71eebde21da4e923b2938d4","observation_id":"441e92bc-1557-4a7d-a989-e32f160bb4ef","resolution":{"observed_at":"2026-08-02T07:19:42.400030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:42.537690Z","title":"Moge: Unlocking accurate monocular geometry estimation for open-domain images with optimal training supervision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:42.537690Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:718354b89bce1a4095f5bd04df64cc00ab3baa7d601c4ed504570394bdfe1711","observation_id":"7066ddf5-e0c3-4f18-b96d-5b2649a436d7","resolution":{"observed_at":"2026-08-02T07:19:42.537690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-20T18:23:48.973294Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23189","snapshot_observed_at":"2026-08-02T07:19:42.675991Z","title":"Trackvla: Embodied visual tracking in the wild.arXiv preprint arXiv:2505.23189, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:42.675991Z"},"links":{"cited_paper":"/paper/2505.23189","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:ba8643c596cfa913f019bc54c344607a837897e52c9f1e3c180d58ca69e0d4ac","observation_id":"d2a5e682-9c0f-4b86-b398-958e6ccf2a58","resolution":{"observed_at":"2026-08-02T07:19:42.675991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:42.887647Z","title":"Gridmm: Grid memory map for vision-and-language navigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:42.887647Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:987e5f9ec66b1fbc41bbe04037252f685e26818e64b0544d52c5e50af2711738","observation_id":"1d498e91-58a5-4e3f-abee-5514a3f38ab6","resolution":{"observed_at":"2026-08-02T07:19:42.887647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:43.042916Z","title":"Lookahead exploration with neural radiance representation for continuous vision-language navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:43.042916Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:ed7c94dcea3ae0088c0dcc84772fe4ad37c6f13c1b0d5410251c3924f88cd382","observation_id":"f5bd57f7-9021-4d13-9c35-84914e1681f7","resolution":{"observed_at":"2026-08-02T07:19:43.042916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:43.223398Z","title":"Chain-of-thought prompting elicits reasoning in large language models.Advances in neural information processing systems, 35:24824–24837, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:43.223398Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:415763d50b3205f91459034a0a47e38ea6e08f490b55c0f61b118bb6d80ed517","observation_id":"343b73d3-f947-49f5-af83-c92c35158c7b","resolution":{"observed_at":"2026-08-02T07:19:43.223398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:43.356041Z","title":"Ground slow, move fast: A dual-system foundation model for generalizable vision-and-language navigation.arXiv preprint arXiv:2512.08186, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:43.356041Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:0169cc8c4dee847036de142cf856ece906496ad886075522fc8180149dc264fb","observation_id":"13e2aa2c-7a73-4bdb-8fe8-13be17d0adbe","resolution":{"observed_at":"2026-08-02T07:19:43.356041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-18T02:14:46.902275Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-08-02T07:19:43.503753Z","title":"Streamvln: Streaming vision-and-language navigation via slowfast context modeling.arXiv preprint arXiv:2507.05240, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:43.503753Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:cf14e1b64180a2d4088c48b8d9cda790ee0cbd3785005ded3cb07cb67731f845","observation_id":"35ace54b-82f0-409c-bcfd-8e99ef9ab06b","resolution":{"observed_at":"2026-08-02T07:19:43.503753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:43.638832Z","title":"Nav-r2 dual-relation reasoning for generalizable open-vocabulary object-goal navigation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:43.638832Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:ac2d79d35741913e3df1ed65bfe9aa0993c95a0c0b4652088ec893a57e7cb6b3","observation_id":"4bc63c77-f5ad-48e3-b10e-f20deda7c58c","resolution":{"observed_at":"2026-08-02T07:19:43.638832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:43.887148Z","title":"Omninav: A unified framework for prospective exploration and visual-language navigation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:43.887148Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:1138c5f6cd205ce53e56c48e7f3a0a23d70602e0a5da07b825005dcb7eb18d22","observation_id":"f240ba48-7982-4785-a6eb-3933a3dfd00e","resolution":{"observed_at":"2026-08-02T07:19:43.887148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:44.163112Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:44.163112Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:5ec2ddd981807856d117ac255105e610b075668e32f3279e40f01a30d4bdd5e9","observation_id":"b3c11b26-4533-4378-870a-ed559ff17874","resolution":{"observed_at":"2026-08-02T07:19:44.163112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24086","last_updated":"2026-04-27T06:20:15Z","snapshot_observed_at":"2026-08-17T04:54:38.323034Z","submitted_at":"2026-04-27T06:20:15Z","title":"AsyncShield: A Plug-and-Play Edge Adapter for Asynchronous Cloud-based VLA Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.24086","snapshot_observed_at":"2026-08-02T07:19:44.848057Z","title":"Asyncshield: A plug-and-play edge adapter for asynchronous cloud-based vla navigation, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:44.848057Z"},"links":{"cited_paper":"/paper/2604.24086","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:14cc90e0c760fbabbb94fa6c03ee9ee35cbeb6f522b440324caf30a30aee9e88","observation_id":"f87437b6-e352-4f3e-88cb-186f17837e35","resolution":{"observed_at":"2026-08-02T07:19:44.848057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:44.595755Z","title":"Ce-nav: Flow-guided reinforcement refinement for cross-embodiment local navigation.arXiv preprint arXiv:2509.23203, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:44.595755Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:e35aa753168119b413f8badc9b2de0849a58e2bc57d919ace06c7c2e52908b01","observation_id":"fb7e05a8-f520-459b-ae16-e2e899d97805","resolution":{"observed_at":"2026-08-02T07:19:44.595755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:45.185975Z","title":"Gradient surgery for multi-task learning.Advances in neural information processing systems, 33:5824–5836, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:45.185975Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:66a63a7fbd62dbdd23eeb4f9436f324d6af4c1022683d1ea586cf7372e2bf06f","observation_id":"c5740e3e-0e1e-4ceb-84d7-b7bf2ee97dee","resolution":{"observed_at":"2026-08-02T07:19:45.185975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:45.033252Z","title":"Hm3d-ovon: A dataset and benchmark for open-vocabulary object goal navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:45.033252Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:36ade389724d219bd72c04c3605ca0516c9d084854a23a04da92b496c415ae5a","observation_id":"dd6cb1f0-d359-4913-aeb3-9fb9a95af901","resolution":{"observed_at":"2026-08-02T07:19:45.033252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:45.353049Z","title":"Robotic control via embodied chain-of-thought reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:45.353049Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:27e82b0c3d0bd7098937cbb504856c229ea4ac3a80a4fb97566dfb955acd7048","observation_id":"0032cf60-d307-4307-a2a7-0583942824a2","resolution":{"observed_at":"2026-08-02T07:19:45.353049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:45.272916Z","title":"Correctnav: Self-correction flywheel empowers vision-language-action navigation model","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:45.272916Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:4e0adda90940306aea5a46db603f88a7eabfa85754162bc0f8124f6cebfe5ecb","observation_id":"c1ffa229-320e-430d-820c-a04ef96401db","resolution":{"observed_at":"2026-08-02T07:19:45.272916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06224","last_updated":"2025-02-06T10:14:36Z","snapshot_observed_at":"2026-08-16T16:28:01.153501Z","submitted_at":"2024-12-09T05:55:55Z","title":"Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06224","snapshot_observed_at":"2026-08-02T07:19:45.554365Z","title":"Uni-navid: A video-based vision-language-action model for unifying embodied navigation tasks.arXiv preprint arXiv:2412.06224, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:45.554365Z"},"links":{"cited_paper":"/paper/2412.06224","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:fbae5ab5e7634cc00da0d11cff56e7073383115b46f6e506021468925a8b1ec5","observation_id":"bfdbe320-9b50-442c-89dc-f11389031e3d","resolution":{"observed_at":"2026-08-02T07:19:45.554365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20083","last_updated":"2024-06-28T17:51:10Z","snapshot_observed_at":"2026-08-18T16:20:24.999714Z","submitted_at":"2024-06-28T17:51:10Z","title":"PoliFormer: Scaling On-Policy RL with Transformers Results in Masterful Navigators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20083","snapshot_observed_at":"2026-08-02T07:19:45.435794Z","title":"Poliformer: Scaling on-policy rl with transformers results in masterful navigators.arXiv preprint arXiv:2406.20083, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:45.435794Z"},"links":{"cited_paper":"/paper/2406.20083","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:91b53fc5b8e39a3bad1028e1dc1ab311d2f2c308f8b564c1d7fc4439375f311a","observation_id":"f45fc376-bbdd-4e1b-bf69-de16055f0d5f","resolution":{"observed_at":"2026-08-02T07:19:45.435794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:45.893363Z","title":"Embodied navigation foundation model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:45.893363Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:b8254f5d0296d0fec6cfc5ca110e24a2a759e790be42e333ae5b264be46fd3bb","observation_id":"510c865f-b4da-407a-b17f-b9ddbceb467d","resolution":{"observed_at":"2026-08-02T07:19:45.893363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15852","last_updated":"2024-06-30T11:14:13Z","snapshot_observed_at":"2026-08-18T12:12:42.503422Z","submitted_at":"2024-02-24T16:39:16Z","title":"NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15852","snapshot_observed_at":"2026-08-02T07:19:45.694354Z","title":"Navid: Video-based vlm plans the next step for vision-and-language navigation.arXiv preprint arXiv:2402.15852, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:45.694354Z"},"links":{"cited_paper":"/paper/2402.15852","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:32675913b57cfab2bf94e5af13d389f9fbe89c9ec4930bc2ba679e9863f53965","observation_id":"84b45b46-bdc3-4a0e-bfa2-c00f9278b93b","resolution":{"observed_at":"2026-08-02T07:19:45.694354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:46.111431Z","title":"Cot-vla: Visual chain-of-thought reasoning for vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:46.111431Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:04a6a4d65cb21530ffb7ad502f161e9d340ada3b7183dbd201a280ee0a7dca92","observation_id":"c4a90c1c-ddee-426a-bd76-fac3191b2434","resolution":{"observed_at":"2026-08-02T07:19:46.111431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.18112","last_updated":"2026-06-29T05:42:10Z","snapshot_observed_at":"2026-08-15T10:08:47.759397Z","submitted_at":"2026-06-16T16:17:44Z","title":"Qwen-RobotNav Technical Report: A Scalable Navigation Model Designed for an Agentic Navigation System","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.18112","snapshot_observed_at":"2026-08-02T07:19:45.977650Z","title":"Qwen-robotnav technical report: A scalable navigation model designed for an agentic navigation system.arXiv preprint arXiv:2606.18112, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:45.977650Z"},"links":{"cited_paper":"/paper/2606.18112","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:6cfbd6d2a8ec4f956c125388c0b31e267ea39b9566144db819e25492d30ad2d5","observation_id":"59865f02-98db-450f-8038-67d1c7f55cd0","resolution":{"observed_at":"2026-08-02T07:19:45.977650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:46.494248Z","title":"Navgpt-2: Unleashing navigational reasoning capability for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:46.494248Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:22f3decc9cadb387d746a9e3642acd439c4eb2fbceddce633cd0def817c3d0d9","observation_id":"1b2f08d2-583e-427c-bc98-06e325f44c00","resolution":{"observed_at":"2026-08-02T07:19:46.494248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:46.276765Z","title":"Empowering embodied visual tracking with visual foundation models and offline rl","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:46.276765Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:6a93e955ae6935e05bd77c017a571ee609f203087193f19cb7be4b94cfa684aa","observation_id":"3c065a18-e89e-4221-b477-1683adbf7e21","resolution":{"observed_at":"2026-08-02T07:19:46.276765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:46.694802Z","title":"Fantasyvln: Unified multimodal chain-of-thought reasoning for vision-and-language navigation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:46.694802Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:dd1921451f5066eb9b3ae84b36c1532eb7801f8a62473dbeaa71e8c6596ff7b7","observation_id":"e57645ce-5f1f-40f3-8174-76c56f8fb83f","resolution":{"observed_at":"2026-08-02T07:19:46.694802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.19034","last_updated":"2026-04-21T03:35:31Z","snapshot_observed_at":"2026-08-18T17:41:09.517846Z","submitted_at":"2026-04-21T03:35:31Z","title":"Explore Like Humans: Autonomous Exploration with Online SG-Memo Construction for Embodied Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.19034","snapshot_observed_at":"2026-08-02T07:19:37.659711Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:37.659711Z"},"links":{"cited_paper":"/paper/2604.19034","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:224dbc516b375d0ce0247b0d0b27ce32731e5a2085919a05265c3bc7f2511a15","observation_id":"d5937e12-c0c7-4f15-b192-086bebb1c23e","resolution":{"observed_at":"2026-08-02T07:19:37.659711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T10:16:46.784385Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":80,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 2 inbound Pith citation observations for arXiv:2607.10383."}