{"as_of":"2026-08-22T06:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:61108e9ebdbcd40ddde7b2b0f2c736c787cde8736c246e75acc529346e2b70f4","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-30T20:42:04.352249Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.23504/citation-record","integrity":"/paper/2607.23504/integrity","json":"/paper/2607.23504/citation-record.json","paper":"/paper/2607.23504"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-30T20:42:02.541961Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:02.541961Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:e791ee18e1752e048ba4aae22e39feeafa63f0d18e75f2ff56996a98af2dd713","observation_id":"4249682e-8f12-4b2b-ae4f-320f69361e1c","resolution":{"observed_at":"2026-07-30T20:42:02.541961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:02.628557Z","title":"Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35: 23716–23736, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:02.628557Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:204a3003d15ac6f5e152694223c456ed2554c82b889522c08dfddf9baa3e021b","observation_id":"e67b5f55-f346-4833-8788-7def70da434e","resolution":{"observed_at":"2026-07-30T20:42:02.628557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:02.675416Z","title":"Etpnav: Evolving topological planning for vision-language navigation in continuous environments.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:02.675416Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:395a222ff1b86ce6826e64bd692282fc9038e420b7770d578cee7ca92b31cf14","observation_id":"c85c0990-00a8-4e6d-b5d4-ad78ce59a3fe","resolution":{"observed_at":"2026-07-30T20:42:02.675416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:02.715588Z","title":"Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:02.715588Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:e45dbaddf9ff74d338a8cf42faf49df491ea38efca4683a2fbf6096c2e84bbc0","observation_id":"166c0485-c004-449f-81b5-7ca6189cc13a","resolution":{"observed_at":"2026-07-30T20:42:02.715588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:02.785592Z","title":"Sim-to-real transfer for vision-and-language navigation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:02.785592Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:bdc7ef226ceb8043768eda96f645b3e7e8649d3a4ed078039518d7850dfa1b48","observation_id":"c924cc41-2f60-424d-9c01-ac2f39d972f8","resolution":{"observed_at":"2026-07-30T20:42:02.785592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-30T20:42:02.854773Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:02.854773Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:9ee5b6da2c33fce1dd19bd61c2890f9db2642b1dfdf9ba895ff9bf6b3158e672","observation_id":"17d349f9-9cfd-4e5f-a6e6-14f848601dc3","resolution":{"observed_at":"2026-07-30T20:42:02.854773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:02.903996Z","title":"Topological planning with transformers for vision-and-language navigation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:02.903996Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:097b79a63f4d6b5c837e64603d1206b40ec25014333c0c48266b037e147883ae","observation_id":"338138f6-32f2-45ea-a9a7-c25effd74dff","resolution":{"observed_at":"2026-07-30T20:42:02.903996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:02.981520Z","title":"Weakly-supervised multi-granularity map learning for vision-and-language navigation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:02.981520Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:81e570f01964bd173d1dfea7a5fd4b5270f333a74b371df604aac31b2b3eec3a","observation_id":"16cca270-3de1-432f-8d88-495bcdfd5430","resolution":{"observed_at":"2026-07-30T20:42:02.981520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-17T17:58:31.496050Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-30T20:42:03.068111Z","title":"Navila: Legged robot vision-language-action model for navigation.arXiv preprint arXiv:2412.04453, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:03.068111Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:cb7c98948645ffd094803ef5e6d1639db3b85f594202a0207b69701396e2d805","observation_id":"51a0af7a-2ead-4729-b06b-9357ef1cda00","resolution":{"observed_at":"2026-07-30T20:42:03.068111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-07-30T20:42:03.137249Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale.arXiv preprint arXiv:2010.11929, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:03.137249Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:8a8b419d00088a71959b277adebedd62e4436b04248d81a6e783363a16e51459","observation_id":"c86f0159-f8d6-4547-8650-1b13c692fc31","resolution":{"observed_at":"2026-07-30T20:42:03.137249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:03.197473Z","title":"Speaker- follower models for vision-and-language navigation.Advances in neural information processing systems, 31, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:03.197473Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:d0cd2322b1e9e91d094ac1e413ea76b7ac77d6131f7c212da7dc64df862dbf9f","observation_id":"94c847d0-1e6b-40a3-a78f-550293eed3ad","resolution":{"observed_at":"2026-07-30T20:42:03.197473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:03.241149Z","title":"Counterfactual vision-and-language navigation via adversarial path sampler","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:03.241149Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:913d5fde5e3e5ead9b1461103ebb61978429745c2f4fa5a9972d708279b25fed","observation_id":"4f368302-63c0-4c80-a8ba-595c46d7c586","resolution":{"observed_at":"2026-07-30T20:42:03.241149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:03.299565Z","title":"Cross-modal map learning for vision and language navigation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:03.299565Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:71fdcb813951d48c166dd16776ab75c5f3ab3b03ee3346da89826eb125d92761","observation_id":"e55bdd75-8713-4096-8559-266d6033c395","resolution":{"observed_at":"2026-07-30T20:42:03.299565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:03.349403Z","title":"Language and visual entity relationship graph for agent navigation.Advances in Neural Information Processing Systems, 33:7685–7696, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:03.349403Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:6a94e0419039fcd1e7b09c3d83ddcde9482a500585b19e5bdd882525a7caa536","observation_id":"270290de-cb87-4127-9f80-2746f625f5c3","resolution":{"observed_at":"2026-07-30T20:42:03.349403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:03.414738Z","title":"Bridging the gap between learning in discrete and continuous environments for vision-and-language navigation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:03.414738Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:c722d4080d10866b5640f48aecadb9b485fbc15f5825e464b0f396aa9281b5b7","observation_id":"a6b9bfce-89b2-4c02-971b-9be105d8bd8f","resolution":{"observed_at":"2026-07-30T20:42:03.414738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:03.492588Z","title":"Sim-2-sim transfer for vision-and-language navigation in con- tinuous environments","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:03.492588Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:b8be40a0e1d9f6a97478a4b9f1683dbfbe7e7533e707f460a0f50b35f2016ced","observation_id":"f11714af-b5db-4d05-8e1d-824a81b8b085","resolution":{"observed_at":"2026-07-30T20:42:03.492588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:03.547400Z","title":"Beyond the nav- graph: Vision-and-language navigation in continuous environments","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:03.547400Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:2bc0cf9e4ef2cf9236683014ccf0ed9448b6cc9ce7e66b54975daeb91936572e","observation_id":"3ebf72e2-17f2-4326-92d3-cde805daa004","resolution":{"observed_at":"2026-07-30T20:42:03.547400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:03.624402Z","title":"Waypoint models for instruction-guided navigation in continuous environments","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:03.624402Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:dfb38e77dbdcb0ece0e4d3800067c470dded40a290e1f521aa3f90ed5b07f52e","observation_id":"b69145a9-ff25-4ff7-a389-99f55bd69f92","resolution":{"observed_at":"2026-07-30T20:42:03.624402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:03.706075Z","title":"Room-across- room: Multilingual vision-and-language navigation with dense spatiotemporal grounding","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:03.706075Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:b822a7b636f98d7ff8a01c9fe7de9c65e8c3a22d11ba6677271b9dd20af698ec","observation_id":"830de76f-17a1-4e7d-9bae-0b9a47022a18","resolution":{"observed_at":"2026-07-30T20:42:03.706075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-22T00:56:08.009523Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-07-30T20:42:03.770114Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:03.770114Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:13396a62f7004c60e3c197de15a69da542fafb877c43614b1f1bc448fd548cd2","observation_id":"77161361-f183-4dea-b951-ef5468de47e1","resolution":{"observed_at":"2026-07-30T20:42:03.770114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:03.851911Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:03.851911Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:6f85a293f522247aa0ccdbb8ad8bcb380cb5442d04edc1395146c51402c8121d","observation_id":"05df4398-8db7-45a9-bdc6-e94aae7c0cc0","resolution":{"observed_at":"2026-07-30T20:42:03.851911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:03.945113Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:03.945113Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:54bd59a657f8e315b1830469a5c170e8de5f09d1109e299a77a3295baffee3e4","observation_id":"a1967f81-244f-4340-a806-6019a8046a72","resolution":{"observed_at":"2026-07-30T20:42:03.945113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:03.969709Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:03.969709Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:575323d5a440c5aead152011b6389e3215c683109edd8be5ee65a8fc80faff5e","observation_id":"6753bae8-a674-4081-8b2d-524570ad9582","resolution":{"observed_at":"2026-07-30T20:42:03.969709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04882","last_updated":"2024-06-07T12:26:34Z","snapshot_observed_at":"2026-08-16T13:45:10.310910Z","submitted_at":"2024-06-07T12:26:34Z","title":"InstructNav: Zero-shot System for Generic Instruction Navigation in Unexplored Environment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04882","snapshot_observed_at":"2026-07-30T20:42:04.019111Z","title":"Instructnav: Zero-shot system for generic instruction navigation in unexplored environment.arXiv preprint arXiv:2406.04882, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.019111Z"},"links":{"cited_paper":"/paper/2406.04882","citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:405178c4e6975de7b06bb25aa9ffcc372a5aec8377363e39b6a0724c970db370","observation_id":"bf81f264-832a-4a0b-9f3e-efb10f36af84","resolution":{"observed_at":"2026-07-30T20:42:04.019111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:04.124407Z","title":"Discuss before moving: Visual language navigation via multi-expert discussions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.124407Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:a89bc868afbf59c8bd4804195e316423100b3c8450fe350a89d969ce8a0e617a","observation_id":"ae4c0ceb-7a80-412a-87d0-b5379d9e0139","resolution":{"observed_at":"2026-07-30T20:42:04.124407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:04.151044Z","title":"Deepstack: Deeply stacking visual tokens is surprisingly simple and effective for lmms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.151044Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:8ae44ee2ef135f298986dd4aabc6ac1ff06e67faf43b73636983bda60891ddc5","observation_id":"80dd1ef7-0309-4364-90ea-9df1c482d955","resolution":{"observed_at":"2026-07-30T20:42:04.151044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:04.159862Z","title":"Reverie: Remote embodied visual referring expression in real indoor environments","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.159862Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:d619ca585cd2974d10b86d40ece1dadc04d5343e12baca1578ae6e88e259422c","observation_id":"0d68cc44-7ddd-4136-8f03-60e9ada92ccc","resolution":{"observed_at":"2026-07-30T20:42:04.159862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:04.170592Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.170592Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:4d56d180c9b8fbe1b99353aff25f6b4abbf8008797cec322185b9b7022f75d76","observation_id":"dfa1ae66-9b8d-43fe-b109-05de296d5261","resolution":{"observed_at":"2026-07-30T20:42:04.170592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08238","last_updated":"2021-09-16T22:01:24Z","snapshot_observed_at":"2026-08-15T09:50:41.483833Z","submitted_at":"2021-09-16T22:01:24Z","title":"Habitat-Matterport 3D Dataset (HM3D): 1000 Large-scale 3D Environments for Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08238","snapshot_observed_at":"2026-07-30T20:42:04.177491Z","title":"Habitat-matterport 3d dataset (hm3d): 1000 large-scale 3d environments for embodied ai.arXiv preprint arXiv:2109.08238, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.177491Z"},"links":{"cited_paper":"/paper/2109.08238","citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:e1689aef912152726ae34953bf547fa427cf32992552c88f99e52dc6af02ed3f","observation_id":"7d4bb9c3-83df-4640-be24-8a1c883918ee","resolution":{"observed_at":"2026-07-30T20:42:04.177491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:04.183795Z","title":"Language- aligned waypoint (law) supervision for vision-and-language navigation in continuous envi- ronments","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.183795Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:fc2b63cbdd19cfb8fbad041904322f7235177b1130818861f78cc241d2ca2eb1","observation_id":"8f7755a6-a814-45d4-b3b8-f6871d6fb957","resolution":{"observed_at":"2026-07-30T20:42:04.183795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:04.190707Z","title":"A reduction of imitation learning and structured prediction to no-regret online learning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.190707Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:1d00f3a7c2b2cd1de08f8d7631979c732d4a0c3f470f3aae94ca1f6fb8ed4c4e","observation_id":"0d9ce42f-e30e-4f61-a6a1-c1de52d2c815","resolution":{"observed_at":"2026-07-30T20:42:04.190707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:04.199713Z","title":"Habitat: A platform for embodied ai research","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.199713Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:3efb9c9c1beecfb69d0ebe7700d391c71d83778229c3fdc3500b59e41980aa09","observation_id":"13fd62c1-a987-4850-a83e-dbb1fbd4111b","resolution":{"observed_at":"2026-07-30T20:42:04.199713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:04.210468Z","title":"Learning to navigate unseen environments: Back translation with environmental dropout","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.210468Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:9e5b38c311eb4a4facc76b3e931799f92d987e0b2b6f3941c4bbb8a680a78aa9","observation_id":"84ea8eb2-66f5-4c3b-a52c-24283fcd70d0","resolution":{"observed_at":"2026-07-30T20:42:04.210468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-08-20T18:27:04.837880Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-07-30T20:42:04.226291Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.226291Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:16fdae887b340b09ea875280ed1b5ffccd3b1c91f7a919f7435f66fbf04712a9","observation_id":"3770f99d-138f-40ca-bceb-704b747b0121","resolution":{"observed_at":"2026-07-30T20:42:04.226291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:04.238540Z","title":"Vision-and-dialog navigation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.238540Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:337abdc9f33bd8f29afeec6e529bbfe27998cabf2e50467c24d31cca7a398bee","observation_id":"10b9fe1e-98db-47c8-bd49-2c27f023c4c8","resolution":{"observed_at":"2026-07-30T20:42:04.238540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-07-30T20:42:04.245014Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.245014Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:21a8b04129f97bb3cb9ae149fed799dfded124a0e8c4d286fb00ba737fb23a2e","observation_id":"591f0d4e-cbb9-43e2-a3ed-f029809c1d62","resolution":{"observed_at":"2026-07-30T20:42:04.245014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:04.256233Z","title":"Dreamwalker: Mental planning for continuous vision-language navigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.256233Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:f28e2a1218714fc215d75926b1e20789d3cb074abe42cbcee54c06bf6533f56b","observation_id":"08aaa791-0068-497c-8215-4577669021dc","resolution":{"observed_at":"2026-07-30T20:42:04.256233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-07-30T20:42:04.265665Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.265665Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:35d3c59eba0b1791063df1f4ec0698aef55729c5cd75df280797be7d81e23c50","observation_id":"b07c4916-dd03-4954-9ff0-9a49313f3033","resolution":{"observed_at":"2026-07-30T20:42:04.265665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:04.273325Z","title":"Gridmm: Grid memory map for vision-and-language navigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.273325Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:8b0fabd40d1523bf882538614079de69eca99e8ae0393570ddc3b9d9376e6fb1","observation_id":"b9ed50af-392c-4949-a1fb-6d13ddcc4585","resolution":{"observed_at":"2026-07-30T20:42:04.273325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:04.280485Z","title":"Lookahead exploration with neural radiance representation for continuous vision-language navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.280485Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:276c5d44a6c7c9528360b3c0ee26bd9f92e7969a2cc715a657ba0a410583b03c","observation_id":"96636e53-13ff-47ef-b6f8-59243aed4443","resolution":{"observed_at":"2026-07-30T20:42:04.280485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09798","last_updated":"2024-10-14T04:48:18Z","snapshot_observed_at":"2026-08-16T13:43:03.918674Z","submitted_at":"2024-06-14T07:50:09Z","title":"Sim-to-Real Transfer via 3D Feature Fields for Vision-and-Language Navigation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09798","snapshot_observed_at":"2026-07-30T20:42:04.289618Z","title":"Sim-to-real transfer via 3d feature fields for vision-and-language navigation.arXiv preprint arXiv:2406.09798, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.289618Z"},"links":{"cited_paper":"/paper/2406.09798","citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:e796c5d47573cedcb539e29d7e308d05f435daa21b92e660e1764c9d9a518227","observation_id":"0ff8670e-d957-4cdc-b122-94b3404acb98","resolution":{"observed_at":"2026-07-30T20:42:04.289618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:04.300070Z","title":"Scaling data generation in vision-and-language navigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.300070Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:b1473eb4a25a833c6e939e17a0f8d4409067cbc3b6b06f438dd72b8df2e609d2","observation_id":"997c602b-1ff2-4595-b5b4-bfde57e93136","resolution":{"observed_at":"2026-07-30T20:42:04.300070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-18T02:14:46.902275Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-30T20:42:04.312697Z","title":"Streamvln: Streaming vision-and-language navigation via slowfast context modeling.arXiv preprint arXiv:2507.05240, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.312697Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:086cde6980504fd9ebafa60db2fbdc92023fe2d74819217400f83c0bee764dad","observation_id":"5bd1de4b-18ff-4341-9a0f-39851b05a53f","resolution":{"observed_at":"2026-07-30T20:42:04.312697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:04.320554Z","title":"Gibson env: Real-world perception for embodied agents","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.320554Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:7649a70c3c6199c38e84a9bdd28be54e60b9fc9e9357caf5ff2ac2c23301fbcc","observation_id":"d85f88cc-a354-4a16-871c-53d9a16153ca","resolution":{"observed_at":"2026-07-30T20:42:04.320554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06224","last_updated":"2025-02-06T10:14:36Z","snapshot_observed_at":"2026-08-16T16:28:01.153501Z","submitted_at":"2024-12-09T05:55:55Z","title":"Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06224","snapshot_observed_at":"2026-07-30T20:42:04.329176Z","title":"Uni-navid: A video-based vision-language-action model for unifying embodied navigation tasks.arXiv preprint arXiv:2412.06224, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.329176Z"},"links":{"cited_paper":"/paper/2412.06224","citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:01c6dcdbe412125fd921c811429a7486129c8a53be4f7de79b14f42e757daee8","observation_id":"62381cda-58df-4449-8cfe-7b594c6a817f","resolution":{"observed_at":"2026-07-30T20:42:04.329176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15852","last_updated":"2024-06-30T11:14:13Z","snapshot_observed_at":"2026-08-18T12:12:42.503422Z","submitted_at":"2024-02-24T16:39:16Z","title":"NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15852","snapshot_observed_at":"2026-07-30T20:42:04.335446Z","title":"Navid: Video-based vlm plans the next step for vision-and-language navigation.arXiv preprint arXiv:2402.15852, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.335446Z"},"links":{"cited_paper":"/paper/2402.15852","citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:c61c4465fb7a73d792d4b7c4e30a7a56cca9d0abffb344fc5891bb21721b48ab","observation_id":"9018df27-be93-47a9-a72f-0f7de330cdc5","resolution":{"observed_at":"2026-07-30T20:42:04.335446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:04.343242Z","title":"Lyra: An efficient and speech-centric framework for omni-cognition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.343242Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:64af196661585b5de3f160283b94412d1ae688b64c3509d3b8c126d4cea10e5e","observation_id":"c87b155e-1dd5-4476-8cec-141e67f181fa","resolution":{"observed_at":"2026-07-30T20:42:04.343242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:04.352249Z","title":"Navgpt: Explicit reasoning in vision-and-language navigation with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.352249Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:6262308014ba435cc07889300df611437bc0205523077d8c12c89444d2eecb3c","observation_id":"bd217528-721c-44f4-9ff0-27980426c0c5","resolution":{"observed_at":"2026-07-30T20:42:04.352249Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T18:17:45.281076Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2607.23504."}