{"as_of":"2026-08-19T13:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0befd869109612130899038d016074bbd03bc32b68c0637a7cbee2067a046a20","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:06:08.650648Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T15:39:59.878169Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16516","snapshot_observed_at":"2026-07-14T15:39:59.878169Z","title":"Think hierarchically, act dynamically: Hierarchical multi-modal fusion and reasoning for vision-and-language navigation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09792","last_updated":"2026-07-09T05:13:02Z","snapshot_observed_at":"2026-08-18T05:01:27.829335Z","submitted_at":"2026-07-09T05:13:02Z","title":"A Comprehensive Survey and Systematic Real-World Evaluation of Embodied Vision-and-Language Navigation","version":1},"reference_index":178,"source":"pdf_text","source_observed_at":"2026-07-14T15:39:59.878169Z"},"links":{"cited_paper":"/paper/2504.16516","citing_paper":"/paper/2607.09792"},"observation_digest":"sha256:2fd4ac1ade2643fe3dee3c5663ce258c4931e979cc50992bbebd2b40c4548fb3","observation_id":"225ef4b9-dcb8-461f-aef4-fa058b0ea40c","resolution":{"observed_at":"2026-07-14T15:39:59.878169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.16516/citation-record","integrity":"/paper/2504.16516/integrity","json":"/paper/2504.16516/citation-record.json","paper":"/paper/2504.16516"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:06:13.392054Z","title":null,"venue":null,"work_id":"698280c0-8f6c-4bf9-b939-159fe327af2e","year":null},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:07.466374Z"},"links":{"citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:26d4b1846a1d4ab5f371bd617eb472d1e794e0173ae569d36f5635ea5faa14f4","observation_id":"ad2bde14-9167-4cfa-860e-2bf1f689dd7a","resolution":{"observed_at":"2026-08-16T11:06:13.402502Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04385","last_updated":"2023-08-03T09:39:00Z","snapshot_observed_at":"2026-08-16T16:10:00.769704Z","submitted_at":"2022-12-08T16:27:54Z","title":"BEVBert: Multimodal Map Pre-training for Language-guided Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04385","snapshot_observed_at":"2026-08-16T11:06:07.499847Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:07.499847Z"},"links":{"cited_paper":"/paper/2212.04385","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:0c5caf3b16ae5e115cd6e69074830ee3c6803f3f55362bbef1832f0f22449536","observation_id":"d229a878-0958-4f5e-ba05-64aa8e326b0c","resolution":{"observed_at":"2026-08-16T11:06:07.499847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03047","last_updated":"2024-01-22T04:57:32Z","snapshot_observed_at":"2026-08-18T09:11:44.749036Z","submitted_at":"2023-04-06T13:07:17Z","title":"ETPNav: Evolving Topological Planning for Vision-Language Navigation in Continuous Environments","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03047","snapshot_observed_at":"2026-08-16T11:06:07.519988Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:07.519988Z"},"links":{"cited_paper":"/paper/2304.03047","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:eda872f339fb1d4f41cc1667e25f5a2d9922a5787aae6fe2004f702950eee77e","observation_id":"cbbb6cf6-be96-4af8-890c-d25497dd732d","resolution":{"observed_at":"2026-08-16T11:06:07.519988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.07280","last_updated":"2018-04-05T22:57:44Z","snapshot_observed_at":"2026-08-15T08:59:56.483834Z","submitted_at":"2017-11-20T12:17:47Z","title":"Vision-and-Language Navigation: Interpreting visually-grounded navigation instructions in real environments","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.07280","snapshot_observed_at":"2026-08-16T11:06:07.545272Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:07.545272Z"},"links":{"cited_paper":"/paper/1711.07280","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:d48ef7b3410ac75c7f6c9f63048b4b6cd01d385ecaa7eb54ce2f5120f26f4b29","observation_id":"1699d242-f2c4-4073-bb44-5310da61a438","resolution":{"observed_at":"2026-08-16T11:06:07.545272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:06:13.363191Z","title":null,"venue":null,"work_id":"94ab9476-6ddb-4479-92e0-bee6c9015cc1","year":2025},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:07.567473Z"},"links":{"citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:233872c28949ed770e1ea26835fd0846ed150b7604eb1964c653d8185db3b845","observation_id":"83d84284-080b-4280-ac67-b3196a929cf1","resolution":{"observed_at":"2026-08-16T11:06:13.373802Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.12256","last_updated":"2020-05-28T22:56:12Z","snapshot_observed_at":"2026-08-14T06:07:26.037866Z","submitted_at":"2020-05-25T17:56:29Z","title":"Neural Topological SLAM for Visual Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.12256","snapshot_observed_at":"2026-08-16T11:06:07.580851Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:07.580851Z"},"links":{"cited_paper":"/paper/2005.12256","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:c70e4bf4800b32d24fd7bca4d56c2b083b4a8496368114d4bcd60de991e51047","observation_id":"76b781b4-2837-441b-8948-d3e778045a1d","resolution":{"observed_at":"2026-08-16T11:06:07.580851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07997","last_updated":"2023-08-15T19:01:19Z","snapshot_observed_at":"2026-08-18T09:11:51.936392Z","submitted_at":"2023-08-15T19:01:19Z","title":"$A^2$Nav: Action-Aware Zero-Shot Robot Navigation by Exploiting Vision-and-Language Ability of Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07997","snapshot_observed_at":"2026-08-16T11:06:07.603723Z","title":"Li, Gaowen Liu, Mingkui Tan, and Chuang Gan","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:07.603723Z"},"links":{"cited_paper":"/paper/2308.07997","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:2de0ea00b85357e944994ec89014e4c4da8a39560b6e342b9c19e411310ead1c","observation_id":"07456b5e-b80a-434b-b619-dce90441f859","resolution":{"observed_at":"2026-08-16T11:06:07.603723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.13309","last_updated":"2023-08-17T22:42:07Z","snapshot_observed_at":"2026-08-18T09:10:39.774722Z","submitted_at":"2021-10-25T22:54:41Z","title":"History Aware Multimodal Transformer for Vision-and-Language Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.13309","snapshot_observed_at":"2026-08-16T11:06:07.655484Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:07.655484Z"},"links":{"cited_paper":"/paper/2110.13309","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:5bdcc44aebc69e5e6b601ec4df49189d7ce7a3f712b8cde75c18d2aaf3173713","observation_id":"b4b2cf3f-f1bd-4a7c-883d-2e17e46ea3b5","resolution":{"observed_at":"2026-08-16T11:06:07.655484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.11781","last_updated":"2022-08-24T21:50:20Z","snapshot_observed_at":"2026-08-18T09:11:04.030829Z","submitted_at":"2022-08-24T21:50:20Z","title":"Learning from Unlabeled 3D Environments for Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.11781","snapshot_observed_at":"2026-08-16T11:06:07.689040Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:07.689040Z"},"links":{"cited_paper":"/paper/2208.11781","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:2d1887b537ad5e92e2807ba222d3c67741bcd97c5859654f913d47d2e3790f4d","observation_id":"b67a72b3-0421-4514-baf4-26aba5c75063","resolution":{"observed_at":"2026-08-16T11:06:07.689040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.11742","last_updated":"2022-02-23T19:06:53Z","snapshot_observed_at":"2026-08-16T17:19:07.162531Z","submitted_at":"2022-02-23T19:06:53Z","title":"Think Global, Act Local: Dual-scale Graph Transformer for Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.11742","snapshot_observed_at":"2026-08-16T11:06:07.725653Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:07.725653Z"},"links":{"cited_paper":"/paper/2202.11742","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:9bb57587d0b090272611ff017f7505f33c29131dd2a90b065560f0baea31abef","observation_id":"b8b2441b-e7b6-41ef-8a64-1ddf14674b56","resolution":{"observed_at":"2026-08-16T11:06:07.725653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1411.5654","last_updated":"2014-11-20T19:50:27Z","snapshot_observed_at":"2026-08-17T16:04:42.789804Z","submitted_at":"2014-11-20T19:50:27Z","title":"Learning a Recurrent Visual Representation for Image Caption Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1411.5654","snapshot_observed_at":"2026-08-16T11:06:07.735728Z","title":"Lawrence Zitnick","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:07.735728Z"},"links":{"cited_paper":"/paper/1411.5654","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:8cba039be28c8f79f92e824e9c50ad979e39e1cc3bd094dadb49c1c18d008793","observation_id":"1e1ee716-811f-4b31-9131-ffe850d2293c","resolution":{"observed_at":"2026-08-16T11:06:07.735728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5194/isprs-archives-xlii-2-w7-339-2017","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:06:08.843469Z","title":null,"venue":null,"work_id":"64c254e3-a659-4cc3-953b-a23811e21a8d","year":2017},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:07.762304Z"},"links":{"citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:039f07dda7a6d17b8e9c995b4373e532a18f82b6c49e7a0f2b3489cbf825f0f9","observation_id":"b613b955-a92a-412f-9dbe-a47d9e473c88","resolution":{"observed_at":"2026-08-16T11:06:08.855981Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5194/isprs-archives-xlii-","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:06:08.815515Z","title":null,"venue":null,"work_id":"1c716e10-5883-4c70-9114-56626215b223","year":2018},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:07.773696Z"},"links":{"citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:6f0ed3e434b0ee2a7f367b21fee6f43778d4d47fce6e016b5b5da55b929afc9e","observation_id":"f3e73971-4aad-47a2-bab0-f63a60d3e4dd","resolution":{"observed_at":"2026-08-16T11:06:08.821752Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.3555","last_updated":"2014-12-11T06:46:53Z","snapshot_observed_at":"2026-08-13T10:35:27.214652Z","submitted_at":"2014-12-11T06:46:53Z","title":"Empirical Evaluation of Gated Recurrent Neural Networks on Sequence Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.3555","snapshot_observed_at":"2026-08-16T11:06:07.781958Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:07.781958Z"},"links":{"cited_paper":"/paper/1412.3555","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:f42c9981fd988b2f9e5cc4e72cb90a9ba0db31c591d4e81f182ee3f1d46dfadf","observation_id":"1d672bb8-3e73-4dad-bdb0-6fb7610b9bbd","resolution":{"observed_at":"2026-08-16T11:06:07.781958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-16T11:06:07.795967Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:07.795967Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:a37970f8c421ea15f44438cdb5e120368c79d0b47e17fbfac048504341307505","observation_id":"1d5d2ba6-6fd8-4009-bbf8-223048b0fe3d","resolution":{"observed_at":"2026-08-16T11:06:07.795967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13956","last_updated":"2024-05-28T04:44:06Z","snapshot_observed_at":"2026-08-18T09:10:37.690969Z","submitted_at":"2024-05-22T19:45:01Z","title":"Attention as an RNN","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13956","snapshot_observed_at":"2026-08-16T11:06:07.807285Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:07.807285Z"},"links":{"cited_paper":"/paper/2405.13956","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:8b1412634873ca72d1093dda21456a1464a9a7b2922d418b5317221ede9a090d","observation_id":"f785bb5c-c4c0-4b72-a556-09b5d95092fa","resolution":{"observed_at":"2026-08-16T11:06:07.807285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.02724","last_updated":"2018-10-27T01:38:56Z","snapshot_observed_at":"2026-08-15T01:51:23.677717Z","submitted_at":"2018-06-07T15:15:35Z","title":"Speaker-Follower Models for Vision-and-Language Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.02724","snapshot_observed_at":"2026-08-16T11:06:07.825790Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:07.825790Z"},"links":{"cited_paper":"/paper/1806.02724","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:d39227041bfbb7264d244f9641c7e85b2b7cf302a074ff18addfe61c30e99f0c","observation_id":"1f074f1b-cb63-4c14-a2f7-a12f78cb470d","resolution":{"observed_at":"2026-08-16T11:06:07.825790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:06:13.317594Z","title":null,"venue":null,"work_id":"1bdf938e-8fcb-440f-a3dd-a7e90703fb7c","year":2025},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:07.840213Z"},"links":{"citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:33b10ffcf3b77e9265e01319a303be7eec8e5299225bce5ff9169ccb9ac7db47","observation_id":"aa50d21b-507f-4a52-9e4a-7d3339078550","resolution":{"observed_at":"2026-08-16T11:06:13.328395Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.09105","last_updated":"2021-08-20T10:58:09Z","snapshot_observed_at":"2026-08-18T09:11:48.307056Z","submitted_at":"2021-08-20T10:58:09Z","title":"Airbert: In-domain Pretraining for Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.09105","snapshot_observed_at":"2026-08-16T11:06:07.854228Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:07.854228Z"},"links":{"cited_paper":"/paper/2108.09105","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:8e59abc46898fb13dceb5d0d614ced6b8c72ea5505ed590111d02e09f29d8986","observation_id":"261cb7a2-f8e1-4b8a-8998-531c649ba286","resolution":{"observed_at":"2026-08-16T11:06:07.854228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.10638","last_updated":"2020-04-05T03:20:31Z","snapshot_observed_at":"2026-08-18T09:11:01.271863Z","submitted_at":"2020-02-25T03:08:12Z","title":"Towards Learning a Generic Agent for Vision-and-Language Navigation via Pre-training","version":2},"cited_work":{"arxiv_id":"2002.10638","doi":null,"metadata_source":"pith","pith_arxiv_id":"2002.10638","snapshot_observed_at":"2026-08-16T11:06:11.902783Z","title":"Towards Learning a Generic Agent for Vision-and-Language Navigation via Pre-training","venue":"cs.CV","work_id":"eb2399d7-1ad8-48d9-9e16-39ac82204863","year":2020},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:07.868524Z"},"links":{"cited_paper":"/paper/2002.10638","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:60498be0487b8074467e4a5c0863f76594e2c8eb62cfc1de5427d36b6d8b5cc3","observation_id":"21de8b16-d1cd-4f1c-bdae-572ce1378f5d","resolution":{"observed_at":"2026-08-16T11:06:11.921926Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:06:07.879964Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:07.879964Z"},"links":{"citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:de3f8d2d1cc03750ec5ffe1399e35178d1b6ae231f0deb91b0f99707f6354675","observation_id":"135980a7-2e73-48fe-97d7-4637a5354f4c","resolution":{"observed_at":"2026-08-16T11:06:07.879964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13922","last_updated":"2021-03-28T11:45:58Z","snapshot_observed_at":"2026-08-18T10:23:42.560770Z","submitted_at":"2020-11-26T00:23:00Z","title":"A Recurrent Vision-and-Language BERT for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13922","snapshot_observed_at":"2026-08-16T11:06:07.911540Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:07.911540Z"},"links":{"cited_paper":"/paper/2011.13922","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:4a5cede12be4266078af2d20257dd1be8611f9e5b7a5c915b5d2b16a39ac136d","observation_id":"94a5d31c-75a6-4065-a4b7-39200e33d59f","resolution":{"observed_at":"2026-08-16T11:06:07.911540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3703632","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:06:08.761527Z","title":null,"venue":null,"work_id":"7988bc96-4856-461f-92c4-26d84a04020f","year":2024},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:07.926090Z"},"links":{"citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:07ee8f5843ac7128785cf28c8585fd825cbd5b9540db3fad3be8fb33c2b22ac9","observation_id":"b8b33199-7c83-4085-ad74-7e74a9f2280f","resolution":{"observed_at":"2026-08-16T11:06:08.775389Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:06:07.950393Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:07.950393Z"},"links":{"citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:32ef9ade888e3c03b8e8aca1104f048175c38b42f6b9aea72867640061e28375","observation_id":"4783f1ff-e4a5-481b-82a8-8e03baaf892e","resolution":{"observed_at":"2026-08-16T11:06:07.950393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.02818","last_updated":"2018-03-07T18:50:30Z","snapshot_observed_at":"2026-08-19T04:36:28.561253Z","submitted_at":"2018-03-07T18:50:30Z","title":"Path Planning and Navigation Inside Off-World Lava Tubes and Caves","version":1},"cited_work":{"arxiv_id":"1803.02818","doi":null,"metadata_source":"pith","pith_arxiv_id":"1803.02818","snapshot_observed_at":"2026-08-16T11:06:11.683670Z","title":"Path Planning and Navigation Inside Off-World Lava Tubes and Caves","venue":"cs.RO","work_id":"7adf5697-67c3-45f2-beba-e73ffaca2084","year":2018},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:07.976483Z"},"links":{"cited_paper":"/paper/1803.02818","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:ed9e78fea78472deee02247d81785fc9f80a7780a08dc29396b948e504963ec4","observation_id":"e50d9ea0-9b8b-4ff8-b1ff-33146436917b","resolution":{"observed_at":"2026-08-16T11:06:11.695926Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07954","last_updated":"2020-10-15T18:01:15Z","snapshot_observed_at":"2026-08-17T11:39:02.437980Z","submitted_at":"2020-10-15T18:01:15Z","title":"Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07954","snapshot_observed_at":"2026-08-16T11:06:07.991028Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:07.991028Z"},"links":{"cited_paper":"/paper/2010.07954","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:de839a2c79ff51a99520b2d5be0470d7b7c833329e7de6bcd2a3b7b49a0ad039","observation_id":"0d7707cf-d0f5-4175-a900-d79c67ba6587","resolution":{"observed_at":"2026-08-16T11:06:07.991028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:06:08.006053Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.006053Z"},"links":{"citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:37fd2049f6355d06a5ee2d226bddd6afb0561d636965ef635adc446d60f7b76b","observation_id":"70f74848-cae4-4864-ad8c-109592e8c126","resolution":{"observed_at":"2026-08-16T11:06:08.006053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15796","last_updated":"2023-03-28T08:00:46Z","snapshot_observed_at":"2026-08-19T13:04:00.652416Z","submitted_at":"2023-03-28T08:00:46Z","title":"KERM: Knowledge Enhanced Reasoning for Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":"2303.15796","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.15796","snapshot_observed_at":"2026-08-16T11:06:11.447288Z","title":"KERM: Knowledge Enhanced Reasoning for Vision-and-Language Navigation","venue":"cs.CV","work_id":"ce9429d2-d006-4f0f-8241-83af4a493ce6","year":2023},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.031009Z"},"links":{"cited_paper":"/paper/2303.15796","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:f05cd8b348a30ec83bbd1d8078052f286398bc558dbfaedea34d2e17604ebbcf","observation_id":"441333e6-66fd-4831-b682-33db62a7fdc3","resolution":{"observed_at":"2026-08-16T11:06:11.471905Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07376","last_updated":"2025-03-22T11:04:36Z","snapshot_observed_at":"2026-08-16T14:10:41.992728Z","submitted_at":"2024-03-12T07:27:02Z","title":"NavCoT: Boosting LLM-Based Vision-and-Language Navigation via Learning Disentangled Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07376","snapshot_observed_at":"2026-08-16T11:06:08.046318Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.046318Z"},"links":{"cited_paper":"/paper/2403.07376","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:23666c1d8c59dc05b69c79e8919e2246d122e2b05199557e42a536e640018482","observation_id":"bcc5dd8e-d0d9-4137-b4b1-7017aaa5eea9","resolution":{"observed_at":"2026-08-16T11:06:08.046318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.04949","last_updated":"2016-12-15T07:19:46Z","snapshot_observed_at":"2026-08-18T09:10:35.042677Z","submitted_at":"2016-12-15T07:19:46Z","title":"Recurrent Image Captioner: Describing Images with Spatial-Invariant Transformation and Attention Filtering","version":1},"cited_work":{"arxiv_id":"1612.04949","doi":null,"metadata_source":"pith","pith_arxiv_id":"1612.04949","snapshot_observed_at":"2026-08-16T11:06:11.274577Z","title":"Recurrent Image Captioner: Describing Images with Spatial-Invariant Transformation and Attention Filtering","venue":"cs.CV","work_id":"1ed0f069-37ac-477b-9ab2-19c057aa7dc6","year":2016},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.068118Z"},"links":{"cited_paper":"/paper/1612.04949","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:ec0a44f0ef9ec94239ec5da8e1443e988f15cae31200fac00f37a51d5a821e59","observation_id":"84fb2f0d-4f24-4747-8d8b-23609b7472e2","resolution":{"observed_at":"2026-08-16T11:06:11.285536Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03739","last_updated":"2025-04-01T11:38:01Z","snapshot_observed_at":"2026-08-18T09:11:48.367917Z","submitted_at":"2025-04-01T11:38:01Z","title":"A Unified Virtual Mixture-of-Experts Framework:Enhanced Inference and Hallucination Mitigation in Single-Model System","version":1},"cited_work":{"arxiv_id":"2504.03739","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.03739","snapshot_observed_at":"2026-08-16T11:06:11.193789Z","title":"A Unified Virtual Mixture-of-Experts Framework:Enhanced Inference and Hallucination Mitigation in Single-Model System","venue":"cs.CL","work_id":"c3258e5e-54ef-4840-b0d2-35205bf2b4a6","year":2025},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.075253Z"},"links":{"cited_paper":"/paper/2504.03739","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:c75a798eb176622511600b7dfd65e436f736d6dc86c341fa51ef1aaa51b8bee9","observation_id":"57c3f1ec-02a5-414d-bbcf-e26b1a9c6a87","resolution":{"observed_at":"2026-08-16T11:06:11.216778Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11382","last_updated":"2023-09-20T15:04:49Z","snapshot_observed_at":"2026-08-18T09:11:47.286590Z","submitted_at":"2023-09-20T15:04:49Z","title":"Discuss Before Moving: Visual Language Navigation via Multi-expert Discussions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11382","snapshot_observed_at":"2026-08-16T11:06:08.081330Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.081330Z"},"links":{"cited_paper":"/paper/2309.11382","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:f533cc65de70bb77f26f756b1107d7d0aafb7b2a7ce00af1e619a3420b2df65d","observation_id":"b2c26202-c90a-4a09-ab8f-8ae360e15ff8","resolution":{"observed_at":"2026-08-16T11:06:08.081330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:06:13.178485Z","title":null,"venue":null,"work_id":"79df2a13-dccf-46e1-8b3e-827263346b21","year":null},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.095462Z"},"links":{"citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:0e484acba36bacd4c93cdae6400458a977ec115f4f66d40b146e9b56131fd6bb","observation_id":"f2c6313f-9df0-47cc-8424-173814867035","resolution":{"observed_at":"2026-08-16T11:06:13.191179Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.14626","last_updated":"2020-07-29T06:32:18Z","snapshot_observed_at":"2026-08-18T09:10:34.080906Z","submitted_at":"2020-07-29T06:32:18Z","title":"Object-and-Action Aware Model for Visual Language Navigation","version":1},"cited_work":{"arxiv_id":"2007.14626","doi":null,"metadata_source":"pith","pith_arxiv_id":"2007.14626","snapshot_observed_at":"2026-08-16T11:06:10.959541Z","title":"Object-and-Action Aware Model for Visual Language Navigation","venue":"cs.CL","work_id":"e6dfa7a3-9b81-4338-b491-d9b86874bdab","year":2020},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.109456Z"},"links":{"cited_paper":"/paper/2007.14626","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:8b85b1da0f5e74e014e253df14f0efac33090adc328d7d3c54b66f9033178122","observation_id":"fd72d41c-dd0e-494e-adfb-c45570de4d55","resolution":{"observed_at":"2026-08-16T11:06:10.970570Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10151","last_updated":"2020-01-06T01:38:43Z","snapshot_observed_at":"2026-08-18T09:11:54.158607Z","submitted_at":"2019-04-23T04:45:28Z","title":"REVERIE: Remote Embodied Visual Referring Expression in Real Indoor Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10151","snapshot_observed_at":"2026-08-16T11:06:08.116380Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.116380Z"},"links":{"cited_paper":"/paper/1904.10151","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:0ef09124b63b43ca41984db7c728496441d0b004d65a49ebadbfc9f0983682b6","observation_id":"831aa656-4a58-4d4a-afb6-dd09264d5213","resolution":{"observed_at":"2026-08-16T11:06:08.116380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15916","last_updated":"2024-05-24T20:20:15Z","snapshot_observed_at":"2026-08-18T09:11:51.458016Z","submitted_at":"2024-05-24T20:20:15Z","title":"Recasting Generic Pretrained Vision Transformers As Object-Centric Scene Encoders For Manipulation Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15916","snapshot_observed_at":"2026-08-16T11:06:08.123049Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.123049Z"},"links":{"cited_paper":"/paper/2405.15916","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:364cfb5d80f66be1ebeec82440b6df011f5b6fddae9214b7686a774416600e57","observation_id":"3b2f1139-704a-4bd0-8d94-b0e4ca4b7d45","resolution":{"observed_at":"2026-08-16T11:06:08.123049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14143","last_updated":"2021-10-27T03:29:34Z","snapshot_observed_at":"2026-08-18T09:10:39.206946Z","submitted_at":"2021-10-27T03:29:34Z","title":"SOAT: A Scene- and Object-Aware Transformer for Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":"2110.14143","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.14143","snapshot_observed_at":"2026-08-16T11:06:11.019757Z","title":"SOAT: A Scene- and Object-Aware Transformer for Vision-and-Language Navigation","venue":"cs.CV","work_id":"5bb5981b-6c62-4304-917d-a5f75671cbe7","year":2021},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.103749Z"},"links":{"cited_paper":"/paper/2110.14143","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:6a17ce3d3e649b8ce941fad73b0b25557b1262dd14cceb6199a131937409d111","observation_id":"c9e23dcf-6252-45a1-9cc1-069232b0e70c","resolution":{"observed_at":"2026-08-16T11:06:11.043438Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10141","last_updated":"2023-08-20T03:00:20Z","snapshot_observed_at":"2026-08-18T09:11:45.734415Z","submitted_at":"2023-08-20T03:00:20Z","title":"March in Chat: Interactive Prompting for Remote Embodied Referring Expression","version":1},"cited_work":{"arxiv_id":"2308.10141","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.10141","snapshot_observed_at":"2026-08-16T11:06:10.694119Z","title":"March in Chat: Interactive Prompting for Remote Embodied Referring Expression","venue":"cs.CV","work_id":"8cd6131a-eece-40f5-923f-03e22912f7c6","year":2023},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.167772Z"},"links":{"cited_paper":"/paper/2308.10141","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:d679e03e04858ed2af636cb17e79b57a31d3ce8cc7ddb49c2ec7b2acdee50840","observation_id":"06e1335e-548d-41ef-8465-63e11fc42636","resolution":{"observed_at":"2026-08-16T11:06:10.710812Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10172","last_updated":"2023-08-20T05:55:30Z","snapshot_observed_at":"2026-08-19T10:28:04.702573Z","submitted_at":"2023-08-20T05:55:30Z","title":"VLN-PETL: Parameter-Efficient Transfer Learning for Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":"2308.10172","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.10172","snapshot_observed_at":"2026-08-16T11:06:10.601263Z","title":"VLN-PETL: Parameter-Efficient Transfer Learning for Vision-and-Language Navigation","venue":"cs.CV","work_id":"6e3f4a99-15d8-48ca-878a-bceba0920c29","year":2023},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.178251Z"},"links":{"cited_paper":"/paper/2308.10172","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:a90433645d4ce7b5f6750a51e21276f6c45555191009940a64fa0e753f02db61","observation_id":"f1a0d447-2f78-454d-ac06-a1c6046ac1e3","resolution":{"observed_at":"2026-08-16T11:06:10.623312Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:06:08.188880Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.188880Z"},"links":{"citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:c9a1c704aabce537c9f73950dce261304f61ab821da7f711f23806cce17f9346","observation_id":"0bb0f6c5-5ca4-4b97-a7b3-37e6fd35d0e6","resolution":{"observed_at":"2026-08-16T11:06:08.188880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:06:08.134321Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.134321Z"},"links":{"citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:c176f3d13ab2bf27450a8c53cd726227c60cf8d3d7eb1d55a72fe342c110c6b5","observation_id":"ecdcfc8d-187e-4d55-a105-b675384dcf3e","resolution":{"observed_at":"2026-08-16T11:06:08.134321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11591","last_updated":"2022-03-22T10:17:12Z","snapshot_observed_at":"2026-08-18T09:10:59.240244Z","submitted_at":"2022-03-22T10:17:12Z","title":"HOP: History-and-Order Aware Pre-training for Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":"2203.11591","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.11591","snapshot_observed_at":"2026-08-16T11:06:10.760690Z","title":"HOP: History-and-Order Aware Pre-training for Vision-and-Language Navigation","venue":"cs.CV","work_id":"4563279e-78e4-4db5-bec5-8e33010a216a","year":2022},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.146056Z"},"links":{"cited_paper":"/paper/2203.11591","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:7a4f5562014a6d85897b4f500af34766bf5ef8c300a6e2d23ffa66a2bfa181ab","observation_id":"e9681660-397b-4e88-bc12-9d36904536f4","resolution":{"observed_at":"2026-08-16T11:06:10.766474Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:06:08.219946Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.219946Z"},"links":{"citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:b738f4d8f597ba64336443989f0f6c80c25a434a885d5d586a1d8c2eb1c21dae","observation_id":"bf5812d1-e8c3-4b4a-9b7f-0d30a7e85e4a","resolution":{"observed_at":"2026-08-16T11:06:08.219946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06383","last_updated":"2021-07-13T20:48:12Z","snapshot_observed_at":"2026-08-18T14:41:48.442811Z","submitted_at":"2021-07-13T20:48:12Z","title":"How Much Can CLIP Benefit Vision-and-Language Tasks?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06383","snapshot_observed_at":"2026-08-16T11:06:08.225352Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.225352Z"},"links":{"cited_paper":"/paper/2107.06383","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:892b3a796cc8eda9034d0aa5938058d2e5cffec0d4b6fba6c6134957ca05c889","observation_id":"97c0c064-284a-460a-8817-3ea8b02238a3","resolution":{"observed_at":"2026-08-16T11:06:08.225352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01085","last_updated":"2025-01-02T06:05:59Z","snapshot_observed_at":"2026-08-15T22:14:17.772107Z","submitted_at":"2025-01-02T06:05:59Z","title":"Noise-Resilient Symbolic Regression with Dynamic Gating Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01085","snapshot_observed_at":"2026-08-16T11:06:08.233759Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.233759Z"},"links":{"cited_paper":"/paper/2501.01085","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:b730a0533bd6b1642d83f6e42883456d7fb8546fe617c562d614c162d5285984","observation_id":"37a1bb22-d106-4120-a957-9c4eda0dc0a0","resolution":{"observed_at":"2026-08-16T11:06:08.233759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-16T11:06:08.198688Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.198688Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:86472fcd9659f0e081024dbed71c907d6cbee7637d54c02ecc565d8696d7ea66","observation_id":"7f6650dc-ae82-476c-bc12-dc36c3f99b6f","resolution":{"observed_at":"2026-08-16T11:06:08.198688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.01497","last_updated":"2016-01-06T06:30:17Z","snapshot_observed_at":"2026-08-14T22:45:50.420062Z","submitted_at":"2015-06-04T07:58:34Z","title":"Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.01497","snapshot_observed_at":"2026-08-16T11:06:08.214231Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.214231Z"},"links":{"cited_paper":"/paper/1506.01497","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:6838e51ef5e786be030e9bc6bd8551824f3621b3ff6790db2308abfe47ee2abd","observation_id":"357441f2-3c70-4317-a7c1-c3da450c1bb3","resolution":{"observed_at":"2026-08-16T11:06:08.214231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.07490","last_updated":"2019-12-03T19:30:19Z","snapshot_observed_at":"2026-08-17T10:15:40.814612Z","submitted_at":"2019-08-20T17:05:18Z","title":"LXMERT: Learning Cross-Modality Encoder Representations from Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.07490","snapshot_observed_at":"2026-08-16T11:06:08.271871Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.271871Z"},"links":{"cited_paper":"/paper/1908.07490","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:aaba90f923f1b502f161ff4aa270acbfa9274d6dc43322dc74e16e8e5cbb24f3","observation_id":"0e56d0db-52be-481a-9240-371285628e17","resolution":{"observed_at":"2026-08-16T11:06:08.271871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.04195","last_updated":"2019-04-08T17:14:52Z","snapshot_observed_at":"2026-08-17T14:44:30.657958Z","submitted_at":"2019-04-08T17:14:52Z","title":"Learning to Navigate Unseen Environments: Back Translation with Environmental Dropout","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.04195","snapshot_observed_at":"2026-08-16T11:06:08.287416Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.287416Z"},"links":{"cited_paper":"/paper/1904.04195","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:a4945c1a1381ecc1819198233c52c55ae697fcddef95b2475514d24be0d6523e","observation_id":"affd29ba-7875-4ed6-91e9-7dc93c5db6cb","resolution":{"observed_at":"2026-08-16T11:06:08.287416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03454","last_updated":"2021-03-05T03:41:00Z","snapshot_observed_at":"2026-08-17T11:36:47.102276Z","submitted_at":"2021-03-05T03:41:00Z","title":"Structured Scene Memory for Vision-Language Navigation","version":1},"cited_work":{"arxiv_id":"2103.03454","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.03454","snapshot_observed_at":"2026-08-16T11:06:09.811873Z","title":"Structured Scene Memory for Vision-Language Navigation","venue":"cs.CV","work_id":"b133870d-5af5-4dac-be71-9f6dadef75ea","year":2021},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.303001Z"},"links":{"cited_paper":"/paper/2103.03454","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:ea6ee13ed3da8a8459701b13fad8cdde1e055f7321f401040a7af4b7907601bc","observation_id":"11977878-68ad-45d8-b322-28adfcc7d736","resolution":{"observed_at":"2026-08-16T11:06:09.830680Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.10132","last_updated":"2019-11-22T16:48:10Z","snapshot_observed_at":"2026-08-18T09:11:53.113718Z","submitted_at":"2019-11-22T16:48:10Z","title":"CRUR: Coupled-Recurrent Unit for Unification, Conceptualization and Context Capture for Language Representation -- A Generalization of Bi Directional LSTM","version":1},"cited_work":{"arxiv_id":"1911.10132","doi":null,"metadata_source":"pith","pith_arxiv_id":"1911.10132","snapshot_observed_at":"2026-08-16T11:06:10.043333Z","title":"CRUR: Coupled-Recurrent Unit for Unification, Conceptualization and Context Capture for Language Representation -- A Generalization of Bi Directional LSTM","venue":"cs.CL","work_id":"9ba862c3-0bea-462d-87cf-97b550e1cbe1","year":2019},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.239929Z"},"links":{"cited_paper":"/paper/1911.10132","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:82eeab94dd577f815094695e978ec0606b2bb076f7eb4066deca817150ac6118","observation_id":"96bb6cb5-1150-4a8f-a9c5-dbdff674ac49","resolution":{"observed_at":"2026-08-16T11:06:10.049623Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15644","last_updated":"2023-08-09T23:51:22Z","snapshot_observed_at":"2026-08-18T09:11:02.164743Z","submitted_at":"2023-07-28T16:03:28Z","title":"Scaling Data Generation in Vision-and-Language Navigation","version":2},"cited_work":{"arxiv_id":"2307.15644","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.15644","snapshot_observed_at":"2026-08-16T11:06:09.672903Z","title":"Scaling Data Generation in Vision-and-Language Navigation","venue":"cs.CV","work_id":"f4396c1b-e831-4187-a63c-7d7e4adb13fd","year":2023},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.353251Z"},"links":{"cited_paper":"/paper/2307.15644","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:8e04c5a672b8171b2be54a1cf3c5d735d0cb5898660dfc025322302b2e1938b0","observation_id":"6ed0e2ee-181d-415e-8439-11c324d558ea","resolution":{"observed_at":"2026-08-16T11:06:09.679691Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:06:13.009869Z","title":null,"venue":null,"work_id":"bd6a671a-ba49-4ca5-828a-e228254d14df","year":null},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.374966Z"},"links":{"citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:b8682674dec4e794fbcb779a29dc215123c8addd7ebb71626dbf3df64247c8d9","observation_id":"72cdfa28-fe1a-407c-a2db-9842fb1329ea","resolution":{"observed_at":"2026-08-16T11:06:13.033549Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09886","last_updated":"2022-04-17T11:29:52Z","snapshot_observed_at":"2026-08-17T15:04:54.298496Z","submitted_at":"2021-11-18T18:59:45Z","title":"SimMIM: A Simple Framework for Masked Image Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09886","snapshot_observed_at":"2026-08-16T11:06:08.394168Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.394168Z"},"links":{"cited_paper":"/paper/2111.09886","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:c7bc3a0b1dd82dbc41380fcbfb154e003ddcf7e84bd53eceee088bfe4156b973","observation_id":"4c801cb5-4993-4f15-936b-2da4a8541fb8","resolution":{"observed_at":"2026-08-16T11:06:08.394168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.10092","last_updated":"2019-04-06T05:43:50Z","snapshot_observed_at":"2026-08-18T09:11:04.025675Z","submitted_at":"2018-11-25T20:49:58Z","title":"Reinforced Cross-Modal Matching and Self-Supervised Imitation Learning for Vision-Language Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.10092","snapshot_observed_at":"2026-08-16T11:06:08.308245Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.308245Z"},"links":{"cited_paper":"/paper/1811.10092","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:3d4b43e83b4bffdf78e2ba6b7a9a740582d50ab8939473ba8ff69fc6b2b1f20a","observation_id":"4cd00b6b-5246-4199-8bc2-fbcce4a5c538","resolution":{"observed_at":"2026-08-16T11:06:08.308245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08409","last_updated":"2023-03-15T07:21:28Z","snapshot_observed_at":"2026-08-18T09:11:50.437637Z","submitted_at":"2023-03-15T07:21:28Z","title":"Lana: A Language-Capable Navigator for Instruction Following and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08409","snapshot_observed_at":"2026-08-16T11:06:08.331220Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.331220Z"},"links":{"cited_paper":"/paper/2303.08409","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:8d977c8745bd2797a7d8b52beeb7772645e371f206cf2c0e34f51f707cb4b306","observation_id":"a1be83a5-e4b6-423b-b63f-e15f0fe11d79","resolution":{"observed_at":"2026-08-16T11:06:08.331220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03921","last_updated":"2025-06-26T06:42:04Z","snapshot_observed_at":"2026-08-18T09:11:47.175548Z","submitted_at":"2025-03-05T21:42:46Z","title":"CREStE: Scalable Mapless Navigation with Internet Scale Priors and Counterfactual Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03921","snapshot_observed_at":"2026-08-16T11:06:08.441977Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.441977Z"},"links":{"cited_paper":"/paper/2503.03921","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:d959ec08638cd65e274b7fcfff501486d49a1f4ab253b45a52c65f961f78d930","observation_id":"1510ace9-ad89-4eae-a863-3734039aa2d6","resolution":{"observed_at":"2026-08-16T11:06:08.441977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03244","last_updated":"2023-08-07T01:43:25Z","snapshot_observed_at":"2026-08-18T09:11:52.511662Z","submitted_at":"2023-08-07T01:43:25Z","title":"Mind the Gap: Improving Success Rate of Vision-and-Language Navigation by Revisiting Oracle Success Routes","version":1},"cited_work":{"arxiv_id":"2308.03244","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.03244","snapshot_observed_at":"2026-08-16T11:06:09.362809Z","title":"Mind the Gap: Improving Success Rate of Vision-and-Language Navigation by Revisiting Oracle Success Routes","venue":"cs.CV","work_id":"22450878-40bd-4538-b346-f6fee90d1000","year":2023},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.472362Z"},"links":{"cited_paper":"/paper/2308.03244","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:e31e10742386005f9b8cb127c14af02e0ff3f5ea505f2c44e01a59c7d564397e","observation_id":"62eb3bd5-ec20-4cf0-84e3-42031a9cc4a4","resolution":{"observed_at":"2026-08-16T11:06:09.381039Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02010","last_updated":"2024-04-01T07:21:52Z","snapshot_observed_at":"2026-08-18T09:10:38.182354Z","submitted_at":"2023-12-04T16:32:51Z","title":"Towards Learning a Generalist Model for Embodied Navigation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02010","snapshot_observed_at":"2026-08-16T11:06:08.490229Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.490229Z"},"links":{"cited_paper":"/paper/2312.02010","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:7eb58d89f899816a73789191b92360bf07bf80d0a15dab384f537ff3e62fa684","observation_id":"16abc862-54ea-4c51-a9d6-2597265ca0c4","resolution":{"observed_at":"2026-08-16T11:06:08.490229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16986","last_updated":"2023-10-19T17:59:43Z","snapshot_observed_at":"2026-08-19T00:49:50.086891Z","submitted_at":"2023-05-26T14:41:06Z","title":"NavGPT: Explicit Reasoning in Vision-and-Language Navigation with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16986","snapshot_observed_at":"2026-08-16T11:06:08.513280Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.513280Z"},"links":{"cited_paper":"/paper/2305.16986","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:cf15f9ffccf69cf801cd8c5c64568b7318fccab468b88073038856d041c7ad92","observation_id":"680dd3e3-6a97-4acd-81c5-c69ce9912374","resolution":{"observed_at":"2026-08-16T11:06:08.513280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.04915","last_updated":"2019-08-14T01:44:50Z","snapshot_observed_at":"2026-08-19T10:39:07.435291Z","submitted_at":"2019-08-14T01:44:50Z","title":"HorNet: A Hierarchical Offshoot Recurrent Network for Improving Person Re-ID via Image Captioning","version":1},"cited_work":{"arxiv_id":"1908.04915","doi":null,"metadata_source":"pith","pith_arxiv_id":"1908.04915","snapshot_observed_at":"2026-08-16T11:06:09.515081Z","title":"HorNet: A Hierarchical Offshoot Recurrent Network for Improving Person Re-ID via Image Captioning","venue":"cs.CV","work_id":"0c43d0c2-2f60-470c-98e2-625b3db069ae","year":2019},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.403390Z"},"links":{"cited_paper":"/paper/1908.04915","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:8dc7e1f55e0d5ba8c239fb43c671c4bb84fd5b127438a2daa6067de59f002fe1","observation_id":"c78a99d6-3d91-4e8b-8325-1d2a8282ff18","resolution":{"observed_at":"2026-08-16T11:06:09.531885Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:06:08.434649Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.434649Z"},"links":{"citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:f60dcb4f2c7940ad51946c65c489981fa9999fbe7c6285954f62629d1035bfbf","observation_id":"629a6ed9-0ff3-4da5-8715-39635f527555","resolution":{"observed_at":"2026-08-16T11:06:08.434649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.07883","last_updated":"2020-04-01T04:24:49Z","snapshot_observed_at":"2026-08-18T09:10:59.693427Z","submitted_at":"2019-11-18T19:17:57Z","title":"Vision-Language Navigation with Self-Supervised Auxiliary Reasoning Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.07883","snapshot_observed_at":"2026-08-16T11:06:08.553062Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.553062Z"},"links":{"cited_paper":"/paper/1911.07883","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:9df5e0d840de563aa1a613bb8bf2dccd94c8656337f9f585d100e336336ec873","observation_id":"65e0daa8-089d-490b-b588-03f8bd86e74f","resolution":{"observed_at":"2026-08-16T11:06:08.553062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18800","last_updated":"2024-09-27T14:54:54Z","snapshot_observed_at":"2026-08-18T09:10:36.516078Z","submitted_at":"2024-09-27T14:54:54Z","title":"MiniVLN: Efficient Vision-and-Language Navigation by Progressive Knowledge Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18800","snapshot_observed_at":"2026-08-16T11:06:08.564391Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.564391Z"},"links":{"cited_paper":"/paper/2409.18800","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:3e7322be11deb542e38be8736e0b8bebc3beabbc27156a852c6ea354bccc808a","observation_id":"921ead16-f975-43fa-803e-44b0590a008e","resolution":{"observed_at":"2026-08-16T11:06:08.564391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:06:12.919459Z","title":null,"venue":null,"work_id":"cebcbf70-4caf-461a-8ebc-cec593644c81","year":null},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.618907Z"},"links":{"citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:c48eef17406c05dd7e19eddd4330fa32cff1b4e3c9f113868a9cbac7f5f382ac","observation_id":"9c2a6e2b-8c09-48ca-8185-22789570984a","resolution":{"observed_at":"2026-08-16T11:06:12.933474Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05728","last_updated":"2021-10-12T03:55:43Z","snapshot_observed_at":"2026-08-18T09:11:00.210479Z","submitted_at":"2021-10-12T03:55:43Z","title":"Rethinking the Spatial Route Prior in Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":"2110.05728","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.05728","snapshot_observed_at":"2026-08-16T11:06:09.117129Z","title":"Rethinking the Spatial Route Prior in Vision-and-Language Navigation","venue":"cs.CV","work_id":"54acf873-5f5d-4ff3-8a57-f8441ec3e813","year":2021},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.523214Z"},"links":{"cited_paper":"/paper/2110.05728","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:92a9454ca30badd77880aa2a98212092e1688a90eae8e24e4be503caeb9f4529","observation_id":"04ac7572-bd40-4b9a-937b-006744c2040e","resolution":{"observed_at":"2026-08-16T11:06:09.134252Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.17138","last_updated":"2021-10-15T10:22:14Z","snapshot_observed_at":"2026-08-17T11:39:21.327135Z","submitted_at":"2021-03-31T15:01:04Z","title":"SOON: Scenario Oriented Object Navigation with Graph-based Exploration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.17138","snapshot_observed_at":"2026-08-16T11:06:08.536657Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.536657Z"},"links":{"cited_paper":"/paper/2103.17138","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:ede6929f022fc6e1bf282e475550b22d4e6584ce88ce23a006297126a4e4db0f","observation_id":"e9637457-7f42-4258-aab7-3e97b9120167","resolution":{"observed_at":"2026-08-16T11:06:08.536657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.16561","last_updated":"2022-05-04T08:15:04Z","snapshot_observed_at":"2026-08-18T09:10:58.560810Z","submitted_at":"2021-03-30T17:59:07Z","title":"Diagnosing Vision-and-Language Navigation: What Really Matters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.16561","snapshot_observed_at":"2026-08-16T11:06:08.650648Z","title":"arXiv:2103.16561 [cs.CV] https://arxiv.org/abs/2103.16561","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.650648Z"},"links":{"cited_paper":"/paper/2103.16561","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:007181433369d32ad6470dbdfa025c35c4d765f7b1306cfc05aa55255b993b48","observation_id":"a0266dda-aa5c-4670-9b97-9556c5ee0a81","resolution":{"observed_at":"2026-08-16T11:06:08.650648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1603.02814","last_updated":"2016-12-16T11:44:34Z","snapshot_observed_at":"2026-08-18T09:10:35.720848Z","submitted_at":"2016-03-09T08:56:45Z","title":"Image Captioning and Visual Question Answering Based on Attributes and External Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1603.02814","snapshot_observed_at":"2026-08-16T11:06:08.382404Z","title":"arXiv:1603.02814 [cs.CV] https://arxiv.org/abs/1603.02814","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.382404Z"},"links":{"cited_paper":"/paper/1603.02814","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:93ad6aa928e448732c85ff76e852e537dd7915c125ffc5341a56ba36deb5c624","observation_id":"1045577f-c177-49b2-9635-45312d44d9f9","resolution":{"observed_at":"2026-08-16T11:06:08.382404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.09304","last_updated":"2020-12-25T02:43:43Z","snapshot_observed_at":"2026-08-19T10:26:33.005798Z","submitted_at":"2020-10-19T08:25:55Z","title":"Language and Visual Entity Relationship Graph for Agent Navigation","version":2},"cited_work":{"arxiv_id":"2010.09304","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.09304","snapshot_observed_at":"2026-08-16T11:06:11.831096Z","title":"Language and Visual Entity Relationship Graph for Agent Navigation","venue":"cs.CV","work_id":"ad1effdd-c15c-4deb-afa7-6d4e12196066","year":2020},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:07.895918Z"},"links":{"cited_paper":"/paper/2010.09304","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:613b52aa2ffdd2ff038cfd37f5a1799dd2839ca1d210ca957b3ab3f01712e8f1","observation_id":"e78ba485-dc43-4352-ba34-c8343d972f81","resolution":{"observed_at":"2026-08-16T11:06:11.845052Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.07201","last_updated":"2021-07-24T08:03:02Z","snapshot_observed_at":"2026-08-17T11:38:45.320491Z","submitted_at":"2021-07-15T09:11:02Z","title":"Neighbor-view Enhanced Model for Vision and Language Navigation","version":3},"cited_work":{"arxiv_id":"2107.07201","doi":null,"metadata_source":"pith","pith_arxiv_id":"2107.07201","snapshot_observed_at":"2026-08-16T11:06:12.827165Z","title":"Neighbor-view Enhanced Model for Vision and Language Navigation","venue":"cs.CV","work_id":"a1d125b7-77ec-4b98-9fa9-cfecb231cf2e","year":2021},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:07.489788Z"},"links":{"cited_paper":"/paper/2107.07201","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:de53cf955d90d01e2612b25c26eac8f8033912b5d256427835d18341fc24a398","observation_id":"1e71d1dd-ec98-4a18-8362-e41e2cf91132","resolution":{"observed_at":"2026-08-16T11:06:12.850825Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:06:07.963783Z","title":"In European Conference on Computer Vision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:07.963783Z"},"links":{"citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:937c405b377e7d4c330d4bf0c5da679058fb8c42be7752d7e58e98503309830a","observation_id":"f7419997-a4fa-4fcb-a4aa-0dab656b6e5b","resolution":{"observed_at":"2026-08-16T11:06:07.963783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":1,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":51,"verified_exact":16,"verified_fuzzy":0},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 1 inbound Pith citation observation for arXiv:2504.16516."}