{"as_of":"2026-08-15T20:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d445557e9001d3decbd753e16882da28d572e8120baaed7b1c19cbac14939931","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:13:35.477535Z","state":"measured"},{"denominator":96,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":96,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":29,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:28:52.281460Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-05T11:41:02.489833Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17221","snapshot_observed_at":"2026-08-05T23:56:04.195788Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.04597","last_updated":"2025-08-06T16:16:58Z","snapshot_observed_at":"2026-08-06T23:08:06.289351Z","submitted_at":"2025-08-06T16:16:58Z","title":"Pseudo Depth Meets Gaussian: A Feed-forward RGB SLAM Baseline","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T23:56:04.195788Z"},"links":{"cited_paper":"/paper/2506.17221","citing_paper":"/paper/2508.04597"},"observation_digest":"sha256:04d159bcdeff272bc95e35dccf9c27353c3395a6fab9804ddc8bcea50b8962ab","observation_id":"73c5e88f-7f8c-427d-a906-4abc614a6403","resolution":{"observed_at":"2026-08-05T23:56:04.195788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17221","snapshot_observed_at":"2026-08-04T17:31:42.089676Z","title":"Vln-r1: Vision- language navigation via reinforcement fine-tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-14T21:27:36.999902Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:42.089676Z"},"links":{"cited_paper":"/paper/2506.17221","citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:c42e0a49c7e7d51327fde58dd9ca1f39a06b81220fa6125047ce8b670eec2158","observation_id":"b85f0e97-f99f-4328-b6a6-3b51bc81b640","resolution":{"observed_at":"2026-08-04T17:31:42.089676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17221","snapshot_observed_at":"2026-08-04T17:00:45.020389Z","title":"Vln-r1: Vision- language navigation via reinforcement fine-tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11197","last_updated":"2025-09-14T09:54:20Z","snapshot_observed_at":"2026-08-13T10:14:57.766017Z","submitted_at":"2025-09-14T09:54:20Z","title":"DreamNav: A Trajectory-Based Imaginative Framework for Zero-Shot Vision-and-Language Navigation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T17:00:45.020389Z"},"links":{"cited_paper":"/paper/2506.17221","citing_paper":"/paper/2509.11197"},"observation_digest":"sha256:addba8c33121865e5d7e75054c923c85dfbcc5d0be191567cea53c3b5986d213","observation_id":"5618983b-961c-4d25-8831-f4de5fb791b7","resolution":{"observed_at":"2026-08-04T17:00:45.020389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17221","snapshot_observed_at":"2026-08-04T16:07:37.828525Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":140,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:37.828525Z"},"links":{"cited_paper":"/paper/2506.17221","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:53dbf23f0b0cd0e0cbfa5b3712d820977c735b0d0205b6040a5f5c37fcfe4423","observation_id":"aa6ee4d9-00b3-47dd-9ceb-a3d06dbea990","resolution":{"observed_at":"2026-08-04T16:07:37.828525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17221","snapshot_observed_at":"2026-08-03T19:24:39.321499Z","title":"Vln-r1: Vision-language navigation via reinforcement fine-tuning.arXiv preprint arXiv:2506.17221,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.00814","last_updated":"2026-05-27T04:00:29Z","snapshot_observed_at":"2026-08-15T02:47:40.693020Z","submitted_at":"2025-11-30T09:42:24Z","title":"IRPO: Boosting Image Restoration via Post-training GRPO","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T19:24:39.321499Z"},"links":{"cited_paper":"/paper/2506.17221","citing_paper":"/paper/2512.00814"},"observation_digest":"sha256:c59b749827a5da002ae52986264588f0576ba90ca7280c1d9477c6adaace9cb8","observation_id":"8f6d4493-0bc1-4a99-9994-6333f0c359cd","resolution":{"observed_at":"2026-08-03T19:24:39.321499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"cited_work":{"arxiv_id":"2506.17221","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.17221","snapshot_observed_at":"2026-07-05T11:41:02.489833Z","title":"Vln-r1: Vision-language navigation via reinforcement fine-tuning.arXiv preprint arXiv:2506.17221","venue":"cs.CV","work_id":"1de72e61-2884-4b01-abd8-bcf151cbd255","year":2025},"citing_paper":{"arxiv_id":"2512.08639","last_updated":"2026-04-15T10:58:19Z","snapshot_observed_at":"2026-08-14T11:46:29.720019Z","submitted_at":"2025-12-09T14:25:24Z","title":"Aerial Vision-Language Navigation with a Unified Framework for Spatial, Temporal and Embodied Reasoning","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T23:58:40.992942Z"},"links":{"cited_paper":"/paper/2506.17221","citing_paper":"/paper/2512.08639"},"observation_digest":"sha256:16e4d5546250d006dfa6492117e488c5c96c35a3f433ac75183c766470b64cb4","observation_id":"49bc9c5f-727f-4eb4-9bc8-98d0d5dd10a2","resolution":{"observed_at":"2026-05-16T23:58:42.589185Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"cited_work":{"arxiv_id":"2506.17221","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.17221","snapshot_observed_at":"2026-07-05T11:41:02.489833Z","title":"Vln-r1: Vision-language navigation via reinforcement fine-tuning.arXiv preprint arXiv:2506.17221","venue":"cs.CV","work_id":"1de72e61-2884-4b01-abd8-bcf151cbd255","year":2025},"citing_paper":{"arxiv_id":"2604.02870","last_updated":"2026-04-03T08:37:08Z","snapshot_observed_at":"2026-08-15T09:17:29.929096Z","submitted_at":"2026-04-03T08:37:08Z","title":"Token Warping Helps MLLMs Look from Nearby Viewpoints","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-13T21:07:55.062113Z"},"links":{"cited_paper":"/paper/2506.17221","citing_paper":"/paper/2604.02870"},"observation_digest":"sha256:5fe5a239a476319a4675d9329d2ae0428d2f95c056689d1b1b4a62bdbc83f408","observation_id":"6ef87bd5-bd44-4240-8069-7b85f724ef06","resolution":{"observed_at":"2026-05-13T21:08:17.442855Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"cited_work":{"arxiv_id":"2506.17221","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.17221","snapshot_observed_at":"2026-07-05T11:41:02.489833Z","title":"Vln-r1: Vision-language navigation via reinforcement fine-tuning.arXiv preprint arXiv:2506.17221","venue":"cs.CV","work_id":"1de72e61-2884-4b01-abd8-bcf151cbd255","year":2025},"citing_paper":{"arxiv_id":"2604.04108","last_updated":"2026-04-05T13:02:18Z","snapshot_observed_at":"2026-08-11T12:26:18.827851Z","submitted_at":"2026-04-05T13:02:18Z","title":"Hypothesis Graph Refinement: Hypothesis-Driven Exploration with Cascade Error Correction for Embodied Navigation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T17:05:57.205365Z"},"links":{"cited_paper":"/paper/2506.17221","citing_paper":"/paper/2604.04108"},"observation_digest":"sha256:ed67a93d97bc7ee8ab6cb1cacb18a5e487f098bc782f7340d9081dac421fa66c","observation_id":"818345e2-d07f-4a43-a906-1cca8202e0c9","resolution":{"observed_at":"2026-05-13T17:08:00.907219Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"cited_work":{"arxiv_id":"2506.17221","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.17221","snapshot_observed_at":"2026-07-05T11:41:02.489833Z","title":"Vln-r1: Vision-language navigation via reinforcement fine-tuning.arXiv preprint arXiv:2506.17221","venue":"cs.CV","work_id":"1de72e61-2884-4b01-abd8-bcf151cbd255","year":2025},"citing_paper":{"arxiv_id":"2604.06725","last_updated":"2026-04-08T06:47:55Z","snapshot_observed_at":"2026-08-14T08:44:19.626999Z","submitted_at":"2026-04-08T06:47:55Z","title":"Enhancing MLLM Spatial Understanding via Active 3D Scene Exploration for Multi-Perspective Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T19:16:46.753641Z"},"links":{"cited_paper":"/paper/2506.17221","citing_paper":"/paper/2604.06725"},"observation_digest":"sha256:e2b6355d6f2e31f828a3f17d2bc83f4f1ab1631529334345d79ea088b8192c44","observation_id":"fde93708-7efc-41f8-aaa4-f929867df094","resolution":{"observed_at":"2026-05-10T23:15:47.751455Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"cited_work":{"arxiv_id":"2506.17221","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.17221","snapshot_observed_at":"2026-07-05T11:41:02.489833Z","title":"Vln-r1: Vision-language navigation via reinforcement fine-tuning.arXiv preprint arXiv:2506.17221","venue":"cs.CV","work_id":"1de72e61-2884-4b01-abd8-bcf151cbd255","year":2025},"citing_paper":{"arxiv_id":"2604.08232","last_updated":"2026-04-09T13:22:24Z","snapshot_observed_at":"2026-08-11T03:15:12.857872Z","submitted_at":"2026-04-09T13:22:24Z","title":"HiRO-Nav: Hybrid ReasOning Enables Efficient Embodied Navigation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T17:01:13.350219Z"},"links":{"cited_paper":"/paper/2506.17221","citing_paper":"/paper/2604.08232"},"observation_digest":"sha256:d8025a9c6f226f3b67f7d74872ee7771fa2bf8252b90e30641356ce2705419a7","observation_id":"53443418-d67e-4f2a-9708-e9072ca1faf8","resolution":{"observed_at":"2026-05-11T07:41:01.531030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"cited_work":{"arxiv_id":"2506.17221","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.17221","snapshot_observed_at":"2026-07-05T11:41:02.489833Z","title":"Vln-r1: Vision-language navigation via reinforcement fine-tuning.arXiv preprint arXiv:2506.17221","venue":"cs.CV","work_id":"1de72e61-2884-4b01-abd8-bcf151cbd255","year":2025},"citing_paper":{"arxiv_id":"2604.17407","last_updated":"2026-04-19T12:30:22Z","snapshot_observed_at":"2026-08-15T00:39:33.214469Z","submitted_at":"2026-04-19T12:30:22Z","title":"Think before Go: Hierarchical Reasoning for Image-goal Navigation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-10T05:43:27.972164Z"},"links":{"cited_paper":"/paper/2506.17221","citing_paper":"/paper/2604.17407"},"observation_digest":"sha256:cc853d7fa5283a27ccdd56307b2c465914bffbc4fc126aa1da9045ff35582132","observation_id":"062ae992-5bef-4e9a-af06-a426058fbc1f","resolution":{"observed_at":"2026-05-10T05:51:10.485653Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"cited_work":{"arxiv_id":"2506.17221","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.17221","snapshot_observed_at":"2026-07-05T11:41:02.489833Z","title":"Vln-r1: Vision-language navigation via reinforcement fine-tuning.arXiv preprint arXiv:2506.17221","venue":"cs.CV","work_id":"1de72e61-2884-4b01-abd8-bcf151cbd255","year":2025},"citing_paper":{"arxiv_id":"2604.17473","last_updated":"2026-06-23T08:05:53Z","snapshot_observed_at":"2026-08-11T07:26:07.831204Z","submitted_at":"2026-04-19T15:03:38Z","title":"Dual-Anchoring: Addressing State Drift in Vision-Language Navigation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-10T06:50:34.310831Z"},"links":{"cited_paper":"/paper/2506.17221","citing_paper":"/paper/2604.17473"},"observation_digest":"sha256:2f78a93df85cd8b0db35496737bd5699c85e26b1a1ea51c91df933257e5b9277","observation_id":"d7e87bfa-b62d-4502-b272-c4e2f2ccce5b","resolution":{"observed_at":"2026-05-10T06:51:45.828270Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"cited_work":{"arxiv_id":"2506.17221","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.17221","snapshot_observed_at":"2026-07-05T11:41:02.489833Z","title":"Vln-r1: Vision-language navigation via reinforcement fine-tuning.arXiv preprint arXiv:2506.17221","venue":"cs.CV","work_id":"1de72e61-2884-4b01-abd8-bcf151cbd255","year":2025},"citing_paper":{"arxiv_id":"2604.18483","last_updated":"2026-07-01T12:23:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:35:57Z","title":"Steadily moving semi-infinite fracture in plane poroelasticity","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-05T11:39:05.686584Z"},"links":{"cited_paper":"/paper/2506.17221","citing_paper":"/paper/2604.18483"},"observation_digest":"sha256:7ef3c02de84bac11285701c317f17dfc17b965b10e2c6268c395ecb74e5ad948","observation_id":"9f612723-deee-4adf-a40e-1a7f51c2744e","resolution":{"observed_at":"2026-07-05T11:41:02.491147Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"cited_work":{"arxiv_id":"2506.17221","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.17221","snapshot_observed_at":"2026-07-05T11:41:02.489833Z","title":"Vln-r1: Vision-language navigation via reinforcement fine-tuning.arXiv preprint arXiv:2506.17221","venue":"cs.CV","work_id":"1de72e61-2884-4b01-abd8-bcf151cbd255","year":2025},"citing_paper":{"arxiv_id":"2604.18484","last_updated":"2026-04-20T16:37:16Z","snapshot_observed_at":"2026-08-10T23:34:51.220731Z","submitted_at":"2026-04-20T16:37:16Z","title":"XEmbodied: A Foundation Model with Enhanced Geometric and Physical Cues for Large-Scale Embodied Environments","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-10T05:46:36.865150Z"},"links":{"cited_paper":"/paper/2506.17221","citing_paper":"/paper/2604.18484"},"observation_digest":"sha256:15cb1f4bfa3265eb6af17e24f31bccf1ae8cdbb5f8bfa7a4af033f7000c0ac70","observation_id":"c75ecfb5-fb62-42f1-a8d0-f4067bd19a30","resolution":{"observed_at":"2026-05-10T05:51:10.296777Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"cited_work":{"arxiv_id":"2506.17221","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.17221","snapshot_observed_at":"2026-07-05T11:41:02.489833Z","title":"Vln-r1: Vision-language navigation via reinforcement fine-tuning.arXiv preprint arXiv:2506.17221","venue":"cs.CV","work_id":"1de72e61-2884-4b01-abd8-bcf151cbd255","year":2025},"citing_paper":{"arxiv_id":"2604.27620","last_updated":"2026-04-30T09:09:40Z","snapshot_observed_at":"2026-08-11T04:56:25.116086Z","submitted_at":"2026-04-30T09:09:40Z","title":"SpaAct: Spatially-Activated Transition Learning with Curriculum Adaptation for Vision-Language Navigation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-07T05:05:33.606975Z"},"links":{"cited_paper":"/paper/2506.17221","citing_paper":"/paper/2604.27620"},"observation_digest":"sha256:709caf81875167513df029d5342d3bb86f1c59a00ed58db09f4d799a051aaf11","observation_id":"e37d385e-ef1d-407e-acb5-948dbc1a8cc6","resolution":{"observed_at":"2026-05-12T10:36:31.243113Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"cited_work":{"arxiv_id":"2506.17221","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.17221","snapshot_observed_at":"2026-07-05T11:41:02.489833Z","title":"Vln-r1: Vision-language navigation via reinforcement fine-tuning.arXiv preprint arXiv:2506.17221","venue":"cs.CV","work_id":"1de72e61-2884-4b01-abd8-bcf151cbd255","year":2025},"citing_paper":{"arxiv_id":"2605.09146","last_updated":"2026-05-09T20:10:53Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:10:53Z","title":"Beyond Thinking: Imagining in 360$^\\circ$ for Humanoid Visual Search","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-12T02:58:46.728868Z"},"links":{"cited_paper":"/paper/2506.17221","citing_paper":"/paper/2605.09146"},"observation_digest":"sha256:72ab42108736d9bf10762f4adeac848d06d7799ca606d9c33a9a8bfbf130d38f","observation_id":"79ce5e0b-fb83-47c5-bf81-7c5e0cf19292","resolution":{"observed_at":"2026-05-12T03:01:18.332757Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"cited_work":{"arxiv_id":"2506.17221","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.17221","snapshot_observed_at":"2026-07-05T11:41:02.489833Z","title":"Vln-r1: Vision-language navigation via reinforcement fine-tuning.arXiv preprint arXiv:2506.17221","venue":"cs.CV","work_id":"1de72e61-2884-4b01-abd8-bcf151cbd255","year":2025},"citing_paper":{"arxiv_id":"2605.15964","last_updated":"2026-05-15T13:55:39Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T13:55:39Z","title":"WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T17:47:32.953903Z"},"links":{"cited_paper":"/paper/2506.17221","citing_paper":"/paper/2605.15964"},"observation_digest":"sha256:e545a826b7c1eba58017feac2894c8ef78a7d9e0c36b7b9fd8bacd32b90626b5","observation_id":"f66da04d-f31d-4ccc-9688-5ff8f158570e","resolution":{"observed_at":"2026-05-20T17:48:48.633274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"cited_work":{"arxiv_id":"2506.17221","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.17221","snapshot_observed_at":"2026-07-05T11:41:02.489833Z","title":"Vln-r1: Vision-language navigation via reinforcement fine-tuning.arXiv preprint arXiv:2506.17221","venue":"cs.CV","work_id":"1de72e61-2884-4b01-abd8-bcf151cbd255","year":2025},"citing_paper":{"arxiv_id":"2605.22816","last_updated":"2026-05-21T17:58:26Z","snapshot_observed_at":"2026-08-15T08:15:33.417798Z","submitted_at":"2026-05-21T17:58:26Z","title":"AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-22T04:46:03.020800Z"},"links":{"cited_paper":"/paper/2506.17221","citing_paper":"/paper/2605.22816"},"observation_digest":"sha256:6b41d277ef28ab0b4224a24f5b7c1f05704b02a666a6b5c141ac690edcc6907a","observation_id":"0ce6c4d5-b991-4c1b-a393-9f1103944045","resolution":{"observed_at":"2026-05-22T04:46:04.568388Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"cited_work":{"arxiv_id":"2506.17221","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.17221","snapshot_observed_at":"2026-07-05T11:41:02.489833Z","title":"Vln-r1: Vision-language navigation via reinforcement fine-tuning.arXiv preprint arXiv:2506.17221","venue":"cs.CV","work_id":"1de72e61-2884-4b01-abd8-bcf151cbd255","year":2025},"citing_paper":{"arxiv_id":"2605.24578","last_updated":"2026-05-23T13:42:35Z","snapshot_observed_at":"2026-08-15T18:55:39.486592Z","submitted_at":"2026-05-23T13:42:35Z","title":"World Models as Group Actions","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:42.720825Z"},"links":{"cited_paper":"/paper/2506.17221","citing_paper":"/paper/2605.24578"},"observation_digest":"sha256:2170cc839ca5bec365e99b4f2b1670728e9731631cbf310b44e63479ec56fe4e","observation_id":"8da6f638-a852-4621-a212-12dc15632643","resolution":{"observed_at":"2026-06-30T13:24:40.331396Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"cited_work":{"arxiv_id":"2506.17221","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.17221","snapshot_observed_at":"2026-07-05T11:41:02.489833Z","title":"Vln-r1: Vision-language navigation via reinforcement fine-tuning.arXiv preprint arXiv:2506.17221","venue":"cs.CV","work_id":"1de72e61-2884-4b01-abd8-bcf151cbd255","year":2025},"citing_paper":{"arxiv_id":"2606.00095","last_updated":"2026-05-25T08:53:21Z","snapshot_observed_at":"2026-08-02T11:09:28.452176Z","submitted_at":"2026-05-25T08:53:21Z","title":"Bridging the 2D-3D Gap: A Hierarchical Semantic-Geometric Map for Vision Language Navigation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T22:33:32.671550Z"},"links":{"cited_paper":"/paper/2506.17221","citing_paper":"/paper/2606.00095"},"observation_digest":"sha256:3f185a72bb369e834b9da4aedd296d1d3af126ad318fc1759f1c331fcfd285a9","observation_id":"ed9be44b-6172-4d41-b974-7b2b4d67a4ed","resolution":{"observed_at":"2026-06-29T22:34:01.336932Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"cited_work":{"arxiv_id":"2506.17221","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.17221","snapshot_observed_at":"2026-07-05T11:41:02.489833Z","title":"Vln-r1: Vision-language navigation via reinforcement fine-tuning.arXiv preprint arXiv:2506.17221","venue":"cs.CV","work_id":"1de72e61-2884-4b01-abd8-bcf151cbd255","year":2025},"citing_paper":{"arxiv_id":"2606.00963","last_updated":"2026-05-31T02:36:57Z","snapshot_observed_at":"2026-08-12T21:36:08.386386Z","submitted_at":"2026-05-31T02:36:57Z","title":"Reasmory: 3D Reconstruction as Explicit Memory for VLMs Spatial Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T17:46:21.821764Z"},"links":{"cited_paper":"/paper/2506.17221","citing_paper":"/paper/2606.00963"},"observation_digest":"sha256:fa1d6af26831ee966de144b76a989394663a8152f98783a42a8a7e1b84ccbd18","observation_id":"b0a0df41-f434-4da9-90ef-c03458f72283","resolution":{"observed_at":"2026-07-01T20:46:13.683917Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"cited_work":{"arxiv_id":"2506.17221","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.17221","snapshot_observed_at":"2026-07-05T11:41:02.489833Z","title":"Vln-r1: Vision-language navigation via reinforcement fine-tuning.arXiv preprint arXiv:2506.17221","venue":"cs.CV","work_id":"1de72e61-2884-4b01-abd8-bcf151cbd255","year":2025},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-08-09T21:32:00.358889Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"cited_paper":"/paper/2506.17221","citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:45ffe40fcf452137ba2db929d4421e2c1a0effc3e84f4ed1b4e3a0fa1a1a513e","observation_id":"59072d98-3d15-47d9-b66f-d43b0980ef2a","resolution":{"observed_at":"2026-07-01T22:16:15.779796Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"cited_work":{"arxiv_id":"2506.17221","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.17221","snapshot_observed_at":"2026-07-05T11:41:02.489833Z","title":"Vln-r1: Vision-language navigation via reinforcement fine-tuning.arXiv preprint arXiv:2506.17221","venue":"cs.CV","work_id":"1de72e61-2884-4b01-abd8-bcf151cbd255","year":2025},"citing_paper":{"arxiv_id":"2606.07244","last_updated":"2026-06-05T13:11:39Z","snapshot_observed_at":"2026-08-14T02:17:00.031248Z","submitted_at":"2026-06-05T13:11:39Z","title":"Beyond Waypoints: A Trajectory-Centric Waypointing Paradigm for Vision-Language Navigation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T21:40:58.329546Z"},"links":{"cited_paper":"/paper/2506.17221","citing_paper":"/paper/2606.07244"},"observation_digest":"sha256:b7f4e3209623e4d0e8b8785b2cc5e85eb5ec1404fef965aa96d4d8b6ef5d9cd8","observation_id":"39828a1e-b0db-486a-b879-ad91aba9459b","resolution":{"observed_at":"2026-07-02T19:07:17.765948Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"cited_work":{"arxiv_id":"2506.17221","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.17221","snapshot_observed_at":"2026-07-05T11:41:02.489833Z","title":"Vln-r1: Vision-language navigation via reinforcement fine-tuning.arXiv preprint arXiv:2506.17221","venue":"cs.CV","work_id":"1de72e61-2884-4b01-abd8-bcf151cbd255","year":2025},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":239,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2506.17221","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:24a73d48cc788ee55f186bb1681cc544b25e90d16dbf811511ad8cb94b4b7a18","observation_id":"9ee761ed-2ee7-4e27-8aab-274aa4eee27c","resolution":{"observed_at":"2026-07-02T17:27:15.728048Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"cited_work":{"arxiv_id":"2506.17221","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.17221","snapshot_observed_at":"2026-07-05T11:41:02.489833Z","title":"Vln-r1: Vision-language navigation via reinforcement fine-tuning.arXiv preprint arXiv:2506.17221","venue":"cs.CV","work_id":"1de72e61-2884-4b01-abd8-bcf151cbd255","year":2025},"citing_paper":{"arxiv_id":"2607.01754","last_updated":"2026-07-02T06:11:07Z","snapshot_observed_at":"2026-08-02T15:41:12.241586Z","submitted_at":"2026-07-02T06:11:07Z","title":"Path-level Hindsight Instructions for Semantic Exploration in Vision-Language Navigation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-03T14:04:46.400336Z"},"links":{"cited_paper":"/paper/2506.17221","citing_paper":"/paper/2607.01754"},"observation_digest":"sha256:43413755a627059b3afc2360d02faea0ca3d5b1fccd56ceea6e8ac234ae8ecdb","observation_id":"afdb57f2-0228-4d53-b770-cbc3316ed17e","resolution":{"observed_at":"2026-07-03T14:08:21.390625Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17221","snapshot_observed_at":"2026-07-14T15:39:59.878169Z","title":"Vln-r1: Vision-language navigation via reinforcement fine-tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09792","last_updated":"2026-07-09T05:13:02Z","snapshot_observed_at":"2026-08-15T10:10:21.526886Z","submitted_at":"2026-07-09T05:13:02Z","title":"A Comprehensive Survey and Systematic Real-World Evaluation of Embodied Vision-and-Language Navigation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T15:39:59.878169Z"},"links":{"cited_paper":"/paper/2506.17221","citing_paper":"/paper/2607.09792"},"observation_digest":"sha256:3653717897363822d7777e6940e19ffe85b6c697c28987d919e1d22907338097","observation_id":"43227267-f85c-427b-b2e8-587b41454996","resolution":{"observed_at":"2026-07-14T15:39:59.878169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17221","snapshot_observed_at":"2026-08-02T05:13:54.793452Z","title":"Vln-r1: Vision- language navigation via reinforcement fine-tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13461","last_updated":"2026-07-15T05:46:34Z","snapshot_observed_at":"2026-08-10T23:44:32.308566Z","submitted_at":"2026-07-15T05:46:34Z","title":"Joint On-and-Off Policy Learning for Vision-and-Language Navigation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T05:13:54.793452Z"},"links":{"cited_paper":"/paper/2506.17221","citing_paper":"/paper/2607.13461"},"observation_digest":"sha256:37d5ae6547f8b800894938935a538df34f6385e3eb7d3946046d317a5b0116f0","observation_id":"86424cd5-e548-4337-b63d-c8f01723c1ad","resolution":{"observed_at":"2026-08-02T05:13:54.793452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17221","snapshot_observed_at":"2026-08-01T03:26:15.484911Z","title":"Vln-r1: Vision-language navigation via reinforcement fine-tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-13T11:57:51.132273Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:15.484911Z"},"links":{"cited_paper":"/paper/2506.17221","citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:2160db3babf568a87f5d649179ae085d0e1cb57290357f8321483cad5e8df3f5","observation_id":"7b9be73c-fe2f-4bf4-b991-db29888e2848","resolution":{"observed_at":"2026-08-01T03:26:15.484911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17221","snapshot_observed_at":"2026-08-15T14:28:52.281460Z","title":"2025 , archiveprefix =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09467","last_updated":"2026-08-10T11:37:46Z","snapshot_observed_at":"2026-08-15T18:34:58.834884Z","submitted_at":"2026-08-10T11:37:46Z","title":"RecoverFly: A Failure-Aware Reinforcement Learning Post-Training Framework for Aerial Vision-Language Navigation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T14:28:52.281460Z"},"links":{"cited_paper":"/paper/2506.17221","citing_paper":"/paper/2608.09467"},"observation_digest":"sha256:4eaf337b17c6f2f7712eea8825b1600c1b7df308a6f68c93638d3aac1c28f074","observation_id":"918d788f-3643-4bfe-b999-c2ffe3ed2f8f","resolution":{"observed_at":"2026-08-15T14:28:52.281460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.17221/citation-record","integrity":"/paper/2506.17221/integrity","json":"/paper/2506.17221/citation-record.json","paper":"/paper/2506.17221"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1807.06757","last_updated":"2018-07-18T03:28:02Z","snapshot_observed_at":"2026-08-14T11:12:04.949259Z","submitted_at":"2018-07-18T03:28:02Z","title":"On Evaluation of Embodied Navigation Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.06757","snapshot_observed_at":"2026-08-15T19:13:34.028057Z","title":"On evaluation of embodied navigation agents.arXiv:1807.06757, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.028057Z"},"links":{"cited_paper":"/paper/1807.06757","citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:3dfb933a638d682713c6dbd2f5f30f23e4fd88cb90cbc4add03e79a40beefb6b","observation_id":"95820f54-6477-4737-adfc-a83fcceeb0bc","resolution":{"observed_at":"2026-08-15T19:13:34.028057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:38.281821Z","title":"Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments","venue":null,"work_id":"8ba9f541-318e-4a6c-894c-d267bccced05","year":2018},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.119892Z"},"links":{"citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:61db99af4f516451b416108744b5ccf1c44372c95c300a600730ba25bbbaacee","observation_id":"03b99020-06ec-4168-a455-16f04ced02dc","resolution":{"observed_at":"2026-08-15T19:13:38.375762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-12T16:46:46.561976Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-15T19:13:34.123874Z","title":"Internlm2 technical report.arXiv:2403.17297, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.123874Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:0448be49cd2d1f785cd4f4c22610d179c6a3af1f83adfa4ec1e906078ce1609b","observation_id":"e5c9ecc8-645d-4305-b11c-2fbe24adca73","resolution":{"observed_at":"2026-08-15T19:13:34.123874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:38.181226Z","title":"Matterport3D: Learning from RGB-D data in indoor environments","venue":null,"work_id":"496ba560-70cf-4b76-8a8a-494b2bf4b764","year":2017},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.128700Z"},"links":{"citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:6696f5afbd488f8e71ed6d95f58f09b3c6231cb14fa5dc1872b6615acadc8cbe","observation_id":"39cce60e-1488-4877-8bc3-a49c2a7001e1","resolution":{"observed_at":"2026-08-15T19:13:38.207351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:38.170417Z","title":"Mapgpt: Map-guided prompting for unified vision-and-language navigation","venue":null,"work_id":"c8dddb37-b66b-4837-9cc2-13e3508303bd","year":2024},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.133535Z"},"links":{"citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:11637bb36191e2af91b41722b753ab5205a21caa93a7462c6e305d86f922ad19","observation_id":"0207b2e9-a086-4c2f-8608-a1fac5f3f3c1","resolution":{"observed_at":"2026-08-15T19:13:38.174363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:38.159825Z","title":"Topological planning with transformers for vision-and-language navigation","venue":null,"work_id":"eb2c8f07-92d5-4810-9ee3-3ff2e958476a","year":2021},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.137422Z"},"links":{"citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:6c06aa5a2e5d24519329a938c77dae15637686d3445d33c5336d6c592f0f7345","observation_id":"e78035b7-549d-4078-b256-330e318eab6b","resolution":{"observed_at":"2026-08-15T19:13:38.163714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:38.062143Z","title":"Weakly-supervised multi-granularity map learning for vision-and-language navigation","venue":null,"work_id":"ed0b9919-212c-4832-b92b-a07dc44fe159","year":2022},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.142245Z"},"links":{"citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:106c518a0899b9ca56714cad00cb146adf56c60b835f11040be89f25ba7b84e7","observation_id":"bc4f4967-a47e-4ded-87b0-f95b28402055","resolution":{"observed_at":"2026-08-15T19:13:38.152988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:37.972216Z","title":"Action-aware zero-shot robot navigation by exploiting vision-and-language ability of foundation models","venue":null,"work_id":"1eee586c-d03b-4b5d-86f3-fb9b9987a088","year":2023},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.146675Z"},"links":{"citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:04b175a637a39da5eb13fc38457f7cd92aa12330dac5ffbc28788f4013fc3c57","observation_id":"1ea06167-e011-4855-9021-92a07169cb14","resolution":{"observed_at":"2026-08-15T19:13:37.976398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:37.960997Z","title":"History aware multimodal transformer for vision-and-language navigation","venue":null,"work_id":"33693a6d-e7c1-4b9c-94ca-7a691e0e8f0c","year":2021},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.149939Z"},"links":{"citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:438c4bc976cfe62c03a6fe1bccce8c334158487eceb86c290674b494d2f86337","observation_id":"d730a088-f690-4c8d-a931-221c2bd60bb4","resolution":{"observed_at":"2026-08-15T19:13:37.964476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:37.948262Z","title":"Uniter: Universal image-text representation learning","venue":null,"work_id":"ac635a5b-b27b-406d-996a-f23da9b6cdc2","year":2020},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.153030Z"},"links":{"citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:28bc5b9a24c70050ff2d84aee628510a382bbff8006078af8bbe10dcdd964c09","observation_id":"b41ab028-19db-4a8e-a4b5-753ec7b0ef97","resolution":{"observed_at":"2026-08-15T19:13:37.952439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.16649","last_updated":"2022-11-30T00:38:54Z","snapshot_observed_at":"2026-08-15T16:33:53.934967Z","submitted_at":"2022-11-30T00:38:54Z","title":"CLIP-Nav: Using CLIP for Zero-Shot Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.16649","snapshot_observed_at":"2026-08-15T19:13:34.157333Z","title":"Clip-nav: Using clip for zero-shot vision-and-language navigation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.157333Z"},"links":{"cited_paper":"/paper/2211.16649","citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:c71465d79a3ea5d85eb0bec1fe577be0afdc585402e54d3e1bfc9413cf85728e","observation_id":"f4e8e106-83e4-4343-81d7-e9d8bec7007b","resolution":{"observed_at":"2026-08-15T19:13:34.157333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:37.731509Z","title":"Cross-modal map learning for vision and language navigation","venue":null,"work_id":"b12724c4-2b50-4711-8325-4292c75f4713","year":2022},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.161576Z"},"links":{"citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:82fe46b81a41c3a5986901fa66c89545e70e1e74f19c268f22130cedbb5e1784","observation_id":"c9741b62-7064-4284-a6f4-b7f06ec1a3c8","resolution":{"observed_at":"2026-08-15T19:13:37.803921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:37.719747Z","title":"Airbert: In-domain pretraining for vision-and-language navigation","venue":null,"work_id":"6da9cb14-06cc-4730-9dfa-7c6791a19e5b","year":2021},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.167609Z"},"links":{"citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:ab0ca00f229ab6e8d503db6774459a645dd38eae57bed53b6b23a5f1a6b820e5","observation_id":"697f58a8-9f65-4993-9ff7-9268d923dbbd","resolution":{"observed_at":"2026-08-15T19:13:37.723752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T19:13:34.171189Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.171189Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:41c950c9ae732bd770a5c91842dccd14f094bf50b092ef9105b3cc2d60640a48","observation_id":"785dd256-8062-4a6d-a829-f1952d97f422","resolution":{"observed_at":"2026-08-15T19:13:34.171189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:37.707178Z","title":"Towards learning a generic agent for vision-and-language navigation via pre-training","venue":null,"work_id":"072f37a2-d003-4bc8-b092-28727b63ad85","year":2020},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.175470Z"},"links":{"citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:d91cb9806847c690a8179b4614b6d6f97114dbe907e6d21d924c62c1344eb284","observation_id":"3f99d3f0-6805-467f-94f1-0230da081561","resolution":{"observed_at":"2026-08-15T19:13:37.711785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:37.558140Z","title":"Bridging the gap between learning in discrete and continuous environments for vision-and-language navigation","venue":null,"work_id":"8ac7b548-e219-4343-9e67-290a64b72c74","year":2022},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.179320Z"},"links":{"citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:0746e76b3eb5f92f9718e0364c89c4445444941b1ada317b77c336d2b4afa11b","observation_id":"17049884-3f30-4baf-af0b-8db308361993","resolution":{"observed_at":"2026-08-15T19:13:37.596724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:37.545272Z","title":"Visual language maps for robot navigation","venue":null,"work_id":"94eae452-57ba-472a-9c98-097c190f3322","year":2023},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.183373Z"},"links":{"citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:087fef0e686adfdd3ce6d9d209141afe4ff878c6d9d56d16992f7e0ead8101d7","observation_id":"806dff77-4bba-4208-a52a-4979530cd93b","resolution":{"observed_at":"2026-08-15T19:13:37.549894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-15T19:13:34.187501Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.187501Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:8f0986808cbc8731ab84b6d79d361102f3c1f245ab14da234ea86c2c867ffcff","observation_id":"c4658de4-9c2e-4aa0-b1f2-327923451d36","resolution":{"observed_at":"2026-08-15T19:13:34.187501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.11945","last_updated":"2021-08-26T17:57:02Z","snapshot_observed_at":"2026-08-13T18:22:28.130155Z","submitted_at":"2021-08-26T17:57:02Z","title":"SASRA: Semantically-aware Spatio-temporal Reasoning Agent for Vision-and-Language Navigation in Continuous Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.11945","snapshot_observed_at":"2026-08-15T19:13:34.236495Z","title":"Sasra: Semantically-aware spatio-temporal reasoning agent for vision-and-language navigation in continuous environments.arXiv:2108.11945, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.236495Z"},"links":{"cited_paper":"/paper/2108.11945","citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:efb7adafc1d8c8ca2238cd93546c0eab8f169eefc3b273415de6208f9911a279","observation_id":"99160d84-0f57-43c3-937b-616320948f42","resolution":{"observed_at":"2026-08-15T19:13:34.236495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16345","last_updated":"2025-02-14T09:32:11Z","snapshot_observed_at":"2026-08-15T05:41:45.095791Z","submitted_at":"2024-11-25T12:44:02Z","title":"Preference Optimization for Reasoning with Pseudo Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16345","snapshot_observed_at":"2026-08-15T19:13:34.302141Z","title":"Preference optimization for reasoning with pseudo feedback.arXiv:2411.16345, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.302141Z"},"links":{"cited_paper":"/paper/2411.16345","citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:f122e481065fadef3546fae37b13e6c614c6fbc66b4a30d6affc65af6aebfb85","observation_id":"e1840740-6108-41ca-a6b0-109baf4aaf77","resolution":{"observed_at":"2026-08-15T19:13:34.302141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:37.409595Z","title":"Waypoint models for instruction-guided navigation in continuous environments","venue":null,"work_id":"329798dc-6c23-4b5b-99ae-9df262521e38","year":2021},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.470076Z"},"links":{"citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:7fbae40c2ee447e59a46d267d8dcbef1d39ae0df1c411e408e63b6ccec669037","observation_id":"802f7653-1b0d-4e2a-b34c-618cc36a8ec6","resolution":{"observed_at":"2026-08-15T19:13:37.470184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:37.396608Z","title":"Sim-2-sim transfer for vision-and-language navigation in continu- ous environments","venue":null,"work_id":"f1b360a2-d615-420e-9c24-9a9a5a126533","year":2022},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.568146Z"},"links":{"citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:8affe06f768c26eac91620e61331a7640c8b813f2b3f48842f011549f56c677c","observation_id":"7a30ae0f-578e-42f2-9d6c-ca424061c678","resolution":{"observed_at":"2026-08-15T19:13:37.400296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:37.383060Z","title":"Beyond the nav-graph: Vision and language navigation in continuous environments","venue":null,"work_id":"3ab2612b-105b-4a1b-ba9f-dfa9f6ac753f","year":2020},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.624553Z"},"links":{"citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:6d4d0f61a43fbd8cc11d35bff9d985d66a0424634fd5e7ced9a191a8cb183d2b","observation_id":"0a56a40f-7e5e-455b-b4f6-108cf6bc48f7","resolution":{"observed_at":"2026-08-15T19:13:37.387544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:37.188347Z","title":"Room-across- room: Multilingual vision-and-language navigation with dense spatiotemporal grounding","venue":null,"work_id":"6481913a-78b5-419e-baef-114412e19bd3","year":2020},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.628683Z"},"links":{"citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:1280ea200434af765c93c8ee4a640428869ab1a26d7d54178b682ce8913a5f82","observation_id":"e520c7a6-6cfc-4087-9022-9f0c700f1ad7","resolution":{"observed_at":"2026-08-15T19:13:37.262456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-15T19:13:34.632894Z","title":"Tulu 3: Pushing frontiers in open language model post-training.arXiv:2411.15124, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.632894Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:1e648c86aad234d9219d78f9aa798b4b55a14d2a37942d7e31993306f8421ec7","observation_id":"c940f246-21f2-45bc-9120-d0d5e31d92c4","resolution":{"observed_at":"2026-08-15T19:13:34.632894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-15T19:13:34.637627Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.637627Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:154dc0441d4a262e4446e6aa45e4c69100c7e2b336ec29fb1202557a3d789cbf","observation_id":"294741cb-7211-46f6-9a0c-efdb784586c5","resolution":{"observed_at":"2026-08-15T19:13:34.637627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03557","last_updated":"2019-08-09T17:57:13Z","snapshot_observed_at":"2026-08-07T01:39:40.489262Z","submitted_at":"2019-08-09T17:57:13Z","title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03557","snapshot_observed_at":"2026-08-15T19:13:34.642564Z","title":"Visualbert: A simple and performant baseline for vision and language.arXiv:1908.03557, 2019","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.642564Z"},"links":{"cited_paper":"/paper/1908.03557","citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:84debca3d42af16a8615550033149ebce02f15067115785568504dafaf452940","observation_id":"88b44393-45b1-4300-b672-c7118fe9035f","resolution":{"observed_at":"2026-08-15T19:13:34.642564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:37.175869Z","title":"Oscar: Object-semantics aligned pre-training for vision-language tasks","venue":null,"work_id":"8155e1d0-5dd4-4ab1-a839-235668074d42","year":2020},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.647351Z"},"links":{"citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:5d7a4cc6dec89b6e36a7fecd7e2558b0567d16ec0a0bb7cb46edac424b6d0a34","observation_id":"9d7b072b-2819-49f8-89ec-b0ca015c7125","resolution":{"observed_at":"2026-08-15T19:13:37.179433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-15T19:13:34.651647Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.651647Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:ad180351effee48bd3e4ae613a337cb1dc55279278a2fdeae94f68ce9e97f1a0","observation_id":"0da77dcf-3ab5-4fe2-9120-8f1fc6bbd410","resolution":{"observed_at":"2026-08-15T19:13:34.651647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-08-13T15:15:10.681693Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18451","snapshot_observed_at":"2026-08-15T19:13:34.656773Z","title":"Skywork-Reward: Bag of tricks for reward modeling in llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.656773Z"},"links":{"cited_paper":"/paper/2410.18451","citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:51e9819676079d2b3c6a64455302e8f8bfa535343d7754a6b95d1e441b2b408c","observation_id":"7a3af02d-e39d-4fc3-9183-98dedf14e1f8","resolution":{"observed_at":"2026-08-15T19:13:34.656773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:34.660965Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.660965Z"},"links":{"citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:c8a5cc746cdb3ed33dfa65068ea9fd7e9cf1d832b563527027047e1a9d5b606a","observation_id":"0a325bba-ec89-4346-a5f6-d4d744577944","resolution":{"observed_at":"2026-08-15T19:13:34.660965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06886","last_updated":"2025-08-25T02:20:09Z","snapshot_observed_at":"2026-08-12T23:25:48.824729Z","submitted_at":"2024-07-09T14:14:47Z","title":"Aligning Cyber Space with Physical World: A Comprehensive Survey on Embodied AI","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06886","snapshot_observed_at":"2026-08-15T19:13:34.665920Z","title":"Aligning cyber space with physical world: A comprehensive survey on embodied ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.665920Z"},"links":{"cited_paper":"/paper/2407.06886","citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:f55ce8994f89f309db22dcb91d0b4603632f15d7a636f6fb949fce82df10c025","observation_id":"67aede46-2b0c-45b4-87fc-9d58544cd12d","resolution":{"observed_at":"2026-08-15T19:13:34.665920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:37.102580Z","title":"Instructnav: Zero-shot system for generic instruction navigation in unexplored environment","venue":null,"work_id":"3cd2119d-f3b4-41da-8f4b-ad999a47dc7e","year":2024},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.670307Z"},"links":{"citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:0027fbd892928261ea866b6342d0d34ebad68d10ba5388ea037d224d463d2c99","observation_id":"3ffb0c44-ba32-4a86-9701-b58cf209230d","resolution":{"observed_at":"2026-08-15T19:13:37.161342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11382","last_updated":"2023-09-20T15:04:49Z","snapshot_observed_at":"2026-08-15T14:14:31.242285Z","submitted_at":"2023-09-20T15:04:49Z","title":"Discuss Before Moving: Visual Language Navigation via Multi-expert Discussions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11382","snapshot_observed_at":"2026-08-15T19:13:34.674399Z","title":"Discuss before moving: Visual language navigation via multi-expert discussions.arXiv:2309.11382, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.674399Z"},"links":{"cited_paper":"/paper/2309.11382","citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:765792faf9333ca04dbf9c3bff07e8bd9fd3f6a3cd8021f543ea43f07eb30660","observation_id":"5f45575c-524a-4a69-a58f-e9dccd63ccaa","resolution":{"observed_at":"2026-08-15T19:13:34.674399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:36.903424Z","title":"Openeqa: Embodied question answering in the era of foundation models","venue":null,"work_id":"f963c981-34f5-42c9-8408-adeabf898012","year":2024},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.678838Z"},"links":{"citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:35fdf36a152906cbc73ddb196ad57b8d6b3075f1ca04d68d32c932675b34b58d","observation_id":"1630eed5-2748-4040-ad58-ae41279ceef6","resolution":{"observed_at":"2026-08-15T19:13:36.955064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:36.890515Z","title":"Improving vision-and-language navigation with image-text pairs from the web","venue":null,"work_id":"38a5bcb2-2288-4907-a307-e5029d6c3db8","year":2020},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.682526Z"},"links":{"citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:e4806215887b350be63c8c9ea43bb9d8d06190879b511fd88b41e8739d8e6d84","observation_id":"04aecad7-8264-4423-9a18-067a2b59e62e","resolution":{"observed_at":"2026-08-15T19:13:36.895040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:36.877742Z","title":"Core challenges of social robot navigation: A survey.ACM Transactions on Human-Robot Interaction, 2023","venue":null,"work_id":"d219c07c-5847-404c-a457-a1b080f2f57b","year":2023},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.832303Z"},"links":{"citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:5b03e3c6c7139ba8d3e2db82057517f5977c35a9f71abcd92d519d8db9b213bc","observation_id":"52a91510-ec62-4ba5-8dd6-26896011261a","resolution":{"observed_at":"2026-08-15T19:13:36.882612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02247","last_updated":"2025-07-19T03:44:28Z","snapshot_observed_at":"2026-08-10T23:21:20.795270Z","submitted_at":"2025-03-04T03:51:36Z","title":"WMNav: Integrating Vision-Language Models into World Models for Object Goal Navigation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02247","snapshot_observed_at":"2026-08-15T19:13:34.882988Z","title":"Wmnav: Integrating vision-language models into world models for object goal navigation.arXiv:2503.02247, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.882988Z"},"links":{"cited_paper":"/paper/2503.02247","citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:135c1114eed5ed0ecdd81bdea3483552b5580203d80496f34fcc2bddc138da7c","observation_id":"2f3dc8c7-0ce2-4101-814d-4c1c5b642f5a","resolution":{"observed_at":"2026-08-15T19:13:34.882988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:36.744174Z","title":"Hello gpt-4o, 2024","venue":null,"work_id":"8186c74d-96b3-4425-acdc-3cb2b4036172","year":2024},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:34.941894Z"},"links":{"citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:73d476bd6909f182127c74a6b139ee7c7655155f8c9bb3f194b040b7d3715233","observation_id":"5fee35b4-0900-41df-a076-6127f161c7c8","resolution":{"observed_at":"2026-08-15T19:13:36.806819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13724","last_updated":"2023-10-19T17:29:17Z","snapshot_observed_at":"2026-08-15T10:54:03.146672Z","submitted_at":"2023-10-19T17:29:17Z","title":"Habitat 3.0: A Co-Habitat for Humans, Avatars and Robots","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13724","snapshot_observed_at":"2026-08-15T19:13:35.003844Z","title":"Habitat 3.0: A co-habitat for humans, avatars and robots.arXiv:2310.13724, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:35.003844Z"},"links":{"cited_paper":"/paper/2310.13724","citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:43af784eb646f9b0800c78b6eecdc9f61bdf3f91af80d792db3f7300354cd891","observation_id":"a353eb50-356f-489e-80fa-cd2efd9adf0a","resolution":{"observed_at":"2026-08-15T19:13:35.003844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:36.731661Z","title":"Hop: History- and-order aware pre-training for vision-and-language navigation","venue":null,"work_id":"d49808c8-3fe0-4549-b07a-550c10365923","year":2022},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:35.024408Z"},"links":{"citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:d7446c2caea3c16e5fd8f91a586cc79cd7f83782996f0425ad3d46d2503a9c85","observation_id":"92d978e1-ad7d-4697-b8b2-2741cb00972b","resolution":{"observed_at":"2026-08-15T19:13:36.736526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:36.718247Z","title":"March in chat: Interactive prompting for remote embodied referring expression","venue":null,"work_id":"16b4187d-1c93-403f-bd6a-0348ce45a365","year":2023},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:35.028417Z"},"links":{"citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:e296d55e8adfb1193313451cd11c20308bec818c5bfa672d571343c9e820ce73","observation_id":"9cc78092-9cd9-421b-86ac-0e845ac13106","resolution":{"observed_at":"2026-08-15T19:13:36.723183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:36.682002Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"4442989a-871b-4920-8a23-48ae1d4e9d44","year":2023},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:35.032505Z"},"links":{"citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:35c677d02fa8e234e27e0cc0eb640cee746bbc1c188c393258c0c2648ec874ce","observation_id":"7c358a7f-d137-4465-9834-efd9306310f0","resolution":{"observed_at":"2026-08-15T19:13:36.710421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.02054","last_updated":"2020-05-13T06:45:15Z","snapshot_observed_at":"2026-07-06T08:27:00.558613Z","submitted_at":"2019-10-04T17:29:39Z","title":"ZeRO: Memory Optimizations Toward Training Trillion Parameter Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.02054","snapshot_observed_at":"2026-08-15T19:13:35.036739Z","title":"Zero: Memory optimiza- tions toward training trillion parameter models.arXiv:1910.02054, 2019","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:35.036739Z"},"links":{"cited_paper":"/paper/1910.02054","citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:66ec162ae37668fcc1a5c799dbd26cfa2ff21cca4a4d7538558294c74622eda5","observation_id":"5dc97792-0628-496d-88d0-8f3ffcae0902","resolution":{"observed_at":"2026-08-15T19:13:35.036739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.15207","last_updated":"2021-09-30T15:28:24Z","snapshot_observed_at":"2026-08-13T18:02:03.371102Z","submitted_at":"2021-09-30T15:28:24Z","title":"Language-Aligned Waypoint (LAW) Supervision for Vision-and-Language Navigation in Continuous Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.15207","snapshot_observed_at":"2026-08-15T19:13:35.040784Z","title":"Language- aligned waypoint (law) supervision for vision-and-language navigation in continuous environ- ments.arXiv:2109.15207, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:35.040784Z"},"links":{"cited_paper":"/paper/2109.15207","citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:931eba2548116e8dac20053eb4e6f27ebe5f7b297902fa477ff49f6be9833d13","observation_id":"2a45ed90-b05c-4e60-aa7a-3d9eff51b244","resolution":{"observed_at":"2026-08-15T19:13:35.040784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:36.463557Z","title":"Habitat: A Platform for Embodied AI Research","venue":null,"work_id":"92008778-f20f-4682-b6ec-478bae73bfec","year":2019},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:35.045064Z"},"links":{"citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:1586223401a4dbb7e4932718ed6494bce3388babe500ef8b5b307dd99b4c4470","observation_id":"03faa876-b8ed-4f59-9b04-28bda83bdc0e","resolution":{"observed_at":"2026-08-15T19:13:36.570681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T19:13:35.048732Z","title":"Proximal policy optimization algorithms.arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:35.048732Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:da6d9dc171432276f4c07b96c77bce04babff6d1ea632696cfff2b95bf8b8845","observation_id":"af473092-c51e-41af-ae58-b89b1d093ac0","resolution":{"observed_at":"2026-08-15T19:13:35.048732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:36.451402Z","title":"Lm-nav: Robotic navigation with large pre-trained models of language, vision, and action","venue":null,"work_id":"4fd83cd3-b724-4c1b-a8d7-b5edba095512","year":2023},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:35.052892Z"},"links":{"citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:e20e5edce40463a3cf796ebce850d9af63ed0f085b2684845ae6f12da94d2553","observation_id":"ea8bbc1f-f466-4dc8-ac43-b7f4575299b5","resolution":{"observed_at":"2026-08-15T19:13:36.455953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T19:13:35.056673Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:35.056673Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:1847f145bf70d39880ec530686295d1cafaffc3597e18f26e6662608ff94cfc7","observation_id":"c4eda079-a033-49f0-bd35-e33ab1691b84","resolution":{"observed_at":"2026-08-15T19:13:35.056673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.08530","last_updated":"2020-02-18T02:59:17Z","snapshot_observed_at":"2026-08-15T04:23:02.210168Z","submitted_at":"2019-08-22T17:59:30Z","title":"VL-BERT: Pre-training of Generic Visual-Linguistic Representations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.08530","snapshot_observed_at":"2026-08-15T19:13:35.061441Z","title":"Vl-bert: Pre-training of generic visual-linguistic representations.arXiv:1908.08530, 2019","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:35.061441Z"},"links":{"cited_paper":"/paper/1908.08530","citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:28614364aeea49f3e6450c20ae03ef040427bbc3a576fd910e8c5acf9c5c7517","observation_id":"cdf2fac2-3abc-4af1-a821-ff090a05bdb1","resolution":{"observed_at":"2026-08-15T19:13:35.061441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-15T19:13:35.069330Z","title":"Aligning large multimodal models with factually augmented rlhf.arXiv:2309.14525, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:35.069330Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:a670f2cde650d19f6ff5e927b2255c61fa4072608e19564898efb782dd02cbc6","observation_id":"20bac8e7-16be-4130-8bb0-a77188020fda","resolution":{"observed_at":"2026-08-15T19:13:35.069330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:36.439305Z","title":"Lxmert: Learning cross-modality encoder representations from transformers","venue":null,"work_id":"edd2c668-47d6-4517-8b7a-7600e54c0fd9","year":2019},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:35.073962Z"},"links":{"citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:729332151b7d71b06de6d426501f66e6fe049491c339568695489886804f8b2b","observation_id":"0add378d-4fe4-4695-aec2-e461b438987f","resolution":{"observed_at":"2026-08-15T19:13:36.443423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-11T01:31:26.242281Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-15T19:13:35.078104Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:35.078104Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:44aa91fa17c6f8befe175b1bd5c6e265dba012dd4cfe138ea95f3b312bf92ce2","observation_id":"471ca004-79fa-4a4e-b5bd-95f5debe78f2","resolution":{"observed_at":"2026-08-15T19:13:35.078104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-15T19:13:35.082112Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:35.082112Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:a50676e9d7ad91d165cddbdb51e142a936d5ff3f2486f86cc4b6d5d837092f20","observation_id":"e0723114-6cbb-4338-a40e-6655eb42e865","resolution":{"observed_at":"2026-08-15T19:13:35.082112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:36.199468Z","title":"Cross-modal semantic alignment pre-training for vision-and-language navigation","venue":null,"work_id":"4a38f11f-5ec6-4825-a812-5b85d47c2e2d","year":2022},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:35.121601Z"},"links":{"citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:7430b00e672c9bad506629f10b5d3e850f4cd2762aa9cdfb27b46358abffd2e6","observation_id":"eac053ab-16e0-427a-bbf0-39a34d8e9763","resolution":{"observed_at":"2026-08-15T19:13:36.304409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:36.186487Z","title":"RlHF-V: Towards trustworthy mllms via behavior alignment from fine-grained correctional human feedback","venue":null,"work_id":"ee567553-3f48-4aec-a229-61947906f11c","year":2024},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:35.255984Z"},"links":{"citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:0ac2b613398f2c83c3131aaf8a601c3a605a3d73b8333a9284332dcdc46540ce","observation_id":"2d2d3e94-8a51-46e0-9cf3-f9ef8b0d1122","resolution":{"observed_at":"2026-08-15T19:13:36.190848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:35.317485Z","title":"RLAIF-V: Aligning mllms through open-source ai feedback for super gpt-4v trustworthiness.arXiv:2405.17220, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:35.317485Z"},"links":{"citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:6b792c6005b7efe78225bd88ae6dbc492c4d16367401dbeae42f8f7029458553","observation_id":"e6d0083e-8dd8-4b57-aad8-aa2b0ffca1c3","resolution":{"observed_at":"2026-08-15T19:13:35.317485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:36.174682Z","title":"Uni-navid: A video-based vision-language-action model for unifying embodied navigation tasks","venue":null,"work_id":"013108be-5df5-407d-9caf-c05749feee6a","year":2025},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:35.321801Z"},"links":{"citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:9345ae49d764f26882cb11e4e46893229b580dfcffe91e14704ab247d3ccb0b6","observation_id":"3c43d417-d420-4ebc-96e4-374abb7c4902","resolution":{"observed_at":"2026-08-15T19:13:36.178360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:36.049458Z","title":"Navid: Video-based vlm plans the next step for vision-and-language navigation","venue":null,"work_id":"ea3779fe-baa7-4c79-b79f-c3860d9a035d","year":2024},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:35.325678Z"},"links":{"citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:323dc25901f999c36ffdd7ad2bb6ce9fd92edeb0e119c332a252f9b7530df07f","observation_id":"bd3a18ce-95ba-4e7a-add5-5bc2e405887d","resolution":{"observed_at":"2026-08-15T19:13:36.167393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05605","last_updated":"2025-06-03T09:19:46Z","snapshot_observed_at":"2026-08-12T22:28:38.428163Z","submitted_at":"2024-10-08T01:36:15Z","title":"CodeDPO: Aligning Code Models with Self Generated and Verified Source Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05605","snapshot_observed_at":"2026-08-15T19:13:35.330200Z","title":"Codedpo: Aligning code models with self generated and verified source code.arXiv:2410.05605,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:35.330200Z"},"links":{"cited_paper":"/paper/2410.05605","citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:390edbfde7422279ca440f3148ea68668e427d66b996fe00f3e7b14d7eaed1cd","observation_id":"b154de35-01e1-4a52-9abc-b5a2363c4374","resolution":{"observed_at":"2026-08-15T19:13:35.330200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00154","last_updated":"2024-12-10T04:39:25Z","snapshot_observed_at":"2026-08-14T09:34:55.962666Z","submitted_at":"2024-11-29T07:19:56Z","title":"o1-Coder: an o1 Replication for Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00154","snapshot_observed_at":"2026-08-15T19:13:35.335052Z","title":"o1-coder: an o1 replication for coding.arXiv:2412.00154, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:35.335052Z"},"links":{"cited_paper":"/paper/2412.00154","citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:41bd0d2a3d6f3e87d5f098373a78375752d04589137325de8883c47f1b5f78a3","observation_id":"342689a5-54d0-457f-b725-6638bf4380a0","resolution":{"observed_at":"2026-08-15T19:13:35.335052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16839","last_updated":"2024-02-06T16:43:31Z","snapshot_observed_at":"2026-08-08T04:17:23.797697Z","submitted_at":"2023-11-28T14:54:37Z","title":"Beyond Hallucinations: Enhancing LVLMs through Hallucination-Aware Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16839","snapshot_observed_at":"2026-08-15T19:13:35.339035Z","title":"Beyond hallucinations: Enhancing lvlms through hallucination-aware direct preference optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:35.339035Z"},"links":{"cited_paper":"/paper/2311.16839","citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:8ef75b79b4178e9cea0161755d9b9411fd5219d91d4259f7789d07262f896588","observation_id":"8fe4223b-2061-47d0-bd69-ad85a6f78bbc","resolution":{"observed_at":"2026-08-15T19:13:35.339035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:35.921359Z","title":"Towards learning a generalist model for embodied navigation","venue":null,"work_id":"0276d185-0b86-48f8-9db3-3dfce38dce25","year":2024},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:35.406823Z"},"links":{"citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:dcb03f4c9641a0a80cbe4a7e379c3f942a8720f0662a671168eefe957a85c963","observation_id":"c72e89a7-32b8-4e48-88b8-064a8684baec","resolution":{"observed_at":"2026-08-15T19:13:35.926368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:35.905343Z","title":"Navgpt-2: Unleashing navigational reasoning capability for large vision-language models","venue":null,"work_id":"25c196b4-715c-4031-8c1c-f737a968beda","year":2025},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:35.464627Z"},"links":{"citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:589301c9bb858fbd4a73b0d2ad31a565e809feadfea6e43d6dd25a92a536f7a4","observation_id":"214c657b-3da0-4473-be45-54f0f86dbf7f","resolution":{"observed_at":"2026-08-15T19:13:35.912524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16986","last_updated":"2023-10-19T17:59:43Z","snapshot_observed_at":"2026-08-13T11:32:22.801057Z","submitted_at":"2023-05-26T14:41:06Z","title":"NavGPT: Explicit Reasoning in Vision-and-Language Navigation with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16986","snapshot_observed_at":"2026-08-15T19:13:35.468781Z","title":"Navgpt: Explicit reasoning in vision-and-language navigation with large language models.arXiv:2305.16986, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:35.468781Z"},"links":{"cited_paper":"/paper/2305.16986","citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:8bb6c06a733cbc907f987d0cfd8d4d2b5685efec47bed7bdcdc2c7cce40cb9e4","observation_id":"8f2a9eee-70ce-4a39-81d1-78360dd66e04","resolution":{"observed_at":"2026-08-15T19:13:35.468781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-08-10T21:21:50.749962Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-08-15T19:13:35.473688Z","title":"Aligning modalities in vision large language models via preference fine-tuning.arXiv:2402.11411, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:35.473688Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:90639e26533c17b86e99575fc8309a15fdef9bdb48c6c269f9b4d7480f225e19","observation_id":"69e6592b-45cb-4852-ae65-72397ef3a9b9","resolution":{"observed_at":"2026-08-15T19:13:35.473688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.04097","last_updated":"2021-10-11T08:48:18Z","snapshot_observed_at":"2026-08-13T18:50:10.804864Z","submitted_at":"2021-07-07T12:09:04Z","title":"Deep Learning for Embodied Vision Navigation: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.04097","snapshot_observed_at":"2026-08-15T19:13:35.477535Z","title":"Deep learning for embodied vision navigation: A survey.arXiv:2108.04097, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:35.477535Z"},"links":{"cited_paper":"/paper/2108.04097","citing_paper":"/paper/2506.17221"},"observation_digest":"sha256:174396640460aa11f57b1d03784a7074a8a4ffce7560c15712af69210802db48","observation_id":"822b315f-3eaf-4ef9-a0ee-2a97b7514e12","resolution":{"observed_at":"2026-08-15T19:13:35.477535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T19:07:13.936740Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":35},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 29 inbound Pith citation observations for arXiv:2506.17221."}