{"as_of":"2026-08-19T09:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d6a201b7b6e1a47babc3bf22c429af1499e415a2620cf22ca0e25b91fe252ff9","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":28,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:06:07.991028Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T09:09:43.507471Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2010.07954","last_updated":"2020-10-15T18:01:15Z","snapshot_observed_at":"2026-08-17T11:39:02.437980Z","submitted_at":"2020-10-15T18:01:15Z","title":"Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding","version":1},"cited_work":{"arxiv_id":"2010.07954","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.07954","snapshot_observed_at":"2026-07-04T09:09:43.507471Z","title":"Room-across-room: Multilingual vision- and-language navigation with dense spatiotemporal ground- ing","venue":null,"work_id":"164a5cbf-5a0b-47dc-8ab3-691f650a166a","year":2010},"citing_paper":{"arxiv_id":"2109.08238","last_updated":"2021-09-16T22:01:24Z","snapshot_observed_at":"2026-08-15T09:50:41.483833Z","submitted_at":"2021-09-16T22:01:24Z","title":"Habitat-Matterport 3D Dataset (HM3D): 1000 Large-scale 3D Environments for Embodied AI","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-14T18:24:57.956486Z"},"links":{"cited_paper":"/paper/2010.07954","citing_paper":"/paper/2109.08238"},"observation_digest":"sha256:acb48cd6a9fc0c1bb43b161075b9c53a52724d3ac85819bd27ce92c3162eaf01","observation_id":"f48cd204-2208-4c16-884a-78557a45f7e0","resolution":{"observed_at":"2026-05-14T18:24:57.995737Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07954","last_updated":"2020-10-15T18:01:15Z","snapshot_observed_at":"2026-08-17T11:39:02.437980Z","submitted_at":"2020-10-15T18:01:15Z","title":"Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07954","snapshot_observed_at":"2026-08-11T23:10:26.129733Z","title":"Room-across-room: Multilingual vision- and-language navigation with dense spatiotemporal ground- ing","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.02795","last_updated":"2024-12-03T19:54:32Z","snapshot_observed_at":"2026-08-18T14:54:00.705149Z","submitted_at":"2024-12-03T19:54:32Z","title":"Hijacking Vision-and-Language Navigation Agents with Adversarial Environmental Attacks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T23:10:26.129733Z"},"links":{"cited_paper":"/paper/2010.07954","citing_paper":"/paper/2412.02795"},"observation_digest":"sha256:06b5858cbb89948d64fe2a91de00a548a9b1f7a0fad1b03a6fd780a1ddf832d9","observation_id":"a5a35ecb-9be6-480b-ac94-bb3e1f377dce","resolution":{"observed_at":"2026-08-11T23:10:26.129733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07954","last_updated":"2020-10-15T18:01:15Z","snapshot_observed_at":"2026-08-17T11:39:02.437980Z","submitted_at":"2020-10-15T18:01:15Z","title":"Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07954","snapshot_observed_at":"2026-08-10T21:47:58.974766Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.05478","last_updated":"2025-06-17T16:28:39Z","snapshot_observed_at":"2026-08-18T08:47:29.483644Z","submitted_at":"2025-01-07T16:01:25Z","title":"Language and Planning in Robotic Navigation: A Multilingual Evaluation of State-of-the-Art Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T21:47:58.974766Z"},"links":{"cited_paper":"/paper/2010.07954","citing_paper":"/paper/2501.05478"},"observation_digest":"sha256:350c017a8cd054a34a0e0726f4f308dea219ac43ad829fc4021f317050bfd69c","observation_id":"db037f63-c215-4897-9654-164d1191e68b","resolution":{"observed_at":"2026-08-10T21:47:58.974766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07954","last_updated":"2020-10-15T18:01:15Z","snapshot_observed_at":"2026-08-17T11:39:02.437980Z","submitted_at":"2020-10-15T18:01:15Z","title":"Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07954","snapshot_observed_at":"2026-08-16T11:06:07.991028Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:07.991028Z"},"links":{"cited_paper":"/paper/2010.07954","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:de839a2c79ff51a99520b2d5be0470d7b7c833329e7de6bcd2a3b7b49a0ad039","observation_id":"0d7707cf-d0f5-4175-a900-d79c67ba6587","resolution":{"observed_at":"2026-08-16T11:06:07.991028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07954","last_updated":"2020-10-15T18:01:15Z","snapshot_observed_at":"2026-08-17T11:39:02.437980Z","submitted_at":"2020-10-15T18:01:15Z","title":"Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07954","snapshot_observed_at":"2026-08-07T13:52:07.294284Z","title":"Room-across-room: Multilingual vision-and-language navigation with dense spatiotemporal grounding.arXiv preprint arXiv:2010.07954, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:07.294284Z"},"links":{"cited_paper":"/paper/2010.07954","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:3def57cd407d7341efc2f0495a0d036caa7645f93f6e03cc0af567ea51f44746","observation_id":"7dfd67f3-cb68-4b50-9467-5d061a57ead8","resolution":{"observed_at":"2026-08-07T13:52:07.294284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07954","last_updated":"2020-10-15T18:01:15Z","snapshot_observed_at":"2026-08-17T11:39:02.437980Z","submitted_at":"2020-10-15T18:01:15Z","title":"Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07954","snapshot_observed_at":"2026-08-15T19:38:59.097188Z","title":"Room- across-room: Multilingual vision-and-language navigation with dense spatiotemporal grounding,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.15377","last_updated":"2025-06-18T11:47:02Z","snapshot_observed_at":"2026-08-18T09:09:17.028029Z","submitted_at":"2025-06-18T11:47:02Z","title":"Efficient and Generalizable Environmental Understanding for Visual Navigation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T19:38:59.097188Z"},"links":{"cited_paper":"/paper/2010.07954","citing_paper":"/paper/2506.15377"},"observation_digest":"sha256:cfe702b9c06d30faec0cfa198276b3f44a025adbef31d1d0e4e0cd0188596592","observation_id":"70223ba6-7919-4ba5-9bd5-238504b91dc6","resolution":{"observed_at":"2026-08-15T19:38:59.097188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07954","last_updated":"2020-10-15T18:01:15Z","snapshot_observed_at":"2026-08-17T11:39:02.437980Z","submitted_at":"2020-10-15T18:01:15Z","title":"Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07954","snapshot_observed_at":"2026-08-06T19:37:05.110483Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-18T02:14:46.902275Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:05.110483Z"},"links":{"cited_paper":"/paper/2010.07954","citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:edc861ac05fbfe13018e2d5983295c77f5d30f3d63fda80ff5323190da2be0fd","observation_id":"c253d784-c227-4c25-b950-f10c9c8ce7cd","resolution":{"observed_at":"2026-08-06T19:37:05.110483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07954","last_updated":"2020-10-15T18:01:15Z","snapshot_observed_at":"2026-08-17T11:39:02.437980Z","submitted_at":"2020-10-15T18:01:15Z","title":"Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07954","snapshot_observed_at":"2026-08-06T19:04:40.343600Z","title":"Room- across-room: Multilingual vision-and-language navigation with dense spatiotemporal grounding,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.06564","last_updated":"2025-07-09T05:38:32Z","snapshot_observed_at":"2026-08-17T01:26:16.022141Z","submitted_at":"2025-07-09T05:38:32Z","title":"SkyVLN: Vision-and-Language Navigation and NMPC Control for UAVs in Urban Environments","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:04:40.343600Z"},"links":{"cited_paper":"/paper/2010.07954","citing_paper":"/paper/2507.06564"},"observation_digest":"sha256:0ecb6b4700e64fda26bff144f71157a6aede5d47efa7eb6cc9facc55971ad5d3","observation_id":"b1a397d6-37ec-422c-858d-f40c8da9034c","resolution":{"observed_at":"2026-08-06T19:04:40.343600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07954","last_updated":"2020-10-15T18:01:15Z","snapshot_observed_at":"2026-08-17T11:39:02.437980Z","submitted_at":"2020-10-15T18:01:15Z","title":"Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07954","snapshot_observed_at":"2026-08-06T12:51:13.571137Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.21450","last_updated":"2025-07-29T02:40:07Z","snapshot_observed_at":"2026-08-18T16:19:50.159270Z","submitted_at":"2025-07-29T02:40:07Z","title":"Recursive Visual Imagination and Adaptive Linguistic Grounding for Vision Language Navigation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T12:51:13.571137Z"},"links":{"cited_paper":"/paper/2010.07954","citing_paper":"/paper/2507.21450"},"observation_digest":"sha256:32d324a1fe446524a948c039ebbf4262ab5fcded861f36e6cdf6ecccaf9c187e","observation_id":"e30f8ce6-b283-4e04-9317-f02585409009","resolution":{"observed_at":"2026-08-06T12:51:13.571137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07954","last_updated":"2020-10-15T18:01:15Z","snapshot_observed_at":"2026-08-17T11:39:02.437980Z","submitted_at":"2020-10-15T18:01:15Z","title":"Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07954","snapshot_observed_at":"2026-08-06T11:20:06.686740Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.22791","last_updated":"2026-06-11T08:47:41Z","snapshot_observed_at":"2026-08-14T10:09:58.243398Z","submitted_at":"2025-07-30T15:56:36Z","title":"Modality-Aware Feature Matching in Visual and Vision-Language Applications: A Comprehensive Survey","version":2},"reference_index":109,"source":"pdf_text","source_observed_at":"2026-08-06T11:20:06.686740Z"},"links":{"cited_paper":"/paper/2010.07954","citing_paper":"/paper/2507.22791"},"observation_digest":"sha256:f6e4c3a9b008956a9ebbf93a2c15fe6ff492d8a1b0dc7a2a7b31942d4179e8b8","observation_id":"7d223918-5734-40c5-8e9d-ad589a900e6e","resolution":{"observed_at":"2026-08-06T11:20:06.686740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07954","last_updated":"2020-10-15T18:01:15Z","snapshot_observed_at":"2026-08-17T11:39:02.437980Z","submitted_at":"2020-10-15T18:01:15Z","title":"Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07954","snapshot_observed_at":"2026-08-06T04:46:02.703754Z","title":"arXiv preprint arXiv:2010.07954 , year=","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2508.03053","last_updated":"2025-08-05T03:56:32Z","snapshot_observed_at":"2026-08-14T21:08:16.926332Z","submitted_at":"2025-08-05T03:56:32Z","title":"SkeNa: Learning to Navigate Unseen Environments Based on Abstract Hand-Drawn Maps","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T04:46:02.703754Z"},"links":{"cited_paper":"/paper/2010.07954","citing_paper":"/paper/2508.03053"},"observation_digest":"sha256:bb8f65b3189fb21d9219b983a610dc492aa6a37ece9937339fdd78831f2a31fb","observation_id":"c09b470b-bfe6-44c1-9759-68594e9ec207","resolution":{"observed_at":"2026-08-06T04:46:02.703754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07954","last_updated":"2020-10-15T18:01:15Z","snapshot_observed_at":"2026-08-17T11:39:02.437980Z","submitted_at":"2020-10-15T18:01:15Z","title":"Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07954","snapshot_observed_at":"2026-08-15T15:57:23.009185Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2509.10454","last_updated":"2025-09-12T17:59:58Z","snapshot_observed_at":"2026-08-17T16:48:11.398137Z","submitted_at":"2025-09-12T17:59:58Z","title":"GC-VLN: Instruction as Graph Constraints for Training-free Vision-and-Language Navigation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T15:57:23.009185Z"},"links":{"cited_paper":"/paper/2010.07954","citing_paper":"/paper/2509.10454"},"observation_digest":"sha256:b03125a82e9a66f951d67b9bb3fae805f1682c4332da47e17345ba3752e3ceac","observation_id":"45615e25-8a37-4b59-951f-91762665c707","resolution":{"observed_at":"2026-08-15T15:57:23.009185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07954","last_updated":"2020-10-15T18:01:15Z","snapshot_observed_at":"2026-08-17T11:39:02.437980Z","submitted_at":"2020-10-15T18:01:15Z","title":"Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding","version":1},"cited_work":{"arxiv_id":"2010.07954","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.07954","snapshot_observed_at":"2026-07-04T09:09:43.507471Z","title":"Room-across-room: Multilingual vision- and-language navigation with dense spatiotemporal ground- ing","venue":null,"work_id":"164a5cbf-5a0b-47dc-8ab3-691f650a166a","year":2010},"citing_paper":{"arxiv_id":"2511.17097","last_updated":"2026-04-14T15:21:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-21T09:52:07Z","title":"Progress-Think: Semantic Progress Reasoning for Vision-Language Navigation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-17T21:02:38.013115Z"},"links":{"cited_paper":"/paper/2010.07954","citing_paper":"/paper/2511.17097"},"observation_digest":"sha256:858b6f627bfc39650843f353ff3a13140bbb8cf22af14c034a7c955e218fce47","observation_id":"710a5dbd-cc5d-443a-8bc1-23f8133a308e","resolution":{"observed_at":"2026-05-17T21:05:15.961021Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07954","last_updated":"2020-10-15T18:01:15Z","snapshot_observed_at":"2026-08-17T11:39:02.437980Z","submitted_at":"2020-10-15T18:01:15Z","title":"Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding","version":1},"cited_work":{"arxiv_id":"2010.07954","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.07954","snapshot_observed_at":"2026-07-04T09:09:43.507471Z","title":"Room-across-room: Multilingual vision- and-language navigation with dense spatiotemporal ground- ing","venue":null,"work_id":"164a5cbf-5a0b-47dc-8ab3-691f650a166a","year":2010},"citing_paper":{"arxiv_id":"2512.21714","last_updated":"2026-04-08T16:31:40Z","snapshot_observed_at":"2026-08-03T01:54:32.856831Z","submitted_at":"2025-12-25T15:31:24Z","title":"AstraNav-World: World Model for Foresight Control and Consistency","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T19:23:58.769472Z"},"links":{"cited_paper":"/paper/2010.07954","citing_paper":"/paper/2512.21714"},"observation_digest":"sha256:7e1cdb80c6dbe5a75595f459e6100c993281f9ce77bf690204ba508af9649d74","observation_id":"0e0924f5-0476-4c30-a355-a4cd9a75639f","resolution":{"observed_at":"2026-05-16T19:28:20.888687Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07954","last_updated":"2020-10-15T18:01:15Z","snapshot_observed_at":"2026-08-17T11:39:02.437980Z","submitted_at":"2020-10-15T18:01:15Z","title":"Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07954","snapshot_observed_at":"2026-08-03T05:28:56.991649Z","title":"Room-across-room: Multilingual vision-and-language nav- igation with dense spatiotemporal grounding,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2602.02220","last_updated":"2026-05-29T14:23:41Z","snapshot_observed_at":"2026-08-14T05:03:15.502680Z","submitted_at":"2026-02-02T15:26:19Z","title":"LangMap: A Human-Verified Benchmark for Hierarchical Open-Vocabulary Goal Navigation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T05:28:56.991649Z"},"links":{"cited_paper":"/paper/2010.07954","citing_paper":"/paper/2602.02220"},"observation_digest":"sha256:2b286cb65dd68071634662d14647c61f37875a897db132188457a6e65b0f1372","observation_id":"140c8ea1-5d6f-4b8e-a270-957019263e01","resolution":{"observed_at":"2026-08-03T05:28:56.991649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07954","last_updated":"2020-10-15T18:01:15Z","snapshot_observed_at":"2026-08-17T11:39:02.437980Z","submitted_at":"2020-10-15T18:01:15Z","title":"Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07954","snapshot_observed_at":"2026-08-02T23:48:58.731930Z","title":"Room-across-room: Multilingual vision-and-language navigation with dense spatiotempo- ral grounding.arXiv preprint arXiv:2010.07954, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:58.731930Z"},"links":{"cited_paper":"/paper/2010.07954","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:f2771b1578e3b958be96e94385fb2ac732e19c6674e791662a17ed362d045d32","observation_id":"bedf0b36-102c-48fe-a757-0962240c6c86","resolution":{"observed_at":"2026-08-02T23:48:58.731930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07954","last_updated":"2020-10-15T18:01:15Z","snapshot_observed_at":"2026-08-17T11:39:02.437980Z","submitted_at":"2020-10-15T18:01:15Z","title":"Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07954","snapshot_observed_at":"2026-08-02T17:15:42.404110Z","title":"arXiv preprint arXiv:2010.07954 (2020)","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2603.27577","last_updated":"2026-08-01T10:28:12Z","snapshot_observed_at":"2026-08-17T20:04:46.470368Z","submitted_at":"2026-03-29T08:34:05Z","title":"Structured Observation Language for Efficient and Generalizable Vision-Language Navigation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T17:15:42.404110Z"},"links":{"cited_paper":"/paper/2010.07954","citing_paper":"/paper/2603.27577"},"observation_digest":"sha256:2327ea2b12ee6432aa9927098c3700f1f61c44cbe970fc7bb1d79e148be987d8","observation_id":"d65e00c9-c22a-49dc-ae2a-921b19c9a4fa","resolution":{"observed_at":"2026-08-02T17:15:42.404110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07954","last_updated":"2020-10-15T18:01:15Z","snapshot_observed_at":"2026-08-17T11:39:02.437980Z","submitted_at":"2020-10-15T18:01:15Z","title":"Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07954","snapshot_observed_at":"2026-08-04T05:43:09.929718Z","title":"arXiv preprint arXiv:2010.07954 (2020)","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2603.27577","last_updated":"2026-08-01T10:28:12Z","snapshot_observed_at":"2026-08-17T20:04:46.470368Z","submitted_at":"2026-03-29T08:34:05Z","title":"Structured Observation Language for Efficient and Generalizable Vision-Language Navigation","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T05:43:09.929718Z"},"links":{"cited_paper":"/paper/2010.07954","citing_paper":"/paper/2603.27577"},"observation_digest":"sha256:ab755cf913b7d98672bf34f153e69e94ce1abc05b24ee7df786e5cddb718fd23","observation_id":"cb750f35-117f-4b7c-81fe-bc8e0fb05753","resolution":{"observed_at":"2026-08-04T05:43:09.929718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07954","last_updated":"2020-10-15T18:01:15Z","snapshot_observed_at":"2026-08-17T11:39:02.437980Z","submitted_at":"2020-10-15T18:01:15Z","title":"Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding","version":1},"cited_work":{"arxiv_id":"2010.07954","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.07954","snapshot_observed_at":"2026-07-04T09:09:43.507471Z","title":"Room-across-room: Multilingual vision- and-language navigation with dense spatiotemporal ground- ing","venue":null,"work_id":"164a5cbf-5a0b-47dc-8ab3-691f650a166a","year":2010},"citing_paper":{"arxiv_id":"2604.17407","last_updated":"2026-04-19T12:30:22Z","snapshot_observed_at":"2026-08-15T00:39:33.214469Z","submitted_at":"2026-04-19T12:30:22Z","title":"Think before Go: Hierarchical Reasoning for Image-goal Navigation","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-05-10T05:43:27.972164Z"},"links":{"cited_paper":"/paper/2010.07954","citing_paper":"/paper/2604.17407"},"observation_digest":"sha256:672a494a3143171c214f376129cc9321d50080a8b766c14994c0722e000e655c","observation_id":"17f95598-8003-4373-a3ab-5c199862b124","resolution":{"observed_at":"2026-05-10T05:51:10.536845Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07954","last_updated":"2020-10-15T18:01:15Z","snapshot_observed_at":"2026-08-17T11:39:02.437980Z","submitted_at":"2020-10-15T18:01:15Z","title":"Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding","version":1},"cited_work":{"arxiv_id":"2010.07954","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.07954","snapshot_observed_at":"2026-07-04T09:09:43.507471Z","title":"Room-across-room: Multilingual vision- and-language navigation with dense spatiotemporal ground- ing","venue":null,"work_id":"164a5cbf-5a0b-47dc-8ab3-691f650a166a","year":2010},"citing_paper":{"arxiv_id":"2604.17473","last_updated":"2026-06-23T08:05:53Z","snapshot_observed_at":"2026-08-11T07:26:07.831204Z","submitted_at":"2026-04-19T15:03:38Z","title":"Dual-Anchoring: Addressing State Drift in Vision-Language Navigation","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-10T06:50:34.310831Z"},"links":{"cited_paper":"/paper/2010.07954","citing_paper":"/paper/2604.17473"},"observation_digest":"sha256:28be34ccf9aba7d28a59f460be25deacbb99bf98341e33eb00fcffc37e12e66c","observation_id":"97613dd1-e17e-4654-98df-7407e7f5a500","resolution":{"observed_at":"2026-05-10T06:51:45.846828Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07954","last_updated":"2020-10-15T18:01:15Z","snapshot_observed_at":"2026-08-17T11:39:02.437980Z","submitted_at":"2020-10-15T18:01:15Z","title":"Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding","version":1},"cited_work":{"arxiv_id":"2010.07954","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.07954","snapshot_observed_at":"2026-07-04T09:09:43.507471Z","title":"Room-across-room: Multilingual vision- and-language navigation with dense spatiotemporal ground- ing","venue":null,"work_id":"164a5cbf-5a0b-47dc-8ab3-691f650a166a","year":2010},"citing_paper":{"arxiv_id":"2604.27620","last_updated":"2026-04-30T09:09:40Z","snapshot_observed_at":"2026-08-11T04:56:25.116086Z","submitted_at":"2026-04-30T09:09:40Z","title":"SpaAct: Spatially-Activated Transition Learning with Curriculum Adaptation for Vision-Language Navigation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-07T05:05:33.606975Z"},"links":{"cited_paper":"/paper/2010.07954","citing_paper":"/paper/2604.27620"},"observation_digest":"sha256:ba90d2a10297bcb74790c2bf47b20fccb70d6778205e8b3b1b611c41913f7d9d","observation_id":"4832bc51-6171-45b9-8807-1a5a7f2a4e5a","resolution":{"observed_at":"2026-05-12T10:36:31.296599Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07954","last_updated":"2020-10-15T18:01:15Z","snapshot_observed_at":"2026-08-17T11:39:02.437980Z","submitted_at":"2020-10-15T18:01:15Z","title":"Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding","version":1},"cited_work":{"arxiv_id":"2010.07954","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.07954","snapshot_observed_at":"2026-07-04T09:09:43.507471Z","title":"Room-across-room: Multilingual vision- and-language navigation with dense spatiotemporal ground- ing","venue":null,"work_id":"164a5cbf-5a0b-47dc-8ab3-691f650a166a","year":2010},"citing_paper":{"arxiv_id":"2605.09441","last_updated":"2026-05-10T09:34:05Z","snapshot_observed_at":"2026-08-11T07:41:04.520067Z","submitted_at":"2026-05-10T09:34:05Z","title":"Beyond Isolation: A Unified Benchmark for General-Purpose Navigation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T04:33:53.557357Z"},"links":{"cited_paper":"/paper/2010.07954","citing_paper":"/paper/2605.09441"},"observation_digest":"sha256:0f17c9e332459089f30fbcf9e6e62d807b9526c6e1f9b4185b3af1ed63a82472","observation_id":"25afc675-608f-4440-9a7f-23147d086b79","resolution":{"observed_at":"2026-05-12T06:06:27.478293Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07954","last_updated":"2020-10-15T18:01:15Z","snapshot_observed_at":"2026-08-17T11:39:02.437980Z","submitted_at":"2020-10-15T18:01:15Z","title":"Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding","version":1},"cited_work":{"arxiv_id":"2010.07954","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.07954","snapshot_observed_at":"2026-07-04T09:09:43.507471Z","title":"Room-across-room: Multilingual vision- and-language navigation with dense spatiotemporal ground- ing","venue":null,"work_id":"164a5cbf-5a0b-47dc-8ab3-691f650a166a","year":2010},"citing_paper":{"arxiv_id":"2605.11762","last_updated":"2026-05-12T08:33:38Z","snapshot_observed_at":"2026-08-17T11:15:45.697420Z","submitted_at":"2026-05-12T08:33:38Z","title":"NavOL: Navigation Policy with Online Imitation Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T05:51:53.848800Z"},"links":{"cited_paper":"/paper/2010.07954","citing_paper":"/paper/2605.11762"},"observation_digest":"sha256:61fdf668406a4fd6a346923bbca5bd10602d7078ac931a9b1bf6313a736f979d","observation_id":"70cc6fd7-e32e-4d82-9d1c-a40a9c2047c9","resolution":{"observed_at":"2026-05-13T05:52:21.913474Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07954","last_updated":"2020-10-15T18:01:15Z","snapshot_observed_at":"2026-08-17T11:39:02.437980Z","submitted_at":"2020-10-15T18:01:15Z","title":"Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding","version":1},"cited_work":{"arxiv_id":"2010.07954","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.07954","snapshot_observed_at":"2026-07-04T09:09:43.507471Z","title":"Room-across-room: Multilingual vision- and-language navigation with dense spatiotemporal ground- ing","venue":null,"work_id":"164a5cbf-5a0b-47dc-8ab3-691f650a166a","year":2010},"citing_paper":{"arxiv_id":"2605.22036","last_updated":"2026-05-21T06:20:17Z","snapshot_observed_at":"2026-08-15T17:22:17.879626Z","submitted_at":"2026-05-21T06:20:17Z","title":"GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T06:45:35.920991Z"},"links":{"cited_paper":"/paper/2010.07954","citing_paper":"/paper/2605.22036"},"observation_digest":"sha256:267110d45d4e984c794daa36c5a1de7d04ac4ccaf564cad310b845051ae24a40","observation_id":"dad079b5-d37e-4a6d-9baa-ae99be1bde43","resolution":{"observed_at":"2026-05-22T06:46:10.597994Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07954","last_updated":"2020-10-15T18:01:15Z","snapshot_observed_at":"2026-08-17T11:39:02.437980Z","submitted_at":"2020-10-15T18:01:15Z","title":"Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding","version":1},"cited_work":{"arxiv_id":"2010.07954","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.07954","snapshot_observed_at":"2026-07-04T09:09:43.507471Z","title":"Room-across-room: Multilingual vision- and-language navigation with dense spatiotemporal ground- ing","venue":null,"work_id":"164a5cbf-5a0b-47dc-8ab3-691f650a166a","year":2010},"citing_paper":{"arxiv_id":"2606.22424","last_updated":"2026-08-17T08:21:55Z","snapshot_observed_at":"2026-08-19T09:17:07.484081Z","submitted_at":"2026-06-21T10:24:16Z","title":"FlowDec: Temporal Conditional Flow Decorruptor for Robust Continuous Vision-Language Navigation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T10:24:56.607921Z"},"links":{"cited_paper":"/paper/2010.07954","citing_paper":"/paper/2606.22424"},"observation_digest":"sha256:a38fe91af2d56b1a657fd8ab5b8b37039eae425f7603547a68e7a4c588afae6f","observation_id":"6b2826c3-71dc-4c98-ba20-c7d446411fbc","resolution":{"observed_at":"2026-07-04T09:09:43.509732Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07954","last_updated":"2020-10-15T18:01:15Z","snapshot_observed_at":"2026-08-17T11:39:02.437980Z","submitted_at":"2020-10-15T18:01:15Z","title":"Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding","version":1},"cited_work":{"arxiv_id":"2010.07954","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.07954","snapshot_observed_at":"2026-07-04T09:09:43.507471Z","title":"Room-across-room: Multilingual vision- and-language navigation with dense spatiotemporal ground- ing","venue":null,"work_id":"164a5cbf-5a0b-47dc-8ab3-691f650a166a","year":2010},"citing_paper":{"arxiv_id":"2606.30367","last_updated":"2026-06-29T14:33:03Z","snapshot_observed_at":"2026-08-06T15:33:36.109677Z","submitted_at":"2026-06-29T14:33:03Z","title":"FutureNav: Unified World-Action Modeling for Vision-and-Language Navigation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T05:05:56.065261Z"},"links":{"cited_paper":"/paper/2010.07954","citing_paper":"/paper/2606.30367"},"observation_digest":"sha256:1684ffe2ea0d3f89f6e8524d86f9dda886dd98e1f1e42f63ba60f25562618c33","observation_id":"6b50e8f1-74ea-4af0-8bf9-d78277a542aa","resolution":{"observed_at":"2026-06-30T15:54:49.926510Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07954","last_updated":"2020-10-15T18:01:15Z","snapshot_observed_at":"2026-08-17T11:39:02.437980Z","submitted_at":"2020-10-15T18:01:15Z","title":"Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07954","snapshot_observed_at":"2026-08-02T05:13:55.288909Z","title":"Room- across-room: Multilingual vision-and-language navigation with dense spatiotemporal grounding,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.13461","last_updated":"2026-07-15T05:46:34Z","snapshot_observed_at":"2026-08-17T08:03:05.810974Z","submitted_at":"2026-07-15T05:46:34Z","title":"Joint On-and-Off Policy Learning for Vision-and-Language Navigation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T05:13:55.288909Z"},"links":{"cited_paper":"/paper/2010.07954","citing_paper":"/paper/2607.13461"},"observation_digest":"sha256:cd3db218e1252d7e1608d59398c77f87765ffb420a7bb0f986298dcd69940d15","observation_id":"14c17f26-fc29-4785-aa0d-e7e187f7eae7","resolution":{"observed_at":"2026-08-02T05:13:55.288909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07954","last_updated":"2020-10-15T18:01:15Z","snapshot_observed_at":"2026-08-17T11:39:02.437980Z","submitted_at":"2020-10-15T18:01:15Z","title":"Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07954","snapshot_observed_at":"2026-08-14T04:34:35.115493Z","title":"arXiv preprint arXiv:2010.07954 (2020) 1, 2, 4, 6, 7","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.08596","last_updated":"2026-08-09T09:21:47Z","snapshot_observed_at":"2026-08-18T08:47:30.146792Z","submitted_at":"2026-08-09T09:21:47Z","title":"Goal-oriented Navigation Instruction Generation with Tour Video Priors","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T04:34:35.115493Z"},"links":{"cited_paper":"/paper/2010.07954","citing_paper":"/paper/2608.08596"},"observation_digest":"sha256:35191ed4cdd26bcdc7bb31e45d92049944d73030e5516645d4e6e2de8dca04a0","observation_id":"50370e0f-fdbc-4726-9b82-d38f282ff8c4","resolution":{"observed_at":"2026-08-14T04:34:35.115493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2010.07954/citation-record","integrity":"/paper/2010.07954/integrity","json":"/paper/2010.07954/citation-record.json","paper":"/paper/2010.07954"},"outbound":[],"paper":{"arxiv_id":"2010.07954","last_updated":"2020-10-15T18:01:15Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T11:39:02.437980Z","submitted_at":"2020-10-15T18:01:15Z","title":"Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 28 inbound Pith citation observations for arXiv:2010.07954."}