{"as_of":"2026-08-20T07:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:830128917abaab17fbc5b62c61c764d4b5e717795534117decbbb347d81be5d1","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T21:36:19.687871Z","state":"measured"},{"denominator":83,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":83,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":20,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:55:39.925157Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T03:19:30.523454Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08579","snapshot_observed_at":"2026-08-15T23:55:39.925157Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UA V Embodied Vision- and-Language Navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03460","last_updated":"2025-05-06T12:00:49Z","snapshot_observed_at":"2026-08-18T23:43:33.203866Z","submitted_at":"2025-05-06T12:00:49Z","title":"LogisticsVLN: Vision-Language Navigation For Low-Altitude Terminal Delivery Based on Agentic UAVs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:39.925157Z"},"links":{"cited_paper":"/paper/2411.08579","citing_paper":"/paper/2505.03460"},"observation_digest":"sha256:6549bcf69ce8aad65e757e24f8671307fd2b739c66949d6b377d399fa9bd3ba5","observation_id":"259dd385-779b-411d-8b2e-69fc3bc10033","resolution":{"observed_at":"2026-08-15T23:55:39.925157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08579","snapshot_observed_at":"2026-08-06T10:15:11.373098Z","title":"Navagent: Multi-scale urban street view fusion for uav embodied vision-and-language navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00288","last_updated":"2026-07-27T08:09:58Z","snapshot_observed_at":"2026-08-17T22:23:15.163304Z","submitted_at":"2025-08-01T03:23:06Z","title":"UAV-ON: A Benchmark for Open-World Object Goal Navigation with Aerial Agents","version":5},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T10:15:11.373098Z"},"links":{"cited_paper":"/paper/2411.08579","citing_paper":"/paper/2508.00288"},"observation_digest":"sha256:9c7da2fea4bdb14d2ba23d1354a63d4411962427cee2c35374eb46f210450a37","observation_id":"ae079907-e5e0-440d-8ecd-307e18499d80","resolution":{"observed_at":"2026-08-06T10:15:11.373098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08579","snapshot_observed_at":"2026-08-04T16:33:25.101602Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.12795","last_updated":"2026-06-01T08:46:33Z","snapshot_observed_at":"2026-08-18T03:22:49.328423Z","submitted_at":"2025-09-16T08:14:15Z","title":"When Large Language Models Meet UAV Projects: An Empirical Study from Developers' Perspective","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T16:33:25.101602Z"},"links":{"cited_paper":"/paper/2411.08579","citing_paper":"/paper/2509.12795"},"observation_digest":"sha256:97ec2d0a226e6b53a56a84e4849d763708e5031a5761a30e0057c4f4c50b0760","observation_id":"f85f8500-c1cd-416f-ab69-baf24b23d718","resolution":{"observed_at":"2026-08-04T16:33:25.101602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08579","snapshot_observed_at":"2026-08-03T05:36:30.808418Z","title":"Navagent: Multi-scale urban street view fusion for uav embodied vision-and-language navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.15875","last_updated":"2026-07-21T06:54:17Z","snapshot_observed_at":"2026-08-17T22:23:13.032805Z","submitted_at":"2026-02-02T09:06:50Z","title":"Fly0: Persistent Metric Anchoring for Zero-Shot Aerial Vision-Language Navigation","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-03T05:36:30.808418Z"},"links":{"cited_paper":"/paper/2411.08579","citing_paper":"/paper/2602.15875"},"observation_digest":"sha256:2d054fee3e23b217c7bdb243de1ae0c6cd84e4785948277aedff757f45f8aa3d","observation_id":"ca3e084c-5b35-4cf2-ad75-2483fd4f2113","resolution":{"observed_at":"2026-08-03T05:36:30.808418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":"2411.08579","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.08579","snapshot_observed_at":"2026-07-04T03:19:30.523454Z","title":"Navagent: Multi-scale urban street view fusion for uav embodied vision-and-language naviga- tion","venue":null,"work_id":"3884cfab-c93a-423d-8d79-e5ee8377b282","year":2024},"citing_paper":{"arxiv_id":"2604.07705","last_updated":"2026-04-09T01:47:24Z","snapshot_observed_at":"2026-08-14T13:37:53.696970Z","submitted_at":"2026-04-09T01:47:24Z","title":"Vision-Language Navigation for Aerial Robots: Towards the Era of Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T18:20:12.463846Z"},"links":{"cited_paper":"/paper/2411.08579","citing_paper":"/paper/2604.07705"},"observation_digest":"sha256:ae417cfbe2cf24207ae3748721b8de4d93cbe25a1e9656671838dfd8015a1d2d","observation_id":"e74eac90-090b-4076-b615-6751be7e3df7","resolution":{"observed_at":"2026-05-11T00:45:50.037911Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":"2411.08579","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.08579","snapshot_observed_at":"2026-07-04T03:19:30.523454Z","title":"Navagent: Multi-scale urban street view fusion for uav embodied vision-and-language naviga- tion","venue":null,"work_id":"3884cfab-c93a-423d-8d79-e5ee8377b282","year":2024},"citing_paper":{"arxiv_id":"2604.07973","last_updated":"2026-04-09T08:37:20Z","snapshot_observed_at":"2026-08-10T22:05:05.605567Z","submitted_at":"2026-04-09T08:37:20Z","title":"How Far Are Large Multimodal Models from Human-Level Spatial Action? A Benchmark for Goal-Oriented Embodied Navigation in Urban Airspace","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T18:09:39.510770Z"},"links":{"cited_paper":"/paper/2411.08579","citing_paper":"/paper/2604.07973"},"observation_digest":"sha256:dc63b070be3fcaf6478fdd403fb0d484994fac8e3bfeb7ebb8283b6ade7f471c","observation_id":"25d503f7-db0c-4a74-97b7-392f4d148dcc","resolution":{"observed_at":"2026-05-11T05:25:57.188006Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":"2411.08579","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.08579","snapshot_observed_at":"2026-07-04T03:19:30.523454Z","title":"Navagent: Multi-scale urban street view fusion for uav embodied vision-and-language naviga- tion","venue":null,"work_id":"3884cfab-c93a-423d-8d79-e5ee8377b282","year":2024},"citing_paper":{"arxiv_id":"2604.08883","last_updated":"2026-04-10T02:47:01Z","snapshot_observed_at":"2026-08-16T01:40:51.896198Z","submitted_at":"2026-04-10T02:47:01Z","title":"HTNav: A Hybrid Navigation Framework with Tiered Structure for Urban Aerial Vision-and-Language Navigation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T18:19:00.107417Z"},"links":{"cited_paper":"/paper/2411.08579","citing_paper":"/paper/2604.08883"},"observation_digest":"sha256:f5532a737af926a767e50c70c53078421416b200ef41a0fab935f165e21ac051","observation_id":"60634c23-66a7-4e1e-a62a-88033472dc05","resolution":{"observed_at":"2026-05-11T00:45:50.559653Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":"2411.08579","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.08579","snapshot_observed_at":"2026-07-04T03:19:30.523454Z","title":"Navagent: Multi-scale urban street view fusion for uav embodied vision-and-language naviga- tion","venue":null,"work_id":"3884cfab-c93a-423d-8d79-e5ee8377b282","year":2024},"citing_paper":{"arxiv_id":"2604.13654","last_updated":"2026-04-15T09:20:02Z","snapshot_observed_at":"2026-07-06T23:01:37.207817Z","submitted_at":"2026-04-15T09:20:02Z","title":"Vision-and-Language Navigation for UAVs: Progress, Challenges, and a Research Roadmap","version":1},"reference_index":121,"source":"pdf_text","source_observed_at":"2026-05-10T13:48:08.135538Z"},"links":{"cited_paper":"/paper/2411.08579","citing_paper":"/paper/2604.13654"},"observation_digest":"sha256:721546cb4e6a38b0e5334388d0d8fc49a5f85477308056f0b352e56a73378362","observation_id":"281c3450-e099-4200-87e8-6ea17bff0105","resolution":{"observed_at":"2026-05-10T14:10:29.748206Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":"2411.08579","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.08579","snapshot_observed_at":"2026-07-04T03:19:30.523454Z","title":"Navagent: Multi-scale urban street view fusion for uav embodied vision-and-language naviga- tion","venue":null,"work_id":"3884cfab-c93a-423d-8d79-e5ee8377b282","year":2024},"citing_paper":{"arxiv_id":"2604.16298","last_updated":"2026-04-17T17:59:48Z","snapshot_observed_at":"2026-08-11T10:42:04.784310Z","submitted_at":"2026-04-17T17:59:48Z","title":"FineCog-Nav: Integrating Fine-grained Cognitive Modules for Zero-shot Multimodal UAV Navigation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T08:13:12.029402Z"},"links":{"cited_paper":"/paper/2411.08579","citing_paper":"/paper/2604.16298"},"observation_digest":"sha256:561043237bb8a8a5a1343e0cb0485f24b0d4bc672c1e4003b04fe3e4b955a5c6","observation_id":"507a31ba-0e73-43e3-8858-b22ed6148c8f","resolution":{"observed_at":"2026-05-10T08:17:37.797250Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":"2411.08579","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.08579","snapshot_observed_at":"2026-07-04T03:19:30.523454Z","title":"Navagent: Multi-scale urban street view fusion for uav embodied vision-and-language naviga- tion","venue":null,"work_id":"3884cfab-c93a-423d-8d79-e5ee8377b282","year":2024},"citing_paper":{"arxiv_id":"2604.16993","last_updated":"2026-07-01T08:24:40Z","snapshot_observed_at":"2026-08-14T13:38:39.932714Z","submitted_at":"2026-04-18T13:41:46Z","title":"Rule-VLN: Bridging Perception and Compliance via Semantic Reasoning and Geometric Rectification","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T06:55:33.464951Z"},"links":{"cited_paper":"/paper/2411.08579","citing_paper":"/paper/2604.16993"},"observation_digest":"sha256:0d315542e4d8e436aab1634a30656ae8c74d264a6418ca46ccaea3830de9ff85","observation_id":"d6299eff-d61f-4149-acc2-8a2142a33336","resolution":{"observed_at":"2026-05-10T06:56:47.412900Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08579","snapshot_observed_at":"2026-07-12T19:10:41.883296Z","title":"arXiv preprint arXiv:2411.08579 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.16993","last_updated":"2026-07-01T08:24:40Z","snapshot_observed_at":"2026-08-14T13:38:39.932714Z","submitted_at":"2026-04-18T13:41:46Z","title":"Rule-VLN: Bridging Perception and Compliance via Semantic Reasoning and Geometric Rectification","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-12T19:10:41.883296Z"},"links":{"cited_paper":"/paper/2411.08579","citing_paper":"/paper/2604.16993"},"observation_digest":"sha256:85804bf55f4b5711af348a932e2c958a6a024dc8755da0f562f3894129651f7c","observation_id":"07109b6f-f89c-44c0-b6d8-90af4a1690df","resolution":{"observed_at":"2026-07-12T19:10:41.883296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":"2411.08579","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.08579","snapshot_observed_at":"2026-07-04T03:19:30.523454Z","title":"Navagent: Multi-scale urban street view fusion for uav embodied vision-and-language naviga- tion","venue":null,"work_id":"3884cfab-c93a-423d-8d79-e5ee8377b282","year":2024},"citing_paper":{"arxiv_id":"2606.00104","last_updated":"2026-05-26T10:03:22Z","snapshot_observed_at":"2026-08-17T22:21:49.586026Z","submitted_at":"2026-05-26T10:03:22Z","title":"PEACE: A Planner-Executor Agent with Constraint Enforcement for UAVs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T16:53:17.504094Z"},"links":{"cited_paper":"/paper/2411.08579","citing_paper":"/paper/2606.00104"},"observation_digest":"sha256:167f12e6704be8cef9e2f5ff04cdbc6067cbdfbc26f3c7872f7b0309b7a2e147","observation_id":"910f37db-f518-45b3-9204-338162d99e22","resolution":{"observed_at":"2026-06-29T16:53:40.407954Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":"2411.08579","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.08579","snapshot_observed_at":"2026-07-04T03:19:30.523454Z","title":"Navagent: Multi-scale urban street view fusion for uav embodied vision-and-language naviga- tion","venue":null,"work_id":"3884cfab-c93a-423d-8d79-e5ee8377b282","year":2024},"citing_paper":{"arxiv_id":"2606.20045","last_updated":"2026-06-18T10:21:42Z","snapshot_observed_at":"2026-08-02T02:11:10.009488Z","submitted_at":"2026-06-18T10:21:42Z","title":"See-and-Reach: Precise Vision-Language Navigation for UAVs within the Field of View","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T18:15:12.176935Z"},"links":{"cited_paper":"/paper/2411.08579","citing_paper":"/paper/2606.20045"},"observation_digest":"sha256:b0ce0a178e3405b2941ee436604b9b60252e2908ad61a0636c2d728dcbcf3826","observation_id":"cd4be5a4-5079-4ea6-a506-b9d38a0f776d","resolution":{"observed_at":"2026-07-04T03:19:30.526950Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":"2411.08579","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.08579","snapshot_observed_at":"2026-07-04T03:19:30.523454Z","title":"Navagent: Multi-scale urban street view fusion for uav embodied vision-and-language naviga- tion","venue":null,"work_id":"3884cfab-c93a-423d-8d79-e5ee8377b282","year":2024},"citing_paper":{"arxiv_id":"2606.31467","last_updated":"2026-06-30T10:46:23Z","snapshot_observed_at":"2026-07-07T00:05:12.546815Z","submitted_at":"2026-06-30T10:46:23Z","title":"AeroVerse-SatAgent: UAV-Satellite Collaborative Spatial Reasoning Inspired by the Dual Visual Pathway Theory of Cognitive Neuroscience","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-01T06:18:35.494240Z"},"links":{"cited_paper":"/paper/2411.08579","citing_paper":"/paper/2606.31467"},"observation_digest":"sha256:623debbbf7f5175652ad72dc3dfb888ec00af14bb76796e01b418e403d28d4e4","observation_id":"2671ee09-a933-488d-acac-8753d74c1d37","resolution":{"observed_at":"2026-07-01T09:45:39.825514Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":"2411.08579","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.08579","snapshot_observed_at":"2026-07-04T03:19:30.523454Z","title":"Navagent: Multi-scale urban street view fusion for uav embodied vision-and-language naviga- tion","venue":null,"work_id":"3884cfab-c93a-423d-8d79-e5ee8377b282","year":2024},"citing_paper":{"arxiv_id":"2606.31654","last_updated":"2026-07-02T11:38:15Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T13:33:48Z","title":"DynFly: Dynamic-Aware Continuous Trajectory Generation for UAV Vision-Language Navigation in Urban Environments","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-01T05:35:32.213470Z"},"links":{"cited_paper":"/paper/2411.08579","citing_paper":"/paper/2606.31654"},"observation_digest":"sha256:b3efa4140e3fb1f3fbef39678cb09fabe29a01e3b9a269effc0982274ac04965","observation_id":"246d65ed-a381-499f-8135-741a3e9cd573","resolution":{"observed_at":"2026-07-01T10:25:41.213953Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":"2411.08579","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.08579","snapshot_observed_at":"2026-07-04T03:19:30.523454Z","title":"Navagent: Multi-scale urban street view fusion for uav embodied vision-and-language naviga- tion","venue":null,"work_id":"3884cfab-c93a-423d-8d79-e5ee8377b282","year":2024},"citing_paper":{"arxiv_id":"2606.31654","last_updated":"2026-07-02T11:38:15Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T13:33:48Z","title":"DynFly: Dynamic-Aware Continuous Trajectory Generation for UAV Vision-Language Navigation in Urban Environments","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-03T22:11:44.933463Z"},"links":{"cited_paper":"/paper/2411.08579","citing_paper":"/paper/2606.31654"},"observation_digest":"sha256:b37084300dd7179383ed04f1d5467ecd19f260077d3098fce36b3f0d41d22423","observation_id":"aba18c66-6fb9-4f43-a8c9-1ec819251b22","resolution":{"observed_at":"2026-07-03T22:18:59.686028Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08579","snapshot_observed_at":"2026-07-11T20:35:41.043764Z","title":"NavAgent: Multi-Scale Urban Street View Fusion for UA V Embodied Vision-and- Language Navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04255","last_updated":"2026-07-05T12:12:33Z","snapshot_observed_at":"2026-08-14T13:38:42.400822Z","submitted_at":"2026-07-05T12:12:33Z","title":"Towards Effcient Low Altitude Sensing: A Dual Heterogeneous Graph Learning Method for UAV Task Allocation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-11T20:35:41.043764Z"},"links":{"cited_paper":"/paper/2411.08579","citing_paper":"/paper/2607.04255"},"observation_digest":"sha256:8f3282fd74f6fbfa548988bfe214f839cbe26e0b29ab572d3971b41d26efbbd9","observation_id":"82cfd643-ee91-4fea-a522-1a1889a1a7ad","resolution":{"observed_at":"2026-07-11T20:35:41.043764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08579","snapshot_observed_at":"2026-07-14T15:39:59.878169Z","title":"Navagent: Multi-scale urban street view fusion for uav embodied vision-and-language navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09792","last_updated":"2026-07-09T05:13:02Z","snapshot_observed_at":"2026-08-18T05:01:27.829335Z","submitted_at":"2026-07-09T05:13:02Z","title":"A Comprehensive Survey and Systematic Real-World Evaluation of Embodied Vision-and-Language Navigation","version":1},"reference_index":263,"source":"pdf_text","source_observed_at":"2026-07-14T15:39:59.878169Z"},"links":{"cited_paper":"/paper/2411.08579","citing_paper":"/paper/2607.09792"},"observation_digest":"sha256:a3df31cbf94f9450830b5b9ebfe8c8fa90b18c74d9413010b4768e82793ff2ad","observation_id":"98a73178-a137-4fd4-ad4f-d5c0ced63f36","resolution":{"observed_at":"2026-07-14T15:39:59.878169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08579","snapshot_observed_at":"2026-07-14T04:58:23.085764Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11529","last_updated":"2026-07-13T13:14:20Z","snapshot_observed_at":"2026-08-17T08:26:56.484885Z","submitted_at":"2026-07-13T13:14:20Z","title":"Parse, Search, and Confirmation: Training-Free Aerial Vision-and-Dialog Navigation with Chain-of-Thought Reasoning and Structured Spatial Memory","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T04:58:23.085764Z"},"links":{"cited_paper":"/paper/2411.08579","citing_paper":"/paper/2607.11529"},"observation_digest":"sha256:1906487d792a793c6e54fdaee00aa07f8a128bd6da0e911f58c0bedd4581b87f","observation_id":"c73e5cef-efe4-4e20-998a-fa9370c7a9d2","resolution":{"observed_at":"2026-07-14T04:58:23.085764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08579","snapshot_observed_at":"2026-08-06T15:42:59.145803Z","title":"arXiv preprint arXiv:2411.08579 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04825","last_updated":"2026-08-05T13:27:07Z","snapshot_observed_at":"2026-08-17T05:40:21.511018Z","submitted_at":"2026-08-05T13:27:07Z","title":"Deliberate Before You Fly: Vision-Guided Spatial Deliberation for UAV See-and-Reach Navigation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T15:42:59.145803Z"},"links":{"cited_paper":"/paper/2411.08579","citing_paper":"/paper/2608.04825"},"observation_digest":"sha256:5e828de7ead7d976456aaf22cb06cbbea5ccb7a31ec858849b171b643873f37d","observation_id":"8694a104-4ed1-4bc4-994e-e90d4ff8b656","resolution":{"observed_at":"2026-08-06T15:42:59.145803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.08579/citation-record","integrity":"/paper/2411.08579/integrity","json":"/paper/2411.08579/citation-record.json","paper":"/paper/2411.08579"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:20.285488Z","title":"Aerialvln: Vision-and-language navigation for uavs,","venue":null,"work_id":"c286805d-4878-42b5-a6d0-e207036b1ce2","year":2023},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.524424Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:5e508aa1a97afb6f796f714de3dc596594515eda9f29c38ed003432ac0cb2e7c","observation_id":"04fe7347-d2af-4c67-8b3f-6876f353ca2e","resolution":{"observed_at":"2026-08-12T21:36:20.288573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:20.277071Z","title":"Vision- and-language navigation: Interpreting visually-grounded navigation in- structions in real environments,","venue":null,"work_id":"8fa00320-f931-4a02-a000-1771b1a0f8c1","year":2017},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.527708Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:1ec4a4b0a2f8609549be5669ecc7cddd908fcaa1ee9a0989867da47af54141ca","observation_id":"d02febe6-863d-4560-b23a-d4476a0d7b9c","resolution":{"observed_at":"2026-08-12T21:36:20.280133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:20.268836Z","title":"Reverie: Remote embodied visual referring expression in real indoor environ- ments,","venue":null,"work_id":"176c9777-b915-44b3-8152-564b8a8d1c76","year":2020},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.530423Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:7b3887315f4000fb50541f56871866966f31bb1545599647b21d58696406a018","observation_id":"50c515e4-f099-49ca-88c6-f8938fb987ec","resolution":{"observed_at":"2026-08-12T21:36:20.271809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:20.258871Z","title":"Stay on the path: Instruction fidelity in vision-and-language navigation,","venue":null,"work_id":"c0088d5d-3a34-476b-ac02-b1543c2f3283","year":2019},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.533221Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:f6207240bdc83c1388fd4a2992341398898d6ef2251fd20bf666461ec2232ab9","observation_id":"c028d0b6-99e3-438b-9115-b29d8be19baf","resolution":{"observed_at":"2026-08-12T21:36:20.263047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:20.250910Z","title":"Room-across- room: Multilingual vision-and-language navigation with dense spa- tiotemporal grounding,","venue":null,"work_id":"2c726f0a-ad14-49b4-aadb-03c2e6b822fd","year":2020},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.536142Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:47d9c0ff3a6d697bfac29b3685f149094578866af18b3d58f6f41502249a494a","observation_id":"8167c85e-b03d-4658-8d39-7bb3a5ee43ef","resolution":{"observed_at":"2026-08-12T21:36:20.253757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:20.243673Z","title":"Beyond the nav-graph: Vision-and-language navigation in continuous environments,","venue":null,"work_id":"c6274a57-3d1b-4ba1-acca-bd09985c482b","year":2020},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.538936Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:83af2e69b0ef5cca08c839383f80082cb3c54fa91fdcfc66780f45e67cc3e1f1","observation_id":"481fcf3f-a758-4e06-946d-c1609a40be6d","resolution":{"observed_at":"2026-08-12T21:36:20.246465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:20.235838Z","title":"Touchdown: Natural language navigation and spatial reasoning in visual street environments,","venue":null,"work_id":"98743599-0964-4460-9dc9-fb33d7890450","year":2019},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.541736Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:0343fe9683394fcd175e6beef7f7bbe2497932f91e993f7507bd8c3839ecaca4","observation_id":"5ff2afa4-1dda-4515-b01d-6d3af43202b5","resolution":{"observed_at":"2026-08-12T21:36:20.239046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:20.226271Z","title":"Dji drone solutions for inspection and infrastructure construction in the oil and gas industry,","venue":null,"work_id":"879b8e97-23f0-4ef4-843c-d4cd48c40d3c","year":2022},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.544208Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:ebb1d66ea5044b6b15e1345e82f21d8d69595d4069f3c2fca42f72acfd183cbb","observation_id":"6b3e3a5c-0025-4063-8dcb-9ee6423bebfa","resolution":{"observed_at":"2026-08-12T21:36:20.229332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:20.216885Z","title":"Dji drone solutions for optimizing operations in the public safety industry,","venue":null,"work_id":"fbcc516e-e6bc-4408-afd3-cec21d89781e","year":2022},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.546761Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:ddfced4032513187a4c846521613e20dad294c6d16bbc855799087656228ab54","observation_id":"8558fc49-85bb-474c-b317-86724bd9dc96","resolution":{"observed_at":"2026-08-12T21:36:20.220369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:20.207993Z","title":"Dji drone solutions for surveying, urban planning, aec, and natural resource management,","venue":null,"work_id":"2f9ef955-4535-4a34-9354-a744c25c6263","year":2022},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.549505Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:3cbcd121b9cf2f318a758e568f1ac16fff0467314db6f5ac549b9b630506e884","observation_id":"55091f4a-2bd7-44c1-964f-5fe7f245fcef","resolution":{"observed_at":"2026-08-12T21:36:20.211167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:20.199348Z","title":"Hop+: History- enhanced and order-aware pre-training for vision-and-language naviga- tion,","venue":null,"work_id":"e857bfe5-e573-444b-b362-8e65286ff5d5","year":2023},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.551791Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:6b96a69646ab681fdaeac4732f7ed7263c67c48c2b46131a29e7f0585fcba966","observation_id":"9bc98473-640a-4dbb-99d8-4343722935b2","resolution":{"observed_at":"2026-08-12T21:36:20.202399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.34077","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:19.875324Z","title":"Correctable landmark discovery via large models for vision-language navigation,","venue":null,"work_id":"514a6f06-bba5-42fd-97e5-2001f84e1ec5","year":2024},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.554070Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:83ee50f4dcd29ca1ef92cd6d3734ca5750bd857f0df965ac4c9ed0733475e648","observation_id":"14b69d68-b0b4-43a7-b915-71a6246b0d82","resolution":{"observed_at":"2026-08-12T21:36:19.880078Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:20.189745Z","title":"Learning to follow and generate instructions for language-capable navigation,","venue":null,"work_id":"8b2241d4-349d-4f64-8b45-21b56b701aec","year":2024},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.556607Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:673d732743b3e73d858d2b9b3ed24f113bf791068c2505a092b8791b57f92e73","observation_id":"05b6b6d9-d36c-44ca-bdc5-ad72ac5e78dc","resolution":{"observed_at":"2026-08-12T21:36:20.193474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03047","last_updated":"2024-01-22T04:57:32Z","snapshot_observed_at":"2026-08-18T09:11:44.749036Z","submitted_at":"2023-04-06T13:07:17Z","title":"ETPNav: Evolving Topological Planning for Vision-Language Navigation in Continuous Environments","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03047","snapshot_observed_at":"2026-08-12T21:36:19.559058Z","title":"Etpnav: Evolving topological planning for vision-language navigation in continuous environments,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.559058Z"},"links":{"cited_paper":"/paper/2304.03047","citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:8bc8cb2c6d7b17997eb914a9e70ad46b1210d6a2b86e4a6e9e03c84f9895bc6b","observation_id":"ac166ce2-4757-4d7c-b6e3-40c2a72d9b54","resolution":{"observed_at":"2026-08-12T21:36:19.559058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:20.180207Z","title":"Towards deviation-robust agent navigation via perturbation-aware con- trastive learning,","venue":null,"work_id":"b17e905d-6b85-4887-8bfd-5f5ae7f95bdc","year":2023},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.562158Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:ccf4c8086ef60c41edae63ff7602943322c8bcf9cf6c200445913f7b5c3b6182","observation_id":"be234d5e-41ea-4056-acee-55b1c92de0d8","resolution":{"observed_at":"2026-08-12T21:36:20.183382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:20.170395Z","title":"A survey on vision-based uav navigation,","venue":null,"work_id":"5b3bbcd0-5f76-4c09-bfd4-fdd5e7f51dcf","year":null},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.564603Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:eec6a12e6ad64ed46f56ecbefa207c0b31504a79f1cb0d0c2dc956485bae3cfb","observation_id":"ed55ea5f-55fd-443b-ad70-5c8664cf7d43","resolution":{"observed_at":"2026-08-12T21:36:20.173548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:20.160538Z","title":"Vision-based navigation of unmanned aerial vehicles,","venue":null,"work_id":"fe8e18cd-d0a7-4917-beec-6ccc9ace5d6e","year":2010},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.567166Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:a451ed030360170f6def62176caea79c82b4759668b181a25ddc206ad0132f41","observation_id":"8b95d68b-795b-46f2-977f-e43f83ed39ee","resolution":{"observed_at":"2026-08-12T21:36:20.163859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:20.151486Z","title":"Mapping instructions to actions in 3d environments with visual goal prediction,","venue":null,"work_id":"6e477e42-247f-46e5-a021-2c1a99fc299b","year":2018},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.569665Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:5f2ec1173226518672b5438e77abcfeebc4e71fd91c2cd69686551af69d35b12","observation_id":"87158f5f-f303-41c3-9aae-244024c4b5cc","resolution":{"observed_at":"2026-08-12T21:36:20.154605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:20.141977Z","title":"Following high-level navigation instructions on a simulated quadcopter with imitation learning,","venue":null,"work_id":"2baf4814-f39f-4e15-a371-1b058d0e2f14","year":2018},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.572086Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:8e7c822928125dfc88d441f4560287444a888593e1598d958e05a7d1087d7656","observation_id":"3dfead87-f1b0-423d-b421-8bc819ef90a1","resolution":{"observed_at":"2026-08-12T21:36:20.145386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:20.132092Z","title":"Mapping naviga- tion instructions to continuous control actions with position-visitation prediction,","venue":null,"work_id":"6b06025a-4b32-4f59-8cc1-417a1f9df77b","year":2018},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.574502Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:ccb77da3d471658c5bff9fd85da4a29200155728c8f8cf2d717bb81a13ed3220","observation_id":"740247c1-d6d0-4488-acc2-50780c0f342b","resolution":{"observed_at":"2026-08-12T21:36:20.135601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:19.577236Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.577236Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:438db5a342bfd6062ed93f473154faadef85b67cdb5f4a55724f2d422b472119","observation_id":"5c176195-5011-4465-afe1-9ca700386462","resolution":{"observed_at":"2026-08-12T21:36:19.577236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-12T21:36:19.582527Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.582527Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:61ddf193e465965bd3b4f0307f52c1e679f7b711465ea091545f0792b8e370ca","observation_id":"08c75f42-d292-497b-aa46-88e384b5241a","resolution":{"observed_at":"2026-08-12T21:36:19.582527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:20.108378Z","title":"Grounded language-image pre- training,","venue":null,"work_id":"e2015d4e-86d0-4f6f-80fa-ea14176bcfb5","year":2021},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.585270Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:e73c70b6eb2b7c711a3a93b8a20ebb178f162e11e0d4f0e9254549c317a72764","observation_id":"8081e15b-0bed-4e6a-8e0f-a7ef0b1f98f4","resolution":{"observed_at":"2026-08-12T21:36:20.111581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:19.587760Z","title":"Instructblip: Towards general-purpose vision- language models with instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.587760Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:eb4084747f7a1684077724afecabcfacbd303dfcd470875b47d0cbd3f07159b3","observation_id":"d5640189-f98a-43fb-ad4d-01639967cd94","resolution":{"observed_at":"2026-08-12T21:36:19.587760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-08-12T12:24:23.815073Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-12T21:36:19.590227Z","title":"Kosmos-2: Grounding multimodal large language models to the world,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.590227Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:7aa5815e9dab17b89fd3170fd554e308dbd6841461fed6cba50ac82d8a2147c4","observation_id":"b3ff0a49-d507-4da7-bbe7-e2ccbd7c251b","resolution":{"observed_at":"2026-08-12T21:36:19.590227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-13T10:46:50.834601Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16199","snapshot_observed_at":"2026-08-12T21:36:19.592961Z","title":"Llama-adapter: E fficient fine-tuning of language models with zero-init attention,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.592961Z"},"links":{"cited_paper":"/paper/2303.16199","citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:e7c5afd9182e8194f892e219bd9bc531fcaa66929c1f24d9497c4e42059a3471","observation_id":"cd3e0007-e2bd-4113-9be9-ea1546bf5de0","resolution":{"observed_at":"2026-08-12T21:36:19.592961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-12T21:36:19.595607Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.595607Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:1dd90148b5c79a017d6a0f302e15835ebc54f7c7024fedae92d6fce59f70ce23","observation_id":"e42cd9e9-2987-4fd5-b6fe-175616d3c02d","resolution":{"observed_at":"2026-08-12T21:36:19.595607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-12T21:36:19.598472Z","title":"Qwen technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.598472Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:64921dc26f603c1e423c326858bba736a1db10f4322c9435ae300e9d68072e3b","observation_id":"e700f938-6099-49c1-9cc8-9ad87223acd7","resolution":{"observed_at":"2026-08-12T21:36:19.598472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:20.093918Z","title":"Gsv-cities: Toward appropriate supervised visual place recognition,","venue":null,"work_id":"ef8c83f0-53a3-405d-8648-55d8e973ee1b","year":2022},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.601061Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:9afa7e1009cc8c47b7d58382831468dd6b5f2dbed55608c689eaaba5e3f94fa0","observation_id":"361d3cf7-3a01-4b60-aaca-0466c615004e","resolution":{"observed_at":"2026-08-12T21:36:20.097195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:20.085311Z","title":"The streetlearn environment and dataset,","venue":null,"work_id":"6a3188d5-e5de-435d-ac84-1cbf23075fe8","year":2019},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.603333Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:c12aef37b5b07e671aedb460ca2081ccf44363c612a0678959c2f646ec5500af","observation_id":"1faea57a-3bfb-4221-9c99-11a2f445dcb8","resolution":{"observed_at":"2026-08-12T21:36:20.088346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:20.076732Z","title":"Learning to follow directions in street view,","venue":null,"work_id":"f579be9b-9213-447a-a9bd-cbe3ba51ce0a","year":2020},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.605868Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:e12e93ffbeb77692ade8cd9c03e4b830f62ff6fe6ca105fc2b074f66ad8b556e","observation_id":"5c2dcecb-229a-40f0-802b-a76f9f343137","resolution":{"observed_at":"2026-08-12T21:36:20.079866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:20.067482Z","title":"Retouchdown: Adding touchdown to streetlearn as a shareable resource for language grounding tasks in street view,","venue":null,"work_id":"2012989a-3a3b-4d72-a7d4-d6a5e2966521","year":2020},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.608453Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:f3256cae80aab1de17432fa306761920f1ae3b2c9377d07454fb51a2d868d66d","observation_id":"a88d4c06-7bf1-4479-ba47-f36f1c8985cd","resolution":{"observed_at":"2026-08-12T21:36:20.070836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:20.058637Z","title":"Silg: The multi-environment symbolic interactive language grounding benchmark,","venue":null,"work_id":"febd489c-c74e-423f-b58c-fb55a61032c7","year":2021},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.610952Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:a7839a7cf49c67cf54535901698b5234cdd0c16c059ad3a20604fccd24e4326c","observation_id":"27ec9b46-ea08-4b44-912e-985f984d3931","resolution":{"observed_at":"2026-08-12T21:36:20.061931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:20.049944Z","title":"Outdoor vision-and-language navigation needs object-level alignment,","venue":null,"work_id":"11aaf707-d9d3-4127-a1b6-7724440bd2d4","year":2023},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.613415Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:1e4a1684eeb9417100cb73aed5b1e0d366b99b8a0dd35505b35befcf1e40d9fe","observation_id":"cb78d08c-45a3-49cd-b72d-c196970336c2","resolution":{"observed_at":"2026-08-12T21:36:20.053117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:20.040942Z","title":"A priority map for vision-and- language navigation with trajectory plans and feature-location cues,","venue":null,"work_id":"9e414ffa-ead0-4baa-ac14-1ac6f2e8d7d6","year":null},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.615811Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:95c1b9aa1dfb3aabc8f47d997f4589b7a0b9547c6075f3c4fab6f39a57dfccc2","observation_id":"ebeb6a68-5332-4048-95e9-2b7fd5c47faa","resolution":{"observed_at":"2026-08-12T21:36:20.044234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:20.031807Z","title":"Multimodal text style transfer for outdoor vision- and-language navigation,","venue":null,"work_id":"cf918c27-4e18-4390-ad47-b7523216d393","year":2021},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.621791Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:0c22ada9fe76f7cf2f61d4bf17a668943201056df012cfea3424212c5e503ac0","observation_id":"c4797cf4-cd03-4f72-8c2d-85c8e909d761","resolution":{"observed_at":"2026-08-12T21:36:20.035193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04429","last_updated":"2022-07-26T10:46:15Z","snapshot_observed_at":"2026-08-16T16:47:07.736175Z","submitted_at":"2022-07-10T10:41:50Z","title":"LM-Nav: Robotic Navigation with Large Pre-Trained Models of Language, Vision, and Action","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.04429","snapshot_observed_at":"2026-08-12T21:36:19.624438Z","title":"Lm-nav: Robotic navigation with large pre-trained models of language, vision, and action,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.624438Z"},"links":{"cited_paper":"/paper/2207.04429","citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:6655c74a265e7242538ef16cccf274b772f3b05bf480f3b4120b368c9ab610f0","observation_id":"7a35650c-9e21-4afa-884b-6f1c7c6c42bf","resolution":{"observed_at":"2026-08-12T21:36:19.624438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06082","last_updated":"2024-01-24T15:10:07Z","snapshot_observed_at":"2026-08-18T15:50:47.427033Z","submitted_at":"2023-07-12T11:08:24Z","title":"VELMA: Verbalization Embodiment of LLM Agents for Vision and Language Navigation in Street View","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06082","snapshot_observed_at":"2026-08-12T21:36:19.627503Z","title":"Velma: Verbalization embodiment of llm agents for vision and language navigation in street view,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.627503Z"},"links":{"cited_paper":"/paper/2307.06082","citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:ed9dda1348dafa568b0a7e30787cc3bf112a76068ad656941848a820969b29df","observation_id":"9a42f1b5-c8e9-4924-98db-5bf2536bd6b2","resolution":{"observed_at":"2026-08-12T21:36:19.627503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:20.022923Z","title":"Opt: Open pre-trained transformer language models,","venue":null,"work_id":"0c1a90c1-c43f-4a97-b674-d79b271f8498","year":2022},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.630225Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:3e7f0e40c3aefc7593e1b07b2412a348732a054427f92d4fef0f167cd184888b","observation_id":"3f7c5d22-0c64-4ab6-9eea-8ee5d29860b3","resolution":{"observed_at":"2026-08-12T21:36:20.025980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:20.014081Z","title":"Palm-e: An embodied multimodal language model,","venue":null,"work_id":"55c69390-de0c-4a3b-98bc-9706c3803b0f","year":2023},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.632744Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:ffa803b7df727d983c1a061fe612cd060e284e7447fb2861a0f4905849263212","observation_id":"b98990a4-4241-4958-a765-dd272f545f0e","resolution":{"observed_at":"2026-08-12T21:36:20.017244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:20.005651Z","title":"Training language models to follow instructions with human feedback,","venue":null,"work_id":"0ac447de-6a91-4425-a748-ec2d3e84941d","year":2022},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.635530Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:ae85bee73e028b93e13d6e750bb2c73f5868427f069ddcda206d9850d60770f6","observation_id":"671d8ebc-8939-401d-ae97-9604757d5c70","resolution":{"observed_at":"2026-08-12T21:36:20.008623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T21:36:19.638214Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.638214Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:bbee7accac2d5a06e57f22a9bf06b0e8c5a12b8d12ad760b708a4db8580bdb92","observation_id":"68054db1-e704-4b2a-902d-dd2bbbaa29a2","resolution":{"observed_at":"2026-08-12T21:36:19.638214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T21:36:19.641203Z","title":"Llama: Open and e fficient foun- dation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.641203Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:23bdc39d04479726b4ac03d71c61d9568e0b307a02d78197c3963f0b39f22e66","observation_id":"e30296cb-10a5-4f4f-9065-a72edb665336","resolution":{"observed_at":"2026-08-12T21:36:19.641203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13166","last_updated":"2023-07-06T06:25:33Z","snapshot_observed_at":"2026-08-16T15:59:04.102953Z","submitted_at":"2023-01-30T18:37:32Z","title":"ESC: Exploration with Soft Commonsense Constraints for Zero-shot Object Navigation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13166","snapshot_observed_at":"2026-08-12T21:36:19.643739Z","title":"Esc: Exploration with soft commonsense constraints for zero-shot object navigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.643739Z"},"links":{"cited_paper":"/paper/2301.13166","citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:f87c9ba9fc18a33e7daea6010dfe5af572c9e0922381409e18e4cdd4c6e31977","observation_id":"e59f452c-8b74-461c-aecf-fbac03409379","resolution":{"observed_at":"2026-08-12T21:36:19.643739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16986","last_updated":"2023-10-19T17:59:43Z","snapshot_observed_at":"2026-08-19T00:49:50.086891Z","submitted_at":"2023-05-26T14:41:06Z","title":"NavGPT: Explicit Reasoning in Vision-and-Language Navigation with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16986","snapshot_observed_at":"2026-08-12T21:36:19.646539Z","title":"Navgpt: Explicit reasoning in vision-and-language navigation with large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.646539Z"},"links":{"cited_paper":"/paper/2305.16986","citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:1c59d17efa76f5342e9e0d506fc0a6f56d60d78ea31ccefc449ad35cd2c4e064","observation_id":"018b6d5a-777a-4d61-b9be-40de66b54966","resolution":{"observed_at":"2026-08-12T21:36:19.646539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:19.996532Z","title":"Neural slam: Learning to explore with external memory,","venue":null,"work_id":"dc4dfb28-f4d7-4a30-b3ed-0eae837fe43e","year":2017},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.649143Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:e3c4338f0b4d0d0696d9d9faab9366571a8f0168e616fea439daa5ae8fadb434","observation_id":"981a5aad-1fb3-4393-b193-a96efc1b2a7b","resolution":{"observed_at":"2026-08-12T21:36:19.999617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:19.987609Z","title":"Egomap: Pro- jective mapping and structured egocentric memory for deep rl,","venue":null,"work_id":"b306aaaa-cc87-432c-b59d-27139af4695a","year":2021},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.651661Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:5732f04a1720af25c558d961a4a090f2d9eddb5f81b3c8ebaf560c80358ba258","observation_id":"97d9714a-e0d8-40ed-a4a6-f453f5a2b1c9","resolution":{"observed_at":"2026-08-12T21:36:19.990743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:19.978656Z","title":"Semantic mapnet: Building allocentric semanticmaps and representations from egocentric views,","venue":null,"work_id":"64e6c780-f134-4a3c-ae9d-d30d338eff36","year":2020},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.654249Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:0e6dc7170ab569694e022544aa2729d567b25a469661a1626c10ee8e300653f3","observation_id":"f0dd38f3-aeee-4319-b76c-8bc758bef865","resolution":{"observed_at":"2026-08-12T21:36:19.981765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:19.969553Z","title":"Audio visual language maps forrobot navigation,","venue":null,"work_id":"5426bbeb-7ef8-4354-a526-d2b0c97893a9","year":2024},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.656831Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:9e8035c3f9df5ec3dc816cef18a2787b5bf88dbd08eae770c8d604881a18c9be","observation_id":"5752096d-59e7-40e4-a8be-53be577cebd1","resolution":{"observed_at":"2026-08-12T21:36:19.972719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:19.960450Z","title":"Mapnet: An allocentric spatial memory for mapping environments,","venue":null,"work_id":"da08dbc0-a362-40f7-8044-a83e7a6cd2c3","year":2018},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.659298Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:8b2b7bfdad3730f8589fe3f723eac4a72135503cdbc9fe91829a3995ebb26258","observation_id":"d0e7dad1-cedc-4b88-8ddc-f46816f24fc3","resolution":{"observed_at":"2026-08-12T21:36:19.963827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04385","last_updated":"2023-08-03T09:39:00Z","snapshot_observed_at":"2026-08-16T16:10:00.769704Z","submitted_at":"2022-12-08T16:27:54Z","title":"BEVBert: Multimodal Map Pre-training for Language-guided Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04385","snapshot_observed_at":"2026-08-12T21:36:19.661906Z","title":"Bevbert: Multimodal map pre-training for language-guided navigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.661906Z"},"links":{"cited_paper":"/paper/2212.04385","citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:1a2284f4193a9c95c7e6afa8266cde5db890d849fcd47df94e8af4793300d471","observation_id":"02cfc938-f6e9-4897-98b1-d6ee4feea425","resolution":{"observed_at":"2026-08-12T21:36:19.661906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:19.950602Z","title":"Cognitive mapping and planning for visual navigation,","venue":null,"work_id":"6b1c95e5-8aa9-4789-8f28-092845672786","year":2017},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.664626Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:286fa7d9b1e4f56cd634e362d4a2bdc7e668e10d523a07222a22a00f86423398","observation_id":"9b204acb-cc5b-434c-b783-d05be3d74076","resolution":{"observed_at":"2026-08-12T21:36:19.954209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:19.940700Z","title":"Semantic mapnet: Building allocentric semantic maps and representations from egocentric views,","venue":null,"work_id":"cf05877a-0f1b-4afa-8278-37c7af603826","year":2021},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.667053Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:788feccb592fbb511351be5487c768bcb39c8cbc205d87125a1072cb782c6074","observation_id":"031e2c47-b4a9-4626-9b0f-3ffd4591cdbc","resolution":{"observed_at":"2026-08-12T21:36:19.943942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:19.931547Z","title":"Cross-modal map learning for vision and language navigation,","venue":null,"work_id":"b06023ea-e843-4963-87dd-8fea83fd9cec","year":2022},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.669525Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:87fe8e738dc7ab4344ab80fa5417cea6b23c63367606cd52dacb9a32971537bf","observation_id":"041a2fff-21b9-470c-b623-41433d2fff10","resolution":{"observed_at":"2026-08-12T21:36:19.934773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:19.922068Z","title":"Topo- logical planning with transformers for vision-and-language navigation,","venue":null,"work_id":"663c3b8f-4ecd-4e64-b252-5363fb85f5ba","year":2021},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.671919Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:f8d4fe334bea410e9489bfb44ead5fb4da3a63cb9d326323a91eafbe0a1e2ed5","observation_id":"569d789a-e2f9-4554-bfe0-ed6486ca583b","resolution":{"observed_at":"2026-08-12T21:36:19.925391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:19.912279Z","title":"Generating landmark navigation instruc- tions from maps as a graph-to-text problem,","venue":null,"work_id":"71205f99-d06f-412c-97e3-72a3b659d60b","year":2020},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.674472Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:5a8622a9fbaedcbb4fcf66eb5521b7591995335e0fe0fe5e6a277819ff0c6ee5","observation_id":"c54bd769-1044-4b50-b5d9-8f4b8bfd62f0","resolution":{"observed_at":"2026-08-12T21:36:19.915520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1405.0312","last_updated":"2015-02-21T01:48:49Z","snapshot_observed_at":"2026-07-06T03:42:37.507458Z","submitted_at":"2014-05-01T21:43:32Z","title":"Microsoft COCO: Common Objects in Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1405.0312","snapshot_observed_at":"2026-08-12T21:36:19.676906Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.676906Z"},"links":{"cited_paper":"/paper/1405.0312","citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:6bcf9a44ffa7b7757be2353e7973d7eafaef58c7d8b310faf504d6ad1f2003cc","observation_id":"81e05be7-04b8-4461-8a59-f34ae2111060","resolution":{"observed_at":"2026-08-12T21:36:19.676906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:19.901773Z","title":"Dynamic head: Unifying object detection heads with attentions,","venue":null,"work_id":"d00bb0d0-1cb4-436f-b0aa-9094dd3e32f0","year":2021},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.679766Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:412380e37e2e002498cba2b97e9c9ea18a0eedbb306c68f36010485aedccc58e","observation_id":"2e33fcc0-dadf-4a77-ab13-678911f39f40","resolution":{"observed_at":"2026-08-12T21:36:19.906035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:19.682360Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.682360Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:481bcb54d359a3b39ff22ce0476f70a16dd5b70686f9f497ac102d32a1312753","observation_id":"0b591f49-95c5-4320-b752-ced7d0b05aa3","resolution":{"observed_at":"2026-08-12T21:36:19.682360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13838","last_updated":"2022-03-25T18:06:14Z","snapshot_observed_at":"2026-08-16T17:11:44.333305Z","submitted_at":"2022-03-25T18:06:14Z","title":"Analyzing Generalization of Vision and Language Navigation to Unseen Outdoor Areas","version":1},"cited_work":{"arxiv_id":"2203.13838","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.13838","snapshot_observed_at":"2026-08-12T21:36:19.709908Z","title":"Analyzing Generalization of Vision and Language Navigation to Unseen Outdoor Areas","venue":"cs.CV","work_id":"f3cb0735-06c0-4ed2-8be4-158b2d871bf4","year":2022},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.687871Z"},"links":{"cited_paper":"/paper/2203.13838","citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:16113ff081307c44010eb713bda9e1f63a9e61359bacb0c1a2226f01e2b1e498","observation_id":"97605107-7c0b-4f76-95fd-549fe7bb7d30","resolution":{"observed_at":"2026-08-12T21:36:19.715144Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:19.887193Z","title":"Available: https: //api.semanticscholar.org/CorpusID: 52967399","venue":null,"work_id":"9b2d230b-195b-422a-ba2c-d161f05099aa","year":null},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.685176Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:a4897ec497f82ef2b4b4fe44515ecb6aa1ebcb4ddabaea77a8870d47965ab498","observation_id":"e20f1ef2-14e0-4d8a-8444-24590a1c84f5","resolution":{"observed_at":"2026-08-12T21:36:19.890398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.11717","last_updated":"2022-11-18T11:24:07Z","snapshot_observed_at":"2026-08-16T16:43:46.249506Z","submitted_at":"2022-07-24T11:09:45Z","title":"A Priority Map for Vision-and-Language Navigation with Trajectory Plans and Feature-Location Cues","version":4},"cited_work":{"arxiv_id":"2207.11717","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.11717","snapshot_observed_at":"2026-08-12T21:36:19.771861Z","title":"A Priority Map for Vision-and-Language Navigation with Trajectory Plans and Feature-Location Cues","venue":"cs.LG","work_id":"44762004-5ee9-4899-8c25-41548bf01479","year":2022},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.618642Z"},"links":{"cited_paper":"/paper/2207.11717","citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:69ccc85fd58adac6184d2b40b00f72c0bebc5c13a2a3630e9cc777ede0433855","observation_id":"bcce2f57-31aa-4f75-bce9-b22958da49b9","resolution":{"observed_at":"2026-08-12T21:36:19.775180Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:20.117534Z","title":"Available: https: //api.semanticscholar.org/CorpusID: 256390509","venue":null,"work_id":"6db3d24f-a507-40a4-8e74-9021e5b6ec29","year":null},"citing_paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:19.579993Z"},"links":{"citing_paper":"/paper/2411.08579"},"observation_digest":"sha256:3a2426a1714b548baad499b7f6c60994f864b436aed301fc7dfa0dbddb67c07d","observation_id":"7e289a04-ca3e-43e1-80e6-5d0bec598cc0","resolution":{"observed_at":"2026-08-12T21:36:20.120847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.08579","last_updated":"2024-11-13T12:51:49Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T12:16:43.344742Z","submitted_at":"2024-11-13T12:51:49Z","title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":17,"verified_exact":1,"verified_fuzzy":43},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 20 inbound Pith citation observations for arXiv:2411.08579."}