{"as_of":"2026-08-17T03:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:92408cecd3165af9ed2f9a8b92cf3c6c6131dec3ca05a1904a0684c4d6e51329","coverage":[{"denominator":198,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:23:58.527149Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T13:56:48.159909Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T11:53:23.901201Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15643","snapshot_observed_at":"2026-08-03T13:56:48.159909Z","title":"Multimodal perception for goal-oriented navigation: A survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.22342","last_updated":"2026-07-26T13:09:53Z","snapshot_observed_at":"2026-08-14T10:48:05.176386Z","submitted_at":"2025-12-26T19:00:12Z","title":"VL-LN Bench: Towards Long-horizon Goal-oriented Navigation with Active Dialogs","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T13:56:48.159909Z"},"links":{"cited_paper":"/paper/2504.15643","citing_paper":"/paper/2512.22342"},"observation_digest":"sha256:3a32c1f13e15c362e803ce6dae7b0abbdd3829766ca5ef4bd696731602c05f52","observation_id":"46e99e77-cbf4-41b1-9b6d-fabc60c15fd0","resolution":{"observed_at":"2026-08-03T13:56:48.159909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"cited_work":{"arxiv_id":"2504.15643","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15643","snapshot_observed_at":"2026-06-29T11:53:23.901201Z","title":"arXiv preprint arXiv:2504.15643 (2025)","venue":null,"work_id":"87f098b3-cc54-42a8-aeec-697fb3996a73","year":2025},"citing_paper":{"arxiv_id":"2605.28237","last_updated":"2026-05-27T09:50:16Z","snapshot_observed_at":"2026-08-06T23:55:29.770936Z","submitted_at":"2026-05-27T09:50:16Z","title":"POINav: Benchmarking and Enhancing Final-Meters Arrival in Real-World Vision-Language Navigation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T11:48:14.888295Z"},"links":{"cited_paper":"/paper/2504.15643","citing_paper":"/paper/2605.28237"},"observation_digest":"sha256:7f93c428f3b5eca3424825d9b0616f99883bb993e22ac43a9b0ba67633d593a6","observation_id":"8335ecdc-9976-4a4f-b229-a6f5c42fb703","resolution":{"observed_at":"2026-06-29T11:53:23.902469Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.15643/citation-record","integrity":"/paper/2504.15643/integrity","json":"/paper/2504.15643/citation-record.json","paper":"/paper/2504.15643"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.173652Z","title":"A frontier-based approach for autonomous explo- ration,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.173652Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:55fb17e8a9ec49535537c1834dd80356f5408272ac7836095c8a358bd8a8e2bb","observation_id":"b0dc7a39-ecb0-4fa4-8746-3f0103a5e6b0","resolution":{"observed_at":"2026-08-16T11:23:58.173652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.177826Z","title":"A fast marching level set method for monoton- ically advancing fronts","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.177826Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:deae85942934ae947b6b2e0227bdbb23bf8c33dd0562069da5c2cdf1f3c90915","observation_id":"58e373e7-eacb-4625-8714-203cdcd2fe5f","resolution":{"observed_at":"2026-08-16T11:23:58.177826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.181307Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.181307Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:07e5c795c0e14a3527bfb4fadbb631238601b34694ac9c7278f5826420881d14","observation_id":"f7978ab8-6b38-4d54-a3da-e2c3c8186765","resolution":{"observed_at":"2026-08-16T11:23:58.181307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.185006Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.185006Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:eeffa972cd57f3c61eba0d063263c0e2385643cc0b04562df1a47b4d8a475499","observation_id":"9ebb01df-daf9-41fc-99c4-e43f32ed3e59","resolution":{"observed_at":"2026-08-16T11:23:58.185006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.188472Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.188472Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:02b776ea9cfdb46b3eb9bf8d158f298f72703f503d0024c96cb2085d911b4492","observation_id":"3c4811ac-b458-4e39-a1af-360f7a3faf10","resolution":{"observed_at":"2026-08-16T11:23:58.188472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-16T19:40:28.523700Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T11:23:58.191896Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.191896Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:67d4b69e8ec67f49460bb9498ea39593bb3c8b7bfe5c3b5826a7b0f4d85a6efa","observation_id":"bac3d744-e0ec-489c-a9f2-1f41b55283e5","resolution":{"observed_at":"2026-08-16T11:23:58.191896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.196073Z","title":"Soundspaces: Audio- visual navigation in 3d environments,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.196073Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:c65db54e57ee906ca721e5f70e6d2664adab8749b6e3e427e9b9b67b550423a6","observation_id":"688c81a4-85a7-47a1-8fa6-e56963f5617a","resolution":{"observed_at":"2026-08-16T11:23:58.196073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.199920Z","title":"Learning representa- tions from audio-visual spatial alignment,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.199920Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:8a890f8f4d09889660cfe6ba69cdf20b80fd56b7e9f09caea01535fbf9ba31b8","observation_id":"4c4535b8-aec9-4dc0-815a-00dda95136ed","resolution":{"observed_at":"2026-08-16T11:23:58.199920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.06757","last_updated":"2018-07-18T03:28:02Z","snapshot_observed_at":"2026-08-14T11:12:04.949259Z","submitted_at":"2018-07-18T03:28:02Z","title":"On Evaluation of Embodied Navigation Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.06757","snapshot_observed_at":"2026-08-16T11:23:58.203228Z","title":"On evaluation of embodied navigation agents,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.203228Z"},"links":{"cited_paper":"/paper/1807.06757","citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:79c3bc0f20c496f2c0db4c9db86cb68a6588dbcf733e3ccc8443bf8a72ac24bb","observation_id":"cea082e8-e16e-4c6a-8563-2f3f6ebf6726","resolution":{"observed_at":"2026-08-16T11:23:58.203228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.13171","last_updated":"2020-08-30T04:28:13Z","snapshot_observed_at":"2026-08-14T14:40:15.936772Z","submitted_at":"2020-06-23T17:18:54Z","title":"ObjectNav Revisited: On Evaluation of Embodied Agents Navigating to Objects","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.13171","snapshot_observed_at":"2026-08-16T11:23:58.207026Z","title":"Objectnav revisited: On evaluation of embodied agents navigating to objects,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.207026Z"},"links":{"cited_paper":"/paper/2006.13171","citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:e0e3d1e49f51fcd4b953d7a04a3dcbf42c1b26c2cdfc5191515543940b30a2eb","observation_id":"42c796d1-1d3b-4339-ab70-beddccb423e6","resolution":{"observed_at":"2026-08-16T11:23:58.207026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05155","last_updated":"2020-04-10T17:57:29Z","snapshot_observed_at":"2026-08-10T10:31:57.774299Z","submitted_at":"2020-04-10T17:57:29Z","title":"Learning to Explore using Active Neural SLAM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05155","snapshot_observed_at":"2026-08-16T11:23:58.210712Z","title":"Learning to explore using active neural slam,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.210712Z"},"links":{"cited_paper":"/paper/2004.05155","citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:f6ebd133e1cd0e4f3f81802fcee79da94fe5ea6cb749762a1c272b8ec479755e","observation_id":"3a3b83cf-bab7-4e94-a264-34bb489efa26","resolution":{"observed_at":"2026-08-16T11:23:58.210712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14296","last_updated":"2024-09-22T02:12:29Z","snapshot_observed_at":"2026-08-16T13:16:34.396967Z","submitted_at":"2024-09-22T02:12:29Z","title":"HM3D-OVON: A Dataset and Benchmark for Open-Vocabulary Object Goal Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14296","snapshot_observed_at":"2026-08-16T11:23:58.214700Z","title":"Hm3d-ovon: A dataset and benchmark for open-vocabulary object goal navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.214700Z"},"links":{"cited_paper":"/paper/2409.14296","citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:012c5dd3f77f8b1c8dfa18ed548d80a5565ef847755f02e75cb6117766b02d06","observation_id":"c39b1909-1715-4644-bb7b-0e35ed95ffe5","resolution":{"observed_at":"2026-08-16T11:23:58.214700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.219033Z","title":"Pirlnav: Pretraining with imitation and rl finetuning for objectnav,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.219033Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:106cbb997e3c19fb3de3f45ab1dbacd575406a000fb18eb82f31401985c6ec2a","observation_id":"4599a02d-f314-4d88-a1e5-545468f98637","resolution":{"observed_at":"2026-08-16T11:23:58.219033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00357","last_updated":"2020-01-20T04:18:58Z","snapshot_observed_at":"2026-08-14T00:24:58.794756Z","submitted_at":"2019-11-01T13:07:37Z","title":"DD-PPO: Learning Near-Perfect PointGoal Navigators from 2.5 Billion Frames","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.00357","snapshot_observed_at":"2026-08-16T11:23:58.223008Z","title":"Dd-ppo: Learning near-perfect pointgoal navigators from 2.5 billion frames,","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.223008Z"},"links":{"cited_paper":"/paper/1911.00357","citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:f80e5c9ff5d49177fc8b465baeef6e8deaa016a7b44e7e2e9dcbd5c3eb264ffe","observation_id":"7f934f9f-9f17-4199-bfa8-df9d8be504dd","resolution":{"observed_at":"2026-08-16T11:23:58.223008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.227123Z","title":"The sur- prising effectiveness of visual odometry techniques for embodied pointgoal navigation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.227123Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:b19de5fda5d00557ef14e535e00334488f3623ed6375011a45150147bcb96aa5","observation_id":"52fb99e9-c369-47b6-8d20-25ff42404673","resolution":{"observed_at":"2026-08-16T11:23:58.227123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.230628Z","title":"Is mapping necessary for realistic pointgoal navigation?","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.230628Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:250d2b680ed698f97fd0805c97c8cb3cfb2e0f2a6fbb2ee01f0b59e1517d062d","observation_id":"40d59e5f-d616-4d62-b16b-5fcaf52d0bea","resolution":{"observed_at":"2026-08-16T11:23:58.230628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.234002Z","title":"Entl: Embodied navi- gation trajectory learner,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.234002Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:62921ae053ddb12b4febb0d64bd156b9bd358bb36b9d04a6c3233625a812911c","observation_id":"6035b2ae-162a-40dd-9420-b9920962feea","resolution":{"observed_at":"2026-08-16T11:23:58.234002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04796","last_updated":"2024-11-07T15:36:49Z","snapshot_observed_at":"2026-08-16T21:59:10.922439Z","submitted_at":"2024-11-07T15:36:49Z","title":"MPVO: Motion-Prior based Visual Odometry for PointGoal Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04796","snapshot_observed_at":"2026-08-16T11:23:58.237226Z","title":"Mpvo: Motion-prior based visual odometry for pointgoal navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.237226Z"},"links":{"cited_paper":"/paper/2411.04796","citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:89ca71a49503f6859a8242d2ead5dceeaef9cedf3348d7325c0cdf7156469553","observation_id":"b39ffa18-49e5-49ad-a5d3-70a4941d0a36","resolution":{"observed_at":"2026-08-16T11:23:58.237226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.240668Z","title":"Object goal navigation using goal-oriented semantic explo- ration,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.240668Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:0fe35f4c924baea8cf2362c42150bf4f7efaca499191f2f52ee53bc14a8f4f00","observation_id":"d44749a1-2139-47f7-a87e-188685371bcf","resolution":{"observed_at":"2026-08-16T11:23:58.240668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.244029Z","title":"Ion: Instance-level object navigation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.244029Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:6de117341dea71a37b42ed1708ac0d4351db8e7200958cc43534e548589e27a3","observation_id":"0cda1d41-8995-481c-8a2d-99aedc85a41a","resolution":{"observed_at":"2026-08-16T11:23:58.244029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.247364Z","title":"Simple but effective: Clip embeddings for embodied ai,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.247364Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:143734c23394a132a9ac82fbfd3de1dd329d5df6a8479a8f94cc891d7a2baaee","observation_id":"510f9ca0-f1ca-427b-82ab-3ac6308a4e2a","resolution":{"observed_at":"2026-08-16T11:23:58.247364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.250748Z","title":"Habitat- web: Learning embodied object-search strategies from human demonstrations at scale,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.250748Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:4bd51ca8f7d069a3caaaeebec039d6cd44aac0e44503315bd3ba0c2ed9b2028d","observation_id":"d6a66436-8fda-45e4-9faf-a1cc705adb13","resolution":{"observed_at":"2026-08-16T11:23:58.250748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.254560Z","title":"Zson: Zero-shot object-goal navigation using multimodal goal embeddings,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.254560Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:8dc7794aed911f52801d418ecdd9fce0d8cc2eab046c788059ea044c5ef0a766","observation_id":"bdcf6658-6bc3-4a8d-9d97-53876f08aafc","resolution":{"observed_at":"2026-08-16T11:23:58.254560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.257978Z","title":"L3mvn: Leveraging large language models for visual target navigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.257978Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:cd61977872afe8ea1361f9d5f2f91ba02dd41865a96c8ede05b67a882bfa6626","observation_id":"8fdc03da-19c8-4e2d-8231-99e9e5e0ee70","resolution":{"observed_at":"2026-08-16T11:23:58.257978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.261308Z","title":"Object-goal visual navigation via effective exploration of relations among historical navigation states,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.261308Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:2842f754c0bfa99feb16997c6b5111cb55b052f993cab8f6bb07f9d32bc30db0","observation_id":"eaa43d67-fb28-48f3-9dc6-93c44a963533","resolution":{"observed_at":"2026-08-16T11:23:58.261308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08189","last_updated":"2024-10-10T17:57:19Z","snapshot_observed_at":"2026-08-16T13:10:35.436623Z","submitted_at":"2024-10-10T17:57:19Z","title":"SG-Nav: Online 3D Scene Graph Prompting for LLM-based Zero-shot Object Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08189","snapshot_observed_at":"2026-08-16T11:23:58.264674Z","title":"Sg-nav: Online 3d scene graph prompting for llm-based zero-shot object navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.264674Z"},"links":{"cited_paper":"/paper/2410.08189","citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:dca14b1683f428b948f55a11d1609186330f260f225501ba799f583ac319b2ae","observation_id":"30063342-ea24-462f-a991-fe68b1765f1a","resolution":{"observed_at":"2026-08-16T11:23:58.264674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.268377Z","title":"Trajectory dif- fusion for objectgoal navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.268377Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:914244d0010330734891597ad0af7a772effe3361dc2d1472c805352737d5d39","observation_id":"b97c035d-a131-47fc-b98d-8c6628efbf87","resolution":{"observed_at":"2026-08-16T11:23:58.268377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.271804Z","title":"Topo- logical semantic graph memory for image-goal navigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.271804Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:a04269dcb14c13b3d6701ba6e6211f91953b70b5d759a06ebd8008449ccc687b","observation_id":"ca9988e8-a922-4e32-8d72-3a622d8a1f91","resolution":{"observed_at":"2026-08-16T11:23:58.271804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.275103Z","title":"Fgprompt: Fine-grained goal prompting for image-goal navigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.275103Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:20b4d3214367be235eb9ee001f6c7035942d51b4c94c9e3cf0bb243703b7d362","observation_id":"5ce0082a-7a43-469b-9c6f-5d032e9d74d6","resolution":{"observed_at":"2026-08-16T11:23:58.275103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.278435Z","title":"Memonav: Working memory model for visual navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.278435Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:1e22567e7e89ba7ea12e3fc29047c0b4ae06585841e614334245ef2637dd25a5","observation_id":"1addc03a-8c1f-4993-9151-9cf16ad4c1ef","resolution":{"observed_at":"2026-08-16T11:23:58.278435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.281916Z","title":"Object instance retrieval in assistive robotics: Leveraging fine-tuned simsiam with multi-view images based on 3d semantic map,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.281916Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:da28ec38e49af247d776e9cd9a418dcc2277aabc30dae7a0c4b79bc9fa197322","observation_id":"45c1a112-7f65-45f5-a96a-ffe088e5ed72","resolution":{"observed_at":"2026-08-16T11:23:58.281916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.285392Z","title":"Look, listen, and act: Towards audio-visual embodied navigation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.285392Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:0cf63019db24b9402dca7796b04f24a430bab64b1e7fb7460ddce356b3088edf","observation_id":"731468b2-86ae-4b12-bbed-8fe581c2016c","resolution":{"observed_at":"2026-08-16T11:23:58.285392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.288720Z","title":"Semantic audio-visual navigation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.288720Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:b15da840ac372d8d52ceab44cf2a874dd65a9fc0fa4019106de79e2a879bc2aa","observation_id":"d039b02d-3ef2-41d4-a9f2-1711c1ed15e3","resolution":{"observed_at":"2026-08-16T11:23:58.288720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.291958Z","title":"Avlen: Audio- visual-language embodied navigation in 3d environments,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.291958Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:494a904c8272515b691e06aab41a5c432aa2f09e002a0ae3fc11196b5e0613bf","observation_id":"5b00744c-7062-4125-9adb-9d5f29354778","resolution":{"observed_at":"2026-08-16T11:23:58.291958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.295090Z","title":"Catch me if you hear me: Audio-visual navigation in complex unmapped environments with moving sounds,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.295090Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:5f9836e89b24d6aff7dbdcd77590f890480d166c57afaa83b86b2f2209f1e595","observation_id":"8028486e-40fc-4e09-b31a-3f8f93902c8e","resolution":{"observed_at":"2026-08-16T11:23:58.295090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.298466Z","title":"Rila: Reflective and imaginative language agent for zero-shot semantic audio-visual navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.298466Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:3e5b40b53dddfdd058cf7a86cebfbb60d41aeea110e257d2d8759a34ae834328","observation_id":"299c4dde-254b-44e8-822a-a76a8f4cd277","resolution":{"observed_at":"2026-08-16T11:23:58.298466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.302036Z","title":"Nomad: Goal masked diffusion policies for navigation and exploration,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.302036Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:1098d80843cd9f4c4cf895284c6a3e6da4b931f653ee7d7341e070ce8bc442d9","observation_id":"c65e1737-6f80-4fa9-974f-7b9189182b3d","resolution":{"observed_at":"2026-08-16T11:23:58.302036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.305511Z","title":"Hartley and A","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.305511Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:debd3a1a006366fd7dbf6fe0e2447f82412e011ba965c1546aebe54d695c644c","observation_id":"6cbf4892-80e5-4ba0-997b-2b5b742a5916","resolution":{"observed_at":"2026-08-16T11:23:58.305511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.308982Z","title":"Cognitive mapping and planning for visual navigation,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.308982Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:052c4f7c0e8cc0e6948a064f6c47f37ce6f828a59b5aff1f3468869aa0c1613e","observation_id":"45a5be88-9b7e-4928-9837-b0be35211d89","resolution":{"observed_at":"2026-08-16T11:23:58.308982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.312185Z","title":"Poni: Potential functions for objectgoal navigation with interaction-free learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.312185Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:55720db0542578fa49d4d389944588fb7db80003e22c5efdab39e110ddaf1374","observation_id":"8eaa879f-ff29-457c-a5f3-11659edb76c5","resolution":{"observed_at":"2026-08-16T11:23:58.312185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.09447","last_updated":"2021-05-20T01:23:15Z","snapshot_observed_at":"2026-08-16T18:23:31.012767Z","submitted_at":"2021-05-20T01:23:15Z","title":"VTNet: Visual Transformer Network for Object Goal Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.09447","snapshot_observed_at":"2026-08-16T11:23:58.315661Z","title":"Vtnet: Visual transformer network for object goal navigation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.315661Z"},"links":{"cited_paper":"/paper/2105.09447","citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:f01cc959a2d4f12069fdfb996b72bc2339891d1f181b80abe11965ceed97ec33","observation_id":"78c0679c-e602-4474-9a11-568817d6d0f8","resolution":{"observed_at":"2026-08-16T11:23:58.315661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1406.1078","last_updated":"2014-09-03T00:25:02Z","snapshot_observed_at":"2026-08-15T13:36:27.756066Z","submitted_at":"2014-06-03T17:47:08Z","title":"Learning Phrase Representations using RNN Encoder-Decoder for Statistical Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1406.1078","snapshot_observed_at":"2026-08-16T11:23:58.319220Z","title":"Learning phrase rep- resentations using rnn encoder-decoder for statistical machine translation,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.319220Z"},"links":{"cited_paper":"/paper/1406.1078","citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:963b7e4f41d32f4ba25205fbbd65facb0cd9c89ffc301d264fe60b79e9c12b78","observation_id":"4e654dee-0e95-4f02-bc94-ed268ea48861","resolution":{"observed_at":"2026-08-16T11:23:58.319220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.322864Z","title":"Long short-term memory,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.322864Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:2a8701c812dc61dd5da869b16f32ff98d8343dcedbdc2cd3bee928346d5e9b1e","observation_id":"31a12abf-6997-4b4b-9e56-687d4992675f","resolution":{"observed_at":"2026-08-16T11:23:58.322864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.330169Z","title":"Image retrieval using scene graphs,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.330169Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:693274e7507fbbca5fa10de6a89881d0d55da8bee7c15bcfbba16077243794b9","observation_id":"0ca0ea47-64dc-4478-b807-30da700d7e75","resolution":{"observed_at":"2026-08-16T11:23:58.330169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.333501Z","title":"Graph r-cnn for scene graph generation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.333501Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:447c565e0a39399364b9c0c22354b819c423b7140a1fd3516a96b02ff83316be","observation_id":"54432b16-b101-4a82-9c0e-69a22e0ada7f","resolution":{"observed_at":"2026-08-16T11:23:58.333501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.02907","last_updated":"2017-02-22T09:55:36Z","snapshot_observed_at":"2026-08-13T11:38:10.906031Z","submitted_at":"2016-09-09T19:48:41Z","title":"Semi-Supervised Classification with Graph Convolutional Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.02907","snapshot_observed_at":"2026-08-16T11:23:58.337129Z","title":"Semi-supervised classification with graph convolutional networks,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.337129Z"},"links":{"cited_paper":"/paper/1609.02907","citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:508638453a6e950771a35420733ac6f4ffcf88788e90d1427ff0c8a7bc1b3f21","observation_id":"3ad98410-ef5e-4929-b402-ab4cbbb53d60","resolution":{"observed_at":"2026-08-16T11:23:58.337129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.341192Z","title":"The graph neural network model,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.341192Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:f7b0264c8a630505319040d71d1d91d04756a91d23c8d188e6b40a356cb94650","observation_id":"486d0211-27a3-44cb-af71-09a50297f3d5","resolution":{"observed_at":"2026-08-16T11:23:58.341192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.345189Z","title":"Learning hierarchical re- lationships for object-goal navigation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.345189Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:8ee675593db4788c1d7b980fde258579e9c33b71b533e1e8e040b3534b555d87","observation_id":"0c9f7a8b-6b70-4e9d-bf2c-ea11a0096e44","resolution":{"observed_at":"2026-08-16T11:23:58.345189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.348790Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.348790Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:4a704a5190f8c8fa3f2464198474a95b061f0465664e694a068791575f89412c","observation_id":"2689650f-a4fd-4048-8c01-9b882c938b89","resolution":{"observed_at":"2026-08-16T11:23:58.348790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.352229Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.352229Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:83ac9ee96920eb6255734c3615a063f51466fa050f6abb0bd383cff35c31b7f1","observation_id":"4c1b6fd8-78f5-4656-8a79-1615a4c4e419","resolution":{"observed_at":"2026-08-16T11:23:58.352229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-16T11:23:58.355645Z","title":"Score-based generative modeling through stochastic differential equations,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.355645Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:acde6e4b24bcd6fbed92f79489197ccbec69963bf047d38b5311dc37cc550d51","observation_id":"bb5574d5-0c7f-424b-95bd-6269515c5c51","resolution":{"observed_at":"2026-08-16T11:23:58.355645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.359531Z","title":"Deep unsupervised learning using nonequilibrium thermody- namics,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.359531Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:75054f0d059f129fa0d1783dc46d4e04603f38e09dbc086ac39fce855b24cf9e","observation_id":"0346d6f8-4140-487b-b135-0cddfaa30b36","resolution":{"observed_at":"2026-08-16T11:23:58.359531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.362944Z","title":"Photorealistic text-to-image diffusion models with deep language understanding,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.362944Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:8051f7613383eb58cd4050954c92b9b7e1b53b5b105ab398a057529fd86db179","observation_id":"d4269d6a-dbd9-494f-86ee-66c14fcb02a0","resolution":{"observed_at":"2026-08-16T11:23:58.362944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14988","last_updated":"2022-09-29T17:50:40Z","snapshot_observed_at":"2026-07-06T13:57:54.539656Z","submitted_at":"2022-09-29T17:50:40Z","title":"DreamFusion: Text-to-3D using 2D Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14988","snapshot_observed_at":"2026-08-16T11:23:58.366389Z","title":"Dreamfusion: Text-to-3d using 2d diffusion,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.366389Z"},"links":{"cited_paper":"/paper/2209.14988","citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:ce01db59b62b806ba80e1140110b0d82facd12151422b9cc469349be669bf3c0","observation_id":"2fd477af-867e-4878-9911-2fc1169c1421","resolution":{"observed_at":"2026-08-16T11:23:58.366389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08238","last_updated":"2021-09-16T22:01:24Z","snapshot_observed_at":"2026-08-15T09:50:41.483833Z","submitted_at":"2021-09-16T22:01:24Z","title":"Habitat-Matterport 3D Dataset (HM3D): 1000 Large-scale 3D Environments for Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08238","snapshot_observed_at":"2026-08-16T11:23:58.370029Z","title":"Habitat-matterport 3d dataset (hm3d): 1000 large-scale 3d environments for embodied ai,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.370029Z"},"links":{"cited_paper":"/paper/2109.08238","citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:6bd9e734a1ff6f63238faae367811e1b155b2400698b75315fae1b4e5ec7a598","observation_id":"6be6bf67-73c7-4de4-8ca3-add359731fd9","resolution":{"observed_at":"2026-08-16T11:23:58.370029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.373574Z","title":"Gibson env: Real-world perception for embodied agents,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.373574Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:9898a67575ddb5c7118d54efaf06952a3ad7a76b5fdf320efb48f8d541296be6","observation_id":"adbaa22b-84be-4224-b115-1cc2255eb98c","resolution":{"observed_at":"2026-08-16T11:23:58.373574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1709.06158","last_updated":"2017-09-18T20:34:48Z","snapshot_observed_at":"2026-08-14T20:32:01.406964Z","submitted_at":"2017-09-18T20:34:48Z","title":"Matterport3D: Learning from RGB-D Data in Indoor Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.06158","snapshot_observed_at":"2026-08-16T11:23:58.377110Z","title":"Matterport3d: Learning from rgb-d data in indoor environments,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.377110Z"},"links":{"cited_paper":"/paper/1709.06158","citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:f50b1779d5b0f731796db36b717699bdc53e1bc1ffc6124b1dca580bf126fb1e","observation_id":"b16ac08b-a5b7-45dd-bd9e-541eefb07011","resolution":{"observed_at":"2026-08-16T11:23:58.377110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.05474","last_updated":"2022-08-26T17:12:17Z","snapshot_observed_at":"2026-08-14T05:42:22.751765Z","submitted_at":"2017-12-14T23:17:24Z","title":"AI2-THOR: An Interactive 3D Environment for Visual AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.05474","snapshot_observed_at":"2026-08-16T11:23:58.380803Z","title":"Ai2- thor: An interactive 3d environment for visual ai,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.380803Z"},"links":{"cited_paper":"/paper/1712.05474","citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:d7c67bad25c359b53ac84058e91accda853327bd433187da140f2cc11e0e760b","observation_id":"c611242e-b189-43b7-a533-4d88a3ec0684","resolution":{"observed_at":"2026-08-16T11:23:58.380803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.384439Z","title":"Robothor: An open simulation-to-real embodied ai plat- form,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.384439Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:80ad195613e9840a5c57a427258571c6ade0b09419782b7ad60194f6b8a1af20","observation_id":"4aea7621-8a5b-46a5-9083-938e61429559","resolution":{"observed_at":"2026-08-16T11:23:58.384439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.388103Z","title":"Procthor: Large-scale embodied ai using procedural genera- tion,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.388103Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:f66449ebb07a049ed02ac3257e802e1fbc64891d50f3264247bac688077361af","observation_id":"34304206-c3d3-4543-8fc0-d71f9c07ce36","resolution":{"observed_at":"2026-08-16T11:23:58.388103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.391567Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.391567Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:bf12791cde30883990a2b8c94658e96b489b62139aec17f034eede24d3f9ca83","observation_id":"31e88cf2-f336-47ca-b03a-e588446d4ad1","resolution":{"observed_at":"2026-08-16T11:23:58.391567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.05797","last_updated":"2019-06-13T16:29:58Z","snapshot_observed_at":"2026-08-16T20:27:41.336890Z","submitted_at":"2019-06-13T16:29:58Z","title":"The Replica Dataset: A Digital Replica of Indoor Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.05797","snapshot_observed_at":"2026-08-16T11:23:58.395305Z","title":"The replica dataset: A digital replica of indoor spaces,","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.395305Z"},"links":{"cited_paper":"/paper/1906.05797","citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:444adcb9588d4f9ec002b100703c7a5dab4f2528aa559b5ff929a5f4547b652c","observation_id":"be790473-3502-4ec2-8905-915749d18991","resolution":{"observed_at":"2026-08-16T11:23:58.395305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.399116Z","title":"Soundspaces 2.0: A simulation platform for visual-acoustic learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.399116Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:2f0e1c54cd5f8d373ed95915d99537e4736b6ccfc74fd4f1a1702e3692b5863d","observation_id":"5f3622ab-fc72-4dd9-b352-1f648b0770c3","resolution":{"observed_at":"2026-08-16T11:23:58.399116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.402637Z","title":"Habitat: A platform for embodied ai research,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.402637Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:bdfac96bf6afa160b03ffc66e409bf3fb91fbde0bede6fa67a3ccedcd131644e","observation_id":"9dc2aa42-482c-4285-9922-798e3acde803","resolution":{"observed_at":"2026-08-16T11:23:58.402637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.406073Z","title":"3d scene graph: A structure for unified semantics, 3d space, and camera,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.406073Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:e414fd5514723862357f4e672aca4384fa256b47c016ff34175b2822d656af20","observation_id":"90502f49-ff63-48a3-bb76-1ecdee55f15a","resolution":{"observed_at":"2026-08-16T11:23:58.406073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08801","last_updated":"2022-12-17T05:23:54Z","snapshot_observed_at":"2026-08-16T16:07:59.445107Z","submitted_at":"2022-12-17T05:23:54Z","title":"Comparison of Model-Free and Model-Based Learning-Informed Planning for PointGoal Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08801","snapshot_observed_at":"2026-08-16T11:23:58.409321Z","title":"Comparison of model-free and model-based learning-informed planning for pointgoal navigation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.409321Z"},"links":{"cited_paper":"/paper/2212.08801","citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:9d3226a77c5af500cd5d0b8623416f12e7cb059623ac9e071616e5b3a645e5ce","observation_id":"eae95ef6-5df3-48e7-a093-13cc16561c62","resolution":{"observed_at":"2026-08-16T11:23:58.409321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.412824Z","title":"Uncertainty-driven planner for exploration and navigation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.412824Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:b352ad1cb5b8cf22bdd26c1545e48b668ae10f177d9c8718d331f09e3f28bb69","observation_id":"e58b523e-db9b-4ca4-a104-00521a8c0cf6","resolution":{"observed_at":"2026-08-16T11:23:58.412824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.416288Z","title":"Moda: Map style trans- fer for self-supervised domain adaptation of embodied agents,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.416288Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:2d282cccbeb5d0c0e053c8aa3d3a55039cf5ce40c8f27d0b965b399a7c194145","observation_id":"de98be67-ceea-4793-ae42-367fe2c614b2","resolution":{"observed_at":"2026-08-16T11:23:58.416288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.419919Z","title":"Splitnet: Sim2sim and task2task transfer for embodied visual navigation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.419919Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:bc627641d147adac9d74ac3f090cd218932ee497cf3d333e1b2c4224595f50ea","observation_id":"00fb410e-b1fb-4ce2-a3b4-286a6b765b2b","resolution":{"observed_at":"2026-08-16T11:23:58.419919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.12760","last_updated":"2020-08-28T17:35:22Z","snapshot_observed_at":"2026-08-14T20:37:30.180201Z","submitted_at":"2020-08-28T17:35:22Z","title":"AllenAct: A Framework for Embodied AI Research","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.12760","snapshot_observed_at":"2026-08-16T11:23:58.424226Z","title":"Allenact: A framework for embodied ai research,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.424226Z"},"links":{"cited_paper":"/paper/2008.12760","citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:f5c860a0b234c42e8a174a2ad57c1abda492ebdc5589b4fc678c7cc6edb580c9","observation_id":"a22928cd-3197-41db-9822-519299c94093","resolution":{"observed_at":"2026-08-16T11:23:58.424226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.428225Z","title":"Auxiliary tasks speed up learning point goal navigation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.428225Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:ac76093ed2160c931b719ed032fd8e0169553bca2d71c7608ce162a13b211c28","observation_id":"759fc4f6-8109-41b5-9699-cc22d5e3afb0","resolution":{"observed_at":"2026-08-16T11:23:58.428225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.431751Z","title":"Auxiliary tasks for efficient learning of point-goal navigation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.431751Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:c685eafba5342bbc62560ec02782ae5424a47f1da5cfa58b880fb0154cb47e77","observation_id":"aa6dbb8d-de84-4b4f-9987-33c8ab9189af","resolution":{"observed_at":"2026-08-16T11:23:58.431751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.435025Z","title":"Integrating egocentric localization for more realistic point-goal navigation agents,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.435025Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:a81d3eeb37a057692eae51b9482b52c6f73a086c781ae76981a6863c2245ecab","observation_id":"df53da9d-7882-4d85-bff6-a3608ac54f2e","resolution":{"observed_at":"2026-08-16T11:23:58.435025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.438367Z","title":"Robustnav: Towards benchmarking robustness in embodied navigation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.438367Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:4d0bc8751820ab29bfa871191afb548cf64f391673d7f32ffdfbf69f3441a547","observation_id":"72414602-a9c2-4831-8ae7-3c8a879b0f7d","resolution":{"observed_at":"2026-08-16T11:23:58.438367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.441616Z","title":"What do navigation agents learn about their environment?","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.441616Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:6e3ba36a9771c29e8d4842467b868641f8006a58bb4c4e44bdb747aef464ac63","observation_id":"18f4761c-d1bd-4b19-8d85-15a3648e90b8","resolution":{"observed_at":"2026-08-16T11:23:58.441616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.444894Z","title":"Vision-and-language navigation: Interpreting visually- grounded navigation instructions in real environments,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.444894Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:01e6a9a5b734a73e83b7e8e4fa69b712678eb1cf02ffef6310816863dd4bbfdc","observation_id":"e52af0ad-9e16-4c73-85dd-962c705e7513","resolution":{"observed_at":"2026-08-16T11:23:58.444894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.448345Z","title":"U-net: Convolutional networks for biomedical image segmentation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.448345Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:ab934a728410b129d47d9185f5e6e02ac7502f004dc0625672be5eaa89d4eaa4","observation_id":"411bc777-9f69-46f6-a7e4-c5bb958c1b25","resolution":{"observed_at":"2026-08-16T11:23:58.448345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.452055Z","title":"Simple and scalable predictive uncertainty estimation using deep ensem- bles,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.452055Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:a2796dcc7e455e3aaffc4ec56811718680ed8eaa92e18e3a0ca29e1e64e623fb","observation_id":"b8cbe645-c80e-45fd-a16c-3a7113242ed4","resolution":{"observed_at":"2026-08-16T11:23:58.452055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.455760Z","title":"Unpaired image-to- image translation using cycle-consistent adversarial networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.455760Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:f28008dd76de5986537b9b2fe19633951bf8ce8928a3c918af71c67033a8fa65","observation_id":"cb83624c-a574-42ec-a15b-568236c5972f","resolution":{"observed_at":"2026-08-16T11:23:58.455760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.459163Z","title":"Real-time object navigation with deep neural networks and hierarchical reinforcement learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.459163Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:97948e13455f3c991014c9cad8ec33dd08d57c4f350b8b468068322efc8d5594","observation_id":"ecd2ab19-855b-475a-b643-1643101de1b9","resolution":{"observed_at":"2026-08-16T11:23:58.459163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.15648","last_updated":"2022-03-08T21:02:12Z","snapshot_observed_at":"2026-08-16T21:52:12.584167Z","submitted_at":"2021-06-29T18:01:30Z","title":"Learning to Map for Active Semantic Goal Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.15648","snapshot_observed_at":"2026-08-16T11:23:58.462505Z","title":"Learning to map for active semantic goal navigation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.462505Z"},"links":{"cited_paper":"/paper/2106.15648","citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:220af5379e3ceb4a710b7174f0042926783c7d226bd6a7cf82964cee0ba3cdc4","observation_id":"c1191d0f-ee78-4922-bf75-ea233f1026d1","resolution":{"observed_at":"2026-08-16T11:23:58.462505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.466110Z","title":"Navigating to objects in unseen environments by distance prediction,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.466110Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:e6a04aa1e5a25f380d8d9b85fef39ca3e12f278b47f2e256e4849f3e1acc2a17","observation_id":"7d2fc55d-083c-41f5-ab9f-c634d71682ea","resolution":{"observed_at":"2026-08-16T11:23:58.466110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.469432Z","title":"Peanut: Predicting and navigating to unseen targets,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.469432Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:d67bdf995671129909f50ff73d6be2df433c39854306b4ac76d5380099a355f1","observation_id":"1cb3b3c2-bade-4995-b0b9-248246506e8e","resolution":{"observed_at":"2026-08-16T11:23:58.469432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.472769Z","title":"Renderable neural radiance map for visual navigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.472769Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:132750422f72875cc5dbda5320a9fec3f4d5231adf2de3eaa6c1daa25d9e7884","observation_id":"4a1891a7-bd69-4c37-b022-406d7b0283e0","resolution":{"observed_at":"2026-08-16T11:23:58.472769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.476136Z","title":"3d-aware object goal navigation via simultaneous exploration SUBMITTED IEEE TRANSACTIONS ON P A TTERN ANAL YSIS AND MACHINE INTELLIGENCE 18 and identification,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.476136Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:a48c943a2b541ebcfec3ecb019aefe75a97f71dd0836228c86673089f51572df","observation_id":"7635a6a7-5075-4f2e-9643-26bc2eb0ca73","resolution":{"observed_at":"2026-08-16T11:23:58.476136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.479637Z","title":"Self-supervised object goal navigation with in-situ finetuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.479637Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:a5b0d1f26dcd61a191050683f093ade5f2f869f8a2c3808cb20e044ab97fef0a","observation_id":"515473b7-3f3f-4b79-9feb-27c20013a2f3","resolution":{"observed_at":"2026-08-16T11:23:58.479637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.483040Z","title":"Skill fusion in hybrid robotic framework for visual object goal naviga- tion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.483040Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:4dfd2395b5a75d257d44cbe0aff213f0d2a90ca2ff84bddee0304767b7085885","observation_id":"df89ca17-abd7-44b5-b2a1-333669324695","resolution":{"observed_at":"2026-08-16T11:23:58.483040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16925","last_updated":"2023-05-26T13:38:33Z","snapshot_observed_at":"2026-08-16T15:29:19.367392Z","submitted_at":"2023-05-26T13:38:33Z","title":"How To Not Train Your Dragon: Training-free Embodied Object Goal Navigation with Semantic Frontiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16925","snapshot_observed_at":"2026-08-16T11:23:58.486363Z","title":"How to not train your dragon: Training-free embodied object goal navigation with semantic frontiers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.486363Z"},"links":{"cited_paper":"/paper/2305.16925","citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:04aaba5809a28101e75f44d4e8893f90af6b206615658d2ac8e5863c6a09e5aa","observation_id":"e227b8b2-afbc-467d-a212-523c9167f354","resolution":{"observed_at":"2026-08-16T11:23:58.486363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06430","last_updated":"2023-11-10T23:31:51Z","snapshot_observed_at":"2026-08-16T14:44:13.616047Z","submitted_at":"2023-11-10T23:31:51Z","title":"GOAT: GO to Any Thing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.06430","snapshot_observed_at":"2026-08-16T11:23:58.490116Z","title":"Goat: Go to any thing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.490116Z"},"links":{"cited_paper":"/paper/2311.06430","citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:00a723becea88d86e9feeebf154b07764f869e2fd80b97690f0782ff80fb22a7","observation_id":"0253b688-d773-4994-a2f8-b3f81731091f","resolution":{"observed_at":"2026-08-16T11:23:58.490116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.493716Z","title":"Goat-bench: A benchmark for multi-modal lifelong navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.493716Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:f18b5a0f04c7897c36e1397bb8f386d1db5ddd8fbd3a1e9c56d964db696d80df","observation_id":"950b0857-bf5e-4b1b-a7dd-434135b4ee16","resolution":{"observed_at":"2026-08-16T11:23:58.493716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.496990Z","title":"Hierarchical object-to-zone graph for object navigation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.496990Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:6f17a300fc9c1925e6980c8bac5124f58aaa74a0a1afa6faf69d6c7785d10696","observation_id":"4872361a-a935-4537-ac9b-f9f877019bfa","resolution":{"observed_at":"2026-08-16T11:23:58.496990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.500262Z","title":"Visual navigation in real-world indoor environments using end-to-end deep rein- forcement learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.500262Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:e1e18c7d113ec49b730859fab0d6cad527ce349ce05081e667d44bf5feb525f0","observation_id":"d43d891b-46fc-43a3-8da5-b5e1e6527250","resolution":{"observed_at":"2026-08-16T11:23:58.500262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.503601Z","title":"Object memory transformer for object goal navigation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.503601Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:85d2de9f3afa4e2145ffdb580dc96a7b2e4965492d6dc57208132a1651f7ae16","observation_id":"75552cfb-af5e-4b07-96b6-2a5463762bbe","resolution":{"observed_at":"2026-08-16T11:23:58.503601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16164","last_updated":"2023-09-28T04:32:08Z","snapshot_observed_at":"2026-08-16T14:56:59.387594Z","submitted_at":"2023-09-28T04:32:08Z","title":"Learning to Terminate in Object Navigation","version":1},"cited_work":{"arxiv_id":"2309.16164","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.16164","snapshot_observed_at":"2026-08-16T11:23:59.178017Z","title":"Learning to Terminate in Object Navigation","venue":"cs.RO","work_id":"af14f241-d8e4-4ced-8e3d-230bbe023be5","year":2023},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.507149Z"},"links":{"cited_paper":"/paper/2309.16164","citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:27db2cfea8b71181aabe77cad62abf7ff9e5d8e708e8be89a371cc4d49916748","observation_id":"edff3e81-c97e-40ec-97ca-faadfb774bea","resolution":{"observed_at":"2026-08-16T11:23:59.181994Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.510886Z","title":"Offline visual rep- resentation learning for embodied navigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.510886Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:2a427f17435612814002df665cff7203dfc4970b2720278ff0d557609ea5cb99","observation_id":"8f37b974-2c60-4b47-ab67-be28a6641617","resolution":{"observed_at":"2026-08-16T11:23:58.510886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.07798","last_updated":"2023-03-14T11:15:37Z","snapshot_observed_at":"2026-08-16T15:48:22.375044Z","submitted_at":"2023-03-14T11:15:37Z","title":"OVRL-V2: A simple state-of-art baseline for ImageNav and ObjectNav","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.07798","snapshot_observed_at":"2026-08-16T11:23:58.513970Z","title":"Ovrl-v2: A simple state-of-art baseline for imagenav and objectnav,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.513970Z"},"links":{"cited_paper":"/paper/2303.07798","citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:fb5334ef09849fda33a533be46be03bcfd4216a3880df107c4daab7de157c92c","observation_id":"a4bb5dfc-e382-4c21-8b5e-b8b1443e5cc1","resolution":{"observed_at":"2026-08-16T11:23:58.513970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.517442Z","title":"Object goal naviga- tion with recursive implicit maps,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.517442Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:0ff83fa56fe7e463d98878037569b90cccdb67240796763db63972de540010f6","observation_id":"a87defec-27bf-4489-a5b8-89152e25f342","resolution":{"observed_at":"2026-08-16T11:23:58.517442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.520795Z","title":"Find what you want: learning demand-conditioned object attribute space for demand-driven navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.520795Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:bed9697c6130fa998cedebf37f57ee9b6562f6fb83ca65ceb72f3de880c40df3","observation_id":"6264a7b8-e9b2-4319-a185-d1d4c7d36f97","resolution":{"observed_at":"2026-08-16T11:23:58.520795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.523946Z","title":"Esc: Exploration with soft commonsense constraints for zero-shot object navigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.523946Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:f392d47ea2da8a488f194fc34f4fd6715a88a25cf5c34ffa56d35d3d10299804","observation_id":"f2c10f73-44ff-4893-b9cd-67bb0000afac","resolution":{"observed_at":"2026-08-16T11:23:58.523946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:23:58.527149Z","title":"Imagine before go: Self-supervised generative map for object goal navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.527149Z"},"links":{"citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:5d4a445df4bc8cfffea33dfe3123622fb694460ea05fd1bcdd979e28e9dd4ecd","observation_id":"a2fd1d71-6d41-427e-8d2b-b93d52fe2c65","resolution":{"observed_at":"2026-08-16T11:23:58.527149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-16T11:19:07.580114Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":99,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":198},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 100 of 198 outbound references and 2 inbound Pith citation observations for arXiv:2504.15643."}