{"as_of":"2026-08-15T20:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:125419688eafa641ee51cb0f14cb8df7705b34ce710f0cd7f8727b7c51709d34","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:48:11.860023Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T01:55:00.771704Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T00:39:17.017972Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.15096","last_updated":"2025-06-18T03:06:01Z","snapshot_observed_at":"2026-08-15T19:41:24.232400Z","submitted_at":"2025-06-18T03:06:01Z","title":"DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15096","snapshot_observed_at":"2026-07-13T22:46:37.452699Z","title":"Dynavlm: Zero-shot vision- language navigation system with dynamic viewpoints and self-refining graph memory.arXiv preprint arXiv:2506.15096, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.18208","last_updated":"2026-03-18T18:57:45Z","snapshot_observed_at":"2026-08-15T18:43:33.111664Z","submitted_at":"2026-03-18T18:57:45Z","title":"Quantum orientation entanglement analysis of the interpolating helicity states between the instant form dynamics and the light-front dynamics","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T22:46:37.452699Z"},"links":{"cited_paper":"/paper/2506.15096","citing_paper":"/paper/2603.18208"},"observation_digest":"sha256:c9d1a4ea338d24b1c234057d091614528b928aad0cdca6ea84f97ec4f0b1ab81","observation_id":"c84cfb44-9898-436b-a7c7-2561aa3ffd8d","resolution":{"observed_at":"2026-07-13T22:46:37.452699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15096","last_updated":"2025-06-18T03:06:01Z","snapshot_observed_at":"2026-08-15T19:41:24.232400Z","submitted_at":"2025-06-18T03:06:01Z","title":"DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory","version":1},"cited_work":{"arxiv_id":"2506.15096","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15096","snapshot_observed_at":"2026-07-04T00:39:17.017972Z","title":"Dynavlm: Zero- shot vision-language navigation system with dynamic viewpoints and self-refining graph memory, 2025","venue":null,"work_id":"586ffcf4-e747-40da-9fc7-dc4466ee7bf9","year":2025},"citing_paper":{"arxiv_id":"2606.03509","last_updated":"2026-06-02T11:27:44Z","snapshot_observed_at":"2026-08-11T21:28:28.551982Z","submitted_at":"2026-06-02T11:27:44Z","title":"EvoMemNav: Efficient Self-Evolving Fine-Grained Memory for Zero-Shot Embodied Navigation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T11:22:06.239906Z"},"links":{"cited_paper":"/paper/2506.15096","citing_paper":"/paper/2606.03509"},"observation_digest":"sha256:2e2e14b3acbf4886483f4e363dbef0a5798b93410c4ba85787843c0a7bbf2214","observation_id":"e71a6bc8-2d2e-4a32-b7c6-a02f1dc53e57","resolution":{"observed_at":"2026-07-02T01:56:28.437092Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15096","last_updated":"2025-06-18T03:06:01Z","snapshot_observed_at":"2026-08-15T19:41:24.232400Z","submitted_at":"2025-06-18T03:06:01Z","title":"DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory","version":1},"cited_work":{"arxiv_id":"2506.15096","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15096","snapshot_observed_at":"2026-07-04T00:39:17.017972Z","title":"Dynavlm: Zero- shot vision-language navigation system with dynamic viewpoints and self-refining graph memory, 2025","venue":null,"work_id":"586ffcf4-e747-40da-9fc7-dc4466ee7bf9","year":2025},"citing_paper":{"arxiv_id":"2606.18634","last_updated":"2026-06-17T03:04:11Z","snapshot_observed_at":"2026-08-12T03:37:04.465436Z","submitted_at":"2026-06-17T03:04:11Z","title":"EffiNav: Fusing Depth and Vision-Language for Efficient Object Goal Navigation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T21:04:00.821473Z"},"links":{"cited_paper":"/paper/2506.15096","citing_paper":"/paper/2606.18634"},"observation_digest":"sha256:6663de24df624b5819b9a1aae9eef37c898675aa83356bfcbf8de53d47002a74","observation_id":"031bc705-0e06-49e7-9e23-a05cd8598b1c","resolution":{"observed_at":"2026-07-04T00:39:17.019788Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15096","last_updated":"2025-06-18T03:06:01Z","snapshot_observed_at":"2026-08-15T19:41:24.232400Z","submitted_at":"2025-06-18T03:06:01Z","title":"DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15096","snapshot_observed_at":"2026-08-02T01:55:00.771704Z","title":"arXiv preprint arXiv:2506.15096 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14514","last_updated":"2026-07-24T03:47:07Z","snapshot_observed_at":"2026-08-14T09:30:20.068555Z","submitted_at":"2026-07-16T03:11:37Z","title":"VTM-Nav: Harnessing Cross-Episode Experience for Object-Goal Navigation with Hierarchical Visual-Topological Memory","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-02T01:55:00.771704Z"},"links":{"cited_paper":"/paper/2506.15096","citing_paper":"/paper/2607.14514"},"observation_digest":"sha256:f9f41a313d6bb32e371ec26000d3ea2353ae0b352449ae0c1df0fb1b04c78d92","observation_id":"2eb36929-8f71-4b79-b07e-42aad0b150cc","resolution":{"observed_at":"2026-08-02T01:55:00.771704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.15096/citation-record","integrity":"/paper/2506.15096/integrity","json":"/paper/2506.15096/citation-record.json","paper":"/paper/2506.15096"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:48:12.304392Z","title":"Navgpt: Explicit rea- soning in vision-and-language navigation with large language models","venue":null,"work_id":"16dc2856-5af6-4c6e-80ef-7db26f95b634","year":null},"citing_paper":{"arxiv_id":"2506.15096","last_updated":"2025-06-18T03:06:01Z","snapshot_observed_at":"2026-08-15T19:41:24.232400Z","submitted_at":"2025-06-18T03:06:01Z","title":"DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T19:48:11.717660Z"},"links":{"citing_paper":"/paper/2506.15096"},"observation_digest":"sha256:ab4d5f048bf9018d816538017c01a27b832d4a9922c69a86560690a51a4bdb39","observation_id":"291cac0c-17cd-4be0-946a-8d9eb79569c9","resolution":{"observed_at":"2026-08-15T19:48:12.308815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04168","last_updated":"2024-10-17T06:43:13Z","snapshot_observed_at":"2026-08-12T23:06:53.810265Z","submitted_at":"2024-08-08T02:28:43Z","title":"Perceive, Reflect, and Plan: Designing LLM Agent for Goal-Directed City Navigation without Instructions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04168","snapshot_observed_at":"2026-08-15T19:48:11.723141Z","title":"Perceive, reflect, and plan: Designing llm agent for goal-directed city navigation without instructions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15096","last_updated":"2025-06-18T03:06:01Z","snapshot_observed_at":"2026-08-15T19:41:24.232400Z","submitted_at":"2025-06-18T03:06:01Z","title":"DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T19:48:11.723141Z"},"links":{"cited_paper":"/paper/2408.04168","citing_paper":"/paper/2506.15096"},"observation_digest":"sha256:b5ae2cc44ef8169b463f49aad330e7a4789d0384562ce60ae5918e91238818fc","observation_id":"45ddb03b-496e-48b1-b6f0-bbfa7d0087e8","resolution":{"observed_at":"2026-08-15T19:48:11.723141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T19:48:11.728682Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15096","last_updated":"2025-06-18T03:06:01Z","snapshot_observed_at":"2026-08-15T19:41:24.232400Z","submitted_at":"2025-06-18T03:06:01Z","title":"DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T19:48:11.728682Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.15096"},"observation_digest":"sha256:d8e62a5df067e3f2ee245dd821f2a8a2b7e2223bd4623e04cc61e5fc94f2e0b4","observation_id":"0a74f920-6520-4816-976d-1510e0a5838a","resolution":{"observed_at":"2026-08-15T19:48:11.728682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-15T19:48:11.735138Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15096","last_updated":"2025-06-18T03:06:01Z","snapshot_observed_at":"2026-08-15T19:41:24.232400Z","submitted_at":"2025-06-18T03:06:01Z","title":"DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T19:48:11.735138Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.15096"},"observation_digest":"sha256:80ea05a61710a633c33c1703ace91019bf3139ef184717e0f2ccff75f55623a8","observation_id":"622799b1-9c8a-42d1-8195-f67b8ea99219","resolution":{"observed_at":"2026-08-15T19:48:11.735138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:48:12.292775Z","title":"Ving: Learning open-world navigation with visual goals","venue":null,"work_id":"6a69c078-cb81-402f-bf6d-6795ca472468","year":2021},"citing_paper":{"arxiv_id":"2506.15096","last_updated":"2025-06-18T03:06:01Z","snapshot_observed_at":"2026-08-15T19:41:24.232400Z","submitted_at":"2025-06-18T03:06:01Z","title":"DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T19:48:11.740575Z"},"links":{"citing_paper":"/paper/2506.15096"},"observation_digest":"sha256:8b348bc642eea374eb229692922b13cf7356f6d0330d22cbbfb207990c013e85","observation_id":"c1324693-a5e3-48c7-9a3e-d7935c7145bf","resolution":{"observed_at":"2026-08-15T19:48:12.296364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.05859","last_updated":"2023-10-11T09:07:01Z","snapshot_observed_at":"2026-08-14T21:27:19.807847Z","submitted_at":"2021-04-12T23:14:41Z","title":"Rapid Exploration for Open-World Navigation with Latent Goal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.05859","snapshot_observed_at":"2026-08-15T19:48:11.745717Z","title":"Rapid exploration for open-world navigation with latent goal models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.15096","last_updated":"2025-06-18T03:06:01Z","snapshot_observed_at":"2026-08-15T19:41:24.232400Z","submitted_at":"2025-06-18T03:06:01Z","title":"DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T19:48:11.745717Z"},"links":{"cited_paper":"/paper/2104.05859","citing_paper":"/paper/2506.15096"},"observation_digest":"sha256:de90eae4a328c0ff151f6a9efeeaecc73bbdf75be923d50115ffdcf64f432c71","observation_id":"de238526-ad5d-44c9-a04b-1362eca3c6b3","resolution":{"observed_at":"2026-08-15T19:48:11.745717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:48:12.280799Z","title":"Soat: A scene-and object-aware transformer for vision-and-language navigation","venue":null,"work_id":"131570ea-8b02-4fbf-8c6c-927df0551810","year":2021},"citing_paper":{"arxiv_id":"2506.15096","last_updated":"2025-06-18T03:06:01Z","snapshot_observed_at":"2026-08-15T19:41:24.232400Z","submitted_at":"2025-06-18T03:06:01Z","title":"DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T19:48:11.750795Z"},"links":{"citing_paper":"/paper/2506.15096"},"observation_digest":"sha256:782167a930742bce11ac298391e3bd689ad9d2bfdcc49edc35018c13f24c4eac","observation_id":"23d5a744-4348-465e-aa53-6338ca0a6892","resolution":{"observed_at":"2026-08-15T19:48:12.284687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-14T00:58:55.999499Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-08-15T19:48:11.755803Z","title":"ViNT: A foundation model for visual navigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15096","last_updated":"2025-06-18T03:06:01Z","snapshot_observed_at":"2026-08-15T19:41:24.232400Z","submitted_at":"2025-06-18T03:06:01Z","title":"DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T19:48:11.755803Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2506.15096"},"observation_digest":"sha256:93b94912211400ddba4dd373083d11adf510d34ce2542b59665cf50fa240b9cd","observation_id":"11e67005-b18c-4429-821c-bac1fe34bc1a","resolution":{"observed_at":"2026-08-15T19:48:11.755803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:48:12.267152Z","title":"Gnm: A general navigation model to drive any robot","venue":null,"work_id":"f470656f-1332-4a75-a9cd-218cc7d7ce85","year":2023},"citing_paper":{"arxiv_id":"2506.15096","last_updated":"2025-06-18T03:06:01Z","snapshot_observed_at":"2026-08-15T19:41:24.232400Z","submitted_at":"2025-06-18T03:06:01Z","title":"DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T19:48:11.761699Z"},"links":{"citing_paper":"/paper/2506.15096"},"observation_digest":"sha256:bd204557ea0d3268ded8c73bf0a10beba2f5e1d58931be8ee533800fee56fd03","observation_id":"0a71ab59-916b-4f46-8aeb-d8c1f287b0f6","resolution":{"observed_at":"2026-08-15T19:48:12.271795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-15T04:55:15.159462Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-15T19:48:11.767423Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15096","last_updated":"2025-06-18T03:06:01Z","snapshot_observed_at":"2026-08-15T19:41:24.232400Z","submitted_at":"2025-06-18T03:06:01Z","title":"DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T19:48:11.767423Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2506.15096"},"observation_digest":"sha256:2fd213da30ae7655e5dae824cd09a372c423ad7053587183f5ba3ffc37ea9a2a","observation_id":"f5229068-1eb8-4c02-8e03-6f5602f71cfb","resolution":{"observed_at":"2026-08-15T19:48:11.767423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-15T19:48:11.772954Z","title":"Rt- 1: Robotics transformer for real-world control at scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.15096","last_updated":"2025-06-18T03:06:01Z","snapshot_observed_at":"2026-08-15T19:41:24.232400Z","submitted_at":"2025-06-18T03:06:01Z","title":"DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T19:48:11.772954Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2506.15096"},"observation_digest":"sha256:560f743d53406255894fc71174f8c016a4822204b6ffdb9df90b62c44b8719cc","observation_id":"b3e9fa15-34cb-4cae-8048-dccf2cd155c6","resolution":{"observed_at":"2026-08-15T19:48:11.772954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15852","last_updated":"2024-06-30T11:14:13Z","snapshot_observed_at":"2026-08-12T04:00:31.932219Z","submitted_at":"2024-02-24T16:39:16Z","title":"NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15852","snapshot_observed_at":"2026-08-15T19:48:11.778523Z","title":"Navid: Video- based vlm plans the next step for vision-and-language navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15096","last_updated":"2025-06-18T03:06:01Z","snapshot_observed_at":"2026-08-15T19:41:24.232400Z","submitted_at":"2025-06-18T03:06:01Z","title":"DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T19:48:11.778523Z"},"links":{"cited_paper":"/paper/2402.15852","citing_paper":"/paper/2506.15096"},"observation_digest":"sha256:5d798cfe1df7a5cec1407a9fcc88ddd5ae3e830ebe74e5b05fe1cc68d95cadfa","observation_id":"89971bbf-d9e9-4981-ac4c-50acecb844d7","resolution":{"observed_at":"2026-08-15T19:48:11.778523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-13T15:09:51.205767Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-15T19:48:11.784305Z","title":"3d-vla: A 3d vision-language-action generative world model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15096","last_updated":"2025-06-18T03:06:01Z","snapshot_observed_at":"2026-08-15T19:41:24.232400Z","submitted_at":"2025-06-18T03:06:01Z","title":"DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T19:48:11.784305Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2506.15096"},"observation_digest":"sha256:d5b5fb12c34b94d5b35f59f0da36345bfe6878c70bea83e2541223731d573e0f","observation_id":"598224b6-42f0-4c7a-81d7-4efecd310df9","resolution":{"observed_at":"2026-08-15T19:48:11.784305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:48:12.253079Z","title":"Discuss before moving: Visual language navigation via multi-expert discussions","venue":null,"work_id":"7e3d08ba-6e7e-41da-95d1-138437ee9473","year":2024},"citing_paper":{"arxiv_id":"2506.15096","last_updated":"2025-06-18T03:06:01Z","snapshot_observed_at":"2026-08-15T19:41:24.232400Z","submitted_at":"2025-06-18T03:06:01Z","title":"DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T19:48:11.790347Z"},"links":{"citing_paper":"/paper/2506.15096"},"observation_digest":"sha256:49b00c3c53d1aae4277e7b3ee0d3cad2879d556792c8ce44f007f42654267931","observation_id":"a484fe12-9f1d-4723-9fb0-0e1795290038","resolution":{"observed_at":"2026-08-15T19:48:12.257753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:48:12.238577Z","title":"L3mvn: Lever- aging large language models for visual target navigation","venue":null,"work_id":"7c40c0d3-40bf-40b4-aa79-e12cc81e0bed","year":2023},"citing_paper":{"arxiv_id":"2506.15096","last_updated":"2025-06-18T03:06:01Z","snapshot_observed_at":"2026-08-15T19:41:24.232400Z","submitted_at":"2025-06-18T03:06:01Z","title":"DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T19:48:11.795436Z"},"links":{"citing_paper":"/paper/2506.15096"},"observation_digest":"sha256:c673ef7abefa4782bbd168477404c3401806bde99e9b4720df27ae8381a2fdce","observation_id":"f5f1298c-2751-4d34-8feb-f726c3f74b54","resolution":{"observed_at":"2026-08-15T19:48:12.243226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-12T21:25:32.312122Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-15T19:48:11.800465Z","title":"Set-of-mark prompting unleashes extraordinary visual grounding in gpt-4v","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15096","last_updated":"2025-06-18T03:06:01Z","snapshot_observed_at":"2026-08-15T19:41:24.232400Z","submitted_at":"2025-06-18T03:06:01Z","title":"DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T19:48:11.800465Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2506.15096"},"observation_digest":"sha256:e7c873221f488ccaa9b0f0b14b257c1bb4d3be92d28d5297f7a316f8c1fdf4f6","observation_id":"89a708d4-824f-49b9-b2a6-773181da590a","resolution":{"observed_at":"2026-08-15T19:48:11.800465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:48:12.224590Z","title":"What does clip know about a red circle? visual prompt engineering for vlms","venue":null,"work_id":"70c72e83-c857-422c-9a85-7f9228900c84","year":2023},"citing_paper":{"arxiv_id":"2506.15096","last_updated":"2025-06-18T03:06:01Z","snapshot_observed_at":"2026-08-15T19:41:24.232400Z","submitted_at":"2025-06-18T03:06:01Z","title":"DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T19:48:11.806160Z"},"links":{"citing_paper":"/paper/2506.15096"},"observation_digest":"sha256:7f226a92b65396ebd7b82e92f69837915b15fc247af10038eed5f0bf52b6e416","observation_id":"8e004a67-ed1d-4d02-a52f-c541d5c6a0f2","resolution":{"observed_at":"2026-08-15T19:48:12.229282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07872","last_updated":"2024-02-12T18:33:47Z","snapshot_observed_at":"2026-08-14T01:10:13.014483Z","submitted_at":"2024-02-12T18:33:47Z","title":"PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07872","snapshot_observed_at":"2026-08-15T19:48:11.811469Z","title":"Pivot: Iterative visual prompting elicits actionable knowledge for vlms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15096","last_updated":"2025-06-18T03:06:01Z","snapshot_observed_at":"2026-08-15T19:41:24.232400Z","submitted_at":"2025-06-18T03:06:01Z","title":"DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T19:48:11.811469Z"},"links":{"cited_paper":"/paper/2402.07872","citing_paper":"/paper/2506.15096"},"observation_digest":"sha256:f794141a70ad82c9abe3b49bbcdc51c7ddc71bcdbc7533459917851a07f90c1d","observation_id":"7b6a019f-9107-4a46-8b67-74a7316ad964","resolution":{"observed_at":"2026-08-15T19:48:11.811469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05755","last_updated":"2024-11-08T18:16:58Z","snapshot_observed_at":"2026-08-12T22:04:35.612322Z","submitted_at":"2024-11-08T18:16:58Z","title":"End-to-End Navigation with Vision Language Models: Transforming Spatial Reasoning into Question-Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05755","snapshot_observed_at":"2026-08-15T19:48:11.816049Z","title":"End-to-End Navigation with Vision Language Models: Trans- forming Spatial Reasoning into Question-Answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15096","last_updated":"2025-06-18T03:06:01Z","snapshot_observed_at":"2026-08-15T19:41:24.232400Z","submitted_at":"2025-06-18T03:06:01Z","title":"DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T19:48:11.816049Z"},"links":{"cited_paper":"/paper/2411.05755","citing_paper":"/paper/2506.15096"},"observation_digest":"sha256:90bfbd52dd5882eb0d92262228485f5d715331021417ebbc6c9b3d730af55fcf","observation_id":"44e33eeb-1c6f-4d68-865e-22e2fb88370b","resolution":{"observed_at":"2026-08-15T19:48:11.816049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:48:12.210719Z","title":"Simultaneous localiza- tion and mapping: part I","venue":null,"work_id":"bb3e58e3-ce46-4d9b-8c47-18f52250fc8b","year":2006},"citing_paper":{"arxiv_id":"2506.15096","last_updated":"2025-06-18T03:06:01Z","snapshot_observed_at":"2026-08-15T19:41:24.232400Z","submitted_at":"2025-06-18T03:06:01Z","title":"DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T19:48:11.819964Z"},"links":{"citing_paper":"/paper/2506.15096"},"observation_digest":"sha256:9a24c3bc1c77e9465f33c060562df44a5598e05abb00246c4d2d753b04b2ea7e","observation_id":"ad94a155-fef8-4a86-8ecd-bf0717b657e4","resolution":{"observed_at":"2026-08-15T19:48:12.215147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:48:12.195354Z","title":"On-line semantic mapping","venue":null,"work_id":"c568f5fb-832c-43e9-973a-46277273948d","year":2013},"citing_paper":{"arxiv_id":"2506.15096","last_updated":"2025-06-18T03:06:01Z","snapshot_observed_at":"2026-08-15T19:41:24.232400Z","submitted_at":"2025-06-18T03:06:01Z","title":"DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T19:48:11.823660Z"},"links":{"citing_paper":"/paper/2506.15096"},"observation_digest":"sha256:7eb8a2442fb916dafe9d22a2c21ba0d6f9a9ef1a40f144724779c2ce81f9dfc3","observation_id":"48246270-163a-46da-827c-b1be97a7477a","resolution":{"observed_at":"2026-08-15T19:48:12.200503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06135","last_updated":"2023-09-27T23:17:28Z","snapshot_observed_at":"2026-08-13T10:57:32.332901Z","submitted_at":"2023-07-12T12:37:55Z","title":"SayPlan: Grounding Large Language Models using 3D Scene Graphs for Scalable Robot Task Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06135","snapshot_observed_at":"2026-08-15T19:48:11.827461Z","title":"Sayplan: Grounding large language models using 3d scene graphs for scalable robot task planning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15096","last_updated":"2025-06-18T03:06:01Z","snapshot_observed_at":"2026-08-15T19:41:24.232400Z","submitted_at":"2025-06-18T03:06:01Z","title":"DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T19:48:11.827461Z"},"links":{"cited_paper":"/paper/2307.06135","citing_paper":"/paper/2506.15096"},"observation_digest":"sha256:f72935147b885561109da8e89377fb4084eb91d51f7bf29fdbeab1412139fbdc","observation_id":"27ffc02c-07ed-4c90-bf84-d3eb0d776aaa","resolution":{"observed_at":"2026-08-15T19:48:11.827461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:48:12.180013Z","title":"Mapping high-level semantic regions in indoor environments with- out object recognition","venue":null,"work_id":"4da03aa9-df00-44cd-ae8e-43231dcd2600","year":2024},"citing_paper":{"arxiv_id":"2506.15096","last_updated":"2025-06-18T03:06:01Z","snapshot_observed_at":"2026-08-15T19:41:24.232400Z","submitted_at":"2025-06-18T03:06:01Z","title":"DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T19:48:11.831369Z"},"links":{"citing_paper":"/paper/2506.15096"},"observation_digest":"sha256:4d4e688b2b2ffc51c8181ab5735705aa151932c40bbaf8b757a2d9fd06a369a7","observation_id":"d3a171f1-f2d1-428b-a8ed-a63f380701da","resolution":{"observed_at":"2026-08-15T19:48:12.184763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:48:12.165465Z","title":"Place categorization and semantic mapping on a mobile robot","venue":null,"work_id":"e58c34bf-0705-409f-ba9f-4fb95d14b06e","year":2016},"citing_paper":{"arxiv_id":"2506.15096","last_updated":"2025-06-18T03:06:01Z","snapshot_observed_at":"2026-08-15T19:41:24.232400Z","submitted_at":"2025-06-18T03:06:01Z","title":"DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T19:48:11.835164Z"},"links":{"citing_paper":"/paper/2506.15096"},"observation_digest":"sha256:e95027bdb8581a205b983d7cdbc2098dcbde658c80092837c9b2c635bb443265","observation_id":"f640369b-23de-4bf5-92d1-47f6b79a064d","resolution":{"observed_at":"2026-08-15T19:48:12.169750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:48:12.150728Z","title":"Text2Map: From navigational instructions to graph-based indoor map representations using LLMs","venue":null,"work_id":"2ff72efe-daea-4e2f-8025-a43e0de22c81","year":2024},"citing_paper":{"arxiv_id":"2506.15096","last_updated":"2025-06-18T03:06:01Z","snapshot_observed_at":"2026-08-15T19:41:24.232400Z","submitted_at":"2025-06-18T03:06:01Z","title":"DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T19:48:11.838808Z"},"links":{"citing_paper":"/paper/2506.15096"},"observation_digest":"sha256:d7a07f4837f7dcb047b7c76d0103213580aca079ea7aac9eb1244414c1e9e0d6","observation_id":"cea3d9dd-2da6-4dca-a432-2bc9b21f3050","resolution":{"observed_at":"2026-08-15T19:48:12.155236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.13171","last_updated":"2020-08-30T04:28:13Z","snapshot_observed_at":"2026-08-14T14:40:15.936772Z","submitted_at":"2020-06-23T17:18:54Z","title":"ObjectNav Revisited: On Evaluation of Embodied Agents Navigating to Objects","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.13171","snapshot_observed_at":"2026-08-15T19:48:11.842408Z","title":"Objectnav revisited: On evaluation of embodied agents navigating to objects","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.15096","last_updated":"2025-06-18T03:06:01Z","snapshot_observed_at":"2026-08-15T19:41:24.232400Z","submitted_at":"2025-06-18T03:06:01Z","title":"DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T19:48:11.842408Z"},"links":{"cited_paper":"/paper/2006.13171","citing_paper":"/paper/2506.15096"},"observation_digest":"sha256:a8ef7f190abe8bcaa4eb02a657ee4371c761896d5958b6135e23fbff80acf069","observation_id":"4fc9d691-58c8-42c8-9eeb-309c58c036c7","resolution":{"observed_at":"2026-08-15T19:48:11.842408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:48:12.135902Z","title":"Goat-bench: A benchmark for multi-modal lifelong navigation","venue":null,"work_id":"11c5762c-9b4c-491e-867c-4fdb86c5096a","year":2024},"citing_paper":{"arxiv_id":"2506.15096","last_updated":"2025-06-18T03:06:01Z","snapshot_observed_at":"2026-08-15T19:41:24.232400Z","submitted_at":"2025-06-18T03:06:01Z","title":"DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T19:48:11.846334Z"},"links":{"citing_paper":"/paper/2506.15096"},"observation_digest":"sha256:47b6ad9a580a3398afc1ef14908b8fcf1a32017961482ff27db737e46f17fc6c","observation_id":"3e7618d6-fe77-43cb-a54e-1c101c68b485","resolution":{"observed_at":"2026-08-15T19:48:12.141099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:48:12.120194Z","title":"Habitat-matterport 3d semantics dataset","venue":null,"work_id":"35f747b8-3b7d-4e41-bfdd-dd49db7cbcc4","year":2023},"citing_paper":{"arxiv_id":"2506.15096","last_updated":"2025-06-18T03:06:01Z","snapshot_observed_at":"2026-08-15T19:41:24.232400Z","submitted_at":"2025-06-18T03:06:01Z","title":"DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T19:48:11.850957Z"},"links":{"citing_paper":"/paper/2506.15096"},"observation_digest":"sha256:f14065b4dc327877d8b6136a8eab3de528a2056170df5d5c61f5db5d676338e3","observation_id":"2b77ae84-de8c-46d7-af94-3b9e5fef98b0","resolution":{"observed_at":"2026-08-15T19:48:12.126513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:48:11.855420Z","title":"Goat: Go to any thing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15096","last_updated":"2025-06-18T03:06:01Z","snapshot_observed_at":"2026-08-15T19:41:24.232400Z","submitted_at":"2025-06-18T03:06:01Z","title":"DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T19:48:11.855420Z"},"links":{"citing_paper":"/paper/2506.15096"},"observation_digest":"sha256:3b275b20eee0463714d3e2afbe66a169ec53858b8ea556eacd2ec528889055fa","observation_id":"dede192d-b36a-4e04-990b-45ed308c8d44","resolution":{"observed_at":"2026-08-15T19:48:11.855420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12156","last_updated":"2023-06-21T10:08:29Z","snapshot_observed_at":"2026-08-13T11:12:44.426861Z","submitted_at":"2023-06-21T10:08:29Z","title":"Fast Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12156","snapshot_observed_at":"2026-08-15T19:48:11.860023Z","title":"Fast segment anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15096","last_updated":"2025-06-18T03:06:01Z","snapshot_observed_at":"2026-08-15T19:41:24.232400Z","submitted_at":"2025-06-18T03:06:01Z","title":"DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T19:48:11.860023Z"},"links":{"cited_paper":"/paper/2306.12156","citing_paper":"/paper/2506.15096"},"observation_digest":"sha256:d85d6afa13fcd446fdc280cd173eeebc7fef88cb7abc3a64f6a4404a711a236c","observation_id":"75393ee7-2daf-4843-84d5-996cc8a13e92","resolution":{"observed_at":"2026-08-15T19:48:11.860023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.15096","last_updated":"2025-06-18T03:06:01Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-15T19:41:24.232400Z","submitted_at":"2025-06-18T03:06:01Z","title":"DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 4 inbound Pith citation observations for arXiv:2506.15096."}