{"as_of":"2026-08-17T21:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ef55b3d1b0b1a1bbc45270de4c579dd97a8ac5b4893afed4a0837313d82abf1b","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:59:11.164370Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T12:04:39.821353Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T14:37:03.075467Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":"2505.11383","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.11383","snapshot_observed_at":"2026-07-02T14:37:03.075467Z","title":"Dynam3d: Dynamic layered 3d tokens empower vlm for vision-and- language navigation.arXiv preprint arXiv:2505.11383","venue":null,"work_id":"9890d033-0d8f-4665-afd5-c10751fc165b","year":2025},"citing_paper":{"arxiv_id":"2511.17097","last_updated":"2026-04-14T15:21:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-21T09:52:07Z","title":"Progress-Think: Semantic Progress Reasoning for Vision-Language Navigation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-17T21:02:38.013115Z"},"links":{"cited_paper":"/paper/2505.11383","citing_paper":"/paper/2511.17097"},"observation_digest":"sha256:5b152a90669f8e45ffb206ce8d712abe5f07789928fd61af9fe95b7e7cd57145","observation_id":"10920aae-b0b6-40f6-bfb5-c4bd0db6c11c","resolution":{"observed_at":"2026-05-17T21:05:15.944979Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":"2505.11383","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.11383","snapshot_observed_at":"2026-07-02T14:37:03.075467Z","title":"Dynam3d: Dynamic layered 3d tokens empower vlm for vision-and- language navigation.arXiv preprint arXiv:2505.11383","venue":null,"work_id":"9890d033-0d8f-4665-afd5-c10751fc165b","year":2025},"citing_paper":{"arxiv_id":"2605.13328","last_updated":"2026-05-13T10:41:24Z","snapshot_observed_at":"2026-08-11T08:12:01.149533Z","submitted_at":"2026-05-13T10:41:24Z","title":"What Limits Vision-and-Language Navigation ?","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-14T17:59:58.891151Z"},"links":{"cited_paper":"/paper/2505.11383","citing_paper":"/paper/2605.13328"},"observation_digest":"sha256:74d9d5c02bf5117d085a43d3eb14671e7c59e6f6a83f1d8efea47fb869db0d06","observation_id":"a7609af3-49f1-4cfe-b0ae-76e5d5b2bd0e","resolution":{"observed_at":"2026-05-14T18:02:32.616304Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":"2505.11383","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.11383","snapshot_observed_at":"2026-07-02T14:37:03.075467Z","title":"Dynam3d: Dynamic layered 3d tokens empower vlm for vision-and- language navigation.arXiv preprint arXiv:2505.11383","venue":null,"work_id":"9890d033-0d8f-4665-afd5-c10751fc165b","year":2025},"citing_paper":{"arxiv_id":"2605.22036","last_updated":"2026-05-21T06:20:17Z","snapshot_observed_at":"2026-08-15T17:22:17.879626Z","submitted_at":"2026-05-21T06:20:17Z","title":"GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-22T06:45:35.920991Z"},"links":{"cited_paper":"/paper/2505.11383","citing_paper":"/paper/2605.22036"},"observation_digest":"sha256:819eaef6904f7ea746bf6bd6027899099c425ce9fc5caa517d872ea2cba37d16","observation_id":"0e70a95a-c0ab-45f8-ba18-94a5f067105f","resolution":{"observed_at":"2026-05-22T06:46:10.563944Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":"2505.11383","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.11383","snapshot_observed_at":"2026-07-02T14:37:03.075467Z","title":"Dynam3d: Dynamic layered 3d tokens empower vlm for vision-and- language navigation.arXiv preprint arXiv:2505.11383","venue":null,"work_id":"9890d033-0d8f-4665-afd5-c10751fc165b","year":2025},"citing_paper":{"arxiv_id":"2606.00095","last_updated":"2026-05-25T08:53:21Z","snapshot_observed_at":"2026-08-02T11:09:28.452176Z","submitted_at":"2026-05-25T08:53:21Z","title":"Bridging the 2D-3D Gap: A Hierarchical Semantic-Geometric Map for Vision Language Navigation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T22:33:32.671550Z"},"links":{"cited_paper":"/paper/2505.11383","citing_paper":"/paper/2606.00095"},"observation_digest":"sha256:1e2687dca3a9d26a16c4a9a771bb680a724ada2361e7122617e04025da14c6b6","observation_id":"60fad76a-54e2-40b7-abc8-9a427e75a6d3","resolution":{"observed_at":"2026-06-29T22:34:01.357198Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":"2505.11383","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.11383","snapshot_observed_at":"2026-07-02T14:37:03.075467Z","title":"Dynam3d: Dynamic layered 3d tokens empower vlm for vision-and- language navigation.arXiv preprint arXiv:2505.11383","venue":null,"work_id":"9890d033-0d8f-4665-afd5-c10751fc165b","year":2025},"citing_paper":{"arxiv_id":"2607.00529","last_updated":"2026-07-01T07:18:07Z","snapshot_observed_at":"2026-08-17T08:01:04.347659Z","submitted_at":"2026-07-01T07:18:07Z","title":"NoPA: Non-Parametric Online 3D Scene Graph Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-02T14:36:02.425820Z"},"links":{"cited_paper":"/paper/2505.11383","citing_paper":"/paper/2607.00529"},"observation_digest":"sha256:30ab0cf27a18120207abbfebe6a8412d581153eb9897a5488a3d353d287bd7c0","observation_id":"a7332381-e0b8-49e3-94e3-26f339981b26","resolution":{"observed_at":"2026-07-02T14:37:03.076919Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11383","snapshot_observed_at":"2026-08-01T12:04:39.821353Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19695","last_updated":"2026-07-22T02:53:46Z","snapshot_observed_at":"2026-08-17T13:59:18.069172Z","submitted_at":"2026-07-22T02:53:46Z","title":"NavVerse: Benchmarking Indoor-to-Outdoor Embodied Navigation in Continuous Robot Simulation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T12:04:39.821353Z"},"links":{"cited_paper":"/paper/2505.11383","citing_paper":"/paper/2607.19695"},"observation_digest":"sha256:bd68bc2f907860d6937150f7150b55a23f7d9463009f3f769534b896bcde479f","observation_id":"6068e15d-7e0d-4aa9-ae6b-46132f95e96f","resolution":{"observed_at":"2026-08-01T12:04:39.821353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.11383/citation-record","integrity":"/paper/2505.11383/integrity","json":"/paper/2505.11383/citation-record.json","paper":"/paper/2505.11383"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:10.849564Z","title":"Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:10.849564Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:33a64f77546f932daf02621e993dcb725d232b370cda18ba860dc348c584aa8a","observation_id":"01d8955a-8656-45e7-b7e4-24c4531b860d","resolution":{"observed_at":"2026-08-15T20:59:10.849564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:10.903499Z","title":"Reverie: Remote embodied visual referring expression in real indoor environments","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:10.903499Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:c9c33187d86b2113b6e59070e0460976a48d435256f8208cafa819cf508341dc","observation_id":"d038db71-6345-4fb3-ad16-aeb9a5715e14","resolution":{"observed_at":"2026-08-15T20:59:10.903499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:10.936174Z","title":"Beyond the nav- graph: Vision-and-language navigation in continuous environments","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:10.936174Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:af3c6ed755b93ac403330c21a868aa603b70433ee2dd7eb7e60d4e78a512ad22","observation_id":"d9e9caf6-4b13-4bed-8dd9-b3e6c09b2f2c","resolution":{"observed_at":"2026-08-15T20:59:10.936174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11142","last_updated":"2025-03-07T06:06:29Z","snapshot_observed_at":"2026-08-16T12:58:00.142204Z","submitted_at":"2025-02-16T14:17:36Z","title":"NavRAG: Generating User Demand Instructions for Embodied Navigation through Retrieval-Augmented LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11142","snapshot_observed_at":"2026-08-15T20:59:10.939678Z","title":"Navrag: Generating user de- mand instructions for embodied navigation through retrieval-augmented llm","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:10.939678Z"},"links":{"cited_paper":"/paper/2502.11142","citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:e6f002a262ed1fd25705d446eefaca64368f520c9363899d58717e2e93103af1","observation_id":"45278d17-f96a-4c42-baeb-20620e5e5c34","resolution":{"observed_at":"2026-08-15T20:59:10.939678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.799763Z","title":"Navid: Video-based vlm plans the next step for vision-and-language navigation","venue":null,"work_id":"73111b3c-ca6b-4fa2-b3ce-d3dd0fe1a0ed","year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:10.943451Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:f85f8ae710bc2bb13a2c367add471abb089021f8abc2f5ecde455d2a79a9eaa7","observation_id":"705f5863-bebe-4c38-8383-8273c10a40e6","resolution":{"observed_at":"2026-08-15T20:59:11.803239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06224","last_updated":"2025-02-06T10:14:36Z","snapshot_observed_at":"2026-08-16T16:28:01.153501Z","submitted_at":"2024-12-09T05:55:55Z","title":"Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06224","snapshot_observed_at":"2026-08-15T20:59:10.947005Z","title":"Uni-navid: A video-based vision-language-action model for unifying embodied navigation tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:10.947005Z"},"links":{"cited_paper":"/paper/2412.06224","citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:96f34c17d7d83e10eb65ed27988fe207ac91ebe19cb20ef58b8b82022196e032","observation_id":"bcaf25e4-d524-4bf8-a3f5-77a3e0cbd0ec","resolution":{"observed_at":"2026-08-15T20:59:10.947005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.788227Z","title":"Navila: Legged robot vision-language-action model for navigation","venue":null,"work_id":"9972f363-d2ea-4398-99e3-472b7e3840d1","year":2025},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:10.952731Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:4506c28c1a99b20ca7d3f9a9593149728ae79040d3680d0e7d8353560fba25d5","observation_id":"d61b36e6-545f-431c-a197-7e3e499c7063","resolution":{"observed_at":"2026-08-15T20:59:11.792553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-15T20:59:10.956883Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:10.956883Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:e7fc91d5ba4c4ad0336af3c0ffbc7006ed04607c7273aab7403cb9fa6e48be9f","observation_id":"b3b93662-d1aa-4d52-8dc3-4e5398686caa","resolution":{"observed_at":"2026-08-15T20:59:10.956883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:10.961049Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:10.961049Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:2ef63b5ff34b6fbd2222a23e63fa1739d41ea988a3822e6d9fee8c250ca88a92","observation_id":"0f5cd850-a1ea-407f-85f6-db18870e19c9","resolution":{"observed_at":"2026-08-15T20:59:10.961049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:10.964786Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:10.964786Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:1dd61fbb2817da2f088d125748c164ea610d524ba72c6256f1c35041973f26d7","observation_id":"996261e8-7526-41ee-a2bd-20522179c51d","resolution":{"observed_at":"2026-08-15T20:59:10.964786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:10.968497Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:10.968497Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:f728f231fe3e5965b62697184154e6cdcd5e47addd3058aa46e41314340239d1","observation_id":"da6b1330-cdc2-43e2-8445-7722539e026e","resolution":{"observed_at":"2026-08-15T20:59:10.968497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12156","last_updated":"2023-06-21T10:08:29Z","snapshot_observed_at":"2026-08-16T15:22:17.250833Z","submitted_at":"2023-06-21T10:08:29Z","title":"Fast Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12156","snapshot_observed_at":"2026-08-15T20:59:10.972360Z","title":"Fast segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:10.972360Z"},"links":{"cited_paper":"/paper/2306.12156","citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:e3287f40f42112173a8a1566a823c0d64f75e46ccc5b89681a313c46b7e9592b","observation_id":"9e8723f9-ff7d-4355-be5c-e9272afdcde4","resolution":{"observed_at":"2026-08-15T20:59:10.972360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.758107Z","title":"Embodied- sam: Online segment any 3d thing in real time","venue":null,"work_id":"906f2b9d-0ec4-418c-8854-eac5a5325b1f","year":null},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:10.976611Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:d1164a5dcaec74f5fe855b45b5f31ec2d7e1287b4afa60ee6e7b80d7d37a16c2","observation_id":"3efa4660-06ae-47dd-9c5c-2562faa81aa3","resolution":{"observed_at":"2026-08-15T20:59:11.761723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-16T08:44:39.717808Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"cited_work":{"arxiv_id":"2411.17030","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.17030","snapshot_observed_at":"2026-08-15T20:59:11.313603Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","venue":"cs.CV","work_id":"4b28e66d-713b-4398-a61e-5aef89c6aff3","year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:10.980663Z"},"links":{"cited_paper":"/paper/2411.17030","citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:bb8bb6eb3322dacd2d5cb452adbc52c738e71d49660ba8573a34602eed338557","observation_id":"b51ff56e-42fa-4640-a62e-899912c30b18","resolution":{"observed_at":"2026-08-15T20:59:11.320907Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.747268Z","title":"Vln bert: A recurrent vision-and-language bert for navigation","venue":null,"work_id":"f46144cf-2bf9-4387-b37d-31c98eadd2e3","year":2021},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:10.984771Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:c3fd37c3e5bb58176d5e207ead5b6f490335106a96448b07f61c04886faf6e8a","observation_id":"8a0a6a91-d385-4944-8dd5-5be7d7a306d6","resolution":{"observed_at":"2026-08-15T20:59:11.750903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:10.988386Z","title":"History aware multimodal transformer for vision-and-language navigation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:10.988386Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:fa3434e1846ed3ab65eb9d9c04e41b7804afdc7bba3ab09195129041e5655a13","observation_id":"d746555c-a006-4a4d-9404-4d5878ab8a2f","resolution":{"observed_at":"2026-08-15T20:59:10.988386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:10.992525Z","title":"Think global, act local: Dual-scale graph transformer for vision-and-language navigation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:10.992525Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:17f1cf59d10470d80373bf33e6960c6e67193076506fc5f6b1a48366562c2f2f","observation_id":"131334fe-8c88-4760-9047-80e969dac600","resolution":{"observed_at":"2026-08-15T20:59:10.992525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:10.995663Z","title":"Vision- and-language navigation via causal learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:10.995663Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:4c41efa897c27ae834f78567f1204076ba644dcd66279613565f1c75f36c8e0b","observation_id":"3bdf7c7a-c675-42f4-b41c-a9caadf81c4c","resolution":{"observed_at":"2026-08-15T20:59:10.995663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.716889Z","title":"Hop+: History- enhanced and order-aware pre-training for vision-and-language navigation","venue":null,"work_id":"ca6cbe22-15b1-453d-b4fa-6eb6948a9bc7","year":2023},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:10.998621Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:feb94535dea71242492f8d41f05e9beba151c19773b10445b77b28918e56adf5","observation_id":"eb7cb573-bf4a-4532-9ac4-ba7134ed269c","resolution":{"observed_at":"2026-08-15T20:59:11.720871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.706259Z","title":"Bird’s-eye-view scene graph for vision- language navigation","venue":null,"work_id":"d4822b2b-7a4f-49c1-9ef5-39b5bb9fa484","year":2023},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.001793Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:630361a9719e559caa559be4684ed0602185aba9b9be5583c3ce64f77d6a9494","observation_id":"2620a608-4819-4edf-b17a-1b0256c8985e","resolution":{"observed_at":"2026-08-15T20:59:11.709765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.004945Z","title":"Matterport3d: Learning from rgb-d data in indoor environments","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.004945Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:cd07a0b56b2c3fd0a335044f41a0d3c454dbeaeda103bea69095a1be33d6a3c6","observation_id":"fe999097-561a-4e17-811a-ea95375f2453","resolution":{"observed_at":"2026-08-15T20:59:11.004945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.008702Z","title":"Habitat: A platform for embodied ai research","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.008702Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:32b14c421b7122a2722c51c694148e3be464ccc3f2b28b7190ddfd2bbedbfb72","observation_id":"ba6d9897-ac8a-498f-827d-5d122622a9d3","resolution":{"observed_at":"2026-08-15T20:59:11.008702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.682167Z","title":"Bridging the gap between learning in discrete and continuous environments for vision-and-language navigation","venue":null,"work_id":"1ab67eba-ce77-49a5-a03e-358b8b3cc5e0","year":2022},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.011706Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:2c478e1d9e704568ce5e991e03e39eaea5714f62e5eff47b27125e4b7c8d8027","observation_id":"3826abaa-d65d-423e-90ed-837387ce4795","resolution":{"observed_at":"2026-08-15T20:59:11.685462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.015092Z","title":"Gridmm: Grid memory map for vision-and-language navigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.015092Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:7925fb4cde2cdcfe8b3463a25c992dbf01b7d9b348496a93930dfaf39680e2fb","observation_id":"0dd1d137-ae3a-48d7-a8fd-b90898c06c12","resolution":{"observed_at":"2026-08-15T20:59:11.015092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.018222Z","title":"Etpnav: Evolving topological planning for vision-language navigation in continuous environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.018222Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:21a2abf2e4b8985c78e9d57cb26a1654350f2397122e8fa91c30e14047059a9f","observation_id":"32cf35d3-5940-4fe4-8d7c-d0e5f10a224b","resolution":{"observed_at":"2026-08-15T20:59:11.018222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.657965Z","title":"Bevbert: Multimodal map pre-training for language-guided navigation","venue":null,"work_id":"6467661f-c4d0-477c-b54d-16f7de1ef2a4","year":2023},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.021346Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:9b9736a027955d39fddf71ee9b568e752c854722400327be2a293c4a344ac41a","observation_id":"9026c242-c737-4e68-bdb4-8cb23b074a4f","resolution":{"observed_at":"2026-08-15T20:59:11.661909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.647410Z","title":"Sim-to-real transfer via 3d feature fields for vision-and-language navigation","venue":null,"work_id":"49c875c3-45f0-4002-aee5-e0f3b016df7a","year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.024387Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:4c043b1c33f05240cda75b45cabbdc9c95a4e49061a0dbddfe3f85beb00847e0","observation_id":"6d3d0a0b-aaeb-4744-9d4f-1dbf17bd71f3","resolution":{"observed_at":"2026-08-15T20:59:11.650854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.636611Z","title":"Open-nav: Exploring zero-shot vision-and-language navigation in continuous environment with open-source llms","venue":null,"work_id":"6c847569-7981-423f-9790-3869469944aa","year":2025},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.028544Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:d58fe3b4563471e1016abeca979ec89a9a445155a41d3451ae04b8686f22f7b4","observation_id":"3b312087-5dd7-42f7-ae1f-96e991bd4927","resolution":{"observed_at":"2026-08-15T20:59:11.640342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12366","last_updated":"2024-09-20T01:32:35Z","snapshot_observed_at":"2026-08-17T11:34:19.843560Z","submitted_at":"2024-07-17T07:44:26Z","title":"NavGPT-2: Unleashing Navigational Reasoning Capability for Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12366","snapshot_observed_at":"2026-08-15T20:59:11.033358Z","title":"Navgpt-2: Un- leashing navigational reasoning capability for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.033358Z"},"links":{"cited_paper":"/paper/2407.12366","citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:122436a6fa4cdc06feaf47410a4d3762fd83af4bd79e62cccb31d63111086ad4","observation_id":"0cfb4c6b-3c7b-40f8-8066-1e7ab584f861","resolution":{"observed_at":"2026-08-15T20:59:11.033358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.625337Z","title":null,"venue":null,"work_id":"6e8b402d-c720-46fc-aa2a-648b14985c64","year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.037712Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:f8298b5744866ad868f8c0c375c011d5aa03c878d5c7509adfa4db1db96a1e4b","observation_id":"bf22fda2-2145-4d70-ab77-38def4453fd7","resolution":{"observed_at":"2026-08-15T20:59:11.629551Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.613562Z","title":null,"venue":null,"work_id":"25a1f749-57f6-4a13-9ec1-d5f7bae03289","year":2025},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.041499Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:f57025c37b4c61b820de7e47002e81173c424b09ec7fb603991925a52737355c","observation_id":"9f6a8151-3867-41fe-81e5-0f6fdbd0d5d9","resolution":{"observed_at":"2026-08-15T20:59:11.617339Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.045479Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.045479Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:e6a370b5a5fcf38d31a4855f0b44d59bccb959e84f7771099952c65cd53ca459","observation_id":"725ba98b-b1d8-4018-aa3a-29813f2fba55","resolution":{"observed_at":"2026-08-15T20:59:11.045479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.049094Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.049094Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:a06d59f83f07b26eb4cd7e30bbe5cd943c487bbd22fbc6a786d92081882bd39b","observation_id":"42c64cff-a0f4-41e9-a8e7-87ab19b0a4f7","resolution":{"observed_at":"2026-08-15T20:59:11.049094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.053125Z","title":"Ll3da: Visual interactive instruction tuning for omni-3d understanding reasoning and planning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.053125Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:3992214f2d3108fd3eaf54d485b9e5a8bf6e70764d624ee90ae87e3f17e5d22e","observation_id":"a916a59d-7d46-48e3-aac3-24f8236b1d8c","resolution":{"observed_at":"2026-08-15T20:59:11.053125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-16T14:35:06.515561Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-15T20:59:11.056801Z","title":"Chat-scene: Bridging 3d scene and large language models with object identifiers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.056801Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:4f1b5e6308540f7722c02b5046058ba89a641dbc502d1f28f4e9509d0ceaee96","observation_id":"b171e546-d8cd-4076-8a8f-7972e223fc3f","resolution":{"observed_at":"2026-08-15T20:59:11.056801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.575885Z","title":"An embodied generalist agent in 3d world","venue":null,"work_id":"8aa88dbd-e8a2-441c-837a-7a435f93fb58","year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.061079Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:39de90d258c3e53856ae64593d4ddc6bfd6b8c6816e5b2cb68fbdb238af83280","observation_id":"8eecf82a-69cd-4065-92be-1720cb442572","resolution":{"observed_at":"2026-08-15T20:59:11.583760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11401","last_updated":"2024-03-22T18:52:51Z","snapshot_observed_at":"2026-08-17T15:42:36.096154Z","submitted_at":"2024-03-18T01:18:48Z","title":"Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11401","snapshot_observed_at":"2026-08-15T20:59:11.064457Z","title":"Scene-llm: Extending language model for 3d visual understanding and reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.064457Z"},"links":{"cited_paper":"/paper/2403.11401","citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:3d69268c5b29ab717ff54001f101e00230a7f61742b34c4ca234498d744ce14c","observation_id":"64c95c6e-091b-4714-81cf-6abfc2239f41","resolution":{"observed_at":"2026-08-15T20:59:11.064457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.068061Z","title":"3d-llm: Injecting the 3d world into large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.068061Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:07c4fba8a8cac0228d1c62a9877794917835846a788edda57629e7d6c74b4f84","observation_id":"c782b4a2-c2ee-4cfe-b079-3788ba651885","resolution":{"observed_at":"2026-08-15T20:59:11.068061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00493","last_updated":"2025-03-27T10:30:42Z","snapshot_observed_at":"2026-08-12T23:13:45.948951Z","submitted_at":"2024-11-30T14:28:53Z","title":"Video-3D LLM: Learning Position-Aware Video Representation for 3D Scene Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00493","snapshot_observed_at":"2026-08-15T20:59:11.071380Z","title":"Video-3d llm: Learning position-aware video representation for 3d scene understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.071380Z"},"links":{"cited_paper":"/paper/2412.00493","citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:f6828c830f3bc5239a89fe3ccd089cc418bb563cc3805a0c76ad9e5c46f64cb8","observation_id":"950c6378-f069-49eb-9012-56ffe44cb7b6","resolution":{"observed_at":"2026-08-15T20:59:11.071380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18125","last_updated":"2025-04-27T06:50:23Z","snapshot_observed_at":"2026-08-16T13:15:01.097068Z","submitted_at":"2024-09-26T17:59:11Z","title":"LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18125","snapshot_observed_at":"2026-08-15T20:59:11.074859Z","title":"Llava-3d: A simple yet effective pathway to empowering lmms with 3d-awareness.arXiv preprint arXiv:2409.18125, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.074859Z"},"links":{"cited_paper":"/paper/2409.18125","citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:03f6ef0bd0d5ae4726804747f8f00712616a0b382e4c91f575941b2b57d44338","observation_id":"346d152d-5f34-45c0-a6a0-ab946f40cebc","resolution":{"observed_at":"2026-08-15T20:59:11.074859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.554758Z","title":"Lookahead exploration with neural radiance representation for continuous vision-language navigation","venue":null,"work_id":"b763a63d-7e03-4d82-b9c2-2d4e8abe8710","year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.078810Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:2b9bb8794a9a6884fdfd604e323dee0aaeff6d086b77cfd4fa8651a77ccb3ed1","observation_id":"14734b56-16dd-4f6c-a957-0ba37e13f1e0","resolution":{"observed_at":"2026-08-15T20:59:11.560550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07563","last_updated":"2024-11-26T10:31:15Z","snapshot_observed_at":"2026-08-16T14:10:36.348767Z","submitted_at":"2024-03-12T11:51:55Z","title":"Learning Generalizable Feature Fields for Mobile Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07563","snapshot_observed_at":"2026-08-15T20:59:11.081771Z","title":"Learning generalizable feature fields for mobile manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.081771Z"},"links":{"cited_paper":"/paper/2403.07563","citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:b1f3f44f62674b32e446ced5c7cfda07c454eb57e9443fcaf5b511e0743ef1ed","observation_id":"474084a7-5bbd-4641-92f0-e2fe4e7770e0","resolution":{"observed_at":"2026-08-15T20:59:11.081771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.085792Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.085792Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:89f929a69dc6f1cc32e3c5bece8a17fe99aa02af918e9509e0f0fcadc5907023","observation_id":"ecc44f67-62e1-4f06-9120-7508788c4a01","resolution":{"observed_at":"2026-08-15T20:59:11.085792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.089780Z","title":"Habitat- matterport 3d semantics dataset","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.089780Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:e964a64d298973efdbab3b847e4e8b7c663f6714813105b18a409a1ec5e1ef79","observation_id":"35e81402-52cf-4eca-a141-d8ad255f3ee7","resolution":{"observed_at":"2026-08-15T20:59:11.089780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.526808Z","title":"Rio: 3d object instance re-localization in changing indoor environments","venue":null,"work_id":"c2f81847-fbfd-43b3-a3c8-ee477e73af68","year":2019},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.093803Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:ecc8736c3bad3d5ffd68d7bf145084ce3bf4c8026b1670fb1c7248995f894607","observation_id":"1c8ec00f-2ea0-492b-9143-af31ef56b098","resolution":{"observed_at":"2026-08-15T20:59:11.532040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.507838Z","title":"Sceneverse: Scaling 3d vision-language learning for grounded scene understanding","venue":null,"work_id":"2f393181-00cc-44d3-bf2f-8ecf5d0f56ee","year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.098172Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:0715d72bea90d41e7b669c337439d01ef84b517c85e92d40ada0218fc0bad4ea","observation_id":"c4f3ca20-cb4a-47ad-843d-610c1d23d289","resolution":{"observed_at":"2026-08-15T20:59:11.517526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01223","last_updated":"2024-04-01T16:31:04Z","snapshot_observed_at":"2026-08-16T14:04:36.256328Z","submitted_at":"2024-04-01T16:31:04Z","title":"Feature Splatting: Language-Driven Physics-Based Scene Synthesis and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01223","snapshot_observed_at":"2026-08-15T20:59:11.102040Z","title":"Feature splatting: Language-driven physics-based scene synthesis and editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.102040Z"},"links":{"cited_paper":"/paper/2404.01223","citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:b1707d6d77655ad997e1eac49ab6ebff0d911224f1a4e0ff33116123be2b210a","observation_id":"5d428d5f-01d3-4f7f-b810-584d1861ed4b","resolution":{"observed_at":"2026-08-15T20:59:11.102040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.106040Z","title":"Xtuner: A toolkit for efficiently fine-tuning llm","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.106040Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:48a038c315ba938668dc6ed989fa8b2db6c70585fb767aa7e499ae873368a7bd","observation_id":"80f4a096-6e24-4429-aae3-3da3c5fb0227","resolution":{"observed_at":"2026-08-15T20:59:11.106040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-15T20:59:11.110249Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.110249Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:8325b20ff4d7212d602ea44c542ae97223413e6ad01ef5d03cefa7355a9c529e","observation_id":"c1f25e16-a2e5-4f69-a7bd-1be5f863865c","resolution":{"observed_at":"2026-08-15T20:59:11.110249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.484050Z","title":"Cross-modal map learning for vision and language navigation","venue":null,"work_id":"166039b3-9c9b-46ef-92ef-d26a7944dd84","year":2022},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.116507Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:77940c8948dafd2815acb9544bfb5ac3e1878aded74a78520f7d17c09f6a6607","observation_id":"ee9c700a-27dd-4ec4-bc40-bd90809ce39b","resolution":{"observed_at":"2026-08-15T20:59:11.490076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.466551Z","title":"Weakly-supervised multi-granularity map learning for vision-and-language navigation","venue":null,"work_id":"60d6ab7f-a097-4ab6-b94d-9079dd6a5fb4","year":2022},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.122152Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:e3b2dc6e37bad769adf0878e50da82307e7e752845b7a7c2668de8eab4a1e7fc","observation_id":"0745b914-d419-47a4-8055-e89f749e0b04","resolution":{"observed_at":"2026-08-15T20:59:11.471819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.452830Z","title":"Instructnav: Zero-shot system for generic instruction navigation in unexplored environment","venue":null,"work_id":"bbf3cb0d-fa63-4e7a-9dce-1dd146ee06dc","year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.126143Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:ee5f0769afb20ca18b26004558871299e264eeab091b4bf76f6947a20ac3d2a7","observation_id":"480992bc-787d-44d2-90d6-9fe4a143bf06","resolution":{"observed_at":"2026-08-15T20:59:11.456951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.440755Z","title":"Affordances-oriented planning using foundation models for continuous vision-language nav- igation","venue":null,"work_id":"f5825404-6e21-4fe9-9434-ca13a6fc57a2","year":2025},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.129374Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:39a6ae09f18462d932875217f2ef3b8ba504a9041df913bcf760fcb32ac85fe6","observation_id":"eeb33017-9d81-4ecc-ac59-29b2f28d52c1","resolution":{"observed_at":"2026-08-15T20:59:11.444755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.132492Z","title":"Arkitscenes: A diverse real-world dataset for 3d indoor scene understanding using mobile rgb-d data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.132492Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:187ffd64b036fda5e1fb94f98e0514f910266c62401a8339825f2d40a36c4b99","observation_id":"8a683655-5628-45f2-840f-6cbd29249200","resolution":{"observed_at":"2026-08-15T20:59:11.132492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.421606Z","title":"Structured3d: A large photo-realistic dataset for structured 3d modeling","venue":null,"work_id":"3a75f09c-23dd-4011-9edb-7303fc74297d","year":2020},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.135977Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:1d1fadb20ccb1bdc6cd580d98b3b7f5153496bfe226675a7081435dde88b5149","observation_id":"0e832c77-1435-4575-82fc-4d87149dd052","resolution":{"observed_at":"2026-08-15T20:59:11.425999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.406707Z","title":"Scaling data generation in vision-and-language navigation","venue":null,"work_id":"04e83fca-24a1-4545-a32f-68e760ea35a7","year":2023},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.142816Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:1936ff2d8fed8e5e35be4120b08966625d74a07a2057563de7e18e5c02f079dc","observation_id":"d0d8957f-b1f3-40df-8ac2-c8058f3bad83","resolution":{"observed_at":"2026-08-15T20:59:11.412170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.148767Z","title":"A reduction of imitation learning and structured prediction to no-regret online learning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.148767Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:329c3949b2618e346b82c9307717a004fa4f6291d5535b62bc950edaff4fd8ad","observation_id":"5bd952d9-d33d-4e06-a66b-e976435b16bf","resolution":{"observed_at":"2026-08-15T20:59:11.148767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.157244Z","title":"Adafactor: Adaptive learning rates with sublinear memory cost","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.157244Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:4ea6fe009b7ce0cc920a992db28e603f6f122beabc411738ff6dc124412fcf49","observation_id":"1ecbbded-bccb-4ae6-a056-5c7da6d6e675","resolution":{"observed_at":"2026-08-15T20:59:11.157244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.06174","last_updated":"2016-04-22T19:21:36Z","snapshot_observed_at":"2026-08-14T14:33:36.303679Z","submitted_at":"2016-04-21T04:15:27Z","title":"Training Deep Nets with Sublinear Memory Cost","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.06174","snapshot_observed_at":"2026-08-15T20:59:11.160541Z","title":"Training deep nets with sublinear memory cost","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.160541Z"},"links":{"cited_paper":"/paper/1604.06174","citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:3cde085994eaf732baef36e257763205db6b8c57969c456dcd7a261276770cf2","observation_id":"1f72137b-27b2-4585-9596-37037a535bad","resolution":{"observed_at":"2026-08-15T20:59:11.160541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.380946Z","title":"Dynamem: Online dynamic spatio-semantic memory for open world mobile manipulation","venue":null,"work_id":"05baa371-4b49-4f55-8d83-529415c3f9e5","year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.164370Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:49ed3a5e361f46f202b9230e10fb3fb82360ff021e0870462d36f18ae1a578ba","observation_id":"3d4c7a5b-a3b9-4828-a977-cf88c588ed25","resolution":{"observed_at":"2026-08-15T20:59:11.384825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":1,"verified_fuzzy":21},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 6 inbound Pith citation observations for arXiv:2505.11383."}