{"as_of":"2026-08-09T16:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5610c7444bb4342ed141917bfd3a29c0f43ea1537dfd0285f6b6984d561f70a2","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T01:41:52.473153Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.14586/citation-record","integrity":"/paper/2607.14586/integrity","json":"/paper/2607.14586/citation-record.json","paper":"/paper/2607.14586"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:48.500807Z","title":"HM3D- OVON: A dataset and benchmark for open-vocabulary object goal navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-09T09:31:20.377161Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:48.500807Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:557a248adb0354619db2f4d55f9c0918ea0442e8e2eec39b3b14139fbf859fa0","observation_id":"18a3fdb3-4f74-4a0e-acdd-06fce3c33428","resolution":{"observed_at":"2026-08-02T01:41:48.500807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:48.673352Z","title":"GOAT-Bench: A benchmark for multi-modal lifelong navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-09T09:31:20.377161Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:48.673352Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:f468def374eabb76e7b4d759970f56c4d4d35aba182cf86572da5def372e3a54","observation_id":"f9b56fb0-b2b5-417e-b0a8-d256ce72b834","resolution":{"observed_at":"2026-08-02T01:41:48.673352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04034","last_updated":"2025-03-08T01:37:47Z","snapshot_observed_at":"2026-08-09T09:31:06.243173Z","submitted_at":"2024-08-07T18:30:18Z","title":"Task-oriented Sequential Grounding and Navigation in 3D Scenes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04034","snapshot_observed_at":"2026-08-02T01:41:48.849680Z","title":"Task-oriented sequential grounding and navigation in 3D scenes,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-09T09:31:20.377161Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:48.849680Z"},"links":{"cited_paper":"/paper/2408.04034","citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:27b90a99912f226833e6dc44e0ceb0d7f7a33bce23e00ebbb91b85414d74f896","observation_id":"eadc8c0c-5395-45cd-9797-00c5b107faed","resolution":{"observed_at":"2026-08-02T01:41:48.849680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:49.022785Z","title":"Object goal navigation using goal-oriented semantic exploration,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-09T09:31:20.377161Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:49.022785Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:3086c93a9bb3067a9e08b20cd08d35df1ec3909b24aeb42a2076b59baa991824","observation_id":"e0f17fa7-441f-42a7-a952-368e7d833415","resolution":{"observed_at":"2026-08-02T01:41:49.022785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:49.144127Z","title":"VLFM: Vision-language frontier maps for zero- shot semantic navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-09T09:31:20.377161Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:49.144127Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:8422e9c2ee847e6a7beb8f1222a3ee7ddd3aef0ef6c6bdd424cbbe0524edb79e","observation_id":"4c796ac1-d23e-45b0-b045-ec58a7283cb8","resolution":{"observed_at":"2026-08-02T01:41:49.144127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:49.291227Z","title":"Move to understand a 3D scene: Bridging visual ground- ing and exploration for efficient and versatile embodied navigation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-09T09:31:20.377161Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:49.291227Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:e955485f6774a442eca91ce46523232390f00498cdd066b83834bd37374a7efe","observation_id":"8a067809-8a12-46ae-aa37-5bb25bb21965","resolution":{"observed_at":"2026-08-02T01:41:49.291227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:49.436063Z","title":"Unifying 3D vision-language understanding via prompt- able queries,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-09T09:31:20.377161Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:49.436063Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:4a493422cbb2b968a8c5a90762b5a33377fdaf2549d83987f36ba839e3da6b72","observation_id":"50a43686-fe47-4752-9f7b-62aac0e018f3","resolution":{"observed_at":"2026-08-02T01:41:49.436063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:49.573559Z","title":"NavGPT: Explicit reasoning in vision- and-language navigation with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-09T09:31:20.377161Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:49.573559Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:aabf55e7b88ae01af562a26128d5e6a21c01b81abe576abf6429e530ce075019","observation_id":"3d527683-1a5e-4d70-b51b-fc4b5c3fe068","resolution":{"observed_at":"2026-08-02T01:41:49.573559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:49.701297Z","title":"NaVid: Video-based VLM plans the next step for vision-and-language navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-09T09:31:20.377161Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:49.701297Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:7ba176868cf351cac274b8edb215f4d04fc9ce6fd36823a0999149fdda988267","observation_id":"5aa67a84-1514-45aa-b566-4eae579fd2a3","resolution":{"observed_at":"2026-08-02T01:41:49.701297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:49.873639Z","title":"L3MVN: Leveraging large language models for visual target navigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-09T09:31:20.377161Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:49.873639Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:f46d96f55136ac2d5a50cdb3ca8e6a9673110e13df55b3eb66941b62f2557d6e","observation_id":"dce93dd5-08cb-4fd7-8c8e-71b966f293d7","resolution":{"observed_at":"2026-08-02T01:41:49.873639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:50.039088Z","title":"SayNav: Grounding large language models for dynamic planning to navigation in new environments,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-09T09:31:20.377161Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:50.039088Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:99a95d6d3d606d310074382736fd848d2d5787107ea93b28effcbda7941d4cd8","observation_id":"69f1c1d8-2f6f-4429-a47c-f4ca7c899a6a","resolution":{"observed_at":"2026-08-02T01:41:50.039088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:50.157628Z","title":"SG-Nav: Online 3D scene graph prompting for LLM-based zero-shot object navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-09T09:31:20.377161Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:50.157628Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:347a75a8ca467b473054dab59c99ea6bbdfe2f377e9c265204543ed5eee35558","observation_id":"892e9a91-5e9e-48ad-8e2b-d1d3b5a24d47","resolution":{"observed_at":"2026-08-02T01:41:50.157628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:50.256336Z","title":"A frontier-based approach for autonomous exploration,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-09T09:31:20.377161Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:50.256336Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:628dc14956a748c844a44b85bfbd6ac9f692e22e75b03c35927f9829c59953a4","observation_id":"79a23742-38c4-4ea3-91ac-b217f9128ac8","resolution":{"observed_at":"2026-08-02T01:41:50.256336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:50.349270Z","title":"PONI: Potential functions for ObjectGoal navigation with interaction-free learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-09T09:31:20.377161Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:50.349270Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:ee83570c9328bbbab72acbfe27d862c2337fdb4b6e20d68538969712b1214a38","observation_id":"fc107c30-578f-49fe-ac81-c41f2db81e81","resolution":{"observed_at":"2026-08-02T01:41:50.349270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:50.444445Z","title":"PIRLNav: Pre- training with imitation and RL finetuning for ObjectNav,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-09T09:31:20.377161Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:50.444445Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:2abc08d718a663e0f4412f683c0e1d22a30181c58e2ba8fd41d23ebd6ffb8315","observation_id":"da2cbd47-b561-478a-b215-033197827d8c","resolution":{"observed_at":"2026-08-02T01:41:50.444445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:50.542590Z","title":"Uni-NaVid: A video-based vision-language-action model for unifying embodied navigation tasks,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-09T09:31:20.377161Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:50.542590Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:5b1da6770aca41727b8ab5789b874c32f71d2ff1ab4a481033c9983718d19e15","observation_id":"09e1a243-b281-4ec8-b3e7-5648140213bb","resolution":{"observed_at":"2026-08-02T01:41:50.542590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:50.628115Z","title":"V oroNav: V oronoi-based zero-shot object navigation with large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-09T09:31:20.377161Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:50.628115Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:0446c7f466cf25caff3a0c4f67d7d4e67c96431afe4e19052f35327c7db38cb5","observation_id":"6a3d1d78-6de2-4ea9-ab8d-aa01ba6f415d","resolution":{"observed_at":"2026-08-02T01:41:50.628115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:50.724452Z","title":"MapGPT: Map-guided prompting with adaptive path planning for vision-and-language navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-09T09:31:20.377161Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:50.724452Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:95e54d1ac402b200d61341d1a414870439d52e84de0e8603f19b95a2d269ab59","observation_id":"802f9793-758c-4bf7-977d-bc16ec2717fb","resolution":{"observed_at":"2026-08-02T01:41:50.724452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:50.790386Z","title":"ESC: Exploration with soft commonsense constraints for zero-shot object navigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-09T09:31:20.377161Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:50.790386Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:ef3662828dd1d04b84740c5f012f65f9f84b14c1a896a7c85137cdf7efdd0fc7","observation_id":"498b2f0e-96c6-4f64-a22a-dc8358fbb9a0","resolution":{"observed_at":"2026-08-02T01:41:50.790386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:50.867928Z","title":"Flamingo: A visual language model for few-shot learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-09T09:31:20.377161Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:50.867928Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:ef82995c27e26eacd14ab45f48093e4bcbc2cc75659176620287e9bdfcbf5b2e","observation_id":"24574323-eae1-4655-80a9-1195d1452786","resolution":{"observed_at":"2026-08-02T01:41:50.867928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:50.920017Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-09T09:31:20.377161Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:50.920017Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:17d7ae8e6df01a08d0df7a567cbc782b063898f87c7c296c4ca79973fdf56725","observation_id":"9e2fba9b-0600-4a47-887f-d57a4a4582dd","resolution":{"observed_at":"2026-08-02T01:41:50.920017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:51.006655Z","title":"BLIP-2: Bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-09T09:31:20.377161Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:51.006655Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:8c571d614f6aeac4dd479843d59ee4b7ffb6a8e2848ea8c86fb663f7ec430821","observation_id":"6c8710cb-484d-441d-8c36-40d5c00b95ea","resolution":{"observed_at":"2026-08-02T01:41:51.006655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:51.065132Z","title":"3D-LLM: Injecting the 3D world into large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-09T09:31:20.377161Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:51.065132Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:37217ce63a67015a33ede4e8d8cc2437992573d9bb86ae63b1f7def005f5b7c5","observation_id":"b29a0332-5521-4879-b866-2c8ecbf728ad","resolution":{"observed_at":"2026-08-02T01:41:51.065132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:51.157750Z","title":"An embodied generalist agent in 3D world,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-09T09:31:20.377161Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:51.157750Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:19a28373158439c26921633bc4c37bdb2e7588241ebb3520cd795db84aa30ba1","observation_id":"08cbdb82-3867-4f6f-b8e6-85aead536ee5","resolution":{"observed_at":"2026-08-02T01:41:51.157750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:51.255377Z","title":"LL3DA: Visual interactive instruction tuning for omni- 3D understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-09T09:31:20.377161Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:51.255377Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:64fb0510fea79b68316f766b046c6fe82e1bb320d3c0402d80e5c3588c34b4b4","observation_id":"e34d34f8-d4b2-4fb4-af0b-4e5b6366163d","resolution":{"observed_at":"2026-08-02T01:41:51.255377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:51.351345Z","title":"EmbodiedGPT: Vision-language pre-training via em- bodied chain of thought,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-09T09:31:20.377161Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:51.351345Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:697c8ddb8b394a1c15ffde296f5c9bc3c1bb650d999ff5c402d0ac6b423ae908","observation_id":"9487fa09-aa21-4e69-8356-ece45640f4d8","resolution":{"observed_at":"2026-08-02T01:41:51.351345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:51.444318Z","title":"Dynam3D: Dynamic layered 3D tokens empower VLM for vision-and-language navigation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-09T09:31:20.377161Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:51.444318Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:c857738671370d354cc55ac3890b8eb90a854701edcb0775cd3a83cad0cc9134","observation_id":"384b949d-474e-4ee8-aa98-4e388da0437a","resolution":{"observed_at":"2026-08-02T01:41:51.444318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:51.535275Z","title":"AstraNav-Memory: Contexts compression for long memory,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-09T09:31:20.377161Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:51.535275Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:1b005fbee1c239f315fea44609abc673ecb52892de308c11570a8d1ad8f9108c","observation_id":"ac9517b3-6973-40af-8537-4165a3d72d82","resolution":{"observed_at":"2026-08-02T01:41:51.535275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-07-06T22:12:35.584339Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-08-02T01:41:51.639055Z","title":"Siméoni et al., “DINOv3,”arXiv:2508.10104, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-09T09:31:20.377161Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:51.639055Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:a26c204241278fa9dad642e4e89adee4f1fc7274a4dd9efd3576454ae5af123c","observation_id":"396570cb-60cd-49dc-b30b-6293bab5e135","resolution":{"observed_at":"2026-08-02T01:41:51.639055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-02T01:41:51.731349Z","title":"Qwen2.5-VL technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-09T09:31:20.377161Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:51.731349Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:797f40546220f941f4f06517763250e89d49e35a1b12c0ed21e77bfcecb36d03","observation_id":"091fa90e-0c94-4c79-a71b-30384284b95c","resolution":{"observed_at":"2026-08-02T01:41:51.731349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:51.859604Z","title":"LoRA: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-09T09:31:20.377161Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:51.859604Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:fcbd098a8bf19eabe73a6b87df5bed26b793a27dc8aee6bd123c08578bfe2486","observation_id":"eee35148-b0bf-4a26-ba8a-f59e8a7f2822","resolution":{"observed_at":"2026-08-02T01:41:51.859604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:51.952688Z","title":"Habitat: A platform for embodied AI research,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-09T09:31:20.377161Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:51.952688Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:2dca73072ec15ac775eed002f6e6da9e9e53fe23de6323af17662d4da15c391c","observation_id":"8d1a3746-65ce-4bce-a4be-876c4a5f6a2d","resolution":{"observed_at":"2026-08-02T01:41:51.952688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:52.050418Z","title":"The design of stretch: A compact, lightweight mobile manipulator for indoor human environments,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-09T09:31:20.377161Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:52.050418Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:f535643a334e195e481bf9034dacacfd2b0633f742c47567105af8dc355a9f33","observation_id":"cc49ba36-6586-4ca4-96c2-dfda73da8a48","resolution":{"observed_at":"2026-08-02T01:41:52.050418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:52.146704Z","title":"TANGO: Training- free embodied AI agents for open-world tasks,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-09T09:31:20.377161Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:52.146704Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:51d765273286294f8eac162a015f48b496cf864eac13dcb4553e3d8d136f9594","observation_id":"7e48a6d5-2dde-493f-9901-72f9c75493a3","resolution":{"observed_at":"2026-08-02T01:41:52.146704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:52.243259Z","title":"MSGNav: Unleashing the power of multi-modal 3D scene graph for zero-shot embodied navigation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-09T09:31:20.377161Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:52.243259Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:28221d27d4a5f826e4ce248c548885a9013644f98d680a0d4372dcd03908fe13","observation_id":"6e30485e-cbee-4082-a043-3c7a8f232d83","resolution":{"observed_at":"2026-08-02T01:41:52.243259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:52.342874Z","title":"Cows on pasture: Baselines and benchmarks for language-driven zero-shot object navigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-09T09:31:20.377161Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:52.342874Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:cfa93a66b4a10e11c7cea8ba47f6139e0184b5424963d98238152ca25e536c0e","observation_id":"3f91037b-3f67-4718-8b22-302b24b279ee","resolution":{"observed_at":"2026-08-02T01:41:52.342874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:52.473153Z","title":"Embodied VideoAgent: Persistent memory from ego- centric videos and embodied sensors enables dynamic scene under- standing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-09T09:31:20.377161Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:52.473153Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:510bc102ea013b5f50d3e21de6e294c42d331f8b495ae7ce20d4670661eacac1","observation_id":"24499448-6823-4f3b-a2b8-66be4601a539","resolution":{"observed_at":"2026-08-02T01:41:52.473153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-09T09:31:20.377161Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2607.14586."}