{"as_of":"2026-08-15T15:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:be202d9bd5b3fea3604aec288a4f19e8b0ddad25931ce830e21501092f581983","coverage":[{"denominator":74,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":74,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T12:41:12.121854Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.17030/citation-record","integrity":"/paper/2411.17030/integrity","json":"/paper/2411.17030/citation-record.json","paper":"/paper/2411.17030"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.994543Z","title":"Bevbert: Multimodal map pre-training for language-guided navigation","venue":null,"work_id":"fb124f66-02ef-412f-91a5-bf952d4d38b1","year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.872337Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:3b7a314154b21631323beef37ec0067023ecbf07dd833cb58304d66fb161e46a","observation_id":"87a76538-db03-4cf3-9019-3a399722a007","resolution":{"observed_at":"2026-08-12T12:41:12.998682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.983161Z","title":"Etpnav: Evolving topo- logical planning for vision-language navigation in continuous environments","venue":null,"work_id":"10398f42-73c1-4184-bd6a-cdc49effe87d","year":2024},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.876375Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:bc4c5b15b01b6bf2d759edaf16627ce635a5110db81101cc1fde86ff1720879b","observation_id":"f1347bfa-b0b5-45a9-a855-7036e6eb5aab","resolution":{"observed_at":"2026-08-12T12:41:12.986898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:11.879942Z","title":"Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.879942Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:f43949312308ee7a378e4a11515a3ab37dffe49f10b71db0d8511678d70e3d24","observation_id":"4011b6c3-a942-4e00-9a57-48c24476a8e8","resolution":{"observed_at":"2026-08-12T12:41:11.879942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.967106Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":"aa1e9b40-9f70-499f-a131-140a9e4030f3","year":2022},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.883947Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:a8ab13e257ff484f8b84a519cba00fc7610560aa0813b47a3ed3b6b85a72f085","observation_id":"e22bb210-cc39-45d2-a090-9f82370aeffd","resolution":{"observed_at":"2026-08-12T12:41:12.970597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.956898Z","title":"Matterport3d: Learning from rgb-d data in indoor environments","venue":null,"work_id":"9156e0ac-a058-4b3e-818e-330fac7f9d96","year":2017},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.887606Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:2cde6ad5aaf184294c7976bfba695984ccb06fe01867f63713454ab482b95682","observation_id":"82a71666-756a-4d72-ab5c-0c9a3acaae83","resolution":{"observed_at":"2026-08-12T12:41:12.960308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.946547Z","title":"Object goal navigation using goal-oriented semantic exploration","venue":null,"work_id":"4e46539f-35c0-4b1f-9498-c542707a307b","year":2020},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.891276Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:b3dd99d407c84c2e95b5edaef74d95ccdb571f6cbb4b5118476125588f345677","observation_id":"231eda7a-b2a6-41d2-8a83-027011731b0c","resolution":{"observed_at":"2026-08-12T12:41:12.950337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.935863Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language","venue":null,"work_id":"1f979646-41c2-4795-9429-8e37e4cad9d9","year":2020},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.895050Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:2f6504ad8f1bc384c55c749630aea875c1ab744a274a6bb37a3ca176025930ec","observation_id":"b8969db9-f9b6-4a6c-9882-b91b6b68fba7","resolution":{"observed_at":"2026-08-12T12:41:12.939810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.925544Z","title":"Weakly- supervised multi-granularity map learning for vision-and- language navigation","venue":null,"work_id":"f6849de5-8838-4f62-8734-d2af59d21c99","year":2022},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.898655Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:58de3934ff46d5eb559b1cb9c3169fd10f8de13f00f34cd19e3a12d5a9927f0c","observation_id":"08e26698-f732-412f-b8db-f817edb853fb","resolution":{"observed_at":"2026-08-12T12:41:12.929169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.914258Z","title":"History aware multimodal transformer for vision- and-language navigation","venue":null,"work_id":"7083c952-0b63-4a10-85c2-915e5820494b","year":2021},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.901828Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:4ea6772ba6fa62ed0cd21b955fa96acc5d41bc5581a5c98a7653f793ed67ba40","observation_id":"c13ec763-50d5-4cf2-9c2b-5672480a839f","resolution":{"observed_at":"2026-08-12T12:41:12.918415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.902646Z","title":"Think global, act lo- cal: Dual-scale graph transformer for vision-and-language navigation","venue":null,"work_id":"a005030d-f81f-4e60-8afb-ec6c7cbb190b","year":2022},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.905101Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:fafae7e671ab18525f709f1ae0201daa4a5bfe86a7c8cc6e8171553905b47dfa","observation_id":"2fdb889f-afea-430b-bf38-2bb66f3dd500","resolution":{"observed_at":"2026-08-12T12:41:12.906552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10370","last_updated":"2024-11-18T08:29:08Z","snapshot_observed_at":"2026-08-15T14:34:38.180262Z","submitted_at":"2024-05-16T18:03:41Z","title":"Grounded 3D-LLM with Referent Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10370","snapshot_observed_at":"2026-08-12T12:41:11.908299Z","title":"Grounded 3d-llm with referent tokens","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.908299Z"},"links":{"cited_paper":"/paper/2405.10370","citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:0d84a90dd03665a0d7a7917808deb4a46a8c8d2755fa37b7e551d12ab0d12548","observation_id":"d395aad0-111f-4b6a-8f98-b241d1e41279","resolution":{"observed_at":"2026-08-12T12:41:11.908299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.892037Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":"9aa04336-a5c8-4291-aeef-22ecb9d345d5","year":2017},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.912314Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:fa3db0eab2875275f1a3c449b3bb5e9c1a4e70108dc3b5dd4bc5c4dfad24215a","observation_id":"c428f878-7a90-4f20-b4e0-3ebcb61cef6c","resolution":{"observed_at":"2026-08-12T12:41:12.895912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.881046Z","title":"Embodied question answering","venue":null,"work_id":"f065acb7-8614-48b5-a3f3-3efd104da94c","year":2018},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.915604Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:3b863216b079d5d57d13a453ca814c1a458b5f6d04cf547905758b70543ec19e","observation_id":"869cafd9-f504-4133-968f-6511437b6efc","resolution":{"observed_at":"2026-08-12T12:41:12.885249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11401","last_updated":"2024-03-22T18:52:51Z","snapshot_observed_at":"2026-08-13T00:52:19.292622Z","submitted_at":"2024-03-18T01:18:48Z","title":"Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11401","snapshot_observed_at":"2026-08-12T12:41:11.918948Z","title":"Scene-llm: Extending language model for 3d visual un- derstanding and reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.918948Z"},"links":{"cited_paper":"/paper/2403.11401","citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:1c85ca674917a5040ed0bc2ee7605ba06543ba23b09ccc49daf58a74fb4d67c8","observation_id":"1885f780-6d26-43a1-98d4-9af56a37c413","resolution":{"observed_at":"2026-08-12T12:41:11.918948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.869803Z","title":"Cows on pasture: Base- lines and benchmarks for language-driven zero-shot object navigation","venue":null,"work_id":"6abce181-50af-47e7-bf40-c6d759ba17fd","year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.922474Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:37ba7a86e48d831881f073a1eef3928a9fbc54665150670f7b6f43d62b229c69","observation_id":"dec94811-4fb1-4952-ae31-51e3319b9022","resolution":{"observed_at":"2026-08-12T12:41:12.873615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.858827Z","title":"Cross-modal map learning for vision and language navigation","venue":null,"work_id":"ea0f0155-427b-49aa-880c-ba5f8725a12a","year":2022},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.925637Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:51335cffdce6112d860ebbbe9737ee3b0e4b3813dda10f10d8d969e04b230491","observation_id":"76e0c43a-b69d-4c27-833f-ab0f65af864f","resolution":{"observed_at":"2026-08-12T12:41:12.862860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:11.928995Z","title":"Navigating to objects in the real world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.928995Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:84c543e3a3e24e72a5963e8f5eaad3b0b297aca7eccbfeb56eba81914b384d72","observation_id":"32b708a5-5cbd-40d2-b21f-123e5ac94c43","resolution":{"observed_at":"2026-08-12T12:41:11.928995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:11.932150Z","title":"Mask r-cnn","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.932150Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:e59a0058cb6e9e731296cf8caba26623297933cda26c4ac004212898f361259b","observation_id":"8ca44bc9-4fdb-402d-88a8-ff3e0ce14c12","resolution":{"observed_at":"2026-08-12T12:41:11.932150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.833068Z","title":"Vln bert: A recurrent vision-and- language bert for navigation","venue":null,"work_id":"7a2d3ee0-8d03-48a2-9fec-04a58d9c3353","year":2021},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.935910Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:d5725d4809bd1c1d0677ed4249d96703b7fcb068fae6bf5a1dc3067bcd7ce489","observation_id":"73872888-fe33-4669-bc14-3c9fecb41c28","resolution":{"observed_at":"2026-08-12T12:41:12.837099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.821292Z","title":"Bridg- ing the gap between learning in discrete and continuous envi- ronments for vision-and-language navigation","venue":null,"work_id":"ac9afc32-c2dd-4727-b322-d68eccd91d85","year":2022},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.939141Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:6092543f6c9cdad5781e2ebf8c100e45f59f3a077c7ebdeb89e56c92386c24fb","observation_id":"d89b78d0-aa78-4caa-b59e-d6dbafd2157e","resolution":{"observed_at":"2026-08-12T12:41:12.825192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.809113Z","title":"Learning naviga- tional visual representations with semantic map supervision","venue":null,"work_id":"b7ee3c0c-b6f5-4e25-852b-d956507d442a","year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.942155Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:1f6215e9b1dad3f5481b477fdc4582f5c9c5bb0189ba62a3d9f14f5f43e48462","observation_id":"e9182e90-2f7b-42b1-8c19-7c45b0e82725","resolution":{"observed_at":"2026-08-12T12:41:12.813560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.797454Z","title":"An embodied generalist agent in 3d world","venue":null,"work_id":"bb03e546-c3d9-4ffc-ad0b-e5b0ea6809a8","year":2024},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.945471Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:82e4aa721195a7c2352100eead055eab990ed935c90a6b13539712996fe0a813","observation_id":"13d47039-932d-4663-a2f5-c1e7792a0eed","resolution":{"observed_at":"2026-08-12T12:41:12.802173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.786430Z","title":"Sceneverse: Scaling 3d vision-language learning for grounded scene un- derstanding","venue":null,"work_id":"dd31e91b-ca62-4bd6-9f75-ebb180dc89e6","year":2024},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.948651Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:1b683269807c25d3bb21dcb2dbd6e9c95172960401b98b63c31694c1fb655cd0","observation_id":"4e10c0c2-b6b6-4435-a834-97ae2aa92747","resolution":{"observed_at":"2026-08-12T12:41:12.790379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.775544Z","title":"Lerf: Language embedded radiance fields","venue":null,"work_id":"c4963d8c-fe16-4f13-a595-bb3eaae68586","year":null},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.951760Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:439c5a63d98914242282ede3ea177595d3a41daeda7d767884c441558b8ddd23","observation_id":"363fd063-7f4b-491e-979a-f2b99222bfa5","resolution":{"observed_at":"2026-08-12T12:41:12.779274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:11.955360Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.955360Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:3d08c42dfdde07806db87b92b983f94d8e54c017b73a090c581371bfa1e530d3","observation_id":"734d25ef-28dc-4fd6-95c4-bb9503c799b8","resolution":{"observed_at":"2026-08-12T12:41:11.955360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.758076Z","title":"Sim-2-sim transfer for vision- and-language navigation in continuous environments","venue":null,"work_id":"4c979cf4-c23c-45ff-9dd2-bc4eefba1203","year":2022},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.958517Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:c9fbc34592e649e87a5f1318b0ee158ba74d550ec5b44e1e400a07b0131fe048","observation_id":"ee853e66-ad70-4388-9196-920578050de5","resolution":{"observed_at":"2026-08-12T12:41:12.762076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:11.961691Z","title":"Beyond the nav-graph: Vision-and-language navigation in continuous environments","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.961691Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:c4567c25ff1ec6f3c7c2640ad39500ea5c6b7b3ccc6d5cdb77a5e8ab065e115c","observation_id":"506da9f3-d1b5-4441-8e94-95f7f2d6f240","resolution":{"observed_at":"2026-08-12T12:41:11.961691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.730122Z","title":"Renderable neural radiance map for visual navigation","venue":null,"work_id":"353a8edb-bd2a-4699-b99a-3d62f2542e35","year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.968341Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:a05eabd7d84bbf5aa7c6150253df3626c96a37bdf48aded1ee8a30ed94e1c786","observation_id":"b078446b-ad7f-45a0-a848-99aa3d927147","resolution":{"observed_at":"2026-08-12T12:41:12.733876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.719640Z","title":"Less is more: Clipbert for video-and-language learning via sparse sampling","venue":null,"work_id":"ddd90587-f5b5-4209-883e-5c811301bcdd","year":2021},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.971725Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:f4266af338a8d410a2e33b17a9c466c2a166d7604f3b460a3f06322580ec9912","observation_id":"5c93262a-6c93-4592-a97b-2e991490be2e","resolution":{"observed_at":"2026-08-12T12:41:12.723406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:11.974912Z","title":"Blip- 2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.974912Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:9968ceff85ec672e9595da2d57af70423b9bce86e93aabb05d52c7065bca696f","observation_id":"9814a060-b2f8-4963-b14c-b1e8c3005b1a","resolution":{"observed_at":"2026-08-12T12:41:11.974912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.702927Z","title":"Grounded language-image pre-training","venue":null,"work_id":"731729dc-4308-429c-a337-d464bf216834","year":2022},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.978223Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:68747a9ba6f6d5ae188491b6cda2b4d3ac78512ce4cdf5f853e86cfd89e938d1","observation_id":"80dec119-ca83-433d-ae63-8da5493d4f70","resolution":{"observed_at":"2026-08-12T12:41:12.706517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.691525Z","title":"Bird’s- eye-view scene graph for vision-language navigation","venue":null,"work_id":"9f23ac28-1286-471e-9005-66ddda6be607","year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.981613Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:933d25a258a219b5f30e768dad25e40ef228211bba83237da6e2cd52aeedf5d0","observation_id":"96f7fa9f-6812-4373-9edf-e19d74043d10","resolution":{"observed_at":"2026-08-12T12:41:12.695814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.679914Z","title":"Vision-language navigation with energy-based policy","venue":null,"work_id":"76a6d88e-780b-4cb8-8aac-569b1b4c363c","year":2024},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.985225Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:b7dcfb20e44e4df0e3d54d8aa2539a5e63d3a6d7918de93d2a3dcab23e7355c6","observation_id":"a6a11262-f324-4279-940d-6c9f6ac64e3d","resolution":{"observed_at":"2026-08-12T12:41:12.683914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.668350Z","title":"V olumetric envi- ronment representation for vision-language navigation","venue":null,"work_id":"b52f37f2-90ad-42fd-bbc1-1fa9b38fb3e4","year":2024},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.988628Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:a2b333e087d4215949aee65f1e06d42a93338f9f673ffc0e9c16940ac00ce13d","observation_id":"2f963d95-0fbe-4569-9e28-cd0474b56ffb","resolution":{"observed_at":"2026-08-12T12:41:12.672126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-12T12:41:11.992187Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.992187Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:b516a842e3fcd828d287792d312162a66a8e7ac4c73c7a157708c40f4eb1cea9","observation_id":"d922b81b-96af-4e65-9622-4ba1d5d98a3b","resolution":{"observed_at":"2026-08-12T12:41:11.992187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.657039Z","title":"Instructnav: Zero-shot system for generic instruction navigation in unexplored environment","venue":null,"work_id":"1051b732-30cc-4e23-bfb1-e20114db0f4e","year":2024},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.995710Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:46619b7c67bf2444c8cb403e48979c108f5a6838625586957d10527012331dfe","observation_id":"6eaef7e8-4f0b-4f82-a952-fa7b0c0f42d4","resolution":{"observed_at":"2026-08-12T12:41:12.661182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.645222Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":"ff2042de-51de-4a71-9257-c21dccfb8100","year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.998993Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:dbaf792059211a61d301192a87835a6bb87dc33c3a86145ff8fc06a6b5c6996d","observation_id":"3af6b1bc-3dd0-4d51-85e6-a82ddbdd8796","resolution":{"observed_at":"2026-08-12T12:41:12.649709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.634943Z","title":"Rec- tifier nonlinearities improve neural network acoustic models","venue":null,"work_id":"ca612068-7fba-4a3f-9276-80d203c44d00","year":2013},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.002258Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:977e0c7a144aa9f166ce176499e8c4b9eb757fd551cac85b2313ba598eec9860","observation_id":"acabc30d-ae47-41bc-822a-2efb0c3c2ae6","resolution":{"observed_at":"2026-08-12T12:41:12.638752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.005584Z","title":"Zson: Zero-shot object-goal navigation using multimodal goal embeddings","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.005584Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:5f423ca1bdb0c93b63f3daef3b1bebf3652463258271ce7e1744d689b1bbb765","observation_id":"b219f52c-18d2-4a73-9c1c-d1b6b7334312","resolution":{"observed_at":"2026-08-12T12:41:12.005584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.618508Z","title":"Openeqa: Embodied question answering in the era of foundation models","venue":null,"work_id":"429306be-4b89-4ab4-8041-5daa12185daf","year":2024},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.009453Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:a0f7f0ae6ba32ca0bfba4094fa2c1e43192302d9d6172f2736b4d8106e8df86f","observation_id":"8f1cc444-c362-4453-8cf2-638a197fb633","resolution":{"observed_at":"2026-08-12T12:41:12.622137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.012861Z","title":"Nerf: Representing scenes as neural radiance fields for view syn- thesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.012861Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:3bdcac15f248df5d1e36c135e255a07dea86303299b3f482704ba49ea0f96ac6","observation_id":"43b429da-8ac1-439c-a8d4-b5ecc2147b59","resolution":{"observed_at":"2026-08-12T12:41:12.012861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.601213Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":"83bffde8-b76f-4cee-8e97-96c0abf30bef","year":null},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.016089Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:f8256a711c93af23d2132f72881067ba281ea0988c52f54ab7c342a15e9358de","observation_id":"799e14c3-c2b6-45c3-97a3-c889cc582bef","resolution":{"observed_at":"2026-08-12T12:41:12.605027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.590570Z","title":"Hop+: History-enhanced and order-aware pre-training for vision-and-language navigation","venue":null,"work_id":"4a106da0-44a1-44bc-bbff-a49f5f446859","year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.019609Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:ca2978596af9fc10fe1b3745b5245a9bedc984e4fe0bf881c3ebee50db0aa989","observation_id":"0660d706-73e8-4c6c-8ad2-570514e5ff43","resolution":{"observed_at":"2026-08-12T12:41:12.594285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07563","last_updated":"2024-11-26T10:31:15Z","snapshot_observed_at":"2026-08-13T00:56:47.710270Z","submitted_at":"2024-03-12T11:51:55Z","title":"Learning Generalizable Feature Fields for Mobile Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07563","snapshot_observed_at":"2026-08-12T12:41:12.022955Z","title":"Learning generalizable feature fields for mobile manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.022955Z"},"links":{"cited_paper":"/paper/2403.07563","citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:16ea8da8ae7ef05a1299f5f6522cacf78a72c39bc702fdaa67183f156c4fc295","observation_id":"4bc9e5cb-477f-485f-8bdb-6e86c9f83573","resolution":{"observed_at":"2026-08-12T12:41:12.022955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.026703Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.026703Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:2e647fd389bf7eb5f6778139e07d5211f1f5bc1829edd3d76238019805031ea9","observation_id":"9029cb07-d3b0-41e2-9958-a4a5f6b4e352","resolution":{"observed_at":"2026-08-12T12:41:12.026703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.573847Z","title":"Habitat-matterport 3d dataset (hm3d): 1000 large-scale 3d environments for embodied ai","venue":null,"work_id":"6d4fa200-535a-4c17-99ef-92b8c8e24b8c","year":null},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.029853Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:b2773acb5b4f20d19f42dad691aaab68fa462b43da4653e7af986bc8a3067276","observation_id":"f94223b8-6c9a-4f83-b735-5189b4c35249","resolution":{"observed_at":"2026-08-12T12:41:12.577550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.563931Z","title":"Poni: Potential functions for objectgoal navigation with interaction- free learning","venue":null,"work_id":"b21b5165-312e-4038-a372-5a1d0effef54","year":2022},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.033132Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:2859f1b968f4a99b8cff1c62276d322d9789ae1fbb90d0cb40cd9469bf39a63d","observation_id":"9f13ec18-5be7-4d83-8e1e-5953cc51592b","resolution":{"observed_at":"2026-08-12T12:41:12.567723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.553810Z","title":"Habitat: A platform for embodied ai research","venue":null,"work_id":"4436093c-633e-400e-bee6-bd26775bd796","year":2019},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.036557Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:2a54f85c8017211ffd7da539d71c12718319c1b7e5f96f0043747fdff31a3787","observation_id":"275dd167-0b4f-4ff0-a88c-3f515edf0292","resolution":{"observed_at":"2026-08-12T12:41:12.557450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.543526Z","title":"Distilled feature fields enable few-shot language-guided manipulation","venue":null,"work_id":"6e57a2ae-c1ae-4699-8a54-786854738926","year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.040645Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:274a6fd1b7448d39b89c9bf3a61b0dd71f33c4911bc64427c19974190d250a1e","observation_id":"30efd223-28ce-48db-be1a-e388086bcf4a","resolution":{"observed_at":"2026-08-12T12:41:12.547216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.532960Z","title":"Language- enhanced rnr-map: Querying renderable neural radiance field maps with natural language","venue":null,"work_id":"0f92b6da-1179-4cfc-82f7-8b1ee408ab1e","year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.043939Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:9cc6d0d8b79a8d1fa596d82a9d9d52715fb263bb3371e11eec31761f9087c208","observation_id":"3a295e05-5e5f-4f1e-ae33-616a181d9ab5","resolution":{"observed_at":"2026-08-12T12:41:12.536766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.522422Z","title":"Nesf: Neural semantic fields for generalizable semantic segmentation of 3d scenes","venue":null,"work_id":"daa71983-3171-42e5-ac96-da6f38de0ac0","year":null},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.047825Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:e3c014d8316c0576d8ea5d50b0dce31c85c5c40f4d7c99dedef5b8018c089484","observation_id":"38570152-e3ba-45fe-b1f1-3103b9430c44","resolution":{"observed_at":"2026-08-12T12:41:12.526238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.510848Z","title":"Yolov7: Trainable bag-of-freebies sets new state-of- the-art for real-time object detectors","venue":null,"work_id":"e80582f0-66b5-4c20-a6ba-a5386b593974","year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.051271Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:9195d11cb391689d322e76920a5bc9c24e091f35e9c2bfdad1947d5c88e1f31e","observation_id":"0c292a5f-4771-4abf-b773-dc6b58d0ac3e","resolution":{"observed_at":"2026-08-12T12:41:12.514554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.500862Z","title":"Dreamwalker: Mental planning for continuous vision- language navigation","venue":null,"work_id":"b47f33a0-f857-4053-a71f-00df7506366f","year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.054825Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:0c8f4e25d480dc5a7caa5919dc9fc1f2c77b66a84274d982e8a2ccfe5b26239e","observation_id":"e754e9da-692d-4d63-8c4f-1fd9d0d90841","resolution":{"observed_at":"2026-08-12T12:41:12.504479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.489465Z","title":"Vision-and-language naviga- tion via causal learning","venue":null,"work_id":"ce099e04-eefd-44ef-9951-e90afdf90fdf","year":2024},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.057945Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:9cff0dce58d779ce4303585bbee5605f37480e5b099a8983c1472a463f1490fd","observation_id":"7ef24cfe-8734-4619-8497-4c8357801ad9","resolution":{"observed_at":"2026-08-12T12:41:12.493108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.374556Z","title":"Scaling data generation in vision-and-language navigation","venue":null,"work_id":"f4373ee1-7632-432b-b0c9-27301fcec715","year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.061317Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:c1af8568c173b9f9c6a9c8e6be10fa864b6fdceb9976cd4668f08a36d4d668a6","observation_id":"c9637c06-818f-4736-9e5b-f8a8ebf87488","resolution":{"observed_at":"2026-08-12T12:41:12.378148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.364198Z","title":"Gridmm: Grid memory map for vision- and-language navigation","venue":null,"work_id":"5baf8a48-7c53-4c00-9d10-9c21236e01ad","year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.064542Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:aa6d26e5c43f88484bc5013a73a4b9fa2f46d6cec8fcfb366af8631b0e4bceef","observation_id":"797ef658-db03-4662-8867-767ab07b4058","resolution":{"observed_at":"2026-08-12T12:41:12.367838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.353989Z","title":"Lookahead exploration with neural radiance representation for continuous vision-language navigation","venue":null,"work_id":"daf130c2-7f3a-436d-9ed5-b6b322df5777","year":2024},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.067942Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:39db27101d0ef2ba2410cda1b98a129e3388ba073aca64dc624042ddbd9ae5e6","observation_id":"7f27c71e-ab7d-4931-92b5-81434c9ad481","resolution":{"observed_at":"2026-08-12T12:41:12.357768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.343256Z","title":"Sim-to-real transfer via 3d feature fields for vision-and-language navigation","venue":null,"work_id":"e99277e3-d43d-4cf1-ab2d-483b07073c2e","year":2024},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.071256Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:8e19ed3c8cf17872caf8e41ee9f9f1d111c1eeedb0511bfae501d93149cb6d56","observation_id":"6c45ba32-515f-4d69-a2b9-2e2b267c89e8","resolution":{"observed_at":"2026-08-12T12:41:12.346864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00357","last_updated":"2020-01-20T04:18:58Z","snapshot_observed_at":"2026-08-14T00:24:58.794756Z","submitted_at":"2019-11-01T13:07:37Z","title":"DD-PPO: Learning Near-Perfect PointGoal Navigators from 2.5 Billion Frames","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.00357","snapshot_observed_at":"2026-08-12T12:41:12.074625Z","title":"Dd-ppo: Learning near-perfect pointgoal navigators from 2.5 billion frames","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.074625Z"},"links":{"cited_paper":"/paper/1911.00357","citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:6856b7ff6520a12890915a4ece6d9f3a3a5a0ab7bb9d64e509341fe11ff936b2","observation_id":"0ed69188-07b2-48da-aa16-dd27c97f58b6","resolution":{"observed_at":"2026-08-12T12:41:12.074625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.333460Z","title":"Habitat-matterport 3d semantics dataset","venue":null,"work_id":"fc1af739-c183-438f-b8f6-8e585c29690f","year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.078457Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:82e809ed01b403558d2cdeaf0f2b2d0829ae583dfa0e0e05f5eb09439cd9b88a","observation_id":"f260ae16-0bf0-4afc-bba2-23a88b0ccaed","resolution":{"observed_at":"2026-08-12T12:41:12.336927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.323282Z","title":"Sg-nav: Online 3d scene graph prompting for llm-based zero- shot object navigation","venue":null,"work_id":"6df83c24-f0bf-4326-9bfb-d7402f64d005","year":2024},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.081615Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:6947eef7e0059283ef899ff57fb11d2548bb668b323654f5c940833fe85fea18","observation_id":"fa71a361-cad1-48f5-91c6-85029c07c25b","resolution":{"observed_at":"2026-08-12T12:41:12.327125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.313151Z","title":"Vlfm: Vision-language frontier maps for zero-shot semantic navigation","venue":null,"work_id":"0716480f-7ac3-425a-8b03-db7aa2085dc1","year":2024},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.084976Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:6eb22bde2abae07be2d65dcb04d3351665a1c55d5e6d2899303c15ce1fc8d621","observation_id":"b40685bc-3f62-49ed-a08a-561e8dd76c41","resolution":{"observed_at":"2026-08-12T12:41:12.316777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.302135Z","title":"Gamap: Zero-shot object goal navigation with multi-scale geometric-affordance guidance","venue":null,"work_id":"b305c061-e9e9-4d36-9c98-ce1ff5c80dbc","year":2024},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.088244Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:8c56d43d26e03dd7b1e13e851cb37aacd8b852c8d96f2f831635c224a077a208","observation_id":"a1bd8e4a-31d3-4df6-9ba7-00ac66e88785","resolution":{"observed_at":"2026-08-12T12:41:12.306045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.291158Z","title":"Gnfactor: Multi-task real robot learning with generalizable neural feature fields","venue":null,"work_id":"9ad9a09a-ffd5-42a2-970b-1fcf07c633c4","year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.091402Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:e58003388c907def7f58f14a5e46c277aa4c084bc8097ec3ac955ed99af1875e","observation_id":"7462ac0a-36cd-40e2-8cc9-e867d1b13a85","resolution":{"observed_at":"2026-08-12T12:41:12.295173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14289","last_updated":"2023-07-01T07:26:22Z","snapshot_observed_at":"2026-08-12T07:11:05.316372Z","submitted_at":"2023-06-25T16:37:25Z","title":"Faster Segment Anything: Towards Lightweight SAM for Mobile Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14289","snapshot_observed_at":"2026-08-12T12:41:12.094566Z","title":"Faster segment anything: Towards lightweight sam for mobile appli- cations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.094566Z"},"links":{"cited_paper":"/paper/2306.14289","citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:f7609a0e7ee5da784d200194c13ea7cc0ee300ece3e490099b0dbc5dda397f38","observation_id":"2c148112-3bef-49ce-bd06-f546961a116e","resolution":{"observed_at":"2026-08-12T12:41:12.094566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03540","last_updated":"2024-11-05T22:42:41Z","snapshot_observed_at":"2026-08-14T22:11:29.051465Z","submitted_at":"2024-11-05T22:42:41Z","title":"VLA-3D: A Dataset for 3D Semantic Scene Understanding and Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03540","snapshot_observed_at":"2026-08-12T12:41:12.098137Z","title":"Vla-3d: A dataset for 3d semantic scene understanding and navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.098137Z"},"links":{"cited_paper":"/paper/2411.03540","citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:b76c336b0bc6d508ed934b5e6f95bc8b4434fde18dbbf6a2c6db74a7f7f9a2d3","observation_id":"4120d482-e917-4997-adff-0b203aa3310c","resolution":{"observed_at":"2026-08-12T12:41:12.098137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.280393Z","title":"Navid: Video-based vlm plans the next step for vision-and-language navigation","venue":null,"work_id":"8359b558-48b4-4d30-93ee-53965f092023","year":2024},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.102131Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:78419631b06444129f1fffe250f00d5d327be01fce0935f365ec413ff9ece267","observation_id":"8aeaf061-8751-411e-a01c-9160b7a018b3","resolution":{"observed_at":"2026-08-12T12:41:12.284146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.269318Z","title":"Hierarchical object-to-zone graph for object navigation","venue":null,"work_id":"9b807070-88df-4fd6-a4d6-553d3e40baa6","year":null},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.105441Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:c6e64b5c89a356ead4afb6d9dc4290038c3acfb4a5cd24999c14dd96b24b43bb","observation_id":"fa271cb0-fd70-420d-a31c-f992cd34dab4","resolution":{"observed_at":"2026-08-12T12:41:12.273067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07035","last_updated":"2024-12-29T23:16:37Z","snapshot_observed_at":"2026-08-12T23:25:39.126520Z","submitted_at":"2024-07-09T16:53:36Z","title":"Vision-and-Language Navigation Today and Tomorrow: A Survey in the Era of Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07035","snapshot_observed_at":"2026-08-12T12:41:12.108676Z","title":"Vision-and-language navigation today and tomorrow: A survey in the era of foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.108676Z"},"links":{"cited_paper":"/paper/2407.07035","citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:8070053cd9c0bd7ab9f9831614d972878c457d39f7f7a42f6368277e20f045cd","observation_id":"3f685f3c-5c53-4d7f-821c-010b9b0811ea","resolution":{"observed_at":"2026-08-12T12:41:12.108676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.258009Z","title":"Structured3d: A large photo-realistic dataset for structured 3d modeling","venue":null,"work_id":"46abc287-4427-4a0c-abde-c7ca21b7a64e","year":2020},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.112252Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:e1f965f6d60bc2bb3d56db248a4d89f56c43c9e3b076cbf43f48dc028588f499","observation_id":"972c91b2-2fd4-46f2-9052-4f568cad6185","resolution":{"observed_at":"2026-08-12T12:41:12.261828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.247197Z","title":"Esc: Ex- ploration with soft commonsense constraints for zero-shot object navigation","venue":null,"work_id":"46a584db-22a0-4319-b2e8-94e167cdc1b7","year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.115389Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:7d6ea9544de6967ab3eee89ca97ac9df387c5e4cdd36917a9c4b7b9003577d21","observation_id":"5b35027b-bcc9-4f56-8f6d-7fd025de0259","resolution":{"observed_at":"2026-08-12T12:41:12.251040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.236056Z","title":"Target-driven visual navigation in indoor scenes using deep reinforcement learning","venue":null,"work_id":"95ce3fe7-59e6-46bf-ab97-c53d5dfaf7bb","year":2017},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.118655Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:bc822ddc92954af7898f7aa03be3cf0bc08fb5a51688a3f53f5bafa822fbf1ed","observation_id":"010eede6-6f5d-4f05-bb16-3215ce0de232","resolution":{"observed_at":"2026-08-12T12:41:12.240154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.223195Z","title":"3d-vista: Pre-trained transformer for 3d vision and text alignment","venue":null,"work_id":"87ae2c7a-a247-43bc-b144-b8e4f9f29e65","year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.121854Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:7afe93a6289109534178bc389df3950a9d18e8dd9c5510eebeb6c2db86990373","observation_id":"b7cf2336-14b3-4f69-b85b-ac37afa3c1de","resolution":{"observed_at":"2026-08-12T12:41:12.228653Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.741290Z","title":null,"venue":null,"work_id":"a4774b36-793b-47ec-b9ae-7e1fd0e4e4a9","year":2020},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":120,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.965153Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:ea2cd41dbcc6a96f0fc70f8076388f39f8c28ce3b758d90a387e2fc72ef8f19d","observation_id":"dbfdaba3-38a0-45a0-bee0-57375ecc9b91","resolution":{"observed_at":"2026-08-12T12:41:12.744699Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks"},"reference_resolution":{"displayed":74,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":17,"verified_exact":0,"verified_fuzzy":55},"total_outbound_references":74},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 74 of 74 outbound references and 0 inbound Pith citation observations for arXiv:2411.17030."}