{"as_of":"2026-08-17T18:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:115b5fafba495a143c8bb05e8ea971bf89b5f94ebdd59b3214c03ac9c6823d26","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:23:01.919344Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T15:39:59.878169Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-14T23:13:15.774007Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-17T14:38:20.575544Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"cited_work":{"arxiv_id":"2506.14507","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14507","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2506.14507 , year=","venue":null,"work_id":"6d1ef9e7-23a0-4f45-8e73-d6e559968eeb","year":null},"citing_paper":{"arxiv_id":"2511.20857","last_updated":"2026-05-18T16:18:02Z","snapshot_observed_at":"2026-08-11T09:44:01.811561Z","submitted_at":"2025-11-25T21:08:07Z","title":"Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory","version":1},"reference_index":248,"source":"arxiv_source","source_observed_at":"2026-05-14T23:13:15.016486Z"},"links":{"cited_paper":"/paper/2506.14507","citing_paper":"/paper/2511.20857"},"observation_digest":"sha256:45e699b4b1bcfb1c3e4d037749ec50cf7dd3567f93b6bc1b4b5ab900d80fd5b6","observation_id":"bcff18d3-129c-4ce3-a3e5-0edbe42ff4a2","resolution":{"observed_at":"2026-05-14T23:13:15.777167Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-17T14:38:20.575544Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14507","snapshot_observed_at":"2026-07-14T15:39:59.878169Z","title":"Can pretrained vision-language embed- dings alone guide robot navigation?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09792","last_updated":"2026-07-09T05:13:02Z","snapshot_observed_at":"2026-08-17T03:28:11.811674Z","submitted_at":"2026-07-09T05:13:02Z","title":"A Comprehensive Survey and Systematic Real-World Evaluation of Embodied Vision-and-Language Navigation","version":1},"reference_index":238,"source":"pdf_text","source_observed_at":"2026-07-14T15:39:59.878169Z"},"links":{"cited_paper":"/paper/2506.14507","citing_paper":"/paper/2607.09792"},"observation_digest":"sha256:d03cf520a69da0a75ece7529eeca30bbef569fe416c0b1ade77a9c0115af1527","observation_id":"b634dbf6-4d76-4ab7-98b0-f537bcf8a414","resolution":{"observed_at":"2026-07-14T15:39:59.878169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.14507/citation-record","integrity":"/paper/2506.14507/integrity","json":"/paper/2506.14507/citation-record.json","paper":"/paper/2506.14507"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:02.549222Z","title":"Getting vit in shape: Scaling laws for compute-optimal model design,","venue":null,"work_id":"c4e1c074-201b-4ddd-9764-b3f747e8420f","year":null},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-17T14:38:20.575544Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:00.467925Z"},"links":{"citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:d0de7e3835ebe99316add23438fc9e92a6fefc5615ee47407fcff53256098239","observation_id":"e0499a38-1ba4-43d3-b5d9-aeb475c79970","resolution":{"observed_at":"2026-08-07T00:23:02.555563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:02.525841Z","title":"Spatialvlm: Endow- ing vision-language models with spatial reasoning capabilities, 2024","venue":null,"work_id":"3fdf419d-620c-4a9c-93c0-73096786d1f7","year":2024},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-17T14:38:20.575544Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:00.566662Z"},"links":{"citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:7847aaa65778404fa7e75a29a1c5b03ac3b1d2837485c20c0f79e1fbab02123c","observation_id":"40e9d7d8-c1a9-4405-acf3-7240dd96a381","resolution":{"observed_at":"2026-08-07T00:23:02.531508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-17T17:58:31.496050Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-07T00:23:00.630568Z","title":"Navila: Legged robot vision-language-action model for navigation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-17T14:38:20.575544Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:00.630568Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:f59f433fe764afc287a108d18ab967f74c8450c4db8aaf64c656ab7ad44ac2d3","observation_id":"ed17b4aa-87dc-430f-a22e-7824d1b5cc3f","resolution":{"observed_at":"2026-08-07T00:23:00.630568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.16649","last_updated":"2022-11-30T00:38:54Z","snapshot_observed_at":"2026-08-16T16:12:15.083932Z","submitted_at":"2022-11-30T00:38:54Z","title":"CLIP-Nav: Using CLIP for Zero-Shot Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.16649","snapshot_observed_at":"2026-08-07T00:23:00.698604Z","title":"Sukhatme","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-17T14:38:20.575544Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:00.698604Z"},"links":{"cited_paper":"/paper/2211.16649","citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:e239456c03a61f486372b3764d2860bfcaf3633158bd0084de4c8a9a11c94e8a","observation_id":"3c22e683-59c9-4af2-9a43-b6de6d942bcc","resolution":{"observed_at":"2026-08-07T00:23:00.698604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:02.503080Z","title":"Learning latent dynamics for planning from pixels, 2019","venue":null,"work_id":"40f932f5-2c31-4bf0-b955-5afeab32709e","year":2019},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-17T14:38:20.575544Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:00.783826Z"},"links":{"citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:c770636283da0807dd7d2386fab619286c26b8731b3d66a7a5c47248f241e0ca","observation_id":"e5e2af88-9c60-4abf-99d4-6749b39fe012","resolution":{"observed_at":"2026-08-07T00:23:02.510339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-08-07T00:23:00.842906Z","title":"Mastering diverse domains through world models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-17T14:38:20.575544Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:00.842906Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:38c0feb872eabc6007e5438ef3705faae402bf2d36632dd8a7e8f48b374fed0f","observation_id":"481ba7a2-3ddb-421e-8953-a4f958356b26","resolution":{"observed_at":"2026-08-07T00:23:00.842906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:02.480054Z","title":"Visual language maps for robot navigation, 2023","venue":null,"work_id":"44d28cca-d198-48c6-9c64-3dd16eafd795","year":2023},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-17T14:38:20.575544Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:00.924004Z"},"links":{"citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:3e5b195d37cea8089729474d236ea2a0db98e4ce1222a6c784ca9188fbc811ad","observation_id":"0040f366-669a-4909-8d08-e03002d5417c","resolution":{"observed_at":"2026-08-07T00:23:02.486795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.02005","last_updated":"2022-02-04T07:30:48Z","snapshot_observed_at":"2026-08-16T17:23:41.543581Z","submitted_at":"2022-02-04T07:30:48Z","title":"BC-Z: Zero-Shot Task Generalization with Robotic Imitation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.02005","snapshot_observed_at":"2026-08-07T00:23:00.963437Z","title":"Bc-z: Zero-shot task general- ization with robotic imitation learning, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-17T14:38:20.575544Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:00.963437Z"},"links":{"cited_paper":"/paper/2202.02005","citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:21dd07e106c9ba47cb65260a77b498fbdcc004ac95eddce4b607e6facd25dc29","observation_id":"987b5551-2994-42c3-9cad-e7c8825761ad","resolution":{"observed_at":"2026-08-07T00:23:00.963437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.03334","last_updated":"2021-06-10T17:15:46Z","snapshot_observed_at":"2026-08-16T18:47:26.631995Z","submitted_at":"2021-02-05T18:36:11Z","title":"ViLT: Vision-and-Language Transformer Without Convolution or Region Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.03334","snapshot_observed_at":"2026-08-07T00:23:00.968433Z","title":"Vilt: Vision-and-language transformer without convolu- tion or region supervision, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-17T14:38:20.575544Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:00.968433Z"},"links":{"cited_paper":"/paper/2102.03334","citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:48669daabf0ac556d9e69e9611a896772709f7dd355fb259743b33c0f9217b46","observation_id":"a2d883d2-6d9b-4aea-8c14-1e0f207b4e51","resolution":{"observed_at":"2026-08-07T00:23:00.968433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09546","last_updated":"2025-05-14T16:45:51Z","snapshot_observed_at":"2026-08-17T14:55:45.244692Z","submitted_at":"2025-05-14T16:45:51Z","title":"Distilling Realizable Students from Unrealizable Teachers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09546","snapshot_observed_at":"2026-08-07T00:23:01.023823Z","title":"Distilling realizable students from unrealizable teachers, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-17T14:38:20.575544Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:01.023823Z"},"links":{"cited_paper":"/paper/2505.09546","citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:01bc460f2fbcd0ace346632e92eac771abaa70176d43c96e1206308876d7eb5a","observation_id":"c9a54b4f-259b-4157-ab69-694ee5098b09","resolution":{"observed_at":"2026-08-07T00:23:01.023823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10568","last_updated":"2024-08-20T06:15:56Z","snapshot_observed_at":"2026-08-16T13:25:19.569615Z","submitted_at":"2024-08-20T06:15:56Z","title":"Constrained Behavior Cloning for Robotic Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10568","snapshot_observed_at":"2026-08-07T00:23:01.104551Z","title":"Constrained behavior cloning for robotic learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-17T14:38:20.575544Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:01.104551Z"},"links":{"cited_paper":"/paper/2408.10568","citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:980c3df19de54017bdd085e47873c548b5b93a4eb4f415852bf6fcdbac73d7d0","observation_id":"1049ce38-98fd-44b0-a912-d685f452942f","resolution":{"observed_at":"2026-08-07T00:23:01.104551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:02.459733Z","title":"ZSON: Zero-shot object-goal navigation using multimodal goal embeddings","venue":null,"work_id":"6bc23752-7026-44fc-b029-7a61ab9cea9a","year":2022},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-17T14:38:20.575544Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:01.190903Z"},"links":{"citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:97d14c3efdcfd81102571c2fb6a33979dd303490dd1e17f6118ffbc64ade68ad","observation_id":"8389b828-de7b-4414-97ee-71e84bdaa3ed","resolution":{"observed_at":"2026-08-07T00:23:02.465031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:01.237600Z","title":"Orbit: A unified simulation framework for interactive robot learning environ- ments","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-17T14:38:20.575544Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:01.237600Z"},"links":{"citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:15c125b2c9407d00e67895aa2494c845b1bf7db3d6503185664b6f0c75a9fc42","observation_id":"d45a9c07-9fde-4449-b71f-79f99530b241","resolution":{"observed_at":"2026-08-07T00:23:01.237600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20164","last_updated":"2024-07-29T16:49:30Z","snapshot_observed_at":"2026-08-16T13:30:09.368057Z","submitted_at":"2024-07-29T16:49:30Z","title":"Language-Conditioned Offline RL for Multi-Robot Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.20164","snapshot_observed_at":"2026-08-07T00:23:01.301764Z","title":"Language-conditioned offline rl for multi-robot navigation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-17T14:38:20.575544Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:01.301764Z"},"links":{"cited_paper":"/paper/2407.20164","citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:a48e468fa6e8f36a597166f5242ea35c4163ea24c658fc1e421115e589ef31e6","observation_id":"c28bb70d-a4d7-4b7d-93d9-cfd44f9e2958","resolution":{"observed_at":"2026-08-07T00:23:01.301764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:02.440235Z","title":"R3m: A uni- versal visual representation for robot manipulation,","venue":null,"work_id":"4719ee93-636f-47dd-ae85-10f0878ba6e9","year":null},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-17T14:38:20.575544Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:01.359403Z"},"links":{"citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:77c7e89a7ee0359dd048aa35e38a57490cb7db9a37efc8dac03d455a208ce0ad","observation_id":"173f7ab1-8664-42c0-a57b-22d6abed694e","resolution":{"observed_at":"2026-08-07T00:23:02.446687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17727","last_updated":"2024-09-26T10:56:35Z","snapshot_observed_at":"2026-08-16T18:14:25.603007Z","submitted_at":"2024-09-26T10:56:35Z","title":"Robotic-CLIP: Fine-tuning CLIP on Action Data for Robotic Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17727","snapshot_observed_at":"2026-08-07T00:23:01.486633Z","title":"Ta, Baoru Huang, Thieu V o, Ngan Le, and Anh Nguyen","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-17T14:38:20.575544Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:01.486633Z"},"links":{"cited_paper":"/paper/2409.17727","citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:e9a7a4de3ad057840f56359e8edfda79b964dcb22dab9fb04aba4fccae755cff","observation_id":"9032cfc7-51d1-4bf7-b85a-1c46bfcda798","resolution":{"observed_at":"2026-08-07T00:23:01.486633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:02.419205Z","title":"Isaac sim","venue":null,"work_id":"3911152a-82b1-404d-83b1-9f877d6d8307","year":2022},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-17T14:38:20.575544Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:01.494307Z"},"links":{"citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:0215184d43c2cc1241b73c4bb6c8f22e2bca146a1c7fc82f645f0c06c67e36df","observation_id":"4dc5ed25-58df-4883-b710-8c2e4851e655","resolution":{"observed_at":"2026-08-07T00:23:02.425411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-07T00:23:01.525716Z","title":"Learning transferable visual models from natural language supervision, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-17T14:38:20.575544Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:01.525716Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:526a2569d2e0ae846bed25e15d923f84218d8313c0f104c4999102d164a58d1c","observation_id":"30a9500b-81ca-4169-880a-acde40926f46","resolution":{"observed_at":"2026-08-07T00:23:01.525716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.08959","last_updated":"2022-09-19T12:27:15Z","snapshot_observed_at":"2026-08-16T16:31:31.875880Z","submitted_at":"2022-09-19T12:27:15Z","title":"Latent Plans for Task-Agnostic Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2209.08959","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.08959","snapshot_observed_at":"2026-08-07T00:23:02.116693Z","title":"Latent Plans for Task-Agnostic Offline Reinforcement Learning","venue":"cs.RO","work_id":"17d10f5b-eb47-443b-a886-db54174ebc51","year":2022},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-17T14:38:20.575544Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:01.592832Z"},"links":{"cited_paper":"/paper/2209.08959","citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:8f96cc34b8686e7037e77852dab74a197febc4b85a4814cd7f1d6a2628282a35","observation_id":"c66757b3-508a-4717-aa66-2dc5e06524df","resolution":{"observed_at":"2026-08-07T00:23:02.127836Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T00:23:01.655232Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-17T14:38:20.575544Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:01.655232Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:c8119e4471253266a31921e403819a8d454b985d65c584054b3c323a2a031bc4","observation_id":"3f7cb8c2-75c1-4d4f-921f-d2a1ed275cf4","resolution":{"observed_at":"2026-08-07T00:23:01.655232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:02.399348Z","title":"Vlm-social-nav: Socially aware robot navigation through scoring using vision-language models, 2024","venue":null,"work_id":"df0063ec-59d4-4607-8e24-7ca04b05d17c","year":2024},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-17T14:38:20.575544Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:01.734952Z"},"links":{"citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:2763092b25eae2cf226109b1b802622cdda498a653efcfc86fd911ffa165fd1e","observation_id":"3fa81a0a-5c6a-4212-8c6e-6968a2ccc98d","resolution":{"observed_at":"2026-08-07T00:23:02.404975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-08-16T15:51:32.614520Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-07T00:23:01.797762Z","title":"Open- world object manipulation using pre-trained vision- language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-17T14:38:20.575544Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:01.797762Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:05ae6280ea864bd6adafd07edd7f8de0b68d3f8f569718b5607e7c8d17a423a7","observation_id":"775a35c4-692f-4f85-976b-691f70366aa1","resolution":{"observed_at":"2026-08-07T00:23:01.797762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15343","last_updated":"2023-09-27T12:05:41Z","snapshot_observed_at":"2026-07-06T15:08:30.190912Z","submitted_at":"2023-03-27T15:53:01Z","title":"Sigmoid Loss for Language Image Pre-Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15343","snapshot_observed_at":"2026-08-07T00:23:01.862440Z","title":"Sigmoid loss for language image pre-training, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-17T14:38:20.575544Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:01.862440Z"},"links":{"cited_paper":"/paper/2303.15343","citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:d0128b0ee099920e25bcc1a0e3043ea6362de1d6d9f6c7ace715b7e325bce3c4","observation_id":"c50d8b92-015b-4c1a-8568-5378e6677997","resolution":{"observed_at":"2026-08-07T00:23:01.862440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:02.379535Z","title":"RT-2: Vision- language-action models transfer web knowledge to robotic control","venue":null,"work_id":"2315260b-fa87-4610-ba48-6eb6cc1cfcae","year":2023},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-17T14:38:20.575544Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:01.919344Z"},"links":{"citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:f0e48d4a40910cf2f3079ab41f4603b05a5314db96e45cfbf9ced6410eebbc16","observation_id":"8e4c8fb4-92e4-4e61-b02a-a8b3e0cf5ee3","resolution":{"observed_at":"2026-08-07T00:23:02.385497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12601","last_updated":"2022-11-18T05:57:09Z","snapshot_observed_at":"2026-08-11T08:36:53.636356Z","submitted_at":"2022-03-23T17:55:09Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12601","snapshot_observed_at":"2026-08-07T00:23:01.438793Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-17T14:38:20.575544Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:01.438793Z"},"links":{"cited_paper":"/paper/2203.12601","citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:eb16b69cf234a6c6b1283ba945eac3c2e52562110662ec2d17a5aa67265d0c65","observation_id":"41596763-d6ca-4f0a-ad20-f00e05c1f39b","resolution":{"observed_at":"2026-08-07T00:23:01.438793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13035","last_updated":"2024-01-09T10:43:02Z","snapshot_observed_at":"2026-08-16T15:31:05.745618Z","submitted_at":"2023-05-22T13:39:28Z","title":"Getting ViT in Shape: Scaling Laws for Compute-Optimal Model Design","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13035","snapshot_observed_at":"2026-08-07T00:23:00.522629Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-17T14:38:20.575544Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:00.522629Z"},"links":{"cited_paper":"/paper/2305.13035","citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:58dce336d383a9b565add0ee69ae6d5100a8f9116e47bad8dae6e50817c48a85","observation_id":"b7bdfaf7-9860-469c-845b-9238aa34cd6f","resolution":{"observed_at":"2026-08-07T00:23:00.522629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-17T14:38:20.575544Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":1,"verified_fuzzy":9},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 2 inbound Pith citation observations for arXiv:2506.14507."}