{"as_of":"2026-08-15T21:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0ad8117fd3e29e533dd10441c7ec3c327bf894a716caa758ebc10aaa9ad92a7c","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:33:40.117731Z","state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06729/citation-record","integrity":"/paper/2608.06729/integrity","json":"/paper/2608.06729/citation-record.json","paper":"/paper/2608.06729"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-15T14:33:38.148006Z","title":"arXiv preprint arXiv:2407.07726 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:38.148006Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:ce144e5987363b0e9d0f7d8f8cfe79701cd8fa7c84c2b0e588b2acb7d1d0ce7c","observation_id":"ae7e2e93-53ed-489e-8bf6-92381f8214a2","resolution":{"observed_at":"2026-08-15T14:33:38.148006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-08-15T09:35:08.116329Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-15T14:33:38.153666Z","title":"arXiv preprint arXiv:2502.19645 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:38.153666Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:be751bc6b95626ce4a1c211b5b7d73be25eb875527004544bf624c9b19463f24","observation_id":"1763a70b-8f94-4838-aea3-9f4acd2bf58d","resolution":{"observed_at":"2026-08-15T14:33:38.153666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:38.158941Z","title":"IEEE Robotics and Automation Letters , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:38.158941Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:eee86c53a4fcab39a82ea810fb972405baf872ce70502c92d17b5da17a7c19e3","observation_id":"d0729d75-683b-4540-9d75-9442a5284b0f","resolution":{"observed_at":"2026-08-15T14:33:38.158941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-08-15T14:33:38.183731Z","title":"arXiv preprint arXiv:2412.14058 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:38.183731Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:56e0d9f18ead7f85e56b53d19ee13bffbc725222fac7fd6e6cc1d99c5379357b","observation_id":"7c7b2dd4-08cb-4a5a-bfa4-2e82a53d2a33","resolution":{"observed_at":"2026-08-15T14:33:38.183731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10631","last_updated":"2025-06-23T07:37:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-13T17:59:52Z","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10631","snapshot_observed_at":"2026-08-15T14:33:38.268148Z","title":"arXiv preprint arXiv:2503.10631 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:38.268148Z"},"links":{"cited_paper":"/paper/2503.10631","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:84027e12557fecd73d60457e8c88cd10a34ef70df818117ea56ff5d5a921f1c8","observation_id":"ea6c5f2f-8764-428a-a367-1c6c15cd2cb9","resolution":{"observed_at":"2026-08-15T14:33:38.268148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:38.283509Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:38.283509Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:9ce5a6bc3c8e33ad0087699dfecbe3ce1ad23cfbad106ff121b2a7f906a1d793","observation_id":"0cfc02c2-dbc6-46fb-9324-08180790e94d","resolution":{"observed_at":"2026-08-15T14:33:38.283509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-15T14:33:38.289124Z","title":"arXiv preprint arXiv:2410.07864 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:38.289124Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:3ef5b9f5ac9b8aaaa74ae5035b79d40fe611979e03407dd9ef7be557ee9633ca","observation_id":"efaa64dd-ad82-4936-bd72-302bd4c7eb17","resolution":{"observed_at":"2026-08-15T14:33:38.289124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-15T04:55:15.159462Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-15T14:33:38.293367Z","title":"arXiv preprint arXiv:2406.09246 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:38.293367Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:af247dfa5d1086f4cea657a4a2c04a20b0dcf87d90c40605396db99c5df6455e","observation_id":"ca3c8834-8946-4a8f-87ad-cadb67b3be5c","resolution":{"observed_at":"2026-08-15T14:33:38.293367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:38.297762Z","title":"Conference on Robot Learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:38.297762Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:763af5cd0413951f9b812523b2572e929aa6b37ce6f2815b6df206a4353db63f","observation_id":"a159239b-43ff-4994-88b1-4d2cf859d8aa","resolution":{"observed_at":"2026-08-15T14:33:38.297762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-15T14:33:38.381582Z","title":"arXiv preprint arXiv:2212.06817 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:38.381582Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:b2bd808b9da95039e98e221cc82d9e95b03a5b7e6eaacced31b395a0d52a77e9","observation_id":"91dea7aa-eeec-4f30-98dc-51c2f9f7398f","resolution":{"observed_at":"2026-08-15T14:33:38.381582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01823","last_updated":"2024-06-01T01:54:54Z","snapshot_observed_at":"2026-08-15T10:07:25.118684Z","submitted_at":"2024-03-04T08:16:11Z","title":"RT-H: Action Hierarchies Using Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01823","snapshot_observed_at":"2026-08-15T14:33:38.488119Z","title":"arXiv preprint arXiv:2403.01823 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:38.488119Z"},"links":{"cited_paper":"/paper/2403.01823","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:9343d4a7202dcc25160ab349a6d07c374085589c8921090833eed8c2dec27f4b","observation_id":"f9e79d84-e7ae-474c-a7ec-c7e8ea9ee1c9","resolution":{"observed_at":"2026-08-15T14:33:38.488119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T14:33:38.492031Z","title":"arXiv 2023 , author=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:38.492031Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:1bcf1956dc9bbe724ea6217b27f756e0e15a831e9f476112505b8e050e206d36","observation_id":"353f80cf-62d5-4ade-8b96-1a9c810582fa","resolution":{"observed_at":"2026-08-15T14:33:38.492031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:38.497050Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:38.497050Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:51dfa832267dc852afcf74e43df8d040794d76e5a939f38a2965f9c8474b1934","observation_id":"8cc9df09-01a3-4ae3-ac50-3f0d41b3d231","resolution":{"observed_at":"2026-08-15T14:33:38.497050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:38.501329Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:38.501329Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:c452b680ae0ba14e47acbc36b55f7c59d14667badd3b08b148e0dfe034d87efe","observation_id":"8a0c119c-abc1-4766-bacc-09239d225052","resolution":{"observed_at":"2026-08-15T14:33:38.501329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:38.505225Z","title":"2023 , journal =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:38.505225Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:d1589150f0380a08b9da2733858daf8756ca67a268bdcbd9f4208b2c0b5dd000","observation_id":"4d22abc2-52d9-4713-8225-26bfc05b6e51","resolution":{"observed_at":"2026-08-15T14:33:38.505225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:38.619247Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:38.619247Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:22cc9fe78d16c19adc80e79d99146f89515df98c36edeaa9c6687f080e3494ca","observation_id":"99f222f3-f23f-475d-a98b-c0c742f15921","resolution":{"observed_at":"2026-08-15T14:33:38.619247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:41.420073Z","title":null,"venue":null,"work_id":"23fee15d-e09e-4aa1-884c-4d8609cf4c8c","year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:38.683398Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:5bc064ea008f5a306978d97d275269d754e80f3fbfbe22d2f21e4138b719c3a6","observation_id":"8408abc6-ef5b-44b8-a463-a4cd5cf473bc","resolution":{"observed_at":"2026-08-15T14:33:41.423444Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:41.409505Z","title":"Computer Vision -","venue":null,"work_id":"addfefe7-805c-42e6-aec0-759142843799","year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:38.686536Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:642aaf4ebda82842842020b166ae0efbf36a296b8f102d395bc29229eaddc929","observation_id":"418df141-abb1-4f02-91a3-f3b5585fedc6","resolution":{"observed_at":"2026-08-15T14:33:41.413259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-15T14:33:38.691558Z","title":"arXiv preprint arXiv:2501.15830 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:38.691558Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:d4b07e2238ecf1f81a2d20119b45a5bfa6da2ffbba6b013e57c6c60b2f41b90c","observation_id":"025c6806-f067-4b91-8594-41212a13192a","resolution":{"observed_at":"2026-08-15T14:33:38.691558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-08-15T14:33:38.696655Z","title":"arXiv preprint arXiv:2508.09071 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:38.696655Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:b7aa9fa65976e55798ebea39c0f643895c99e4d3d7b442f6c489d477739feaad","observation_id":"684f71ff-c72e-4af1-9211-ad0792094b98","resolution":{"observed_at":"2026-08-15T14:33:38.696655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:38.700126Z","title":"IEEE Robotics and Automation Letters , volume=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:38.700126Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:ca570110a49f8ba24b0e6f02a8039c96fe25319cfe03236429c3dd31e9f2684d","observation_id":"2c0dd2ac-bf53-4dcb-afb7-27fb5a82e3bc","resolution":{"observed_at":"2026-08-15T14:33:38.700126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:38.794118Z","title":"arXiv preprint arXiv:2506.07961 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:38.794118Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:42a2ec4a8fb73f8da4ae5ba76eb06f1ca9f811b87cafb2e5ba887b70d4bd4c46","observation_id":"a2e0bae6-d0d5-4e6e-8386-f08a305fa272","resolution":{"observed_at":"2026-08-15T14:33:38.794118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:38.870725Z","title":"arXiv preprint arXiv:2506.22242 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:38.870725Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:46482c181644c85acc077308f8a4421676cecaf0d5059be9cdc55aa033714f24","observation_id":"3bed30ce-dd15-4cf7-9159-d8450e8655fc","resolution":{"observed_at":"2026-08-15T14:33:38.870725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:38.875114Z","title":"arXiv preprint arXiv:2510.17439 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:38.875114Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:41d1648c60c409295c506ca16b655d7541d2886663658011b05866fd97fe6564","observation_id":"ffa41d8a-b812-453b-b475-eec3757968b8","resolution":{"observed_at":"2026-08-15T14:33:38.875114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-13T15:09:51.205767Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-15T14:33:38.878597Z","title":"arXiv preprint arXiv:2403.09631 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:38.878597Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:7d850b463e436d493c3440179087431e15938a28197a4e93ac5833f64a07309a","observation_id":"e9beff1d-e16c-4b87-acc8-b52f80ebefbe","resolution":{"observed_at":"2026-08-15T14:33:38.878597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:38.882575Z","title":"arXiv preprint arXiv:2507.00416 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:38.882575Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:9a5645ee4cfcbd34d23f3b8abfe46d31c8eb6b69868c860f11496fdbf58f8d61","observation_id":"8a05c435-c8a2-49b0-93f9-5a3ec9b93b0a","resolution":{"observed_at":"2026-08-15T14:33:38.882575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03553","last_updated":"2024-09-27T08:16:28Z","snapshot_observed_at":"2026-08-13T05:12:36.538689Z","submitted_at":"2024-05-06T15:20:30Z","title":"AlphaMath Almost Zero: Process Supervision without Process","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03553","snapshot_observed_at":"2026-08-15T14:33:38.971255Z","title":"URL https://arxiv","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:38.971255Z"},"links":{"cited_paper":"/paper/2405.03553","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:0b776a36954d83b4bf45fb492f0e6f2887b500644f95f24d0322480243756a51","observation_id":"801b711f-8a16-467e-b694-942cdcf552df","resolution":{"observed_at":"2026-08-15T14:33:38.971255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:38.975423Z","title":"Findings of the Association for Computational Linguistics: ACL 2025 , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:38.975423Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:f2c06af48a063e6998bbc214df2ea93f2b6b1953373bba15b1bc17bae338bcdf","observation_id":"974d7a01-3d29-4984-aff4-c142f277c92a","resolution":{"observed_at":"2026-08-15T14:33:38.975423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-15T14:33:38.979347Z","title":"arXiv preprint arXiv:2203.11171 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:38.979347Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:f73bd6816f1acf13ef24cf5075b7efb4aac28c8cf5d90190ccd8007f6536e6e5","observation_id":"7f19ee55-8d2b-410b-bf90-83d05d1f441c","resolution":{"observed_at":"2026-08-15T14:33:38.979347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:41.385201Z","title":"Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":"60907ff8-333a-4d13-9a09-7de5550d9040","year":2024},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:38.983031Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:f60faf5dbb554dce48b5191562eab4905f8a3b45f5a408a1ca83ca9f7a8c7efa","observation_id":"6e95a505-16e4-4cda-bfd2-331d85b41f05","resolution":{"observed_at":"2026-08-15T14:33:41.389106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-08-14T10:00:52.343929Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-15T14:33:39.033472Z","title":"arXiv preprint arXiv:2407.21787 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.033472Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:3730d4c8d9ce00c3c2b57b3dd943f1c03868d151827d482f22a6ad7481a9d574","observation_id":"921a7363-0122-470c-b298-c0b43d6364cd","resolution":{"observed_at":"2026-08-15T14:33:39.033472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13816","last_updated":"2025-02-24T21:05:58Z","snapshot_observed_at":"2026-08-12T22:20:41.524137Z","submitted_at":"2024-10-17T17:46:26Z","title":"Steering Your Generalists: Improving Robotic Foundation Models via Value Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13816","snapshot_observed_at":"2026-08-15T14:33:39.091894Z","title":"arXiv preprint arXiv:2410.13816 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.091894Z"},"links":{"cited_paper":"/paper/2410.13816","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:6c6ee542b27d763c45403d0457d62d7b7be8921ab4ff94d46fa36c82e1870a9d","observation_id":"1bcaec27-b361-476f-b672-df4542556946","resolution":{"observed_at":"2026-08-15T14:33:39.091894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17811","snapshot_observed_at":"2026-08-15T14:33:39.096472Z","title":"arXiv preprint arXiv:2506.17811 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.096472Z"},"links":{"cited_paper":"/paper/2506.17811","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:8049d5ca3dc0e7c83ee83a8b250c21a763c58e1faed976bb81341b8c523de213","observation_id":"dd585a45-c7b8-4582-8fed-cfd5017f5521","resolution":{"observed_at":"2026-08-15T14:33:39.096472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.05681","last_updated":"2026-07-04T15:45:15Z","snapshot_observed_at":"2026-08-04T11:20:10.610981Z","submitted_at":"2025-10-07T08:38:08Z","title":"Verifier-free Test-Time Sampling for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.05681","snapshot_observed_at":"2026-08-15T14:33:39.100502Z","title":"arXiv preprint arXiv:2510.05681 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.100502Z"},"links":{"cited_paper":"/paper/2510.05681","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:81152099fcde7181a147a37ff5482b7dfc31db1a96be5774e1b9fcb0479f1f08","observation_id":"6fcb863b-8d34-49f3-bdb6-5348083076a1","resolution":{"observed_at":"2026-08-15T14:33:39.100502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:39.104348Z","title":"arXiv preprint arXiv:2510.10975 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.104348Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:a75601785113ba18eb2ed640318a6cc6e5f88f3816ece5521dbe6dabd5888195","observation_id":"28bfe46d-e9f3-482b-9162-6da73869dcc0","resolution":{"observed_at":"2026-08-15T14:33:39.104348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:39.160032Z","title":"arXiv preprint arXiv:2601.00675 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.160032Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:dc2a4664f9e5590f9151981c70e959b3f7f3449d68e39d376a270ef198728587","observation_id":"24dccad6-a362-4f62-9ccb-e2b96c7d4114","resolution":{"observed_at":"2026-08-15T14:33:39.160032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-15T14:33:39.203775Z","title":"arXiv preprint arXiv:2403.12945 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.203775Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:4a6746648aebe7d7cee0e973fdd1c1a5c07851afca4cc550506240a4de4436b2","observation_id":"b008e761-fc45-4e5e-b572-177f675dd105","resolution":{"observed_at":"2026-08-15T14:33:39.203775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:39.209322Z","title":"Conference on Robot Learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.209322Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:35cece832f21f6d13b112645d31bfdf960a34998dfa8875d831c51fc59192a34","observation_id":"0111b435-3b3b-44a4-88d2-9353815a56a2","resolution":{"observed_at":"2026-08-15T14:33:39.209322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13877","last_updated":"2025-05-27T01:46:53Z","snapshot_observed_at":"2026-08-15T09:21:12.808847Z","submitted_at":"2024-12-18T14:17:16Z","title":"RoboMIND: Benchmark on Multi-embodiment Intelligence Normative Data for Robot Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13877","snapshot_observed_at":"2026-08-15T14:33:39.212850Z","title":"arXiv preprint arXiv:2412.13877 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.212850Z"},"links":{"cited_paper":"/paper/2412.13877","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:e207b52019f5527c5522f400d3036b91feacb80e99e2bab82ecd8da35bb75eb9","observation_id":"87c4d7ed-efee-4e1d-9445-c5caa928a19d","resolution":{"observed_at":"2026-08-15T14:33:39.212850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:39.262864Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.262864Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:c115b63ac0bbc647d7d5e3e948d056defe4b757bbaece01ed5c3922936f25f5e","observation_id":"80dd6fb4-2975-4007-b080-c3fba28930fb","resolution":{"observed_at":"2026-08-15T14:33:39.262864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-15T14:33:39.287949Z","title":"arXiv preprint arXiv:2410.24164 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.287949Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:cdd793a6fb583f2597abea028ee193595449163f8c312efe68b97198cc5f8e40","observation_id":"ec6d4e48-53ec-4841-b49e-765388534aab","resolution":{"observed_at":"2026-08-15T14:33:39.287949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-15T14:33:39.292896Z","title":"arXiv preprint arXiv:2504.16054 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.292896Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:affd518b066d112fa03b160b165d1b3ccc84cfa0a79263185ccae73c5c00e97b","observation_id":"bc59b65e-895c-4e78-b10c-449d389761e1","resolution":{"observed_at":"2026-08-15T14:33:39.292896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:39.297696Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.297696Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:c5c26ef68cb8980c0d2ad75e08d99ff37ad35e1672216e41ccf97d4dbff18365","observation_id":"ffea7ef0-1caf-4aaa-a27e-7decbd33ab69","resolution":{"observed_at":"2026-08-15T14:33:39.297696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:39.301691Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.301691Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:202884315dee839d83a62407cd3f07e394e72636b750c0e5c28153bd3cee518b","observation_id":"23d72755-8f67-4d36-bd1b-4d2bfaa0ebd8","resolution":{"observed_at":"2026-08-15T14:33:39.301691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:39.353990Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.353990Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:292028e4a96d39f4f6c840d15f4a9eb24bc5dbb30c23c5ddbad78d068d951c7a","observation_id":"01f7e032-03b0-4ca9-9032-83978cc94e92","resolution":{"observed_at":"2026-08-15T14:33:39.353990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:39.358576Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.358576Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:f2c9b5680aee512b229190ff7f61fd4b2b8aaa1ccdc80fbc73b49da69835f30b","observation_id":"6cb7f7ad-b15e-40c1-8bf0-485001dbee02","resolution":{"observed_at":"2026-08-15T14:33:39.358576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12288","last_updated":"2023-02-23T19:13:10Z","snapshot_observed_at":"2026-07-06T14:55:15.719380Z","submitted_at":"2023-02-23T19:13:10Z","title":"ZoeDepth: Zero-shot Transfer by Combining Relative and Metric Depth","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12288","snapshot_observed_at":"2026-08-15T14:33:39.362769Z","title":"arXiv preprint arXiv:2302.12288 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.362769Z"},"links":{"cited_paper":"/paper/2302.12288","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:582ebf0d22be1cc5889139638367b03ce50761455c8dde88322c502060a75d53","observation_id":"b4ffd6d4-740b-4a24-8bbf-a2c81d120ec7","resolution":{"observed_at":"2026-08-15T14:33:39.362769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03480","last_updated":"2026-04-19T06:23:17Z","snapshot_observed_at":"2026-07-30T14:07:10.544745Z","submitted_at":"2025-03-05T13:16:55Z","title":"SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03480","snapshot_observed_at":"2026-08-15T14:33:39.367292Z","title":"arXiv preprint arXiv:2503.03480 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.367292Z"},"links":{"cited_paper":"/paper/2503.03480","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:8a51157159b72cf103b4510aeca8000ac8483d67b862a799bd75972ec4cf1d39","observation_id":"62f9fa2f-2332-47c7-b234-eb9ccb9992b9","resolution":{"observed_at":"2026-08-15T14:33:39.367292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05941","last_updated":"2024-05-09T17:30:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-09T17:30:16Z","title":"Evaluating Real-World Robot Manipulation Policies in Simulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05941","snapshot_observed_at":"2026-08-15T14:33:39.371997Z","title":"arXiv preprint arXiv:2405.05941 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.371997Z"},"links":{"cited_paper":"/paper/2405.05941","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:a5b9808f34b5f644a8a66d6a20fe72351b06adf0105fce68894774ac3e4ed8f6","observation_id":"8c311ac6-cc58-4af1-b442-d92bed8e7ea4","resolution":{"observed_at":"2026-08-15T14:33:39.371997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04447","last_updated":"2025-08-26T08:23:50Z","snapshot_observed_at":"2026-08-05T16:56:52.400110Z","submitted_at":"2025-07-06T16:14:29Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04447","snapshot_observed_at":"2026-08-15T14:33:39.375454Z","title":"arXiv preprint arXiv:2507.04447 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.375454Z"},"links":{"cited_paper":"/paper/2507.04447","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:3d4fdd2562a8b6ee96276e88ee090de567fba1f2cb58e83c31773d692719bb8d","observation_id":"5b344481-fde6-48e3-b820-939cd989bafd","resolution":{"observed_at":"2026-08-15T14:33:39.375454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:39.379418Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.379418Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:01af5641cdf54bfbdb370afaae653395a24d2628b8c3418090c32d9773affed3","observation_id":"686c96fe-47bf-4e27-b40e-8108637e46a7","resolution":{"observed_at":"2026-08-15T14:33:39.379418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:39.392414Z","title":"Proceedings of the IEEE/CVF international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.392414Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:7cc84c6bdf443cff8b8aa344b014b1fd0c361e8705cc8f05d7822ae38e5f45b5","observation_id":"b6ddcaa8-62ba-48f8-aa9e-2e228d718057","resolution":{"observed_at":"2026-08-15T14:33:39.392414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:39.473885Z","title":", author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.473885Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:5b7fc07d2a661802e633ec9ca201670bc15b1b0ecbe8e11026e0e66820d699b8","observation_id":"60ca2448-e9bd-4003-ae0f-6ce16ba6df92","resolution":{"observed_at":"2026-08-15T14:33:39.473885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-08-14T08:22:11.295012Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-15T14:33:39.537822Z","title":"arXiv preprint arXiv:2405.12213 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.537822Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:69403a96ad01c831b508598f68387daa8afae61491682a0a4d410784567e03fc","observation_id":"f1c1451d-d63e-46f4-b1f5-b44bd5a73354","resolution":{"observed_at":"2026-08-15T14:33:39.537822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19236","last_updated":"2026-01-30T13:36:22Z","snapshot_observed_at":"2026-07-06T22:19:00.152099Z","submitted_at":"2025-08-26T17:57:16Z","title":"MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19236","snapshot_observed_at":"2026-08-15T14:33:39.561942Z","title":"arXiv preprint arXiv:2508.19236 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.561942Z"},"links":{"cited_paper":"/paper/2508.19236","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:76ae5bcdafb7defe044f61603c979a1feb85f7e78942e0e214f3adfcdb9d7012","observation_id":"0a34adf9-9825-40be-a7b7-a21df0bfa7c2","resolution":{"observed_at":"2026-08-15T14:33:39.561942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:39.566446Z","title":"2024 IEEE International Conference on Robotics and Automation (ICRA) , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.566446Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:0058b19ac6b904d53ab96334eb89c6cc27cf93ed4b7e666681169789c057dbab","observation_id":"4da556c2-42cf-425a-b1a7-af0af792fa5f","resolution":{"observed_at":"2026-08-15T14:33:39.566446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:41.306944Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":"73c07ca1-9030-4f06-85f4-c44d7c5512e1","year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.570305Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:0c53b1efa5392e67a87b93f77b4e120a6e9fbeb1e188046c4c599ed7f8f566e6","observation_id":"f762a73a-42df-4efb-b706-eb386f54e39d","resolution":{"observed_at":"2026-08-15T14:33:41.311095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-15T14:33:39.573805Z","title":"arXiv preprint arXiv:2307.09288 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.573805Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:3c9742724cff4bea01e271d634dc77a3f912e863d2b25d3b8284e08a592f3a96","observation_id":"abbfdb0f-96c0-4d4e-9908-ca777fba6274","resolution":{"observed_at":"2026-08-15T14:33:39.573805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:39.578402Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.578402Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:e6fb8280e88a98cf7537e5fd94c6bce91fb9d91ec2ce09b7b577c6cb9d70edcc","observation_id":"3de06352-e39b-44b0-92c2-f68f8bc7ddab","resolution":{"observed_at":"2026-08-15T14:33:39.578402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:39.634116Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.634116Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:5832439640a365ab8454dcca413932f1324569131efd3b1916db7308bf5c7d60","observation_id":"b334f3a3-4c84-4115-bc12-0c502d664b1e","resolution":{"observed_at":"2026-08-15T14:33:39.634116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:39.728583Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.728583Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:7ac6636713f940e82aaf6b8d21de22b6cecf3e0e9f60e0b1b48e989c1daa828e","observation_id":"9f3f74d0-5ab8-4336-87b5-c1b280691917","resolution":{"observed_at":"2026-08-15T14:33:39.728583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:41.276915Z","title":"9th Annual Conference on Robot Learning , year=","venue":null,"work_id":"bbcd7957-333f-44f2-9153-d87783360753","year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.732138Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:465d1c43554c5e8552ee2b1fd596018ce15f3455abee34c9be9f589a1a0c156c","observation_id":"bcad87bf-fb90-4a15-a5fc-3386623c3a3e","resolution":{"observed_at":"2026-08-15T14:33:41.280516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.10647","last_updated":"2025-11-13T18:59:53Z","snapshot_observed_at":"2026-07-06T22:35:46.018050Z","submitted_at":"2025-11-13T18:59:53Z","title":"Depth Anything 3: Recovering the Visual Space from Any Views","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.10647","snapshot_observed_at":"2026-08-15T14:33:39.735865Z","title":"arXiv preprint arXiv:2511.10647 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.735865Z"},"links":{"cited_paper":"/paper/2511.10647","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:3f9f8a033536cd66e59eddfc90c8d66e26093d3e9cb235e2c94fcc1fb70e08b1","observation_id":"9e5e6f1f-6f55-43a1-aec8-30ede2ab26a8","resolution":{"observed_at":"2026-08-15T14:33:39.735865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-15T14:33:39.739135Z","title":"arXiv preprint arXiv:2010.11929 , year=","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.739135Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:932b5afa9574b18043e07d42d8cf8a2e648a5ac0c96116ace4ddd73b4ee6fd0d","observation_id":"0c33db0d-3f55-4324-83ce-01cc86ad7d2f","resolution":{"observed_at":"2026-08-15T14:33:39.739135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:41.266775Z","title":"IEEE Robotics and Automation Letters , volume=","venue":null,"work_id":"3a1937f1-bcba-4db8-8071-d0f684a0e416","year":2022},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.744353Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:d67487237925d0e1141d1fc5f81d66ed24acf60913cf1a1e9bf2150a630a11ab","observation_id":"10296197-c141-4541-a43b-bd0dfb0f63f6","resolution":{"observed_at":"2026-08-15T14:33:41.270224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:39.748139Z","title":"arXiv preprint arXiv:2603.12942 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.748139Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:2e5951b1798d720307e3a4279c55609573d5441dc6b9f0f36834b8f187101d80","observation_id":"b3c62d0e-f7be-4c67-9049-a55541de67a0","resolution":{"observed_at":"2026-08-15T14:33:39.748139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:39.751081Z","title":"arXiv preprint arXiv:2511.09516 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.751081Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:141ee38f9c112d29551c9867d1d813be5454c5715a342b3ab86fae7f4f96c2be","observation_id":"217fca06-6500-4992-a60c-3739e205c05c","resolution":{"observed_at":"2026-08-15T14:33:39.751081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.22283","last_updated":"2026-05-21T10:32:53Z","snapshot_observed_at":"2026-08-13T05:57:26.213139Z","submitted_at":"2026-05-21T10:32:53Z","title":"Spatial Memory for Out-of-Vision Manipulation in Vision-Language-Action","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.22283","snapshot_observed_at":"2026-08-15T14:33:39.754892Z","title":"arXiv preprint arXiv:2605.22283 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.754892Z"},"links":{"cited_paper":"/paper/2605.22283","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:362ed3d5dd7b6bc62783ac7c8b995a68a7fff5f97ba09403ae744b8f7be2becf","observation_id":"e3608715-e71f-4952-9ffe-bc43eae14b7b","resolution":{"observed_at":"2026-08-15T14:33:39.754892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-04T23:08:22.516431Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06669","snapshot_observed_at":"2026-08-15T14:33:39.871201Z","title":"arXiv preprint arXiv:2503.06669 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.871201Z"},"links":{"cited_paper":"/paper/2503.06669","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:975d34d603b0e3faf4604e457b400c9add497ffaac0275c06170d2cfb341e24b","observation_id":"e6a6648e-c7a3-4fc3-ba67-1a971de1217d","resolution":{"observed_at":"2026-08-15T14:33:39.871201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-15T14:33:39.959379Z","title":"arXiv preprint arXiv:2411.19650 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.959379Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:423b228c15e148f5d90a9b6d2fb4f68e0e76248b8f55ba9a736aca959c4a27ee","observation_id":"da6697d6-8d2a-4f8a-acd7-b65ac646bc6c","resolution":{"observed_at":"2026-08-15T14:33:39.959379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05855","last_updated":"2025-08-09T10:58:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-09T11:25:56Z","title":"DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05855","snapshot_observed_at":"2026-08-15T14:33:39.964543Z","title":"arXiv preprint arXiv:2502.05855 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.964543Z"},"links":{"cited_paper":"/paper/2502.05855","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:0c55fce4f9ad1e88494766e6072f460d02a5913bbf94d1a302e2b06b267c8462","observation_id":"be4a9eeb-d7cb-430f-b815-adb4031cd6e6","resolution":{"observed_at":"2026-08-15T14:33:39.964543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:39.968623Z","title":"The International Journal of Robotics Research , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.968623Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:f489d8a946a9f87a5529e3a503628f4e3e2d492f54517efe540fe9ce42ca2d1d","observation_id":"b8fa5fcd-f5e0-416d-8c1c-162408133c7e","resolution":{"observed_at":"2026-08-15T14:33:39.968623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:39.972759Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.972759Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:cd1159a52f2f6632213537c50a6cefe0b8dbf967ec0625f6585e452f4c8b257a","observation_id":"50c141b7-f62e-4f38-8685-38709cd06859","resolution":{"observed_at":"2026-08-15T14:33:39.972759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:39.976530Z","title":"arXiv preprint arXiv:2601.17885 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.976530Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:fb74a70fb2e8fd48b4c4f9943973de1a8c54a3030cd291057639b3d181a1d447","observation_id":"70e15055-bb60-4e35-8792-896d4f1fd471","resolution":{"observed_at":"2026-08-15T14:33:39.976530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:39.980491Z","title":"arXiv preprint arXiv:2603.03596 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.980491Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:cb1dee039da81924122e21b8f920509ff8f399dbeb2de2f4d6939184a728d067","observation_id":"cd0a5095-a81e-4042-b2cc-7c11d0bf3421","resolution":{"observed_at":"2026-08-15T14:33:39.980491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:41.241848Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":"a4375ab9-edf2-4786-ab84-6a50ca144a57","year":2023},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.984092Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:681dae77520792965b1a515b57148c37cf1421d81a95a1201ab86113634e5af5","observation_id":"7356e200-f8de-419a-9f72-b57d7124bfe1","resolution":{"observed_at":"2026-08-15T14:33:41.245491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:39.998452Z","title":"2011 10th IEEE international symposium on mixed and augmented reality , pages=","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.998452Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:803f7860df02653a3e7f0242f483020a163c7bc6353a16767b6f2854c89e637f","observation_id":"1a06449e-2bd5-4e54-b807-016c520003fb","resolution":{"observed_at":"2026-08-15T14:33:39.998452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05635","last_updated":"2025-11-04T12:01:01Z","snapshot_observed_at":"2026-08-14T13:55:25.823113Z","submitted_at":"2025-08-07T17:59:44Z","title":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05635","snapshot_observed_at":"2026-08-15T14:33:40.052053Z","title":"arXiv preprint arXiv:2508.05635 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:40.052053Z"},"links":{"cited_paper":"/paper/2508.05635","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:fbd595c26c708eb3126c4c61c9bdc539772949195e4b203cf9b174cffd2dd111","observation_id":"282bb211-58b9-49b5-a321-fc7623c404df","resolution":{"observed_at":"2026-08-15T14:33:40.052053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.17502","last_updated":"2026-05-30T03:49:39Z","snapshot_observed_at":"2026-08-03T20:59:48.866420Z","submitted_at":"2025-11-21T18:59:32Z","title":"RynnVLA-002: A Unified Vision-Language-Action and World Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.17502","snapshot_observed_at":"2026-08-15T14:33:40.086994Z","title":"arXiv preprint arXiv:2511.17502 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:40.086994Z"},"links":{"cited_paper":"/paper/2511.17502","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:a4183eab01a9254c9fe67f9cc1fb654abc880d9e3339ad353b325c045db613be","observation_id":"cbcab0b7-be21-459d-a1dd-d7d2f6d4e54c","resolution":{"observed_at":"2026-08-15T14:33:40.086994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:41.221032Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"e55ba4ce-e881-4b44-a777-061153b9f2ee","year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:40.091060Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:813bb70eea0f50b883a2bde0a4c700d974545b94976e3ec8049faca1b766a357","observation_id":"ba421f0d-dcf6-4f75-bc15-eb4da3008fa7","resolution":{"observed_at":"2026-08-15T14:33:41.226904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:40.094674Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:40.094674Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:d6c2ca63f5d8e92aba951a20615b410369a81f9e6b0c7070a72a66ff36b4f278","observation_id":"d3b3487e-4528-4459-846e-406b4becffbb","resolution":{"observed_at":"2026-08-15T14:33:40.094674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-15T14:33:40.098346Z","title":"arXiv preprint arXiv:2207.12598 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:40.098346Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:f439b43368c53255ee1ad834b258f7a5df949563214f7e3410754dc5e90d15b1","observation_id":"c44050e2-1ab4-4ddd-b3f5-5cad689ec8ce","resolution":{"observed_at":"2026-08-15T14:33:40.098346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:40.102244Z","title":"IEEE Robotics and Automation Letters , volume=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:40.102244Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:12a7ef0d5e651f24460f75356f5a6409f307095e0847ae8303e3814c9d9f57ec","observation_id":"c4c54e4c-464a-488a-93a5-16ccbfcb7628","resolution":{"observed_at":"2026-08-15T14:33:40.102244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.19683","last_updated":"2026-04-22T17:44:56Z","snapshot_observed_at":"2026-08-15T06:57:44.935343Z","submitted_at":"2026-04-21T17:05:37Z","title":"Mask World Model: Predicting What Matters for Robust Robot Policy Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.19683","snapshot_observed_at":"2026-08-15T14:33:40.105970Z","title":"arXiv preprint arXiv:2604.19683 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:40.105970Z"},"links":{"cited_paper":"/paper/2604.19683","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:0138eb6984c4fca62d91a6c966111ebbd29630baf74d4e9a4f252272c1d1864e","observation_id":"623d2989-3534-45f8-b3ce-72f24b64da33","resolution":{"observed_at":"2026-08-15T14:33:40.105970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:40.109759Z","title":"Transactions on Machine Learning Research Journal , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:40.109759Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:291d9bd93efba4d7bc60112bdf86348853ce63836ff7c7d649ab1f0618333520","observation_id":"c8fe6e67-3b19-4e38-9dad-4a20fba9c767","resolution":{"observed_at":"2026-08-15T14:33:40.109759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:40.113681Z","title":"Proceedings of the IEEE/CVF international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:40.113681Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:f1bc2a4ab5d7fbbbb625a1f1fbe733fba160b0f2363848fa5342e468081f1e59","observation_id":"6c3c7702-35ce-4323-8246-6f111d3673ff","resolution":{"observed_at":"2026-08-15T14:33:40.113681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:40.117731Z","title":"Proceedings of the IEEE/CVF international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:40.117731Z"},"links":{"citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:c59ef665586abd18c2480e5fbacb80164b813dfbcfbf4ce4aed1011323614bb3","observation_id":"dd029b01-e1d7-4015-8164-7d463853202e","resolution":{"observed_at":"2026-08-15T14:33:40.117731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":80,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 0 inbound Pith citation observations for arXiv:2608.06729."}