{"as_of":"2026-08-22T17:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5d512e1ff54f181b9aa0c44d636a325770af967d769ac6af3adb1f1c2dab7401","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T11:08:46.212987Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09771/citation-record","integrity":"/paper/2608.09771/integrity","json":"/paper/2608.09771/citation-record.json","paper":"/paper/2608.09771"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.21539","last_updated":"2025-06-26T17:55:40Z","snapshot_observed_at":"2026-08-13T10:05:34.967093Z","submitted_at":"2025-06-26T17:55:40Z","title":"WorldVLA: Towards Autoregressive Action World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21539","snapshot_observed_at":"2026-08-11T11:08:45.747732Z","title":"WorldVLA: Towards autoregressive action world model.arXiv preprint arXiv:2506.21539,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09771","last_updated":"2026-08-10T15:58:39Z","snapshot_observed_at":"2026-08-19T21:45:56.677114Z","submitted_at":"2026-08-10T15:58:39Z","title":"SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T11:08:45.747732Z"},"links":{"cited_paper":"/paper/2506.21539","citing_paper":"/paper/2608.09771"},"observation_digest":"sha256:89a37391ac9eaa123bc4e6822eeb35060f3e8af65884932b4d7388394d6d42ee","observation_id":"83cb2c09-8967-4031-8d35-2babda4c855d","resolution":{"observed_at":"2026-08-11T11:08:45.747732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:08:45.833247Z","title":"LaW AM: Latent world action models for efficient dynamics- aware robot policies.arXiv preprint arXiv:2606.15768,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09771","last_updated":"2026-08-10T15:58:39Z","snapshot_observed_at":"2026-08-19T21:45:56.677114Z","submitted_at":"2026-08-10T15:58:39Z","title":"SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T11:08:45.833247Z"},"links":{"citing_paper":"/paper/2608.09771"},"observation_digest":"sha256:9321b3afa6f73cb4a3fe1377aad6522fbc59b815087f3963aa44b5532a57a2bd","observation_id":"0f3ab69f-682b-4a43-80d0-c2fd6ceefeeb","resolution":{"observed_at":"2026-08-11T11:08:45.833247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-14T18:47:26.721223Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-11T11:08:45.872154Z","title":"PaLM-E: An embodied multi- modal language model.arXiv preprint arXiv:2303.03378,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09771","last_updated":"2026-08-10T15:58:39Z","snapshot_observed_at":"2026-08-19T21:45:56.677114Z","submitted_at":"2026-08-10T15:58:39Z","title":"SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T11:08:45.872154Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2608.09771"},"observation_digest":"sha256:e8b84a6bc375a703343f8152bf24f2d9d0abc5d4cca7f2aadf21010b04ed3750","observation_id":"5c1dfd9f-c37e-43d5-b186-f708a588fda5","resolution":{"observed_at":"2026-08-11T11:08:45.872154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13626","last_updated":"2025-12-26T12:19:56Z","snapshot_observed_at":"2026-08-21T10:57:34.843204Z","submitted_at":"2025-10-15T14:51:36Z","title":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.13626","snapshot_observed_at":"2026-08-11T11:08:45.922224Z","title":"LIBERO-Plus: In-depth robustness analysis of vision-language-action models.arXiv preprint arXiv:2510.13626,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09771","last_updated":"2026-08-10T15:58:39Z","snapshot_observed_at":"2026-08-19T21:45:56.677114Z","submitted_at":"2026-08-10T15:58:39Z","title":"SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T11:08:45.922224Z"},"links":{"cited_paper":"/paper/2510.13626","citing_paper":"/paper/2608.09771"},"observation_digest":"sha256:c66ef6e686b54639679189bdb2f20f69b5c3051313bafeae48ba1828bea9d5ba","observation_id":"ca298d05-24c0-40b8-a0c2-9d854b69b1e6","resolution":{"observed_at":"2026-08-11T11:08:45.922224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19854","last_updated":"2025-04-28T14:47:34Z","snapshot_observed_at":"2026-08-14T03:25:49.528763Z","submitted_at":"2025-04-28T14:47:34Z","title":"NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19854","snapshot_observed_at":"2026-08-11T11:08:45.931972Z","title":"Chia-Yu Hung, Qi Sun, Pengfei Hong, Amir Zadeh, Chuan Li, U-Xuan Tan, Navonil Majumder, and Soujanya Poria","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09771","last_updated":"2026-08-10T15:58:39Z","snapshot_observed_at":"2026-08-19T21:45:56.677114Z","submitted_at":"2026-08-10T15:58:39Z","title":"SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T11:08:45.931972Z"},"links":{"cited_paper":"/paper/2504.19854","citing_paper":"/paper/2608.09771"},"observation_digest":"sha256:aebae8bf59e70ede43d0a56735cf450e81bf7a4d5c2c1e3321cde906bec3d593","observation_id":"765db3dd-c201-41cb-8efb-7c4aeb080a39","resolution":{"observed_at":"2026-08-11T11:08:45.931972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-16T21:53:14.144225Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-11T11:08:45.941219Z","title":"Moo Jin Kim, Chelsea Finn, and Percy Liang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09771","last_updated":"2026-08-10T15:58:39Z","snapshot_observed_at":"2026-08-19T21:45:56.677114Z","submitted_at":"2026-08-10T15:58:39Z","title":"SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T11:08:45.941219Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2608.09771"},"observation_digest":"sha256:b3c35052b43e76325de4775e17f35a67cc851012feb24267efb193b6eafbf4f7","observation_id":"c8615701-0ad2-49e9-8dab-290db302e8cb","resolution":{"observed_at":"2026-08-11T11:08:45.941219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:08:46.668189Z","title":"Yann LeCun","venue":null,"work_id":"945692a6-4422-4910-98ca-a8454cf2cb67","year":2025},"citing_paper":{"arxiv_id":"2608.09771","last_updated":"2026-08-10T15:58:39Z","snapshot_observed_at":"2026-08-19T21:45:56.677114Z","submitted_at":"2026-08-10T15:58:39Z","title":"SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T11:08:45.946352Z"},"links":{"citing_paper":"/paper/2608.09771"},"observation_digest":"sha256:098a00d16a50959c34a9fc83f2da5d8348270c56e73a0428bc772be7e0b61db5","observation_id":"57dcca88-e4dd-4d53-96fb-a67d814b6134","resolution":{"observed_at":"2026-08-11T11:08:46.772331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:08:46.568794Z","title":"Version 0.9.2","venue":null,"work_id":"6704b988-a2ba-49d7-b837-d391c3e6419d","year":1912},"citing_paper":{"arxiv_id":"2608.09771","last_updated":"2026-08-10T15:58:39Z","snapshot_observed_at":"2026-08-19T21:45:56.677114Z","submitted_at":"2026-08-10T15:58:39Z","title":"SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T11:08:45.950866Z"},"links":{"citing_paper":"/paper/2608.09771"},"observation_digest":"sha256:cd07fed3217b6be662049eb98918da354b71998cd8240c1a7a5d64332ffac8cb","observation_id":"1342aa1b-2879-4608-aa91-bbafe3e25cc2","resolution":{"observed_at":"2026-08-11T11:08:46.573656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.14482","last_updated":"2026-06-11T10:07:56Z","snapshot_observed_at":"2026-08-16T02:46:49.800923Z","submitted_at":"2026-03-15T17:02:40Z","title":"V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.14482","snapshot_observed_at":"2026-08-11T11:08:45.959926Z","title":"V-JEPA 2.1: Unlocking dense features in video self-supervised learning.arXiv preprint arXiv:2603.14482,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09771","last_updated":"2026-08-10T15:58:39Z","snapshot_observed_at":"2026-08-19T21:45:56.677114Z","submitted_at":"2026-08-10T15:58:39Z","title":"SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T11:08:45.959926Z"},"links":{"cited_paper":"/paper/2603.14482","citing_paper":"/paper/2608.09771"},"observation_digest":"sha256:5623747bb0387d11ca94ef89e51397e22b8548dbb5d026d2f4f0922955872811","observation_id":"e0cd1a2d-af60-4903-9568-c07e39e9b554","resolution":{"observed_at":"2026-08-11T11:08:45.959926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06388","last_updated":"2026-05-07T15:05:26Z","snapshot_observed_at":"2026-08-12T15:42:05.987893Z","submitted_at":"2026-05-07T15:05:26Z","title":"Reconstruction or Semantics? What Makes a Latent Space Useful for Robotic World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.06388","snapshot_observed_at":"2026-08-11T11:08:45.964568Z","title":"Reconstruction or semantics? what makes a latent space useful for robotic world models.arXiv preprint arXiv:2605.06388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09771","last_updated":"2026-08-10T15:58:39Z","snapshot_observed_at":"2026-08-19T21:45:56.677114Z","submitted_at":"2026-08-10T15:58:39Z","title":"SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T11:08:45.964568Z"},"links":{"cited_paper":"/paper/2605.06388","citing_paper":"/paper/2608.09771"},"observation_digest":"sha256:3407d95270d3d5fcd749955e4ef53d0977651954284ac2017a85dd3dbb63eeb8","observation_id":"71391fcd-e6c3-4f5c-9931-fa5a09f56ace","resolution":{"observed_at":"2026-08-11T11:08:45.964568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-11T11:08:45.969263Z","title":"Octo Model Team, Dibya Ghosh, Homer Walke, Karl Pertsch, Kevin Black, Oier Mees, Sudeep Dasari, Joey Hejna, Tobias Kreiman, Charles Xu, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09771","last_updated":"2026-08-10T15:58:39Z","snapshot_observed_at":"2026-08-19T21:45:56.677114Z","submitted_at":"2026-08-10T15:58:39Z","title":"SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T11:08:45.969263Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2608.09771"},"observation_digest":"sha256:140d2ec50b9633a8faf4fb3f72f50ee67be0c6bf1e00a4d229df933fcf8de894","observation_id":"8688246d-06b4-4f5a-ad86-e9bd14a83cb1","resolution":{"observed_at":"2026-08-11T11:08:45.969263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-13T13:59:48.091257Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-11T11:08:45.974690Z","title":"Open x-embodiment: Robotic learning datasets and RT-X models.arXiv preprint arXiv:2310.08864,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09771","last_updated":"2026-08-10T15:58:39Z","snapshot_observed_at":"2026-08-19T21:45:56.677114Z","submitted_at":"2026-08-10T15:58:39Z","title":"SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T11:08:45.974690Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2608.09771"},"observation_digest":"sha256:fedbe302ddfc4c4b478b1d7f9cf7e5cc47ac8543304e121001c5f4ac32964781","observation_id":"dcad48c1-4510-48aa-aaae-bafad8447487","resolution":{"observed_at":"2026-08-11T11:08:45.974690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-11T11:08:45.979381Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09771","last_updated":"2026-08-10T15:58:39Z","snapshot_observed_at":"2026-08-19T21:45:56.677114Z","submitted_at":"2026-08-10T15:58:39Z","title":"SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T11:08:45.979381Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2608.09771"},"observation_digest":"sha256:a7cd10e209cb5a2fedef0af66da0ded6b28ed6fa5f100110382e6e767be6e940","observation_id":"aba3db34-5f17-47ba-829b-86c7ebc7ecf2","resolution":{"observed_at":"2026-08-11T11:08:45.979381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:08:46.010332Z","title":"VLA-JEPA: Enhancing vision-language-action model with latent world model.arXiv preprint arXiv:2602.10098,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09771","last_updated":"2026-08-10T15:58:39Z","snapshot_observed_at":"2026-08-19T21:45:56.677114Z","submitted_at":"2026-08-10T15:58:39Z","title":"SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T11:08:46.010332Z"},"links":{"citing_paper":"/paper/2608.09771"},"observation_digest":"sha256:a2c9b96fb7105b67fc8b2bfd879bfc8fb42553c9431d053957d52e54ac7dc7a6","observation_id":"9dc75381-318f-4ed7-9052-9e94ce4e4aa6","resolution":{"observed_at":"2026-08-11T11:08:46.010332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07931","last_updated":"2026-05-13T19:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-08T16:04:43Z","title":"One Token Per Frame: Reconsidering Visual Bandwidth in World Models for VLA Policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.07931","snapshot_observed_at":"2026-08-11T11:08:46.049581Z","title":"Yang Tian, Sizhe Yang, Jia Zeng, Ping Wang, Dahua Lin, Hao Dong, and Jiangmiao Pang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09771","last_updated":"2026-08-10T15:58:39Z","snapshot_observed_at":"2026-08-19T21:45:56.677114Z","submitted_at":"2026-08-10T15:58:39Z","title":"SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T11:08:46.049581Z"},"links":{"cited_paper":"/paper/2605.07931","citing_paper":"/paper/2608.09771"},"observation_digest":"sha256:391dc6fdda2b07c1fac36f0e9414409f4a58a777ea3d3467e7f31d0532922725","observation_id":"56422c58-b632-45e8-8594-8037de63614d","resolution":{"observed_at":"2026-08-11T11:08:46.049581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.13674","last_updated":"2026-06-11T17:59:43Z","snapshot_observed_at":"2026-08-13T22:58:06.874802Z","submitted_at":"2026-06-11T17:59:43Z","title":"RepWAM: World Action Modeling with Representation Visual-Action Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.13674","snapshot_observed_at":"2026-08-11T11:08:46.106485Z","title":"Repwam: World action modeling with representation visual-action tokenizers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09771","last_updated":"2026-08-10T15:58:39Z","snapshot_observed_at":"2026-08-19T21:45:56.677114Z","submitted_at":"2026-08-10T15:58:39Z","title":"SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T11:08:46.106485Z"},"links":{"cited_paper":"/paper/2606.13674","citing_paper":"/paper/2608.09771"},"observation_digest":"sha256:bdab77386998aff2502b1259537d852df1154d37c12573593f9a567d4527fadc","observation_id":"fc1388da-6e49-4c77-9948-bb653c50241c","resolution":{"observed_at":"2026-08-11T11:08:46.106485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15922","last_updated":"2026-02-17T15:04:02Z","snapshot_observed_at":"2026-08-09T12:54:21.149243Z","submitted_at":"2026-02-17T15:04:02Z","title":"World Action Models are Zero-shot Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15922","snapshot_observed_at":"2026-08-11T11:08:46.164680Z","title":"World action models are zero-shot policies.arXiv preprint arXiv:2602.15922,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09771","last_updated":"2026-08-10T15:58:39Z","snapshot_observed_at":"2026-08-19T21:45:56.677114Z","submitted_at":"2026-08-10T15:58:39Z","title":"SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T11:08:46.164680Z"},"links":{"cited_paper":"/paper/2602.15922","citing_paper":"/paper/2608.09771"},"observation_digest":"sha256:c4dda0619be08d221f2cfd307bc577248c8b4541e09899d3d28587d6d6e07bc9","observation_id":"7ab6af63-4bfa-46c9-81a4-e328aab4b4d8","resolution":{"observed_at":"2026-08-11T11:08:46.164680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.16666","last_updated":"2026-03-23T05:41:14Z","snapshot_observed_at":"2026-08-20T03:53:25.888886Z","submitted_at":"2026-03-17T15:33:43Z","title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.16666","snapshot_observed_at":"2026-08-11T11:08:46.206232Z","title":"Fast-W AM: Do world action models need test-time future imagination?arXiv preprint arXiv:2603.16666,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09771","last_updated":"2026-08-10T15:58:39Z","snapshot_observed_at":"2026-08-19T21:45:56.677114Z","submitted_at":"2026-08-10T15:58:39Z","title":"SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T11:08:46.206232Z"},"links":{"cited_paper":"/paper/2603.16666","citing_paper":"/paper/2608.09771"},"observation_digest":"sha256:91450989cefa0edc11218f3e79b174fa35245f8aea508bcb2bd1445503406f37","observation_id":"b5b6ed8a-023d-4443-84a6-46cc0d14d0ed","resolution":{"observed_at":"2026-08-11T11:08:46.206232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.16391","last_updated":"2026-03-27T17:20:10Z","snapshot_observed_at":"2026-08-18T13:02:41.347839Z","submitted_at":"2026-03-27T17:20:10Z","title":"Disentangled Robot Learning via Separate Forward and Inverse Dynamics Pretraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.16391","snapshot_observed_at":"2026-08-11T11:08:46.209237Z","title":"org/abs/2604.16391","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09771","last_updated":"2026-08-10T15:58:39Z","snapshot_observed_at":"2026-08-19T21:45:56.677114Z","submitted_at":"2026-08-10T15:58:39Z","title":"SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T11:08:46.209237Z"},"links":{"cited_paper":"/paper/2604.16391","citing_paper":"/paper/2608.09771"},"observation_digest":"sha256:44ea433dbf9dba2b864f8e7036bc060f4f017aa199135f95b897bc6c4438f369","observation_id":"2e1119bf-dc01-4872-a5e8-a36b1cc4a28c","resolution":{"observed_at":"2026-08-11T11:08:46.209237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02792","last_updated":"2025-05-23T00:47:24Z","snapshot_observed_at":"2026-08-10T02:54:28.264405Z","submitted_at":"2025-04-03T17:38:59Z","title":"Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02792","snapshot_observed_at":"2026-08-11T11:08:46.212987Z","title":"Brianna Zitkovich, Tianhe Yu, Sichun Xu, Peng Xu, Ted Xiao, Fei Xia, Jialin Wu, Paul Wohlhart, Stefan Welker, Ayzaan Wahid, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09771","last_updated":"2026-08-10T15:58:39Z","snapshot_observed_at":"2026-08-19T21:45:56.677114Z","submitted_at":"2026-08-10T15:58:39Z","title":"SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T11:08:46.212987Z"},"links":{"cited_paper":"/paper/2504.02792","citing_paper":"/paper/2608.09771"},"observation_digest":"sha256:9ac29e6c702852b0a825f5af3802b9df15a4c5c5db1685f06b0f15a7867b5eb6","observation_id":"9452ac29-a653-4698-a1ca-0e630528246d","resolution":{"observed_at":"2026-08-11T11:08:46.212987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07819","last_updated":"2019-01-29T06:44:13Z","snapshot_observed_at":"2026-08-14T17:56:41.525140Z","submitted_at":"2018-11-19T17:30:36Z","title":"Learning Actionable Representations with Goal-Conditioned Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07819","snapshot_observed_at":"2026-08-11T11:08:45.926331Z","title":"Yucheng Hu, Yanjiang Guo, Pengchao Wang, Xiaoyu Chen, Yen-Jen Wang, Jianke Zhang, Koushil Sreenath, Chaochao Lu, and Jianyu Chen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09771","last_updated":"2026-08-10T15:58:39Z","snapshot_observed_at":"2026-08-19T21:45:56.677114Z","submitted_at":"2026-08-10T15:58:39Z","title":"SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-11T11:08:45.926331Z"},"links":{"cited_paper":"/paper/1811.07819","citing_paper":"/paper/2608.09771"},"observation_digest":"sha256:638e2ff8218f28af52171696d4630eb43a9d081e948e69a0b642447d6cc3dbc9","observation_id":"b21644e1-2a10-48e0-ae06-76d9f94b39be","resolution":{"observed_at":"2026-08-11T11:08:45.926331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04996","last_updated":"2025-09-05T10:43:12Z","snapshot_observed_at":"2026-08-17T01:27:04.996509Z","submitted_at":"2025-09-05T10:43:12Z","title":"FLOWER: Democratizing Generalist Robot Policies with Efficient Vision-Language-Action Flow Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.04996","snapshot_observed_at":"2026-08-11T11:08:45.984225Z","title":"FLOWER: Democratizing generalist robot policies with efficient vision-language-action flow policies.arXiv preprint arXiv:2509.04996,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09771","last_updated":"2026-08-10T15:58:39Z","snapshot_observed_at":"2026-08-19T21:45:56.677114Z","submitted_at":"2026-08-10T15:58:39Z","title":"SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T11:08:45.984225Z"},"links":{"cited_paper":"/paper/2509.04996","citing_paper":"/paper/2608.09771"},"observation_digest":"sha256:aa453dbf74801202e757d898da54284e74cc52bd5ec6b53d8661a80a5a07c0ab","observation_id":"9e742514-6b93-4c6a-a89a-6181e74ea0bb","resolution":{"observed_at":"2026-08-11T11:08:45.984225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08001","last_updated":"2025-02-06T12:37:15Z","snapshot_observed_at":"2026-08-16T18:26:33.270093Z","submitted_at":"2024-10-10T14:57:51Z","title":"Towards Synergistic, Generalized, and Efficient Dual-System for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08001","snapshot_observed_at":"2026-08-11T11:08:45.647572Z","title":"Towards synergistic, generalized, and efficient dual-system for robotic manipulation.arXiv preprint arXiv:2410.08001,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09771","last_updated":"2026-08-10T15:58:39Z","snapshot_observed_at":"2026-08-19T21:45:56.677114Z","submitted_at":"2026-08-10T15:58:39Z","title":"SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T11:08:45.647572Z"},"links":{"cited_paper":"/paper/2410.08001","citing_paper":"/paper/2608.09771"},"observation_digest":"sha256:8e24aa7643bb8cdeee965d5c004a772bec513f02d6f7812a515ad3c849ec964d","observation_id":"aa0eef69-d08e-47f6-9380-c7b23718aef7","resolution":{"observed_at":"2026-08-11T11:08:45.647572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.08243","last_updated":"2023-04-13T17:59:37Z","snapshot_observed_at":"2026-08-16T16:01:20.302377Z","submitted_at":"2023-01-19T18:59:01Z","title":"Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.08243","snapshot_observed_at":"2026-08-11T11:08:45.630477Z","title":"Mido Assran et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09771","last_updated":"2026-08-10T15:58:39Z","snapshot_observed_at":"2026-08-19T21:45:56.677114Z","submitted_at":"2026-08-10T15:58:39Z","title":"SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T11:08:45.630477Z"},"links":{"cited_paper":"/paper/2301.08243","citing_paper":"/paper/2608.09771"},"observation_digest":"sha256:07ded39bdb0be576a2231afd61de95ec0ef0862859871cd19fe36b554e97321a","observation_id":"7171984b-7e5d-4db6-9029-3f5aa3d45168","resolution":{"observed_at":"2026-08-11T11:08:45.630477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-08-16T17:53:54.636855Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-11T11:08:45.641449Z","title":"Anthony Brohan, Noah Brown, Justice Carbajal, Yevgen Chebotar, Joseph Dabis, Chelsea Finn, Keerthana Gopalakrishnan, Karol Hausman, Alex Herzog, Jasmine Hsu, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09771","last_updated":"2026-08-10T15:58:39Z","snapshot_observed_at":"2026-08-19T21:45:56.677114Z","submitted_at":"2026-08-10T15:58:39Z","title":"SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T11:08:45.641449Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2608.09771"},"observation_digest":"sha256:f217d3f976f0d04a63cc2cae9f81bb4261f29d68edf0519aa7fbb1804169e1b2","observation_id":"fc697d1c-8ced-43c9-9d40-fa180351349b","resolution":{"observed_at":"2026-08-11T11:08:45.641449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08471","last_updated":"2024-02-15T18:59:11Z","snapshot_observed_at":"2026-08-17T22:50:34.371081Z","submitted_at":"2024-02-15T18:59:11Z","title":"Revisiting Feature Prediction for Learning Visual Representations from Video","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08471","snapshot_observed_at":"2026-08-11T11:08:45.636699Z","title":"Revisiting feature prediction for learning visual representations from video.arXiv preprint arXiv:2404.08471,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09771","last_updated":"2026-08-10T15:58:39Z","snapshot_observed_at":"2026-08-19T21:45:56.677114Z","submitted_at":"2026-08-10T15:58:39Z","title":"SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-11T11:08:45.636699Z"},"links":{"cited_paper":"/paper/2404.08471","citing_paper":"/paper/2608.09771"},"observation_digest":"sha256:8f2582b5a30a0c5d80a3714772f49da33dd6e02552782611c71a3345c5b8c9a4","observation_id":"30b5ebf9-3ef9-442e-8016-e3f4984afd1e","resolution":{"observed_at":"2026-08-11T11:08:45.636699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12215","last_updated":"2026-06-03T04:04:20Z","snapshot_observed_at":"2026-08-19T19:57:13.864566Z","submitted_at":"2026-02-12T17:53:51Z","title":"LDA-1B: Scaling Latent Dynamics Action Model via Universal Embodied Data Ingestion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12215","snapshot_observed_at":"2026-08-11T11:08:45.955594Z","title":"LDA-1B: Scaling latent dynamics action model via universal embodied data ingestion.arXiv preprint arXiv:2602.12215,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09771","last_updated":"2026-08-10T15:58:39Z","snapshot_observed_at":"2026-08-19T21:45:56.677114Z","submitted_at":"2026-08-10T15:58:39Z","title":"SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-11T11:08:45.955594Z"},"links":{"cited_paper":"/paper/2602.12215","citing_paper":"/paper/2608.09771"},"observation_digest":"sha256:37d594e3380a93798fc448f62697c20ae43efaa3af7d85bbfc46ea165ebccaa5","observation_id":"ecff5be2-a9fe-43a5-b00d-13475af2ee70","resolution":{"observed_at":"2026-08-11T11:08:45.955594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.09771","last_updated":"2026-08-10T15:58:39Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-19T21:45:56.677114Z","submitted_at":"2026-08-10T15:58:39Z","title":"SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2608.09771."}