{"as_of":"2026-08-14T19:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1154edcdbb38f29dc4b7a6aa07bce29d01f04b1248a65ac2ecba1efbc60bc18c","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T18:27:58.510808Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09381/citation-record","integrity":"/paper/2608.09381/integrity","json":"/paper/2608.09381/citation-record.json","paper":"/paper/2608.09381"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-11T18:27:58.440915Z","title":"Black,K.;Brown,N.;Driess,D.;Esmail,A.;Equi,M.;Finn, C.; Fusai, N.; Groom, L.; Hausman, K.; Ichter, B.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09381","last_updated":"2026-08-10T09:57:54Z","snapshot_observed_at":"2026-08-13T23:43:29.635348Z","submitted_at":"2026-08-10T09:57:54Z","title":"JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T18:27:58.440915Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2608.09381"},"observation_digest":"sha256:12a7bc41e092a3372e32b8a5475204c20b6d28a5f832ab3bba0d60935a945bd5","observation_id":"2303cbd8-4dc4-4888-9817-23ff0b784e44","resolution":{"observed_at":"2026-08-11T18:27:58.440915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13626","last_updated":"2025-12-26T12:19:56Z","snapshot_observed_at":"2026-08-13T00:59:48.824306Z","submitted_at":"2025-10-15T14:51:36Z","title":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.13626","snapshot_observed_at":"2026-08-11T18:27:58.444976Z","title":"arXiv:2510.13626","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09381","last_updated":"2026-08-10T09:57:54Z","snapshot_observed_at":"2026-08-13T23:43:29.635348Z","submitted_at":"2026-08-10T09:57:54Z","title":"JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T18:27:58.444976Z"},"links":{"cited_paper":"/paper/2510.13626","citing_paper":"/paper/2608.09381"},"observation_digest":"sha256:3ac4dce3240f6596dba9c9f35b01e89bb72e8fbb7744fb9f3adbb2834a20b779","observation_id":"293745fc-0811-4b86-b9b6-1d60f3e39454","resolution":{"observed_at":"2026-08-11T18:27:58.444976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:27:58.808820Z","title":"0, .25, .50, .75,1 Three-block placement Place all three target blocks on the plate, with partial credit for completed placements","venue":null,"work_id":"e549295b-bdb4-410c-968c-2b60833e60f7","year":null},"citing_paper":{"arxiv_id":"2608.09381","last_updated":"2026-08-10T09:57:54Z","snapshot_observed_at":"2026-08-13T23:43:29.635348Z","submitted_at":"2026-08-10T09:57:54Z","title":"JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T18:27:58.510808Z"},"links":{"citing_paper":"/paper/2608.09381"},"observation_digest":"sha256:4267256b148c52863da210e654e023779e6fc04ff1084ada35b532c0cff31641","observation_id":"f5b30d59-8018-437d-9fb8-9752196624bb","resolution":{"observed_at":"2026-08-11T18:27:58.812634Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.30552","last_updated":"2026-07-01T17:07:04Z","snapshot_observed_at":"2026-08-13T06:00:09.028498Z","submitted_at":"2026-06-29T16:48:48Z","title":"Training Vision-Language-Action Models with Dense Embodied Chain-of-Thought Supervision","version":2},"cited_work":{"arxiv_id":"2606.30552","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.30552","snapshot_observed_at":"2026-08-11T18:27:58.752181Z","title":"Training Vision-Language-Action Models with Dense Embodied Chain-of-Thought Supervision","venue":"cs.RO","work_id":"fae12330-4557-43e4-bad1-16812085d28e","year":2026},"citing_paper":{"arxiv_id":"2608.09381","last_updated":"2026-08-10T09:57:54Z","snapshot_observed_at":"2026-08-13T23:43:29.635348Z","submitted_at":"2026-08-10T09:57:54Z","title":"JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T18:27:58.458145Z"},"links":{"cited_paper":"/paper/2606.30552","citing_paper":"/paper/2608.09381"},"observation_digest":"sha256:e48994c5d7054461e7f749f067d07bd0c267df096b59e8c93dc6d922f5be7f01","observation_id":"816fe6d9-7ca7-44ac-a613-8886548cfac5","resolution":{"observed_at":"2026-08-11T18:27:58.757020Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.19678","snapshot_observed_at":"2026-08-11T18:27:58.462125Z","title":"InInternational Conference on Learning Representations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09381","last_updated":"2026-08-10T09:57:54Z","snapshot_observed_at":"2026-08-13T23:43:29.635348Z","submitted_at":"2026-08-10T09:57:54Z","title":"JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T18:27:58.462125Z"},"links":{"cited_paper":"/paper/2605.19678","citing_paper":"/paper/2608.09381"},"observation_digest":"sha256:22c02063e90d3da48e87b3e011d220754183421c1230bcf78d720d50daebc639","observation_id":"926b2cab-789c-4ed3-8301-018a6cbbb54f","resolution":{"observed_at":"2026-08-11T18:27:58.462125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:27:58.465794Z","title":"Miao, S.; Feng, N.; Wu, J.; Lin, Y.; He, X.; Li, D.; and Long,M.2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09381","last_updated":"2026-08-10T09:57:54Z","snapshot_observed_at":"2026-08-13T23:43:29.635348Z","submitted_at":"2026-08-10T09:57:54Z","title":"JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T18:27:58.465794Z"},"links":{"citing_paper":"/paper/2608.09381"},"observation_digest":"sha256:5a0832b57c270e49c2f920523559c33caaaef524b6bca6ec5c8b6373c7d5f32e","observation_id":"698618c8-f15b-4b4d-9065-bfe62e7954d2","resolution":{"observed_at":"2026-08-11T18:27:58.465794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:27:58.885192Z","title":"Physical Intelligence; Black, K.; Brown, N.; Darpinian, J.; Dhabalia,K.;Driess,D.;Esmail,A.;Equi,M.;Finn,C.;Fu- sai, N.; et al","venue":null,"work_id":"fe0cb387-591e-4128-9bfe-bbb4aad5adfa","year":2025},"citing_paper":{"arxiv_id":"2608.09381","last_updated":"2026-08-10T09:57:54Z","snapshot_observed_at":"2026-08-13T23:43:29.635348Z","submitted_at":"2026-08-10T09:57:54Z","title":"JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T18:27:58.469594Z"},"links":{"citing_paper":"/paper/2608.09381"},"observation_digest":"sha256:db47dbb714bd183d6a335e824f17705a848e6dc072fa226c38f020b8e508f3a4","observation_id":"96d463c9-6265-4e8d-88b3-1f03d7dd53f8","resolution":{"observed_at":"2026-08-11T18:27:58.889066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.05014","last_updated":"2026-04-06T17:59:21Z","snapshot_observed_at":"2026-08-11T13:37:09.952888Z","submitted_at":"2026-04-06T17:59:21Z","title":"StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.05014","snapshot_observed_at":"2026-08-11T18:27:58.473548Z","title":"arXiv:2604.05014","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09381","last_updated":"2026-08-10T09:57:54Z","snapshot_observed_at":"2026-08-13T23:43:29.635348Z","submitted_at":"2026-08-10T09:57:54Z","title":"JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T18:27:58.473548Z"},"links":{"cited_paper":"/paper/2604.05014","citing_paper":"/paper/2608.09381"},"observation_digest":"sha256:435a838002eee0abc8aef603d8fe648113debeef367368e267a7cc6047cbd221","observation_id":"e514e95f-37c6-440b-8713-498185037704","resolution":{"observed_at":"2026-08-11T18:27:58.473548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:27:58.477033Z","title":"arXiv:2602.10098","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09381","last_updated":"2026-08-10T09:57:54Z","snapshot_observed_at":"2026-08-13T23:43:29.635348Z","submitted_at":"2026-08-10T09:57:54Z","title":"JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T18:27:58.477033Z"},"links":{"citing_paper":"/paper/2608.09381"},"observation_digest":"sha256:eeea1c4565749d9d84c70705307eef2a81ab3cee5945a8c7524f04f36effe10e","observation_id":"f0de75d1-b698-4252-8ff9-aa133464bf2d","resolution":{"observed_at":"2026-08-11T18:27:58.477033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15922","last_updated":"2026-02-17T15:04:02Z","snapshot_observed_at":"2026-08-09T12:54:21.149243Z","submitted_at":"2026-02-17T15:04:02Z","title":"World Action Models are Zero-shot Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15922","snapshot_observed_at":"2026-08-11T18:27:58.480327Z","title":"Ye, A.; Wang, B.; Ni, C.; Huang, G.; Zhao, G.; Li, H.; Li, H.; Li, J.; Lv, J.; Liu, J.; et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09381","last_updated":"2026-08-10T09:57:54Z","snapshot_observed_at":"2026-08-13T23:43:29.635348Z","submitted_at":"2026-08-10T09:57:54Z","title":"JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T18:27:58.480327Z"},"links":{"cited_paper":"/paper/2602.15922","citing_paper":"/paper/2608.09381"},"observation_digest":"sha256:21f9e8fde0678c9968a88b13e3c5a0d659af109c93188fd85d260c37ca2cacc7","observation_id":"9693e49e-6508-49b1-8203-b676b420398d","resolution":{"observed_at":"2026-08-11T18:27:58.480327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.20834","last_updated":"2026-04-24T16:37:03Z","snapshot_observed_at":"2026-08-02T06:38:24.634185Z","submitted_at":"2026-04-22T17:58:19Z","title":"PokeVLA: Empowering Pocket-Sized Vision-Language-Action Model with Comprehensive World Knowledge Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.20834","snapshot_observed_at":"2026-08-11T18:27:58.485559Z","title":"Zheng, R.; Wang, J.; Reed, S.; Bjorck, J.; Fang, Y.; Hu, F.; Jang,J.;Kundalia,K.;Lin,Z.;Magne,L.;etal.2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09381","last_updated":"2026-08-10T09:57:54Z","snapshot_observed_at":"2026-08-13T23:43:29.635348Z","submitted_at":"2026-08-10T09:57:54Z","title":"JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T18:27:58.485559Z"},"links":{"cited_paper":"/paper/2604.20834","citing_paper":"/paper/2608.09381"},"observation_digest":"sha256:a17b2fddfba061f934dab259fefa92901adb617448558232cd88ff5a56a8edd5","observation_id":"c9b4c20a-af3b-4a10-8003-c2fa25b596fa","resolution":{"observed_at":"2026-08-11T18:27:58.485559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.21391","last_updated":"2026-04-23T07:59:26Z","snapshot_observed_at":"2026-07-06T23:08:01.670049Z","submitted_at":"2026-04-23T07:59:26Z","title":"From Noise to Intent: Anchoring Generative VLA Policies with Residual Bridges","version":1},"cited_work":{"arxiv_id":"2604.21391","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.21391","snapshot_observed_at":"2026-08-11T18:27:58.537102Z","title":"From Noise to Intent: Anchoring Generative VLA Policies with Residual Bridges","venue":"cs.RO","work_id":"677ff456-71be-4057-ae14-e15a715c2739","year":2026},"citing_paper":{"arxiv_id":"2608.09381","last_updated":"2026-08-10T09:57:54Z","snapshot_observed_at":"2026-08-13T23:43:29.635348Z","submitted_at":"2026-08-10T09:57:54Z","title":"JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T18:27:58.489065Z"},"links":{"cited_paper":"/paper/2604.21391","citing_paper":"/paper/2608.09381"},"observation_digest":"sha256:96a25a4c77ea54abf4fdb9329513b9a39ebf57568a99235e6c4796fda4461f1a","observation_id":"dcd39c70-e222-48b7-812c-3bea6e98989d","resolution":{"observed_at":"2026-08-11T18:27:58.542580Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:27:58.820434Z","title":"We report the average task success rate over all 20 tasks","venue":null,"work_id":"5dbdeb74-aac8-4bcb-b702-6aa414176578","year":2025},"citing_paper":{"arxiv_id":"2608.09381","last_updated":"2026-08-10T09:57:54Z","snapshot_observed_at":"2026-08-13T23:43:29.635348Z","submitted_at":"2026-08-10T09:57:54Z","title":"JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T18:27:58.507689Z"},"links":{"citing_paper":"/paper/2608.09381"},"observation_digest":"sha256:d86adacfaff798729a03ef51c40bcc473bb40d6f2bb8490ac5ca8452b9963a20","observation_id":"253f5c72-3d5f-4866-b74a-b7ffe55ee3df","resolution":{"observed_at":"2026-08-11T18:27:58.824845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:27:58.859125Z","title":null,"venue":null,"work_id":"09371b2c-2c06-4b37-a071-b0e3989765b5","year":2024},"citing_paper":{"arxiv_id":"2608.09381","last_updated":"2026-08-10T09:57:54Z","snapshot_observed_at":"2026-08-13T23:43:29.635348Z","submitted_at":"2026-08-10T09:57:54Z","title":"JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T18:27:58.496584Z"},"links":{"citing_paper":"/paper/2608.09381"},"observation_digest":"sha256:3b5bee1b1bbc2c33d41ae72db0ea2adf336271aaaf812445f13db951a2cab1e2","observation_id":"ce4913ae-baa9-4306-87c9-193129b725ea","resolution":{"observed_at":"2026-08-11T18:27:58.863555Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:27:58.846994Z","title":"Only the Qwen LoRA adapters, transition prediction head, and action expert are optimized","venue":null,"work_id":"a4eb90e0-3efe-43e7-b8e4-0f4f567336b8","year":2026},"citing_paper":{"arxiv_id":"2608.09381","last_updated":"2026-08-10T09:57:54Z","snapshot_observed_at":"2026-08-13T23:43:29.635348Z","submitted_at":"2026-08-10T09:57:54Z","title":"JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling","version":1},"reference_index":128,"source":"pdf_text","source_observed_at":"2026-08-11T18:27:58.499962Z"},"links":{"citing_paper":"/paper/2608.09381"},"observation_digest":"sha256:4f236b0e91b9efc49be19027f39be9ad864b32626d9518dee5b932c3b7ad2ed7","observation_id":"a941725f-048f-4c70-8607-e400892a8cc1","resolution":{"observed_at":"2026-08-11T18:27:58.850605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:27:58.872559Z","title":null,"venue":null,"work_id":"608f1ec5-522d-49c7-9994-19afe0e7f19d","year":null},"citing_paper":{"arxiv_id":"2608.09381","last_updated":"2026-08-10T09:57:54Z","snapshot_observed_at":"2026-08-13T23:43:29.635348Z","submitted_at":"2026-08-10T09:57:54Z","title":"JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling","version":1},"reference_index":896,"source":"pdf_text","source_observed_at":"2026-08-11T18:27:58.492463Z"},"links":{"citing_paper":"/paper/2608.09381"},"observation_digest":"sha256:37e0283d20e37e8c6d4fb7e9811dbf74d4f402b6e19ee825f097d64f8501239c","observation_id":"ab67598c-f27b-4f18-8114-ca5b555e49bd","resolution":{"observed_at":"2026-08-11T18:27:58.876459Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:27:58.833554Z","title":null,"venue":null,"work_id":"5ee3eacd-51db-4249-afa3-8ee54e656298","year":2025},"citing_paper":{"arxiv_id":"2608.09381","last_updated":"2026-08-10T09:57:54Z","snapshot_observed_at":"2026-08-13T23:43:29.635348Z","submitted_at":"2026-08-10T09:57:54Z","title":"JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T18:27:58.503962Z"},"links":{"citing_paper":"/paper/2608.09381"},"observation_digest":"sha256:aa4519332d395f1dbf86bf6b965e46095087808df2a8161326bd5cc9c9cc62d9","observation_id":"b1dd2530-887d-4ce4-97d4-053f5f09c2c9","resolution":{"observed_at":"2026-08-11T18:27:58.838440Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:27:58.896237Z","title":"InForty-first International Conference on Machine Learn- ing,ICML2024,Vienna,Austria,July21–27,2024,volume 235 ofProceedings of Machine Learning Research, 23123– 23144","venue":null,"work_id":"90aa48e1-779c-4d5a-a16b-2e0dab79fa7e","year":2024},"citing_paper":{"arxiv_id":"2608.09381","last_updated":"2026-08-10T09:57:54Z","snapshot_observed_at":"2026-08-13T23:43:29.635348Z","submitted_at":"2026-08-10T09:57:54Z","title":"JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T18:27:58.454400Z"},"links":{"citing_paper":"/paper/2608.09381"},"observation_digest":"sha256:c5734da65b728656e310c3fbcb03af2152fb250cc0b8ce45421f492a828dfcb2","observation_id":"0079f681-f4c2-4610-a6ec-b52073f66b85","resolution":{"observed_at":"2026-08-11T18:27:58.900366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09985","snapshot_observed_at":"2026-08-11T18:27:58.435802Z","title":"arXiv:2506.09985","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09381","last_updated":"2026-08-10T09:57:54Z","snapshot_observed_at":"2026-08-13T23:43:29.635348Z","submitted_at":"2026-08-10T09:57:54Z","title":"JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-11T18:27:58.435802Z"},"links":{"cited_paper":"/paper/2506.09985","citing_paper":"/paper/2608.09381"},"observation_digest":"sha256:7fe1505c4c04a711e04aa7c1cf145906bbd38d1bb70172590ec330381134efc1","observation_id":"fed3a5c9-3654-4bff-911b-8d7a96e6b72f","resolution":{"observed_at":"2026-08-11T18:27:58.435802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04476","last_updated":"2026-05-12T10:07:13Z","snapshot_observed_at":"2026-08-11T01:23:00.247206Z","submitted_at":"2026-02-04T12:04:02Z","title":"Vision-aligned Latent Reasoning for Multi-modal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04476","snapshot_observed_at":"2026-08-11T18:27:58.449889Z","title":"Karamcheti, S.; Nair, S.; Balakrishna, A.; Liang, P.; Kollar, T.; and Sadigh, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09381","last_updated":"2026-08-10T09:57:54Z","snapshot_observed_at":"2026-08-13T23:43:29.635348Z","submitted_at":"2026-08-10T09:57:54Z","title":"JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-11T18:27:58.449889Z"},"links":{"cited_paper":"/paper/2602.04476","citing_paper":"/paper/2608.09381"},"observation_digest":"sha256:9ed6128cdfdf76adb2b87292a22d0f96dde7e8dc820a4c98b43e04f2051c338b","observation_id":"ff31df74-baf2-480e-901b-07ac4f7cb4a7","resolution":{"observed_at":"2026-08-11T18:27:58.449889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.09381","last_updated":"2026-08-10T09:57:54Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-13T23:43:29.635348Z","submitted_at":"2026-08-10T09:57:54Z","title":"JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":13,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 0 inbound Pith citation observations for arXiv:2608.09381."}