{"as_of":"2026-08-15T01:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2b710b5d2c565b899fa323ff108d2c1077b4f33b081841861585eb20be296bbc","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:08:34.770206Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06374/citation-record","integrity":"/paper/2608.06374/integrity","json":"/paper/2608.06374/citation-record.json","paper":"/paper/2608.06374"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-07T04:08:30.205321Z","title":"Qwen3-VL technical report.arXiv preprint arXiv:2511.21631,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06374","last_updated":"2026-08-06T17:59:20Z","snapshot_observed_at":"2026-08-13T07:40:46.791650Z","submitted_at":"2026-08-06T17:59:20Z","title":"DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:30.205321Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.06374"},"observation_digest":"sha256:f868ef417469f92b31c7254ebf7c2008d8d45b1db9a276f184cad004171fcccb","observation_id":"1649fcac-ca18-4e40-8f10-c7adf07e6430","resolution":{"observed_at":"2026-08-07T04:08:30.205321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-07T04:08:30.467744Z","title":"GR00T N1: An open foundation model for generalist humanoid robots.arXiv preprint arXiv:2503.14734,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06374","last_updated":"2026-08-06T17:59:20Z","snapshot_observed_at":"2026-08-13T07:40:46.791650Z","submitted_at":"2026-08-06T17:59:20Z","title":"DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:30.467744Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2608.06374"},"observation_digest":"sha256:78a9ab2dbadbed6b7895656fc3c43717dc92f590c74d1ca513abccef762679cc","observation_id":"2a6b57db-92ad-4772-adb5-67ec67d28af0","resolution":{"observed_at":"2026-08-07T04:08:30.467744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:30.589081Z","title":"π0.5: a vision-language-action model with open-world generalization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06374","last_updated":"2026-08-06T17:59:20Z","snapshot_observed_at":"2026-08-13T07:40:46.791650Z","submitted_at":"2026-08-06T17:59:20Z","title":"DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:30.589081Z"},"links":{"citing_paper":"/paper/2608.06374"},"observation_digest":"sha256:e47993f97af031a3276fe2c4ebeb913cc211d17e6f4a0165970fa5b1c9efae35","observation_id":"7bf3de5f-7d1e-49da-a6a3-0549bdefa25f","resolution":{"observed_at":"2026-08-07T04:08:30.589081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21539","last_updated":"2025-06-26T17:55:40Z","snapshot_observed_at":"2026-08-13T10:05:34.967093Z","submitted_at":"2025-06-26T17:55:40Z","title":"WorldVLA: Towards Autoregressive Action World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21539","snapshot_observed_at":"2026-08-07T04:08:30.854406Z","title":"Worldvla: Towards autoregressive action world model.arXiv preprint arXiv:2506.21539,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06374","last_updated":"2026-08-06T17:59:20Z","snapshot_observed_at":"2026-08-13T07:40:46.791650Z","submitted_at":"2026-08-06T17:59:20Z","title":"DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:30.854406Z"},"links":{"cited_paper":"/paper/2506.21539","citing_paper":"/paper/2608.06374"},"observation_digest":"sha256:f5943c62824ed7f309a8ab95d3f49859a1510e551b0d15856ddcb4528e384c23","observation_id":"8cd17faf-f616-489c-84c8-76eb8df3f413","resolution":{"observed_at":"2026-08-07T04:08:30.854406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:35.929109Z","title":"Unified diffusion vla: Vision-language-action model via joint discrete denosing diffusion process","venue":null,"work_id":"b8ccb4e6-0123-4a7e-bfec-d0516757cf73","year":2026},"citing_paper":{"arxiv_id":"2608.06374","last_updated":"2026-08-06T17:59:20Z","snapshot_observed_at":"2026-08-13T07:40:46.791650Z","submitted_at":"2026-08-06T17:59:20Z","title":"DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:30.980745Z"},"links":{"citing_paper":"/paper/2608.06374"},"observation_digest":"sha256:0f4d036bae41ed30fec45ddce8a8e450ed06d24e583f1dc53bcac2d8acc64912","observation_id":"95c66a4c-f7db-42ef-a2cd-ca379b979706","resolution":{"observed_at":"2026-08-07T04:08:36.068260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.03342","last_updated":"2025-11-28T18:57:04Z","snapshot_observed_at":"2026-07-06T22:31:40.462674Z","submitted_at":"2025-10-02T14:32:45Z","title":"Gemini Robotics 1.5: Pushing the Frontier of Generalist Robots with Advanced Embodied Reasoning, Thinking, and Motion Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.03342","snapshot_observed_at":"2026-08-07T04:08:31.446237Z","title":"Gemini robotics 1.5: Pushing the frontier of generalist robots with advanced embodied reasoning, thinking, and motion transfer.arXiv preprint arXiv:2510.03342,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06374","last_updated":"2026-08-06T17:59:20Z","snapshot_observed_at":"2026-08-13T07:40:46.791650Z","submitted_at":"2026-08-06T17:59:20Z","title":"DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:31.446237Z"},"links":{"cited_paper":"/paper/2510.03342","citing_paper":"/paper/2608.06374"},"observation_digest":"sha256:305fb7db66b88be6238d8a01cbc923d1a7fd91551b8981e14874d515220939a3","observation_id":"d8ec08ed-8be9-40d9-9570-3cefb9d7195a","resolution":{"observed_at":"2026-08-07T04:08:31.446237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11709","last_updated":"2026-03-09T06:44:42Z","snapshot_observed_at":"2026-08-12T03:35:51.024147Z","submitted_at":"2025-05-16T21:34:47Z","title":"EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric Video","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11709","snapshot_observed_at":"2026-08-07T04:08:31.585050Z","title":"Egodex: Learning dexterous manipulation from large-scale egocentric video.arXiv preprint arXiv:2505.11709,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06374","last_updated":"2026-08-06T17:59:20Z","snapshot_observed_at":"2026-08-13T07:40:46.791650Z","submitted_at":"2026-08-06T17:59:20Z","title":"DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:31.585050Z"},"links":{"cited_paper":"/paper/2505.11709","citing_paper":"/paper/2608.06374"},"observation_digest":"sha256:350844202ab1d265f6128c4f42322a7438659c974296b7001111c636c0b616cd","observation_id":"ca4eac97-f468-4da1-9944-bd469dff7e5d","resolution":{"observed_at":"2026-08-07T04:08:31.585050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.25044","last_updated":"2026-05-24T12:41:34Z","snapshot_observed_at":"2026-08-14T15:05:49.491848Z","submitted_at":"2026-05-24T12:41:34Z","title":"X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2605.25044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.25044","snapshot_observed_at":"2026-08-07T04:08:35.367513Z","title":"X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models","venue":"cs.RO","work_id":"8e894d0a-1707-479e-88ec-59083c24919e","year":2026},"citing_paper":{"arxiv_id":"2608.06374","last_updated":"2026-08-06T17:59:20Z","snapshot_observed_at":"2026-08-13T07:40:46.791650Z","submitted_at":"2026-08-06T17:59:20Z","title":"DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:31.733430Z"},"links":{"cited_paper":"/paper/2605.25044","citing_paper":"/paper/2608.06374"},"observation_digest":"sha256:b522495e7e643b3b0c33104091560dadf57778c7688eb2bf67f5335614b4c41c","observation_id":"661c8415-e32d-42f7-a21e-379b73e1f64a","resolution":{"observed_at":"2026-08-07T04:08:35.494187Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05635","last_updated":"2025-11-04T12:01:01Z","snapshot_observed_at":"2026-08-14T13:55:25.823113Z","submitted_at":"2025-08-07T17:59:44Z","title":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05635","snapshot_observed_at":"2026-08-07T04:08:31.904125Z","title":"Genie envisioner: A unified world foundation platform for robotic manipulation.arXiv preprint arXiv:2508.05635,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06374","last_updated":"2026-08-06T17:59:20Z","snapshot_observed_at":"2026-08-13T07:40:46.791650Z","submitted_at":"2026-08-06T17:59:20Z","title":"DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:31.904125Z"},"links":{"cited_paper":"/paper/2508.05635","citing_paper":"/paper/2608.06374"},"observation_digest":"sha256:2f3db237032fa65229aa783a2811cfc93ff64a9ce9e0ac707d915abfdf03c817","observation_id":"6aaeeb94-8408-434b-a01d-86026369bf5d","resolution":{"observed_at":"2026-08-07T04:08:31.904125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-07T04:08:32.026849Z","title":"Flow matching for generative modeling.arXiv preprint arXiv:2210.02747,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06374","last_updated":"2026-08-06T17:59:20Z","snapshot_observed_at":"2026-08-13T07:40:46.791650Z","submitted_at":"2026-08-06T17:59:20Z","title":"DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:32.026849Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2608.06374"},"observation_digest":"sha256:7f5f86f6f470232d6294d2437364ee4508eb5990565de37919440b53e3ddfc86","observation_id":"e890f8c1-332d-4d7d-8640-910bbff428c1","resolution":{"observed_at":"2026-08-07T04:08:32.026849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-07T04:08:32.170479Z","title":"Rdt-1b: A diffusion foundation model for bimanual manipulation.arXiv preprint arXiv:2410.07864,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06374","last_updated":"2026-08-06T17:59:20Z","snapshot_observed_at":"2026-08-13T07:40:46.791650Z","submitted_at":"2026-08-06T17:59:20Z","title":"DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:32.170479Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2608.06374"},"observation_digest":"sha256:71535f68274c400af52d3a1c9f607f92f9769ebc6a177f4dc14cddbbf2bd9d66","observation_id":"0627c0d9-437d-46fd-a078-75aa4482b4e3","resolution":{"observed_at":"2026-08-07T04:08:32.170479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:32.319686Z","title":"Rdt2: Exploring the scaling limit of umi data towards zero-shot cross- embodiment generalization.arXiv preprint arXiv:2602.03310,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06374","last_updated":"2026-08-06T17:59:20Z","snapshot_observed_at":"2026-08-13T07:40:46.791650Z","submitted_at":"2026-08-06T17:59:20Z","title":"DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:32.319686Z"},"links":{"citing_paper":"/paper/2608.06374"},"observation_digest":"sha256:82418fee67718e9c487d4c34dc61447926fe55c7e286b5a32fdd757b2a1a42e0","observation_id":"9f04f079-c9f0-46b7-aebf-1a9248facb2f","resolution":{"observed_at":"2026-08-07T04:08:32.319686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-08-07T04:08:32.515534Z","title":"Being-h0: Vision-language-action pretraining from large-scale human videos.arXiv preprint arXiv:2507.15597,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06374","last_updated":"2026-08-06T17:59:20Z","snapshot_observed_at":"2026-08-13T07:40:46.791650Z","submitted_at":"2026-08-06T17:59:20Z","title":"DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:32.515534Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2608.06374"},"observation_digest":"sha256:f3343eb1a360fc1cfbe5520c3ec4eafede0edef66418c1e50847ec0f930c4110","observation_id":"36d4981d-d08b-4f6a-85bd-92b8aed13ce4","resolution":{"observed_at":"2026-08-07T04:08:32.515534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06951","last_updated":"2025-09-09T09:42:16Z","snapshot_observed_at":"2026-07-06T22:26:03.668339Z","submitted_at":"2025-09-08T17:58:30Z","title":"F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06951","snapshot_observed_at":"2026-08-07T04:08:32.698704Z","title":"F1: A vision-language-action model bridging understanding and generation to actions.arXiv preprint arXiv:2509.06951,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06374","last_updated":"2026-08-06T17:59:20Z","snapshot_observed_at":"2026-08-13T07:40:46.791650Z","submitted_at":"2026-08-06T17:59:20Z","title":"DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:32.698704Z"},"links":{"cited_paper":"/paper/2509.06951","citing_paper":"/paper/2608.06374"},"observation_digest":"sha256:f32517588556bdd3b668316e9fdf76d98e005574e7c0130ba0685ed5492480c1","observation_id":"e3727072-d7ea-42fa-950a-547676b04672","resolution":{"observed_at":"2026-08-07T04:08:32.698704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12215","last_updated":"2026-06-03T04:04:20Z","snapshot_observed_at":"2026-08-02T23:57:43.860710Z","submitted_at":"2026-02-12T17:53:51Z","title":"LDA-1B: Scaling Latent Dynamics Action Model via Universal Embodied Data Ingestion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12215","snapshot_observed_at":"2026-08-07T04:08:32.864862Z","title":"Lda-1b: Scaling latent dynamics action model via universal embodied data ingestion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06374","last_updated":"2026-08-06T17:59:20Z","snapshot_observed_at":"2026-08-13T07:40:46.791650Z","submitted_at":"2026-08-06T17:59:20Z","title":"DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:32.864862Z"},"links":{"cited_paper":"/paper/2602.12215","citing_paper":"/paper/2608.06374"},"observation_digest":"sha256:9bd82d8c51ed1b2d780024d56212fc196fc8ee8061e35a6d7f951779222f112d","observation_id":"35567722-aa66-41f9-845d-a8cff86b20ef","resolution":{"observed_at":"2026-08-07T04:08:32.864862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:32.992667Z","title":"Dit4dit: Jointly modeling video dynamics and actions for generalizable robot control.arXiv preprint arXiv:2603.10448,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06374","last_updated":"2026-08-06T17:59:20Z","snapshot_observed_at":"2026-08-13T07:40:46.791650Z","submitted_at":"2026-08-06T17:59:20Z","title":"DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:32.992667Z"},"links":{"citing_paper":"/paper/2608.06374"},"observation_digest":"sha256:fc94ad1f6a699b4558ae2db0f1722c90c2a1a68670ca962858c1352981c24cb5","observation_id":"b48ceb03-990a-46ad-be06-d8aa7137b986","resolution":{"observed_at":"2026-08-07T04:08:32.992667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-08-14T08:22:11.295012Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-07T04:08:33.125804Z","title":"Octo: An open-source generalist robot policy.arXiv preprint arXiv:2405.12213,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06374","last_updated":"2026-08-06T17:59:20Z","snapshot_observed_at":"2026-08-13T07:40:46.791650Z","submitted_at":"2026-08-06T17:59:20Z","title":"DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:33.125804Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2608.06374"},"observation_digest":"sha256:bcf070381b7b27ece9b4c591ef05e62d75767daa3381d7eac5ecd34874ee2d1d","observation_id":"1a4e4caf-28b9-4714-937d-997d46cbf171","resolution":{"observed_at":"2026-08-07T04:08:33.125804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-13T13:59:48.091257Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-07T04:08:33.290245Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models.arXiv preprint arXiv:2310.08864,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06374","last_updated":"2026-08-06T17:59:20Z","snapshot_observed_at":"2026-08-13T07:40:46.791650Z","submitted_at":"2026-08-06T17:59:20Z","title":"DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:33.290245Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2608.06374"},"observation_digest":"sha256:78e1655cd6ccfcb9b9ed0cab2077d471cdfdbf0ca1d8e1bd27416c820d43cf39","observation_id":"b565bdd3-d70a-4935-bbdf-87154a678f5e","resolution":{"observed_at":"2026-08-07T04:08:33.290245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.30280","last_updated":"2026-06-01T13:48:35Z","snapshot_observed_at":"2026-08-04T01:13:02.026321Z","submitted_at":"2026-05-28T17:36:31Z","title":"Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.30280","snapshot_observed_at":"2026-08-07T04:08:33.495200Z","title":"Qwen Team","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06374","last_updated":"2026-08-06T17:59:20Z","snapshot_observed_at":"2026-08-13T07:40:46.791650Z","submitted_at":"2026-08-06T17:59:20Z","title":"DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:33.495200Z"},"links":{"cited_paper":"/paper/2605.30280","citing_paper":"/paper/2608.06374"},"observation_digest":"sha256:d296f05a6ad71947af9643d717e4dc1898e002da954f4c95a59d7e64eabdfc8b","observation_id":"0f4dcdf4-c9a5-4a80-97d0-ad9853dd29a7","resolution":{"observed_at":"2026-08-07T04:08:33.495200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10629","last_updated":"2024-10-20T14:35:31Z","snapshot_observed_at":"2026-07-06T19:33:08.264958Z","submitted_at":"2024-10-14T15:36:42Z","title":"SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10629","snapshot_observed_at":"2026-08-07T04:08:33.762140Z","title":"Sana: Efficient high-resolution image synthesis with linear diffusion transformers.arXiv preprint arXiv:2410.10629,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06374","last_updated":"2026-08-06T17:59:20Z","snapshot_observed_at":"2026-08-13T07:40:46.791650Z","submitted_at":"2026-08-06T17:59:20Z","title":"DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:33.762140Z"},"links":{"cited_paper":"/paper/2410.10629","citing_paper":"/paper/2608.06374"},"observation_digest":"sha256:c22541da9446184871d54802c2bb67f87535985e4bf8147d26f60ed9e6315477","observation_id":"df557ac1-f5ed-4d1c-9085-6a0d1b74d5b8","resolution":{"observed_at":"2026-08-07T04:08:33.762140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:33.872178Z","title":"S-VAM: Shortcut video-action model by self-distilling geometric and semantic foresight.arXiv preprint arXiv:2603.16195,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06374","last_updated":"2026-08-06T17:59:20Z","snapshot_observed_at":"2026-08-13T07:40:46.791650Z","submitted_at":"2026-08-06T17:59:20Z","title":"DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:33.872178Z"},"links":{"citing_paper":"/paper/2608.06374"},"observation_digest":"sha256:d18277757c5fd0459eef13bf8270dab9dc1c25a439663643fa83084e82dfebd7","observation_id":"08c26dfa-6788-40a1-a319-f17e8b986f04","resolution":{"observed_at":"2026-08-07T04:08:33.872178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-14T01:52:48.608000Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-07T04:08:33.990715Z","title":"Egovla: Learning vision-language-action models from egocentric human videos.arXiv preprint arXiv:2507.12440,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06374","last_updated":"2026-08-06T17:59:20Z","snapshot_observed_at":"2026-08-13T07:40:46.791650Z","submitted_at":"2026-08-06T17:59:20Z","title":"DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:33.990715Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2608.06374"},"observation_digest":"sha256:fb6e6b20648c5d60ed76d4f9a11c91025cfe485e0148f06fad1b8c24b9dc4527","observation_id":"8497af07-401d-4b51-837e-68ca3ab74b7f","resolution":{"observed_at":"2026-08-07T04:08:33.990715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.11236","last_updated":"2026-04-14T10:01:08Z","snapshot_observed_at":"2026-07-06T22:45:29.609382Z","submitted_at":"2026-02-11T16:47:01Z","title":"ABot-M0: VLA Foundation Model for Robotic Manipulation with Action Manifold Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.11236","snapshot_observed_at":"2026-08-07T04:08:34.107020Z","title":"Abot-m0: Vla foundation model for robotic manipulation with action manifold learning.arXiv preprint arXiv:2602.11236, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06374","last_updated":"2026-08-06T17:59:20Z","snapshot_observed_at":"2026-08-13T07:40:46.791650Z","submitted_at":"2026-08-06T17:59:20Z","title":"DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:34.107020Z"},"links":{"cited_paper":"/paper/2602.11236","citing_paper":"/paper/2608.06374"},"observation_digest":"sha256:751e7fd349017b4752c1335ae65a938890241764cf072f93b68df54379faee4d","observation_id":"4f32dc7b-762f-477d-8103-39e7c570d5d1","resolution":{"observed_at":"2026-08-07T04:08:34.107020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.16666","last_updated":"2026-03-23T05:41:14Z","snapshot_observed_at":"2026-07-06T22:49:23.750692Z","submitted_at":"2026-03-17T15:33:43Z","title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.16666","snapshot_observed_at":"2026-08-07T04:08:34.194886Z","title":"Fast-wam: Do world action models need test-time future imagination?arXiv preprint arXiv:2603.16666, 2026.https://arxiv.org/abs/2603.16666","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06374","last_updated":"2026-08-06T17:59:20Z","snapshot_observed_at":"2026-08-13T07:40:46.791650Z","submitted_at":"2026-08-06T17:59:20Z","title":"DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:34.194886Z"},"links":{"cited_paper":"/paper/2603.16666","citing_paper":"/paper/2608.06374"},"observation_digest":"sha256:67a04e863e27493dc1893dbaaa16ab2ecbdbc5fd4e6c64ae0b9c9faaa438e754","observation_id":"e7098613-4f50-45e8-b1c5-36b68c2c9667","resolution":{"observed_at":"2026-08-07T04:08:34.194886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.10274","last_updated":"2025-10-11T16:20:17Z","snapshot_observed_at":"2026-08-11T15:30:01.335662Z","submitted_at":"2025-10-11T16:20:17Z","title":"X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.10274","snapshot_observed_at":"2026-08-07T04:08:34.328037Z","title":"Universal actions for enhanced embodied foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06374","last_updated":"2026-08-06T17:59:20Z","snapshot_observed_at":"2026-08-13T07:40:46.791650Z","submitted_at":"2026-08-06T17:59:20Z","title":"DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:34.328037Z"},"links":{"cited_paper":"/paper/2510.10274","citing_paper":"/paper/2608.06374"},"observation_digest":"sha256:0058477d2df2299114f905224b3395727917b0d3276a7c1b8604e04c0bcac6d8","observation_id":"f19e7637-c24c-4a27-a3b8-a8b371bd3d28","resolution":{"observed_at":"2026-08-07T04:08:34.328037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:34.454382Z","title":"Dualcot-vla: Visual-linguistic chain of thought via parallel reasoning for vision-language-action models.arXiv preprint arXiv:2603.22280,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06374","last_updated":"2026-08-06T17:59:20Z","snapshot_observed_at":"2026-08-13T07:40:46.791650Z","submitted_at":"2026-08-06T17:59:20Z","title":"DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:34.454382Z"},"links":{"citing_paper":"/paper/2608.06374"},"observation_digest":"sha256:142e981bce7f16e4cba198ba9c5f4bd00ab148e8e970c00c25fe221d1cac1872","observation_id":"9de9e644-1520-4f75-b9a0-4f49416a8123","resolution":{"observed_at":"2026-08-07T04:08:34.454382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02792","last_updated":"2025-05-23T00:47:24Z","snapshot_observed_at":"2026-08-10T02:54:28.264405Z","submitted_at":"2025-04-03T17:38:59Z","title":"Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02792","snapshot_observed_at":"2026-08-07T04:08:34.605130Z","title":"Unified world models: Coupling video and action diffusion for pretraining on large robotic datasets.arXiv preprint arXiv:2504.02792,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06374","last_updated":"2026-08-06T17:59:20Z","snapshot_observed_at":"2026-08-13T07:40:46.791650Z","submitted_at":"2026-08-06T17:59:20Z","title":"DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:34.605130Z"},"links":{"cited_paper":"/paper/2504.02792","citing_paper":"/paper/2608.06374"},"observation_digest":"sha256:aa4a69ecc16bc54ed02a5659e28ba01f67041eefb26434e8fab2806a9cbce76c","observation_id":"dff9f64b-0ab7-4687-b3bf-6ca0ce99c360","resolution":{"observed_at":"2026-08-07T04:08:34.605130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:35.700227Z","title":"Pour water from the cup into the bowl","venue":null,"work_id":"b98afd13-6856-4630-bc10-7493cd7976a7","year":2024},"citing_paper":{"arxiv_id":"2608.06374","last_updated":"2026-08-06T17:59:20Z","snapshot_observed_at":"2026-08-13T07:40:46.791650Z","submitted_at":"2026-08-06T17:59:20Z","title":"DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:34.770206Z"},"links":{"citing_paper":"/paper/2608.06374"},"observation_digest":"sha256:4e600ad8ba7df6ede21660cc44f3a2d9bd46234fd899586eee64aedcb244b30c","observation_id":"4b1325a6-460c-460c-ae7f-6ddbc9686921","resolution":{"observed_at":"2026-08-07T04:08:35.818773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06111","last_updated":"2025-11-03T11:52:57Z","snapshot_observed_at":"2026-08-09T00:51:47.897197Z","submitted_at":"2025-05-09T15:11:13Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06111","snapshot_observed_at":"2026-08-07T04:08:30.741535Z","title":"Univla: Learning to act anywhere with task-centric latent actions.arXiv preprint arXiv:2505.06111,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06374","last_updated":"2026-08-06T17:59:20Z","snapshot_observed_at":"2026-08-13T07:40:46.791650Z","submitted_at":"2026-08-06T17:59:20Z","title":"DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:30.741535Z"},"links":{"cited_paper":"/paper/2505.06111","citing_paper":"/paper/2608.06374"},"observation_digest":"sha256:6de7eb2b259e5fa93093243aa91ef3c879392a93463ae1176837b32dc5178088","observation_id":"8820e162-4e63-4253-a374-b4892f8b70f2","resolution":{"observed_at":"2026-08-07T04:08:30.741535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.05693","last_updated":"2026-07-08T05:36:16Z","snapshot_observed_at":"2026-08-10T04:18:53.177072Z","submitted_at":"2025-12-05T13:21:05Z","title":"HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.05693","snapshot_observed_at":"2026-08-07T04:08:31.338877Z","title":"Himoe-vla: Hierarchical mixture-of-experts for generalist vision-language-action policies","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06374","last_updated":"2026-08-06T17:59:20Z","snapshot_observed_at":"2026-08-13T07:40:46.791650Z","submitted_at":"2026-08-06T17:59:20Z","title":"DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:31.338877Z"},"links":{"cited_paper":"/paper/2512.05693","citing_paper":"/paper/2608.06374"},"observation_digest":"sha256:a6481fc92ec410095cbe7f8a632409ce9cf71ee10efef4eb042c2c19cdee7545","observation_id":"007ffccb-8d24-4cf9-b888-6ada2a48fe4c","resolution":{"observed_at":"2026-08-07T04:08:31.338877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13030","last_updated":"2025-12-25T08:16:05Z","snapshot_observed_at":"2026-07-06T22:38:59.725645Z","submitted_at":"2025-12-15T06:58:40Z","title":"Motus: A Unified Latent Action World Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13030","snapshot_observed_at":"2026-08-07T04:08:30.343015Z","title":"Motus: A unified latent action world model.arXiv preprint arXiv:2512.13030,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06374","last_updated":"2026-08-06T17:59:20Z","snapshot_observed_at":"2026-08-13T07:40:46.791650Z","submitted_at":"2026-08-06T17:59:20Z","title":"DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:30.343015Z"},"links":{"cited_paper":"/paper/2512.13030","citing_paper":"/paper/2608.06374"},"observation_digest":"sha256:6a537d36ba63b1c023757ba2800997be81e0a0babfbb5fb0b317000d9b2806ac","observation_id":"d42209f7-9bd3-4862-89a5-bf9b552a7448","resolution":{"observed_at":"2026-08-07T04:08:30.343015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18088","last_updated":"2025-08-27T17:52:42Z","snapshot_observed_at":"2026-08-01T01:17:47.017808Z","submitted_at":"2025-06-22T16:26:53Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18088","snapshot_observed_at":"2026-08-07T04:08:31.186529Z","title":"Robotwin 2.0: A scalable data generator and benchmark with strong domain randomization for robust bimanual robotic manipulation.arXiv preprint arXiv:2506.18088, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06374","last_updated":"2026-08-06T17:59:20Z","snapshot_observed_at":"2026-08-13T07:40:46.791650Z","submitted_at":"2026-08-06T17:59:20Z","title":"DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:31.186529Z"},"links":{"cited_paper":"/paper/2506.18088","citing_paper":"/paper/2608.06374"},"observation_digest":"sha256:05eb2c970ace74c2ffae60dc029334d12a4f27f4c9055fc1c8ba5489e87f29e5","observation_id":"10140715-8be0-4680-87c4-b1fcde1c48f8","resolution":{"observed_at":"2026-08-07T04:08:31.186529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.06374","last_updated":"2026-08-06T17:59:20Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-13T07:40:46.791650Z","submitted_at":"2026-08-06T17:59:20Z","title":"DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2608.06374."}