{"as_of":"2026-08-22T11:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4bce593cdec27483b946b0e07e38a30c83a97f1ce5e89d4d749340e5e2feb91c","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:03:56.849002Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":18,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:32:45.934582Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T09:09:43.343253Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13725","snapshot_observed_at":"2026-08-05T20:32:45.934582Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:45.934582Z"},"links":{"cited_paper":"/paper/2506.13725","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:73fa71070c66c44e473c9906977f8cd232b6e3f3e715ab6e79858a9f86a6460d","observation_id":"be481c99-2867-4366-a198-bc684b3d9df4","resolution":{"observed_at":"2026-08-05T20:32:45.934582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13725","snapshot_observed_at":"2026-08-04T09:08:16.922730Z","title":"Ceed-vla: Consistency vision-language-action model with early-exit decoding.arXiv preprint arXiv:2506.13725, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.17111","last_updated":"2025-10-23T15:06:39Z","snapshot_observed_at":"2026-08-04T09:08:06.048583Z","submitted_at":"2025-10-20T02:59:45Z","title":"Efficient Vision-Language-Action Models for Embodied Manipulation: A Systematic Survey","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-04T09:08:16.922730Z"},"links":{"cited_paper":"/paper/2506.13725","citing_paper":"/paper/2510.17111"},"observation_digest":"sha256:8d053c641290d606c161aeb1cba30178ad6e5216cce773a5147022fc4f3792fc","observation_id":"b51bbd19-9e80-4531-81eb-9e27543d25e2","resolution":{"observed_at":"2026-08-04T09:08:16.922730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"cited_work":{"arxiv_id":"2506.13725","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13725","snapshot_observed_at":"2026-07-04T09:09:43.343253Z","title":"arXiv preprint arXiv:2506.13725 (2025)","venue":null,"work_id":"e6ce7eeb-7ae4-45dd-aff0-4ef398868e06","year":2025},"citing_paper":{"arxiv_id":"2511.18082","last_updated":"2026-04-13T14:33:40Z","snapshot_observed_at":"2026-08-11T02:22:51.293115Z","submitted_at":"2025-11-22T14:44:03Z","title":"ActDistill: General Action-Guided Self-Derived Distillation for Efficient Vision-Language-Action Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-17T06:07:42.311608Z"},"links":{"cited_paper":"/paper/2506.13725","citing_paper":"/paper/2511.18082"},"observation_digest":"sha256:976b3dfd5c63d757a83445b293adef85a31ca944aff957c1a34a06932cac4087","observation_id":"6de05001-3b60-489c-ac47-885cc542e7bb","resolution":{"observed_at":"2026-05-17T06:09:09.450153Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13725","snapshot_observed_at":"2026-08-03T09:07:40.798831Z","title":"Ceed- vla: Consistency vision-language-action model with early-exit decoding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.14945","last_updated":"2026-06-24T08:09:11Z","snapshot_observed_at":"2026-08-03T09:07:37.767508Z","submitted_at":"2026-01-21T12:43:11Z","title":"TIDAL: Temporally Interleaved Diffusion and Action Loop for High-Frequency VLA Control","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T09:07:40.798831Z"},"links":{"cited_paper":"/paper/2506.13725","citing_paper":"/paper/2601.14945"},"observation_digest":"sha256:276dbcfe612577c06c25b743af70624d14a97043f3e50ee710654c6409dfa042","observation_id":"e1479c07-7d66-406b-a765-3283517e3000","resolution":{"observed_at":"2026-08-03T09:07:40.798831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"cited_work":{"arxiv_id":"2506.13725","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13725","snapshot_observed_at":"2026-07-04T09:09:43.343253Z","title":"arXiv preprint arXiv:2506.13725 (2025)","venue":null,"work_id":"e6ce7eeb-7ae4-45dd-aff0-4ef398868e06","year":2025},"citing_paper":{"arxiv_id":"2603.01581","last_updated":"2026-04-27T12:47:49Z","snapshot_observed_at":"2026-08-18T15:46:30.680632Z","submitted_at":"2026-03-02T08:12:03Z","title":"KERV: Kinematic-Rectified Speculative Decoding for Embodied VLA Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T18:39:58.095112Z"},"links":{"cited_paper":"/paper/2506.13725","citing_paper":"/paper/2603.01581"},"observation_digest":"sha256:6f3503c71c4338929d4f957399cf31ce7c34b14252cc042488e818276c75b7ec","observation_id":"a4bbf19b-aa62-45bf-bbf6-2cd307ba8a78","resolution":{"observed_at":"2026-05-15T18:40:14.570520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"cited_work":{"arxiv_id":"2506.13725","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13725","snapshot_observed_at":"2026-07-04T09:09:43.343253Z","title":"arXiv preprint arXiv:2506.13725 (2025)","venue":null,"work_id":"e6ce7eeb-7ae4-45dd-aff0-4ef398868e06","year":2025},"citing_paper":{"arxiv_id":"2603.17573","last_updated":"2026-04-27T12:41:06Z","snapshot_observed_at":"2026-08-11T12:57:12.574965Z","submitted_at":"2026-03-18T10:25:08Z","title":"HeiSD: Hybrid Speculative Decoding for Embodied Vision-Language-Action Models with Kinematic Awareness","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T09:15:50.963123Z"},"links":{"cited_paper":"/paper/2506.13725","citing_paper":"/paper/2603.17573"},"observation_digest":"sha256:3ba75008b2c7487438441997f58167a0ca7c060f84747cfcfb52c3c957a74c48","observation_id":"f45ad5cb-e421-42cc-b058-eadfe3834d53","resolution":{"observed_at":"2026-05-15T09:19:54.391118Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"cited_work":{"arxiv_id":"2506.13725","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13725","snapshot_observed_at":"2026-07-04T09:09:43.343253Z","title":"arXiv preprint arXiv:2506.13725 (2025)","venue":null,"work_id":"e6ce7eeb-7ae4-45dd-aff0-4ef398868e06","year":2025},"citing_paper":{"arxiv_id":"2603.19199","last_updated":"2026-05-16T06:32:19Z","snapshot_observed_at":"2026-08-10T22:18:18.061068Z","submitted_at":"2026-03-19T17:51:37Z","title":"FASTER: Rethinking Real-Time Flow VLAs","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-15T08:02:13.188363Z"},"links":{"cited_paper":"/paper/2506.13725","citing_paper":"/paper/2603.19199"},"observation_digest":"sha256:b2a410990402c740aa7108d3cf5d4a944e0f89a0f9414160ca4e221dd01d9399","observation_id":"4514a288-6e48-4563-a2c1-3652e0635de3","resolution":{"observed_at":"2026-05-15T08:05:15.405380Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"cited_work":{"arxiv_id":"2506.13725","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13725","snapshot_observed_at":"2026-07-04T09:09:43.343253Z","title":"arXiv preprint arXiv:2506.13725 (2025)","venue":null,"work_id":"e6ce7eeb-7ae4-45dd-aff0-4ef398868e06","year":2025},"citing_paper":{"arxiv_id":"2603.19199","last_updated":"2026-05-16T06:32:19Z","snapshot_observed_at":"2026-08-10T22:18:18.061068Z","submitted_at":"2026-03-19T17:51:37Z","title":"FASTER: Rethinking Real-Time Flow VLAs","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-21T10:48:56.280105Z"},"links":{"cited_paper":"/paper/2506.13725","citing_paper":"/paper/2603.19199"},"observation_digest":"sha256:a2b99b11aa84f2f32b9a32405130a37dbb07cc92c4b26775ff07907c28ceae91","observation_id":"8e9f5ba8-0293-4b62-9db0-94f9e7319f43","resolution":{"observed_at":"2026-05-21T10:50:01.049926Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"cited_work":{"arxiv_id":"2506.13725","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13725","snapshot_observed_at":"2026-07-04T09:09:43.343253Z","title":"arXiv preprint arXiv:2506.13725 (2025)","venue":null,"work_id":"e6ce7eeb-7ae4-45dd-aff0-4ef398868e06","year":2025},"citing_paper":{"arxiv_id":"2603.25661","last_updated":"2026-04-07T08:13:17Z","snapshot_observed_at":"2026-08-13T17:34:17.715834Z","submitted_at":"2026-03-26T17:14:57Z","title":"Fast-dVLA: Accelerating Discrete Diffusion VLA to Real-Time Performance","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T00:27:35.706107Z"},"links":{"cited_paper":"/paper/2506.13725","citing_paper":"/paper/2603.25661"},"observation_digest":"sha256:7463f34b8123057e449e33128fc788d3a3dd7c3b6aa1c8053874b5bb7e6a6d21","observation_id":"32cba324-89e1-4902-bc26-5192c4b9076c","resolution":{"observed_at":"2026-05-15T00:28:23.089779Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"cited_work":{"arxiv_id":"2506.13725","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13725","snapshot_observed_at":"2026-07-04T09:09:43.343253Z","title":"arXiv preprint arXiv:2506.13725 (2025)","venue":null,"work_id":"e6ce7eeb-7ae4-45dd-aff0-4ef398868e06","year":2025},"citing_paper":{"arxiv_id":"2603.26320","last_updated":"2026-08-06T10:15:07Z","snapshot_observed_at":"2026-08-16T22:25:00.007205Z","submitted_at":"2026-03-27T11:38:43Z","title":"DFM-VLA: Iterative Action Refinement for Robot Manipulation via Discrete Flow Matching","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-14T22:59:21.473359Z"},"links":{"cited_paper":"/paper/2506.13725","citing_paper":"/paper/2603.26320"},"observation_digest":"sha256:5d1d153d895bb4bfb500cb1acca3431653cd1ba2188d5b48d32308e5240dca8e","observation_id":"43e413fa-af44-456e-8a74-50381c5fd1c0","resolution":{"observed_at":"2026-05-14T22:59:34.161353Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"cited_work":{"arxiv_id":"2506.13725","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13725","snapshot_observed_at":"2026-07-04T09:09:43.343253Z","title":"arXiv preprint arXiv:2506.13725 (2025)","venue":null,"work_id":"e6ce7eeb-7ae4-45dd-aff0-4ef398868e06","year":2025},"citing_paper":{"arxiv_id":"2604.05323","last_updated":"2026-04-07T01:52:42Z","snapshot_observed_at":"2026-08-17T07:00:14.452436Z","submitted_at":"2026-04-07T01:52:42Z","title":"VLA-InfoEntropy: A Training-Free Vision-Attention Information Entropy Approach for Vision-Language-Action Models Inference Acceleration and Success","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T18:33:26.708966Z"},"links":{"cited_paper":"/paper/2506.13725","citing_paper":"/paper/2604.05323"},"observation_digest":"sha256:12f6c80e4d73c079204d752df5d78793cd237952b2ab28a9db80f43542d705b2","observation_id":"de9d4e31-5709-404c-a1a5-1c782d7ec6f8","resolution":{"observed_at":"2026-05-11T00:25:50.161228Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"cited_work":{"arxiv_id":"2506.13725","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13725","snapshot_observed_at":"2026-07-04T09:09:43.343253Z","title":"arXiv preprint arXiv:2506.13725 (2025)","venue":null,"work_id":"e6ce7eeb-7ae4-45dd-aff0-4ef398868e06","year":2025},"citing_paper":{"arxiv_id":"2604.17706","last_updated":"2026-04-24T09:42:43Z","snapshot_observed_at":"2026-08-16T21:24:05.741604Z","submitted_at":"2026-04-20T01:36:58Z","title":"OmniVLA-RL: A Vision-Language-Action Model with Spatial Understanding and Online RL","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-10T05:16:57.241755Z"},"links":{"cited_paper":"/paper/2506.13725","citing_paper":"/paper/2604.17706"},"observation_digest":"sha256:ddfe497f956d3bd092873cc7e4c25ebadc1786acfda4ffcca6d5c204c35fe759","observation_id":"b28306b3-e047-4f22-9032-da5062115548","resolution":{"observed_at":"2026-05-10T09:28:39.251472Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"cited_work":{"arxiv_id":"2506.13725","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13725","snapshot_observed_at":"2026-07-04T09:09:43.343253Z","title":"arXiv preprint arXiv:2506.13725 (2025)","venue":null,"work_id":"e6ce7eeb-7ae4-45dd-aff0-4ef398868e06","year":2025},"citing_paper":{"arxiv_id":"2605.16241","last_updated":"2026-05-15T17:48:25Z","snapshot_observed_at":"2026-08-17T18:35:49.747117Z","submitted_at":"2026-05-15T17:48:25Z","title":"Offline Semantic Guidance for Efficient Vision-Language-Action Policy Distillation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T18:41:12.533556Z"},"links":{"cited_paper":"/paper/2506.13725","citing_paper":"/paper/2605.16241"},"observation_digest":"sha256:94e748c074ed37ae541c79a71f2f088b6bff1db197344ade171cf80c3e6a8c39","observation_id":"edef16f2-4804-4bc3-8c2c-4357e1c26b7d","resolution":{"observed_at":"2026-05-20T18:43:38.645339Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"cited_work":{"arxiv_id":"2506.13725","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13725","snapshot_observed_at":"2026-07-04T09:09:43.343253Z","title":"arXiv preprint arXiv:2506.13725 (2025)","venue":null,"work_id":"e6ce7eeb-7ae4-45dd-aff0-4ef398868e06","year":2025},"citing_paper":{"arxiv_id":"2606.05737","last_updated":"2026-07-13T05:29:03Z","snapshot_observed_at":"2026-08-13T14:19:41.164631Z","submitted_at":"2026-06-04T05:58:30Z","title":"Let It Be Simple: One-Step Action Generation for Vision-Language-Action Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T03:11:29.041809Z"},"links":{"cited_paper":"/paper/2506.13725","citing_paper":"/paper/2606.05737"},"observation_digest":"sha256:9615506c4c9451ee78508d0a44981db52a25a19d4ae45836f44fb567be2aed20","observation_id":"0f1ab9eb-b80c-43ba-bd72-c3371d59acfd","resolution":{"observed_at":"2026-07-02T11:36:55.452695Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13725","snapshot_observed_at":"2026-07-14T18:24:22.623163Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.05737","last_updated":"2026-07-13T05:29:03Z","snapshot_observed_at":"2026-08-13T14:19:41.164631Z","submitted_at":"2026-06-04T05:58:30Z","title":"Let It Be Simple: One-Step Action Generation for Vision-Language-Action Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T18:24:22.623163Z"},"links":{"cited_paper":"/paper/2506.13725","citing_paper":"/paper/2606.05737"},"observation_digest":"sha256:1d6a7935b3789e8c40ab571cd8fd2cd9589d5e5012b215838edb629ff83a1673","observation_id":"72173b02-b85b-4226-8e25-984d447008cf","resolution":{"observed_at":"2026-07-14T18:24:22.623163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"cited_work":{"arxiv_id":"2506.13725","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13725","snapshot_observed_at":"2026-07-04T09:09:43.343253Z","title":"arXiv preprint arXiv:2506.13725 (2025)","venue":null,"work_id":"e6ce7eeb-7ae4-45dd-aff0-4ef398868e06","year":2025},"citing_paper":{"arxiv_id":"2606.19565","last_updated":"2026-06-17T20:08:14Z","snapshot_observed_at":"2026-08-07T10:17:45.129429Z","submitted_at":"2026-06-17T20:08:14Z","title":"Mix-QVLA: Task-Evidence-Aware Mixed-Precision Quantization of Vision-Language-Action Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T20:57:33.909350Z"},"links":{"cited_paper":"/paper/2506.13725","citing_paper":"/paper/2606.19565"},"observation_digest":"sha256:b7e55fb8a5a13d40cdb5b76571a78de7b47aa388f0f8f3b7d4d1c56109b8bd50","observation_id":"319d07c7-f9db-401f-ad47-a0beabb17060","resolution":{"observed_at":"2026-07-04T00:49:18.555750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"cited_work":{"arxiv_id":"2506.13725","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13725","snapshot_observed_at":"2026-07-04T09:09:43.343253Z","title":"arXiv preprint arXiv:2506.13725 (2025)","venue":null,"work_id":"e6ce7eeb-7ae4-45dd-aff0-4ef398868e06","year":2025},"citing_paper":{"arxiv_id":"2606.22540","last_updated":"2026-06-25T01:18:44Z","snapshot_observed_at":"2026-08-13T19:54:38.163011Z","submitted_at":"2026-06-21T14:54:07Z","title":"PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-26T10:27:00.283283Z"},"links":{"cited_paper":"/paper/2506.13725","citing_paper":"/paper/2606.22540"},"observation_digest":"sha256:6d736db6ddc1466c82b44e19faf4d4d7d67f112009d931eb1f5b7e1eec3aa268","observation_id":"03d29aec-462c-4a2b-af12-7d32e6c24390","resolution":{"observed_at":"2026-07-04T09:09:43.344653Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13725","snapshot_observed_at":"2026-08-04T04:31:42.146059Z","title":"2506.13725 , archivePrefix=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06370","last_updated":"2026-08-03T07:05:26Z","snapshot_observed_at":"2026-08-16T19:26:53.070749Z","submitted_at":"2026-07-07T15:10:15Z","title":"ActionCache: Training-Free Acceleration for Vision-Language-Action Models with Action Caching and Refinement","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T04:31:42.146059Z"},"links":{"cited_paper":"/paper/2506.13725","citing_paper":"/paper/2607.06370"},"observation_digest":"sha256:1f0c6dc83213387dc75f86acf76ac4193940fa4455f65602c11f57953a6375c0","observation_id":"9bda4dbb-82b4-493f-b9b7-de91a664ed53","resolution":{"observed_at":"2026-08-04T04:31:42.146059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.13725/citation-record","integrity":"/paper/2506.13725/integrity","json":"/paper/2506.13725/citation-record.json","paper":"/paper/2506.13725"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-15T20:03:56.609772Z","title":"Openflamingo: An open-source framework for training large autoregressive vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.609772Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:a2819eb740dc67302fc761ac255e4259045b4545380621ba7639686a0a2c675b","observation_id":"8d7ff528-4d4c-4ab2-be30-09d1a1843f17","resolution":{"observed_at":"2026-08-15T20:03:56.609772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:03:56.616066Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.616066Z"},"links":{"citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:d1f69a990e99ff402a8bc7cc99094a6c4ddfa819bb2ac6c0d54c6cdf0dfc3388","observation_id":"3b046983-0b0d-46a4-b054-e10e76269fce","resolution":{"observed_at":"2026-08-15T20:03:56.616066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:03:57.711298Z","title":"Rt-1: Robotics transformer for real-world control at scale,","venue":null,"work_id":"ce2b870b-1574-47ed-bf04-72352d31fd9a","year":2023},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.621040Z"},"links":{"citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:11b5b4ea49654a6a85d8005dc5979e5e45c995c65a3dd1bd3e1e7d0296fb1bbb","observation_id":"8123eacf-17c8-4197-a040-7a41ff0f6dd5","resolution":{"observed_at":"2026-08-15T20:03:57.715953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:03:57.694666Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control,","venue":null,"work_id":"173d11c5-881d-4890-9142-82ec480d3023","year":2023},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.626043Z"},"links":{"citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:67f4f071f8ae622bdf2fe250a4c7ef73f4c256c615242a73320a097e65db2080","observation_id":"32c889a8-cba3-4371-9fa6-40b0b62eee97","resolution":{"observed_at":"2026-08-15T20:03:57.700002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:03:56.631647Z","title":"Octo: An open-source generalist robot policy,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.631647Z"},"links":{"citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:a44bbf2181c501da5567b1bcc4ea6e508ca44d9a5f5fc0055f40baf4edfcff05","observation_id":"8753db4c-b8d1-4625-9ead-0cbd6356bca4","resolution":{"observed_at":"2026-08-15T20:03:56.631647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11815","last_updated":"2024-06-17T17:55:29Z","snapshot_observed_at":"2026-08-20T11:59:52.975840Z","submitted_at":"2024-06-17T17:55:29Z","title":"LLARVA: Vision-Action Instruction Tuning Enhances Robot Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11815","snapshot_observed_at":"2026-08-15T20:03:56.636770Z","title":"Llarva: Vision-action instruction tuning enhances robot learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.636770Z"},"links":{"cited_paper":"/paper/2406.11815","citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:cdbbd0b853466bbfe153b1316fd2f6b24b7ce6b5383032ce6b17b2a68b553f9b","observation_id":"4d5d0a9d-c5bd-49e2-a846-cf6f124625f9","resolution":{"observed_at":"2026-08-15T20:03:56.636770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:03:56.642401Z","title":"Germ: A generalist robotic model with mixture-of-experts for quadruped robot,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.642401Z"},"links":{"citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:20d8c3cb8c57461d069e13f31f276caba97a1f14110efb3219a55a6fc9ad7ec4","observation_id":"e9025fcc-bbec-4802-82c7-ffa1025b413f","resolution":{"observed_at":"2026-08-15T20:03:56.642401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-16T21:53:14.144225Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-15T20:03:56.647276Z","title":"Openvla: An open-source vision-language-action model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.647276Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:accd792313e97147703d5a0c5a0e0d4a1ea315065f4fb91c1b5e14d934f0baa2","observation_id":"c20e7363-a77f-4ad0-a9f6-3ecd1e04b491","resolution":{"observed_at":"2026-08-15T20:03:56.647276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:03:56.652802Z","title":"Palm-e: An embodied multimodal language model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.652802Z"},"links":{"citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:58e1e056bb34a18af30d8ad0fcd9975030abbb9c87d9319dbf7f6f39ccb2858f","observation_id":"60da48d7-a71e-49dc-9f54-e6e8087b0fc0","resolution":{"observed_at":"2026-08-15T20:03:56.652802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-15T20:03:56.657488Z","title":"3d-vla: A 3d vision-language-action generative world model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.657488Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:b5b12927b9c2c42ef4c9f72c03bd5bfd85675e438571c269b9a82f6fd1bea98d","observation_id":"28d62628-12bb-4d40-bd52-e4a219ccefa7","resolution":{"observed_at":"2026-08-15T20:03:56.657488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-15T20:03:56.662472Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.662472Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:06166612f652dcedb32a6c9fa57ebfe7da0696e7bf6f71cbd94e99d723aea4a4","observation_id":"dcb1a255-0787-44d4-9fda-e6acc987ee25","resolution":{"observed_at":"2026-08-15T20:03:56.662472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-08-16T17:53:54.636855Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-15T20:03:56.667365Z","title":"π0: A vision-language-action flow model for general robot control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.667365Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:9327fd43e97f127fac58908e2dc47b1d4d913769d2ff04af4a66c74275369b88","observation_id":"90b907f0-9f9b-4400-a1ac-5c1cd691a1f1","resolution":{"observed_at":"2026-08-15T20:03:56.667365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:03:56.672708Z","title":"Accelerating vision-language-action model integrated with action chunking via parallel decoding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.672708Z"},"links":{"citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:4dbac0095e45bb861079fe872d0a3eb078668c489b75d41b2debf91632f4cb20","observation_id":"98620e95-121c-464b-bea3-74cb0e75441b","resolution":{"observed_at":"2026-08-15T20:03:56.672708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-16T14:02:38.692247Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10826","snapshot_observed_at":"2026-08-15T20:03:56.677639Z","title":"Rationalvla: A rational vision-language-action model with dual system,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.677639Z"},"links":{"cited_paper":"/paper/2506.10826","citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:db92c7d8b26d4d7473585e4331ed33ac507c9896e8c428561e59e0cb25630f8c","observation_id":"663a58cd-4f79-4962-ad9a-8e0d91a5afde","resolution":{"observed_at":"2026-08-15T20:03:56.677639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:03:56.682676Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models: Open x-embodiment collaboration 0,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.682676Z"},"links":{"citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:f6faa876ef0a591caae59e36f3a337bb68123a6a8ed61697794681926dcb8bfa","observation_id":"c67430d8-5179-40c7-a1e8-0e6b7916734f","resolution":{"observed_at":"2026-08-15T20:03:56.682676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:03:57.635394Z","title":"Rh20t: A com- prehensive robotic dataset for learning diverse skills in one-shot,","venue":null,"work_id":"324733d0-2d91-47a1-98d8-710e80a7b5a1","year":2024},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.687305Z"},"links":{"citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:c0d2db9fc945f6174aa5a4f876b0cd2ac44e23fda230cb06f46703edb034cf73","observation_id":"97f08e80-6d0a-4ecc-9f59-c1ff72babc30","resolution":{"observed_at":"2026-08-15T20:03:57.641491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16098","last_updated":"2023-11-27T18:59:25Z","snapshot_observed_at":"2026-08-19T02:20:11.693473Z","submitted_at":"2023-11-27T18:59:25Z","title":"On Bringing Robots Home","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16098","snapshot_observed_at":"2026-08-15T20:03:56.691883Z","title":"On bringing robots home,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.691883Z"},"links":{"cited_paper":"/paper/2311.16098","citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:930529d00eed0d1c64846497b6e3a1154929b47c5591d86867103d8ddc505e55","observation_id":"be4f74f1-1a31-4a04-9848-f6ff67d12ef2","resolution":{"observed_at":"2026-08-15T20:03:56.691883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:03:57.619542Z","title":"Bridgedata v2: A dataset for robot learning at scale,","venue":null,"work_id":"aaa1aa09-2acd-4914-8d6a-f40611d202d6","year":2023},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.696730Z"},"links":{"citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:3c09fcde1b7d768f59873b4359d86e4e8b98f64fa8fbb7d28aa9481f51ddbf5b","observation_id":"d88e83db-ec85-40f2-b9cf-0800ba16b652","resolution":{"observed_at":"2026-08-15T20:03:57.624607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-08-15T09:35:08.116329Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-15T20:03:56.701922Z","title":"Fine-tuning vision-language-action models: Optimizing speed and success,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.701922Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:85ea0dac4f4ba8208f2aa58efe1aee1f063d6f284658f744b1dd8353b974a69d","observation_id":"283ede15-9c16-414e-b230-4d389e0e853e","resolution":{"observed_at":"2026-08-15T20:03:56.701922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:03:56.707036Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.707036Z"},"links":{"citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:37281404be4685d9e8ebfc3aaecd8ce3ed61dd7b6e318c8c0bb9ed4e35a247c8","observation_id":"c20f4237-8534-4018-bdbd-00955cff6154","resolution":{"observed_at":"2026-08-15T20:03:56.707036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:03:56.712545Z","title":"Consistency models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.712545Z"},"links":{"citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:6e02a8f4561a85ae08e29e23123c4feb861ecf3e2441c9307a7f7b8115630a3f","observation_id":"7418f760-567b-4c63-a954-c08cc21408a5","resolution":{"observed_at":"2026-08-15T20:03:56.712545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:03:57.583437Z","title":"Awq: Activation-aware weight quantization for on-device llm compression and acceleration,","venue":null,"work_id":"6dd61e2e-7a11-4c4d-baae-2535d88e8a34","year":2024},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.717483Z"},"links":{"citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:dfc338c154795e837c373b5bd0f824b6496a7fd722b6056669fee1a6cc7efb53","observation_id":"417e8cc1-00f7-484b-9bac-9458a6118d32","resolution":{"observed_at":"2026-08-15T20:03:57.588659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:03:57.567337Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models,","venue":null,"work_id":"39a82b09-75b9-4060-bf73-c890a03b90b9","year":2024},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.722233Z"},"links":{"citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:7c79a286b7e2fd29965050dd4ed485e8c08f98d3cf055022a0d1ee02685e22bf","observation_id":"e4c413fb-5ece-43cb-88d7-ba06764b34a5","resolution":{"observed_at":"2026-08-15T20:03:57.572830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:03:56.726915Z","title":"Deer-vla: Dynamic inference of multimodal large language models for efficient robot execution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.726915Z"},"links":{"citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:1c55ca9bf6738402c26fdb412cfb112df44e923dda44fc408ce09656aaacd5da","observation_id":"f056a893-b636-48c9-9d54-2719e66ddb04","resolution":{"observed_at":"2026-08-15T20:03:56.726915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01034","last_updated":"2024-12-02T01:33:49Z","snapshot_observed_at":"2026-08-14T15:17:01.572742Z","submitted_at":"2024-12-02T01:33:49Z","title":"Quantization-Aware Imitation-Learning for Resource-Efficient Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01034","snapshot_observed_at":"2026-08-15T20:03:56.731563Z","title":"Quantization-aware imitation- learning for resource-efficient robotic control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.731563Z"},"links":{"cited_paper":"/paper/2412.01034","citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:70cb8c762cd4c882223f3f8f27d3ddf47c1108e905cfa601bcf60244df5f4d88","observation_id":"c563878a-e1fb-49dc-80cf-27b0282cf637","resolution":{"observed_at":"2026-08-15T20:03:56.731563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-16T13:45:24.500059Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-08-15T20:03:56.736691Z","title":"Robomamba: Multimodal state space model for efficient robot reasoning and manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.736691Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:772cea0e1b7ebdd7f92fb1ac9d53c2e993758d666c3a65aa21a4fe6550793d4e","observation_id":"04764f86-045f-4794-8ef7-a3205db38888","resolution":{"observed_at":"2026-08-15T20:03:56.736691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12514","last_updated":"2025-05-13T11:02:20Z","snapshot_observed_at":"2026-08-21T21:05:25.248896Z","submitted_at":"2024-09-19T07:10:18Z","title":"TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12514","snapshot_observed_at":"2026-08-15T20:03:56.741574Z","title":"Tinyvla: Towards fast, data-efficient vision-language-action models for robotic manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.741574Z"},"links":{"cited_paper":"/paper/2409.12514","citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:f660e3d32bfc9e8e99fa49aecebb3d731163fc31bf6601048050249bf6ef9702","observation_id":"7693a43e-c1e0-432c-a104-a3554f971536","resolution":{"observed_at":"2026-08-15T20:03:56.741574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:03:56.746834Z","title":"Vla-cache: Towards efficient vision-language-action model via adaptive token caching in robotic manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.746834Z"},"links":{"citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:79247c0edc518c60cfcdc1d9141f89f492d12f7b652dea74809b8c20fd210eff","observation_id":"d5b16d86-d8fe-4c70-b43c-c20afe52f9d7","resolution":{"observed_at":"2026-08-15T20:03:56.746834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-08-21T05:15:36.931588Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-15T20:03:56.752158Z","title":"Fast: Efficient action tokenization for vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.752158Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:0dffa6333d869b98b0a3e8ea65907bfd4efa50672a590c449dc0bd8dac8a1f74","observation_id":"81046b82-50ff-4aeb-88e3-2841aa15a5cb","resolution":{"observed_at":"2026-08-15T20:03:56.752158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20384","last_updated":"2025-04-14T11:39:39Z","snapshot_observed_at":"2026-08-18T18:57:38.430017Z","submitted_at":"2025-03-26T10:05:38Z","title":"MoLe-VLA: Dynamic Layer-skipping Vision Language Action Model via Mixture-of-Layers for Efficient Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20384","snapshot_observed_at":"2026-08-15T20:03:56.757584Z","title":"Mole-vla: Dynamic layer-skipping vision language action model via mixture-of-layers for efficient robot manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.757584Z"},"links":{"cited_paper":"/paper/2503.20384","citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:9cdcf498e06e6bc9e33df95bde548239d4798643489ee320ee06b0fa82b83309","observation_id":"6c1acb7b-b4ec-4f88-8a51-21a1186ea5da","resolution":{"observed_at":"2026-08-15T20:03:56.757584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:03:56.762565Z","title":"Consistency policy: Accelerated visuomotor policies via consistency distillation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.762565Z"},"links":{"citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:d40736b25287b96cdaf02899b85db65ff89a0d81a2ed7676fc07a7bdcd5a1872","observation_id":"a8a594df-baa4-4acc-81d1-dc4364d9e177","resolution":{"observed_at":"2026-08-15T20:03:56.762565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01586","last_updated":"2025-09-06T02:40:42Z","snapshot_observed_at":"2026-08-18T04:49:38.607492Z","submitted_at":"2024-06-03T17:59:23Z","title":"ManiCM: Real-time 3D Diffusion Policy via Consistency Model for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01586","snapshot_observed_at":"2026-08-15T20:03:56.767431Z","title":"Manicm: Real-time 3d diffusion policy via consistency model for robotic manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.767431Z"},"links":{"cited_paper":"/paper/2406.01586","citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:61968768cd8eecb93a921f2fad858227a666dd29fa3c3c3e3e59b6809ea84b1a","observation_id":"95d490de-c3ce-43e3-aa1b-158dbf2f64ad","resolution":{"observed_at":"2026-08-15T20:03:56.767431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:03:56.772308Z","title":"Flowpolicy: Enabling fast and robust 3d flow-based policy via consistency flow matching for robot manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.772308Z"},"links":{"citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:1ce3a509b49f8fd5c52703343c19220fd0ed35f1acb7dac1e113de4d8162c712","observation_id":"6020c8c0-ed8b-4a8f-bb73-890335e76e68","resolution":{"observed_at":"2026-08-15T20:03:56.772308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09265","last_updated":"2024-12-19T12:11:13Z","snapshot_observed_at":"2026-08-16T13:00:09.856902Z","submitted_at":"2024-12-12T13:22:02Z","title":"Score and Distribution Matching Policy: Advanced Accelerated Visuomotor Policies via Matched Distillation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09265","snapshot_observed_at":"2026-08-15T20:03:56.777186Z","title":"Score and distribution matching policy: Advanced accelerated visuomotor policies via matched distillation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.777186Z"},"links":{"cited_paper":"/paper/2412.09265","citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:ec3d39f8b6b62c32229df0a4f2418a961b71d9c4917cde7fc20858da7387bb62","observation_id":"6a64deeb-7bdb-4814-97db-d538d186e8a0","resolution":{"observed_at":"2026-08-15T20:03:56.777186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:03:57.518867Z","title":"Accelerating transformer inference for translation via parallel decoding,","venue":null,"work_id":"a811f238-b9c4-42e0-a56d-772c5c7d4145","year":2023},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.782407Z"},"links":{"citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:e86d566cffd541f5f039831c559672b603ca54a28250ffa784ee94b1562495ea","observation_id":"a2380b1e-6a9e-4a29-90b5-df023aacbbc5","resolution":{"observed_at":"2026-08-15T20:03:57.524743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:03:57.500906Z","title":"Cllms: Consistency large language models,","venue":null,"work_id":"ceded43e-efb9-4279-a50e-ff38da0f683c","year":2024},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.787063Z"},"links":{"citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:ebf2426b947e758482afe9c50b787aca734e4f11004c7d16905976f3c6840a82","observation_id":"5633983e-ec13-490c-8444-57d249dcc95e","resolution":{"observed_at":"2026-08-15T20:03:57.506961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:03:57.483976Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware,","venue":null,"work_id":"66555a3d-fa34-422d-9eba-1a30251bb7fc","year":2023},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.792512Z"},"links":{"citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:df78761b11ab51eab61a244006ab0a8cce3f166639c5d0f59daad87ab8c5d943","observation_id":"bc7bf07c-dba3-4e95-8782-3429467f64c6","resolution":{"observed_at":"2026-08-15T20:03:57.489454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05618","last_updated":"2022-04-12T08:25:34Z","snapshot_observed_at":"2026-08-21T20:27:53.057202Z","submitted_at":"2022-04-12T08:25:34Z","title":"When Should We Prefer Offline Reinforcement Learning Over Behavioral Cloning?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05618","snapshot_observed_at":"2026-08-15T20:03:56.797614Z","title":"When should we prefer offline reinforcement learning over behavioral cloning?","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.797614Z"},"links":{"cited_paper":"/paper/2204.05618","citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:6f53e97b6f6d5645872bccb3cfce1bafff2db63a10b88d6a4d0f6faa7a725280","observation_id":"251fbc9a-589b-4c48-a248-b64ea91a439d","resolution":{"observed_at":"2026-08-15T20:03:56.797614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08007","last_updated":"2025-03-11T03:13:45Z","snapshot_observed_at":"2026-08-16T12:51:17.669045Z","submitted_at":"2025-03-11T03:13:45Z","title":"MoRE: Unlocking Scalability in Reinforcement Learning for Quadruped Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08007","snapshot_observed_at":"2026-08-15T20:03:56.802853Z","title":"More: Unlocking scalability in reinforcement learning for quadruped vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.802853Z"},"links":{"cited_paper":"/paper/2503.08007","citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:d1bda4f2afc12d252779c8d6c9ebc7db8938804ff2b0a0008de84a5bc7e0d6f1","observation_id":"ba97a53e-4464-446e-a6e6-c15e7c2d03d2","resolution":{"observed_at":"2026-08-15T20:03:56.802853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:03:57.466873Z","title":"Calvin: A benchmark for language- conditioned policy learning for long-horizon robot manipulation tasks,","venue":null,"work_id":"69ee3502-ab3c-47df-99c2-0aabf440b337","year":2021},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.807897Z"},"links":{"citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:8f0500cd83487542e0d03b3e96816bedc371ccd596093884c353edfbee713f10","observation_id":"45fda0ce-a7fa-4b52-a704-5368ba5c5aff","resolution":{"observed_at":"2026-08-15T20:03:57.472128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:03:57.450644Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learning,","venue":null,"work_id":"cb89de2d-f326-4d88-a381-4bbac5bdfc65","year":2024},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.812868Z"},"links":{"citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:40c2687af7c0ad8e0d2a3cacf41f7bd0bcddde4d019449b8bd71852d167913b8","observation_id":"7de4386b-2053-45f6-aad1-81681cc3f0c1","resolution":{"observed_at":"2026-08-15T20:03:57.455793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-15T20:03:56.818379Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.818379Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:030bcbe885f59d41419fb4951256d48be97fb17683d241d03a98b452c3e86d86","observation_id":"f73ce12c-f74e-4144-b1a4-9d6cf85fa236","resolution":{"observed_at":"2026-08-15T20:03:56.818379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-08-15T01:31:24.363496Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-15T20:03:56.823526Z","title":"Sparsevlm: Visual token sparsification for efficient vision-language model inference,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.823526Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:d958c9d0ba18f1d18a7917c46ffc4bd43a8a745450ebcbd33588af69b30c9925","observation_id":"f8c0c19f-b2b3-462e-ad71-9f98a8aafa37","resolution":{"observed_at":"2026-08-15T20:03:56.823526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:03:57.434667Z","title":"Minivla: A better vla with a smaller footprint,","venue":null,"work_id":"8e5290e6-8649-4394-92dc-478d40806c94","year":2024},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.828838Z"},"links":{"citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:3c02ff3e7e0fa21fcb31c541bf7130fdbfc76c22c369f0315569a749cf1635d0","observation_id":"e8abecc4-7640-45fa-b7ce-9ec4da54c0a0","resolution":{"observed_at":"2026-08-15T20:03:57.439775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-08-07T02:44:43.738657Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-08-15T20:03:56.833941Z","title":"Robotic control via embodied chain-of-thought reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.833941Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:84db96f18b422e244f0cc3052cf898e73aa24dec7fc678181acfc2556233ceb6","observation_id":"2a72d645-d7af-46d4-afa4-f70c71d04122","resolution":{"observed_at":"2026-08-15T20:03:56.833941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23705","last_updated":"2025-05-29T17:40:09Z","snapshot_observed_at":"2026-08-19T18:45:15.073189Z","submitted_at":"2025-05-29T17:40:09Z","title":"Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23705","snapshot_observed_at":"2026-08-15T20:03:56.839049Z","title":"Knowledge insulating vision-language-action models: Train fast, run fast, generalize better,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.839049Z"},"links":{"cited_paper":"/paper/2505.23705","citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:131c1ff7ad4dfc0cfcc746026ab7d9077fcab2e6f130686759065aeee6b75e66","observation_id":"865cb0b7-3c73-4e0c-8e43-d17f21599335","resolution":{"observed_at":"2026-08-15T20:03:56.839049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:03:56.843873Z","title":"Pybullet, a python module for physics simulation for games, robotics and machine learning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.843873Z"},"links":{"citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:757b525468e4a6889af7b0b82e37e49e0c1b1ba2d2856e8817fc87de089d13c4","observation_id":"cd1c1245-ea67-4bc7-9850-b88b26c04e42","resolution":{"observed_at":"2026-08-15T20:03:56.843873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:03:57.402645Z","title":"Vlas: Vision-language- action model with speech instructions for customized robot manipulation,","venue":null,"work_id":"4ad4302b-c3d2-4c48-bbfe-e9c9d70d2f4c","year":2025},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.849002Z"},"links":{"citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:e264a577a98bd7d46fed5f59380371beeb5c5e23494e4aee29a12dbfa46ff1b4","observation_id":"f098090b-396d-48af-9e10-96fee243fde1","resolution":{"observed_at":"2026-08-15T20:03:57.410395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 18 inbound Pith citation observations for arXiv:2506.13725."}