{"as_of":"2026-08-16T18:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:77221b8a2d8f4e0930df4a4b479addb03753f59cd4eda0367874ee6db224e692","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:42:22.520527Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":30,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T16:26:37.873643Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T09:09:43.353580Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2508.13073","last_updated":"2025-09-01T08:10:01Z","snapshot_observed_at":"2026-08-07T15:40:31.068428Z","submitted_at":"2025-08-18T16:45:48Z","title":"Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey","version":2},"reference_index":190,"source":"pdf_text","source_observed_at":"2026-05-17T20:28:15.818016Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2508.13073"},"observation_digest":"sha256:981e9e8363190855d2adfbf8c3df968976809ffb93596efc6360ba4ba197f360","observation_id":"4316c6d6-fead-4c95-9ae8-ee1f59723499","resolution":{"observed_at":"2026-05-17T20:28:16.171413Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-08-15T16:26:37.873643Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.05614","last_updated":"2026-05-24T09:40:18Z","snapshot_observed_at":"2026-08-15T16:19:47.543669Z","submitted_at":"2025-09-06T06:22:19Z","title":"SpecPrune-VLA: Accelerating Vision-Language-Action Models via Action-Aware Self-Speculative Pruning","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T16:26:37.873643Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2509.05614"},"observation_digest":"sha256:12b63393313baff40ccdfaef6ac76ef1662fc627c48cd455fc5ad71a36714c09","observation_id":"44d9d7e3-ee97-4034-88c2-386843edd8bd","resolution":{"observed_at":"2026-08-15T16:26:37.873643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-08-04T19:47:08.917977Z","title":"Siyu Xu, Yunke Wang, Chenghao Xia, Dihao Zhu, Tao Huang, and Chang Xu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09090","last_updated":"2025-09-11T01:52:25Z","snapshot_observed_at":"2026-08-15T09:18:31.650518Z","submitted_at":"2025-09-11T01:52:25Z","title":"SQAP-VLA: A Synergistic Quantization-Aware Pruning Framework for High-Performance Vision-Language-Action Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T19:47:08.917977Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2509.09090"},"observation_digest":"sha256:48bbdc7f0d2deefa9675421d881090be5060e6300e7022d2a790255623540136","observation_id":"3b59d997-6657-4795-9fa9-181e2d445d87","resolution":{"observed_at":"2026-08-04T19:47:08.917977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-08-04T09:08:10.480133Z","title":"Efficientvla: Training-free acceleration and compression for vision-language-action models.arXiv preprint arXiv:2506.10100, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.17111","last_updated":"2025-10-23T15:06:39Z","snapshot_observed_at":"2026-08-04T09:08:06.048583Z","submitted_at":"2025-10-20T02:59:45Z","title":"Efficient Vision-Language-Action Models for Embodied Manipulation: A Systematic Survey","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T09:08:10.480133Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2510.17111"},"observation_digest":"sha256:8a15fac4663539c75cf5c834f9a8388875a0376eb172e384812dccff85733f1a","observation_id":"d008c444-3c0a-4ba0-98e6-d5093b28e79b","resolution":{"observed_at":"2026-08-04T09:08:10.480133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2511.15279","last_updated":"2026-04-03T06:36:12Z","snapshot_observed_at":"2026-08-13T00:45:20.091739Z","submitted_at":"2025-11-19T09:42:08Z","title":"Look, Zoom, Understand: The Robotic Eyeball for Embodied Perception","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-17T21:03:28.341042Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2511.15279"},"observation_digest":"sha256:519f07c9236f1a21aedf456b9a29f275e4a43f60493aea256c634c39d49041da","observation_id":"e53e1bc3-8d58-4f2b-a346-7bdc45d1b570","resolution":{"observed_at":"2026-05-17T21:05:15.691585Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2511.18082","last_updated":"2026-04-13T14:33:40Z","snapshot_observed_at":"2026-08-11T02:22:51.293115Z","submitted_at":"2025-11-22T14:44:03Z","title":"ActDistill: General Action-Guided Self-Derived Distillation for Efficient Vision-Language-Action Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-17T06:07:42.311608Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2511.18082"},"observation_digest":"sha256:66a3c38764b00c53027cc80ad821ef6e22b226323b93ac5c6f1202a6274fc81f","observation_id":"4e054053-f9d8-44d1-ac88-d40fce46e3fc","resolution":{"observed_at":"2026-05-17T06:09:09.442219Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-08-03T17:38:20.825770Z","title":"Ef- ficientVLA: Training-free acceleration and compression for vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.11891","last_updated":"2026-07-02T17:23:13Z","snapshot_observed_at":"2026-08-13T12:16:49.743297Z","submitted_at":"2025-12-09T16:53:44Z","title":"VLSA: Vision-Language-Action Models with Plug-and-Play Safety Constraint Layer","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T17:38:20.825770Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2512.11891"},"observation_digest":"sha256:f62b3290e88337c9fcda088d2db89f440d5d5160f5b93937d35b4e470a03de2e","observation_id":"0f28b4b9-3a3a-4405-a49b-547632d1ed6d","resolution":{"observed_at":"2026-08-03T17:38:20.825770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2601.12894","last_updated":"2026-05-15T13:46:26Z","snapshot_observed_at":"2026-08-02T15:06:51.761583Z","submitted_at":"2026-01-19T09:50:36Z","title":"Sparse ActionGen: Accelerating Diffusion Policy with Real-time Pruning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T16:33:41.439450Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2601.12894"},"observation_digest":"sha256:ebcbc28058a0b2e8c0a9e677c6de5770fc3a94c4d0ad8be641d36050e71d7c6c","observation_id":"981cc3f0-e0b8-4a8a-a7d9-342e1c6d426b","resolution":{"observed_at":"2026-05-21T16:34:16.323095Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-08-03T09:07:40.671144Z","title":"Efficientvla: Training-free acceleration and compression for vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.14945","last_updated":"2026-06-24T08:09:11Z","snapshot_observed_at":"2026-08-03T09:07:37.767508Z","submitted_at":"2026-01-21T12:43:11Z","title":"TIDAL: Temporally Interleaved Diffusion and Action Loop for High-Frequency VLA Control","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T09:07:40.671144Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2601.14945"},"observation_digest":"sha256:ba63932b52ea987ec7a92decb21f4d1d52f30c8db0503a658752d2ef23048987","observation_id":"02ab87f7-bc0e-40eb-9e14-48390c2f3690","resolution":{"observed_at":"2026-08-03T09:07:40.671144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2602.20309","last_updated":"2026-04-06T23:32:59Z","snapshot_observed_at":"2026-08-11T03:24:57.486480Z","submitted_at":"2026-02-23T19:55:54Z","title":"QuantVLA: Scale-Calibrated Post-Training Quantization for Vision-Language-Action Models","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-15T20:20:10.435886Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2602.20309"},"observation_digest":"sha256:4a10bd79a980fd7a34fb5d8eba4c1a34338f660d6dfaf9cdff7bb8756df43d35","observation_id":"6c7d9eef-d914-4cd6-a27e-074b5a3e79db","resolution":{"observed_at":"2026-05-15T20:20:17.316243Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2603.01581","last_updated":"2026-04-27T12:47:49Z","snapshot_observed_at":"2026-08-16T01:41:25.937044Z","submitted_at":"2026-03-02T08:12:03Z","title":"KERV: Kinematic-Rectified Speculative Decoding for Embodied VLA Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-15T18:39:58.095112Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2603.01581"},"observation_digest":"sha256:7c0f281b4ac30842acd82e66156c484aaa58cd716c9a20b2ad383928718832bc","observation_id":"f0f7db96-b64f-48a4-b027-42b339bfb857","resolution":{"observed_at":"2026-05-15T18:40:14.556429Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2603.14371","last_updated":"2026-05-18T10:25:25Z","snapshot_observed_at":"2026-08-16T16:55:30.689482Z","submitted_at":"2026-03-15T13:23:56Z","title":"OxyGen: Unified KV Cache Management for VLA Inference under Multi-Task Parallelism","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-21T11:46:12.134869Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2603.14371"},"observation_digest":"sha256:3f55c5f3cd63b0c018714545026fb351b49a85619d1ca38ea6359abee3aba812","observation_id":"1f69e69a-47b0-4c55-bd0c-c444b8940e1a","resolution":{"observed_at":"2026-05-21T11:50:03.894952Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2603.17573","last_updated":"2026-04-27T12:41:06Z","snapshot_observed_at":"2026-08-11T12:57:12.574965Z","submitted_at":"2026-03-18T10:25:08Z","title":"HeiSD: Hybrid Speculative Decoding for Embodied Vision-Language-Action Models with Kinematic Awareness","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T09:15:50.963123Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2603.17573"},"observation_digest":"sha256:844382f2e76ac6acc648240db3e265a7a5ac3305a1d54e1afc5776696c46f7fd","observation_id":"f7d4b8bd-f3a8-446c-b38e-06586f789013","resolution":{"observed_at":"2026-05-15T09:19:54.367062Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2603.25661","last_updated":"2026-04-07T08:13:17Z","snapshot_observed_at":"2026-08-13T17:34:17.715834Z","submitted_at":"2026-03-26T17:14:57Z","title":"Fast-dVLA: Accelerating Discrete Diffusion VLA to Real-Time Performance","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T00:27:35.706107Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2603.25661"},"observation_digest":"sha256:dade85452339c3b5ee3c722ad185b7b537b224554b73d2450de250484266c5d8","observation_id":"64185bdc-e3af-438c-9c05-343412c1578a","resolution":{"observed_at":"2026-05-15T00:28:23.079901Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2604.02965","last_updated":"2026-04-03T10:55:51Z","snapshot_observed_at":"2026-08-11T02:34:07.052638Z","submitted_at":"2026-04-03T10:55:51Z","title":"Open-Loop Planning, Closed-Loop Verification: Speculative Verification for VLA","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-13T19:45:17.852646Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2604.02965"},"observation_digest":"sha256:5acfcf7da096a409184a30cdf9be790eecc602a0b3f4cd1ae1888c6218d26578","observation_id":"4d22d0a3-9b6d-46ae-996a-8e5284e889b1","resolution":{"observed_at":"2026-05-13T19:48:11.466762Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2604.05656","last_updated":"2026-04-07T09:56:03Z","snapshot_observed_at":"2026-08-11T01:52:19.449746Z","submitted_at":"2026-04-07T09:56:03Z","title":"SnapFlow: One-Step Action Generation for Flow-Matching VLAs via Progressive Self-Distillation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-10T19:49:43.492952Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2604.05656"},"observation_digest":"sha256:85aab7bf7a4e4499b7ce6d92c43a36b79d5ca6b86674d6f04a5d178ed735c9e8","observation_id":"c8506f8c-8a63-4f16-b377-97d022dfb03a","resolution":{"observed_at":"2026-05-10T22:30:49.378979Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2604.05672","last_updated":"2026-04-15T03:34:03Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T10:18:40Z","title":"A1: A Fully Transparent Open-Source, Adaptive and Efficient Truncated Vision-Language-Action Model","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T19:31:23.255452Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2604.05672"},"observation_digest":"sha256:acc59da34f55868c1e073cf0649fb46e61cf67cafa74cd30db2043bcca2f071e","observation_id":"e1dd9d99-fa7f-46ff-8421-80aa2b4d6211","resolution":{"observed_at":"2026-05-10T22:50:51.343242Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2604.24447","last_updated":"2026-04-27T13:12:16Z","snapshot_observed_at":"2026-08-11T15:37:05.363567Z","submitted_at":"2026-04-27T13:12:16Z","title":"Characterizing Vision-Language-Action Models across XPUs: Constraints and Acceleration for On-Robot Deployment","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-08T03:04:46.460069Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2604.24447"},"observation_digest":"sha256:6f856e584f32f6a3cb325b5917ee786fc0765cfa24e739b6b94e5e29e4f1cd75","observation_id":"95c54592-f7f1-4fec-a8ff-1bd60566a19a","resolution":{"observed_at":"2026-05-11T22:16:52.096217Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2605.13316","last_updated":"2026-05-13T10:28:50Z","snapshot_observed_at":"2026-08-12T10:39:07.918347Z","submitted_at":"2026-05-13T10:28:50Z","title":"Test-time Sparsity for Extreme Fast Action Diffusion","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-14T19:46:12.266227Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2605.13316"},"observation_digest":"sha256:d9caf28f8bbeb4259da0a76a8b6e90a58bc1a71f53274db3095b610a41eddfc0","observation_id":"13ae0dad-5a0d-425c-951a-b9c3994a7148","resolution":{"observed_at":"2026-05-14T19:47:52.891164Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2605.13778","last_updated":"2026-05-13T16:57:51Z","snapshot_observed_at":"2026-08-16T12:12:32.701922Z","submitted_at":"2026-05-13T16:57:51Z","title":"Realtime-VLA FLASH: Speculative Inference Framework for Diffusion-based VLAs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-14T17:50:54.574805Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2605.13778"},"observation_digest":"sha256:487576786ac478bcb45aac938374c616e3785b0809833c0bcbc46c0459f57569","observation_id":"0107d8df-f2db-41c4-bcb2-7dad63fca88d","resolution":{"observed_at":"2026-05-14T17:52:33.095937Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2605.29438","last_updated":"2026-05-28T06:33:05Z","snapshot_observed_at":"2026-08-13T08:00:54.593455Z","submitted_at":"2026-05-28T06:33:05Z","title":"ElegantVLA: Learning When to Think for Efficient Vision-Language-Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T07:16:27.229603Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2605.29438"},"observation_digest":"sha256:2401e2e229db7a3b02ba1190aa20333b65c1c8fcdaa1a33429b301f7e6bd32c1","observation_id":"fc81d8d9-83d4-478c-a640-037e81e0d0fe","resolution":{"observed_at":"2026-06-29T07:23:13.012215Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2605.29662","last_updated":"2026-07-24T01:54:48Z","snapshot_observed_at":"2026-08-16T15:55:31.697178Z","submitted_at":"2026-05-28T09:23:08Z","title":"SAFE-Pruner: Semantic Attention-Guided Future-Aware Token Pruning for Efficient Vision-Language-Action Manipulation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-29T08:40:10.152344Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2605.29662"},"observation_digest":"sha256:7634bdbc86e34128ec52c90ea9009bd3a7c0a735c6a407d9b51cbbc58ba8f398","observation_id":"004af9c3-53d0-4396-bf1c-47914ef8f9b4","resolution":{"observed_at":"2026-06-29T08:43:14.995266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-08-02T12:54:43.001891Z","title":"arXiv preprint arXiv:2506.10100 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29662","last_updated":"2026-07-24T01:54:48Z","snapshot_observed_at":"2026-08-16T15:55:31.697178Z","submitted_at":"2026-05-28T09:23:08Z","title":"SAFE-Pruner: Semantic Attention-Guided Future-Aware Token Pruning for Efficient Vision-Language-Action Manipulation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T12:54:43.001891Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2605.29662"},"observation_digest":"sha256:2f2ec848d129182cbae918192d8d95a095f84e82791951b496062d3c1f0437aa","observation_id":"f04faa39-63e9-4b65-a1d5-0c12d5bd2aba","resolution":{"observed_at":"2026-08-02T12:54:43.001891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2606.02775","last_updated":"2026-06-01T18:38:21Z","snapshot_observed_at":"2026-08-07T06:38:00.863324Z","submitted_at":"2026-06-01T18:38:21Z","title":"AURA: Action-Gated Memory for Robot Policies at Constant VRAM","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-28T14:30:49.006075Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2606.02775"},"observation_digest":"sha256:3640521da0e30dfc7ace43926ac51fe750d7837e863f7ede3810914a0d0ff20d","observation_id":"fde631ff-4b09-400d-8c0e-4c4d2d0e9b4c","resolution":{"observed_at":"2026-07-01T23:16:24.312584Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T01:14:14.972805Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:2749d19d3e1bc9f40ec2663d97292fe6bea7f7aa984266dc2f750584e7736d17","observation_id":"5c1302be-7ab3-445d-b8c5-f0d11d7a5e8e","resolution":{"observed_at":"2026-07-02T13:36:58.831557Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-08-02T12:17:09.296034Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.296034Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:6b04ee0a983afc1d6f866d8c801e76b3fce40560231cc00e440221cf4971a445","observation_id":"99897dc2-d26b-4804-b5bb-6887768d813a","resolution":{"observed_at":"2026-08-02T12:17:09.296034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2606.19565","last_updated":"2026-06-17T20:08:14Z","snapshot_observed_at":"2026-08-07T10:17:45.129429Z","submitted_at":"2026-06-17T20:08:14Z","title":"Mix-QVLA: Task-Evidence-Aware Mixed-Precision Quantization of Vision-Language-Action Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T20:57:33.909350Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2606.19565"},"observation_digest":"sha256:f455f7b346df01af12a4b187a6d42c27db457b64e7d9b1a1e5260be56481cce5","observation_id":"89634f0a-bbe8-42a2-ad79-111bab56487d","resolution":{"observed_at":"2026-07-04T00:49:18.553137Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2606.22540","last_updated":"2026-06-25T01:18:44Z","snapshot_observed_at":"2026-08-13T19:54:38.163011Z","submitted_at":"2026-06-21T14:54:07Z","title":"PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-26T10:27:00.283283Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2606.22540"},"observation_digest":"sha256:bc83fc0677180dbb46d28b36e4cd6f0ba91e66d1f4ba2981bbb079fa211a0750","observation_id":"f05d4f4e-6f77-4a43-b8c6-73abe9bda677","resolution":{"observed_at":"2026-07-04T09:09:43.355026Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2606.30378","last_updated":"2026-06-29T14:38:20Z","snapshot_observed_at":"2026-07-07T00:04:15.048683Z","submitted_at":"2026-06-29T14:38:20Z","title":"OmniCoT: A Benchmark for Global and Multi-Step Panoramic Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-30T06:11:09.693576Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2606.30378"},"observation_digest":"sha256:7feb3365218d02cb61da19032dc5d76b84b974518a10d9c21ea3f4bdf863aaff","observation_id":"65af8c99-1171-4d82-b1c8-00e7e2dbdfa6","resolution":{"observed_at":"2026-06-30T06:14:19.071969Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2606.31382","last_updated":"2026-06-30T09:10:31Z","snapshot_observed_at":"2026-07-07T00:05:07.912609Z","submitted_at":"2026-06-30T09:10:31Z","title":"Revisiting Parameter Redundancy in Vision-Language-Action Models: Insights from VLM-to-VLA Adaptation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-01T05:07:45.792132Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2606.31382"},"observation_digest":"sha256:b42c9f6c0e74f6147d1f9ce065dbdd797235070923f10b59abc22cf67b436f05","observation_id":"4a86d6ca-a55f-43b0-9b94-063ce82f6fb4","resolution":{"observed_at":"2026-07-01T10:45:42.872784Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.10100/citation-record","integrity":"/paper/2506.10100/integrity","json":"/paper/2506.10100/citation-record.json","paper":"/paper/2506.10100"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:23.372908Z","title":"Blip: Bootstrapping language-image pre-training for unified vision- language understanding and generation,","venue":null,"work_id":"b4bd2ef6-9f4c-4115-80fa-fd510eb888d7","year":2022},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.343098Z"},"links":{"citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:b4899af3628ee4da7b212b222769ffaa76d9a366e478005b3658bbbd2538d970","observation_id":"aacf24e7-c2b3-470e-ade4-fb84ea8df2a2","resolution":{"observed_at":"2026-08-07T04:42:23.377905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:22.348179Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.348179Z"},"links":{"citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:75a932731ae8c4771162c05e2e48403f1d2b0bc8e17657a2223601e29c3fe119","observation_id":"77609ff6-b538-45c0-b690-64a2a12ff3e2","resolution":{"observed_at":"2026-08-07T04:42:22.348179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:22.353075Z","title":"Mc-llava: Multi-concept personalized vision-language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.353075Z"},"links":{"citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:7944252f9dfdaf97d462463ca455da4ebf4c31f43fe5189e079bd2651dd0c1c6","observation_id":"baa521e3-ebf3-4db0-95e3-b65cb896c169","resolution":{"observed_at":"2026-08-07T04:42:22.353075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:23.347014Z","title":"Llm as dataset analyst: Subpopulation structure discovery with large language model,","venue":null,"work_id":"2b0ef2f5-7c92-457c-9f86-6d3ca55d974b","year":2024},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.357974Z"},"links":{"citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:af3bad608f867da150dcd9e6124054c8bada597291e3d2e5518fc419f0c73a5b","observation_id":"b27a4e92-8246-41e1-98e8-9775f55dbf25","resolution":{"observed_at":"2026-08-07T04:42:23.352330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-15T04:55:15.159462Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-07T04:42:22.362474Z","title":"Openvla: An open-source vision-language-action model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.362474Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:eda6f4cb5dd7baeeda866adb022ae66335028ec3e5c089ca927be81f9cda3e7f","observation_id":"320a45c5-9b07-462e-a697-8adb27f8ccf5","resolution":{"observed_at":"2026-08-07T04:42:22.362474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:23.330101Z","title":"Cogact: A foundational vision-language-action model for synergizing cognition and action in robotic manipulation,","venue":null,"work_id":"c01c55ce-bb2f-4fa3-9f77-f7f939a0fff3","year":2024},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.368007Z"},"links":{"citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:2efdeb4de51552737e6b2837f286d62b95194a32fb21d02868787e51d4cb75a7","observation_id":"051eb1d3-decf-41ee-a5c5-6e40c862a084","resolution":{"observed_at":"2026-08-07T04:42:23.335146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-08-16T17:53:54.636855Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-07T04:42:22.372709Z","title":"π0: A vision-language-action flow model for general robot control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.372709Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:40bf6bbf0ce2dcdd29115f011250857d706a4761d51398e16e8341729fd72640","observation_id":"1642af91-ea4d-44a1-98b9-a3e6e2d3176e","resolution":{"observed_at":"2026-08-07T04:42:22.372709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-07T04:42:22.377361Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.377361Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:96b12a3cea019b57ac8c44dac2ada3733d82c60224978df82433fb657b5e97e7","observation_id":"e5399721-7228-49e8-98cb-c05020f66953","resolution":{"observed_at":"2026-08-07T04:42:22.377361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:22.382025Z","title":"Rh20t: A comprehensive robotic dataset for learning diverse skills in one-shot,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.382025Z"},"links":{"citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:ea69beea4dc8751f0e61ac294c20a703c78fe2447c2f63b2b49a2fd0eb5bab2f","observation_id":"85652d90-aaef-4c8e-8508-e489b2b0d284","resolution":{"observed_at":"2026-08-07T04:42:22.382025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:23.304042Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models: Open x-embodiment collaboration 0,","venue":null,"work_id":"50b59326-5de5-410e-9cc3-7c31f157b2ca","year":2024},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.386914Z"},"links":{"citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:85c28e842bdc5dfe4af872a2efcc30f926d80171f09eda822b97629633d92bf2","observation_id":"020d6a78-a086-4183-beb3-add3f89f3dd3","resolution":{"observed_at":"2026-08-07T04:42:23.309286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-15T01:35:58.775756Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-08-07T04:42:22.391752Z","title":"Diffusion-vla: Scal- ing robot foundation models via unified diffusion and autoregression,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.391752Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:c39f6b20fe554093c828239abc8df1d2786e15272b30d227e72baf8a94230221","observation_id":"086f3048-ec0e-44a0-a2fb-13ec3e1bccb0","resolution":{"observed_at":"2026-08-07T04:42:22.391752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05855","last_updated":"2025-08-09T10:58:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-09T11:25:56Z","title":"DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05855","snapshot_observed_at":"2026-08-07T04:42:22.396376Z","title":"Dexvla: Vision-language model with plug-in diffusion expert for general robot control,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.396376Z"},"links":{"cited_paper":"/paper/2502.05855","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:d76ccf53dd3c5f03800d05463878b5407ee905a433f9c8126abfd77aed346556","observation_id":"e8d590b4-e47e-4904-b7cc-28c8771c99df","resolution":{"observed_at":"2026-08-07T04:42:22.396376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12514","last_updated":"2025-05-13T11:02:20Z","snapshot_observed_at":"2026-08-07T15:12:56.367961Z","submitted_at":"2024-09-19T07:10:18Z","title":"TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12514","snapshot_observed_at":"2026-08-07T04:42:22.401474Z","title":"Tinyvla: Towards fast, data-efficient vision-language-action models for robotic manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.401474Z"},"links":{"cited_paper":"/paper/2409.12514","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:d0b7b77782058017489f7fd3e36f579fd1d9b007669a45d656b69a1eac15b5e6","observation_id":"96c28ed2-9e4b-42b7-84c6-4cdcd2ef2e7a","resolution":{"observed_at":"2026-08-07T04:42:22.401474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T04:42:22.406153Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.406153Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:d2a0468f6fcbfa401a064c174f1c7a87722af156f5e61d88d787378c46659318","observation_id":"c984ae9d-181d-45d3-9eb2-a77891aed692","resolution":{"observed_at":"2026-08-07T04:42:22.406153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:23.287925Z","title":"Gpt-3: Its nature, scope, limits, and consequences,","venue":null,"work_id":"7c9ef8ed-8734-4316-9f89-e78bd38ac391","year":2020},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.410901Z"},"links":{"citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:7f4edc3e9a843514d5cdb2ff9b042e61a0d6b9670c5f3091ca58c8b8e04f4820","observation_id":"ed77cdd5-8a2b-4bb8-bf1b-af55189203de","resolution":{"observed_at":"2026-08-07T04:42:23.293032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T04:42:22.415264Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.415264Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:0a01bc0796b42fd08f7a249159919720c1f98e68d6613018a5cea5732bc13507","observation_id":"bc1fd14e-3e80-43ca-9f45-0ef5bf29cc74","resolution":{"observed_at":"2026-08-07T04:42:22.415264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-08-16T14:33:50.657682Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-07T04:42:22.419997Z","title":"Roberta: A robustly optimized bert pretraining approach,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.419997Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:492c817923e71bf3b7e16939b9dab97f57f02cb75dba9b933e4b0bfd53e88e23","observation_id":"faddad0e-b75c-407b-8653-185e68ed752f","resolution":{"observed_at":"2026-08-07T04:42:22.419997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12212","last_updated":"2025-06-01T05:57:00Z","snapshot_observed_at":"2026-08-16T05:47:52.816756Z","submitted_at":"2025-05-18T03:10:00Z","title":"Data Whisperer: Efficient Data Selection for Task-Specific LLM Fine-Tuning via Few-Shot In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12212","snapshot_observed_at":"2026-08-07T04:42:22.425017Z","title":"Data whisperer: Efficient data selection for task-specific llm fine-tuning via few-shot in-context learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.425017Z"},"links":{"cited_paper":"/paper/2505.12212","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:2186f50d167f7ae28f1752e68685bd2883b15e8f42dff1939e76b1ee8b9384d8","observation_id":"743d6ac6-6307-475b-b850-00e59b1f09ba","resolution":{"observed_at":"2026-08-07T04:42:22.425017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:23.270726Z","title":"Deer-vla: Dynamic inference of multimodal large language models for efficient robot execution,","venue":null,"work_id":"07b48047-a40d-47bf-bd4a-c19b1d0165d8","year":2024},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.429692Z"},"links":{"citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:c30aed995cf61094e4a2c29469de32d24816ac453a710486a01ed8681f274b3d","observation_id":"a5275882-d35e-4cee-a032-515921a93d7a","resolution":{"observed_at":"2026-08-07T04:42:23.276043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20384","last_updated":"2025-04-14T11:39:39Z","snapshot_observed_at":"2026-08-16T12:46:42.262426Z","submitted_at":"2025-03-26T10:05:38Z","title":"MoLe-VLA: Dynamic Layer-skipping Vision Language Action Model via Mixture-of-Layers for Efficient Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20384","snapshot_observed_at":"2026-08-07T04:42:22.434287Z","title":"Mole- vla: Dynamic layer-skipping vision language action model via mixture-of-layers for efficient robot manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.434287Z"},"links":{"cited_paper":"/paper/2503.20384","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:1bc74d4a844027f2fb6c7c06891685d8f32c78b3147ac5f041edbeccd629d8de","observation_id":"25aa3d8d-ae22-4f6a-993b-bf3401d4953a","resolution":{"observed_at":"2026-08-07T04:42:22.434287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:22.439171Z","title":"Vla-cache: Towards efficient vision-language-action model via adaptive token caching in robotic manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.439171Z"},"links":{"citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:ca4c81fa6ce5571a9a273f1ddeea9c23e5e388b63de5085cd10a591e61a5e504","observation_id":"959ff49e-de6f-4ee2-8209-1f45cb3ead09","resolution":{"observed_at":"2026-08-07T04:42:22.439171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05941","last_updated":"2024-05-09T17:30:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-09T17:30:16Z","title":"Evaluating Real-World Robot Manipulation Policies in Simulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05941","snapshot_observed_at":"2026-08-07T04:42:22.443858Z","title":"Evaluating real-world robot manipulation policies in simulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.443858Z"},"links":{"cited_paper":"/paper/2405.05941","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:05ac483bf9ad9b08369379e5d0dca454fcc98c320b6c865f94d8f160dc667e47","observation_id":"3f6c98d6-7739-49b8-b544-cf5795d88626","resolution":{"observed_at":"2026-08-07T04:42:22.443858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-08-13T00:43:50.403870Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-07T04:42:22.448483Z","title":"Vision-language foundation models as effective robot imitators,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.448483Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:71f4751fc2697c0330aa629d9aa74ca44423d37b53c09018db2513c447d711d8","observation_id":"b6f21b8b-0c64-4036-950b-5921283d297f","resolution":{"observed_at":"2026-08-07T04:42:22.448483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:23.253842Z","title":"Rt- 2: Vision-language-action models transfer web knowledge to robotic control,","venue":null,"work_id":"9d5422a8-385e-4a30-8a0d-d560814c6c06","year":2023},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.453348Z"},"links":{"citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:f7b86b9331d821541cfb762c095d6750c93f89fc78fb1e264a0fa43978da3b52","observation_id":"3cb5ba0e-88ac-4173-8124-fd95c4ff5bec","resolution":{"observed_at":"2026-08-07T04:42:23.259009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-07T04:42:22.457907Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.457907Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:b52ad2e0a6e87a8f1e36d8b1494b1eef85d95b55854554383a26de0e0bb82875","observation_id":"086ef63c-0e52-4f4d-a69f-f2d391546eae","resolution":{"observed_at":"2026-08-07T04:42:22.457907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07865","last_updated":"2024-05-30T13:08:48Z","snapshot_observed_at":"2026-08-16T14:19:15.096234Z","submitted_at":"2024-02-12T18:21:14Z","title":"Prismatic VLMs: Investigating the Design Space of Visually-Conditioned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07865","snapshot_observed_at":"2026-08-07T04:42:22.462536Z","title":"Prismatic vlms: Investigating the design space of visually-conditioned language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.462536Z"},"links":{"cited_paper":"/paper/2402.07865","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:0d27579f34a0f472e6e836f26c5c2608e1962809c74a6862233d620883318238","observation_id":"1c694594-dc43-4882-85ad-42c7e2dc1fc3","resolution":{"observed_at":"2026-08-07T04:42:22.462536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-07T04:42:22.467423Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.467423Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:2cd483ab8fe9d6adb0011c430d18876885eb3e706f5df5847e07b46725f12122","observation_id":"ea5a9fc6-5d0c-4dcb-8641-bf866810c160","resolution":{"observed_at":"2026-08-07T04:42:22.467423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-07T04:42:22.472319Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.472319Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:aba40725edfaf6abd1ceac81cc52cd770a27be8d5b0774ee9f2f617fac78574a","observation_id":"4a52e617-b8ff-47fe-a799-2661b3047795","resolution":{"observed_at":"2026-08-07T04:42:22.472319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-07T04:42:22.477013Z","title":"Openflamingo: An open-source framework for training large autoregressive vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.477013Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:d11f4b2850039c1f7451e303d2ff1b45f90dbfc8650e5f847a6819287cd998e3","observation_id":"3c1a0722-21f1-41da-acc7-e306163ea6bf","resolution":{"observed_at":"2026-08-07T04:42:22.477013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:22.481621Z","title":"Shifting ai efficiency from model-centric to data-centric compression,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.481621Z"},"links":{"citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:6a066fa276a795c2d819d466ef0357a0e2d45467502134793b286a042449e937","observation_id":"4c7fdd45-9494-44f5-adf2-6742c56bd912","resolution":{"observed_at":"2026-08-07T04:42:22.481621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11494","last_updated":"2025-06-08T08:35:58Z","snapshot_observed_at":"2026-08-16T12:57:51.270833Z","submitted_at":"2025-02-17T06:56:28Z","title":"Stop Looking for Important Tokens in Multimodal Language Models: Duplication Matters More","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11494","snapshot_observed_at":"2026-08-07T04:42:22.486234Z","title":"Stop looking for important tokens in multimodal language models: Duplication matters more,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.486234Z"},"links":{"cited_paper":"/paper/2502.11494","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:99dac67a090b983041b14c4d84693f69ee5f486eab8cd590100212201351ae7f","observation_id":"cacd0bc7-fd66-4a1a-9f80-daaf0b49ed6a","resolution":{"observed_at":"2026-08-07T04:42:22.486234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-16T13:45:24.500059Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-08-07T04:42:22.491193Z","title":"Robomamba: Efficient vision-language-action model for robotic reasoning and manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.491193Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:949e08d80d49f958898989ef36d86cf5d45ab1142aa42cb4015a225cfe179bfc","observation_id":"4028d45d-1f3b-4f46-8544-e66684b8a3ec","resolution":{"observed_at":"2026-08-07T04:42:22.491193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07795","last_updated":"2022-10-14T13:26:41Z","snapshot_observed_at":"2026-08-16T16:24:07.152401Z","submitted_at":"2022-10-14T13:26:41Z","title":"EfficientVLM: Fast and Accurate Vision-Language Models via Knowledge Distillation and Modal-adaptive Pruning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07795","snapshot_observed_at":"2026-08-07T04:42:22.496390Z","title":"Efficientvlm: Fast and accurate vision-language models via knowledge distillation and modal-adaptive pruning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.496390Z"},"links":{"cited_paper":"/paper/2210.07795","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:fb2e1320ca5e31f352f7e7a6ac7b1fe9ee2cfdf100857fc9d659866b102ac33d","observation_id":"78a1091e-b3b4-4e90-b66a-76d73d61b983","resolution":{"observed_at":"2026-08-07T04:42:22.496390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-07T04:42:22.501557Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.501557Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:eddbda1de1fb765f8933078e20131585fe09f48e808825e0844456a934ca6c33","observation_id":"e0915ada-6900-45e5-b8dd-2469232b64b2","resolution":{"observed_at":"2026-08-07T04:42:22.501557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:22.506407Z","title":"Sigmoid loss for language image pre-training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.506407Z"},"links":{"citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:f4d84dd623be600502cbb8a5a23edaeec539bb7aee2495cca5a1ffd25048e871","observation_id":"f11bb0b0-6789-4eb2-8ab4-4115c366cbee","resolution":{"observed_at":"2026-08-07T04:42:22.506407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-07T04:42:22.511092Z","title":"Cogact: A foundational vision-language-action model for synergizing cognition and action in robotic manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.511092Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:1cd4921e4eaefa04683a4726802d3c9ba20d716d62127c3b97c01fcf93c0457a","observation_id":"5c166334-8866-4bf3-9b26-33e05a25f187","resolution":{"observed_at":"2026-08-07T04:42:22.511092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:23.224772Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models,","venue":null,"work_id":"5f4d558d-fb85-4969-85da-9cd405482b4c","year":2025},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.515825Z"},"links":{"citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:55cf3e3f5ae7e29514a88782835ab3f3257fdc9f99a45e28eea881d3b29f0081","observation_id":"b1069ea2-5275-431a-955b-85ad8ec40f76","resolution":{"observed_at":"2026-08-07T04:42:23.231985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15296","last_updated":"2025-02-28T15:23:40Z","snapshot_observed_at":"2026-08-13T09:51:40.995400Z","submitted_at":"2025-01-25T18:26:39Z","title":"You Only Prune Once: Designing Calibration-Free Model Compression With Policy Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15296","snapshot_observed_at":"2026-08-07T04:42:22.520527Z","title":"You only prune once: Designing calibration-free model compression with policy learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.520527Z"},"links":{"cited_paper":"/paper/2501.15296","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:3e8e96885a6441feaa9f20f86a1e91c8146a2a3f442b9054fbfc03d21540c389","observation_id":"052e0a74-8ea6-4abe-9850-bfc6f7250a8c","resolution":{"observed_at":"2026-08-07T04:42:22.520527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 30 inbound Pith citation observations for arXiv:2506.10100."}