{"as_of":"2026-08-09T19:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e1bce0913ba7567c1ca0391507b5db87d76baa811e16d4c9c8a79d09b2b8844f","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:07:26.130586Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T20:59:53.042021Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T09:19:43.485742Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01016","snapshot_observed_at":"2026-08-03T20:59:53.042021Z","title":"VQ-VLA: Improving vision-language- action models via scaling vector-quantized action tokenizers.arXiv preprint arXiv:2507.01016, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.17502","last_updated":"2026-05-30T03:49:39Z","snapshot_observed_at":"2026-08-03T20:59:48.866420Z","submitted_at":"2025-11-21T18:59:32Z","title":"RynnVLA-002: A Unified Vision-Language-Action and World Model","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T20:59:53.042021Z"},"links":{"cited_paper":"/paper/2507.01016","citing_paper":"/paper/2511.17502"},"observation_digest":"sha256:7e6ab62e293d1a457ab624dd587cf96f044bce8206dea49fe7b3c777643d6729","observation_id":"3a81d664-dbb7-49fc-8697-3ce1f15be229","resolution":{"observed_at":"2026-08-03T20:59:53.042021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"cited_work":{"arxiv_id":"2507.01016","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01016","snapshot_observed_at":"2026-07-04T09:19:43.485742Z","title":"Vq-vla: Improving vision-language-action models via scaling vector-quantized action tokenizers.arXiv preprint arXiv:2507.01016","venue":null,"work_id":"2d49f961-abca-44e9-9f82-01c68a8e158b","year":2025},"citing_paper":{"arxiv_id":"2511.18085","last_updated":"2026-05-08T04:30:23Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T15:00:08Z","title":"Continually Evolving Skill Knowledge in Vision Language Action Model","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-17T06:02:31.638120Z"},"links":{"cited_paper":"/paper/2507.01016","citing_paper":"/paper/2511.18085"},"observation_digest":"sha256:b6ee083dd2aa68e7227953b021f3970b9b570ad0607e860638450eb04ef5370c","observation_id":"4f2fbe16-6b13-4c90-9544-c2ded5458320","resolution":{"observed_at":"2026-05-17T06:04:09.248500Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01016","snapshot_observed_at":"2026-08-03T13:29:48.923259Z","title":"Vq- vla: Improving vision-language-action models via scaling vector- quantized action tokenizers,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.24125","last_updated":"2026-07-26T09:02:49Z","snapshot_observed_at":"2026-08-08T10:23:37.779496Z","submitted_at":"2025-12-30T10:18:42Z","title":"Unified Embodied VLM Reasoning with Robotic Action via Autoregressive Discretized Pre-training","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T13:29:48.923259Z"},"links":{"cited_paper":"/paper/2507.01016","citing_paper":"/paper/2512.24125"},"observation_digest":"sha256:5d6cb8bb394864e2bafc335ccadbd515cd67f875170e6bf0c755b0af78cde38c","observation_id":"5a469e98-446a-4ff9-8737-5725a9922559","resolution":{"observed_at":"2026-08-03T13:29:48.923259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"cited_work":{"arxiv_id":"2507.01016","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01016","snapshot_observed_at":"2026-07-04T09:19:43.485742Z","title":"Vq-vla: Improving vision-language-action models via scaling vector-quantized action tokenizers.arXiv preprint arXiv:2507.01016","venue":null,"work_id":"2d49f961-abca-44e9-9f82-01c68a8e158b","year":2025},"citing_paper":{"arxiv_id":"2602.12978","last_updated":"2026-05-17T13:09:20Z","snapshot_observed_at":"2026-08-05T03:16:35.662407Z","submitted_at":"2026-02-13T14:56:06Z","title":"Learning Native Continuation for Action Chunking Flow Policies","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T12:38:26.522838Z"},"links":{"cited_paper":"/paper/2507.01016","citing_paper":"/paper/2602.12978"},"observation_digest":"sha256:1bf39cf0b85fc6b56d150021a5245b930a34133157214014cd3188ccb98ae69e","observation_id":"d3391853-c917-4460-8253-b556712ed4f2","resolution":{"observed_at":"2026-05-21T12:40:08.704943Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"cited_work":{"arxiv_id":"2507.01016","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01016","snapshot_observed_at":"2026-07-04T09:19:43.485742Z","title":"Vq-vla: Improving vision-language-action models via scaling vector-quantized action tokenizers.arXiv preprint arXiv:2507.01016","venue":null,"work_id":"2d49f961-abca-44e9-9f82-01c68a8e158b","year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-02T21:37:08.464741Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-21T13:04:30.544504Z"},"links":{"cited_paper":"/paper/2507.01016","citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:63f8703dc79719856525bfe87e0583b378ec01b3c6cd6808d7df843467ecf45e","observation_id":"2b267576-52e1-4a81-b10e-890416b67a99","resolution":{"observed_at":"2026-05-21T13:05:10.051106Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01016","snapshot_observed_at":"2026-08-02T21:37:14.978308Z","title":"Vq-vla: Improving vision- language-action models via scaling vector-quantized ac- tion tokenizers.arXiv preprint arXiv:2507.01016, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-02T21:37:08.464741Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:14.978308Z"},"links":{"cited_paper":"/paper/2507.01016","citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:ff52545cdd1adb531fe019876af1441b71a8122fd37a66105254785185a2bc55","observation_id":"408a266b-fe64-4d6d-a97c-0ced98d15a1f","resolution":{"observed_at":"2026-08-02T21:37:14.978308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"cited_work":{"arxiv_id":"2507.01016","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01016","snapshot_observed_at":"2026-07-04T09:19:43.485742Z","title":"Vq-vla: Improving vision-language-action models via scaling vector-quantized action tokenizers.arXiv preprint arXiv:2507.01016","venue":null,"work_id":"2d49f961-abca-44e9-9f82-01c68a8e158b","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-13T03:57:10.338617Z"},"links":{"cited_paper":"/paper/2507.01016","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:9ae50b962a4d3114b58d2b584b1c8d34b7fa5023320004b883cea0c929c603d5","observation_id":"97714748-41f3-43a9-b146-f3ad49458b1d","resolution":{"observed_at":"2026-05-13T03:57:12.827282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"cited_work":{"arxiv_id":"2507.01016","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01016","snapshot_observed_at":"2026-07-04T09:19:43.485742Z","title":"Vq-vla: Improving vision-language-action models via scaling vector-quantized action tokenizers.arXiv preprint arXiv:2507.01016","venue":null,"work_id":"2d49f961-abca-44e9-9f82-01c68a8e158b","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2507.01016","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:7e1c433fbec24ae67e992950fa2c01e961412016607340d59c6a2a1c64267b63","observation_id":"6a8e3e34-85de-437e-998b-533c131989ae","resolution":{"observed_at":"2026-07-01T14:15:46.671785Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"cited_work":{"arxiv_id":"2507.01016","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01016","snapshot_observed_at":"2026-07-04T09:19:43.485742Z","title":"Vq-vla: Improving vision-language-action models via scaling vector-quantized action tokenizers.arXiv preprint arXiv:2507.01016","venue":null,"work_id":"2d49f961-abca-44e9-9f82-01c68a8e158b","year":2025},"citing_paper":{"arxiv_id":"2605.22671","last_updated":"2026-05-31T08:30:46Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:14:19Z","title":"From Abstraction to Instantiation: Learning Behavioral Representation for Vision-Language-Action Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T06:05:52.461348Z"},"links":{"cited_paper":"/paper/2507.01016","citing_paper":"/paper/2605.22671"},"observation_digest":"sha256:3f3670a366c0f4fd678772a0caa408bc6297dcebe7ca5cf98201aaf916b29e0a","observation_id":"eb409383-3e7e-4ba8-9645-4bef12279702","resolution":{"observed_at":"2026-05-22T06:06:08.666110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"cited_work":{"arxiv_id":"2507.01016","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01016","snapshot_observed_at":"2026-07-04T09:19:43.485742Z","title":"Vq-vla: Improving vision-language-action models via scaling vector-quantized action tokenizers.arXiv preprint arXiv:2507.01016","venue":null,"work_id":"2d49f961-abca-44e9-9f82-01c68a8e158b","year":2025},"citing_paper":{"arxiv_id":"2605.22671","last_updated":"2026-05-31T08:30:46Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:14:19Z","title":"From Abstraction to Instantiation: Learning Behavioral Representation for Vision-Language-Action Model","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T16:52:05.565650Z"},"links":{"cited_paper":"/paper/2507.01016","citing_paper":"/paper/2605.22671"},"observation_digest":"sha256:131dcc6afee0358489d799b27b48f687560a15079723372692c2e3f2544fe853","observation_id":"d7a5fd1e-bd22-4e94-bdcd-8398898ae269","resolution":{"observed_at":"2026-06-30T16:54:58.265667Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"cited_work":{"arxiv_id":"2507.01016","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01016","snapshot_observed_at":"2026-07-04T09:19:43.485742Z","title":"Vq-vla: Improving vision-language-action models via scaling vector-quantized action tokenizers.arXiv preprint arXiv:2507.01016","venue":null,"work_id":"2d49f961-abca-44e9-9f82-01c68a8e158b","year":2025},"citing_paper":{"arxiv_id":"2606.21372","last_updated":"2026-06-19T12:24:49Z","snapshot_observed_at":"2026-08-01T15:59:11.712537Z","submitted_at":"2026-06-19T12:24:49Z","title":"NAC: Neural Action Codec for Vision-Language-Action Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T13:59:53.484305Z"},"links":{"cited_paper":"/paper/2507.01016","citing_paper":"/paper/2606.21372"},"observation_digest":"sha256:a0b6a316cef4918d981e346ce6d7965d981a22ffb5fb0d6a876c91dae1a57737","observation_id":"3df18ac4-53bf-401e-94a0-bec8be992c4c","resolution":{"observed_at":"2026-07-04T06:59:37.911642Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"cited_work":{"arxiv_id":"2507.01016","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01016","snapshot_observed_at":"2026-07-04T09:19:43.485742Z","title":"Vq-vla: Improving vision-language-action models via scaling vector-quantized action tokenizers.arXiv preprint arXiv:2507.01016","venue":null,"work_id":"2d49f961-abca-44e9-9f82-01c68a8e158b","year":2025},"citing_paper":{"arxiv_id":"2606.22480","last_updated":"2026-06-21T12:49:46Z","snapshot_observed_at":"2026-08-08T11:39:41.619777Z","submitted_at":"2026-06-21T12:49:46Z","title":"ARP: Enhancing Quantized Skill Abstractions via Visual Alignment and Iterative Refinement for Robotic Manipulation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-26T10:14:42.111428Z"},"links":{"cited_paper":"/paper/2507.01016","citing_paper":"/paper/2606.22480"},"observation_digest":"sha256:369793d2f544340e557bc5396068d0763d4190be4eb33233698b8882132888f3","observation_id":"29b1bc9b-80ac-436d-a26e-b6ec5eceff9d","resolution":{"observed_at":"2026-07-04T09:19:43.487289Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01016","snapshot_observed_at":"2026-07-14T05:40:47.306935Z","title":"Vq-vla: Improving vision- language-action models via scaling vector-quantized ac- tion tokenizers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11427","last_updated":"2026-07-13T11:31:53Z","snapshot_observed_at":"2026-08-07T09:19:25.836681Z","submitted_at":"2026-07-13T11:31:53Z","title":"EDAR: Learning Environment-Dependent Action Representations for Robotic Manipulation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-14T05:40:47.306935Z"},"links":{"cited_paper":"/paper/2507.01016","citing_paper":"/paper/2607.11427"},"observation_digest":"sha256:776a0873c9528be5a1b60cab2cf847d36da4e98fc68595ea46e9bef59042dd8c","observation_id":"64cce292-40e0-4212-8839-749231c2e2d0","resolution":{"observed_at":"2026-07-14T05:40:47.306935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01016","snapshot_observed_at":"2026-08-02T05:01:26.608329Z","title":"Vq-vla: Improving vision-language-action models via scaling vector-quantized action tokenizers.arXiv preprint arXiv:2507.01016, 2025b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13522","last_updated":"2026-07-15T07:21:00Z","snapshot_observed_at":"2026-08-09T08:21:58.226231Z","submitted_at":"2026-07-15T07:21:00Z","title":"Kepler-Encoder-v0.1: Towards a Multimodal Embedding Model for Robots","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T05:01:26.608329Z"},"links":{"cited_paper":"/paper/2507.01016","citing_paper":"/paper/2607.13522"},"observation_digest":"sha256:bd81e4731e4a5813de8f3d92af60da9f66322caf936d72569456602d5d8998e0","observation_id":"f734bcda-218e-4a07-8473-f5a4d39067db","resolution":{"observed_at":"2026-08-02T05:01:26.608329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.01016/citation-record","integrity":"/paper/2507.01016/integrity","json":"/paper/2507.01016/citation-record.json","paper":"/paper/2507.01016"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T21:07:22.122914Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:22.122914Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:fb53a6f9d7a26299ace7c2cfc0258532996c1c2740304f6a9a2f451062b8cc29","observation_id":"0bb710e7-e1dd-4a4a-9df3-36d5f420dc2e","resolution":{"observed_at":"2026-08-06T21:07:22.122914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-06T21:07:22.189706Z","title":"Do as i can, not as i say: Grounding language in robotic affordances","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:22.189706Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:bbcc676ab1b3a67c18ef5f49bb35a072087cca0bf43cf298d70a560d2dc59ea9","observation_id":"d2b560d4-2189-4451-aa56-58d7370ba347","resolution":{"observed_at":"2026-08-06T21:07:22.189706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:28.375397Z","title":"Flamingo: A visual language model for few-shot learning","venue":null,"work_id":"3f16cad1-be8f-4952-ae2b-2354cb40c83f","year":null},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:22.275615Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:4b44943b567aad623a252d78b62b33ba109ee6c967b9079183d96469f3437be8","observation_id":"8cb96dad-3e34-4e3b-be2a-3df86d9bd178","resolution":{"observed_at":"2026-08-06T21:07:28.458950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:28.237652Z","title":"Minivla: A better vla with a smaller footprint","venue":null,"work_id":"4b72b573-969e-4a47-ae95-1549b0565ff2","year":null},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:22.363654Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:5b72393b15de5d8d5e452ce14f19f1c89bcdac5ec131fa57fe4249c5b0b04c73","observation_id":"bab2aed8-d8df-48d5-b6d8-f8f3ca6e8650","resolution":{"observed_at":"2026-08-06T21:07:28.333788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-06T21:07:22.451956Z","title":"Rt-1: Robotics transformer for real-world control at scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:22.451956Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:7870b5affa10fb640d1e53a2a8bdadd8e5fb29ca99148b49bd9bcfd977e37bab","observation_id":"9b752740-a23b-42b6-a8c4-1e9ce8e0b41b","resolution":{"observed_at":"2026-08-06T21:07:22.451956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-06T21:07:22.506991Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:22.506991Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:05b88c908b85cad3706cc7fe70cf3d939fa47a1960c14b26a6a7e056c5ab3a20","observation_id":"6df64edd-df2d-43d0-b50b-7a9991989922","resolution":{"observed_at":"2026-08-06T21:07:22.506991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-06T21:07:22.569402Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:22.569402Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:0e50f5f66a0eda8d2d2a21ba6f47345e8a6de37653bfa55523cab18d32e16129","observation_id":"d43c688d-cb8a-4c24-815a-9141f9a3bea3","resolution":{"observed_at":"2026-08-06T21:07:22.569402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:28.104015Z","title":"Anyvlm: Unified vision-language model for any robot morphology","venue":null,"work_id":"fc429e7c-0c84-44e4-93da-8bb9b4484225","year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:22.651487Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:c6f433e4b5f6e45c5df61d16a9452b25aa1e220bb2ca253ae53919fdd625da32","observation_id":"3a2658ac-b097-4a57-99f2-2d45dbf88426","resolution":{"observed_at":"2026-08-06T21:07:28.147454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18565","last_updated":"2023-05-29T18:58:38Z","snapshot_observed_at":"2026-08-07T07:27:51.369423Z","submitted_at":"2023-05-29T18:58:38Z","title":"PaLI-X: On Scaling up a Multilingual Vision and Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18565","snapshot_observed_at":"2026-08-06T21:07:22.706473Z","title":"Pali-x: On scaling up a multilingual vision and language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:22.706473Z"},"links":{"cited_paper":"/paper/2305.18565","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:ed19529b83ed48b6853f8699c4c50a218fdbec3ae036e8d73bc0f5e1914e9430","observation_id":"d4f6ece7-02f1-4998-ac13-45b3652590c6","resolution":{"observed_at":"2026-08-06T21:07:22.706473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00785","last_updated":"2024-10-17T13:41:16Z","snapshot_observed_at":"2026-07-06T19:43:42.287026Z","submitted_at":"2024-10-17T13:41:16Z","title":"IGOR: Image-GOal Representations are the Atomic Control Units for Foundation Models in Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00785","snapshot_observed_at":"2026-08-06T21:07:22.759775Z","title":"Igor: Image-goal representations are the atomic control units for foundation models in embodied ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:22.759775Z"},"links":{"cited_paper":"/paper/2411.00785","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:af7d2ec0fc6f97b7f5ad33712e808b2f4f94081f387c8d2d62d68e6505b58b51","observation_id":"3827fc8f-d211-4da5-b32d-9e48b3d2b97c","resolution":{"observed_at":"2026-08-06T21:07:22.759775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:27.966497Z","title":"Diffusion policy: Visuomotor policy learning via action diffu- sion","venue":null,"work_id":"0eee8994-17fd-4577-9974-6a37b2d6ddda","year":2023},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:22.864369Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:5bd17d67334f84c0ac17300cab84a5fa00ac90d1d4dd01c18ea741bfc75be165","observation_id":"7457aed0-8bc8-4c67-8070-4a723c9fbbd1","resolution":{"observed_at":"2026-08-06T21:07:28.002060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19578","last_updated":"2024-10-17T19:31:39Z","snapshot_observed_at":"2026-08-09T11:45:30.937531Z","submitted_at":"2024-03-28T17:04:00Z","title":"Keypoint Action Tokens Enable In-Context Imitation Learning in Robotics","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19578","snapshot_observed_at":"2026-08-06T21:07:22.903469Z","title":"Keypoint action to- kens enable in-context imitation learning in robotics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:22.903469Z"},"links":{"cited_paper":"/paper/2403.19578","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:808e5c3bf9efc1cd8d48d447eafa2df880805623c3619e8fdcbe734b3d7896d5","observation_id":"49ca3dd1-337e-4860-8823-47335f20c2c8","resolution":{"observed_at":"2026-08-06T21:07:22.903469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:27.867882Z","title":"Palm-e: an embod- ied multimodal language model","venue":null,"work_id":"4b629c15-d27d-4829-882a-e8690e541123","year":2023},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:22.959736Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:795f9567f99159cd6d8f478d8c43259bc0cfc8dc2ba0bdeab1e577306ce18b96","observation_id":"f6a7de39-98df-4cdc-836c-6243442d69a2","resolution":{"observed_at":"2026-08-06T21:07:27.918616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:27.777147Z","title":"Exploiting llm quantization","venue":null,"work_id":"c5bebd73-82c2-4948-b3b2-c60c65b8bd0c","year":null},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:23.014734Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:5808b8eceb68139c7cccea75d08c2c3f3f8f79ea9d39496e7fd49f43407ce2fe","observation_id":"97837d45-4a19-4c9f-a7d8-8072d999b00b","resolution":{"observed_at":"2026-08-06T21:07:27.833382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:27.679623Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":"d3146187-8d81-4084-afd6-cd2e31b5dca6","year":2021},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:23.128367Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:94d0931af7eea6ca98da1e1587918188f6197b910d91f8f7a2b90775d48fb2eb","observation_id":"f2dbaa8c-661a-4e26-ba7c-87affb1f7875","resolution":{"observed_at":"2026-08-06T21:07:27.731198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.00595","last_updated":"2023-09-26T10:47:35Z","snapshot_observed_at":"2026-07-06T15:49:23.374270Z","submitted_at":"2023-07-02T15:33:31Z","title":"RH20T: A Comprehensive Robotic Dataset for Learning Diverse Skills in One-Shot","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.00595","snapshot_observed_at":"2026-08-06T21:07:23.240619Z","title":"Rh20t: A comprehensive robotic dataset for learning diverse skills in one-shot","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:23.240619Z"},"links":{"cited_paper":"/paper/2307.00595","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:ae593efd16895e8471f8c4620f142e13be5309c89467068a96d251af65fd075a","observation_id":"c5c4ba28-880a-40a5-b658-21c9594fb4d5","resolution":{"observed_at":"2026-08-06T21:07:23.240619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:27.590862Z","title":"A new algorithm for data compression","venue":null,"work_id":"3a786577-0199-4bdc-83d4-264828783b5f","year":1994},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:23.348202Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:9ab88cd8a99ca773db00b45aa19a560e12a798e360e4ad203704b06032b1699d","observation_id":"96be1bc3-b35f-431b-b1a5-c6304326c03f","resolution":{"observed_at":"2026-08-06T21:07:27.620501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:27.481214Z","title":"Act3d: 3d feature field transformers for multi-task robotic manipulation","venue":null,"work_id":"69530bea-0aa1-42a6-a0e7-24db2456b508","year":null},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:23.457029Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:28ba0fdddb60cee9dab10ee390100b2a6b475f60af284b6c81bb3267ffb18184","observation_id":"743aa2af-c4ba-4d72-96f2-2b3cd9565335","resolution":{"observed_at":"2026-08-06T21:07:27.531754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11956","last_updated":"2019-10-25T23:01:43Z","snapshot_observed_at":"2026-08-07T14:52:56.563730Z","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.11956","snapshot_observed_at":"2026-08-06T21:07:23.545915Z","title":"Relay policy learning: Solving long- horizon tasks via imitation and reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:23.545915Z"},"links":{"cited_paper":"/paper/1910.11956","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:6a185e5d0498ad3f7d3c4bce7a736b53db3886196b94d1fb06de4ccd5857e64a","observation_id":"85db7f8c-2df1-49c7-836d-3b681e7bcffb","resolution":{"observed_at":"2026-08-06T21:07:23.545915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.04143","last_updated":"2024-05-03T15:00:50Z","snapshot_observed_at":"2026-08-06T01:36:48.822991Z","submitted_at":"2015-11-13T02:34:33Z","title":"Deep Reinforcement Learning in Parameterized Action Space","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.04143","snapshot_observed_at":"2026-08-06T21:07:23.686753Z","title":"Deep reinforce- ment learning in parameterized action space","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:23.686753Z"},"links":{"cited_paper":"/paper/1511.04143","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:265695e3d06c8dad3b230132ea6c79a29eccf796a323a18e46ccaed785c4cc24","observation_id":"b1115345-e57e-4ec5-a187-8b9c1ed1f47e","resolution":{"observed_at":"2026-08-06T21:07:23.686753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-07-06T13:15:58.303738Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-06T21:07:23.792753Z","title":"Cogvideo: Large-scale pretraining for text-to-video gen- eration via transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:23.792753Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:f1f343399357087f9679982c22a9bc4c60ffb2b41d9d47ca8ae02ceb83e48e80","observation_id":"8e9902a1-93fd-498e-b383-c9e4935b72b7","resolution":{"observed_at":"2026-08-06T21:07:23.792753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:27.384715Z","title":"Rlbench: The robot learning benchmark & learning environment","venue":null,"work_id":"725b12ac-51de-4f56-9913-32b68b06af3a","year":2020},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:23.874297Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:ba9c8a689ee156af3ff2506641f4ad607d78c6b9fcab837148be41f2c5a13ec8","observation_id":"13dca03f-3454-44ce-8b2e-858468f84538","resolution":{"observed_at":"2026-08-06T21:07:27.442533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:23.982056Z","title":"Pyramidal flow matching for efficient video generative modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:23.982056Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:3ccc99471bfd491923a3f30a3c2ec4d9abcc58c26763afd86554f2ba0f6540f9","observation_id":"398ef956-5728-4acf-aeae-20f2aa4fcf33","resolution":{"observed_at":"2026-08-06T21:07:23.982056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-06T21:07:24.072732Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:24.072732Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:3f06302217635c6044625075dff449a3d34f84e31c82b6a3419fe649c7490ea7","observation_id":"60582574-bb70-4fc5-abd2-93782b851e18","resolution":{"observed_at":"2026-08-06T21:07:24.072732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-06T21:07:24.169056Z","title":"Fine-tuning vision-language-action models: Optimizing speed and suc- cess","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:24.169056Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:06537872c6a196b63054f35fbf00f7aa11dc11c064caefb79cf0cda25ca8d70a","observation_id":"aa408865-f62b-4e67-8fa0-68500444dcf2","resolution":{"observed_at":"2026-08-06T21:07:24.169056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03181","last_updated":"2024-06-28T04:15:33Z","snapshot_observed_at":"2026-08-04T18:59:25.456993Z","submitted_at":"2024-03-05T18:19:29Z","title":"Behavior Generation with Latent Actions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03181","snapshot_observed_at":"2026-08-06T21:07:24.226708Z","title":"Be- havior generation with latent actions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:24.226708Z"},"links":{"cited_paper":"/paper/2403.03181","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:34b610f42317bb4c6524ad17ce2da22b85ee33ab9ea6e4552b390c98f33ff495","observation_id":"ab9bdf39-151d-42fc-93a5-b7188949b3f1","resolution":{"observed_at":"2026-08-06T21:07:24.226708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03310","last_updated":"2023-10-14T15:52:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-05T23:32:26Z","title":"LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03310","snapshot_observed_at":"2026-08-06T21:07:24.295662Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:24.295662Z"},"links":{"cited_paper":"/paper/2306.03310","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:1376a225533905c111b7b67c5572f36f69f463d6cfb5f4f95053f9ec294ba0a1","observation_id":"12ce03b6-eb68-4fdd-b832-d35b9d18ff2f","resolution":{"observed_at":"2026-08-06T21:07:24.295662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04410","last_updated":"2025-02-09T08:59:19Z","snapshot_observed_at":"2026-08-06T03:43:29.067278Z","submitted_at":"2024-09-06T17:14:53Z","title":"Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04410","snapshot_observed_at":"2026-08-06T21:07:24.365470Z","title":"Open-magvit2: An open-source project toward democratizing auto-regressive visual generation.arXiv preprint arXiv:2409.04410, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:24.365470Z"},"links":{"cited_paper":"/paper/2409.04410","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:6cba6d3b529e7542e7869bde90290cb01ab18502a725de8b98a09aa28c30cd43","observation_id":"ff2f85e6-844b-4225-8780-158474d501a5","resolution":{"observed_at":"2026-08-06T21:07:24.365470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-06T21:07:24.445625Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:24.445625Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:17a6cf09dc0b3d0fb68eecdfb5fce076abbf88ccb9ee160f906fca53ee22e7d9","observation_id":"c61f6e63-fbab-4d01-a09e-f871f4665d8d","resolution":{"observed_at":"2026-08-06T21:07:24.445625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:27.272758Z","title":"Quest: Self-supervised skill abstractions for learning continuous control","venue":null,"work_id":"dbcfea23-b3ce-469a-b497-05d4f1180f70","year":2025},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:24.514228Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:a41f36d4ed2de1063c19a227b8121b7533b9e0656a3923ee0f755bab9ad1ab6b","observation_id":"2dc1c629-12aa-4ffc-b9c5-24dd9705b76a","resolution":{"observed_at":"2026-08-06T21:07:27.322251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.14483","last_updated":"2021-11-04T12:11:21Z","snapshot_observed_at":"2026-08-07T22:37:17.355946Z","submitted_at":"2021-07-30T08:20:22Z","title":"ManiSkill: Generalizable Manipulation Skill Benchmark with Large-Scale Demonstrations","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.14483","snapshot_observed_at":"2026-08-06T21:07:24.596296Z","title":"Maniskill: Generalizable manipulation skill benchmark with large-scale demonstrations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:24.596296Z"},"links":{"cited_paper":"/paper/2107.14483","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:c40007c505171bb9b44175b7621284c46d006c5d8a04e01c113636382dd38e8b","observation_id":"5beecf7a-5133-43f5-a2de-2873d75a10cf","resolution":{"observed_at":"2026-08-06T21:07:24.596296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:27.177208Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models: Open x-embodiment collaboration 0","venue":null,"work_id":"f161c173-296d-4533-b230-87977d6bdcc6","year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:24.653961Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:f8f7d1030a6b4aa9f74ee3044a657e827fca50692a275eff386b999ca90c47bd","observation_id":"2b13a5cb-123d-45f7-a071-a5d63ffe1527","resolution":{"observed_at":"2026-08-06T21:07:27.226869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-06T21:07:24.690665Z","title":"Fast: Efficient action tokenization for vision- language-action models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:24.690665Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:88807610f22b15507836db9f0f2b1fc2c2c7fb5004f99ecc5858883f8d38dd11","observation_id":"0c87a25f-e31b-4a1c-bcc9-b8cbf4155947","resolution":{"observed_at":"2026-08-06T21:07:24.690665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:27.085503Z","title":"Language models are unsuper- vised multitask learners","venue":null,"work_id":"4c5b3f32-8e9f-451a-adfa-c3884c85b63a","year":2019},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:24.774942Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:3d377bb520ccf9fb095c8cf7f499ee0ac51bf320e95e6d604f60105086806ad5","observation_id":"49f8508b-3bab-41b6-9b32-6d4ba7b90ecb","resolution":{"observed_at":"2026-08-06T21:07:27.133600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02692","last_updated":"2025-03-10T09:01:48Z","snapshot_observed_at":"2026-07-06T20:01:05.921085Z","submitted_at":"2024-12-03T18:59:10Z","title":"Scalable Image Tokenization with Index Backpropagation Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02692","snapshot_observed_at":"2026-08-06T21:07:24.825964Z","title":"Taming scalable visual tok- enizer for autoregressive image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:24.825964Z"},"links":{"cited_paper":"/paper/2412.02692","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:7a6c2c8147526c1ddb29bd082b801ece0782fc7bb0a6bb3c5c5f8c93d2cf4b62","observation_id":"3a536382-8929-4bb4-a7a0-e36e558a26ef","resolution":{"observed_at":"2026-08-06T21:07:24.825964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11796","last_updated":"2024-12-09T18:31:01Z","snapshot_observed_at":"2026-08-07T10:56:20.468878Z","submitted_at":"2024-08-21T17:38:48Z","title":"LLM Pruning and Distillation in Practice: The Minitron Approach","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11796","snapshot_observed_at":"2026-08-06T21:07:24.915904Z","title":"Llm pruning and distillation in practice: The minitron approach","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:24.915904Z"},"links":{"cited_paper":"/paper/2408.11796","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:b86d8539b1bf914ac8fca3ee375e475559fe5858c68a2389026c87bf2cc95c4c","observation_id":"7366d8dd-f706-4cfe-b1e1-b8382b733708","resolution":{"observed_at":"2026-08-06T21:07:24.915904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-06T21:07:24.973912Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:24.973912Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:ca883ec8ee897e40d945ec31b27b2ae439e015f42697cde26bbd574a1e17327b","observation_id":"4db8a6af-59f3-4159-a494-9b86e285c1fe","resolution":{"observed_at":"2026-08-06T21:07:24.973912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-06T21:07:25.030945Z","title":"Octo: An open-source generalist robot policy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:25.030945Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:bcdc020ea265fd602c855654b94fec03f7f77c2f686995050930bab18d8be5be","observation_id":"8554926e-dcd0-4b2a-93ab-00b3c145a3de","resolution":{"observed_at":"2026-08-06T21:07:25.030945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:25.105749Z","title":"Neural discrete representation learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:25.105749Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:0483091658e53f4686ae3c610d96bda6a779325d4e3a04a6a41ae4e8804fd618","observation_id":"d9d6a6d4-90fa-462c-9991-fda81792a0fb","resolution":{"observed_at":"2026-08-06T21:07:25.105749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:26.980594Z","title":"Chatgpt for robotics: Design principles and model abilities","venue":null,"work_id":"06bb5c32-992c-4514-b3c6-b780b92c97ec","year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:25.151700Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:0702da2d4e8fb6e26a523d0efe852cddca8a9f83c3d519f6ce052e2feafe9e56","observation_id":"9c69885d-71c4-4ad6-b823-a8a55f78fdc6","resolution":{"observed_at":"2026-08-06T21:07:27.044323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00025","last_updated":"2024-07-12T12:51:00Z","snapshot_observed_at":"2026-07-06T17:09:59.848387Z","submitted_at":"2023-12-28T23:34:43Z","title":"Any-point Trajectory Modeling for Policy Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00025","snapshot_observed_at":"2026-08-06T21:07:25.244285Z","title":"Any-point trajectory modeling for policy learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:25.244285Z"},"links":{"cited_paper":"/paper/2401.00025","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:02c7afe296f810b95edf6d9d6fa1560809a0876061b3673b8fae66ba320832d8","observation_id":"bd82c91d-c9d7-45fc-a6a3-c4788a484fdb","resolution":{"observed_at":"2026-08-06T21:07:25.244285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12514","last_updated":"2025-05-13T11:02:20Z","snapshot_observed_at":"2026-08-07T15:12:56.367961Z","submitted_at":"2024-09-19T07:10:18Z","title":"TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12514","snapshot_observed_at":"2026-08-06T21:07:25.323052Z","title":"Tinyvla: Towards fast, data-efficient vision- language-action models for robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:25.323052Z"},"links":{"cited_paper":"/paper/2409.12514","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:146943ecbb5e6fa6cdc50e0aead7a9a1e505aacbc6e53186492b2d4c1d99454e","observation_id":"fd872960-f77d-4bab-9005-d9e24eec506c","resolution":{"observed_at":"2026-08-06T21:07:25.323052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05716","last_updated":"2025-02-07T14:58:32Z","snapshot_observed_at":"2026-07-06T15:40:39.214427Z","submitted_at":"2023-06-09T07:22:12Z","title":"Transferring Foundation Models for Generalizable Robotic Manipulation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05716","snapshot_observed_at":"2026-08-06T21:07:25.362504Z","title":"Transferring foundation models for generalizable robotic ma- nipulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:25.362504Z"},"links":{"cited_paper":"/paper/2306.05716","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:115023de09ef8969bac1fefa94e37a5cf56bf58765f28213b1f3db48e08b7581","observation_id":"748b3e90-2048-49ad-a580-f499ac889134","resolution":{"observed_at":"2026-08-06T21:07:25.362504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05304","last_updated":"2024-11-21T17:45:43Z","snapshot_observed_at":"2026-07-06T17:41:34.856417Z","submitted_at":"2024-03-08T13:33:00Z","title":"Spatiotemporal Predictive Pre-training for Robotic Motor Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05304","snapshot_observed_at":"2026-08-06T21:07:25.446793Z","title":"Spatiotemporal predictive pre-training for robotic motor control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:25.446793Z"},"links":{"cited_paper":"/paper/2403.05304","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:bf352ee3aceba5955f5e548f62baeedae04b925db71605f3ba707312ceb4ef95","observation_id":"da1bc365-02d9-4d08-a4b0-9b76864969d4","resolution":{"observed_at":"2026-08-06T21:07:25.446793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14519","last_updated":"2025-04-01T17:59:17Z","snapshot_observed_at":"2026-08-08T04:32:35.112465Z","submitted_at":"2024-11-21T16:45:43Z","title":"Tra-MoE: Learning Trajectory Prediction Model from Multiple Domains for Adaptive Policy Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14519","snapshot_observed_at":"2026-08-06T21:07:25.504405Z","title":"Tra-moe: Learning trajectory prediction model from multiple domains for adaptive policy condition- ing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:25.504405Z"},"links":{"cited_paper":"/paper/2411.14519","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:475930b13c56dda14dee043de107239d8322bed3148d5f6e266ce2062c71b52d","observation_id":"e1d8b0a8-5381-4bc9-bd51-22bf5b3618a4","resolution":{"observed_at":"2026-08-06T21:07:25.504405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-08-06T21:07:25.536516Z","title":"Latent action pretraining from videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:25.536516Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:128dc87e54c415cb2aa7a1af111c293a9368845c7bf76f2c9d50c9e6c3903de6","observation_id":"5a69ef97-ae9a-40d9-9334-e9c04c16722c","resolution":{"observed_at":"2026-08-06T21:07:25.536516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-08-07T02:44:43.738657Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-08-06T21:07:25.595946Z","title":"Robotic control via embodied chain-of-thought reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:25.595946Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:d420e3b7b9e51acb6f17e1cf80a2d199089988ebe59c7c33f79afb5b44dedff1","observation_id":"1b81bb15-fd8f-409e-9e5f-108a76b3b3ba","resolution":{"observed_at":"2026-08-06T21:07:25.595946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:26.862780Z","title":"Soundstream: An end-to- end neural audio codec","venue":null,"work_id":"0e6a40e5-69f7-4db5-8a6c-bd0d3945afa8","year":2021},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:25.664555Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:de8bdb2b067505aee10fdc1af175bd4d103dd87b0d12c8e4b19e3f3c712d976a","observation_id":"a4a5ee28-9536-481e-b8cc-fca2f56b8fbf","resolution":{"observed_at":"2026-08-06T21:07:26.923590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:25.702842Z","title":"Moviedreamer: Hierarchical generation for coherent long visual sequence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:25.702842Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:921ace39302a969055d0dc55aadbce012fb3d1f60b5478a0360af15d2c45b28e","observation_id":"296c81bb-282e-4713-b691-debf1cd58ac1","resolution":{"observed_at":"2026-08-06T21:07:25.702842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:25.791210Z","title":"Diception: A generalist diffusion model for visual perceptual tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:25.791210Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:1f2e50db552db7fa6d7900c7d427b07f33b9ba4ce08f838c7c67485ea2a7dda1","observation_id":"850984de-93ef-4ff3-ab41-3585a9bf2cea","resolution":{"observed_at":"2026-08-06T21:07:25.791210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-08-06T21:07:25.850810Z","title":"Learning fine-grained bimanual manipulation with low- cost hardware","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:25.850810Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:494a19d957b0d0854de2cfde004772ea180dbbd80bdcec677813a6c1d5628fde","observation_id":"9b04ccf3-2d15-4542-855f-c4cece5049b7","resolution":{"observed_at":"2026-08-06T21:07:25.850810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13508","last_updated":"2025-02-21T07:01:56Z","snapshot_observed_at":"2026-08-07T18:06:23.081376Z","submitted_at":"2025-02-19T07:53:45Z","title":"VLAS: Vision-Language-Action Model With Speech Instructions For Customized Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13508","snapshot_observed_at":"2026-08-06T21:07:25.936596Z","title":"Vlas: Vision-language-action model with speech instructions for customized robot manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:25.936596Z"},"links":{"cited_paper":"/paper/2502.13508","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:573fecdb5e47365152cc342a626544a92bb68a2488104c48f54258b67c40bd67","observation_id":"ef8e333e-3baf-4787-8619-ad432f15f447","resolution":{"observed_at":"2026-08-06T21:07:25.936596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-05T20:54:58.855446Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-06T21:07:25.998032Z","title":"3d-vla: A 3d vision-language-action generative world model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:25.998032Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:bfde9bd763bba88efb1ca10ad09c9f8306ca6d36e25ee959325f763b6050d80e","observation_id":"50648549-db24-47ed-9cd1-4360a95c363b","resolution":{"observed_at":"2026-08-06T21:07:25.998032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:26.771059Z","title":"Point cloud matters: Rethinking the impact of different observation spaces on robot learn- ing","venue":null,"work_id":"b702d064-62a1-4afe-83c0-1cbd7b119a8b","year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:26.049381Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:687ee9b5f16c8fe0cba28dc738091c707b458dd8c1e4c713d937113158ddac54","observation_id":"cb1aa5e6-43e7-4995-b644-82f7e86dbef5","resolution":{"observed_at":"2026-08-06T21:07:26.828145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08208","last_updated":"2025-03-01T15:51:38Z","snapshot_observed_at":"2026-08-09T13:26:34.101512Z","submitted_at":"2024-10-10T17:59:51Z","title":"SPA: 3D Spatial-Awareness Enables Effective Embodied Representation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08208","snapshot_observed_at":"2026-08-06T21:07:26.130586Z","title":"Spa: 3d spatial-awareness enables effective embodied representation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:26.130586Z"},"links":{"cited_paper":"/paper/2410.08208","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:306a91a8ebe07e37bcdaf9386016ac11447817d9e56b9df72eb593136a274b7b","observation_id":"d873b553-398d-4f19-8b8c-2d544b0d7e47","resolution":{"observed_at":"2026-08-06T21:07:26.130586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 14 inbound Pith citation observations for arXiv:2507.01016."}