{"as_of":"2026-08-16T08:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3d0d4f635118cd5de6bd9ba73cb79d2c594e6200cf41981afe94b32052104f02","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:06:38.524296Z","state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":30,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:33:39.096472Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2506.17811","doi":"10.48550/arxiv.2506.17811","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robomonkey: Scaling test-time sampling and verifi- cation for vision-language-action models","venue":"arXiv (Cornell University)","work_id":"2ac4686a-c8e9-4f2f-ac62-4f6c5956e8cd","year":2025},"citing_paper":{"arxiv_id":"2405.14093","last_updated":"2026-05-01T01:50:44Z","snapshot_observed_at":"2026-08-04T06:47:25.827167Z","submitted_at":"2024-05-23T01:43:54Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","version":8},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-24T01:25:10.150459Z"},"links":{"cited_paper":"/paper/2506.17811","citing_paper":"/paper/2405.14093"},"observation_digest":"sha256:029e155e7b87c239c0f941cc46d181c0bef5be32c86f9adb2177a7a2e644b426","observation_id":"edfdb120-c5e4-469e-abf7-aaccd705f309","resolution":{"observed_at":"2026-05-24T01:25:54.534326Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17811","snapshot_observed_at":"2026-08-04T11:20:12.318041Z","title":"Robomonkey: Scaling test-time sampling and verification for vision-language- action models.arXiv preprint arXiv:2506.17811,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.05681","last_updated":"2026-07-04T15:45:15Z","snapshot_observed_at":"2026-08-04T11:20:10.610981Z","submitted_at":"2025-10-07T08:38:08Z","title":"Verifier-free Test-Time Sampling for Vision-Language-Action Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T11:20:12.318041Z"},"links":{"cited_paper":"/paper/2506.17811","citing_paper":"/paper/2510.05681"},"observation_digest":"sha256:23a7cb65f1344056251189980cc411f2139e12482746cbd027bb36f19318a2d3","observation_id":"a3653210-b34b-4cae-9497-566057a51829","resolution":{"observed_at":"2026-08-04T11:20:12.318041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17811","snapshot_observed_at":"2026-08-03T14:10:35.494365Z","title":"Robomonkey: Scaling test-time sampling and ver- ification for vision-language-action models.arXiv preprint arXiv:2506.17811, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21430","last_updated":"2026-06-03T18:06:11Z","snapshot_observed_at":"2026-08-15T09:04:10.523399Z","submitted_at":"2025-12-24T21:36:34Z","title":"EVE: A Generator-Verifier System for Generative Policies","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T14:10:35.494365Z"},"links":{"cited_paper":"/paper/2506.17811","citing_paper":"/paper/2512.21430"},"observation_digest":"sha256:a3442d8a50b8ee07649ad90f02446f0269af64ea525676d5404b2598b9628ebf","observation_id":"5233924e-4ad9-46ed-9b19-e95e50ebb821","resolution":{"observed_at":"2026-08-03T14:10:35.494365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2506.17811","doi":"10.48550/arxiv.2506.17811","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robomonkey: Scaling test-time sampling and verifi- cation for vision-language-action models","venue":"arXiv (Cornell University)","work_id":"2ac4686a-c8e9-4f2f-ac62-4f6c5956e8cd","year":2025},"citing_paper":{"arxiv_id":"2602.13193","last_updated":"2026-04-06T03:04:33Z","snapshot_observed_at":"2026-08-11T00:39:38.533421Z","submitted_at":"2026-02-13T18:57:56Z","title":"Steerable Vision-Language-Action Policies for Embodied Reasoning and Hierarchical Control","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-15T22:05:39.797848Z"},"links":{"cited_paper":"/paper/2506.17811","citing_paper":"/paper/2602.13193"},"observation_digest":"sha256:18fbf2b0a245a2335f03886917810c22cbb674d56a134b7fe7312362067db18f","observation_id":"5b96847f-426c-4cbc-bca9-6886648566a3","resolution":{"observed_at":"2026-05-15T22:06:42.922905Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2506.17811","doi":"10.48550/arxiv.2506.17811","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robomonkey: Scaling test-time sampling and verifi- cation for vision-language-action models","venue":"arXiv (Cornell University)","work_id":"2ac4686a-c8e9-4f2f-ac62-4f6c5956e8cd","year":2025},"citing_paper":{"arxiv_id":"2602.22474","last_updated":"2026-05-12T19:47:13Z","snapshot_observed_at":"2026-08-16T04:15:24.036714Z","submitted_at":"2026-02-25T23:23:22Z","title":"When to Act, Ask, or Learn: Uncertainty-Aware Policy Steering","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T19:00:12.595469Z"},"links":{"cited_paper":"/paper/2506.17811","citing_paper":"/paper/2602.22474"},"observation_digest":"sha256:4c1611e4a9ec6e524764fb34cdf91fa241160a0a61162086941da9a33dadde0b","observation_id":"62c26e7b-1bfd-4e3e-b416-ec4a6fab46cc","resolution":{"observed_at":"2026-05-15T19:00:15.390421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17811","snapshot_observed_at":"2026-07-13T14:05:26.303000Z","title":"Robomonkey: Scaling test-time sampling and verification for vision-language-action models.arXiv preprint arXiv:2506.17811, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01985","last_updated":"2026-05-29T16:27:50Z","snapshot_observed_at":"2026-08-14T09:47:36.459678Z","submitted_at":"2026-04-02T12:48:36Z","title":"World Action Verifier: Self-Improving World Models via Forward-Inverse Asymmetry","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-13T14:05:26.303000Z"},"links":{"cited_paper":"/paper/2506.17811","citing_paper":"/paper/2604.01985"},"observation_digest":"sha256:ccf5f6b0f98dc35b3f67409b52d494988dc0c8dfd62659b665cbf5446598f4cd","observation_id":"6a5c4afd-13aa-458d-a997-ba4df1b255cc","resolution":{"observed_at":"2026-07-13T14:05:26.303000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2506.17811","doi":"10.48550/arxiv.2506.17811","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robomonkey: Scaling test-time sampling and verifi- cation for vision-language-action models","venue":"arXiv (Cornell University)","work_id":"2ac4686a-c8e9-4f2f-ac62-4f6c5956e8cd","year":2025},"citing_paper":{"arxiv_id":"2604.05672","last_updated":"2026-04-15T03:34:03Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T10:18:40Z","title":"A1: A Fully Transparent Open-Source, Adaptive and Efficient Truncated Vision-Language-Action Model","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T19:31:23.255452Z"},"links":{"cited_paper":"/paper/2506.17811","citing_paper":"/paper/2604.05672"},"observation_digest":"sha256:70936eab96b75d142b2d94861fa98157bce20eaf138989d55a88fea5bbfad471","observation_id":"5ed0ebed-4ab1-4060-8e6c-3a920776859f","resolution":{"observed_at":"2026-05-10T22:50:51.354393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2506.17811","doi":"10.48550/arxiv.2506.17811","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robomonkey: Scaling test-time sampling and verifi- cation for vision-language-action models","venue":"arXiv (Cornell University)","work_id":"2ac4686a-c8e9-4f2f-ac62-4f6c5956e8cd","year":2025},"citing_paper":{"arxiv_id":"2604.18107","last_updated":"2026-04-20T11:25:51Z","snapshot_observed_at":"2026-08-13T00:59:13.469270Z","submitted_at":"2026-04-20T11:25:51Z","title":"Test-Time Perturbation Learning with Delayed Feedback for Vision-Language-Action Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T05:56:15.244586Z"},"links":{"cited_paper":"/paper/2506.17811","citing_paper":"/paper/2604.18107"},"observation_digest":"sha256:64f2ae554a41a84e7582a5f33ffdec695e9e7d2ce24b826f7567e6326b5f78f0","observation_id":"e233ee14-b447-4839-b7fa-28a5b9b87253","resolution":{"observed_at":"2026-05-10T06:06:19.436103Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2506.17811","doi":"10.48550/arxiv.2506.17811","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robomonkey: Scaling test-time sampling and verifi- cation for vision-language-action models","venue":"arXiv (Cornell University)","work_id":"2ac4686a-c8e9-4f2f-ac62-4f6c5956e8cd","year":2025},"citing_paper":{"arxiv_id":"2604.19730","last_updated":"2026-04-21T17:52:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-21T17:52:17Z","title":"FASTER: Value-Guided Sampling for Fast RL","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T02:47:36.475845Z"},"links":{"cited_paper":"/paper/2506.17811","citing_paper":"/paper/2604.19730"},"observation_digest":"sha256:fc4759ec0e40000fc22a859f3613c1a4f71a9bf4a41440faea0806d74d782d64","observation_id":"47fe3bba-3321-450d-8847-d759182c8b7c","resolution":{"observed_at":"2026-05-10T02:48:26.489694Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2506.17811","doi":"10.48550/arxiv.2506.17811","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robomonkey: Scaling test-time sampling and verifi- cation for vision-language-action models","venue":"arXiv (Cornell University)","work_id":"2ac4686a-c8e9-4f2f-ac62-4f6c5956e8cd","year":2025},"citing_paper":{"arxiv_id":"2605.01194","last_updated":"2026-05-02T02:13:11Z","snapshot_observed_at":"2026-08-15T19:42:01.165650Z","submitted_at":"2026-05-02T02:13:11Z","title":"VLA-ATTC: Adaptive Test-Time Compute for VLA Models with Relative Action Critic Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-09T15:10:16.533927Z"},"links":{"cited_paper":"/paper/2506.17811","citing_paper":"/paper/2605.01194"},"observation_digest":"sha256:2a7101fd1e202cf6c1c20f9723dfdadaaf01c6afb53ba812a9ca6d0c4e42d078","observation_id":"7721425b-da35-442f-b07e-f7f3cd0731f7","resolution":{"observed_at":"2026-05-11T16:46:06.411348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2506.17811","doi":"10.48550/arxiv.2506.17811","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robomonkey: Scaling test-time sampling and verifi- cation for vision-language-action models","venue":"arXiv (Cornell University)","work_id":"2ac4686a-c8e9-4f2f-ac62-4f6c5956e8cd","year":2025},"citing_paper":{"arxiv_id":"2605.10094","last_updated":"2026-05-12T11:39:28Z","snapshot_observed_at":"2026-08-06T05:38:04.446908Z","submitted_at":"2026-05-11T07:11:10Z","title":"Retrieve-then-Steer: Online Success Memory for Test-Time Adaptation of Generative VLAs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T03:46:01.737920Z"},"links":{"cited_paper":"/paper/2506.17811","citing_paper":"/paper/2605.10094"},"observation_digest":"sha256:b619203516adbfb8ca5949b7b9a57ef65bed03e4a812059b3b193f797e8ca416","observation_id":"58771551-4cd8-4a59-8dc8-ccb39886429b","resolution":{"observed_at":"2026-05-12T07:06:27.337192Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2506.17811","doi":"10.48550/arxiv.2506.17811","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robomonkey: Scaling test-time sampling and verifi- cation for vision-language-action models","venue":"arXiv (Cornell University)","work_id":"2ac4686a-c8e9-4f2f-ac62-4f6c5956e8cd","year":2025},"citing_paper":{"arxiv_id":"2605.10094","last_updated":"2026-05-12T11:39:28Z","snapshot_observed_at":"2026-08-06T05:38:04.446908Z","submitted_at":"2026-05-11T07:11:10Z","title":"Retrieve-then-Steer: Online Success Memory for Test-Time Adaptation of Generative VLAs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T07:50:13.845621Z"},"links":{"cited_paper":"/paper/2506.17811","citing_paper":"/paper/2605.10094"},"observation_digest":"sha256:324da3884e9f55c4a7644d981e2a4150b924c8b2e3f96578673bd2fd0fe46312","observation_id":"4da659ed-a157-4656-ab83-5f7bda2d0144","resolution":{"observed_at":"2026-05-13T07:52:32.091527Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2506.17811","doi":"10.48550/arxiv.2506.17811","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robomonkey: Scaling test-time sampling and verifi- cation for vision-language-action models","venue":"arXiv (Cornell University)","work_id":"2ac4686a-c8e9-4f2f-ac62-4f6c5956e8cd","year":2025},"citing_paper":{"arxiv_id":"2605.12620","last_updated":"2026-05-12T18:08:24Z","snapshot_observed_at":"2026-08-13T20:14:46.598389Z","submitted_at":"2026-05-12T18:08:24Z","title":"Think Twice, Act Once: Verifier-Guided Action Selection For Embodied Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-14T21:04:05.443622Z"},"links":{"cited_paper":"/paper/2506.17811","citing_paper":"/paper/2605.12620"},"observation_digest":"sha256:061984afb6fc514678399ba2e91aca2ac86e58dc9d4dec973913158fc2f1248a","observation_id":"571dd059-587f-444d-8b48-6592f7ff21d9","resolution":{"observed_at":"2026-05-14T21:19:28.884923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2506.17811","doi":"10.48550/arxiv.2506.17811","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robomonkey: Scaling test-time sampling and verifi- cation for vision-language-action models","venue":"arXiv (Cornell University)","work_id":"2ac4686a-c8e9-4f2f-ac62-4f6c5956e8cd","year":2025},"citing_paper":{"arxiv_id":"2605.30660","last_updated":"2026-05-28T23:39:09Z","snapshot_observed_at":"2026-08-13T01:38:10.471558Z","submitted_at":"2026-05-28T23:39:09Z","title":"BOKBO (Best of K Bad Options): Calibrated Abstention for VLA Policies","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T08:08:00.917021Z"},"links":{"cited_paper":"/paper/2506.17811","citing_paper":"/paper/2605.30660"},"observation_digest":"sha256:231f3e71869e71f168510926add8fea2d920b9212e8b5d154b88828c7e1a8f9a","observation_id":"25a87d92-38ca-45b2-85ca-2506e047f2b5","resolution":{"observed_at":"2026-06-29T08:13:15.469458Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2506.17811","doi":"10.48550/arxiv.2506.17811","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robomonkey: Scaling test-time sampling and verifi- cation for vision-language-action models","venue":"arXiv (Cornell University)","work_id":"2ac4686a-c8e9-4f2f-ac62-4f6c5956e8cd","year":2025},"citing_paper":{"arxiv_id":"2606.01036","last_updated":"2026-05-31T05:56:28Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T05:56:28Z","title":"Position: Good Embodied Reward Models Need Bad Behavior Data","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T17:18:17.337336Z"},"links":{"cited_paper":"/paper/2506.17811","citing_paper":"/paper/2606.01036"},"observation_digest":"sha256:12cb1c3f72dfb5a4b381801a5dc4805e8a49740083ecc8c7e5fd82869d4aee72","observation_id":"1e8edaba-78a9-4527-83e6-4658151a8536","resolution":{"observed_at":"2026-06-28T17:22:24.983591Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2506.17811","doi":"10.48550/arxiv.2506.17811","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robomonkey: Scaling test-time sampling and verifi- cation for vision-language-action models","venue":"arXiv (Cornell University)","work_id":"2ac4686a-c8e9-4f2f-ac62-4f6c5956e8cd","year":2025},"citing_paper":{"arxiv_id":"2606.08015","last_updated":"2026-07-19T14:50:06Z","snapshot_observed_at":"2026-08-02T23:41:02.702950Z","submitted_at":"2026-06-06T07:10:25Z","title":"Q-VGM: Q-Value-Gradient Matching for Off-Policy Reinforcement Learning of Flow-Matching VLA","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T19:57:25.010339Z"},"links":{"cited_paper":"/paper/2506.17811","citing_paper":"/paper/2606.08015"},"observation_digest":"sha256:a24d577a94e8f4a6fc1861b11736c394b3c52c70ce66a89d8067b2d73821b65a","observation_id":"d634f6ca-4601-4581-b9d6-b698e0d0fb38","resolution":{"observed_at":"2026-07-02T21:07:23.740490Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17811","snapshot_observed_at":"2026-08-02T12:13:46.079807Z","title":"RoboMonkey: Scaling test-time sampling and verification for vision- language-action models.arXiv preprint arXiv:2506.17811, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08015","last_updated":"2026-07-19T14:50:06Z","snapshot_observed_at":"2026-08-02T23:41:02.702950Z","submitted_at":"2026-06-06T07:10:25Z","title":"Q-VGM: Q-Value-Gradient Matching for Off-Policy Reinforcement Learning of Flow-Matching VLA","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T12:13:46.079807Z"},"links":{"cited_paper":"/paper/2506.17811","citing_paper":"/paper/2606.08015"},"observation_digest":"sha256:5837c0b7a35029561e89245d0fe42648db870498a72b8d7d544db28b48e7c7a7","observation_id":"2a9d5541-b750-4a89-8d8b-960072f382df","resolution":{"observed_at":"2026-08-02T12:13:46.079807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2506.17811","doi":"10.48550/arxiv.2506.17811","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robomonkey: Scaling test-time sampling and verifi- cation for vision-language-action models","venue":"arXiv (Cornell University)","work_id":"2ac4686a-c8e9-4f2f-ac62-4f6c5956e8cd","year":2025},"citing_paper":{"arxiv_id":"2606.08231","last_updated":"2026-06-06T15:39:29Z","snapshot_observed_at":"2026-08-07T16:58:05.550639Z","submitted_at":"2026-06-06T15:39:29Z","title":"Test-Time Scaling in Multimodal Foundation Models: A Comprehensive Survey of Generation and Reasoning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-27T19:36:57.231932Z"},"links":{"cited_paper":"/paper/2506.17811","citing_paper":"/paper/2606.08231"},"observation_digest":"sha256:e17fd5c5d907d072b29c3412d5e93775a050cf8621a8b900213ce59b1a678bee","observation_id":"249821c4-17aa-4189-b796-6c354f5e982a","resolution":{"observed_at":"2026-07-02T21:37:25.336361Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2506.17811","doi":"10.48550/arxiv.2506.17811","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robomonkey: Scaling test-time sampling and verifi- cation for vision-language-action models","venue":"arXiv (Cornell University)","work_id":"2ac4686a-c8e9-4f2f-ac62-4f6c5956e8cd","year":2025},"citing_paper":{"arxiv_id":"2606.10568","last_updated":"2026-06-09T08:31:59Z","snapshot_observed_at":"2026-07-06T23:49:47.137691Z","submitted_at":"2026-06-09T08:31:59Z","title":"VeriSpace: Spatially Grounded Action Verification for Vision-Language-Action Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T12:47:35.314486Z"},"links":{"cited_paper":"/paper/2506.17811","citing_paper":"/paper/2606.10568"},"observation_digest":"sha256:3f454ac0915a4df4eec51f0994f5c217fe31c49e31ba849ad8f8a3e8eaa22890","observation_id":"46650ddc-4c73-4c07-b549-9526b0621644","resolution":{"observed_at":"2026-07-03T06:17:41.823491Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2506.17811","doi":"10.48550/arxiv.2506.17811","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robomonkey: Scaling test-time sampling and verifi- cation for vision-language-action models","venue":"arXiv (Cornell University)","work_id":"2ac4686a-c8e9-4f2f-ac62-4f6c5956e8cd","year":2025},"citing_paper":{"arxiv_id":"2606.13675","last_updated":"2026-06-11T17:59:45Z","snapshot_observed_at":"2026-07-30T00:58:38.369141Z","submitted_at":"2026-06-11T17:59:45Z","title":"Improving Robotic Generalist Policies via Flow Reversal Steering","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-27T06:20:19.209180Z"},"links":{"cited_paper":"/paper/2506.17811","citing_paper":"/paper/2606.13675"},"observation_digest":"sha256:840815d1b68cf64ad010ce6c5583d7107a87527e10ece0c5389bfc3840c57924","observation_id":"1a19962c-56bb-46eb-b9d9-9650480934db","resolution":{"observed_at":"2026-07-03T15:48:35.766856Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2506.17811","doi":"10.48550/arxiv.2506.17811","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robomonkey: Scaling test-time sampling and verifi- cation for vision-language-action models","venue":"arXiv (Cornell University)","work_id":"2ac4686a-c8e9-4f2f-ac62-4f6c5956e8cd","year":2025},"citing_paper":{"arxiv_id":"2606.18589","last_updated":"2026-06-17T01:28:07Z","snapshot_observed_at":"2026-08-11T18:02:09.190978Z","submitted_at":"2026-06-17T01:28:07Z","title":"DREAM-Chunk: Reactive Action Chunking with Latent World Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T21:25:03.953677Z"},"links":{"cited_paper":"/paper/2506.17811","citing_paper":"/paper/2606.18589"},"observation_digest":"sha256:cd12ad4fc40b4a9d049acc2ea119a58644c234f90bf33a260650af4bcbb73603","observation_id":"f9191966-ddb5-46eb-ba49-0ba830711892","resolution":{"observed_at":"2026-07-04T00:09:15.344625Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2506.17811","doi":"10.48550/arxiv.2506.17811","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robomonkey: Scaling test-time sampling and verifi- cation for vision-language-action models","venue":"arXiv (Cornell University)","work_id":"2ac4686a-c8e9-4f2f-ac62-4f6c5956e8cd","year":2025},"citing_paper":{"arxiv_id":"2606.22998","last_updated":"2026-06-23T07:19:46Z","snapshot_observed_at":"2026-07-06T23:57:47.047975Z","submitted_at":"2026-06-22T08:14:35Z","title":"TEXEDO : Test Time Scaling for Controller-aware Language-conditioned Humanoid Motion Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T08:50:47.113217Z"},"links":{"cited_paper":"/paper/2506.17811","citing_paper":"/paper/2606.22998"},"observation_digest":"sha256:cf48089001f0520811c15dd2362b17ff305ce42eed0266ea3abb4123724024ab","observation_id":"e1dc8254-71c4-45bc-8e92-7889ecbea1c7","resolution":{"observed_at":"2026-07-04T10:29:44.874350Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2506.17811","doi":"10.48550/arxiv.2506.17811","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robomonkey: Scaling test-time sampling and verifi- cation for vision-language-action models","venue":"arXiv (Cornell University)","work_id":"2ac4686a-c8e9-4f2f-ac62-4f6c5956e8cd","year":2025},"citing_paper":{"arxiv_id":"2606.26006","last_updated":"2026-06-24T16:23:18Z","snapshot_observed_at":"2026-07-07T00:00:21.918469Z","submitted_at":"2026-06-24T16:23:18Z","title":"FORCE: Efficient VLA Reinforcement Fine-Tuning via Value-Calibrated Warm-up and Self-Distillation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-25T19:29:00.117285Z"},"links":{"cited_paper":"/paper/2506.17811","citing_paper":"/paper/2606.26006"},"observation_digest":"sha256:e69d2458072bd74d970ddfb7bab1cfaa0c1d154271ec69b1d8ce9c4f7f11a102","observation_id":"034156c2-f375-4932-95c7-767b4479c82c","resolution":{"observed_at":"2026-06-27T04:40:32.808464Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2506.17811","doi":"10.48550/arxiv.2506.17811","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robomonkey: Scaling test-time sampling and verifi- cation for vision-language-action models","venue":"arXiv (Cornell University)","work_id":"2ac4686a-c8e9-4f2f-ac62-4f6c5956e8cd","year":2025},"citing_paper":{"arxiv_id":"2606.26080","last_updated":"2026-06-24T17:54:08Z","snapshot_observed_at":"2026-08-02T15:38:18.729836Z","submitted_at":"2026-06-24T17:54:08Z","title":"Neglected Free Lunch from Post-training: Progress Advantage for LLM Agents","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-06-25T19:55:51.114244Z"},"links":{"cited_paper":"/paper/2506.17811","citing_paper":"/paper/2606.26080"},"observation_digest":"sha256:782ffed2fe152763a20395078843878ba18836e8baf6a5db10a9ad14097b4c43","observation_id":"24d9cc48-6a8e-483a-aba3-3455be10c0d1","resolution":{"observed_at":"2026-07-04T20:40:07.874571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2506.17811","doi":"10.48550/arxiv.2506.17811","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robomonkey: Scaling test-time sampling and verifi- cation for vision-language-action models","venue":"arXiv (Cornell University)","work_id":"2ac4686a-c8e9-4f2f-ac62-4f6c5956e8cd","year":2025},"citing_paper":{"arxiv_id":"2606.27268","last_updated":"2026-06-25T16:50:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-25T16:50:21Z","title":"E-TTS: A New Embodied Test-Time Scaling Framework for Robotic Manipulation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T04:48:28.868562Z"},"links":{"cited_paper":"/paper/2506.17811","citing_paper":"/paper/2606.27268"},"observation_digest":"sha256:a9af269accf149328bdfdd4238e6336bd28528b005c8cb2105c9b04d0f18f19e","observation_id":"cbf0cef8-129f-419b-99e3-a59a24afc55e","resolution":{"observed_at":"2026-07-04T13:59:51.743107Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2506.17811","doi":"10.48550/arxiv.2506.17811","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robomonkey: Scaling test-time sampling and verifi- cation for vision-language-action models","venue":"arXiv (Cornell University)","work_id":"2ac4686a-c8e9-4f2f-ac62-4f6c5956e8cd","year":2025},"citing_paper":{"arxiv_id":"2606.30613","last_updated":"2026-06-29T17:48:01Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:48:01Z","title":"Sequential Planning via Anchored Robotic Keypoints","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T04:59:12.363425Z"},"links":{"cited_paper":"/paper/2506.17811","citing_paper":"/paper/2606.30613"},"observation_digest":"sha256:2ee38b70556c2c953f7aedfddd3c86f5c63a5e0935187e29a92d68e3a8648cae","observation_id":"a3dce2f3-a2d9-4f3d-a051-19829b317a00","resolution":{"observed_at":"2026-06-30T05:04:20.305003Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2506.17811","doi":"10.48550/arxiv.2506.17811","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robomonkey: Scaling test-time sampling and verifi- cation for vision-language-action models","venue":"arXiv (Cornell University)","work_id":"2ac4686a-c8e9-4f2f-ac62-4f6c5956e8cd","year":2025},"citing_paper":{"arxiv_id":"2606.31132","last_updated":"2026-06-30T05:00:32Z","snapshot_observed_at":"2026-07-07T00:04:53.774826Z","submitted_at":"2026-06-30T05:00:32Z","title":"ELASTIC: Efficiently Learning to Adaptively Scale Test-Time Compute for Generative Control Policies","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-01T05:44:43.682828Z"},"links":{"cited_paper":"/paper/2506.17811","citing_paper":"/paper/2606.31132"},"observation_digest":"sha256:fa086cb5139caf9f0d7d0490f5845acbb5bec68687b80e15724d1a495ce63aba","observation_id":"1ff96540-ca17-4162-bb44-c6ec42c22457","resolution":{"observed_at":"2026-07-01T05:45:25.230116Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17811","snapshot_observed_at":"2026-08-01T06:55:48.373261Z","title":"Kang et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21725","last_updated":"2026-07-23T18:18:32Z","snapshot_observed_at":"2026-08-07T09:12:42.560281Z","submitted_at":"2026-07-23T18:18:32Z","title":"Addressing the Orchestration Gap in Generalist Robots via Physical Agency","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T06:55:48.373261Z"},"links":{"cited_paper":"/paper/2506.17811","citing_paper":"/paper/2607.21725"},"observation_digest":"sha256:8d19927df70c7ed4d3795838008d9c662b8fd8bb89be3648f7af2438bedc5ad3","observation_id":"7dbbbd27-8f04-4a49-8abd-ca84d1638c6a","resolution":{"observed_at":"2026-08-01T06:55:48.373261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17811","snapshot_observed_at":"2026-08-04T00:44:25.466499Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00337","last_updated":"2026-07-31T22:58:59Z","snapshot_observed_at":"2026-08-14T17:43:55.981621Z","submitted_at":"2026-07-31T22:58:59Z","title":"Action Chunk Scheduling for Batched Robot Policy Serving","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T00:44:25.466499Z"},"links":{"cited_paper":"/paper/2506.17811","citing_paper":"/paper/2608.00337"},"observation_digest":"sha256:91ba9dec7d464e3c860cb20b743c77c025092c9ff3f36c26a2e06b994c11dfaf","observation_id":"74547591-ffd8-4c5d-85a8-59a55fe33727","resolution":{"observed_at":"2026-08-04T00:44:25.466499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17811","snapshot_observed_at":"2026-08-15T14:33:39.096472Z","title":"arXiv preprint arXiv:2506.17811 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06729","last_updated":"2026-08-07T02:49:39Z","snapshot_observed_at":"2026-08-15T21:39:46.929480Z","submitted_at":"2026-08-07T02:49:39Z","title":"AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:39.096472Z"},"links":{"cited_paper":"/paper/2506.17811","citing_paper":"/paper/2608.06729"},"observation_digest":"sha256:8049d5ca3dc0e7c83ee83a8b250c21a763c58e1faed976bb81341b8c523de213","observation_id":"dd585a45-c7b8-4582-8fed-cfd5017f5521","resolution":{"observed_at":"2026-08-15T14:33:39.096472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.17811/citation-record","integrity":"/paper/2506.17811/integrity","json":"/paper/2506.17811/citation-record.json","paper":"/paper/2506.17811"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-15T19:06:37.720618Z","title":"Black, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:37.720618Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:1c1db0758da5af0da3072a996d38bdf91ab3faa094205cad9deeb746114cb662","observation_id":"4e059f11-7ec9-4262-8037-40809d52d008","resolution":{"observed_at":"2026-08-15T19:06:37.720618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-15T04:55:15.159462Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-15T19:06:37.820431Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:37.820431Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:634d5f979470b377e270e5c85eeea3bd0dc8512a900da527750eec4ff4eaf29c","observation_id":"15066f09-9a54-4e0c-a180-b55bad10623a","resolution":{"observed_at":"2026-08-15T19:06:37.820431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-14T18:47:26.721223Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-15T19:06:37.917365Z","title":"Driess, F","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:37.917365Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:e2c0266f1c1328c586dea0fcb1b563b59c31a2e7212ae2363c1d8bef9588f83b","observation_id":"83488752-6157-4a42-85b0-71592f090891","resolution":{"observed_at":"2026-08-15T19:06:37.917365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-15T19:06:37.945432Z","title":"Brohan, N","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:37.945432Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:975e47cf738f1b52a964e442114dd73b17cf2e3459814216ee81b26a2af9910c","observation_id":"c1ddb712-20ae-47fd-b766-afad2aa402dd","resolution":{"observed_at":"2026-08-15T19:06:37.945432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-15T19:06:37.965394Z","title":"Brohan, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:37.965394Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:3c90af6195ac94bca574254aacbd81c1296cde69ed30d0bf83d9df09c6b37a17","observation_id":"c38bf6fe-0a3a-465e-b4e9-ef30531c2c0c","resolution":{"observed_at":"2026-08-15T19:06:37.965394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-15T19:06:37.971689Z","title":"Khazatsky, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:37.971689Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:43c595319f52a7b94a19e065b642a57b1283849f5b50cc9a60016c402a4671b3","observation_id":"c6df4f1c-18c7-4f44-93ce-4c05d9ee50cc","resolution":{"observed_at":"2026-08-15T19:06:37.971689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-13T13:59:48.091257Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-15T19:06:37.977603Z","title":"O’Neill, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:37.977603Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:3ac200b70e0814d989d2d32eefdbf983d865062c7e06f4b6d809d5d1a789bcf6","observation_id":"91c077f5-fbb1-4816-a541-b54e26403883","resolution":{"observed_at":"2026-08-15T19:06:37.977603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04640","last_updated":"2024-10-10T17:09:24Z","snapshot_observed_at":"2026-08-14T05:29:12.035364Z","submitted_at":"2024-10-06T22:13:30Z","title":"Unpacking Failure Modes of Generative Policies: Runtime Monitoring of Consistency and Progress","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04640","snapshot_observed_at":"2026-08-15T19:06:37.981890Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:37.981890Z"},"links":{"cited_paper":"/paper/2410.04640","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:d590d1c04a530c1ebff16c71e950d0679599a039f3515f9c3869323cfddb0fa9","observation_id":"e7b01b71-4f62-40ff-a7b6-2c908f3ed1da","resolution":{"observed_at":"2026-08-15T19:06:37.981890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08735","last_updated":"2024-07-11T17:59:22Z","snapshot_observed_at":"2026-08-12T23:23:58.789490Z","submitted_at":"2024-07-11T17:59:22Z","title":"Real-Time Anomaly Detection and Reactive Planning with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08735","snapshot_observed_at":"2026-08-15T19:06:37.986849Z","title":"Sinha, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:37.986849Z"},"links":{"cited_paper":"/paper/2407.08735","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:b3aabd8c68da0135f139ce679a8c397145e578e5a516e8427849a4f8f6577ef8","observation_id":"5173db46-84b5-4d06-8e7a-ca875a913f41","resolution":{"observed_at":"2026-08-15T19:06:37.986849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20635","last_updated":"2024-10-15T17:54:17Z","snapshot_observed_at":"2026-08-12T23:12:14.990680Z","submitted_at":"2024-07-30T08:26:44Z","title":"Autonomous Improvement of Instruction Following Skills via Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.20635","snapshot_observed_at":"2026-08-15T19:06:37.991892Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:37.991892Z"},"links":{"cited_paper":"/paper/2407.20635","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:779cea535e31d464a0d116a6e8be3584c86b081059d078bdbc72e2104120ed75","observation_id":"2bdb5384-3bac-4ea7-91d1-b8326729e01c","resolution":{"observed_at":"2026-08-15T19:06:37.991892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:06:39.415343Z","title":null,"venue":null,"work_id":"56b170ee-28e4-4a27-b56c-1e034acd6365","year":2023},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.092611Z"},"links":{"citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:2fda73c95ac1c2767c529f4ab37a9a42afaa4f2eee4e0750023ab1ee496268d8","observation_id":"3f30a8b9-0bfb-4ee3-b866-7f54b211250e","resolution":{"observed_at":"2026-08-15T19:06:39.420120Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14037","last_updated":"2024-08-26T06:14:25Z","snapshot_observed_at":"2026-08-12T22:57:39.788028Z","submitted_at":"2024-08-26T06:14:25Z","title":"Re-Mix: Optimizing Data Mixtures for Large Scale Imitation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14037","snapshot_observed_at":"2026-08-15T19:06:38.138469Z","title":"Hejna, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.138469Z"},"links":{"cited_paper":"/paper/2408.14037","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:0225f2c4baac99f0d71944728c5b0ff5ee88d61206e69f469d59bcc9b9c68873","observation_id":"253698f0-fb00-4a30-beaa-449d6f8d59a5","resolution":{"observed_at":"2026-08-15T19:06:38.138469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:06:39.402030Z","title":null,"venue":null,"work_id":"6eaa3dc8-83e9-4586-93ed-dc42e14f32e7","year":2023},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.185687Z"},"links":{"citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:4390a2266d55683ddf867ef9c06e941e245e6f023f61c1b4cbb7a9380dfe2a0b","observation_id":"8a04da67-f2c0-431f-a736-e4372c90c757","resolution":{"observed_at":"2026-08-15T19:06:39.406138Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-12T23:18:51.506083Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-15T19:06:38.206319Z","title":"Cheang, G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.206319Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:9ef9b57a9f05b769860d26e909693d262356b7b8a1b6bc88b3fd8c4d1a854dbd","observation_id":"0a58b227-3677-4a19-86b6-51e4a7e85b0c","resolution":{"observed_at":"2026-08-15T19:06:38.206319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-08-15T19:06:38.210628Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.210628Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:c519ac518b814b98a3954a692d4c5d775c5e373c47f53aec5158a4cd6a7bc246","observation_id":"a58c5d9a-dbda-478b-9afd-3733512a29e4","resolution":{"observed_at":"2026-08-15T19:06:38.210628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-08-07T02:44:43.738657Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-08-15T19:06:38.214757Z","title":"Zawalski, W","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.214757Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:1f764d86601b5a8ee0ddcbc49ec757e7e7d1a98609d403d348877ffd96509f1c","observation_id":"38d57aa7-d733-4825-9016-d0a8f519a14a","resolution":{"observed_at":"2026-08-15T19:06:38.214757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:06:39.388304Z","title":"Clark, S","venue":null,"work_id":"df43f3d4-f61f-4edc-8e36-0ed38a74fcdb","year":null},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.219134Z"},"links":{"citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:b4c73104d27341bd62d3541dce060dc66bc143db636ca56fc351374935117173","observation_id":"f90b4e2e-cd28-4276-86e4-075fe468485b","resolution":{"observed_at":"2026-08-15T19:06:39.392652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22020","last_updated":"2025-03-27T22:23:04Z","snapshot_observed_at":"2026-08-11T02:04:51.188806Z","submitted_at":"2025-03-27T22:23:04Z","title":"CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22020","snapshot_observed_at":"2026-08-15T19:06:38.229182Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.229182Z"},"links":{"cited_paper":"/paper/2503.22020","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:64f265d2c52ca69e8c279dec3407c310bfcc1ae9753040398f499ad53070bf5a","observation_id":"6feb5e24-d370-4a0a-96a2-060a380a1766","resolution":{"observed_at":"2026-08-15T19:06:38.229182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-08-15T01:47:42.243585Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-15T19:06:38.234157Z","title":"Zhang, K","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.234157Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:9d8da4e3303b0fc60b927887063ab66cd920e8f134b434a244c133ac139408c8","observation_id":"a6a72b8a-6b33-4917-b966-3427af5083b2","resolution":{"observed_at":"2026-08-15T19:06:38.234157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03480","last_updated":"2026-04-19T06:23:17Z","snapshot_observed_at":"2026-07-30T14:07:10.544745Z","submitted_at":"2025-03-05T13:16:55Z","title":"SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03480","snapshot_observed_at":"2026-08-15T19:06:38.238907Z","title":"Zhang, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.238907Z"},"links":{"cited_paper":"/paper/2503.03480","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:dc8a88c7b4b1508ebe7a63ee76a8bbbf77e08de4769db0d6ad1454755e5c81c0","observation_id":"1ad6c9ec-260e-4e88-b27e-e5c084e30ad0","resolution":{"observed_at":"2026-08-15T19:06:38.238907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:06:38.259743Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.259743Z"},"links":{"citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:d8d50ba0f0abfe31ce51c79c3ef9aa0708e091f1f5c24331304b2da98845a304","observation_id":"d114ff00-4823-40d1-985a-fa979fc0fa12","resolution":{"observed_at":"2026-08-15T19:06:38.259743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-08-14T10:00:52.343929Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-15T19:06:38.295278Z","title":"Brown, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.295278Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:00e8c13bf24cca6e54033c8b323836699fdbae52e67a9e35c4d4c2102a1ed1c0","observation_id":"b0674c40-77d7-4e80-9047-b2c0f26a802f","resolution":{"observed_at":"2026-08-15T19:06:38.295278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-15T19:06:38.340900Z","title":"Snell, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.340900Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:53cb944a4d55803ad4ef2e5b505b223b0ab63c11d9187d4fba9ed0151e62357b","observation_id":"2c39bab2-ea9c-41e8-acff-71b86cb73548","resolution":{"observed_at":"2026-08-15T19:06:38.340900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15254","last_updated":"2025-06-10T21:52:15Z","snapshot_observed_at":"2026-08-12T22:39:21.535243Z","submitted_at":"2024-09-23T17:53:42Z","title":"Archon: An Architecture Search Framework for Inference-Time Techniques","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15254","snapshot_observed_at":"2026-08-15T19:06:38.373143Z","title":"Saad-Falcon, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.373143Z"},"links":{"cited_paper":"/paper/2409.15254","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:c548fd67bb80efab955af6f0c588126873693ad41a993b3978873da71d1d9d94","observation_id":"a66afff2-0ada-4a60-8afc-cc57ebb4fa02","resolution":{"observed_at":"2026-08-15T19:06:38.373143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02419","last_updated":"2024-06-04T21:20:33Z","snapshot_observed_at":"2026-08-14T17:54:56.641521Z","submitted_at":"2024-03-04T19:12:48Z","title":"Are More LLM Calls All You Need? Towards Scaling Laws of Compound Inference Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02419","snapshot_observed_at":"2026-08-15T19:06:38.379078Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.379078Z"},"links":{"cited_paper":"/paper/2403.02419","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:8a079eba8d4d69687fd9f1658dbe7a750a69e8963da7ea1af144dce49312dd60","observation_id":"e2917ace-fb17-4223-82c4-71dc3e5cb266","resolution":{"observed_at":"2026-08-15T19:06:38.379078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10457","last_updated":"2024-07-15T06:12:17Z","snapshot_observed_at":"2026-08-15T22:58:09.088173Z","submitted_at":"2024-07-15T06:12:17Z","title":"The Good, The Bad, and The Greedy: Evaluation of LLMs Should Not Ignore Non-Determinism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10457","snapshot_observed_at":"2026-08-15T19:06:38.383966Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.383966Z"},"links":{"cited_paper":"/paper/2407.10457","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:ce969d473e873aed73882e7135a36b9994307a21e44fa789fc89cf27a7b0a482","observation_id":"8c758267-f737-4aa0-b13d-33eac92f9687","resolution":{"observed_at":"2026-08-15T19:06:38.383966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14382","last_updated":"2025-02-20T09:18:53Z","snapshot_observed_at":"2026-08-12T07:09:19.930689Z","submitted_at":"2025-02-20T09:18:53Z","title":"S*: Test Time Scaling for Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14382","snapshot_observed_at":"2026-08-15T19:06:38.388648Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.388648Z"},"links":{"cited_paper":"/paper/2502.14382","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:97f1c481972c9fc0811fc426cc37a12f194cf3fb6441e9f4688ae3b44a2a9cc3","observation_id":"1c4e0469-4a93-4cc2-b050-1d0d756e64ad","resolution":{"observed_at":"2026-08-15T19:06:38.388648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03553","last_updated":"2024-09-27T08:16:28Z","snapshot_observed_at":"2026-08-13T05:12:36.538689Z","submitted_at":"2024-05-06T15:20:30Z","title":"AlphaMath Almost Zero: Process Supervision without Process","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03553","snapshot_observed_at":"2026-08-15T19:06:38.393156Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.393156Z"},"links":{"cited_paper":"/paper/2405.03553","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:9fbece5e70a0a2898cbde5bdff93d054c0e1f3fdbc9d0b04a235081095b0126b","observation_id":"6938cea0-ed60-4892-90e3-3e03d74fda0f","resolution":{"observed_at":"2026-08-15T19:06:38.393156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-15T19:06:38.397965Z","title":"Cobbe, V","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.397965Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:2bfe4747d3f193794486d25f6afcacb3d99ec5e8841dee81c2367288daa4629d","observation_id":"19bf0dd0-dd21-4d09-b833-3d0e400d2149","resolution":{"observed_at":"2026-08-15T19:06:38.397965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17578","last_updated":"2025-02-24T19:01:47Z","snapshot_observed_at":"2026-08-07T17:52:10.217224Z","submitted_at":"2025-02-24T19:01:47Z","title":"How Do Large Language Monkeys Get Their Power (Laws)?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17578","snapshot_observed_at":"2026-08-15T19:06:38.402486Z","title":"Schaeffer, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.402486Z"},"links":{"cited_paper":"/paper/2502.17578","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:c92dad26eed54cd3fc443500ed5dc94594281c43dd221656c4cb59ab12b129b4","observation_id":"f3642f3b-331d-4dbb-a3f4-9324325275fb","resolution":{"observed_at":"2026-08-15T19:06:38.402486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14005","last_updated":"2025-01-25T00:38:28Z","snapshot_observed_at":"2026-08-13T00:01:48.524542Z","submitted_at":"2024-05-22T21:22:44Z","title":"Neural Scaling Laws in Robotics","version":2},"cited_work":{"arxiv_id":"2405.14005","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.14005","snapshot_observed_at":"2026-08-15T19:06:38.876145Z","title":"Neural Scaling Laws in Robotics","venue":"cs.RO","work_id":"a14d9481-04d5-45ef-b4c5-91b28be0c388","year":2024},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.407250Z"},"links":{"cited_paper":"/paper/2405.14005","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:7462b2a5945bca56ae6e2da4984f598ea6a45ea1d46622c193e071b9ea48205a","observation_id":"d0f22b34-486f-4f03-bba3-6eb13a59a4eb","resolution":{"observed_at":"2026-08-15T19:06:38.882296Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18647","last_updated":"2026-06-26T02:30:53Z","snapshot_observed_at":"2026-08-12T22:16:00.894762Z","submitted_at":"2024-10-24T11:19:30Z","title":"Data Scaling Laws in Imitation Learning for Robotic Manipulation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18647","snapshot_observed_at":"2026-08-15T19:06:38.411781Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.411781Z"},"links":{"cited_paper":"/paper/2410.18647","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:5fe6c3cfa3a7663131c2cd5425a135a9c6173b15fe13ed4e27eb746a09ddcff4","observation_id":"9fc6d12e-f6cf-4ad7-aa15-8a4ab87c3080","resolution":{"observed_at":"2026-08-15T19:06:38.411781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-15T19:06:38.416217Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.416217Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:a1a2e1daa0cacb3262b807a3450664fa0a6f700f9fc5f8e95358ba67f1d4c757","observation_id":"03b07d9f-fe95-4199-9249-c0d9cefaa9a6","resolution":{"observed_at":"2026-08-15T19:06:38.416217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-08-14T08:22:11.295012Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-15T19:06:38.421626Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.421626Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:ea0cc72acab0b439f16c99a494004f298f03ce22ab99c21ee9421e1abc968e38","observation_id":"69c0694f-c741-4fdc-98c6-6789447b173b","resolution":{"observed_at":"2026-08-15T19:06:38.421626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-15T19:06:38.426202Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.426202Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:da6ccf093cefb7d44bf14cf0e78ce964d06b6c3caba43917203468f28e2600e6","observation_id":"bb428566-5c6e-433d-9ef3-e2d51b6ab430","resolution":{"observed_at":"2026-08-15T19:06:38.426202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-15T19:06:38.430602Z","title":"Ouyang, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.430602Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:c816ceb7e338dcbff721e08c1e5e21f7f34a0b9d12c12837b98c7665dc0fa22b","observation_id":"87cd5ef0-0eb8-4d50-9671-1aaff25bda4c","resolution":{"observed_at":"2026-08-15T19:06:38.430602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-15T19:06:38.435136Z","title":"Touvron, L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.435136Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:4813527c8b4b8966eb709c7211ac1dbdb7e4b3a7b8fa718797c9f248c9a1c0cc","observation_id":"d593b6f9-f771-40a1-a0c3-42734a85763e","resolution":{"observed_at":"2026-08-15T19:06:38.435136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:06:38.439546Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.439546Z"},"links":{"citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:577e9372311bad462c7dd2a34bab68e4078368910ac67ff34a3f64948ca52e7b","observation_id":"beca4e98-53d6-4cfd-9def-6542eae23843","resolution":{"observed_at":"2026-08-15T19:06:38.439546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-08-15T23:42:34.277075Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-15T19:06:38.443789Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.443789Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:b3b571e180481966399cc79d708c141c01215eb705a5f7fd5a69f6c322816504","observation_id":"285859cb-de5c-4421-9be6-28cf8b7069af","resolution":{"observed_at":"2026-08-15T19:06:38.443789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-15T19:06:38.448239Z","title":"Radford, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.448239Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:18e7442ad9a7f45dbfb3812917f2e47cf6bed8fdbce14ff13946645a8811885b","observation_id":"36f6c4c1-bb92-4dc8-ad46-bf14e2487a9d","resolution":{"observed_at":"2026-08-15T19:06:38.448239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05941","last_updated":"2024-05-09T17:30:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-09T17:30:16Z","title":"Evaluating Real-World Robot Manipulation Policies in Simulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05941","snapshot_observed_at":"2026-08-15T19:06:38.452789Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.452789Z"},"links":{"cited_paper":"/paper/2405.05941","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:b2db7d1d0f99f38308913a7c5bae7b1bf3ac91460896f5cb2afb50c0c0b0b554","observation_id":"0ba898ea-adac-46f1-9acc-c2a4af4ecb79","resolution":{"observed_at":"2026-08-15T19:06:38.452789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13816","last_updated":"2025-02-24T21:05:58Z","snapshot_observed_at":"2026-08-12T22:20:41.524137Z","submitted_at":"2024-10-17T17:46:26Z","title":"Steering Your Generalists: Improving Robotic Foundation Models via Value Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13816","snapshot_observed_at":"2026-08-15T19:06:38.457661Z","title":"Nakamoto, O","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.457661Z"},"links":{"cited_paper":"/paper/2410.13816","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:374d3c8541583a74d382d0267d83d2a6e6b1f35131529a2a23fa4d4166774acc","observation_id":"605e53ba-8823-48bc-92f6-e29625f49a38","resolution":{"observed_at":"2026-08-15T19:06:38.457661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-08-11T10:42:54.633244Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-15T19:06:38.462357Z","title":"Zheng, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.462357Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:8bd69cef0a7f7296dbd5c7d21d6033724a4119c2b0a463725d572e3c1688277b","observation_id":"f1073a59-2748-43af-8613-ab36b3572abb","resolution":{"observed_at":"2026-08-15T19:06:38.462357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03094","last_updated":"2023-05-28T07:32:38Z","snapshot_observed_at":"2026-08-14T14:44:52.069123Z","submitted_at":"2022-10-06T17:50:11Z","title":"VIMA: General Robot Manipulation with Multimodal Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03094","snapshot_observed_at":"2026-08-15T19:06:38.467452Z","title":"Jiang, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.467452Z"},"links":{"cited_paper":"/paper/2210.03094","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:0afd9ba6a83674700e5816277acaa6398b5e12b328b3a7577b22e9c6204579fd","observation_id":"382a5456-6d14-46cb-a901-946196f6c3da","resolution":{"observed_at":"2026-08-15T19:06:38.467452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:06:39.366818Z","title":null,"venue":null,"work_id":"29fb682d-d36e-404d-b90b-f1b80634fa88","year":2023},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.471692Z"},"links":{"citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:727a0f42ace4651011e2007fd3c3c5c46923998c08d1bc1f95d2eff9e36a65a4","observation_id":"3c70256e-bdb6-449a-aece-b9fae0ba27f3","resolution":{"observed_at":"2026-08-15T19:06:39.370955Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:06:39.353093Z","title":"V aswani, N","venue":null,"work_id":"92bc356d-9838-4e8f-b08c-804628a9e298","year":2017},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.475810Z"},"links":{"citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:c74f6bfcc3b2cde9181b091f0c840034a4615859cf914c4f397561d89ee7e57c","observation_id":"187590a6-9f47-48aa-8246-2f8484aa763d","resolution":{"observed_at":"2026-08-15T19:06:39.357391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.14020","last_updated":"2023-08-25T17:58:53Z","snapshot_observed_at":"2026-08-14T13:56:28.206358Z","submitted_at":"2022-12-28T18:45:05Z","title":"A System-Level View on Out-of-Distribution Data in Robotics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.14020","snapshot_observed_at":"2026-08-15T19:06:38.480379Z","title":"Sinha, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.480379Z"},"links":{"cited_paper":"/paper/2212.14020","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:5222271ea88af582c8f401e3cd6bc44edbecf09f65dfca1e20827ee92f6b3595","observation_id":"76d6634f-8d37-4278-8b20-cc132a863eb1","resolution":{"observed_at":"2026-08-15T19:06:38.480379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02482","last_updated":"2025-09-14T01:23:00Z","snapshot_observed_at":"2026-08-12T22:07:58.135973Z","submitted_at":"2024-11-04T18:59:36Z","title":"NeRF-Aug: Data Augmentation for Robotics with Neural Radiance Fields","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02482","snapshot_observed_at":"2026-08-15T19:06:38.484785Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.484785Z"},"links":{"cited_paper":"/paper/2411.02482","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:22674de93fbe7035210235eda1b681883efb4ea26e287bcb064d21cf1133e903","observation_id":"c5a3e6d5-ee0f-42bc-9903-a7f9a22523fb","resolution":{"observed_at":"2026-08-15T19:06:38.484785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.02886","last_updated":"2022-07-20T17:13:22Z","snapshot_observed_at":"2026-08-13T15:49:20.422993Z","submitted_at":"2022-05-05T18:40:05Z","title":"Data Augmentation for Manipulation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.02886","snapshot_observed_at":"2026-08-15T19:06:38.489585Z","title":"Mitrano and D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.489585Z"},"links":{"cited_paper":"/paper/2205.02886","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:841298bbd621a6a101eda25a7a6373a5efc640d4d07e3fe3a3e80ddb5b80ffbb","observation_id":"5c6cf54a-f027-4187-9659-7091f51b78ed","resolution":{"observed_at":"2026-08-15T19:06:38.489585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07753","last_updated":"2023-05-25T03:50:11Z","snapshot_observed_at":"2026-08-14T13:06:41.783915Z","submitted_at":"2022-09-16T07:17:23Z","title":"Code as Policies: Language Model Programs for Embodied Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07753","snapshot_observed_at":"2026-08-15T19:06:38.494324Z","title":"Liang, W","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.494324Z"},"links":{"cited_paper":"/paper/2209.07753","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:e80cd17e29c209ca539cd6d70628a91b90fcadc9364b79080922bc25d91e12c0","observation_id":"494f23dc-975a-44cd-bac5-f8811053809a","resolution":{"observed_at":"2026-08-15T19:06:38.494324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15021","last_updated":"2023-09-13T23:46:22Z","snapshot_observed_at":"2026-08-13T11:34:35.754750Z","submitted_at":"2023-05-24T11:04:30Z","title":"EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15021","snapshot_observed_at":"2026-08-15T19:06:38.499008Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.499008Z"},"links":{"cited_paper":"/paper/2305.15021","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:b614db5cc14dcf0830d0b77fec40ea3441542490b11df1c2ffb8cff2b6d9b4d2","observation_id":"7b35c8ee-390c-4f4a-9fa7-3ffb0547b308","resolution":{"observed_at":"2026-08-15T19:06:38.499008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-08-15T19:06:38.504584Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.504584Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:6cc4a88ad2022e600a9d870e172e2cbe0c78f513e7fd09626e04ab8319dbbbd8","observation_id":"91da8de5-3147-4eca-a9f4-a44fd29c289c","resolution":{"observed_at":"2026-08-15T19:06:38.504584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01828","last_updated":"2025-05-02T17:53:34Z","snapshot_observed_at":"2026-08-15T09:08:03.573863Z","submitted_at":"2025-02-03T21:11:02Z","title":"From Foresight to Forethought: VLM-In-the-Loop Policy Steering via Latent Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01828","snapshot_observed_at":"2026-08-15T19:06:38.509271Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.509271Z"},"links":{"cited_paper":"/paper/2502.01828","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:e63fa1708110677574a0c6517bcfa250df7e17eb1d2a9506261eca45991f618e","observation_id":"89a249db-1725-4a5c-9548-bd2031201532","resolution":{"observed_at":"2026-08-15T19:06:38.509271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16627","last_updated":"2025-03-26T02:40:00Z","snapshot_observed_at":"2026-08-16T07:48:11.169294Z","submitted_at":"2024-11-25T18:03:50Z","title":"Inference-Time Policy Steering through Human Interactions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16627","snapshot_observed_at":"2026-08-15T19:06:38.514099Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.514099Z"},"links":{"cited_paper":"/paper/2411.16627","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:9b872366a773125b806650bf1c57e1db4f42d86085b99081637a15ba7bca3f73","observation_id":"bcb67212-4abb-4fab-acc0-812546809658","resolution":{"observed_at":"2026-08-15T19:06:38.514099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14723","last_updated":"2025-02-03T18:57:05Z","snapshot_observed_at":"2026-08-12T18:56:51.611569Z","submitted_at":"2025-01-24T18:58:40Z","title":"CodeMonkeys: Scaling Test-Time Compute for Software Engineering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14723","snapshot_observed_at":"2026-08-15T19:06:38.519265Z","title":"Ehrlich, B","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.519265Z"},"links":{"cited_paper":"/paper/2501.14723","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:b138d4ff43e6e48683f3aec61adc504a9e8fab08bf6a501a31f56bdfdba5599e","observation_id":"e984e6f6-fe80-403c-aa64-3f8bbe667f61","resolution":{"observed_at":"2026-08-15T19:06:38.519265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03310","last_updated":"2023-10-14T15:52:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-05T23:32:26Z","title":"LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03310","snapshot_observed_at":"2026-08-15T19:06:38.524296Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.524296Z"},"links":{"cited_paper":"/paper/2306.03310","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:d0751cc902ac2efc5e02ff2c445f03ccb645267a47490778a9a4bedf815363ec","observation_id":"e40e821c-78c8-4712-bebc-2a8a37b30654","resolution":{"observed_at":"2026-08-15T19:06:38.524296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03729","last_updated":"2025-02-11T04:51:45Z","snapshot_observed_at":"2026-08-13T00:43:48.441990Z","submitted_at":"2025-02-06T02:43:23Z","title":"Action-Free Reasoning for Policy Generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03729","snapshot_observed_at":"2026-08-15T19:06:38.223870Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.223870Z"},"links":{"cited_paper":"/paper/2502.03729","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:2243339cea9c4f59cdbeb10857be18815d5e7661ee6de4091777523a72ce26d3","observation_id":"52c68ad5-b5b5-476b-9a8f-af757160255a","resolution":{"observed_at":"2026-08-15T19:06:38.223870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 30 inbound Pith citation observations for arXiv:2506.17811."}