{"as_of":"2026-08-09T21:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5d5bbffa04c9565c982c944777d05573aaecabc33e6ab208e31381922be47ba0","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":47,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T14:50:57.959258Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-09T14:50:57.959258Z","title":"Grape: Generalizing robot policy via preference alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01719","last_updated":"2025-02-07T03:54:34Z","snapshot_observed_at":"2026-08-09T14:44:14.296178Z","submitted_at":"2025-02-03T18:56:33Z","title":"MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T14:50:57.959258Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2502.01719"},"observation_digest":"sha256:b5faedb8d3d6d7b8b5fe5ff0d343a920b62f15f2fe58209f6febfdbb84631a48","observation_id":"cb8b47de-5906-4be4-b685-a637e828abe3","resolution":{"observed_at":"2026-08-09T14:50:57.959258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2502.05855","last_updated":"2025-08-09T10:58:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-09T11:25:56Z","title":"DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-14T19:48:48.725800Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2502.05855"},"observation_digest":"sha256:3644f98f96a32b2b5b2fdab612ae6c87f776c57dae99b15c62b603da41c9584e","observation_id":"83a3fcea-f4b4-4d05-886d-741da72770f3","resolution":{"observed_at":"2026-05-14T19:48:48.806390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2503.03480","last_updated":"2026-04-19T06:23:17Z","snapshot_observed_at":"2026-07-30T14:07:10.544745Z","submitted_at":"2025-03-05T13:16:55Z","title":"SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-23T01:27:33.123243Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2503.03480"},"observation_digest":"sha256:cbf398ac5440bf023698853c3c22d6e950a43ae69a527a81cedaf78849cbdb4d","observation_id":"d799988c-429d-4e5f-9812-7004b9454f9e","resolution":{"observed_at":"2026-05-23T01:32:22.363054Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-04T23:08:22.516431Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-11T15:09:24.367362Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2503.06669"},"observation_digest":"sha256:7aad70a978c8723422b7fb114c6d05ca8f992e86fdf8bc29bbca1f5eb452cc10","observation_id":"2fe91573-9106-4706-b7c4-aa0c4edc2f88","resolution":{"observed_at":"2026-05-11T15:09:24.594651Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2505.06111","last_updated":"2025-11-03T11:52:57Z","snapshot_observed_at":"2026-08-09T00:51:47.897197Z","submitted_at":"2025-05-09T15:11:13Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-12T15:28:06.883492Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2505.06111"},"observation_digest":"sha256:e3abcce987ad2b196180fe3bfa824be313b51d90f773f441b59e4032aca6e204","observation_id":"a6898c71-0575-4ffd-8d6e-122c1bd2b242","resolution":{"observed_at":"2026-05-12T15:28:06.959009Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:c5571890c92b5b30d9d02c7ea601a7c4a88d65d2c756813174fc688570ee210a","observation_id":"a50457bd-f4cd-4f9a-a775-a7e4dfb9c6c6","resolution":{"observed_at":"2026-05-16T12:55:40.398126Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-07T11:11:40.572064Z","title":"Grape: Generalizing robot policy via preference alignment.arXiv preprint arXiv:2411.19309, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03350","last_updated":"2025-06-03T19:43:58Z","snapshot_observed_at":"2026-08-09T00:38:29.639641Z","submitted_at":"2025-06-03T19:43:58Z","title":"Adversarial Attacks on Robotic Vision Language Action Models","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:40.572064Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2506.03350"},"observation_digest":"sha256:7f3374a9eb919154ae707437374906c7307ddac101a1918355d7adb90be4b124","observation_id":"4bface85-924a-42ee-a04b-36476e85f515","resolution":{"observed_at":"2026-08-07T11:11:40.572064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-07T00:40:37.279568Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13045","last_updated":"2025-08-24T10:01:04Z","snapshot_observed_at":"2026-08-08T06:33:39.031465Z","submitted_at":"2025-06-16T02:27:25Z","title":"Continual Learning for Generative AI: From LLMs to MLLMs and Beyond","version":4},"reference_index":258,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:37.279568Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2506.13045"},"observation_digest":"sha256:26a6fa75107668d02b8bb6a7fbe2501155a17843b29d6f41c83d717c5105b94b","observation_id":"29e67213-daad-427c-b70d-6acbf6f1b574","resolution":{"observed_at":"2026-08-07T00:40:37.279568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2508.13073","last_updated":"2025-09-01T08:10:01Z","snapshot_observed_at":"2026-08-07T15:40:31.068428Z","submitted_at":"2025-08-18T16:45:48Z","title":"Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey","version":2},"reference_index":177,"source":"pdf_text","source_observed_at":"2026-05-17T20:28:15.818016Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2508.13073"},"observation_digest":"sha256:cd7abd7719e9b5b2f59b889441a0089512a77265ebf484f79f2b6b231db6314e","observation_id":"8878e613-9cc9-4eda-923c-404de6112c0d","resolution":{"observed_at":"2026-05-17T20:28:16.109526Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T10:30:23.688049Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.688049Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:32b2cc313a34f431850007c278e47d16b52bcb97f1cbd223ee19eaaa0e42f52c","observation_id":"02898c68-a010-4aa3-adf2-0cfe4243bf80","resolution":{"observed_at":"2026-08-05T10:30:23.688049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2509.09674","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T17:59:17Z","title":"SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-15T08:02:11.189795Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2509.09674"},"observation_digest":"sha256:0c96fdaf9a6e78ce4692f5f5232eb2eb839e70a6c7fb80fa923f9984cd9f51d6","observation_id":"fd5ff45e-a0ba-4ba4-952a-a685a8f4638b","resolution":{"observed_at":"2026-05-15T08:02:11.464210Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-04T10:24:57.958256Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.09976","last_updated":"2026-06-25T14:25:12Z","snapshot_observed_at":"2026-08-04T10:24:54.103532Z","submitted_at":"2025-10-11T03:11:18Z","title":"Reinforcement Fine-Tuning of Flow-Matching Policies for Vision-Language-Action Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T10:24:57.958256Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2510.09976"},"observation_digest":"sha256:bfaf7205d72472f80a85381efb3765945a514fcaceb2ff6b78acca6a70e1ecdf","observation_id":"54f664df-f197-40ff-89df-f5497b457f57","resolution":{"observed_at":"2026-08-04T10:24:57.958256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2510.12710","last_updated":"2026-04-09T08:55:45Z","snapshot_observed_at":"2026-07-06T22:32:37.311210Z","submitted_at":"2025-10-14T16:44:39Z","title":"Reflection-Based Task Adaptation for Self-Improving VLA","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-18T07:28:11.187479Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2510.12710"},"observation_digest":"sha256:b72387434eed840dac4a15096ead002a229456bb9fc323e67ba9356ac5dae3d5","observation_id":"40ef77c0-734c-44db-9fd0-8c8f4fb483ea","resolution":{"observed_at":"2026-05-18T07:31:02.933528Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2510.17640","last_updated":"2026-08-05T02:51:23Z","snapshot_observed_at":"2026-08-08T23:09:05.210442Z","submitted_at":"2025-10-20T15:21:12Z","title":"RESample: A Robust Data Augmentation Framework via Exploratory Sampling for Robotic Manipulation","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T06:10:47.309028Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2510.17640"},"observation_digest":"sha256:aa8a75b863deae30cfe5433b81dec744068bf9dbe1204bdb0a5181142c2701af","observation_id":"a64082d7-3ec8-4d36-bd0f-2c30aa744d6b","resolution":{"observed_at":"2026-05-18T06:10:57.868145Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2511.14759","last_updated":"2025-11-19T04:34:49Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-18T18:58:55Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-12T10:34:59.134604Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2511.14759"},"observation_digest":"sha256:c7f9f702650ff5de3ab87acde89927275a6bc1fb1cbf91bfc702857b065a086c","observation_id":"1dd654af-0a47-4061-a394-7a1a3f3bf613","resolution":{"observed_at":"2026-05-12T10:34:59.387695Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2511.15669","last_updated":"2026-08-05T03:23:59Z","snapshot_observed_at":"2026-08-08T23:09:08.696409Z","submitted_at":"2025-10-31T05:26:16Z","title":"DeepThinkVLA: Enhancing Reasoning Capability of Vision-Language-Action Models","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-18T03:09:09.713822Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2511.15669"},"observation_digest":"sha256:01e34c8da523666432324ef8358402694a80af6b84239380225c6930af1fcb3e","observation_id":"eb701436-3068-4bac-a2b7-ca52cf2f6edc","resolution":{"observed_at":"2026-05-18T03:10:48.869856Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-03T13:53:27.515205Z","title":"Grape: Generalizing robot policy via prefer- ence alignment.arXiv preprint arXiv:2411.19309, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.22539","last_updated":"2026-07-02T08:55:28Z","snapshot_observed_at":"2026-08-06T03:03:38.906157Z","submitted_at":"2025-12-27T09:40:54Z","title":"VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T13:53:27.515205Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2512.22539"},"observation_digest":"sha256:478c6bd80486e5578c75efee594b381b722599197c6725993f605a427fb39d4d","observation_id":"fd542b69-2fa3-45a5-a2df-22e01d8028ab","resolution":{"observed_at":"2026-08-03T13:53:27.515205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2602.09023","last_updated":"2026-05-19T02:18:04Z","snapshot_observed_at":"2026-08-02T13:36:40.045905Z","submitted_at":"2026-02-09T18:59:52Z","title":"TwinRL: Digital Twin-Driven Reinforcement Learning for Real-World Robotic Manipulation","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-21T13:13:53.818915Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2602.09023"},"observation_digest":"sha256:e48813ae85caf470e45984fe095468a8499c73a6689f5ce10e1eee141ee38a97","observation_id":"62cb33a6-30c1-48ce-b3d1-b892d91f022f","resolution":{"observed_at":"2026-05-21T13:14:10.900849Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-06T10:59:04.687049Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:c9835f8c812756717d8b25dfacca2b2af54705e5f005522587e04f88403cc776","observation_id":"904c8a16-d0a8-4b19-8bae-3e0284a62a0e","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2604.28192","last_updated":"2026-05-07T14:00:44Z","snapshot_observed_at":"2026-08-02T05:19:22.679378Z","submitted_at":"2026-04-30T17:59:52Z","title":"LaST-R1: Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-07T05:47:17.494531Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2604.28192"},"observation_digest":"sha256:d22c056390caeeb7653c41694a58ca471b1c23311b80e6b26b2e29c94e242c92","observation_id":"42866686-c264-452a-a320-63705cc5313b","resolution":{"observed_at":"2026-05-12T10:31:30.009180Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2604.28192","last_updated":"2026-05-07T14:00:44Z","snapshot_observed_at":"2026-08-02T05:19:22.679378Z","submitted_at":"2026-04-30T17:59:52Z","title":"LaST-R1: Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-08T03:00:26.352130Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2604.28192"},"observation_digest":"sha256:070d19345d1653127fa5ff18bc0f4d024e17ec1571c876b8d34683717b11fbe5","observation_id":"e7e21ad5-2002-4d86-9cfb-3157990b3a32","resolution":{"observed_at":"2026-05-11T22:17:03.135989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-09T19:31:38.069592Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:20a15b7a6cc7836ed0450ec3f8f5b9f1556d2d0e1534a5db2a16894297d021eb","observation_id":"5605a0c1-a662-42a1-acba-56c0b3227373","resolution":{"observed_at":"2026-05-11T15:36:10.861354Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:bdd6b072aa3afba6d0d791ee49908eac13b3d5938267756a822952b1fe1ba477","observation_id":"8446b9d6-3128-4dda-b251-182de97f9328","resolution":{"observed_at":"2026-07-01T08:15:32.297095Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2605.08774","last_updated":"2026-05-09T08:00:59Z","snapshot_observed_at":"2026-07-06T23:20:57.084438Z","submitted_at":"2026-05-09T08:00:59Z","title":"ProcVLM: Learning Procedure-Grounded Progress Rewards for Robotic Manipulation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-12T01:40:22.192349Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2605.08774"},"observation_digest":"sha256:b181e5637f4787d67be0792770af9200633bddb73f8132d12be16e8e3da2dcef","observation_id":"14c156f9-c290-4a3b-b2ff-a42e8914e864","resolution":{"observed_at":"2026-05-12T01:41:19.940732Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2605.09410","last_updated":"2026-05-10T08:24:05Z","snapshot_observed_at":"2026-08-02T13:43:45.064816Z","submitted_at":"2026-05-10T08:24:05Z","title":"RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T04:39:32.715650Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2605.09410"},"observation_digest":"sha256:01b1e3d9927f26ee458d894116c0ff377ffa4ae63f1c74d89ee0c3eb37bd0303","observation_id":"406737e0-8593-4ee5-98f8-7b550cf92ba6","resolution":{"observed_at":"2026-05-12T06:01:25.984235Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2605.12167","last_updated":"2026-05-12T14:15:16Z","snapshot_observed_at":"2026-07-06T23:23:54.142937Z","submitted_at":"2026-05-12T14:15:16Z","title":"From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-13T04:44:03.661688Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2605.12167"},"observation_digest":"sha256:e797203a0839378b4c949c5ae48e866fe2092e4632d6cf8a71078df70798fee9","observation_id":"5e16325d-038d-4ed9-998a-680fd90a8f0c","resolution":{"observed_at":"2026-05-13T04:57:17.884932Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2605.17486","last_updated":"2026-05-17T14:55:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-17T14:55:32Z","title":"DyGRO-VLA: Cross-Task Scaling of Vision-Language-Action Models via Dynamic Grouped Residual Optimization","version":1},"reference_index":191,"source":"arxiv_source","source_observed_at":"2026-05-20T12:39:50.004269Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2605.17486"},"observation_digest":"sha256:06e55242e2ff27479a64a36f404bd77f4927419a0c90ac6a5a0d782d46892603","observation_id":"c38a1916-b160-4388-893a-8d8bf55445c7","resolution":{"observed_at":"2026-05-20T12:43:17.293277Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2605.19580","last_updated":"2026-05-19T09:22:49Z","snapshot_observed_at":"2026-07-06T23:30:16.094579Z","submitted_at":"2026-05-19T09:22:49Z","title":"PAPO-VLA: Planning-Aware Policy Optimization for Vision-Language-Action Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T05:12:26.907425Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2605.19580"},"observation_digest":"sha256:51842c30c81dacc84e6d75fcb70fb2e8b0e976e6f625284f87701919d4b6a606","observation_id":"5114bd6a-3171-4846-b807-df20d8a2dfa4","resolution":{"observed_at":"2026-05-20T05:13:03.383440Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2606.01036","last_updated":"2026-05-31T05:56:28Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T05:56:28Z","title":"Position: Good Embodied Reward Models Need Bad Behavior Data","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T17:18:17.337336Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2606.01036"},"observation_digest":"sha256:9fb57690ee7727899b93c88c84ecadef6b413b0945f92c5f48ec81b5cb3b8b34","observation_id":"9a8982b7-5c89-4284-bcae-25bde5ea9884","resolution":{"observed_at":"2026-06-28T17:22:24.973243Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2606.05468","last_updated":"2026-06-03T21:47:43Z","snapshot_observed_at":"2026-07-06T23:45:28.379468Z","submitted_at":"2026-06-03T21:47:43Z","title":"FlowPRO: Reward-Free Reinforced Fine-Tuning of Flow-Matching VLAs via Proximalized Preference Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T05:38:11.089753Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2606.05468"},"observation_digest":"sha256:bd1c3d5360ba4137efa2075fe14ca1c8c855f4ff8ff02d1e6c912e851052efa0","observation_id":"02a91f91-65be-4ab1-a6f7-ca0aaa2d4ece","resolution":{"observed_at":"2026-07-02T09:06:49.389175Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2606.12372","last_updated":"2026-06-10T17:38:24Z","snapshot_observed_at":"2026-08-06T11:07:11.202179Z","submitted_at":"2026-06-10T17:38:24Z","title":"UniIntervene: Agentic Intervention for Efficient Real-World Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-27T09:46:59.746745Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2606.12372"},"observation_digest":"sha256:cd61cba04532e551de35daef13f3c27d616ace7254a07b0682fe4ba873f41e03","observation_id":"7f8b034d-70c4-4bbb-b528-7fe26894c452","resolution":{"observed_at":"2026-07-03T10:58:02.728427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2606.12550","last_updated":"2026-06-10T18:01:06Z","snapshot_observed_at":"2026-08-02T12:19:26.092564Z","submitted_at":"2026-06-10T18:01:06Z","title":"Foresight: Iterative Reasoning About Clues that Matter for Navigation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T09:35:05.441401Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2606.12550"},"observation_digest":"sha256:5308466f5281aea40872cd088dfda84d1a0b9fd98bec87bd8cd009715cdfcf12","observation_id":"627851db-f62c-4f08-9b3e-9bb97f8af871","resolution":{"observed_at":"2026-07-03T11:28:04.175007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-02T11:31:37.690666Z","title":"GRAPE: Generalizing robot policy via preference alignment.arXiv preprint arXiv:2411.19309, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-05T17:41:55.223171Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:37.690666Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:6f33c880d47d4458e5ddd060369e05f826175dbdd93b742b6dd28aad107cf5c1","observation_id":"f7277805-4317-4e28-9e61-fc005ca76c40","resolution":{"observed_at":"2026-08-02T11:31:37.690666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2606.20698","last_updated":"2026-06-15T08:58:37Z","snapshot_observed_at":"2026-08-06T18:32:43.826239Z","submitted_at":"2026-06-15T08:58:37Z","title":"SafeDojo: Safe Reinforcement Learning for VLA via Interactive World Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T04:13:22.598591Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2606.20698"},"observation_digest":"sha256:51589a1e0c4d92220571ea486e1fcd037cde3c39f792f2fb1ba2f8ded7c2971d","observation_id":"62cfe2bf-a65b-4d10-9fe0-c2e626669ab7","resolution":{"observed_at":"2026-07-03T17:18:44.353030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2606.20698","last_updated":"2026-06-15T08:58:37Z","snapshot_observed_at":"2026-08-06T18:32:43.826239Z","submitted_at":"2026-06-15T08:58:37Z","title":"SafeDojo: Safe Reinforcement Learning for VLA via Interactive World Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T04:13:22.598591Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2606.20698"},"observation_digest":"sha256:d1180bf6602cf7a9dad78ce9d74ee0565b0881478adea63e85b66a63f499dd7b","observation_id":"dd067f52-1652-4806-8e97-4d554a3ac16d","resolution":{"observed_at":"2026-06-27T04:20:31.958581Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2606.22860","last_updated":"2026-06-22T05:07:08Z","snapshot_observed_at":"2026-08-06T11:26:10.711774Z","submitted_at":"2026-06-22T05:07:08Z","title":"HiL-ResRL: A Model-Agnostic Finetuning Adapter via Human-in-the-loop Residual Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T08:45:04.483217Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2606.22860"},"observation_digest":"sha256:de873881012785a48deaddc1457f68c6df741823225d46dee55526774f4469c3","observation_id":"3e82a913-f3bb-4323-ad4c-b10b8512e9dc","resolution":{"observed_at":"2026-07-04T10:29:45.655525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2606.23640","last_updated":"2026-06-22T17:30:24Z","snapshot_observed_at":"2026-08-02T09:22:48.099895Z","submitted_at":"2026-06-22T17:30:24Z","title":"Learning Process Rewards via Success Visitation Matching for Efficient RL","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-06-26T09:20:35.062060Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2606.23640"},"observation_digest":"sha256:fcd5abe283168b504390d5f30c35c6860019b806ad63f12f79a1091ab8ac31ec","observation_id":"37132ba4-8cb9-454d-87ad-233ba7680559","resolution":{"observed_at":"2026-07-04T09:59:44.474130Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2606.25800","last_updated":"2026-06-24T13:17:59Z","snapshot_observed_at":"2026-07-07T00:00:12.737052Z","submitted_at":"2026-06-24T13:17:59Z","title":"ROAD-VLA: Robust Online Adaptation via Self-Distillation for Vision-Language-Action Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-25T20:22:16.508280Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2606.25800"},"observation_digest":"sha256:134470864f1c999a8b6882d4f1681edc247284c5818f103b513c516f3bd9ee21","observation_id":"276ca8c9-6be5-404b-8e94-6c71abf6c499","resolution":{"observed_at":"2026-07-04T20:20:07.062167Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2606.29892","last_updated":"2026-06-29T07:31:41Z","snapshot_observed_at":"2026-08-02T16:37:27.749603Z","submitted_at":"2026-06-29T07:31:41Z","title":"Trust Your Instincts: Confidence-Driven Test-Time RL for Vision-Language-Action Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-30T06:02:15.781538Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2606.29892"},"observation_digest":"sha256:01adfbf8a50c53ccffe25be11372ba6c9b71afa1b278b41030a94891de546df6","observation_id":"f7e59c4a-1b10-4957-ab3e-fd326e41c4b5","resolution":{"observed_at":"2026-06-30T06:04:21.163124Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2606.31157","last_updated":"2026-06-30T05:35:18Z","snapshot_observed_at":"2026-07-07T00:04:53.774826Z","submitted_at":"2026-06-30T05:35:18Z","title":"Rethinking Foundation Model Collaboration: Enhancing Specialized Models through Proxy Task Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-01T06:38:44.170473Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2606.31157"},"observation_digest":"sha256:e47b8e35f9587e774b6775ecbee08ae6fcaf33ed64253225ac6a95ec21298a62","observation_id":"5c19d9a5-74d1-4f82-8f75-e53ecebe2fc2","resolution":{"observed_at":"2026-07-01T06:45:29.789741Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2606.32027","last_updated":"2026-08-01T01:25:23Z","snapshot_observed_at":"2026-08-06T23:11:22.545657Z","submitted_at":"2026-06-30T17:54:02Z","title":"Freeform Preference Learning for Robotic Manipulation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-01T04:58:28.971536Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2606.32027"},"observation_digest":"sha256:33431c95c7a366ceae9a7275c7dc13a3f8005bd3f4c6f4f09105697fcc2ff0de","observation_id":"534908e9-3bd8-4b9e-a92e-584e4d8aa8a2","resolution":{"observed_at":"2026-07-01T10:55:41.966122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-07-14T16:55:18.028851Z","title":"Zhang, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.32027","last_updated":"2026-08-01T01:25:23Z","snapshot_observed_at":"2026-08-06T23:11:22.545657Z","submitted_at":"2026-06-30T17:54:02Z","title":"Freeform Preference Learning for Robotic Manipulation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T16:55:18.028851Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2606.32027"},"observation_digest":"sha256:55b9bbf87e73a24171d219ec036c24b59d2fb129422080b6decef1395dfdd7d4","observation_id":"2d48f57a-1bc6-4b95-bcde-dd18adfd100a","resolution":{"observed_at":"2026-07-14T16:55:18.028851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-04T02:32:19.142604Z","title":"Zhang, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.32027","last_updated":"2026-08-01T01:25:23Z","snapshot_observed_at":"2026-08-06T23:11:22.545657Z","submitted_at":"2026-06-30T17:54:02Z","title":"Freeform Preference Learning for Robotic Manipulation","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T02:32:19.142604Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2606.32027"},"observation_digest":"sha256:994e0c7dbc323bc192e5fbb97e018d625176822b99954ad26f386b3066fc17d3","observation_id":"1b5e5b47-3b10-4bcf-8972-443f065ab236","resolution":{"observed_at":"2026-08-04T02:32:19.142604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-07-30T14:45:01.915411Z","title":"GRAPE: Generalizing robot policy via preference alignment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-30T14:45:01.915411Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:09dfcdf28b6f37540e762a8c2bec2cbca38f2b6fd36c8660f18372c959fbf3f7","observation_id":"2f0f7346-005b-42ac-ba88-c2df11dc3a3b","resolution":{"observed_at":"2026-07-30T14:45:01.915411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-01T10:23:14.040221Z","title":"GRAPE: Generalizing robot policy via preference alignment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:14.040221Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:7e0de2bfb72e98f0a2e18c46fe886b82d1eb9c69efa94f8f87a4705fc184478f","observation_id":"8247ecf9-282f-4cea-99d9-e682e690fe3f","resolution":{"observed_at":"2026-08-01T10:23:14.040221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-01T01:32:25.304633Z","title":"Grape: Generalizing robot policy via preference alignment.arXiv preprint arXiv:2411.19309, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27782","last_updated":"2026-07-30T07:14:39Z","snapshot_observed_at":"2026-08-07T16:30:55.760479Z","submitted_at":"2026-07-30T07:14:39Z","title":"RedFlow: Redirect Failure into Action-Level Corrections for Flow-matching VLA Policy","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T01:32:25.304633Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2607.27782"},"observation_digest":"sha256:0963fd6460216db4ae10739e908b1b6b1d2466681d0aea7dd89641fe488d8639","observation_id":"a95f753a-b662-479e-bbb8-80748f72cebb","resolution":{"observed_at":"2026-08-01T01:32:25.304633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-07T19:38:41.768698Z","title":"Zhao,Q.;Lu,Y.;Kim,M.J.;Fu,Z.;Zhang,Z.;Wu,Y.;Li,Z.; Ma, Q.; Han, S.; Finn, C.; Handa, A.; Liu, M.-Y.; Xiang, D.; Wetzstein,G.;andLin,T.-Y.2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05999","last_updated":"2026-08-06T13:07:56Z","snapshot_observed_at":"2026-08-09T21:12:00.857743Z","submitted_at":"2026-08-06T13:07:56Z","title":"Beyond Flat Policies: Hierarchical Post-Training for Embodied Agents in Robotic Manipulation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T19:38:41.768698Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2608.05999"},"observation_digest":"sha256:10cf6c19b6a8ef407888421bcb8e10e0689f71079db4c05cbcc83a4cf5f2c0d8","observation_id":"97963ac0-26fe-4a7e-b568-b59535017128","resolution":{"observed_at":"2026-08-07T19:38:41.768698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.19309/citation-record","integrity":"/paper/2411.19309/integrity","json":"/paper/2411.19309/citation-record.json","paper":"/paper/2411.19309"},"outbound":[],"paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 47 inbound Pith citation observations for arXiv:2411.19309."}