{"as_of":"2026-08-16T09:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7aecdca0cfdaef8705bdaf10f9e71c9a725968ab9eaed3e2032227ebf4015ef9","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T10:29:55.365544Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.07314/citation-record","integrity":"/paper/2608.07314/integrity","json":"/paper/2608.07314/citation-record.json","paper":"/paper/2608.07314"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:56.192258Z","title":"PaLM-E: An embodied multimodal language model,","venue":null,"work_id":"fb149c11-20e5-4a01-a4e1-2a33a59d39a0","year":2023},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.231185Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:fbf1b3b94cd6877ef77fef6993705df7553c32eff288e97ea12fc6a90f2bb449","observation_id":"22fd29ac-b83c-409e-8d90-27297fe18a37","resolution":{"observed_at":"2026-08-10T10:29:56.195731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:56.182369Z","title":"RT-1: Robotics transformer for real-world control at scale,","venue":null,"work_id":"1ff97dd6-39b6-4cae-892e-0d490e74cfd1","year":2023},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.235069Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:748b7c0ed120db0ad7fbb07e68753c1e6f20062fcbfc41922d5175812092aaee","observation_id":"3fa02969-224b-4744-a1ae-5da4257e0daa","resolution":{"observed_at":"2026-08-10T10:29:56.186044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:56.172134Z","title":"RT-2: Vision-language-action models transfer web knowledge to robotic control,","venue":null,"work_id":"b1ec1959-569c-48ef-8cdc-95158e0a44ab","year":2023},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.238673Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:466791792aeede51ec6751c212b6dc1d8894766771341fe47e4fdee8c785e0fa","observation_id":"29a27b32-044a-4c8a-903a-48e1d3ac7059","resolution":{"observed_at":"2026-08-10T10:29:56.175689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:56.162168Z","title":"Open X-Embodiment: Robotic learning datasets and RT-X models,","venue":null,"work_id":"759d1c11-01dc-47e3-a0ae-0f46d28f0bd2","year":2024},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.242091Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:456b6a9751d02d92e28b0857ea2e18ef4eb694a77624118ad6724e8144739483","observation_id":"ea4da3e9-37b1-4529-9654-dc7e9ac20716","resolution":{"observed_at":"2026-08-10T10:29:56.165594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:56.152925Z","title":"Octo: An open-source generalist robot policy,","venue":null,"work_id":"980f0d92-bd36-4948-b5bb-9862c24d9853","year":2024},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.245579Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:182d3139d3f467f01dd49f1cdc4b690940757ec3047abf3071f7fa6b96965664","observation_id":"56230c39-9f3d-4b74-b647-a0e692aa832e","resolution":{"observed_at":"2026-08-10T10:29:56.155897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:56.144126Z","title":"OpenVLA: An open-source vision- language-action model,","venue":null,"work_id":"2c280345-990d-47a1-9cd6-7c0abdf479f0","year":2025},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.248925Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:2c4c433d3026e094996c01b0e89d3bb6b6e477dc7fbcf2e692e0ed63c6a5e42e","observation_id":"12848eb0-1192-4339-b31f-2d29fe98b861","resolution":{"observed_at":"2026-08-10T10:29:56.147186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:56.134190Z","title":"Fine-tuning vision-language-action models: Optimizing speed and success,","venue":null,"work_id":"659571b9-2225-46cf-bdc3-da74449fea68","year":2025},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.252088Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:be7aeb3ae4f74ab49ef53ec17e2afcc4f4e0942c53a7fde93b2e733e826596c6","observation_id":"bf801935-81ea-416f-8f26-aec8e029f257","resolution":{"observed_at":"2026-08-10T10:29:56.138028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:56.123524Z","title":"A reduction of imitation learning and structured prediction to no-regret online learning,","venue":null,"work_id":"1d1f389d-2ae3-4af7-aea0-cee2f9cd76c2","year":2011},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.254959Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:2c415914bf95308b11d0dc3da31e6727dbf740e057bacceea66f106063560f08","observation_id":"0f01f29c-4545-49d7-95f6-b4fc8b577c71","resolution":{"observed_at":"2026-08-10T10:29:56.127108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-08-14T01:02:35.686274Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-08-10T10:29:55.257629Z","title":"VLA-RL: Towards masterful and general robotic manipulation with scalable reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.257629Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:a053b1ae9c95f5a65ea884e995928726bc097cfe87f60eeea7d05604de479b14","observation_id":"5476859f-65e1-4d2b-adcf-a043a72076f6","resolution":{"observed_at":"2026-08-10T10:29:55.257629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:56.113100Z","title":"SimpleVLA-RL: Scaling VLA training via reinforcement learning,","venue":null,"work_id":"a84e77ae-7a2a-4831-9085-de1151aa35c7","year":2026},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.260771Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:a3d2e9afc77dad168ee8d178680b45464374b5ee3ab52ac41f348f409782aa2a","observation_id":"f73d1b42-aa20-4d12-8ef7-f7e48bd7899f","resolution":{"observed_at":"2026-08-10T10:29:56.116999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.23073","last_updated":"2026-04-30T20:04:38Z","snapshot_observed_at":"2026-07-31T07:02:53.376869Z","submitted_at":"2026-04-24T23:57:45Z","title":"RL Token: Bootstrapping Online RL with Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.23073","snapshot_observed_at":"2026-08-10T10:29:55.263923Z","title":"Rl token: Bootstrapping online rl with vision-language- action models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.263923Z"},"links":{"cited_paper":"/paper/2604.23073","citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:72ff5fb5c3779460fda2c8c5c20981f53d5bdfb084fd93df3f22910acc6a9348","observation_id":"34301185-637a-412e-ab6e-6c5c09477126","resolution":{"observed_at":"2026-08-10T10:29:55.263923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:56.102919Z","title":"Knowledge insulating vision-language-action models: Train fast, run fast, generalize better,","venue":null,"work_id":"823f3696-42ce-441d-931a-f653a591dda9","year":2025},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.266959Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:7427899a9df8cb37a4ad143ec277ab1114b99e3bee054e4dd2179baa10dba74e","observation_id":"9f211459-f700-4493-a8cb-9098f4574656","resolution":{"observed_at":"2026-08-10T10:29:56.106712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16664","last_updated":"2025-01-28T02:53:48Z","snapshot_observed_at":"2026-08-15T21:48:56.393467Z","submitted_at":"2025-01-28T02:53:48Z","title":"Improving Vision-Language-Action Model with Online Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16664","snapshot_observed_at":"2026-08-10T10:29:55.270093Z","title":"Improving vision-language-action model with online reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.270093Z"},"links":{"cited_paper":"/paper/2501.16664","citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:d71fc3557ac5d685b835ad6e8874513fd67df8ce6d646e01e59863dd60a13502","observation_id":"edfee9b4-2bab-447b-8495-e59005959870","resolution":{"observed_at":"2026-08-10T10:29:55.270093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:56.092690Z","title":"Addressing function approximation error in actor-critic methods,","venue":null,"work_id":"de0933f8-5701-4c9e-90ad-6256f35ef243","year":2018},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.273617Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:e43fc8d822df1ee0470d80fe554d7a83f13968e705ca778e255a92b97535b539","observation_id":"a5f798a9-de3c-464c-b2f5-7123f70a7771","resolution":{"observed_at":"2026-08-10T10:29:56.096260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:56.082723Z","title":"BridgeData V2: A dataset for robot learning at scale,","venue":null,"work_id":"d22a58e1-f7fa-4a39-821a-56e89ee70e3f","year":2023},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.276679Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:2ebf861cafac37648d528c95fd072742034a5cf5ee4626b1ff1e8a5f7e2f42bf","observation_id":"7668e1bc-5b3f-4710-82f3-f085ce17c84f","resolution":{"observed_at":"2026-08-10T10:29:56.086289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:55.279752Z","title":"Vision-language foundation models as effective robot imitators,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.279752Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:c0e0f4783bd05f0f0ee066cdc3e5ccaf6fac7fc7d7478c6570631538c4769867","observation_id":"29ca5594-d6bd-4964-94df-c05bdf3801a0","resolution":{"observed_at":"2026-08-10T10:29:55.279752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.01288","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:55.910710Z","title":"Visa-flow: Accelerating robot skill learning via large-scale video semantic action flow,","venue":null,"work_id":"1ee633e5-e06d-4164-a6fd-4b89b87fa619","year":2025},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.283014Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:97820ce2e47f22c8b2553cece9f8829ff73316980bc88375b3b649aa7183e891","observation_id":"4b7bdbb6-6c16-4379-8ffe-24ff1d0f6af1","resolution":{"observed_at":"2026-08-10T10:29:55.915698Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:56.066778Z","title":"π 0: A vision-language-action flow model for general robot control,","venue":null,"work_id":"079074ff-5f35-4c75-8cf5-851bac7b1d5c","year":2025},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.286220Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:80ee4510017b6b03e800cafb25d9e6178882a51254ebe2d26bc2d9e489fde6a4","observation_id":"6dadfcca-bde9-4ada-9e09-db4045287d65","resolution":{"observed_at":"2026-08-10T10:29:56.070341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:56.056834Z","title":"π0.5: A vision-language-action model with open-world generalization,","venue":null,"work_id":"880bc8bc-c49e-4cb7-966a-6add02c35c10","year":null},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.289517Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:2aa786a973af05543a09d06d960b5c96159615d7a5859fc11745dc6ee531ba3b","observation_id":"26618d8a-a725-4ff9-845f-2dafac8509ee","resolution":{"observed_at":"2026-08-10T10:29:56.060558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-10T10:29:55.296092Z","title":"GR00T N1: An open foundation model for generalist humanoid robots,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.296092Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:5b2ba7347d2aa358e0bc4a92ee6568dae591dad313252b75ffccc7195da8d08f","observation_id":"87607237-d798-43ab-8d8a-065063327d4b","resolution":{"observed_at":"2026-08-10T10:29:55.296092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17016","last_updated":"2025-05-22T17:59:45Z","snapshot_observed_at":"2026-08-15T14:40:29.317550Z","submitted_at":"2025-05-22T17:59:45Z","title":"Interactive Post-Training for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17016","snapshot_observed_at":"2026-08-10T10:29:55.299516Z","title":"Interactive post- training for vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.299516Z"},"links":{"cited_paper":"/paper/2505.17016","citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:de2fbe743946466b2ea2dff7c7f1f0ed0a825738891fd7de3952e20954345cd0","observation_id":"3066997d-de2d-47fe-ade4-6bcea7246a0e","resolution":{"observed_at":"2026-08-10T10:29:55.299516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:56.036844Z","title":"VLA-RFT: Vision-language-action reinforcement fine-tuning with verified rewards in world simulators,","venue":null,"work_id":"bf80ce21-589d-45ac-afd6-0d7f05cda6df","year":null},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.302904Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:53b42c3ba54538a4bebb9c014524559590635b8eeab27a9b59e3ec17ca3eae1d","observation_id":"eec1aa47-6d89-4fbe-bd06-e161450369d4","resolution":{"observed_at":"2026-08-10T10:29:56.040569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:56.027049Z","title":"ConRFT: A reinforced fine-tuning method for VLA models via consistency policy,","venue":null,"work_id":"a7d66289-1893-43a2-9f51-c06debd8e177","year":2025},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.309572Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:b52102169cd8f8b7614b43dea5829a60c9c92885e7556d337646ce9c860ebf5f","observation_id":"8599fa7e-bda9-4196-9164-a095a7ad8298","resolution":{"observed_at":"2026-08-10T10:29:56.030298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.14759","last_updated":"2025-11-19T04:34:49Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-18T18:58:55Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.14759","snapshot_observed_at":"2026-08-10T10:29:55.312519Z","title":"π ∗ 0.6: a VLA that learns from experience,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.312519Z"},"links":{"cited_paper":"/paper/2511.14759","citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:e5f8ae9cede005f05abd747cb6a759ad68cf3b05f4b94a477831ac601ce9a88a","observation_id":"ef126e3e-aeae-4b5e-8752-2cedf4b0b831","resolution":{"observed_at":"2026-08-10T10:29:55.312519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2606.15285","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:55.653053Z","title":"Acting while understanding: Asynchronous semantic-action decoupling for real-time vision-language-action models,","venue":null,"work_id":"318616b3-cfca-44f8-a00d-991b9fbf68fc","year":2026},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.316233Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:26541db2857dce269d1ffe1ca066dc573524b7a3f2371046c8415b49915836db","observation_id":"6eb70623-a93a-45c2-8578-e2e368f4b264","resolution":{"observed_at":"2026-08-10T10:29:55.660050Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.12105","last_updated":"2026-06-10T13:59:07Z","snapshot_observed_at":"2026-08-02T10:21:49.594416Z","submitted_at":"2026-06-10T13:59:07Z","title":"DAM-VLA: Decoupled Asynchronous Multimodal Vision Language Action model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.12105","snapshot_observed_at":"2026-08-10T10:29:55.319520Z","title":"DAM-VLA: Decoupled asynchronous multimodal vision language action model,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.319520Z"},"links":{"cited_paper":"/paper/2606.12105","citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:638a0e077b1171d3f26c451c233c0380ea4f7f0af2d627a91b391b079850979b","observation_id":"bff91253-b426-414e-92fa-ed83fc42e6f1","resolution":{"observed_at":"2026-08-10T10:29:55.319520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.05765","last_updated":"2026-04-07T08:14:29Z","snapshot_observed_at":"2026-08-15T04:19:25.226738Z","submitted_at":"2026-02-05T15:30:23Z","title":"RL-VLA$^3$: A Flexible and Asynchronous Reinforcement Learning Framework for VLA Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.05765","snapshot_observed_at":"2026-08-10T10:29:55.322806Z","title":"RL-VLA 3: A flexible and asynchronous reinforcement learning framework for VLA training,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.322806Z"},"links":{"cited_paper":"/paper/2602.05765","citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:39c16d2e0df10818578445cdc02a99354606e40930010b1a1096682b521b831e","observation_id":"1595bda8-f98a-4546-a9fd-5b91cd3c17be","resolution":{"observed_at":"2026-08-10T10:29:55.322806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:56.017073Z","title":"FLOWER: Democratizing generalist robot policies with efficient vision-language-flow models,","venue":null,"work_id":"dc546f16-5543-4b8f-9c7f-0ce12da6f3da","year":2025},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.326214Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:57adc15d196678f464815084cd0691cac91e38e4ac8c31b8439674cd77ea634f","observation_id":"c9190653-2b3a-4c89-be44-49d47b8d0d05","resolution":{"observed_at":"2026-08-10T10:29:56.020826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:56.006593Z","title":"CALVIN: A benchmark for language-conditioned policy learning for long-horizon robot manipulation tasks,","venue":null,"work_id":"b2e7e0c4-2f37-4ec6-b198-56aca47a73a9","year":2022},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.329247Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:ef364fbdc40af408c162f75f0534e2a52844f3805fbb25d6940584381596090a","observation_id":"df257f01-d68e-4020-86cb-20df0eadc475","resolution":{"observed_at":"2026-08-10T10:29:56.010337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13139","last_updated":"2023-12-21T05:34:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-20T16:00:43Z","title":"Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13139","snapshot_observed_at":"2026-08-10T10:29:55.332304Z","title":"Unleashing large-scale video generative pre-training for visual robot manipulation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.332304Z"},"links":{"cited_paper":"/paper/2312.13139","citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:6f288ceefec85066f11f5985d5b3292e3d26d007ac9562ac6c978be0b974d3ab","observation_id":"070e97bc-b8ca-414e-b4a4-7b62c0b62d05","resolution":{"observed_at":"2026-08-10T10:29:55.332304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-15T18:55:35.634820Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-08-10T10:29:55.335648Z","title":"Unified vision-language-action model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.335648Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:15cd52c96f223e881ba55f90ffd0ce21cc49573540bc8ad80e1b873fef47ebc5","observation_id":"c0d5ca24-f249-4b16-aee9-1bbd471e85db","resolution":{"observed_at":"2026-08-10T10:29:55.335648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:55.995449Z","title":"Disentangled robot learning via separate forward and inverse dynamics pretraining,","venue":null,"work_id":"ddd49c0c-6efd-4bf6-8067-ed8851a83b01","year":2026},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.339006Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:11ac3d9ed6e4f65bbf1ad74168bee5446b7ea6b186841013db65a2db314d23bc","observation_id":"bcf3a1ed-5608-4cf1-85df-33d4ca959e10","resolution":{"observed_at":"2026-08-10T10:29:55.999192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10639","last_updated":"2023-10-16T17:57:23Z","snapshot_observed_at":"2026-08-08T13:35:58.479807Z","submitted_at":"2023-10-16T17:57:23Z","title":"Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10639","snapshot_observed_at":"2026-08-10T10:29:55.342197Z","title":"Zero-shot robotic manipulation with pretrained image-editing diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.342197Z"},"links":{"cited_paper":"/paper/2310.10639","citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:9d62b1c36134a39199dac858afc585d396473c3a5e504cc89d29f8f30d46b400","observation_id":"494b723d-3fc4-4c09-be34-5b9b3e44242f","resolution":{"observed_at":"2026-08-10T10:29:55.342197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10885","last_updated":"2024-07-25T14:30:22Z","snapshot_observed_at":"2026-07-06T17:31:17.058043Z","submitted_at":"2024-02-16T18:43:02Z","title":"3D Diffuser Actor: Policy Diffusion with 3D Scene Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10885","snapshot_observed_at":"2026-08-10T10:29:55.345462Z","title":"3D diffuser actor: Policy diffusion with 3D scene representations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.345462Z"},"links":{"cited_paper":"/paper/2402.10885","citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:6c63a873bedf54a5de70b95c144c08ada84fbbe71f645b1e8de1d538a99df672","observation_id":"d3f1a906-5701-4748-890a-26e4d2cd3052","resolution":{"observed_at":"2026-08-10T10:29:55.345462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:55.984774Z","title":"Closed-loop visuomotor control with generative expectation for robotic manipulation,","venue":null,"work_id":"a3d0641b-a06c-4aea-8e91-ca43ee3aaa45","year":2024},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.348290Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:81a5b7e7b742d11ad662adef1ff9cbc8d18f2adf819d61e7c69de26bfd0b933d","observation_id":"151c7e52-33d6-4715-9660-055547a9ecc6","resolution":{"observed_at":"2026-08-10T10:29:55.988461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08001","last_updated":"2025-02-06T12:37:15Z","snapshot_observed_at":"2026-08-12T22:26:15.509923Z","submitted_at":"2024-10-10T14:57:51Z","title":"Towards Synergistic, Generalized, and Efficient Dual-System for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08001","snapshot_observed_at":"2026-08-10T10:29:55.351046Z","title":"Towards synergistic, generalized, and efficient dual-system for robotic manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.351046Z"},"links":{"cited_paper":"/paper/2410.08001","citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:95e2c2577017a18bdf50cc2f2cbf39d965e507a83f2adb34b5bf12f3e3cdd73d","observation_id":"57f9af1d-d3b1-49dc-8040-fe607b8cfead","resolution":{"observed_at":"2026-08-10T10:29:55.351046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:55.974091Z","title":"UP-VLA: A unified understanding and prediction model for embodied agent,","venue":null,"work_id":"37c065c5-bf8c-4e57-87c7-3e2d712d5ef4","year":null},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.353821Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:a318d0ac076ae79f6a6a32d646cbbbb76e2495f0d0337233548e2265bdb25473","observation_id":"329ece0c-ce06-44bb-bb75-991b50ca45d5","resolution":{"observed_at":"2026-08-10T10:29:55.977851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:55.963048Z","title":"What matters in building vision-language- action models for generalist robots,","venue":null,"work_id":"98be8aa6-e98c-470b-8aa7-55bed03212cf","year":2026},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.359366Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:500b1eb1f726f4438d2e1129f2f12ea7b58d1a2f63d27c348a1e6e51113cff29","observation_id":"995e8f22-1a8e-46e0-84bf-941c89e41238","resolution":{"observed_at":"2026-08-10T10:29:55.966734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15109","last_updated":"2024-12-19T17:52:50Z","snapshot_observed_at":"2026-07-06T20:10:19.704368Z","submitted_at":"2024-12-19T17:52:50Z","title":"Predictive Inverse Dynamics Models are Scalable Learners for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15109","snapshot_observed_at":"2026-08-10T10:29:55.362007Z","title":"Predictive inverse dynamics models are scalable learners for robotic manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.362007Z"},"links":{"cited_paper":"/paper/2412.15109","citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:374b2427d1e9ebc814db6c276334c946882d3ef848413356851cc42b1a76bb51","observation_id":"b1c35929-4741-4869-a527-3e1902b19ff7","resolution":{"observed_at":"2026-08-10T10:29:55.362007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-14T12:42:36.436107Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-08-10T10:29:55.356467Z","title":"Available: https://arxiv.org/abs/2501.18867","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.356467Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:b98b7121b93ebe891a8bf93e9f49cd907132cc4ff5123a75f219f5dff0663268","observation_id":"76e909f4-f93f-4e90-991a-6a937ec19a6b","resolution":{"observed_at":"2026-08-10T10:29:55.356467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:55.951983Z","title":"Video prediction policy: A generalist robot policy with predictive visual representations,","venue":null,"work_id":"5c77a503-39e6-4cd0-a67a-3659d030c1fe","year":2025},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.365544Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:e9de41c3920e617eb1150291de1f48c059151dd1ce12a2e53d56d3a484dc24d3","observation_id":"07711bc4-1625-48fd-b1e5-c6201cd13b93","resolution":{"observed_at":"2026-08-10T10:29:55.955746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:56.046724Z","title":null,"venue":null,"work_id":"f0d8d85a-8c16-48e5-b11b-340c2cdc1b46","year":2025},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":305,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.292911Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:ccee162d2748a9df84f570e67859ff81ef96b543472fcf7ae2fc7253077c1766","observation_id":"7294401d-902b-4fdd-bf7c-f2e75b9fb205","resolution":{"observed_at":"2026-08-10T10:29:56.049969Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:55.306328Z","title":"Available: https://arxiv.org/abs/2510.00406","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.306328Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:eabd714c645034fcc6089b414616781bb41fe3fd8f23f8ad9898fff5e4201f2b","observation_id":"c57bf128-f41f-4721-82f8-47351af4de48","resolution":{"observed_at":"2026-08-10T10:29:55.306328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-14T16:20:47.385886Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":2,"verified_fuzzy":23},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2608.07314."}