{"as_of":"2026-08-09T17:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1ff2e0ac4f69f9958016f6a00234918297e1db57a9d46fa0ba0f4bdef3c669fa","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":30,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:26:30.940459Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T13:39:51.078263Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1910.11956","last_updated":"2019-10-25T23:01:43Z","snapshot_observed_at":"2026-08-07T14:52:56.563730Z","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1910.11956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.11956","snapshot_observed_at":"2026-07-04T13:39:51.078263Z","title":"Relay policy learning: Solving long-horizon tasks via imitation and reinforcement learning","venue":null,"work_id":"ad002352-9797-48d1-b2ea-543ce79e8165","year":1910},"citing_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T23:19:17.322890Z"},"links":{"cited_paper":"/paper/1910.11956","citing_paper":"/paper/2004.07219"},"observation_digest":"sha256:625620978048641b369e3bb0ebedf2b993bed822fc23f2bb62b5758d4fcf7c8e","observation_id":"b0592225-ea90-47e1-bf98-8704da4577f9","resolution":{"observed_at":"2026-05-12T23:19:17.414978Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11956","last_updated":"2019-10-25T23:01:43Z","snapshot_observed_at":"2026-08-07T14:52:56.563730Z","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1910.11956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.11956","snapshot_observed_at":"2026-07-04T13:39:51.078263Z","title":"Relay policy learning: Solving long-horizon tasks via imitation and reinforcement learning","venue":null,"work_id":"ad002352-9797-48d1-b2ea-543ce79e8165","year":1910},"citing_paper":{"arxiv_id":"2210.00030","last_updated":"2023-03-07T02:29:59Z","snapshot_observed_at":"2026-08-02T00:17:16.761436Z","submitted_at":"2022-09-30T18:14:07Z","title":"VIP: Towards Universal Visual Reward and Representation via Value-Implicit Pre-Training","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T04:42:52.627166Z"},"links":{"cited_paper":"/paper/1910.11956","citing_paper":"/paper/2210.00030"},"observation_digest":"sha256:9f2ef93d732b84ac6affc3232d3c7efff7d9d7cffe6b100a720d3d62b9425c39","observation_id":"198e1864-ad6b-4f8a-b3c7-0b888f799c45","resolution":{"observed_at":"2026-05-15T04:42:52.711721Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11956","last_updated":"2019-10-25T23:01:43Z","snapshot_observed_at":"2026-08-07T14:52:56.563730Z","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1910.11956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.11956","snapshot_observed_at":"2026-07-04T13:39:51.078263Z","title":"Relay policy learning: Solving long-horizon tasks via imitation and reinforcement learning","venue":null,"work_id":"ad002352-9797-48d1-b2ea-543ce79e8165","year":1910},"citing_paper":{"arxiv_id":"2312.13139","last_updated":"2023-12-21T05:34:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-20T16:00:43Z","title":"Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation","version":2},"reference_index":120,"source":"arxiv_source","source_observed_at":"2026-05-13T16:32:05.538507Z"},"links":{"cited_paper":"/paper/1910.11956","citing_paper":"/paper/2312.13139"},"observation_digest":"sha256:3aedb7f299834908e001d4d24aaf6ffee6e208d5e666cfd4362bbb1033604036","observation_id":"4defba8b-2764-4aeb-aa63-2183159555b1","resolution":{"observed_at":"2026-05-13T16:32:05.604253Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11956","last_updated":"2019-10-25T23:01:43Z","snapshot_observed_at":"2026-08-07T14:52:56.563730Z","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1910.11956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.11956","snapshot_observed_at":"2026-07-04T13:39:51.078263Z","title":"Relay policy learning: Solving long-horizon tasks via imitation and reinforcement learning","venue":null,"work_id":"ad002352-9797-48d1-b2ea-543ce79e8165","year":1910},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/1910.11956","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:f44fec67177fc6d16b65746817337744f8d7f76fa8da1a16c4b10e74c0d9e424","observation_id":"de2072f5-0ece-47fb-96a7-13ab1a87fafa","resolution":{"observed_at":"2026-05-16T08:48:14.875918Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11956","last_updated":"2019-10-25T23:01:43Z","snapshot_observed_at":"2026-08-07T14:52:56.563730Z","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1910.11956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.11956","snapshot_observed_at":"2026-07-04T13:39:51.078263Z","title":"Relay policy learning: Solving long-horizon tasks via imitation and reinforcement learning","venue":null,"work_id":"ad002352-9797-48d1-b2ea-543ce79e8165","year":1910},"citing_paper":{"arxiv_id":"2411.00361","last_updated":"2026-04-15T18:16:21Z","snapshot_observed_at":"2026-07-06T19:43:23.653382Z","submitted_at":"2024-11-01T04:58:40Z","title":"Direct Preference Optimization for Primitive-Enabled Hierarchical RL: A Bilevel Approach","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-23T18:30:38.818711Z"},"links":{"cited_paper":"/paper/1910.11956","citing_paper":"/paper/2411.00361"},"observation_digest":"sha256:b5d271f940f849268ae10daeff8528da5e754a89528f6a216bc5d31b8904c836","observation_id":"5a0b22ca-5241-4357-9b91-ab026ad64f38","resolution":{"observed_at":"2026-05-23T18:33:19.665531Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11956","last_updated":"2019-10-25T23:01:43Z","snapshot_observed_at":"2026-08-07T14:52:56.563730Z","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1910.11956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.11956","snapshot_observed_at":"2026-07-04T13:39:51.078263Z","title":"Relay policy learning: Solving long-horizon tasks via imitation and reinforcement learning","venue":null,"work_id":"ad002352-9797-48d1-b2ea-543ce79e8165","year":1910},"citing_paper":{"arxiv_id":"2506.13456","last_updated":"2026-05-13T10:49:00Z","snapshot_observed_at":"2026-08-07T16:19:33.135284Z","submitted_at":"2025-06-16T13:14:58Z","title":"Block-wise Adaptive Caching for Accelerating Diffusion Policy","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-19T09:36:09.790248Z"},"links":{"cited_paper":"/paper/1910.11956","citing_paper":"/paper/2506.13456"},"observation_digest":"sha256:7bc495d8028b757eb5a7b59534707bd1e564ea5ea3d3f541332edc08a7cd69a7","observation_id":"f361a955-fa05-4f92-93bc-d4217624d2d4","resolution":{"observed_at":"2026-05-19T09:37:14.015757Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11956","last_updated":"2019-10-25T23:01:43Z","snapshot_observed_at":"2026-08-07T14:52:56.563730Z","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.11956","snapshot_observed_at":"2026-08-07T00:26:30.940459Z","title":"Relay policy learning: Solving long-horizon tasks via imitation and reinforcement learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.14287","last_updated":"2025-06-17T07:59:07Z","snapshot_observed_at":"2026-08-09T04:06:15.863490Z","submitted_at":"2025-06-17T07:59:07Z","title":"Steering Robots with Inference-Time Interactions","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:30.940459Z"},"links":{"cited_paper":"/paper/1910.11956","citing_paper":"/paper/2506.14287"},"observation_digest":"sha256:aa44518ac0a644688ef700762cba4b321887d53e4363518de672d4177fa048c9","observation_id":"df18f18a-39af-47af-a11c-a273e36f4d61","resolution":{"observed_at":"2026-08-07T00:26:30.940459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11956","last_updated":"2019-10-25T23:01:43Z","snapshot_observed_at":"2026-08-07T14:52:56.563730Z","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.11956","snapshot_observed_at":"2026-08-06T21:07:23.545915Z","title":"Relay policy learning: Solving long- horizon tasks via imitation and reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:23.545915Z"},"links":{"cited_paper":"/paper/1910.11956","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:6a185e5d0498ad3f7d3c4bce7a736b53db3886196b94d1fb06de4ccd5857e64a","observation_id":"85db7f8c-2df1-49c7-836d-3b681e7bcffb","resolution":{"observed_at":"2026-08-06T21:07:23.545915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11956","last_updated":"2019-10-25T23:01:43Z","snapshot_observed_at":"2026-08-07T14:52:56.563730Z","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.11956","snapshot_observed_at":"2026-08-06T17:12:27.957201Z","title":"Relay policy learning: Solving long-horizon tasks via imitation and reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.12496","last_updated":"2025-07-15T21:49:49Z","snapshot_observed_at":"2026-08-06T17:00:15.350427Z","submitted_at":"2025-07-15T21:49:49Z","title":"FOUNDER: Grounding Foundation Models in World Models for Open-Ended Embodied Decision Making","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T17:12:27.957201Z"},"links":{"cited_paper":"/paper/1910.11956","citing_paper":"/paper/2507.12496"},"observation_digest":"sha256:b90f7f0e36fdcb9f23a8d8f8d4340b87b0e50991548a428df20357f2d4fd830d","observation_id":"70a90a27-ee19-4c55-90ab-040b1ee96e71","resolution":{"observed_at":"2026-08-06T17:12:27.957201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11956","last_updated":"2019-10-25T23:01:43Z","snapshot_observed_at":"2026-08-07T14:52:56.563730Z","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.11956","snapshot_observed_at":"2026-08-06T15:17:34.911775Z","title":"Relay policy learning: Solving long-horizon tasks via imitation and reinforcement learning.arXiv preprint arXiv:1910.11956, 2019","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.16473","last_updated":"2025-07-24T08:23:56Z","snapshot_observed_at":"2026-08-09T12:19:33.989331Z","submitted_at":"2025-07-22T11:22:58Z","title":"Learning Temporal Abstractions via Variational Homomorphisms in Option-Induced Abstract MDPs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:17:34.911775Z"},"links":{"cited_paper":"/paper/1910.11956","citing_paper":"/paper/2507.16473"},"observation_digest":"sha256:7b3989b72e99b16db7be8a78697312518fde1d0cc4bf1050ed38d7ee46c862a5","observation_id":"59e65321-a80a-46f8-8a06-056ab68d8390","resolution":{"observed_at":"2026-08-06T15:17:34.911775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11956","last_updated":"2019-10-25T23:01:43Z","snapshot_observed_at":"2026-08-07T14:52:56.563730Z","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.11956","snapshot_observed_at":"2026-08-05T22:37:38.862346Z","title":"Communications of the ACM, 63(11): 139–144","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.06804","last_updated":"2025-08-09T03:27:21Z","snapshot_observed_at":"2026-08-05T22:37:36.438660Z","submitted_at":"2025-08-09T03:27:21Z","title":"D3P: Dynamic Denoising Diffusion Policy via Reinforcement Learning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-05T22:37:38.862346Z"},"links":{"cited_paper":"/paper/1910.11956","citing_paper":"/paper/2508.06804"},"observation_digest":"sha256:991837d01cfa50ceb5df7ebb92cbaba91db58008f1375fd13d60150c14306e3e","observation_id":"e1c9652e-a846-42bb-b6cc-536c9be01cd3","resolution":{"observed_at":"2026-08-05T22:37:38.862346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11956","last_updated":"2019-10-25T23:01:43Z","snapshot_observed_at":"2026-08-07T14:52:56.563730Z","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.11956","snapshot_observed_at":"2026-08-04T08:45:48.991607Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.19528","last_updated":"2026-06-16T14:16:10Z","snapshot_observed_at":"2026-08-04T08:45:45.421057Z","submitted_at":"2025-10-22T12:32:52Z","title":"Learning Upper Lower Value Envelopes to Shape Online RL: A Principled Approach","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T08:45:48.991607Z"},"links":{"cited_paper":"/paper/1910.11956","citing_paper":"/paper/2510.19528"},"observation_digest":"sha256:e9f90e7b8854f4aba379f33e144f6be7056c05693dace9405be5b323e2a26c81","observation_id":"17b2e3e5-a7c8-4e3a-ae6b-d8f26c2d3b74","resolution":{"observed_at":"2026-08-04T08:45:48.991607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11956","last_updated":"2019-10-25T23:01:43Z","snapshot_observed_at":"2026-08-07T14:52:56.563730Z","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.11956","snapshot_observed_at":"2026-08-03T20:13:27.607487Z","title":"Relay policy learning: Solving long-horizon tasks via imitation and reinforcement learning.arXiv preprint arXiv:1910.11956, 2019","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2511.20906","last_updated":"2026-06-20T17:21:11Z","snapshot_observed_at":"2026-08-09T14:58:36.580682Z","submitted_at":"2025-11-25T22:46:42Z","title":"DASIP: Dynamic Test-Time Compute Scaling for Robot Control with Stochastic Interpolant Policies","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T20:13:27.607487Z"},"links":{"cited_paper":"/paper/1910.11956","citing_paper":"/paper/2511.20906"},"observation_digest":"sha256:4f12f786a42e0cfe3928988095a662bbae1a7d82c4b8b51b971f51b1d65e41d4","observation_id":"e5a808f4-74b4-44be-b620-5437f98b78f3","resolution":{"observed_at":"2026-08-03T20:13:27.607487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11956","last_updated":"2019-10-25T23:01:43Z","snapshot_observed_at":"2026-08-07T14:52:56.563730Z","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1910.11956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.11956","snapshot_observed_at":"2026-07-04T13:39:51.078263Z","title":"Relay policy learning: Solving long-horizon tasks via imitation and reinforcement learning","venue":null,"work_id":"ad002352-9797-48d1-b2ea-543ce79e8165","year":1910},"citing_paper":{"arxiv_id":"2601.12894","last_updated":"2026-05-15T13:46:26Z","snapshot_observed_at":"2026-08-02T15:06:51.761583Z","submitted_at":"2026-01-19T09:50:36Z","title":"Sparse ActionGen: Accelerating Diffusion Policy with Real-time Pruning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T16:33:41.439450Z"},"links":{"cited_paper":"/paper/1910.11956","citing_paper":"/paper/2601.12894"},"observation_digest":"sha256:fdd27393a6e508db40015ea07211c2c4f0234f21a3d7f61bf6ff18a2e138ca03","observation_id":"5bea7f2a-15cc-46e8-a837-adb104d549b1","resolution":{"observed_at":"2026-05-21T16:34:16.328023Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11956","last_updated":"2019-10-25T23:01:43Z","snapshot_observed_at":"2026-08-07T14:52:56.563730Z","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1910.11956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.11956","snapshot_observed_at":"2026-07-04T13:39:51.078263Z","title":"Relay policy learning: Solving long-horizon tasks via imitation and reinforcement learning","venue":null,"work_id":"ad002352-9797-48d1-b2ea-543ce79e8165","year":1910},"citing_paper":{"arxiv_id":"2604.04826","last_updated":"2026-04-06T16:27:18Z","snapshot_observed_at":"2026-08-08T05:44:33.998906Z","submitted_at":"2026-04-06T16:27:18Z","title":"Efficient Multi-Objective Planning with Weighted Maximization Using Large Neighbourhood Search","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T19:13:45.010530Z"},"links":{"cited_paper":"/paper/1910.11956","citing_paper":"/paper/2604.04826"},"observation_digest":"sha256:62e1314ce82e217cbbf8881b37a43f97eb11dbb6e10f8c16c1c14c2cad943874","observation_id":"3c387d72-f425-4ff5-bcf3-e6344341bcfd","resolution":{"observed_at":"2026-05-10T23:20:50.996667Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11956","last_updated":"2019-10-25T23:01:43Z","snapshot_observed_at":"2026-08-07T14:52:56.563730Z","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1910.11956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.11956","snapshot_observed_at":"2026-07-04T13:39:51.078263Z","title":"Relay policy learning: Solving long-horizon tasks via imitation and reinforcement learning","venue":null,"work_id":"ad002352-9797-48d1-b2ea-543ce79e8165","year":1910},"citing_paper":{"arxiv_id":"2604.10573","last_updated":"2026-04-12T10:36:18Z","snapshot_observed_at":"2026-08-02T12:13:25.467849Z","submitted_at":"2026-04-12T10:36:18Z","title":"Learning 3D Representations for Spatial Intelligence from Unposed Multi-View Images","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T15:44:39.322417Z"},"links":{"cited_paper":"/paper/1910.11956","citing_paper":"/paper/2604.10573"},"observation_digest":"sha256:d13a185e28023ef6930c482d82adbe9f2ca6fbe2b31da9f4ef59177c8b8fee86","observation_id":"b7d900f5-c284-46da-a984-bf67f9623a63","resolution":{"observed_at":"2026-05-11T09:56:03.625672Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11956","last_updated":"2019-10-25T23:01:43Z","snapshot_observed_at":"2026-08-07T14:52:56.563730Z","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1910.11956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.11956","snapshot_observed_at":"2026-07-04T13:39:51.078263Z","title":"Relay policy learning: Solving long-horizon tasks via imitation and reinforcement learning","venue":null,"work_id":"ad002352-9797-48d1-b2ea-543ce79e8165","year":1910},"citing_paper":{"arxiv_id":"2604.10962","last_updated":"2026-04-13T03:56:37Z","snapshot_observed_at":"2026-08-02T07:19:58.094243Z","submitted_at":"2026-04-13T03:56:37Z","title":"ScoRe-Flow: Complete Distributional Control via Score-Based Reinforcement Learning for Flow Matching","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T16:02:36.261596Z"},"links":{"cited_paper":"/paper/1910.11956","citing_paper":"/paper/2604.10962"},"observation_digest":"sha256:d6a1c9ca21359175645da436393a5dd02a617dfa2e2c60d0e2fd9781adace38b","observation_id":"0950a9e9-687e-47f0-a34d-48ea79c64616","resolution":{"observed_at":"2026-05-11T09:26:00.645341Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11956","last_updated":"2019-10-25T23:01:43Z","snapshot_observed_at":"2026-08-07T14:52:56.563730Z","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1910.11956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.11956","snapshot_observed_at":"2026-07-04T13:39:51.078263Z","title":"Relay policy learning: Solving long-horizon tasks via imitation and reinforcement learning","venue":null,"work_id":"ad002352-9797-48d1-b2ea-543ce79e8165","year":1910},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":1},"reference_index":147,"source":"arxiv_source","source_observed_at":"2026-05-08T18:48:56.075160Z"},"links":{"cited_paper":"/paper/1910.11956","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:b5360c2424046d29e4214f6af92bd089cbe3d7cb797b3dc0ebc6bcb603aa1ffd","observation_id":"915a78e5-f88f-4878-a8fc-5cca01a41ca9","resolution":{"observed_at":"2026-05-09T06:10:42.470603Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11956","last_updated":"2019-10-25T23:01:43Z","snapshot_observed_at":"2026-08-07T14:52:56.563730Z","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1910.11956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.11956","snapshot_observed_at":"2026-07-04T13:39:51.078263Z","title":"Relay policy learning: Solving long-horizon tasks via imitation and reinforcement learning","venue":null,"work_id":"ad002352-9797-48d1-b2ea-543ce79e8165","year":1910},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/1910.11956","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:3a6f3defb6ce11172fb553f168f013ba37787732feb553a39df80e162e9305f0","observation_id":"242da48d-3abb-4790-885d-79a84a51b9fd","resolution":{"observed_at":"2026-07-01T00:05:09.684233Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11956","last_updated":"2019-10-25T23:01:43Z","snapshot_observed_at":"2026-08-07T14:52:56.563730Z","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1910.11956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.11956","snapshot_observed_at":"2026-07-04T13:39:51.078263Z","title":"Relay policy learning: Solving long-horizon tasks via imitation and reinforcement learning","venue":null,"work_id":"ad002352-9797-48d1-b2ea-543ce79e8165","year":1910},"citing_paper":{"arxiv_id":"2605.03363","last_updated":"2026-05-05T04:49:38Z","snapshot_observed_at":"2026-07-06T23:16:20.322265Z","submitted_at":"2026-05-05T04:49:38Z","title":"Learning Reactive Dexterous Grasping via Hierarchical Task-Space RL Planning and Joint-Space QP Control","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-07T15:57:58.686493Z"},"links":{"cited_paper":"/paper/1910.11956","citing_paper":"/paper/2605.03363"},"observation_digest":"sha256:e5f6bfbe8758c34297e7ba13aeefd7b2c9c4e825f77ea19ca690f0b2056c910c","observation_id":"88d10d64-f776-49cd-babb-95b915500970","resolution":{"observed_at":"2026-05-12T10:51:29.433062Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11956","last_updated":"2019-10-25T23:01:43Z","snapshot_observed_at":"2026-08-07T14:52:56.563730Z","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1910.11956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.11956","snapshot_observed_at":"2026-07-04T13:39:51.078263Z","title":"Relay policy learning: Solving long-horizon tasks via imitation and reinforcement learning","venue":null,"work_id":"ad002352-9797-48d1-b2ea-543ce79e8165","year":1910},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":224,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/1910.11956","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:49be4b63c585a03d0ea7b501a0d74624f751c9c9c93d02ebea5312d578352454","observation_id":"6e350794-77b1-49ad-9769-58a7a6d14469","resolution":{"observed_at":"2026-05-13T05:07:18.000999Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11956","last_updated":"2019-10-25T23:01:43Z","snapshot_observed_at":"2026-08-07T14:52:56.563730Z","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1910.11956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.11956","snapshot_observed_at":"2026-07-04T13:39:51.078263Z","title":"Relay policy learning: Solving long-horizon tasks via imitation and reinforcement learning","venue":null,"work_id":"ad002352-9797-48d1-b2ea-543ce79e8165","year":1910},"citing_paper":{"arxiv_id":"2605.15725","last_updated":"2026-05-15T08:22:37Z","snapshot_observed_at":"2026-08-06T08:15:14.018564Z","submitted_at":"2026-05-15T08:22:37Z","title":"DiLA: Disentangled Latent Action World Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T19:35:37.527479Z"},"links":{"cited_paper":"/paper/1910.11956","citing_paper":"/paper/2605.15725"},"observation_digest":"sha256:9856ddcc415aea4dc63b6e2df78043f617f0e4c429251bfcd3746a97e29a0120","observation_id":"1dfa8652-7124-4f99-a039-7d29d0201766","resolution":{"observed_at":"2026-05-20T19:38:56.392763Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11956","last_updated":"2019-10-25T23:01:43Z","snapshot_observed_at":"2026-08-07T14:52:56.563730Z","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1910.11956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.11956","snapshot_observed_at":"2026-07-04T13:39:51.078263Z","title":"Relay policy learning: Solving long-horizon tasks via imitation and reinforcement learning","venue":null,"work_id":"ad002352-9797-48d1-b2ea-543ce79e8165","year":1910},"citing_paper":{"arxiv_id":"2605.17244","last_updated":"2026-05-17T03:58:01Z","snapshot_observed_at":"2026-08-03T01:10:09.382150Z","submitted_at":"2026-05-17T03:58:01Z","title":"Drift Flow Matching","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-20T14:31:05.979325Z"},"links":{"cited_paper":"/paper/1910.11956","citing_paper":"/paper/2605.17244"},"observation_digest":"sha256:7b58cb7b158654483c1a62017475066c5a2c6d90bf9792ecd7bff71996b1ab73","observation_id":"a0bcfbde-a451-4380-94f0-5510b9f0adff","resolution":{"observed_at":"2026-05-20T14:33:21.456573Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11956","last_updated":"2019-10-25T23:01:43Z","snapshot_observed_at":"2026-08-07T14:52:56.563730Z","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1910.11956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.11956","snapshot_observed_at":"2026-07-04T13:39:51.078263Z","title":"Relay policy learning: Solving long-horizon tasks via imitation and reinforcement learning","venue":null,"work_id":"ad002352-9797-48d1-b2ea-543ce79e8165","year":1910},"citing_paper":{"arxiv_id":"2605.22493","last_updated":"2026-05-21T13:45:28Z","snapshot_observed_at":"2026-07-06T23:32:49.530788Z","submitted_at":"2026-05-21T13:45:28Z","title":"Understanding Multimodal Failure in Action-Chunking Behavioral Cloning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T08:14:28.115848Z"},"links":{"cited_paper":"/paper/1910.11956","citing_paper":"/paper/2605.22493"},"observation_digest":"sha256:b9fdfa2b3698084ba209863adccdfd84d8ed61bb022954145efd2c5c00167ac7","observation_id":"f0d5cfea-ba06-45d2-831a-0b89a5816f8f","resolution":{"observed_at":"2026-05-22T08:14:45.504390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11956","last_updated":"2019-10-25T23:01:43Z","snapshot_observed_at":"2026-08-07T14:52:56.563730Z","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1910.11956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.11956","snapshot_observed_at":"2026-07-04T13:39:51.078263Z","title":"Relay policy learning: Solving long-horizon tasks via imitation and reinforcement learning","venue":null,"work_id":"ad002352-9797-48d1-b2ea-543ce79e8165","year":1910},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"cited_paper":"/paper/1910.11956","citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:c6b1d024f52ed826506941780946b2c0b71612e7a44fc5fadc3a0d13c3bf6870","observation_id":"619cd848-645e-45ef-9a86-fcc2a7408db6","resolution":{"observed_at":"2026-07-04T13:39:51.080320Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11956","last_updated":"2019-10-25T23:01:43Z","snapshot_observed_at":"2026-08-07T14:52:56.563730Z","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.11956","snapshot_observed_at":"2026-07-11T19:24:48.899301Z","title":"Relay policy learning: Solving long-horizon tasks via imitation and reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2607.04409","last_updated":"2026-07-05T17:02:40Z","snapshot_observed_at":"2026-08-08T22:46:44.595810Z","submitted_at":"2026-07-05T17:02:40Z","title":"Learning Task-Sufficient World Models by Synergizing Agentic Exploration and Structured Modeling","version":1},"reference_index":135,"source":"arxiv_source","source_observed_at":"2026-07-11T19:24:48.899301Z"},"links":{"cited_paper":"/paper/1910.11956","citing_paper":"/paper/2607.04409"},"observation_digest":"sha256:5ceb42a6b7c3e04a54aec24cccbf8342e9fae5c9c775d3ed0e726fc02776c9f7","observation_id":"5d93897c-4d3d-4532-b647-8fb3651a43ca","resolution":{"observed_at":"2026-07-11T19:24:48.899301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11956","last_updated":"2019-10-25T23:01:43Z","snapshot_observed_at":"2026-08-07T14:52:56.563730Z","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.11956","snapshot_observed_at":"2026-07-14T10:23:25.158961Z","title":"Relay policy learning: Solving long-horizon tasks via imitation and reinforcement learning.arXiv preprint arXiv:1910.11956, 2019","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2607.10625","last_updated":"2026-07-12T07:38:53Z","snapshot_observed_at":"2026-08-07T06:50:58.781901Z","submitted_at":"2026-07-12T07:38:53Z","title":"Dual-Process Atomic Skill Learning: Decoupling Semantic Reasoning and Real-Time Control","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T10:23:25.158961Z"},"links":{"cited_paper":"/paper/1910.11956","citing_paper":"/paper/2607.10625"},"observation_digest":"sha256:e9ac9f188572b72e559a89ef3d054fe17110e09a2808456adf81bc3e45b35ced","observation_id":"fd3fb91f-ada2-4ef3-9ee7-e3907b692c60","resolution":{"observed_at":"2026-07-14T10:23:25.158961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11956","last_updated":"2019-10-25T23:01:43Z","snapshot_observed_at":"2026-08-07T14:52:56.563730Z","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.11956","snapshot_observed_at":"2026-08-01T08:32:00.377284Z","title":"arXiv preprint arXiv:1910.11956 , year=","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-05T03:29:01.517081Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":115,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.377284Z"},"links":{"cited_paper":"/paper/1910.11956","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:b0668031bce019e1651eff4879676ff6f7efe33f5ce00b3e6f9a374a0dcb941b","observation_id":"42ade7d4-095b-4500-ba52-3515edd58d5f","resolution":{"observed_at":"2026-08-01T08:32:00.377284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11956","last_updated":"2019-10-25T23:01:43Z","snapshot_observed_at":"2026-08-07T14:52:56.563730Z","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.11956","snapshot_observed_at":"2026-07-31T06:18:55.529553Z","title":"Relay policy learning: solving long-horizon tasks via imitation and reinforcement learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.24744","last_updated":"2026-07-27T17:59:58Z","snapshot_observed_at":"2026-08-06T17:57:37.442251Z","submitted_at":"2026-07-27T17:59:58Z","title":"Data Pyramid for Embodied Manipulation","version":1},"reference_index":132,"source":"pdf_text","source_observed_at":"2026-07-31T06:18:55.529553Z"},"links":{"cited_paper":"/paper/1910.11956","citing_paper":"/paper/2607.24744"},"observation_digest":"sha256:6d7dac85c96adc548d64c18b9ab8f1e2f5cdc1ca59a6f8dece8c591dbd7077b6","observation_id":"86aeffef-3846-4676-acbd-1de15e085da4","resolution":{"observed_at":"2026-07-31T06:18:55.529553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11956","last_updated":"2019-10-25T23:01:43Z","snapshot_observed_at":"2026-08-07T14:52:56.563730Z","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.11956","snapshot_observed_at":"2026-08-04T19:45:31.346266Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.01851","last_updated":"2026-08-03T07:58:35Z","snapshot_observed_at":"2026-08-07T23:22:57.641630Z","submitted_at":"2026-08-03T07:58:35Z","title":"Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-04T19:45:31.346266Z"},"links":{"cited_paper":"/paper/1910.11956","citing_paper":"/paper/2608.01851"},"observation_digest":"sha256:508a68edff5d9a01f0e98a7f8a22139b9a62240cd7c34507cedb0328f0b30984","observation_id":"a92d4533-c64d-43b5-9267-6193ab9d44c5","resolution":{"observed_at":"2026-08-04T19:45:31.346266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1910.11956/citation-record","integrity":"/paper/1910.11956/integrity","json":"/paper/1910.11956/citation-record.json","paper":"/paper/1910.11956"},"outbound":[],"paper":{"arxiv_id":"1910.11956","last_updated":"2019-10-25T23:01:43Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T14:52:56.563730Z","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 30 inbound Pith citation observations for arXiv:1910.11956."}