{"as_of":"2026-08-10T11:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:72ea75fb5d0b5e056fac0d1dd8c2d0f42618cf1ce7ebe03b9769dbc0a4d94105","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T03:18:45.404752Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T06:36:28.586778Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T06:37:26.736986Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2602.08557","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.08557","snapshot_observed_at":"2026-07-01T02:17:19.407585Z","title":"Constrained Sampling to Guide Universal Manipulation RL","venue":null,"work_id":"6ff80fd5-f46f-4e04-8b89-1a977f7fe109","year":2026},"citing_paper":{"arxiv_id":"2605.12338","last_updated":"2026-05-12T16:19:32Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T16:19:32Z","title":"Manifold Sampling via Entropy Maximization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T06:36:28.586778Z"},"links":{"cited_paper":"/paper/2602.08557","citing_paper":"/paper/2605.12338"},"observation_digest":"sha256:f2bd82d331c2466263aa26d5069278748ce9a230e385bf4ef37c9ff2537c5e62","observation_id":"ba319c3b-5ffa-44f4-9cac-248638812038","resolution":{"observed_at":"2026-07-01T02:17:19.407585Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2602.08557/citation-record","integrity":"/paper/2602.08557/integrity","json":"/paper/2602.08557/citation-record.json","paper":"/paper/2602.08557"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1910.07113","last_updated":"2019-10-16T00:59:05Z","snapshot_observed_at":"2026-08-02T15:37:37.200292Z","submitted_at":"2019-10-16T00:59:05Z","title":"Solving Rubik's Cube with a Robot Hand","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07113","snapshot_observed_at":"2026-08-03T03:18:39.888001Z","title":"Solving rubik’s cube with a robot hand.arXiv:1910.07113, 2019","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:39.888001Z"},"links":{"cited_paper":"/paper/1910.07113","citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:42a7fb9ba470199f39f3d4fdbafa882c3d263e1cde3c25cf0e87ee458dacac9b","observation_id":"0a78c7f9-4d01-4aaf-acf9-3bc444364f34","resolution":{"observed_at":"2026-08-03T03:18:39.888001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:40.003451Z","title":"Hindsight experience replay.Ad- vances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:40.003451Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:5c280279bebaecaf1c717b05fe05b3b75b8b3522c9ebe7071f267ede4524b94c","observation_id":"71d2c116-5951-4170-a71b-2eab23533629","resolution":{"observed_at":"2026-08-03T03:18:40.003451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:40.080431Z","title":"Consensus complementarity control for multi-contact mpc.IEEE Transactions on Robotics, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:40.080431Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:d8afbc6ed159232bdd81400b9dc4277ab0a53ea5239071933bf638cdfbe1e617","observation_id":"74d95574-de97-4af4-a0ea-dbef81513d00","resolution":{"observed_at":"2026-08-03T03:18:40.080431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:40.226418Z","title":"Guided goal generation for hindsight multi- goal reinforcement learning.Neurocomputing, 359: 353–367, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:40.226418Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:97410c819e18f7255bd0cf2f2e9d9603fd642a891764aabd70431e414b96c8e4","observation_id":"348d7fe1-08e8-49de-95a5-d57b619e308a","resolution":{"observed_at":"2026-08-03T03:18:40.226418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:40.267064Z","title":"Efficient online reinforcement learn- ing with offline data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:40.267064Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:101ab62fdc25d83d3e0afd4fbef1a13e4e4447e55ebbf7d9ec5a6358219519b9","observation_id":"de9c0539-9241-44f2-847b-cfe9c94f4f23","resolution":{"observed_at":"2026-08-03T03:18:40.267064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:40.358042Z","title":"Cambridge university press, 2004","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:40.358042Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:8cb8e74cce487c67fcf5a5d2d4dc55b04d7dd425db8e51a2c875a2d589e2bdb5","observation_id":"6faf0550-222e-46fc-bbcb-aa66f777754e","resolution":{"observed_at":"2026-08-03T03:18:40.358042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01568","last_updated":"2026-05-12T14:58:56Z","snapshot_observed_at":"2026-07-06T21:34:58.336085Z","submitted_at":"2025-06-02T11:47:51Z","title":"Trajectory First: A Curriculum for Discovering Diverse Policies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01568","snapshot_observed_at":"2026-08-03T03:18:40.489773Z","title":"Trajectory first: A curriculum for discovering diverse policies.arXiv:2506.01568, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:40.489773Z"},"links":{"cited_paper":"/paper/2506.01568","citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:0b45534c856f82010907f49ff28acdb5649cc3857cd0b0e573559428b1680b17","observation_id":"8bfcef64-9018-465c-9e9b-250679ec11b6","resolution":{"observed_at":"2026-08-03T03:18:40.489773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:40.659846Z","title":"Tenenbaum, Tim Rockt¨aschel, and Edward Grefenstette","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:40.659846Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:85c8e4ec50a3eb13b5a7aed6735758fe2baf40831d0d5aae472ae1cf33c38b85","observation_id":"092c6880-7c3d-4b24-b553-d1fe6c3fdb00","resolution":{"observed_at":"2026-08-03T03:18:40.659846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:40.791116Z","title":"Goal-conditioned reinforcement learning with imagined subgoals","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:40.791116Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:7c26d0eab060abb971284354e922b203309496e5ae4113dbde6a33a5429aadf1","observation_id":"a11b49b1-6d7b-4230-a3bc-3dca10e0e33a","resolution":{"observed_at":"2026-08-03T03:18:40.791116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:40.924236Z","title":"Whole-body motion planning with centroidal dynamics and full kinematics","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:40.924236Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:91ad89b7a490f10372302fa7e92bf112ce6d163c9236fc5ec49be9dec232d1a1","observation_id":"9312a0e2-cd30-46b3-b62e-910765ff927b","resolution":{"observed_at":"2026-08-03T03:18:40.924236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16309","last_updated":"2023-10-17T16:34:46Z","snapshot_observed_at":"2026-08-08T18:56:55.901260Z","submitted_at":"2023-05-25T17:58:14Z","title":"Imitating Task and Motion Planning with Visuomotor Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16309","snapshot_observed_at":"2026-08-03T03:18:41.001006Z","title":"Imitating Task and Motion Planning with Visuomotor Transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:41.001006Z"},"links":{"cited_paper":"/paper/2305.16309","citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:906d30ef3de736489d6cc2962c2bc92670fc9c2adf10adc0e905b579bf232daa","observation_id":"af2ab279-dcbd-4450-a988-4f1d92f8ff45","resolution":{"observed_at":"2026-08-03T03:18:41.001006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:41.080155Z","title":"Footstep planning on uneven terrain with mixed-integer convex opti- mization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:41.080155Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:4aa469ae2221589bff116432a1600c88ad913204f14f41dc7b39f572d580eea6","observation_id":"0c82b822-c67b-4582-bd46-3986c1f99f1d","resolution":{"observed_at":"2026-08-03T03:18:41.080155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:41.128554Z","title":"Curriculum-guided hindsight experience replay.Advances in neural information processing systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:41.128554Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:c29708fef377120824b5f6d8ac031077c1c20563e04190a834c897e32ef7fce8","observation_id":"63a70379-42df-4df1-96cf-80e300968bd9","resolution":{"observed_at":"2026-08-03T03:18:41.128554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:41.182925Z","title":"Reverse cur- riculum generation for reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:41.182925Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:7ce613efa3081b67c56bf9ea364782d541c08ba61c510ca989ee07478e338e05","observation_id":"1710f86c-1cef-413e-af9e-743cc411e77d","resolution":{"observed_at":"2026-08-03T03:18:41.182925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:41.241596Z","title":"A mini- malist approach to offline reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:41.241596Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:fbb94865bd72c836b0f9eab66346344f9f62b1f2d7b8b0eff3b8d20b8ef799d9","observation_id":"4c89126a-fed1-403d-b17b-86c02b785592","resolution":{"observed_at":"2026-08-03T03:18:41.241596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:41.308550Z","title":"Addressing function approximation error in actor- critic methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:41.308550Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:e1f41b06bdc27c2be0035268c7f3c8e2cf87ac55c9e75960bb4d70ce4342b53e","observation_id":"f1b6f8b0-a930-487f-9b2b-12a429152eef","resolution":{"observed_at":"2026-08-03T03:18:41.308550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:41.406600Z","title":"For sale: State-action representation learning for deep reinforcement learning.Advances in neural information processing systems, 36:61573–61624, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:41.406600Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:ef5b48c973d8faba637b0683c5e3270d3e8564e5d64d6e5bf42536dba1c47eda","observation_id":"17333686-f503-4f84-94e3-3adf917ffa2a","resolution":{"observed_at":"2026-08-03T03:18:41.406600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:41.454298Z","title":"Goal-conditioned on-policy reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:41.454298Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:66eef6b1479bad6348f3482378ee08e2805399df6e509bcbed144810a3a04da8","observation_id":"7c78450a-397a-4d42-9f27-14a11cce383f","resolution":{"observed_at":"2026-08-03T03:18:41.454298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:41.536480Z","title":"Rosati Papini, Patrick M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:41.536480Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:f0d4ad3147dd8cf0aa9c2ec92bca533345c90412d1831ebc5d92ea56098fb53f","observation_id":"5595e818-1a2f-4e3e-888d-15de75507ab3","resolution":{"observed_at":"2026-08-03T03:18:41.536480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:41.582037Z","title":"Hopkins, Georg Wiedebach, Jared Bishop, Steven Pickles, David M ¨uller, and Moritz B ¨acher","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:41.582037Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:1738b84d1b969c7f60f62b57ae058e51679e628e352781336eb9de1625c3b88b","observation_id":"6c0cfc75-03bc-423f-8874-4307bbfcd60a","resolution":{"observed_at":"2026-08-03T03:18:41.582037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:41.641014Z","title":"Relay policy learning: Solving long-horizon tasks via imitation 9 and reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:41.641014Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:59276290c4ce3a1496b86d8b6853f97bb27c80dc8f1be9fdecd293fabd1e559c","observation_id":"94958bf7-0d87-4884-9555-ba89a3a63f56","resolution":{"observed_at":"2026-08-03T03:18:41.641014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:41.684555Z","title":"Com- pletely derandomized self-adaptation in evolution strategies.Evolutionary computation, 9(2):159–195, 2001","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:41.684555Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:8e049e5f37659e6648fc91add89835400d6882d0c514a456c375e85f0541880e","observation_id":"686709a8-a2dd-49f8-980a-6aff9f8b3769","resolution":{"observed_at":"2026-08-03T03:18:41.684555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:41.759263Z","title":"Adaptive curriculum generation from demon- strations for sim-to-real visuomotor control","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:41.759263Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:031988260e8c7d0e8cdfe048e61614637406d407c410aa7763dd163e3fcd5773","observation_id":"8e96e5d1-1881-4c09-bf9f-4d7c9d25a6e8","resolution":{"observed_at":"2026-08-03T03:18:41.759263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:41.854316Z","title":"Imitation bootstrapped reinforcement learn- ing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:41.854316Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:acb49a51bc58c7f0b5a290af7bb92422a956e2a5e2bc03508a5b1b085116d1b8","observation_id":"728ce637-c309-4b5c-8bff-67e6ef070395","resolution":{"observed_at":"2026-08-03T03:18:41.854316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:41.956297Z","title":"MRHER: model-based relay hindsight experience replay for sequential object manipulation tasks with sparse rewards","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:41.956297Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:a2526a5b87004d5fea8d98d1e6bcc09ad783dc26c1b5706422aeae75d2a1abe4","observation_id":"33707ae8-1d4d-40fe-8621-96ddfdea4268","resolution":{"observed_at":"2026-08-03T03:18:41.956297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.14759","last_updated":"2025-11-19T04:34:49Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-18T18:58:55Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.14759","snapshot_observed_at":"2026-08-03T03:18:42.039197Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:42.039197Z"},"links":{"cited_paper":"/paper/2511.14759","citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:b48628196ba8e47ba4b5b50fe1b75073e0697c60b5f0843cf70a0464eb2f2cb6","observation_id":"5399d154-392f-4eac-9870-fa665a2caff4","resolution":{"observed_at":"2026-08-03T03:18:42.039197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:42.076353Z","title":"SEIL: Simulation-augmented Equivariant Imitation Learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:42.076353Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:6b2278b91ae9ebdcbf1cb993bdf83cf54c437f74ed57a600f95737cdcb28e078","observation_id":"4d20cb4d-a467-42ce-ba69-623f086e7026","resolution":{"observed_at":"2026-08-03T03:18:42.076353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:42.180138Z","title":"Reinforcement learning from imperfect demon- strations under soft expert guidance","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:42.180138Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:8877b8dffd32041dab1274de44f34aabcd601998070e9bd1a539a9641cebd045","observation_id":"04e2b77d-3975-48b9-9ac1-8b0d25681ae2","resolution":{"observed_at":"2026-08-03T03:18:42.180138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:42.306462Z","title":"An Introduction to Zero-Order Optimization Techniques for Robotics","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:42.306462Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:75070b9214d839c192a6630ba4858e0127fce0f770f49b736f97d4174b5a1637","observation_id":"eadb4438-bd95-400c-9f20-78815afb413b","resolution":{"observed_at":"2026-08-03T03:18:42.306462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:42.486208Z","title":"Grasping with chopsticks: Combating covariate shift in model-free imitation learning for fine ma- nipulation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:42.486208Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:54ceaca4fc2d96f6aab8920159fb8e4ae108fb298e0b63813fa06ba4dd73d363","observation_id":"4cc63ff3-eba0-4b79-9195-a5b20d03e085","resolution":{"observed_at":"2026-08-03T03:18:42.486208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12972","last_updated":"2024-06-03T21:37:15Z","snapshot_observed_at":"2026-07-06T16:35:48.413898Z","submitted_at":"2023-10-19T17:59:03Z","title":"CCIL: Continuity-based Data Augmentation for Corrective Imitation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12972","snapshot_observed_at":"2026-08-03T03:18:42.641224Z","title":"CCIL: Continuity-based Data Augmentation for Correc- tive Imitation Learning.arXiv:2310.12972, June 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:42.641224Z"},"links":{"cited_paper":"/paper/2310.12972","citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:9275342c4393a0f42abe073d8a71655ae1d552445bf6f6fc212bfc37af5a6349","observation_id":"8a8f1ca8-9c55-422b-9214-e9a3ef1746d9","resolution":{"observed_at":"2026-08-03T03:18:42.641224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:42.733557Z","title":"Prehensile manipulation planning: Modeling, algorithms and implementation.IEEE Transactions on Robotics, 38 (4):2370–2388, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:42.733557Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:82f231d0be99b657a801874ba55caf3233f98a67c5d36ed8159dcd8a6b1b71b3","observation_id":"393fe058-23e8-443f-be5f-2d834d94b650","resolution":{"observed_at":"2026-08-03T03:18:42.733557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:42.854352Z","title":"LaValle.Planning Algorithms","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:42.854352Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:76f6503438e83593d6ca6ce9fc4299993e28fb773e4bf77736c9f9f0e12d2827","observation_id":"967d1248-c825-40aa-a5ae-3c598343bde9","resolution":{"observed_at":"2026-08-03T03:18:42.854352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:43.015708Z","title":"Leveraging randomized smoothing for optimal control of nonsmooth dynamical systems.Nonlinear Analysis: Hybrid Systems, 52:101468, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:43.015708Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:3f0a6f305603a864952d0fa9b4acbfcc5c361f35385e3daed1641b968381a730","observation_id":"c2d5c605-85bc-4c4a-9dac-e6d62e0538b8","resolution":{"observed_at":"2026-08-03T03:18:43.015708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00948","last_updated":"2019-09-03T21:05:21Z","snapshot_observed_at":"2026-08-06T00:36:08.175723Z","submitted_at":"2017-12-04T08:18:08Z","title":"Learning Multi-Level Hierarchies with Hindsight","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.00948","snapshot_observed_at":"2026-08-03T03:18:43.091575Z","title":"Hier- archical actor-critic.arXiv:1712.00948, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:43.091575Z"},"links":{"cited_paper":"/paper/1712.00948","citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:b670db4839d6a5658b5bd465ba96e51f3bef634fe2a7d3b2ec2416b61f908dbb","observation_id":"5e35741b-8585-4856-96b7-a9ebb544b128","resolution":{"observed_at":"2026-08-03T03:18:43.091575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01521","last_updated":"2024-11-06T14:52:28Z","snapshot_observed_at":"2026-08-03T17:25:51.986888Z","submitted_at":"2024-11-03T10:47:39Z","title":"Diversity Progress for Goal Selection in Discriminability-Motivated RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01521","snapshot_observed_at":"2026-08-03T03:18:43.137497Z","title":"Diversity progress for goal selection in discriminability-motivated RL.arXiv:2411.01521, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:43.137497Z"},"links":{"cited_paper":"/paper/2411.01521","citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:e414a5438421d82386e398a1add76d2ba3a0e36d83c0183305301e161461e9fa","observation_id":"92117946-ab01-4571-9eb4-6d650de3df14","resolution":{"observed_at":"2026-08-03T03:18:43.137497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:43.235037Z","title":"Opt2skill: Imi- tating dynamically-feasible whole-body trajectories for versatile humanoid loco-manipulation.IEEE Robotics and Automation Letters, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:43.235037Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:085f45e7626197886417f49f98ce765e76b16bdf80f1f950d6064e2f0db11fc3","observation_id":"b9365b04-1e10-45c2-b593-8f08d08621fd","resolution":{"observed_at":"2026-08-03T03:18:43.235037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:43.334351Z","title":"Learn goal-conditioned policy with intrinsic motivation for deep reinforcement learn- ing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:43.334351Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:29d0e9593c8205b0a7c1664f2bc27b3784416e56d30dccf1315439f0fb6a37ae","observation_id":"637b6f5f-cc41-4723-871b-1056ee1704ea","resolution":{"observed_at":"2026-08-03T03:18:43.334351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:43.412356Z","title":"A simple motion-planning algorithm for general robot manipulators.IEEE Journal on Robotics and Automation, 3(3):224–238, 2003","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:43.412356Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:bd99cfa5f0f52580c3959335d39c9da55c58e8900d8f33a182b2eaafbea75894","observation_id":"94bb907f-f133-47cb-82c3-123359e34b53","resolution":{"observed_at":"2026-08-03T03:18:43.412356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:43.513196Z","title":"Crocoddyl: An efficient and versatile framework for multi-contact optimal control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:43.513196Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:fdff41fea009749c47faab73bd211d34bc4be4cf322b0bda9ca30bbd884b6f55","observation_id":"4a56b452-3a57-4d72-8451-f492c2f28916","resolution":{"observed_at":"2026-08-03T03:18:43.513196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:43.567841Z","title":"Discovery of complex behaviors through contact-invariant optimization.ACM Transactions on Graphics (ToG), 31(4):1–8, 2012","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:43.567841Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:01765bed080722292dec110511b6b2f024c54ff9655878b527ef6ce1150334c5","observation_id":"25fd7c43-c00a-4e41-9f68-03bc08d462ee","resolution":{"observed_at":"2026-08-03T03:18:43.567841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:43.644522Z","title":"Data-efficient hierarchical reinforce- ment learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:43.644522Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:014a976a9ae0bccd354295bd497bd50287ea427626de909f8f0808b35193b466","observation_id":"46a9d70e-cab1-4fbb-ae47-762cf9c9a4b9","resolution":{"observed_at":"2026-08-03T03:18:43.644522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:43.721053Z","title":"Visual rein- forcement learning with imagined goals","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:43.721053Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:6ed7b78e4c8226c0bc8a80f938c74603edb31322895f68081f669669f210a928","observation_id":"80d062c6-0d99-4778-a510-c19360bbdee0","resolution":{"observed_at":"2026-08-03T03:18:43.721053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:43.804347Z","title":"Deep exploration via bootstrapped DQN.Advances in neural information processing systems, 29, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:43.804347Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:5fb6515e6bc59d449784d060f43f54b5f857503813c9944735d4838f746381d5","observation_id":"bc0baf5d-532c-4ac4-9572-71aa39e25154","resolution":{"observed_at":"2026-08-03T03:18:43.804347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:43.868995Z","title":"Deep black-box reinforcement learning with movement primitives","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:43.868995Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:a763f6991a51c635c7369a48ababb3cc268b94c668fcc27c1fea53173419b456","observation_id":"1959e961-7c8b-4779-9b5a-9c0f6f534144","resolution":{"observed_at":"2026-08-03T03:18:43.868995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:43.986784Z","title":"Learning from trajectories via subgoal discovery.Advances in Neural Information Processing Systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:43.986784Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:cdbe99c84bbcc1e267b4be72ab236b2f642a15df691eb1e8acb3f4528168d521","observation_id":"7aeaa312-056c-4fd9-9775-3a0ec292c050","resolution":{"observed_at":"2026-08-03T03:18:43.986784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:44.058986Z","title":"Deepmimic: Example- guided deep reinforcement learning of physics- based character skills.ACM Transactions On Graphics (TOG), 37(4):1–14, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:44.058986Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:984b998a15793f6a546a1950d91873b0b54ca881ad3b05ba27ea8985d5098316","observation_id":"fc03dd7c-d556-4940-8c4c-55f49da96e0a","resolution":{"observed_at":"2026-08-03T03:18:44.058986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:44.172977Z","title":"Amp: Adversarial motion priors for stylized physics-based character control","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:44.172977Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:04d46cfa02cca3a3a8c372397a4df8d0a92a840d4c7009a5e71cd883c78bbe73","observation_id":"c072c2b3-1ae4-4ad7-bf46-e21e5da79b58","resolution":{"observed_at":"2026-08-03T03:18:44.172977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:44.243624Z","title":"A direct method for trajectory optimization of rigid bodies through contact.The International Journal of Robotics Research, 33(1):69–81, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:44.243624Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:9080f586ce9b7a1fa8bab9a0103c32af58cd8e535dfd07f1148346018743595a","observation_id":"7267bc19-edfa-40cb-9961-d359c2b32dd3","resolution":{"observed_at":"2026-08-03T03:18:44.243624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:44.355935Z","title":"Universal value function approxima- tors","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:44.355935Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:b47f0ff4a6cbfb48fda931b6299590c2ae6bd6ad19ef81cde69cc671bc45aeb6","observation_id":"a5b8611f-2b81-4a67-810a-5bdcf99c5de6","resolution":{"observed_at":"2026-08-03T03:18:44.355935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:44.432152Z","title":"Manipulation planning with probabilistic roadmaps.The International Journal of Robotics Research, 23(7-8):729–746, 2004","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:44.432152Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:23f7ac4812c6a5860388a267a0244147c736b22375e87175b22a9b7e1d26eac2","observation_id":"ce434447-877d-453f-bac6-65438f199747","resolution":{"observed_at":"2026-08-03T03:18:44.432152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:44.493433Z","title":"Hybrid RL: Using both offline and online data can make RL efficient","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:44.493433Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:45074e604cfbbd8fe2f0b963dcf846636e1d64e761f67ea23944c2c477f53d0d","observation_id":"6838d084-bdd8-4a31-b5ee-a8a6659b98c3","resolution":{"observed_at":"2026-08-03T03:18:44.493433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:44.603041Z","title":"Bundled gradients through contact via randomized smoothing.IEEE Robotics and Automation Letters, 7 (2):4000–4007, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:44.603041Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:4469d9d9e5c9fd2015a71675043d5245c7ce8bcef56afeb7e9cb6cb1a28a7067","observation_id":"362c1aab-8d26-4066-af5d-f5d9eb89411a","resolution":{"observed_at":"2026-08-03T03:18:44.603041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:44.706472Z","title":"Synthesis and stabilization of complex behaviors through online trajectory optimization","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:44.706472Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:a7841ae0be830dd113d844033c79013267f858cd18b714224565d5c8a87bb769","observation_id":"6ee97c2a-b3f9-4bb6-b078-26e58014264b","resolution":{"observed_at":"2026-08-03T03:18:44.706472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:44.790839Z","title":"Mu- joco: A physics engine for model-based control","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:44.790839Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:0d88e2d53e482f52b746c12faef6f2491cf0874ae8527bc2e2be899750da97cd","observation_id":"392dacd3-a116-4234-a1b4-6f34dbec5488","resolution":{"observed_at":"2026-08-03T03:18:44.790839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:44.862435Z","title":"De- scribing physics for physical reasoning: Force-based sequential manipulation planning.IEEE Robotics and Automation Letters, 5(4):6209–6216, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:44.862435Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:a6813cbb9539c05d48fee051a6c95e642b0300f056981434ff31e8fe6989e3b9","observation_id":"a3cb649d-21ab-4002-bfe1-671502173463","resolution":{"observed_at":"2026-08-03T03:18:44.862435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:44.933637Z","title":"Keeping your distance: Solving sparse reward tasks using self-balancing shaped rewards.Advances in Neural Information Processing Systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:44.933637Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:9ac0db1acab075f27aa039f9984b4f066f240c2b7fc469a54e57ecfa63687f2f","observation_id":"ea14798e-6026-478a-afa8-ac5535aa7077","resolution":{"observed_at":"2026-08-03T03:18:44.933637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:45.048452Z","title":"Jump-start reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:45.048452Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:60dd6f06c2ed9d08a9facbb3336a656c7d4933b2018915b30b8c5bca5d192704","observation_id":"d6b0321c-bb3c-4555-8804-7a28c25f61de","resolution":{"observed_at":"2026-08-03T03:18:45.048452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-09T14:56:41.112679Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05477","snapshot_observed_at":"2026-08-03T03:18:45.143694Z","title":"Epistemically-guided forward-backward exploration.arxiv:2507.05477, July 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:45.143694Z"},"links":{"cited_paper":"/paper/2507.05477","citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:34a65782807a5568c3214a678cb8485b760ffea261e5055ae12e14c6eb7cec71","observation_id":"c699018c-5239-4955-9582-2b8d5e5957f6","resolution":{"observed_at":"2026-08-03T03:18:45.143694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:45.227500Z","title":"Kinodynamic motion planning for a team of multirotors transporting a cable-suspended payload in cluttered environ- ments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:45.227500Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:273fa260b5c6d5f22b3bb33fc4a5f2ae780f627ff36ce6b47da83ec90048505a","observation_id":"2eb2bcfe-641d-48c4-8478-e5378ecf1f1a","resolution":{"observed_at":"2026-08-03T03:18:45.227500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:45.337677Z","title":"Numerical optimization.Springer Science, 35(67-68):7, 1999","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:45.337677Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:84c282f3493cea942852875d01ba13354ebab288ad2cd0b393e5e4b6273bfcc3","observation_id":"6de2c14a-cfd9-45b7-87cf-64b0adadafe2","resolution":{"observed_at":"2026-08-03T03:18:45.337677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:18:45.404752Z","title":"Uni- versal manipulation policy network for articulated objects.IEEE robotics and automation letters, 7(2): 2447–2454, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:45.404752Z"},"links":{"citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:a6f071da6f24368cf7e84e9d0291e60ace196415426cc1e51bd2b57e15105bb1","observation_id":"a4fe5061-727e-4a7f-a392-e50c572f0b22","resolution":{"observed_at":"2026-08-03T03:18:45.404752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":62,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 1 inbound Pith citation observation for arXiv:2602.08557."}