{"as_of":"2026-08-17T23:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f58c7f1d1b0319278574acefac46136224d8c76f4bb8bc17a05aa700e127f627","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:31:05.142660Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.07086/citation-record","integrity":"/paper/2608.07086/integrity","json":"/paper/2608.07086/citation-record.json","paper":"/paper/2608.07086"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.825882Z","title":"Deep reinforcement learning at the edge of the statistical precipice.Advances in Neural Information Processing Systems, 2021","venue":null,"work_id":"211031da-aaad-4250-9d65-5532c82a8000","year":2021},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-17T18:07:22.435738Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.001933Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:89630a71054f400a5774750b9b666fc32b7bb42e656bfff42c4ee2880f1ee90e","observation_id":"7b645c31-9859-436c-b7ad-91e7c44f0365","resolution":{"observed_at":"2026-08-15T14:31:05.830406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.006890Z","title":"PyTorch 2: Faster Machine Learning Through Dynamic Python Bytecode Transformation and Graph Compilation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-17T18:07:22.435738Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.006890Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:540b764679e7d2902eb0a56fd45d99bf35c9d443f00188e27d6d7f944129bc0b","observation_id":"a71db8cf-97de-4be7-8d0a-4350e0effaef","resolution":{"observed_at":"2026-08-15T14:31:05.006890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1206.5538","last_updated":"2014-04-23T11:48:51Z","snapshot_observed_at":"2026-08-15T00:55:35.699171Z","submitted_at":"2012-06-24T20:51:38Z","title":"Representation Learning: A Review and New Perspectives","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1206.5538","snapshot_observed_at":"2026-08-15T14:31:05.010898Z","title":"Representation learning: A review and new perspectives, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-17T18:07:22.435738Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.010898Z"},"links":{"cited_paper":"/paper/1206.5538","citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:cb12329052bd5c0214b2d79d5e66227e5adefa8c310b91c6be35585a2359c158","observation_id":"5cc07015-ee2e-4b2d-b84d-dbc3a1c4fab9","resolution":{"observed_at":"2026-08-15T14:31:05.010898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.812880Z","title":"Revisitingrainbow: Promotingmoreinsightful andinclusivedeepreinforcementlearningresearch","venue":null,"work_id":"46006dd1-c5e9-432b-9618-61f1773dfeb3","year":2021},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-17T18:07:22.435738Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.016231Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:a234d1efe799f86e3e05d8e24bf928b7bb66f7b5868857b91d999ff661b0ff0e","observation_id":"f7c176e3-440d-42da-b1f1-e688d0d61fc8","resolution":{"observed_at":"2026-08-15T14:31:05.817149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.799665Z","title":"Beyond the rainbow: High perfor- mance deep reinforcement learning on a desktop PC","venue":null,"work_id":"c95f53af-ca7a-4c06-a112-7904c006202e","year":2025},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-17T18:07:22.435738Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.020565Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:132386c7e1bf3c92d1471666f41dec0c02c63edf394d9feb96ffcb275093764e","observation_id":"55b224c6-c5f6-490a-9dc5-48842f814911","resolution":{"observed_at":"2026-08-15T14:31:05.803930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.06700","last_updated":"2020-07-13T21:22:17Z","snapshot_observed_at":"2026-08-17T14:46:34.237683Z","submitted_at":"2020-07-13T21:22:17Z","title":"Revisiting Fundamentals of Experience Replay","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.06700","snapshot_observed_at":"2026-08-15T14:31:05.024537Z","title":"Revisiting fundamentals of experience replay, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-17T18:07:22.435738Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.024537Z"},"links":{"cited_paper":"/paper/2007.06700","citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:c7b54443c2f1189307d64ebd5f77650483ab86030a406cf193cd97f8af13561a","observation_id":"a2d0ff16-9a26-45c0-82a9-88788c052046","resolution":{"observed_at":"2026-08-15T14:31:05.024537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.786931Z","title":"An equivalence between loss functions and non-uniform sampling in experience replay.Advances in Neural Information Processing Systems, 33,","venue":null,"work_id":"cb3118e3-daf3-47db-837f-cc3053404558","year":null},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-17T18:07:22.435738Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.029479Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:9f31cdf333a91abe8f962fa92ce796fa084681fdec05e7710c91c808c33ade53","observation_id":"18f84dbe-49c6-41ac-a648-658a38c48b85","resolution":{"observed_at":"2026-08-15T14:31:05.791033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.774202Z","title":"Smith, Shixiang Shane Gu, Doina Precup, and David Meger","venue":null,"work_id":"108fdc79-cce2-4d21-8321-91b09532e580","year":2023},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-17T18:07:22.435738Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.033872Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:578d9033464a34f340925ccdd59e1a3a1c3da10c17282de82c7c8ff32a1e5dbf","observation_id":"ba8afdf8-a6dd-497e-b95a-3865bba1c3a7","resolution":{"observed_at":"2026-08-15T14:31:05.778291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.760530Z","title":"Towards general- purpose model-free reinforcement learning","venue":null,"work_id":"5e176e40-8321-4662-a617-e4dda8433ecd","year":2025},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-17T18:07:22.435738Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.037718Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:1d2dd04b0d12296451b7e226443f443c1ff9c6ec063c28de28dd524371b1355d","observation_id":"114a4593-5437-4a6a-b95c-95c297cbd53c","resolution":{"observed_at":"2026-08-15T14:31:05.764984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.747243Z","title":null,"venue":null,"work_id":"15d5a74b-2819-4b19-9701-9ea155fe90b2","year":2023},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-17T18:07:22.435738Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.042750Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:3463947806f60f7eb7f455a99a0d7bb4196cc67d9c3401c1b556b5ce8f566b9c","observation_id":"198838a9-a1ee-4b99-b3f1-36f25938948d","resolution":{"observed_at":"2026-08-15T14:31:05.751431Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.046493Z","title":"World models","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-17T18:07:22.435738Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.046493Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:3ba59c8d4f4c4becdf0a69d555e435658d14931a60b4c6e0dbc4333234e672eb","observation_id":"b0424f19-834a-4528-ad26-79e415c6cc07","resolution":{"observed_at":"2026-08-15T14:31:05.046493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.734318Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"5d28b57e-52f7-428c-ac7c-4b33e90090fd","year":2018},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-17T18:07:22.435738Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.050311Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:4774af981043ed733ff7ee06d7a57f08dbf05fd47435715b53a54022020ac63d","observation_id":"6f7029ca-cfb7-4d49-8b67-7b6183bc9427","resolution":{"observed_at":"2026-08-15T14:31:05.738365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.721312Z","title":"Dream to control: Learning behaviors by latent imagination","venue":null,"work_id":"b79cb6d9-f70c-4610-9d0e-07617f5a2617","year":2020},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-17T18:07:22.435738Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.054111Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:a654163b87af3cb6af0526a2ff5c9f0ee493d037ee686a9bd8ec9201abba8178","observation_id":"b9b0687c-193a-4f11-acb9-2980ee440fc7","resolution":{"observed_at":"2026-08-15T14:31:05.725965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.708356Z","title":"Td-mpc2: Scalable,robustworldmodelsforcontinuous control","venue":null,"work_id":"14dd74da-781f-4c41-9f90-e0d2e61d0fb3","year":2024},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-17T18:07:22.435738Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.057874Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:a6cd7ab588576c23efcb9c519d7b71ae5b9f07a9191db94cbf268e5f187a92dc","observation_id":"4a5a9464-f724-4d99-b55e-565db405084a","resolution":{"observed_at":"2026-08-15T14:31:05.712833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.694890Z","title":"Rainbow: Combining improvements in deep reinforcement learning","venue":null,"work_id":"daeb678e-9e3e-49a4-bac0-1681e5114196","year":null},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-17T18:07:22.435738Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.062036Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:0ce5992a9c7fe373c01cb957acb2ae5cee1a795de576352f2d001dae16926ea7","observation_id":"75521aa7-6adf-44cc-a9fc-4f6f63778aea","resolution":{"observed_at":"2026-08-15T14:31:05.699017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04832","last_updated":"2026-04-18T13:11:19Z","snapshot_observed_at":"2026-08-07T20:09:01.472991Z","submitted_at":"2024-11-07T16:13:54Z","title":"Plasticity Loss in Deep Reinforcement Learning: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04832","snapshot_observed_at":"2026-08-15T14:31:05.065783Z","title":"Plasticity loss in deep reinforcement learning: A survey, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-17T18:07:22.435738Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.065783Z"},"links":{"cited_paper":"/paper/2411.04832","citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:4a8f17943156dcc44a5832a73a98499ceb37911d764880774f2c7f5af4453f63","observation_id":"5edb7225-8d95-4cf5-93a0-1e30b94bf0a9","resolution":{"observed_at":"2026-08-15T14:31:05.065783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.682276Z","title":"Mastering massive multi-task reinforcement learning via mixture-of-expert decision transformer","venue":null,"work_id":"170830ff-b015-4f7d-aada-b8408c38352b","year":2025},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-17T18:07:22.435738Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.069668Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:233f7e41a94a64233ddeee7123b2082a62996547cf10cf0af7b76d60493ca020","observation_id":"9dabe8db-d422-4f46-a02e-93d1151f35b2","resolution":{"observed_at":"2026-08-15T14:31:05.686469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.655926Z","title":"QPO: Query-dependent prompt optimization via multi-loop offline reinforcement learning.Transactions on Machine Learning Research, 2025","venue":null,"work_id":"abf50021-3392-48dc-98dd-fc025b73aedd","year":2025},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-17T18:07:22.435738Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.078419Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:eff87efe0cfdef2f4b7cb73a9065221c13f477df539d2a7ec9adf3b4cb057355","observation_id":"53a4a274-5cb8-4031-b1bf-7753a63c9128","resolution":{"observed_at":"2026-08-15T14:31:05.660678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.643302Z","title":"Large batch experience replay, 2021","venue":null,"work_id":"c193379a-fff5-4e45-91cd-4e82049d2a29","year":2021},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-17T18:07:22.435738Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.082448Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:cab3c95e46e46327c25f6310206493169d1fefa4b2a3442325e39e18aac962bf","observation_id":"319fb73b-2c66-47d1-b57c-ff3b3b2d30a4","resolution":{"observed_at":"2026-08-15T14:31:05.647586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.629793Z","title":"Wurman, Jaegul Choo, Peter Stone, and Takuma Seno","venue":null,"work_id":"6a712207-5159-4f52-a2ff-9598de533bda","year":2025},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-17T18:07:22.435738Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.085958Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:b71ba613780afd17af8b89a4d90110fac5e01b267cc111d41600c2487ef2ca77","observation_id":"cdcacc60-feda-444a-834f-e39b00bab801","resolution":{"observed_at":"2026-08-15T14:31:05.634494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.616194Z","title":"Hyperspherical normalization for scalable deep reinforcement learning","venue":null,"work_id":"8b90670f-e115-45d4-adcb-49b02da1e267","year":2025},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-17T18:07:22.435738Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.089803Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:12614a8a80ed7f759401d582d207d5f61673d4a1abd73e28aae410b10a3687f2","observation_id":"1c377562-335d-4156-a0eb-9dc78448d871","resolution":{"observed_at":"2026-08-15T14:31:05.620487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.12096","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.381602Z","title":"Rethinking the role of dynamic sparse training for scalable deep reinforcement learning, 2025","venue":null,"work_id":"eb51def4-e43b-4f12-83db-e656c540eb6c","year":2025},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-17T18:07:22.435738Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.093033Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:45402cb7da3e74c6da7adf967f6fd0884fd1851bd080e76358dd6cd19588dfb8","observation_id":"4b4e2654-1194-4ec2-9809-600e16731e56","resolution":{"observed_at":"2026-08-15T14:31:05.388872Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.602888Z","title":"Mahankali, Zhang-Wei Hong, Ayush Sekhari, Alexander Rakhlin, and Pulkit Agrawal","venue":null,"work_id":"8d677c78-724b-4614-9e6a-ae685b0db499","year":2024},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-17T18:07:22.435738Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.097064Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:fac81ff63bb7a757a81483fe7d82ed27f11a627b02b49d0a7b14a05ff1894a3b","observation_id":"0b3d14d8-c749-46db-8cfd-92fab8f3f293","resolution":{"observed_at":"2026-08-15T14:31:05.607191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16158","last_updated":"2024-12-03T08:42:49Z","snapshot_observed_at":"2026-08-16T13:49:30.634028Z","submitted_at":"2024-05-25T09:53:25Z","title":"Bigger, Regularized, Optimistic: scaling for compute and sample-efficient continuous control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16158","snapshot_observed_at":"2026-08-15T14:31:05.100698Z","title":"Bigger, regularized, optimistic: scaling for compute and sample-efficient continuous control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-17T18:07:22.435738Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.100698Z"},"links":{"cited_paper":"/paper/2405.16158","citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:f93367693cebb45ffcb835f4b5ef6e6bef5f3b51493e2cc3b833d6ef4f677498","observation_id":"214917d2-f8fb-4d65-8fea-3b5a87a08529","resolution":{"observed_at":"2026-08-15T14:31:05.100698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.589633Z","title":"The primacy bias in deep reinforcement learning","venue":null,"work_id":"2cc775c8-6dc1-49e6-9231-a353007892ab","year":2022},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-17T18:07:22.435738Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.104762Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:3c84d384793de14bf60d4cf748e25d80a3996879b575cae32eff893f799b71df","observation_id":"2569f3ca-d3d4-4a04-a81e-6035a01de763","resolution":{"observed_at":"2026-08-15T14:31:05.593965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05952","last_updated":"2016-02-25T17:55:31Z","snapshot_observed_at":"2026-08-15T17:33:32.559096Z","submitted_at":"2015-11-18T20:54:44Z","title":"Prioritized Experience Replay","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05952","snapshot_observed_at":"2026-08-15T14:31:05.109114Z","title":"Prioritized experience replay.arXiv preprint arXiv:1511.05952, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-17T18:07:22.435738Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.109114Z"},"links":{"cited_paper":"/paper/1511.05952","citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:92670b986cf9e15cdf4ab0ab90b56b65cc3ea86c10893f853cb2eeef9082c8df","observation_id":"69a707fb-f985-4874-927a-b6bb18f8cca8","resolution":{"observed_at":"2026-08-15T14:31:05.109114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10506","last_updated":"2024-06-18T18:11:07Z","snapshot_observed_at":"2026-08-16T14:09:21.685692Z","submitted_at":"2024-03-15T17:45:44Z","title":"HumanoidBench: Simulated Humanoid Benchmark for Whole-Body Locomotion and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10506","snapshot_observed_at":"2026-08-15T14:31:05.113954Z","title":"Humanoid- bench: Simulated humanoid benchmark for whole-body locomotion and manipulation.arXiv Preprint arxiv:2403.10506, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-17T18:07:22.435738Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.113954Z"},"links":{"cited_paper":"/paper/2403.10506","citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:316daa7270911199104debd6f60539c81b77b4714757fb46a13336d747d9f9e4","observation_id":"8baa9996-7acb-4b10-893b-254deb7763dd","resolution":{"observed_at":"2026-08-15T14:31:05.113954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.04136","last_updated":"2020-09-21T15:34:30Z","snapshot_observed_at":"2026-08-14T23:15:23.495239Z","submitted_at":"2020-04-08T17:40:43Z","title":"CURL: Contrastive Unsupervised Representations for Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.04136","snapshot_observed_at":"2026-08-15T14:31:05.118443Z","title":"Curl: Contrastive unsupervised representations for reinforcement learning, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-17T18:07:22.435738Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.118443Z"},"links":{"cited_paper":"/paper/2004.04136","citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:39535889d82e75c5274ea084dfe72a92e1579b50e4cd627297f5a0b32b329175","observation_id":"06849875-f7d8-46b1-a0aa-5e34fec23a11","resolution":{"observed_at":"2026-08-15T14:31:05.118443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10483","last_updated":"2023-11-01T15:06:08Z","snapshot_observed_at":"2026-08-16T16:37:38.344888Z","submitted_at":"2022-08-22T17:55:43Z","title":"Prioritizing Samples in Reinforcement Learning with Reducible Loss","version":3},"cited_work":{"arxiv_id":"2208.10483","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.10483","snapshot_observed_at":"2026-08-15T14:31:05.222447Z","title":"Prioritizing Samples in Reinforcement Learning with Reducible Loss","venue":"cs.LG","work_id":"0bbf41f2-e479-4084-9951-9dde783383ed","year":2022},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-17T18:07:22.435738Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.123358Z"},"links":{"cited_paper":"/paper/2208.10483","citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:5e8b84d9bbb490b82019241efdff194f7500869f217e1ae95e4f5a5a31aedfb6","observation_id":"06d296aa-09b2-4fc3-aa9d-c15e9bbee99f","resolution":{"observed_at":"2026-08-15T14:31:05.229660Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.576822Z","title":"MaxinfoRL: Boosting exploration in reinforcement learning through information gain maximization","venue":null,"work_id":"123ff4c8-e446-44f0-b3d5-2e45a0ec9616","year":2025},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-17T18:07:22.435738Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.128069Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:1e72ea43cd299bddb0d8dea4a5dd55e1cc3f57cee52794a6e6b41a6c08ae7ca8","observation_id":"1f82b7ca-3752-4d2f-b1cd-af5539c2c183","resolution":{"observed_at":"2026-08-15T14:31:05.580941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-15T14:31:05.133424Z","title":"Deepmind control suite.arXiv preprint arXiv:1801.00690, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-17T18:07:22.435738Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.133424Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:9327667ce4564e9c75c6d58581e48b75573b1fc059f4b313abfd031b953b1381","observation_id":"9976e6e9-1ab3-4df9-a4b3-ea6db16b9e2e","resolution":{"observed_at":"2026-08-15T14:31:05.133424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.13600","last_updated":"2022-05-26T20:11:23Z","snapshot_observed_at":"2026-08-16T16:57:22.239854Z","submitted_at":"2022-05-26T20:11:23Z","title":"MyoSuite -- A contact-rich simulation suite for musculoskeletal motor control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.13600","snapshot_observed_at":"2026-08-15T14:31:05.138058Z","title":"Myosuite – a contact-rich simulation suite for musculoskeletal motor control.https://github","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-17T18:07:22.435738Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.138058Z"},"links":{"cited_paper":"/paper/2205.13600","citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:870b2f4c1213dd2ab25f9b9d932905f9ce308c44e5dad880310c3df87398c72f","observation_id":"5fe39764-39e3-424f-b0ed-7278b0939307","resolution":{"observed_at":"2026-08-15T14:31:05.138058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.564728Z","title":"Towards sample efficient reinforcement learning","venue":null,"work_id":"a3e27ccd-c50d-4be2-ae78-3a7bfc10488d","year":2018},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-17T18:07:22.435738Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.142660Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:5b47a2b25251c089f48ea89f32bb34e41b52230732b4028f679abac23eff6161","observation_id":"4c5b25b3-c1e9-4c35-9c75-c2b123dd9bd7","resolution":{"observed_at":"2026-08-15T14:31:05.568934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.669641Z","title":null,"venue":null,"work_id":"f8c91fdb-0d45-4578-9354-a6fe2fee34fe","year":null},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-17T18:07:22.435738Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.073893Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:b7aa526b7e9c687ea8adc6e51efafac5315511b205881b3dc327c054d6c20d94","observation_id":"b2c3eb7a-f0ca-48c1-a217-f1132a55ecc6","resolution":{"observed_at":"2026-08-15T14:31:05.673659Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T18:07:22.435738Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":2,"verified_fuzzy":19},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2608.07086."}