{"as_of":"2026-08-10T05:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:425304333c2b547b3860e9c934dd2eacd1041c639c855daedcae21d851cc2253","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:31:07.893666Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.02712/citation-record","integrity":"/paper/2507.02712/integrity","json":"/paper/2507.02712/citation-record.json","paper":"/paper/2507.02712"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:08.749441Z","title":"G., Martinez-Canabal, A., Restivo, L., Yiu, A","venue":null,"work_id":"3b12b78c-1a24-491f-a3db-59d6548a2a34","year":2014},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.722212Z"},"links":{"citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:9231fb7ecc5447834f5b599e1692ed5c29a74e2d454d0acac68946b669ec330f","observation_id":"7aff1d63-812c-4418-abc2-8d8de1be267e","resolution":{"observed_at":"2026-08-06T20:31:08.752935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:08.739144Z","title":null,"venue":null,"work_id":"08597fda-50fc-4f0c-90b6-cd9911ad8e3c","year":2017},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.725971Z"},"links":{"citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:533e144f8213d4a6fbb198a5d850a5cb03a30299dc397e0ab35197b7d8749504","observation_id":"14692d07-0f6c-49d5-a1e6-f00270608c45","resolution":{"observed_at":"2026-08-06T20:31:08.742771Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.01495","last_updated":"2018-02-23T10:04:20Z","snapshot_observed_at":"2026-08-05T02:06:43.683268Z","submitted_at":"2017-07-05T17:55:53Z","title":"Hindsight Experience Replay","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.01495","snapshot_observed_at":"2026-08-06T20:31:07.729165Z","title":"Hindsight experience replay, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.729165Z"},"links":{"cited_paper":"/paper/1707.01495","citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:d3cefee544f83c3c5a584728d1ae173ce945d341d5c6bac218c00f94caf8e48f","observation_id":"076d37ad-e04c-42d6-84eb-381e891b9d0e","resolution":{"observed_at":"2026-08-06T20:31:07.729165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.01151","last_updated":"2022-01-03T22:38:41Z","snapshot_observed_at":"2026-08-09T12:23:00.915557Z","submitted_at":"2021-06-02T13:41:02Z","title":"Towards Deeper Deep Reinforcement Learning with Spectral Normalization","version":4},"cited_work":{"arxiv_id":"2106.01151","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.01151","snapshot_observed_at":"2026-08-06T20:31:08.554777Z","title":"Towards Deeper Deep Reinforcement Learning with Spectral Normalization","venue":"cs.LG","work_id":"f5633008-b607-4dd3-be02-d59afbd301da","year":2021},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.732795Z"},"links":{"cited_paper":"/paper/2106.01151","citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:8dde0b10ad62c59e7b321ea19cc563f951246a16357b4229685554923f3a248c","observation_id":"83eafc08-8570-48de-af84-d8c83a37784d","resolution":{"observed_at":"2026-08-06T20:31:08.559364Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.05982","last_updated":"2021-03-18T03:42:07Z","snapshot_observed_at":"2026-07-06T10:32:46.366651Z","submitted_at":"2021-01-15T06:25:58Z","title":"Randomized Ensembled Double Q-Learning: Learning Fast Without a Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.05982","snapshot_observed_at":"2026-08-06T20:31:07.736250Z","title":"Randomized ensembled double q-learning: Learning fast without a model, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.736250Z"},"links":{"cited_paper":"/paper/2101.05982","citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:ef55906c48f2c201b69db1fe9bb491441e27ed5c556839b059ee37f5208f5c54","observation_id":"a1146ce5-7daf-4a84-a69c-1cb359dba087","resolution":{"observed_at":"2026-08-06T20:31:07.736250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.12001","last_updated":"2020-10-22T19:32:21Z","snapshot_observed_at":"2026-08-05T02:32:41.345268Z","submitted_at":"2020-10-22T19:32:21Z","title":"Reinforcement Learning with Combinatorial Actions: An Application to Vehicle Routing","version":1},"cited_work":{"arxiv_id":"2010.12001","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.12001","snapshot_observed_at":"2026-08-06T20:31:08.523336Z","title":"Reinforcement Learning with Combinatorial Actions: An Application to Vehicle Routing","venue":"cs.LG","work_id":"b13015f3-1d2a-4f3f-9abe-a6bd7f12723f","year":2020},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.739657Z"},"links":{"cited_paper":"/paper/2010.12001","citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:e174c0f5c4439a60dd9ff85858a07b9aa9e712907b2c7d54d065aa604644c900","observation_id":"99ca0aa0-a4d3-42e7-b55f-718c6b1edc7f","resolution":{"observed_at":"2026-08-06T20:31:08.527278Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:08.728550Z","title":"G., and Courville, A","venue":null,"work_id":"2cb9f5aa-8ff8-4944-9bc0-aa2eaee76b96","year":2022},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.743173Z"},"links":{"citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:fb1b47cc771ccf224af378d7b784bdbae6970c75d2e5951c8d25c67c1f5d70f4","observation_id":"87541af9-5a2f-49b7-b6b7-f11c5d8562f6","resolution":{"observed_at":"2026-08-06T20:31:08.731769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:08.718601Z","title":"Revisiting fundamentals of experience replay","venue":null,"work_id":"ed9c35a9-9d37-49a8-b87c-26fa8f145894","year":2020},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.746379Z"},"links":{"citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:4eb69eb5fddeeb8bd3f17cbd1f4defaf0c702dd2d97d096e2eeb2094b7228503","observation_id":"6be13383-186a-45cb-a57a-3a43ca0e5d28","resolution":{"observed_at":"2026-08-06T20:31:08.721805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:07.752348Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.752348Z"},"links":{"citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:52b8e4eabcc9f3be5b9d89948f0f05e310169053322abbc67361b152375929df","observation_id":"05813f0f-6324-4cd3-a5c3-ea08cd96f953","resolution":{"observed_at":"2026-08-06T20:31:07.752348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-08-09T23:42:27.348266Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-08-06T20:31:07.755855Z","title":"Off-policy deep reinforcement learning without exploration, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.755855Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:be2a13c2157097e253c363495389da75792f097a69b3e498f877e0faf3ceafe3","observation_id":"a01e27ca-ae96-4cf7-8ea7-ad628b92dfc6","resolution":{"observed_at":"2026-08-06T20:31:07.755855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01290","last_updated":"2018-08-08T21:27:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-01-04T09:50:50Z","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.01290","snapshot_observed_at":"2026-08-06T20:31:07.759082Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.759082Z"},"links":{"cited_paper":"/paper/1801.01290","citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:94542e411fc020ed6595b211842472e13606caee20cec5c6a4f0f9e6f262d8e9","observation_id":"7a438761-5c34-46cc-ab07-baf253aa120c","resolution":{"observed_at":"2026-08-06T20:31:07.759082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-08-06T20:31:07.762140Z","title":"Mastering diverse domains through world models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.762140Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:6fad7fbbfddfd5ff98e79b43f199bd33e7686e9384c708375f283dcafa33eb62","observation_id":"f8a51ae0-cfbb-42c8-8313-ccb38a545b0f","resolution":{"observed_at":"2026-08-06T20:31:07.762140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.04021","last_updated":"2021-03-17T11:36:47Z","snapshot_observed_at":"2026-07-06T10:12:38.348940Z","submitted_at":"2020-11-08T16:55:16Z","title":"On the role of planning in model-based deep reinforcement learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.04021","snapshot_observed_at":"2026-08-06T20:31:07.765568Z","title":"B., Friesen, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.765568Z"},"links":{"cited_paper":"/paper/2011.04021","citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:a070019c8e28f6f37bd076fecc00292ab9102a1931c2475dad2eec2a961fb18e","observation_id":"b235f8dc-118b-4247-878d-df8dc60994be","resolution":{"observed_at":"2026-08-06T20:31:07.765568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16828","last_updated":"2024-03-21T17:56:19Z","snapshot_observed_at":"2026-07-31T05:32:29.431480Z","submitted_at":"2023-10-25T17:57:07Z","title":"TD-MPC2: Scalable, Robust World Models for Continuous Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16828","snapshot_observed_at":"2026-08-06T20:31:07.768698Z","title":"Td-mpc2: Scalable, robust world models for continuous control, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.768698Z"},"links":{"cited_paper":"/paper/2310.16828","citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:717b2cad7291d0ca89f77bb114466a7a3303171fb7859b2f8195845159551239","observation_id":"0b92d735-cce7-4368-bea6-8f53734a18e5","resolution":{"observed_at":"2026-08-06T20:31:07.768698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-08-06T20:31:07.771743Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.771743Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:59b52c1c3e829a126cfb0428cd267a1846667e61b5bb8f03ae4a1dd15d1e5317","observation_id":"7644f8c5-a2b8-4ba6-b0bb-8d0aab9341c1","resolution":{"observed_at":"2026-08-06T20:31:07.771743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:08.701231Z","title":null,"venue":null,"work_id":"5a27aa7e-067a-46b0-8614-e09bc86b98f7","year":2012},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.774885Z"},"links":{"citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:90c6e3d2fe610a4997b2801ef1537a2472541b70fc291c1ea8e6d7c8457d4b79","observation_id":"ca392238-6909-4c9c-b9fb-c250139f0bcd","resolution":{"observed_at":"2026-08-06T20:31:08.704544Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15144","last_updated":"2023-04-17T18:45:23Z","snapshot_observed_at":"2026-07-06T14:23:47.116494Z","submitted_at":"2022-11-28T08:56:42Z","title":"Offline Q-Learning on Diverse Multi-Task Data Both Scales And Generalizes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15144","snapshot_observed_at":"2026-08-06T20:31:07.778134Z","title":"Offline q-learning on diverse multi-task data both scales and generalizes, 2023 a","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.778134Z"},"links":{"cited_paper":"/paper/2211.15144","citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:a69a790f38b037aff310b8acc31384f7ef5b30fc2aa273b64abe8814e82bb259","observation_id":"d83cb6d7-1eef-42bd-996c-db7aca6e49d4","resolution":{"observed_at":"2026-08-06T20:31:07.778134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11958","last_updated":"2024-10-24T23:03:41Z","snapshot_observed_at":"2026-08-06T18:45:31.583176Z","submitted_at":"2023-08-23T06:57:05Z","title":"Maintaining Plasticity in Continual Learning via Regenerative Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11958","snapshot_observed_at":"2026-08-06T20:31:07.781548Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.781548Z"},"links":{"cited_paper":"/paper/2308.11958","citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:0355069c04d176a100848e804e02028e6ed994fe2466e60061c1941faaee4013","observation_id":"e7cfef08-df5d-406c-a6cb-6f94a450dca7","resolution":{"observed_at":"2026-08-06T20:31:07.781548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06487","last_updated":"2021-08-07T18:51:37Z","snapshot_observed_at":"2026-08-08T20:16:19.069312Z","submitted_at":"2020-02-16T02:02:23Z","title":"Maxmin Q-learning: Controlling the Estimation Bias of Q-learning","version":2},"cited_work":{"arxiv_id":"2002.06487","doi":null,"metadata_source":"pith","pith_arxiv_id":"2002.06487","snapshot_observed_at":"2026-08-06T20:31:08.422311Z","title":"Maxmin Q-learning: Controlling the Estimation Bias of Q-learning","venue":"cs.LG","work_id":"e9a2d593-0325-43a0-92f9-5be66b9c652e","year":2020},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.784730Z"},"links":{"cited_paper":"/paper/2002.06487","citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:10cd078924b0897604546d9596588f2006ba0c1d7e0216315f7f9aa4ec38bc14","observation_id":"d088f7c7-5f19-4ea5-a0b3-35d00bd2887e","resolution":{"observed_at":"2026-08-06T20:31:08.425853Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:07.788341Z","title":"Crafting papers on machine learning","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.788341Z"},"links":{"citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:29954b19739c2f80699f571b07c5e70ef3dabe63473b2d122953eb8eb3e0fbc1","observation_id":"60bae0e6-b729-41ab-8dbe-315c98a2bd88","resolution":{"observed_at":"2026-08-06T20:31:07.788341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09754","last_updated":"2025-05-29T15:02:38Z","snapshot_observed_at":"2026-08-10T03:59:03.902801Z","submitted_at":"2024-10-13T07:20:53Z","title":"SimBa: Simplicity Bias for Scaling Up Parameters in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09754","snapshot_observed_at":"2026-08-06T20:31:07.791190Z","title":"J., Subramanian, K., Wurman, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.791190Z"},"links":{"cited_paper":"/paper/2410.09754","citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:f757a8ff55dae77d782e9c545ccb14c9dd93836460a77a65e60c54d8aed865f5","observation_id":"f4fbd433-1d8f-41b2-8366-2add8b07afcf","resolution":{"observed_at":"2026-08-06T20:31:07.791190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15241","last_updated":"2022-10-15T07:31:27Z","snapshot_observed_at":"2026-07-06T13:15:32.315247Z","submitted_at":"2022-05-30T16:55:38Z","title":"Multi-Game Decision Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15241","snapshot_observed_at":"2026-08-06T20:31:07.794565Z","title":"Multi-game decision transformers, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.794565Z"},"links":{"cited_paper":"/paper/2205.15241","citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:843c7ba6a4ad2926775036bd5e2c742c536b39eb787f0e90995dc852478d98bc","observation_id":"509a2ea9-5c56-428c-9e8e-d5fa44404ded","resolution":{"observed_at":"2026-08-06T20:31:07.794565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10466","last_updated":"2023-04-20T17:11:05Z","snapshot_observed_at":"2026-07-06T15:18:03.563300Z","submitted_at":"2023-04-20T17:11:05Z","title":"Efficient Deep Reinforcement Learning Requires Regulating Overfitting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10466","snapshot_observed_at":"2026-08-06T20:31:07.797950Z","title":"Efficient deep reinforcement learning requires regulating overfitting, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.797950Z"},"links":{"cited_paper":"/paper/2304.10466","citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:5cec4f06a39838c72a9e025f519765b3f3307008419f132f4d03ef0d3b9a3acf","observation_id":"06716c5a-e090-4980-9555-a23967eca3b6","resolution":{"observed_at":"2026-08-06T20:31:07.797950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:08.683279Z","title":"Self-improving reactive agents based on reinforcement learning, planning and teaching","venue":null,"work_id":"2246f633-bd0d-487e-a255-5a9340d64016","year":1992},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.801068Z"},"links":{"citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:e75d3f51eea62bb4c84aa0457fbefdff18614422500b707f3c260b10a1ae4729","observation_id":"c26ec12c-de27-401b-a85f-ce66137a5902","resolution":{"observed_at":"2026-08-06T20:31:08.686847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07994","last_updated":"2025-06-02T12:04:04Z","snapshot_observed_at":"2026-07-06T19:31:13.821669Z","submitted_at":"2024-10-10T14:51:14Z","title":"Neuroplastic Expansion in Deep Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07994","snapshot_observed_at":"2026-08-06T20:31:07.804229Z","title":"Neuroplastic expansion in deep reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.804229Z"},"links":{"cited_paper":"/paper/2410.07994","citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:d1bbdbcb51163bffb4a895ec59896ca62b1e927c9e4acfd1fec9198eb8e02358","observation_id":"0d32c5df-e889-44bd-8c6f-7f0abf8b5fbc","resolution":{"observed_at":"2026-08-06T20:31:07.804229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18520","last_updated":"2024-05-28T18:38:46Z","snapshot_observed_at":"2026-07-06T18:21:35.476139Z","submitted_at":"2024-05-28T18:38:46Z","title":"Offline-Boosted Actor-Critic: Adaptively Blending Optimal Historical Behaviors in Deep Off-Policy RL","version":1},"cited_work":{"arxiv_id":"2405.18520","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.18520","snapshot_observed_at":"2026-08-06T20:31:08.366551Z","title":"Offline-Boosted Actor-Critic: Adaptively Blending Optimal Historical Behaviors in Deep Off-Policy RL","venue":"cs.LG","work_id":"06f44be3-8118-4030-8c25-47d79cda6dc3","year":2024},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.807373Z"},"links":{"cited_paper":"/paper/2405.18520","citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:28d48f2ebb6d7280b558f3b79439885c4997dcd8f130de8cdc490522feef7f05","observation_id":"68e96471-c61d-43a5-bcce-8d2ef2b968b1","resolution":{"observed_at":"2026-08-06T20:31:08.369997Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18443","last_updated":"2023-05-29T03:25:22Z","snapshot_observed_at":"2026-07-06T15:34:59.457879Z","submitted_at":"2023-05-29T03:25:22Z","title":"Off-Policy RL Algorithms Can be Sample-Efficient for Continuous Control via Sample Multiple Reuse","version":1},"cited_work":{"arxiv_id":"2305.18443","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.18443","snapshot_observed_at":"2026-08-06T20:31:08.352916Z","title":"Off-Policy RL Algorithms Can be Sample-Efficient for Continuous Control via Sample Multiple Reuse","venue":"cs.LG","work_id":"f5c2fdc6-8bb9-4a98-8cc0-9bb0605f356a","year":2023},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.811010Z"},"links":{"cited_paper":"/paper/2305.18443","citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:fc763c6b76319701822a599eb9afb7ca31989f2d2c55df96c63943c5f570af4a","observation_id":"21ad5a78-4195-4b9f-81e7-a00887f5abe9","resolution":{"observed_at":"2026-08-06T20:31:08.356162Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:08.672515Z","title":"Revisiting plasticity in visual reinforcement learning: Data","venue":null,"work_id":"738047f1-5247-4871-a876-0a050762d44c","year":2023},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.814435Z"},"links":{"citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:227abd45d1b2e55635e9857cd795591f2078617f4027536af8cc0caf55190728","observation_id":"e10a8a42-796e-4cff-8630-84e19176cb1e","resolution":{"observed_at":"2026-08-06T20:31:08.676422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:08.662229Z","title":"Learning better with less: effective augmentation for sample-efficient visual reinforcement learning","venue":null,"work_id":"8ee1a413-e3fa-4076-b111-129c3e7bc1da","year":2024},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.817406Z"},"links":{"citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:30f2ca8bc412bd07af66873f68954da62d40505faf5507dba5dc48716d9a6df3","observation_id":"49ae2da8-2275-4f2f-87f6-c2ee1728b98b","resolution":{"observed_at":"2026-08-06T20:31:08.665608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:07.820592Z","title":"A., Veness, J., Bellemare, M","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.820592Z"},"links":{"citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:6cb323e36aa148fc4e4982c27ae037d144231fea4506720b322a8b074530c3d7","observation_id":"ee022c66-5efd-4700-ab41-d07e51ad42f9","resolution":{"observed_at":"2026-08-06T20:31:07.820592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.03765","last_updated":"2022-04-06T12:03:06Z","snapshot_observed_at":"2026-08-09T15:48:18.869153Z","submitted_at":"2021-02-07T10:28:09Z","title":"Tactical Optimism and Pessimism for Deep Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.03765","snapshot_observed_at":"2026-08-06T20:31:07.823397Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.823397Z"},"links":{"cited_paper":"/paper/2102.03765","citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:f8a19f4e987ee3ea7a1af66ad19ea23f22fc99ed0effb5f820ec2ddce86edef0","observation_id":"5c2c47d7-9055-4489-9486-cf68f70856f4","resolution":{"observed_at":"2026-08-06T20:31:07.823397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:08.643341Z","title":"Safe and efficient off-policy reinforcement learning","venue":null,"work_id":"b83eaff4-e981-4863-950f-e188eef225ef","year":2016},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.826499Z"},"links":{"citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:8cf853d3f1aa3a844620ad39dcf918f39ecc41b21482dbffcb1ba9fe7cc5d842","observation_id":"17b91c07-a928-4fb7-8da3-3047956666e2","resolution":{"observed_at":"2026-08-06T20:31:08.646868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00514","last_updated":"2024-06-19T11:32:01Z","snapshot_observed_at":"2026-07-06T17:38:04.972649Z","submitted_at":"2024-03-01T13:25:10Z","title":"Overestimation, Overfitting, and Plasticity in Actor-Critic: the Bitter Lesson of Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00514","snapshot_observed_at":"2026-08-06T20:31:07.829896Z","title":"Overestimation, overfitting, and plasticity in actor-critic: the bitter lesson of reinforcement learning, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.829896Z"},"links":{"cited_paper":"/paper/2403.00514","citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:6a127889a1eed9e8f1dcb49373278c3d1205166bb442f2817f592e861a231513","observation_id":"e48555d3-1a4f-4afc-9fb0-98007b4db202","resolution":{"observed_at":"2026-08-06T20:31:07.829896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16158","last_updated":"2024-12-03T08:42:49Z","snapshot_observed_at":"2026-08-07T12:11:17.938787Z","submitted_at":"2024-05-25T09:53:25Z","title":"Bigger, Regularized, Optimistic: scaling for compute and sample-efficient continuous control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16158","snapshot_observed_at":"2026-08-06T20:31:07.833263Z","title":"Bigger, regularized, optimistic: scaling for compute and sample-efficient continuous control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.833263Z"},"links":{"cited_paper":"/paper/2405.16158","citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:96e6e78c050eb3e02842bff83459c2cdd6cd5ebab4344bf158639f8847bf7608","observation_id":"06aacba1-9960-461d-af50-c9385de58593","resolution":{"observed_at":"2026-08-06T20:31:07.833263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:08.632924Z","title":"The primacy bias in deep reinforcement learning","venue":null,"work_id":"a1b43e17-cf0e-453b-b445-4b55f967cdc2","year":2022},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.836474Z"},"links":{"citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:0bf005982c8e85b9b20303dfd85178a3ce5c566226463007ccbdabe660bf53ac","observation_id":"f7ec94b5-f792-475f-8695-a22c52df0d42","resolution":{"observed_at":"2026-08-06T20:31:08.636343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:08.622756Z","title":"The primacy bias in deep reinforcement learning","venue":null,"work_id":"8d138303-88df-4130-a73c-29e0f6673300","year":2022},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.839510Z"},"links":{"citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:0935f01d88ca88341c8f7467cbfb4ff5f8a77b6ceaa5d5dc931757816188266b","observation_id":"de80d9de-0e39-4ad9-ad13-2bf944c18a31","resolution":{"observed_at":"2026-08-06T20:31:08.626016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15555","last_updated":"2023-10-03T21:51:58Z","snapshot_observed_at":"2026-07-06T15:32:58.159006Z","submitted_at":"2023-05-24T20:41:35Z","title":"Deep Reinforcement Learning with Plasticity Injection","version":2},"cited_work":{"arxiv_id":"2305.15555","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.15555","snapshot_observed_at":"2026-08-06T20:31:08.199803Z","title":"Deep Reinforcement Learning with Plasticity Injection","venue":"cs.LG","work_id":"5a020442-141a-43d1-a76b-56f2c8b99cf6","year":2023},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.842475Z"},"links":{"cited_paper":"/paper/2305.15555","citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:3bbd31c622c44ccc1194b0b36f4ec0d47fe6f5b24c4156549f9e22bdd4dc29f4","observation_id":"cace0f27-cf37-4aed-8e64-ca26e1e72b3b","resolution":{"observed_at":"2026-08-06T20:31:08.203321Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:08.612665Z","title":"F., Maximo, M","venue":null,"work_id":"94151ed7-b86d-419e-9652-a015d5d144b5","year":2023},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.845517Z"},"links":{"citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:5c928da09c17ca3868664333fdaec0bafd06df01f0dc086f38c854cfd54d81df","observation_id":"af5cebe9-6f5d-4b4f-9a91-c9485cf6dc85","resolution":{"observed_at":"2026-08-06T20:31:08.615876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15017","last_updated":"2024-08-18T12:35:55Z","snapshot_observed_at":"2026-08-03T10:46:31.514009Z","submitted_at":"2023-10-23T15:12:20Z","title":"Mind the Model, Not the Agent: The Primacy Bias in Model-based RL","version":3},"cited_work":{"arxiv_id":"2310.15017","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.15017","snapshot_observed_at":"2026-08-06T20:31:08.184659Z","title":"Mind the Model, Not the Agent: The Primacy Bias in Model-based RL","venue":"cs.LG","work_id":"510978f9-36f5-4f78-93cb-dd7566570ec1","year":2023},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.848472Z"},"links":{"cited_paper":"/paper/2310.15017","citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:3ac759add109d976246582d1fca7443d87c0a3eee6cc23575f9ac802d1dd50e5","observation_id":"d21eff04-0311-410b-b076-d73df4cfcf2b","resolution":{"observed_at":"2026-08-06T20:31:08.189091Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05952","last_updated":"2016-02-25T17:55:31Z","snapshot_observed_at":"2026-07-06T04:37:00.543211Z","submitted_at":"2015-11-18T20:54:44Z","title":"Prioritized Experience Replay","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05952","snapshot_observed_at":"2026-08-06T20:31:07.851773Z","title":"Prioritized experience replay, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.851773Z"},"links":{"cited_paper":"/paper/1511.05952","citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:2fa6a65818225facfe09ca1e708e98020aea63cd184217ecd4cfe404d3ef963e","observation_id":"00063d9b-4edb-4755-a226-0234e1737fcb","resolution":{"observed_at":"2026-08-06T20:31:07.851773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19452","last_updated":"2023-11-13T17:57:19Z","snapshot_observed_at":"2026-07-06T15:35:41.522547Z","submitted_at":"2023-05-30T23:23:25Z","title":"Bigger, Better, Faster: Human-level Atari with human-level efficiency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19452","snapshot_observed_at":"2026-08-06T20:31:07.855211Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.855211Z"},"links":{"cited_paper":"/paper/2305.19452","citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:eb756bb2406e303b161d59a47bd2db1e5a4ad5586a0d827f0e17d65ab5f88c16","observation_id":"32c85167-3414-4d21-9124-6089bf9e1e07","resolution":{"observed_at":"2026-08-06T20:31:07.855211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10506","last_updated":"2024-06-18T18:11:07Z","snapshot_observed_at":"2026-08-04T05:16:12.953751Z","submitted_at":"2024-03-15T17:45:44Z","title":"HumanoidBench: Simulated Humanoid Benchmark for Whole-Body Locomotion and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10506","snapshot_observed_at":"2026-08-06T20:31:07.858169Z","title":"Humanoidbench: Simulated humanoid benchmark for whole-body locomotion and manipulation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.858169Z"},"links":{"cited_paper":"/paper/2403.10506","citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:7d0bec795d79a304c70cda54c55f28989c63cbf8e480d0df0adf959917769a8b","observation_id":"1b531b16-792b-455e-815a-2354069bbe5a","resolution":{"observed_at":"2026-08-06T20:31:07.858169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.09163","last_updated":"2020-11-27T20:22:38Z","snapshot_observed_at":"2026-07-06T10:05:35.400002Z","submitted_at":"2020-10-19T01:27:07Z","title":"D2RL: Deep Dense Architectures in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.09163","snapshot_observed_at":"2026-08-06T20:31:07.861099Z","title":"D2rl: Deep dense architectures in reinforcement learning","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.861099Z"},"links":{"cited_paper":"/paper/2010.09163","citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:0010d150c5ecf1c8c9068abfd1beaaf3470690f244339655605a7271fa548fa0","observation_id":"3fef00f0-d673-41eb-86b8-904c818345a2","resolution":{"observed_at":"2026-08-06T20:31:07.861099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:07.864194Z","title":"S., and Evci, U","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.864194Z"},"links":{"citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:38b60efecfda04f71fac939c7957b0128eb0afb4950f56842e412c85398385de","observation_id":"4e135d2c-82fc-4882-9e82-6d8b96c4b333","resolution":{"observed_at":"2026-08-06T20:31:07.864194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:07.867001Z","title":"Model-based off-policy deep reinforcement learning with model-embedding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.867001Z"},"links":{"citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:4a9137c95e91f040b55e63a194bb23e8e9936af0f6fc15c278abb8b76b6a25af","observation_id":"f04a19ad-6483-4bac-a13d-214ccc1c524b","resolution":{"observed_at":"2026-08-06T20:31:07.867001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-06T20:31:07.869907Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.869907Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:97314626ab8e4f74955393d39dd50f40470321de9bf0ac71f2498bf897ed328c","observation_id":"a3b7639b-7c2d-4fb1-9739-cf884d6fc7b2","resolution":{"observed_at":"2026-08-06T20:31:07.869907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:07.873149Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.873149Z"},"links":{"citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:28ec39af9eaa4792bec414efe2cb06b269fc35b7f7e789e46c96edee1de6dcdf","observation_id":"5cdb96e0-727c-4c76-a696-61ebe68dd034","resolution":{"observed_at":"2026-08-06T20:31:07.873149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02648","last_updated":"2018-12-06T16:36:20Z","snapshot_observed_at":"2026-07-06T07:19:38.028327Z","submitted_at":"2018-12-06T16:36:20Z","title":"Deep Reinforcement Learning and the Deadly Triad","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02648","snapshot_observed_at":"2026-08-06T20:31:07.875903Z","title":"Deep reinforcement learning and the deadly triad, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.875903Z"},"links":{"cited_paper":"/paper/1812.02648","citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:70343b309e24b9ed7058610ee9a03daa2fcd811e8b32c6684073b8132c75b87f","observation_id":"36c73bf8-76c9-416b-a0de-3420f9133fa1","resolution":{"observed_at":"2026-08-06T20:31:07.875903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19668","last_updated":"2024-02-14T03:56:25Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T15:50:56Z","title":"DrM: Mastering Visual Reinforcement Learning through Dormant Ratio Minimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19668","snapshot_observed_at":"2026-08-06T20:31:07.879014Z","title":"Drm: Mastering visual reinforcement learning through dormant ratio minimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.879014Z"},"links":{"cited_paper":"/paper/2310.19668","citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:252c9ba35331526a3fc81104fd36ccd72a58217f5c7fb0a73a9d53944d443a0d","observation_id":"3de77387-dce0-45db-97f7-38563c7bb890","resolution":{"observed_at":"2026-08-06T20:31:07.879014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:07.882225Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.882225Z"},"links":{"citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:e5821e3add8114a26bd0e33688485bae992f62cc7e25bd1b8acffbbd22b5d965","observation_id":"aec07206-9c07-44b4-a215-54ef911545a2","resolution":{"observed_at":"2026-08-06T20:31:07.882225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09030","last_updated":"2024-06-13T12:03:40Z","snapshot_observed_at":"2026-08-08T23:38:10.299386Z","submitted_at":"2024-06-13T12:03:40Z","title":"CUER: Corrected Uniform Experience Replay for Off-Policy Continuous Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"2406.09030","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.09030","snapshot_observed_at":"2026-08-06T20:31:07.935311Z","title":"CUER: Corrected Uniform Experience Replay for Off-Policy Continuous Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"24be7277-91ce-4f71-b561-0287f0932a0f","year":2024},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.885065Z"},"links":{"cited_paper":"/paper/2406.09030","citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:b3bc798c34faef83f8e0c7198acdfce9b86e2c9b74d15d1ec5b8ef4419217fdc","observation_id":"d999a541-9b98-4a60-b247-3d673b20e49e","resolution":{"observed_at":"2026-08-06T20:31:07.940764Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:07.888111Z","title":"Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.888111Z"},"links":{"citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:e5e7c5df2b2acecd2fddcd19f3076225a47220b91965721345086ac6eee0560d","observation_id":"09a809a3-306b-43d0-a0ad-40d4b16a8723","resolution":{"observed_at":"2026-08-06T20:31:07.888111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01275","last_updated":"2018-04-30T04:24:26Z","snapshot_observed_at":"2026-08-03T12:09:42.690927Z","submitted_at":"2017-12-04T06:03:26Z","title":"A Deeper Look at Experience Replay","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01275","snapshot_observed_at":"2026-08-06T20:31:07.890842Z","title":"and Sutton, R","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.890842Z"},"links":{"cited_paper":"/paper/1712.01275","citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:ebad38953761a9577906a15566be0d9161d077409748a27090d8f00324731044","observation_id":"9d297b55-e8b9-4877-bdd8-16220fb3e746","resolution":{"observed_at":"2026-08-06T20:31:07.890842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:07.893666Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.893666Z"},"links":{"citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:0fcae6b9da83f01899a5eb420c9047827d580db69c57873b9af6f53c126fb192","observation_id":"f0155f89-63b6-4af6-9489-8b181178e5bb","resolution":{"observed_at":"2026-08-06T20:31:07.893666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T11:19:20.263180Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":36,"verified_exact":7,"verified_fuzzy":10},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2507.02712."}