{"as_of":"2026-08-17T16:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9efaea397f6153ddd4f085409bef6a557347b26bec46b305830ad0dcbf266445","coverage":[{"denominator":209,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T08:27:03.376909Z","state":"measured"},{"denominator":111,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":111,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T14:00:57.517509Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T19:30:07.939680Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21872","snapshot_observed_at":"2026-08-05T20:31:47.521445Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10399","last_updated":"2025-08-14T06:56:16Z","snapshot_observed_at":"2026-08-15T15:38:07.042671Z","submitted_at":"2025-08-14T06:56:16Z","title":"Large Model Empowered Embodied AI: A Survey on Decision-Making and Embodied Learning","version":1},"reference_index":139,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:47.521445Z"},"links":{"cited_paper":"/paper/2506.21872","citing_paper":"/paper/2508.10399"},"observation_digest":"sha256:57f93c386a8a074ae0a8e2eacd8329bfe48daa347e4494c4208e7a6c18a544b8","observation_id":"94af6eae-201b-430b-b6fe-6754917d7091","resolution":{"observed_at":"2026-08-05T20:31:47.521445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.21872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.21872","snapshot_observed_at":"2026-07-04T19:30:07.939680Z","title":"A Survey of Continual Reinforcement Learning","venue":"cs.LG","work_id":"53e5266a-78db-4c8c-aad6-269446580cfc","year":2025},"citing_paper":{"arxiv_id":"2604.22199","last_updated":"2026-04-24T04:09:42Z","snapshot_observed_at":"2026-08-15T13:38:56.226839Z","submitted_at":"2026-04-24T04:09:42Z","title":"An LLM-Driven Closed-Loop Autonomous Learning Framework for Robots Facing Uncovered Tasks in Open Environments","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T11:27:34.992950Z"},"links":{"cited_paper":"/paper/2506.21872","citing_paper":"/paper/2604.22199"},"observation_digest":"sha256:1bbc78e674ddbb31cb4eed8457d3062c510d8264c37cc5061cd91de01d3d219b","observation_id":"2412ae16-5e9a-40b5-b564-7a85281ef93e","resolution":{"observed_at":"2026-05-11T19:36:14.650855Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.21872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.21872","snapshot_observed_at":"2026-07-04T19:30:07.939680Z","title":"A Survey of Continual Reinforcement Learning","venue":"cs.LG","work_id":"53e5266a-78db-4c8c-aad6-269446580cfc","year":2025},"citing_paper":{"arxiv_id":"2606.00143","last_updated":"2026-05-29T02:24:45Z","snapshot_observed_at":"2026-08-13T03:57:55.017107Z","submitted_at":"2026-05-29T02:24:45Z","title":"Regime-Adaptive Continual Learning for Portfolio Management","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T20:30:20.156082Z"},"links":{"cited_paper":"/paper/2506.21872","citing_paper":"/paper/2606.00143"},"observation_digest":"sha256:959f1a5a2af97026aeae3a87a54360dbcbfc64f2f607ec27052a4d5a84c27138","observation_id":"47743675-6bcd-41d1-8d14-00ae3593e0dd","resolution":{"observed_at":"2026-06-28T20:32:37.261070Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.21872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.21872","snapshot_observed_at":"2026-07-04T19:30:07.939680Z","title":"A Survey of Continual Reinforcement Learning","venue":"cs.LG","work_id":"53e5266a-78db-4c8c-aad6-269446580cfc","year":2025},"citing_paper":{"arxiv_id":"2606.03382","last_updated":"2026-06-04T22:09:00Z","snapshot_observed_at":"2026-08-02T02:33:38.414458Z","submitted_at":"2026-06-02T09:26:26Z","title":"Local Guidance, Global Impact: Gaussian-Reshaped Trust Region Unlocks Behavior Transitions","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-28T10:51:30.546134Z"},"links":{"cited_paper":"/paper/2506.21872","citing_paper":"/paper/2606.03382"},"observation_digest":"sha256:a4d611cfe13268b5a72551189a236c4b39bd2063e045eda0cfc62a2a50500c7c","observation_id":"da285bb5-9a5b-4138-8aa5-fcc1d3441142","resolution":{"observed_at":"2026-07-02T02:36:26.590082Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21872","snapshot_observed_at":"2026-07-12T15:01:54.826833Z","title":"A survey of continual reinforcement learning.arXiv preprint arXiv:2506.21872, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06379","last_updated":"2026-07-09T05:21:29Z","snapshot_observed_at":"2026-08-07T12:33:45.469282Z","submitted_at":"2026-06-04T16:47:33Z","title":"EasyLens: A Training-Free Plug-and-Play Subtle-Lesion Representation Amplifier for Medical Vision-Language Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-12T15:01:54.826833Z"},"links":{"cited_paper":"/paper/2506.21872","citing_paper":"/paper/2606.06379"},"observation_digest":"sha256:6d67cac38db600e32e2d7190026c0e9874ec73af2203bca57d99c5bc92ec4a04","observation_id":"c20592d6-2b33-455d-a84e-ee351c363d1c","resolution":{"observed_at":"2026-07-12T15:01:54.826833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.21872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.21872","snapshot_observed_at":"2026-07-04T19:30:07.939680Z","title":"A Survey of Continual Reinforcement Learning","venue":"cs.LG","work_id":"53e5266a-78db-4c8c-aad6-269446580cfc","year":2025},"citing_paper":{"arxiv_id":"2606.06380","last_updated":"2026-06-04T16:47:41Z","snapshot_observed_at":"2026-08-13T05:52:47.627229Z","submitted_at":"2026-06-04T16:47:41Z","title":"Emergent Language as an Approach to Conscious AI","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-28T01:28:54.111496Z"},"links":{"cited_paper":"/paper/2506.21872","citing_paper":"/paper/2606.06380"},"observation_digest":"sha256:64a2f2bd58d64c7ff5e2ef99f5604cc44c1a30d3775b70a943dd75abb0fe921a","observation_id":"ef9c21df-094f-4543-b88d-c1505b9bcc70","resolution":{"observed_at":"2026-07-02T13:16:58.586054Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.21872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.21872","snapshot_observed_at":"2026-07-04T19:30:07.939680Z","title":"A Survey of Continual Reinforcement Learning","venue":"cs.LG","work_id":"53e5266a-78db-4c8c-aad6-269446580cfc","year":2025},"citing_paper":{"arxiv_id":"2606.08102","last_updated":"2026-06-10T11:06:40Z","snapshot_observed_at":"2026-08-15T15:35:30.036266Z","submitted_at":"2026-06-06T11:07:13Z","title":"Continual Quadruped Robots Coordination via Semantic Skill Discovery","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T19:37:53.168569Z"},"links":{"cited_paper":"/paper/2506.21872","citing_paper":"/paper/2606.08102"},"observation_digest":"sha256:3b96aafa53cf023ae23c4da43121af1ea62a7e71152d7e3dcb9a6ae1b2873d57","observation_id":"533b93a4-5150-45aa-9c08-05701e58881d","resolution":{"observed_at":"2026-07-02T21:37:25.181442Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.21872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.21872","snapshot_observed_at":"2026-07-04T19:30:07.939680Z","title":"A Survey of Continual Reinforcement Learning","venue":"cs.LG","work_id":"53e5266a-78db-4c8c-aad6-269446580cfc","year":2025},"citing_paper":{"arxiv_id":"2606.25389","last_updated":"2026-06-24T04:40:21Z","snapshot_observed_at":"2026-08-03T02:20:03.390753Z","submitted_at":"2026-06-24T04:40:21Z","title":"Offline Multi-agent Continual Cooperation via Skill Partition and Reuse","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-25T21:14:31.778575Z"},"links":{"cited_paper":"/paper/2506.21872","citing_paper":"/paper/2606.25389"},"observation_digest":"sha256:e9ca02a14ce6f13b3f750b15dfedeb10253cc266664afc4ed67aed12a7d0e2a6","observation_id":"21dd0c6d-fa7e-4830-b873-f87c5e74bbea","resolution":{"observed_at":"2026-07-04T19:30:07.940887Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21872","snapshot_observed_at":"2026-07-31T18:18:00.298402Z","title":"A Survey of Continual Reinforcement Learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24320","last_updated":"2026-07-27T12:01:29Z","snapshot_observed_at":"2026-08-14T10:13:00.300293Z","submitted_at":"2026-07-27T12:01:29Z","title":"Continual-RL for Generalization in Autonomous Racing on the RoboRacer Platform","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T18:18:00.298402Z"},"links":{"cited_paper":"/paper/2506.21872","citing_paper":"/paper/2607.24320"},"observation_digest":"sha256:828709ed20a5f6f04b8ec1876c32e58f8140c7112b19b14e876d60f915ee9a3b","observation_id":"eabe5058-98a9-4b26-9e80-3762ad6ec7b1","resolution":{"observed_at":"2026-07-31T18:18:00.298402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21872","snapshot_observed_at":"2026-08-06T00:31:37.297766Z","title":"arXiv preprint arXiv:2506.21872 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01149","last_updated":"2026-08-02T11:00:04Z","snapshot_observed_at":"2026-08-16T05:56:26.731190Z","submitted_at":"2026-08-02T11:00:04Z","title":"PATH-Bench: Path-Dependent Evaluation of Lifelong Agents","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T00:31:37.297766Z"},"links":{"cited_paper":"/paper/2506.21872","citing_paper":"/paper/2608.01149"},"observation_digest":"sha256:0214fdae5109bf98e64d4585d225dd2cf14becc525cf3be0e0204dc5dda33d6c","observation_id":"fca4c27e-653f-412c-b5c1-84667ab4b2ca","resolution":{"observed_at":"2026-08-06T00:31:37.297766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21872","snapshot_observed_at":"2026-08-10T14:00:57.517509Z","title":"A survey of continual reinforcement learning.arXiv preprint arXiv:2506.21872, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07148","last_updated":"2026-08-07T12:10:08Z","snapshot_observed_at":"2026-08-17T07:58:12.103151Z","submitted_at":"2026-08-07T12:10:08Z","title":"A MARL Centered Reference Architecture for Large Language Model Augmentation in Smart Manufacturing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:57.517509Z"},"links":{"cited_paper":"/paper/2506.21872","citing_paper":"/paper/2608.07148"},"observation_digest":"sha256:1964476c1378e745f5d0c534ba4a58a753788ae7a52115b2f317e9896303a49a","observation_id":"3c78565f-e685-4545-bc56-87ba44375a07","resolution":{"observed_at":"2026-08-10T14:00:57.517509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.21872/citation-record","integrity":"/paper/2506.21872/integrity","json":"/paper/2506.21872/citation-record.json","paper":"/paper/2506.21872"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7b69f1bb-70b2-4187-9819-77a85125739a","year":2018},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:1a2f79f4d1219fcb31e4daed1ce99731e9be5a2de2ce2dabdb51f00b936d4a25","observation_id":"967ff375-bbf9-4eec-a065-dca450e2480d","resolution":{"observed_at":"2026-05-19T08:27:12.432852Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":"87cfceda-6de3-4d61-b65d-e35a974c060d","year":2015},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:ed74c5b130a0a4868dc2695908e78ad089b772f6fbbcb4644d22b66208e7ab5d","observation_id":"b3ad794c-f3ad-4b68-84b7-2a597d68c1dd","resolution":{"observed_at":"2026-05-19T08:27:12.448167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A general reinforcement learning algorithm that masters chess, shogi, and go through self-play","venue":null,"work_id":"354748dc-4961-47ef-8a3b-5858faf18d71","year":2018},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:13ab708c47d6738d31c95f694ff036536549d2fe82541011b46292d0ee52482a","observation_id":"46da753e-c281-4e5a-91ce-e0800ffc2317","resolution":{"observed_at":"2026-05-19T08:27:12.443848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved prediction of protein-protein interactions using AlphaFold2","venue":null,"work_id":"5f450b19-f7e2-4d77-8b18-b8f8f3b8917d","year":2022},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:a264a664d1635a6dc2e30c1ad6afdbd7035d5b057eb7dc3c592788097e4444ae","observation_id":"1a703971-a976-4bd5-9a91-3183a9e62fb2","resolution":{"observed_at":"2026-05-19T08:27:12.439976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning high-accuracy error decoding for quantum processors","venue":null,"work_id":"af80b563-f4a3-482d-989f-b24a24c5c6ee","year":2024},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:af02db65a9637824128d3d3882f71df5719d5f59a54372d7171c5f656d6fe928","observation_id":"0a3884d8-166e-41e2-81ab-7e0e354fc3b2","resolution":{"observed_at":"2026-05-19T08:27:12.436340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"8291c45e-801c-48c4-a105-230c8e25da8a","year":2022},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:2e1439d3aa5400941f8f60e2910b5507a09519d0a0460d232237f38437215008","observation_id":"c979f30f-04a4-446b-a926-4f0b575cd962","resolution":{"observed_at":"2026-05-19T08:27:12.430350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:546ee84261218b521a424581a3c535f7060a39dc8afae2d125cc61a1dbeabaa3","observation_id":"859afd83-0bbf-4300-869f-cfc4b186ff60","resolution":{"observed_at":"2026-05-19T08:27:11.207615Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepther- mal: Combustion optimization for thermal power generating units using offline reinforcement learning","venue":null,"work_id":"fe98123b-170e-4e6c-b360-fd5afbf30484","year":2022},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:6ea3a3b9edb9d3859e1296f77317573c52833292d5f0b2499bf39e0ebaf99180","observation_id":"b5ca8f71-1075-4796-bac6-09c8befb8c90","resolution":{"observed_at":"2026-05-19T08:27:12.426347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Magnetic control of tokamak plasmas through deep reinforcement learning","venue":null,"work_id":"614b0c51-1ba1-4074-856d-fe9eab9b657a","year":2022},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:0da280dedc3ef77e5fc6580ef14fd3736b8ad609d05e676d39920be2e9d67205","observation_id":"1cacd800-3716-4f5b-8895-678a8211897d","resolution":{"observed_at":"2026-05-19T08:27:12.237995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dense reinforcement learning for safety validation of autonomous vehicles","venue":null,"work_id":"f27f9c47-4a29-4dfc-add9-90f034f12aaa","year":2023},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:bfc879d25bca0480eeb6c345c1b19e79bc1f972a618e9b8ec45e1ec7cc4b14b6","observation_id":"a8835f6b-7ae6-4705-aa3c-56f3ebdcd1c6","resolution":{"observed_at":"2026-05-19T08:27:12.046499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grandmaster level in StarCraft II using multi-agent reinforcement learning","venue":null,"work_id":"e46b29eb-39c1-4880-b6ef-fabd3192600b","year":2019},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:e54dc00c6d7ce61ab458556a04e3ca34e7b70b93719776a5d6af86b07f4defcb","observation_id":"206c745d-f98f-4a76-8f4c-371382266358","resolution":{"observed_at":"2026-05-19T08:27:12.080902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards sample efficient reinforcement learning","venue":null,"work_id":"fb5edb2f-eac3-4276-a9a7-3b7766f5e99d","year":2018},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:5dd524b835defc2274dabc3996545b59027e00fd878354d461318fd456939d6c","observation_id":"280239a3-c4c6-4640-b83f-1ec173301a41","resolution":{"observed_at":"2026-05-19T08:27:11.863549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ding and H","venue":null,"work_id":"cf068522-82e9-4406-baed-84c299d0e8a3","year":2020},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:88aa1a9f7a4b63dfc39f76fa156d9d8b9469cdece78f6db056c3e10a27af9dd9","observation_id":"ab61ff0e-9777-4df5-a632-40f83bbe1815","resolution":{"observed_at":"2026-05-19T08:27:12.004858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Challenges of real-world reinforcement learning: definitions, benchmarks and analysis","venue":null,"work_id":"713d4fe9-9a50-49fd-b8b9-8e17768e1692","year":2021},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:3ecc5bf6b967122234f9d92a728ac6b6de3768299563e18ba3c5198a19b17efa","observation_id":"b7545c45-2671-410a-8b5b-ce74d6ea4e5d","resolution":{"observed_at":"2026-05-19T08:27:11.805347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Biological underpinnings for lifelong learning machines","venue":null,"work_id":"74993d3b-72cf-4853-95cd-0c3760ea0b2a","year":2022},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:4ac809dbc8385538d411078af98fc9c450a360f8aca16dc5397036015a34632a","observation_id":"6d1a35f1-f732-46d8-916a-ee5841acdec8","resolution":{"observed_at":"2026-05-19T08:27:12.041850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continual lifelong learning with neural networks: A review","venue":null,"work_id":"b5c3df35-87bc-4dcf-bec6-06fe5ce42912","year":2019},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:2a3ce68442fd9f8006dd261aab5394b793496b35e66660b810eed7383b4b37e1","observation_id":"31e9954b-12b6-4795-bedc-2132e5022cbe","resolution":{"observed_at":"2026-05-19T08:27:12.017728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A continual learning survey: Defying forgetting in classification tasks","venue":null,"work_id":"d9102a60-4816-4519-9fe1-5513c62cd96b","year":2022},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:e997757decf6d4b10307dc6a826dfe813369b0ef001363414ab4af3809199963","observation_id":"7e16880e-0531-4610-8cf2-350e38c0b5a9","resolution":{"observed_at":"2026-05-19T08:27:11.774606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A comprehensive survey of continual learning: Theory, method and application","venue":null,"work_id":"07608b2d-cefe-4cbe-9446-249404783f40","year":2024},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:4feefc7bd54946fee4ddc086272662330ed0746b77d4c7e7a29e63cc54cc4ff1","observation_id":"2b1357f1-c02a-47dc-84c2-408b6c4c1fc8","resolution":{"observed_at":"2026-05-19T08:27:12.189475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Federated continual learning via knowledge fusion: A survey","venue":null,"work_id":"f8687ba3-b8a8-4b1a-a5ef-222caf89201d","year":2024},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:f584cf12bc621a6e5e8d202461336af351a871f5fd705cd1f4751b9c998aabb6","observation_id":"95c9d345-2f1d-4c35-b1d5-cdf07f31624e","resolution":{"observed_at":"2026-05-19T08:27:12.373331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CHILD: A first step towards continual learning","venue":null,"work_id":"4d69dbe8-0414-47d2-a115-8968c81f6381","year":1997},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:1a45f4e8c0423d455e404f8903bc5d769aded890e0d7c49dd6ad80707790b560","observation_id":"40a4d10c-71b1-4a6a-b752-1e7d63822726","resolution":{"observed_at":"2026-05-19T08:27:11.832538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards continual reinforcement learning: A review and perspectives","venue":null,"work_id":"0b365226-d53b-4d0d-97b0-337ac1efdbe9","year":2022},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:2d79240949ff632e6232fc9fe9f1ea056babeff96186c574669d5b535ce7a92e","observation_id":"2d837f75-7687-492f-b5aa-138e00975d5d","resolution":{"observed_at":"2026-05-19T08:27:11.628921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fast TRAC: A parameter-free optimizer for lifelong reinforcement learning","venue":null,"work_id":"32a44200-f9ed-469d-bc24-fb572a3496b7","year":2024},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:a75ae2929b8d1bc40ae7276936e67f8bb095cac2c866562ee391ee526765f120","observation_id":"08d46c16-7cee-4883-a305-bd0c05b87d66","resolution":{"observed_at":"2026-05-19T08:27:11.965198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A comprehensive survey of forgetting in deep learning beyond continual learning","venue":null,"work_id":"fd486825-554d-493d-8d78-70314349a116","year":2025},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:9051d467677fe22de4b8b7f1a9745f7dc0b6ac93b9468ebb8601d2718f1ea3aa","observation_id":"9fe53a8b-fa4d-4b2c-acd9-f3c34d3c4d01","resolution":{"observed_at":"2026-05-19T08:27:12.140951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Markov decision processes","venue":null,"work_id":"5f519251-b438-480a-93cc-4feb321eabf4","year":1990},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:d320c4f9582a07b03ff09705ce48691ebec74a21a85017905330e72ce0c50506","observation_id":"484f22d7-9290-4000-8245-3e71bd78e1a4","resolution":{"observed_at":"2026-05-19T08:27:12.405697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"38450394-ac41-4201-8c61-4acafa6c7f43","year":2017},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:d53e5b666c3da6b67d6f2f33906374f3c87b9acf3df7478594ef03e47b437dd9","observation_id":"8e3bc458-7486-4c8b-842f-a0a2f3d45f40","resolution":{"observed_at":"2026-05-19T08:27:11.740074Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prioritized experience replay","venue":null,"work_id":"d0f94e53-aaef-48c5-b65f-e74f495abd43","year":2016},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:20b7c9c2f15659a7e576bd92a5f270450f35141fd401c22d764b699862b6e9a2","observation_id":"4abe9bc8-35b3-454e-893a-6b468a84c1d5","resolution":{"observed_at":"2026-05-19T08:27:12.076735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dueling network architectures for deep reinforcement learning","venue":null,"work_id":"014a8f1e-76c1-4df3-8a28-e5c74a1ddf29","year":2016},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:3e143987493e2c5d1434cd2c140e805d95d19d6e748a16ad29f8a54e61ca4331","observation_id":"2b2dc532-3797-4124-8304-bfdb11072062","resolution":{"observed_at":"2026-05-19T08:27:12.072661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep recurrent Q-Learning for partially observable mdps","venue":null,"work_id":"cdb1c044-3d19-4d28-b328-cb50718a014f","year":2015},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:3b5a2f2a45477e58c07f2e843bcc3652b0d9bbe72b3df419768ee98e263e8592","observation_id":"155d3c30-45e2-48f8-b761-92ba9be4a797","resolution":{"observed_at":"2026-05-19T08:27:11.910398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Asynchronous methods for deep reinforcement learning","venue":null,"work_id":"44bc519a-47ad-464b-97fd-a1589d629de7","year":2016},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:2ef4712bf80e59e2a109e3ee6931a4d1c0338397cc17cb2e5d7038e929cb4f5a","observation_id":"0a865d94-e831-4b8e-b43f-81305b19c246","resolution":{"observed_at":"2026-05-19T08:27:12.184912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continuous control with deep reinforce- ment learning","venue":null,"work_id":"20eb029f-e386-4cca-b833-05b15c43a8b9","year":2016},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:601b90b3b572404462e6331186276010f8f95d0b113e256b61f04157e0399664","observation_id":"ba3c09b4-617a-44ee-9a2b-b59e5347c484","resolution":{"observed_at":"2026-05-19T08:27:11.819433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Addressing function ap- proximation error in actor-critic methods","venue":null,"work_id":"e5dcd3c8-1256-42d9-a398-c17dd9223591","year":2018},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:8ebc8d0fc18170efa5250d1279ef24ce89bc38751fc6592e98480308dadea194","observation_id":"f1161da1-f9e5-4cfd-9b11-9bd95126cc35","resolution":{"observed_at":"2026-05-19T08:27:11.729214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Trust region policy optimization","venue":null,"work_id":"b7fef1fc-3aea-43e3-ac9c-29e46daa1ae2","year":2015},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:97d5dbc0aad0df98b626626c63d9412b82365c2bceb52e48ec814dbb145e353e","observation_id":"85692d8d-42f1-4d4d-8326-5658bb22746f","resolution":{"observed_at":"2026-05-19T08:27:11.711997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:eeb9e31cc08eee78b2502a04225e1953fcf08e681e9860c337a69a95b0459112","observation_id":"dc52effd-16ad-4450-93bd-04d7d315908b","resolution":{"observed_at":"2026-05-19T08:27:11.179467Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"e702c970-9397-4d2d-97fc-1e37240be7a4","year":2018},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:cbbdb7bfd61b083fcdb5e830d10a73c0ea35a3580496a602af6a236358541ded","observation_id":"6084fd90-87f7-4980-8fff-c7c5bb1ffb6e","resolution":{"observed_at":"2026-05-19T08:27:11.991637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A wholistic view of continual learning with deep neural networks: Forgotten lessons and the bridge to active and open world learning","venue":null,"work_id":"f595b5cf-180e-4a65-a11e-459983d7a985","year":2023},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:4497b149332afbd93c7d8af681b122c63f0e61f9e24b1e1144db7982d18c81a2","observation_id":"717ba5ac-84e0-40fe-ac83-c6518315f0e7","resolution":{"observed_at":"2026-05-19T08:27:12.401957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continual learning for robotics: Definition, framework, learning strategies, opportunities and challenges","venue":null,"work_id":"c98a4e63-5cac-421e-8575-de8ccc0a6fc5","year":2020},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:2a798e5b7a3a078c14dfd2c6fda016d948ee11a4cc6f9f703e1ab43818b0d92e","observation_id":"0c7961cc-3f26-469f-83ad-4ed780f19ef6","resolution":{"observed_at":"2026-05-19T08:27:11.956405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continual variational autoencoder via continual generative knowledge distillation","venue":null,"work_id":"cfe8f186-6e60-418b-a05e-89e723356983","year":2023},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:b39e66e5f07c835423a09b15b1f9d69e2387b63e74574ac9b804bbad1abb5d1d","observation_id":"01461a72-d0a8-40c8-b145-7fbbe9de06a6","resolution":{"observed_at":"2026-05-19T08:27:12.116126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"iCaRL: Incremental classifier and representation learning","venue":null,"work_id":"60b321d8-e09f-4d9e-92af-3528ee480d4d","year":2017},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:4b240364f6a54ab1bec022c7b4a585ba96854dcd07637b78e196eadd351c7ff6","observation_id":"814a68dd-9aa1-46ff-bb13-21661b254b63","resolution":{"observed_at":"2026-05-19T08:27:12.171662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continual learning with deep generative replay","venue":null,"work_id":"d0765f55-3048-4685-9087-1263cf466c21","year":2017},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:a91b787270a75edfcaf1aa35c25e26ae1ab5411239b11da3b385b0aa28c517b4","observation_id":"bdff437e-3417-408b-8a67-a659810f3018","resolution":{"observed_at":"2026-05-19T08:27:11.721486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Class-incremental learning via deep model consolida- tion","venue":null,"work_id":"8655caa7-cd04-4253-97a5-bd23eb8de574","year":2020},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:61b80f110e3278cf2be9dec8210388fe947d61dbee3a12fa8e215e3d2faf6553","observation_id":"0ae8e263-5e4e-4666-aa1c-7ca597e36698","resolution":{"observed_at":"2026-05-19T08:27:12.102519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Differential privacy preservation in robust continual learning","venue":null,"work_id":"625adca0-27c9-4e80-8b7e-5cf590cd6930","year":2022},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:58e7e37c1aeb75cb3551e55b99f17f9703da4ffd3dcc26a3b9553138e7a30cdc","observation_id":"e437c4b7-df05-4f04-a258-b3706b0868c2","resolution":{"observed_at":"2026-05-19T08:27:11.843767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Overcoming catastrophic forgetting in neural networks","venue":null,"work_id":"39af75ff-8c2a-4069-82bd-6816531bf57f","year":2017},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:652e13ea6762ed481b39db6b3272f1eca17c152ab444db52c68f4768a8c4aebd","observation_id":"766a0077-67bd-4f60-b2d5-bcbaa054e9e0","resolution":{"observed_at":"2026-05-19T08:27:12.206444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continual learning via inter-task synaptic mapping","venue":null,"work_id":"8b207376-9ddf-4fae-90b3-4be5c1b9e948","year":2021},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:489e1660c8436d23af6819e87da308ab7b6a927c8eaf46a9bb44169c9ad10aac","observation_id":"c6ea9064-a1e4-41e9-9830-9d266c186e7d","resolution":{"observed_at":"2026-05-19T08:27:12.210606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning without forgetting","venue":null,"work_id":"7ac411d6-37c7-4b5e-a29b-d9e0cf6ad5dc","year":2018},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:e30c69d02cca2b925087293192f14bbfa37b8c5f8fbc3b45206aa853238afe67","observation_id":"df6a1fc9-53bb-4fb3-aa0e-55a41832d4d3","resolution":{"observed_at":"2026-05-19T08:27:11.681615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Class-incremental learning by knowl- edge distillation with adaptive feature consolidation","venue":null,"work_id":"5d4ee1d5-40e4-4b46-8ece-6c695d4be592","year":2022},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:90cc9478186fcafd1a2edec216cd2d6c2ed097bee76106530a8a5caaa65326d7","observation_id":"eaad7dcf-3b91-4f68-96da-c2d49ee0e448","resolution":{"observed_at":"2026-05-19T08:27:12.247226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PackNet: Adding multiple tasks to a single network by iterative pruning","venue":null,"work_id":"82bdaa0c-741a-4037-89e9-05478e32f2dc","year":2018},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:badb0d42eb23a18b7b786e80ffab328fb8c373eb4ccad4a665bb5530a59f0c21","observation_id":"a60c4aad-e340-4cec-bb05-6ecf79b68333","resolution":{"observed_at":"2026-05-19T08:27:12.241824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Piggyback: Adapting a single network to multiple tasks by learning to mask weights","venue":null,"work_id":"de5807a0-a1ed-4832-836f-cb367742bb7b","year":2018},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:2b65152b40dc7e0eb6b2d3cef689903fa3b7330e0b89b3c5db6148a16a003154","observation_id":"f99e7528-3d36-4728-b8cc-bfebf65a2031","resolution":{"observed_at":"2026-05-19T08:27:11.757431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lifelong generative modelling using dynamic expansion graph model","venue":null,"work_id":"f756f0ef-1a91-499c-b439-baa36946f574","year":2022},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:1bfe645c553ec1f0542215e00e58fae3009d9d4b514d5db8cd7dfc47566db895","observation_id":"626a6b33-eadc-4be7-8691-d3edcd1b0aa8","resolution":{"observed_at":"2026-05-19T08:27:11.897391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Few-shot incremental learning with continually evolved classifiers","venue":null,"work_id":"8687b90c-e5bf-4f10-8930-a231ae7e88b1","year":2021},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:7e7eb16f62c6e66707d2161da6e22c6cf5eb6744558df59a820e68b8a2090872","observation_id":"24575a05-0ab4-4036-a0d5-ef3b258183ef","resolution":{"observed_at":"2026-05-19T08:27:11.744031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12488","last_updated":"2019-01-23T16:58:13Z","snapshot_observed_at":"2026-08-14T18:07:24.477342Z","submitted_at":"2018-10-30T02:08:35Z","title":"Re-evaluating Continual Learning Scenarios: A Categorization and Case for Strong Baselines","version":4},"cited_work":{"arxiv_id":"1810.12488","doi":null,"metadata_source":"pith","pith_arxiv_id":"1810.12488","snapshot_observed_at":"2026-07-04T16:09:57.300453Z","title":"Re-evaluating Continual Learning Scenarios: A Categorization and Case for Strong Baselines","venue":"cs.LG","work_id":"41d65f99-cf0a-4af4-b181-84fb2c16135f","year":2018},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"cited_paper":"/paper/1810.12488","citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:9be1c7d7757194801c0e67e35b80e205c6027bb8be81cdc6c5c7a3f46008f3ae","observation_id":"515b7a97-b40b-46c2-9620-14d3b4c05486","resolution":{"observed_at":"2026-05-19T08:27:11.172394Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Three types of incremental learning","venue":null,"work_id":"b65fc642-3119-4e4e-b162-c644f0624bbf","year":2022},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:4cc92ef79d2e9cd424eb56731fa37d212f2b6d98a0649e128d80ccca7efda147","observation_id":"9e81b28d-15c5-49f6-a6cc-ebe4dbb9798a","resolution":{"observed_at":"2026-05-19T08:27:11.973937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A definition of continual reinforcement learning","venue":null,"work_id":"784fa317-742e-4e73-93b2-f6ca2a15a2cb","year":2023},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:8203f2e13573ea289a0df4c3b72922035b4fb196207fe3f38947c50d9ea578ef","observation_id":"b707d3f7-1f83-4d44-8d73-22d6add971db","resolution":{"observed_at":"2026-05-19T08:27:12.413783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Loss of plasticity in continual deep reinforcement learning","venue":null,"work_id":"54eb2c79-5308-49ea-8a64-186203b3b702","year":2023},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:ad6876727248da5e3db9c547446cdc945562cb4b63e0e9ca17a7393052fbd718","observation_id":"0cff2393-36f5-419e-860b-6b5b10059ce6","resolution":{"observed_at":"2026-05-19T08:27:12.055108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey of multi-task deep reinforcement learning","venue":null,"work_id":"cab1d404-1048-43ac-8329-cedebbf38ee6","year":2020},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:d5f624332ac4a7b0e143a19e24312ebc72180879aa667e543e2a2478ec8b2d73","observation_id":"99681c59-4e18-43b7-8853-ff4b38474a13","resolution":{"observed_at":"2026-05-19T08:27:12.193570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transfer learning in deep reinforcement learning: A survey","venue":null,"work_id":"abdd9c36-8aa2-456b-9f8c-6adafcdec799","year":2023},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:e8481fd90c0cdca2572b25696d52f2499d5226ce49183b67a6fb7fc208d9bd03","observation_id":"e80d4a7c-178e-4c6c-a776-530f5724bd8c","resolution":{"observed_at":"2026-05-19T08:27:12.068456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continual reinforcement learning with complex synapses","venue":null,"work_id":"beedb7d8-0361-4fc4-9152-4ae234e640de","year":2018},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:db727d537fadac84358d37bc6a5bc9cee60e29e5e4c9e58d50f290df066f9ae3","observation_id":"70ddc7db-ee9e-4555-b5f7-83e858eb2d5f","resolution":{"observed_at":"2026-05-19T08:27:12.022265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Loss of plasticity in deep continual learning","venue":null,"work_id":"42370f36-f88b-4486-8583-6153804104a4","year":2024},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:57521d3c16b093183d1f9090b37d68829b498fae93c75f1a51fb6e53831f6726","observation_id":"eb5cad15-b9fe-40ba-ab37-2241bb6b4caa","resolution":{"observed_at":"2026-05-19T08:27:12.270042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04832","last_updated":"2026-04-18T13:11:19Z","snapshot_observed_at":"2026-08-07T20:09:01.472991Z","submitted_at":"2024-11-07T16:13:54Z","title":"Plasticity Loss in Deep Reinforcement Learning: A Survey","version":3},"cited_work":{"arxiv_id":"2411.04832","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04832","snapshot_observed_at":"2026-07-04T19:30:07.847309Z","title":"Plasticity Loss in Deep Reinforcement Learning: A Survey","venue":"cs.AI","work_id":"a7c70fc3-1b92-4e76-a995-cbc2130c36d0","year":2024},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"cited_paper":"/paper/2411.04832","citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:75e9940a4a0c55703a791424331ee31ed56ddb885794088ddc2d25806719e89a","observation_id":"d1afbb7e-de5f-4f15-9c70-999c49d8b9fc","resolution":{"observed_at":"2026-05-19T08:27:11.132613Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A study of plasticity loss in on-policy deep reinforcement learning","venue":null,"work_id":"7074f475-f254-4e3e-8af8-6dff0e994570","year":2024},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:dc72ff8de8d07340c59c64a5d5335d48a9253e622a1c4882654d40d964deaff2","observation_id":"1a47ce9d-d194-4dfa-ac0a-f630c79b98d5","resolution":{"observed_at":"2026-05-19T08:27:12.084992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Contin- ual world: A robotic benchmark for continual reinforcementlearning","venue":null,"work_id":"9daa3299-0dcc-45ea-808a-cba7d6d69924","year":2021},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:e74208700bc3c895fd0016a4419ebeadf772b6d472e420c405afe5ff8f74df67","observation_id":"5cf69aa2-3cac-4005-894c-24cdd69c6010","resolution":{"observed_at":"2026-05-19T08:27:12.341334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Disentangling transfer in continual reinforcement learning","venue":null,"work_id":"40c1bc3a-9759-4e1d-92fd-84f28d5f1b53","year":2022},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:203d329489e7f115a7c8adb3dcac1ea0ebbbb8b074d5e678a917e85dfd776fed","observation_id":"2e254c6f-13fc-4e2b-81a1-ee45be498e4f","resolution":{"observed_at":"2026-05-19T08:27:12.381893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-composing policies for scalable continual reinforcement learning","venue":null,"work_id":"83e3a493-0e8c-4e0a-b891-74fedd4484e2","year":2024},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:62d7187322bdd18378b866535d3334bcc8b75bae4a2348dfcc8fda187268bccb","observation_id":"17f51a78-7825-4d18-8b38-1d90f8d5ebe1","resolution":{"observed_at":"2026-05-19T08:27:12.377738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continuous coordination as a realistic scenario for lifelong learning","venue":null,"work_id":"f237f775-bd55-4d6f-ba6d-965546bca7ff","year":2021},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:ab5c013d4146c84d19a40bb65b3394534fcee26249d2c42587cf79cef8a216fc","observation_id":"2478aee0-0810-43ff-ab83-f1e5abae3856","resolution":{"observed_at":"2026-05-19T08:27:11.810086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.07454","last_updated":"2022-03-14T19:20:26Z","snapshot_observed_at":"2026-08-17T09:30:44.279340Z","submitted_at":"2022-03-14T19:20:26Z","title":"L2Explorer: A Lifelong Reinforcement Learning Assessment Environment","version":1},"cited_work":{"arxiv_id":"2203.07454","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.07454","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"L2Explorer: A lifelong reinforcement learning assessment environment","venue":null,"work_id":"9199e60e-f398-4364-bc2c-6e555296c049","year":2022},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"cited_paper":"/paper/2203.07454","citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:b9f121406515754f7b9134e65040b873ac6ac8a07edf16a9118714f316294abd","observation_id":"39074b72-6c35-492d-97a5-6bfd955aa841","resolution":{"observed_at":"2026-05-19T08:27:11.165479Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Building a subspace of policies for scalable continual learning","venue":null,"work_id":"756c7da8-23d1-44de-91c6-88cdda539acd","year":2023},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:ea743da73f23a7c10613baf6ecf0644e4789f69d43bf407bf0efd1e55ab65394","observation_id":"45dafd26-e4db-4958-8372-2652816ed364","resolution":{"observed_at":"2026-05-19T08:27:12.345029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Model-based lifelong reinforcement learning with bayesian exploration","venue":null,"work_id":"9fe812d2-0ce8-424f-89f9-59e167bd3832","year":2022},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:14898ac4b417dc589361375eb60bdc61e13c568223c762de07770a2674981bd5","observation_id":"18d40ed3-d7ae-40c4-8a07-53d26acecdb8","resolution":{"observed_at":"2026-05-19T08:27:12.348927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continual reinforcement learning in 3D non-stationary environments","venue":null,"work_id":"054601b2-2867-4770-a552-a3840efd1e62","year":2020},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:d8a6051c4b8195c0fbc01f3cc3a397d1e78592d310706ceaea2d10c18ca4730a","observation_id":"a4c19a8f-7830-4ab5-9aaf-986e40db702c","resolution":{"observed_at":"2026-05-19T08:27:12.353185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CORA: Benchmarks, baselines, and metrics as a platform for continual rein- forcement learning agents","venue":null,"work_id":"d527659a-f70a-4b62-8fad-706917c2d1f8","year":2022},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:39d107c48b5d473f9831c09da07029949ece1c499c21c7d0d8fe1c30e43ec86c","observation_id":"97c30c7c-a467-4e55-8725-f7eeaca1f00e","resolution":{"observed_at":"2026-05-19T08:27:12.389860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"COOM: A game benchmark for continual reinforcement learning","venue":null,"work_id":"b4afb6dc-9729-4930-a26a-c6240ebd03db","year":2023},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:5c51a39eb31d800334f03e0923a14cedd57070e25bf96097388e1796474a85b9","observation_id":"de4c8c94-5768-449a-8295-2d110be8c0ea","resolution":{"observed_at":"2026-05-19T08:27:12.315650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Policy and value transfer in lifelong reinforcement learning","venue":null,"work_id":"0b423d2f-4f16-4ce4-86ce-e6727d8193bd","year":2018},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:bebcb6f9b43ea561f8a415634b550a07b03f67893d67caf8680c5db6071882f1","observation_id":"a17bc714-3f58-46bc-bca6-50698560b051","resolution":{"observed_at":"2026-05-19T08:27:12.331084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Minigrid & miniworld: Modular & customizable reinforcement learning envi- ronments for goal-oriented tasks","venue":null,"work_id":"74175d3a-2110-4ce9-805d-b9a08f0cd26e","year":2023},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:2530590048ab984709b109ff8a378d462936c89b1556b5e2b1ec988cbac4b2a7","observation_id":"020c2df7-8e4d-4379-adba-e0239c9af79c","resolution":{"observed_at":"2026-05-19T08:27:12.328324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.03801","last_updated":"2016-12-13T12:19:48Z","snapshot_observed_at":"2026-08-14T21:25:55.714417Z","submitted_at":"2016-12-12T17:32:49Z","title":"DeepMind Lab","version":2},"cited_work":{"arxiv_id":"1612.03801","doi":null,"metadata_source":"pith","pith_arxiv_id":"1612.03801","snapshot_observed_at":"2026-07-09T12:56:14.879463Z","title":"DeepMind Lab","venue":"cs.AI","work_id":"8a8d827f-5377-4733-bfe8-bc66c011d458","year":2016},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"cited_paper":"/paper/1612.03801","citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:60ce6394e93771c51aa67cbb4a46b841f7cca75c79f99990eed9939960441611","observation_id":"dbb71f58-8c2a-4b0e-825c-ebf1b0115f54","resolution":{"observed_at":"2026-05-19T08:27:11.193393Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Progress & compress: A scalable framework for continual learning","venue":null,"work_id":"4d6e5885-59ee-4e4b-9eb7-aca407e2d4ec","year":2018},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:5a45e5b4e1121b7475b79c03c91810bb1c50e2e4ac3550c54ff63151f968d627","observation_id":"02f6d114-3c64-4a32-881c-1c44015ba22e","resolution":{"observed_at":"2026-05-19T08:27:12.297774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-08-13T22:24:37.672685Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:359d10f1ef571d9f8de8122b13bb47f81779f4eccfc3e1163e121752c9243836","observation_id":"ddd202c7-ae37-4a30-8447-3b99b380b73b","resolution":{"observed_at":"2026-05-19T08:27:11.186560Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Same state, different task: Continual reinforcement learning without interference","venue":null,"work_id":"f9fec60c-cff9-4ff9-9b20-ff45571d1790","year":2022},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:5ed0214caa4773774c8cbd565a50de621259dfc6695c3418d2c79ec9dc823cf9","observation_id":"35081155-68e4-431e-8434-5153db5b9898","resolution":{"observed_at":"2026-05-19T08:27:12.311291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MuJoCo: A physics engine for model-based control","venue":null,"work_id":"f2f6b30f-b75b-4799-9383-c4d1c0cda7ff","year":2012},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:3608d0b22a95cf2db46801ad336a2600c0b0c96684c764d90f22b831c5699bcf","observation_id":"b64a08aa-db33-4884-adeb-73882401fdfc","resolution":{"observed_at":"2026-05-19T08:27:12.333984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Policy consolidation for continual reinforcement learning","venue":null,"work_id":"78839a4b-e56a-4ad7-92d7-22495a48e3b2","year":2019},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:491088b963ff1139e9e4c73a2eaa96a0052a220acc0b9d625fc73120cd985ae8","observation_id":"82198ff5-e320-4e48-9dda-8a13420048ec","resolution":{"observed_at":"2026-05-19T08:27:12.369300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"IMPALA: scalable distributed deep-RL with impor- tance weighted actor-learner architectures","venue":null,"work_id":"9c7fde71-a215-4ea2-b6e2-1bce80935db0","year":2018},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:f56a553706f8c2d53e355f28206c429cb523aa8159beb5c632feb520b63d298e","observation_id":"a6ff9d46-9a2a-48c3-8a76-9e83157444c9","resolution":{"observed_at":"2026-05-19T08:27:12.265828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prediction and control in continual rein- forcement learning","venue":null,"work_id":"0f65b3b7-504f-41da-98da-1528df3c7c26","year":2023},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:6a8ea1f9e71a1048174edff36cfde67ce7acad87cbd38e7d6d2d44d5018a0b89","observation_id":"a428e50b-c3e8-4acb-92b8-66aad0e30a1f","resolution":{"observed_at":"2026-05-19T08:27:12.279403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The arcade learning environment: An evaluation platform for general agents","venue":null,"work_id":"7df79982-58ff-4516-9d3a-d99b4b218e69","year":2013},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:2e75565eb6a9294ef6e0cfcdc938189e3142df6a355054ecee28b139788f7892","observation_id":"868c6bfb-980a-43e9-b82e-3640d785e62e","resolution":{"observed_at":"2026-05-19T08:27:11.947778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.04671","last_updated":"2022-10-22T14:34:44Z","snapshot_observed_at":"2026-08-16T23:40:37.342111Z","submitted_at":"2016-06-15T08:20:51Z","title":"Progressive Neural Networks","version":4},"cited_work":{"arxiv_id":"1606.04671","doi":"10.1007/978-3-030-58598-3_10","metadata_source":"pith","pith_arxiv_id":"1606.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Progressive Neural Networks","venue":"cs.LG","work_id":"0700d73f-b94d-4cd3-be40-086e4c4544c4","year":2016},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"cited_paper":"/paper/1606.04671","citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:e71296af24712015a61ff8c946f7f6657bb6ea6ba7657ea857d9d899e8bb33ae","observation_id":"9423d14f-91ec-4f24-b28c-de36e6d8bc10","resolution":{"observed_at":"2026-05-19T08:27:11.158048Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.04782","last_updated":"2017-08-16T06:20:52Z","snapshot_observed_at":"2026-08-15T23:26:03.690915Z","submitted_at":"2017-08-16T06:20:52Z","title":"StarCraft II: A New Challenge for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1708.04782","doi":"10.48550/arxiv.1708.04782","metadata_source":"pith","pith_arxiv_id":"1708.04782","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"StarCraft II: A New Challenge for Reinforcement Learning","venue":"cs.LG","work_id":"9c70874f-186a-43a4-be0b-cc1efa99bd91","year":2017},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"cited_paper":"/paper/1708.04782","citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:aa7098543c63a86799f4512a2301576b47849dab1e7289a4db6cee082c75254f","observation_id":"2ce40946-0517-48f3-80c3-2264f19c5da5","resolution":{"observed_at":"2026-05-19T08:27:11.200227Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lifelong reinforcement learning with temporal logic formulas and reward machines","venue":null,"work_id":"b5e2e7c5-d294-486e-9d82-a33609f67944","year":2022},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:7dbad5b20bc8ceb195140a2d253e0912c1b715720d7c44062d1d75f3f077ba98","observation_id":"32a6c183-0629-404a-8029-233133c45b14","resolution":{"observed_at":"2026-05-19T08:27:11.931889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reset-free lifelong learning with skill-space planning","venue":null,"work_id":"65519e83-35c8-40d3-905e-ffc4ca150a0e","year":2021},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:9e253b4e63e11cb83083f6442e0469ee8c2fed953c68feca9d4b8db656a4a284","observation_id":"33925282-0e5a-4b8a-a1fa-820a11ee2696","resolution":{"observed_at":"2026-05-19T08:27:12.202370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Model-free generative replay for lifelong reinforcement learning: Application to starcraft-2","venue":null,"work_id":"f51d9a40-5169-4332-9ab7-9308fdd8ee3c","year":2022},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:6152fbb5d23d06ef75c193511559c1d0467b231f194197f47f30f8a90aaa1ac3","observation_id":"55b3df8d-281a-490a-8296-16a4f7b4fa18","resolution":{"observed_at":"2026-05-19T08:27:12.120628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lifelong federated reinforcement learn- ing: A learning architecture for navigation in cloud robotic systems","venue":null,"work_id":"be3852ef-b9a5-480e-b288-f652272a2df5","year":2019},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:ad302cab8c17cf73380a1971497369fff1cf9080234de3ea144c7f2d8afb7220","observation_id":"c0e337d2-531b-49d5-a644-76028358c161","resolution":{"observed_at":"2026-05-19T08:27:12.026730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Discorl: Continual reinforcement learning via policy distillation","venue":null,"work_id":"b9011baa-4c23-4352-bbb6-1992f2045250","year":2019},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:d06efab137edca3e287feb0fbbebb94937cf9c3894eda574843c0cef93fd76e6","observation_id":"118af6e2-62a8-4ad1-8ba3-f645e0ae9516","resolution":{"observed_at":"2026-05-19T08:27:12.421526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continual vision-based reinforcement learning with group symme- tries","venue":null,"work_id":"c835ae49-63e8-4bed-8b1a-8893475f21f5","year":2023},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:f03c047a15aa75e4b3fe729a93f79925b99c9a85eeecd0265dcfdae9fbac1527","observation_id":"44082620-c4a0-499c-8455-dd0329c42bff","resolution":{"observed_at":"2026-05-19T08:27:12.227470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evaluating continual learning on a home robot","venue":null,"work_id":"8ddee9cf-cc02-4c68-9e43-89a234454dac","year":2023},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:abdc99c70a7b5a20ccb829a323a27e33e8d50e877b4d657633a7894a184c39df","observation_id":"303b791b-35c3-49d4-a128-4311420e6a65","resolution":{"observed_at":"2026-05-19T08:27:12.288214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Hanabi challenge: A new frontier for AI research","venue":null,"work_id":"75ab25a7-29bc-49d7-b46f-d4f0c613fe01","year":2020},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:3d617ab1f0fffdecb3c32f813c8ac6512b7b869542d3f39c54a275498e5d1e81","observation_id":"495f9316-a600-41bd-a01c-b05782289478","resolution":{"observed_at":"2026-05-19T08:27:11.987401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Meta-World: A benchmark and evaluation for multi-task and meta reinforcement learning","venue":null,"work_id":"8c44db02-bddf-4428-82b9-0bacd61ed2cd","year":2020},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:5944691b89d0f45bc4cff22defc87a061ded0f24f603023c065962e811d23126","observation_id":"fa2a6d7c-5931-4e10-9d8e-dd7bf093dac1","resolution":{"observed_at":"2026-05-19T08:27:12.283887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Using task features for zero-shot knowledge transfer in lifelong learning","venue":null,"work_id":"a6bf9df0-0863-4a91-bc61-9b5ce20e0218","year":2016},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:613d64f600852491012147bc2db3d08427e2bbae6c1d9e346dfd527c5c0bc884","observation_id":"91bde47c-78d3-4ab4-b208-4c170d3656f9","resolution":{"observed_at":"2026-05-19T08:27:12.038028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A deep hierarchical approach to lifelong learning in minecraft","venue":null,"work_id":"0c0832e9-f838-4baa-bd6c-43c021f380ed","year":2017},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:93b327259dbdd6efa0e002b772ca0b0ef59032d3adc2769665232ffee97b37cd","observation_id":"d0a384fc-ec91-4545-b10c-2a197faad6b8","resolution":{"observed_at":"2026-05-19T08:27:11.951834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1701.08734","last_updated":"2017-01-30T18:06:07Z","snapshot_observed_at":"2026-08-14T21:18:51.601049Z","submitted_at":"2017-01-30T18:06:07Z","title":"PathNet: Evolution Channels Gradient Descent in Super Neural Networks","version":1},"cited_work":{"arxiv_id":"1701.08734","doi":"10.48550/arxiv.1701.08734","metadata_source":"pith","pith_arxiv_id":"1701.08734","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PathNet: Evolution Channels Gradient Descent in Super Neural Networks","venue":"cs.NE","work_id":"67145523-6c66-41a2-a3b0-ceb37c0dc852","year":2017},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"cited_paper":"/paper/1701.08734","citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:b7d3d26eedce38ca97f6d20f2500feedc0bc6c9ca32c7699552f31f08f61ba4d","observation_id":"3ca6ef8f-5e1c-41b5-8d48-ceb974194ed7","resolution":{"observed_at":"2026-05-19T08:27:11.138798Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Selective experience replay for lifelong learning","venue":null,"work_id":"b8c0d048-28dc-4c66-91c0-ab6565e1a0aa","year":2018},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:a78e73a3f54196419066784faceb58f6646ed4bcbba279ff3667e249e6d95194","observation_id":"ee9ec092-6db5-444f-825a-8c8360b50916","resolution":{"observed_at":"2026-05-19T08:27:12.393970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"State abstractions for lifelong reinforcement learning","venue":null,"work_id":"5b64c803-7e09-421f-a7c8-0a25ec7e17d5","year":2018},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:4841c925c944879e1d26fda514e77c62025c092be52316456c4d458bff4b850b","observation_id":"430f585f-d5e0-4884-bf77-89ed2dde9e5f","resolution":{"observed_at":"2026-05-19T08:27:12.417607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Composing value functions in reinforcement learning","venue":null,"work_id":"ba478965-e19c-43fd-9592-cb3b686a7096","year":2019},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:0219816098df83d762d410d27b83e34dea230e2f5ee235a5cddbe8d5022d30c9","observation_id":"01c0ebe3-3e3e-4411-8bc0-08c0b04746f1","resolution":{"observed_at":"2026-05-19T08:27:11.854198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Experience replay for continual learning","venue":null,"work_id":"da2b1011-ddb4-48cc-82ce-97d51e38a065","year":2019},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:bedea9518d79473be934211af911b7a6740c91fc76ba7784bf0d6d04ebe45660","observation_id":"c2f767ba-2b53-4386-b31b-71d48db83b35","resolution":{"observed_at":"2026-05-19T08:27:11.618533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Model primitives for hierarchical lifelong reinforcement learning","venue":null,"work_id":"ce337adf-fb37-4d1c-a6de-ffbe46267cf1","year":2020},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:40f70bb58fa4098f19d4638967f99fa2fd04df1fc1d59541ea5c343fb8e2863c","observation_id":"41155558-dce9-4e25-b1b8-49382d35d32e","resolution":{"observed_at":"2026-05-19T08:27:11.960618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep reinforcement learning amidst lifelong non-stationarity","venue":null,"work_id":"c5398b90-8632-49da-946c-d35956ddeb9c","year":2020},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:4ab8d060b9c428db78251b611753568b36bfd81d489e623ee4039bf64c098441","observation_id":"aa54b45f-78e4-4864-91f0-d07ac192f820","resolution":{"observed_at":"2026-05-19T08:27:11.639980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T05:51:50.531326Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":10,"verified_fuzzy":88},"total_outbound_references":209},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 100 of 209 outbound references and 11 inbound Pith citation observations for arXiv:2506.21872."}