{"as_of":"2026-08-21T15:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:51fc5d46239cd5c79a8316cd604a2516cf63d96a23a3cb37fe4c081f498ad073","coverage":[{"denominator":246,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:16:00.018724Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.10330/citation-record","integrity":"/paper/2505.10330/integrity","json":"/paper/2505.10330/citation-record.json","paper":"/paper/2505.10330"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.069279Z","title":"Mastering the game of go without human knowledge,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.069279Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:434764c03403dc23e7541607a50d7e14f584edfedce92fc1608be8b11b645cd0","observation_id":"8bb213dc-9450-46f7-b3fd-2b6099c64b29","resolution":{"observed_at":"2026-08-15T21:15:59.069279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.077876Z","title":"Mastering atari, go, chess and shogi by planning with a learned model,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.077876Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:b1435c1d15397cc960f8ef9f29851f3f60973c78937f22e6ea0ad216e9bcaf36","observation_id":"f1d598b9-b60d-44cb-bcea-26b056cab1bf","resolution":{"observed_at":"2026-08-15T21:15:59.077876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.084850Z","title":"Grandmaster level in starcraft ii using multi-agent reinforcement learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.084850Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:2c707b3279dc37970aa5c9b8f84b5244abcabbd84c1daebc380629c68f8d1ff1","observation_id":"c49256e1-822a-4cd1-9957-b794514bb4ab","resolution":{"observed_at":"2026-08-15T21:15:59.084850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06680","last_updated":"2019-12-13T19:56:40Z","snapshot_observed_at":"2026-08-13T14:13:07.807518Z","submitted_at":"2019-12-13T19:56:40Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06680","snapshot_observed_at":"2026-08-15T21:15:59.091559Z","title":"Dota 2 with large scale deep reinforcement learning,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.091559Z"},"links":{"cited_paper":"/paper/1912.06680","citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:d9690a961f1714acf3420cc933a3816c695e04112619e5a01fe0a3f3ee00b978","observation_id":"c5f77ab1-08bf-4a91-b0e4-b52429619df8","resolution":{"observed_at":"2026-08-15T21:15:59.091559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.099808Z","title":"Agent57: Outperforming the human atari benchmark,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.099808Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:b6cd9f66639c23e9b9715ad7862e4b26ba806312618280667df04b94624ebcb3","observation_id":"8549a4f1-5811-4511-98c9-6885b84f8aee","resolution":{"observed_at":"2026-08-15T21:15:59.099808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.113283Z","title":"Reinforcement learning based recommender systems: A survey,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.113283Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:b713ae7ac61b2af819cb396b217ca91a1e938c778ed90abd0abf847698b16771","observation_id":"a9ad6ea3-71c7-494c-9814-82a1b315d9e0","resolution":{"observed_at":"2026-08-15T21:15:59.113283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.126194Z","title":"Deepmind ai reduces google data centre cooling bill by 40%,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.126194Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:b6cbd8d6b53c6718ff108cbdd6097f275b5beecb3d0594565e099070d966dc18","observation_id":"8787a233-f3d0-4d8f-9132-a9af6cf52f1d","resolution":{"observed_at":"2026-08-15T21:15:59.126194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.133657Z","title":"Gnu-rl: A precocial reinforcement learning so- lution for building hvac control using a differentiable mpc policy,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.133657Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:4c8004518e30a9702d2fb6986daecf7c1f38b9e7c7b43ad24dcfb155b6e61747","observation_id":"646eedef-cc8e-4f49-b633-505c07d9fab7","resolution":{"observed_at":"2026-08-15T21:15:59.133657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.145334Z","title":"Magnetic control of tokamak plasmas through deep reinforce- ment learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.145334Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:923972e9bf2dbcbd28c7de9c2fc88dfee1e11b00f63a3fb0ced378369da7da1a","observation_id":"b0a39276-513c-4fb5-9374-9fa80e2814a4","resolution":{"observed_at":"2026-08-15T21:15:59.145334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.155739Z","title":"Adversarial policies beat superhuman go ais,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.155739Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:ab4311efc999afebd5cc2a2c4858eb5aa30bcef3ca296b9f3302de9cfde3cd81","observation_id":"7edde538-4863-4b5a-83d5-8bfb448839a6","resolution":{"observed_at":"2026-08-15T21:15:59.155739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.161373Z","title":"Adaptation in constant utility non-stationary environments.,","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.161373Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:8665b96b26a6c6011765ec7b2dd1ae37b82ad7ce98636e70a95697643206c612","observation_id":"af2d9cac-75a0-4ae1-b2b1-61604bdac3ad","resolution":{"observed_at":"2026-08-15T21:15:59.161373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.175120Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.175120Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:43cc2fe63adb1b687a14fd738fb36109067b56888ee9289f84d9af79313d071f","observation_id":"074e49ff-b87b-447a-a19c-54a6f7d03619","resolution":{"observed_at":"2026-08-15T21:15:59.175120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.181875Z","title":"Impact of timing in post-warning prepositioning decisions on performance measures of disaster management: A 163 real-life application,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.181875Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:0c451121fa854374b58266766929f60e8ada41b0b9622223de287650387fdb90","observation_id":"a2369159-0aec-464f-976d-cbb0314a3961","resolution":{"observed_at":"2026-08-15T21:15:59.181875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.190382Z","title":"Domain randomization for transferring deep neural networks from simulation to the real world,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.190382Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:03c281c6db75bb4b1641759d17ac23f6801c54413bd3a71b2552fa8df57548e8","observation_id":"bee051dd-7a95-4a27-a96b-1dbfbd3ba6f1","resolution":{"observed_at":"2026-08-15T21:15:59.190382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.198548Z","title":"Learning optimal adap- tation strategies in unpredictable motor tasks,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.198548Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:391096219e48d28ed33596d14acb495979f52b20312ce15c59ccb9269c0d0cc4","observation_id":"f6f5d207-465d-4eeb-ac17-ec1b171158f6","resolution":{"observed_at":"2026-08-15T21:15:59.198548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.210439Z","title":"Reward learning: Reinforcement, incentives, and expectations,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.210439Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:9939b5fb388d833a153ac59fc31868a86fb634ae4879d55e103d3c8f2d42d133","observation_id":"f8612988-d5f0-4eef-9623-d2bd9a89fe36","resolution":{"observed_at":"2026-08-15T21:15:59.210439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00010","last_updated":"2021-01-14T22:29:59Z","snapshot_observed_at":"2026-08-20T09:20:08.028678Z","submitted_at":"2020-06-30T18:00:01Z","title":"Towards precision holography","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.00010","snapshot_observed_at":"2026-08-15T21:15:59.221123Z","title":"Inte- grating animal temperament within ecology and evolution,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.221123Z"},"links":{"cited_paper":"/paper/2007.00010","citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:553e1b5b1ca79ef481e3080d20bc705996c949a8d596addef4dbec5299724f6c","observation_id":"d62bc700-fd5f-499a-90a3-9ed6e906c8ec","resolution":{"observed_at":"2026-08-15T21:15:59.221123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.227562Z","title":"Deep neural networks for youtube rec- ommendations,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.227562Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:3be71104141a4521523d8457cba4ad1dab5278a05468126b0feb55c6f4c423de","observation_id":"c23d9383-47bb-428d-a8c1-3c1eb5e75a59","resolution":{"observed_at":"2026-08-15T21:15:59.227562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.236715Z","title":"Scheduling on a budget: Avoiding stale recommendations with timely updates,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.236715Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:40bbd0a12876a7cde1429a9e139259118576265ade97068a0f1a69375ba51cb7","observation_id":"1accb39b-d7ba-4401-9899-aa4f85be4955","resolution":{"observed_at":"2026-08-15T21:15:59.236715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.249385Z","title":"Catastrophic interference in connectionist net- works: The sequential learning problem,","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.249385Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:1689fe9093faf7d12be7aa91c405694ed0533206cafc8cad110e0d47dc4aa1a5","observation_id":"ab83c578-080a-4238-abbc-def669a488b2","resolution":{"observed_at":"2026-08-15T21:15:59.249385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.257424Z","title":"Learning to predict by the methods of temporal differences,","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.257424Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:73e66cb26d6eb00ad9856e4452b8d980e0c5263d91a37656c34120232e2df4e0","observation_id":"3b8e47fc-3c03-43bf-86b5-4a19971b3148","resolution":{"observed_at":"2026-08-15T21:15:59.257424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.267179Z","title":"Analysis of temporal-diffference learning with func- tion approximation,","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.267179Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:14137da8a153618fe3b60c59573ab5b132aa6cb7506891e9d4e91f226ebd36fb","observation_id":"a86c677b-3431-4fd4-b80d-033953f4dd8e","resolution":{"observed_at":"2026-08-15T21:15:59.267179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.277183Z","title":"Human-level control through deep reinforcement learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.277183Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:3a9259f390c68f594b206d32185ca4aa7c3844e3438cea003431ede62cf079b6","observation_id":"3c6ccfc8-6e62-4ea6-9593-08ac31f9e694","resolution":{"observed_at":"2026-08-15T21:15:59.277183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02648","last_updated":"2018-12-06T16:36:20Z","snapshot_observed_at":"2026-08-18T08:00:35.342323Z","submitted_at":"2018-12-06T16:36:20Z","title":"Deep Reinforcement Learning and the Deadly Triad","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02648","snapshot_observed_at":"2026-08-15T21:15:59.289096Z","title":"Deep reinforcement learning and the deadly triad,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.289096Z"},"links":{"cited_paper":"/paper/1812.02648","citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:5a9ed533bc9190620ee9786cb0eaedd6c4e3cd872b1de98de0dc3e51b25b7410","observation_id":"0c6c19b7-8dff-4885-a1c6-a42f99cfcad4","resolution":{"observed_at":"2026-08-15T21:15:59.289096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.299736Z","title":"Simple statistical gradient-following algorithms for connectionist reinforcement learning,","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.299736Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:dafc8cc61592883f1046fa77b0141266d411597770224de47642582b52c702ea","observation_id":"f7e9ba2d-1b8c-498f-95b0-416f42011241","resolution":{"observed_at":"2026-08-15T21:15:59.299736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.309292Z","title":"Asynchronous methods for deep reinforcement learning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.309292Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:b79b38011311a6c14b11c2a77db6a74558e57b8a60355d988224ecb0f970b89a","observation_id":"35b57e3e-b9be-41c7-ba46-c22dc1ce44b0","resolution":{"observed_at":"2026-08-15T21:15:59.309292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.316184Z","title":"Impala: Scalable distributed deep-rl with importance weighted actor-learner architectures,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.316184Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:85dbdcb4b6172e28038dacd53419a1da0ae503a2f633287024a03fcd5414c096","observation_id":"a41617e8-6cbd-47b7-b593-472866fd3b01","resolution":{"observed_at":"2026-08-15T21:15:59.316184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.324781Z","title":"Continuous control with deep reinforcement learning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.324781Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:589d2af31ea6a9af8f798b1c17021b85a9652a42de4e6a7089a6118eb069f25c","observation_id":"16062bad-540c-40c8-8a77-2a1b55b195bc","resolution":{"observed_at":"2026-08-15T21:15:59.324781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.335060Z","title":"Distributed distributional deterministic policy gradients,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.335060Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:81dc821a4a435ace5d124abec424c65ae9593d914727713608d8478b8fa6f354","observation_id":"945f7532-0f0b-4353-ae67-1ee4d13088d4","resolution":{"observed_at":"2026-08-15T21:15:59.335060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.346698Z","title":"Scalable trust-region method for deep reinforcement learning using kronecker-factored approximation,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.346698Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:ee5af39fa301a6bf9f7b76d21b8526680c5196abce72d2046875684fc87f6144","observation_id":"62c1d1da-3bcd-4d85-8c46-9edcb8be888e","resolution":{"observed_at":"2026-08-15T21:15:59.346698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.354303Z","title":"Soft actor-critic: Off-policy maxi- mum entropy deep reinforcement learning with a stochastic actor,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.354303Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:681af5a40ea096949e02d07ce163d693203576c6dc7d78775ea4650cbeaa98b0","observation_id":"02d67d68-b000-47bb-a1dc-d36558a3c55f","resolution":{"observed_at":"2026-08-15T21:15:59.354303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.369754Z","title":"Trust region pol- icy optimization,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.369754Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:f675324a820af0bb323d039f14582659ee6cf355b2bad9d3c5b89f9ead1ed27d","observation_id":"58588fe6-dc46-4e88-aba3-8b8681a924ef","resolution":{"observed_at":"2026-08-15T21:15:59.369754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T21:15:59.377816Z","title":"Proximal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.377816Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:ea3d6294e66b339f84778d5f603feef0fd699febf9fd4b1b57e0810cd2c6710f","observation_id":"88e42701-3dea-44a9-99d1-2e07398935cd","resolution":{"observed_at":"2026-08-15T21:15:59.377816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.384898Z","title":"Dyna, an integrated architecture for learning, planning, and reacting,","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.384898Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:53ce11ca53f8fe4eb3cc2bd3584c0823e197ab3e2754291789a9a995d177d566","observation_id":"dd4d2e19-2898-4e64-bdbc-e559d47f153a","resolution":{"observed_at":"2026-08-15T21:15:59.384898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.395462Z","title":"First return, then explore,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.395462Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:590f0b662fcfe1323d42f59c523e5f449d0e42c324207379c37eb20bac7c74a6","observation_id":"6bb3b444-52e1-4069-b7d3-3ef783a3f54f","resolution":{"observed_at":"2026-08-15T21:15:59.395462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.406216Z","title":"Learning latent dynamics for planning from pixels,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.406216Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:4a630ca43d0afdf948a498aefad677967fb584cd82be120020f9cfbd6df25f1d","observation_id":"4a0ed717-3cb0-47e0-9674-b2ce1d30610f","resolution":{"observed_at":"2026-08-15T21:15:59.406216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.418445Z","title":"Curious model-building control systems,","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.418445Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:4efb7b831375e0a78248c93773041e696137d5bdf0251778c34ea5b68f6fc113","observation_id":"6ec25d40-c564-4cfc-9958-99194229e867","resolution":{"observed_at":"2026-08-15T21:15:59.418445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.09249","last_updated":"2015-11-30T11:35:26Z","snapshot_observed_at":"2026-08-20T10:43:56.847409Z","submitted_at":"2015-11-30T11:35:26Z","title":"On Learning to Think: Algorithmic Information Theory for Novel Combinations of Reinforcement Learning Controllers and Recurrent Neural World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.09249","snapshot_observed_at":"2026-08-15T21:15:59.428205Z","title":"On learning to think: Algorithmic information theory for novel combinations of reinforcement learning controllers and recurrent neural world models,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.428205Z"},"links":{"cited_paper":"/paper/1511.09249","citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:221ccb19c852986f54268a068d0fd0b1ce40647761c8fcc260df568153612055","observation_id":"f56d2ea2-50f9-4060-9e51-c18d150b418c","resolution":{"observed_at":"2026-08-15T21:15:59.428205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.437614Z","title":"Recurrent world models facilitate policy evolution,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.437614Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:ff4844a6deec0c5eabf995eb9241611ec467e092a12aca037990e743901d3a72","observation_id":"18c87a44-82aa-4a6c-a073-bbf03641872c","resolution":{"observed_at":"2026-08-15T21:15:59.437614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.448190Z","title":"Dream to control: Learning behav- iors by latent imagination,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.448190Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:e1bcc37bdf85f5f50923b792dab045bf2f06f9e9e6e67df7c208e3216451477e","observation_id":"ed22c21e-7630-4db0-bb89-f39ec53129d3","resolution":{"observed_at":"2026-08-15T21:15:59.448190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.464751Z","title":"Mastering atari with discrete world models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.464751Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:5ccbb06c81a086674f078fdaf814cd82e245ef330d5497856a68fc406f40b10d","observation_id":"7fc91ebd-9bd0-4bde-b830-847e45b5a062","resolution":{"observed_at":"2026-08-15T21:15:59.464751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-08-15T21:15:59.472534Z","title":"Mastering diverse domains through world models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.472534Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:9a9a4b50e26ffd0e30af0a0366564e508701ffa4fedaaba6f87dab8480c13b15","observation_id":"f04e09b9-1be3-458e-aa98-d378d4291cd3","resolution":{"observed_at":"2026-08-15T21:15:59.472534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1259","last_updated":"2014-10-07T18:08:30Z","snapshot_observed_at":"2026-08-14T23:20:50.864190Z","submitted_at":"2014-09-03T21:03:41Z","title":"On the Properties of Neural Machine Translation: Encoder-Decoder Approaches","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1259","snapshot_observed_at":"2026-08-15T21:15:59.485835Z","title":"On the proper- ties of neural machine translation: Encoder-decoder approaches,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.485835Z"},"links":{"cited_paper":"/paper/1409.1259","citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:f39f0454bf72a242248723023b7e0d199a60ecdbead3a4e4bc2634afb506842a","observation_id":"5b345e16-a794-4728-a06a-8084bf0f0700","resolution":{"observed_at":"2026-08-15T21:15:59.485835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.492201Z","title":"Convolutional networks for images, speech, and time series,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.492201Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:8d4ba7bfd01ee913a8d5043210cfae8fdaf5e29dd825c3983ddcb8f08dbbfe66","observation_id":"67b5deec-6cfc-4b56-b67c-f299ef73d8bd","resolution":{"observed_at":"2026-08-15T21:15:59.492201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1308.3432","last_updated":"2013-08-15T15:19:34Z","snapshot_observed_at":"2026-08-14T04:51:04.817737Z","submitted_at":"2013-08-15T15:19:34Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1308.3432","snapshot_observed_at":"2026-08-15T21:15:59.498195Z","title":"Estimating or propagating gradi- ents through stochastic neurons for conditional computation,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.498195Z"},"links":{"cited_paper":"/paper/1308.3432","citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:fd9049460af6575b849ed4ce2e59108f87b00f130e1165607f2f0a10a1a24f09","observation_id":"c7d134be-e586-4825-9cd3-1e8f6610bc10","resolution":{"observed_at":"2026-08-15T21:15:59.498195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.507948Z","title":"Dm control: Software and tasks for continuous con- trol,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.507948Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:5634bedad66f5e9ef591857f85da2d7a423b1ac39a166f8252933a5d3795373f","observation_id":"6f2691ef-5777-46ef-b275-9dfce39284dc","resolution":{"observed_at":"2026-08-15T21:15:59.507948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.515230Z","title":"The arcade learning environment: An evaluation platform for general agents,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.515230Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:a0ebf70502fbc2fa8d7480ff07a3fc3e442c4ea298ff8db1092de2da0bbb7e0a","observation_id":"0e902dc0-ae37-426c-976e-cd0e7fdcf3c7","resolution":{"observed_at":"2026-08-15T21:15:59.515230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.521131Z","title":"Policy invariance under reward transforma- tions: Theory and application to reward shaping,","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.521131Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:e4cd44d27509834ec59e439121afadac7cf36c09bbe2b6eb15e7516f54e33ac5","observation_id":"373b9b0a-ee95-4973-9969-b4f351d66902","resolution":{"observed_at":"2026-08-15T21:15:59.521131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.530020Z","title":"Self-improving reactive agents based on reinforcement learning, plan- ning and teaching,","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.530020Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:4700e6f8cf57c5369d448aa531d4e954eb9efcf8c5cba1689d497c29126d5d62","observation_id":"d46664b3-7be0-4861-9f84-5e1cc92ec8ce","resolution":{"observed_at":"2026-08-15T21:15:59.530020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.537162Z","title":"Sample efficient actor-critic with experience replay,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.537162Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:f943cd5bc114e7a0eee59042b3595425a956bc40d2f604d03f2443942bf2bf08","observation_id":"badbb7e8-9f76-4d1f-946d-d40e6b9ec770","resolution":{"observed_at":"2026-08-15T21:15:59.537162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.545797Z","title":"Rainbow: Combining improvements in deep reinforcement learn- ing,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.545797Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:e36ee816f68efcbbb353821f5419ff2ce3ebca276bfa6e26a8067259a7f49343","observation_id":"63dc1484-2984-4929-8633-a13d189143e0","resolution":{"observed_at":"2026-08-15T21:15:59.545797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01275","last_updated":"2018-04-30T04:24:26Z","snapshot_observed_at":"2026-08-14T20:07:22.164941Z","submitted_at":"2017-12-04T06:03:26Z","title":"A Deeper Look at Experience Replay","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01275","snapshot_observed_at":"2026-08-15T21:15:59.552889Z","title":"A deeper look at experience replay,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.552889Z"},"links":{"cited_paper":"/paper/1712.01275","citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:c5667179c3f1243bba2ddbffafa41b391a48b9fccc974a2e3df05d35e03d2a2d","observation_id":"2c3f1207-1be5-45d3-911d-b2b49a2c82c4","resolution":{"observed_at":"2026-08-15T21:15:59.552889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.560650Z","title":"Revisiting fundamentals of experience replay,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.560650Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:32947939d51272036237a4090bd57d0860a27e6c963d7a14dffa21687b938193","observation_id":"a84b1911-47e9-4e67-8861-60e084505eb1","resolution":{"observed_at":"2026-08-15T21:15:59.560650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.571827Z","title":"Prioritized experience replay,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.571827Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:7788214960b08d72ce96beee9b7cdd22098ad8bec9ee8dfeb39ae10694d0ac94","observation_id":"2be1cbd3-8fe3-4fd6-b634-012b09fd6ff4","resolution":{"observed_at":"2026-08-15T21:15:59.571827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.579543Z","title":"Prioritized experience replay method based on experience reward,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.579543Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:567aadae4a18e8ad366d3326f5ba3bdd85ec432c2178dfa172bfc134512625eb","observation_id":"887dd01e-658c-4e6b-b6a4-58075e686d7d","resolution":{"observed_at":"2026-08-15T21:15:59.579543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.587135Z","title":"Model-augmented prioritized experience replay,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.587135Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:9506abc2dcf4b48f02452c6eab9674fb60fea9113d7806c573ce3e9ab5001cdc","observation_id":"bf2d5765-a429-4875-9021-55001a1a28f7","resolution":{"observed_at":"2026-08-15T21:15:59.587135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.593754Z","title":"Prioritized experience replay based on dynamics priority,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.593754Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:f931c08651faa283793e402750dc86768b197d2ae6de2564cdb0fe05112b7ef5","observation_id":"21827c24-b782-4c12-b54a-9cdff7bc22da","resolution":{"observed_at":"2026-08-15T21:15:59.593754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.600732Z","title":"Image augmentation is all you need: Reg- ularizing deep reinforcement learning from pixels,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.600732Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:e88f48c81d8ec8a2e814862b416a9bb950de266f2229b4afbea2928205d2f1d2","observation_id":"28880909-9ef5-4f2b-95e2-716081aa983e","resolution":{"observed_at":"2026-08-15T21:15:59.600732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.608644Z","title":"Temporal difference learning for model pre- dictive control,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.608644Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:14c930fb40422ccfcb4cb55f43d4d8f85b3bd714aea2e185563a3ac54f1d8802","observation_id":"bb3261a3-2354-4fab-9fa7-3b8d165774e3","resolution":{"observed_at":"2026-08-15T21:15:59.608644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.07888","last_updated":"2023-07-04T21:25:52Z","snapshot_observed_at":"2026-08-08T22:17:29.770172Z","submitted_at":"2020-09-16T18:38:54Z","title":"Transfer Learning in Deep Reinforcement Learning: A Survey","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.07888","snapshot_observed_at":"2026-08-15T21:15:59.617648Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.617648Z"},"links":{"cited_paper":"/paper/2009.07888","citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:e2ed08e3979217c3545a670b80d4f7ac3dc2910b05b0cd4a447e2a2a5db5b3aa","observation_id":"951eaa83-08f4-44f7-875d-a76e668421e0","resolution":{"observed_at":"2026-08-15T21:15:59.617648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-16T18:00:58.008096Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-15T21:15:59.629259Z","title":"Distilling the knowledge in a neural net- work,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.629259Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:3d7d9ce3091bfcb4ed7579ea4898a72dfb44ce071dd0c5253f1bf981aeae32b1","observation_id":"ac750a00-b921-4bb4-b3a7-bbb561a2299d","resolution":{"observed_at":"2026-08-15T21:15:59.629259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.642310Z","title":"Knowledge distillation: A survey,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.642310Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:b7660ef9408a8c26762b94e073e2efdb8c5c9754612d1d90b3bd9d640a86ec19","observation_id":"bbfd7cca-92d8-457e-8cdd-354b96510e35","resolution":{"observed_at":"2026-08-15T21:15:59.642310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.650908Z","title":"Teaching on a budget: Agents advising agents in rein- forcement learning,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.650908Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:e0ea8aba0940e8b0a3b9f629992d9764894b01b0b7340a1130e923d25f9c8228","observation_id":"f5b1d7c9-131f-4cb5-a799-62ab7283ce40","resolution":{"observed_at":"2026-08-15T21:15:59.650908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.661472Z","title":"Online transfer learning in reinforcement learning do- mains,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.661472Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:112fc81ce6e4a9375b251e4bb4aa974f47055bcf3a9ee98df93ce8c752d84c91","observation_id":"65a7e75e-8a59-4218-8d61-f9c10140c608","resolution":{"observed_at":"2026-08-15T21:15:59.661472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.673376Z","title":"A survey on transfer learning,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.673376Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:548789e2bbb450bb792a68b3482ae3daf483b6d40aece1e256ee8b9cb151a183","observation_id":"3fec6310-43f4-4baf-8400-abe9f017ca53","resolution":{"observed_at":"2026-08-15T21:15:59.673376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.682328Z","title":"Transfer learning for reinforcement learning domains: A survey.,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.682328Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:cad0528efd3eb6ae6afb798555827dfe1eb8a8e75bd63c3c611a784af3f0ccdc","observation_id":"f6b7be33-429f-4471-aff3-7e626e0f478c","resolution":{"observed_at":"2026-08-15T21:15:59.682328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15361","last_updated":"2024-12-12T09:06:56Z","snapshot_observed_at":"2026-08-21T05:27:25.275944Z","submitted_at":"2023-03-27T16:32:21Z","title":"A Comprehensive Survey on Test-Time Adaptation under Distribution Shifts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15361","snapshot_observed_at":"2026-08-15T21:15:59.692146Z","title":"A comprehensive survey on test-time adaptation under distribution shifts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.692146Z"},"links":{"cited_paper":"/paper/2303.15361","citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:f84b7cfd593312edfff11fe092d8012db297b903a43d0a7efb9a1accc83a79de","observation_id":"e75e4662-eb63-4180-9447-11933bcccff1","resolution":{"observed_at":"2026-08-15T21:15:59.692146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.701112Z","title":"A review of novelty detection,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.701112Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:3ffa9f9e8419abe0b49a137b7f243769bf881699a499c89e3d16657a06a9501d","observation_id":"7d2f22a2-1761-4126-a62a-7f75083599cc","resolution":{"observed_at":"2026-08-15T21:15:59.701112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.709383Z","title":"Towards a unifying framework for formal theories of novelty,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.709383Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:a06e96b6eb0a0ac0f0bfb9113769191441202da0524ad0e1d87869464d2986cc","observation_id":"558d6a72-f865-4a75-8344-4d1000c6f88c","resolution":{"observed_at":"2026-08-15T21:15:59.709383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.717946Z","title":"Open-world learning for radically autonomous agents,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.717946Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:87f2a192d193dc97702ceec5b687d860c4c593639b444ec3762d659cdcdcc11d","observation_id":"d4e83569-863d-413b-aa9a-e99ca2d53c82","resolution":{"observed_at":"2026-08-15T21:15:59.717946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.730032Z","title":"Mixtbn: A fully test-time adaptation method for visual reinforce- ment learning on robotic manipulation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.730032Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:5705c1bda9a3192dac211f9ac00d9c67d9ac7e8742e2fe481d7d6091813464da","observation_id":"13fd4986-b491-4ed7-a7f1-c23a1214b0f3","resolution":{"observed_at":"2026-08-15T21:15:59.730032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.745099Z","title":"Active test-time adaptation: Theoretical analyses and an algorithm,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.745099Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:a98c5a0af5a836d69c034325145e996b5aed57a66e34110e3a3f329e9281e8d7","observation_id":"506e06de-0f6c-4e4c-967b-c2cfd0644945","resolution":{"observed_at":"2026-08-15T21:15:59.745099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.754014Z","title":"Unknown sample discovery for source free open set domain adaptation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.754014Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:7d60ac94ec3ad71caff07dd1c5cf1224fde7d54e32eebb54feca19b0d03c58cd","observation_id":"d69bb3f9-5363-4488-9c46-4db95f5d3cff","resolution":{"observed_at":"2026-08-15T21:15:59.754014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.775138Z","title":"Hidden-mode markov decision processes for nonstationary sequential decision making,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.775138Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:9f46ce334bd360c50a8430883cea31c77a5aa38cc1f7d6da7f2515a1584a937e","observation_id":"86a5621a-af8d-4542-bd5d-eff244394314","resolution":{"observed_at":"2026-08-15T21:15:59.775138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.786510Z","title":"Choosing search heuristics by non-stationary reinforcement learn- ing,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.786510Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:7a01487d426fc221ad2f46472e7a3ffe4d38ef639e3d3e829a41231b430770ce","observation_id":"55f29354-0515-4d56-89dd-d7eb3a83b818","resolution":{"observed_at":"2026-08-15T21:15:59.786510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.799270Z","title":"Non-stationary reinforcement learning without prior knowledge: An optimal black-box approach,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.799270Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:77d4eb3b72cff74c3198bf98f09977675dec0f670683d62283de2f1fcfad21e1","observation_id":"15c88ad6-90e1-4269-8d00-b9cf1aa2b763","resolution":{"observed_at":"2026-08-15T21:15:59.799270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.811735Z","title":"Near-optimal model- free reinforcement learning in non-stationary episodic mdps,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.811735Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:408f4357901cf0ab9abe8ce0c74ccb6c8715b907296e8c849f526d3ce2e63608","observation_id":"6474dc5c-ee3b-41bb-88f1-bbf9ddcfd52e","resolution":{"observed_at":"2026-08-15T21:15:59.811735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.819317Z","title":"Non-stationary reinforcement learning under general function approximation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.819317Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:f2cce2a07ea6d9d1d37fab62dff85d685ac3bb238514b7698ed72f20538a1e47","observation_id":"68f75129-2aab-4295-b69a-6b5d0005fe42","resolution":{"observed_at":"2026-08-15T21:15:59.819317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.826698Z","title":"Addressing environment non-stationarity by repeat- ing q-learning updates,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.826698Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:f94543cd21337a9d22a411331975109f1841da93ecc6e9b3362b676a9abe2d49","observation_id":"f5ad77ed-1116-4b98-8967-2c6100a10b5d","resolution":{"observed_at":"2026-08-15T21:15:59.826698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.839173Z","title":"Non-stationary markov decision processes, a worst-case approach using model-based reinforcement learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.839173Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:1b461fd1b22d8ccd9a927a1e623369047d9122030cc61cf146f2668a4f61a388","observation_id":"4fd715e3-9bdb-4ef1-b845-316ab26f6ef8","resolution":{"observed_at":"2026-08-15T21:15:59.839173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.847130Z","title":"Reinforcement learning algorithm for non-stationary environments,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.847130Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:bf1bf80b1923ba4b0ba381a4eac5adeca99c8c7cb23561ec49762e59a45a0c00","observation_id":"9de3e21d-e44e-4e85-a7c4-4eb6ac2ec82a","resolution":{"observed_at":"2026-08-15T21:15:59.847130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.858236Z","title":"Reactive exploration to cope with non-stationarity in life- long reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.858236Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:891c8c0918cfa22d2135e804426a9ac012d03b2ed5670cda443105992a2ebfc3","observation_id":"575e6f73-7b01-44d9-a2c4-484e39a41db0","resolution":{"observed_at":"2026-08-15T21:15:59.858236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.872781Z","title":"Transfer in reinforcement learning: A framework and a survey,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.872781Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:2f9cb9bae269059b82b7f038eee33ff4e5ee581da375051c01f4e57fc93db554","observation_id":"3644160b-304e-427c-b30b-62cfa6749b00","resolution":{"observed_at":"2026-08-15T21:15:59.872781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.881669Z","title":"Cross-modal domain adaptation for cost-efficient visual reinforcement learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.881669Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:a5fe06e50f102ea32d754ba1a2de56d765c8116174e74e8c4766294fa01f3bf5","observation_id":"9389818f-b3cd-40fd-98a9-52b142a18d76","resolution":{"observed_at":"2026-08-15T21:15:59.881669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.889965Z","title":"Deep reinforcement learning amidst lifelong non- stationarity,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.889965Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:7b027b829e4fd36c76ae8e328923f8960e3733db8893ef684f53d2b8ab01bda1","observation_id":"7879d77e-0e4d-4cb7-9b88-f95b63e0c972","resolution":{"observed_at":"2026-08-15T21:15:59.889965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.900392Z","title":"Model-based nov- elty adaptation for open-world ai,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.900392Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:fa2d1c611bbb313aeee353e5bc6c1e120991123fc47d5dfcacde8ea266118ef6","observation_id":"56d56f0c-6e62-4b3d-b297-60328daf7490","resolution":{"observed_at":"2026-08-15T21:15:59.900392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.906124Z","title":"Detecting and adapting to novelty in games,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.906124Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:c847b972d864b62dd7e82470d7cd1ecf7efb52b94f2528db2e1609477185b6c6","observation_id":"139fd434-fe0d-47ba-a6de-b7b3fabcfcf2","resolution":{"observed_at":"2026-08-15T21:15:59.906124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.915271Z","title":"Spotter: Extending symbolic planning operators through targeted reinforcement learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.915271Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:3889cde4d1b37793ce5070b90d77f06662f7a1973dbcbb45757a6b50b4bd75e7","observation_id":"05e3ef52-8c99-4259-a8d1-4afd3b6bea1f","resolution":{"observed_at":"2026-08-15T21:15:59.915271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.929097Z","title":"An integrated architecture for online adaptation to novelty in open worlds using probabilistic programming and novelty-aware planning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.929097Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:32a25d5735dc3c06988c0ac68e9554f4af26c5c7e9b2c5921a3eadee581c1326","observation_id":"d3c11078-a8b5-47ed-a070-7c91546c2ea9","resolution":{"observed_at":"2026-08-15T21:15:59.929097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.938416Z","title":"Lifelong machine learning systems: Beyond learning algorithms,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.938416Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:6d2d873b68abc8125fd941cd96085924c65d15f9a71e11e26b8b9d22085cfca6","observation_id":"03e8f72d-2128-4d16-828f-768e541c3d4e","resolution":{"observed_at":"2026-08-15T21:15:59.938416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.947252Z","title":"Online learning and online convex optimization,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.947252Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:1f35f6f3d3329b23c66138bbde370b66a1c3423ad7845f569416fa9dedcbdffd","observation_id":"b634438a-fd1c-4970-9325-a0c36b931914","resolution":{"observed_at":"2026-08-15T21:15:59.947252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.955337Z","title":"Introduction to online convex optimization,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.955337Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:dc478fbc91faf6fe92bfa3526ee9233dc003f90d7421f6a20faaefb4fbae5ab0","observation_id":"a3890c45-8d6e-47ea-b98f-efa00d81004f","resolution":{"observed_at":"2026-08-15T21:15:59.955337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.963420Z","title":"Measuring catas- trophic forgetting in neural networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.963420Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:2be0766edc9aa327b1d4b67ec3f15eb59b4466b51de2cf7422e1778df2a6fe02","observation_id":"c74011aa-0093-46f0-b1c4-b3b7358044e2","resolution":{"observed_at":"2026-08-15T21:15:59.963420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.971825Z","title":"Memory efficient experience replay for streaming learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.971825Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:14b62297000d27daafcd75c221d2343b2c11810d7ca0e8af58a1ba3e1687e12f","observation_id":"af57c857-b637-430a-9a20-f7357cfd3fd8","resolution":{"observed_at":"2026-08-15T21:15:59.971825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.09536","last_updated":"2021-05-06T17:55:20Z","snapshot_observed_at":"2026-08-16T18:50:29.795403Z","submitted_at":"2021-01-23T17:23:08Z","title":"Memory-Efficient Semi-Supervised Continual Learning: The World is its Own Replay Buffer","version":2},"cited_work":{"arxiv_id":"2101.09536","doi":null,"metadata_source":"pith","pith_arxiv_id":"2101.09536","snapshot_observed_at":"2026-08-15T21:16:02.794253Z","title":"Memory-Efficient Semi-Supervised Continual Learning: The World is its Own Replay Buffer","venue":"cs.CV","work_id":"786896a4-2254-45e6-a2e9-971aff5cdc26","year":2021},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.979001Z"},"links":{"cited_paper":"/paper/2101.09536","citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:0c028f4cedfbb8e6ed700f5b8ca1a8c75afec529c4df3e89ace3020550ccfb98","observation_id":"333e7cbe-c8be-4d13-8436-cdb184485355","resolution":{"observed_at":"2026-08-15T21:16:02.803170Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.987683Z","title":"Reinforcement learning with gaussian pro- cesses,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.987683Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:79b417bb2f300025873a3315f062dcfcf33b93b0ff6330627df9d6b4932a53b9","observation_id":"0a5f28b3-0f63-4859-a0c3-c6671931149a","resolution":{"observed_at":"2026-08-15T21:15:59.987683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.994086Z","title":"Chevalier-Boisvert, L","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.994086Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:36698349633ab7d9010a199c302129bf10e7e8f64ae32bc52a485c78835d1b92","observation_id":"acd0dfca-ade8-4287-975d-c5ddbb3c3399","resolution":{"observed_at":"2026-08-15T21:15:59.994086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:00.004212Z","title":"A multi-agent simulator for generating novelty in monopoly,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:00.004212Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:8fa1acbb81a97c4f86bacdb584b3b31f8973f7af52298a92c91a0ae535ca4726","observation_id":"399c1633-f32f-4532-a424-8730b4830a13","resolution":{"observed_at":"2026-08-15T21:16:00.004212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:00.012629Z","title":"Novelty gen- eration framework for ai agents in angry birds style physics games,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:00.012629Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:8689ecdc6c1377c7bd8ab4cb6d0c559aac76f0b301f01e217f6bc0bb58d52906","observation_id":"f026a157-e36f-4327-9ee7-0c6efc7721b6","resolution":{"observed_at":"2026-08-15T21:16:00.012629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:00.018724Z","title":"Schmidhuber, A possibility for implementing curiosity and boredom in model- building neural controllers, 1991","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:00.018724Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:8753f4cbe61d9b51180159e1c6b8bbab078a67f3371f6b8cbed792bec30d3904","observation_id":"405165c0-6884-4373-b9d5-c509a3d9a614","resolution":{"observed_at":"2026-08-15T21:16:00.018724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-19T19:06:00.519715Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":99,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":246},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 100 of 246 outbound references and 0 inbound Pith citation observations for arXiv:2505.10330."}