{"as_of":"2026-08-10T19:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:100c700dfe6ac823a59ce8f07247cc268abaf800fe52c31519ee668e0c332570","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T15:52:16.912981Z","state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.04029/citation-record","integrity":"/paper/2606.04029/integrity","json":"/paper/2606.04029/citation-record.json","paper":"/paper/2606.04029"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1910.07113","last_updated":"2019-10-16T00:59:05Z","snapshot_observed_at":"2026-08-02T15:37:37.200292Z","submitted_at":"2019-10-16T00:59:05Z","title":"Solving Rubik's Cube with a Robot Hand","version":1},"cited_work":{"arxiv_id":"1910.07113","doi":"10.48550/arxiv.1910.07113","metadata_source":"pith","pith_arxiv_id":"1910.07113","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Solving Rubik's Cube with a Robot Hand","venue":"cs.LG","work_id":"81bf9cee-6de8-49f6-b967-3cb853e5ba67","year":2019},"citing_paper":{"arxiv_id":"2606.04029","last_updated":"2026-06-06T23:43:36Z","snapshot_observed_at":"2026-08-09T04:19:11.332111Z","submitted_at":"2026-06-01T19:40:10Z","title":"Position: Deployed Reinforcement Learning should be Continual","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T15:52:16.912981Z"},"links":{"cited_paper":"/paper/1910.07113","citing_paper":"/paper/2606.04029"},"observation_digest":"sha256:0188d71a3e142cbb094842a972a05ffc93e87b8f284a3e1950b39d42ed8da65c","observation_id":"92ccab8a-f15e-4d28-9476-90046d9d69f8","resolution":{"observed_at":"2026-07-01T21:56:16.602705Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-22T19:53:19.266123+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T19:53:19.266123+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":"1606.06565","doi":"10.48550/arxiv.1606.06565","metadata_source":"pith","pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Concrete Problems in AI Safety","venue":"cs.AI","work_id":"c8d14fbe-6eab-464a-95b3-778aabd82fa3","year":2016},"citing_paper":{"arxiv_id":"2606.04029","last_updated":"2026-06-06T23:43:36Z","snapshot_observed_at":"2026-08-09T04:19:11.332111Z","submitted_at":"2026-06-01T19:40:10Z","title":"Position: Deployed Reinforcement Learning should be Continual","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T15:52:16.912981Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2606.04029"},"observation_digest":"sha256:95020ae0f686cc2482b47eb7e76b1e756ca90fc61d0e2ae5228b075b4153cdf8","observation_id":"1ccad928-0bce-4314-9663-761a3bbb83a8","resolution":{"observed_at":"2026-07-01T21:56:16.611614Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:49:52.215761+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:49:52.215761+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06680","last_updated":"2019-12-13T19:56:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-12-13T19:56:40Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1912.06680","doi":"10.5281/zenodo.17096679","metadata_source":"pith","pith_arxiv_id":"1912.06680","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","venue":"cs.LG","work_id":"b047dc18-e9a3-4d11-8ff6-cd59d41a6357","year":2019},"citing_paper":{"arxiv_id":"2606.04029","last_updated":"2026-06-06T23:43:36Z","snapshot_observed_at":"2026-08-09T04:19:11.332111Z","submitted_at":"2026-06-01T19:40:10Z","title":"Position: Deployed Reinforcement Learning should be Continual","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T15:52:16.912981Z"},"links":{"cited_paper":"/paper/1912.06680","citing_paper":"/paper/2606.04029"},"observation_digest":"sha256:dd74ba32ac402356058213f6dc1d19cb595603d7f7f2db992b078f0655b5157f","observation_id":"7e0f079a-08c9-4156-aba2-3f4718d3a61a","resolution":{"observed_at":"2026-07-01T21:56:16.605017Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17401","last_updated":"2024-01-30T19:35:43Z","snapshot_observed_at":"2026-07-06T17:22:45.506107Z","submitted_at":"2024-01-30T19:35:43Z","title":"Step-size Optimization for Continual Learning","version":1},"cited_work":{"arxiv_id":"2401.17401","doi":"10.48550/arxiv.2401.17401","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.17401","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-size optimization for continual learning","venue":"arXiv (Cornell University)","work_id":"5e4ed761-3b2a-4bdf-b5ba-0731e2dd7b25","year":2024},"citing_paper":{"arxiv_id":"2606.04029","last_updated":"2026-06-06T23:43:36Z","snapshot_observed_at":"2026-08-09T04:19:11.332111Z","submitted_at":"2026-06-01T19:40:10Z","title":"Position: Deployed Reinforcement Learning should be Continual","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T15:52:16.912981Z"},"links":{"cited_paper":"/paper/2401.17401","citing_paper":"/paper/2606.04029"},"observation_digest":"sha256:a6487cbf3d7b8eed57506406f867a8e2a2f504bc2887597051325bcb39d23147","observation_id":"68d1d2e2-d849-4f29-9a5b-f21463cf11a4","resolution":{"observed_at":"2026-07-01T21:56:16.617758Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.04249","last_updated":"2026-07-28T18:40:16Z","snapshot_observed_at":"2026-08-09T13:53:02.575442Z","submitted_at":"2025-11-06T10:35:21Z","title":"Can Context Bridge the Reality Gap? Sim-to-Real Transfer of Context-Aware Policies","version":3},"cited_work":{"arxiv_id":"2511.04249","doi":"10.48550/arxiv.2511.04249","metadata_source":"arxiv_reference","pith_arxiv_id":"2511.04249","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Iannotta, Y","venue":"ArXiv.org","work_id":"354e4a85-bee4-43fb-8bc8-d90567821c49","year":2025},"citing_paper":{"arxiv_id":"2606.04029","last_updated":"2026-06-06T23:43:36Z","snapshot_observed_at":"2026-08-09T04:19:11.332111Z","submitted_at":"2026-06-01T19:40:10Z","title":"Position: Deployed Reinforcement Learning should be Continual","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T15:52:16.912981Z"},"links":{"cited_paper":"/paper/2511.04249","citing_paper":"/paper/2606.04029"},"observation_digest":"sha256:fb645d8db4fd036009b04ed93e2e3694da60f0c6eafce17754bcdbda24f383b5","observation_id":"b58becd8-7027-4610-86aa-c9d62f85c28e","resolution":{"observed_at":"2026-07-28T02:21:36.130719Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:52:16.912981Z","title":"Accessed: 2026-01-11","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.04029","last_updated":"2026-06-06T23:43:36Z","snapshot_observed_at":"2026-08-09T04:19:11.332111Z","submitted_at":"2026-06-01T19:40:10Z","title":"Position: Deployed Reinforcement Learning should be Continual","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T15:52:16.912981Z"},"links":{"citing_paper":"/paper/2606.04029"},"observation_digest":"sha256:823d5fcaac41a06189abbdf0b6006c4e2ee8c403bd58639e2675a3c84e236c70","observation_id":"935d409f-7b00-4f5d-b544-c4f65d3bc493","resolution":{"observed_at":"2026-06-28T15:52:16.912981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:52:16.912981Z","title":"Accessed: 2026-01-28","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.04029","last_updated":"2026-06-06T23:43:36Z","snapshot_observed_at":"2026-08-09T04:19:11.332111Z","submitted_at":"2026-06-01T19:40:10Z","title":"Position: Deployed Reinforcement Learning should be Continual","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T15:52:16.912981Z"},"links":{"citing_paper":"/paper/2606.04029"},"observation_digest":"sha256:2bd370193a0654d1dc62057577e518dd0d40f084bff27a01f61019a92366ca49","observation_id":"2ae664dc-5123-422c-ba52-fc1bebe5c3c7","resolution":{"observed_at":"2026-06-28T15:52:16.912981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.22764","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T21:56:16.621433Z","title":"In-Context Learning can Perform Continual Learning Like Humans.arXiv preprint 2509.22764,","venue":null,"work_id":"1ef7a4b2-f5dc-49b5-939e-746f36e4a822","year":null},"citing_paper":{"arxiv_id":"2606.04029","last_updated":"2026-06-06T23:43:36Z","snapshot_observed_at":"2026-08-09T04:19:11.332111Z","submitted_at":"2026-06-01T19:40:10Z","title":"Position: Deployed Reinforcement Learning should be Continual","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T15:52:16.912981Z"},"links":{"citing_paper":"/paper/2606.04029"},"observation_digest":"sha256:a4e7dc85ae5c4eb27d346c9d7e21a7f41ad8be48ade262cfe4a0fbc8c2aae30f","observation_id":"ec9c1a80-2451-4081-a511-6be0cac50fcf","resolution":{"observed_at":"2026-07-01T21:56:16.623050Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:52:16.912981Z","title":"Accessed: 2026-01-27","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.04029","last_updated":"2026-06-06T23:43:36Z","snapshot_observed_at":"2026-08-09T04:19:11.332111Z","submitted_at":"2026-06-01T19:40:10Z","title":"Position: Deployed Reinforcement Learning should be Continual","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T15:52:16.912981Z"},"links":{"citing_paper":"/paper/2606.04029"},"observation_digest":"sha256:eac0b5f73676355ffb286c14f188ceaafc1d03cd7de0201df34e8cf05ff2084f","observation_id":"7963899a-59d5-47d1-8b4b-416028041cfb","resolution":{"observed_at":"2026-06-28T15:52:16.912981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.03900","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.03900","snapshot_observed_at":"2026-07-01T21:56:16.626906Z","title":"and Ku, H","venue":null,"work_id":"5f8da0b8-e366-47c9-95ba-396e5d21c5bd","year":null},"citing_paper":{"arxiv_id":"2606.04029","last_updated":"2026-06-06T23:43:36Z","snapshot_observed_at":"2026-08-09T04:19:11.332111Z","submitted_at":"2026-06-01T19:40:10Z","title":"Position: Deployed Reinforcement Learning should be Continual","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T15:52:16.912981Z"},"links":{"cited_paper":"/paper/2507.03900","citing_paper":"/paper/2606.04029"},"observation_digest":"sha256:6df941460a15d6b0f05ff953d5027e454ab2ae0d5f4eec8e838b868de2b88313","observation_id":"7230b9cf-49f5-4521-825d-c050ed5b3d97","resolution":{"observed_at":"2026-07-01T21:56:16.628195Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:52:16.912981Z","title":"ualberta.ca/RLAI/rewardhypothesis","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.04029","last_updated":"2026-06-06T23:43:36Z","snapshot_observed_at":"2026-08-09T04:19:11.332111Z","submitted_at":"2026-06-01T19:40:10Z","title":"Position: Deployed Reinforcement Learning should be Continual","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T15:52:16.912981Z"},"links":{"citing_paper":"/paper/2606.04029"},"observation_digest":"sha256:98f75890a18bbd866ece464a4fd04b960b51a18447765a28cf7c11def00572ed","observation_id":"5a1215ce-7207-4bd3-b2cd-d9872d7d139d","resolution":{"observed_at":"2026-06-28T15:52:16.912981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.11173","last_updated":"2023-03-21T22:20:47Z","snapshot_observed_at":"2026-08-07T03:59:31.852666Z","submitted_at":"2022-08-23T20:02:09Z","title":"The Alberta Plan for AI Research","version":3},"cited_work":{"arxiv_id":"2208.11173","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2208.11173","snapshot_observed_at":"2026-07-04T19:30:07.299076Z","title":"arXiv preprint arXiv:2208.11173 , year=","venue":null,"work_id":"1a91e0c1-a8d0-47a7-9320-79c2224d1c5f","year":2022},"citing_paper":{"arxiv_id":"2606.04029","last_updated":"2026-06-06T23:43:36Z","snapshot_observed_at":"2026-08-09T04:19:11.332111Z","submitted_at":"2026-06-01T19:40:10Z","title":"Position: Deployed Reinforcement Learning should be Continual","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T15:52:16.912981Z"},"links":{"cited_paper":"/paper/2208.11173","citing_paper":"/paper/2606.04029"},"observation_digest":"sha256:dc49eda9d27b0efb847c9a7d2d5275c96b11adc4fe0ca791c7ad5daf61ed9e4a","observation_id":"5f31dce2-94e3-45c3-91de-18106c1baa28","resolution":{"observed_at":"2026-07-01T21:56:16.625429Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2606.04029","last_updated":"2026-06-06T23:43:36Z","snapshot_observed_at":"2026-08-09T04:19:11.332111Z","submitted_at":"2026-06-01T19:40:10Z","title":"Position: Deployed Reinforcement Learning should be Continual","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T15:52:16.912981Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2606.04029"},"observation_digest":"sha256:8424111ffc8b5241e8b913f57b0b25ae6177184f20724de7c6b0e47447f4357e","observation_id":"ad5cb1a3-aa96-40c4-bc86-1be31eb72f77","resolution":{"observed_at":"2026-07-01T21:56:16.614234Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15141","last_updated":"2022-11-06T01:29:38Z","snapshot_observed_at":"2026-07-06T13:58:02.046343Z","submitted_at":"2022-09-30T00:07:48Z","title":"On Convergence of Average-Reward Off-Policy Control Algorithms in Weakly Communicating MDPs","version":2},"cited_work":{"arxiv_id":"2209.15141","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2209.15141","snapshot_observed_at":"2026-07-01T21:56:16.606118Z","title":"and Sutton, R","venue":null,"work_id":"c2f6e198-7f61-455d-b100-05e5e6ca04f3","year":null},"citing_paper":{"arxiv_id":"2606.04029","last_updated":"2026-06-06T23:43:36Z","snapshot_observed_at":"2026-08-09T04:19:11.332111Z","submitted_at":"2026-06-01T19:40:10Z","title":"Position: Deployed Reinforcement Learning should be Continual","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T15:52:16.912981Z"},"links":{"cited_paper":"/paper/2209.15141","citing_paper":"/paper/2606.04029"},"observation_digest":"sha256:2fa30735210adbb65ace36420110e4172a2eb937ff2a1e2cd9b79ddd0760f634","observation_id":"57da014b-a1ab-4e2f-860b-dd73df5d1e51","resolution":{"observed_at":"2026-07-01T21:56:16.608428Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:52:16.912981Z","title":"The damping coefficient bt grows in a noisily quadratic manner over time, as shown in Figure 3 (Gaussian noise σ= 0.02 )","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2606.04029","last_updated":"2026-06-06T23:43:36Z","snapshot_observed_at":"2026-08-09T04:19:11.332111Z","submitted_at":"2026-06-01T19:40:10Z","title":"Position: Deployed Reinforcement Learning should be Continual","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T15:52:16.912981Z"},"links":{"citing_paper":"/paper/2606.04029"},"observation_digest":"sha256:96bb970aedeac970ef0b77e87acb5a9a8f660cc823dcaa85a2cfca557aa86b37","observation_id":"62716def-181e-40de-9008-4a5dd09ed3e7","resolution":{"observed_at":"2026-06-28T15:52:16.912981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.04029","last_updated":"2026-06-06T23:43:36Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T04:19:11.332111Z","submitted_at":"2026-06-01T19:40:10Z","title":"Position: Deployed Reinforcement Learning should be Continual"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":5,"verified_exact":7,"verified_fuzzy":0},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 0 inbound Pith citation observations for arXiv:2606.04029."}