{"as_of":"2026-08-20T13:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:683a5f307002516140eaacdd7697f420b0b53f96221ec5f50274ff25f991bcee","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:56:51.152652Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.06937/citation-record","integrity":"/paper/2501.06937/integrity","json":"/paper/2501.06937/citation-record.json","paper":"/paper/2501.06937"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:56:51.593311Z","title":null,"venue":null,"work_id":"4b09e385-165f-415a-8683-545b4ac7dd25","year":2001},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-19T12:44:49.581077Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.042565Z"},"links":{"citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:709048e7bdcf2a4d1d9aabb3461b3dfe6ad84c25d09fd8af42909387cb043f20","observation_id":"be150886-de80-4762-a6a8-42644b6bad6c","resolution":{"observed_at":"2026-08-10T20:56:51.596693Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:56:51.585022Z","title":"G., Naddaf, Y., Veness, J., and Bowling, M","venue":null,"work_id":"ca49f641-dda0-4fc2-8eb6-6b395f2fa59a","year":2013},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-19T12:44:49.581077Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.046887Z"},"links":{"citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:0eaeaa146ef3badd4d542bffa16b3f61db05f1e645fdf10daf7c157465b73770","observation_id":"93c12656-9030-4f74-8e1f-8cba2be7ec58","resolution":{"observed_at":"2026-08-10T20:56:51.587835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-13T12:26:05.192883Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-10T20:56:51.050601Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-19T12:44:49.581077Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.050601Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:cf3467dc5e7322d9bdbe10ee439611279c577d3b701437869f445e182ad8136e","observation_id":"d14898ed-0568-4795-a409-d931006dbf8c","resolution":{"observed_at":"2026-08-10T20:56:51.050601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:56:51.575750Z","title":null,"venue":null,"work_id":"684f721f-1233-4331-b339-6cec88c47358","year":2021},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-19T12:44:49.581077Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.055134Z"},"links":{"citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:65726bab5aa64828e1c41e50b2d78f423f4ca8ae771a9d7659860b237f372ad4","observation_id":"cbe57015-1b5f-430c-b418-b5b2bd07c762","resolution":{"observed_at":"2026-08-10T20:56:51.579136Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.06782","last_updated":"2017-11-18T00:53:20Z","snapshot_observed_at":"2026-08-19T11:11:38.304113Z","submitted_at":"2017-11-18T00:53:20Z","title":"Leave no Trace: Learning to Reset for Safe and Autonomous Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.06782","snapshot_observed_at":"2026-08-10T20:56:51.059025Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-19T12:44:49.581077Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.059025Z"},"links":{"cited_paper":"/paper/1711.06782","citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:c06c93a29336655cf055e7a6c45beeecd5633b0e45be2ffa34a8f7c9f44614af","observation_id":"d2fb5b3c-811c-4c25-bd61-bc90e63e0b63","resolution":{"observed_at":"2026-08-10T20:56:51.059025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:56:51.062911Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-19T12:44:49.581077Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.062911Z"},"links":{"citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:a4023702622dc208c7b36ee49aa44d6e0493814e2fc0d3208cf82c17d8b0ef65","observation_id":"4da91d0c-c520-49ec-9ea2-c098833d9a8e","resolution":{"observed_at":"2026-08-10T20:56:51.062911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:56:51.560697Z","title":"and Petrik, M","venue":null,"work_id":"01df76f1-5a1d-435d-b7b6-4c46e96f0f22","year":2024},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-19T12:44:49.581077Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.067089Z"},"links":{"citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:aa5d486775d60b2382fd36e54dabd19cb36a368decab86f3d5b1b158f1ff2121","observation_id":"e803cdbb-79e9-457f-8208-ec2546712ee9","resolution":{"observed_at":"2026-08-10T20:56:51.564149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-17T07:51:41.384508Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-10T20:56:51.070550Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-19T12:44:49.581077Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.070550Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:e38234a3dfc545f572c00dc4a52b1640da7078b7b86f05c0d826697c1e8826bb","observation_id":"cbebf486-942b-40e4-9eb7-2f4cadf725a9","resolution":{"observed_at":"2026-08-10T20:56:51.070550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01972","last_updated":"2024-08-04T09:26:00Z","snapshot_observed_at":"2026-08-16T13:28:42.076667Z","submitted_at":"2024-08-04T09:26:00Z","title":"RVI-SAC: Average Reward Off-Policy Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01972","snapshot_observed_at":"2026-08-10T20:56:51.074552Z","title":"and Ono, I","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-19T12:44:49.581077Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.074552Z"},"links":{"cited_paper":"/paper/2408.01972","citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:462a4cd07431dbb51ffc3eb1980961c2cd12483ad9c191be935626b5ec3c94fb","observation_id":"3577ed12-96a2-4ede-afe8-fbe2a3f4b295","resolution":{"observed_at":"2026-08-10T20:56:51.074552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-08-16T22:06:26.835611Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-10T20:56:51.078679Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-19T12:44:49.581077Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.078679Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:a9c678f49f872ef9f7355026368689e7c80dd27a5354f36aa25be0484cbf2464","observation_id":"5c5ea7ba-f326-4ded-8cca-75798e2af797","resolution":{"observed_at":"2026-08-10T20:56:51.078679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.03442","last_updated":"2021-11-01T03:53:25Z","snapshot_observed_at":"2026-08-17T12:32:53.813629Z","submitted_at":"2021-06-07T09:19:42Z","title":"Average-Reward Reinforcement Learning with Trust Region Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.03442","snapshot_observed_at":"2026-08-10T20:56:51.082564Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-19T12:44:49.581077Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.082564Z"},"links":{"cited_paper":"/paper/2106.03442","citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:2c4e02eebc6deb585a73d51fd902ac7642fb66fb44ac862f0e6d5ffd5c9bed02","observation_id":"0bc6b9d6-5972-481e-acdd-4019b2ad8d9a","resolution":{"observed_at":"2026-08-10T20:56:51.082564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:56:51.087603Z","title":"A., Veness, J., Bellemare, M","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-19T12:44:49.581077Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.087603Z"},"links":{"citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:f4c346f2f47cde13fd1cd97f62dda527e76cb3e3d559df1fc54b84852c653baf","observation_id":"835823a5-df91-487b-a6f5-ab970128cb0b","resolution":{"observed_at":"2026-08-10T20:56:51.087603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09999","last_updated":"2024-10-30T14:18:42Z","snapshot_observed_at":"2026-08-17T16:56:48.053689Z","submitted_at":"2024-05-16T11:33:49Z","title":"Reward Centering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09999","snapshot_observed_at":"2026-08-10T20:56:51.090784Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-19T12:44:49.581077Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.090784Z"},"links":{"cited_paper":"/paper/2405.09999","citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:1429ebdadd31a43bf687e7c53b76f9dbf663072ded4cfa0fa585526d34a995c6","observation_id":"9f9ef73d-43e4-433f-be92-dde05275b5d1","resolution":{"observed_at":"2026-08-10T20:56:51.090784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06306","last_updated":"2020-02-15T02:43:16Z","snapshot_observed_at":"2026-08-02T20:55:21.409228Z","submitted_at":"2020-02-15T02:43:16Z","title":"Jelly Bean World: A Testbed for Never-Ending Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06306","snapshot_observed_at":"2026-08-10T20:56:51.094911Z","title":"A., Saparov, A., and Mitchell, T","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-19T12:44:49.581077Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.094911Z"},"links":{"cited_paper":"/paper/2002.06306","citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:ca79cd7e665b40e21ff631701977b8d5ec229cf62440558818db1a00f3b2e2a8","observation_id":"9822b3bd-4d1c-4ac9-84f5-6723d589abaa","resolution":{"observed_at":"2026-08-10T20:56:51.094911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:56:51.545443Z","title":null,"venue":null,"work_id":"500a4843-442d-453d-b186-1c2b4cfbf0d8","year":2014},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-19T12:44:49.581077Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.098506Z"},"links":{"citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:16e3e85380f76d6574183ffbb2ed506e0dbfae2ad31fe6031a6495d3f1c2c24b","observation_id":"b3a91d80-5572-4fc1-a42c-e842cb5e85ba","resolution":{"observed_at":"2026-08-10T20:56:51.549244Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:56:51.535232Z","title":null,"venue":null,"work_id":"8a252b40-f707-495b-b1ee-87bb22e5aa01","year":2023},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-19T12:44:49.581077Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.101851Z"},"links":{"citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:d0d967a0fbc82d82eb9a98048b5be8487ba288cfce40908bd77e890c66e450ae","observation_id":"b351cda6-3d10-4448-9656-c9523f29e2ad","resolution":{"observed_at":"2026-08-10T20:56:51.538881Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-10T20:56:51.104986Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-19T12:44:49.581077Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.104986Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:961d7841d4a51763d0600b24510824dcf5461707098c02f873c263835f65858b","observation_id":"519c400b-9380-42fe-89b6-375b81f9ba7a","resolution":{"observed_at":"2026-08-10T20:56:51.104986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:56:51.524996Z","title":null,"venue":null,"work_id":"9d09ba68-32c0-4efb-857d-e54c54934881","year":2021},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-19T12:44:49.581077Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.108332Z"},"links":{"citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:c411049caf524ff97b40e3ff45b483c9996b896d3439fe16311253ae677dc665","observation_id":"f765d528-5c76-4c55-892f-ea08522312a1","resolution":{"observed_at":"2026-08-10T20:56:51.528853Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:56:51.515121Z","title":null,"venue":null,"work_id":"86c92b04-e345-43a9-b642-81614802ce54","year":2022},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-19T12:44:49.581077Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.111420Z"},"links":{"citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:9d778785aac264d2955c5b39a76f42b2761986efddd8fb6c685209fd61a296c1","observation_id":"7d38b37d-f827-444a-9ddb-b1a33c365145","resolution":{"observed_at":"2026-08-10T20:56:51.518642Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:56:51.114743Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-19T12:44:49.581077Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.114743Z"},"links":{"citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:c9f6a6f71825b5d91c167d6e460d96dd3b24192afc49f367dcb738f6598f8e1b","observation_id":"fb175955-ecca-48b7-8b67-7ef70bbd0fc0","resolution":{"observed_at":"2026-08-10T20:56:51.114743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:56:51.117972Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-19T12:44:49.581077Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.117972Z"},"links":{"citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:800086dcb7a0644ed5be4201099f515c47fa0d70e5e6d9cfc8e511f008a31e87","observation_id":"a58ef605-33d2-43b5-97bb-51781700d1d0","resolution":{"observed_at":"2026-08-10T20:56:51.117972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-08-13T22:24:37.672685Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-10T20:56:51.121085Z","title":"U., De Cola, G., Deleu, T., Goul \\ a o, M., Kallinteris, A., Krimmel, M., KG, A., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-19T12:44:49.581077Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.121085Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:c865860bcb27ea738ed8f2d1fc2e720f34c0e40f90824d029c7b4972310b4306","observation_id":"3fcd1410-718a-4941-88da-70582473c74f","resolution":{"observed_at":"2026-08-10T20:56:51.121085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:56:51.494870Z","title":null,"venue":null,"work_id":"0a22eaf2-4455-41a2-97dc-727f025e1595","year":2021},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-19T12:44:49.581077Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.124304Z"},"links":{"citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:2fdaf6266ad78235d6f78ab89e4a324aa47a6835db97760e6f82199a4203a444","observation_id":"32099d3d-34fd-4afb-9ad3-424c62f33400","resolution":{"observed_at":"2026-08-10T20:56:51.498595Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:56:51.484109Z","title":"and Ross, K","venue":null,"work_id":"7065b9d3-c897-4644-a0c1-9f511c26f7ee","year":2021},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-19T12:44:49.581077Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.127557Z"},"links":{"citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:72d4aaa0aa2adf4855ab58be6c261bfcb29a7438f72322224ec037defc6a7c51","observation_id":"c768aa35-d9c8-4e8c-b19c-23112d861c4f","resolution":{"observed_at":"2026-08-10T20:56:51.488242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:56:51.473346Z","title":null,"venue":null,"work_id":"5598b9e8-884d-4286-8e36-a9988a13759b","year":2022},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-19T12:44:49.581077Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.130679Z"},"links":{"citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:bf4b8a515ae8262fb072728fcd74429172b67168ccd628e2f85003537cb17507","observation_id":"05517a7e-0d4f-4860-88f3-f56349d0ec11","resolution":{"observed_at":"2026-08-10T20:56:51.477254Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.12570","last_updated":"2020-04-27T03:36:10Z","snapshot_observed_at":"2026-08-09T09:30:54.167911Z","submitted_at":"2020-04-27T03:36:10Z","title":"The Ingredients of Real-World Robotic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.12570","snapshot_observed_at":"2026-08-10T20:56:51.133757Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-19T12:44:49.581077Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.133757Z"},"links":{"cited_paper":"/paper/2004.12570","citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:e33049725604b73a9100a9be2f1b469bdbfd49ddf5d8ed574f57094a32db46ca","observation_id":"3c0fb13f-2a7f-4cd3-ae6c-34f461c50e48","resolution":{"observed_at":"2026-08-10T20:56:51.133757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03814","last_updated":"2024-09-02T05:18:49Z","snapshot_observed_at":"2026-08-16T14:37:04.288625Z","submitted_at":"2023-12-06T18:29:23Z","title":"Pearl: A Production-ready Reinforcement Learning Agent","version":2},"cited_work":{"arxiv_id":"2312.03814","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.03814","snapshot_observed_at":"2026-08-10T20:56:51.348417Z","title":"Pearl: A Production-ready Reinforcement Learning Agent","venue":"cs.LG","work_id":"113d8411-736b-4e02-b2f3-c20e20f2380b","year":2023},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-19T12:44:49.581077Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.137298Z"},"links":{"cited_paper":"/paper/2312.03814","citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:1cc40ee6c77afef2a05ef56956f28cc60bc1ff55a579996ce2ad8a9d7232bc59","observation_id":"47f1ddd2-023b-4c39-8c16-9f6ae5e4777a","resolution":{"observed_at":"2026-08-10T20:56:51.352949Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:56:51.141171Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-19T12:44:49.581077Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.141171Z"},"links":{"citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:575cc555f6ca968ecf4c5674832b331ff2ae3138702b7d7d0eac6ff2576cce9f","observation_id":"e88cee22-f087-413d-a8ff-26293f0d462b","resolution":{"observed_at":"2026-08-10T20:56:51.141171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:56:51.145296Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-19T12:44:49.581077Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.145296Z"},"links":{"citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:3e40fabcff91d05bf407bacd370f636f8c74038429bbf4d05dcc5e4dc4a5904f","observation_id":"432d02ac-23d8-4d74-b0e4-b4f2566d4be1","resolution":{"observed_at":"2026-08-10T20:56:51.145296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:56:51.149172Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-19T12:44:49.581077Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.149172Z"},"links":{"citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:dd6b613dd79f3a910aee841462eb683d30c4ac72dddec505c3703f4f152581b3","observation_id":"0c86f820-0284-474a-ba05-541e0913f5ac","resolution":{"observed_at":"2026-08-10T20:56:51.149172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"refactor/0000775","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:56:51.331009Z","title":"yF࡞g5. t]k e_kx kϣ], [#>3,>Mj <3oseӡ؎O޲ 7v 10 ΓZ Snc ay xط<Xت֬2/̡ Z̄峖G?Y[x=S c _ZSFX3#v)7n֎a | t 6IͰ|q֎Ğb /eev .Jj 6 4^ D[OVY L |axj ?#+#ڱ 44 . T c 7 W O &# O` !ң ծ [bY ncMj .0^?","venue":null,"work_id":"3f608554-68e5-46c8-aa3b-6f0fe02712b1","year":null},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-19T12:44:49.581077Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.152652Z"},"links":{"citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:e93ea846abb8a1f73cc653290742d19146188d754a0dfeaad4d76ebc4b504361","observation_id":"152e618d-2879-4b74-bba0-39abe64e30a6","resolution":{"observed_at":"2026-08-10T20:56:51.337592Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-19T12:44:49.581077Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":1,"verified_fuzzy":3},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2501.06937."}