{"as_of":"2026-08-20T08:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a3887f0264175114dc7717420ec64fe843daf9063db622886d07a1fa51ee1747","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T05:19:09.239168Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T05:22:09.716785Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-11T13:25:20.593899Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.01500","snapshot_observed_at":"2026-08-12T05:22:09.716785Z","title":"rlpyt: A research code base for deep reinforcement learning in pytorch,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2412.00534","last_updated":"2024-11-30T16:56:29Z","snapshot_observed_at":"2026-08-19T07:09:01.000062Z","submitted_at":"2024-11-30T16:56:29Z","title":"Towards Fault Tolerance in Multi-Agent Reinforcement Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T05:22:09.716785Z"},"links":{"cited_paper":"/paper/1909.01500","citing_paper":"/paper/2412.00534"},"observation_digest":"sha256:62f8c1a9a4ccc4cea0daf2fe6a4f2a565244cdb53ea848a50b2d693d5a31c637","observation_id":"5130b66b-b7bf-41fc-a2e8-19851e9801e3","resolution":{"observed_at":"2026-08-12T05:22:09.716785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"cited_work":{"arxiv_id":"1909.01500","doi":null,"metadata_source":"pith","pith_arxiv_id":"1909.01500","snapshot_observed_at":"2026-08-11T13:25:20.593899Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","venue":"cs.LG","work_id":"46215338-1efd-4947-8703-f2bbc783135f","year":2019},"citing_paper":{"arxiv_id":"2412.13184","last_updated":"2024-12-17T18:58:00Z","snapshot_observed_at":"2026-08-19T07:09:05.272596Z","submitted_at":"2024-12-17T18:58:00Z","title":"Tilted Quantile Gradient Updates for Quantile-Constrained Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T13:25:20.502923Z"},"links":{"cited_paper":"/paper/1909.01500","citing_paper":"/paper/2412.13184"},"observation_digest":"sha256:e01913009ac78e31147e296db77084f48b657668ed9b91769a77181ec5286e2c","observation_id":"b0bd5300-83ce-46a4-98d1-076dbd8826fe","resolution":{"observed_at":"2026-08-11T13:25:20.601321Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/1909.01500/citation-record","integrity":"/paper/1909.01500/integrity","json":"/paper/1909.01500/citation-record.json","paper":"/paper/1909.01500"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-08-17T17:19:33.060917Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-14T05:19:09.072128Z","title":"Playing atari with deep reinforcement learning","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.072128Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:d4a0788dca5854535fee133148172f4cead1e4790dcc98beeec6a89052c25ff0","observation_id":"ee727af1-0c2d-4cf6-8fd0-270121f07507","resolution":{"observed_at":"2026-08-14T05:19:09.072128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T05:19:09.078409Z","title":"Trust region policy optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.078409Z"},"links":{"citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:0c31d62785609cc04714e20582f5cfb9fa0bf938e7315e74935e590a3e221521","observation_id":"4c79b4e0-7a25-4270-98e1-6f6823e0cc88","resolution":{"observed_at":"2026-08-14T05:19:09.078409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T05:19:09.083402Z","title":"Automatic differentiation in PyTorch","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.083402Z"},"links":{"citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:9edb154afa0d6cdd78b6f6e513bf85502cc96a0fdfa039c79add0fe1b95106b0","observation_id":"40dfdb77-ff30-4630-9d08-5721f4fe8af0","resolution":{"observed_at":"2026-08-14T05:19:09.083402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T05:19:09.769098Z","title":"Alphastar","venue":null,"work_id":"83ec11aa-5017-4c23-baf2-990d2e8ba84b","year":2019},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.088307Z"},"links":{"citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:6eed6aebdb977146e96dc9220a28ae112f3bee91af11cd945e99d64011799ea7","observation_id":"0ce29919-2576-4037-89bd-dfdadb2617f1","resolution":{"observed_at":"2026-08-14T05:19:09.774152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T05:19:09.093052Z","title":"Openai ﬁve","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.093052Z"},"links":{"citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:9d9f26b3255ad21cdb76e12adb389cc8fa026c2e839aadcd8d394b5b2d40c792","observation_id":"7341aaff-8341-4d70-a4f8-7a0501821e62","resolution":{"observed_at":"2026-08-14T05:19:09.093052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T05:19:09.742848Z","title":"Recurrent experience replay in distributed reinforcement learning","venue":null,"work_id":"ae516e58-31f8-47af-97a6-c4825208d070","year":2018},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.097276Z"},"links":{"citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:cc51ad58808aacd9e28a531510b20c678760252114b173de6d28efbe74c9a707","observation_id":"532c3c91-0ed4-417b-8fda-182bfec2589a","resolution":{"observed_at":"2026-08-14T05:19:09.747802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T05:19:09.102296Z","title":"Openai gym, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.102296Z"},"links":{"citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:0e807b6758cc821137b0faf74919a71c85179a4797f28bfa15f0a488c6847c36","observation_id":"05be1ce0-186d-4ea7-8abd-cdabb46eced9","resolution":{"observed_at":"2026-08-14T05:19:09.102296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T05:19:09.106629Z","title":"Asynchronous methods for deep reinforcement learning","venue":null,"work_id":null,"year":1928},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.106629Z"},"links":{"citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:186631def322e1fb6d43d78b6f8fa1ba14cc053fc29220122ebe267a39a617d4","observation_id":"91b2453c-1b24-42e0-bb52-358795a52a8f","resolution":{"observed_at":"2026-08-14T05:19:09.106629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-14T05:19:09.111092Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.111092Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:ecd477ea9a3fb3691a7b60346d6466b5062858e2daf0f9296f70c24be6aeeded","observation_id":"433f9895-e312-4791-b09f-f74779a9cc46","resolution":{"observed_at":"2026-08-14T05:19:09.111092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T05:19:09.707585Z","title":"Deep reinforcement learning with double q-learning","venue":null,"work_id":"bde2ab4f-8edd-4ce3-bce2-2fb5efc4c413","year":2016},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.115999Z"},"links":{"citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:baf96f323f4eddbdace1aa27d50120f0949e4e134795ea6a1465b684fa882f58","observation_id":"31e71905-a7b0-4fc4-ad7d-06ce1bd82dec","resolution":{"observed_at":"2026-08-14T05:19:09.712516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06581","last_updated":"2016-04-05T09:03:06Z","snapshot_observed_at":"2026-08-18T06:21:07.128252Z","submitted_at":"2015-11-20T13:07:54Z","title":"Dueling Network Architectures for Deep Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06581","snapshot_observed_at":"2026-08-14T05:19:09.121127Z","title":"Dueling network architectures for deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.121127Z"},"links":{"cited_paper":"/paper/1511.06581","citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:1cfde00ef5c5a15a76987a41fe1a4a6ce9cec35be919ccd09895cf1ab97ef6b1","observation_id":"ac7a8f62-c5ea-4d1e-9fe4-c26c5c789f60","resolution":{"observed_at":"2026-08-14T05:19:09.121127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T05:19:09.692030Z","title":"A distributional perspective on reinforce- ment learning","venue":null,"work_id":"33fe4429-3168-4622-9e9b-95ab64dc0db3","year":2017},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.126224Z"},"links":{"citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:f4bd16fee370b3d5d8b6df08e1dfa2298269976a8dac08361d2d6128d9e0f5c6","observation_id":"8067a7a9-2fed-4f15-b86b-375b2c35d75b","resolution":{"observed_at":"2026-08-14T05:19:09.697643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T05:19:09.674994Z","title":"Rainbow: Combining improvements in deep reinforcement learning","venue":null,"work_id":"198c1e6a-7406-4a30-8d8a-40c6a4b043f8","year":2018},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.130655Z"},"links":{"citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:1ce9f8d6da1ff668d66762ceab9c0f59b4f6b581dbf26ee2f1997cb505825bbe","observation_id":"2cb9aac9-b65d-4d20-a1f5-711632c8cb6d","resolution":{"observed_at":"2026-08-14T05:19:09.680384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.00933","last_updated":"2018-03-02T16:21:46Z","snapshot_observed_at":"2026-08-14T19:40:13.717780Z","submitted_at":"2018-03-02T16:21:46Z","title":"Distributed Prioritized Experience Replay","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.00933","snapshot_observed_at":"2026-08-14T05:19:09.134917Z","title":"Distributed prioritized experience replay","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.134917Z"},"links":{"cited_paper":"/paper/1803.00933","citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:f4352603cdf4ff11f071e8da88f48978f875b8bfb2599f847a60b120ccd5a12e","observation_id":"20c04ee0-549f-4d4d-93a7-531168ba3ab4","resolution":{"observed_at":"2026-08-14T05:19:09.134917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.06923","last_updated":"2018-06-14T14:28:37Z","snapshot_observed_at":"2026-08-19T07:10:19.138790Z","submitted_at":"2018-06-14T14:28:37Z","title":"Implicit Quantile Networks for Distributional Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.06923","snapshot_observed_at":"2026-08-14T05:19:09.139219Z","title":"Implicit quantile networks for distributional reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.139219Z"},"links":{"cited_paper":"/paper/1806.06923","citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:ca6f153ade53af62ddd4d2d7883c9aae5dd0446c274562476406dac40e147768","observation_id":"d8e12ed6-839e-455c-a176-fc0925a7dd36","resolution":{"observed_at":"2026-08-14T05:19:09.139219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T05:19:09.144002Z","title":"Continuous deep q-learning with model-based acceleration","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.144002Z"},"links":{"citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:76b9c0b2f9809ce2f28c8491547bed644a0cc62c0d9e15f539a4501b69f367e0","observation_id":"db2b5157-2bbd-472a-a24d-654f0c7d5180","resolution":{"observed_at":"2026-08-14T05:19:09.144002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.09477","last_updated":"2018-10-22T17:37:07Z","snapshot_observed_at":"2026-08-17T01:05:22.671331Z","submitted_at":"2018-02-26T17:54:49Z","title":"Addressing Function Approximation Error in Actor-Critic Methods","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.09477","snapshot_observed_at":"2026-08-14T05:19:09.148298Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.148298Z"},"links":{"cited_paper":"/paper/1802.09477","citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:01c5eba3de67b5af77cd6670d93d6883bf0696901f717633dbfd3432b41f3982","observation_id":"9753ee44-b572-4930-9919-d3b185e347d4","resolution":{"observed_at":"2026-08-14T05:19:09.148298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01290","last_updated":"2018-08-08T21:27:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-01-04T09:50:50Z","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.01290","snapshot_observed_at":"2026-08-14T05:19:09.153918Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.153918Z"},"links":{"cited_paper":"/paper/1801.01290","citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:5ca66971cffb721a3de6d936865d1e8c588c22962548a0f74e36f3fe8205c448","observation_id":"42ad99cc-37ac-44f4-808c-feb29af19c4b","resolution":{"observed_at":"2026-08-14T05:19:09.153918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-17T07:51:41.384508Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-14T05:19:09.159727Z","title":"Soft actor-critic algorithms and applications","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.159727Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:562d23d24d01ac8c2c18407b78c0a4476ab6ea9ef21232c63e5cbe19317257e9","observation_id":"dd02575e-29ed-425d-a429-d737560c5d33","resolution":{"observed_at":"2026-08-14T05:19:09.159727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.08617","last_updated":"2018-04-23T11:57:21Z","snapshot_observed_at":"2026-08-16T07:35:11.886692Z","submitted_at":"2018-04-23T11:57:21Z","title":"Distributed Distributional Deterministic Policy Gradients","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.08617","snapshot_observed_at":"2026-08-14T05:19:09.165087Z","title":"Distributed distributional deterministic policy gradients","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.165087Z"},"links":{"cited_paper":"/paper/1804.08617","citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:058a9ca4bee87d28c7c82f1e3eba990779c1986cf1afbef14af0d02d4ce6a7d4","observation_id":"c8413eae-e346-4bcd-8e46-3e269d1fa5cb","resolution":{"observed_at":"2026-08-14T05:19:09.165087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05952","last_updated":"2016-02-25T17:55:31Z","snapshot_observed_at":"2026-08-15T17:33:32.559096Z","submitted_at":"2015-11-18T20:54:44Z","title":"Prioritized Experience Replay","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05952","snapshot_observed_at":"2026-08-14T05:19:09.170057Z","title":"Prioritized experience replay","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.170057Z"},"links":{"cited_paper":"/paper/1511.05952","citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:c5f3e2364bb0c38d0c2a22175fb5e822f0a216011e94bd81837c31b7f1c637bd","observation_id":"7bc417dd-f7dc-4eaa-9d4a-58301850b34d","resolution":{"observed_at":"2026-08-14T05:19:09.170057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T05:19:09.174352Z","title":"The arcade learning environment: An evaluation platform for general agents","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.174352Z"},"links":{"citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:291225cc07d48f54510e416c5f7392af9902f4470333335a7e28c337350a9454","observation_id":"8db25fa9-0c94-4297-919e-579686a8bd8e","resolution":{"observed_at":"2026-08-14T05:19:09.174352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T05:19:09.178979Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.178979Z"},"links":{"citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:f433679ba39ead4a5d2aa5cf3062345de9fcf4ea096243df9bc101db600404c8","observation_id":"98c0d123-7b6c-40aa-98f9-fa478a6dd09d","resolution":{"observed_at":"2026-08-14T05:19:09.178979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.02811","last_updated":"2019-01-10T20:48:11Z","snapshot_observed_at":"2026-08-18T07:59:54.298447Z","submitted_at":"2018-03-07T18:39:12Z","title":"Accelerated Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.02811","snapshot_observed_at":"2026-08-14T05:19:09.183570Z","title":"Accelerated methods for deep reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.183570Z"},"links":{"cited_paper":"/paper/1803.02811","citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:8dac7bf9674d90cf22f73187fea0cc7c8423623ddea220820b7dbd1e7390c063","observation_id":"2b9a4144-fef1-4762-9cb8-74f30c148890","resolution":{"observed_at":"2026-08-14T05:19:09.183570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T05:19:09.630117Z","title":"Openai spinning up","venue":null,"work_id":"820834ed-d08d-4b9a-a593-58d1d79a507b","year":2018},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.188465Z"},"links":{"citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:df49df8a44ba2d3f12520e21158822e8316eb36b54012acf6026279b5a62e8f5","observation_id":"4f22f19d-c9e5-4953-802e-27a8fea1562f","resolution":{"observed_at":"2026-08-14T05:19:09.635508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1211.5590","last_updated":"2012-11-23T20:42:41Z","snapshot_observed_at":"2026-08-16T13:34:08.462158Z","submitted_at":"2012-11-23T20:42:41Z","title":"Theano: new features and speed improvements","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1211.5590","snapshot_observed_at":"2026-08-14T05:19:09.193455Z","title":"Theano: new features and speed improvements","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.193455Z"},"links":{"cited_paper":"/paper/1211.5590","citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:68b53a6b1e487f443f3bc53b76940e9bfd3c3f20d5de2701db892da01373fe10","observation_id":"89e8521c-c76f-4522-a235-5b25ad259f33","resolution":{"observed_at":"2026-08-14T05:19:09.193455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.06162","last_updated":"2018-12-14T20:49:09Z","snapshot_observed_at":"2026-08-14T17:43:20.166812Z","submitted_at":"2018-12-14T20:49:09Z","title":"An Empirical Model of Large-Batch Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.06162","snapshot_observed_at":"2026-08-14T05:19:09.198199Z","title":"An empirical model of large-batch training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.198199Z"},"links":{"cited_paper":"/paper/1812.06162","citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:ac5e5b13b4d0617562550f69fbd360ea6b8a671825228171edd435f5f8c0767f","observation_id":"608edfe3-7719-4b08-bf07-bfc6426c76be","resolution":{"observed_at":"2026-08-14T05:19:09.198199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T05:19:09.202760Z","title":"Benchmarking deep reinforcement learning for continuous control","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.202760Z"},"links":{"citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:2aa2087bc63e4c47c8faa3e1e20d6277e53830b1259035625ea9365b6a21bc96","observation_id":"1ebe22d1-d061-47ae-9489-d88134d99935","resolution":{"observed_at":"2026-08-14T05:19:09.202760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T05:19:09.605379Z","title":"Openai baselines","venue":null,"work_id":"0b756797-81c2-4bd3-9820-9860f47aa020","year":2017},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.207543Z"},"links":{"citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:296859b0e6b47632af256cd39de0df193f4d0eb89fbc8dce3983acf818b5bb47","observation_id":"0de24811-f854-4f53-8642-34621f9224a2","resolution":{"observed_at":"2026-08-14T05:19:09.609831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.06110","last_updated":"2018-12-14T19:03:38Z","snapshot_observed_at":"2026-08-14T19:03:45.460809Z","submitted_at":"2018-12-14T19:03:38Z","title":"Dopamine: A Research Framework for Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.06110","snapshot_observed_at":"2026-08-14T05:19:09.211753Z","title":"Dopamine: A research framework for deep reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.211753Z"},"links":{"cited_paper":"/paper/1812.06110","citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:3c89cc3a6d979f1813f6207e08b67b879f99b89bc86f477b8760fb036ccbc3d5","observation_id":"79b021e3-4ea5-4886-b20f-e5b9d1ff7f70","resolution":{"observed_at":"2026-08-14T05:19:09.211753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T05:19:09.590099Z","title":"Tensorﬂow: A system for large-scale machine learning","venue":null,"work_id":"7f3a881a-a4a1-47e5-8740-5ef781bc6182","year":2016},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.215961Z"},"links":{"citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:aaacd96c6ea144c73aafdbacddb26c3f8c2cf4e59072829cfbc36cbff343b81f","observation_id":"b0761670-d21a-4574-b7d2-54a1d3ef2a3c","resolution":{"observed_at":"2026-08-14T05:19:09.594816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.09381","last_updated":"2018-06-29T00:19:24Z","snapshot_observed_at":"2026-08-14T20:00:00.450392Z","submitted_at":"2017-12-26T19:43:59Z","title":"RLlib: Abstractions for Distributed Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.09381","snapshot_observed_at":"2026-08-14T05:19:09.220509Z","title":"Ray rllib: A composable and scalable reinforcement learning library","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.220509Z"},"links":{"cited_paper":"/paper/1712.09381","citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:0df490fba97a37c7ed4fc20dbbb37f5dcb09020d417e2a848e9f307c507838c3","observation_id":"723cded4-26b8-4ade-a27c-b71d298e3f7f","resolution":{"observed_at":"2026-08-14T05:19:09.220509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T05:19:09.574999Z","title":"Ray: A distributed framework for emerging{AI} applications","venue":null,"work_id":"1fedcd60-f5dc-4385-88ca-4fbab75e9c42","year":2018},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.225505Z"},"links":{"citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:2289e6ed02eaea53f57515cb135f939bede0724fe41107033dd8cf38900fa44c","observation_id":"19b4a751-53ef-4531-8ffc-363a2908f03a","resolution":{"observed_at":"2026-08-14T05:19:09.580166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00260","last_updated":"2019-09-04T19:30:00Z","snapshot_observed_at":"2026-08-14T19:23:21.694743Z","submitted_at":"2018-11-01T07:02:45Z","title":"Horizon: Facebook's Open Source Applied Reinforcement Learning Platform","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00260","snapshot_observed_at":"2026-08-14T05:19:09.230237Z","title":"Horizon: Facebook’s open source applied reinforcement learning platform","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.230237Z"},"links":{"cited_paper":"/paper/1811.00260","citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:bfa26e2c7c3b5a7c9dcbd0827b20bb827e7862274a134e78b9a3f3da655498e0","observation_id":"3f75761d-a2b1-46fb-8592-5ef783c64fe5","resolution":{"observed_at":"2026-08-14T05:19:09.230237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T05:19:09.556124Z","title":"Hogwild: A lock-free approach to parallelizing stochastic gradient descent","venue":null,"work_id":"1b2bb886-c856-485a-820c-60a0a95b1349","year":2011},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.235111Z"},"links":{"citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:dfafe18c4f2c88158b0b4f5248016fa8fc34df4f1dcadd30551c096dcabb08de","observation_id":"21dae2e6-90c6-4ae4-b291-86cce34f19dd","resolution":{"observed_at":"2026-08-14T05:19:09.563270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1410.0759","last_updated":"2014-12-18T01:13:16Z","snapshot_observed_at":"2026-08-14T23:17:07.466378Z","submitted_at":"2014-10-03T06:16:43Z","title":"cuDNN: Efficient Primitives for Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1410.0759","snapshot_observed_at":"2026-08-14T05:19:09.239168Z","title":"cudnn: Efﬁcient primitives for deep learning","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.239168Z"},"links":{"cited_paper":"/paper/1410.0759","citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:083a4928efdb636bd3b3b22a5927fc48c706eebe68ef7dea9298fd5af007f5e7","observation_id":"0ce2a332-97e6-4e8b-a248-e6440d32b5c1","resolution":{"observed_at":"2026-08-14T05:19:09.239168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-19T18:54:33.813129Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 2 inbound Pith citation observations for arXiv:1909.01500."}