{"as_of":"2026-08-20T23:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e271fe9ff7f34c542c1221f09b9b3ff408349bcfcc570a86cf3acf913ac9c79d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":19,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T05:12:25.792675Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-25T12:35:48.973163Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-08-20T21:25:16.574803Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":"1812.02900","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Off-policy deep reinforcement learning without explo- ration","venue":null,"work_id":"7b042caa-e72b-431c-a209-86fee6e3d470","year":2018},"citing_paper":{"arxiv_id":"1907.00456","last_updated":"2019-07-08T17:21:46Z","snapshot_observed_at":"2026-08-14T02:56:45.044088Z","submitted_at":"2019-06-30T20:53:19Z","title":"Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-25T12:32:09.940698Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/1907.00456"},"observation_digest":"sha256:d7965eb705f52ef7de317464af5de9dabfce6c0ecbf063cbb2cec4a4ab49d3a7","observation_id":"63b06953-ea16-4a6a-964a-e3a3380b921a","resolution":{"observed_at":"2026-05-25T12:35:48.976218Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-08-20T21:25:16.574803Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-08-14T05:24:51.093084Z","title":"Off-policy deep reinforcement learning without exploration","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1909.01387","last_updated":"2019-09-03T18:20:48Z","snapshot_observed_at":"2026-08-20T14:42:08.144375Z","submitted_at":"2019-09-03T18:20:48Z","title":"Making Efficient Use of Demonstrations to Solve Hard Exploration Problems","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-14T05:24:51.093084Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/1909.01387"},"observation_digest":"sha256:2a17b8c023b1cdc6c233c05dcb475979acb4eecaa5c29c9b4197f469bbda1934","observation_id":"b57d7d31-f756-4b92-af20-246ddb4892aa","resolution":{"observed_at":"2026-08-14T05:24:51.093084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-08-20T21:25:16.574803Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":"1812.02900","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Off-policy deep reinforcement learning without explo- ration","venue":null,"work_id":"7b042caa-e72b-431c-a209-86fee6e3d470","year":2018},"citing_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-08-12T13:17:36.653110Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T15:19:21.367628Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/1911.11361"},"observation_digest":"sha256:9adc3491ccb589921fb23820e5a27d6889a01872ea99ed56a597b83fe0c37339","observation_id":"b6b042a1-08d5-4666-8bde-5a1126682347","resolution":{"observed_at":"2026-05-13T15:19:21.423129Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-08-20T21:25:16.574803Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":"1812.02900","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Off-policy deep reinforcement learning without explo- ration","venue":null,"work_id":"7b042caa-e72b-431c-a209-86fee6e3d470","year":2018},"citing_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-08-16T08:32:46.407746Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T23:19:17.322890Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/2004.07219"},"observation_digest":"sha256:a8e066fffce421d022cb4ee2d00b12bafc744c8809d60e9238ca99dbfbd22f13","observation_id":"22f1d582-6358-4ddc-9f69-86b106be883b","resolution":{"observed_at":"2026-05-12T23:19:17.409114Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-08-20T21:25:16.574803Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":"1812.02900","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Off-policy deep reinforcement learning without explo- ration","venue":null,"work_id":"7b042caa-e72b-431c-a209-86fee6e3d470","year":2018},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":177,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:71cba31fdbca43cc0d57c73c56cb155db9073ceebe14fb742df947328ef39bf4","observation_id":"22bd0f83-d64b-421f-b16c-3c9cff3ce925","resolution":{"observed_at":"2026-05-11T11:33:21.574462Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-08-20T21:25:16.574803Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":"1812.02900","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Off-policy deep reinforcement learning without explo- ration","venue":null,"work_id":"7b042caa-e72b-431c-a209-86fee6e3d470","year":2018},"citing_paper":{"arxiv_id":"2412.02818","last_updated":"2026-05-18T18:24:46Z","snapshot_observed_at":"2026-08-17T08:39:33.945155Z","submitted_at":"2024-12-03T20:34:51Z","title":"RoboMD: Uncovering Robot Vulnerabilities through Semantic Potential Fields","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-23T07:49:37.878395Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/2412.02818"},"observation_digest":"sha256:e16179257e10dc1e7f1461c4924b8cf678e44f17fb57ff5f3bfdb7fa346c7190","observation_id":"cffc500b-6e73-442a-b4dd-fe35a2b93c91","resolution":{"observed_at":"2026-05-23T07:52:43.880492Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-08-20T21:25:16.574803Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-08-16T05:12:25.792675Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.21383","last_updated":"2025-04-30T07:32:40Z","snapshot_observed_at":"2026-08-20T09:47:29.252176Z","submitted_at":"2025-04-30T07:32:40Z","title":"FAST-Q: Fast-track Exploration with Adversarially Balanced State Representations for Counterfactual Action Estimation in Offline Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T05:12:25.792675Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/2504.21383"},"observation_digest":"sha256:d14e3e5eaec8bfb6ac5fd0a6bda07c6605f5b5037354eaeffe440d0b0e8dc8c7","observation_id":"af49df21-5a83-47e8-8e05-54eb16dd9a2f","resolution":{"observed_at":"2026-08-16T05:12:25.792675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-08-20T21:25:16.574803Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-08-07T15:42:49.667242Z","title":"Dan Hendrycks and Kevin Gimpel","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-11T22:28:18.522157Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:49.667242Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:db52bf5254868f5d9b28ff22e0824dcfd69f2adaaebfbb614a02bbdc84c55769","observation_id":"832ce9c9-889f-4ad2-9cb1-0298b845ddf0","resolution":{"observed_at":"2026-08-07T15:42:49.667242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-08-20T21:25:16.574803Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-08-15T19:14:53.499845Z","title":"Off-policy deep reinforcement learning without exploration","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.17155","last_updated":"2025-06-26T21:55:13Z","snapshot_observed_at":"2026-08-18T17:00:41.421344Z","submitted_at":"2025-06-20T16:57:59Z","title":"Sparse-Reg: Improving Sample Complexity in Offline Reinforcement Learning using Sparsity","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T19:14:53.499845Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/2506.17155"},"observation_digest":"sha256:cc0dcc52be7b06ad55e58ffdb025e7ae0c3654ab6904dfd468c4923cb59e6aa0","observation_id":"838b30cd-6327-4b5e-b370-03f69d8b8d73","resolution":{"observed_at":"2026-08-15T19:14:53.499845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-08-20T21:25:16.574803Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-08-06T20:31:07.755855Z","title":"Off-policy deep reinforcement learning without exploration, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-19T03:02:00.698111Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.755855Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:d52c65c671e9e055397e0e9bb66da07a9e3840c4fb2d2bc212034cc0db946dfb","observation_id":"a01e27ca-ae96-4cf7-8ea7-ad628b92dfc6","resolution":{"observed_at":"2026-08-06T20:31:07.755855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-08-20T21:25:16.574803Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":"1812.02900","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Off-policy deep reinforcement learning without explo- ration","venue":null,"work_id":"7b042caa-e72b-431c-a209-86fee6e3d470","year":2018},"citing_paper":{"arxiv_id":"2509.19538","last_updated":"2026-05-13T08:29:03Z","snapshot_observed_at":"2026-08-13T16:49:04.581232Z","submitted_at":"2025-09-23T20:06:26Z","title":"DAWM: Diffusion Action World Models for Offline Reinforcement Learning via Action-Inferred Transitions","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T13:55:16.513839Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/2509.19538"},"observation_digest":"sha256:55e4192c10536d39172bbb82e81bf08cf35915169c92f36f24f472ae4c99a7e3","observation_id":"d72888b8-ee2f-42b6-bb8d-62f8603480b2","resolution":{"observed_at":"2026-05-18T13:56:26.092270Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-08-20T21:25:16.574803Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":"1812.02900","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Off-policy deep reinforcement learning without explo- ration","venue":null,"work_id":"7b042caa-e72b-431c-a209-86fee6e3d470","year":2018},"citing_paper":{"arxiv_id":"2604.21209","last_updated":"2026-04-23T02:01:37Z","snapshot_observed_at":"2026-08-11T12:08:16.451121Z","submitted_at":"2026-04-23T02:01:37Z","title":"Align Generative Artificial Intelligence with Human Preferences: A Novel Large Language Model Fine-Tuning Method for Online Review Management","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-09T22:40:31.084594Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/2604.21209"},"observation_digest":"sha256:fd7519bed75128159caca87e1f251ff075be72dbe0dadc02dd3acf7e886dbd11","observation_id":"59543e8c-047a-4967-8190-805e0c333707","resolution":{"observed_at":"2026-05-09T22:44:14.995302Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-08-20T21:25:16.574803Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":"1812.02900","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Off-policy deep reinforcement learning without explo- ration","venue":null,"work_id":"7b042caa-e72b-431c-a209-86fee6e3d470","year":2018},"citing_paper":{"arxiv_id":"2605.11151","last_updated":"2026-05-20T06:10:49Z","snapshot_observed_at":"2026-08-15T08:24:04.711902Z","submitted_at":"2026-05-11T18:58:49Z","title":"RankQ: Offline-to-Online Reinforcement Learning via Self-Supervised Action Ranking","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T02:32:16.746824Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/2605.11151"},"observation_digest":"sha256:309254553c00c69562aef1b0cee0430ce9283c168919d531cd5d57c5cc7a7f50","observation_id":"205f6cf7-2b43-4d79-bc0c-0164ad81ea66","resolution":{"observed_at":"2026-05-13T02:37:08.190747Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-08-20T21:25:16.574803Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":"1812.02900","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Off-policy deep reinforcement learning without explo- ration","venue":null,"work_id":"7b042caa-e72b-431c-a209-86fee6e3d470","year":2018},"citing_paper":{"arxiv_id":"2605.11151","last_updated":"2026-05-20T06:10:49Z","snapshot_observed_at":"2026-08-15T08:24:04.711902Z","submitted_at":"2026-05-11T18:58:49Z","title":"RankQ: Offline-to-Online Reinforcement Learning via Self-Supervised Action Ranking","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T08:53:29.468764Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/2605.11151"},"observation_digest":"sha256:97e5f6426096602ad34a7a5b5d8c181b757c732779f5120daf4f09cc17aabc88","observation_id":"fb0b81a7-af25-4529-8e26-ec16c1db2bcb","resolution":{"observed_at":"2026-05-21T08:54:05.798839Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-08-20T21:25:16.574803Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-08-01T13:15:11.461088Z","title":"Fujimoto, D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.19199","last_updated":"2026-07-21T15:34:06Z","snapshot_observed_at":"2026-08-15T23:00:05.810063Z","submitted_at":"2026-07-21T15:34:06Z","title":"Conservative Query and Adaptive Regularization for Offline RL Under Uncertainty Estimation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T13:15:11.461088Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/2607.19199"},"observation_digest":"sha256:eacc1679bba08fc19c04ab4d7e16591179e05951352211c63e3d9e46cbc9ab9b","observation_id":"2c6f62e2-ea4c-4def-abbd-e319c799d8e8","resolution":{"observed_at":"2026-08-01T13:15:11.461088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-08-20T21:25:16.574803Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-07-30T11:06:22.520577Z","title":"Off-policy deep reinforcement learning without exploration, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-19T15:53:26.918304Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-30T11:06:22.520577Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:1f238a818c6f7b10f1dbf631cfb5bc3c18b0e5a385d22de7e2d9260675400a20","observation_id":"6416329b-4cb6-43ff-b08c-718c17b387b5","resolution":{"observed_at":"2026-07-30T11:06:22.520577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-08-20T21:25:16.574803Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-08-05T04:27:43.878960Z","title":"Off-policy deep reinforcement learning without exploration, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-19T15:53:26.918304Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.878960Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:e11d0bfe9735ee1592e006c41fa93fd9fe87ab41efc9574c9b1123a10bda427b","observation_id":"db5f9166-ea8d-42c8-b127-c020905a6e98","resolution":{"observed_at":"2026-08-05T04:27:43.878960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-08-20T21:25:16.574803Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-07-31T01:24:20.486289Z","title":"Off-policy deep reinforcement learning without exploration","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.27422","last_updated":"2026-07-29T19:43:40Z","snapshot_observed_at":"2026-08-15T04:12:24.511915Z","submitted_at":"2026-07-29T19:43:40Z","title":"Good Rankers, Bad Objectives: Bilinear Contrastive Critics under Expressive Policy Search","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-31T01:24:20.486289Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/2607.27422"},"observation_digest":"sha256:21bff664690cccbcf92dddac680a2547de8e96382760a312feae561d79f22de4","observation_id":"e20d9cb9-f75b-4cdc-9654-9a97e46cb8fc","resolution":{"observed_at":"2026-07-31T01:24:20.486289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-08-20T21:25:16.574803Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-08-04T19:45:30.241728Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.01851","last_updated":"2026-08-03T07:58:35Z","snapshot_observed_at":"2026-08-17T12:44:12.584111Z","submitted_at":"2026-08-03T07:58:35Z","title":"Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-04T19:45:30.241728Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/2608.01851"},"observation_digest":"sha256:4756ed4ef473b1d0577f74dc160d08029249a39f76a49124ea1ed3a37bb966f2","observation_id":"9d55c0f0-601a-4975-94d9-2cc4805c1d1b","resolution":{"observed_at":"2026-08-04T19:45:30.241728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1812.02900/citation-record","integrity":"/paper/1812.02900/integrity","json":"/paper/1812.02900/citation-record.json","paper":"/paper/1812.02900"},"outbound":[],"paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-20T21:25:16.574803Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 19 inbound Pith citation observations for arXiv:1812.02900."}