{"as_of":"2026-08-09T20:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:da284d836c813ae5ed085191faae5ad60fdb61d852537d4ce61481a77302f25e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":28,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T04:36:12.619468Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":105,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":"2006.05990","doi":"10.48550/arxiv.2006.05990","metadata_source":"pith","pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What matters in on-policy reinforcement learning? A large-scal e empirical study","venue":"cs.LG","work_id":"67073b84-d283-4a63-ba53-c9e65061ec57","year":2020},"citing_paper":{"arxiv_id":"2108.03298","last_updated":"2021-09-25T00:37:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-08-06T20:48:30Z","title":"What Matters in Learning from Offline Human Demonstrations for Robot Manipulation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-13T08:51:55.826747Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2108.03298"},"observation_digest":"sha256:6f12fbc99cba610dcc575b4236b86cf4803299eadb0b5c71fbfd45f2e9d58f0d","observation_id":"11bf0bf6-346d-4a68-8682-77a61759fe70","resolution":{"observed_at":"2026-05-13T08:51:55.997703Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":"2006.05990","doi":"10.48550/arxiv.2006.05990","metadata_source":"pith","pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What matters in on-policy reinforcement learning? A large-scal e empirical study","venue":"cs.LG","work_id":"67073b84-d283-4a63-ba53-c9e65061ec57","year":2020},"citing_paper":{"arxiv_id":"2201.03544","last_updated":"2022-02-14T09:05:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-10T18:58:52Z","title":"The Effects of Reward Misspecification: Mapping and Mitigating Misaligned Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T07:08:52.723528Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2201.03544"},"observation_digest":"sha256:d37e12c467507efdbf0064c264ac8756acadd752e4af94f4d0106f514ded06db","observation_id":"edd1cefa-a79c-401e-a686-fd5a82942d12","resolution":{"observed_at":"2026-05-21T07:08:52.801639Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":"2006.05990","doi":"10.48550/arxiv.2006.05990","metadata_source":"pith","pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What matters in on-policy reinforcement learning? A large-scal e empirical study","venue":"cs.LG","work_id":"67073b84-d283-4a63-ba53-c9e65061ec57","year":2020},"citing_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-11T09:08:21.677362Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2301.04104"},"observation_digest":"sha256:bc4f62ad94df188a456f18de4e22a57ef18bf93bca7c90fc92e3a84b381d5289","observation_id":"5e7bc265-bb22-4746-9f1c-6b5223fd8b4b","resolution":{"observed_at":"2026-05-11T09:08:21.980352Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-09T04:36:12.619468Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.03560","last_updated":"2025-02-05T19:17:33Z","snapshot_observed_at":"2026-08-09T04:29:10.506440Z","submitted_at":"2025-02-05T19:17:33Z","title":"Simulating Errors in Touchscreen Typing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T04:36:12.619468Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2502.03560"},"observation_digest":"sha256:0b814bf9ac6bfcb5c3cb10f7a9527005212e02dac9879a778a9871b09448db06","observation_id":"0c67352e-c4d3-4b5f-b882-fb53c819e4ef","resolution":{"observed_at":"2026-08-09T04:36:12.619468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-07T23:34:10.862569Z","title":"What matters in on-policy reinforcement learning? a large-scale empirical study","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.08844","last_updated":"2025-02-12T23:30:01Z","snapshot_observed_at":"2026-08-07T23:27:22.713894Z","submitted_at":"2025-02-12T23:30:01Z","title":"MuJoCo Playground","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T23:34:10.862569Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2502.08844"},"observation_digest":"sha256:a9e0b7d8c8a9b07ae42935860538fb18dec8aa65f3f094c887b3a5e8efe34fea","observation_id":"87b35a59-608e-447d-9477-3e97bb1daa7f","resolution":{"observed_at":"2026-08-07T23:34:10.862569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-07T10:55:20.205546Z","title":"What matters in on-policy reinforcement learning? a large-scale empirical study","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-09T01:33:11.458736Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.205546Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:0c7c637253077867ecf33ab44258928dbb860822579bd3e6225af13b45be8dbf","observation_id":"b4b230da-84bc-4768-b4c3-268d49f2c8c0","resolution":{"observed_at":"2026-08-07T10:55:20.205546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-07T04:19:22.151310Z","title":"What matters in on-policy reinforcement learning? a large-scale empirical study, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:22.151310Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2506.10910"},"observation_digest":"sha256:df5a0ded52aac656333ab6a7ebe0eeff3be5471d5640554e5ccffa697bed21fc","observation_id":"58df91f7-f6d0-43f2-914c-f803515f43e7","resolution":{"observed_at":"2026-08-07T04:19:22.151310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-06T22:48:46.211558Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.20589","last_updated":"2026-05-31T14:57:19Z","snapshot_observed_at":"2026-08-08T10:43:33.614184Z","submitted_at":"2025-06-25T16:28:30Z","title":"Communicating Smartly in Molecular Communication Environments: Neural Networks in the Internet of Bio-Nano Things","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T22:48:46.211558Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2506.20589"},"observation_digest":"sha256:79b7839f94568735dd94e5dcc7051d2f039899f545ff84eda11a30125e4e620f","observation_id":"9bbad98f-46c2-43b4-bc7a-bd421c171fc0","resolution":{"observed_at":"2026-08-06T22:48:46.211558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-06T18:18:44.262283Z","title":"What matters in on-policy reinforcement learning? a large-scale empirical study","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.08718","last_updated":"2025-07-11T16:19:45Z","snapshot_observed_at":"2026-08-08T04:07:41.428130Z","submitted_at":"2025-07-11T16:19:45Z","title":"On the Effect of Regularization in Policy Mirror Descent","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T18:18:44.262283Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2507.08718"},"observation_digest":"sha256:d13fb2a0948545abc3af286f19aaeecdf987eeae7a58044960e2bcb4328b2034","observation_id":"05e8926f-c64c-4013-be31-a7adcfd16cf7","resolution":{"observed_at":"2026-08-06T18:18:44.262283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-06T18:18:26.684738Z","title":"What matters in on-policy reinforcement learning? a large-scale empirical study,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.08726","last_updated":"2025-07-11T16:26:31Z","snapshot_observed_at":"2026-08-06T23:34:07.839962Z","submitted_at":"2025-07-11T16:26:31Z","title":"Learning human-to-robot handovers through 3D scene reconstruction","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:26.684738Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2507.08726"},"observation_digest":"sha256:90d2876a6acd7ed2838ca8da40cad6d5a94e2bed3bb025e4bc017f770801b5e0","observation_id":"0922a89a-ec0c-4f0d-984e-0897a8430c28","resolution":{"observed_at":"2026-08-06T18:18:26.684738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-06T17:05:16.167535Z","title":"What matters in on-policy reinforcement learning? a large-scale empirical study,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.11975","last_updated":"2025-07-16T07:17:41Z","snapshot_observed_at":"2026-08-09T09:50:47.034393Z","submitted_at":"2025-07-16T07:17:41Z","title":"Online Training and Pruning of Deep Reinforcement Learning Networks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:05:16.167535Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2507.11975"},"observation_digest":"sha256:410f01814bea228331275fc4525bcf7c923fdd404e5aae49912342e16f612aa2","observation_id":"b0bd07b4-47d3-45fb-8dd6-c316ec3a8241","resolution":{"observed_at":"2026-08-06T17:05:16.167535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-03T19:16:26.948543Z","title":"What matters in on-policy rein- forcement learning? a large-scale empirical study.arXiv preprint arXiv:2006.05990,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2512.01467","last_updated":"2026-06-08T10:55:45Z","snapshot_observed_at":"2026-08-06T23:33:15.422373Z","submitted_at":"2025-12-01T09:50:04Z","title":"Differentiable Weightless Controllers: Learning Logic Circuits for Continuous Control","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-03T19:16:26.948543Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2512.01467"},"observation_digest":"sha256:e0d8723f023d1ff3b5fd8398ac0384ebb1da44bd62ccf81daeecabae218a8433","observation_id":"4d1af3aa-8b4b-4dea-865c-f087b1bfce4d","resolution":{"observed_at":"2026-08-03T19:16:26.948543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-02T18:45:20.216901Z","title":"What matters in on-policy reinforcement learning? a large-scale empirical study","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:20.216901Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:47811463cf9b7535df809c2e634fed255bf0e0c08bdd00c0900694b78e788200","observation_id":"16ea3926-2720-442f-ae65-02428ba04317","resolution":{"observed_at":"2026-08-02T18:45:20.216901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":"2006.05990","doi":"10.48550/arxiv.2006.05990","metadata_source":"pith","pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What matters in on-policy reinforcement learning? A large-scal e empirical study","venue":"cs.LG","work_id":"67073b84-d283-4a63-ba53-c9e65061ec57","year":2020},"citing_paper":{"arxiv_id":"2604.14142","last_updated":"2026-04-15T17:59:01Z","snapshot_observed_at":"2026-07-06T23:02:00.082783Z","submitted_at":"2026-04-15T17:59:01Z","title":"From $P(y|x)$ to $P(y)$: Investigating Reinforcement Learning in Pre-train Space","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-10T12:50:57.603403Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2604.14142"},"observation_digest":"sha256:569794f3ccbd7b50a6a2942de1e12018286a2d8b1dcb29dcf8d32b5f9f4217ec","observation_id":"b9348a80-ac48-439d-9a34-652d31809979","resolution":{"observed_at":"2026-05-11T11:41:04.216628Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":"2006.05990","doi":"10.48550/arxiv.2006.05990","metadata_source":"pith","pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What matters in on-policy reinforcement learning? A large-scal e empirical study","venue":"cs.LG","work_id":"67073b84-d283-4a63-ba53-c9e65061ec57","year":2020},"citing_paper":{"arxiv_id":"2604.18978","last_updated":"2026-05-07T15:47:31Z","snapshot_observed_at":"2026-08-08T15:22:09.895907Z","submitted_at":"2026-04-21T01:59:54Z","title":"Low-Rank Adaptation for Critic Learning in Off-Policy Reinforcement Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T02:55:22.577012Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2604.18978"},"observation_digest":"sha256:0b0f4916b4182d6e8a97c041c237b6de27fb0ff8f4fd4d61ad40b9fa532f761d","observation_id":"0897607c-7adc-46df-8bc8-f1172f451575","resolution":{"observed_at":"2026-05-11T12:46:27.889717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":"2006.05990","doi":"10.48550/arxiv.2006.05990","metadata_source":"pith","pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What matters in on-policy reinforcement learning? A large-scal e empirical study","venue":"cs.LG","work_id":"67073b84-d283-4a63-ba53-c9e65061ec57","year":2020},"citing_paper":{"arxiv_id":"2604.26126","last_updated":"2026-05-15T12:49:51Z","snapshot_observed_at":"2026-08-09T06:56:36.646396Z","submitted_at":"2026-04-28T21:29:03Z","title":"Application of Deep Reinforcement Learning to Event-Triggered Control for Networked Artificial Pancreas Systems","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-07T14:51:30.263897Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2604.26126"},"observation_digest":"sha256:49e6d284fd6d06683aeae7122a1e6198dadc040ee11cdfdcbb5e27b778bff58e","observation_id":"810aace4-d58a-49c6-85b6-0fb17d21ba16","resolution":{"observed_at":"2026-05-12T00:41:16.498617Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":"2006.05990","doi":"10.48550/arxiv.2006.05990","metadata_source":"pith","pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What matters in on-policy reinforcement learning? A large-scal e empirical study","venue":"cs.LG","work_id":"67073b84-d283-4a63-ba53-c9e65061ec57","year":2020},"citing_paper":{"arxiv_id":"2604.26126","last_updated":"2026-05-15T12:49:51Z","snapshot_observed_at":"2026-08-09T06:56:36.646396Z","submitted_at":"2026-04-28T21:29:03Z","title":"Application of Deep Reinforcement Learning to Event-Triggered Control for Networked Artificial Pancreas Systems","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-19T17:46:20.907461Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2604.26126"},"observation_digest":"sha256:655eda323aabea9665805f1d018b60ee9997c8f67609a2698b6174cd6ba978b9","observation_id":"ec7d7e36-c90a-4688-b726-47c03e42b11c","resolution":{"observed_at":"2026-05-19T17:47:41.630296Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":"2006.05990","doi":"10.48550/arxiv.2006.05990","metadata_source":"pith","pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What matters in on-policy reinforcement learning? A large-scal e empirical study","venue":"cs.LG","work_id":"67073b84-d283-4a63-ba53-c9e65061ec57","year":2020},"citing_paper":{"arxiv_id":"2605.08665","last_updated":"2026-06-03T08:11:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T04:07:16Z","title":"Hint Tuning: Less Data Makes Better Reasoners","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:13.146373Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2605.08665"},"observation_digest":"sha256:0477289585a2529a00c4e6311046ec43e5bee7cb905514be23b4f432ccce4087","observation_id":"e5544742-6a92-4df8-8429-0affd16ea488","resolution":{"observed_at":"2026-05-12T08:36:26.341552Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":"2006.05990","doi":"10.48550/arxiv.2006.05990","metadata_source":"pith","pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What matters in on-policy reinforcement learning? A large-scal e empirical study","venue":"cs.LG","work_id":"67073b84-d283-4a63-ba53-c9e65061ec57","year":2020},"citing_paper":{"arxiv_id":"2605.08665","last_updated":"2026-06-03T08:11:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T04:07:16Z","title":"Hint Tuning: Less Data Makes Better Reasoners","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T23:34:43.785312Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2605.08665"},"observation_digest":"sha256:1089c21f43d59eb5665c4c0894cbdce72c1b07732b4d7a0cd33078ab8dd94721","observation_id":"2306338e-254c-4b5e-a92e-c19e3e962391","resolution":{"observed_at":"2026-06-30T23:35:07.063312Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":"2006.05990","doi":"10.48550/arxiv.2006.05990","metadata_source":"pith","pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What matters in on-policy reinforcement learning? A large-scal e empirical study","venue":"cs.LG","work_id":"67073b84-d283-4a63-ba53-c9e65061ec57","year":2020},"citing_paper":{"arxiv_id":"2605.11375","last_updated":"2026-05-12T00:58:42Z","snapshot_observed_at":"2026-08-08T13:07:17.510449Z","submitted_at":"2026-05-12T00:58:42Z","title":"TuniQ: Autotuning Compilation Passes for Quantum Workloads at Scale for Effectiveness and Efficiency","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T02:50:20.040271Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2605.11375"},"observation_digest":"sha256:43368dce8891893710c81e83a302620f616e3ed5db6638548e200f98519080c6","observation_id":"fd05a4da-3bbf-4276-a8e5-fcb36ddeedbf","resolution":{"observed_at":"2026-05-13T02:52:08.830825Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":"2006.05990","doi":"10.48550/arxiv.2006.05990","metadata_source":"pith","pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What matters in on-policy reinforcement learning? A large-scal e empirical study","venue":"cs.LG","work_id":"67073b84-d283-4a63-ba53-c9e65061ec57","year":2020},"citing_paper":{"arxiv_id":"2605.11473","last_updated":"2026-05-12T03:40:28Z","snapshot_observed_at":"2026-08-08T22:43:14.252060Z","submitted_at":"2026-05-12T03:40:28Z","title":"TOPPO: Rethinking PPO for Multi-Task Reinforcement Learning with Critic Balancing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T01:48:13.679862Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2605.11473"},"observation_digest":"sha256:ea00724432994c63fbd63e21e281dd68fae0b457dc1acb0e627fe8570d7c150d","observation_id":"ed702539-4593-4c4c-9d30-38c779010c53","resolution":{"observed_at":"2026-05-13T01:52:05.744552Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":"2006.05990","doi":"10.48550/arxiv.2006.05990","metadata_source":"pith","pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What matters in on-policy reinforcement learning? A large-scal e empirical study","venue":"cs.LG","work_id":"67073b84-d283-4a63-ba53-c9e65061ec57","year":2020},"citing_paper":{"arxiv_id":"2605.18591","last_updated":"2026-08-03T00:43:51Z","snapshot_observed_at":"2026-08-06T23:24:40.850221Z","submitted_at":"2026-05-18T16:05:36Z","title":"Randomized Advantage Transformation (RAT): Computing Natural Policy Gradients via Direct Backpropagation","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-05-20T12:44:29.147095Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2605.18591"},"observation_digest":"sha256:dcb76c1234d1827a8a4c70daaabe331ca875640d64bb23a29526aaabddc0b4f7","observation_id":"e8ccc653-d395-4959-978f-9d755b9a10bb","resolution":{"observed_at":"2026-05-20T12:48:17.499793Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":"2006.05990","doi":"10.48550/arxiv.2006.05990","metadata_source":"pith","pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What matters in on-policy reinforcement learning? A large-scal e empirical study","venue":"cs.LG","work_id":"67073b84-d283-4a63-ba53-c9e65061ec57","year":2020},"citing_paper":{"arxiv_id":"2605.30719","last_updated":"2026-06-26T17:52:03Z","snapshot_observed_at":"2026-07-06T23:39:58.378823Z","submitted_at":"2026-05-29T01:24:24Z","title":"When are LLMs Sufficient Policy Optimizers for Sequential RL Tasks?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T23:38:33.520625Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2605.30719"},"observation_digest":"sha256:6a157f5972fd57d7a07c3c6c2cc57f9b1b0e18244cede2683a3574391d69a5b7","observation_id":"4a2c263d-a5cb-48b1-aca4-b3c0ef4abb7b","resolution":{"observed_at":"2026-06-28T23:42:49.605925Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":"2006.05990","doi":"10.48550/arxiv.2006.05990","metadata_source":"pith","pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What matters in on-policy reinforcement learning? A large-scal e empirical study","venue":"cs.LG","work_id":"67073b84-d283-4a63-ba53-c9e65061ec57","year":2020},"citing_paper":{"arxiv_id":"2605.30719","last_updated":"2026-06-26T17:52:03Z","snapshot_observed_at":"2026-07-06T23:39:58.378823Z","submitted_at":"2026-05-29T01:24:24Z","title":"When are LLMs Sufficient Policy Optimizers for Sequential RL Tasks?","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T05:42:55.457904Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2605.30719"},"observation_digest":"sha256:5f3d362e4df05b728e9b1527098a7773b9c2d21fa0f9ffe9557b4c73f027d6e7","observation_id":"4249dc2e-3a72-431a-b874-9af188867e0a","resolution":{"observed_at":"2026-06-29T05:43:07.739085Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":"2006.05990","doi":"10.48550/arxiv.2006.05990","metadata_source":"pith","pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What matters in on-policy reinforcement learning? A large-scal e empirical study","venue":"cs.LG","work_id":"67073b84-d283-4a63-ba53-c9e65061ec57","year":2020},"citing_paper":{"arxiv_id":"2606.17199","last_updated":"2026-06-15T18:37:51Z","snapshot_observed_at":"2026-08-08T14:44:03.594424Z","submitted_at":"2026-06-15T18:37:51Z","title":"PowerOPD: Stabilizing On-Policy Distillation with Bounded Power Transformation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-27T03:39:37.096675Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2606.17199"},"observation_digest":"sha256:c04eaea0afb356dedd3015050a0e9203d9453289663bd36cbb820634acc6b347","observation_id":"ea047044-d8ca-484c-88d2-a6d70d7ccaf6","resolution":{"observed_at":"2026-07-03T17:48:46.310519Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":"2006.05990","doi":"10.48550/arxiv.2006.05990","metadata_source":"pith","pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What matters in on-policy reinforcement learning? A large-scal e empirical study","venue":"cs.LG","work_id":"67073b84-d283-4a63-ba53-c9e65061ec57","year":2020},"citing_paper":{"arxiv_id":"2606.23993","last_updated":"2026-06-27T11:51:16Z","snapshot_observed_at":"2026-08-03T03:39:13.981875Z","submitted_at":"2026-06-22T22:56:33Z","title":"Learning to Trigger: Reinforcement Learning at the Large Hadron Collider","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-26T08:35:33.377206Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2606.23993"},"observation_digest":"sha256:2c83426f986fe45ff7016860a1e92dd1ab017ea55fad6e6178ecf46b185a3cac","observation_id":"69add4d6-dddd-4560-a164-723cc1443895","resolution":{"observed_at":"2026-07-04T10:39:45.862272Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":"2006.05990","doi":"10.48550/arxiv.2006.05990","metadata_source":"pith","pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What matters in on-policy reinforcement learning? A large-scal e empirical study","venue":"cs.LG","work_id":"67073b84-d283-4a63-ba53-c9e65061ec57","year":2020},"citing_paper":{"arxiv_id":"2606.23993","last_updated":"2026-06-27T11:51:16Z","snapshot_observed_at":"2026-08-03T03:39:13.981875Z","submitted_at":"2026-06-22T22:56:33Z","title":"Learning to Trigger: Reinforcement Learning at the Large Hadron Collider","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T10:20:52.408426Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2606.23993"},"observation_digest":"sha256:5f99f9a67d733d27a4f37a552cbecc89b52f89985d6a8d109044bea4e4061bc5","observation_id":"ae2dde90-abce-4a0e-ae84-b3abf3babac2","resolution":{"observed_at":"2026-06-30T11:54:39.123007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":"2006.05990","doi":"10.48550/arxiv.2006.05990","metadata_source":"pith","pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What matters in on-policy reinforcement learning? A large-scal e empirical study","venue":"cs.LG","work_id":"67073b84-d283-4a63-ba53-c9e65061ec57","year":2020},"citing_paper":{"arxiv_id":"2607.07756","last_updated":"2026-07-08T14:01:16Z","snapshot_observed_at":"2026-08-02T22:53:58.003943Z","submitted_at":"2026-07-08T14:01:16Z","title":"The Importance of Encoder Choice:A Tabular-Image Study","version":1},"reference_index":168,"source":"arxiv_source","source_observed_at":"2026-07-10T19:03:32.353393Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2607.07756"},"observation_digest":"sha256:ab071cf1bf94837021990af754c289e9958ac04f4e6a7c36373ab02dc7078110","observation_id":"c078e5ea-f243-46fc-a542-efdd9bed50b0","resolution":{"observed_at":"2026-07-10T19:07:34.906671Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2006.05990/citation-record","integrity":"/paper/2006.05990/integrity","json":"/paper/2006.05990/citation-record.json","paper":"/paper/2006.05990"},"outbound":[],"paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 28 inbound Pith citation observations for arXiv:2006.05990."}