{"as_of":"2026-08-08T20:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cb0b7db42da1430e32e6f3b4fe3c974ff79e9b3bdfaa9c81799b66e8faa78851","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":25,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:15:46.288418Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T12:09:48.784830Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2005.12729","last_updated":"2020-05-25T16:24:59Z","snapshot_observed_at":"2026-07-06T09:23:23.891393Z","submitted_at":"2020-05-25T16:24:59Z","title":"Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO","version":1},"cited_work":{"arxiv_id":"2005.12729","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2005.12729","snapshot_observed_at":"2026-07-04T12:09:48.784830Z","title":"arXiv preprint arXiv:2005.12729 , year=","venue":null,"work_id":"a0c5b73d-c242-4cb2-b4d4-fbffb504fe33","year":2005},"citing_paper":{"arxiv_id":"2304.06767","last_updated":"2023-12-01T14:28:06Z","snapshot_observed_at":"2026-08-07T04:02:54.504761Z","submitted_at":"2023-04-13T18:22:40Z","title":"RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment","version":4},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-05-18T00:46:56.664582Z"},"links":{"cited_paper":"/paper/2005.12729","citing_paper":"/paper/2304.06767"},"observation_digest":"sha256:a8f98ca3f2ef938010651c547460aecd5f7fe542383bc10ba721a1fdaadcc17b","observation_id":"d1e461ff-bee6-4969-857b-70a087d36390","resolution":{"observed_at":"2026-05-18T00:46:56.870644Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.12729","last_updated":"2020-05-25T16:24:59Z","snapshot_observed_at":"2026-07-06T09:23:23.891393Z","submitted_at":"2020-05-25T16:24:59Z","title":"Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO","version":1},"cited_work":{"arxiv_id":"2005.12729","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2005.12729","snapshot_observed_at":"2026-07-04T12:09:48.784830Z","title":"arXiv preprint arXiv:2005.12729 , year=","venue":null,"work_id":"a0c5b73d-c242-4cb2-b4d4-fbffb504fe33","year":2005},"citing_paper":{"arxiv_id":"2408.07199","last_updated":"2024-08-13T20:52:13Z","snapshot_observed_at":"2026-08-01T22:07:45.419539Z","submitted_at":"2024-08-13T20:52:13Z","title":"Agent Q: Advanced Reasoning and Learning for Autonomous AI Agents","version":1},"reference_index":208,"source":"arxiv_source","source_observed_at":"2026-05-20T09:41:59.979595Z"},"links":{"cited_paper":"/paper/2005.12729","citing_paper":"/paper/2408.07199"},"observation_digest":"sha256:af7371ac1260bf92f960bd57a4437ae2f756b9271cd838166340825fcf6306d2","observation_id":"6320458f-5f51-4b32-b4d5-70cbfc97563a","resolution":{"observed_at":"2026-05-20T09:42:04.375198Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.12729","last_updated":"2020-05-25T16:24:59Z","snapshot_observed_at":"2026-07-06T09:23:23.891393Z","submitted_at":"2020-05-25T16:24:59Z","title":"Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.12729","snapshot_observed_at":"2026-08-07T15:15:46.288418Z","title":"Implementation matters in deep policy gradients: A case study on PPO and TRPO","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.17122","last_updated":"2025-05-21T17:59:02Z","snapshot_observed_at":"2026-08-08T17:27:05.443478Z","submitted_at":"2025-05-21T17:59:02Z","title":"Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:46.288418Z"},"links":{"cited_paper":"/paper/2005.12729","citing_paper":"/paper/2505.17122"},"observation_digest":"sha256:ee26d7b407f7c7a33d447d9cee173ed9f7a04abd215acc06f2500532c6b0ec80","observation_id":"dc0ec6a0-0fe7-4e1f-8560-d83ff9f57534","resolution":{"observed_at":"2026-08-07T15:15:46.288418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.12729","last_updated":"2020-05-25T16:24:59Z","snapshot_observed_at":"2026-07-06T09:23:23.891393Z","submitted_at":"2020-05-25T16:24:59Z","title":"Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.12729","snapshot_observed_at":"2026-08-07T12:43:47.833667Z","title":"Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO.arXiv e-prints, page arXiv:2005.12729, May 2020","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:47.833667Z"},"links":{"cited_paper":"/paper/2005.12729","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:16b59f7517e0957dd8d678fcb8b36ab6dfc4371f134d05c0c0816cc6f536a0fa","observation_id":"19324a54-6076-42a7-9974-d420050cd73f","resolution":{"observed_at":"2026-08-07T12:43:47.833667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.12729","last_updated":"2020-05-25T16:24:59Z","snapshot_observed_at":"2026-07-06T09:23:23.891393Z","submitted_at":"2020-05-25T16:24:59Z","title":"Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.12729","snapshot_observed_at":"2026-08-06T18:18:45.097844Z","title":"Implementation matters in deep policy gradients: A case study on ppo and trpo","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.08718","last_updated":"2025-07-11T16:19:45Z","snapshot_observed_at":"2026-08-08T04:07:41.428130Z","submitted_at":"2025-07-11T16:19:45Z","title":"On the Effect of Regularization in Policy Mirror Descent","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T18:18:45.097844Z"},"links":{"cited_paper":"/paper/2005.12729","citing_paper":"/paper/2507.08718"},"observation_digest":"sha256:7eea057009bff4c51bdeb308fd976e74c300e775c5780248db33020b92b17f55","observation_id":"ca9784f2-02ca-4061-ad86-be0546e474fc","resolution":{"observed_at":"2026-08-06T18:18:45.097844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.12729","last_updated":"2020-05-25T16:24:59Z","snapshot_observed_at":"2026-07-06T09:23:23.891393Z","submitted_at":"2020-05-25T16:24:59Z","title":"Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.12729","snapshot_observed_at":"2026-08-06T15:01:56.164569Z","title":"Engstrom, A","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.17055","last_updated":"2025-07-22T22:31:11Z","snapshot_observed_at":"2026-08-08T11:26:04.595048Z","submitted_at":"2025-07-22T22:31:11Z","title":"Shared Control of Holonomic Wheelchairs through Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:56.164569Z"},"links":{"cited_paper":"/paper/2005.12729","citing_paper":"/paper/2507.17055"},"observation_digest":"sha256:6f0d81279745beb354f383d32400b20bcd1ec89ed3192cc1abe60c837e3922ac","observation_id":"b798d612-57e9-4f25-9a09-a704bf31f366","resolution":{"observed_at":"2026-08-06T15:01:56.164569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.12729","last_updated":"2020-05-25T16:24:59Z","snapshot_observed_at":"2026-07-06T09:23:23.891393Z","submitted_at":"2020-05-25T16:24:59Z","title":"Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.12729","snapshot_observed_at":"2026-08-06T14:13:07.089075Z","title":"Implementation matters in deep policy gradients: A case study on ppo and trpo, May 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.19672","last_updated":"2025-07-25T20:52:58Z","snapshot_observed_at":"2026-08-07T12:02:14.124506Z","submitted_at":"2025-07-25T20:52:58Z","title":"Alignment and Safety in Large Language Models: Safety Mechanisms, Training Paradigms, and Emerging Challenges","version":1},"reference_index":216,"source":"arxiv_source","source_observed_at":"2026-08-06T14:13:07.089075Z"},"links":{"cited_paper":"/paper/2005.12729","citing_paper":"/paper/2507.19672"},"observation_digest":"sha256:a5cc0c1f9d27aac0830eccf64bbad99f05a984f73b5f57582b03270d222a694f","observation_id":"96838120-0c29-41d2-b247-d6365188a7d3","resolution":{"observed_at":"2026-08-06T14:13:07.089075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.12729","last_updated":"2020-05-25T16:24:59Z","snapshot_observed_at":"2026-07-06T09:23:23.891393Z","submitted_at":"2020-05-25T16:24:59Z","title":"Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.12729","snapshot_observed_at":"2026-08-03T07:17:13.398189Z","title":"Engstrom, A","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2601.20789","last_updated":"2026-05-29T01:36:45Z","snapshot_observed_at":"2026-08-06T06:19:33.132630Z","submitted_at":"2026-01-28T17:27:08Z","title":"SERA: Soft-Verified Efficient Repository Agents","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T07:17:13.398189Z"},"links":{"cited_paper":"/paper/2005.12729","citing_paper":"/paper/2601.20789"},"observation_digest":"sha256:d112d56313da3d13af64be9d85e0f760c89d0493a34752f6720630acd8b91ce6","observation_id":"44e20981-aeb7-4aa2-b449-20b1aaf520ec","resolution":{"observed_at":"2026-08-03T07:17:13.398189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.12729","last_updated":"2020-05-25T16:24:59Z","snapshot_observed_at":"2026-07-06T09:23:23.891393Z","submitted_at":"2020-05-25T16:24:59Z","title":"Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.12729","snapshot_observed_at":"2026-08-02T18:45:20.537597Z","title":"Implementation matters in deep policy gradients: A case study on ppo and trpo","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:20.537597Z"},"links":{"cited_paper":"/paper/2005.12729","citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:b8d24d2b161df448d6deec2f596132419f6c66f7e3b130bf7a9ec60c656ee2b3","observation_id":"43518c25-4e3d-4773-8eda-17dedb3c887c","resolution":{"observed_at":"2026-08-02T18:45:20.537597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.12729","last_updated":"2020-05-25T16:24:59Z","snapshot_observed_at":"2026-07-06T09:23:23.891393Z","submitted_at":"2020-05-25T16:24:59Z","title":"Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO","version":1},"cited_work":{"arxiv_id":"2005.12729","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2005.12729","snapshot_observed_at":"2026-07-04T12:09:48.784830Z","title":"arXiv preprint arXiv:2005.12729 , year=","venue":null,"work_id":"a0c5b73d-c242-4cb2-b4d4-fbffb504fe33","year":2005},"citing_paper":{"arxiv_id":"2604.18578","last_updated":"2026-04-30T14:35:55Z","snapshot_observed_at":"2026-08-02T22:04:13.250695Z","submitted_at":"2026-04-20T17:59:01Z","title":"Bounded Ratio Reinforcement Learning","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T04:50:11.020901Z"},"links":{"cited_paper":"/paper/2005.12729","citing_paper":"/paper/2604.18578"},"observation_digest":"sha256:95833d2a9cf1ddae0693ce423f3312462eaf27d00831bcdf38445b4691a94dc7","observation_id":"c9d43959-881d-43c0-9145-44e658aec8e0","resolution":{"observed_at":"2026-05-10T11:35:19.053807Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.12729","last_updated":"2020-05-25T16:24:59Z","snapshot_observed_at":"2026-07-06T09:23:23.891393Z","submitted_at":"2020-05-25T16:24:59Z","title":"Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO","version":1},"cited_work":{"arxiv_id":"2005.12729","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2005.12729","snapshot_observed_at":"2026-07-04T12:09:48.784830Z","title":"arXiv preprint arXiv:2005.12729 , year=","venue":null,"work_id":"a0c5b73d-c242-4cb2-b4d4-fbffb504fe33","year":2005},"citing_paper":{"arxiv_id":"2604.26126","last_updated":"2026-05-15T12:49:51Z","snapshot_observed_at":"2026-08-06T04:36:41.382029Z","submitted_at":"2026-04-28T21:29:03Z","title":"Application of Deep Reinforcement Learning to Event-Triggered Control for Networked Artificial Pancreas Systems","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-07T14:51:30.263897Z"},"links":{"cited_paper":"/paper/2005.12729","citing_paper":"/paper/2604.26126"},"observation_digest":"sha256:489da2a52a11c07c6bcd3868b69846421edeff3fea53faf30098ee04af981196","observation_id":"27c12819-cd74-4918-8b56-c044b86bbd6f","resolution":{"observed_at":"2026-05-12T00:41:16.486953Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.12729","last_updated":"2020-05-25T16:24:59Z","snapshot_observed_at":"2026-07-06T09:23:23.891393Z","submitted_at":"2020-05-25T16:24:59Z","title":"Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO","version":1},"cited_work":{"arxiv_id":"2005.12729","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2005.12729","snapshot_observed_at":"2026-07-04T12:09:48.784830Z","title":"arXiv preprint arXiv:2005.12729 , year=","venue":null,"work_id":"a0c5b73d-c242-4cb2-b4d4-fbffb504fe33","year":2005},"citing_paper":{"arxiv_id":"2604.26126","last_updated":"2026-05-15T12:49:51Z","snapshot_observed_at":"2026-08-06T04:36:41.382029Z","submitted_at":"2026-04-28T21:29:03Z","title":"Application of Deep Reinforcement Learning to Event-Triggered Control for Networked Artificial Pancreas Systems","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-19T17:46:20.907461Z"},"links":{"cited_paper":"/paper/2005.12729","citing_paper":"/paper/2604.26126"},"observation_digest":"sha256:43863c8526e111700ead6b1ca298e591b3f32a73247863f21c86996596e323d8","observation_id":"07e7e605-660a-40c8-beec-f7d10bbdfcb8","resolution":{"observed_at":"2026-05-19T17:47:41.626886Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.12729","last_updated":"2020-05-25T16:24:59Z","snapshot_observed_at":"2026-07-06T09:23:23.891393Z","submitted_at":"2020-05-25T16:24:59Z","title":"Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO","version":1},"cited_work":{"arxiv_id":"2005.12729","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2005.12729","snapshot_observed_at":"2026-07-04T12:09:48.784830Z","title":"arXiv preprint arXiv:2005.12729 , year=","venue":null,"work_id":"a0c5b73d-c242-4cb2-b4d4-fbffb504fe33","year":2005},"citing_paper":{"arxiv_id":"2605.02320","last_updated":"2026-05-06T13:24:45Z","snapshot_observed_at":"2026-08-02T22:49:58.340073Z","submitted_at":"2026-05-04T08:15:52Z","title":"ANO: A Principled Approach to Robust Policy Optimization","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-08T19:34:12.002351Z"},"links":{"cited_paper":"/paper/2005.12729","citing_paper":"/paper/2605.02320"},"observation_digest":"sha256:4bf4dcd1fc7cbc5f2695bc1e254fa0ec67193d4f1fce2aa5bc8aa93168ab188b","observation_id":"4a49f367-01c8-4aa0-abed-8c07c071b344","resolution":{"observed_at":"2026-05-09T05:45:23.303091Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.12729","last_updated":"2020-05-25T16:24:59Z","snapshot_observed_at":"2026-07-06T09:23:23.891393Z","submitted_at":"2020-05-25T16:24:59Z","title":"Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO","version":1},"cited_work":{"arxiv_id":"2005.12729","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2005.12729","snapshot_observed_at":"2026-07-04T12:09:48.784830Z","title":"arXiv preprint arXiv:2005.12729 , year=","venue":null,"work_id":"a0c5b73d-c242-4cb2-b4d4-fbffb504fe33","year":2005},"citing_paper":{"arxiv_id":"2605.06032","last_updated":"2026-05-07T11:22:45Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T11:22:45Z","title":"Does Synthetic Data Help? Empirical Evidence from Deep Learning Time Series Forecasters","version":1},"reference_index":254,"source":"arxiv_source","source_observed_at":"2026-05-08T14:16:34.235992Z"},"links":{"cited_paper":"/paper/2005.12729","citing_paper":"/paper/2605.06032"},"observation_digest":"sha256:f11cbe4ecf642d367a5c7b1929402c94f525d076635ad14d06ffb71dbbebf93b","observation_id":"52dd2441-8816-4fb8-af6a-aacbb3fc3bea","resolution":{"observed_at":"2026-05-11T18:41:12.454247Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.12729","last_updated":"2020-05-25T16:24:59Z","snapshot_observed_at":"2026-07-06T09:23:23.891393Z","submitted_at":"2020-05-25T16:24:59Z","title":"Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO","version":1},"cited_work":{"arxiv_id":"2005.12729","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2005.12729","snapshot_observed_at":"2026-07-04T12:09:48.784830Z","title":"arXiv preprint arXiv:2005.12729 , year=","venue":null,"work_id":"a0c5b73d-c242-4cb2-b4d4-fbffb504fe33","year":2005},"citing_paper":{"arxiv_id":"2605.06987","last_updated":"2026-05-07T22:05:23Z","snapshot_observed_at":"2026-07-31T05:30:22.249144Z","submitted_at":"2026-05-07T22:05:23Z","title":"Response Time Enhances Alignment with Heterogeneous Preferences","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-11T01:04:26.288913Z"},"links":{"cited_paper":"/paper/2005.12729","citing_paper":"/paper/2605.06987"},"observation_digest":"sha256:67e5c1ea064bd1933384caad2a060d830d963f2f2f6b9e0f094b997bcadce43d","observation_id":"bb983171-0d8d-45a4-be46-b146e61802ae","resolution":{"observed_at":"2026-05-11T04:46:00.141867Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.12729","last_updated":"2020-05-25T16:24:59Z","snapshot_observed_at":"2026-07-06T09:23:23.891393Z","submitted_at":"2020-05-25T16:24:59Z","title":"Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO","version":1},"cited_work":{"arxiv_id":"2005.12729","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2005.12729","snapshot_observed_at":"2026-07-04T12:09:48.784830Z","title":"arXiv preprint arXiv:2005.12729 , year=","venue":null,"work_id":"a0c5b73d-c242-4cb2-b4d4-fbffb504fe33","year":2005},"citing_paper":{"arxiv_id":"2605.11473","last_updated":"2026-05-12T03:40:28Z","snapshot_observed_at":"2026-08-02T04:53:57.647690Z","submitted_at":"2026-05-12T03:40:28Z","title":"TOPPO: Rethinking PPO for Multi-Task Reinforcement Learning with Critic Balancing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T01:48:13.679862Z"},"links":{"cited_paper":"/paper/2005.12729","citing_paper":"/paper/2605.11473"},"observation_digest":"sha256:368bae9ed98a98fafe78e22515a1dda8640d1dfc68ddeefeedf8205c5840d03b","observation_id":"5cdcc69b-7f56-4ea8-828b-6657dc5f04f9","resolution":{"observed_at":"2026-05-13T01:52:05.738887Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.12729","last_updated":"2020-05-25T16:24:59Z","snapshot_observed_at":"2026-07-06T09:23:23.891393Z","submitted_at":"2020-05-25T16:24:59Z","title":"Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO","version":1},"cited_work":{"arxiv_id":"2005.12729","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2005.12729","snapshot_observed_at":"2026-07-04T12:09:48.784830Z","title":"arXiv preprint arXiv:2005.12729 , year=","venue":null,"work_id":"a0c5b73d-c242-4cb2-b4d4-fbffb504fe33","year":2005},"citing_paper":{"arxiv_id":"2605.26784","last_updated":"2026-05-26T09:53:42Z","snapshot_observed_at":"2026-08-06T13:00:03.980604Z","submitted_at":"2026-05-26T09:53:42Z","title":"Ratio-Variance Regularized Policy Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T19:44:02.317303Z"},"links":{"cited_paper":"/paper/2005.12729","citing_paper":"/paper/2605.26784"},"observation_digest":"sha256:86fef7e9c31b072025a925f2f25e25e94f29b7b2efa4ec96babbef91a55ec0f3","observation_id":"34485d47-4743-4400-a09d-9c895fef8c0d","resolution":{"observed_at":"2026-06-29T19:53:55.985787Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.12729","last_updated":"2020-05-25T16:24:59Z","snapshot_observed_at":"2026-07-06T09:23:23.891393Z","submitted_at":"2020-05-25T16:24:59Z","title":"Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.12729","snapshot_observed_at":"2026-07-12T23:02:52.079919Z","title":"Implementation matters in deep policy gradients: A case study on ppo and trpo,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2605.27385","last_updated":"2026-04-10T19:37:16Z","snapshot_observed_at":"2026-08-06T06:57:18.386176Z","submitted_at":"2026-04-10T19:37:16Z","title":"Personalized Observation Normalization for Federated Reinforcement Learning in Simulation Environments with Heterogeneity","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T23:02:52.079919Z"},"links":{"cited_paper":"/paper/2005.12729","citing_paper":"/paper/2605.27385"},"observation_digest":"sha256:d304362beeb97e00c2c9a6ead2ad18698d1ec3c9f3368152b12018203100a990","observation_id":"f6af7c43-22eb-45ff-a1b1-9f8337fb0d18","resolution":{"observed_at":"2026-07-12T23:02:52.079919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.12729","last_updated":"2020-05-25T16:24:59Z","snapshot_observed_at":"2026-07-06T09:23:23.891393Z","submitted_at":"2020-05-25T16:24:59Z","title":"Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO","version":1},"cited_work":{"arxiv_id":"2005.12729","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2005.12729","snapshot_observed_at":"2026-07-04T12:09:48.784830Z","title":"arXiv preprint arXiv:2005.12729 , year=","venue":null,"work_id":"a0c5b73d-c242-4cb2-b4d4-fbffb504fe33","year":2005},"citing_paper":{"arxiv_id":"2606.04574","last_updated":"2026-06-25T11:19:06Z","snapshot_observed_at":"2026-08-02T17:59:40.124402Z","submitted_at":"2026-06-03T08:10:33Z","title":"Dynamic Multi-Pair Trading Strategy in Cryptocurrency Markets with Deep Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T07:38:03.222413Z"},"links":{"cited_paper":"/paper/2005.12729","citing_paper":"/paper/2606.04574"},"observation_digest":"sha256:3ec4d30a3aa5f3e9b29274d20343f0a0323c3334de98e1c4d88ec29c7a9789d3","observation_id":"cf90a442-801c-4282-9a38-7337e7bc4607","resolution":{"observed_at":"2026-07-02T06:06:41.426638Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.12729","last_updated":"2020-05-25T16:24:59Z","snapshot_observed_at":"2026-07-06T09:23:23.891393Z","submitted_at":"2020-05-25T16:24:59Z","title":"Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO","version":1},"cited_work":{"arxiv_id":"2005.12729","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2005.12729","snapshot_observed_at":"2026-07-04T12:09:48.784830Z","title":"arXiv preprint arXiv:2005.12729 , year=","venue":null,"work_id":"a0c5b73d-c242-4cb2-b4d4-fbffb504fe33","year":2005},"citing_paper":{"arxiv_id":"2606.13605","last_updated":"2026-06-11T17:22:05Z","snapshot_observed_at":"2026-08-07T11:19:13.177492Z","submitted_at":"2026-06-11T17:22:05Z","title":"Distribution-Agnostic Robust Trajectory Optimization via Chance-Constrained Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T05:42:37.031721Z"},"links":{"cited_paper":"/paper/2005.12729","citing_paper":"/paper/2606.13605"},"observation_digest":"sha256:3087a0f5c3ebb5191e7072d71916ae02eea982faf0dc22a60e50a3ff9a1b5375","observation_id":"316ce026-771d-4e4e-b3c9-692453b5f899","resolution":{"observed_at":"2026-07-03T16:28:38.903131Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.12729","last_updated":"2020-05-25T16:24:59Z","snapshot_observed_at":"2026-07-06T09:23:23.891393Z","submitted_at":"2020-05-25T16:24:59Z","title":"Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO","version":1},"cited_work":{"arxiv_id":"2005.12729","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2005.12729","snapshot_observed_at":"2026-07-04T12:09:48.784830Z","title":"arXiv preprint arXiv:2005.12729 , year=","venue":null,"work_id":"a0c5b73d-c242-4cb2-b4d4-fbffb504fe33","year":2005},"citing_paper":{"arxiv_id":"2606.23110","last_updated":"2026-06-22T09:53:27Z","snapshot_observed_at":"2026-08-07T23:04:32.208086Z","submitted_at":"2026-06-22T09:53:27Z","title":"LOLLA: Deep Reinforcement Learning for Closed-Loop Link Adaptation Towards a GPU-Accelerated AI-RAN","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-26T07:14:40.706395Z"},"links":{"cited_paper":"/paper/2005.12729","citing_paper":"/paper/2606.23110"},"observation_digest":"sha256:f5d566f3643121d907bf525557fae6c742a766566c15d8533362b4df942deff5","observation_id":"c43b365a-919c-42ee-9c54-d17a1c1fdd92","resolution":{"observed_at":"2026-07-04T12:09:48.786465Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.12729","last_updated":"2020-05-25T16:24:59Z","snapshot_observed_at":"2026-07-06T09:23:23.891393Z","submitted_at":"2020-05-25T16:24:59Z","title":"Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.12729","snapshot_observed_at":"2026-07-12T04:21:03.464973Z","title":"Engstrom, A","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03176","last_updated":"2026-07-03T10:24:30Z","snapshot_observed_at":"2026-08-03T11:13:09.564165Z","submitted_at":"2026-07-03T10:24:30Z","title":"Understanding electricity consumption behaviour through Inverse Reinforcement Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-12T04:21:03.464973Z"},"links":{"cited_paper":"/paper/2005.12729","citing_paper":"/paper/2607.03176"},"observation_digest":"sha256:be2942c5ba0bb99a1d28a9bf58f2e133a610e6f59dfed725e72773719ac72e30","observation_id":"fe19167d-f4a3-4b44-9437-b41ed7f7b555","resolution":{"observed_at":"2026-07-12T04:21:03.464973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.12729","last_updated":"2020-05-25T16:24:59Z","snapshot_observed_at":"2026-07-06T09:23:23.891393Z","submitted_at":"2020-05-25T16:24:59Z","title":"Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.12729","snapshot_observed_at":"2026-07-11T13:53:36.775836Z","title":"arXiv preprint arXiv:2005.12729 , year=","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":1},"reference_index":147,"source":"arxiv_source","source_observed_at":"2026-07-11T13:53:36.775836Z"},"links":{"cited_paper":"/paper/2005.12729","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:04ceb6d56e0ad55d0d218e0ee89ee0c3399be22d1ca3de7b45a5edf95a31ec40","observation_id":"47e40277-b8b8-483d-a3a0-2a33dbbe64d8","resolution":{"observed_at":"2026-07-11T13:53:36.775836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.12729","last_updated":"2020-05-25T16:24:59Z","snapshot_observed_at":"2026-07-06T09:23:23.891393Z","submitted_at":"2020-05-25T16:24:59Z","title":"Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.12729","snapshot_observed_at":"2026-08-02T08:40:48.552061Z","title":"arXiv preprint arXiv:2005.12729 , year=","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":148,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:48.552061Z"},"links":{"cited_paper":"/paper/2005.12729","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:2e0668c87a23ad931873aa3ea9fe5db87664d368cbf86bffa74987d534857ef0","observation_id":"0253a4f8-8e1d-4aab-85cf-946b64d8577d","resolution":{"observed_at":"2026-08-02T08:40:48.552061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.12729","last_updated":"2020-05-25T16:24:59Z","snapshot_observed_at":"2026-07-06T09:23:23.891393Z","submitted_at":"2020-05-25T16:24:59Z","title":"Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.12729","snapshot_observed_at":"2026-08-01T02:44:30.092180Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:30.092180Z"},"links":{"cited_paper":"/paper/2005.12729","citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:c349ba54fa6de949ba4e6ac9fca137f5635f2515a0fea1836e265ca11840ff1b","observation_id":"40ce625e-4d6b-4884-b8bc-3a84d544f609","resolution":{"observed_at":"2026-08-01T02:44:30.092180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2005.12729/citation-record","integrity":"/paper/2005.12729/integrity","json":"/paper/2005.12729/citation-record.json","paper":"/paper/2005.12729"},"outbound":[],"paper":{"arxiv_id":"2005.12729","last_updated":"2020-05-25T16:24:59Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T09:23:23.891393Z","submitted_at":"2020-05-25T16:24:59Z","title":"Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 25 inbound Pith citation observations for arXiv:2005.12729."}