{"as_of":"2026-08-19T07:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1116b83c93e07a61a528a7c12e463ece9cf9cf098278f20082b98df3d0f2bc44","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:28:36.463613Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:16:29.076338Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-23T19:23:22.088073Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.15370","last_updated":"2025-05-21T05:30:43Z","snapshot_observed_at":"2026-08-12T14:20:16.538123Z","submitted_at":"2024-11-22T22:46:21Z","title":"Deep Policy Gradient Methods Without Batch Updates, Target Networks, or Replay Buffers","version":2},"cited_work":{"arxiv_id":"2411.15370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.15370","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://arxiv.org/abs/2411.15370","venue":null,"work_id":"3bb1a1d0-a457-4b4f-8f4e-0a2334ef8e8e","year":2024},"citing_paper":{"arxiv_id":"2410.17517","last_updated":"2026-07-21T18:31:44Z","snapshot_observed_at":"2026-08-16T13:06:47.063801Z","submitted_at":"2024-10-23T02:49:37Z","title":"The Hive Mind is a Single Reinforcement Learning Agent","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:27.381408Z"},"links":{"cited_paper":"/paper/2411.15370","citing_paper":"/paper/2410.17517"},"observation_digest":"sha256:268b7a9ccb6ae9b2a97346e419244bf6e39ffba3ff0886268f55fcc4893b3199","observation_id":"5f805f2b-8114-45fc-9733-87f9dd8099b4","resolution":{"observed_at":"2026-05-23T19:23:22.090290Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15370","last_updated":"2025-05-21T05:30:43Z","snapshot_observed_at":"2026-08-12T14:20:16.538123Z","submitted_at":"2024-11-22T22:46:21Z","title":"Deep Policy Gradient Methods Without Batch Updates, Target Networks, or Replay Buffers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15370","snapshot_observed_at":"2026-08-15T19:16:29.076338Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17204","last_updated":"2025-06-20T17:54:24Z","snapshot_observed_at":"2026-08-18T17:01:09.263981Z","submitted_at":"2025-06-20T17:54:24Z","title":"Network Sparsity Unlocks the Scaling Potential of Deep Reinforcement Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T19:16:29.076338Z"},"links":{"cited_paper":"/paper/2411.15370","citing_paper":"/paper/2506.17204"},"observation_digest":"sha256:a04806426941dd95dc83ba05f98b1770894a9488f314d27f767cdfee74896894","observation_id":"cd65b16c-a140-415e-b947-da1f44889529","resolution":{"observed_at":"2026-08-15T19:16:29.076338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.15370/citation-record","integrity":"/paper/2411.15370/integrity","json":"/paper/2411.15370/citation-record.json","paper":"/paper/2411.15370"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:28:37.762240Z","title":null,"venue":null,"work_id":"7484b819-83ae-4326-b254-a99424b1e6a8","year":null},"citing_paper":{"arxiv_id":"2411.15370","last_updated":"2025-05-21T05:30:43Z","snapshot_observed_at":"2026-08-12T14:20:16.538123Z","submitted_at":"2024-11-22T22:46:21Z","title":"Deep Policy Gradient Methods Without Batch Updates, Target Networks, or Replay Buffers","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:28:36.129633Z"},"links":{"citing_paper":"/paper/2411.15370"},"observation_digest":"sha256:751040972bfe2421b4d386087afde2bc4653c03008d037b207cfc7168a3b2bf4","observation_id":"9ae6fafe-f848-4081-b498-fde9a086bc11","resolution":{"observed_at":"2026-08-12T14:28:37.766178Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:28:37.750859Z","title":null,"venue":null,"work_id":"971bc7b6-bcbf-4630-951e-67c0b06576a8","year":2022},"citing_paper":{"arxiv_id":"2411.15370","last_updated":"2025-05-21T05:30:43Z","snapshot_observed_at":"2026-08-12T14:20:16.538123Z","submitted_at":"2024-11-22T22:46:21Z","title":"Deep Policy Gradient Methods Without Batch Updates, Target Networks, or Replay Buffers","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T14:28:36.178664Z"},"links":{"citing_paper":"/paper/2411.15370"},"observation_digest":"sha256:ec80f27747b3a59431ab8eb61a138e31d32f4a070b7167349ee21e42b3751328","observation_id":"fd06cfa7-acb9-42d5-95ec-84cbe33549f5","resolution":{"observed_at":"2026-08-12T14:28:37.755738Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:28:37.563245Z","title":"If ˆY is an unbiased estimator of ¯Y and { ˆYj}j are i.i.d","venue":null,"work_id":"886c3782-790d-4197-9df8-6c1672e5c6b3","year":null},"citing_paper":{"arxiv_id":"2411.15370","last_updated":"2025-05-21T05:30:43Z","snapshot_observed_at":"2026-08-12T14:20:16.538123Z","submitted_at":"2024-11-22T22:46:21Z","title":"Deep Policy Gradient Methods Without Batch Updates, Target Networks, or Replay Buffers","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T14:28:36.258725Z"},"links":{"citing_paper":"/paper/2411.15370"},"observation_digest":"sha256:a368b9a296f247737ac057f948bb91b2f78db90725b17efded9304cf2fdac691","observation_id":"aa13e95c-d80e-479c-9b5b-07d3548afc0f","resolution":{"observed_at":"2026-08-12T14:28:37.664235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:28:37.553344Z","title":"If ˆy is an unbiased estimator of ¯y and {yj}j are i.i.d","venue":null,"work_id":"270f6da6-7bd8-4eb6-9515-c003b8b3d166","year":2022},"citing_paper":{"arxiv_id":"2411.15370","last_updated":"2025-05-21T05:30:43Z","snapshot_observed_at":"2026-08-12T14:20:16.538123Z","submitted_at":"2024-11-22T22:46:21Z","title":"Deep Policy Gradient Methods Without Batch Updates, Target Networks, or Replay Buffers","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:28:36.262384Z"},"links":{"citing_paper":"/paper/2411.15370"},"observation_digest":"sha256:cf9afb3e9ad8f10cd88763064321ce42afb25854b5d71b3a4a1c9cc4cc92ebae","observation_id":"5ee2c12d-34a0-4015-8a43-4125c5648cc3","resolution":{"observed_at":"2026-08-12T14:28:37.557407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:28:37.539639Z","title":"Guidelines: • The answer NA means that the abstract and introduction do not include the claims made in the paper","venue":null,"work_id":"8a34a96f-2278-42cd-ab1a-c2cd4a5a83c5","year":null},"citing_paper":{"arxiv_id":"2411.15370","last_updated":"2025-05-21T05:30:43Z","snapshot_observed_at":"2026-08-12T14:20:16.538123Z","submitted_at":"2024-11-22T22:46:21Z","title":"Deep Policy Gradient Methods Without Batch Updates, Target Networks, or Replay Buffers","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:28:36.266488Z"},"links":{"citing_paper":"/paper/2411.15370"},"observation_digest":"sha256:3501643e21c9ac15ce9241f50baf7291a6b22a17d03f755112fac8b78430d0f6","observation_id":"01d77d02-9cb7-4394-862f-b8e99688825f","resolution":{"observed_at":"2026-08-12T14:28:37.546652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:28:37.323915Z","title":"Limitations","venue":null,"work_id":"e912b7ca-32e5-411a-9dc9-8457a7fc600b","year":null},"citing_paper":{"arxiv_id":"2411.15370","last_updated":"2025-05-21T05:30:43Z","snapshot_observed_at":"2026-08-12T14:20:16.538123Z","submitted_at":"2024-11-22T22:46:21Z","title":"Deep Policy Gradient Methods Without Batch Updates, Target Networks, or Replay Buffers","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T14:28:36.270752Z"},"links":{"citing_paper":"/paper/2411.15370"},"observation_digest":"sha256:6d226b984f7267b7baf70e9634734b5ee8ecb4310b5cd1495ea9b0250f44291d","observation_id":"4eb8622f-e1df-4424-95cc-a3f8043b31da","resolution":{"observed_at":"2026-08-12T14:28:37.424635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:28:37.313796Z","title":"Guidelines: • The answer NA means that the paper does not include theoretical results","venue":null,"work_id":"def488bf-095b-4dda-8fb6-94fe2e2c965a","year":null},"citing_paper":{"arxiv_id":"2411.15370","last_updated":"2025-05-21T05:30:43Z","snapshot_observed_at":"2026-08-12T14:20:16.538123Z","submitted_at":"2024-11-22T22:46:21Z","title":"Deep Policy Gradient Methods Without Batch Updates, Target Networks, or Replay Buffers","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:28:36.274285Z"},"links":{"citing_paper":"/paper/2411.15370"},"observation_digest":"sha256:dc8fe523e6a95b17e52510c07f15ae60a776604e78cf795d4a8f855a15955e94","observation_id":"4c169bb7-0ce9-404a-965f-bdaf10f68f15","resolution":{"observed_at":"2026-08-12T14:28:37.317713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:28:37.303926Z","title":"We provide pseudo- code and implementation details which are easy to follow and reproduce","venue":null,"work_id":"61d582f4-7ff4-43d1-8f4b-21be5f86b33f","year":null},"citing_paper":{"arxiv_id":"2411.15370","last_updated":"2025-05-21T05:30:43Z","snapshot_observed_at":"2026-08-12T14:20:16.538123Z","submitted_at":"2024-11-22T22:46:21Z","title":"Deep Policy Gradient Methods Without Batch Updates, Target Networks, or Replay Buffers","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:28:36.277778Z"},"links":{"citing_paper":"/paper/2411.15370"},"observation_digest":"sha256:8a6d6d7a4a0bf5a9eec7ace3fcf4a6088aa45897e3a1638e5707fdb1af45806c","observation_id":"43353a88-73fa-42b4-b7cd-100aff96d0fc","resolution":{"observed_at":"2026-08-12T14:28:37.307848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:28:37.051852Z","title":"All data can be generated during training","venue":null,"work_id":"4a5f8438-27d0-43d8-b967-6c3e6f9d0ca1","year":null},"citing_paper":{"arxiv_id":"2411.15370","last_updated":"2025-05-21T05:30:43Z","snapshot_observed_at":"2026-08-12T14:20:16.538123Z","submitted_at":"2024-11-22T22:46:21Z","title":"Deep Policy Gradient Methods Without Batch Updates, Target Networks, or Replay Buffers","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:28:36.281382Z"},"links":{"citing_paper":"/paper/2411.15370"},"observation_digest":"sha256:8192c82a0ab4e1d4d857f86e566e0ae24ad61b062dfc5a84e625dad3e6954965","observation_id":"9701a506-9e26-4dcc-846e-5aef48b1adc7","resolution":{"observed_at":"2026-08-12T14:28:37.198589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:28:37.041853Z","title":"We also list important hyper-parameters, neural network architectures, and other training details in the appendix","venue":null,"work_id":"12063134-6347-41cc-8a57-ed52d0bacaeb","year":null},"citing_paper":{"arxiv_id":"2411.15370","last_updated":"2025-05-21T05:30:43Z","snapshot_observed_at":"2026-08-12T14:20:16.538123Z","submitted_at":"2024-11-22T22:46:21Z","title":"Deep Policy Gradient Methods Without Batch Updates, Target Networks, or Replay Buffers","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T14:28:36.285818Z"},"links":{"citing_paper":"/paper/2411.15370"},"observation_digest":"sha256:440b4e95cd931988b6e5203d1fa2a3344e6e8ecd342fb570a7bd16aea2ff57df","observation_id":"aabcf87c-1da2-4887-be5a-a45e22a20e85","resolution":{"observed_at":"2026-08-12T14:28:37.045620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:28:37.031514Z","title":"All results are averaged over 30 runs and reported with 95% confidence interval","venue":null,"work_id":"a4b37aed-2dee-4f48-9e6e-bdabf7084398","year":null},"citing_paper":{"arxiv_id":"2411.15370","last_updated":"2025-05-21T05:30:43Z","snapshot_observed_at":"2026-08-12T14:20:16.538123Z","submitted_at":"2024-11-22T22:46:21Z","title":"Deep Policy Gradient Methods Without Batch Updates, Target Networks, or Replay Buffers","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T14:28:36.289957Z"},"links":{"citing_paper":"/paper/2411.15370"},"observation_digest":"sha256:4fd82ef7f82fa35fb27edf30c41b1e2ef791cd657cca7bedc186f7a26e81797c","observation_id":"7bb0f572-ce8a-49cc-8adf-b4389de3351f","resolution":{"observed_at":"2026-08-12T14:28:37.035305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:28:37.020460Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"18359089-b46c-4544-abd5-a61b8b18ef9e","year":null},"citing_paper":{"arxiv_id":"2411.15370","last_updated":"2025-05-21T05:30:43Z","snapshot_observed_at":"2026-08-12T14:20:16.538123Z","submitted_at":"2024-11-22T22:46:21Z","title":"Deep Policy Gradient Methods Without Batch Updates, Target Networks, or Replay Buffers","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:28:36.301253Z"},"links":{"citing_paper":"/paper/2411.15370"},"observation_digest":"sha256:f907bab496240220ecaf7dd8dea49b8e7391b2ed9718dbc068dabc4bd7cb4942","observation_id":"b26a0333-19a7-444f-904e-9258f11ec5ff","resolution":{"observed_at":"2026-08-12T14:28:37.024001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:28:36.907571Z","title":"• If the authors answer No, they should explain the special circumstances that require a deviation from the Code of Ethics","venue":null,"work_id":"38ffbfae-bddc-4ce3-82ea-f5a17fb59e7c","year":null},"citing_paper":{"arxiv_id":"2411.15370","last_updated":"2025-05-21T05:30:43Z","snapshot_observed_at":"2026-08-12T14:20:16.538123Z","submitted_at":"2024-11-22T22:46:21Z","title":"Deep Policy Gradient Methods Without Batch Updates, Target Networks, or Replay Buffers","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:28:36.391274Z"},"links":{"citing_paper":"/paper/2411.15370"},"observation_digest":"sha256:17abe9919d117f5f2e7e81b97160ea0f7a8075175e3dad60abbfde20d0234fe8","observation_id":"7b98a8d1-a70b-4352-b53a-97f9a4d3dea4","resolution":{"observed_at":"2026-08-12T14:28:37.013746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:28:36.755393Z","title":"Guidelines: • The answer NA means that there is no societal impact of the work performed","venue":null,"work_id":"4f06c71d-bf01-4518-9f09-61b713f7f5b0","year":null},"citing_paper":{"arxiv_id":"2411.15370","last_updated":"2025-05-21T05:30:43Z","snapshot_observed_at":"2026-08-12T14:20:16.538123Z","submitted_at":"2024-11-22T22:46:21Z","title":"Deep Policy Gradient Methods Without Batch Updates, Target Networks, or Replay Buffers","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T14:28:36.446111Z"},"links":{"citing_paper":"/paper/2411.15370"},"observation_digest":"sha256:f0f127a613bea881115eed4733f49a24f74fc6713fbb33d89b6246db253e523c","observation_id":"598d7125-4740-43fe-868a-b06a68f200dd","resolution":{"observed_at":"2026-08-12T14:28:36.759056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:28:36.745333Z","title":null,"venue":null,"work_id":"86fa5644-cc7f-496e-b8b9-a2f5d0796c58","year":null},"citing_paper":{"arxiv_id":"2411.15370","last_updated":"2025-05-21T05:30:43Z","snapshot_observed_at":"2026-08-12T14:20:16.538123Z","submitted_at":"2024-11-22T22:46:21Z","title":"Deep Policy Gradient Methods Without Batch Updates, Target Networks, or Replay Buffers","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:28:36.449703Z"},"links":{"citing_paper":"/paper/2411.15370"},"observation_digest":"sha256:66323b266fa26f22e0cf8d56afd025ed8e998fbdd05006dd5cce228cf95cee4b","observation_id":"62fa513f-08b8-4688-a0d1-7da0336bc486","resolution":{"observed_at":"2026-08-12T14:28:36.748818Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:28:36.734758Z","title":"All our results are generated during training","venue":null,"work_id":"9b51f62f-4e5b-4645-abec-eceb7168a85b","year":null},"citing_paper":{"arxiv_id":"2411.15370","last_updated":"2025-05-21T05:30:43Z","snapshot_observed_at":"2026-08-12T14:20:16.538123Z","submitted_at":"2024-11-22T22:46:21Z","title":"Deep Policy Gradient Methods Without Batch Updates, Target Networks, or Replay Buffers","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:28:36.453035Z"},"links":{"citing_paper":"/paper/2411.15370"},"observation_digest":"sha256:4bfd66c44e5d1f88a83393dce56a4d92fa227b38152ae6227b4ec158908dde96","observation_id":"3da4fab0-88f2-450e-931d-1eae4bd66df1","resolution":{"observed_at":"2026-08-12T14:28:36.738384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:28:36.724026Z","title":"• Researchers should communicate the details of the dataset/code/model as part of their submissions via structured templates","venue":null,"work_id":"2202a8ba-5664-4d99-814c-86a9fb806deb","year":null},"citing_paper":{"arxiv_id":"2411.15370","last_updated":"2025-05-21T05:30:43Z","snapshot_observed_at":"2026-08-12T14:20:16.538123Z","submitted_at":"2024-11-22T22:46:21Z","title":"Deep Policy Gradient Methods Without Batch Updates, Target Networks, or Replay Buffers","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:28:36.456421Z"},"links":{"citing_paper":"/paper/2411.15370"},"observation_digest":"sha256:42f62aeca92bd7a5d1164e29a71cac0722c17de129da44122b7044aca08cd6c5","observation_id":"a2515985-b436-4cf4-91ef-c5c390052cce","resolution":{"observed_at":"2026-08-12T14:28:36.728013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:28:36.613613Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"ec1d823c-bd9d-4632-80d5-b789b9d0425a","year":null},"citing_paper":{"arxiv_id":"2411.15370","last_updated":"2025-05-21T05:30:43Z","snapshot_observed_at":"2026-08-12T14:20:16.538123Z","submitted_at":"2024-11-22T22:46:21Z","title":"Deep Policy Gradient Methods Without Batch Updates, Target Networks, or Replay Buffers","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T14:28:36.460059Z"},"links":{"citing_paper":"/paper/2411.15370"},"observation_digest":"sha256:37741aee14525625def0b677aa701ea48db0808021a1ad7f28e94109bf2cafb6","observation_id":"c11a8980-e900-4a47-a2d6-18fdee074516","resolution":{"observed_at":"2026-08-12T14:28:36.716860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:28:36.488932Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"c5da681f-6f55-423d-bdb7-d76934d8618a","year":null},"citing_paper":{"arxiv_id":"2411.15370","last_updated":"2025-05-21T05:30:43Z","snapshot_observed_at":"2026-08-12T14:20:16.538123Z","submitted_at":"2024-11-22T22:46:21Z","title":"Deep Policy Gradient Methods Without Batch Updates, Target Networks, or Replay Buffers","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:28:36.463613Z"},"links":{"citing_paper":"/paper/2411.15370"},"observation_digest":"sha256:58c6f6517e636feb6f71cdf608967fd78bc7e7dfbab6b8e82c7ba2372742fbe0","observation_id":"095d6426-efb0-4455-8c3e-f0f3bbc49eba","resolution":{"observed_at":"2026-08-12T14:28:36.503641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.15370","last_updated":"2025-05-21T05:30:43Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T14:20:16.538123Z","submitted_at":"2024-11-22T22:46:21Z","title":"Deep Policy Gradient Methods Without Batch Updates, Target Networks, or Replay Buffers"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 2 inbound Pith citation observations for arXiv:2411.15370."}