{"as_of":"2026-08-20T18:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e5f937f439262dc2f33ad46b1e8d31fba78245a7a631e3067ea53d3240cf23f8","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T14:25:39.636614Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-11T11:33:20.892688Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T11:33:21.562600Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"cited_work":{"arxiv_id":"1908.03263","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1908.03263","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"dc99cad6-0314-4dd9-9507-efcc7c36cf7a","year":2019},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":282,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"cited_paper":"/paper/1908.03263","citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:54df6ea0718655d9faa448dd43e9d05673a4220589725449b57b7b352547f9d0","observation_id":"2ac05bc8-c0f4-4185-b19b-7e362f2cf794","resolution":{"observed_at":"2026-05-11T11:33:21.565277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/1908.03263/citation-record","integrity":"/paper/1908.03263/integrity","json":"/paper/1908.03263/citation-record.json","paper":"/paper/1908.03263"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.917248Z","title":null,"venue":null,"work_id":"c3e900f3-77c9-4792-8846-952a3d457ecb","year":1992},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.177695Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:57dde5feeac8df84c3192ad1ab06062de211aff71de1e8c438e59884efbaae7b","observation_id":"191a5e9e-b75f-46ec-943b-b200e16d508c","resolution":{"observed_at":"2026-08-14T14:25:40.924948Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.889425Z","title":null,"venue":null,"work_id":"6ad4e1ea-04dd-45ab-a09e-3e671a82a4fe","year":2000},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.187513Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:2e20006f74c70152580a9190d018d2449ac59e1899a3fe1dba4f70a80eed6fd6","observation_id":"7da8213a-70aa-4ee0-829a-f224c1aae600","resolution":{"observed_at":"2026-08-14T14:25:40.897151Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.864441Z","title":null,"venue":null,"work_id":"9b97a60e-98ef-40f1-b92d-9572a18db56a","year":2002},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.196950Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:de6cc03edec15b0ca1460da83b33cb69eb17a8e20e87cebe41373f1178a1e536","observation_id":"b3ca9d18-1357-4dfd-a6ee-27d6b2e53085","resolution":{"observed_at":"2026-08-14T14:25:40.869973Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.838366Z","title":"Peters and S","venue":null,"work_id":"c4299828-2b02-4d69-9633-19f6c2cbf127","year":2008},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.206498Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:c423cfd42d3ec5a68b459bc0342ff7a17815ebe321102c9ad15c6672b4d171b7","observation_id":"cc2a877b-8086-408d-9614-bd9979352332","resolution":{"observed_at":"2026-08-14T14:25:40.847301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:39.213978Z","title":"Schulman, S","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.213978Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:6afbc5d5d0051572d47755316d95cd8036bdcbfb700529f21530e72391cecbca","observation_id":"34cf5d5e-26cf-4e57-a13e-f01d62e27c77","resolution":{"observed_at":"2026-08-14T14:25:39.213978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.799543Z","title":"Cheng, X","venue":null,"work_id":"4bd3a116-06ad-40c6-a5a5-d2cf0e8e759c","year":2019},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.222566Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:81d3b278fc3ea4f28167198482136e43783c10fa971a66adcc94b394011521cb","observation_id":"57f71c96-e1ba-4f92-a4ec-cdf0b63a3ba2","resolution":{"observed_at":"2026-08-14T14:25:40.804769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.776117Z","title":null,"venue":null,"work_id":"e663e8f6-71a1-4165-a950-4e09e26c06f2","year":2000},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.234559Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:22263ee752dd965a50b823dd536ba0447d8e8faba4857ee027f9376bbd65a225","observation_id":"d31b7ebf-c3c0-4b7f-a6d5-0fa7aa35bdee","resolution":{"observed_at":"2026-08-14T14:25:40.784745Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.740796Z","title":"Cheng, X","venue":null,"work_id":"42560f0b-0e37-4646-988c-291d13378ce5","year":2018},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.245548Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:0c66ddffa3d67b158a679d16d07c6894b1b6666bed21681e55227ca66b1b1904","observation_id":"71803ba2-1efc-48fb-bd61-c9da035f4473","resolution":{"observed_at":"2026-08-14T14:25:40.750048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.10462","last_updated":"2022-02-09T16:18:53Z","snapshot_observed_at":"2026-08-19T10:49:01.363949Z","submitted_at":"2019-06-25T11:36:18Z","title":"Policy Optimization with Stochastic Mirror Descent","version":5},"cited_work":{"arxiv_id":"1906.10462","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.10462","snapshot_observed_at":"2026-08-14T14:25:39.856362Z","title":"Policy Optimization with Stochastic Mirror Descent","venue":"cs.LG","work_id":"e3ee5ae9-8c5e-49f5-bf49-026dd223d124","year":2019},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.260813Z"},"links":{"cited_paper":"/paper/1906.10462","citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:102c7c7cdccae10a1c08f9fce91cbcc45dd4b2b07cb7f3839146f2380bfa3f95","observation_id":"09f63648-3278-48c7-8939-de72168efcb4","resolution":{"observed_at":"2026-08-14T14:25:39.867071Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.719801Z","title":"Ghadimi, G","venue":null,"work_id":"480c527f-22bf-4a61-b93d-2c903dc0a6c6","year":2016},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.274695Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:dcac0eea7409027b8e5d74e23d1fae201f96227d17b2cae050ef7af019faaf86","observation_id":"d626b641-55e4-4d66-892f-f924b8a01997","resolution":{"observed_at":"2026-08-14T14:25:40.725517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.696676Z","title":"Kimura, S","venue":null,"work_id":"e3f631f1-a5a2-495e-8c54-a541120c50e5","year":2000},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.282947Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:dc248b09afc98ac0cd8de14728fdf8fb3a68a94c2db86a5208ccfa81a2f42122","observation_id":"a671989a-ef87-46c2-8c7c-a3c28e61d926","resolution":{"observed_at":"2026-08-14T14:25:40.702491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.666863Z","title":null,"venue":null,"work_id":"e2fcaef7-ceff-4f70-bb09-963b81b4dd12","year":2014},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.291379Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:45ad904af7de8de9fe55918529f0b002e522bf29eb5abc734cfd51d47f6d435e","observation_id":"5c46c7f7-eb94-4c5f-bd5e-6990e74346a4","resolution":{"observed_at":"2026-08-14T14:25:40.676747Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.641227Z","title":"Silver, G","venue":null,"work_id":"82a8773d-ba18-4061-a1d2-9eea7e5098c2","year":2014},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.300911Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:06e321763cec8a07d81d2176b7e9724ddc5ba057246ef247500319151475b80e","observation_id":"9aa4f302-9e25-4fe3-a30e-1ca7475dc66a","resolution":{"observed_at":"2026-08-14T14:25:40.650996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.609221Z","title":"Schulman, P","venue":null,"work_id":"83d1eb60-f8e1-48af-87c8-295adaa68094","year":2016},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.306683Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:e53ef43e58b092898d6eb3d0524c4909793e6b8e94d58d878ab352cd34c24c18","observation_id":"a7042fe8-6800-4ca3-9fbb-cd57f2745822","resolution":{"observed_at":"2026-08-14T14:25:40.616211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.585809Z","title":null,"venue":null,"work_id":"15dc54e7-af12-401b-97de-369af1c831a9","year":2018},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.315864Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:673472c8e5eb2a9488a479a490ebd5ca46711b195360298ce99519bfe8d11665","observation_id":"c6273e3d-8564-4baf-a028-7b905328105e","resolution":{"observed_at":"2026-08-14T14:25:40.593088Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.564356Z","title":"Efroni, G","venue":null,"work_id":"76931f2b-bfc9-43fc-9eb8-6eae48945c80","year":2019},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.322420Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:47f031e8ec6474e80510016c42bd043f5c8ab627cb9b480a480a4842192175e2","observation_id":"80be2f38-460e-4332-b502-7de517abca12","resolution":{"observed_at":"2026-08-14T14:25:40.570376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.545110Z","title":null,"venue":null,"work_id":"59400d4c-2b53-4504-a7f5-2ceb3edd9e13","year":1999},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.328381Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:2841190583f4a939b6630c98898ae9d99b3fcc8fcca70c23250a3a680e88d577","observation_id":"f8d14759-c79d-4cfd-910c-c571bb326be1","resolution":{"observed_at":"2026-08-14T14:25:40.551194Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.525460Z","title":"Greensmith, P","venue":null,"work_id":"caaf4fc2-39c5-4764-b839-8c7a4918dab4","year":2004},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.337728Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:8cc3cba481b3419197091d3193d56fe6ee092481d912cb76aaa99391c3a87778","observation_id":"dd6fce16-93ba-4e1f-8598-cb6ec1a9da50","resolution":{"observed_at":"2026-08-14T14:25:40.531336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.497424Z","title":"Jie and P","venue":null,"work_id":"f953465f-c51d-4bbe-999f-3cc1bcff263f","year":2010},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.346992Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:7d78e4f5f65436c65011bfc266256495a7b1ed7ab068575ef76b4ad90adf945c","observation_id":"e1079437-cff7-41ef-9154-0d8c8d1d818d","resolution":{"observed_at":"2026-08-14T14:25:40.508191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.477474Z","title":null,"venue":null,"work_id":"4559ca49-4305-44f2-82ec-9bf260a1a777","year":2017},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.363164Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:4f711f029c50c7a10675e06d63ecaef213e0051962b4f9752c9594e6204b2978","observation_id":"24bf1f2f-8d04-49fe-b23c-be04665ed17b","resolution":{"observed_at":"2026-08-14T14:25:40.483707Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.455281Z","title":null,"venue":null,"work_id":"b6e1011e-6815-4e2b-a46f-1727203bf9cb","year":2018},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.370748Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:95f4c96acaf3b14a77b8f470ea04acb860aebc71655361af4f0afecdcba4452c","observation_id":"7ee92dd1-df7f-4d7e-a123-7650d1098d6d","resolution":{"observed_at":"2026-08-14T14:25:40.462850Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.432082Z","title":"Grathwohl, D","venue":null,"work_id":"8a479bd7-ecfc-41c2-b9e5-b7654368939f","year":2018},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.386784Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:88477559fe82bf41cf7ae19e93508387784cddcde079065b0c0e47c8cabe8c00","observation_id":"f864052a-b272-4a22-885e-ba3824d912c0","resolution":{"observed_at":"2026-08-14T14:25:40.441686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.10031","last_updated":"2018-11-19T18:57:02Z","snapshot_observed_at":"2026-08-18T07:30:07.444149Z","submitted_at":"2018-02-27T17:16:48Z","title":"The Mirage of Action-Dependent Baselines in Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.10031","snapshot_observed_at":"2026-08-14T14:25:39.395346Z","title":"Tucker, S","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.395346Z"},"links":{"cited_paper":"/paper/1802.10031","citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:6d9701c7610d9b9007137ad4f4758775c3d1526f69063170a67b8fee1d57a6df","observation_id":"8a087b20-2c97-45a4-8fed-e943814e64e2","resolution":{"observed_at":"2026-08-14T14:25:39.395346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.06225","last_updated":"2018-11-15T08:18:33Z","snapshot_observed_at":"2026-08-14T17:58:54.861799Z","submitted_at":"2018-11-15T08:18:33Z","title":"Reward-estimation variance elimination in sequential decision processes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.06225","snapshot_observed_at":"2026-08-14T14:25:39.404839Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.404839Z"},"links":{"cited_paper":"/paper/1811.06225","citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:5b7bd056aed0dba9202cf32f6213d9359a7d67d4b2ead2861918190eb26c83cd","observation_id":"371e0090-7036-4b0c-a91b-ec496ff7e2e3","resolution":{"observed_at":"2026-08-14T14:25:39.404839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.411836Z","title":null,"venue":null,"work_id":"1c5ed930-69bb-4b53-ad54-ff3ff076be09","year":2018},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.418128Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:97ce6329b61d7ddd3c06e4ed2b02914d45763a333c1946468dc4bc76ce5b3b4f","observation_id":"a2db03ec-246c-485a-a25c-17b62980cfc2","resolution":{"observed_at":"2026-08-14T14:25:40.417372Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.389732Z","title":null,"venue":null,"work_id":"a12aa5d3-c660-40e4-b17c-1a0ab6d51597","year":1957},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.425024Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:0ea9e8363fe901e6f73b718a963f0adbe17cc0a98a2af4b37af0d462403c8b5b","observation_id":"c8c16567-bff4-4ed4-a284-9f49c2b7c3b5","resolution":{"observed_at":"2026-08-14T14:25:40.397483Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.351596Z","title":null,"venue":null,"work_id":"4a87e3db-e2c9-4bae-babc-fa0481c9d647","year":1995},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.434584Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:4637cedb4b98ee315c55a40592490dae367f91962c0d414cdb2120bcbe22f5b3","observation_id":"83f44b55-f1fe-4b9b-9aac-c46a2fb6e61b","resolution":{"observed_at":"2026-08-14T14:25:40.365337Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:39.440612Z","title":"Beck and M","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.440612Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:f8eb67467e044c220fb741318cae4f9d0303f164da73035227b33fc9694c8228","observation_id":"b4090b9c-e85c-46ae-a45d-ddb4d4f6ca6b","resolution":{"observed_at":"2026-08-14T14:25:39.440612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.304803Z","title":null,"venue":null,"work_id":"706a38df-3146-42f3-8cab-f26fd9806db7","year":2003},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.449838Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:53be65b48bdfaf2ecddea482603ad9f21943d2452464e03009289b08e92636f0","observation_id":"07ba154f-3f7f-4ce6-831b-813832b46c4f","resolution":{"observed_at":"2026-08-14T14:25:40.317137Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.276837Z","title":"Vemula, W","venue":null,"work_id":"b029991e-9a25-423f-b783-46ee45afdf22","year":2019},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.464991Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:b18b824708f31e6a2115c2e88015aeda9101de897e3fb60463607df23c2a8b31","observation_id":"2c2a25d3-496d-4314-be2d-c416db887245","resolution":{"observed_at":"2026-08-14T14:25:40.284582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.247337Z","title":null,"venue":null,"work_id":"ac8b37e4-7e18-43d0-98c3-51865d3b29fa","year":1990},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.482592Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:93af32581aa3453ab4d39e962b83d4c6c505e20cdbc58f7e847a8ea02777bd6c","observation_id":"38408601-f664-4a24-bb12-efedbf9cadeb","resolution":{"observed_at":"2026-08-14T14:25:40.258593Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:39.491821Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.491821Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:e31ba202fa79a76dc0d18e46b8704acbd28624bba8e9f4c1d8fe6f1dd27fb816","observation_id":"895ec48f-b0a8-4842-8570-d3adb223217c","resolution":{"observed_at":"2026-08-14T14:25:39.491821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:39.499332Z","title":"Schmidt, N","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.499332Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:49bd1634c8f056e7f1785cd3172f6c429ebb9701f47c3ec577795b16f704e0b1","observation_id":"90fad94f-fd03-4d05-a2a9-3772dacca61f","resolution":{"observed_at":"2026-08-14T14:25:39.499332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.191108Z","title":"Johnson and T","venue":null,"work_id":"2469f6ed-f30f-4b1f-ae34-61865f07b800","year":2013},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.506390Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:ea046e16099a6917bf5bd2400c31437cbddac75b6dcd551b989f70473efd334d","observation_id":"bceff0ea-6228-4960-823e-e87165ca94b5","resolution":{"observed_at":"2026-08-14T14:25:40.199064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.155461Z","title":"Defazio, F","venue":null,"work_id":"450f35a3-55fc-4440-8d7f-0e5a191ab3cc","year":2014},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.514204Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:e295a4dd29ce0b94c89e68e2876f5590edc4691c7595fa7f186e9f2a90ebeeb2","observation_id":"3b37b103-d5da-4510-b3d3-50c58d4bc5b0","resolution":{"observed_at":"2026-08-14T14:25:40.168026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.126058Z","title":null,"venue":null,"work_id":"de287e2e-73f4-4e59-a777-48bdf7333d21","year":2013},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.520508Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:6514ff191708ceac9c1034f703801ecbbd9047bedd2b1e0170f1ed0d2765cce1","observation_id":"1df63345-774d-44a6-8c82-8065e0835dd4","resolution":{"observed_at":"2026-08-14T14:25:40.132969Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.03326","last_updated":"2020-05-02T07:20:30Z","snapshot_observed_at":"2026-08-17T09:10:04.869132Z","submitted_at":"2018-01-10T11:59:59Z","title":"Expected Policy Gradients for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1801.03326","doi":null,"metadata_source":"pith","pith_arxiv_id":"1801.03326","snapshot_observed_at":"2026-08-14T14:25:39.744855Z","title":"Expected Policy Gradients for Reinforcement Learning","venue":"stat.ML","work_id":"9782d341-bc6f-4930-a929-27e6a3d326b1","year":2018},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.540027Z"},"links":{"cited_paper":"/paper/1801.03326","citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:c9319baa1392f5a939177d108e9618736633c10ade6ab2e8d8d7dbfe1253a5a7","observation_id":"9627ad71-871a-4bb5-8b6f-3f4df6e5262a","resolution":{"observed_at":"2026-08-14T14:25:39.759551Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.095463Z","title":null,"venue":null,"work_id":"aefd3b2c-652b-4a23-9c82-2b5e6d3638c0","year":1996},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.547750Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:179fd1c6159538ba1fd698ffd7c6b84020e39980792477d304223330d6d12ab7","observation_id":"14a9e677-16d0-4d01-9b91-5cb3b06f84c7","resolution":{"observed_at":"2026-08-14T14:25:40.105382Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.060748Z","title":null,"venue":null,"work_id":"2592fe24-abdd-472f-89b9-68e7156f816f","year":2001},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.568347Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:b1c107e08e08e27649a6ac39daa59eacd28b406f98c67809bef7c4ae7faab857","observation_id":"6716a93d-b318-4de0-9902-a434c6d3db5a","resolution":{"observed_at":"2026-08-14T14:25:40.069970Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.027709Z","title":"Baxter and P","venue":null,"work_id":"d734a099-fe21-4b33-85be-c8bbdb035afd","year":2001},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.579352Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:da223596ed017c21b6ddf76b13c2710a03eda4ab7895ac1b21bebcc94719e5e1","observation_id":"af4d472a-85e8-4970-b13a-003c7530376e","resolution":{"observed_at":"2026-08-14T14:25:40.038358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:39.995088Z","title":"Landau and E","venue":null,"work_id":"ddf54e6a-c6ec-4a7b-84bb-39eb1d5d035d","year":1958},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.593945Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:608ada69acd65debed9ef5c8d73e19ee5e2dbfe6859f646de4e39ffd831b0c02","observation_id":"0985f900-b8ab-4169-88f1-305275137236","resolution":{"observed_at":"2026-08-14T14:25:40.000894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-13T12:26:05.192883Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-14T14:25:39.601235Z","title":"Brockman, V","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.601235Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:5a975202c79f7d126b6c6f100f03703f3b9dc3cd69f7b25320a31ae7d81ff571","observation_id":"9e8624c0-204f-46eb-b5ab-034b6abb15d3","resolution":{"observed_at":"2026-08-14T14:25:39.601235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:39.968140Z","title":null,"venue":null,"work_id":"b2be4e59-f83a-4a52-8609-2a9178dc36ff","year":2018},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.612620Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:2dd4f58fc8bfd7101e632e1a0fcb3dbe5d72e90c1e65c0b63bf4096efafc4371","observation_id":"62138545-a281-4e10-87c7-5e8f3b0c6a9a","resolution":{"observed_at":"2026-08-14T14:25:39.977301Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:39.938179Z","title":null,"venue":null,"work_id":"7109f243-31ad-493a-8034-b92a968877c3","year":2006},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.619676Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:9d73de5cf30e38316ff1af4fdf534b2dfd588125c38cfd0ae6a718958a669321","observation_id":"bba63ec3-e7a8-4190-8c9d-92853e5157e5","resolution":{"observed_at":"2026-08-14T14:25:39.946075Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:39.915130Z","title":"That is, a feasible ordering must be causal at least in actions: the action randomness that causes a state must be arranged before that state in the ordering","venue":null,"work_id":"c5f8545a-c3f8-409a-b582-f5f0008b8f57","year":null},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.627640Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:c41fe3822e6ad0a29c6642cd7ed82024271f50da0cacb9fbb10a771082a64262","observation_id":"b27d937a-603c-4b9d-bc23-642f3b55db4b","resolution":{"observed_at":"2026-08-14T14:25:39.922455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:39.884976Z","title":"We consider the following operations (a) Suppose, in an ordering, there isSv→Su,v >u, then we can exchange them without affecting residue","venue":null,"work_id":"ba6c4216-23e7-4e5e-9d7f-b2711bd1afc8","year":null},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.636614Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:fb1f6011438ccfb1ded69e8e3e4db967c1b1020aed6f20657665786f3a253dd3","observation_id":"4d2ba498-63b1-4513-bc65-d36c41ce8afb","resolution":{"observed_at":"2026-08-14T14:25:39.894577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T07:30:05.983534Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":2,"verified_fuzzy":18},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 1 inbound Pith citation observation for arXiv:1908.03263."}