{"as_of":"2026-08-10T09:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:885c1b43132c3b63f5c187ac08f55b4e3e2d6c847431ea17c513fa33270332dd","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:54:25.833975Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T12:48:17.537507Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1909.01150","last_updated":"2019-11-12T21:42:43Z","snapshot_observed_at":"2026-08-04T13:08:13.681112Z","submitted_at":"2019-08-29T15:38:19Z","title":"Neural Policy Gradient Methods: Global Optimality and Rates of Convergence","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.01150","snapshot_observed_at":"2026-08-07T11:54:25.833975Z","title":"Neural policy gradient methods: Global optimality and rates of convergence","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:25.833975Z"},"links":{"cited_paper":"/paper/1909.01150","citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:e564f588e761d90aa13a29d95bbd680df972da0527578a9a16d0e77294264f5d","observation_id":"935a9aa8-71f1-4b99-8138-d8b4689fdcc5","resolution":{"observed_at":"2026-08-07T11:54:25.833975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.01150","last_updated":"2019-11-12T21:42:43Z","snapshot_observed_at":"2026-08-04T13:08:13.681112Z","submitted_at":"2019-08-29T15:38:19Z","title":"Neural Policy Gradient Methods: Global Optimality and Rates of Convergence","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.01150","snapshot_observed_at":"2026-08-06T13:21:59.394738Z","title":"Neural policy gradient methods: Global optimality and rates of convergence","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2507.20853","last_updated":"2025-07-28T14:06:44Z","snapshot_observed_at":"2026-08-10T04:44:01.568944Z","submitted_at":"2025-07-28T14:06:44Z","title":"Geometry of Neural Reinforcement Learning in Continuous State and Action Spaces","version":1},"reference_index":125,"source":"arxiv_source","source_observed_at":"2026-08-06T13:21:59.394738Z"},"links":{"cited_paper":"/paper/1909.01150","citing_paper":"/paper/2507.20853"},"observation_digest":"sha256:ff653b53ee685704bd1d30ceab923caf22e6251eda860d80c8aab36416246269","observation_id":"d6cff440-07e1-4ff3-b0a8-0cab089b8d64","resolution":{"observed_at":"2026-08-06T13:21:59.394738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.01150","last_updated":"2019-11-12T21:42:43Z","snapshot_observed_at":"2026-08-04T13:08:13.681112Z","submitted_at":"2019-08-29T15:38:19Z","title":"Neural Policy Gradient Methods: Global Optimality and Rates of Convergence","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.01150","snapshot_observed_at":"2026-08-03T16:09:09.416245Z","title":"Neural policy gradient methods: Global optimality and rates of convergence.arXiv preprint arXiv:1909.01150,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2512.14991","last_updated":"2026-07-06T16:45:59Z","snapshot_observed_at":"2026-08-09T01:29:28.771698Z","submitted_at":"2025-12-17T00:52:19Z","title":"Adaptive Partitioning and Learning for Stochastic Control of Diffusion Processes","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-03T16:09:09.416245Z"},"links":{"cited_paper":"/paper/1909.01150","citing_paper":"/paper/2512.14991"},"observation_digest":"sha256:fdd96d49130fae2433179ebb3533eb8e57f850bb92f5194fd72ce05d915ee4da","observation_id":"19e16767-28a5-46df-b75f-58bd86f541c0","resolution":{"observed_at":"2026-08-03T16:09:09.416245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.01150","last_updated":"2019-11-12T21:42:43Z","snapshot_observed_at":"2026-08-04T13:08:13.681112Z","submitted_at":"2019-08-29T15:38:19Z","title":"Neural Policy Gradient Methods: Global Optimality and Rates of Convergence","version":3},"cited_work":{"arxiv_id":"1909.01150","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1909.01150","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:1909.01150 , year=","venue":null,"work_id":"e760ec4d-0f59-4923-9dc0-24a7cd4905d8","year":1909},"citing_paper":{"arxiv_id":"2602.01505","last_updated":"2026-05-06T16:04:38Z","snapshot_observed_at":"2026-08-04T18:30:12.465245Z","submitted_at":"2026-02-02T00:35:42Z","title":"Optimal Sample Complexity for Single Time-Scale Actor-Critic with Momentum","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-16T08:12:57.430291Z"},"links":{"cited_paper":"/paper/1909.01150","citing_paper":"/paper/2602.01505"},"observation_digest":"sha256:2ee7899ff14c8aa710e6fa2f6c1404a693eaeba977b1756934e8877903a9b8b7","observation_id":"5eeadcc8-f19d-42e5-86ba-ef351f030fbb","resolution":{"observed_at":"2026-05-16T08:17:36.502446Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.01150","last_updated":"2019-11-12T21:42:43Z","snapshot_observed_at":"2026-08-04T13:08:13.681112Z","submitted_at":"2019-08-29T15:38:19Z","title":"Neural Policy Gradient Methods: Global Optimality and Rates of Convergence","version":3},"cited_work":{"arxiv_id":"1909.01150","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1909.01150","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:1909.01150 , year=","venue":null,"work_id":"e760ec4d-0f59-4923-9dc0-24a7cd4905d8","year":1909},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"cited_paper":"/paper/1909.01150","citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:78f0ccf5b5cce6d8db43517d63ef083f59f53de3a0a0e76cf9ec431b1363c6c4","observation_id":"436449cc-b1fa-404f-a98c-6ce866dc2e4b","resolution":{"observed_at":"2026-05-12T00:51:14.853753Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.01150","last_updated":"2019-11-12T21:42:43Z","snapshot_observed_at":"2026-08-04T13:08:13.681112Z","submitted_at":"2019-08-29T15:38:19Z","title":"Neural Policy Gradient Methods: Global Optimality and Rates of Convergence","version":3},"cited_work":{"arxiv_id":"1909.01150","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1909.01150","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:1909.01150 , year=","venue":null,"work_id":"e760ec4d-0f59-4923-9dc0-24a7cd4905d8","year":1909},"citing_paper":{"arxiv_id":"2605.09209","last_updated":"2026-05-09T23:00:31Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-09T23:00:31Z","title":"Select-then-differentiate: Solving Bilevel Optimization with Manifold Lower-level Solution Sets","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-12T03:10:43.367020Z"},"links":{"cited_paper":"/paper/1909.01150","citing_paper":"/paper/2605.09209"},"observation_digest":"sha256:eca12835d1f9e8a378830a7206b9dbdaeee217d97eadfe6546ccdded2945c3f3","observation_id":"5bb3b89b-3080-43ce-a618-9689a22c7443","resolution":{"observed_at":"2026-05-12T03:11:18.880634Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.01150","last_updated":"2019-11-12T21:42:43Z","snapshot_observed_at":"2026-08-04T13:08:13.681112Z","submitted_at":"2019-08-29T15:38:19Z","title":"Neural Policy Gradient Methods: Global Optimality and Rates of Convergence","version":3},"cited_work":{"arxiv_id":"1909.01150","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1909.01150","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:1909.01150 , year=","venue":null,"work_id":"e760ec4d-0f59-4923-9dc0-24a7cd4905d8","year":1909},"citing_paper":{"arxiv_id":"2605.10909","last_updated":"2026-05-11T17:49:09Z","snapshot_observed_at":"2026-07-06T23:22:47.781940Z","submitted_at":"2026-05-11T17:49:09Z","title":"Revisiting Policy Gradients for Restricted Policy Classes: Escaping Myopic Local Optima with $k$-step Policy Gradients","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-12T04:02:04.342363Z"},"links":{"cited_paper":"/paper/1909.01150","citing_paper":"/paper/2605.10909"},"observation_digest":"sha256:11ce4760d573ffa68ddee712ad9da2a032ec7676afbf839e02665cb7c5931bd2","observation_id":"fda4f7a5-6c3a-498d-b41e-b4d900c2539a","resolution":{"observed_at":"2026-05-12T06:41:44.208343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.01150","last_updated":"2019-11-12T21:42:43Z","snapshot_observed_at":"2026-08-04T13:08:13.681112Z","submitted_at":"2019-08-29T15:38:19Z","title":"Neural Policy Gradient Methods: Global Optimality and Rates of Convergence","version":3},"cited_work":{"arxiv_id":"1909.01150","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1909.01150","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:1909.01150 , year=","venue":null,"work_id":"e760ec4d-0f59-4923-9dc0-24a7cd4905d8","year":1909},"citing_paper":{"arxiv_id":"2605.18591","last_updated":"2026-08-03T00:43:51Z","snapshot_observed_at":"2026-08-06T23:24:40.850221Z","submitted_at":"2026-05-18T16:05:36Z","title":"Randomized Advantage Transformation (RAT): Computing Natural Policy Gradients via Direct Backpropagation","version":1},"reference_index":112,"source":"arxiv_source","source_observed_at":"2026-05-20T12:44:29.147095Z"},"links":{"cited_paper":"/paper/1909.01150","citing_paper":"/paper/2605.18591"},"observation_digest":"sha256:40c6f6e17986dd68451891a76cfba53ea69a7127c42249cde79a01ecc57626ff","observation_id":"0b6d6895-f07a-4d40-9de8-935c1ec04bc1","resolution":{"observed_at":"2026-05-20T12:48:17.539175Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/1909.01150/citation-record","integrity":"/paper/1909.01150/integrity","json":"/paper/1909.01150/citation-record.json","paper":"/paper/1909.01150"},"outbound":[],"paper":{"arxiv_id":"1909.01150","last_updated":"2019-11-12T21:42:43Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-04T13:08:13.681112Z","submitted_at":"2019-08-29T15:38:19Z","title":"Neural Policy Gradient Methods: Global Optimality and Rates of Convergence"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 8 inbound Pith citation observations for arXiv:1909.01150."}