{"as_of":"2026-08-14T12:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f850cc43089e69bd06ed3e15f846803eccef828d61175353df7ffe14a51dc2c3","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:21:29.954534Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.05953/citation-record","integrity":"/paper/2506.05953/integrity","json":"/paper/2506.05953/citation-record.json","paper":"/paper/2506.05953"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-07T10:21:29.928004Z","title":"Robotics and Autonomous Systems 131, 103568","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.05953","last_updated":"2025-06-06T10:29:05Z","snapshot_observed_at":"2026-08-08T21:57:04.716554Z","submitted_at":"2025-06-06T10:29:05Z","title":"Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:21:29.928004Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2506.05953"},"observation_digest":"sha256:395fffe825915ddbfa1175fb2b78a2babe58ade941c5fbeff30b20a57e0f48b4","observation_id":"1af85dc5-728c-4ef0-b73e-d409453afb69","resolution":{"observed_at":"2026-08-07T10:21:29.928004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11513","last_updated":"2026-05-01T12:34:37Z","snapshot_observed_at":"2026-08-13T08:33:04.361242Z","submitted_at":"2024-08-21T10:44:57Z","title":"Last-Iterate Convergence of General Parameterized Policies in Constrained MDPs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11513","snapshot_observed_at":"2026-08-07T10:21:29.937676Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05953","last_updated":"2025-06-06T10:29:05Z","snapshot_observed_at":"2026-08-08T21:57:04.716554Z","submitted_at":"2025-06-06T10:29:05Z","title":"Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:21:29.937676Z"},"links":{"cited_paper":"/paper/2408.11513","citing_paper":"/paper/2506.05953"},"observation_digest":"sha256:44540159ca02fb955a4be05880744eeac7e8c96cf2dd4ba52df0aae562eed9a3","observation_id":"a224fb8b-1410-48fe-9a42-989f10280e04","resolution":{"observed_at":"2026-08-07T10:21:29.937676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:21:30.151849Z","title":null,"venue":null,"work_id":"530bb34d-e82b-46f6-a228-08e6850144cf","year":2022},"citing_paper":{"arxiv_id":"2506.05953","last_updated":"2025-06-06T10:29:05Z","snapshot_observed_at":"2026-08-08T21:57:04.716554Z","submitted_at":"2025-06-06T10:29:05Z","title":"Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:21:29.954534Z"},"links":{"citing_paper":"/paper/2506.05953"},"observation_digest":"sha256:5f8e54711f0c171623566a2282eb84fb74c6feb1c9cf06fa5facc3582fa2a8d9","observation_id":"6091738d-e883-4ec0-96d1-66569de17fed","resolution":{"observed_at":"2026-08-07T10:21:30.156809Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:21:30.221599Z","title":null,"venue":null,"work_id":"1b231961-c75e-4021-8983-fe7026db094e","year":2021},"citing_paper":{"arxiv_id":"2506.05953","last_updated":"2025-06-06T10:29:05Z","snapshot_observed_at":"2026-08-08T21:57:04.716554Z","submitted_at":"2025-06-06T10:29:05Z","title":"Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:21:29.733240Z"},"links":{"citing_paper":"/paper/2506.05953"},"observation_digest":"sha256:b59399cc8c5d0deefb601f25dcd03bb23b0e86642c33b6f9ed3aa0229cddba81","observation_id":"65f17fcb-8643-478e-b787-55678502f56e","resolution":{"observed_at":"2026-08-07T10:21:30.226107Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:21:30.180077Z","title":null,"venue":null,"work_id":"cf11c1b5-6fe6-42bb-96d4-5f3ee83eb519","year":1940},"citing_paper":{"arxiv_id":"2506.05953","last_updated":"2025-06-06T10:29:05Z","snapshot_observed_at":"2026-08-08T21:57:04.716554Z","submitted_at":"2025-06-06T10:29:05Z","title":"Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes","version":1},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-07T10:21:29.945891Z"},"links":{"citing_paper":"/paper/2506.05953"},"observation_digest":"sha256:369721a7732882f27196984c182974a2f97813c6615e419a97bac5fc7bea45ae","observation_id":"1c0e0e6c-6364-41b6-b6ab-16f999295e79","resolution":{"observed_at":"2026-08-07T10:21:30.184116Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:21:30.193087Z","title":null,"venue":null,"work_id":"54645b4f-7005-48fe-bbec-a43dcb33ed5d","year":2025},"citing_paper":{"arxiv_id":"2506.05953","last_updated":"2025-06-06T10:29:05Z","snapshot_observed_at":"2026-08-08T21:57:04.716554Z","submitted_at":"2025-06-06T10:29:05Z","title":"Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes","version":1},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-07T10:21:29.941700Z"},"links":{"citing_paper":"/paper/2506.05953"},"observation_digest":"sha256:8c828788330e5191a33787795e8792119fdcc4b5256cf4b265d206abfb25959f","observation_id":"3bff57d4-77ba-4980-b962-88df74cf03af","resolution":{"observed_at":"2026-08-07T10:21:30.197055Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.07900","last_updated":"2020-05-24T21:30:54Z","snapshot_observed_at":"2026-08-09T11:28:04.683583Z","submitted_at":"2018-10-18T05:25:11Z","title":"Policy Gradient in Partially Observable Environments: Approximation and Convergence","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.07900","snapshot_observed_at":"2026-08-07T10:21:29.414918Z","title":"Courier Corporation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05953","last_updated":"2025-06-06T10:29:05Z","snapshot_observed_at":"2026-08-08T21:57:04.716554Z","submitted_at":"2025-06-06T10:29:05Z","title":"Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes","version":1},"reference_index":2007,"source":"pdf_text","source_observed_at":"2026-08-07T10:21:29.414918Z"},"links":{"cited_paper":"/paper/1810.07900","citing_paper":"/paper/2506.05953"},"observation_digest":"sha256:1b405e8e4ee8e7c16ca061da3906335686e9c4ee16a25ba60e007c8dbfac09c9","observation_id":"8e3dabbf-8f89-4c53-80c7-b30bff4f7e6c","resolution":{"observed_at":"2026-08-07T10:21:29.414918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:21:30.235854Z","title":"Journal of Optimization Theory and Applications 153, 688–708","venue":null,"work_id":"197fe567-804c-4d44-a9b8-a243795513ec","year":2022},"citing_paper":{"arxiv_id":"2506.05953","last_updated":"2025-06-06T10:29:05Z","snapshot_observed_at":"2026-08-08T21:57:04.716554Z","submitted_at":"2025-06-06T10:29:05Z","title":"Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-07T10:21:29.487809Z"},"links":{"citing_paper":"/paper/2506.05953"},"observation_digest":"sha256:847aafbaa6956b3de6c9979c9d3bdffc2d91ebd5808efb2ef3bb2b17206af28d","observation_id":"d7531016-6d4f-4552-8e16-26323277461b","resolution":{"observed_at":"2026-08-07T10:21:30.240836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.08757","last_updated":"2018-01-26T11:11:18Z","snapshot_observed_at":"2026-08-09T14:33:35.632300Z","submitted_at":"2018-01-26T11:11:18Z","title":"Safe Exploration in Continuous Action Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.08757","snapshot_observed_at":"2026-08-07T10:21:29.646248Z","title":"arXiv preprint arXiv:1801.08757","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05953","last_updated":"2025-06-06T10:29:05Z","snapshot_observed_at":"2026-08-08T21:57:04.716554Z","submitted_at":"2025-06-06T10:29:05Z","title":"Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T10:21:29.646248Z"},"links":{"cited_paper":"/paper/1801.08757","citing_paper":"/paper/2506.05953"},"observation_digest":"sha256:4c38b151cb0d145d3eca443cef13a92b09fa88734e1a25c92de791939afe28e5","observation_id":"4271e805-bac3-4047-b529-7c02f71a29ea","resolution":{"observed_at":"2026-08-07T10:21:29.646248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:21:29.828608Z","title":"Advances in Neural Information Processing Systems (NeurIPS) 33, 8378–8390","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05953","last_updated":"2025-06-06T10:29:05Z","snapshot_observed_at":"2026-08-08T21:57:04.716554Z","submitted_at":"2025-06-06T10:29:05Z","title":"Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T10:21:29.828608Z"},"links":{"citing_paper":"/paper/2506.05953"},"observation_digest":"sha256:d67969d4cab67b39a6a303eb74eb732ac92aaca5f84a06d8f6c83ded3e84e1fe","observation_id":"23eb6839-ec15-461b-983d-65b88833db7d","resolution":{"observed_at":"2026-08-07T10:21:29.828608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00552","last_updated":"2022-02-03T20:48:15Z","snapshot_observed_at":"2026-07-06T12:03:55.626372Z","submitted_at":"2021-10-31T17:46:26Z","title":"Policy Optimization for Constrained MDPs with Provable Fast Global Convergence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.00552","snapshot_observed_at":"2026-08-07T10:21:29.933220Z","title":"arXiv preprint arXiv:2111.00552","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05953","last_updated":"2025-06-06T10:29:05Z","snapshot_observed_at":"2026-08-08T21:57:04.716554Z","submitted_at":"2025-06-06T10:29:05Z","title":"Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T10:21:29.933220Z"},"links":{"cited_paper":"/paper/2111.00552","citing_paper":"/paper/2506.05953"},"observation_digest":"sha256:8e62551ec17045ff73ac5d2d8f80d22da49bf145c19d244c44cbf18e7fcfaa12","observation_id":"701ec355-c83d-4a44-a034-63684c786d0b","resolution":{"observed_at":"2026-08-07T10:21:29.933220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:21:30.166590Z","title":null,"venue":null,"work_id":"1dc70231-f45b-4271-a5aa-fe0c40656270","year":1909},"citing_paper":{"arxiv_id":"2506.05953","last_updated":"2025-06-06T10:29:05Z","snapshot_observed_at":"2026-08-08T21:57:04.716554Z","submitted_at":"2025-06-06T10:29:05Z","title":"Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T10:21:29.950115Z"},"links":{"citing_paper":"/paper/2506.05953"},"observation_digest":"sha256:7f68d49a2a29c5218f8a5d2cec6cf54fe9f6bdba4fe02dc5f9688bed60f3ad74","observation_id":"0dee27c5-8433-4924-9ad7-512cb59a7cf7","resolution":{"observed_at":"2026-08-07T10:21:30.170599Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:21:30.206497Z","title":"11506–11533","venue":null,"work_id":"d757576c-d2a4-4f16-bf74-11970190d696","year":2020},"citing_paper":{"arxiv_id":"2506.05953","last_updated":"2025-06-06T10:29:05Z","snapshot_observed_at":"2026-08-08T21:57:04.716554Z","submitted_at":"2025-06-06T10:29:05Z","title":"Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T10:21:29.920865Z"},"links":{"citing_paper":"/paper/2506.05953"},"observation_digest":"sha256:e4b8a55c4eda58986b08ff084047dad1c24b5d90c4ba6dd160665e9352a16f36","observation_id":"5d26c38f-73b2-439c-9214-e1e4b74089e0","resolution":{"observed_at":"2026-08-07T10:21:30.211143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.05953","last_updated":"2025-06-06T10:29:05Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T21:57:04.716554Z","submitted_at":"2025-06-06T10:29:05Z","title":"Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 0 inbound Pith citation observations for arXiv:2506.05953."}