{"as_of":"2026-08-18T02:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4de22bdacd1d9b61db0cce9177ff94a5b6061d4a2c142ae14668243183b2ab4f","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T05:24:51.822886Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T05:00:42.106290Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20887","snapshot_observed_at":"2026-08-03T05:00:42.106290Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-13T12:25:58.286571Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:42.106290Z"},"links":{"cited_paper":"/paper/2504.20887","citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:c547df0492638e1174d696cd11cbcffe588a67a51a713b38b9e50bd86b080133","observation_id":"729129bc-3353-48b3-833d-1f61bc861859","resolution":{"observed_at":"2026-08-03T05:00:42.106290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.20887/citation-record","integrity":"/paper/2504.20887/integrity","json":"/paper/2504.20887/citation-record.json","paper":"/paper/2504.20887"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:24:51.684717Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T05:24:51.684717Z"},"links":{"citing_paper":"/paper/2504.20887"},"observation_digest":"sha256:57b931b1d1577afbef56e916e48eb83b2189f8593ac6d1453d48108eee9817ad","observation_id":"7fbd467b-7cc3-4d36-b8c7-171c03715c7e","resolution":{"observed_at":"2026-08-16T05:24:51.684717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:24:52.252601Z","title":"Entropic value-at-risk: A new coherent risk measure","venue":null,"work_id":"be8d6581-733e-402d-bfeb-0e52d9fd47c2","year":2012},"citing_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T05:24:51.690040Z"},"links":{"citing_paper":"/paper/2504.20887"},"observation_digest":"sha256:44e2d30bd48b260c21acb5e33dafe2b41b0bb2fc3e33a1a54c047f60546dcff2","observation_id":"c93b054f-e52b-49f7-b71d-be1852cc8eb5","resolution":{"observed_at":"2026-08-16T05:24:52.256237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:24:52.242365Z","title":"Coherent measures of risk","venue":null,"work_id":"384e1e8b-d493-46f3-bd02-7e7ae9e55146","year":1999},"citing_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T05:24:51.693799Z"},"links":{"citing_paper":"/paper/2504.20887"},"observation_digest":"sha256:bd262fc80200967245ba16abb64364f6af4dc0380b97c947fd7166cf90172daf","observation_id":"1b13c10c-5166-4dd1-a500-14b8c8a98d5c","resolution":{"observed_at":"2026-08-16T05:24:52.245978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:24:52.232205Z","title":"and Ott, J","venue":null,"work_id":"e0d86caa-691c-4fdd-8157-e17b0172b1f1","year":2011},"citing_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T05:24:51.697568Z"},"links":{"citing_paper":"/paper/2504.20887"},"observation_digest":"sha256:6976ef4e61ac20772b58157e94c7900663da1a7144e8fc2a69727a0d73b06228","observation_id":"534dfed5-9f78-4013-8612-7498e2625df5","resolution":{"observed_at":"2026-08-16T05:24:52.235758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:24:52.221416Z","title":"G., Dabney, W., and Munos, R","venue":null,"work_id":"b6c59056-8f7a-4f52-9922-05a1e6de9f1d","year":2017},"citing_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T05:24:51.701811Z"},"links":{"citing_paper":"/paper/2504.20887"},"observation_digest":"sha256:651bc1699f9fa32496a694b07e0f3cb4ba40b069ce0afe862bcb6e47d7ba5456","observation_id":"3d411935-5ef4-47bb-abd3-b21ee96ae61b","resolution":{"observed_at":"2026-08-16T05:24:52.224895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-13T12:26:05.192883Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-16T05:24:51.705527Z","title":"Openai gym","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T05:24:51.705527Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2504.20887"},"observation_digest":"sha256:a0aa8102eb64c9f8dda1e29a5709d87a25c2b2b45d982be9f958742aafab47a7","observation_id":"36cd2613-7316-4256-8d87-71d7f8620e74","resolution":{"observed_at":"2026-08-16T05:24:51.705527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:24:51.709484Z","title":"Risk-constrained reinforcement learning with percentile risk criteria","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T05:24:51.709484Z"},"links":{"citing_paper":"/paper/2504.20887"},"observation_digest":"sha256:8cc61927078a3a5ddc0005cde71f8de10b5e874fc9becd3b295288f2ca28b9f3","observation_id":"001b0b41-e592-42ee-9920-a4f4f0a5829c","resolution":{"observed_at":"2026-08-16T05:24:51.709484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:24:52.204723Z","title":"Implicit quantile networks for distributional reinforcement learning","venue":null,"work_id":"34d78d0c-88ac-4042-bc80-7dc30cc78ce2","year":2018},"citing_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T05:24:51.713399Z"},"links":{"citing_paper":"/paper/2504.20887"},"observation_digest":"sha256:9547147b0b7367c0bcd894b122f2452d182f3e61adb3d9439a6ab41437027c1d","observation_id":"3eb44e88-ba54-4cf0-9341-900c0b4bd962","resolution":{"observed_at":"2026-08-16T05:24:52.208327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:24:52.194763Z","title":"A., Krass, D., and Ross, K","venue":null,"work_id":"323d8306-0974-4459-b6f0-e9cdf9f24185","year":1995},"citing_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T05:24:51.716837Z"},"links":{"citing_paper":"/paper/2504.20887"},"observation_digest":"sha256:64ddb041167c85560cb0c9bf28a76681097303006977139d1199f1f768e90841","observation_id":"ef75e414-19e6-4d21-b557-dbb2109a11e8","resolution":{"observed_at":"2026-08-16T05:24:52.198590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:24:52.182965Z","title":"Efficient risk-averse reinforcement learning","venue":null,"work_id":"3f5d4e30-75ea-4c31-b903-06293714ade6","year":2022},"citing_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T05:24:51.720123Z"},"links":{"citing_paper":"/paper/2504.20887"},"observation_digest":"sha256:5f0ff1a64682778aa4f215bb4566334b6d33aa7092e3cb8a848177fcea32c1bd","observation_id":"096752ef-d711-45f0-89e0-7949217b2328","resolution":{"observed_at":"2026-08-16T05:24:52.187298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1502.02259","last_updated":"2015-02-08T14:58:50Z","snapshot_observed_at":"2026-08-14T23:00:56.212471Z","submitted_at":"2015-02-08T14:58:50Z","title":"Contextual Markov Decision Processes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.02259","snapshot_observed_at":"2026-08-16T05:24:51.723782Z","title":"Contextual markov decision processes","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T05:24:51.723782Z"},"links":{"cited_paper":"/paper/1502.02259","citing_paper":"/paper/2504.20887"},"observation_digest":"sha256:6fbbc152775d5d8c40a5e7ee349aef1f46b8e93dd4c45b0b2cc4bea63a49c9ec","observation_id":"5f691eff-8ab2-4dd1-a104-588dbecf0747","resolution":{"observed_at":"2026-08-16T05:24:51.723782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:24:51.728072Z","title":"Being optimistic to be conservative: Quickly learning a cvar policy","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T05:24:51.728072Z"},"links":{"citing_paper":"/paper/2504.20887"},"observation_digest":"sha256:a9b0a177346570247e2b32874aac92daeb56f8f1c3934a5050a85aa797a1732f","observation_id":"c1f27cc6-d9e4-4585-949e-87187563aecf","resolution":{"observed_at":"2026-08-16T05:24:51.728072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:24:52.171031Z","title":"and Min, S","venue":null,"work_id":"7d0637fc-7ed0-4cbd-bb5b-6c5283766143","year":2024},"citing_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T05:24:51.731740Z"},"links":{"citing_paper":"/paper/2504.20887"},"observation_digest":"sha256:16c0c0685fc7661c9fca26b8e2bcbb5856443314b3ff2a3f85163505be5acc4a","observation_id":"225754bb-9d06-4566-b10f-98070d457f42","resolution":{"observed_at":"2026-08-16T05:24:52.175018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:24:52.160735Z","title":"and Ghavamzadeh, M","venue":null,"work_id":"be98bef0-a9a7-4b6d-8417-94c6d3863d0f","year":2013},"citing_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T05:24:51.735247Z"},"links":{"citing_paper":"/paper/2504.20887"},"observation_digest":"sha256:02adc5321d4f850004eac408f38c56df80d73bf2c10cba69647858f75bb4e7e6","observation_id":"d9029d2f-6c68-4c0e-890d-a9b4825b0716","resolution":{"observed_at":"2026-08-16T05:24:52.164267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:24:52.149962Z","title":null,"venue":null,"work_id":"02f47fdf-91f3-4c49-986a-f5c338e51f02","year":2022},"citing_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T05:24:51.738823Z"},"links":{"citing_paper":"/paper/2504.20887"},"observation_digest":"sha256:209c4becd569cd9f6c4a97ed18dfd97dab0128fb6c0bf0d96ca9608bd3f8a68f","observation_id":"4909ab9b-f809-4198-8c88-7533f4cd14eb","resolution":{"observed_at":"2026-08-16T05:24:52.153287Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:24:52.138905Z","title":"An alternative to variance: Gini deviation for risk-averse policy gradient","venue":null,"work_id":"b1462032-217e-4db2-9065-175e06b9409c","year":2023},"citing_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T05:24:51.742553Z"},"links":{"citing_paper":"/paper/2504.20887"},"observation_digest":"sha256:ef34a37d66ab2c4c7af6a48fba9364cbdd55d34b283dc83d44c4898e2961bd48","observation_id":"dd044ddb-b837-4444-ba6f-46d27b4f765d","resolution":{"observed_at":"2026-08-16T05:24:52.142878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:24:52.127922Z","title":"A simple mixture policy parameterization for improving sample efficiency of cvar optimization","venue":null,"work_id":"d5859173-0a0e-4898-88cc-69b640c9ddfa","year":2024},"citing_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T05:24:51.746232Z"},"links":{"citing_paper":"/paper/2504.20887"},"observation_digest":"sha256:d33122085bd5b27885dde0b0c521d1695754c92a8de2959a3fda24666645e943","observation_id":"a775af44-f3f0-47f6-9feb-c374b7beb1a9","resolution":{"observed_at":"2026-08-16T05:24:52.131793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.14547","last_updated":"2025-06-29T01:33:14Z","snapshot_observed_at":"2026-07-06T09:16:26.306280Z","submitted_at":"2020-04-30T02:23:15Z","title":"DSAC: Distributional Soft Actor-Critic for Risk-Sensitive Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.14547","snapshot_observed_at":"2026-08-16T05:24:51.750051Z","title":"Dsac: Distributional soft actor critic for risk-sensitive reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T05:24:51.750051Z"},"links":{"cited_paper":"/paper/2004.14547","citing_paper":"/paper/2504.20887"},"observation_digest":"sha256:8f2fd8d335c631a75067774ab59c2c26a2f9c920ebb754a3c259d8085de3a5ac","observation_id":"599c907c-27fd-44bd-8c44-e964fe44ad02","resolution":{"observed_at":"2026-08-16T05:24:51.750051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:24:52.117147Z","title":"Risk averse robust adversarial reinforcement learning","venue":null,"work_id":"fb665d33-ad33-4e7f-9846-244f8aa42059","year":2019},"citing_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T05:24:51.753961Z"},"links":{"citing_paper":"/paper/2504.20887"},"observation_digest":"sha256:78a20ccdd2cc611a7ad34242b05400b7ce5d867bbc95d3a4664f86030f853c01","observation_id":"9712860f-e0bb-4165-aa1c-3e16c638f894","resolution":{"observed_at":"2026-08-16T05:24:52.120848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:24:52.106608Z","title":"Robust adversarial reinforcement learning","venue":null,"work_id":"4198c2a0-5470-41a4-92aa-fc48dedce9ff","year":2017},"citing_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T05:24:51.757713Z"},"links":{"citing_paper":"/paper/2504.20887"},"observation_digest":"sha256:4fb0e52404b74ad65a80dc47492d4434066072266563bf42fe6a122d9092ec26","observation_id":"3303bbc5-905c-44ad-8210-25fcb97369cb","resolution":{"observed_at":"2026-08-16T05:24:52.110374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:24:52.094953Z","title":"and Ghavamzadeh, M","venue":null,"work_id":"c20901fd-1dee-4fb1-97b2-687fb5de7ecd","year":2016},"citing_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T05:24:51.761373Z"},"links":{"citing_paper":"/paper/2504.20887"},"observation_digest":"sha256:7b597406b9f22a83795a1ee145363503d9d04cf57a3eb75fde8fe3b03c920d5c","observation_id":"c5fc1ffc-929b-4b45-b5bd-8959c6f0c675","resolution":{"observed_at":"2026-08-16T05:24:52.098851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:24:52.083903Z","title":"Risk-averse bayes-adaptive reinforcement learning","venue":null,"work_id":"111b247b-c831-4757-8972-9e29870fa885","year":2021},"citing_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T05:24:51.764894Z"},"links":{"citing_paper":"/paper/2504.20887"},"observation_digest":"sha256:16784375e753fa5cf8fca5db05de652041e30e12e8c449cf46990b3e5da6eec5","observation_id":"7d701ba4-646c-4c66-a2ad-ce14249f14f1","resolution":{"observed_at":"2026-08-16T05:24:52.087717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:24:51.768761Z","title":"T., Uryasev, S., et al","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T05:24:51.768761Z"},"links":{"citing_paper":"/paper/2504.20887"},"observation_digest":"sha256:a5b45010936bde5ea1a634efbd4928c5d3f32317bf006ec9ecf09402a5294596","observation_id":"04b1bb58-f80b-4f32-9a7e-4b1188b7decf","resolution":{"observed_at":"2026-08-16T05:24:51.768761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:24:51.772344Z","title":"Risk-averse dynamic programming for markov decision processes","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T05:24:51.772344Z"},"links":{"citing_paper":"/paper/2504.20887"},"observation_digest":"sha256:9c8bf17b0f2e9c4527ef23bf2ab87fe8e61dcdab5096a11ef94a01c91c6a80ad","observation_id":"a3a30c3d-c60c-4ecd-9b37-0266d053624b","resolution":{"observed_at":"2026-08-16T05:24:51.772344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:24:52.060323Z","title":"Td algorithm for the variance of return and mean-variance reinforcement learning","venue":null,"work_id":"74d0dbdc-d1c6-4c44-8743-0a453125e52d","year":2001},"citing_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T05:24:51.776702Z"},"links":{"citing_paper":"/paper/2504.20887"},"observation_digest":"sha256:67d00ef2eb439526d56d1855198f0f1c9d9aa455375f035512f38a2365791052","observation_id":"d9176156-48a1-4f6d-94e9-75c5638d2820","resolution":{"observed_at":"2026-08-16T05:24:52.064073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:24:51.780739Z","title":"Learning risk-aware quadrupedal locomotion using distributional reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T05:24:51.780739Z"},"links":{"citing_paper":"/paper/2504.20887"},"observation_digest":"sha256:423b7ec993a02794422ff493e6b9a9b24940866019db1e7b641778557929485a","observation_id":"f100aa98-1d27-47bf-83e6-ece8e05748a0","resolution":{"observed_at":"2026-08-16T05:24:51.780739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:24:51.784208Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T05:24:51.784208Z"},"links":{"citing_paper":"/paper/2504.20887"},"observation_digest":"sha256:2d002f7317bf8c58e8265be7cabd4b73159013cb778aa4447a4d00b63067ea46","observation_id":"a33fdc01-e9cc-4a60-bb13-25689409e5ee","resolution":{"observed_at":"2026-08-16T05:24:51.784208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:24:52.043308Z","title":null,"venue":null,"work_id":"00684e0f-fdcb-49f2-9c8f-744daac73fdb","year":1982},"citing_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T05:24:51.787837Z"},"links":{"citing_paper":"/paper/2504.20887"},"observation_digest":"sha256:c3e86a0959844d588b6571a3d04f8992228c3ad69590f1ee9314cc3eaff8df8d","observation_id":"a1eeef5a-2ce1-4030-8aaf-708b437d5703","resolution":{"observed_at":"2026-08-16T05:24:52.046873Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:24:51.791196Z","title":"Responsive safety in reinforcement learning by pid lagrangian methods","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T05:24:51.791196Z"},"links":{"citing_paper":"/paper/2504.20887"},"observation_digest":"sha256:664e72027dffbe9df4cfe35b603456c354fbf41bbeda22d3c57cfdbe005ead4c","observation_id":"f2eb2229-f88a-4a4d-b4b7-db0e9a63932a","resolution":{"observed_at":"2026-08-16T05:24:51.791196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:24:51.794615Z","title":null,"venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T05:24:51.794615Z"},"links":{"citing_paper":"/paper/2504.20887"},"observation_digest":"sha256:b34273ca149dfe4bfab5e71482a73c5585421cd52d1ce4853fecf4deaddb6b72","observation_id":"fea598fa-a8d1-4774-be37-2c3cdb39491e","resolution":{"observed_at":"2026-08-16T05:24:51.794615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:24:52.020179Z","title":"Optimizing the cvar via sampling","venue":null,"work_id":"ee4b4851-4e87-4b7a-91ab-1735b22a2204","year":2015},"citing_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T05:24:51.799693Z"},"links":{"citing_paper":"/paper/2504.20887"},"observation_digest":"sha256:ecc7538b93ba3d056fcc99488d70139e68b93780d7a44bbe4d3404ec5d3c048c","observation_id":"7d484be4-8971-4cfa-b5f6-ef2963eca8ea","resolution":{"observed_at":"2026-08-16T05:24:52.023700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.03618","last_updated":"2019-11-09T06:24:43Z","snapshot_observed_at":"2026-08-09T06:53:55.854025Z","submitted_at":"2019-11-09T06:24:43Z","title":"Worst Cases Policy Gradients","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.03618","snapshot_observed_at":"2026-08-16T05:24:51.803063Z","title":"C., Zhang, J., and Salakhutdinov, R","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T05:24:51.803063Z"},"links":{"cited_paper":"/paper/1911.03618","citing_paper":"/paper/2504.20887"},"observation_digest":"sha256:bd8848595dd23abebf61bf66535f94d3c0a1663736e68ceb5e6f3e631b62489e","observation_id":"5d4c26ee-aaef-499a-9115-6b59d715d2b5","resolution":{"observed_at":"2026-08-16T05:24:51.803063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-08-13T22:24:37.672685Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-16T05:24:51.807162Z","title":"U., De Cola, G., Deleu, T., Goul \\ a o, M., Kallinteris, A., Krimmel, M., KG, A., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T05:24:51.807162Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2504.20887"},"observation_digest":"sha256:d9621b1325f95bd0d716c7e87b0a098917da95719d899d4874bd040ba2e0417d","observation_id":"b25a8f75-294b-41c0-9312-e85ac17e675b","resolution":{"observed_at":"2026-08-16T05:24:51.807162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:24:52.008864Z","title":null,"venue":null,"work_id":"f7e5824b-007a-4054-99c8-1cc19fec8853","year":2000},"citing_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T05:24:51.810844Z"},"links":{"citing_paper":"/paper/2504.20887"},"observation_digest":"sha256:02ad6e6ce514441eace689b00ee7f780e0b9caff3a447479a1abcd91755609c2","observation_id":"cf327413-a44a-4ee4-9938-e4befbed8c43","resolution":{"observed_at":"2026-08-16T05:24:52.012377Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:24:51.996605Z","title":"Risk-aware reward shaping of reinforcement learning agents for autonomous driving","venue":null,"work_id":"73b3b478-0c20-4706-a512-fe51ab12da9c","year":2023},"citing_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T05:24:51.814178Z"},"links":{"citing_paper":"/paper/2504.20887"},"observation_digest":"sha256:19a72b7c466243d2b65646d4537adc11ea9cbb5c5f717ec8ff8374fa794683e9","observation_id":"9c4a3620-2e61-44a5-ab2c-4a4332aa8ba2","resolution":{"observed_at":"2026-08-16T05:24:52.001336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14758","last_updated":"2024-04-15T13:44:11Z","snapshot_observed_at":"2026-08-16T14:24:17.929668Z","submitted_at":"2024-01-26T10:33:38Z","title":"Off-Policy Primal-Dual Safe Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14758","snapshot_observed_at":"2026-08-16T05:24:51.818977Z","title":"Off-policy primal-dual safe reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T05:24:51.818977Z"},"links":{"cited_paper":"/paper/2401.14758","citing_paper":"/paper/2504.20887"},"observation_digest":"sha256:ccf39f3ddf7fae78c1777b02d10f4dee8daf6db7329d1ae711fa885cb92081e3","observation_id":"bbe21a40-01b8-4e58-bba6-008f881fadaa","resolution":{"observed_at":"2026-08-16T05:24:51.818977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:24:51.984306Z","title":"D., Tindemans, S","venue":null,"work_id":"35ba9a41-00a9-4d3a-a4c2-901caf107501","year":2021},"citing_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T05:24:51.822886Z"},"links":{"citing_paper":"/paper/2504.20887"},"observation_digest":"sha256:adc433573e8fd6ecc3501aa61a8acae99bbc2304ba2c52ca1d18cd2d9a586806","observation_id":"250cdd10-2b4a-4d87-87fd-d34c3fdfe57e","resolution":{"observed_at":"2026-08-16T05:24:51.988906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T13:29:36.088373Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":19},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 1 inbound Pith citation observation for arXiv:2504.20887."}