{"as_of":"2026-08-14T07:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:37d584ed3b7706d520733d544c8449b684d84e752889fe40d26b6d24cc997266","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:09:08.965688Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T15:52:16.912981Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T21:56:16.626906Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.03900","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.03900","snapshot_observed_at":"2026-07-01T21:56:16.626906Z","title":"and Ku, H","venue":null,"work_id":"5f8da0b8-e366-47c9-95ba-396e5d21c5bd","year":null},"citing_paper":{"arxiv_id":"2606.04029","last_updated":"2026-06-06T23:43:36Z","snapshot_observed_at":"2026-08-13T13:43:13.826522Z","submitted_at":"2026-06-01T19:40:10Z","title":"Position: Deployed Reinforcement Learning should be Continual","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T15:52:16.912981Z"},"links":{"cited_paper":"/paper/2507.03900","citing_paper":"/paper/2606.04029"},"observation_digest":"sha256:298955284d832bb3ed1fd82b0bce15a2b27727fbfeffc894d7db3c4cf1592100","observation_id":"7230b9cf-49f5-4521-825d-c050ed5b3d97","resolution":{"observed_at":"2026-07-01T21:56:16.628195Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.03900/citation-record","integrity":"/paper/2507.03900/integrity","json":"/paper/2507.03900/citation-record.json","paper":"/paper/2507.03900"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:00.906755Z","title":"Spectral measures of risk: A coherent representation of subjective risk aversion","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:00.906755Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:b47053d80d443797c2979775a8b70308ed3d67185bc4bd3aad21eb85d30dd285","observation_id":"4219a721-e37a-4fa8-a3bc-4ac5913ac001","resolution":{"observed_at":"2026-08-06T20:09:00.906755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:20.787218Z","title":"Kakade, Jason D","venue":null,"work_id":"76ed56fe-c579-4d01-9ff5-a2501816d9b8","year":2021},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:01.031571Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:9d6d7fe8d3c9e10729cc0152406cf13ed743051d0872e91a9aab96ee6ce02156","observation_id":"818dda2a-6161-435f-ac6a-b30e1a9e1610","resolution":{"observed_at":"2026-08-06T20:09:20.861936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:20.635781Z","title":"An Optimistic Perspective on Offline Reinforcement Learning","venue":null,"work_id":"629d13c1-ac0f-469b-bd5e-417acf0a5258","year":2020},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:01.190995Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:021d02cc2f76228591b49fd8c631f02e04e592590790fad307ba6d07efc3f7ab","observation_id":"5f44cbee-17ab-4308-a6df-0c9aecfb9cc0","resolution":{"observed_at":"2026-08-06T20:09:20.721182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.eswa.2017.06.023","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"Expert Systems with Applications","work_id":"573af30d-9a8c-458f-802d-706d5edf0821","year":2017},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:01.349277Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:f9cc6600ac66ab5800573dd636a71dea7a50b2bcbfe84140b4c9dba74b243088","observation_id":"cf4b3243-800d-403e-aed4-5491e391eb64","resolution":{"observed_at":"2026-08-06T20:09:10.698147Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2022.32171","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:13.505940Z","title":"Monotonic Quantile Network for Worst-Case Offline Reinforcement Learning","venue":null,"work_id":"0291739a-ec16-4c3f-b6bd-17326a086788","year":2022},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:01.472655Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:d1589b4ea7a3faff3801605a41d66f8df882df429224127ff160fd178f59bc38","observation_id":"e16a79df-3a9e-4966-b1f7-0501435841e5","resolution":{"observed_at":"2026-08-06T20:09:13.594508Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:20.477322Z","title":"Hoffman, David Budden, Will Dabney, Dan Horgan, Dhruva Tb, Alistair Muldal, Nicolas Heess, and Timothy Lillicrap","venue":null,"work_id":"abcd01fd-91f1-4743-99e4-067cbe83cfdf","year":2018},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:01.614027Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:0fb4446ad89c79e33eeecd6d35aee99c208c1b723eba3a081e6aad7c83336c95","observation_id":"2c94b283-49b8-4bb6-908f-fa894c4d63c0","resolution":{"observed_at":"2026-08-06T20:09:20.565400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s00186-021-00746-w","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:03:45.533247Z","title":"Minimizing spectral risk measures applied to Markov decision processes","venue":"Mathematical Methods of Operations Research","work_id":"5b156368-88ab-443a-b2b8-8b9ae78743aa","year":2021},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:01.731072Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:c021f33e6e8d70bdcf1bb1a5535b981b02dc20f5fc43f95526361d388ae1b9b6","observation_id":"e3ec32b7-685b-410a-ba77-ed2b5b53250a","resolution":{"observed_at":"2026-08-06T20:09:10.457411Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s00186-011-0367-0","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:03:45.533247Z","title":"Markov Decision Processes with Average-Value-at-Risk criteria","venue":"Mathematical Methods of Operations Research","work_id":"9e5a5890-bb5d-40e0-b021-dd51d7d253f9","year":2011},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:01.882570Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:c389270ef2d33354d59063b3f58294c8544982e6d02171d841f49a4034724b95","observation_id":"d8549def-12b3-4bb3-8c0a-434b396d7cae","resolution":{"observed_at":"2026-08-06T20:09:10.126479Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2013.0601","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:13.229697Z","title":"More Risk-Sensitive Markov Decision Processes","venue":null,"work_id":"a44c084b-3fb0-40dd-8469-755a70da1e5d","year":2014},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:01.977237Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:cac09facc0463bbb4bc8dfba64db590cc5cde7066fa50afb36d69c771925f87d","observation_id":"a5043075-a4d4-4af5-9951-42440171f472","resolution":{"observed_at":"2026-08-06T20:09:13.319843Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:20.315469Z","title":"Bellemare, Will Dabney, and R \\'e mi Munos","venue":null,"work_id":"213fcbb5-e825-479d-9a9b-bc9b20ef3df9","year":2017},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:02.093022Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:1ab2244dcc32d522dd352a6c22b450a67a4f9a3d2b0756e1ba2297c1223040b9","observation_id":"11d0c8aa-8e73-41e2-8ba8-8f0c9a30fd9a","resolution":{"observed_at":"2026-08-06T20:09:20.407563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:02.177952Z","title":"Bellemare, Will Dabney, and Mark Rowland","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:02.177952Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:7c67c517586dd5d8e91dab686a9bb24e6e728a24e584038266bad0735e94db8d","observation_id":"95b15776-8282-46da-aebe-959c05c6cc67","resolution":{"observed_at":"2026-08-06T20:09:02.177952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2022.10376","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:12.912407Z","title":"Ziebart, and Marcello Restelli","venue":null,"work_id":"81b35591-e62d-4c8d-961c-2e1d50cb2892","year":2022},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:02.319842Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:dd91a8889c0dfba25324c11ac103dce997ee1f77a271f9e951b32868a82df927","observation_id":"4cc39029-f341-4571-a305-74d6bc06725e","resolution":{"observed_at":"2026-08-06T20:09:13.000302Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:20.128588Z","title":"JAX : Composable transformations of Python + NumPy programs, 2018","venue":null,"work_id":"8e2309b8-39fa-48b6-9ddf-b2aca4317de8","year":2018},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:02.432682Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:08729f004253c4bcf293e8fab7c7677682577fb01002af001c36be46b4344729","observation_id":"a682904f-ff2a-4185-b67c-be850ef8606c","resolution":{"observed_at":"2026-08-06T20:09:20.191891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2013.65798","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:12.595940Z","title":"Stochastic optimal control with dynamic, time-consistent risk constraints","venue":null,"work_id":"86349031-966d-45c8-9152-d2ad99fce7db","year":2013},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:02.560824Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:6e05ef11ab238eafd5385853960305abb83cfec7f6a50b16c0678121cf989337","observation_id":"eff56d07-4d40-4dd6-8669-2ee6b540eff4","resolution":{"observed_at":"2026-08-06T20:09:12.723585Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:19.966164Z","title":"Risk- Sensitive and Robust Decision-Making : A CVaR Optimization Approach","venue":null,"work_id":"3aa27466-8dab-4799-b0f9-6eab20e3fa80","year":2015},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:02.683924Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:a1b77313ef65c0980d2cd1b08e722b1ea4ee0a3214ee3ae09881eb93a47bc8e0","observation_id":"06b74b07-ca31-4c9a-9ef3-150118f5cd76","resolution":{"observed_at":"2026-08-06T20:09:20.028618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:19.835854Z","title":"Risk- Constrained Reinforcement Learning with Percentile Risk Criteria","venue":null,"work_id":"1a6d7ae3-9805-4ed6-b216-45af488228cc","year":2018},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:02.823461Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:02eea50808b0626813f1cc47c12494b17a273a9598843e62fe2bf7889141ab82","observation_id":"66647590-cea9-47e0-b73f-441c2ffc856c","resolution":{"observed_at":"2026-08-06T20:09:19.895986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:02.930157Z","title":"Reinforcement learning with dynamic convex risk measures","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:02.930157Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:35ccb4df230edf0b334ad14033518d1746b4f1ed2b2b49c90cb2e511c615437e","observation_id":"2dbbcb24-cbc6-4052-962b-124805143fee","resolution":{"observed_at":"2026-08-06T20:09:02.930157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:19.698610Z","title":"Implicit Quantile Networks for Distributional Reinforcement Learning","venue":null,"work_id":"1028257b-6ad6-4c4a-bfa4-41a5269e0fc5","year":2018},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:03.075941Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:a2db6d9131ddab795b3304fa319f7b8b8668ece2074c257505df85de38b328fa","observation_id":"f0d4630e-f1df-4103-928c-1698dae99d38","resolution":{"observed_at":"2026-08-06T20:09:19.766023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:03.263587Z","title":"Distributional Reinforcement Learning With Quantile Regression","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:03.263587Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:2895b2a563b4090ad0217366d4804eda52e8e591fd3f3429e5f01cb3537f067b","observation_id":"4c4d812c-2be4-4cb1-914c-c7f7486ced76","resolution":{"observed_at":"2026-08-06T20:09:03.263587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2006.37752","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:12.200927Z","title":"Clinical data based optimal STI strategies for HIV : A reinforcement learning approach","venue":null,"work_id":"d7a4be42-680c-4171-ac45-5343d2d42462","year":2006},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:03.407058Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:29129d395ca29535450a7f4a6ddeeed129b047d22c6a742a487a596a5c363ae6","observation_id":"d3b18462-f364-4668-b48c-54c630043f1d","resolution":{"observed_at":"2026-08-06T20:09:12.348618Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:19.591113Z","title":"D4RL : Datasets for Deep Data-Driven Reinforcement Learning , 2021","venue":null,"work_id":"14771004-52d7-4b03-acfe-25259e088cfe","year":2021},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:03.540504Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:3057a91044f820f2b5e9d8bd0693bb35a51fa470d412de9691f87b0440cdd438","observation_id":"f318aac4-4250-4d1c-ab86-fc6724e616f0","resolution":{"observed_at":"2026-08-06T20:09:19.653166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:19.450669Z","title":"A Minimalist Approach to Offline Reinforcement Learning","venue":null,"work_id":"67099c8c-2569-45f5-8c31-20c4edcdde03","year":2021},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:03.718762Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:bcfca7bacfd48ca695ed1688d9a5903bcfd485d9b75ed8d6676faaa8b1820864","observation_id":"b074b5e5-4fc5-4b3d-be5e-3fc1e8740605","resolution":{"observed_at":"2026-08-06T20:09:19.511250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:19.305149Z","title":"Addressing Function Approximation Error in Actor-Critic Methods","venue":null,"work_id":"ea2fa113-7348-43f5-818c-cbc520ec531f","year":2018},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:03.855924Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:8aeb76bc0ce28017bfe4813e1e83d5e89b3a701940b09e279ac8202cabfd96e7","observation_id":"67d9525d-59fa-4196-94f1-8a2d12febab0","resolution":{"observed_at":"2026-08-06T20:09:19.361603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:19.101814Z","title":"Off- Policy Deep Reinforcement Learning without Exploration","venue":null,"work_id":"ce99d6c1-60bb-4dd4-a164-c098ef304c64","year":2019},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:04.086235Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:e98cf71f1360e6b05f2c231bd8b5066768319d32cf7ee6409b4f7d0d681f6272","observation_id":"628e5ce1-a411-4814-a049-f01fa970edbf","resolution":{"observed_at":"2026-08-06T20:09:19.219022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:18.909593Z","title":"Klein, William Dabney, and Jonathan P","venue":null,"work_id":"393d8581-e3c4-4fbf-a914-380e340ad8d0","year":2015},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:04.319782Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:bc8f8ef0458e1dee41a2d83ddf11fa9da1ff3d077a9edd207542ee2c770732a7","observation_id":"755f5532-968d-4271-9d68-5e4309cc0476","resolution":{"observed_at":"2026-08-06T20:09:19.016606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:18.676969Z","title":"Efficient Risk-Averse Reinforcement Learning","venue":null,"work_id":"ebbdc3db-8da5-48dc-bc9c-941b8f55f326","year":2022},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:04.475325Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:86f58013a0c30b567f3210d7da202c019877e9236d2815fd2767d0501e93374b","observation_id":"38c7fddf-fc6f-4957-bd34-7568f01b7fc4","resolution":{"observed_at":"2026-08-06T20:09:18.790336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:18.476149Z","title":"Soft Actor-Critic : Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","venue":null,"work_id":"d67a9ce4-2e22-4ffa-a37a-71eec67c1666","year":2018},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:04.621013Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:e80a25cd3bfe8b6f74c27088036d5c99d0d32520c0a8054145e595667f75b14d","observation_id":"11fd4a65-f29a-486f-a461-75690ac637dc","resolution":{"observed_at":"2026-08-06T20:09:18.566734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:18.372261Z","title":"Double Q-learning","venue":null,"work_id":"8f7925e9-7cbb-4c20-a711-09873561e7f0","year":2010},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:04.756123Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:328571a602f94d183a1cba93d50690fc9db78fdd102ab10c223b6a4d88ad5e7a","observation_id":"bfe34753-ee71-4ce3-bba5-3d3acae318f0","resolution":{"observed_at":"2026-08-06T20:09:18.375462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:18.332295Z","title":"On a relationship between distorted and spectral risk measures","venue":null,"work_id":"2fa6fe80-c914-40f1-8335-cae89dfa86ca","year":2006},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:04.878707Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:6c389cf4845a71119524df36fd3b3a8e5122e949c497c85d154a1e17abd3dc45","observation_id":"c3b6e7d6-5116-4c3f-a30c-7808a9fe745e","resolution":{"observed_at":"2026-08-06T20:09:18.367029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:18.110745Z","title":null,"venue":null,"work_id":"3ef853bf-dcda-42c9-80a2-295f7f358931","year":2022},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:05.050796Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:3abe94c8c4d4996dc5d4571afd223ddae709250b66cb528fe1030a2ce962918b","observation_id":"47bd0b89-4219-4fc7-a950-2f93ca6d08f1","resolution":{"observed_at":"2026-08-06T20:09:18.235835Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:05.113204Z","title":null,"venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:05.113204Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:a2929ab2ee3c8111f0564e7851e47dd0bf5aec9309b5fc163ff61fd400690689","observation_id":"e55e4fc8-e5b2-475e-bc04-d29c4e29121e","resolution":{"observed_at":"2026-08-06T20:09:05.113204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:17.902713Z","title":"Approximately Optimal Approximate Reinforcement Learning","venue":null,"work_id":"5acf7239-b005-4c76-92aa-cff403540cbf","year":2002},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:05.222826Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:79690279b6ef5b565c6fd0bdb6d01da53c2db70ac3ac2e9ba2c57e872c119ea1","observation_id":"2b9ce50d-c8ec-4978-b790-d3188f79e63e","resolution":{"observed_at":"2026-08-06T20:09:17.999079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:17.676842Z","title":"A Natural Policy Gradient","venue":null,"work_id":"7aaeb809-df6c-425b-9604-40f748100b25","year":2001},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:05.343379Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:21d12d8f032b2317f2e2573b49881164bf281a365bfea9213cd02fc23cfd316f","observation_id":"666ea40f-6b55-43d1-b4d0-c91e0abb7959","resolution":{"observed_at":"2026-08-06T20:09:17.805535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:05.467312Z","title":"Being Optimistic to Be Conservative : Quickly Learning a CVaR Policy","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:05.467312Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:c7bee70d84b634be469a107bce231008b9197b2395c004db02b044f25bb176c1","observation_id":"8420dfe2-352f-483d-aa5f-fb3b53d5ed68","resolution":{"observed_at":"2026-08-06T20:09:05.467312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:17.519660Z","title":"Spectral- Risk Safe Reinforcement Learning with Convergence Guarantees","venue":null,"work_id":"7835b445-629b-42f9-bb49-b7d263220e60","year":2024},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:05.567256Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:25b09eb3c045949c975e557a2eb723b4b3df26e7b38d7e646828a9140c74cc58","observation_id":"1fbb0463-481e-47c3-ad87-cfb5e2a29a67","resolution":{"observed_at":"2026-08-06T20:09:17.593249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:17.340903Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","venue":null,"work_id":"a1ff07c1-389f-488f-b5b9-9ad4347f204e","year":2021},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:05.707458Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:444421487721cd51e2a55e06ab335629556fac617aad34e399520c6e377db016","observation_id":"af0e3352-b28e-4541-a2af-f2e1c6c8d27b","resolution":{"observed_at":"2026-08-06T20:09:17.406774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:17.182805Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","venue":null,"work_id":"f7b401e5-b04c-49e4-a66a-46358d0fd820","year":2020},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:05.831653Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:a5aad43a1757b4fa2e9967fe9592afab726983376645dc42d85822fae206c85a","observation_id":"df73e2a6-93fd-4b06-a25d-689241a433e5","resolution":{"observed_at":"2026-08-06T20:09:17.266832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:17.012668Z","title":"Offline Reinforcement Learning : Tutorial , Review , and Perspectives on Open Problems , 2020","venue":null,"work_id":"1808ee5c-fb8a-4d07-b7c9-d2b863975854","year":2020},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:05.928906Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:1b4521c75963a1db89ea9e27519ae27fce050be40ac05fc6ec020379c1e53690","observation_id":"dfdb5793-2f79-4f88-8a23-fb97153644ce","resolution":{"observed_at":"2026-08-06T20:09:17.115164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:16.818871Z","title":"Distributional Reinforcement Learning for Risk-Sensitive Policies","venue":null,"work_id":"9f642272-011b-4631-b881-3feea5e0a0e8","year":2022},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:06.039648Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:2153b838f728641f31ebe301c784e2aabe59e770c5d244f8866f0bf8cceac542","observation_id":"5b8132a9-4a92-4a6d-8562-5d75b52cc8c9","resolution":{"observed_at":"2026-08-06T20:09:16.888918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:16.626846Z","title":"DSAC : Distributional Soft Actor Critic for Risk-Sensitive Reinforcement Learning , 2020","venue":null,"work_id":"0d5259e6-57cf-4fda-ada2-6a58f6ac08fa","year":2020},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:06.208255Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:d41761fc480ffc139e7b08ea7977db98d0aea98729545e619cf6ca85563230cd","observation_id":"6e58cb62-bddb-460b-a196-10d16ce67132","resolution":{"observed_at":"2026-08-06T20:09:16.706738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:16.530793Z","title":"Conservative Offline Distributional Reinforcement Learning","venue":null,"work_id":"04343ad9-762f-49a5-9136-9680a66829f2","year":2021},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:06.307890Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:7a8067ffc21eef8f6070cf927843249dd41674b91d44dfe85fa55f275806f63a","observation_id":"12309041-de66-4a08-a9c3-56567b2f6854","resolution":{"observed_at":"2026-08-06T20:09:16.559075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:16.309498Z","title":"On the Global Convergence Rates of Softmax Policy Gradient Methods","venue":null,"work_id":"41d88092-7133-4889-90fe-c1f6e694ba62","year":2020},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:06.444387Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:86d68733f31d5de08b8a8ac5f9a24e394cf5650ad421479f81ee3d2683dff2c0","observation_id":"e2c2af76-719e-418e-9004-bf869e60037f","resolution":{"observed_at":"2026-08-06T20:09:16.431390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:06.548162Z","title":"Rusu, Joel Veness, Marc G","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:06.548162Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:ddd986ba52db9e5d76887b195cdaa31557d6c290969ad5d4ff729430d95df9d2","observation_id":"f8cd50fd-868c-45bb-9c70-f97198bb71b4","resolution":{"observed_at":"2026-08-06T20:09:06.548162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:16.116073Z","title":"Beyond CVaR : Leveraging Static Spectral Risk Measures for Enhanced Decision-Making in Distributional Reinforcement Learning","venue":null,"work_id":"b1c6621c-5833-4099-9afe-133e59867524","year":2025},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:06.621353Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:0fde597961aa814767ef032ac868807a742001b529f9fd9f7a60f2970b587f71","observation_id":"82e90c22-a28a-411b-9793-d579fc8a3d17","resolution":{"observed_at":"2026-08-06T20:09:16.226896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:15.898822Z","title":"Nonparametric return distribution approximation for reinforcement learning","venue":null,"work_id":"a2406298-c815-48ea-86b8-b3450b022957","year":2010},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:06.739855Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:f51a6eed66a543460b3749ba189d64e8b8d399faff3ad89909685c6e535fcb23","observation_id":"e13a8b29-bd97-4f3a-8d67-b989c55a6775","resolution":{"observed_at":"2026-08-06T20:09:16.004464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:15.616003Z","title":"AWAC : Accelerating Online Reinforcement Learning with Offline Datasets , 2021","venue":null,"work_id":"43a01226-5034-40c9-95f2-9e40a328a377","year":2021},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:06.875633Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:6eb18819ed2e4840cba1ca147735e8f8d9111ad41408baaa08a5403d01a1fe9e","observation_id":"ebf41783-9baf-4f9e-b7ab-c841a2cbe4cb","resolution":{"observed_at":"2026-08-06T20:09:15.777513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2020.11357","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:11.899256Z","title":"An intelligent financial portfolio trading strategy using deep Q-learning","venue":null,"work_id":"69ec7aba-4295-42fa-a002-96267739916f","year":2020},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:07.010839Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:20c92c863163ebda0b8e55bfca1d2087c94eb8460be87d7bb08c32cc81282f42","observation_id":"45f624a7-f1b1-4bd8-95a9-daf925ae741f","resolution":{"observed_at":"2026-08-06T20:09:12.014681Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.eswa.2018.02.032","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Pendharkar and Patrick Cusatis","venue":"Expert Systems with Applications","work_id":"6fb0f60a-ef7a-4247-bd05-e4b50a0edf4b","year":2018},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:07.102726Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:ed2900ce2746ba10d47e8dbb1fa7904191d5b98c6197249ec6331b636bd820f3","observation_id":"ad62c8db-799a-4ed8-abaa-8f7a2d0b7a3a","resolution":{"observed_at":"2026-08-06T20:09:09.853490Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:15.332436Z","title":"Advantage- Weighted Regression : Simple and Scalable Off-Policy Reinforcement Learning , 2019","venue":null,"work_id":"aed2ff34-7f76-47e4-bd78-cf3c73c61efa","year":2019},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:07.157603Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:a6e3e8439dbcec2fdec9775cf89961deb6209698fc4c27a4b93b8bec0514cabb","observation_id":"c2c396cc-98a1-4615-8478-863477a0475a","resolution":{"observed_at":"2026-08-06T20:09:15.459637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2015.0747","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:11.519180Z","title":"Pflug and Alois Pichler","venue":null,"work_id":"f19398b2-479e-4fc7-b954-846c041fcb92","year":2016},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:07.221355Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:535ae0bf3eb229e3f33c9552f26c8478caec1878c29b8e1d4506ab0f6328bd9d","observation_id":"f9e397af-2269-43dc-8b8e-f40d17050400","resolution":{"observed_at":"2026-08-06T20:09:11.663550Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:07.334040Z","title":"Premiums and reserves, adjusted by distortions","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:07.334040Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:da90d71d1f960d53dfe9a97380910927051121cc212b33ee97e0856dcb337672","observation_id":"058d69ea-34d7-412d-9d0c-83a9d3e37ce8","resolution":{"observed_at":"2026-08-06T20:09:07.334040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:15.182915Z","title":"Optimizing Return Distributions with Distributional Dynamic Programming , 2025","venue":null,"work_id":"a676d329-e2c6-405b-a896-465e9d66e47d","year":2025},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:07.439899Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:f28bb7d4c86ecf563bda9c7f37a5dd91a57a4396aeccb061538ff0b6412bc39e","observation_id":"3f7f53aa-6cd6-4966-9a89-6e583c8bc049","resolution":{"observed_at":"2026-08-06T20:09:15.269547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:07.541870Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:07.541870Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:11197a03d1b3f12678cfc3eed33cdb433193f3b25cea0f625b88f6b01f6a5935","observation_id":"bbd05617-b64d-4890-a3bc-f1c9d3462292","resolution":{"observed_at":"2026-08-06T20:09:07.541870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:15.003615Z","title":"One Risk to Rule Them All : A Risk-Sensitive Perspective on Model-Based Offline Reinforcement Learning","venue":null,"work_id":"30471319-74df-4c51-8266-6282a0e24047","year":2023},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:07.620283Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:40e11203ec8d272fa712bdd452e2c6168dde0624c299de5aade7b8e62ce84f72","observation_id":"1f1442fb-baf4-4661-a3dc-ee71377204e0","resolution":{"observed_at":"2026-08-06T20:09:15.078965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:14.848946Z","title":"Trust Region Policy Optimization","venue":null,"work_id":"8b906811-c6cc-478b-99a6-62a1b0993d5d","year":2015},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:07.698024Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:67b0bf6ed058e8b054da912683fc4e4e938ec99add859a60a2b4cfd1d5992b64","observation_id":"c6a59a7f-5799-4cf5-9e62-5e91edb7cf2a","resolution":{"observed_at":"2026-08-06T20:09:14.950080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:14.670536Z","title":"Ruszczy \\'n ski","venue":null,"work_id":"94fb9698-e85c-4962-aa22-9752b22c43d8","year":2014},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:07.775821Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:45f1837803e6316b4c16179b3d6010e7251391862d019fde33ac3e173b7d5e2f","observation_id":"84ad0e20-4878-4bfa-93c8-92aa4f31b27d","resolution":{"observed_at":"2026-08-06T20:09:14.744203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:14.527547Z","title":"Deterministic Policy Gradient Algorithms","venue":null,"work_id":"815d16c8-6026-4253-987a-29fba5447f11","year":2014},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:07.904865Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:fa896de4727f40ddbb66ad33d82181f69e80166ac93006afcee02e6833f4b42e","observation_id":"5fbafa98-15d1-4798-8bda-d13f2527dc89","resolution":{"observed_at":"2026-08-06T20:09:14.593706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:14.389809Z","title":"Sutton and Andrew G","venue":null,"work_id":"58f82030-f4a1-4069-92ef-003ff038b047","year":2018},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:07.948153Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:cb89034c0de80086aa1dfacce7ca5abf6f4702031b9e6ca37337a071217cde1b","observation_id":"3a26e391-bf0e-4aad-899a-2df5b30612ee","resolution":{"observed_at":"2026-08-06T20:09:14.465030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:14.190552Z","title":"Policy Gradient Methods for Reinforcement Learning with Function Approximation","venue":null,"work_id":"ff6f64a8-c8a4-46d9-bd4f-bd74bf1bae15","year":1999},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:08.013284Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:599736d0b0463290e9d22e10afa9ab45688302293e116f5e26185b950a894daf","observation_id":"f0560e98-05c7-436c-b7af-c5716d45e054","resolution":{"observed_at":"2026-08-06T20:09:14.285068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:14.016961Z","title":"Policy gradients with variance related risk criteria","venue":null,"work_id":"46787c6d-11a1-4c76-9a87-5191f96eed19","year":2012},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:08.105147Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:4e186807d75789efbbc8ce915a3cc01ba8dc63ea17cf57448d56c8e62435ac2b","observation_id":"869fb5a0-7ee4-4bdb-b35e-8aeae9ad8065","resolution":{"observed_at":"2026-08-06T20:09:14.082329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v29i1.9561","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Optimizing the CVaR via Sampling","venue":null,"work_id":"3e7abdd6-ea78-4735-9dcf-38b3d0fe26fd","year":2015},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:08.195484Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:1e8aa03ba389244109d9a9b13fa8fac45d83420981f9d1936d72caea4bb90a5b","observation_id":"409acc79-75b6-4116-821e-614534134b9c","resolution":{"observed_at":"2026-08-06T20:09:09.605858Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:08.260691Z","title":"Sequential Decision Making With Coherent Risk","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:08.260691Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:a6adf782970882b653d21e2bcef2ab54a3b579ac181d8d4c1e29a65c9606658e","observation_id":"9262ecb2-9e1a-46db-8f5a-d5d29b34a444","resolution":{"observed_at":"2026-08-06T20:09:08.260691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:08.361397Z","title":"MuJoCo : A physics engine for model-based control","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:08.361397Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:21cc2f86f0e6cf8a5adcf25d2d0d1b00e96d2ab921dc37c603dab6b4d31670b4","observation_id":"2196e995-8326-4bc4-aa9b-bf9056b694c9","resolution":{"observed_at":"2026-08-06T20:09:08.361397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:08.452063Z","title":null,"venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:08.452063Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:48aee85836cd7d0ac58497712640f3836b2cfb0a6b0a7d3a5967b7deef5b246f","observation_id":"1ae47d57-2f70-4a4a-a488-11ecffc0c1e9","resolution":{"observed_at":"2026-08-06T20:09:08.452063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:13.742046Z","title":"Risk- Averse Offline Reinforcement Learning","venue":null,"work_id":"70c48b0e-fee0-4226-8733-ca2bdc7b0210","year":2021},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:08.536696Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:414e904def56702302c21b7853ccd22d6b089c225c9e4b4eb26aca09d41b5bd5","observation_id":"fcd58df1-a2eb-4870-82d2-7083fc360ccd","resolution":{"observed_at":"2026-08-06T20:09:13.889984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2022.11680","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:10.885818Z","title":"Risk-sensitive policies for portfolio management","venue":null,"work_id":"babdc357-8c54-4cae-8e11-7037e531f631","year":2022},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:08.625089Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:cd262ec3eb0b45cab97d94fe037e8769f32139ff164af3caf20d78f143683bcd","observation_id":"bb26b307-7329-4857-adaa-188115dff86b","resolution":{"observed_at":"2026-08-06T20:09:11.045884Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:08.722702Z","title":"Insurance pricing and increased limits ratemaking by proportional hazards transforms","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:08.722702Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:ea6e56ee00b060d5d3881ac40b24b337cc49fe0a162a8c2a05153037216e14ab","observation_id":"f101390c-fa33-406e-be30-25a145180aa3","resolution":{"observed_at":"2026-08-06T20:09:08.722702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.2307/253675","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"Journal of Risk & Insurance","work_id":"ec038b4b-b6a6-4146-b00c-7fd77ef3349a","year":2000},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:08.807810Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:ad434f8895e3e3144cd3fcb1d8d8dfbe051a58baf95c13d8bdcdbf9fce47c6be","observation_id":"73482005-bdb5-48b3-bc3e-a7c67ed59d91","resolution":{"observed_at":"2026-08-06T20:09:09.347148Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:08.878012Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:08.878012Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:fec998d9b1435f3f25c6c86c8994d39104a9c999c5ad01a2247760170fd45bcf","observation_id":"be656925-48e4-4fe1-af11-e43f396d85fb","resolution":{"observed_at":"2026-08-06T20:09:08.878012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v35i12.17302","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Mean- Variance Policy Iteration for Risk-Averse Reinforcement Learning","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"320ce899-4b13-4b58-97c1-486a58a69319","year":2021},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:08.965688Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:ca5602d35de5f4d58cba536297be74c9ab68b5d32615b199c8fa7d6a6d77d44c","observation_id":"5d659ce4-0d20-4870-997c-75df4fbdbe73","resolution":{"observed_at":"2026-08-06T20:09:09.121529Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":6,"parse_uncertain":0,"unresolved":15,"verified_exact":9,"verified_fuzzy":40},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 1 inbound Pith citation observation for arXiv:2507.03900."}