{"as_of":"2026-08-09T04:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:26a9b7ea66537f50ee71324e53bfe1635531b933118e27ec5708f7ce5551bbf6","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T05:00:44.567451Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T19:31:33.732451Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T22:50:51.108083Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"cited_work":{"arxiv_id":"2602.03778","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.03778","snapshot_observed_at":"2026-07-01T02:17:19.184541Z","title":"Reward redistribu- tion for cvar mdps using a bellman operator on l-infinity","venue":null,"work_id":"c31f81c5-4f65-4676-8f85-4fd04309681f","year":2026},"citing_paper":{"arxiv_id":"2604.04795","last_updated":"2026-07-07T17:01:01Z","snapshot_observed_at":"2026-07-13T09:40:41.819534Z","submitted_at":"2026-04-06T16:01:59Z","title":"Sample Complexity for Markov Decision Processes and Stochastic Optimal Control with Static Risk Measures","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T19:31:33.732451Z"},"links":{"cited_paper":"/paper/2602.03778","citing_paper":"/paper/2604.04795"},"observation_digest":"sha256:1697993469f13bf0e5b6ec8c47eee73f19aec2f6d150e6ede62228edc5011694","observation_id":"19a246b1-bc52-435f-aa88-b39ecccd7936","resolution":{"observed_at":"2026-07-01T02:17:19.184541Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2602.03778/citation-record","integrity":"/paper/2602.03778/integrity","json":"/paper/2602.03778/citation-record.json","paper":"/paper/2602.03778"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:39.290410Z","title":"Andrychowicz, F","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:39.290410Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:66204ec00fabf8151cbb7c847f199fe5db47a83619eba19142e3b02c733eb1e7","observation_id":"c55ad402-e7f1-4ec4-9a86-8f19abcee506","resolution":{"observed_at":"2026-08-03T05:00:39.290410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:39.361929Z","title":"Predictive CVar q-learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:39.361929Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:b0167dd47fe1f3ba6913e5dd368a08c4828f2b17faf58e79a1d694ba16936a2d","observation_id":"d3087eee-dc31-4e4f-ba50-d8ad8ffafe9e","resolution":{"observed_at":"2026-08-03T05:00:39.361929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:39.466284Z","title":"Artzner, F","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:39.466284Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:f5c1e90a356d3c5e491ae047edcf9778a11d57d4c9885cb7ce2abc28e0089862","observation_id":"94a3ad6c-89c4-42ac-984e-440514776dad","resolution":{"observed_at":"2026-08-03T05:00:39.466284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:39.607989Z","title":"Bastani, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:39.607989Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:bc29906792f37ca4e7e8c83fb2893eca81ce035333555830b7ff05244eff5b31","observation_id":"8aa3ed2d-c9fd-4f5d-972f-dc515628d835","resolution":{"observed_at":"2026-08-03T05:00:39.607989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:39.684832Z","title":"B¨ auerle, T","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:39.684832Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:c14ba3a329c086cf38532e0ec77601783aa4f8e028e5053ba2dfc20e83d5c090","observation_id":"aebb6ee5-4c59-442f-944a-13d251065b75","resolution":{"observed_at":"2026-08-03T05:00:39.684832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:39.836318Z","title":"B¨ auerle and J","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:39.836318Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:9ba7c804004558c9f9b243f5e24143cc090c7b0ee1fef0cd3ff370f14bc0f53c","observation_id":"adc529bf-d9bb-4f87-abb0-07152ad8ed42","resolution":{"observed_at":"2026-08-03T05:00:39.836318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:39.953096Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:39.953096Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:701282bed1d6870309f1ce893bcaf337e7d2c765e40055d9b6263281874f70c1","observation_id":"bbb662eb-9be9-406f-82af-19d94cf73309","resolution":{"observed_at":"2026-08-03T05:00:39.953096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:40.111565Z","title":null,"venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:40.111565Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:d8222d10679e474b5722075806eafde6987defe75fd83848d8428bdec198aa2e","observation_id":"00f0eb34-09fa-4a1c-afce-0493d9337f7b","resolution":{"observed_at":"2026-08-03T05:00:40.111565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:40.257543Z","title":null,"venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:40.257543Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:f6c1ae2c93899703d0505a36a45a14f144764754da8a27609e5f927d3f073535","observation_id":"c61a1492-e09f-4179-ac3d-c1e89001b2bb","resolution":{"observed_at":"2026-08-03T05:00:40.257543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:40.458999Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:40.458999Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:f169f650913dbbc089571bc83add5ee9f3c3ddfa785c288c4565909dc79537a4","observation_id":"dd488dd3-4cc2-430d-9e21-05ed71bb3142","resolution":{"observed_at":"2026-08-03T05:00:40.458999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.02787","last_updated":"2020-06-04T12:56:16Z","snapshot_observed_at":"2026-08-02T00:46:52.816691Z","submitted_at":"2019-10-01T22:12:00Z","title":"Quantile QT-Opt for Risk-Aware Vision-Based Robotic Grasping","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.02787","snapshot_observed_at":"2026-08-03T05:00:40.609467Z","title":"Bodnar, A","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:40.609467Z"},"links":{"cited_paper":"/paper/1910.02787","citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:c062e300632a4e4cdebd6b99c7b912b9ca4cbae2e3141de957cbd62e555b151d","observation_id":"9956550a-6198-422e-a856-d83fd58a94da","resolution":{"observed_at":"2026-08-03T05:00:40.609467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:40.760225Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:40.760225Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:62ec5aef6da7ff3a123e68fe1d5fbd66bb225eefa30643bd74982992bb6d59f0","observation_id":"5f580598-567a-4631-a287-682c3a47787e","resolution":{"observed_at":"2026-08-03T05:00:40.760225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:40.908153Z","title":"Coache and S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:40.908153Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:67db66de4b15449f995328f1f72d936f6cfca5098b39e29b78e230bdcbf5991c","observation_id":"f8e1c3c3-b51c-4b3c-b049-10b63b7b72b6","resolution":{"observed_at":"2026-08-03T05:00:40.908153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:40.950310Z","title":"Dabney, G","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:40.950310Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:af5267eb5c9a9cd9176951d85d22454db725bf2113bf8c9ee7b4a4adbe71789b","observation_id":"edae7a6e-862e-403d-9f69-66a3ca59ff26","resolution":{"observed_at":"2026-08-03T05:00:40.950310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:41.008319Z","title":"Dabney, M","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:41.008319Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:3f0942de45a3faed3d3e15a5502e00db44fcbd1dd0262739fddd1a1b6f7d09e1","observation_id":"00909810-6c3e-4649-95b5-985349f0d1c9","resolution":{"observed_at":"2026-08-03T05:00:41.008319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:41.059367Z","title":"Eysenbach, X","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:41.059367Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:d38dfa1ac397d3a9fc21eb0573d55dbc58210000d6a40d58cb5553b4ca98272d","observation_id":"74d39c56-2a3a-4ab3-865e-a73df8ab0440","resolution":{"observed_at":"2026-08-03T05:00:41.059367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.14005","last_updated":"2026-04-15T15:09:05Z","snapshot_observed_at":"2026-08-07T04:57:37.566729Z","submitted_at":"2025-07-18T15:18:19Z","title":"On the Fundamental Limitations of Dual Static CVaR Decompositions in Markov Decision Processes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.14005","snapshot_observed_at":"2026-08-03T05:00:41.104568Z","title":"Godbout and A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:41.104568Z"},"links":{"cited_paper":"/paper/2507.14005","citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:45f06c4adfad3a06991e49592062540e215ec7209b94b2e570671a5ca71a5b73","observation_id":"bb1614d3-c3a0-42db-8970-e075bf392d5a","resolution":{"observed_at":"2026-08-03T05:00:41.104568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:41.176033Z","title":"Greenberg, Y","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:41.176033Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:aa97c8178fc35d04b40cf5a4f89d24c5972d534af3d94f81256b829aec82223d","observation_id":"f2d254f4-aba0-49c7-8846-0f41a3798df8","resolution":{"observed_at":"2026-08-03T05:00:41.176033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:41.237882Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:41.237882Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:3cf40bd304a72126d76947b887d3e8d42d7c42d49e19710171c84136e048b5b0","observation_id":"0c36b96f-f091-4f3f-aefe-0cd730cccb2c","resolution":{"observed_at":"2026-08-03T05:00:41.237882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24128","last_updated":"2024-10-31T16:53:20Z","snapshot_observed_at":"2026-07-06T19:43:00.571297Z","submitted_at":"2024-10-31T16:53:20Z","title":"Q-learning for Quantile MDPs: A Decomposition, Performance, and Convergence Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24128","snapshot_observed_at":"2026-08-03T05:00:41.317966Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:41.317966Z"},"links":{"cited_paper":"/paper/2410.24128","citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:54b616bf076b14ee97868f95256e9d0039d07f70b77a44c5f5313ccb6be20d7b","observation_id":"a4137331-f899-40a4-8544-fd419f5f7bbf","resolution":{"observed_at":"2026-08-03T05:00:41.317966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:41.367988Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:41.367988Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:c06d4de50f867647b5a152f22690075ba8f0d279ab2ae47912ee7fd8245d26fe","observation_id":"eaf31ef1-97c3-4fbe-ac67-78d94a7bb68c","resolution":{"observed_at":"2026-08-03T05:00:41.367988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.03445","last_updated":"2025-09-09T16:45:32Z","snapshot_observed_at":"2026-08-06T12:16:58.355420Z","submitted_at":"2021-09-08T06:06:28Z","title":"Convergence of Batch Asynchronous Stochastic Approximation With Applications to Reinforcement Learning","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.03445","snapshot_observed_at":"2026-08-03T05:00:41.438755Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:41.438755Z"},"links":{"cited_paper":"/paper/2109.03445","citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:cf9b9073764790fa56e07cfb72e3ce421f753533c3c78dea1dc1890efbab4f76","observation_id":"d201daf5-b84a-4e9b-8b43-62e41aa8270a","resolution":{"observed_at":"2026-08-03T05:00:41.438755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:41.572723Z","title":"Keramati, C","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:41.572723Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:b34bac95203c6db0d281be233182230a57f68d25108ade187d55ff6ca63407dc","observation_id":"e340c233-7c78-4da5-b08b-61afbb6089f9","resolution":{"observed_at":"2026-08-03T05:00:41.572723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:41.681722Z","title":"Kim and S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:41.681722Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:aa232f20636a40368d77e2c59289b30016faf9b9617372c11f221494526ae212","observation_id":"ae9fe827-eee9-466a-9bca-194baaeb0221","resolution":{"observed_at":"2026-08-03T05:00:41.681722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:41.825187Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:41.825187Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:104736f378e2100e6ae4936987f9a9c55e9c1a046f4268c9aaec3a4f14306df7","observation_id":"6e81dad5-dfae-458f-8898-9bdaa125f673","resolution":{"observed_at":"2026-08-03T05:00:41.825187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:41.937723Z","title":"Majumdar and M","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:41.937723Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:aebb0779bfaacadec2ce65ac4c33cefb82f69f88ae7abca233c10186da7e7da0","observation_id":"d092259a-3035-49a5-9b4b-246cc0652de6","resolution":{"observed_at":"2026-08-03T05:00:41.937723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20887","last_updated":"2025-07-21T03:55:34Z","snapshot_observed_at":"2026-08-07T15:58:09.354739Z","submitted_at":"2025-04-29T16:04:16Z","title":"Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20887","snapshot_observed_at":"2026-08-03T05:00:42.106290Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:42.106290Z"},"links":{"cited_paper":"/paper/2504.20887","citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:7a9bb4df90ae9175f02b3dbfacef2da3191ae8f62ab05013fa2e129e8513cfd3","observation_id":"729129bc-3353-48b3-833d-1f61bc861859","resolution":{"observed_at":"2026-08-03T05:00:42.106290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:42.251825Z","title":null,"venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:42.251825Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:212b05bbdbea68557774ec9171ff4c2a7a612ad708460e832a4786c5d0039a2c","observation_id":"be61549a-1cab-4545-831e-d51f53e378f7","resolution":{"observed_at":"2026-08-03T05:00:42.251825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:42.378177Z","title":"Moghimi and H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:42.378177Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:9816f29e63fcf4c297880fe392983816879c71e990145a5ba7a50ff3174c1ecd","observation_id":"cf48ee31-9f0b-4ac6-a472-356438d6d49f","resolution":{"observed_at":"2026-08-03T05:00:42.378177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:42.490132Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:42.490132Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:2ee1e8878f02bd2b0b32038d37125ca4d2636b1d2bcf55dae3ed150e440fc70a","observation_id":"7438794a-7c70-4749-a508-ff7d7a7d20c5","resolution":{"observed_at":"2026-08-03T05:00:42.490132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:42.614452Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:42.614452Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:babe75956064d22244d7bdc122ffbb3491bf3f35ada68440cabd2b011d553a65","observation_id":"f5d769e9-c29d-47b9-b07d-5c4ecd168d1e","resolution":{"observed_at":"2026-08-03T05:00:42.614452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:42.726586Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:42.726586Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:1530c183ec3f213057ec960b82066d9aa8e9c5a81df66a5a121f24ef825bebbd","observation_id":"62ec911d-9c58-48b3-ab5a-7da5ae4120e1","resolution":{"observed_at":"2026-08-03T05:00:42.726586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01072","last_updated":"2024-07-04T09:32:18Z","snapshot_observed_at":"2026-08-06T05:10:41.210993Z","submitted_at":"2023-12-02T08:49:51Z","title":"A Survey of Temporal Credit Assignment in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01072","snapshot_observed_at":"2026-08-03T05:00:42.882135Z","title":"Pignatelli, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:42.882135Z"},"links":{"cited_paper":"/paper/2312.01072","citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:ca9b9246fcef2fd4519b4b01dbe304ef9c78a9e2758c8c87a8489617613d205f","observation_id":"b211e744-065c-4019-a2ea-774e7c3d15be","resolution":{"observed_at":"2026-08-03T05:00:42.882135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13028","last_updated":"2025-08-03T14:06:03Z","snapshot_observed_at":"2026-08-06T20:55:28.052506Z","submitted_at":"2025-01-22T17:20:43Z","title":"Optimizing Return Distributions with Distributional Dynamic Programming","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13028","snapshot_observed_at":"2026-08-03T05:00:43.012228Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:43.012228Z"},"links":{"cited_paper":"/paper/2501.13028","citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:3222542f95bd310668278abe0b1c76fa9de576bc17fb2367801d277309f80802","observation_id":"2e2115d2-677e-4695-ad35-38fcc05b500f","resolution":{"observed_at":"2026-08-03T05:00:43.012228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:43.149409Z","title":null,"venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:43.149409Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:0a73f0b0cfb8d272b230b05a1cb574f7240fd07f82aebd2852652f986e36450e","observation_id":"1a773011-ce78-4120-9009-285824cd6501","resolution":{"observed_at":"2026-08-03T05:00:43.149409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:43.264614Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:43.264614Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:12d7a84931e851a8203fc6e5248f6a5bc56122aac3a05fbe0e9e401ea09fa1b6","observation_id":"53326bf2-181c-449b-8977-47bad8926ed5","resolution":{"observed_at":"2026-08-03T05:00:43.264614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:43.360117Z","title":"Ruszczy´ nski","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:43.360117Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:950e4a189e9ac428cdd190f6806c8b8a3007097ba9b567a45115ded83528a5b0","observation_id":"92fddbf0-801c-47e2-80b6-a4a83f2f405d","resolution":{"observed_at":"2026-08-03T05:00:43.360117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:43.482599Z","title":"Schneider, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:43.482599Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:abd5c8240c0360fe15aba7b5c8790844e1893a9150c15355503a9ac470e6e99b","observation_id":"b35cd1bb-042c-4579-839e-eaac1788beeb","resolution":{"observed_at":"2026-08-03T05:00:43.482599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:43.594072Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:43.594072Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:a5e984a2cdf7d44bcf5938713162e0ad96f3b13d00840592e1a130c175e257d3","observation_id":"616e5455-4612-411f-8d36-fd4791f14257","resolution":{"observed_at":"2026-08-03T05:00:43.594072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:43.714533Z","title":"Stanko and K","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:43.714533Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:f5755e6b50d5c625dbb1bbee5479cd7bdb2ec028e74ece16de235a33a4411663","observation_id":"3f86a70a-847f-41be-b1fa-212e1e91e867","resolution":{"observed_at":"2026-08-03T05:00:43.714533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:43.837265Z","title":"Tamar, Y","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:43.837265Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:c7498c1862f63e43a49882b0aa72e98b3a7b44a1cc9844b744eccec1765221b7","observation_id":"cf626c4b-2321-4e4f-9ad4-219184d8c17f","resolution":{"observed_at":"2026-08-03T05:00:43.837265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:43.927821Z","title":"Tamar, Y","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:43.927821Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:21a406edc4aed2f5385014dab6dfcc16416a00dfc4f9faee3dac1a5197e64baa","observation_id":"48d6a032-460d-4725-afe5-65b541d9ceab","resolution":{"observed_at":"2026-08-03T05:00:43.927821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.03618","last_updated":"2019-11-09T06:24:43Z","snapshot_observed_at":"2026-07-06T08:35:45.430761Z","submitted_at":"2019-11-09T06:24:43Z","title":"Worst Cases Policy Gradients","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.03618","snapshot_observed_at":"2026-08-03T05:00:44.013222Z","title":null,"venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:44.013222Z"},"links":{"cited_paper":"/paper/1911.03618","citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:3d2df062756d747d467d5fa42a4c8319c201b4d0fbc04195a7dfc00ce3136933","observation_id":"b54b3462-8402-4d70-9759-9acf20d60574","resolution":{"observed_at":"2026-08-03T05:00:44.013222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:44.133408Z","title":null,"venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:44.133408Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:dd42017bd472fd801d68719b40155168079eeee5fd7576b50c018374fda6f72b","observation_id":"4e6d8b5c-516a-49dc-9234-fcf3b0c2b91c","resolution":{"observed_at":"2026-08-03T05:00:44.133408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:44.246938Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:44.246938Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:fca4ca98dcb8b8f5f49daea15dcf0ed5c98ecfcfb1625ac6e47b419f07a5be45","observation_id":"de8b305c-6488-46cd-9ff0-292661dde551","resolution":{"observed_at":"2026-08-03T05:00:44.246938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06323","last_updated":"2025-02-28T02:35:06Z","snapshot_observed_at":"2026-07-06T17:42:20.597469Z","submitted_at":"2024-03-10T21:45:12Z","title":"A Reductions Approach to Risk-Sensitive Reinforcement Learning with Optimized Certainty Equivalents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06323","snapshot_observed_at":"2026-08-03T05:00:44.339758Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:44.339758Z"},"links":{"cited_paper":"/paper/2403.06323","citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:b9ba837c3fc19c0dc5bcf8d849b4de6325fcdb9f72270f72990e6d2d3064c92e","observation_id":"9c91a862-2c0c-4c93-b634-0fdaf4ed1ae8","resolution":{"observed_at":"2026-08-03T05:00:44.339758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:44.406778Z","title":"Wang and M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:44.406778Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:e77955234a716a2ecabae0f926db77c4953917f5b23b78c62ab7ef469c851072","observation_id":"c15afc32-40a2-4253-ad09-b658561e007a","resolution":{"observed_at":"2026-08-03T05:00:44.406778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:44.506107Z","title":"− 0−1X t=0 γtr(st, at) +z ! − +z − # =−z − +z − = ˆv† 0(s, z). 29 We follow with atk+ 1: ˆv† k+1(s, z) =E τ∼P ¯π(·,z∗ l ) s","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:44.506107Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:8d15640cf26fec4fff6c01a682a9f413a71855582c985d19af50cf7edd9ffb6d","observation_id":"d82bf449-a6d3-4b21-891b-2cf4bc7cd561","resolution":{"observed_at":"2026-08-03T05:00:44.506107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:00:44.567451Z","title":"These are used to calculate the empirical return distribution, the empirical CVaR performance as well as analyzing the number of times the robot enters the crater per episode","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:44.567451Z"},"links":{"citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:180b3899ad497e4741d6ff1c47b3cd3aab79ff0aeafde812878943ce0f90caed","observation_id":"864970d3-76df-4999-b090-f065ae9aaa12","resolution":{"observed_at":"2026-08-03T05:00:44.567451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-05T22:17:21.917922Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 1 inbound Pith citation observation for arXiv:2602.03778."}