{"as_of":"2026-08-10T00:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:879bb9ccc957cc57d459b724c6ffd2f944186a6bb235ff67c03ff99333128dcc","coverage":[{"denominator":300,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T18:22:19.263723Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01917/citation-record","integrity":"/paper/2608.01917/integrity","json":"/paper/2608.01917/citation-record.json","paper":"/paper/2608.01917"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.690856Z","title":"and Bhatnagar, Shalabh , journal=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.690856Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:9d90060d430d7bd27f77180b7184a5fe0b3c2fcb095ca3b9d624697cfd9190de","observation_id":"8db38a2c-9b04-4ca8-9c63-c3f27c04b4e6","resolution":{"observed_at":"2026-08-04T18:22:18.690856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.695939Z","title":"Machine Learning , author =","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.695939Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:4a4d7b3a0afbda0c3f211eea7dd2dd5f7e8bb36b8123ee8b4da5ffdba437cef2","observation_id":"9118ebe3-b1de-4718-ac31-b8acdd26de97","resolution":{"observed_at":"2026-08-04T18:22:18.695939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.701121Z","title":"Mathematical Methods of Operations Research , author =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.701121Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:5dafaebe4b256107ef85f51d40fd2768cf9298e145349d285c144e7d2b6a4ee1","observation_id":"e36e78f1-ecb8-4383-85ee-99630534485a","resolution":{"observed_at":"2026-08-04T18:22:18.701121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.arcontrol.2023.03.001","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Annual Reviews in Control , author =","venue":"Annual Reviews in Control","work_id":"3d49c683-273c-420a-a8d8-eede2d394965","year":2023},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.706614Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:210398adbfe62ba18611fa21a36d648de41c46a9d68ca80afa855891844091ba","observation_id":"9c2af1d9-d4ed-469c-899a-3ec3f54ec7d8","resolution":{"observed_at":"2026-08-04T18:24:06.531535Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.711800Z","title":"IEEE Transactions on Automatic Control , volume=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.711800Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:092d3172ee03fe28caafeeef2866c7d9a4240fb42389ec90d6220592ba42c7e5","observation_id":"7ad6a522-a654-4909-b998-5af57ca24a3f","resolution":{"observed_at":"2026-08-04T18:22:18.711800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.716981Z","title":", booktitle =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.716981Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:a8c6240c2e61b07325866b8904cbeda5a1a0972f52b0088e1995d8aae71726b3","observation_id":"11b163b2-4328-49a8-aeee-2b37d4f799e5","resolution":{"observed_at":"2026-08-04T18:22:18.716981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.722395Z","title":"Proceedings of the 41st International Conference on Machine Learning (ICML) , pages =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.722395Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:c9854a3e6963597e4523ad72233cac1d0e1dad30e7907504f854fdd0845fef9e","observation_id":"bee477c4-d457-4244-bd46-5116ac377fdb","resolution":{"observed_at":"2026-08-04T18:22:18.722395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.727304Z","title":"Journal of machine learning research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.727304Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:86286f7d2c840cdb58cb86edee46968a8cc0508ee81d26d3b61fb345c6198d5b","observation_id":"0300aa3a-0786-4869-9516-676b81fb997e","resolution":{"observed_at":"2026-08-04T18:22:18.727304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.732186Z","title":"Conference on learning theory , pages=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.732186Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:2d7bc61f6ffd523219e8a7801de55ad6323dd7ee94fd0f0063c3f85f5c8548dd","observation_id":"175bc61a-9953-46b8-b607-f0f66e7db118","resolution":{"observed_at":"2026-08-04T18:22:18.732186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.737798Z","title":"European Journal of Operational Research , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.737798Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:6e7845c46b5d8a7b52c100b76f336cd273c8f7dd2b05ae5d94581ebc7578ea9a","observation_id":"f1e38876-9e02-422f-be12-09e79b4e2c1e","resolution":{"observed_at":"2026-08-04T18:22:18.737798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.743079Z","title":"Finite Sample Analysis of Average-Reward","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.743079Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:141fa76a9777e279f08b651fc82ef73f2d410dd9c805264c544bf101a7fe7d9f","observation_id":"c349e537-f96e-4eac-900f-5374dde9ae85","resolution":{"observed_at":"2026-08-04T18:22:18.743079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.747754Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.747754Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:9b723598244a03037fa7a3b9390396c51433547a57e5dd172c3d1f31dff93289","observation_id":"c2e5ed37-eed2-4841-adcf-6cedf792f3ad","resolution":{"observed_at":"2026-08-04T18:22:18.747754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.753131Z","title":"Proceedings of The 5th Annual Learning for Dynamics and Control Conference , pages =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.753131Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:ba9d7e81835e4b3d0d655d2a1308a17128ff5bb5315111ebed3d6d727e1028dd","observation_id":"eecfe608-48fe-41ff-9a9d-62fe086efad8","resolution":{"observed_at":"2026-08-04T18:22:18.753131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.04976","last_updated":"2021-09-10T16:20:56Z","snapshot_observed_at":"2026-07-06T11:46:27.012397Z","submitted_at":"2021-09-10T16:20:56Z","title":"Optimal bounds for bit-sizes of stationary distributions in finite Markov chains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.04976","snapshot_observed_at":"2026-08-04T18:22:18.758321Z","title":"arXiv preprint arXiv:2109.04976 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.758321Z"},"links":{"cited_paper":"/paper/2109.04976","citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:f8928073bb9bd5a99d3ac6f109de1c072a1ed10cafb532eda98231c4fdabc304","observation_id":"fb61a18d-bb60-40d0-a397-b0c1b039934a","resolution":{"observed_at":"2026-08-04T18:22:18.758321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.766950Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , author=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.766950Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:6dad5e0712e5e359f9e657e407583243d97ce86ceeb79aaad17f580572523815","observation_id":"e6325516-97d0-4cde-91a9-eddd09d22b04","resolution":{"observed_at":"2026-08-04T18:22:18.766950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.780150Z","title":"IEEE transactions on automatic control , volume=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.780150Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:811aa16bfe3fc2f848bcc3ddeb80d1ae367c0993350bada38a5d6403a17abc7b","observation_id":"df8872e7-cdbe-4652-bfb7-ec387efcd4c6","resolution":{"observed_at":"2026-08-04T18:22:18.780150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.784841Z","title":"Machine Learning , volume=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.784841Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:78918728bf89bb8f58d5ac8f0b208820bdea02ba47cabeea44d68fab088b430c","observation_id":"143893c6-f56c-4fc4-a0ae-f6e74469aa79","resolution":{"observed_at":"2026-08-04T18:22:18.784841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.790116Z","title":"2022 , volume =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.790116Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:f1f935052c08e21116da4560e6482b7bbd11edd145912b0d73ed77ca1507e356","observation_id":"12a2606f-0b95-4ff4-ae5c-26aaf6bfdd64","resolution":{"observed_at":"2026-08-04T18:22:18.790116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.797052Z","title":"Mathematical Methods of Operations Research , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.797052Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:12e6ef1338f32015e602ebd0a2170c074aaca28000b023e1eb31d1c66489ddd4","observation_id":"6fbb45d0-de81-416e-97b4-598c0a31ab61","resolution":{"observed_at":"2026-08-04T18:22:18.797052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.801774Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.801774Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:b0f1e0d05d38641a55ddc9df4b5f4991336f401f4a92d7605cae267fbe5d7b3a","observation_id":"da0f7704-db1d-4842-aee1-27a57bbe0a8d","resolution":{"observed_at":"2026-08-04T18:22:18.801774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.812917Z","title":"and Baras, John S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.812917Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:2f6e5f0928f3622ffd622f5ec04d8b44c37e7b329a9c78669a17474a45b1b4d1","observation_id":"75682599-b845-403d-86d6-48d80a346511","resolution":{"observed_at":"2026-08-04T18:22:18.812917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.819412Z","title":"Risk-sensitive","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.819412Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:942176626fcf0673a976714e9b996c69a5ad71b4fcb0c17e46cac2b8f61ac992","observation_id":"06662154-c51d-4f3e-99a3-d612f2f9c3e6","resolution":{"observed_at":"2026-08-04T18:22:18.819412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.827880Z","title":"2011 , publisher=","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.827880Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:72d4e559b4981f0871f8bf7e7008e8019d1afefae0ca6d6f6291541453bff16d","observation_id":"62329475-513f-46d5-94b5-bf38b77fe59d","resolution":{"observed_at":"2026-08-04T18:22:18.827880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09992","last_updated":"2024-02-15T14:55:38Z","snapshot_observed_at":"2026-08-05T21:55:31.852425Z","submitted_at":"2024-02-15T14:55:38Z","title":"Risk-Sensitive Soft Actor-Critic for Robust Deep Reinforcement Learning under Distribution Shifts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09992","snapshot_observed_at":"2026-08-04T18:22:18.835736Z","title":"arXiv preprint arXiv:2402.09992 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.835736Z"},"links":{"cited_paper":"/paper/2402.09992","citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:38494d1cbddbfc18ef4b0d3de959ceeaacd932a8c7b6509de5b1afb71c63035a","observation_id":"36fe0165-550a-41c8-81ac-aad91c7bce32","resolution":{"observed_at":"2026-08-04T18:22:18.835736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.841373Z","title":"A utility criterion for","venue":null,"work_id":null,"year":1976},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.841373Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:0bef83404b7bcfa5a78a7534266784ba78845f06538672a3e2913d94e32100ef","observation_id":"b05fe670-2f16-44af-8968-64511385fb09","resolution":{"observed_at":"2026-08-04T18:22:18.841373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.847991Z","title":"Uncertainty in economics , pages=","venue":null,"work_id":null,"year":1978},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.847991Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:035fe3b5f1f89d17b4f636f8fb5b02b0ea2a357b083cf9754ccedb0fd658ed51","observation_id":"43bd783d-26c7-46ad-9418-7ed015a7dedc","resolution":{"observed_at":"2026-08-04T18:22:18.847991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.854891Z","title":"2002 , publisher=","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.854891Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:3f48cfe9639dbdb9a0013463ac25312ff824e64fb7bac6dc38f8bc60b181c6d6","observation_id":"8e16f210-21e9-4712-ad05-8e7712e9dc7e","resolution":{"observed_at":"2026-08-04T18:22:18.854891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.861690Z","title":"2025 , school=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.861690Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:dd3a78ebea2282e6a21faaa682f8a9441af689cd5ece692ffa6faf0142d348f6","observation_id":"b3e1cb71-3bbc-48e8-b13d-90476ca453b8","resolution":{"observed_at":"2026-08-04T18:22:18.861690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.866412Z","title":"SIAM Journal on Applied Mathematics , volume=","venue":null,"work_id":null,"year":1966},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.866412Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:dc5e2fc382617bd7785f28445a90cbcaffd9e93bf309fb2c4c132e687c0d73ba","observation_id":"d88ce866-ee02-47a6-9b18-bf0eb7f5cc49","resolution":{"observed_at":"2026-08-04T18:22:18.866412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.873407Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.873407Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:27893d7e2d3bf7f506feaccba17b609c889fb91d21609f8bbc1c5712e12b615f","observation_id":"a0c0a525-3440-4b2b-9a15-f2461e29245f","resolution":{"observed_at":"2026-08-04T18:22:18.873407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.882226Z","title":"Conference On Learning Theory , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.882226Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:25256a5081e188e0a524629ed210165ad533ac7776f5d4cb2adf8d6c77957b9d","observation_id":"0d424e17-cfb3-48e7-8237-b6a56b2074aa","resolution":{"observed_at":"2026-08-04T18:22:18.882226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.890930Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.890930Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:b9d82adb6ecbf2295e45050835183512886c3df4adbbdcf54a94ffdd07f0ef10","observation_id":"c9569d53-91d8-4479-8a27-5015c2a166f5","resolution":{"observed_at":"2026-08-04T18:22:18.890930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.895915Z","title":"Lakshminarayanan and C","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.895915Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:fce60dcc76cf6963083c36f2bb0b23875f276e6ab1db74bd40f7a84fe1e39265","observation_id":"bc287802-30be-412e-bc1f-d10b44cb7b58","resolution":{"observed_at":"2026-08-04T18:22:18.895915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.901603Z","title":"and Ying, L","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.901603Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:a8bcaeb02619b2cb995b3a2c1e9e1b1ed317d71fe2c90129653445582b535451","observation_id":"38ddd001-628b-4517-98bb-486746ee6668","resolution":{"observed_at":"2026-08-04T18:22:18.901603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.907172Z","title":"The Annals of Applied Probability , volume=","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.907172Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:7e1de33da3f0e132d19e284bfccdc24f3206d40091746243ee6cea7121781792","observation_id":"2f5b5c23-6dea-4499-bf84-3cdd774c1a30","resolution":{"observed_at":"2026-08-04T18:22:18.907172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.912698Z","title":"The Annals of Applied Probability , volume=","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.912698Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:51c46f80870cc8c9c0b6916b22d7549e9101e107b25f50b5bc11b1ca54718a1e","observation_id":"0c1fe015-dca3-4e28-8afb-a32906362ebe","resolution":{"observed_at":"2026-08-04T18:22:18.912698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.919050Z","title":"Conference On Learning Theory , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.919050Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:b3b5ef491eeba6d99770af6ffbcb8f39b072f8857ead0ac5575cd0e66aee5894","observation_id":"7c28c4da-4349-4587-94f8-54a8383e50d1","resolution":{"observed_at":"2026-08-04T18:22:18.919050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.923984Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.923984Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:0f711ed28659b546d51afb6393620da760afe1fa8d07a140c8fef7bcb311ce17","observation_id":"03b5a6fe-52b2-46f4-8c28-57c842d19b4c","resolution":{"observed_at":"2026-08-04T18:22:18.923984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.929178Z","title":"Automatica , volume=","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.929178Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:889ab1d5b45c38f776ffe342e5155980e5a9492060a419fde0e1ed4cb3757640","observation_id":"bbff7235-68f3-4193-b772-96c5aa253958","resolution":{"observed_at":"2026-08-04T18:22:18.929178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.934795Z","title":"SIAM Journal on Control and Optimization , volume=","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.934795Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:ea07a5ee953939dd6a87d3ecd93c762ec9b4b5cb9c0d3e94b103e5678990b250","observation_id":"1abdcdd6-17ce-4d6c-9237-40a2b54df874","resolution":{"observed_at":"2026-08-04T18:22:18.934795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.939159Z","title":"and Bertsekas, D","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.939159Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:9156e662fecc6b9b535b7d5d356efe73cae717c474d2bedce934178c4c65ad4e","observation_id":"d6aa574e-f74b-4aae-b6a2-804721cf1f9c","resolution":{"observed_at":"2026-08-04T18:22:18.939159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.944294Z","title":"Operations Research Letters , volume=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.944294Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:30bf100244a1b20ebb303333d99375dbce0e3bb0d29df2e631c3c0b06e0bdcef","observation_id":"6e06ee61-655f-42f2-9a18-67f76fd5b601","resolution":{"observed_at":"2026-08-04T18:22:18.944294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.949194Z","title":"2009 , publisher=","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.949194Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:16906b965885a658fa8c2d503d74806ded1a7c091da696411380fe56d4427556","observation_id":"b124759b-9a12-4133-9a31-427fe950e7ea","resolution":{"observed_at":"2026-08-04T18:22:18.949194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.953997Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.953997Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:f37cc7e8a92d9807f80d5a716c86a58899b5fc30ad26817d1199d3e67a28dbc5","observation_id":"fa2e63c3-1084-4e7a-a4c0-c001efb01bed","resolution":{"observed_at":"2026-08-04T18:22:18.953997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.958218Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.958218Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:824319d48fe5a9e7acaeb9fa3f8745656b8d827e732dcdcdf79d662b58ab4fbb","observation_id":"19fd20d5-9f56-466e-8614-cd9367240c10","resolution":{"observed_at":"2026-08-04T18:22:18.958218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.962342Z","title":"Operations Research Letters , volume=","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.962342Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:586c74fef671f191241ba63001375f14284e4d62cfc15112ade76a1039e22f01","observation_id":"c8cf078e-3dff-4d41-904b-e10afc2dedd6","resolution":{"observed_at":"2026-08-04T18:22:18.962342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.967254Z","title":"Operations Research Letters , volume=","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.967254Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:171acca81f20f7ca5692acc5898155e54650a66f0a096849b56de3bd4d15f9cb","observation_id":"a77c9f77-b43f-4f87-99c7-3bfcaa546f22","resolution":{"observed_at":"2026-08-04T18:22:18.967254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.972037Z","title":"2020 , eprint=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.972037Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:0c1447b550ba1a5236f9cad6405e298cb3fbbe9f14e4de53130fba99cef94236","observation_id":"be714e41-a9d9-4203-95f3-e53dc2ac0bcc","resolution":{"observed_at":"2026-08-04T18:22:18.972037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.976757Z","title":"Proceedings of the 31st Conference On Learning Theory , pages =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.976757Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:e77c6ac5f59b44a44029c6644a370b2e69e4081ed81c954235f5f33c08c230f7","observation_id":"3cb90f47-0ad6-41ab-9cbd-12fc1b4562b5","resolution":{"observed_at":"2026-08-04T18:22:18.976757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.981525Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.981525Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:9a3d9b479da999f159742aba998e8469b5085fa9d98c697b8d9e960e552a85d8","observation_id":"e9b39222-53c8-427f-87b8-e970c2eb2a43","resolution":{"observed_at":"2026-08-04T18:22:18.981525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.04157","last_updated":"2022-08-29T22:59:35Z","snapshot_observed_at":"2026-08-04T05:25:50.810670Z","submitted_at":"2022-02-08T21:35:10Z","title":"A Policy Gradient Algorithm for the Risk-Sensitive Exponential Cost MDP","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.04157","snapshot_observed_at":"2026-08-04T18:22:18.986360Z","title":"Moharrami and Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.986360Z"},"links":{"cited_paper":"/paper/2202.04157","citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:e1e0e44278edf94b9f1978b9a23317c8a761c6c7e4ec5be6823904bd6cedbaa9","observation_id":"131d7d82-bb6f-4026-aad0-98f4e6af2541","resolution":{"observed_at":"2026-08-04T18:22:18.986360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.990885Z","title":"Proceedings of the IEEE , volume=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.990885Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:dc82136788f3709540f215106090e1d5c61ee53f9ad020bed7deec44a8e3bb7c","observation_id":"eca4883d-f604-4df5-bfaf-ce253d98fceb","resolution":{"observed_at":"2026-08-04T18:22:18.990885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:18.995256Z","title":"Methodology and Computing in Applied Probability , volume=","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.995256Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:5b4956b692168fed083cc31d16ad83d99348ad17c6fdb83e293bfc42112aac24","observation_id":"b645de49-f1f6-4bf8-abc9-7b601a8f0927","resolution":{"observed_at":"2026-08-04T18:22:18.995256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.01567","last_updated":"2023-09-04T20:15:15Z","snapshot_observed_at":"2026-07-06T10:37:50.467703Z","submitted_at":"2021-02-02T15:48:19Z","title":"A Lyapunov Theory for Finite-Sample Guarantees of Asynchronous Q-Learning and TD-Learning Variants","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.01567","snapshot_observed_at":"2026-08-04T18:22:18.999794Z","title":"arXiv preprint arXiv:2102.01567 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:18.999794Z"},"links":{"cited_paper":"/paper/2102.01567","citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:c15d044ffc0f931eca79dec107f17d6dc7175f04730c06cab83b53924e48bf59","observation_id":"76bf0df5-3a2a-401e-a94f-0243c08c8e9c","resolution":{"observed_at":"2026-08-04T18:22:18.999794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.009259Z","title":"Journal of Banking & Finance , volume=","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.009259Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:d035755d63a49ee35fe27f6f6f4148bd051df4014bba49127ba515057fba116f","observation_id":"62c8ef94-0386-45b7-b0c7-0a31241b57bb","resolution":{"observed_at":"2026-08-04T18:22:19.009259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.015312Z","title":"Journal of Banking & Finance , volume=","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.015312Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:90b56563e28f8d19bcc2210153210d450e576c9cbcbc766c73f988219cf6f274","observation_id":"348962b5-6861-41ea-a76b-5b4dc17f16a0","resolution":{"observed_at":"2026-08-04T18:22:19.015312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.021495Z","title":"and Blake, D","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.021495Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:8becbf109969d4e344a389cc6e19bd4305dcb1268fabf1718155f25d04841ef5","observation_id":"345553d5-8f0c-4f32-9ad2-350071ebf3df","resolution":{"observed_at":"2026-08-04T18:22:19.021495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.026351Z","title":"Siam Review , volume=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.026351Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:82d365d05a0004b4fa24092f9db6f595cbd4642afa39ecd96d22cb53a41364b5","observation_id":"e8a5e955-0773-4ecb-b636-7e15c1cbd02c","resolution":{"observed_at":"2026-08-04T18:22:19.026351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.032519Z","title":"Finance and stochastics , volume=","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.032519Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:3adfb588641fa119d04f4c4cde058ff277949795c16ffe5513d21c6ebfc05238","observation_id":"272eb171-9ffd-48d9-80d8-50a95aca0b84","resolution":{"observed_at":"2026-08-04T18:22:19.032519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.036997Z","title":"SIAM Journal on Control and Optimization , volume=","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.036997Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:62ebcb20104d6c7143b56bee8f6a22af9452ebea8d4ad7ea0a8024951599b3de","observation_id":"a21000ea-36aa-4808-9e2c-dae3b7f45e85","resolution":{"observed_at":"2026-08-04T18:22:19.036997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.041959Z","title":"Handbook of Sequential Analysis , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.041959Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:a831af6ee1c09583cb58ec342fa5b6ad077adaf418d790c6f8f9128ed1ac01e2","observation_id":"a3a53880-6767-41f5-9efb-e133e6ab7cb8","resolution":{"observed_at":"2026-08-04T18:22:19.041959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.046297Z","title":"2016 , publisher=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.046297Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:06bd7424415bb605f0a42d318789945ebf64a562850b8f5abec64b803170f650","observation_id":"8c3c8782-b052-4b75-a26f-0c0015ab0c37","resolution":{"observed_at":"2026-08-04T18:22:19.046297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.052711Z","title":"Electronic Journal of Statistics , volume=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.052711Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:9ee4b8e5a1668a5958021a05ebe697f5f988379087d5ded2daf957022945861c","observation_id":"5fa117c2-fcae-446f-8951-8c0643da1c61","resolution":{"observed_at":"2026-08-04T18:22:19.052711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.058406Z","title":"Mathematics of operations research , volume=","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.058406Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:8558378988abcc2e5a48ff55ba7fd01db6296f41cab08d3d6b7dee1c44e164b6","observation_id":"3b22e938-ba67-49b5-9c79-369178f51a1b","resolution":{"observed_at":"2026-08-04T18:22:19.058406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.065133Z","title":null,"venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.065133Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:4fd147e8c3a17678fe1c6d0c64138eded7bd199076a6b9bab75a3e7257667247","observation_id":"bf5b06f5-00da-4609-8bf5-26502e77c48a","resolution":{"observed_at":"2026-08-04T18:22:19.065133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.069843Z","title":"Bhatnagar and V","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.069843Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:4d1fc95f904b1966b96fe17d3291daaf311ae9eea52baecf6bbc1ef4b6a82e8e","observation_id":"7dd47ac4-6349-4633-8c26-31e28a3515ee","resolution":{"observed_at":"2026-08-04T18:22:19.069843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.075831Z","title":"Systems & Control Letters , volume=","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.075831Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:f47e34a37185cd039637d4207912af3627156b0d5f80ef8c194ea270182b0c99","observation_id":"bb6f97e2-0f85-4fdd-9be2-d97ba9ed1e9a","resolution":{"observed_at":"2026-08-04T18:22:19.075831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.081296Z","title":"SIAM Journal on Control and Optimization , volume=","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.081296Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:ae8126a8818ad2237a8d0255b52b1b93de0db9c5d9207909d1c4603bef59e7d3","observation_id":"efd2e365-0866-4a3e-8187-46483f30939a","resolution":{"observed_at":"2026-08-04T18:22:19.081296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.086019Z","title":"Zhang and A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.086019Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:cbdf806cc38960883cb37fdb09418cf110ad448ad22edcfa47273359ba9d2a50","observation_id":"8772cfc4-e81a-4165-b1da-b408505f9c86","resolution":{"observed_at":"2026-08-04T18:22:19.086019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.091581Z","title":"International Conference on Machine Learning , pages =","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.091581Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:f87743308df14db2836f87b04873a7c55048d74ab513014d3104b654e4704032","observation_id":"454544dc-d067-486e-9ec1-7f956b0027b9","resolution":{"observed_at":"2026-08-04T18:22:19.091581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.095979Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.095979Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:a1e9e2b9a0e3d1703fd575d580fb7e40296845911e7c7f23fd912e4156dbefa5","observation_id":"ca26104c-0a33-4a7a-bb38-8521a022f96d","resolution":{"observed_at":"2026-08-04T18:22:19.095979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.101293Z","title":null,"venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.101293Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:99552eb5224742ad538b3b1103145bd888a107ee618eeaa6095ff799a1a6af7f","observation_id":"2dbbb8c3-3060-4315-8ff5-98b70f894059","resolution":{"observed_at":"2026-08-04T18:22:19.101293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.106213Z","title":"Annales de l'IHP Probabilit","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.106213Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:b0c772fd98cf08d2175d911f43ade6c417e9bd266ce121d4379bcd3766f9537b","observation_id":"2a1909b8-87a1-435f-b59c-6d248bf387de","resolution":{"observed_at":"2026-08-04T18:22:19.106213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.110701Z","title":"Conference on Learning Theory , pages=","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.110701Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:3f71df814c19b1a2f8c0c6b0b3524195f188709b0bc0e982147aa421a471a56f","observation_id":"feff9784-73e5-4ba1-85a0-1fe94e6acfba","resolution":{"observed_at":"2026-08-04T18:22:19.110701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.116237Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.116237Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:e0367c721598432b0cd5ce5ec61dd315aa1f96d34dd0369770a446cc2bef7b17","observation_id":"a6b13972-5ec4-46d8-93d9-63d0073d62f4","resolution":{"observed_at":"2026-08-04T18:22:19.116237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.122143Z","title":"The Annals of Probability , volume=","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.122143Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:370a0a80b352a41bb5406cdbf54a29c582064e7427e38b999774714422caff61","observation_id":"f7e4b406-6a78-4cbd-b1f1-4ad8ef0eb740","resolution":{"observed_at":"2026-08-04T18:22:19.122143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.126548Z","title":"and Glynn, P","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.126548Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:d873ca8057dd5933fc0722c47c4c587863ef57f10867ff3658c7e40482289774","observation_id":"399c86cd-8b6a-41e0-a437-f6775b0ca748","resolution":{"observed_at":"2026-08-04T18:22:19.126548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.131417Z","title":"2014 , publisher=","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.131417Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:f6ad2a6aee103015c38be3f1faae439ec207d8500c28a22d45be7247431d98a1","observation_id":"5f457dab-e549-4639-943a-cb979e6ee8ac","resolution":{"observed_at":"2026-08-04T18:22:19.131417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.136367Z","title":"Aleksandrov and V.I","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.136367Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:d371db6c0e45cf5516daf7d7ff5e0b4878556b4097ac628a74c8f066bda0f87a","observation_id":"78ee7559-461a-433b-9ac9-c3744c26d1a3","resolution":{"observed_at":"2026-08-04T18:22:19.136367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.141744Z","title":", author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.141744Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:969d290b78ebf50f7702ed2beb59f432e551518a7004941af8d3a179c193ae68","observation_id":"d354f1d7-e2e9-4cee-afaf-be41c0c60110","resolution":{"observed_at":"2026-08-04T18:22:19.141744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.147098Z","title":"Mathematics of Operations Research , volume=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.147098Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:f3c8b8e97f4c3647b113f2001a45a01637d87f4d40d65e14ae07148b2dbd71a8","observation_id":"783e1255-505a-412c-9b1f-4eaa8e93e4e9","resolution":{"observed_at":"2026-08-04T18:22:19.147098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.151951Z","title":"More risk-sensitive","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.151951Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:73957ae76365a0d90e71cc916754151819e42d40da62a0dbb010b5240292e305","observation_id":"ae8b0974-bcc5-48d9-b853-6205bb35d884","resolution":{"observed_at":"2026-08-04T18:22:19.151951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.156668Z","title":"and Ruszczynski, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.156668Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:1072c44d4a0064bb5bc03b94321261483a2672d726c58e66e2431338b19d27c9","observation_id":"bc23b54c-e54f-4bf4-af64-69a55a2f5b7a","resolution":{"observed_at":"2026-08-04T18:22:19.156668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.03919","last_updated":"2015-06-08T06:31:42Z","snapshot_observed_at":"2026-07-06T04:09:08.596909Z","submitted_at":"2015-02-13T09:16:24Z","title":"Policy Gradient for Coherent Risk Measures","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.03919","snapshot_observed_at":"2026-08-04T18:22:19.161330Z","title":"arXiv , Author =:1502.03919 , Journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.161330Z"},"links":{"cited_paper":"/paper/1502.03919","citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:5fa063a74a89115948bd05cfc8c0592b32138d6ec432653438effc6ec6c32851","observation_id":"6c2107bd-10e9-4837-8e20-97cb52b1324a","resolution":{"observed_at":"2026-08-04T18:22:19.161330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.166208Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.166208Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:d1808481891bf46a0c467d160339e041def25bde69655088cc687dcc8270c4e1","observation_id":"ac26e41f-42c3-4b7e-a9fb-2e1818ca40d7","resolution":{"observed_at":"2026-08-04T18:22:19.166208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.171011Z","title":"Wiley Encyclopedia of Operations Research and Management Science , Title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.171011Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:5c85775c24c241700fe03012e4b33f5fd875f221d8016979e8bf79f5b164544d","observation_id":"43f6bba2-ccfe-4bb3-b523-13d5b10611be","resolution":{"observed_at":"2026-08-04T18:22:19.171011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.175419Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.175419Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:cb1695913993a24d8ce0de56d73576753e5276775a40bec6eb12f3a1a135eddd","observation_id":"e8e20687-03d8-4124-8a4d-9844d3e1b28a","resolution":{"observed_at":"2026-08-04T18:22:19.175419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.184860Z","title":"Bhatnagar and R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.184860Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:a99098f5b199197508d241e94aa72c1b12ede61ae861668604d29232333313a6","observation_id":"f73c5fa1-8175-496b-8bbb-a6c909faec2e","resolution":{"observed_at":"2026-08-04T18:22:19.184860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.189846Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.189846Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:8b7fb3fd5b1c85691394aae505103ab9f2d35f9d8c32d9f5f578999627728b57","observation_id":"09225190-4c15-458b-82f5-734551f461f9","resolution":{"observed_at":"2026-08-04T18:22:19.189846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.195103Z","title":", Isbn =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.195103Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:22c604cb941d8a212b2a643b2cc73b321cd000949ac1a4031ba3534628075fff","observation_id":"956c8f5f-ffc5-4bb5-b101-c8e525f8893f","resolution":{"observed_at":"2026-08-04T18:22:19.195103Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.205703Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.205703Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:3ca935221b214ed9e540ccc6c5213bcc6d007fa12e04b09295799bfb4f1e8585","observation_id":"532b94a9-134b-456c-9751-68d6d762bdbd","resolution":{"observed_at":"2026-08-04T18:22:19.205703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.211275Z","title":"Barto and R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.211275Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:1b8115a479ca2f3076f53d4c36dcdae2325aedb4a2e7be61b0908bd1f3bfe6b9","observation_id":"f73b968b-89c4-4e46-ac2d-090a1e86cc71","resolution":{"observed_at":"2026-08-04T18:22:19.211275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.218986Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.218986Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:390530f2a6545123958919483eab6e77b230232efcd62ef77ece257ee26a11d9","observation_id":"4f0083a1-3fbb-4ddb-a224-fd4dcd7fadd6","resolution":{"observed_at":"2026-08-04T18:22:19.218986Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.223387Z","title":"Shen and W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.223387Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:a0e21b274ff91291faab7c188001be173141bf24f809698880c93012c00b1db0","observation_id":"4f473516-335b-4bce-8115-738e8e5bc2d3","resolution":{"observed_at":"2026-08-04T18:22:19.223387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.228159Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.228159Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:1e6f1435a615a7596783fff03df575e9a5252faaceb2e652c1add2db2769e0fe","observation_id":"067e723c-76d7-46b0-9a27-a08deb15e95b","resolution":{"observed_at":"2026-08-04T18:22:19.228159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.233112Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.233112Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:31f63a4bf90600f3dd5c74cdbf5ff1fd7840a99f981fddcc6f7c03b6a087fac9","observation_id":"3d01eb7b-a00a-4903-b6ce-9cacd2d0dbea","resolution":{"observed_at":"2026-08-04T18:22:19.233112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.241771Z","title":"Basu and T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.241771Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:2d35f3159044817d46f950f716596d8cbd5d7f2b844c42d21985c819e14f886e","observation_id":"ea3b4a3a-e50a-4098-9b5b-fb5a82651863","resolution":{"observed_at":"2026-08-04T18:22:19.241771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.250319Z","title":"Mathematics of Operations Research , volume =","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.250319Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:294d016db5548bb3ee191eea8333576bcb474fb6a71c35f2c19df36a5282db3f","observation_id":"b89fdccc-073b-4fe9-9375-c7aab4fcc4c1","resolution":{"observed_at":"2026-08-04T18:22:19.250319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.256617Z","title":"Mihatsch and R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.256617Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:be9ceaf53e16362c2fbe0daf8c125d72a114d31534228eed50517192937397e4","observation_id":"b38c57ba-5be4-423d-85e8-6226159ffdb2","resolution":{"observed_at":"2026-08-04T18:22:19.256617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:22:19.263723Z","title":"Filar and D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-04T18:22:19.263723Z"},"links":{"citing_paper":"/paper/2608.01917"},"observation_digest":"sha256:987784860c2d52cc61aeb9ef9609527f30c7b8accb0204137c824924f8409550","observation_id":"27f448c9-7221-4623-a10a-89d465a12901","resolution":{"observed_at":"2026-08-04T18:22:19.263723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.01917","last_updated":"2026-08-03T08:50:07Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T23:34:20.504322Z","submitted_at":"2026-08-03T08:50:07Z","title":"Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":2,"unresolved":97,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":300},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 300 outbound references and 0 inbound Pith citation observations for arXiv:2608.01917."}