{"as_of":"2026-08-10T05:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c485971f2a4cb44bd798308846215ecb7b417a7b2bb02504938c585a93ccad73","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:35:51.668145Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.21841/citation-record","integrity":"/paper/2505.21841/integrity","json":"/paper/2505.21841/citation-record.json","paper":"/paper/2505.21841"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:34:28.970873Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T13:34:28.970873Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:1fd1af9a4694abe72032fe5d2f07360597677d5bdc5742a3e00f41c93bd958ab","observation_id":"505562c8-8319-48b4-a76b-f495dc7b1a99","resolution":{"observed_at":"2026-08-07T13:34:28.970873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:58.335582Z","title":"Constrained policy optimization","venue":null,"work_id":"0a9e786f-b175-4f42-81a4-90a2eef504b9","year":2017},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:47.027164Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:c0e27bc9ceaf6b4aa0ba72dc76ba115cc1073fc5cd39fc0b3f07a3ea991f0dbb","observation_id":"630fe61f-14f5-4025-aa51-0741d651fe4b","resolution":{"observed_at":"2026-08-07T13:35:58.539697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:58.141991Z","title":"Constrained Markov decision processes, volume 7","venue":null,"work_id":"974207d9-8209-4223-9e41-d20758e39144","year":1999},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:47.159068Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:effd9533215dde15916be954539d525399beb0c40acb48c738780a2537e5a540","observation_id":"00939444-31d3-4e08-bcf8-9f10515a817e","resolution":{"observed_at":"2026-08-07T13:35:58.227495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:57.934683Z","title":"Near-optimal regret bounds for reinforcement learning","venue":null,"work_id":"a8556362-f748-439d-a9c0-5e07fbb75f4b","year":2008},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:47.450316Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:f93e8cb24f5181250560bff2016c8624873f4dd8ef152fa69b35aaf6fb3a7c00","observation_id":"702aad4e-aa41-47b2-bc61-d37059c9958e","resolution":{"observed_at":"2026-08-07T13:35:58.051680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:47.683128Z","title":"G., Osband, I., and Munos, R","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:47.683128Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:a651fbec9807a92dff6f24dd9c32636420a10a8ac0c16259ff5e5e16fcfe0c7e","observation_id":"f732cb5a-352a-4cee-a1b6-46c437e7cb63","resolution":{"observed_at":"2026-08-07T13:35:47.683128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:57.690389Z","title":"S., Agarwal, M., Koppel, A., and Aggarwal, V","venue":null,"work_id":"198eb068-5fd3-4ccb-b22e-6b7f8b4fc961","year":2022},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:47.767912Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:eae4a1020b38ab4ad9f460471b4e162a61da888faccd0f0cfb4365900859ceaa","observation_id":"11fef369-1567-4313-a78b-c6b810038091","resolution":{"observed_at":"2026-08-07T13:35:57.781747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00885","last_updated":"2022-10-18T01:23:03Z","snapshot_observed_at":"2026-08-09T03:52:46.431783Z","submitted_at":"2021-12-01T23:21:48Z","title":"DOPE: Doubly Optimistic and Pessimistic Exploration for Safe Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2112.00885","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.00885","snapshot_observed_at":"2026-08-07T13:35:53.447482Z","title":"DOPE: Doubly Optimistic and Pessimistic Exploration for Safe Reinforcement Learning","venue":"cs.LG","work_id":"504fd8cf-6f48-430b-a480-02276df3e5b9","year":2021},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:47.885604Z"},"links":{"cited_paper":"/paper/2112.00885","citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:f4b651f07aa9242bc3acf2c80d6b8ea25be0bdd6b310ca917c9346dceecfea77","observation_id":"eff5fcfe-0b06-4347-bcf2-9688eb8b64b2","resolution":{"observed_at":"2026-08-07T13:35:53.527372Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05284","last_updated":"2021-06-14T07:13:54Z","snapshot_observed_at":"2026-08-09T03:52:44.623387Z","submitted_at":"2021-02-10T06:33:04Z","title":"Finding the Stochastic Shortest Path with Low Regret: The Adversarial Cost and Unknown Transition Case","version":2},"cited_work":{"arxiv_id":"2102.05284","doi":null,"metadata_source":"pith","pith_arxiv_id":"2102.05284","snapshot_observed_at":"2026-08-07T13:35:53.242866Z","title":"Finding the Stochastic Shortest Path with Low Regret: The Adversarial Cost and Unknown Transition Case","venue":"cs.LG","work_id":"ab897678-bbfc-4318-be3c-a0c3b8b6c53b","year":2021},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:48.002331Z"},"links":{"cited_paper":"/paper/2102.05284","citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:cba2e162103368e4590e8577f365f705a01e3f513b6136e1a1c813d5642634b5","observation_id":"3347a759-18a2-4458-a690-11666c403118","resolution":{"observed_at":"2026-08-07T13:35:53.355079Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:57.497902Z","title":"Learning infinite-horizon average-reward markov decision process with constraints","venue":null,"work_id":"8e89533a-bc80-4eaf-bc47-d62ceedf03a9","year":2022},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:48.098233Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:bbfcaca6b3fdfae942950f33e101779167005001f8d5a6178b6b8d5686d3bf61","observation_id":"900a97dd-cfee-456f-953d-bbc0c71787bc","resolution":{"observed_at":"2026-08-07T13:35:57.621924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:57.172896Z","title":"Risk-constrained reinforcement learning with percentile risk criteria","venue":null,"work_id":"c582c1e9-0cf1-4bc5-9231-2b2265aa9b40","year":2017},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:48.234339Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:2b049092ff02f4c21325b1bea0b9201781b796843e2a9b70042cb4b498e245a8","observation_id":"06e5816d-1349-4dd4-b8ec-d67ed52b0e08","resolution":{"observed_at":"2026-08-07T13:35:57.335859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:56.897804Z","title":"Unifying pac and regret: Uniform pac bounds for episodic reinforcement learning","venue":null,"work_id":"6b0613a0-4e16-457e-9795-1c5c6384f05d","year":2017},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:48.336113Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:04f407f1496a47763d8244456d5fc80b10b6278126ed11031080407842a3b92b","observation_id":"8fcd96a9-0e4c-43af-b02f-be102f098bb2","resolution":{"observed_at":"2026-08-07T13:35:57.018850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:56.715880Z","title":"Provably efficient safe exploration via primal-dual policy optimization","venue":null,"work_id":"087dfb2b-1c1b-49e6-963c-66b9ed8c999b","year":2021},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:48.467808Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:f1f5df1e487bd01791e7c7eb128c6840cc8d1225ec1273955e4e1d4cfb079574","observation_id":"cdc0c94a-c330-4168-81ad-7bdc10a34556","resolution":{"observed_at":"2026-08-07T13:35:56.831806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11965","last_updated":"2022-11-19T22:54:07Z","snapshot_observed_at":"2026-08-08T20:10:25.190538Z","submitted_at":"2022-01-28T07:18:29Z","title":"Provably Efficient Primal-Dual Reinforcement Learning for CMDPs with Non-stationary Objectives and Constraints","version":4},"cited_work":{"arxiv_id":"2201.11965","doi":null,"metadata_source":"pith","pith_arxiv_id":"2201.11965","snapshot_observed_at":"2026-08-07T13:35:52.991684Z","title":"Provably Efficient Primal-Dual Reinforcement Learning for CMDPs with Non-stationary Objectives and Constraints","venue":"cs.LG","work_id":"c4d75177-aa42-40bc-ac0a-a5dfa64ae50b","year":2022},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:48.569789Z"},"links":{"cited_paper":"/paper/2201.11965","citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:38bfd0e6305c53158c5a1d386f91037216b3d7eecd536b15ac4ca3019387ccfa","observation_id":"6e50368c-c30d-4027-b003-6cdfbcd64dc7","resolution":{"observed_at":"2026-08-07T13:35:53.098564Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.02189","last_updated":"2020-03-04T17:03:56Z","snapshot_observed_at":"2026-08-05T18:34:50.706165Z","submitted_at":"2020-03-04T17:03:56Z","title":"Exploration-Exploitation in Constrained MDPs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.02189","snapshot_observed_at":"2026-08-07T13:35:48.684747Z","title":"Exploration-exploitation in constrained MDP s","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:48.684747Z"},"links":{"cited_paper":"/paper/2003.02189","citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:9f26ca9a41639f8224fda89adc68885eddb2ea8ffe2e09598a2e233c6cc2af02","observation_id":"9b1fab1b-2b67-43ce-a413-b9e645253a4c","resolution":{"observed_at":"2026-08-07T13:35:48.684747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14326","last_updated":"2024-08-29T06:17:11Z","snapshot_observed_at":"2026-07-06T15:20:53.397829Z","submitted_at":"2023-04-27T16:58:29Z","title":"A Best-of-Both-Worlds Algorithm for Constrained MDPs with Long-Term Constraints","version":2},"cited_work":{"arxiv_id":"2304.14326","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.14326","snapshot_observed_at":"2026-08-07T13:35:52.691095Z","title":"A Best-of-Both-Worlds Algorithm for Constrained MDPs with Long-Term Constraints","venue":"cs.LG","work_id":"2068b860-f1f8-47aa-935d-32096eb9e9a0","year":2023},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:48.792791Z"},"links":{"cited_paper":"/paper/2304.14326","citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:a508327db5a7cacc6c8c8604a0c292827b42029c2df841c20f505dc7e2dad95d","observation_id":"3ad0cfde-e1bf-4a66-b104-c999d0353657","resolution":{"observed_at":"2026-08-07T13:35:52.838965Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:56.532642Z","title":"Provably efficient model-free constrained rl with linear function approximation","venue":null,"work_id":"b7da0fb1-8bd4-40ca-bf1f-c0e1ec750833","year":2022},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:48.894556Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:0facd79bf22b51e561501e135bef6c1cdc560b9c0a8182052e5b02e1dbd16e7b","observation_id":"e064fe05-10de-4988-a9a1-0ebb44156973","resolution":{"observed_at":"2026-08-07T13:35:56.615244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:56.359867Z","title":"Online convex optimization with hard constraints: Towards the best of two worlds and beyond","venue":null,"work_id":"ec9d0bdb-648c-4dda-8519-f239cab32a26","year":2022},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:49.064830Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:60c42d3539ce2957dcd523ec3f1f5966515d72ff698a99b6eea691b39d6ff1f9","observation_id":"d06a5db2-2c72-4b9a-bcbc-5682e2b3ec77","resolution":{"observed_at":"2026-08-07T13:35:56.433971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:56.174450Z","title":"Safe reinforcement learning on autonomous vehicles","venue":null,"work_id":"e0dda4eb-bc12-4d6a-8eec-329b7e1103cb","year":2018},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:49.160323Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:4ce26b5fea9adb15b6fc15966f46fd4b372dae0d26375c933586338ac681b4be","observation_id":"55b6921b-dfe2-4b24-92c6-c7e51f6ea4aa","resolution":{"observed_at":"2026-08-07T13:35:56.252065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:55.988347Z","title":"Learning adversarial markov decision processes with bandit feedback and unknown transition","venue":null,"work_id":"c5cece8b-1765-4d11-8f8b-75602e70aa3c","year":2020},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:49.233974Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:535ed688a47e92248569a520e0b419ff7830614a7bb6f8edf5a9c87a83561b8c","observation_id":"cd4ebc55-86eb-4332-9128-e09e759b68b5","resolution":{"observed_at":"2026-08-07T13:35:56.073085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.05944","last_updated":"2021-07-02T08:21:07Z","snapshot_observed_at":"2026-08-06T00:52:01.343606Z","submitted_at":"2020-11-11T18:01:59Z","title":"Asymptotically Optimal Information-Directed Sampling","version":4},"cited_work":{"arxiv_id":"2011.05944","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.05944","snapshot_observed_at":"2026-08-07T13:35:52.532739Z","title":"Asymptotically Optimal Information-Directed Sampling","venue":"stat.ML","work_id":"a7599f03-b39c-4948-9dc7-9116d55bc5d3","year":2020},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:49.315365Z"},"links":{"cited_paper":"/paper/2011.05944","citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:ea904d2d84c0be3450b8fbfd1918ea794f7b76974d1705e104623250b8893f08","observation_id":"4cc7faf8-aad4-4a61-8a87-fc00818c6150","resolution":{"observed_at":"2026-08-07T13:35:52.598973Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17780","last_updated":"2024-07-01T12:08:25Z","snapshot_observed_at":"2026-08-02T09:21:27.139700Z","submitted_at":"2024-01-31T12:23:24Z","title":"A Policy Gradient Primal-Dual Algorithm for Constrained MDPs with Uniform PAC Guarantees","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17780","snapshot_observed_at":"2026-08-07T13:35:49.425405Z","title":"A policy gradient primal-dual algorithm for constrained mdps with uniform pac guarantees","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:49.425405Z"},"links":{"cited_paper":"/paper/2401.17780","citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:5caf9b61ed4a804f9f97f88f03d38a169115015360d6efab86de4e4763317e38","observation_id":"3152b411-b341-40c6-8c39-757ffd025609","resolution":{"observed_at":"2026-08-07T13:35:49.425405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08060","last_updated":"2025-03-12T21:09:19Z","snapshot_observed_at":"2026-08-03T11:49:21.596943Z","submitted_at":"2024-12-11T03:06:42Z","title":"An Optimistic Algorithm for Online Convex Optimization with Adversarial Constraints","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08060","snapshot_observed_at":"2026-08-07T13:35:49.517407Z","title":"and Jordan, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:49.517407Z"},"links":{"cited_paper":"/paper/2412.08060","citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:7ef6e5a33163c3f8d05478ffd3d1f8d2068595c17c728381d6a933095e149e7d","observation_id":"a8af659f-5cf7-463d-b447-43f7d5501947","resolution":{"observed_at":"2026-08-07T13:35:49.517407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:55.852747Z","title":"Learning policies with zero or bounded constraint violation for constrained MDPs","venue":null,"work_id":"bf92d3b0-c0d3-41a9-aaee-cde7349e3580","year":2021},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:49.610537Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:77371aacbd9e54ae7c53a530d85090c5664a0685294ce8559d165ee7dde22e9e","observation_id":"0ae5c9b7-2a55-4a3d-8f5c-2bddaf7c3ce1","resolution":{"observed_at":"2026-08-07T13:35:55.912890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:55.621439Z","title":"Learning policies with zero or bounded constraint violation for constrained mdps","venue":null,"work_id":"92e362fd-8027-48d0-a614-30a38a18de20","year":2021},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:49.718689Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:1587f94d645d1569d1c16089147b0ebf1a3f1d25cc0bdfb75bb39cc67400aecd","observation_id":"43ca9dfd-247a-45e0-8f8d-a91c9e1a2c08","resolution":{"observed_at":"2026-08-07T13:35:55.746482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:55.413440Z","title":"Policy optimization in adversarial mdps: Improved exploration via dilated bonuses","venue":null,"work_id":"4d5fe721-7e16-4d78-868d-2eadccc8b32c","year":2021},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:49.844197Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:565d0d9d6216bc2db6b818be8216490a779af06c07ad2aecf82278c4d1f0d73b","observation_id":"30023b5d-0b14-481a-8259-27aae1a15833","resolution":{"observed_at":"2026-08-07T13:35:55.501758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07001","last_updated":"2023-08-30T15:58:45Z","snapshot_observed_at":"2026-08-09T03:51:57.296732Z","submitted_at":"2023-06-12T10:10:57Z","title":"Cancellation-Free Regret Bounds for Lagrangian Approaches in Constrained Markov Decision Processes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07001","snapshot_observed_at":"2026-08-07T13:35:49.965851Z","title":"Cancellation-free regret bounds for lagrangian approaches in constrained markov decision processes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:49.965851Z"},"links":{"cited_paper":"/paper/2306.07001","citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:03f0218033961f366fc9aa178c903b6783582af4114c1e2b86b838606368e54d","observation_id":"b0a2135b-3cbe-424a-981b-d9ac16ab7d0a","resolution":{"observed_at":"2026-08-07T13:35:49.965851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15776","last_updated":"2024-07-19T14:00:43Z","snapshot_observed_at":"2026-08-05T13:09:01.112216Z","submitted_at":"2024-02-24T09:47:46Z","title":"Truly No-Regret Learning in Constrained MDPs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15776","snapshot_observed_at":"2026-08-07T13:35:50.106454Z","title":"Truly no-regret learning in constrained mdps","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:50.106454Z"},"links":{"cited_paper":"/paper/2402.15776","citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:6df44d82109e52dfa7b2705c414ddf37403fa8ef14689c6d9271b0a60f0118ff","observation_id":"132bc39d-c3d1-47da-bf21-fd3bedf6e30a","resolution":{"observed_at":"2026-08-07T13:35:50.106454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:55.135818Z","title":null,"venue":null,"work_id":"04d2a870-bb50-41a4-a32d-d6e5d5478bf4","year":2010},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:50.236838Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:5436cc1b8888e5a31379e8db74572f5b4f46be8e5227553cfb0e86166402cd8b","observation_id":"4bd08f26-9eb0-45c3-84b4-49c23f9636e1","resolution":{"observed_at":"2026-08-07T13:35:55.253773Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:54.959075Z","title":"Upper confidence primal-dual reinforcement learning for CMDP with adversarial loss","venue":null,"work_id":"0d7b9ec9-898f-4c09-b493-fadbc483315f","year":2020},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:50.374739Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:1c721a51765c91766847790269baa9506c751004898877df5eb32fe5e16c0d2a","observation_id":"d496fcf0-1dd2-49f9-b471-fda868e43a9b","resolution":{"observed_at":"2026-08-07T13:35:55.038809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:54.664835Z","title":"and Sridharan, K","venue":null,"work_id":"33c3c427-6d7f-4af2-b121-b51b2c5a60c3","year":2013},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:50.535752Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:338b9f9632c9ae271a6c36aeb0647e28843ff6eda1d19c71d8509747c42bb653","observation_id":"1d7336e1-2e04-4a89-9b5c-f897fe1b595d","resolution":{"observed_at":"2026-08-07T13:35:54.836763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.12435","last_updated":"2022-01-05T19:21:00Z","snapshot_observed_at":"2026-07-06T09:00:46.442419Z","submitted_at":"2020-02-27T20:58:39Z","title":"Learning in Markov Decision Processes under Constraints","version":5},"cited_work":{"arxiv_id":"2002.12435","doi":null,"metadata_source":"pith","pith_arxiv_id":"2002.12435","snapshot_observed_at":"2026-08-07T13:35:52.255278Z","title":"Learning in Markov Decision Processes under Constraints","venue":"cs.LG","work_id":"8b475650-d4ef-4507-a043-30aee4d71d1f","year":2020},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:50.654786Z"},"links":{"cited_paper":"/paper/2002.12435","citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:40a7a4cca28833e929261bbaaa1c4adbd4fdb02fb740c5e7e57b95492dfba9ca","observation_id":"5435887d-aee8-47e5-be4a-1626685ea8d8","resolution":{"observed_at":"2026-08-07T13:35:52.311657Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18955","last_updated":"2024-10-27T16:37:56Z","snapshot_observed_at":"2026-08-07T09:23:39.294571Z","submitted_at":"2023-10-29T09:55:41Z","title":"Optimal Algorithms for Online Convex Optimization with Adversarial Constraints","version":3},"cited_work":{"arxiv_id":"2310.18955","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.18955","snapshot_observed_at":"2026-08-07T13:35:52.098114Z","title":"Optimal Algorithms for Online Convex Optimization with Adversarial Constraints","venue":"cs.LG","work_id":"1f3ef9bb-ec24-41c0-a7aa-d7dbe7e34fed","year":2023},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:50.768281Z"},"links":{"cited_paper":"/paper/2310.18955","citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:88e8b2a08c0e013b1dad2b56610c5568a8d4a252855c63f1ae53d7eafcbee2b6","observation_id":"69f3302e-3541-4a29-b121-6ab7b2a4be2f","resolution":{"observed_at":"2026-08-07T13:35:52.145545Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03672","last_updated":"2025-02-07T14:08:39Z","snapshot_observed_at":"2026-08-03T19:03:13.558970Z","submitted_at":"2024-03-06T12:49:08Z","title":"Learning Adversarial MDPs with Stochastic Hard Constraints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03672","snapshot_observed_at":"2026-08-07T13:35:51.044652Z","title":"E., Castiglioni, M., Marchesi, A., and Gatti, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:51.044652Z"},"links":{"cited_paper":"/paper/2403.03672","citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:9b308088e23c60ff7494beb1f4504df9d65d33bc4f75902074ab3ff4d78385e3","observation_id":"a182d344-fcc4-42ee-bf95-7cbc40d03d95","resolution":{"observed_at":"2026-08-07T13:35:51.044652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02275","last_updated":"2024-10-03T07:54:04Z","snapshot_observed_at":"2026-08-10T04:57:29.337431Z","submitted_at":"2024-10-03T07:54:04Z","title":"Optimal Strong Regret and Violation in Constrained MDPs via Policy Optimization","version":1},"cited_work":{"arxiv_id":"2410.02275","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.02275","snapshot_observed_at":"2026-08-07T13:35:51.787799Z","title":"Optimal Strong Regret and Violation in Constrained MDPs via Policy Optimization","venue":"cs.LG","work_id":"2acb72e9-0bd0-48be-acb8-fb4795419475","year":2024},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:51.152297Z"},"links":{"cited_paper":"/paper/2410.02275","citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:269c9310e23f1079de665fa706ba9d319c306223b5a3247925a71656cdb860c9","observation_id":"b8adca20-6eb5-4929-a697-dde12424916b","resolution":{"observed_at":"2026-08-07T13:35:51.890075Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:54.448102Z","title":"Triple-Q: a model-free algorithm for constrained reinforcement learning with sublinear regret and zero constraint violation","venue":null,"work_id":"d1642971-7ed2-4d6a-9cc0-5f6f2722c25b","year":2022},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:51.294799Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:ab199337a0f925417a6d913fdb99253adba60506209a6c2b85148cdbd4fdefc4","observation_id":"18847069-32b1-4364-aee1-77751cd6bdd9","resolution":{"observed_at":"2026-08-07T13:35:54.549056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:54.277471Z","title":"A provably-efficient model-free algorithm for infinite-horizon average-reward constrained markov decision processes","venue":null,"work_id":"d9fb71fa-c2d0-4657-a6ad-67ac7f12a61f","year":2022},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:51.366080Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:df768826ad53265375d28a0b3986f35cfc9462ef8d0ca32feca39a2f93ca114c","observation_id":"ac158d50-b7f6-4f0d-928e-2102d5c876fb","resolution":{"observed_at":"2026-08-07T13:35:54.348961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:54.071119Z","title":"Provably efficient model-free algorithms for non-stationary CMDP s","venue":null,"work_id":"656fe4c3-6e27-4277-966a-321f786de311","year":2023},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:51.499356Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:c377feecba85c6e090cb6895d8ad4791224efa371c8cd0e551d12652b71f75f4","observation_id":"10b44870-fe67-4b09-aa82-f812732727e1","resolution":{"observed_at":"2026-08-07T13:35:54.171541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:53.865210Z","title":null,"venue":null,"work_id":"d1551b66-bd56-4781-99e1-47664e1d570c","year":2020},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:51.570309Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:8bff2be530c09fecb9fd2eb5132cf11d129ffa98d2c88c7973dc87de1aa36828","observation_id":"531160d9-5088-45ee-a051-a9a4dcc157ab","resolution":{"observed_at":"2026-08-07T13:35:53.960811Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:53.650305Z","title":"and Ugot, O.-A","venue":null,"work_id":"19369051-3a85-468e-b62b-90b3845b1dc9","year":2020},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:51.668145Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:6af904f4a4eb61a727cce1ce0db61ee0e087513a32afdd4de77d91b78067b2bd","observation_id":"42c9f1b7-449e-4905-b842-e43a45cd2e29","resolution":{"observed_at":"2026-08-07T13:35:53.728331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T03:52:43.737009Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":10,"verified_exact":6,"verified_fuzzy":21},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2505.21841."}