{"as_of":"2026-08-17T16:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f406490c356f80a13578209ed37960c13fb008f159f06b12b5fe017ab25e3296","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:16:04.170613Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.16415/citation-record","integrity":"/paper/2504.16415/integrity","json":"/paper/2504.16415/citation-record.json","paper":"/paper/2504.16415"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:03.948118Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:03.948118Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:92faccc615742db0b9da3f89678267440b8f58dcd442cfa52cb28f29102416fe","observation_id":"653de7a0-e14a-4d30-a844-79114d016b31","resolution":{"observed_at":"2026-08-16T11:16:03.948118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.904116Z","title":"M., Lee, J","venue":null,"work_id":"de1638f8-a4a0-4a3e-95c9-963748451593","year":2021},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:03.953166Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:0ed06e75f0ad37ec1262996ad1b30cf13ae3fe97e8d05c31596da8c597774f94","observation_id":"ca2878ab-e549-467a-8b06-6bd76f9bb7c8","resolution":{"observed_at":"2026-08-16T11:16:04.907969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.892945Z","title":"U., and Aggarwal, V","venue":null,"work_id":"41c96cf3-8c8c-4947-a69e-379f6f9e9fa7","year":2024},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:03.957028Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:a4b8d57a012709e9c9af436936f466f21f03c0dbd8f82df82353f3b468bc44b5","observation_id":"93917d66-04eb-49ce-8e98-a9e3f8e805b4","resolution":{"observed_at":"2026-08-16T11:16:04.896660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:03.961027Z","title":"First-order methods in optimization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:03.961027Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:7fdc513140d64138bf0a9161e91d002b9fed4150738a61260452e41ca571cc49","observation_id":"c4622e78-580e-4ef6-bc66-5a57b67e4a53","resolution":{"observed_at":"2026-08-16T11:16:03.961027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.875532Z","title":"Stochastic multi-armed-bandit problem with non-stationary rewards","venue":null,"work_id":"14cc2fe3-67b1-41f2-a9fa-9234ffcfe8f2","year":2014},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:03.964686Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:e739913c2f53b83ab0f0a2d26e9cefb4977525941a3dec5869be17d0a7611fed","observation_id":"b8b4b070-4b30-47ad-8c5e-97c0be17014c","resolution":{"observed_at":"2026-08-16T11:16:04.879255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.864702Z","title":"S., Ghavamzadeh, M., and Lee, M","venue":null,"work_id":"5359a364-9bd5-4731-a9b9-a9092306af93","year":2009},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:03.968267Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:53fa3efdde540e93ec7e6b0fc2f914a6b2938d409a983f00f86609d92b85b2c6","observation_id":"dcaceccf-a89b-488c-aa53-53760d493ceb","resolution":{"observed_at":"2026-08-16T11:16:04.868979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.851497Z","title":"Regret analysis of stochastic and nonstochastic multi-armed bandit problems","venue":null,"work_id":"e976b178-0701-4b69-97a7-3b6bf18f5817","year":2012},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:03.972827Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:cdf8bc4d9719bd20566ef933df7e0a67f5475c2da3e436551b18203bcebe057d","observation_id":"e11a1424-fac8-4ed4-af34-327cebf3369a","resolution":{"observed_at":"2026-08-16T11:16:04.856558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.838868Z","title":"Fast global convergence of natural policy gradient methods with entropy regularization","venue":null,"work_id":"4bf805d3-5908-4e1f-80fc-126fe8b01839","year":2022},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:03.977907Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:c8f5b4b7c36a128046dba5e2f214f8a8ef0a2536eb6ed8c8116d79162c9338e6","observation_id":"94b9d0e9-78b0-4e12-881a-09704368f686","resolution":{"observed_at":"2026-08-16T11:16:04.843310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.826132Z","title":"Optimizing for the future in non-stationary mdps","venue":null,"work_id":"01fe77cb-7699-4d65-baf9-834c73d772e0","year":2020},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:03.982030Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:2f5dbb79bfbcc2334637d6960191fd88e2cb7976991c1791924e7190b54697ec","observation_id":"b8489771-fe9f-4d25-94fe-812dc81e94fa","resolution":{"observed_at":"2026-08-16T11:16:04.830462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.812989Z","title":"Stabilizing reinforcement learning in dynamic environment with application to online recommendation","venue":null,"work_id":"18c0d898-e622-4f9b-8bc9-11d7c9a52584","year":2018},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:03.985559Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:37564c15fd6c0537dc8fcbc2dc49db6963099ede701d786b6fe0da1ea97c7773","observation_id":"1676c12f-fb0f-4024-b1f2-2becc8f34351","resolution":{"observed_at":"2026-08-16T11:16:04.817636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.801336Z","title":"and Zhao, L","venue":null,"work_id":"335c9ed6-ddd4-4353-91dc-d35209abe95c","year":2023},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:03.989285Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:da329cb4632fc7725a8b70df4cbc97916ed5e54d3d1362b5541ac47a52d6ef90","observation_id":"4ac1d03a-6728-4324-918d-4e140bdeb12d","resolution":{"observed_at":"2026-08-16T11:16:04.805055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.789846Z","title":"C., Simchi-Levi, D., and Zhu, R","venue":null,"work_id":"51a61c61-70c1-4a1c-b88a-d749dfa3e98c","year":2019},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:03.993078Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:0f2fed59f30168eeec7257b1e5a058b5ff2e5d79395bcd59e5ca7b36ad25cc28","observation_id":"3f1ef721-8f11-483f-853b-a48936e43dce","resolution":{"observed_at":"2026-08-16T11:16:04.793923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.779122Z","title":"C., Simchi-Levi, D., and Zhu, R","venue":null,"work_id":"823de3c5-3c1a-49db-b10c-580f1b92b90a","year":2020},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:03.996510Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:3090be704f6a1b8f13659f1ea9cc193e5a442fe22080f3f7020caabe4d3d20a5","observation_id":"85046599-b60b-49c4-ba6e-2e3e49c817e6","resolution":{"observed_at":"2026-08-16T11:16:04.782754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.765965Z","title":"C., Simchi-Levi, D., and Zhu, R","venue":null,"work_id":"82bd00ca-cdc5-4356-83e0-8ca584a5abf8","year":2023},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.000031Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:5b8af14db79cad9cff6304ae2989d35d718da063883b8359eba4d0c92eec54fd","observation_id":"24689d8c-b7d8-492a-821f-96c1c02e42a6","resolution":{"observed_at":"2026-08-16T11:16:04.770734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.753169Z","title":"A kernel-based approach to non-stationary reinforcement learning in metric spaces","venue":null,"work_id":"807fd7fc-516c-40a1-961b-cc0ec5ed0798","year":2021},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.003317Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:52bd6721655e3647ad6e2065ec7f27109515b186c6e4f9ad98759d065cd60d66","observation_id":"ef86e6ac-8325-4271-913e-b48613ffe31c","resolution":{"observed_at":"2026-08-16T11:16:04.757771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.740889Z","title":"M., and Mansour, Y","venue":null,"work_id":"7f85502a-a1cb-4ca1-834e-d3030cb73d47","year":2009},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.006825Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:e809ec64436dcbbe409df7b493e7fb6756a6dcef64ea4448fead5cb6f93d2eca","observation_id":"207f88a5-a57e-4d80-8411-061ad28e0c8c","resolution":{"observed_at":"2026-08-16T11:16:04.744455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.726330Z","title":"Dynamic regret of policy optimization in non-stationary environments","venue":null,"work_id":"4aa9b3bb-b95f-4397-83cb-a046e3357774","year":2020},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.010119Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:872a8264d3580ce88a75ff97b6ab402234c8db29d45c602e9bfdbc9bee9d45e6","observation_id":"c201b2fe-8135-476a-891f-74025763357b","resolution":{"observed_at":"2026-08-16T11:16:04.732565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.710987Z","title":"Non-stationary reinforcement learning under general function approximation","venue":null,"work_id":"00f40b6e-e0ba-472e-b51e-bb3064f28598","year":2023},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.013406Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:4f830ab7a7c27eb3107b6a66aaf87f4358a471d1af6bd8b07b25006c41999d56","observation_id":"18ed8316-7435-4fe5-968f-26ddfac355b2","resolution":{"observed_at":"2026-08-16T11:16:04.715426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.697734Z","title":"A sliding-window algorithm for markov decision processes with arbitrarily changing rewards and transitions, 2018","venue":null,"work_id":"3d63f736-0b7c-42e4-a733-f6bc9cd200b8","year":2018},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.016639Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:4c42cbee8c6af4f39f677a971d93254bdd89a1ee67332a1afc46837b7e68fd7a","observation_id":"2cd4f8d5-c7b2-4f18-9148-9aa8005410d1","resolution":{"observed_at":"2026-08-16T11:16:04.702291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"0805.3415","last_updated":"2008-05-22T09:18:44Z","snapshot_observed_at":"2026-08-16T18:59:25.396218Z","submitted_at":"2008-05-22T09:18:44Z","title":"On Upper-Confidence Bound Policies for Non-Stationary Bandit Problems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"0805.3415","snapshot_observed_at":"2026-08-16T11:16:04.020144Z","title":"and Moulines, E","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.020144Z"},"links":{"cited_paper":"/paper/0805.3415","citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:205bfeb80df9d4edc0ad02ebe20e7e4944fc06cd74428d550dd7f5ec249290a9","observation_id":"a1f95f88-4cb7-4d29-bcea-79402c0638f2","resolution":{"observed_at":"2026-08-16T11:16:04.020144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05826","last_updated":"2021-09-22T08:03:34Z","snapshot_observed_at":"2026-08-14T17:04:44.192829Z","submitted_at":"2020-06-10T13:26:31Z","title":"Transient Non-Stationarity and Generalisation in Deep Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.05826","snapshot_observed_at":"2026-08-16T11:16:04.023886Z","title":"Transient non-stationarity and generalisation in deep reinforcement learning","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.023886Z"},"links":{"cited_paper":"/paper/2006.05826","citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:87e0b4f8db915ee58e5680991ab0d096533980bd730b15f147b9ebd430566839","observation_id":"7444774b-c490-49f7-aaaf-9a767560eb1f","resolution":{"observed_at":"2026-08-16T11:16:04.023886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.685005Z","title":"Near-optimal regret bounds for reinforcement learning","venue":null,"work_id":"df6441d0-49e5-4c2c-9ddf-0df1e472b404","year":2010},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.027462Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:4c6955bda1527da1de8165b6b37e754a0c71d69d0479ec021324f4ad98e5fd2f","observation_id":"80a783cc-88cd-4381-84ea-1d15b75b8b8c","resolution":{"observed_at":"2026-08-16T11:16:04.689556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.672667Z","title":"Efficient reinforcement learning for routing jobs in heterogeneous queueing systems","venue":null,"work_id":"ffa08eaf-3e97-4676-a0ec-6d179dda0ef8","year":2024},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.031248Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:a68944e52e5588d86286b39bd52ec0f04a45cfde720701dbaa53308c2bdf1916","observation_id":"a950b67b-098c-4223-82f4-d8ccde3256a1","resolution":{"observed_at":"2026-08-16T11:16:04.676827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.660076Z","title":null,"venue":null,"work_id":"a91989cf-1c20-42ab-a61a-1b8c2c570e16","year":2023},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.034636Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:5979d436818d622feca90201bf310e419f11698dd288f20ded149a71fb1aac74","observation_id":"94ac8006-84f1-4ffe-89ca-0fdd2be74acf","resolution":{"observed_at":"2026-08-16T11:16:04.664726Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.645021Z","title":"and Qian, P","venue":null,"work_id":"c5d221cc-9800-482c-a404-c98a65c10206","year":2024},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.038113Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:c05a0fbe5a681f53b31b137da29a46916075e0b539821bcd4ee6e230ab671f19","observation_id":"6615cda7-1c04-45a2-b2d9-8ba0e1b443be","resolution":{"observed_at":"2026-08-16T11:16:04.651057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.041523Z","title":"Towards continual reinforcement learning: A review and perspectives","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.041523Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:84103506a37984825996e881287f575cdcfb990e11e78ed55fa2319a029932a9","observation_id":"eeeb929f-f14a-4ae9-ae11-9f6b52eda3b4","resolution":{"observed_at":"2026-08-16T11:16:04.041523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.624485Z","title":"R., Varma, S","venue":null,"work_id":"ec48fa6e-f039-4950-8f92-5f381412ceab","year":2021},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.045034Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:02f8d2f21a5f590ac400ad809c6d5c6614aaa736e6aab64c07ff9fc141f55c73","observation_id":"ec2f33a2-8e55-4d43-8873-7adaaf4d9deb","resolution":{"observed_at":"2026-08-16T11:16:04.628726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.610317Z","title":"T., Romberg, J., and Maguluri, S","venue":null,"work_id":"118a9217-bfa5-414c-8694-7d012257709c","year":2022},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.048824Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:54878521355b45d8da57aba400f4b8c504816dcf6432b8e3137448919807e138","observation_id":"f71f109a-8aa0-4ed3-a96a-09d665fa23b5","resolution":{"observed_at":"2026-08-16T11:16:04.614699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.596856Z","title":null,"venue":null,"work_id":"e23a922d-d932-43d0-9192-330b5e57b400","year":2003},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.052793Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:af95845069e21da963ab056f43cc3974e2093b706939fef2f1a2d0262a198d1a","observation_id":"2923654e-62a3-433f-a4e0-a7a9239c85be","resolution":{"observed_at":"2026-08-16T11:16:04.601039Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.583384Z","title":"Improved regret bound and experience replay in regularized policy iteration","venue":null,"work_id":"f618d38f-d61e-476c-afa8-d2e027ab3080","year":2021},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.056203Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:7a131fad61b1355437413caa633b25830763caa45cd1da7867b7f2dcd0f50faa","observation_id":"c939c320-c385-424b-a86d-8883a306e65f","resolution":{"observed_at":"2026-08-16T11:16:04.588694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.570162Z","title":"and Rachelson, E","venue":null,"work_id":"b6f48c4c-1ae3-4c2a-a675-fb79d5b58452","year":2019},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.059581Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:dee15b719eca8b157dd5e72f31e00c4c4e68814223eb161fefc75b50e0e4e05b","observation_id":"3e2a53e9-02f4-47ac-a315-6d51d8646982","resolution":{"observed_at":"2026-08-16T11:16:04.575504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.558763Z","title":"Pausing policy learning in non-stationary reinforcement learning","venue":null,"work_id":"988570bb-e825-4613-a7a9-bee4e73d4b2b","year":2024},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.062965Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:5c849a53612248a504178b93199ead41f106240ed8bffaf9fc96bde9a04704bb","observation_id":"b373027a-0703-405c-88fe-b887980b8a9c","resolution":{"observed_at":"2026-08-16T11:16:04.562565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.545827Z","title":"Rl-qn: A reinforcement learning framework for optimal control of queueing systems","venue":null,"work_id":"62d41a28-162b-4840-b462-91cfb5c871b7","year":2022},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.066666Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:0bc74d862e4c0e7526958944bfcd82ecf5de6005b3270359bd75614587faf7df","observation_id":"1c993825-9e01-4eda-aa3b-696f9a48ed80","resolution":{"observed_at":"2026-08-16T11:16:04.551164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12202","last_updated":"2023-07-28T07:50:22Z","snapshot_observed_at":"2026-08-17T11:53:55.043247Z","submitted_at":"2023-02-23T17:55:11Z","title":"A Definition of Non-Stationary Bandits","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12202","snapshot_observed_at":"2026-08-16T11:16:04.069961Z","title":"A definition of non-stationary bandits","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.069961Z"},"links":{"cited_paper":"/paper/2302.12202","citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:22fb66649ec20e3c3e30ff2349b39dfda74865d2b11a4f09c82fcabdf33b1b72","observation_id":"7bc2e48e-317b-48d7-82ac-eef77431d013","resolution":{"observed_at":"2026-08-16T11:16:04.069961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.534572Z","title":"Nonstationary bandit learning via predictive sampling","venue":null,"work_id":"73e7acc8-295f-4938-ad01-e44c8988f8bc","year":2023},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.073909Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:8841308c4b8f14d5ed946c77e211c6b1d7f9740c16656356532e781a06a6814d","observation_id":"96129abb-a2ab-488b-9a3a-a86e9ec7b14e","resolution":{"observed_at":"2026-08-16T11:16:04.538438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.523206Z","title":"Average reward reinforcement learning: Foundations, algorithms, and empirical results","venue":null,"work_id":"227087fd-a32f-4477-9229-1f707734b626","year":1996},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.078377Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:820543d972c5c37a0b7952a6f65ffb1128e0e7abd1b2149901fc6d3791829df3","observation_id":"fa0791ca-66de-4294-b7d7-95b4148e8c84","resolution":{"observed_at":"2026-08-16T11:16:04.527413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.509924Z","title":"Model-free nonstationary reinforcement learning: Near-optimal regret and applications in multiagent reinforcement learning and inventory control","venue":null,"work_id":"91d1c57a-2b42-4ea4-8fda-d669a968efea","year":2024},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.082744Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:80e1582d3f03749f8d2b4d9f7f833bd9c3c816ccd9c09e58c1581c5031de30d1","observation_id":"3b38bb50-96f6-4444-9da8-efc50c204f34","resolution":{"observed_at":"2026-08-16T11:16:04.514105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.497158Z","title":"New insights and perspectives on the natural gradient method","venue":null,"work_id":"36b4b7b9-0904-480f-96e1-328a4e818e78","year":2020},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.087368Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:259886cab8aaba8189f60a8ed37a5fb1d6e4171a0640eab6bd256a16fc88f89e","observation_id":"7c4e1aa2-4ae1-4cfd-8133-12f97bc87932","resolution":{"observed_at":"2026-08-16T11:16:04.501063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.485067Z","title":null,"venue":null,"work_id":"19cab516-a72b-4c7d-9e3d-cb66fb248e7a","year":2005},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.091564Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:076082fff6c11a555ed11471380d82396e5575fe82941a1097f7f56a4e23f4a7","observation_id":"f9fd8b3d-866e-48f3-aea2-a2e05a6eed6d","resolution":{"observed_at":"2026-08-16T11:16:04.488647Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.473631Z","title":"and Srikant, R","venue":null,"work_id":"cc47221d-b21e-494c-ac97-79b529445066","year":2023},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.095137Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:ce76e0ebc0724d66b63e3b1371d59583acb7ce4204940d93bd36bddec9796119","observation_id":"64f089b1-aab5-4b53-a9fe-86759e30c5f5","resolution":{"observed_at":"2026-08-16T11:16:04.477406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.461069Z","title":"Performance bounds for policy-based average reward reinforcement learning algorithms","venue":null,"work_id":"eb7d19f9-ab44-448a-9370-5ed85090e1bc","year":2023},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.098637Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:c88ed0543fc2252b1a106d5716e65614af66a3fe242e48138e42b2e0df8dfa78","observation_id":"d8631203-b9e7-4f10-ae79-c455b2175960","resolution":{"observed_at":"2026-08-16T11:16:04.465214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.448578Z","title":"Bridging the gap between value and policy based reinforcement learning","venue":null,"work_id":"68050a03-f428-4009-9188-74f86e9083c7","year":2017},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.102009Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:a068632e2f47ebb1215c36a9f655dcac26edef1feb9a40a68a5c766836e4886d","observation_id":"e13e4eda-4d78-4a9e-90b6-7f579e8d7dd8","resolution":{"observed_at":"2026-08-16T11:16:04.452784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.436328Z","title":"Variational regret bounds for reinforcement learning","venue":null,"work_id":"6fc4880a-a86e-4418-8ae6-fc8f7ad7d6c8","year":2020},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.105527Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:5029cf81a4ebbb1aae1c5b379d3c58f5b91f1d9dde0c8e685d55cb16d2016f01","observation_id":"1c888d79-729b-481e-af21-e2e8af216279","resolution":{"observed_at":"2026-08-16T11:16:04.440305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.423257Z","title":"A survey of reinforcement learning algorithms for dynamically varying environments","venue":null,"work_id":"04d4f586-0f0c-40ed-b8af-ec1d2a2a54af","year":2021},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.109453Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:0d0f4b719ae9c50cfe3d8f493b3748001a51d3c033979eeab83b2077cdae061a","observation_id":"0c74fd38-3b86-46e4-b764-21e61e672db4","resolution":{"observed_at":"2026-08-16T11:16:04.428052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.408915Z","title":"and Papadimitriou, C","venue":null,"work_id":"3a8959b9-54b1-42f2-92ef-51e85cbe7bf5","year":2024},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.113199Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:10cc26251ec7c7cf6107f8fd9712e78a03171024bed922ae055e4d45350f2e0c","observation_id":"7cc4bef4-0572-4bc7-a6af-9ed68e9df8c2","resolution":{"observed_at":"2026-08-16T11:16:04.413135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.396742Z","title":"Reinforcement learning for humanoid robotics","venue":null,"work_id":"ccb6e285-3c4f-487b-b6fc-a0b204c42681","year":2003},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.117009Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:3df1b045c7d252ad18abe6b6a6b799b5e218db1aa5e4ac922a419cff11f3bcf4","observation_id":"92027896-4a5b-4ed7-91e8-dc88be160dbe","resolution":{"observed_at":"2026-08-16T11:16:04.400798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.120637Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.120637Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:e61867d924ce0c1d9eaa59114b1bbcc7da8fd5fd5bd1d4cc049c3127c67634f2","observation_id":"de98ca8f-217c-48db-8cd9-5e3ca019b59e","resolution":{"observed_at":"2026-08-16T11:16:04.120637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.09727","last_updated":"2017-07-31T05:46:39Z","snapshot_observed_at":"2026-08-14T20:44:19.342054Z","submitted_at":"2017-07-31T05:46:39Z","title":"Taming Non-stationary Bandits: A Bayesian Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.09727","snapshot_observed_at":"2026-08-16T11:16:04.124835Z","title":"and Kalyani, S","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.124835Z"},"links":{"cited_paper":"/paper/1707.09727","citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:553b2651fe7667c777cd07590a155fca945422e1d82deb411de2e265924f62a3","observation_id":"12bbe108-bada-4cc1-be69-f1a3ae9ba9e0","resolution":{"observed_at":"2026-08-16T11:16:04.124835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.377189Z","title":null,"venue":null,"work_id":"2341cb02-a6a2-431c-8cdd-2eefbad70ba1","year":2018},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.129502Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:b6ec7216f0698d039ef157d5d2c47fceb879359d37ae586928402432284f1e17","observation_id":"0b1eae28-da1a-457a-badc-0404906eb8a7","resolution":{"observed_at":"2026-08-16T11:16:04.381015Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.366178Z","title":"S., McAllester, D., Singh, S., and Mansour, Y","venue":null,"work_id":"b0045033-cb4e-4a56-9a29-306ededc4fbe","year":1999},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.133253Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:c432efd4b6716f0355c58224856afb231e83e13d0478d1fe37ce46915e88d9d9","observation_id":"9f6fd08f-133a-43e5-8029-9d32cbd1cfcf","resolution":{"observed_at":"2026-08-16T11:16:04.369819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.12870","last_updated":"2021-12-27T14:22:39Z","snapshot_observed_at":"2026-08-16T19:10:55.865259Z","submitted_at":"2020-10-24T11:02:45Z","title":"Efficient Learning in Non-Stationary Linear Markov Decision Processes","version":3},"cited_work":{"arxiv_id":"2010.12870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.12870","snapshot_observed_at":"2026-08-16T11:16:04.217360Z","title":"Efficient Learning in Non-Stationary Linear Markov Decision Processes","venue":"cs.LG","work_id":"c1c6702f-8734-49e4-a553-e69f77eb7b15","year":2020},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.136748Z"},"links":{"cited_paper":"/paper/2010.12870","citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:679764dc3883a119cfdaf692d633c5b688733057149f66a9715ecdf565d868e0","observation_id":"07f8b68d-865c-44b6-a5a9-c4a505f98284","resolution":{"observed_at":"2026-08-16T11:16:04.223437Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.353197Z","title":"Non-asymptotic analysis for single-loop ( N atural) actor-critic with compatible function approximation","venue":null,"work_id":"c7527c81-ff02-46e5-875d-f4f108c1aaad","year":2024},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.143651Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:69dca1abf0eef41f4ad619a7605a887992716d3a3cd230985fe0801b51576cd8","observation_id":"609a6bef-86e7-4ab2-b128-633b6fc78cab","resolution":{"observed_at":"2026-08-16T11:16:04.358298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.341330Z","title":"and Luo, H","venue":null,"work_id":"419ff038-f287-40a9-b46c-75fdd7e53050","year":2021},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.147668Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:0183de8b098f044ee6cc016b185b39c3e422908cc7e490571dc5fb48c78ac4f7","observation_id":"6bbed65e-980d-4ddb-80f2-b7a6683b5676","resolution":{"observed_at":"2026-08-16T11:16:04.345302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.328469Z","title":"F., Zhang, W., Xu, P., and Gu, Q","venue":null,"work_id":"1dd6ca36-f53e-4111-aa3c-12471f1b5b04","year":2020},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.151138Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:bf52f3f6e0497efbf1403cf97fcf3c2fa3a0c36e3972c4ad4d0cf8180aa4a0bd","observation_id":"38c9fcba-22e8-40c3-8b8f-b6b677a123cf","resolution":{"observed_at":"2026-08-16T11:16:04.332643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.316333Z","title":"M., Golmohammadi, A., Shi, Y., et al","venue":null,"work_id":"dde0f2e9-db6e-4c3c-acbe-7d104c4a77af","year":2024},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.155857Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:8f827cf376e1225c15bfaae1423bfed474722f464a5b274d270579e61fe59b42","observation_id":"12087280-777f-4d97-8e43-0fc39d8cad9a","resolution":{"observed_at":"2026-08-16T11:16:04.320024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.300918Z","title":"Multi-agent reinforcement learning: A selective overview of theories and algorithms","venue":null,"work_id":"d2665ee6-8121-4475-ac09-c069cd53f156","year":2021},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.159451Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:a46c5bfd01dbfccf798212862fce64272878858230e347514be3b1083c0acf14","observation_id":"855a2975-1c4f-4ce8-97d8-4a99ce175245","resolution":{"observed_at":"2026-08-16T11:16:04.306025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.287592Z","title":null,"venue":null,"work_id":"473f17fa-9944-4219-9729-56eef28c23ca","year":2021},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.162985Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:8deb8eba960587dce9bca5715a4298fd078bba22881328aba18f2bd6944186f0","observation_id":"fc320535-15a3-44f1-b4ee-59dfacc79af9","resolution":{"observed_at":"2026-08-16T11:16:04.292073Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04244","last_updated":"2024-04-13T06:52:10Z","snapshot_observed_at":"2026-08-17T15:21:39.018951Z","submitted_at":"2020-10-08T20:07:44Z","title":"Nonstationary Reinforcement Learning with Linear Function Approximation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04244","snapshot_observed_at":"2026-08-16T11:16:04.166805Z","title":"R., and Jagmohan, A","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.166805Z"},"links":{"cited_paper":"/paper/2010.04244","citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:e17ac5b2b2eb86b8788e8aa1b10a5041e67fa75a58fc3a4611e6b940a9575cd3","observation_id":"0f857b11-1235-487a-af37-095c7afe56d3","resolution":{"observed_at":"2026-08-16T11:16:04.166805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:04.275810Z","title":"Finite-sample analysis for sarsa with linear function approximation","venue":null,"work_id":"3d8cda55-3a37-4c61-ac6b-d2bbd122c8d6","year":2019},"citing_paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-16T11:16:04.170613Z"},"links":{"citing_paper":"/paper/2504.16415"},"observation_digest":"sha256:573be41dc28a2de36d6c898e48d0639b783e745345dbb5efedc29fb84dd00187","observation_id":"01959a49-5c02-454e-9b45-0d99969c0422","resolution":{"observed_at":"2026-08-16T11:16:04.279920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.16415","last_updated":"2025-04-23T04:37:26Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T11:02:00.582076Z","submitted_at":"2025-04-23T04:37:26Z","title":"Natural Policy Gradient for Average Reward Non-Stationary RL"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":1,"verified_fuzzy":44},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2504.16415."}