{"as_of":"2026-08-18T09:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d2cd993dc9ec8154e64910c3834438cb35eb5e7dd3ecc8184e3497c07d2f9960","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:42:09.234480Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.11997/citation-record","integrity":"/paper/2504.11997/integrity","json":"/paper/2504.11997/citation-record.json","paper":"/paper/2504.11997"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.616121Z","title":"Improved algorithms for linear stochastic bandits","venue":null,"work_id":"c86d0eef-cbe1-4890-9a9b-3e9eef557d64","year":2011},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-17T19:00:23.000015Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.136777Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:26c24dffad31ba1eb662681bad477fd634b1d3a540e9dec2edb690a58730f3b1","observation_id":"bf20c210-1e8f-4150-a5b6-21453d6537d1","resolution":{"observed_at":"2026-08-16T12:42:09.620630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.602444Z","title":"Near-opt imal regret bounds for reinforcement learn- ing","venue":null,"work_id":"464ca4a7-fa90-4ab3-87d6-617920ac68d2","year":2008},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-17T19:00:23.000015Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.141280Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:a236cb4e186d53e47315064ec059124b6b539d62922b0e9b074a4c34bd88f5b1","observation_id":"5f0c9a4d-d416-4a2a-9d54-0666df91980e","resolution":{"observed_at":"2026-08-16T12:42:09.607023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.588544Z","title":"Model-based reinforcement learning with value-targeted regression","venue":null,"work_id":"ac477998-16c5-44c3-87f7-713eb4692fb0","year":2020},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-17T19:00:23.000015Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.145088Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:797154a733c420a696c4b6910951acdc95c419b52b78d1183f0ef1e24d0eb4e4","observation_id":"1ea6fd89-cdc6-48f4-8e41-2abc1102bf37","resolution":{"observed_at":"2026-08-16T12:42:09.593152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.575714Z","title":"REGAL: a regularizati on based algorithm for reinforcement learn- ing in weakly communicating MDPs","venue":null,"work_id":"fca2e07b-76b2-46ac-853b-dd63938315b1","year":2009},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-17T19:00:23.000015Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.148984Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:c70d099b67831e9313f5f3d88f1620e34191f24db91525a8027ae35a6108fa29","observation_id":"002223ee-3be3-4914-972c-8bb3ae082ce9","resolution":{"observed_at":"2026-08-16T12:42:09.579572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.563388Z","title":"Learning Inﬁnite- Horizon Average-Reward Linear Mixture MDPs of Bounded Span","venue":null,"work_id":"1316fcf5-1668-4935-b141-25c3b1b21e59","year":2025},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-17T19:00:23.000015Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.153118Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:5272f56d259cac69cbe95bbc64a8b1ad24ac72a631da0fb3825abc3ee7ffa0e2","observation_id":"31c5fe95-e827-45d8-9aee-9d599ebdc74a","resolution":{"observed_at":"2026-08-16T12:42:09.567360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.550836Z","title":"Efﬁcient bias-span- constrained exploration-exploitation in reinforcement l earning","venue":null,"work_id":"ad2800cc-dd53-472d-bc91-93ddbf945eab","year":2018},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-17T19:00:23.000015Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.157133Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:2ed41a97ed7a74283080bc68873a109f830d34cde476586ea6866439add3cfd3","observation_id":"3c9707ba-a4c4-41bd-9b5b-39656b819037","resolution":{"observed_at":"2026-08-16T12:42:09.554902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.537952Z","title":"Inven tory management in supply chains: a re- inforcement learning approach","venue":null,"work_id":"c0012716-8d83-433d-b1c8-1d85c2d34ea5","year":2002},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-17T19:00:23.000015Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.161662Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:781e5b93091cab1f3f0382a48d0abb1bf8dba7595ddb0a3a03c07ae9b736c767","observation_id":"d93434ac-c213-49e1-85fb-85fb567db066","resolution":{"observed_at":"2026-08-16T12:42:09.542022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.524529Z","title":"Can deep reinforce- ment learning improve inventory management? performance o n lost sales, dual-sourcing, and multi- echelon problems","venue":null,"work_id":"11167bef-f1ab-4754-b79c-43478d2f7cc9","year":2022},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-17T19:00:23.000015Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.165411Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:1f71c01018a897d4f58052a85a3c0362d519a9bac387c645be96173b619707f3","observation_id":"4fda9f0f-7d61-40fc-a096-0838a5d95c09","resolution":{"observed_at":"2026-08-16T12:42:09.529036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.511503Z","title":"Reinforcement learning for long-run a verage cost","venue":null,"work_id":"c0c55f18-e475-4aab-b5b6-71da5a1e6ca2","year":2004},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-17T19:00:23.000015Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.168956Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:174bf81cdcfa4865d0b1002313b8fb1e47077b23a9c86ee60dacf3799b2d8af9","observation_id":"98eaf7ce-6c45-4b91-965b-db82a068ab8d","resolution":{"observed_at":"2026-08-16T12:42:09.515365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.498520Z","title":"Sample-efﬁ cient Learning of Inﬁnite-horizon Average-reward MDPs with General Function Approximation","venue":null,"work_id":"4b86694d-94f2-4e2e-85f5-7f13c5023b21","year":2024},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-17T19:00:23.000015Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.172453Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:ef217d2d05310094c74815b6512190c406dc0e113162ef90f4ea1a83f58d2974","observation_id":"a373189d-04ed-4aea-bb3f-17d2dc51226c","resolution":{"observed_at":"2026-08-16T12:42:09.502455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.485169Z","title":"Reinforcement Learn- ing for Inﬁnite-Horizon Average-Reward Linear MDPs via App roximation by Discounted-Reward MDPs","venue":null,"work_id":"6e23c4e9-d818-4c48-b2f5-85fb1d86a6f5","year":2025},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-17T19:00:23.000015Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.175983Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:d50bfb779b279a5ed4d034a07d592e8d2e9874b1068278e82d2388cd49211c11","observation_id":"24fdec2c-618e-4828-b6ce-4d8d17d54ab2","resolution":{"observed_at":"2026-08-16T12:42:09.489896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.471264Z","title":"Provably efﬁcient reinforcement learning with linear function approximation","venue":null,"work_id":"95f72676-f761-407e-a427-57d9e3b220a6","year":2020},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-17T19:00:23.000015Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.179550Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:9b09ed611ba125c455288a12f775a8d3bbdc6cc4b0fafe9fee14127337cb78c7","observation_id":"e391adbc-7cf0-4878-8159-94883c14b200","resolution":{"observed_at":"2026-08-16T12:42:09.475838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.457141Z","title":"Towards tight bounds on th e sample complexity of average-reward MDPs","venue":null,"work_id":"c2b26e2c-a3a5-4639-ba8b-65df2e0529e2","year":2021},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-17T19:00:23.000015Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.183813Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:c1ce3767b018bcc107b07c22643e23303850b84e60be9ab197af8b784fe08059","observation_id":"657a964b-9e31-40c9-b403-68f9bd3a29ce","resolution":{"observed_at":"2026-08-16T12:42:09.461767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.442202Z","title":"Reinforcement learning based routin g in networks: Review and classiﬁcation of approaches","venue":null,"work_id":"1b2b3328-c7fb-4a9b-a52b-3893e21da82d","year":2019},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-17T19:00:23.000015Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.187438Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:fb77c5c8e66e5e3806724d3c8bfc55c36478ed5b850ace2fe90818deddbdd804","observation_id":"cedffd33-f0b3-448f-8bf8-2e0fd7300a92","resolution":{"observed_at":"2026-08-16T12:42:09.446829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.427224Z","title":"Sample complexity of reinforcement learning using linearly combined model ensembles","venue":null,"work_id":"58458a39-9fe8-47f5-afd9-67bd9b22efa3","year":2020},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-17T19:00:23.000015Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.191051Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:657282d859fa11af983024861064ed588011e8c003154044a9a20afd14aa75a1","observation_id":"0c11398c-0252-4f53-9d54-307eef909972","resolution":{"observed_at":"2026-08-16T12:42:09.431697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.00603","last_updated":"2022-12-01T15:57:58Z","snapshot_observed_at":"2026-08-16T16:11:42.655602Z","submitted_at":"2022-12-01T15:57:58Z","title":"Near Sample-Optimal Reduction-based Policy Learning for Average Reward MDP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.00603","snapshot_observed_at":"2026-08-16T12:42:09.194938Z","title":"Near sample- optimal reduction-based policy learn- ing for average reward mdp","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-17T19:00:23.000015Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.194938Z"},"links":{"cited_paper":"/paper/2212.00603","citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:2f27ed47c349bf59165073e9cec49d3a80e37d51a5b93bf42ca7ac13b000fb6b","observation_id":"1dbf06e3-abd3-41d1-b432-3413b6dc6477","resolution":{"observed_at":"2026-08-16T12:42:09.194938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08833","last_updated":"2024-02-12T19:06:53Z","snapshot_observed_at":"2026-08-16T14:52:28.680908Z","submitted_at":"2023-10-13T03:08:59Z","title":"Optimal Sample Complexity for Average Reward Markov Decision Processes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08833","snapshot_observed_at":"2026-08-16T12:42:09.198958Z","title":"Optimal Sample Complexity for Average Reward Markov Decision Processes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-17T19:00:23.000015Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.198958Z"},"links":{"cited_paper":"/paper/2310.08833","citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:c33652bdd5b42086ce933c7bb9d63b573f327bb1a7c639bf037bfeebc8020937","observation_id":"217f2d16-2c1e-46c1-8c2e-141cdeb8a9cc","resolution":{"observed_at":"2026-08-16T12:42:09.198958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.412501Z","title":"Learning inﬁnite-horizon average-reward mdps with linear function approximation","venue":null,"work_id":"5e771773-fbea-41e9-8cdc-cec339bdab51","year":2021},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-17T19:00:23.000015Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.203038Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:26c6fb7cb27ff6c920fdb2a901189dce55c2b0867bbbb60479bc070e08bd3e60","observation_id":"67fd2d37-9401-4a37-83f0-86ede1737eaa","resolution":{"observed_at":"2026-08-16T12:42:09.417503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.398067Z","title":"Model-free reinforcement learning in inﬁnite-horizon average-rewar d markov decision processes","venue":null,"work_id":"b06659c5-3544-459c-b554-19250213fa1e","year":2020},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-17T19:00:23.000015Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.206780Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:651608a148f980ce9fcd7700410cd44c9713a02b17e6212bd2ebf20fc18eccbd","observation_id":"53a1d58c-2ca8-4d3b-b05c-fcaf71db6ffc","resolution":{"observed_at":"2026-08-16T12:42:09.402404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.384282Z","title":"Nearly minimax o ptimal regret for learning inﬁnite- horizon average-reward mdps with linear function approxim ation","venue":null,"work_id":"5022bdd1-4a21-49bd-a3bc-bef37936c561","year":2022},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-17T19:00:23.000015Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.210522Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:98aaa03d1105537f58c8062ed9fb340dddd1e83936c387dd88fbe2c680517650","observation_id":"d2731aac-4d0a-458c-b9a5-3e15acf4d278","resolution":{"observed_at":"2026-08-16T12:42:09.388691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.369599Z","title":"Joint optimiz ation of preventive maintenance and production scheduling for multi-state production systems based on reinforcement learning","venue":null,"work_id":"db380a97-7d3c-4b18-b2f7-28aeb0b63325","year":2021},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-17T19:00:23.000015Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.214369Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:eaa9db812fc0979e9eefb73702c0a73b2488374eee5d4eab328c435317afbd32","observation_id":"0345c7d6-3486-466a-958a-fabedd69edf8","resolution":{"observed_at":"2026-08-16T12:42:09.373977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.355852Z","title":"Regret minimization for reinforcement learning by evaluating the optimal bias function","venue":null,"work_id":"4b6d36e1-6bb2-4164-8063-e50f3c4abcc0","year":2019},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-17T19:00:23.000015Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.217863Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:07505d5f32cbf8146cb820292e23fd658c3c37e0293c03db7c538018b60ff47c","observation_id":"990b21e2-c469-466b-a0bc-df1453fd3a51","resolution":{"observed_at":"2026-08-16T12:42:09.360091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.341533Z","title":"Sharper Model-free Reinf orcement Learning for Average-reward Markov Decision Processes","venue":null,"work_id":"10644361-f5f1-4abf-a8b5-f8d2c3f4fc3a","year":2023},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-17T19:00:23.000015Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.221490Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:a70b69f360ec86d843750ed444bbc96542f516913f96671a3cc08c84ab6e9ec7","observation_id":"d57704ee-93b7-40f9-8cb2-ac9df73c03b4","resolution":{"observed_at":"2026-08-16T12:42:09.346138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13469","last_updated":"2024-03-19T18:24:43Z","snapshot_observed_at":"2026-08-18T04:14:42.921726Z","submitted_at":"2023-11-22T15:34:44Z","title":"Span-Based Optimal Sample Complexity for Average Reward MDPs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13469","snapshot_observed_at":"2026-08-16T12:42:09.225245Z","title":"Span-Based Optimal Sam ple Complexity for Average Reward MDPs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-17T19:00:23.000015Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.225245Z"},"links":{"cited_paper":"/paper/2311.13469","citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:09180bd82b21f0d875b18c0c711613e613875be187b4fd46adb69371360e9134","observation_id":"486aa4c3-e495-49a0-8ec6-1b840927354f","resolution":{"observed_at":"2026-08-16T12:42:09.225245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.325388Z","title":"If n is odd, we can take φ n = 0 and similar argument holds","venue":null,"work_id":"ef125c21-63ad-48a6-b66e-35f1bfb6405c","year":null},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-17T19:00:23.000015Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.229998Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:3d86483297b03d483e8a159d29025515618f819e04dc70a60ddaa2a27ec48b47","observation_id":"5c22267d-d48d-4aa0-9489-d9849a5e0a23","resolution":{"observed_at":"2026-08-16T12:42:09.331024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.309039Z","title":"By Lemma 6, we have for t≥ 4, Qt u(s, a)≤ r(s, a) + γ[P V t u+1](s, a) + 2β‖ϕ (s, a)‖Λ −1 t + 2(mt−3− mt)","venue":null,"work_id":"209354ba-87cc-498c-999a-83a45db31f4d","year":null},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-17T19:00:23.000015Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.234480Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:d68b0050a82814b09d1050a02496599154fe54c1c0d266e5488f4aafe383b4b3","observation_id":"f18c35c9-61d7-4e3d-be48-0c3248b617e2","resolution":{"observed_at":"2026-08-16T12:42:09.314883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T19:00:23.000015Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":0,"verified_fuzzy":23},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:2504.11997."}