{"as_of":"2026-08-18T00:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d83e6f82f868d0d1ff63759c19eb2796f865fa17ddde4970cdff3aa6d60a5c1a","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:22:57.874474Z","state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:07:17.743225Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-15T15:07:18.042953Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.22854","last_updated":"2026-07-16T17:57:33Z","snapshot_observed_at":"2026-08-16T17:42:05.729524Z","submitted_at":"2025-07-30T17:24:23Z","title":"A Bit of Freedom Goes a Long Way: Classical and Quantum Algorithms for Reinforcement Learning under a Generative Model","version":3},"cited_work":{"arxiv_id":"2507.22854","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.22854","snapshot_observed_at":"2026-08-15T15:07:18.042953Z","title":"A Bit of Freedom Goes a Long Way: Classical and Quantum Algorithms for Reinforcement Learning under a Generative Model","venue":"cs.LG","work_id":"bea88319-9ef2-4520-9f29-39f9a8260c29","year":2025},"citing_paper":{"arxiv_id":"2608.02826","last_updated":"2026-08-03T19:38:31Z","snapshot_observed_at":"2026-08-16T17:43:04.980750Z","submitted_at":"2026-08-03T19:38:31Z","title":"Improved Quantum Algorithms for Reinforcement Learning Under a Generative Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T15:07:17.743225Z"},"links":{"cited_paper":"/paper/2507.22854","citing_paper":"/paper/2608.02826"},"observation_digest":"sha256:954e968b8dd85f5b411e47045ba89b117977c0c50b4d5b53383c2384c0d832f2","observation_id":"73a7406c-769d-4718-a6bd-433367a55a14","resolution":{"observed_at":"2026-08-15T15:07:18.047918Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.22854/citation-record","integrity":"/paper/2507.22854/integrity","json":"/paper/2507.22854/citation-record.json","paper":"/paper/2507.22854"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:57.842621Z","title":"Markov decision processes with their applications , vol- ume 14","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2507.22854","last_updated":"2026-07-16T17:57:33Z","snapshot_observed_at":"2026-08-16T17:42:05.729524Z","submitted_at":"2025-07-30T17:24:23Z","title":"A Bit of Freedom Goes a Long Way: Classical and Quantum Algorithms for Reinforcement Learning under a Generative Model","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:57.842621Z"},"links":{"citing_paper":"/paper/2507.22854"},"observation_digest":"sha256:10a69010d0e32c563f534c225f019e6835c52b3c22d453a73a7f0f27740df7f0","observation_id":"75fe3cf3-5c90-4468-bd2e-87fc122f11db","resolution":{"observed_at":"2026-08-06T11:22:57.842621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07591","last_updated":"2026-05-30T18:39:29Z","snapshot_observed_at":"2026-08-16T15:08:27.309711Z","submitted_at":"2023-08-15T06:24:53Z","title":"Approximations and Learning for Continuous State and Action MDPs under Average Cost Criteria","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07591","snapshot_observed_at":"2026-08-06T11:22:57.846867Z","title":"Finite-sample convergence rates for Q-learning and indirect algorithms","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2507.22854","last_updated":"2026-07-16T17:57:33Z","snapshot_observed_at":"2026-08-16T17:42:05.729524Z","submitted_at":"2025-07-30T17:24:23Z","title":"A Bit of Freedom Goes a Long Way: Classical and Quantum Algorithms for Reinforcement Learning under a Generative Model","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:57.846867Z"},"links":{"cited_paper":"/paper/2308.07591","citing_paper":"/paper/2507.22854"},"observation_digest":"sha256:fa289a8cd7a986ec077b01f1edb4b8574a1279c44787d3edbf14bf87e05744a3","observation_id":"4818222d-efd6-4c52-9fad-972f49f8c88e","resolution":{"observed_at":"2026-08-06T11:22:57.846867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:58.097398Z","title":"Almost optimal model-free reinforce- ment learningvia reference-advantage decomposition","venue":null,"work_id":"38964328-a51f-41f4-a4b3-859d0ab9f292","year":2020},"citing_paper":{"arxiv_id":"2507.22854","last_updated":"2026-07-16T17:57:33Z","snapshot_observed_at":"2026-08-16T17:42:05.729524Z","submitted_at":"2025-07-30T17:24:23Z","title":"A Bit of Freedom Goes a Long Way: Classical and Quantum Algorithms for Reinforcement Learning under a Generative Model","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:57.874474Z"},"links":{"citing_paper":"/paper/2507.22854"},"observation_digest":"sha256:caa11e9326b96542031d2edb644037dd8ada95e12363d503b1f5ecb85c183f20","observation_id":"de05e2e0-113e-441b-9c5e-e193260455b9","resolution":{"observed_at":"2026-08-06T11:22:58.102079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"quant-ph/9607014","last_updated":"1999-01-07T16:50:45Z","snapshot_observed_at":"2026-08-12T22:54:40.402900Z","submitted_at":"1996-07-18T19:12:42Z","title":"A Quantum Algorithm for Finding the Minimum","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"quant-ph/9607014","snapshot_observed_at":"2026-08-06T11:22:57.829026Z","title":"Approximate policy iteration: A survey and some new meth- ods","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.22854","last_updated":"2026-07-16T17:57:33Z","snapshot_observed_at":"2026-08-16T17:42:05.729524Z","submitted_at":"2025-07-30T17:24:23Z","title":"A Bit of Freedom Goes a Long Way: Classical and Quantum Algorithms for Reinforcement Learning under a Generative Model","version":3},"reference_index":1998,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:57.829026Z"},"links":{"cited_paper":"/paper/quant-ph/9607014","citing_paper":"/paper/2507.22854"},"observation_digest":"sha256:183a4403b88ea1be3a3d5c4f8c284c151c0c6a5d3a324eb37b0f217dfbb0ae48","observation_id":"67e72fbd-9ef6-47f6-9b05-2f1f3fffb0e4","resolution":{"observed_at":"2026-08-06T11:22:57.829026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.05456","last_updated":"2020-07-10T15:52:21Z","snapshot_observed_at":"2026-08-16T00:36:38.032362Z","submitted_at":"2020-07-10T15:52:21Z","title":"Improved Analysis of UCRL2 with Empirical Bernstein Inequality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.05456","snapshot_observed_at":"2026-08-06T11:22:57.833805Z","title":"Tight regret bounds for model-based reinforcement learning with greedy policies","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.22854","last_updated":"2026-07-16T17:57:33Z","snapshot_observed_at":"2026-08-16T17:42:05.729524Z","submitted_at":"2025-07-30T17:24:23Z","title":"A Bit of Freedom Goes a Long Way: Classical and Quantum Algorithms for Reinforcement Learning under a Generative Model","version":3},"reference_index":2005,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:57.833805Z"},"links":{"cited_paper":"/paper/2007.05456","citing_paper":"/paper/2507.22854"},"observation_digest":"sha256:a7f56b92cdd7ae69420e54a52e751cda4f482dda9b03bcec90c469791272de63","observation_id":"18e15db9-9115-45ca-9938-caa8c5ed36a4","resolution":{"observed_at":"2026-08-06T11:22:57.833805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:58.186115Z","title":"Minimax regret bounds for reinforcement learning","venue":null,"work_id":"7897388e-10bc-4eb7-8dab-32a8f2d5c941","year":null},"citing_paper":{"arxiv_id":"2507.22854","last_updated":"2026-07-16T17:57:33Z","snapshot_observed_at":"2026-08-16T17:42:05.729524Z","submitted_at":"2025-07-30T17:24:23Z","title":"A Bit of Freedom Goes a Long Way: Classical and Quantum Algorithms for Reinforcement Learning under a Generative Model","version":3},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:57.819860Z"},"links":{"citing_paper":"/paper/2507.22854"},"observation_digest":"sha256:b32063686067f537282bf95fee65bf1605b80cbefb40d316e5a89a58df2fd962","observation_id":"ab7710d8-836a-4d91-a4b9-2db33c708e67","resolution":{"observed_at":"2026-08-06T11:22:58.190660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:58.200073Z","title":"Logarithmic online regret bounds for undiscounted reinforcement learning","venue":null,"work_id":"6af11b1e-cf0d-434f-a70a-13d5d3b86a2e","year":null},"citing_paper":{"arxiv_id":"2507.22854","last_updated":"2026-07-16T17:57:33Z","snapshot_observed_at":"2026-08-16T17:42:05.729524Z","submitted_at":"2025-07-30T17:24:23Z","title":"A Bit of Freedom Goes a Long Way: Classical and Quantum Algorithms for Reinforcement Learning under a Generative Model","version":3},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:57.815098Z"},"links":{"citing_paper":"/paper/2507.22854"},"observation_digest":"sha256:c345c314f08403554a81e43ed44e14ebfd6bdf9622abbe5d1c4eec65e7f2bd5a","observation_id":"e68d45e1-769e-4625-98ba-b3e184298ee1","resolution":{"observed_at":"2026-08-06T11:22:58.204202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:58.213472Z","title":"Near-optimal regret bounds for reinforcement learning","venue":null,"work_id":"3d8be840-7606-4798-81fc-25c58844febc","year":null},"citing_paper":{"arxiv_id":"2507.22854","last_updated":"2026-07-16T17:57:33Z","snapshot_observed_at":"2026-08-16T17:42:05.729524Z","submitted_at":"2025-07-30T17:24:23Z","title":"A Bit of Freedom Goes a Long Way: Classical and Quantum Algorithms for Reinforcement Learning under a Generative Model","version":3},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:57.810526Z"},"links":{"citing_paper":"/paper/2507.22854"},"observation_digest":"sha256:06802079e213f512f848a9754655d60deb4e6c25d71300d80fe55dbe8e82a9a1","observation_id":"fd105edd-8c00-41f0-9eea-5e0d78751993","resolution":{"observed_at":"2026-08-06T11:22:58.217846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:58.141621Z","title":"Improved regret bounds for undiscounted continuous reinforcement learning","venue":null,"work_id":"50ee41f3-8d63-40a5-abb6-0d225d5f4ae4","year":2015},"citing_paper":{"arxiv_id":"2507.22854","last_updated":"2026-07-16T17:57:33Z","snapshot_observed_at":"2026-08-16T17:42:05.729524Z","submitted_at":"2025-07-30T17:24:23Z","title":"A Bit of Freedom Goes a Long Way: Classical and Quantum Algorithms for Reinforcement Learning under a Generative Model","version":3},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:57.852347Z"},"links":{"citing_paper":"/paper/2507.22854"},"observation_digest":"sha256:6ddaaeebfa724fd5e0adcc19d2ea4efb1743f481a38073141f8f6911233ae932","observation_id":"67ae80fc-2a13-42db-b016-b8c2233fdfb5","resolution":{"observed_at":"2026-08-06T11:22:58.146322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:58.171180Z","title":"Quantum probability oracles & multidimensional amplitude estimation","venue":null,"work_id":"a05c774d-a204-471c-9f63-4578f6043b3f","year":2021},"citing_paper":{"arxiv_id":"2507.22854","last_updated":"2026-07-16T17:57:33Z","snapshot_observed_at":"2026-08-16T17:42:05.729524Z","submitted_at":"2025-07-30T17:24:23Z","title":"A Bit of Freedom Goes a Long Way: Classical and Quantum Algorithms for Reinforcement Learning under a Generative Model","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:57.824455Z"},"links":{"citing_paper":"/paper/2507.22854"},"observation_digest":"sha256:513bb6844afb07070e171b624d317288a8eee55d38d704e93a6f3428dbd6f1b2","observation_id":"fcb39ba7-a87b-49a5-835d-76a1daa5cb04","resolution":{"observed_at":"2026-08-06T11:22:58.176021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:58.227580Z","title":"Dynamic policy programming","venue":null,"work_id":"fce6d357-8f05-4434-aee9-3652b08daa9f","year":null},"citing_paper":{"arxiv_id":"2507.22854","last_updated":"2026-07-16T17:57:33Z","snapshot_observed_at":"2026-08-16T17:42:05.729524Z","submitted_at":"2025-07-30T17:24:23Z","title":"A Bit of Freedom Goes a Long Way: Classical and Quantum Algorithms for Reinforcement Learning under a Generative Model","version":3},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:57.805142Z"},"links":{"citing_paper":"/paper/2507.22854"},"observation_digest":"sha256:1632ba6c21f7358e412a71181f95f218f12267fe3c8f1c4d10d3b9edd76054ee","observation_id":"0556d1d9-6889-41e9-b3d4-aaf336d63979","resolution":{"observed_at":"2026-08-06T11:22:58.231651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:58.156444Z","title":"Hernandez-Lerma","venue":null,"work_id":"0a52ebc7-a143-4ea1-a9de-0bd57b41b097","year":2001},"citing_paper":{"arxiv_id":"2507.22854","last_updated":"2026-07-16T17:57:33Z","snapshot_observed_at":"2026-08-16T17:42:05.729524Z","submitted_at":"2025-07-30T17:24:23Z","title":"A Bit of Freedom Goes a Long Way: Classical and Quantum Algorithms for Reinforcement Learning under a Generative Model","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:57.838527Z"},"links":{"citing_paper":"/paper/2507.22854"},"observation_digest":"sha256:a67b05f7a2ccf573ae112a816b172ccc7923ba72bbcc5462973c1cfe10008fd0","observation_id":"ed7c7f1b-2f63-4f6f-8943-36aa2379ada7","resolution":{"observed_at":"2026-08-06T11:22:58.160474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.00603","last_updated":"2022-12-01T15:57:58Z","snapshot_observed_at":"2026-08-16T16:11:42.655602Z","submitted_at":"2022-12-01T15:57:58Z","title":"Near Sample-Optimal Reduction-based Policy Learning for Average Reward MDP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.00603","snapshot_observed_at":"2026-08-06T11:22:57.865812Z","title":"Near sample-optimal reduction- based policy learning for average reward MDP","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22854","last_updated":"2026-07-16T17:57:33Z","snapshot_observed_at":"2026-08-16T17:42:05.729524Z","submitted_at":"2025-07-30T17:24:23Z","title":"A Bit of Freedom Goes a Long Way: Classical and Quantum Algorithms for Reinforcement Learning under a Generative Model","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:57.865812Z"},"links":{"cited_paper":"/paper/2212.00603","citing_paper":"/paper/2507.22854"},"observation_digest":"sha256:aaa7d6464df8c5f33272ef9830dedf9fc00e7116f23cb54e8a1dda2e87e93244","observation_id":"f54689f6-5d42-400b-a9bf-f0e1dfc99477","resolution":{"observed_at":"2026-08-06T11:22:57.865812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:58.112757Z","title":"Interactive value iteration for Markov decision processes with unknown rewards","venue":null,"work_id":"edd35719-4083-4a26-8c4a-54812e615e35","year":2013},"citing_paper":{"arxiv_id":"2507.22854","last_updated":"2026-07-16T17:57:33Z","snapshot_observed_at":"2026-08-16T17:42:05.729524Z","submitted_at":"2025-07-30T17:24:23Z","title":"A Bit of Freedom Goes a Long Way: Classical and Quantum Algorithms for Reinforcement Learning under a Generative Model","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:57.870544Z"},"links":{"citing_paper":"/paper/2507.22854"},"observation_digest":"sha256:5fa014247866153835bd4921d7a3bdd9860cc17eb8b578c2edfc1b8bfcba508a","observation_id":"b77448f8-06d7-44bd-b9a2-9dfae67d3fa4","resolution":{"observed_at":"2026-08-06T11:22:58.117270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:58.127556Z","title":"Learn- ing infinite-horizon average-reward MDPs with linear function approximation","venue":null,"work_id":"5127e830-d53d-4f75-aabf-4d7ab29e2711","year":2021},"citing_paper":{"arxiv_id":"2507.22854","last_updated":"2026-07-16T17:57:33Z","snapshot_observed_at":"2026-08-16T17:42:05.729524Z","submitted_at":"2025-07-30T17:24:23Z","title":"A Bit of Freedom Goes a Long Way: Classical and Quantum Algorithms for Reinforcement Learning under a Generative Model","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:57.861761Z"},"links":{"citing_paper":"/paper/2507.22854"},"observation_digest":"sha256:debaef2a97fc906bdadc049310a0832c445ad188756331c213c9f4a4ad0d606a","observation_id":"f4f8c309-e9e0-4570-b2c3-ad3751b2b498","resolution":{"observed_at":"2026-08-06T11:22:58.131921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04438","last_updated":"2025-07-06T15:52:37Z","snapshot_observed_at":"2026-08-16T10:14:01.553820Z","submitted_at":"2025-07-06T15:52:37Z","title":"Quantum Algorithms for Bandits with Knapsacks with Improved Regret and Time Complexities","version":1},"cited_work":{"arxiv_id":"2507.04438","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.04438","snapshot_observed_at":"2026-08-06T11:22:57.926875Z","title":"Quantum Algorithms for Bandits with Knapsacks with Improved Regret and Time Complexities","venue":"quant-ph","work_id":"e39e4709-a3cd-40c5-8b08-749897b4d802","year":2025},"citing_paper":{"arxiv_id":"2507.22854","last_updated":"2026-07-16T17:57:33Z","snapshot_observed_at":"2026-08-16T17:42:05.729524Z","submitted_at":"2025-07-30T17:24:23Z","title":"A Bit of Freedom Goes a Long Way: Classical and Quantum Algorithms for Reinforcement Learning under a Generative Model","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:57.856397Z"},"links":{"cited_paper":"/paper/2507.04438","citing_paper":"/paper/2507.22854"},"observation_digest":"sha256:954b4e6d110b368da1a0baf4bc724040f0ba5ec7af56b855df2ddd0e8a90e867","observation_id":"87020556-fd2f-4104-b40c-d19aa609a1d4","resolution":{"observed_at":"2026-08-06T11:22:57.934217Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.22854","last_updated":"2026-07-16T17:57:33Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T17:42:05.729524Z","submitted_at":"2025-07-30T17:24:23Z","title":"A Bit of Freedom Goes a Long Way: Classical and Quantum Algorithms for Reinforcement Learning under a Generative Model"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":1,"verified_fuzzy":10},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 1 inbound Pith citation observation for arXiv:2507.22854."}