{"as_of":"2026-08-15T14:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d611ea9d68aa50460d89d579da427e1ad800b292a60f6629b38b6506b995a8f2","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T05:47:47.782246Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T06:51:04.104314Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-06-28T23:12:46.704827Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.16132","snapshot_observed_at":"2026-08-03T18:18:59.262679Z","title":"A minimal-assumption analysis of q-learning with time-varying policies","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06244","last_updated":"2026-08-11T15:07:41Z","snapshot_observed_at":"2026-08-14T23:11:30.658193Z","submitted_at":"2025-12-06T02:04:50Z","title":"Auto-exploration for online reinforcement learning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T18:18:59.262679Z"},"links":{"cited_paper":"/paper/2510.16132","citing_paper":"/paper/2512.06244"},"observation_digest":"sha256:f6669526b52cab7ee31146ca1113354fbafbbf7d3aa5b97081b0fda31b4e75aa","observation_id":"3b08014c-0621-417b-acd6-e070e5b31058","resolution":{"observed_at":"2026-08-03T18:18:59.262679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.16132","snapshot_observed_at":"2026-08-04T06:51:04.104314Z","title":"A minimal-assumption analysis of q-learning with time-varying policies","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06244","last_updated":"2026-08-11T15:07:41Z","snapshot_observed_at":"2026-08-14T23:11:30.658193Z","submitted_at":"2025-12-06T02:04:50Z","title":"Auto-exploration for online reinforcement learning","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T06:51:04.104314Z"},"links":{"cited_paper":"/paper/2510.16132","citing_paper":"/paper/2512.06244"},"observation_digest":"sha256:f0f9aee1b479655daa822dd8a50c66693ef8f4cc8125db1fe3aa6828bfbfa799","observation_id":"cb299ed5-5f90-49d5-84a4-6ed886b883ac","resolution":{"observed_at":"2026-08-04T06:51:04.104314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"cited_work":{"arxiv_id":"2510.16132","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.16132","snapshot_observed_at":"2026-06-28T23:12:46.704827Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","venue":"cs.LG","work_id":"04efd2f8-8aa3-427c-909a-e9a7dbcc1016","year":2025},"citing_paper":{"arxiv_id":"2605.13639","last_updated":"2026-05-13T15:04:59Z","snapshot_observed_at":"2026-08-02T11:45:59.910042Z","submitted_at":"2026-05-13T15:04:59Z","title":"Achieving $\\epsilon^{-2}$ Sample Complexity for Single-Loop Actor-Critic under Minimal Assumptions","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-14T19:28:32.795407Z"},"links":{"cited_paper":"/paper/2510.16132","citing_paper":"/paper/2605.13639"},"observation_digest":"sha256:a678ce477040241b7c3492636d6389a4e7794d971bfd0644bcdb427ef6dac84c","observation_id":"1628a8a3-f589-4358-93ca-05282a1c6e37","resolution":{"observed_at":"2026-05-14T19:29:23.755661Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"cited_work":{"arxiv_id":"2510.16132","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.16132","snapshot_observed_at":"2026-06-28T23:12:46.704827Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","venue":"cs.LG","work_id":"04efd2f8-8aa3-427c-909a-e9a7dbcc1016","year":2025},"citing_paper":{"arxiv_id":"2605.31309","last_updated":"2026-05-29T13:41:01Z","snapshot_observed_at":"2026-08-14T08:51:02.554928Z","submitted_at":"2026-05-29T13:41:01Z","title":"Non-Asymptotic Convergence of Stochastic Iterative Algorithms: A Lyapunov Framework","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:02.699220Z"},"links":{"cited_paper":"/paper/2510.16132","citing_paper":"/paper/2605.31309"},"observation_digest":"sha256:bca2186fbe867a0a6093851f2ecd3292c72875be7fc6fa316fe9e1f2cfc2365a","observation_id":"e15c10b6-921f-4eb5-aa07-40dbad77416e","resolution":{"observed_at":"2026-06-28T23:12:46.706182Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2510.16132/citation-record","integrity":"/paper/2510.16132/integrity","json":"/paper/2510.16132/citation-record.json","paper":"/paper/2510.16132"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MIT press","venue":null,"work_id":"90ee52c5-a013-40c1-ad2b-3e69e0741d47","year":2018},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:875a9258b2662d77f434755dfd9025a0960fcf115d86fec3dc8d29170556049c","observation_id":"b9ca54e1-5211-4ff7-b235-5dcb51fba50b","resolution":{"observed_at":"2026-05-18T05:50:57.898472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mastering the game of Go without human knowledge.Nature, 550(7676):354","venue":null,"work_id":"1aa74cce-0455-449e-bd2b-85d564c41c4e","year":2017},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:85b7dcf1d23bb5669f0646d8ce7b728ddaf2ccea34ce39b3b7b4736839c4b3d7","observation_id":"d4f5148d-91eb-4074-a1f2-38c03889ed58","resolution":{"observed_at":"2026-05-18T05:50:57.883528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to-endtrainingofdeepvisuomotor policies.Journal of Machine Learning Research, 17(39):1–40","venue":null,"work_id":"de498175-bba4-4054-b7d8-7b406126cb79","year":2016},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:4c745e74130cc00cc2763f16820a7e734ab06049a63662e5c6a0011654f894ed","observation_id":"8a448e8a-4c02-4048-9657-4a91c76ea079","resolution":{"observed_at":"2026-05-18T05:50:57.831147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3543846","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcementlearningbasedrecommendersystems: A survey.ACM Comput","venue":"ACM Computing Surveys","work_id":"9a2bf3db-a08b-42db-bd4a-83ad9b623166","year":2022},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:8a07939b7e94e7090c33b32d38a7999c4d8c4e3f1a3c2eaf69f5167eb686a9ab","observation_id":"9d108c9a-200e-497d-8d61-963183a0fbb4","resolution":{"observed_at":"2026-05-18T05:50:56.401270Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6ed71681-59cf-4b4b-8048-d603d559a08e","year":2022},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:06441773efc71be6cf068a2f02a1b1448ae1d3de20fc018565e8d87b30016e54","observation_id":"d7366329-0358-4172-8f7d-34903b80e443","resolution":{"observed_at":"2026-05-18T05:50:57.920556Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Q-learning.Machine learning, 8(3-4):279–292","venue":null,"work_id":"6d2e8755-1edd-4cb1-83b5-fceba3c903cd","year":1992},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:ec1fb855e70f397407bcd7b55eefcad99cd9fb9d8d11d75ae24d9b2b5764d53b","observation_id":"c35feb33-52df-43db-987d-a563ef8fbe98","resolution":{"observed_at":"2026-05-18T05:50:57.860221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T11:52:23.528993Z","title":"A stochastic approximation method.The Annals of Mathematical Statistics, pages 400–407","venue":null,"work_id":"0de1379f-cac9-42cc-a802-9d3dbbb7da37","year":1951},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:a9f3e33caf5237db37f0bde5a38043e58098a056444415eeb3807b4f91a340cf","observation_id":"e5b9b4e2-5e66-4551-a898-5304b62d629b","resolution":{"observed_at":"2026-05-18T05:50:57.857739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rusu, Joel Veness, Marc G","venue":null,"work_id":"df5465ee-77bb-45ce-b79e-29ea2422f3c8","year":2015},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:8dec4a4f2fb5b7f3292994faa389172817be25a02eb137b2e523ce42c87934f2","observation_id":"157f3967-b039-4b1b-9099-9916e2018c17","resolution":{"observed_at":"2026-05-18T05:50:57.915996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Asynchronous stochastic approximation and Q-learning.Machine learning, 16(3): 185–202","venue":null,"work_id":"85a754c0-abe4-4989-991c-a02309c7c04e","year":1994},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:36f8341d95ad9e5e2d706ae496abd74a6d4b57325deb10230593ff3517a306dc","observation_id":"1181646d-c12d-4e10-b14e-3ead5ebda138","resolution":{"observed_at":"2026-05-18T05:50:57.781622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The ODE method for convergence of stochastic approximation and reinforcement learning.SIAM Journal on Control and Optimization, 38(2):447–469","venue":null,"work_id":"25cecd67-39e6-4234-9001-3466e43be450","year":2000},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:35b2c6ec61911bf0493e7a832ddf42c61e8672e5823432b3083d570f49223418","observation_id":"21406b28-d5f0-454f-8f93-947fa0b0fb0f","resolution":{"observed_at":"2026-05-18T05:50:57.871074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Springer","venue":null,"work_id":"52bf0dd3-577a-4a41-be92-f2d35c00c29e","year":2009},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:01d711b91ffc0b364485ec3795dd6fca059a1622165c44cf7a0a59995aec1f78","observation_id":"4f33f359-c396-4228-ac20-4634d1e519c0","resolution":{"observed_at":"2026-05-18T05:50:57.821547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The asymptotic convergence-rate of q-learning","venue":null,"work_id":"e29653a9-4d05-4ba8-b65c-dc581248d8b8","year":1998},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:ace117cf169e57fbe7a6b3f9d21c73a67b58d09c9ef6fb149b3c48c01aabb9df","observation_id":"69317bae-e396-4799-bbcb-16b1bdd2ae3a","resolution":{"observed_at":"2026-05-18T05:50:57.779073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.sysconle.2012.08.014","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beck and R","venue":"Systems & Control Letters","work_id":"7ca3f131-2a81-4d94-a4c6-ace284e4e796","year":2012},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:b91f80e0d423379c296c1fe991e6d5d1e667e55df68f5edb437e08755968d8f0","observation_id":"24089893-345c-45a7-854c-6cae3e62a881","resolution":{"observed_at":"2026-05-18T05:50:56.404442Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/acc.2013","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beck and R","venue":null,"work_id":"cdda6f85-7245-4680-9a2a-3c483a890bee","year":1926},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:4ed90e6fd7e04c63adcfa99c580d0160f6fc00ec9294dd16698612fb115cca7d","observation_id":"570ab767-c2e4-4b4e-a7c6-0e05eb209442","resolution":{"observed_at":"2026-05-18T05:50:56.408356Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A Lyapunov theory for finite-sample guarantees of Markovian stochastic approximation.Operations Research, 72(4): 1352–1367","venue":null,"work_id":"b4e7708d-7aae-415d-b253-0b335de04240","year":2024},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:2c3f7183ea2cadba08d7e4c39feecd3cd54ae823077b656ef047343724b001bc","observation_id":"1d1d9469-7edb-4682-a7fc-1e8a2efc5e8f","resolution":{"observed_at":"2026-05-18T05:50:57.880442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Final iteration convergence bound of Q-learning: Switching system approach.IEEE Transactions on Automatic Control, 69(7):4765–4772","venue":null,"work_id":"157200e8-a6ee-4f76-a02d-8b2ec7463536","year":2024},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:d7dc78511657139dd4a985b53a47459c01d1e5fa21d80700dc197244533a91e6","observation_id":"8ce43545-3d7f-4f83-92c8-18ef34751507","resolution":{"observed_at":"2026-05-18T05:50:57.783901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.06265","last_updated":"2019-06-24T17:09:55Z","snapshot_observed_at":"2026-08-14T16:31:47.013764Z","submitted_at":"2019-05-15T16:06:30Z","title":"Stochastic approximation with cone-contractive operators: Sharp $\\ell_\\infty$-bounds for $Q$-learning","version":2},"cited_work":{"arxiv_id":"1905.06265","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.06265","snapshot_observed_at":"2026-07-09T22:56:37.754397Z","title":"Stochastic approximation with cone-contractive operators: Sharp $\\ell_\\infty$-bounds for $Q$-learning","venue":"cs.LG","work_id":"493446c0-0206-4c59-8a76-c5c0886192b1","year":2019},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"cited_paper":"/paper/1905.06265","citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:a3eb684d1590876b457104cdcb16927d01a8e8cf20347d1c5a6067a084d74fde","observation_id":"e8da3c8f-4da7-4b4a-a18c-38ae475180bb","resolution":{"observed_at":"2026-05-18T05:50:57.144619Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.04697","last_updated":"2019-08-08T17:33:58Z","snapshot_observed_at":"2026-08-14T16:17:20.489041Z","submitted_at":"2019-06-11T16:58:54Z","title":"Variance-reduced $Q$-learning is minimax optimal","version":2},"cited_work":{"arxiv_id":"1906.04697","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.04697","snapshot_observed_at":"2026-07-09T22:56:37.735104Z","title":"Variance-reduced q-learning is minimax optimal","venue":"cs.LG","work_id":"60497a6e-266a-42d8-9dd6-acc8d3171cc4","year":2019},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"cited_paper":"/paper/1906.04697","citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:24724ef2e5aad99f4dccc168bf0f80113f8f75945613795cf516e23ea1f02571","observation_id":"e442f492-2650-42c9-ba2e-7ec42922dc85","resolution":{"observed_at":"2026-05-18T05:50:57.149874Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning rates for Q-learning.Journal of Machine Learning Research, 5(Dec):1–25","venue":null,"work_id":"d815cd61-af7e-4c0d-a871-ac700af455e7","year":2003},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:acaef4c2bf3746552bee7f5ceaf1ae21882e29223c227da4dc8efb0b54e2ca01","observation_id":"61420611-9398-41f8-aeb5-d6e9bc60dedb","resolution":{"observed_at":"2026-05-18T05:50:57.812070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Finite-time analysis of asynchronous stochastic approximation and Q-learning","venue":null,"work_id":"fd6dc5ab-b7ea-4a79-b54f-bec0289daa5e","year":2020},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:3e3f05598feb1a8ea90628db5daa52cd8f6063b4b48b381afaa61747e1646ff7","observation_id":"b1ca6e2e-e954-4653-8d8d-eb5a147e7428","resolution":{"observed_at":"2026-05-18T05:50:57.923273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sample complexity of asynchronous Q-learning: sharper analysis and variance reduction","venue":null,"work_id":"39c4951e-290c-4b86-a304-050886dd3544","year":2020},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:24ad8a5cd8b73e55eee6083aac1c4a83f2171b42df150aa2c07c860c7304fede","observation_id":"09a9234b-3834-4dd3-80cd-9e9f5f5358f2","resolution":{"observed_at":"2026-05-18T05:50:57.854241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A statistical analysis of polyak-ruppert averaged q-learning","venue":null,"work_id":"ded04098-1b61-4987-bbde-6975a664fab4","year":2023},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:b8f04ac1f43ede891ddabd328ccc35152636ca699fff2ff534649669b2f92303","observation_id":"9c53fb4e-5279-4c18-80c0-f61414134787","resolution":{"observed_at":"2026-05-18T05:50:57.809770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6d5fe32c-456e-4dab-88a8-aef70e34400c","year":2012},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:29a9527257ebe4dad62b15b635f30324bf3105505bfba5d0617f1e9dce531b9c","observation_id":"6dcf852c-6970-439c-aa58-1840e8e02047","resolution":{"observed_at":"2026-05-18T05:50:57.910984Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Is q-learning provably efficient? Advances in neural information processing systems, 31","venue":null,"work_id":"93bf1905-1c49-4409-8db9-86b4cbcdeb05","year":2018},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:83f1fb471570f1ab190c189cf29afcfff84297da1a21f33cf8884719cf2f438e","observation_id":"5cfcae1b-57c4-414e-ac26-5bfec2989721","resolution":{"observed_at":"2026-05-18T05:50:57.846985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19254","last_updated":"2025-05-27T16:10:41Z","snapshot_observed_at":"2026-08-09T20:45:43.685040Z","submitted_at":"2025-01-31T16:10:50Z","title":"Linear $Q$-Learning Does Not Diverge in $L^2$: Convergence Rates to a Bounded Set","version":4},"cited_work":{"arxiv_id":"2501.19254","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.19254","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Linear Q-le arning does not diverge: Convergence rates to a bounded set","venue":null,"work_id":"d3cbeeab-7132-4b26-b865-76b988b161fa","year":2025},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"cited_paper":"/paper/2501.19254","citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:dcdc707ec3ea399d7cf1efdc613e39c271ca654cfa6ea3e3a0d8ddf04af8996b","observation_id":"b42121ae-070b-4859-85e6-37be898e1cdc","resolution":{"observed_at":"2026-05-18T05:50:57.163269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep reinforcement learning with double q-learning","venue":null,"work_id":"ca66cf72-7a6b-4a0a-925e-196e88abf696","year":2094},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:3258dd3e7b5ca883637921b26747675a59a011967d5b0afd4fc3a81ae8713f5c","observation_id":"ed1504d7-e858-4fff-a53e-2466ad2dd7e9","resolution":{"observed_at":"2026-05-18T05:50:57.844681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Value-differencebasedexploration: Adaptivecontrolbetween 𝜖-greedy and softmax","venue":null,"work_id":"1cd5825b-f760-4100-8b9a-81bbd65a23c0","year":2011},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:3f86a2c539319e8238218c5e84e18f0c031401a903eb8dd7850b887124877f9e","observation_id":"9e833408-06e9-418f-96ec-5a7613cf462c","resolution":{"observed_at":"2026-05-18T05:50:57.892340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dueling network architectures for deep reinforcement learning","venue":null,"work_id":"02d84b5d-dabb-4765-a52c-339278c5a0bc","year":1995},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:57456637d95f8dca3b29ad8f140ade96fa4b13b93c1e52211a85089b92f464a5","observation_id":"8af9cfa4-0eaf-474c-9f98-5f54ea7fce24","resolution":{"observed_at":"2026-05-18T05:50:57.850964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Finite-time error bounds for linear stochastic approximation and TD-learning","venue":null,"work_id":"1dbe1718-a7a6-4a85-9570-e782d10266c3","year":2019},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:4692de6b9ad04a026bb7235bce3bf46743183b5d6a538d32d69a3ee098b231dd","observation_id":"504677f2-d2b5-4080-b107-5f49defaca19","resolution":{"observed_at":"2026-05-18T05:50:57.772706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A finite-time analysis of temporal difference learning with linear function approximation","venue":null,"work_id":"0204a81c-2252-4094-a78e-f955dd0a10df","year":2018},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:94cf07094e5976db87a245d8665dfa858c644ae4297bddc821f49dc9f33b6fdf","observation_id":"45ec2924-76f6-4489-92ff-f4bb5e0e0c9c","resolution":{"observed_at":"2026-05-18T05:50:57.800197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Finite-sample analysis for SARSA with linear function approximation","venue":null,"work_id":"5ebb6c7d-be51-4beb-a1ec-4b4352978be3","year":2019},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:933352b113e315e3b3681c5abcef65ec9d0e68d86c4dc0c3941e8c00aa9ade2a","observation_id":"591423c9-fbd6-41c6-80e2-eb427e05eac3","resolution":{"observed_at":"2026-05-18T05:50:57.889331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stochastic approximation with unbounded Markovian noise: A general-purpose theorem","venue":null,"work_id":"c1a5c981-fce5-42ca-a72c-6a62dd97e03d","year":2025},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:e902ab79e0e6259d6434cb4f411416cac16899951d85c0d6ac8510f9eb1a0f6b","observation_id":"115ce0fd-40e2-49ad-b329-ac3e2c9f221d","resolution":{"observed_at":"2026-05-18T05:50:57.874646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Concentration of contractive stochastic approximation and reinforcement learning.Stochastic Systems, 12(4):411–430","venue":null,"work_id":"ff94ccc1-3161-4057-8a01-4e2d6ce3859f","year":2022},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:d171d448c6650f5955e3eda8c539622ee1b5abdb6df97791339a9bd6a44fb903","observation_id":"2dc4bd93-7a98-4e6a-95e1-214a03ed1f59","resolution":{"observed_at":"2026-05-18T05:50:57.839260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Convergence of stochastic iterative dynamic programming algorithms","venue":null,"work_id":"9926b9cb-4ba4-4d80-96e4-d62af562bbd1","year":1994},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:9d94e5ddba8f9385b51ee4161d6453102050ab1779a82dfa3d8e2663ea9a272f","observation_id":"c22e91bc-90c0-4dd5-84e3-bcbde789ed42","resolution":{"observed_at":"2026-05-18T05:50:57.903822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A unified switching system perspective and convergence analysis of Q-learning algorithms.Advances in Neural Information Processing Systems, 33:15556–15567","venue":null,"work_id":"ae1f63c6-29c6-460d-9014-59570f77ad48","year":2020},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:e9d56319b674fdc4ddf219fb6f9a8d8286e753ee8761458fb0528f0177cc3ef6","observation_id":"549421a8-182b-4158-a414-b8e9113d13e8","resolution":{"observed_at":"2026-05-18T05:50:57.877311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zapq-learning.AdvancesinNeuralInformationProcessingSystems, 30","venue":null,"work_id":"98f37153-e973-4b6b-9f2f-2306d6a62414","year":2017},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:9a395167114c7d68fa307146f91fa290506cae0c3af674a78e5f97c9f28f2cf0","observation_id":"2291be45-5c55-4511-92aa-63c321465bd3","resolution":{"observed_at":"2026-05-18T05:50:57.828854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instance-optimality in optimal valueestimation: Adaptivityviavariance-reducedq-learning.IEEETransactionsonInformationTheory","venue":null,"work_id":"e4c069fd-6ec1-45fd-bc93-07269670ce5a","year":2024},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:d74bdae334b14eddf1695188b114cef3051ef512e81eb4a3a5591e31435e2a79","observation_id":"748b2d33-e46f-4732-b6ff-a5c2bfed9d16","resolution":{"observed_at":"2026-05-18T05:50:57.786485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13884","last_updated":"2024-01-25T02:01:53Z","snapshot_observed_at":"2026-08-13T04:35:07.809373Z","submitted_at":"2024-01-25T02:01:53Z","title":"Constant Stepsize Q-learning: Distributional Convergence, Bias and Extrapolation","version":1},"cited_work":{"arxiv_id":"2401.13884","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.13884","snapshot_observed_at":"2026-07-01T13:05:45.530664Z","title":"and Xie, Q","venue":null,"work_id":"a69febfa-1f08-4340-9aa4-d2675e77b066","year":2024},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"cited_paper":"/paper/2401.13884","citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:748d62c0b037154ad03a8df4d7b0f91cf9b2c463beaecbca89051bec24a9578f","observation_id":"97155cf2-5cfc-4627-92be-fd8d4a93244e","resolution":{"observed_at":"2026-05-18T05:50:57.154573Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An analysis of reinforcement learning with function approximation","venue":null,"work_id":"d9aed715-545b-45f3-b8f0-6d43d9b20b16","year":2008},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:0f48d94299bf26ac58f74af78c04bf938851a4137b3e07a531f6c6b1e6d60cde","observation_id":"c6cf3182-ab9f-48a8-9962-df2c645d9fdd","resolution":{"observed_at":"2026-05-18T05:50:57.793365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Target network and truncation overcome the deadly triad in q-learning.SIAM Journal on Mathematics of Data Science, 5(4):1078–1101","venue":null,"work_id":"46dda703-5d15-4c94-b36e-86f4fbff455d","year":2023},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:466306a7268f32fa274e94c2bed520526df69594f72ea67a9153bcfbdf800026","observation_id":"a66069be-9dd5-4796-b973-04b0ab453e23","resolution":{"observed_at":"2026-05-18T05:50:57.817177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TheprojectedBellmanequationinreinforcementlearning.IEEETransactionsonAutomatic Control","venue":null,"work_id":"d157be5a-3f7a-436b-81f6-32fb5aacfd7a","year":2024},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:e96dc98f3ab757d4f48b8fbd95085c0af6ee80c2bf04409ac8aeb023ac0a6abd","observation_id":"9d91f3b9-ec2b-4d8f-8d14-07cffe222769","resolution":{"observed_at":"2026-05-18T05:50:57.788459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The blessing of heterogeneity in federated q-learning: Linear speedup and beyond.Journal of Machine Learning Research, 26(26):1–85","venue":null,"work_id":"f6c5c30c-1a97-4b68-8631-ba1667ee7712","year":2025},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:e67d09557e3729faa9de6206b85e82b7c7a37bdbf5e5a3b7231992c9e167b51a","observation_id":"4ab33dd2-86ac-4cf5-a0e3-9665646bf8d8","resolution":{"observed_at":"2026-05-18T05:50:57.833760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Federated reinforcement learning: Linearspeedupundermarkoviansampling","venue":null,"work_id":"b83d4aa4-56ad-4d5c-a3d9-5d7ecde96488","year":2022},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:7d8759566c60222f643c1de42a5bfdd0f2fa4ca1aaed352859aed249cea2743b","observation_id":"a22bbfe9-ea11-4a87-81d7-eb28731b3e5a","resolution":{"observed_at":"2026-05-18T05:50:57.775212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Q-learning with logarithmic regret","venue":null,"work_id":"d6e89569-f5f0-4f4b-84b3-9a8b6fd4e6c5","year":2021},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:bcdc44909c6a3dfa96f0fb4156d7ac978a8cb1bba8dc363ab2f07aed74aa18bb","observation_id":"402a0e6a-93fe-4ae9-b620-c6c70f702e1b","resolution":{"observed_at":"2026-05-18T05:50:57.765694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Online Q-learning using connectionist systems.University of Cambridge, Department of Engineering, Cambridge, UK, 37","venue":null,"work_id":"48fd327e-c4a1-4ebd-9f12-73d4df54ca20","year":1994},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:f7f283aed73910e746696f0ead26344d7bfcd72e4cb7521f3a88cb60e7f4ddf8","observation_id":"21cb9915-568d-449f-9b24-36abc0302b99","resolution":{"observed_at":"2026-05-18T05:50:57.791161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Convergence results for single-step on-policy reinforcement-learning algorithms.Machine learning, 38:287–308","venue":null,"work_id":"85093fea-b9cc-4d56-9b91-fc39417502ff","year":2000},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:1449bff2ac05ebeb3fad61b40bbbbd5d325d51ad5b082641dd2e44b589438e16","observation_id":"3743101c-2284-4072-9633-6c278603e637","resolution":{"observed_at":"2026-05-18T05:50:57.757679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the convergence of sarsa with linear function approximation","venue":null,"work_id":"321bc856-39cb-4db0-8d6f-d4232e4368a6","year":2023},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:cfcb59019e1469f7cdb0817799d018bbaffa1eaad84e300f97ee1998f952c177","observation_id":"f1313c6c-bed2-4cc5-92e7-f24c505ec7ff","resolution":{"observed_at":"2026-05-18T05:50:57.826434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A finite-time analysis of two time-scale actor-critic methods.Advances in Neural Information Processing Systems, 33:17617–17628","venue":null,"work_id":"f3a41ec5-c4da-4cf4-aa06-8424d4488007","year":2020},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:bc11e03ac23fe81031bf033cc1f15fd3c6df66e73e88755195b21cb966d1b5b5","observation_id":"aaa09663-c42c-4b61-8e0b-319dedf49445","resolution":{"observed_at":"2026-05-18T05:50:57.901466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Finite sample analysis of two-time-scale natural actor-critic algorithm.IEEE Transactions on Automatic Control","venue":null,"work_id":"031c6758-3dff-42f4-815b-b1daba487be5","year":2022},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:d4148038fe080e3d99cb59dca3e4b83c28ed2a38c4c190b05f39980ba0961892","observation_id":"93e23c6f-f8fb-4c1a-8ac7-6f2aa4ea2a2e","resolution":{"observed_at":"2026-05-18T05:50:57.824056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A finite-sample analysis of payoff-based independent learning in zero-sum stochastic games.Advances in Neural Information Processing Systems, 36:75826–75883","venue":null,"work_id":"4ef3235e-37ec-4029-b496-b4cec810cb25","year":2023},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:f155ab4a4851c3684971cd7a55cf87799d8b13057a2fbf2b6c5481670e396a97","observation_id":"acb7a39c-9226-4f1e-b96a-81adc984d3bd","resolution":{"observed_at":"2026-05-18T05:50:57.760039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0865.367349","doi":"10.1145/3670865.3673491","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Two-timescale Q-learning with function approximation in zero-sum stochastic games","venue":null,"work_id":"1a7af059-073a-47bd-a6a4-d50b41929e7c","year":2024},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:1b14a1057957f1e93eeed92683a6f45cb13dbd0bba1b73436ab4fc0c9d099012","observation_id":"2ad4678d-86a4-4efa-8b2e-a74eb0860be8","resolution":{"observed_at":"2026-05-18T05:50:56.393420Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"John Wiley & Sons","venue":null,"work_id":"06b21029-9457-4298-b2d4-16695edfd447","year":2014},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:4e02a4e6804fc9f8ed4901a27fc60c28cfe2e30bb1268e678ca05d28f35eae96","observation_id":"43e28953-6f72-4311-83c6-2652b3797038","resolution":{"observed_at":"2026-05-18T05:50:57.913503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Athena Scientific","venue":null,"work_id":"ffc9f0dc-45a7-480e-81b9-cf3c7f20797a","year":1996},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:955571d090e3031e83a2aef102a4463e0704fbdf90acddc789112d738caa69d4","observation_id":"17531437-0612-4f18-8223-8197579f5c6e","resolution":{"observed_at":"2026-05-18T05:50:57.819386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Surlesopérationsdanslesensemblesabstraitsetleurapplicationauxéquationsintégrales","venue":null,"work_id":"cbdeb35e-77e7-4d12-ae1e-3374cc897ec9","year":1922},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:1e31cf4d0f2bdd568754203622e7a9d393b3c806ff1bb75b4e5e5c658a486e67","observation_id":"f045ed24-6843-4e61-a346-690ec6b8da2a","resolution":{"observed_at":"2026-05-18T05:50:57.895407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00805","last_updated":"2018-08-21T00:02:44Z","snapshot_observed_at":"2026-08-14T21:08:29.545204Z","submitted_at":"2017-04-03T20:50:29Z","title":"On the Properties of the Softmax Function with Application in Game Theory and Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"1704.00805","doi":null,"metadata_source":"pith","pith_arxiv_id":"1704.00805","snapshot_observed_at":"2026-06-29T00:02:50.326473Z","title":"On the Properties of the Softmax Function with Application in Game Theory and Reinforcement Learning","venue":"math.OC","work_id":"9c212edc-125f-4fbf-84ea-a495bf87b6e6","year":2017},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"cited_paper":"/paper/1704.00805","citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:a6ce84696247dd3f245a167f8614390c9eb2230c9332bb2a48cc8ad4b4a4c3c0","observation_id":"1b4409d4-49d8-4fd8-b8ba-36b530e55e52","resolution":{"observed_at":"2026-05-18T05:50:57.158526Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AmericanMathematical Soc","venue":null,"work_id":"7af46ebc-d99a-4ee0-8499-f1135748be46","year":2017},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:66bc7990d37c6e0a078c1599e70797ba84dc3a3b779235b8ab04bb3befe57847","observation_id":"d409e13f-b061-4f0c-a581-be87d7af282d","resolution":{"observed_at":"2026-05-18T05:50:57.762568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sample and communication-efficient decentralized actor-critic algorithms with finite-time analysis","venue":null,"work_id":"ec6440a5-dd19-489a-be1e-887c6eb093d3","year":2022},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:48d0c81ffcc876cde16fb5e2b3662342a1afc7dcca8257207dc9ddbac0d7553c","observation_id":"8728ed8e-5e97-4e17-a6a6-ae862df3e1fb","resolution":{"observed_at":"2026-05-18T05:50:57.886546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sample efficient stochastic policy extra-gradient algorithm for zero-sum markov game","venue":null,"work_id":"1a1f785e-9f09-400d-9083-2da9f6ad9eb5","year":2021},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:c1a2e98636047bedf18b54c590dc059227fc3448e608fa37fd721cff4751730c","observation_id":"5c50e7e5-bc53-44dc-a4e1-0ec69633b0d4","resolution":{"observed_at":"2026-05-18T05:50:57.836205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sample complexity bounds for two timescale value-based reinforcement learningalgorithms","venue":null,"work_id":"a65ac150-a5ea-4fd0-88aa-1bc7f9083cdb","year":2021},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:493dfec5a495a56ae6b594aae427059daf7ab20608ffaf36661247e126d53564","observation_id":"cb5597b9-418c-47d6-9b89-e05227925f81","resolution":{"observed_at":"2026-05-18T05:50:57.797716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On finite-time convergence of actor-critic algorithm.IEEE Journal on Selected Areas in Information Theory, 2(2):652–664","venue":null,"work_id":"51564b88-ebd7-4f3c-a7fd-920e895fa74a","year":2021},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:a3e81df3c73f9a2ed83db26b2859426b681cdb278a74acec078b7d052aa91b17","observation_id":"e2347e59-b47f-4bc9-a945-94f7cbc3e8b9","resolution":{"observed_at":"2026-05-18T05:50:57.814713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T19:25:32.912395Z","title":"Cambridge University Press","venue":null,"work_id":"02df6fda-c1b7-46d5-a67d-fd7439791b09","year":2020},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:211da85bacd668ef9290d7c802f8b7c984e4a51c5f5bdd4f04e5df17d06635ee","observation_id":"46293fee-e626-4f3f-9100-5ebd516e70e4","resolution":{"observed_at":"2026-05-18T05:50:57.842054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sharper model-free reinforcement learning for average-reward markov decision processes","venue":null,"work_id":"620c2f57-313c-45bb-8b9d-a9a8cd8cd51d","year":2023},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:44b421f0037ac64c6e06fd1369850c6bb565785b2c9790fd2b053c3d925b1413","observation_id":"f07419b0-f028-41e5-be68-0f962d2e291a","resolution":{"observed_at":"2026-05-18T05:50:57.768576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.00603","last_updated":"2022-12-01T15:57:58Z","snapshot_observed_at":"2026-08-13T13:29:58.760243Z","submitted_at":"2022-12-01T15:57:58Z","title":"Near Sample-Optimal Reduction-based Policy Learning for Average Reward MDP","version":1},"cited_work":{"arxiv_id":"2212.00603","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.00603","snapshot_observed_at":"2026-07-01T18:55:59.140544Z","title":"Near sample-optimal reduction-based policy learning for average reward mdp.Preprint","venue":null,"work_id":"9cb51a59-8e27-4a05-be37-6ba2620bd6d9","year":2022},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"cited_paper":"/paper/2212.00603","citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:c6758c72fd733927bc8de4d3631cf418f469e2fe4d93edecc5244a57968bfb37","observation_id":"287162d5-da44-4a40-a323-5ea354c2632d","resolution":{"observed_at":"2026-05-18T05:50:57.135525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8427fa6e-8643-46ed-aa06-b6f0cebb2857","year":2018},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:016368c5203e643988254a07047bc80bf9595b366d922ce7879c632675ba0c51","observation_id":"d622e720-2f6d-4c5e-b93e-a71ca2230213","resolution":{"observed_at":"2026-05-18T05:50:57.795648Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Solution representations for poisson’s equation, martingale structure, and the markov chain central limit theorem.Stochastic Systems, 14(1):47–68","venue":null,"work_id":"2316caa5-2cbb-4d1b-8a73-fb8b4f3ca3ee","year":2024},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:f1140313fd820f7facf14cb498877ba54e677b56cbc80d56a89232cf6bf1688a","observation_id":"e369d986-826f-4399-9bc9-07aa4076dc84","resolution":{"observed_at":"2026-05-18T05:50:57.908573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generalized inverses and their application to applied probability problems.Linear Algebra and its Applications, 45:157–198","venue":null,"work_id":"38216df2-ca5d-4ba2-823b-9b76cd8658c9","year":1982},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:069410330d603dd2837dd2a175e7718087d23bccc7c7066f2047ae0961e0126b","observation_id":"8b5fb187-8840-4a1e-97c6-c5166a59f520","resolution":{"observed_at":"2026-05-18T05:50:57.863120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A liapounov bound for solutions of the poisson equation.The Annals of Probability, pages 916–931","venue":null,"work_id":"25d520ec-ee75-49e0-bfbc-46dc1ea008f2","year":1996},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:67af772b8ee387c8a9d54b2905df02aaa6620a977207ead580fccc2e3e1b6d32","observation_id":"f4ab5305-30f9-4d4b-8ede-20ecd76d15f9","resolution":{"observed_at":"2026-05-18T05:50:57.865774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.11239","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An approximate policy iteration viewpoint of actor–critic algorithms.Automatica, 179:112395","venue":null,"work_id":"a879c5c7-6f9a-4509-9761-b4813aa3875c","year":2025},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:e598e1d53cb303b1b398fe8131aef36acc71e3d57f31803ba99ebfe439b51901","observation_id":"2c1f914b-abe2-4ad2-84ac-2b3148387d25","resolution":{"observed_at":"2026-05-18T05:50:57.139934Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Boundedness of iterates in Q-learning.Systems & control letters, 55(4):347–349","venue":null,"work_id":"e63df8f9-fbfe-468c-81f6-dbf3e70f629b","year":2006},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:c8018d4571e6a5161d3c197d7daf90544a950fcb1e3e036434ac0c90de23b84f","observation_id":"08bc700b-47cd-4237-a278-1707a8269e22","resolution":{"observed_at":"2026-05-18T05:50:57.807325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Minimax pac bounds on the sample complexity of reinforcement learning with a generative model.Machine learning, 91(3):325–349","venue":null,"work_id":"696c4470-daef-4668-833d-5ec0dec2544c","year":2013},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:9b6d3290aba8b71555c43b0f845c7ec58bac2bdf9c9cce73379069387f060d79","observation_id":"f571dc90-2911-4582-a792-e271205f56f8","resolution":{"observed_at":"2026-05-18T05:50:57.802443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Online learning and online convex optimization.Foundations and Trends®in Machine Learning, 4(2):107–194","venue":null,"work_id":"ac04d0d7-8876-495f-b5e8-6b62fbfb72fc","year":2012},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:30ede6525e844015ce3041b59241d23e4df9658d711b40073bc9551abace837e","observation_id":"f9b421a6-7f4d-4dcd-94a5-6b8e8acaace5","resolution":{"observed_at":"2026-05-18T05:50:57.804965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1137/1.9781611974997","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beck.First-Order Methods in Optimization","venue":"Society for Industrial and Applied Mathematics eBooks","work_id":"04368896-824a-49e9-be92-3551072b73fb","year":2017},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:895fd3c553106786a142e576092bfcec7554078ed168c186084ef4814b71b9dd","observation_id":"e12f59b6-387d-4bc2-a5a8-e52a4656242c","resolution":{"observed_at":"2026-05-18T05:50:56.397550Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-05-30T11:25:53.245677+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-30T11:25:53.245677+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"95eb9775-4310-4a99-854d-237c09719827","year":2023},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:e3253403cda585928f3cdefca9864395b511fe4f556215425e8301d81aaef6a0","observation_id":"f747d203-dc94-4722-9b94-a8d9a373b005","resolution":{"observed_at":"2026-05-18T05:50:57.905947Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"To this end, define𝑧𝑘 := Í𝑘 𝑛=0 P 𝑛𝑦 for any𝑘≥0","venue":null,"work_id":"53fd1916-b892-431a-b710-7f56e53d8309","year":null},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:88b0313fdec17fff48a32998253243e4a7ce91d5887d6b7c6f069ad539854cd3","observation_id":"74c0dc09-8578-4e6a-b435-cacb90495b4d","resolution":{"observed_at":"2026-05-18T05:50:57.918307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"𝑟𝑏∑︁ 𝑖=0 𝑟𝑏 +1 𝑖+1 𝑃𝑖 𝜋𝑏 (𝑠 ′′, 𝑠′) # 𝜋𝑏 (𝑎 ′|𝑠 ′) (Change of variable:𝑖=𝑗−1) = 1 2𝑟𝑏+1 ∑︁ 𝑠′′ ∈ S 𝑝(𝑠 ′′ |𝑠, 𝑎)","venue":null,"work_id":"c8073de6-3231-4114-99b7-0fa45081a862","year":null},"citing_paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-18T05:47:47.782246Z"},"links":{"citing_paper":"/paper/2510.16132"},"observation_digest":"sha256:93c6a1e64761a993d026582d15da21a6e6f3b97e32d8215a46423d26c07e043d","observation_id":"8b12d8ff-faa6-40ba-ac89-6a0cb3114080","resolution":{"observed_at":"2026-05-18T05:50:57.868662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2510.16132","last_updated":"2026-04-03T19:00:32Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T08:50:23.111350Z","submitted_at":"2025-10-17T18:19:00Z","title":"A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":1,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":4,"verified_exact":9,"verified_fuzzy":59},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 4 inbound Pith citation observations for arXiv:2510.16132."}