{"as_of":"2026-08-18T23:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8776ee9c95a4e0be2fa917a2f0afd86601f5a6aed9d7f7d879e7ac653cc220b9","coverage":[{"denominator":125,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-09T22:47:51.676289Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.06935/citation-record","integrity":"/paper/2607.06935/integrity","json":"/paper/2607.06935/citation-record.json","paper":"/paper/2607.06935"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.501327Z","title":"Puterman.Markov Decision Processes: Discrete Stochastic Dynamic Pro- gramming","venue":null,"work_id":"7b144255-c48f-4153-bb0e-cfe3ffcffc3b","year":1994},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:9428f5ddcf8c24fe88f480314eb1ede1d8c6f0db5a56f8230c7d2d3afabf322c","observation_id":"8c96fc50-d110-4b28-9264-fd9372aeb26c","resolution":{"observed_at":"2026-07-09T23:06:37.502493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:85a0c5ec7c3b288dfc119cc30966a2046649da4e7be3015e4fb2850d54e87dd6","observation_id":"3840bc46-ce83-427a-8711-a6671b20ec41","resolution":{"observed_at":"2026-07-09T22:56:37.774476Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-17T17:38:13.840562+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-17T17:38:13.840562+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.533118Z","title":"MIT press, 2022","venue":null,"work_id":"827fe2bb-e115-4eaa-83b1-1253179a11e1","year":2022},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:fa5641a47fc9b3b1fe765c14cb019592eb339036ec9e17c5cd81375c95a973f8","observation_id":"2bfeddfa-607d-448f-9da5-04af7a69f915","resolution":{"observed_at":"2026-07-09T23:06:37.534166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.529668Z","title":"Deep belief markov models for pomdp inference.Neural networks, page 108386, 2025","venue":null,"work_id":"e63154ad-8d10-41f9-9a5c-19429353a131","year":2025},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:4f306b0f6bf2715f9a156edbf291dec6af9578b79689c802dc81a6605e656552","observation_id":"607eb37a-f2f6-4e05-9e06-7f2f2c32d65d","resolution":{"observed_at":"2026-07-09T23:06:37.530914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.614309Z","title":"A markovian decision process.Journal of mathematics and me- chanics, 6(5):679–684, 1957","venue":null,"work_id":"1168fca7-8442-4b62-9d6b-1d67a810cdf9","year":1957},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:a22023bb379ed2ab549eebe8c90b58e6280b9603a8a87482b1de76e565895269","observation_id":"b7e8116b-faf7-47b4-86fc-94da8d8ad568","resolution":{"observed_at":"2026-07-09T23:06:37.615465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.619848Z","title":"An upper bound on the loss from approximate optimal-value functions.Machine Learning, 16(3):227–233, 1994","venue":null,"work_id":"338c17ae-b5a2-4e29-8e8f-e2b57a21ce40","year":1994},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:f28bdf3c1a4c9127816a6185150356273b2f62b0cb15c673b2b2c1c2d9f99621","observation_id":"dc7347e8-d4ba-4def-b8db-b5e8c793d64d","resolution":{"observed_at":"2026-07-09T23:06:37.621061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.541350Z","title":null,"venue":null,"work_id":"7429a957-6971-489c-9fe7-b94f2405b6ef","year":1960},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:e9df3ecce224e4427ea0f56a260016494a3ab134689c49f34589a829a42fe4d2","observation_id":"8a84f11f-0456-4c3c-bdbf-91ffa2febd5a","resolution":{"observed_at":"2026-07-09T23:06:37.542427Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.546240Z","title":"Improved and generalized upper bounds on the complexity of policy iteration.Advances in Neural Information Processing Systems, 26, 2013","venue":null,"work_id":"f2093d70-07a4-429a-827c-9e13791cae08","year":2013},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:100adcc15dd7ebb9bfcbb1439063f065de890d9a2a633c93e8eaccb624cf72b3","observation_id":"0a247d84-7460-4b2c-a4ed-fa142a938d6b","resolution":{"observed_at":"2026-07-09T23:06:37.547431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.568494Z","title":"Springer, 2018","venue":null,"work_id":"43353fe9-47da-48c7-83f2-57812cdd78d0","year":2018},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:9d9ca7aa0ecddf9bf47aef3d2eae43c19c846a157ab522c945fed8b840dda919","observation_id":"594cc6c6-d866-44d8-ad15-56587c71c4c0","resolution":{"observed_at":"2026-07-09T23:06:37.569487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10677","last_updated":"2021-11-25T00:30:38Z","snapshot_observed_at":"2026-08-16T18:30:29.632782Z","submitted_at":"2021-04-19T21:07:09Z","title":"From Convex Optimization to MDPs: A Review of First-Order, Second-Order and Quasi-Newton Methods for MDPs","version":2},"cited_work":{"arxiv_id":"2104.10677","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.10677","snapshot_observed_at":"2026-07-09T22:56:37.744669Z","title":"From Convex Optimization to MDPs: A Review of First-Order, Second-Order and Quasi-Newton Methods for MDPs","venue":"math.OC","work_id":"ec073ebd-bda1-425b-b3e8-4250c0b73ed4","year":2021},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"cited_paper":"/paper/2104.10677","citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:459d810d588bf530ab482c52a3af9a57da4daab472e9450d1e9be280a1bc6f5e","observation_id":"2d187ea6-6994-44fc-a1b1-2d32ad828c69","resolution":{"observed_at":"2026-07-09T22:56:37.745852Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.599070Z","title":"A method for solving the convex programming problem with con- vergence rate o (1/k2)","venue":null,"work_id":"7d5d15e1-104b-485e-a157-f021623c588b","year":1983},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:f4c0d4eadf42dc002ba16cae5b2cd56524f266bdc2922df99347f1b22daa899b","observation_id":"4e9e4919-ca7a-480d-899a-9bf521a6209d","resolution":{"observed_at":"2026-07-09T23:06:37.600268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:56:37.503545Z","title":"Springer Science & Business Media, 2013","venue":null,"work_id":"2cc41e9a-07bf-48f3-a82b-7cf824f28af1","year":2013},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:33d634208ac36856b0c55d4d043eade61aa65c2938b6305d018bec43c7813976","observation_id":"50718e16-f93f-4a33-a320-008081266679","resolution":{"observed_at":"2026-07-09T22:56:37.504613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.600799Z","title":"Some methods of speeding up the convergence of iteration methods","venue":null,"work_id":"8e33c744-7de7-4518-b534-2d7e0689d432","year":1964},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:42efeee8d36337c4f034bd89e82984947e80c57e651f1707b3218b51d7e8fea3","observation_id":"f6c4c399-d58c-4373-a8cc-19127ff8c3eb","resolution":{"observed_at":"2026-07-09T23:06:37.601878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.555100Z","title":"A first-order approach to accelerated value iteration.Operations Research, 71(2):517–535, 2023","venue":null,"work_id":"f66f3baf-4ed0-4e2e-9b53-2be59ca88375","year":2023},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:6acaf155f314d3858a5830d85e8d75ee90a32644689fdc8e80b3a3d85daa72f2","observation_id":"46b874da-b796-45de-b692-1b04b4cb6653","resolution":{"observed_at":"2026-07-09T23:06:37.556361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.506919Z","title":"Pid accelerated value iter- ation algorithm","venue":null,"work_id":"896db7b0-4460-4050-97ce-6a3de865abf9","year":2021},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:9d0e1c2e69575a6d5290cf244e505b4b7f846649e905c2917695e51202bc3dc8","observation_id":"b407913f-067d-4bb8-8d91-1324e0ef9f71","resolution":{"observed_at":"2026-07-09T23:06:37.508074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.07798","last_updated":"2017-05-22T15:06:25Z","snapshot_observed_at":"2026-08-14T20:59:03.934741Z","submitted_at":"2017-05-22T15:06:25Z","title":"A unified view of entropy-regularized Markov decision processes","version":1},"cited_work":{"arxiv_id":"1705.07798","doi":null,"metadata_source":"pith","pith_arxiv_id":"1705.07798","snapshot_observed_at":"2026-07-09T22:56:37.739931Z","title":"A unified view of entropy-regularized Markov decision processes","venue":"cs.LG","work_id":"80b2d2e4-f964-4515-9237-cb45fb9435e3","year":2017},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"cited_paper":"/paper/1705.07798","citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:7fc8971a0814fe61ceace033fd195a4326da30d5854304a442e03823636e2bfb","observation_id":"2c8bdf71-bd6f-4350-9a2a-e9b4219b939b","resolution":{"observed_at":"2026-07-09T22:56:37.741188Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.602392Z","title":"Generative adversarial imitation learning.Advances in neural information processing systems, 29, 2016","venue":null,"work_id":"5ca583af-cf55-49d2-b2f8-a3cda823a66b","year":2016},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:a24da9b8dd6f7a26828df9a520a8cfd5c4e74f795ed7aacdb0a6ff1956087787","observation_id":"09e0cabb-2143-49bd-98f3-a877dfec2952","resolution":{"observed_at":"2026-07-09T23:06:37.603531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.623228Z","title":"Variational policy gradient method for reinforcement learning with general utilities","venue":null,"work_id":"553c0e16-40a1-43e8-acaf-c8f24ae83f6a","year":2020},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:1c4c3a371acdf189f77efc3a088d3f45a802a5419677b4144904e132a3e9e58d","observation_id":"f7070b96-34e2-494c-b0b0-d1c1feeab671","resolution":{"observed_at":"2026-07-09T23:06:37.624435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00108","last_updated":"2024-11-09T12:16:12Z","snapshot_observed_at":"2026-08-18T13:02:09.809549Z","submitted_at":"2023-12-30T01:09:29Z","title":"Stochastic Optimization under Hidden Convexity","version":2},"cited_work":{"arxiv_id":"2401.00108","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.00108","snapshot_observed_at":"2026-07-09T22:56:37.746919Z","title":"Stochastic Optimization under Hidden Convexity","venue":"math.OC","work_id":"5c689fb6-e7f9-4c3c-9bcc-d04319b7daf3","year":2023},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"cited_paper":"/paper/2401.00108","citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:044f6cb0799dc01ae8ee7d8b7d6f653431699b30ce9c7dd0d8d9e12ae9e1bae4","observation_id":"5622de66-6cb8-415f-97d0-f0ce8f0e848a","resolution":{"observed_at":"2026-07-09T22:56:37.748081Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.565216Z","title":"Model-based reinforcement learning with a generative model is minimax optimal","venue":null,"work_id":"fef54c7c-78d8-4a7d-b228-f5bb3ae15862","year":2020},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:0c633b607f2dd9343f7b4556d502e014216bac55b511cfd2a9ec8b2f8360c488","observation_id":"dbe4491c-7c82-4134-b8e0-b2170fed9987","resolution":{"observed_at":"2026-07-09T23:06:37.566394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.583422Z","title":"Minimax pac bounds on the sample complexity of reinforcement learning with a generative model","venue":null,"work_id":"5f4ebb7c-6227-490b-9744-96bde83ea85c","year":2013},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:1b277c1afb27a1e2944c7bad70cd1e894a82f12e94cca141392a24a57d97e838","observation_id":"b3016a84-d9d8-4c85-a4cb-4843e363023c","resolution":{"observed_at":"2026-07-09T23:06:37.584620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.624933Z","title":"Breaking the sample size barrier in model-based reinforcement learning with a generative model.Advances in neural information processing systems, 33:12861–12872, 2020","venue":null,"work_id":"8fa88e08-d9ea-494f-ac5c-ab967e417497","year":2020},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:fe79b5639f4e468a9b7bcc6e8f760f6e1de6ef000be8ec2c2c768154cd202c39","observation_id":"1a4aa522-d10d-4def-85f3-f438933b7681","resolution":{"observed_at":"2026-07-09T23:06:37.626147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.633057Z","title":"Near-optimal time and sample complexities for solving markov decision processes with a generative model.Advances in Neural Information Processing Systems, 31, 2018","venue":null,"work_id":"875c6bd1-226e-4c6f-bb17-8b178ef53931","year":2018},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:98d502376514e4dcb8b836d740dfae6381e71640097711f1682c84481b8209c0","observation_id":"54d16de7-e98c-48af-a929-5d175ed29e32","resolution":{"observed_at":"2026-07-09T23:06:37.634321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.511983Z","title":"Reinforcement learning: Theory and algorithms.CS Dept., UW Seattle, Seattle, WA, USA, Tech","venue":null,"work_id":"9a9008d4-f25d-41f2-bb61-172749f708a8","year":null},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:7b18d5d79209bc8b7b0439d4ea838953996c28dd8eecee7cc69f38fa9755b696","observation_id":"6be2a1cc-dc5f-4921-b98d-dd3ec061397b","resolution":{"observed_at":"2026-07-09T23:06:37.513427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.542923Z","title":"Optimal sample complexity for average reward markov decision processes","venue":null,"work_id":"6d21aca5-5c18-4fa0-aade-7d7bc9cd779b","year":2024},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:ce47fdbe7a2578515d82731859065629e69c48e64f438cd85e19cdb0520042f7","observation_id":"96cf21f2-ea97-4172-a02d-64d3893fa985","resolution":{"observed_at":"2026-07-09T23:06:37.544080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.520831Z","title":"Sample complexity of asynchronous q-learning: Sharper analysis and variance reduction.Advances in neural information processing systems, 33:7031–7043, 2020","venue":null,"work_id":"02878122-227b-417a-b7d1-358463fa26ef","year":2020},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:19ebdfc427e23df1c2a28779e3f9549eaa8d8e0ae2eabe9421deb48fc34ca54d","observation_id":"0487e0b8-1526-48f8-9c37-f4a48152808e","resolution":{"observed_at":"2026-07-09T23:06:37.522052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.531428Z","title":"From dirichlet to rubin: Optimistic exploration in rl without bonuses","venue":null,"work_id":"f0bf6eb7-20a0-4c76-9e4b-77ac844d3b5d","year":2022},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:21c643c4066d771d48824f721cae54dbdbea180a492826388f1f5fd101084c75","observation_id":"4493884f-f773-4eba-832e-1c6fd0507e4b","resolution":{"observed_at":"2026-07-09T23:06:37.532574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.539785Z","title":"Pac bounds for discounted mdps","venue":null,"work_id":"23394edc-b50c-4325-96a1-58bd6930080f","year":2012},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:011b8d482e8e6126753a997e835684bfc8d124ec63d24e68e99cb31056b90970","observation_id":"d468340e-52af-41dd-b1dd-b2e2251eb0b1","resolution":{"observed_at":"2026-07-09T23:06:37.540846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.628323Z","title":"Assouad, fano, and le cam","venue":null,"work_id":"452ab58d-9346-4b97-8cab-626562acbd1c","year":1997},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:0655ad013e4a7368f6ad95e466d15780a73f8289c25ebb5acdf7042150a48b8f","observation_id":"03ef91a2-a2c4-4a05-be39-4e6be5e7af6d","resolution":{"observed_at":"2026-07-09T23:06:37.629352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.556888Z","title":"Towards tight bounds on the sample complexity of average-reward mdps","venue":null,"work_id":"eb334873-d5bc-4f25-bf3c-6f5132e56011","year":null},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:9229fe52d52592410571f1aa07805889f9b4e9f34d9aa23fb98d7f895ff6b068","observation_id":"df529439-d5cf-4154-b3bb-2420c9b74978","resolution":{"observed_at":"2026-07-09T23:06:37.558089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.534694Z","title":"pages 17, 18","venue":null,"work_id":"1aa31185-70e5-4247-9e5a-e20c3116ff6d","year":2021},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:77e26ebe12a2c6b37babd1cd1b037b3766b922f08ca14b92276de61600a47191","observation_id":"43a93845-8091-4c44-b98a-ccbbf5f8f77a","resolution":{"observed_at":"2026-07-09T23:06:37.535734Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.497956Z","title":"Freedman’s inequality for matrix martingales","venue":null,"work_id":"5bad452e-d37f-4473-90ba-280834b6b242","year":2011},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:a5d888369f52f26025fe06454cda2268b27415b074e5adddea95336f587ba3c5","observation_id":"e3272491-4db6-4eea-8e57-369a0a88a7b1","resolution":{"observed_at":"2026-07-09T23:06:37.499104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.515751Z","title":"Is q-learning minimax optimal? a tight sample complexity analysis.Operations Research, 72(1): 222–236, 2024","venue":null,"work_id":"c25d887c-d6f6-4357-9cba-dffb17db313e","year":2024},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:ba69df24fb81591ba215a095a3c8a61150cf3c8b8eccbc1c164b38e9b274f2cf","observation_id":"14c9d5ae-ad9d-41aa-a718-6799b0080122","resolution":{"observed_at":"2026-07-09T23:06:37.517104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.06265","last_updated":"2019-06-24T17:09:55Z","snapshot_observed_at":"2026-08-16T08:39:16.101139Z","submitted_at":"2019-05-15T16:06:30Z","title":"Stochastic approximation with cone-contractive operators: Sharp $\\ell_\\infty$-bounds for $Q$-learning","version":2},"cited_work":{"arxiv_id":"1905.06265","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.06265","snapshot_observed_at":"2026-07-09T22:56:37.754397Z","title":"Stochastic approximation with cone-contractive operators: Sharp $\\ell_\\infty$-bounds for $Q$-learning","venue":"cs.LG","work_id":"493446c0-0206-4c59-8a76-c5c0886192b1","year":2019},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"cited_paper":"/paper/1905.06265","citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:f1a427b97168a652a25138f54c79dec01510605846ed553b365c53488ada4d6c","observation_id":"ce3c1e5a-e422-4beb-b2a8-c467b44733cf","resolution":{"observed_at":"2026-07-09T22:56:37.755639Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.527911Z","title":"Finite-sample convergence rates for q-learning and indirect algorithms.Advances in neural information processing systems, 11, 1998","venue":null,"work_id":"413a7b54-dd4d-4f24-9347-56d7df1c622f","year":1998},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:e06e6cf67c565174ec5b80dbd44ac749441838f74c276cb39bbc6f3e513cc236","observation_id":"4c92c3c3-4836-42e6-9c2c-7c45aecd9f16","resolution":{"observed_at":"2026-07-09T23:06:37.529072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.499635Z","title":"A statistical analysis of polyak-ruppert averaged q-learning","venue":null,"work_id":"da115b34-b0a9-4b36-948c-0da5cae6a6b1","year":2023},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:b141fb210283c330f37353dab460d5a09e0a1a81fa88979543d1fcd2c294ac6d","observation_id":"e0b3c3f8-23c4-41e9-8d6d-655bff861b99","resolution":{"observed_at":"2026-07-09T23:06:37.500740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.04697","last_updated":"2019-08-08T17:33:58Z","snapshot_observed_at":"2026-08-14T16:17:20.489041Z","submitted_at":"2019-06-11T16:58:54Z","title":"Variance-reduced $Q$-learning is minimax optimal","version":2},"cited_work":{"arxiv_id":"1906.04697","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.04697","snapshot_observed_at":"2026-07-09T22:56:37.735104Z","title":"Variance-reduced q-learning is minimax optimal","venue":"cs.LG","work_id":"60497a6e-266a-42d8-9dd6-acc8d3171cc4","year":2019},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"cited_paper":"/paper/1906.04697","citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:08b7974bc1dd6cde08f9352d93b235838271620526179d290e58e1183a96a017","observation_id":"9f6c1b55-1e44-4b51-b1d4-082933adde0a","resolution":{"observed_at":"2026-07-09T22:56:37.736273Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.503049Z","title":"Randomized linear programming solves the markov decision problem in nearly linear (sometimes sublinear) time.Mathematics of Operations Research, 45 (2):517–546, 2020","venue":null,"work_id":"585c2b09-d2fd-4233-b4b5-683698917e67","year":2020},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:d5fdc3c7953e2b6fafe6d078760ace1f6ef6a8abe3aeadc666a840f54cff7014","observation_id":"feb90f15-4dac-4b57-bfa7-c55160ea031b","resolution":{"observed_at":"2026-07-09T23:06:37.504323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:56:37.501871Z","title":"Efficiently solving mdps with stochastic mirror descent","venue":null,"work_id":"c279e1db-663f-4e0b-98a6-101b0df8a0fb","year":2020},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:53478d92baea68dddbcef081920e4aec332d27330fd760136b95135ca186f6a7","observation_id":"2e0b7dab-3863-4abd-9700-f2acaced553d","resolution":{"observed_at":"2026-07-09T22:56:37.502992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.604036Z","title":"Solving matrix games with near-optimal matvec complexity.arXiv e-prints, pages arXiv–2601, 2026","venue":null,"work_id":"83b127df-4bed-4abb-9cf8-5e4ba159a65e","year":2026},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:6e2c5e3c1eacb2531dece16ea2fccc78aeda4bc3daaff8931b5708de0d2d0b08","observation_id":"bd3b8edd-bdc9-461a-9a3d-e6a4e7b5c7e3","resolution":{"observed_at":"2026-07-09T23:06:37.605225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.576673Z","title":"Minimumcostflows, mdps, andℓ1-regressioninnearlylinear time for dense instances","venue":null,"work_id":"f58c8868-2a63-4763-b2bc-4c8cc5d3816c","year":2021},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:679c964123a404466f329ee8eaad017846bf0c3c6c9c7c49ff12d4843d191825","observation_id":"fec0dc65-3bd8-4650-b840-7325450d65b3","resolution":{"observed_at":"2026-07-09T23:06:37.577819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.578338Z","title":"Efficient global planning in large mdps via stochas- tic primal-dual optimization","venue":null,"work_id":"f8fe0b6f-726b-4afe-bd2f-aa05ef77e864","year":2023},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:947c033a3d56be72234a67a80e6fd4b4ad23b82e1ff07899b8eaee27fe91c018","observation_id":"6ad6faa2-2f65-49c6-8c8c-e0f01027688e","resolution":{"observed_at":"2026-07-09T23:06:37.579458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.615992Z","title":"Tight high probability bounds for linear stochastic approximation with fixed stepsize.Advances in Neural Information Processing Systems, 34:30063–30074,","venue":null,"work_id":"07fbdfc1-484b-466b-97ba-66424ec919a6","year":null},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:c214d639671d5162d96e8a33c876e34789817f02abee3a7e667c133192737dc3","observation_id":"d98744b4-1240-4078-a40c-33ffb1653502","resolution":{"observed_at":"2026-07-09T23:06:37.617443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.571804Z","title":"Statistical inferenceforlinearstochasticapproximationwithmarkoviannoise.Advances in Neural Information Processing Systems, 38:174565–174626, 2026","venue":null,"work_id":"0115fa4d-8a54-42d6-990f-10fbe1b9ad7a","year":2026},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:fe0807d701e4aef73e76cef13d485b6afe6ca453cce49d7dc3224744a5d6b317","observation_id":"d9a65bc3-ddaf-4f36-9980-b3134b9e1a5e","resolution":{"observed_at":"2026-07-09T23:06:37.572970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.525979Z","title":"Finite-time high-probability bounds for polyak–ruppert averaged iterates of linear stochastic ap- proximation.Mathematics of Operations Research, 50(2):935–964, 2025","venue":null,"work_id":"da77de5e-4446-4ab1-8e09-8cc533e2a506","year":2025},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:18e0def3bcc2e9e08bbaff18684fec81c03e5f4922fd8dd54f9c261a71087459","observation_id":"863847bc-a59a-4fd4-8e9a-07ad930a98f9","resolution":{"observed_at":"2026-07-09T23:06:37.527414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.634967Z","title":"Learning to predict by the methods of temporal differences","venue":null,"work_id":"d6d81b13-7c0b-4c32-82d4-9f050d1fdcd5","year":1988},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:d80f2e3d0f10ce49710543b66b3c6753af791171177334c6d7f8bfb2e09557d6","observation_id":"02e7238c-bee3-44b2-9004-eb6d39afb31a","resolution":{"observed_at":"2026-07-09T23:06:37.636237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.626666Z","title":"Improved high-probability bounds for the temporal difference learning algorithm via exponential stability","venue":null,"work_id":"3f371a59-3afc-4a3f-ab0e-b7a5bfe0ae7d","year":null},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:efeb4ed5ba64a24f30bf79a7228bc8ec62c6c77f3c3ffb05c1bb2816fd882d73","observation_id":"bfb97434-0e1c-4dd3-a150-90249a079648","resolution":{"observed_at":"2026-07-09T23:06:37.627821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.631494Z","title":"pages 28","venue":null,"work_id":"1fc4ebad-78c9-4146-af50-7768ffcd00fb","year":2024},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:30a13b9346c2aa4c84f3b2ccbe5d77b9fd14152496a1a645e82374bbc8006600","observation_id":"0a4bfb33-aabc-4e9c-9539-b06517c8d8f6","resolution":{"observed_at":"2026-07-09T23:06:37.632533Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.612667Z","title":"Residual algorithms: Reinforcement learning with function approx- imation","venue":null,"work_id":"35c97a91-3ef5-48b5-a434-e3a1e587b409","year":1995},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:f3f78b3599eebe152e6ab600360d531a982db981797f1593a8a064bf9666be5f","observation_id":"ef7e5892-8397-48f7-8764-622c5dcfcec8","resolution":{"observed_at":"2026-07-09T23:06:37.613814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.558606Z","title":"A convergento(n)temporal- difference algorithm for off-policy learning with linear function approximation.Ad- vances in neural information processing systems, 21, 2008","venue":null,"work_id":"70817361-fac9-4d67-b00f-f43834ba16f6","year":2008},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:4d8a75fc9df0efaef633d92e68667d8504079292ecc86c15fce9e3689b57814a","observation_id":"a5451273-2d1f-47dd-9455-1dbcb9cc0c3a","resolution":{"observed_at":"2026-07-09T23:06:37.559853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.586926Z","title":"S Sutton, Hamid Reza Maei, Doina Precup, Shalabh Bhatnagar, David Silver, Csaba Szepesvári, and E","venue":null,"work_id":"f804933c-5936-46ab-8302-3d480ecb7d3a","year":2009},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:eba2c5d8406a790f8a13fba67f4f028c825376524c0eca7df98800eaa74ee351","observation_id":"58568cbb-93ce-4db7-81e0-575fa443bc02","resolution":{"observed_at":"2026-07-09T23:06:37.588139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.561915Z","title":"Gaussian approximation for two-timescale linear stochastic approximation","venue":null,"work_id":"e2dcb026-c062-41a7-b46c-f090ce8e9dca","year":2026},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:2c8de637878f1c3f5fe19d70c04d809c2d5d8b312bf40e1e6d35174ca084ad8f","observation_id":"c87c284a-cceb-44e7-8b02-e9540456c859","resolution":{"observed_at":"2026-07-09T23:06:37.563024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.585196Z","title":"Some aspects of the sequential design of experiments.Bulletin of the American Mathematical Society, 58(5):527–535, 1952","venue":null,"work_id":"b942dd1c-e1e4-4ba1-80c8-729b0476822b","year":1952},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:7ea4e9f5d11cb58854160b3a34ba4373fc914fe1886e51d1fba9175c1df80530","observation_id":"e41f464a-319b-49fc-a105-45a192fac53e","resolution":{"observed_at":"2026-07-09T23:06:37.586393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.588815Z","title":"Introduction to multi-armed bandits.Foundations and Trends in Machine Learning, 12(1-2):1–286, 2019","venue":null,"work_id":"f2614cfa-b49c-4fb1-9f6a-e01c03af2c89","year":2019},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:6af9fa9fb1b6ff6dcd4142235390f11f547ba8ce921ca6e32a4f7311fe541d5f","observation_id":"7b959147-979c-4d20-9f6a-c3687757c0bf","resolution":{"observed_at":"2026-07-09T23:06:37.590019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.597268Z","title":"Regret analysis of stochastic and non- stochastic multi-armed bandit problems.Foundations and Trends in Machine Learn- ing, 5(1):1–122, 2012","venue":null,"work_id":"ee8eb969-b06d-4464-b96c-23a2ddb8e26b","year":2012},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:c59ed96d661896abc9daaeac87650ae732840fa3f58c515e6ce60d5055db3de0","observation_id":"23df21be-6c13-4283-ac22-b146bde277c6","resolution":{"observed_at":"2026-07-09T23:06:37.598532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.609427Z","title":"Asymptoticallyefficientadaptiveallocationrules","venue":null,"work_id":"3a4aca2a-ca08-4c1e-a3af-899c10b457e4","year":1985},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:3703d6c41bc74f4a6f78cd6b4b829616edf58ccc0c567a1634a8229af80cb692","observation_id":"47bc7bf8-28c9-4c32-9409-32c93948d2a8","resolution":{"observed_at":"2026-07-09T23:06:37.610463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.629842Z","title":"Finite-time analysis of the multi- armed bandit problem.Machine Learning, 47(2-3):235–256, 2002","venue":null,"work_id":"2b2cf573-99de-4e5d-8832-e954ccb28f8f","year":2002},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:82fd9c11aaad98ad82749ac419e5ceaabbb9eccb99f6a1952208b14f504b965c","observation_id":"2a30c6b4-4d98-45f2-a1d0-21d84d106c8e","resolution":{"observed_at":"2026-07-09T23:06:37.630993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.569984Z","title":"Onthelikelihoodthatoneunknownprobabilityexceedsanother in view of the evidence of two samples.Biometrika, 25(3/4):285–294, 1933","venue":null,"work_id":"bccdd248-7f6a-4561-ad60-912c873523ae","year":1933},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:d669da83efa0980fd8f234488eb14db3c2ee27e986a0d0396cd115c2b16d02d5","observation_id":"e6d3077f-f3c9-49ff-a166-00df0f9538d1","resolution":{"observed_at":"2026-07-09T23:06:37.571273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.581701Z","title":"A tutorial on thompson sampling.Foundations and Trends®in Machine Learning, 11(1):1–96,","venue":null,"work_id":"d047e780-c3a7-45de-b79e-978bdabc347e","year":null},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:4d27655650899d7e014b1fff996c6c91e66055b39c1c6ad224bf181c0562d4ca","observation_id":"29f09b7d-f6e8-4f16-b3d6-9a49501a13c5","resolution":{"observed_at":"2026-07-09T23:06:37.582894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.566901Z","title":"Cambridge University Press,","venue":null,"work_id":"090e3089-9281-4d18-88de-193d61c5a403","year":null},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:c25a6aa8bacde7be3c3b41692cf7aa89553d0fdf80ec22e0cd6c5fdc5b7ec1cc","observation_id":"e2f8921d-b4fd-4696-be06-b55b748311c8","resolution":{"observed_at":"2026-07-09T23:06:37.568008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.595655Z","title":"An empirical evaluation of thompson sampling.Ad- vances in neural information processing systems, 24, 2011","venue":null,"work_id":"0e38e737-a7df-4767-8cf0-e0c3b2a3be42","year":2011},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:852beea8234e41c68b8a395bdfdd8b1193abdb11fbd9feb0d38209ebcde49343","observation_id":"efca1d98-2947-4f77-9b0e-b9d756863152","resolution":{"observed_at":"2026-07-09T23:06:37.596758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.573436Z","title":"Further optimal regret bounds for thompson sam- pling","venue":null,"work_id":"dda6d841-9a77-4412-98be-5a6715e5369a","year":2017},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:45cc158dafd68e74553aba8e1b305977d627ffc9de5bf975e1181a5941eb8e42","observation_id":"d423b61c-bdb3-4f7e-94ee-efa0dbf881b9","resolution":{"observed_at":"2026-07-09T23:06:37.574497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.551619Z","title":"Analysis of thompson sampling for the multi-armed bandit problem","venue":null,"work_id":"673953eb-cdfb-458d-b0db-78afc7530401","year":2012},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:2bdf82fd1cb4c2eca3f72c4e4ae27dbeac4930b509ea3d038c96158c3fba5584","observation_id":"3c3b4746-6292-457a-92ed-0c14e1feec65","resolution":{"observed_at":"2026-07-09T23:06:37.552759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1204.5721","last_updated":"2012-11-03T18:50:58Z","snapshot_observed_at":"2026-08-15T04:11:56.160249Z","submitted_at":"2012-04-25T18:04:32Z","title":"Regret Analysis of Stochastic and Nonstochastic Multi-armed Bandit Problems","version":2},"cited_work":{"arxiv_id":"1204.5721","doi":null,"metadata_source":"pith","pith_arxiv_id":"1204.5721","snapshot_observed_at":"2026-07-09T22:56:37.732571Z","title":"Regret Analysis of Stochastic and Nonstochastic Multi-armed Bandit Problems","venue":"cs.LG","work_id":"23dc072b-2841-4976-b6a1-ca161bf9a937","year":2012},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"cited_paper":"/paper/1204.5721","citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:a33eb6935c1a0f777214ac31418e4ef23006b53fffc258a243133ff1b4576c7e","observation_id":"38ea0d67-7489-4b00-a8eb-0af066c4cb07","resolution":{"observed_at":"2026-07-09T22:56:37.733876Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.553273Z","title":"Episodic reinforcement learning in finite mdps: Minimax lower bounds revisited","venue":null,"work_id":"e07d0c8d-4379-43e3-8a20-adad1910baab","year":2021},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:e4350adca479f547ee88de72c8f694e00b8815b4c0d07c59e4bb131401954976","observation_id":"a2a1c426-57ee-474a-b6ba-4300d2ed6a4e","resolution":{"observed_at":"2026-07-09T23:06:37.554424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.590541Z","title":"Near-optimal regret bounds for reinforcement learning.Journal of Machine Learning Research, 11:1563–1600, 2010","venue":null,"work_id":"f33ab795-521e-4de1-91c4-defacb9c9fcd","year":2010},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:f5cd22f5366e61f1ab781bd84a3f3bbd23f747064259f222bf06b249741c2b24","observation_id":"979c3d86-060e-44e1-af69-b9d76768720a","resolution":{"observed_at":"2026-07-09T23:06:37.591710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.611011Z","title":"A unifying view of optimism in episodic reinforce- ment learning","venue":null,"work_id":"1a04dc87-aa9c-4e28-8483-1e114c37d2ec","year":2020},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:c7cedf573230b5ae7262b63c3f395790b847243e97da31d4f9bc9fe9fb7bf48e","observation_id":"658b9dd7-2d3d-4471-b1b6-bfacffd5ecc0","resolution":{"observed_at":"2026-07-09T23:06:37.612156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.605810Z","title":"Minimax regret bounds for reinforcement learning","venue":null,"work_id":"24c87158-b1f6-4450-b5c7-84ea668bb622","year":2017},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:ea5ca71c008c2b78f6096dcea81f153e7d9bf9cd13c4cd3a12f9b44716d46032","observation_id":"f807cfed-f852-4d1f-b30b-0ed459468af8","resolution":{"observed_at":"2026-07-09T23:06:37.606967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.560381Z","title":"Rusu, Joel Veness, Marc G","venue":null,"work_id":"abcb42f3-5dcb-41b6-935e-08a6ef561d76","year":2015},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:09fc1936aa469f9b53b02d2bdafd6cefc013dd13d9fd2b1e94e295681495c2d8","observation_id":"52656bc2-427d-4740-8e89-23bada35e115","resolution":{"observed_at":"2026-07-09T23:06:37.561434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.592351Z","title":"Asynchronous methods for deep reinforcement learning","venue":null,"work_id":"838d0efa-3891-468e-b173-e431c19a9c92","year":1928},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:d02dac0c96d95b3a1acfebc7b59dd633323347cf8fc0b0ba4a7659d5a8b81678","observation_id":"f5001757-cc5a-44e4-83b6-102cd1caed61","resolution":{"observed_at":"2026-07-09T23:06:37.593511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.594057Z","title":"Trust region policy optimization","venue":null,"work_id":"a9138492-d8dc-42a0-999e-6976fc1c6e9e","year":2015},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:e5462bbf6d9482c87526d804d3e0dfc8e2cb8296883b24f4294eaf0cd5359ee3","observation_id":"2bc3cfb2-7dcf-4522-92ec-8d4245b58e78","resolution":{"observed_at":"2026-07-09T23:06:37.595136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:56:37.507073Z","title":"Generalization and exploration via randomized value functions","venue":null,"work_id":"98238da9-9a80-4c0e-9e8f-d9efedd94a0f","year":2016},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:1e1b81ba4ab3a8775c77095c5b659549b495c9421afa9cef6feede0787ca7ba2","observation_id":"fb2e76d8-792e-4984-bf33-350c04862815","resolution":{"observed_at":"2026-07-09T22:56:37.508406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.574989Z","title":"Is q-learning provably efficient?Advances in neural information processing systems, 31, 2018","venue":null,"work_id":"b51d583f-8968-48e1-b44a-f581492b98eb","year":2018},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:94311521572296073a7505b2e17328a8aca2ebb042e4afa52a474835773c68c7","observation_id":"5f7bc0a9-979f-42ac-b971-81f27e2b1922","resolution":{"observed_at":"2026-07-09T23:06:37.576159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.580003Z","title":"Almost optimal model-free reinforce- ment learningvia reference-advantage decomposition.Advances in Neural Information Processing Systems, 33:15198–15207, 2020","venue":null,"work_id":"b5c205d8-d609-4327-aa5e-11dbbc7d84e3","year":2020},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:32a5d7cbf130caa337aa2b9a609da8074acde86cb28942bcfd46227d8198c887","observation_id":"62b6891e-6bcc-4c72-84e4-ea8c406cacd2","resolution":{"observed_at":"2026-07-09T23:06:37.581204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.563542Z","title":"(more) efficient reinforcement learning via posterior sampling.Advances in Neural Information Processing Systems, 26, 2013","venue":null,"work_id":"90eb3041-50a9-4161-ad53-3c2aaa5dcc54","year":2013},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:0e0e7cd257869099867815dfabbb1a0d4f194c94c366206f1b513d53195f8d6d","observation_id":"4c2dc31f-1b9f-47a1-9fd4-518414f1f8ca","resolution":{"observed_at":"2026-07-09T23:06:37.564706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.621592Z","title":"Optimistic posterior sampling for reinforcement learn- ing: Worst-caseregretbounds","venue":null,"work_id":"4615cf07-3a85-4c8f-bce2-b6f59a686a45","year":2017},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:a883edbd6c05507c68f31f5133ddb0c5b052cf03b6dad3969159ee854149408f","observation_id":"43600ac8-cd84-486c-b1a9-c8c9a9d5e4ae","resolution":{"observed_at":"2026-07-09T23:06:37.622702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.517675Z","title":"Optimistic pos- terior sampling for reinforcement learning with few samples and tight guarantees","venue":null,"work_id":"65bdcdbf-98bc-4a4b-92ea-cdc3f0b60242","year":2022},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:88dd0023542873fb940e00629f4a75ba802be6ac276ee215c064cbda326b299a","observation_id":"b1a56240-a299-4146-b4a0-0f903b189cb8","resolution":{"observed_at":"2026-07-09T23:06:37.518797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.536243Z","title":"Deep exploration via randomized value functions.Journal of machine learning research, 20(124):1–62,","venue":null,"work_id":"0fa2a43f-b051-4413-8fbc-a2932fcebd12","year":null},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:6908b1155dc14d6fff388f5e031e8be1524d8b2a61ad03737430a9ff58e2639b","observation_id":"a52d8616-c9df-447f-85d0-ccdeea1502c1","resolution":{"observed_at":"2026-07-09T23:06:37.537575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.524262Z","title":"Worst-case regret bounds for exploration via randomized value func- tions.Advances in neural information processing systems, 32, 2019","venue":null,"work_id":"34300d6a-4057-4170-a23f-644581793066","year":2019},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:243e7e9f59ea01c0a2c3ef26825e29380c8e99be1f606e3dd0ac3c2f007a0160","observation_id":"c5f613ff-65f0-4b19-abbf-5344212064b4","resolution":{"observed_at":"2026-07-09T23:06:37.525461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.522557Z","title":"Improved worst-case regret bounds for randomized least-squares value iteration","venue":null,"work_id":"5db02273-7af4-4909-a43e-b5abaa5e9432","year":2021},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:0c450b3027868e3c86f05d2538e2104778e59b802d304f89b701ceba6143f375","observation_id":"ee221d4e-9358-46e7-8e9b-ff9a6167f679","resolution":{"observed_at":"2026-07-09T23:06:37.523757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.617957Z","title":"Near-optimal randomized exploration for tabular markov decision processes.Advances in neural information processing systems, 35:6358–6371, 2022","venue":null,"work_id":"340c5dbc-eabf-4071-baca-e8a8cc42bae2","year":2022},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:ee179897378b28f7e35464ec459fdc45a12b50a5e412ccc9eb25b9d41090a0de","observation_id":"8b7ce566-a3cb-43f5-b7ab-a007538120c3","resolution":{"observed_at":"2026-07-09T23:06:37.619182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.544605Z","title":"Finite-time bounds for fitted value iteration","venue":null,"work_id":"b1c4d273-f78e-47ca-857e-252af71ded44","year":2008},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:b3cc90c99f18fdc8b2086e4baea70f8d1fdd6ea7b3bebfb91d1f1ae46a62e3bf","observation_id":"fd5a70ac-0eba-40e5-a724-ef79cb96a95a","resolution":{"observed_at":"2026-07-09T23:06:37.545725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.538105Z","title":"Error bounds for approximate policy iteration","venue":null,"work_id":"b2b78589-812c-4899-9aa9-92143bd16ba5","year":2003},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:3eb5255fb7c9c958a4d96c2e54319faea575b9ae96da3abced34ad3672a7b738","observation_id":"4d41807c-a370-4f7a-8279-977d1e35412e","resolution":{"observed_at":"2026-07-09T23:06:37.539240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.607643Z","title":"Kernel-based reinforcement learning.Machine learn- ing, 49(2):161–178, 2002","venue":null,"work_id":"2970ae88-08dc-440a-b71e-4fd63b0045f1","year":2002},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:f78161480e09f5aa170d378f8a89e041bc1316cbdbfd855440ed5f6872a3ff97","observation_id":"cecc9e32-113b-4da4-9e6b-c1bc17acc3e6","resolution":{"observed_at":"2026-07-09T23:06:37.608890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.504856Z","title":"Kernel-based reinforcement learning: A finite-time analysis","venue":null,"work_id":"ac43d71b-6f77-42c7-a972-79e9d2a7f08d","year":2021},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:20a36fba8997f6f303695cce0ba748916c0763199f6b9aa5e9af5913ddcfdaf8","observation_id":"8cda6af4-4335-461f-a18d-36c3d25cfcdd","resolution":{"observed_at":"2026-07-09T23:06:37.506146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:56:38.248524Z","title":"Adaptive discretization for episodic reinforcement learning in metric spaces.Proceedings of the ACM on Measurement and Analysis of Computing Systems, 3(3):1–44, 2019","venue":null,"work_id":"48678f41-0138-4d35-8f3d-414af3474300","year":2019},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:6b412a4eb867770dae7ab7c5dbf965b8c7eb65852d71aaf318d1b497c2b0c799","observation_id":"99c9189c-d339-4b0c-8a72-91fb4b45f762","resolution":{"observed_at":"2026-07-09T22:56:38.249924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:56:38.246366Z","title":"Provably efficient reinforcement learning with linear function approximation","venue":null,"work_id":"45605fba-4b4d-4926-8f25-559fcf06837f","year":2020},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:c4d0359a2f08eb272a482f3b9bcffb217be72a4a16f6bcdbd7cc5075c20b0d3b","observation_id":"d0d4ad1a-f395-4342-a425-e3f90a0f01a5","resolution":{"observed_at":"2026-07-09T22:56:38.247742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:56:38.250657Z","title":"Linear least-squares algorithms for temporal difference learning.Machine learning, 22(1):33–57, 1996","venue":null,"work_id":"70f2cc0e-e7d0-4082-8f18-8327f3ec3b1a","year":1996},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:738877686b6b0cc26b2b34eed18dbb0187ec8e9c854a010005094983de1622fb","observation_id":"c462ef11-47a3-4f1e-bd2c-9c342e4f963a","resolution":{"observed_at":"2026-07-09T22:56:38.251963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.neunet.2008.02.003","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning of motor skills with policy gradients.Neural Networks, 21:682–697, 2008","venue":"Neural Networks","work_id":"bd9fef8f-2f89-4183-b17c-07f7c5954926","year":2008},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:8f7c906edafd46193dc064651f2f3b6db3716c7f6e2c6556f02d18ba22840cd3","observation_id":"2d142eb7-5900-4cab-b928-4404be97753c","resolution":{"observed_at":"2026-07-09T22:56:37.583878Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:56:38.243513Z","title":"Williams","venue":null,"work_id":"1cf2d128-4636-4581-a778-e3a27ea7dc73","year":1992},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:8e2d23035784f72fafc9753d72239339fbc993689e4bd9a584ec4896367d0063","observation_id":"221dcbd7-c929-41e7-828b-9211b9e2bb69","resolution":{"observed_at":"2026-07-09T22:56:38.244791Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1137/s0363012901385691","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Konda and John N","venue":"SIAM Journal on Control and Optimization","work_id":"5a559c6d-b8de-42ea-b975-38f4c29aba8f","year":2003},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:b62c04fe4656b2f2c2d9a2f63f9f215f72e3926ee7e4f51411c2fd077d07389c","observation_id":"326af9d8-7ac9-4992-bebb-6aece3e97238","resolution":{"observed_at":"2026-07-09T22:56:37.595607Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-17T22:38:20.415239+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-17T22:38:20.415239+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.neucom.2007.11.026","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neurocomputing , volume =","venue":"Neurocomputing","work_id":"ff9d19c3-eded-4198-bcfd-627eb62aa779","year":2008},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:be540de837b19369caaca931f31832525ed9fa2a7ca1a580463c9e4492eb9e7e","observation_id":"808f8a33-eef2-446c-9f53-1c5fda42994a","resolution":{"observed_at":"2026-07-09T22:56:37.579375Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-05-21T21:22:37.901973+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T21:22:37.901973+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2017.274324","doi":"10.1109/msp.2017.2743240","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Arulkumaran, M","venue":"IEEE Signal Processing Magazine","work_id":"32330520-c18e-469e-b5a8-92c229565fa7","year":2017},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:209c3164be33d894be1756e76ec4c97f6948b9ffb8d6293efe881e2ad535aae0","observation_id":"5672a2f2-c10d-4a5d-bd8f-30cc7aa3bdeb","resolution":{"observed_at":"2026-07-09T22:56:37.588235Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-13T17:19:52.329569+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T17:19:52.329569+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.127716","doi":"10.1016/j.neucom.2024.127716","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Trust region policy opti- mization via entropy regularization for Kullback–Leibler divergence constraint.Neu- rocomputing, 589:127716, 2024","venue":"Neurocomputing","work_id":"f0838d98-6d2c-46f9-b5a5-8be4e14ed8bf","year":2024},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:76b422d3740c2fe6bfae8abfe460440a0bce8dbeeb1c029191100a2d30fbce42","observation_id":"24823e60-4c89-4f5a-b96b-bdefb12188c6","resolution":{"observed_at":"2026-07-09T22:56:37.582084Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s10107-022-01816-5","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Policy mirror descent for reinforcement learning: Linear convergence, new sampling complexity, and generalized problem classes.Mathematical Program- ming, 198(1):1059–1106, 2023","venue":"Mathematical Programming","work_id":"d6857c11-6796-4518-aa23-e7823ae79e96","year":2023},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:d8bb3403505fb32b731cb58db04d991cff6690829a14c131e4c4931f92bb8ed9","observation_id":"c501ec6a-0c56-43ba-b1f9-526212f30e55","resolution":{"observed_at":"2026-07-09T22:56:37.585701Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:a02ae3f7fc04332c38b8df577c3a71db09a931d76ac66bb09935cf5106d59f50","observation_id":"d760a2a1-0f15-48a9-ad3c-69d5e7d59b67","resolution":{"observed_at":"2026-07-09T22:56:37.772074Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:06:37.549818Z","title":"Improving proximal policy optimization with alpha divergence.Neurocomputing, 534:94–105,","venue":null,"work_id":"c0e7c7b9-6c7a-49c0-83be-0b52b9c172dd","year":null},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:0458be4788d5c359116d0cee614de6332340a107233e5f9553f22a03aa0a5261","observation_id":"979c69d2-4ca7-4ef3-b852-00ca17d33eeb","resolution":{"observed_at":"2026-07-09T23:06:37.551094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.neucom.2023.02.008","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"pages 54","venue":"Neurocomputing","work_id":"e185d57b-365c-4889-8580-37c9ece7091d","year":2023},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:d3ab78ff00468e1d784cecfe7ae40f765d5e9c7c3581883ef3bda6463a5711a5","observation_id":"4e4ac8e6-8628-4fe0-ad4a-87600a2dfaae","resolution":{"observed_at":"2026-07-09T22:56:37.597170Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.02507","last_updated":"2026-04-02T21:04:17Z","snapshot_observed_at":"2026-08-17T03:26:47.644850Z","submitted_at":"2026-04-02T21:04:17Z","title":"Reinforcement Learning from Human Feedback: A Statistical Perspective","version":1},"cited_work":{"arxiv_id":"2604.02507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.02507","snapshot_observed_at":"2026-07-09T22:56:37.790235Z","title":"Reinforcement Learning from Human Feedback: A Statistical Perspective","venue":"stat.ML","work_id":"09426690-b6e7-4204-aa16-d1ec44ec47f3","year":2026},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"cited_paper":"/paper/2604.02507","citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:acdf9cf1330574b943acbaf145f9c9dcfa764dab3908eca8bbb324b1d4e6c443","observation_id":"89263e8a-a2e3-4f87-ae49-77870af71df6","resolution":{"observed_at":"2026-07-09T22:56:37.791390Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12034","last_updated":"2024-02-19T10:42:34Z","snapshot_observed_at":"2026-08-16T14:17:23.208474Z","submitted_at":"2024-02-19T10:42:34Z","title":"When Do Off-Policy and On-Policy Policy Gradient Methods Align?","version":1},"cited_work":{"arxiv_id":"2402.12034","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.12034","snapshot_observed_at":"2026-07-09T22:56:37.783147Z","title":"When Do Off-Policy and On-Policy Policy Gradient Methods Align?","venue":"stat.ML","work_id":"9ea7db58-bd67-437c-b28b-264a44a2491e","year":2024},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"cited_paper":"/paper/2402.12034","citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:8bf2d721e864af6ea80fe693046fb853bb9201c90f1cdbd6d1c52f1c5ddf4767","observation_id":"110d358f-45d6-4fc6-a555-e67f35b831ad","resolution":{"observed_at":"2026-07-09T22:56:37.784291Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","latest_version":1,"primary_category":"math.OC","snapshot_observed_at":"2026-08-12T22:38:38.255404Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":1,"metadata_mismatch":2,"parse_uncertain":2,"unresolved":1,"verified_exact":15,"verified_fuzzy":79},"total_outbound_references":125},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 100 of 125 outbound references and 0 inbound Pith citation observations for arXiv:2607.06935."}