{"as_of":"2026-08-10T13:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3821750b9d9d7e446d4e78369ac76a09094c6cccd0ce74372a729cc7f66870da","coverage":[{"denominator":11,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:41:53.055380Z","state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.18064/citation-record","integrity":"/paper/2505.18064/integrity","json":"/paper/2505.18064/citation-record.json","paper":"/paper/2505.18064"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.13013","last_updated":"2025-01-22T16:56:42Z","snapshot_observed_at":"2026-08-06T04:47:40.931727Z","submitted_at":"2025-01-22T16:56:42Z","title":"The regret lower bound for communicating Markov Decision Processes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13013","snapshot_observed_at":"2026-08-07T14:41:52.317140Z","title":"_eprint: 2501.13013","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18064","last_updated":"2025-05-23T16:11:39Z","snapshot_observed_at":"2026-08-09T14:21:57.411902Z","submitted_at":"2025-05-23T16:11:39Z","title":"Asymptotically optimal regret in communicating Markov decision processes","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:41:52.317140Z"},"links":{"cited_paper":"/paper/2501.13013","citing_paper":"/paper/2505.18064"},"observation_digest":"sha256:0961246376205965c3a8a5497f3933d5d5659a80b1eae72e1b81fea7f8bc6c2b","observation_id":"b97480b8-281b-492d-a57e-531ff7779aa3","resolution":{"observed_at":"2026-08-07T14:41:52.317140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1205.4217","last_updated":"2012-07-19T13:59:13Z","snapshot_observed_at":"2026-07-06T02:48:21.680156Z","submitted_at":"2012-05-18T19:00:51Z","title":"Thompson Sampling: An Asymptotically Optimal Finite Time Analysis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1205.4217","snapshot_observed_at":"2026-08-07T14:41:52.699755Z","title":"arXiv: 1205.4217","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18064","last_updated":"2025-05-23T16:11:39Z","snapshot_observed_at":"2026-08-09T14:21:57.411902Z","submitted_at":"2025-05-23T16:11:39Z","title":"Asymptotically optimal regret in communicating Markov decision processes","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:41:52.699755Z"},"links":{"cited_paper":"/paper/1205.4217","citing_paper":"/paper/2505.18064"},"observation_digest":"sha256:25374a457024d0b2250ae81fcb14a73cdcff96fdfcc7a710abbbf4ae3f74725a","observation_id":"c1177cdb-2798-4a64-9447-616a5d833687","resolution":{"observed_at":"2026-08-07T14:41:52.699755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.12425","last_updated":"2019-12-11T18:01:23Z","snapshot_observed_at":"2026-08-09T09:03:14.982810Z","submitted_at":"2019-05-27T20:15:54Z","title":"Near-optimal Optimistic Reinforcement Learning using Empirical Bernstein Inequalities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.12425","snapshot_observed_at":"2026-08-07T14:41:52.867553Z","title":"Damianos Tranos and Alexandre Proutiere","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2505.18064","last_updated":"2025-05-23T16:11:39Z","snapshot_observed_at":"2026-08-09T14:21:57.411902Z","submitted_at":"2025-05-23T16:11:39Z","title":"Asymptotically optimal regret in communicating Markov decision processes","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:41:52.867553Z"},"links":{"cited_paper":"/paper/1905.12425","citing_paper":"/paper/2505.18064"},"observation_digest":"sha256:d66ac587d58d4aafbb23b97cbb4da42770edbd62347d41c3474334a74d2fe978","observation_id":"59780be3-1494-4337-9bc4-08bd81a43143","resolution":{"observed_at":"2026-08-07T14:41:52.867553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:41:54.162726Z","title":"2 2.1.1 Randomized policies, their gain, bias & gap functions","venue":null,"work_id":"56fd613c-d3af-4419-8d96-edacf9989b7c","year":2025},"citing_paper":{"arxiv_id":"2505.18064","last_updated":"2025-05-23T16:11:39Z","snapshot_observed_at":"2026-08-09T14:21:57.411902Z","submitted_at":"2025-05-23T16:11:39Z","title":"Asymptotically optimal regret in communicating Markov decision processes","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:41:53.055380Z"},"links":{"citing_paper":"/paper/2505.18064"},"observation_digest":"sha256:35541cb2a85f97803e6b8287520a9642920d48b7e1d2db47565c74c22a5dae1f","observation_id":"c8f64276-0b8f-4855-882f-859cd0eab264","resolution":{"observed_at":"2026-08-07T14:41:54.230041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1988.19451","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:41:53.982846Z","title":"Shipra Agrawal and Navin Goyal","venue":null,"work_id":"3f7dc2c5-a2f2-4a07-bdb9-336fb7e66a27","year":1988},"citing_paper":{"arxiv_id":"2505.18064","last_updated":"2025-05-23T16:11:39Z","snapshot_observed_at":"2026-08-09T14:21:57.411902Z","submitted_at":"2025-05-23T16:11:39Z","title":"Asymptotically optimal regret in communicating Markov decision processes","version":1},"reference_index":1988,"source":"pdf_text","source_observed_at":"2026-08-07T14:41:52.015182Z"},"links":{"citing_paper":"/paper/2505.18064"},"observation_digest":"sha256:722d6c4b23bbb5af72d683db7fdf021d837f414e4b99ab7b341600785012f1d7","observation_id":"4f545917-448a-4995-90a0-eae6717909f2","resolution":{"observed_at":"2026-08-07T14:41:54.076804Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:41:54.343108Z","title":"OptimisminReinforcementLearningand Kullback-Leibler Divergence.2010 48th Annual Allerton Conference on Communication, Control, and Computing (Allerton), pages 115–122, September","venue":null,"work_id":"2f2a087c-d171-43ab-b012-88725563665d","year":2010},"citing_paper":{"arxiv_id":"2505.18064","last_updated":"2025-05-23T16:11:39Z","snapshot_observed_at":"2026-08-09T14:21:57.411902Z","submitted_at":"2025-05-23T16:11:39Z","title":"Asymptotically optimal regret in communicating Markov decision processes","version":1},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-07T14:41:52.388109Z"},"links":{"citing_paper":"/paper/2505.18064"},"observation_digest":"sha256:b4eefce8cc616f00e930b271cd6d2bc28bba04d26b03a886bd37d0a546a77bac","observation_id":"e787acf3-7951-4e31-b64d-2be6d3e1ae14","resolution":{"observed_at":"2026-08-07T14:41:54.432856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1004.5229","last_updated":"2010-10-13T10:11:39Z","snapshot_observed_at":"2026-08-09T05:30:34.833731Z","submitted_at":"2010-04-29T09:31:55Z","title":"Optimism in Reinforcement Learning and Kullback-Leibler Divergence","version":3},"cited_work":{"arxiv_id":"1004.5229","doi":null,"metadata_source":"pith","pith_arxiv_id":"1004.5229","snapshot_observed_at":"2026-08-07T14:41:53.401042Z","title":"Optimism in Reinforcement Learning and Kullback-Leibler Divergence","venue":"cs.LG","work_id":"2a682b3c-01e1-4c3f-927f-d027601d1725","year":2010},"citing_paper":{"arxiv_id":"2505.18064","last_updated":"2025-05-23T16:11:39Z","snapshot_observed_at":"2026-08-09T14:21:57.411902Z","submitted_at":"2025-05-23T16:11:39Z","title":"Asymptotically optimal regret in communicating Markov decision processes","version":1},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-07T14:41:52.449262Z"},"links":{"cited_paper":"/paper/1004.5229","citing_paper":"/paper/2505.18064"},"observation_digest":"sha256:43361d447b268ffcc34b77df2e004e6da7258758c8c02a7503c81cf0450171cd","observation_id":"aa5e2e6b-1d62-480e-ada3-dfe14b0cbdb4","resolution":{"observed_at":"2026-08-07T14:41:53.465716Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1111.1797","last_updated":"2012-04-09T10:43:05Z","snapshot_observed_at":"2026-07-06T02:37:10.370619Z","submitted_at":"2011-11-08T04:27:01Z","title":"Analysis of Thompson Sampling for the multi-armed bandit problem","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1111.1797","snapshot_observed_at":"2026-08-07T14:41:52.078339Z","title":"arXiv:1111.1797 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18064","last_updated":"2025-05-23T16:11:39Z","snapshot_observed_at":"2026-08-09T14:21:57.411902Z","submitted_at":"2025-05-23T16:11:39Z","title":"Asymptotically optimal regret in communicating Markov decision processes","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-07T14:41:52.078339Z"},"links":{"cited_paper":"/paper/1111.1797","citing_paper":"/paper/2505.18064"},"observation_digest":"sha256:5262b53046052670b0bcf4f3114243c591e34efebe551a849af19110bb7f66bd","observation_id":"4dcb854f-c078-4950-baf7-133786970846","resolution":{"observed_at":"2026-08-07T14:41:52.078339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.05456","last_updated":"2020-07-10T15:52:21Z","snapshot_observed_at":"2026-08-07T18:46:44.111792Z","submitted_at":"2020-07-10T15:52:21Z","title":"Improved Analysis of UCRL2 with Empirical Bernstein Inequality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.05456","snapshot_observed_at":"2026-08-07T14:41:52.529881Z","title":"Improved Analysis of UCRL2 with Empirical Bernstein Inequality.ArXiv, abs/2007.05456,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2505.18064","last_updated":"2025-05-23T16:11:39Z","snapshot_observed_at":"2026-08-09T14:21:57.411902Z","submitted_at":"2025-05-23T16:11:39Z","title":"Asymptotically optimal regret in communicating Markov decision processes","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T14:41:52.529881Z"},"links":{"cited_paper":"/paper/2007.05456","citing_paper":"/paper/2505.18064"},"observation_digest":"sha256:fc2d6b1f329fc474f2194d8599b6914989941fd3ee0fa9e82b15694d520e0458","observation_id":"f77ad02a-93d7-4232-9cd3-b69d95b5a342","resolution":{"observed_at":"2026-08-07T14:41:52.529881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.14338","last_updated":"2021-06-27T23:41:57Z","snapshot_observed_at":"2026-07-06T11:23:33.794895Z","submitted_at":"2021-06-27T23:41:57Z","title":"Regret Analysis in Deterministic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2106.14338","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.14338","snapshot_observed_at":"2026-08-07T14:41:53.192836Z","title":"Regret Analysis in Deterministic Reinforcement Learning","venue":"cs.LG","work_id":"7867aa27-1fea-4fc6-93b8-92372ab9f1bd","year":2021},"citing_paper":{"arxiv_id":"2505.18064","last_updated":"2025-05-23T16:11:39Z","snapshot_observed_at":"2026-08-09T14:21:57.411902Z","submitted_at":"2025-05-23T16:11:39Z","title":"Asymptotically optimal regret in communicating Markov decision processes","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T14:41:52.936313Z"},"links":{"cited_paper":"/paper/2106.14338","citing_paper":"/paper/2505.18064"},"observation_digest":"sha256:1432a58807000d16117c030598d43b5be581e93fe6a33b70eb31ca90fcc3f89e","observation_id":"25ad5aad-bcea-4ec1-a0a9-b4747667d607","resolution":{"observed_at":"2026-08-07T14:41:53.279499Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.06480","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:41:53.747595Z","title":"_eprint: 2502.06480","venue":null,"work_id":"87976a89-f360-4d08-8951-462a41d7cb8f","year":null},"citing_paper":{"arxiv_id":"2505.18064","last_updated":"2025-05-23T16:11:39Z","snapshot_observed_at":"2026-08-09T14:21:57.411902Z","submitted_at":"2025-05-23T16:11:39Z","title":"Asymptotically optimal regret in communicating Markov decision processes","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T14:41:52.215124Z"},"links":{"citing_paper":"/paper/2505.18064"},"observation_digest":"sha256:7fe1657de55253912f965271b7f4bc17dd7f890f46531e22e338d6363cb1b28b","observation_id":"7f096932-4b03-4d01-afc6-f1398f33e713","resolution":{"observed_at":"2026-08-07T14:41:53.838157Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18064","last_updated":"2025-05-23T16:11:39Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T14:21:57.411902Z","submitted_at":"2025-05-23T16:11:39Z","title":"Asymptotically optimal regret in communicating Markov decision processes"},"reference_resolution":{"displayed":11,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":5,"verified_exact":2,"verified_fuzzy":2},"total_outbound_references":11},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 11 of 11 outbound references and 0 inbound Pith citation observations for arXiv:2505.18064."}