{"as_of":"2026-08-09T16:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:971d8d0a179c6380eaf0d58ef4207718974859dda44428cd4323f2e3401e5719","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:35:12.088553Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T17:18:43.049717Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.01302","last_updated":"2024-11-02T16:28:34Z","snapshot_observed_at":"2026-08-09T09:00:42.433938Z","submitted_at":"2024-11-02T16:28:34Z","title":"Regret of exploratory policy improvement and $q$-learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01302","snapshot_observed_at":"2026-08-07T14:35:12.088553Z","title":"Tang and X","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18529","last_updated":"2026-07-28T03:10:35Z","snapshot_observed_at":"2026-08-09T09:01:33.400232Z","submitted_at":"2025-05-24T05:47:23Z","title":"Beyond separability: convergence rate of vanishing viscosity approximations to mean field games via FBSDE stability","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:35:12.088553Z"},"links":{"cited_paper":"/paper/2411.01302","citing_paper":"/paper/2505.18529"},"observation_digest":"sha256:ca228808aac9900609dd635d1308e18ad22b933361fa1890322df36911430544","observation_id":"16902dd1-f9ca-46cb-999f-a6f9e1d98eef","resolution":{"observed_at":"2026-08-07T14:35:12.088553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01302","last_updated":"2024-11-02T16:28:34Z","snapshot_observed_at":"2026-08-09T09:00:42.433938Z","submitted_at":"2024-11-02T16:28:34Z","title":"Regret of exploratory policy improvement and $q$-learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01302","snapshot_observed_at":"2026-08-07T12:50:56.214175Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23541","last_updated":"2025-06-16T08:53:57Z","snapshot_observed_at":"2026-08-09T09:01:33.826451Z","submitted_at":"2025-05-29T15:21:06Z","title":"Upper and lower bounds for local Lipschitz stability of Bayesian posteriors","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:56.214175Z"},"links":{"cited_paper":"/paper/2411.01302","citing_paper":"/paper/2505.23541"},"observation_digest":"sha256:ce1b206bbb05c87d34213a1e44db2810e0b1b186be43670895f702b1dbdac584","observation_id":"1ee90eef-f7da-4936-9625-53dedca82274","resolution":{"observed_at":"2026-08-07T12:50:56.214175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01302","last_updated":"2024-11-02T16:28:34Z","snapshot_observed_at":"2026-08-09T09:00:42.433938Z","submitted_at":"2024-11-02T16:28:34Z","title":"Regret of exploratory policy improvement and $q$-learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01302","snapshot_observed_at":"2026-08-06T21:33:38.321579Z","title":"Regret of exploratory policy improvement and q-learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:38.321579Z"},"links":{"cited_paper":"/paper/2411.01302","citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:a902bdd953c7f427d639710f1a4e4423ea40082f5b56bfc0e99ff05509e8882c","observation_id":"8fcc4cb7-4208-41ba-83b1-a123ac4ebeb2","resolution":{"observed_at":"2026-08-06T21:33:38.321579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01302","last_updated":"2024-11-02T16:28:34Z","snapshot_observed_at":"2026-08-09T09:00:42.433938Z","submitted_at":"2024-11-02T16:28:34Z","title":"Regret of exploratory policy improvement and $q$-learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01302","snapshot_observed_at":"2026-08-03T18:40:33.523529Z","title":"Tang and X","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.04697","last_updated":"2026-07-30T02:52:31Z","snapshot_observed_at":"2026-08-08T07:29:46.503525Z","submitted_at":"2025-12-04T11:48:07Z","title":"Continuous-time reinforcement learning for optimal switching over multiple regimes","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T18:40:33.523529Z"},"links":{"cited_paper":"/paper/2411.01302","citing_paper":"/paper/2512.04697"},"observation_digest":"sha256:4951ac7a8dd76d84ebe3e24e77ee9ffd73a771bcf950e673079af0ad1a3d6cdd","observation_id":"aa758c4c-9bfa-4c24-a10a-f3f9ce6b2f26","resolution":{"observed_at":"2026-08-03T18:40:33.523529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01302","last_updated":"2024-11-02T16:28:34Z","snapshot_observed_at":"2026-08-09T09:00:42.433938Z","submitted_at":"2024-11-02T16:28:34Z","title":"Regret of exploratory policy improvement and $q$-learning","version":1},"cited_work":{"arxiv_id":"2411.01302","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.01302","snapshot_observed_at":"2026-07-03T17:18:43.049717Z","title":"Wang, H., Zariphopoulou, T., and Zhou, X","venue":null,"work_id":"eb09a1d3-e966-4775-b2f7-3da4efd83484","year":2024},"citing_paper":{"arxiv_id":"2601.18681","last_updated":"2026-05-08T00:14:56Z","snapshot_observed_at":"2026-07-06T22:43:02.453697Z","submitted_at":"2026-01-26T16:56:40Z","title":"ART for Diffusion Sampling: A Reinforcement Learning Approach to Timestep Schedule","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T10:42:23.768313Z"},"links":{"cited_paper":"/paper/2411.01302","citing_paper":"/paper/2601.18681"},"observation_digest":"sha256:40adfca8687329345643348f08074875df0454389d79b32ff9e1ac318f575ebc","observation_id":"f992bf67-3ff9-4351-92c9-233dce063556","resolution":{"observed_at":"2026-05-16T10:42:45.291381Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01302","last_updated":"2024-11-02T16:28:34Z","snapshot_observed_at":"2026-08-09T09:00:42.433938Z","submitted_at":"2024-11-02T16:28:34Z","title":"Regret of exploratory policy improvement and $q$-learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01302","snapshot_observed_at":"2026-08-03T04:22:32.991605Z","title":"Tang and X","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.05533","last_updated":"2026-06-18T02:47:04Z","snapshot_observed_at":"2026-08-09T01:17:57.736271Z","submitted_at":"2026-02-05T10:46:20Z","title":"Conditional Diffusion Guidance under Hard Constraint: A Stochastic Analysis Approach","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-03T04:22:32.991605Z"},"links":{"cited_paper":"/paper/2411.01302","citing_paper":"/paper/2602.05533"},"observation_digest":"sha256:c52712a6fa938c2415d1dadc317162e3c7b413fa727e27753f1f0bfa2e45ff9c","observation_id":"0769ca52-5e5d-4178-af31-555dd1da43d9","resolution":{"observed_at":"2026-08-03T04:22:32.991605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01302","last_updated":"2024-11-02T16:28:34Z","snapshot_observed_at":"2026-08-09T09:00:42.433938Z","submitted_at":"2024-11-02T16:28:34Z","title":"Regret of exploratory policy improvement and $q$-learning","version":1},"cited_work":{"arxiv_id":"2411.01302","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.01302","snapshot_observed_at":"2026-07-03T17:18:43.049717Z","title":"Wang, H., Zariphopoulou, T., and Zhou, X","venue":null,"work_id":"eb09a1d3-e966-4775-b2f7-3da4efd83484","year":2024},"citing_paper":{"arxiv_id":"2605.13010","last_updated":"2026-05-13T05:02:47Z","snapshot_observed_at":"2026-08-03T02:37:11.973206Z","submitted_at":"2026-05-13T05:02:47Z","title":"Amortized Guidance for Image Inpainting with Pretrained Diffusion Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-14T19:33:27.641167Z"},"links":{"cited_paper":"/paper/2411.01302","citing_paper":"/paper/2605.13010"},"observation_digest":"sha256:151634a988a59fa572553688e1f7d31e22802249223439d0cd2952dcf695e907","observation_id":"d49273f0-8ba8-43eb-bdab-8fa3f4fd8fbc","resolution":{"observed_at":"2026-05-14T19:37:52.622190Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01302","last_updated":"2024-11-02T16:28:34Z","snapshot_observed_at":"2026-08-09T09:00:42.433938Z","submitted_at":"2024-11-02T16:28:34Z","title":"Regret of exploratory policy improvement and $q$-learning","version":1},"cited_work":{"arxiv_id":"2411.01302","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.01302","snapshot_observed_at":"2026-07-03T17:18:43.049717Z","title":"Wang, H., Zariphopoulou, T., and Zhou, X","venue":null,"work_id":"eb09a1d3-e966-4775-b2f7-3da4efd83484","year":2024},"citing_paper":{"arxiv_id":"2607.02137","last_updated":"2026-07-03T02:14:28Z","snapshot_observed_at":"2026-08-08T05:30:20.123996Z","submitted_at":"2026-07-02T13:13:19Z","title":"ART for Diffusion Sampling: Continuous-Time Control and Actor-Critic Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-03T17:14:04.821073Z"},"links":{"cited_paper":"/paper/2411.01302","citing_paper":"/paper/2607.02137"},"observation_digest":"sha256:7501792013304bdd2d5956794d4fd1587742a661c0c0067e4a6da4fdcf12a6d2","observation_id":"d3f5a2e7-5589-424f-b2e4-a564f8992746","resolution":{"observed_at":"2026-07-03T17:18:43.051182Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01302","last_updated":"2024-11-02T16:28:34Z","snapshot_observed_at":"2026-08-09T09:00:42.433938Z","submitted_at":"2024-11-02T16:28:34Z","title":"Regret of exploratory policy improvement and $q$-learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01302","snapshot_observed_at":"2026-07-12T08:25:48.021715Z","title":"Haoran Wang, Thaleia Zariphopoulou, and Xun Yu Zhou","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02137","last_updated":"2026-07-03T02:14:28Z","snapshot_observed_at":"2026-08-08T05:30:20.123996Z","submitted_at":"2026-07-02T13:13:19Z","title":"ART for Diffusion Sampling: Continuous-Time Control and Actor-Critic Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T08:25:48.021715Z"},"links":{"cited_paper":"/paper/2411.01302","citing_paper":"/paper/2607.02137"},"observation_digest":"sha256:ae81373ed47280a0096c441992af7f94a34fea0ff84c7e742b84caa0c01d0e89","observation_id":"74239336-d89e-431c-8d7b-b46b887269a7","resolution":{"observed_at":"2026-07-12T08:25:48.021715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01302","last_updated":"2024-11-02T16:28:34Z","snapshot_observed_at":"2026-08-09T09:00:42.433938Z","submitted_at":"2024-11-02T16:28:34Z","title":"Regret of exploratory policy improvement and $q$-learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01302","snapshot_observed_at":"2026-08-02T01:57:50.446846Z","title":"Wenpin Tang and Xun Yu Zhou","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14522","last_updated":"2026-07-16T03:19:53Z","snapshot_observed_at":"2026-08-09T09:01:09.929029Z","submitted_at":"2026-07-16T03:19:53Z","title":"A Continuous-Time Reinforcement Learning Framework for Fine-Tuning Discrete Diffusion Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T01:57:50.446846Z"},"links":{"cited_paper":"/paper/2411.01302","citing_paper":"/paper/2607.14522"},"observation_digest":"sha256:b2c3fab53e56cda527674d91f4bf7ca84104cf845968dbfe3854e5dc6cb21fb0","observation_id":"e94006f6-03e4-4e2e-963a-39107ecb0fa9","resolution":{"observed_at":"2026-08-02T01:57:50.446846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01302","last_updated":"2024-11-02T16:28:34Z","snapshot_observed_at":"2026-08-09T09:00:42.433938Z","submitted_at":"2024-11-02T16:28:34Z","title":"Regret of exploratory policy improvement and $q$-learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01302","snapshot_observed_at":"2026-08-01T11:22:20.704553Z","title":"Regret of exploratory policy improvement and q- learning.arXiv:2411.01302, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.704553Z"},"links":{"cited_paper":"/paper/2411.01302","citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:d92aa798b137dec79944024213991ba5aa8aedd837ddca70d95dc41826b56837","observation_id":"4c764ff7-65ef-41ed-ac5a-2d826cecf34a","resolution":{"observed_at":"2026-08-01T11:22:20.704553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.01302/citation-record","integrity":"/paper/2411.01302/integrity","json":"/paper/2411.01302/citation-record.json","paper":"/paper/2411.01302"},"outbound":[],"paper":{"arxiv_id":"2411.01302","last_updated":"2024-11-02T16:28:34Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T09:00:42.433938Z","submitted_at":"2024-11-02T16:28:34Z","title":"Regret of exploratory policy improvement and $q$-learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 11 inbound Pith citation observations for arXiv:2411.01302."}