{"as_of":"2026-08-10T09:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:78f522ebf0e9a4148bd8e4df332d3abc9fef10f6d003f017703f44487924019a","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:34:04.168498Z","state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.13862/citation-record","integrity":"/paper/2506.13862/integrity","json":"/paper/2506.13862/citation-record.json","paper":"/paper/2506.13862"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:06.364768Z","title":"single-task RL","venue":null,"work_id":"9d801594-b840-458d-b2d9-5cc2c92b22ce","year":2020},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-10T01:40:45.849259Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:03.294608Z"},"links":{"citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:a2258380e8cdd709073f199088a68801747249ba16ae11dbb7d3acc0bb8ec359","observation_id":"86109e89-1663-4981-a269-60bc7099eba2","resolution":{"observed_at":"2026-08-07T00:34:06.503389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:07.149431Z","title":null,"venue":null,"work_id":"f270a6b8-1011-47cd-91e3-8dc9d7cdb95a","year":2001},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-10T01:40:45.849259Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:02.894245Z"},"links":{"citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:bef3c6e9465d2cca622df87c3042fe115298cf44f79e1e766f7040ade13c8687","observation_id":"f7264f06-876d-4bf3-ac89-6f1a90f7d4ea","resolution":{"observed_at":"2026-08-07T00:34:07.288593Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:06.640689Z","title":null,"venue":null,"work_id":"1b091b71-9233-45e2-ac57-17c444391480","year":2018},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-10T01:40:45.849259Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:03.161264Z"},"links":{"citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:b94cca128e084079ce8f46dfa2e4af02311737601ade1abebe7f327dc9e7a1ca","observation_id":"bf13b061-6f02-4338-947f-3b3082204d4b","resolution":{"observed_at":"2026-08-07T00:34:06.730051Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.03176","last_updated":"2019-06-07T00:36:50Z","snapshot_observed_at":"2026-07-06T07:37:51.655095Z","submitted_at":"2019-03-07T20:34:36Z","title":"MinAtar: An Atari-Inspired Testbed for Thorough and Reproducible Reinforcement Learning Experiments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.03176","snapshot_observed_at":"2026-08-07T00:34:02.491366Z","title":"and Tian, T","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-10T01:40:45.849259Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:02.491366Z"},"links":{"cited_paper":"/paper/1903.03176","citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:fa01e9c0e2399038098e2c356c2de37f310d9982797eaafd3b1860667c086637","observation_id":"7014e099-0c24-42b9-a2c3-688f78ce2d9a","resolution":{"observed_at":"2026-08-07T00:34:02.491366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:07.422595Z","title":null,"venue":null,"work_id":"702d318e-cd6e-4918-88ef-88c53bd95aed","year":2019},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-10T01:40:45.849259Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:02.732844Z"},"links":{"citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:6d114978ca00506bca856728af0b5ab48d7128faf90b23bfa0af184feecee477","observation_id":"13004cb4-2553-452c-87f0-0eb8c1412822","resolution":{"observed_at":"2026-08-07T00:34:07.545576Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:06.122990Z","title":null,"venue":null,"work_id":"5ad1550f-46cb-4064-8908-ea6f962c7a24","year":2021},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-10T01:40:45.849259Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:03.429724Z"},"links":{"citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:d157d52d6b09e611e8d66957d31af539b62afa99ea234776cda7a099fa20f8ae","observation_id":"8bb50f7b-3cd9-4073-b96f-4cbeae8614ef","resolution":{"observed_at":"2026-08-07T00:34:06.224679Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:05.812486Z","title":"For PQN, we use the CleanRL implementation (Huang et al., 2022)","venue":null,"work_id":"f4b16bd2-078a-4d12-b2d0-3b6aa008fe5e","year":2019},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-10T01:40:45.849259Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:03.537326Z"},"links":{"citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:755ff3614d5a7cf69447b935252437bebad63df5ec78d8654da5221e77276e4c","observation_id":"c052211d-e640-432d-8c14-0d3c16cdc075","resolution":{"observed_at":"2026-08-07T00:34:05.917222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:05.602172Z","title":null,"venue":null,"work_id":"a2f6ef16-2c2e-4d6c-aa39-73f373ffa12a","year":null},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-10T01:40:45.849259Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:03.697384Z"},"links":{"citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:adb33f3ac25020a94769a22b7db136f07ccdaf7e3041a23833f9a169652fc1b6","observation_id":"2977c183-1317-43ac-b637-925c2a76c054","resolution":{"observed_at":"2026-08-07T00:34:05.694862Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:05.331998Z","title":"In the MinAtar environ- ments α is linearly annealed from 1 to 0 over the course of learning.∗Humanoid-v4 uses a hidden layer size of256","venue":null,"work_id":"b7936d88-1d73-444f-9909-4b64e49251b9","year":2017},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-10T01:40:45.849259Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:03.814872Z"},"links":{"citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:828e08fe3c5946ec9516dc671de251c72b10764c9bc1950bb2c3c9885be69c68","observation_id":"604c68c7-509d-41e0-a758-99730384f708","resolution":{"observed_at":"2026-08-07T00:34:05.424094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:05.064563Z","title":null,"venue":null,"work_id":"a5093ba6-0292-4d37-ba53-5158ab6a25b3","year":2015},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-10T01:40:45.849259Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:04.036926Z"},"links":{"citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:688a679d3e1d71934ab56e4e330b12080a0118e3119ca10f8eb21424fa42dab1","observation_id":"e27c280b-70f5-4b1e-bb4a-d2578ef42c6b","resolution":{"observed_at":"2026-08-07T00:34:05.131796Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:04.840000Z","title":"Classic and MinAtar hyperparameters are based on the original paper (Gallici et al., 2025), while MuJoCo hyperparameters were found by hyperparameter tuning","venue":null,"work_id":"69519f89-2262-4c15-a0e9-1b264a5b6e6f","year":2025},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-10T01:40:45.849259Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:04.168498Z"},"links":{"citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:126aea321b0941052cfa929f083f3aea4f8d765b099fbbff1053ab4ffec8052f","observation_id":"81bef3d0-d1a3-4e91-8a59-3480fe621da4","resolution":{"observed_at":"2026-08-07T00:34:04.937775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:01.737396Z","title":"doi: 10.1016/S0167-6377(02)00231-6","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-10T01:40:45.849259Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":2003,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:01.737396Z"},"links":{"citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:f09b641b40dee89a001a5eed4863e6fcb0ac68d07e5fe0941c4fcd97a6255679","observation_id":"0b0f0d1f-d8c6-4ac8-bb09-b376ac207a24","resolution":{"observed_at":"2026-08-07T00:34:01.737396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.09814","last_updated":"2021-06-07T13:44:15Z","snapshot_observed_at":"2026-08-05T10:37:00.663177Z","submitted_at":"2020-05-20T01:30:43Z","title":"Mirror Descent Policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.09814","snapshot_observed_at":"2026-08-07T00:34:02.274823Z","title":"Mirror descent policy optimization","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-10T01:40:45.849259Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:02.274823Z"},"links":{"cited_paper":"/paper/2005.09814","citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:ba8cfff335117fd1fac0f6d18d9f43a7c89fada871f824bf8c7b443471765b7b","observation_id":"89fea3c6-8f12-4a8f-99a4-1d118f9ff6c4","resolution":{"observed_at":"2026-08-07T00:34:02.274823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:06.848188Z","title":"We can see in Fig","venue":null,"work_id":"07c205b0-e1dd-4fd7-b8f9-d413b5bf5c33","year":2020},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-10T01:40:45.849259Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:03.027368Z"},"links":{"citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:3ad89bde8793eafd973e2da1c991449c29c2665d02e557cf258513348361a80f","observation_id":"a11d5ff7-9cf5-4c62-91ea-fcb73de79e63","resolution":{"observed_at":"2026-08-07T00:34:07.019219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01400","last_updated":"2023-02-21T14:48:00Z","snapshot_observed_at":"2026-07-06T13:59:19.633826Z","submitted_at":"2022-10-04T06:17:52Z","title":"Linear Convergence of Natural Policy Gradient Methods with Log-Linear Policies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.01400","snapshot_observed_at":"2026-08-07T00:34:02.598175Z","title":"S., Gower, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-10T01:40:45.849259Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:02.598175Z"},"links":{"cited_paper":"/paper/2210.01400","citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:d992a064c53819855de3e6f5cfb6bbfc7557e13a5ac618aecf1081afa08b0e88","observation_id":"82fdb66c-f27d-4497-abf3-de8584454647","resolution":{"observed_at":"2026-08-07T00:34:02.598175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.09457","last_updated":"2022-11-29T17:00:55Z","snapshot_observed_at":"2026-08-03T16:50:13.855764Z","submitted_at":"2022-01-24T04:54:58Z","title":"Homotopic Policy Mirror Descent: Policy Convergence, Implicit Regularization, and Improved Sample Complexity","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.09457","snapshot_observed_at":"2026-08-07T00:34:02.124836Z","title":"Homotopic policy mirror descent: Policy convergence, implicit regularization, and improved sample complexity.arXiv preprint arXiv:2201.09457,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-10T01:40:45.849259Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:02.124836Z"},"links":{"cited_paper":"/paper/2201.09457","citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:acda792d987e80d36a545724a565f9d8aa8f7c7a750ebe0c8693d47388617473","observation_id":"eb783b25-fc5b-4a52-b22e-b3a4fd72315a","resolution":{"observed_at":"2026-08-07T00:34:02.124836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.05982","last_updated":"2021-03-18T03:42:07Z","snapshot_observed_at":"2026-07-06T10:32:46.366651Z","submitted_at":"2021-01-15T06:25:58Z","title":"Randomized Ensembled Double Q-Learning: Learning Fast Without a Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.05982","snapshot_observed_at":"2026-08-07T00:34:01.863748Z","title":"Randomized ensembled double q-learning: Learning fast without a model.arXiv preprint arXiv:2101.05982,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-10T01:40:45.849259Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:01.863748Z"},"links":{"cited_paper":"/paper/2101.05982","citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:7e0b83ed927904c130aca6c4327c4ba59a3eaa5bde9daf180fb0ca0be2fe45ec","observation_id":"726edaa6-805d-4d80-9f87-9537bbeb5c61","resolution":{"observed_at":"2026-08-07T00:34:01.863748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06487","last_updated":"2021-08-07T18:51:37Z","snapshot_observed_at":"2026-08-08T20:16:19.069312Z","submitted_at":"2020-02-16T02:02:23Z","title":"Maxmin Q-learning: Controlling the Estimation Bias of Q-learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06487","snapshot_observed_at":"2026-08-07T00:34:01.965749Z","title":"Maxmin q-learning: Controlling the estimation bias of q-learning.arXiv preprint arXiv:2002.06487,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-10T01:40:45.849259Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:01.965749Z"},"links":{"cited_paper":"/paper/2002.06487","citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:8e4b95cd0b1245c1bd233bc5d6ee89bcf1f3a25394c1f9d1d6644fa3bea16b44","observation_id":"6f1bc58c-a35c-4fa4-a565-7dc90dcc5f57","resolution":{"observed_at":"2026-08-07T00:34:01.965749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:02.354750Z","title":"van Hasselt, H., Doron, Y., Strub, F., Hessel, M., Sonnerat, N., and Modayil, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-10T01:40:45.849259Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:02.354750Z"},"links":{"citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:3c3804b144896f642104ff8561e5adfe4d3b8ac2c510094c69aefaedc4ed2deb","observation_id":"b7c1b16f-eca0-4fbb-9424-7b73cac187dd","resolution":{"observed_at":"2026-08-07T00:34:02.354750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T01:40:45.849259Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 0 inbound Pith citation observations for arXiv:2506.13862."}