{"as_of":"2026-08-18T15:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0cce27bca3274d9c25d59cb1a895d2b8569c747c561f09c6189f21b719e97ccf","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:10:29.525354Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.22566/citation-record","integrity":"/paper/2506.22566/integrity","json":"/paper/2506.22566/citation-record.json","paper":"/paper/2506.22566"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:32.878438Z","title":"Lipbab: Computing exact lipschitz constant of relu networks","venue":null,"work_id":"5c6c9adc-1746-47ea-8128-0af563e02c66","year":2021},"citing_paper":{"arxiv_id":"2506.22566","last_updated":"2025-07-24T18:16:23Z","snapshot_observed_at":"2026-08-12T12:24:19.622551Z","submitted_at":"2025-06-27T18:28:41Z","title":"Exploration Behavior of Untrained Policies","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:27.275619Z"},"links":{"citing_paper":"/paper/2506.22566"},"observation_digest":"sha256:d5254a3e55045a5f680006e07c4d1d3bbc55a728907c9b4b265ccbdeb6faa95d","observation_id":"4f742340-d001-4ecb-ad71-3213a896ec27","resolution":{"observed_at":"2026-08-06T22:10:32.943686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:32.735109Z","title":"Radial basis functions","venue":null,"work_id":"3a2399d9-6f8d-48f2-8b7b-454a641a307c","year":2000},"citing_paper":{"arxiv_id":"2506.22566","last_updated":"2025-07-24T18:16:23Z","snapshot_observed_at":"2026-08-12T12:24:19.622551Z","submitted_at":"2025-06-27T18:28:41Z","title":"Exploration Behavior of Untrained Policies","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:27.379296Z"},"links":{"citing_paper":"/paper/2506.22566"},"observation_digest":"sha256:182193f49706b906a4fef1b95deca2d6de41a4d98d7bef99ecec1fe2528fbfdf","observation_id":"5e3a4c18-c91a-436b-a530-2607ec7bbadc","resolution":{"observed_at":"2026-08-06T22:10:32.810908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12894","last_updated":"2018-10-30T17:44:42Z","snapshot_observed_at":"2026-08-14T18:06:54.993797Z","submitted_at":"2018-10-30T17:44:42Z","title":"Exploration by Random Network Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12894","snapshot_observed_at":"2026-08-06T22:10:27.481099Z","title":"Exploration by random network distillation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.22566","last_updated":"2025-07-24T18:16:23Z","snapshot_observed_at":"2026-08-12T12:24:19.622551Z","submitted_at":"2025-06-27T18:28:41Z","title":"Exploration Behavior of Untrained Policies","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:27.481099Z"},"links":{"cited_paper":"/paper/1810.12894","citing_paper":"/paper/2506.22566"},"observation_digest":"sha256:739036cfc2326b223434a70e3e0e17f6a7bd6c66cc44cf7b6b6a91de596af10c","observation_id":"c93c7a78-3e4a-4457-b0fe-9f056c9059e1","resolution":{"observed_at":"2026-08-06T22:10:27.481099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:32.398966Z","title":"Rainbow: Combining im- provements in deep reinforcement learning","venue":null,"work_id":"9d357eb4-962c-483d-8aa6-941af53457cd","year":2018},"citing_paper":{"arxiv_id":"2506.22566","last_updated":"2025-07-24T18:16:23Z","snapshot_observed_at":"2026-08-12T12:24:19.622551Z","submitted_at":"2025-06-27T18:28:41Z","title":"Exploration Behavior of Untrained Policies","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:27.621983Z"},"links":{"citing_paper":"/paper/2506.22566"},"observation_digest":"sha256:63661577921346fb93b5471763eecab4cb268e4551a1af7fb551e9ee31042741","observation_id":"aea7d39d-5684-45d1-a88a-db50d36e9520","resolution":{"observed_at":"2026-08-06T22:10:32.593138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:32.132602Z","title":"Neural tangent kernel: Convergence and generalization in neural networks","venue":null,"work_id":"1d6f5e26-8d20-459c-9f23-82f5403496df","year":2018},"citing_paper":{"arxiv_id":"2506.22566","last_updated":"2025-07-24T18:16:23Z","snapshot_observed_at":"2026-08-12T12:24:19.622551Z","submitted_at":"2025-06-27T18:28:41Z","title":"Exploration Behavior of Untrained Policies","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:27.797985Z"},"links":{"citing_paper":"/paper/2506.22566"},"observation_digest":"sha256:6e1af1054cf6473b0865285d3014e429ddbe112e44efada846075b586b155873","observation_id":"921bc39c-40bb-4719-a0bf-387044182b2c","resolution":{"observed_at":"2026-08-06T22:10:32.248330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:31.830559Z","title":"Exploration in deep reinforce- ment learning: A survey","venue":null,"work_id":"7e514017-8fe4-424f-8734-e6f685c3e834","year":2022},"citing_paper":{"arxiv_id":"2506.22566","last_updated":"2025-07-24T18:16:23Z","snapshot_observed_at":"2026-08-12T12:24:19.622551Z","submitted_at":"2025-06-27T18:28:41Z","title":"Exploration Behavior of Untrained Policies","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:27.956796Z"},"links":{"citing_paper":"/paper/2506.22566"},"observation_digest":"sha256:55d9589d39a1b866cda94d51f1ed3e934469fc4a38e474e8d134cc1f2623a330","observation_id":"4a01a4cc-b16d-411d-83f0-78a7da33c1a8","resolution":{"observed_at":"2026-08-06T22:10:32.009910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.08688","last_updated":"2020-04-18T18:55:02Z","snapshot_observed_at":"2026-08-11T20:47:36.088605Z","submitted_at":"2020-04-18T18:55:02Z","title":"Lipschitz constant estimation of Neural Networks via sparse polynomial optimization","version":1},"cited_work":{"arxiv_id":"2004.08688","doi":null,"metadata_source":"pith","pith_arxiv_id":"2004.08688","snapshot_observed_at":"2026-08-06T22:10:29.833606Z","title":"Lipschitz constant estimation of Neural Networks via sparse polynomial optimization","venue":"cs.LG","work_id":"a11fe2c3-928f-4f96-86de-d25b6facb1da","year":2020},"citing_paper":{"arxiv_id":"2506.22566","last_updated":"2025-07-24T18:16:23Z","snapshot_observed_at":"2026-08-12T12:24:19.622551Z","submitted_at":"2025-06-27T18:28:41Z","title":"Exploration Behavior of Untrained Policies","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:28.129862Z"},"links":{"cited_paper":"/paper/2004.08688","citing_paper":"/paper/2506.22566"},"observation_digest":"sha256:360228f325ee33828bd008add2804a48d7617724a629a8b6ef5ce0864e39e1f1","observation_id":"648b2eca-f65a-4e42-aa9b-c8e86a180c32","resolution":{"observed_at":"2026-08-06T22:10:29.933889Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:31.630493Z","title":"Flipping coins to estimate pseudocounts for exploration in reinforcement learning","venue":null,"work_id":"2afab19d-8531-4a06-bd14-d02a5c959fc0","year":2023},"citing_paper":{"arxiv_id":"2506.22566","last_updated":"2025-07-24T18:16:23Z","snapshot_observed_at":"2026-08-12T12:24:19.622551Z","submitted_at":"2025-06-27T18:28:41Z","title":"Exploration Behavior of Untrained Policies","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:28.283250Z"},"links":{"citing_paper":"/paper/2506.22566"},"observation_digest":"sha256:eaa4e68dd72763bf3e52f1fcbe778f79db5e06a6a9acd0af147dcfe717bcf8b2","observation_id":"1a691914-3af9-435c-8dab-fd76864640ee","resolution":{"observed_at":"2026-08-06T22:10:31.740520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:31.350552Z","title":"Periodic activation functions induce stationar- ity","venue":null,"work_id":"5a98c9a6-5c30-4f9a-86ea-9316825d7131","year":2021},"citing_paper":{"arxiv_id":"2506.22566","last_updated":"2025-07-24T18:16:23Z","snapshot_observed_at":"2026-08-12T12:24:19.622551Z","submitted_at":"2025-06-27T18:28:41Z","title":"Exploration Behavior of Untrained Policies","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:28.463799Z"},"links":{"citing_paper":"/paper/2506.22566"},"observation_digest":"sha256:637e2dc3d41e2df6640f74031f4ebcd73458dafc9d5ecb6090310c1dac2c4d8a","observation_id":"24c8ee25-e0a5-4cff-86a8-0d3e5110a3b3","resolution":{"observed_at":"2026-08-06T22:10:31.470042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:28.624563Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.22566","last_updated":"2025-07-24T18:16:23Z","snapshot_observed_at":"2026-08-12T12:24:19.622551Z","submitted_at":"2025-06-27T18:28:41Z","title":"Exploration Behavior of Untrained Policies","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:28.624563Z"},"links":{"citing_paper":"/paper/2506.22566"},"observation_digest":"sha256:dc86de9bc37cf33bea03a853983e9846640c82f1b0e6d4bae30c79ccf69fb890","observation_id":"a0542598-25d5-440f-9006-12808fac717e","resolution":{"observed_at":"2026-08-06T22:10:28.624563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:28.721081Z","title":"Bayesian learning for neural networks , volume 118","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.22566","last_updated":"2025-07-24T18:16:23Z","snapshot_observed_at":"2026-08-12T12:24:19.622551Z","submitted_at":"2025-06-27T18:28:41Z","title":"Exploration Behavior of Untrained Policies","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:28.721081Z"},"links":{"citing_paper":"/paper/2506.22566"},"observation_digest":"sha256:0d6a0ffe81137d4ebc3dabcb5ea7f21c796cd97cbed44c32e14f676d8e57b455","observation_id":"e3830a1c-008c-4c0e-ae77-39efec3bb782","resolution":{"observed_at":"2026-08-06T22:10:28.721081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:31.055627Z","title":"The primacy bias in deep reinforcement learning","venue":null,"work_id":"06cd2dcb-3b3c-4bf5-808b-ccbefdcb3177","year":2022},"citing_paper":{"arxiv_id":"2506.22566","last_updated":"2025-07-24T18:16:23Z","snapshot_observed_at":"2026-08-12T12:24:19.622551Z","submitted_at":"2025-06-27T18:28:41Z","title":"Exploration Behavior of Untrained Policies","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:28.801986Z"},"links":{"citing_paper":"/paper/2506.22566"},"observation_digest":"sha256:6726cecf079102bd6de9c23fa9b7918901329249b8b639f0001d163108ff0f41","observation_id":"ff014368-7c2d-4e38-a154-f1cf0c515db3","resolution":{"observed_at":"2026-08-06T22:10:31.187261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:30.799363Z","title":"Deep reinforcement learning with plasticity injection","venue":null,"work_id":"78b3f4c4-0503-419e-a4fb-eadb90903dd4","year":2023},"citing_paper":{"arxiv_id":"2506.22566","last_updated":"2025-07-24T18:16:23Z","snapshot_observed_at":"2026-08-12T12:24:19.622551Z","submitted_at":"2025-06-27T18:28:41Z","title":"Exploration Behavior of Untrained Policies","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:28.888210Z"},"links":{"citing_paper":"/paper/2506.22566"},"observation_digest":"sha256:27df39613ab89cfbb282118c6c5a8b3b3b2de873f09feec29da56c53ab1843c0","observation_id":"744ac8ad-46de-4499-bc53-31ac34d2eb37","resolution":{"observed_at":"2026-08-06T22:10:30.923444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:30.591822Z","title":"Deep exploration via bootstrapped dqn","venue":null,"work_id":"06e9fce6-07dc-48e4-a40f-9c892c0d2413","year":2016},"citing_paper":{"arxiv_id":"2506.22566","last_updated":"2025-07-24T18:16:23Z","snapshot_observed_at":"2026-08-12T12:24:19.622551Z","submitted_at":"2025-06-27T18:28:41Z","title":"Exploration Behavior of Untrained Policies","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:28.961018Z"},"links":{"citing_paper":"/paper/2506.22566"},"observation_digest":"sha256:da80ca381235736fc72ea52772592e91d53a785c69af4252a04cc0d69079b406","observation_id":"e483f8f7-c5b7-41e9-b252-789164ae8490","resolution":{"observed_at":"2026-08-06T22:10:30.670591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:30.321139Z","title":"Trust region policy optimization","venue":null,"work_id":"511515c7-773f-4b9c-9967-fe68c249b384","year":null},"citing_paper":{"arxiv_id":"2506.22566","last_updated":"2025-07-24T18:16:23Z","snapshot_observed_at":"2026-08-12T12:24:19.622551Z","submitted_at":"2025-06-27T18:28:41Z","title":"Exploration Behavior of Untrained Policies","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:29.041931Z"},"links":{"citing_paper":"/paper/2506.22566"},"observation_digest":"sha256:2a3d3559abf37f2eed1a4cac60cb40c9d1ceb3707fe6b39a0cda2ab3071f076e","observation_id":"3c452bac-3594-4190-bf34-11c4375a7721","resolution":{"observed_at":"2026-08-06T22:10:30.438864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T22:10:29.122205Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.22566","last_updated":"2025-07-24T18:16:23Z","snapshot_observed_at":"2026-08-12T12:24:19.622551Z","submitted_at":"2025-06-27T18:28:41Z","title":"Exploration Behavior of Untrained Policies","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:29.122205Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.22566"},"observation_digest":"sha256:019993d9edfb27f0bc1f12fda2f22b6a007369ca2568f6eac57f50e4690a5f6c","observation_id":"1cf297be-0c97-490d-ab4d-efcd470d9e22","resolution":{"observed_at":"2026-08-06T22:10:29.122205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.11052","last_updated":"2021-09-22T21:54:21Z","snapshot_observed_at":"2026-08-16T17:54:43.242403Z","submitted_at":"2021-09-22T21:54:21Z","title":"On Bonus-Based Exploration Methods in the Arcade Learning Environment","version":1},"cited_work":{"arxiv_id":"2109.11052","doi":null,"metadata_source":"pith","pith_arxiv_id":"2109.11052","snapshot_observed_at":"2026-08-06T22:10:29.646785Z","title":"On Bonus-Based Exploration Methods in the Arcade Learning Environment","venue":"cs.LG","work_id":"1fdc18d9-91a2-4c7c-80ed-f12731d7d1ec","year":2021},"citing_paper":{"arxiv_id":"2506.22566","last_updated":"2025-07-24T18:16:23Z","snapshot_observed_at":"2026-08-12T12:24:19.622551Z","submitted_at":"2025-06-27T18:28:41Z","title":"Exploration Behavior of Untrained Policies","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:29.210486Z"},"links":{"cited_paper":"/paper/2109.11052","citing_paper":"/paper/2506.22566"},"observation_digest":"sha256:fa0cf73c011f7893e6ab78e4dd7bd23a5ebc552c0a4e54104bcdd1de50aecc50","observation_id":"419d81e5-aa47-4426-b564-2a250826ae5e","resolution":{"observed_at":"2026-08-06T22:10:29.743035Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:29.278455Z","title":"Lipschitz regularity of deep neural networks: analysis and efficient estimation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.22566","last_updated":"2025-07-24T18:16:23Z","snapshot_observed_at":"2026-08-12T12:24:19.622551Z","submitted_at":"2025-06-27T18:28:41Z","title":"Exploration Behavior of Untrained Policies","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:29.278455Z"},"links":{"citing_paper":"/paper/2506.22566"},"observation_digest":"sha256:9c52e7e177c0a1a20092309b3da5a180d84362a7abec3dce667dcb800b5f865a","observation_id":"22c9fc1d-d33a-44f0-a281-3d3b3fef7bf1","resolution":{"observed_at":"2026-08-06T22:10:29.278455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:30.134898Z","title":"Q-learning","venue":null,"work_id":"7412de3a-4a72-45f8-8243-f955341017be","year":1992},"citing_paper":{"arxiv_id":"2506.22566","last_updated":"2025-07-24T18:16:23Z","snapshot_observed_at":"2026-08-12T12:24:19.622551Z","submitted_at":"2025-06-27T18:28:41Z","title":"Exploration Behavior of Untrained Policies","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:29.345229Z"},"links":{"citing_paper":"/paper/2506.22566"},"observation_digest":"sha256:1992549cf6cfa133524cbfa01fe472480146333446eab76bdd92561a7fa7752a","observation_id":"aec46387-79f1-45fe-b2f3-ce3a690111e0","resolution":{"observed_at":"2026-08-06T22:10:30.220688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:30.007706Z","title":"Simple statistical gradient-following algorithms for connectionist rein- forcement learning","venue":null,"work_id":"0b86702c-f850-4d0a-9750-04add857a6f2","year":1992},"citing_paper":{"arxiv_id":"2506.22566","last_updated":"2025-07-24T18:16:23Z","snapshot_observed_at":"2026-08-12T12:24:19.622551Z","submitted_at":"2025-06-27T18:28:41Z","title":"Exploration Behavior of Untrained Policies","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:29.435222Z"},"links":{"citing_paper":"/paper/2506.22566"},"observation_digest":"sha256:07c86e46ba4e8b66e698e1b38db7f2757c17ace24d677eaa8b96882700af2a32","observation_id":"c5b8af5f-2bc5-42f1-8abf-0e501571d7c2","resolution":{"observed_at":"2026-08-06T22:10:30.062294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01578","last_updated":"2017-02-15T05:28:05Z","snapshot_observed_at":"2026-08-14T21:31:52.294004Z","submitted_at":"2016-11-05T00:41:37Z","title":"Neural Architecture Search with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01578","snapshot_observed_at":"2026-08-06T22:10:29.525354Z","title":"Neural architecture search with reinforcement learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.22566","last_updated":"2025-07-24T18:16:23Z","snapshot_observed_at":"2026-08-12T12:24:19.622551Z","submitted_at":"2025-06-27T18:28:41Z","title":"Exploration Behavior of Untrained Policies","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:29.525354Z"},"links":{"cited_paper":"/paper/1611.01578","citing_paper":"/paper/2506.22566"},"observation_digest":"sha256:7e56d56678b589d0528170429863e9e92ec25fd9c364f9d2c98c1bc321132268","observation_id":"fbe3f23d-dab5-49d1-b34c-e2efb76b71c6","resolution":{"observed_at":"2026-08-06T22:10:29.525354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.22566","last_updated":"2025-07-24T18:16:23Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T12:24:19.622551Z","submitted_at":"2025-06-27T18:28:41Z","title":"Exploration Behavior of Untrained Policies"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":2,"verified_fuzzy":13},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2506.22566."}