{"as_of":"2026-08-18T10:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e28e1064f662e2655d4795cd469010533273cb753e5f966d229f0465d39b111c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":18,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:59:58.574784Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":5,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","snapshot_observed_at":"2026-08-16T17:59:37.786854Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00157","snapshot_observed_at":"2026-08-11T22:12:10.452960Z","title":"A survey of exploration methods in rein- forcement learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.452960Z"},"links":{"cited_paper":"/paper/2109.00157","citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:3472ff36f92d005c0f2a433e80d9e616a1cdbef2a66bc57d78c987f82e8171e9","observation_id":"028e9a40-e4cf-43b0-87e4-ed52803edc9a","resolution":{"observed_at":"2026-08-11T22:12:10.452960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","snapshot_observed_at":"2026-08-16T17:59:37.786854Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00157","snapshot_observed_at":"2026-08-11T19:09:53.307309Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-17T23:56:40.452336Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.307309Z"},"links":{"cited_paper":"/paper/2109.00157","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:21f29fcaed84f45a939f450f55863e486153a28d7cd38da6d6a0655cfcdbc827","observation_id":"595fc39b-f931-4b4d-abbb-d9a20d1d694f","resolution":{"observed_at":"2026-08-11T19:09:53.307309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","snapshot_observed_at":"2026-08-16T17:59:37.786854Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00157","snapshot_observed_at":"2026-08-11T11:59:02.571787Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.14741","last_updated":"2024-12-19T11:17:31Z","snapshot_observed_at":"2026-08-15T15:37:06.308078Z","submitted_at":"2024-12-19T11:17:31Z","title":"Active Inference and Human--Computer Interaction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T11:59:02.571787Z"},"links":{"cited_paper":"/paper/2109.00157","citing_paper":"/paper/2412.14741"},"observation_digest":"sha256:ed931723a60011f4943e8f0e4135ade26b0fa8c81433337b600647a42f60474a","observation_id":"52181ded-a820-4ff4-a78a-693a6396b17b","resolution":{"observed_at":"2026-08-11T11:59:02.571787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","snapshot_observed_at":"2026-08-16T17:59:37.786854Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00157","snapshot_observed_at":"2026-08-10T18:11:48.173645Z","title":"arXiv preprint arXiv:2109.00157 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.11533","last_updated":"2025-01-20T15:17:24Z","snapshot_observed_at":"2026-08-14T12:39:10.034760Z","submitted_at":"2025-01-20T15:17:24Z","title":"The impact of intrinsic rewards on exploration in Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:48.173645Z"},"links":{"cited_paper":"/paper/2109.00157","citing_paper":"/paper/2501.11533"},"observation_digest":"sha256:6fcf201bf3b0aef193d4adc08d1d9c24ea6a93da85f382b4e72f3d4b76a9181f","observation_id":"4c4361b5-ff42-4174-8b5a-f2b15909f195","resolution":{"observed_at":"2026-08-10T18:11:48.173645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","snapshot_observed_at":"2026-08-16T17:59:37.786854Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00157","snapshot_observed_at":"2026-08-15T21:59:58.574784Z","title":"arXiv preprint arXiv:2109.00157 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.08453","last_updated":"2025-05-13T11:30:51Z","snapshot_observed_at":"2026-08-16T23:30:50.993792Z","submitted_at":"2025-05-13T11:30:51Z","title":"Parameter Estimation using Reinforcement Learning Causal Curiosity: Limits and Challenges","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:58.574784Z"},"links":{"cited_paper":"/paper/2109.00157","citing_paper":"/paper/2505.08453"},"observation_digest":"sha256:c12d7a08c1cfe0b8c69303a59637f2708ea4b8dd80612f637b6adb2c6cc21711","observation_id":"43a209fe-3b9d-41c8-957b-fbb07b00cbc4","resolution":{"observed_at":"2026-08-15T21:59:58.574784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","snapshot_observed_at":"2026-08-16T17:59:37.786854Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00157","snapshot_observed_at":"2026-08-06T21:21:54.730532Z","title":"A survey of exploration methods in reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00518","last_updated":"2025-07-01T07:32:54Z","snapshot_observed_at":"2026-08-14T13:49:23.585878Z","submitted_at":"2025-07-01T07:32:54Z","title":"Exploring Large Action Sets with Hyperspherical Embeddings using von Mises-Fisher Sampling","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:54.730532Z"},"links":{"cited_paper":"/paper/2109.00157","citing_paper":"/paper/2507.00518"},"observation_digest":"sha256:662b548a37e54fd00c0dcd4e5a8a377cd71fac6a9c8927c28824e90305c78b33","observation_id":"7e36c451-4f03-4bec-af1c-54f73c8859ec","resolution":{"observed_at":"2026-08-06T21:21:54.730532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","snapshot_observed_at":"2026-08-16T17:59:37.786854Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00157","snapshot_observed_at":"2026-08-06T18:14:16.231424Z","title":"A survey of exploration methods in reinforcement learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09117","last_updated":"2025-07-12T02:22:55Z","snapshot_observed_at":"2026-08-14T16:24:29.034780Z","submitted_at":"2025-07-12T02:22:55Z","title":"Towards Human-level Dexterity via Robot Learning","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:16.231424Z"},"links":{"cited_paper":"/paper/2109.00157","citing_paper":"/paper/2507.09117"},"observation_digest":"sha256:8f88a8936400c9ed5bfa9b0c2fafe2f7985333e2284d79c69ebdc1fedf98a483","observation_id":"3cd80d02-d104-44df-a2c3-ee39a4cb426c","resolution":{"observed_at":"2026-08-06T18:14:16.231424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","snapshot_observed_at":"2026-08-16T17:59:37.786854Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00157","snapshot_observed_at":"2026-08-05T20:21:04.419668Z","title":"A survey of exploration methods in reinforcement learning.CoRR, abs/2109.00157, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:04.419668Z"},"links":{"cited_paper":"/paper/2109.00157","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:2d42096232f81fb0776bb40e3c539691dd598d77ad199a5864b73f1ea7a2524f","observation_id":"62f72c5a-6235-4654-bc26-fe632c7dce51","resolution":{"observed_at":"2026-08-05T20:21:04.419668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","snapshot_observed_at":"2026-08-16T17:59:37.786854Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00157","snapshot_observed_at":"2026-08-04T18:53:02.597599Z","title":"A survey of exploration methods in reinforcement learning.arXiv preprint arXiv:2109.00157,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.597599Z"},"links":{"cited_paper":"/paper/2109.00157","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:3453b774e2f9b8ef2b215acd78478ad5bf0257e91a7ae97caf289114a0991176","observation_id":"7c8d4574-d36e-4a66-9513-d4dc796d50d7","resolution":{"observed_at":"2026-08-04T18:53:02.597599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","snapshot_observed_at":"2026-08-16T17:59:37.786854Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2109.00157","doi":"10.48550/arxiv.2109.00157","metadata_source":"arxiv_reference","pith_arxiv_id":"2109.00157","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey of Exploration Methods in Reinforcement Learning","venue":"arXiv (Cornell University)","work_id":"66dafe38-40cf-4975-916e-6a1489255123","year":2021},"citing_paper":{"arxiv_id":"2601.22235","last_updated":"2026-04-13T14:52:09Z","snapshot_observed_at":"2026-08-15T05:23:29.566667Z","submitted_at":"2026-01-29T19:06:33Z","title":"Smart Walkers in Discrete Space","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T09:19:47.050591Z"},"links":{"cited_paper":"/paper/2109.00157","citing_paper":"/paper/2601.22235"},"observation_digest":"sha256:70eb669ef9f638cf08981d7c167efcf70638af2999b68f6eafa15a0c894f77fa","observation_id":"877220da-97a2-4565-9c7a-a2f10d61f3a2","resolution":{"observed_at":"2026-05-16T09:20:47.682510Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-10T21:38:16.888626+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T21:38:16.888626+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","snapshot_observed_at":"2026-08-16T17:59:37.786854Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2109.00157","doi":"10.48550/arxiv.2109.00157","metadata_source":"arxiv_reference","pith_arxiv_id":"2109.00157","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey of Exploration Methods in Reinforcement Learning","venue":"arXiv (Cornell University)","work_id":"66dafe38-40cf-4975-916e-6a1489255123","year":2021},"citing_paper":{"arxiv_id":"2604.05820","last_updated":"2026-07-14T09:49:12Z","snapshot_observed_at":"2026-08-16T09:22:51.694456Z","submitted_at":"2026-04-07T12:53:42Z","title":"SpecRL: Reinforcement Learning with Test-Based Completeness Rewards for Formal Specification Synthesis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T19:06:10.718673Z"},"links":{"cited_paper":"/paper/2109.00157","citing_paper":"/paper/2604.05820"},"observation_digest":"sha256:5f59f046dad8484695746effafe032008a8de2060460ffa63d388ac3f22b6efd","observation_id":"0ae1acbb-c158-48d9-bb24-f7539e748d95","resolution":{"observed_at":"2026-05-10T23:30:50.844784Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-10T21:38:16.888626+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T21:38:16.888626+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","snapshot_observed_at":"2026-08-16T17:59:37.786854Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2109.00157","doi":"10.48550/arxiv.2109.00157","metadata_source":"arxiv_reference","pith_arxiv_id":"2109.00157","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey of Exploration Methods in Reinforcement Learning","venue":"arXiv (Cornell University)","work_id":"66dafe38-40cf-4975-916e-6a1489255123","year":2021},"citing_paper":{"arxiv_id":"2604.12645","last_updated":"2026-06-03T11:53:00Z","snapshot_observed_at":"2026-08-15T06:22:50.270387Z","submitted_at":"2026-04-14T12:16:56Z","title":"Contextual Multi-Task Reinforcement Learning for Autonomous Reef Monitoring","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T15:13:16.406160Z"},"links":{"cited_paper":"/paper/2109.00157","citing_paper":"/paper/2604.12645"},"observation_digest":"sha256:b14ccc9c9d0093ff43b99b1d060801e31ff70a6dda7b59a588deaae9298e49e2","observation_id":"3413dc2e-46f0-4972-9d79-0f866fc922a9","resolution":{"observed_at":"2026-05-10T15:15:31.460106Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-10T21:38:16.888626+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T21:38:16.888626+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","snapshot_observed_at":"2026-08-16T17:59:37.786854Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00157","snapshot_observed_at":"2026-07-12T21:15:13.179473Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.12645","last_updated":"2026-06-03T11:53:00Z","snapshot_observed_at":"2026-08-15T06:22:50.270387Z","submitted_at":"2026-04-14T12:16:56Z","title":"Contextual Multi-Task Reinforcement Learning for Autonomous Reef Monitoring","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T21:15:13.179473Z"},"links":{"cited_paper":"/paper/2109.00157","citing_paper":"/paper/2604.12645"},"observation_digest":"sha256:110cf6892cf2b486fa1d84cb4a029b93195d0cb5a5c474a068601f6bc50c6457","observation_id":"2864721b-faa5-461b-a298-3e582951cbdf","resolution":{"observed_at":"2026-07-12T21:15:13.179473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","snapshot_observed_at":"2026-08-16T17:59:37.786854Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2109.00157","doi":"10.48550/arxiv.2109.00157","metadata_source":"arxiv_reference","pith_arxiv_id":"2109.00157","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey of Exploration Methods in Reinforcement Learning","venue":"arXiv (Cornell University)","work_id":"66dafe38-40cf-4975-916e-6a1489255123","year":2021},"citing_paper":{"arxiv_id":"2604.15614","last_updated":"2026-04-17T01:41:52Z","snapshot_observed_at":"2026-08-14T18:59:36.244742Z","submitted_at":"2026-04-17T01:41:52Z","title":"Flexible Empowerment at Reasoning with Extended Best-of-N Sampling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T09:39:29.875977Z"},"links":{"cited_paper":"/paper/2109.00157","citing_paper":"/paper/2604.15614"},"observation_digest":"sha256:6ac022a49a359d8ce056f23e2beaff4ebc5b72e05134c594817e9d8f6d014168","observation_id":"6fbaf575-13ae-449d-af90-d33c5b0a82b7","resolution":{"observed_at":"2026-05-10T09:43:49.278744Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-10T21:38:16.888626+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T21:38:16.888626+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","snapshot_observed_at":"2026-08-16T17:59:37.786854Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2109.00157","doi":"10.48550/arxiv.2109.00157","metadata_source":"arxiv_reference","pith_arxiv_id":"2109.00157","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey of Exploration Methods in Reinforcement Learning","venue":"arXiv (Cornell University)","work_id":"66dafe38-40cf-4975-916e-6a1489255123","year":2021},"citing_paper":{"arxiv_id":"2605.04207","last_updated":"2026-05-05T18:47:08Z","snapshot_observed_at":"2026-08-11T08:12:07.333767Z","submitted_at":"2026-05-05T18:47:08Z","title":"Optimal Semiparametric Dynamic Pricing with Feature Diversity","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-08T17:34:49.811590Z"},"links":{"cited_paper":"/paper/2109.00157","citing_paper":"/paper/2605.04207"},"observation_digest":"sha256:ab69b0c20df0bc8a87681f55f1c478cd36090129b62086c23c57100c0e7b4f88","observation_id":"c62a7275-2b45-4015-8da9-98638dbab921","resolution":{"observed_at":"2026-05-11T17:26:06.944659Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-10T21:38:16.888626+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T21:38:16.888626+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","snapshot_observed_at":"2026-08-16T17:59:37.786854Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2109.00157","doi":"10.48550/arxiv.2109.00157","metadata_source":"arxiv_reference","pith_arxiv_id":"2109.00157","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey of Exploration Methods in Reinforcement Learning","venue":"arXiv (Cornell University)","work_id":"66dafe38-40cf-4975-916e-6a1489255123","year":2021},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-08-15T21:55:25.625601Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2109.00157","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:f9734a0019542a959c81511ce3f72813e7802ac0bbaeaf5f541607886d8d39f9","observation_id":"768a09fc-41e6-4135-8ef3-2afd43b35674","resolution":{"observed_at":"2026-07-04T07:59:40.653383Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-10T21:38:16.888626+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T21:38:16.888626+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","snapshot_observed_at":"2026-08-16T17:59:37.786854Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00157","snapshot_observed_at":"2026-08-03T04:39:32.089880Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-07T18:56:05.725689Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":234,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:32.089880Z"},"links":{"cited_paper":"/paper/2109.00157","citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:cceb8c6e846d27e48f33d82f8602eeeccf1e3e6e1405c90de043a537adfb41ff","observation_id":"5e0b398b-60e6-4157-aa44-89cf8ebba0e2","resolution":{"observed_at":"2026-08-03T04:39:32.089880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","snapshot_observed_at":"2026-08-16T17:59:37.786854Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00157","snapshot_observed_at":"2026-08-11T10:32:12.730067Z","title":"A survey of exploration methods in reinforcement learning.CoRR, abs/2109.00157, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-16T11:53:44.863080Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.730067Z"},"links":{"cited_paper":"/paper/2109.00157","citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:250128d231f1dc9e15c4e3c941b412ef7283970b4a7499ff0e414cc4596ea23d","observation_id":"463ddaed-3d44-4da6-9ce5-80f49d67d6bd","resolution":{"observed_at":"2026-08-11T10:32:12.730067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2109.00157/citation-record","integrity":"/paper/2109.00157/integrity","json":"/paper/2109.00157/citation-record.json","paper":"/paper/2109.00157"},"outbound":[],"paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T17:59:37.786854Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 18 inbound Pith citation observations for arXiv:2109.00157."}