{"as_of":"2026-08-13T10:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cb91e7e5bbc32eaf25b9b8af124721c307f7cf0a726791cc58953cb30f0ca2ac","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T17:04:31.896668Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T12:15:08.304150Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T08:09:40.723680Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"cited_work":{"arxiv_id":"2501.12627","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12627","snapshot_observed_at":"2026-07-04T08:09:40.723680Z","title":null,"venue":null,"work_id":"8d057077-836f-4a44-8bfb-959881c9058a","year":2025},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-07-06T23:56:54.959593Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":251,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2501.12627","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:423db877e6e21946f99824d449a7d259a88b657b1637e1b08d6435d7fdfe041d","observation_id":"ea666f1f-983f-42cd-9966-94b2d78a1c1d","resolution":{"observed_at":"2026-07-04T08:09:40.724925Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.12627/citation-record","integrity":"/paper/2501.12627/integrity","json":"/paper/2501.12627/citation-record.json","paper":"/paper/2501.12627"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.666812Z","title":"Deep reinforcement learning at the edge of the statistical precipice","venue":null,"work_id":"93958470-6bcd-4837-a1a1-fe3d5e067712","year":2021},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.664680Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:ddbb833ce5ce49d8f73acdcfb5df26add9eb131199fa9c1790dbc3a4d2e7060c","observation_id":"bd12ae0c-9e7c-47c1-ba72-949a942c50d9","resolution":{"observed_at":"2026-08-10T17:04:32.671849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.650017Z","title":"Atari-5: Distilling the arcade learning environment down to five games","venue":null,"work_id":"b64f9600-e9af-4dcc-9878-4d46147d57d5","year":2023},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.670067Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:abd8af919284c87a59172a12f1f236c6374afe044b20c20ed162f3d22a3a029e","observation_id":"777d5ba1-acf0-467c-9d2e-420e08bb6f61","resolution":{"observed_at":"2026-08-10T17:04:32.655050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.634720Z","title":"Existence, relatedness, and growth: Human needs in organizational settings","venue":null,"work_id":"dbd5445d-295f-4ec6-89d7-490e179a3814","year":1972},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.674886Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:6901422b0afe53a4e89ba3f65e7d09a17ed3070451e4c28f8acd716ee068b755","observation_id":"b025b990-4e9d-4136-91ad-7e30cf51b870","resolution":{"observed_at":"2026-08-10T17:04:32.639893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.619002Z","title":"Using confidence bounds for exploitation-exploration trade-offs","venue":null,"work_id":"e3fa6223-e5be-4ae9-8607-91cdd7171444","year":2002},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.679787Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:f887a6a92b7ce7efb49264484ae9b7b36bd60ddc5b1118100ccfa11cd9b3b914","observation_id":"fab2e43a-96cf-48ae-900d-3b37447c7a19","resolution":{"observed_at":"2026-08-10T17:04:32.624106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.603658Z","title":"Never give up: Learning directed exploration strategies","venue":null,"work_id":"7a4efe84-4771-44d4-9c9a-80bd976d190f","year":2020},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.684579Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:bb515d35a841c097b1df4969d7d52648e083dfab53a0e716c6949a80ab63d853","observation_id":"42f52b22-413a-4239-ac7e-ae3ce297336c","resolution":{"observed_at":"2026-08-10T17:04:32.608864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.588462Z","title":"The arcade learning environment: An evaluation platform for general agents","venue":null,"work_id":"b06b3c50-3d94-41a1-b823-1d0b74e5bfee","year":2013},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.689560Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:7e5fcc578f6f0d2ed20ac5a76b70c74e5815071139bc82dcbef86799a984896d","observation_id":"dc46cc3b-895d-4b3d-8121-fd8c24dbfd99","resolution":{"observed_at":"2026-08-10T17:04:32.593250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.573419Z","title":"Unifying count-based exploration and intrinsic motivation","venue":null,"work_id":"e8f679ad-290f-4c3e-9146-b5947cca4757","year":2016},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.694801Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:80ade0661207e42ea92a856a1902c4d3fe5756da536381610c7bb6fb2f7e2df2","observation_id":"1553f4ef-748c-4999-a2d7-b454bfa9b33e","resolution":{"observed_at":"2026-08-10T17:04:32.578496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.557565Z","title":"A markovian decision process","venue":null,"work_id":"3d6c9877-4ad1-4e04-a1c7-f2a4a319703c","year":1957},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.699397Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:c1833fa011ef6d6a79f7090b4dbc19e2c25e888668c7ae92dd5384adddc295ae","observation_id":"29042ab4-e56a-47ea-a5dc-495eafe0d9fc","resolution":{"observed_at":"2026-08-10T17:04:32.562582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.541629Z","title":"Exploration by random network distillation","venue":null,"work_id":"6f34784e-9f41-41af-882b-6e136f5ceac0","year":2019},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.705179Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:5b04dbf358ec93608b2a234f0e7cfc8ba0bdf67709dd707e64f808a1cf3ab749","observation_id":"9d1afa23-e649-41e7-83cf-a20d2800927d","resolution":{"observed_at":"2026-08-10T17:04:32.546712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.526131Z","title":"Explore, discover and learn: Unsupervised discovery of state-covering skills","venue":null,"work_id":"454182ae-6c87-42f5-8d0f-6b1fb7c6cf30","year":2020},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.710552Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:a4f7ef6d8762f3b3495bac47c492f72aefdf1d6933d4484aee48da6df3415bb5","observation_id":"80fddff9-f795-4460-b351-96a5501b9a18","resolution":{"observed_at":"2026-08-10T17:04:32.531059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.508248Z","title":"Minigrid & miniworld: Modular & customizable reinforcement learning environments for goal-oriented tasks","venue":null,"work_id":"95d193f0-258d-4de8-9011-83374dbf5ebc","year":2023},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.715540Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:3d7eb4546b7968deb87495ad4720a3cd2ab55a35161dc649f8112fe08737e502","observation_id":"10b4dfd5-e1dd-453f-95c2-e8e02292dbfc","resolution":{"observed_at":"2026-08-10T17:04:32.514663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.491437Z","title":"Leveraging procedural generation to benchmark reinforcement learning","venue":null,"work_id":"45762b78-f0d0-4b3f-8ee4-8da65cdbaf31","year":2020},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.720712Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:77732994391d280b9ea13a4e31cd7acbfa3195ecc70421b5e4919da1d5328be0","observation_id":"85ba021e-a615-4c9e-9059-04ffd982424a","resolution":{"observed_at":"2026-08-10T17:04:32.497491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.474747Z","title":"Stochastic linear optimization under bandit feedback","venue":null,"work_id":"9a925aa2-8f14-4dd8-9dae-3a351066546e","year":2008},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.725530Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:588beae5d709115d0ba610983f4a88d317c009ff1e5d0eaa9c571a78f53cc74b","observation_id":"b48be9ad-2e89-446a-857f-a7f686b64864","resolution":{"observed_at":"2026-08-10T17:04:32.479715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.459445Z","title":"Diversity is all you need: Learning skills without a reward function","venue":null,"work_id":"4a097f27-783d-4f6b-96b5-963cadbfb52a","year":2018},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.730698Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:f58113decbb7a296ba212bd17e5760eabc85c6e0e438b177669fe39e250fbe22","observation_id":"0dabe982-1812-4302-9b1a-383c4fc6b0af","resolution":{"observed_at":"2026-08-10T17:04:32.464273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.443182Z","title":"Adversarially guided actor-critic","venue":null,"work_id":"2a5971fe-aa57-4834-96f4-c2ba0499d80b","year":2021},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.735368Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:3349e284b81d7348e03b8b10c2bcd1f3566cfa321c84a2ff1f47d35ae64fe1ee","observation_id":"d996408c-e6e1-41f5-9480-c491fba766b4","resolution":{"observed_at":"2026-08-10T17:04:32.448723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.07507","last_updated":"2016-11-22T20:44:39Z","snapshot_observed_at":"2026-08-02T15:05:52.307944Z","submitted_at":"2016-11-22T20:44:39Z","title":"Variational Intrinsic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.07507","snapshot_observed_at":"2026-08-10T17:04:31.740034Z","title":"Variational intrinsic control","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.740034Z"},"links":{"cited_paper":"/paper/1611.07507","citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:a61ff865b7c4fc4088f0b369c76be73af3360dc06fb059e4ed89d14d8e45198f","observation_id":"c02a526d-a851-4081-a54a-850e1efcf554","resolution":{"observed_at":"2026-08-10T17:04:31.740034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.426131Z","title":"Fast task inference with variational intrinsic successor features","venue":null,"work_id":"24b09000-c662-4bf3-a033-d9a0449ba71b","year":2020},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.745680Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:420bd6b05b9d80724f61f9ff5662ec9185ff6e5063469d7a2987005799eeaf81","observation_id":"02f8d2c1-69c4-40ef-b290-4a966b455c1f","resolution":{"observed_at":"2026-08-10T17:04:32.432093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.408553Z","title":"Provably efficient maximum entropy exploration","venue":null,"work_id":"bdff6243-74f8-4786-af0b-1b0cc9a1999f","year":2019},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.750439Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:aa35ab3cf8e21fd3451f371d3fb5213aa6411a54e21b9f63715ce8066cf8384d","observation_id":"40c39387-4a1a-4ff8-a700-7ce1765cfaae","resolution":{"observed_at":"2026-08-10T17:04:32.414030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.391561Z","title":"Exploration via elliptical episodic bonuses","venue":null,"work_id":"1ee21914-2dfa-488a-82a3-8b2dbfcff714","year":2022},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.755324Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:0730e4f2d0676811387f9b31351d4c07ea5925cba4e1c93260511cd4e8d8e356","observation_id":"6c77159e-7fab-45ef-a465-6146559a7f82","resolution":{"observed_at":"2026-08-10T17:04:32.396886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03236","last_updated":"2023-06-05T20:45:30Z","snapshot_observed_at":"2026-08-11T20:23:16.398727Z","submitted_at":"2023-06-05T20:45:30Z","title":"A Study of Global and Episodic Bonuses for Exploration in Contextual MDPs","version":1},"cited_work":{"arxiv_id":"2306.03236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.03236","snapshot_observed_at":"2026-08-10T17:04:32.003686Z","title":"A Study of Global and Episodic Bonuses for Exploration in Contextual MDPs","venue":"cs.AI","work_id":"de895682-d243-4c93-b2e6-072034ff0879","year":2023},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.760641Z"},"links":{"cited_paper":"/paper/2306.03236","citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:ca4e6a4c2e4459c818720654159360c1c232efb3756425eb7b7c224321adb94f","observation_id":"ecdcb10c-28dd-4b67-8e33-85840a9f89e1","resolution":{"observed_at":"2026-08-10T17:04:32.011275Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.375483Z","title":"Planning and acting in partially observable stochastic domains","venue":null,"work_id":"584ea4e9-f3ba-4368-9d93-cdb50483d698","year":1998},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.765980Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:f4ffe97d787e94a11c69dd4c23fade475d6d471b42350a019a025f0f242b982e","observation_id":"726615b0-541b-47b7-85c3-e284cc80958b","resolution":{"observed_at":"2026-08-10T17:04:32.380601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.359974Z","title":"Curl: Contrastive unsupervised representations for reinforcement learning","venue":null,"work_id":"7f71fe10-64ee-4c70-87d4-13f491163431","year":2020},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.770736Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:5134921193afced131ee2cd4fa3f9f9c45d1ffa81baad01f7421f6f7837ae2fb","observation_id":"bb2441da-0e0b-4c45-b9b7-92c3c81f1039","resolution":{"observed_at":"2026-08-10T17:04:32.365128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.343798Z","title":"Cic: Contrastive intrinsic control for unsupervised skill discovery","venue":null,"work_id":"d3ff571d-705e-4864-b746-1bc07259db36","year":2021},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.775401Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:d1a58c8aa65d3eb0b5bf4f3162c93707fca66ef819858ff785ff5fc83cf897fe","observation_id":"2b80cb0b-265f-46b1-a407-77add88a25d5","resolution":{"observed_at":"2026-08-10T17:04:32.349486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.327874Z","title":"Urlb: Unsupervised reinforcement learning benchmark","venue":null,"work_id":"3a3b9cff-d37c-406a-952c-ab8059da8e2a","year":2021},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.780024Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:3b0f4caa5c1cf50420d69d8c9a67437b457c10580c703b69e56e11f0304fd9a3","observation_id":"0b57d581-455a-4b5d-9b79-286e760ea403","resolution":{"observed_at":"2026-08-10T17:04:32.333107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:31.785023Z","title":"A contextual-bandit approach to personalized news article recommendation","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.785023Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:67d1c06232dae6742ed22c189d74e2c68fc0e2684ed9c12d4c373b4c85e8770c","observation_id":"fbfafc83-6a9c-4275-aec1-51134eeed3cd","resolution":{"observed_at":"2026-08-10T17:04:31.785023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.301109Z","title":"Aps: Active pretraining with successor features","venue":null,"work_id":"f2fb2f97-dbf4-48d1-9149-45b0a7b994f4","year":2021},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.789842Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:8152d07ccaa0f5eb4e2313c96807c170a51bfd47a3733a379eb3f37bcd6cbeb7","observation_id":"586a0342-e2ce-4c97-a19a-f321767e38ac","resolution":{"observed_at":"2026-08-10T17:04:32.305952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.285427Z","title":"Count-based exploration with the successor representation","venue":null,"work_id":"98d7127f-5422-457a-bd0a-a38093ef5591","year":2020},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.794533Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:7db72cb702808cdf917ba69821f61695a36d396e7f6931e44fbb606aa3a5f6d5","observation_id":"f9c13c34-23d2-40fa-9e4e-a9a9e1d6d75e","resolution":{"observed_at":"2026-08-10T17:04:32.290227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.269858Z","title":"A dynamic theory of human motivation","venue":null,"work_id":"732cacc0-8c66-4f1f-b934-88163cf14a23","year":1958},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.801075Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:aa2d5bc6ca74f129fec9c45d6e1aa038643e23b7d2b4d4c75095c7bf74f3ccb9","observation_id":"167bf6db-1c33-49a3-a2db-506bafe739d2","resolution":{"observed_at":"2026-08-10T17:04:32.274824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.253324Z","title":"Improving intrinsic exploration with language abstractions","venue":null,"work_id":"ef89b63c-ad09-426b-b743-9698ccfade29","year":2022},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.806136Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:f7cb185550a46c341f78082a44c8a886edab0510e15428a59784a5047cf836d8","observation_id":"3e37be31-db05-4499-93aa-fec1ee4c345b","resolution":{"observed_at":"2026-08-10T17:04:32.258772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.237503Z","title":"Count-based exploration with neural density models","venue":null,"work_id":"7b23bf1a-1cc2-43ce-8873-17d6c77baf8b","year":2017},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.811005Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:e6719085be2f6319a89f4115c596fb02ddbb381047ba03ba45e5e94fb1d92837","observation_id":"f0e6ea44-e187-4119-b82d-106f8e2f4acb","resolution":{"observed_at":"2026-08-10T17:04:32.242416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00914","last_updated":"2022-02-08T07:34:26Z","snapshot_observed_at":"2026-08-09T14:57:38.077331Z","submitted_at":"2022-02-02T08:29:04Z","title":"Lipschitz-constrained Unsupervised Skill Discovery","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00914","snapshot_observed_at":"2026-08-10T17:04:31.816155Z","title":"Lipschitz-constrained unsupervised skill discovery","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.816155Z"},"links":{"cited_paper":"/paper/2202.00914","citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:4d20cd7f3b79fe909780b15e3c92b95b62eb6785c26e2978aca5b2d2468906a3","observation_id":"486ab38a-5025-4edb-b7e2-680f42fbb893","resolution":{"observed_at":"2026-08-10T17:04:31.816155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:31.820821Z","title":"Curiosity-driven exploration by self-supervised prediction","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.820821Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:d84c1abe0a61598b3893d0cbab51af43115ba29f94e784480a891805d211410b","observation_id":"d051dbc2-2728-4121-bad0-cf8043d7f72c","resolution":{"observed_at":"2026-08-10T17:04:31.820821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.211119Z","title":"Self-supervised exploration via disagreement","venue":null,"work_id":"a31839ab-b0b6-4a26-a082-6d14f89a597c","year":2019},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.825285Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:5d895252dc3a4af1ded8985faf069a7c94180d27708e2866ec0e740b2d5ae83c","observation_id":"dae2e2b5-728e-483f-a7c1-cdf48f88d5ec","resolution":{"observed_at":"2026-08-10T17:04:32.216136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.194107Z","title":"Ride: Rewarding impact-driven exploration for procedurally-generated environments","venue":null,"work_id":"02d5206f-f09a-48b1-87eb-e39935f9b6a0","year":2020},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.829753Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:eca5e7f6c5a545f2c881433eb8aaa72d1e360bd8e431fb2707e75f16520da1fc","observation_id":"c253f65d-1884-4552-b4aa-34d7aeb1d127","resolution":{"observed_at":"2026-08-10T17:04:32.199778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.176829Z","title":"Minihack the planet: A sandbox for open-ended reinforcement learning research","venue":null,"work_id":"bafb0b20-a270-4e1a-8fab-f5aabdbcf02f","year":2021},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.834609Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:218d6a3ec763ed5c5a78c9954b70abfc4323ef3d540c4e612e445de7f4c90140","observation_id":"e7f619b6-92d2-4171-836b-d697f8a232cb","resolution":{"observed_at":"2026-08-10T17:04:32.182309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-10T17:04:31.839875Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.839875Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:c2d32a683eb4c1cfc30caa7f79c29c05ac19b4f3d53a9be08d550fded6afb4d7","observation_id":"51ccc0d7-1fd0-4e2b-b73b-846d65d96fa9","resolution":{"observed_at":"2026-08-10T17:04:31.839875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.160896Z","title":"State entropy maximization with random encoders for efficient exploration","venue":null,"work_id":"017e5b8f-6a86-4ff8-8d29-1f16b5a895fa","year":2021},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.845382Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:14315adbeced8533897c0a0ff866c0ed80f5d5082a19c71e852308e42ccce742","observation_id":"e019307f-01e9-42f1-9754-8ce787f3b7cb","resolution":{"observed_at":"2026-08-10T17:04:32.166131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1507.00814","last_updated":"2015-11-19T22:40:30Z","snapshot_observed_at":"2026-08-01T13:17:26.224723Z","submitted_at":"2015-07-03T04:11:15Z","title":"Incentivizing Exploration In Reinforcement Learning With Deep Predictive Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1507.00814","snapshot_observed_at":"2026-08-10T17:04:31.850563Z","title":"Incentivizing exploration in reinforcement learning with deep predictive models","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.850563Z"},"links":{"cited_paper":"/paper/1507.00814","citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:658553552f0c5feef7914409e5f67c78fdc516b829dddcdd5132946027afdb32","observation_id":"3bd73490-d8c9-4f91-baf4-0b9fe55ed8fc","resolution":{"observed_at":"2026-08-10T17:04:31.850563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:31.855932Z","title":"Reinforcement learning: An introduction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.855932Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:3aeba3ab006fb99903561ca200291bd6828b014ac77718d73b7a8970877a25ee","observation_id":"d7c5f284-6475-4019-b3f9-cefc29542115","resolution":{"observed_at":"2026-08-10T17:04:31.855932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:31.860690Z","title":"\\# exploration: A study of count-based exploration for deep reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.860690Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:fed9c64b403bd1969da3086a38b04c35335f3bed9b02e8944aeaf79389a7c2e6","observation_id":"2cef02a3-edf5-43c6-9fc8-4a27ada1fc55","resolution":{"observed_at":"2026-08-10T17:04:31.860690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.122187Z","title":"Reinforcement learning with prototypical representations","venue":null,"work_id":"559d89cc-f060-4806-b680-9c7ed52f196d","year":2021},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.865517Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:63ef448ec6aa4894d5233f7915663b5f7205516439eb58028cd186a40b6ab7a3","observation_id":"b2bcbb78-6710-494f-8f9a-a84688d5851a","resolution":{"observed_at":"2026-08-10T17:04:32.127782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.100065Z","title":"Rewarding episodic visitation discrepancy for exploration in reinforcement learning","venue":null,"work_id":"4404058e-e483-4374-815f-b45ab49e77fc","year":2022},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.870168Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:61c041e7c7943fa4f404d3626c12e5aa3dbe72ac20bbbeba317a9980d7398c22","observation_id":"ce6a0bb6-ad98-4bdf-8008-b911a70e1984","resolution":{"observed_at":"2026-08-10T17:04:32.105311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.083871Z","title":"R \\'e nyi state entropy maximization for exploration acceleration in reinforcement learning","venue":null,"work_id":"e4bfb54f-87d0-42f1-b370-d8d30a7f3091","year":2022},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.874687Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:de8ef06917b72ad228d789239f3f28f2b42c88c9cb8a668882f53535bc32f21e","observation_id":"3f4e8c4b-f613-45e3-8860-13a13a60dd75","resolution":{"observed_at":"2026-08-10T17:04:32.089219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19548","last_updated":"2025-04-25T01:53:37Z","snapshot_observed_at":"2026-08-12T23:54:44.077783Z","submitted_at":"2024-05-29T22:23:20Z","title":"RLeXplore: Accelerating Research in Intrinsically-Motivated Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19548","snapshot_observed_at":"2026-08-10T17:04:31.880479Z","title":"Rlexplore: Accelerating research in intrinsically-motivated reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.880479Z"},"links":{"cited_paper":"/paper/2405.19548","citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:5368d31143c55b99c54d362bcf99f8cf3b045009a1702097dd9cca2437435ea0","observation_id":"f3e1a87a-8f8a-406a-abc1-4777764238e2","resolution":{"observed_at":"2026-08-10T17:04:31.880479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.067798Z","title":"Rllte: Long-term evolution project of reinforcement learning","venue":null,"work_id":"4ad00d90-151c-4ebd-be51-a635ba4b3138","year":2025},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.886926Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:f977e3fbeda1bfcf273b8082510fb3995bb704a22b2689382513248d1427cbe3","observation_id":"892dd3d4-1673-431a-b114-762c796b0303","resolution":{"observed_at":"2026-08-10T17:04:32.072848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.052146Z","title":"Noveld: A simple yet effective exploration criterion","venue":null,"work_id":"78c5412f-f9d2-4342-b29b-be2232b4d53a","year":2021},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.891809Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:ef229c16dd26f252e5dc3e3152ceb11adf87c884353738f99d91e5520657e797","observation_id":"c9f54259-2184-4fac-8134-bcbf9206621d","resolution":{"observed_at":"2026-08-10T17:04:32.057202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:31.896668Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.896668Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:b1ffb0bb54c11fd25cc0c37d648b3ae6503b16a4bedd961e70cdecdbfab64a49","observation_id":"a0e2ef72-6f7e-4268-8b52-866ea9ee5639","resolution":{"observed_at":"2026-08-10T17:04:31.896668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T12:18:59.926921Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":1,"verified_fuzzy":36},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 1 inbound Pith citation observation for arXiv:2501.12627."}