{"as_of":"2026-08-13T01:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5d692765bc12f24fc6ca57a85f60b9374bf8cc94e9d0c1e321f71974712aeddd","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T20:28:45.048339Z","state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.05766/citation-record","integrity":"/paper/2412.05766/integrity","json":"/paper/2412.05766/citation-record.json","paper":"/paper/2412.05766"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-08-11T20:28:44.751929Z","title":"Hafner, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05766","last_updated":"2024-12-08T00:21:37Z","snapshot_observed_at":"2026-08-12T20:35:45.805046Z","submitted_at":"2024-12-08T00:21:37Z","title":"Policy-shaped prediction: avoiding distractions in model-based reinforcement learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:44.751929Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2412.05766"},"observation_digest":"sha256:21321a0356e63a0c856b6a5945b0b075d6585527dfd94dbb45c4ac7acece0c42","observation_id":"ab188922-f77c-4f5a-8f2f-f8dc800750f9","resolution":{"observed_at":"2026-08-11T20:28:44.751929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-11T20:28:44.966115Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05766","last_updated":"2024-12-08T00:21:37Z","snapshot_observed_at":"2026-08-12T20:35:45.805046Z","submitted_at":"2024-12-08T00:21:37Z","title":"Policy-shaped prediction: avoiding distractions in model-based reinforcement learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:44.966115Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2412.05766"},"observation_digest":"sha256:3bee0e6f22425b0244671956608981a4f878dc76bcf3f61d79cf36e740c6ce2d","observation_id":"d5bb4fef-e4fd-4adb-9c5a-d3ea6286e56a","resolution":{"observed_at":"2026-08-11T20:28:44.966115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6034","last_updated":"2014-04-19T11:54:52Z","snapshot_observed_at":"2026-07-06T03:31:30.452356Z","submitted_at":"2013-12-20T16:45:54Z","title":"Deep Inside Convolutional Networks: Visualising Image Classification Models and Saliency Maps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6034","snapshot_observed_at":"2026-08-11T20:28:45.002755Z","title":"Simonyan, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05766","last_updated":"2024-12-08T00:21:37Z","snapshot_observed_at":"2026-08-12T20:35:45.805046Z","submitted_at":"2024-12-08T00:21:37Z","title":"Policy-shaped prediction: avoiding distractions in model-based reinforcement learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:45.002755Z"},"links":{"cited_paper":"/paper/1312.6034","citing_paper":"/paper/2412.05766"},"observation_digest":"sha256:db389529a70e0f8d0431d262ef60f47d3a540c3670353a224e37f7d8e947e61f","observation_id":"45205631-176d-4256-855a-1bd18381dd90","resolution":{"observed_at":"2026-08-11T20:28:45.002755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03825","last_updated":"2017-06-12T19:53:30Z","snapshot_observed_at":"2026-07-06T05:46:32.599765Z","submitted_at":"2017-06-12T19:53:30Z","title":"SmoothGrad: removing noise by adding noise","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03825","snapshot_observed_at":"2026-08-11T20:28:45.014569Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05766","last_updated":"2024-12-08T00:21:37Z","snapshot_observed_at":"2026-08-12T20:35:45.805046Z","submitted_at":"2024-12-08T00:21:37Z","title":"Policy-shaped prediction: avoiding distractions in model-based reinforcement learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:45.014569Z"},"links":{"cited_paper":"/paper/1706.03825","citing_paper":"/paper/2412.05766"},"observation_digest":"sha256:0a872f5980ded5274b9e65f99e2011f541803b568188c2b00aca587019b10cfb","observation_id":"56254eb0-3883-49a8-b4d8-1c3d967b23c7","resolution":{"observed_at":"2026-08-11T20:28:45.014569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-11T20:28:45.020457Z","title":"Tassa, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05766","last_updated":"2024-12-08T00:21:37Z","snapshot_observed_at":"2026-08-12T20:35:45.805046Z","submitted_at":"2024-12-08T00:21:37Z","title":"Policy-shaped prediction: avoiding distractions in model-based reinforcement learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:45.020457Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2412.05766"},"observation_digest":"sha256:164116308da1113ee55784f2dfa04d82dc78f087a8619596d786389db1e8189f","observation_id":"498ee4d0-47ef-408b-9e8d-d0e330dd76de","resolution":{"observed_at":"2026-08-11T20:28:45.020457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.15477","last_updated":"2023-04-06T23:56:38Z","snapshot_observed_at":"2026-08-12T04:21:29.004755Z","submitted_at":"2022-06-30T17:59:49Z","title":"Denoised MDPs: Learning World Models Better Than the World Itself","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.15477","snapshot_observed_at":"2026-08-11T20:28:45.031618Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05766","last_updated":"2024-12-08T00:21:37Z","snapshot_observed_at":"2026-08-12T20:35:45.805046Z","submitted_at":"2024-12-08T00:21:37Z","title":"Policy-shaped prediction: avoiding distractions in model-based reinforcement learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:45.031618Z"},"links":{"cited_paper":"/paper/2206.15477","citing_paper":"/paper/2412.05766"},"observation_digest":"sha256:6d8e211cf3a8ff5c1f58c0889b033784258e33576474ff005113aa03db0860c9","observation_id":"5ff31b1c-18ba-41e2-b8ec-0e65e87809cb","resolution":{"observed_at":"2026-08-11T20:28:45.031618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17116","last_updated":"2023-12-28T16:53:23Z","snapshot_observed_at":"2026-07-06T17:09:19.909685Z","submitted_at":"2023-12-28T16:53:23Z","title":"Generalizable Visual Reinforcement Learning with Segment Anything Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17116","snapshot_observed_at":"2026-08-11T20:28:45.037385Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05766","last_updated":"2024-12-08T00:21:37Z","snapshot_observed_at":"2026-08-12T20:35:45.805046Z","submitted_at":"2024-12-08T00:21:37Z","title":"Policy-shaped prediction: avoiding distractions in model-based reinforcement learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:45.037385Z"},"links":{"cited_paper":"/paper/2312.17116","citing_paper":"/paper/2412.05766"},"observation_digest":"sha256:ee68b9f85efc894c3adaad092321879a36bc41a6e7d2665e9fae6d5865a0abe3","observation_id":"bc6f1f18-a822-4c37-9fb2-dfb8ef8a9fe7","resolution":{"observed_at":"2026-08-11T20:28:45.037385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.09645","last_updated":"2021-07-20T17:29:13Z","snapshot_observed_at":"2026-07-06T11:30:56.150751Z","submitted_at":"2021-07-20T17:29:13Z","title":"Mastering Visual Continuous Control: Improved Data-Augmented Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.09645","snapshot_observed_at":"2026-08-11T20:28:45.043226Z","title":"Yarats, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05766","last_updated":"2024-12-08T00:21:37Z","snapshot_observed_at":"2026-08-12T20:35:45.805046Z","submitted_at":"2024-12-08T00:21:37Z","title":"Policy-shaped prediction: avoiding distractions in model-based reinforcement learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:45.043226Z"},"links":{"cited_paper":"/paper/2107.09645","citing_paper":"/paper/2412.05766"},"observation_digest":"sha256:e31a7190f36e935e5511f8e9053d1b2d2253b004f6885467029052e81341e550","observation_id":"854ae04f-e2d5-41b4-bfda-c1f862c70040","resolution":{"observed_at":"2026-08-11T20:28:45.043226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:45.446436Z","title":"We believe this level of resource consumption could be easily reduced","venue":null,"work_id":"7c322c16-a40d-4853-af6b-31e9ca3a9fd7","year":null},"citing_paper":{"arxiv_id":"2412.05766","last_updated":"2024-12-08T00:21:37Z","snapshot_observed_at":"2026-08-12T20:35:45.805046Z","submitted_at":"2024-12-08T00:21:37Z","title":"Policy-shaped prediction: avoiding distractions in model-based reinforcement learning","version":1},"reference_index":300,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:45.048339Z"},"links":{"citing_paper":"/paper/2412.05766"},"observation_digest":"sha256:f3c5f59526405bc4f0d4dad91f090ccda8fceaafd3b90e6c9c0f88cae9dc0711","observation_id":"04ca557f-b8f5-4957-afbf-ef63cf70af38","resolution":{"observed_at":"2026-08-11T20:28:45.494190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-11T20:28:44.782737Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05766","last_updated":"2024-12-08T00:21:37Z","snapshot_observed_at":"2026-08-12T20:35:45.805046Z","submitted_at":"2024-12-08T00:21:37Z","title":"Policy-shaped prediction: avoiding distractions in model-based reinforcement learning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:44.782737Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2412.05766"},"observation_digest":"sha256:144e8ed26f8aa26b36e135bb790f1fa78e96adf7682d30e5f60778fc039f9f83","observation_id":"4c35734f-9b59-49d9-a1d7-97b26f67b1fe","resolution":{"observed_at":"2026-08-11T20:28:44.782737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01603","last_updated":"2020-03-17T17:10:58Z","snapshot_observed_at":"2026-08-09T02:21:17.479736Z","submitted_at":"2019-12-03T18:57:16Z","title":"Dream to Control: Learning Behaviors by Latent Imagination","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01603","snapshot_observed_at":"2026-08-11T20:28:44.611761Z","title":"Hafner, T","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2412.05766","last_updated":"2024-12-08T00:21:37Z","snapshot_observed_at":"2026-08-12T20:35:45.805046Z","submitted_at":"2024-12-08T00:21:37Z","title":"Policy-shaped prediction: avoiding distractions in model-based reinforcement learning","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:44.611761Z"},"links":{"cited_paper":"/paper/1912.01603","citing_paper":"/paper/2412.05766"},"observation_digest":"sha256:ed0539c706a84466219fb914fb1a263d50f7642d449ea205b2a9dbc88492c2a9","observation_id":"2f380f59-b967-4b6a-8c56-593ca4dcc279","resolution":{"observed_at":"2026-08-11T20:28:44.611761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02193","last_updated":"2022-02-12T20:01:53Z","snapshot_observed_at":"2026-08-02T12:02:13.904371Z","submitted_at":"2020-10-05T17:52:14Z","title":"Mastering Atari with Discrete World Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02193","snapshot_observed_at":"2026-08-11T20:28:44.688087Z","title":"Hafner, T","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.05766","last_updated":"2024-12-08T00:21:37Z","snapshot_observed_at":"2026-08-12T20:35:45.805046Z","submitted_at":"2024-12-08T00:21:37Z","title":"Policy-shaped prediction: avoiding distractions in model-based reinforcement learning","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:44.688087Z"},"links":{"cited_paper":"/paper/2010.02193","citing_paper":"/paper/2412.05766"},"observation_digest":"sha256:14eea56319e23a3972356d415113285b0324a240f1c98e0b8d1a71b7bd6e3206","observation_id":"ad2e0e10-0ff0-4c11-95fa-176a9f6e83a4","resolution":{"observed_at":"2026-08-11T20:28:44.688087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.06548","last_updated":"2023-02-13T17:45:03Z","snapshot_observed_at":"2026-08-10T03:13:16.466090Z","submitted_at":"2023-02-13T17:45:03Z","title":"Automatic Noise Filtering with Dynamic Sparse Training in Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.06548","snapshot_observed_at":"2026-08-11T20:28:44.570722Z","title":"Grooten, G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05766","last_updated":"2024-12-08T00:21:37Z","snapshot_observed_at":"2026-08-12T20:35:45.805046Z","submitted_at":"2024-12-08T00:21:37Z","title":"Policy-shaped prediction: avoiding distractions in model-based reinforcement learning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:44.570722Z"},"links":{"cited_paper":"/paper/2302.06548","citing_paper":"/paper/2412.05766"},"observation_digest":"sha256:6180482ffc653c3641108542fe0b80200f2d9507c94c3e7b4594d0ea60ba4eaa","observation_id":"aab0590e-5cf6-4c1c-ac04-b71506a2d545","resolution":{"observed_at":"2026-08-11T20:28:44.570722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.00374","last_updated":"2024-04-03T14:26:32Z","snapshot_observed_at":"2026-08-12T07:29:47.947863Z","submitted_at":"2019-03-01T15:40:19Z","title":"Model-Based Reinforcement Learning for Atari","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.00374","snapshot_observed_at":"2026-08-11T20:28:44.771468Z","title":"Kaiser, M","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2412.05766","last_updated":"2024-12-08T00:21:37Z","snapshot_observed_at":"2026-08-12T20:35:45.805046Z","submitted_at":"2024-12-08T00:21:37Z","title":"Policy-shaped prediction: avoiding distractions in model-based reinforcement learning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:44.771468Z"},"links":{"cited_paper":"/paper/1903.00374","citing_paper":"/paper/2412.05766"},"observation_digest":"sha256:b7dd85c95e41485bc96044b3b5f3a740c39b102d33889bea57f6b3fda63ad4ee","observation_id":"6e2ad742-594b-4923-884e-58e8215b2672","resolution":{"observed_at":"2026-08-11T20:28:44.771468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.04523","last_updated":"2021-04-19T03:02:59Z","snapshot_observed_at":"2026-08-12T23:15:37.684751Z","submitted_at":"2020-02-11T16:26:07Z","title":"Objective Mismatch in Model-based Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.04523","snapshot_observed_at":"2026-08-11T20:28:44.869965Z","title":"Lambert, B","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2412.05766","last_updated":"2024-12-08T00:21:37Z","snapshot_observed_at":"2026-08-12T20:35:45.805046Z","submitted_at":"2024-12-08T00:21:37Z","title":"Policy-shaped prediction: avoiding distractions in model-based reinforcement learning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:44.869965Z"},"links":{"cited_paper":"/paper/2002.04523","citing_paper":"/paper/2412.05766"},"observation_digest":"sha256:99d7e40effd586fb2f38261e3d5a2cd02871701dce03c4baf81a27f3e1a00f05","observation_id":"e832b5b3-2826-4730-99f8-90621918d39e","resolution":{"observed_at":"2026-08-11T20:28:44.869965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.08229","last_updated":"2022-12-27T22:24:38Z","snapshot_observed_at":"2026-08-09T06:35:09.788305Z","submitted_at":"2022-07-17T17:06:52Z","title":"Guaranteed Discovery of Control-Endogenous Latent States with Multi-Step Inverse Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.08229","snapshot_observed_at":"2026-08-11T20:28:44.788015Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05766","last_updated":"2024-12-08T00:21:37Z","snapshot_observed_at":"2026-08-12T20:35:45.805046Z","submitted_at":"2024-12-08T00:21:37Z","title":"Policy-shaped prediction: avoiding distractions in model-based reinforcement learning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:44.788015Z"},"links":{"cited_paper":"/paper/2207.08229","citing_paper":"/paper/2412.05766"},"observation_digest":"sha256:519c51d47c0d9b05593b5b41b35855716cd951ba9de900b04f22133c0e9bde55","observation_id":"7a77ee94-2d1a-4ced-a14a-ed4b329fc617","resolution":{"observed_at":"2026-08-11T20:28:44.788015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01464","last_updated":"2023-06-20T19:28:16Z","snapshot_observed_at":"2026-08-12T08:46:39.573080Z","submitted_at":"2022-04-04T13:28:31Z","title":"Value Gradient weighted Model-Based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2204.01464","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.01464","snapshot_observed_at":"2026-08-11T20:28:45.185122Z","title":"Value Gradient weighted Model-Based Reinforcement Learning","venue":"cs.LG","work_id":"09e5c5bf-b3c3-4d7f-8ae4-6f3f5bcc3f97","year":2022},"citing_paper":{"arxiv_id":"2412.05766","last_updated":"2024-12-08T00:21:37Z","snapshot_observed_at":"2026-08-12T20:35:45.805046Z","submitted_at":"2024-12-08T00:21:37Z","title":"Policy-shaped prediction: avoiding distractions in model-based reinforcement learning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:45.026651Z"},"links":{"cited_paper":"/paper/2204.01464","citing_paper":"/paper/2412.05766"},"observation_digest":"sha256:804efa9ed23139bae325d4baf2fcf48ff8acc92f3fc591cf9d5f0c154f92698a","observation_id":"113827e4-2831-4d5e-9a97-95cfe4326c81","resolution":{"observed_at":"2026-08-11T20:28:45.221413Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.05766","last_updated":"2024-12-08T00:21:37Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T20:35:45.805046Z","submitted_at":"2024-12-08T00:21:37Z","title":"Policy-shaped prediction: avoiding distractions in model-based reinforcement learning"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":1,"verified_fuzzy":1},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 0 inbound Pith citation observations for arXiv:2412.05766."}