{"as_of":"2026-08-18T05:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1ec26ab9e36dfcd9def9cbd4a42ff05cce43f8de38c3235ca97cbdf2c73b4e42","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T01:04:38.609510Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T20:37:34.104637Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2006.16712","last_updated":"2022-03-31T07:59:04Z","snapshot_observed_at":"2026-08-13T19:17:05.731227Z","submitted_at":"2020-06-30T12:10:07Z","title":"Model-based Reinforcement Learning: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16712","snapshot_observed_at":"2026-08-14T13:59:09.326537Z","title":"Model-based reinforcement learning: A survey","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"1908.03963","last_updated":"2021-04-30T04:14:28Z","snapshot_observed_at":"2026-08-17T17:10:26.816609Z","submitted_at":"2019-08-11T21:40:11Z","title":"A Review of Cooperative Multi-Agent Deep Reinforcement Learning","version":4},"reference_index":119,"source":"arxiv_source","source_observed_at":"2026-08-14T13:59:09.326537Z"},"links":{"cited_paper":"/paper/2006.16712","citing_paper":"/paper/1908.03963"},"observation_digest":"sha256:b539ede926281b0d034be6b0a38c6c39b36aff00959ceb7f399fabedbc5693f7","observation_id":"82c3ec8c-fcbd-4cba-913a-2cb120c18cfd","resolution":{"observed_at":"2026-08-14T13:59:09.326537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16712","last_updated":"2022-03-31T07:59:04Z","snapshot_observed_at":"2026-08-13T19:17:05.731227Z","submitted_at":"2020-06-30T12:10:07Z","title":"Model-based Reinforcement Learning: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16712","snapshot_observed_at":"2026-08-11T14:13:09.018910Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.01432","last_updated":"2024-12-16T21:04:09Z","snapshot_observed_at":"2026-08-13T18:03:19.859725Z","submitted_at":"2024-12-16T21:04:09Z","title":"Survey on safe robot control via learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T14:13:09.018910Z"},"links":{"cited_paper":"/paper/2006.16712","citing_paper":"/paper/2501.01432"},"observation_digest":"sha256:30da08b3eb7c92cec89f2b147ae2421b9cf4d40fb6687f765fda041084deb672","observation_id":"9778ed31-dae6-45a9-afae-75edd99bc68a","resolution":{"observed_at":"2026-08-11T14:13:09.018910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16712","last_updated":"2022-03-31T07:59:04Z","snapshot_observed_at":"2026-08-13T19:17:05.731227Z","submitted_at":"2020-06-30T12:10:07Z","title":"Model-based Reinforcement Learning: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16712","snapshot_observed_at":"2026-08-09T14:59:44.989171Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01591","last_updated":"2025-07-16T18:06:24Z","snapshot_observed_at":"2026-08-16T00:04:03.391790Z","submitted_at":"2025-02-03T18:25:17Z","title":"Improving Transformer World Models for Data-Efficient RL","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T14:59:44.989171Z"},"links":{"cited_paper":"/paper/2006.16712","citing_paper":"/paper/2502.01591"},"observation_digest":"sha256:8e2b92b4d79bf07eb3bf4de2b8619acff26eeec8cd52914dd3bf390238d07505","observation_id":"acf57ae0-2144-4c3b-8141-be2b610886fc","resolution":{"observed_at":"2026-08-09T14:59:44.989171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16712","last_updated":"2022-03-31T07:59:04Z","snapshot_observed_at":"2026-08-13T19:17:05.731227Z","submitted_at":"2020-06-30T12:10:07Z","title":"Model-based Reinforcement Learning: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16712","snapshot_observed_at":"2026-08-16T01:04:38.609510Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.02216","last_updated":"2025-05-12T03:34:54Z","snapshot_observed_at":"2026-08-18T00:22:52.221802Z","submitted_at":"2025-05-04T18:59:07Z","title":"LLM-Guided Probabilistic Program Induction for POMDP Model Estimation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.609510Z"},"links":{"cited_paper":"/paper/2006.16712","citing_paper":"/paper/2505.02216"},"observation_digest":"sha256:66cbc75431e923adfb8489b32caf39060259e4b2f7e74e17ea2343e7fbbe23c9","observation_id":"ef2b4856-8ffe-4771-98b3-c7a4418d7204","resolution":{"observed_at":"2026-08-16T01:04:38.609510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16712","last_updated":"2022-03-31T07:59:04Z","snapshot_observed_at":"2026-08-13T19:17:05.731227Z","submitted_at":"2020-06-30T12:10:07Z","title":"Model-based Reinforcement Learning: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16712","snapshot_observed_at":"2026-08-15T22:17:41.070322Z","title":"Model - based Reinforcement Learning : A Survey,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.07911","last_updated":"2025-05-12T13:34:50Z","snapshot_observed_at":"2026-08-18T05:05:18.837905Z","submitted_at":"2025-05-12T13:34:50Z","title":"Combining Bayesian Inference and Reinforcement Learning for Agent Decision Making: A Review","version":1},"reference_index":147,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:41.070322Z"},"links":{"cited_paper":"/paper/2006.16712","citing_paper":"/paper/2505.07911"},"observation_digest":"sha256:ab9d93b9e2850d4452e51bf44e098d6af53dc0db282c4ea969b31892f8d584fb","observation_id":"25dfb52f-4a83-4a43-a434-0e93b6c56e3a","resolution":{"observed_at":"2026-08-15T22:17:41.070322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16712","last_updated":"2022-03-31T07:59:04Z","snapshot_observed_at":"2026-08-13T19:17:05.731227Z","submitted_at":"2020-06-30T12:10:07Z","title":"Model-based Reinforcement Learning: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16712","snapshot_observed_at":"2026-08-06T16:28:58.403785Z","title":"Moerland, Joost Broekens, Aske Plaat, and Catholijn M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":128,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:58.403785Z"},"links":{"cited_paper":"/paper/2006.16712","citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:3158b1e1525e33a8814dfce1e24c8166d652af7ef9373a6fa81983110b20b9b0","observation_id":"cc974e25-ff59-48dd-9d1b-02cd69e16eca","resolution":{"observed_at":"2026-08-06T16:28:58.403785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16712","last_updated":"2022-03-31T07:59:04Z","snapshot_observed_at":"2026-08-13T19:17:05.731227Z","submitted_at":"2020-06-30T12:10:07Z","title":"Model-based Reinforcement Learning: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16712","snapshot_observed_at":"2026-08-06T15:41:59.924682Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.15274","last_updated":"2025-07-21T06:21:58Z","snapshot_observed_at":"2026-08-09T13:10:47.842682Z","submitted_at":"2025-07-21T06:21:58Z","title":"Temporal Basis Function Models for Closed-Loop Neural Stimulation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:41:59.924682Z"},"links":{"cited_paper":"/paper/2006.16712","citing_paper":"/paper/2507.15274"},"observation_digest":"sha256:0b75be620c4eab3528ff1cd9f8695321a457e536e32684fae2eb9b7d5a8bc7cc","observation_id":"57ede97e-27cf-4f11-b2f7-a0360a63cba9","resolution":{"observed_at":"2026-08-06T15:41:59.924682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16712","last_updated":"2022-03-31T07:59:04Z","snapshot_observed_at":"2026-08-13T19:17:05.731227Z","submitted_at":"2020-06-30T12:10:07Z","title":"Model-based Reinforcement Learning: A Survey","version":4},"cited_work":{"arxiv_id":"2006.16712","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.16712","snapshot_observed_at":"2026-07-10T20:37:34.104637Z","title":"Model- based reinforcement learning: A survey","venue":"cs.LG","work_id":"2d7fcd18-6f63-488f-8c3c-cf40031f03ab","year":2020},"citing_paper":{"arxiv_id":"2604.14811","last_updated":"2026-04-16T09:32:15Z","snapshot_observed_at":"2026-08-11T07:33:41.607770Z","submitted_at":"2026-04-16T09:32:15Z","title":"Learning Ad Hoc Network Dynamics via Graph-Structured World Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T12:02:12.857242Z"},"links":{"cited_paper":"/paper/2006.16712","citing_paper":"/paper/2604.14811"},"observation_digest":"sha256:f15b6f92d6cca4538cc781e57a020e2f77ca2fdc53be8756e6241fe27711915c","observation_id":"af4e4fec-62aa-4c5f-9cb9-6cfcd635bc95","resolution":{"observed_at":"2026-05-10T12:05:22.313929Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16712","last_updated":"2022-03-31T07:59:04Z","snapshot_observed_at":"2026-08-13T19:17:05.731227Z","submitted_at":"2020-06-30T12:10:07Z","title":"Model-based Reinforcement Learning: A Survey","version":4},"cited_work":{"arxiv_id":"2006.16712","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.16712","snapshot_observed_at":"2026-07-10T20:37:34.104637Z","title":"Model- based reinforcement learning: A survey","venue":"cs.LG","work_id":"2d7fcd18-6f63-488f-8c3c-cf40031f03ab","year":2020},"citing_paper":{"arxiv_id":"2606.19328","last_updated":"2026-06-22T15:12:05Z","snapshot_observed_at":"2026-07-06T23:54:37.596257Z","submitted_at":"2026-06-17T17:54:32Z","title":"UBP2: Uncertainty-Balanced Preference Planning for Efficient Preference-based Reinforcement Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T21:27:31.026539Z"},"links":{"cited_paper":"/paper/2006.16712","citing_paper":"/paper/2606.19328"},"observation_digest":"sha256:d93f9957ff66eeb2c6a5001dc49637b2dfdd680200ea393a318a0386b7060dc6","observation_id":"e474e7f6-fa1d-4cd9-b922-df3b68bd45c1","resolution":{"observed_at":"2026-07-04T00:09:14.907252Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16712","last_updated":"2022-03-31T07:59:04Z","snapshot_observed_at":"2026-08-13T19:17:05.731227Z","submitted_at":"2020-06-30T12:10:07Z","title":"Model-based Reinforcement Learning: A Survey","version":4},"cited_work":{"arxiv_id":"2006.16712","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.16712","snapshot_observed_at":"2026-07-10T20:37:34.104637Z","title":"Model- based reinforcement learning: A survey","venue":"cs.LG","work_id":"2d7fcd18-6f63-488f-8c3c-cf40031f03ab","year":2020},"citing_paper":{"arxiv_id":"2606.24991","last_updated":"2026-06-23T14:51:59Z","snapshot_observed_at":"2026-08-17T15:01:33.366712Z","submitted_at":"2026-06-23T14:51:59Z","title":"Solving Markov Decision Processes with Future Information via MPC","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-06-25T22:00:02.577707Z"},"links":{"cited_paper":"/paper/2006.16712","citing_paper":"/paper/2606.24991"},"observation_digest":"sha256:b0723f00c3bbfecc48624da27ff0e12341c664f56694f0f45f0f6aaa96611c2d","observation_id":"b962d3f6-d0fa-4f4c-80ec-a7a1311c0a14","resolution":{"observed_at":"2026-07-04T19:00:06.260425Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16712","last_updated":"2022-03-31T07:59:04Z","snapshot_observed_at":"2026-08-13T19:17:05.731227Z","submitted_at":"2020-06-30T12:10:07Z","title":"Model-based Reinforcement Learning: A Survey","version":4},"cited_work":{"arxiv_id":"2006.16712","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.16712","snapshot_observed_at":"2026-07-10T20:37:34.104637Z","title":"Model- based reinforcement learning: A survey","venue":"cs.LG","work_id":"2d7fcd18-6f63-488f-8c3c-cf40031f03ab","year":2020},"citing_paper":{"arxiv_id":"2607.06824","last_updated":"2026-07-15T13:59:55Z","snapshot_observed_at":"2026-08-14T22:01:56.779806Z","submitted_at":"2026-07-07T21:41:59Z","title":"CaLiSym: Learning Symplectic Dynamics of Real-World Systems through Structured Canonical Lifts","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-10T20:34:14.693049Z"},"links":{"cited_paper":"/paper/2006.16712","citing_paper":"/paper/2607.06824"},"observation_digest":"sha256:0abb9770d8712548adde8281e7651fe9e261f7e2b911b5b22dfb1e777bfa8096","observation_id":"1c13e5a2-ced5-41a3-9464-9b59b8d32ebc","resolution":{"observed_at":"2026-07-10T20:37:34.106345Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16712","last_updated":"2022-03-31T07:59:04Z","snapshot_observed_at":"2026-08-13T19:17:05.731227Z","submitted_at":"2020-06-30T12:10:07Z","title":"Model-based Reinforcement Learning: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16712","snapshot_observed_at":"2026-08-02T08:18:13.594573Z","title":"Model- based reinforcement learning: A survey,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.06824","last_updated":"2026-07-15T13:59:55Z","snapshot_observed_at":"2026-08-14T22:01:56.779806Z","submitted_at":"2026-07-07T21:41:59Z","title":"CaLiSym: Learning Symplectic Dynamics of Real-World Systems through Structured Canonical Lifts","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T08:18:13.594573Z"},"links":{"cited_paper":"/paper/2006.16712","citing_paper":"/paper/2607.06824"},"observation_digest":"sha256:e089a29590aed264f0afe98ba06ebbd535495ad8bb10da4182dab90a846461b4","observation_id":"18006a6e-3f60-4329-8972-1c6e5fccadb0","resolution":{"observed_at":"2026-08-02T08:18:13.594573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16712","last_updated":"2022-03-31T07:59:04Z","snapshot_observed_at":"2026-08-13T19:17:05.731227Z","submitted_at":"2020-06-30T12:10:07Z","title":"Model-based Reinforcement Learning: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16712","snapshot_observed_at":"2026-08-01T20:28:19.676070Z","title":"URLhttps://arxiv.org/abs/2006.16712","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.16636","last_updated":"2026-07-18T04:46:53Z","snapshot_observed_at":"2026-08-09T01:27:38.331708Z","submitted_at":"2026-07-18T04:46:53Z","title":"PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T20:28:19.676070Z"},"links":{"cited_paper":"/paper/2006.16712","citing_paper":"/paper/2607.16636"},"observation_digest":"sha256:ff014330a8869b3a81f6e0876ce4fd397457c1091751b11dbda1a20dc675c236","observation_id":"d5758318-51ce-4909-bd4d-b081eeee91c9","resolution":{"observed_at":"2026-08-01T20:28:19.676070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2006.16712/citation-record","integrity":"/paper/2006.16712/integrity","json":"/paper/2006.16712/citation-record.json","paper":"/paper/2006.16712"},"outbound":[],"paper":{"arxiv_id":"2006.16712","last_updated":"2022-03-31T07:59:04Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T19:17:05.731227Z","submitted_at":"2020-06-30T12:10:07Z","title":"Model-based Reinforcement Learning: A Survey"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 13 inbound Pith citation observations for arXiv:2006.16712."}