{"as_of":"2026-08-13T21:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0a9c76be206f8a778a5d1e5e59a9d94549e1cfaf3f2361ce8795be74e082b319","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T05:09:29.269978Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.05735/citation-record","integrity":"/paper/2509.05735/integrity","json":"/paper/2509.05735/citation-record.json","paper":"/paper/2509.05735"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1905.13320","last_updated":"2019-05-30T21:30:29Z","snapshot_observed_at":"2026-07-06T07:56:54.143277Z","submitted_at":"2019-05-30T21:30:29Z","title":"Combating the Compounding-Error Problem with a Multi-step Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.13320","snapshot_observed_at":"2026-08-05T05:09:29.205646Z","title":null,"venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2509.05735","last_updated":"2025-09-06T14:52:33Z","snapshot_observed_at":"2026-08-12T00:00:11.549024Z","submitted_at":"2025-09-06T14:52:33Z","title":"Offline vs. Online Learning in Model-based RL: Lessons for Data Collection Strategies","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T05:09:29.205646Z"},"links":{"cited_paper":"/paper/1905.13320","citing_paper":"/paper/2509.05735"},"observation_digest":"sha256:c8c667f1bd38f2f29eeb7748938776455855cf1ba8aedbf5406cea4949cb96c1","observation_id":"ee287cfc-e534-4381-acbc-8d2791ef3b3f","resolution":{"observed_at":"2026-08-05T05:09:29.205646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:09:29.422143Z","title":"Below, the training of the world model M includes training all components in Eq","venue":null,"work_id":"b5204064-f17f-4fb3-a5d0-3ea037dea45f","year":2025},"citing_paper":{"arxiv_id":"2509.05735","last_updated":"2025-09-06T14:52:33Z","snapshot_observed_at":"2026-08-12T00:00:11.549024Z","submitted_at":"2025-09-06T14:52:33Z","title":"Offline vs. Online Learning in Model-based RL: Lessons for Data Collection Strategies","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T05:09:29.261773Z"},"links":{"citing_paper":"/paper/2509.05735"},"observation_digest":"sha256:468b5ff78d13d8c2c0ad3637a21f4166d823b4d9e508b8a6f22e7790f04415ab","observation_id":"32071725-ddd9-4c2f-b5c2-facf1b812fed","resolution":{"observed_at":"2026-08-05T05:09:29.425275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.09575","last_updated":"2021-03-17T11:34:54Z","snapshot_observed_at":"2026-07-06T10:50:44.662873Z","submitted_at":"2021-03-17T11:34:54Z","title":"Regularized Behavior Value Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.09575","snapshot_observed_at":"2026-08-05T05:09:29.215472Z","title":"Regularized behavior value estimation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.05735","last_updated":"2025-09-06T14:52:33Z","snapshot_observed_at":"2026-08-12T00:00:11.549024Z","submitted_at":"2025-09-06T14:52:33Z","title":"Offline vs. Online Learning in Model-based RL: Lessons for Data Collection Strategies","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T05:09:29.215472Z"},"links":{"cited_paper":"/paper/2103.09575","citing_paper":"/paper/2509.05735"},"observation_digest":"sha256:2aced9bd142af5e94786465f29a1eba0933bfd83f6f16dfe2dd9db1a9dc51a8b","observation_id":"86bb3937-28c7-4ce8-90fb-f09a9540103e","resolution":{"observed_at":"2026-08-05T05:09:29.215472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03360","last_updated":"2023-05-05T08:23:56Z","snapshot_observed_at":"2026-08-13T11:48:48.004198Z","submitted_at":"2023-05-05T08:23:56Z","title":"A Survey on Offline Model-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2305.03360","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.03360","snapshot_observed_at":"2026-08-05T05:09:29.340499Z","title":"A Survey on Offline Model-Based Reinforcement Learning","venue":"cs.LG","work_id":"55ce1997-0859-4cb2-a3ab-2aee69d5b211","year":2023},"citing_paper":{"arxiv_id":"2509.05735","last_updated":"2025-09-06T14:52:33Z","snapshot_observed_at":"2026-08-12T00:00:11.549024Z","submitted_at":"2025-09-06T14:52:33Z","title":"Offline vs. Online Learning in Model-based RL: Lessons for Data Collection Strategies","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T05:09:29.225492Z"},"links":{"cited_paper":"/paper/2305.03360","citing_paper":"/paper/2509.05735"},"observation_digest":"sha256:3c44cd5a1072ffefb2a4d0b15d07fa95120750020e0535c18f9e3cf7ec9bcc1b","observation_id":"783a355f-10d1-4167-9e5b-b7b0dd5e819c","resolution":{"observed_at":"2026-08-05T05:09:29.343895Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:09:29.450971Z","title":"Discor: Corrective feedback in reinforcement learning via distribution correction","venue":null,"work_id":"639589b9-ed6c-4da7-9a38-e65f336610f0","year":2025},"citing_paper":{"arxiv_id":"2509.05735","last_updated":"2025-09-06T14:52:33Z","snapshot_observed_at":"2026-08-12T00:00:11.549024Z","submitted_at":"2025-09-06T14:52:33Z","title":"Offline vs. Online Learning in Model-based RL: Lessons for Data Collection Strategies","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T05:09:29.234724Z"},"links":{"citing_paper":"/paper/2509.05735"},"observation_digest":"sha256:7115479270930f4da9ba05a15d8b24015fd2cdb0805e3c4b700cf765e0510b2e","observation_id":"aeccf0ce-10ea-4c16-809e-db11a1d5e6ce","resolution":{"observed_at":"2026-08-05T05:09:29.454915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:09:29.442173Z","title":"Andrew Bagnell","venue":null,"work_id":"14708cd6-3249-4d1a-b238-37e82bd02014","year":1905},"citing_paper":{"arxiv_id":"2509.05735","last_updated":"2025-09-06T14:52:33Z","snapshot_observed_at":"2026-08-12T00:00:11.549024Z","submitted_at":"2025-09-06T14:52:33Z","title":"Offline vs. Online Learning in Model-based RL: Lessons for Data Collection Strategies","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T05:09:29.238447Z"},"links":{"citing_paper":"/paper/2509.05735"},"observation_digest":"sha256:b2c1e1f82afa86651fd7a02394d659100298e65c45d5cb9a4fe71d88637dfe49","observation_id":"49a3ba7d-8906-4510-b54e-b22e15165640","resolution":{"observed_at":"2026-08-05T05:09:29.445196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12527","last_updated":"2024-11-29T19:52:18Z","snapshot_observed_at":"2026-08-13T04:15:02.568576Z","submitted_at":"2024-02-19T20:38:00Z","title":"The Edge-of-Reach Problem in Offline Model-Based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2402.12527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.12527","snapshot_observed_at":"2026-08-05T05:09:29.319190Z","title":"The Edge-of-Reach Problem in Offline Model-Based Reinforcement Learning","venue":"cs.LG","work_id":"f319f881-df27-4c52-b6ff-0ac7a4b28499","year":2024},"citing_paper":{"arxiv_id":"2509.05735","last_updated":"2025-09-06T14:52:33Z","snapshot_observed_at":"2026-08-12T00:00:11.549024Z","submitted_at":"2025-09-06T14:52:33Z","title":"Offline vs. Online Learning in Model-based RL: Lessons for Data Collection Strategies","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T05:09:29.241251Z"},"links":{"cited_paper":"/paper/2402.12527","citing_paper":"/paper/2509.05735"},"observation_digest":"sha256:0de55bdcc5d83efc947481dd03656c4b1362fffec4d9572d79d73b316a69f6b6","observation_id":"d18d4844-7d4d-422d-8037-d70e1072919e","resolution":{"observed_at":"2026-08-05T05:09:29.324068Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08448","last_updated":"2024-05-14T09:12:30Z","snapshot_observed_at":"2026-08-13T00:55:26.938356Z","submitted_at":"2024-05-14T09:12:30Z","title":"Understanding the performance gap between online and offline alignment algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08448","snapshot_observed_at":"2026-08-05T05:09:29.245182Z","title":"Understanding the performance gap between online and offline alignment algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.05735","last_updated":"2025-09-06T14:52:33Z","snapshot_observed_at":"2026-08-12T00:00:11.549024Z","submitted_at":"2025-09-06T14:52:33Z","title":"Offline vs. Online Learning in Model-based RL: Lessons for Data Collection Strategies","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T05:09:29.245182Z"},"links":{"cited_paper":"/paper/2405.08448","citing_paper":"/paper/2509.05735"},"observation_digest":"sha256:248148f84e0f6e07eea4aafa889cbd2248d68a6e23fc8404d3ef11749f7f1d41","observation_id":"372920bb-6144-4d2a-9de6-51c63bbeb966","resolution":{"observed_at":"2026-08-05T05:09:29.245182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.13425","last_updated":"2022-04-05T19:24:13Z","snapshot_observed_at":"2026-07-06T12:33:01.613365Z","submitted_at":"2022-01-31T18:39:27Z","title":"Don't Change the Algorithm, Change the Data: Exploratory Data for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.13425","snapshot_observed_at":"2026-08-05T05:09:29.248222Z","title":"Don’t change the algorithm, change the data: Exploratory data for offline reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.05735","last_updated":"2025-09-06T14:52:33Z","snapshot_observed_at":"2026-08-12T00:00:11.549024Z","submitted_at":"2025-09-06T14:52:33Z","title":"Offline vs. Online Learning in Model-based RL: Lessons for Data Collection Strategies","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T05:09:29.248222Z"},"links":{"cited_paper":"/paper/2201.13425","citing_paper":"/paper/2509.05735"},"observation_digest":"sha256:a7a680cd745c57d0ab8008f89ff85fa84f884f49882ebbd0877005b5d5049622","observation_id":"ea4bdc3f-4d47-4feb-b7de-06859784cd58","resolution":{"observed_at":"2026-08-05T05:09:29.248222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.03176","last_updated":"2019-06-07T00:36:50Z","snapshot_observed_at":"2026-07-06T07:37:51.655095Z","submitted_at":"2019-03-07T20:34:36Z","title":"MinAtar: An Atari-Inspired Testbed for Thorough and Reproducible Reinforcement Learning Experiments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.03176","snapshot_observed_at":"2026-08-05T05:09:29.251166Z","title":"Minatar: An atari-inspired testbed for thorough and reproducible reinforcement learning experiments","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2509.05735","last_updated":"2025-09-06T14:52:33Z","snapshot_observed_at":"2026-08-12T00:00:11.549024Z","submitted_at":"2025-09-06T14:52:33Z","title":"Offline vs. Online Learning in Model-based RL: Lessons for Data Collection Strategies","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T05:09:29.251166Z"},"links":{"cited_paper":"/paper/1903.03176","citing_paper":"/paper/2509.05735"},"observation_digest":"sha256:24642efe8217b9f3534289257dd5daf7355c38f762154d2093500ff2791dbfe3","observation_id":"05cd2f78-30c3-45ae-a746-040560acf259","resolution":{"observed_at":"2026-08-05T05:09:29.251166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:09:29.432065Z","title":"A Implementation Details A.1 Runtime Overview Our experiments comprised approximately 2000 runs, totaling 20000 GPU hours","venue":null,"work_id":"5713fe4d-8563-4856-8a9b-e5e425c2e2b2","year":2025},"citing_paper":{"arxiv_id":"2509.05735","last_updated":"2025-09-06T14:52:33Z","snapshot_observed_at":"2026-08-12T00:00:11.549024Z","submitted_at":"2025-09-06T14:52:33Z","title":"Offline vs. Online Learning in Model-based RL: Lessons for Data Collection Strategies","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T05:09:29.258053Z"},"links":{"citing_paper":"/paper/2509.05735"},"observation_digest":"sha256:1e82d4170f348b804ec3939bcb486d490ca8f6767c124d395b06e33e26b0c628","observation_id":"8ba0897d-c032-412c-8d51-8790df24a9bc","resolution":{"observed_at":"2026-08-05T05:09:29.436594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:09:29.412309Z","title":"-same”, while the different model initialization is marked with “-diff","venue":null,"work_id":"15f8efd0-ae79-4395-8f7c-705c9ceb599a","year":2022},"citing_paper":{"arxiv_id":"2509.05735","last_updated":"2025-09-06T14:52:33Z","snapshot_observed_at":"2026-08-12T00:00:11.549024Z","submitted_at":"2025-09-06T14:52:33Z","title":"Offline vs. Online Learning in Model-based RL: Lessons for Data Collection Strategies","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T05:09:29.265767Z"},"links":{"citing_paper":"/paper/2509.05735"},"observation_digest":"sha256:a15e0dbb2d40d64aac62c8dba82b20fe3d3b50853cfe55b2886fed20079a285d","observation_id":"ab6cea53-7737-43db-94cd-71264f022b31","resolution":{"observed_at":"2026-08-05T05:09:29.415889Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:09:29.402697Z","title":null,"venue":null,"work_id":"94e28c9f-e9dd-4101-9e98-a51c12242b0f","year":2021},"citing_paper":{"arxiv_id":"2509.05735","last_updated":"2025-09-06T14:52:33Z","snapshot_observed_at":"2026-08-12T00:00:11.549024Z","submitted_at":"2025-09-06T14:52:33Z","title":"Offline vs. Online Learning in Model-based RL: Lessons for Data Collection Strategies","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T05:09:29.269978Z"},"links":{"citing_paper":"/paper/2509.05735"},"observation_digest":"sha256:670b37c8a2426968cdcbc5554172549fee497199fb199397e475d34881716c12","observation_id":"a571720c-4a66-4583-aae5-55809fd18630","resolution":{"observed_at":"2026-08-05T05:09:29.406556Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-08-05T05:09:29.222266Z","title":"Mastering diverse domains through world models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.05735","last_updated":"2025-09-06T14:52:33Z","snapshot_observed_at":"2026-08-12T00:00:11.549024Z","submitted_at":"2025-09-06T14:52:33Z","title":"Offline vs. Online Learning in Model-based RL: Lessons for Data Collection Strategies","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-05T05:09:29.222266Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2509.05735"},"observation_digest":"sha256:950388a85485fc4d9bf808ea8eaff4da230eba7ddc3c27708041e373542e44a4","observation_id":"45390c4c-59ae-464e-8f66-d06cee0d787c","resolution":{"observed_at":"2026-08-05T05:09:29.222266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.14876","last_updated":"2021-06-28T17:50:40Z","snapshot_observed_at":"2026-08-12T14:32:59.345704Z","submitted_at":"2021-06-28T17:50:40Z","title":"Multi-task curriculum learning in a complex, visual, hard-exploration domain: Minecraft","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.14876","snapshot_observed_at":"2026-08-05T05:09:29.228691Z","title":"Multi-task curriculum learning in a complex, visual, hard-exploration domain: Minecraft","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.05735","last_updated":"2025-09-06T14:52:33Z","snapshot_observed_at":"2026-08-12T00:00:11.549024Z","submitted_at":"2025-09-06T14:52:33Z","title":"Offline vs. Online Learning in Model-based RL: Lessons for Data Collection Strategies","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-05T05:09:29.228691Z"},"links":{"cited_paper":"/paper/2106.14876","citing_paper":"/paper/2509.05735"},"observation_digest":"sha256:b309510833ec2d0237dbfd9c26c75dd1779fc9877d1e6a77967873e99304c20d","observation_id":"5422bfd4-e554-4c47-847b-13464b51c3e6","resolution":{"observed_at":"2026-08-05T05:09:29.228691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:09:29.461195Z","title":"Exploring generalization and adaptability of offline reinforcement learning for robot manipulation","venue":null,"work_id":"146ee793-295f-4897-96f2-feb7e0168660","year":2023},"citing_paper":{"arxiv_id":"2509.05735","last_updated":"2025-09-06T14:52:33Z","snapshot_observed_at":"2026-08-12T00:00:11.549024Z","submitted_at":"2025-09-06T14:52:33Z","title":"Offline vs. Online Learning in Model-based RL: Lessons for Data Collection Strategies","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-05T05:09:29.231579Z"},"links":{"citing_paper":"/paper/2509.05735"},"observation_digest":"sha256:00e048da712ffbe45711987e3c9c6aca96947e8763bfcce7dc9fb8a1d6ae5b5f","observation_id":"970f977b-940e-4d93-b523-185692526cbc","resolution":{"observed_at":"2026-08-05T05:09:29.464306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09241","last_updated":"2022-10-17T16:34:01Z","snapshot_observed_at":"2026-08-13T14:03:32.523106Z","submitted_at":"2022-10-17T16:34:01Z","title":"Boosting Offline Reinforcement Learning via Data Rebalancing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09241","snapshot_observed_at":"2026-08-05T05:09:29.254979Z","title":"Boosting offline reinforcement learning via data rebalancing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.05735","last_updated":"2025-09-06T14:52:33Z","snapshot_observed_at":"2026-08-12T00:00:11.549024Z","submitted_at":"2025-09-06T14:52:33Z","title":"Offline vs. Online Learning in Model-based RL: Lessons for Data Collection Strategies","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-05T05:09:29.254979Z"},"links":{"cited_paper":"/paper/2210.09241","citing_paper":"/paper/2509.05735"},"observation_digest":"sha256:f1361253b8f440b4c144630c040fe637feb64cc4c286388f8e1b4d8c96cd9376","observation_id":"912e2045-4ae9-4daa-b764-dd6721502493","resolution":{"observed_at":"2026-08-05T05:09:29.254979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.04551","last_updated":"2019-06-04T18:13:09Z","snapshot_observed_at":"2026-07-06T07:14:03.735574Z","submitted_at":"2018-11-12T04:30:10Z","title":"Learning Latent Dynamics for Planning from Pixels","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.04551","snapshot_observed_at":"2026-08-05T05:09:29.219130Z","title":"Learning latent dynamics for planning from pixels","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.05735","last_updated":"2025-09-06T14:52:33Z","snapshot_observed_at":"2026-08-12T00:00:11.549024Z","submitted_at":"2025-09-06T14:52:33Z","title":"Offline vs. Online Learning in Model-based RL: Lessons for Data Collection Strategies","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T05:09:29.219130Z"},"links":{"cited_paper":"/paper/1811.04551","citing_paper":"/paper/2509.05735"},"observation_digest":"sha256:b2e029a00c79d1c7d6e2340790dd7dcebe05a9c7dd9d6fb9b77956bed577369a","observation_id":"e885a2ad-9441-46a0-af61-63eaf5aa4185","resolution":{"observed_at":"2026-08-05T05:09:29.219130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03870","last_updated":"2023-05-09T22:25:00Z","snapshot_observed_at":"2026-08-13T11:48:14.375520Z","submitted_at":"2023-05-05T22:55:34Z","title":"Knowledge Transfer from Teachers to Learners in Growing-Batch Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2305.03870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.03870","snapshot_observed_at":"2026-08-05T05:09:29.374114Z","title":"Knowledge Transfer from Teachers to Learners in Growing-Batch Reinforcement Learning","venue":"cs.LG","work_id":"f8fbd5ba-2142-49ab-939d-978fca368950","year":2023},"citing_paper":{"arxiv_id":"2509.05735","last_updated":"2025-09-06T14:52:33Z","snapshot_observed_at":"2026-08-12T00:00:11.549024Z","submitted_at":"2025-09-06T14:52:33Z","title":"Offline vs. Online Learning in Model-based RL: Lessons for Data Collection Strategies","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T05:09:29.212419Z"},"links":{"cited_paper":"/paper/2305.03870","citing_paper":"/paper/2509.05735"},"observation_digest":"sha256:18d3e48236fac5c4308de7a23580cf159b4760043904f026174f1ed8e5dfeeb6","observation_id":"ac127ea4-8e9e-4825-89da-61919d9a4b69","resolution":{"observed_at":"2026-08-05T05:09:29.377909Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09119","last_updated":"2021-06-18T04:46:41Z","snapshot_observed_at":"2026-08-13T19:02:32.411107Z","submitted_at":"2021-06-16T20:48:49Z","title":"Behavioral Priors and Dynamics Models: Improving Performance and Domain Transfer in Offline RL","version":2},"cited_work":{"arxiv_id":"2106.09119","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.09119","snapshot_observed_at":"2026-08-05T05:09:29.386179Z","title":"Behavioral Priors and Dynamics Models: Improving Performance and Domain Transfer in Offline RL","venue":"cs.LG","work_id":"5428d64d-c07d-42b7-bf16-b159da8d4c29","year":2021},"citing_paper":{"arxiv_id":"2509.05735","last_updated":"2025-09-06T14:52:33Z","snapshot_observed_at":"2026-08-12T00:00:11.549024Z","submitted_at":"2025-09-06T14:52:33Z","title":"Offline vs. Online Learning in Model-based RL: Lessons for Data Collection Strategies","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T05:09:29.209188Z"},"links":{"cited_paper":"/paper/2106.09119","citing_paper":"/paper/2509.05735"},"observation_digest":"sha256:a6b3148784843e6fda2af5f19b47052335a61c69f0c808ee0c77f0fe00484971","observation_id":"a1289718-f32d-456a-b445-3dc26cc19514","resolution":{"observed_at":"2026-08-05T05:09:29.389938Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.05735","last_updated":"2025-09-06T14:52:33Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T00:00:11.549024Z","submitted_at":"2025-09-06T14:52:33Z","title":"Offline vs. Online Learning in Model-based RL: Lessons for Data Collection Strategies"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":10,"verified_exact":3,"verified_fuzzy":5},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 0 inbound Pith citation observations for arXiv:2509.05735."}