{"as_of":"2026-08-13T02:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f3b945dc1e1f7481b4e2d308ddc1bac7cf37c75784647e671186a21006ac921a","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T19:42:10.399295Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.06486/citation-record","integrity":"/paper/2412.06486/integrity","json":"/paper/2412.06486/citation-record.json","paper":"/paper/2412.06486"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.12399","last_updated":"2024-10-30T14:34:49Z","snapshot_observed_at":"2026-08-13T00:03:26.278736Z","submitted_at":"2024-05-20T22:51:05Z","title":"Diffusion for World Modeling: Visual Details Matter in Atari","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12399","snapshot_observed_at":"2026-08-11T19:42:10.189641Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.189641Z"},"links":{"cited_paper":"/paper/2405.12399","citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:f93b245a0013bd1efb405c976a9e75ea87f48c8a65318aa5c59a64ba6607dd98","observation_id":"b947bd01-8fba-4ead-bbee-b2d651283573","resolution":{"observed_at":"2026-08-11T19:42:10.189641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:42:11.372780Z","title":"Machine Learning20(1-2), 65–81 (1995)","venue":null,"work_id":"1ae622c0-48a5-4edd-8df7-52474c3c9a5c","year":1995},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.195132Z"},"links":{"citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:519d377f61cfe47fc905df17fcdf18370cf329241def03c8afdfede9f459d07c","observation_id":"973362bb-fa34-4211-98ee-95edc52a959e","resolution":{"observed_at":"2026-08-11T19:42:11.378659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09119","last_updated":"2021-06-18T04:46:41Z","snapshot_observed_at":"2026-08-06T02:39:04.613378Z","submitted_at":"2021-06-16T20:48:49Z","title":"Behavioral Priors and Dynamics Models: Improving Performance and Domain Transfer in Offline RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09119","snapshot_observed_at":"2026-08-11T19:42:10.199994Z","title":"arXiv preprint arXiv:2106.09119 (2021), abs/2106.09119","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.199994Z"},"links":{"cited_paper":"/paper/2106.09119","citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:99fab99373ad98338ebf3db4604168195f43265ea22e7fc5f8dd775f8978b05c","observation_id":"3153c975-ffaf-4e94-b376-faec6ae384ff","resolution":{"observed_at":"2026-08-11T19:42:10.199994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.05214","last_updated":"2018-09-14T01:15:28Z","snapshot_observed_at":"2026-08-12T23:30:17.434158Z","submitted_at":"2018-09-14T01:15:28Z","title":"Model-Based Reinforcement Learning via Meta-Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.05214","snapshot_observed_at":"2026-08-11T19:42:10.205189Z","title":"arXiv preprint arXiv:1809.05214 (2018), https://arxiv.org/abs/1809.05214","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.205189Z"},"links":{"cited_paper":"/paper/1809.05214","citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:88fa62751925250c53be650d7a56492d975228822edbb6d2e1d6578bd41a436b","observation_id":"b1cb7d9f-9616-4e94-b017-47126842144f","resolution":{"observed_at":"2026-08-11T19:42:10.205189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:42:11.355373Z","title":"In: Proceedings of the 28th International Conference on Machine Learning (ICML-11)","venue":null,"work_id":"ee605693-f692-434b-942b-64081a1ef075","year":2011},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.210366Z"},"links":{"citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:500d41e9c98ec8a0b65b0d92658f0395dcf9254c3eaf440a08e560f970d2a3fb","observation_id":"563fc216-1dc3-4c59-8208-49ad4e05bb89","resolution":{"observed_at":"2026-08-11T19:42:11.361030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03570","last_updated":"2024-10-15T20:56:47Z","snapshot_observed_at":"2026-08-10T17:46:40.475985Z","submitted_at":"2024-02-05T22:43:57Z","title":"Diffusion World Model: Future Modeling Beyond Step-by-Step Rollout for Offline Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03570","snapshot_observed_at":"2026-08-11T19:42:10.215013Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.215013Z"},"links":{"cited_paper":"/paper/2402.03570","citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:4b63b73c402588aa43a82b49fd4b0f28173f48bf3d07bf171ef1ae40d7c677d4","observation_id":"dfe80ac4-ac1b-4b8f-ae54-8c4ecb2dd705","resolution":{"observed_at":"2026-08-11T19:42:10.215013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02758","last_updated":"2023-02-17T21:24:30Z","snapshot_observed_at":"2026-08-12T03:41:20.467065Z","submitted_at":"2021-10-06T13:43:27Z","title":"Mismatched No More: Joint Model-Policy Optimization for Model-Based RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02758","snapshot_observed_at":"2026-08-11T19:42:10.220446Z","title":"arXiv preprint arXiv:2110.02758 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.220446Z"},"links":{"cited_paper":"/paper/2110.02758","citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:743b411e955f99fc6dfc2cbb6088329f9cb9c965fb38e26f7723d892b77bafb4","observation_id":"8badf9c3-688d-42db-ad42-a6f6cbf86a5f","resolution":{"observed_at":"2026-08-11T19:42:10.220446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:42:11.335842Z","title":"In: Proceedings of the 36th International Conference on Ma- chine Learning","venue":null,"work_id":"de01c696-ef56-4f63-8217-72a8cddf45b5","year":2019},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.225768Z"},"links":{"citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:1ee61b0dfedb4a5fcc54f7acbaaeff19db7ea3dc0298327071f8555ff5169ad9","observation_id":"9762876d-6ab6-4ee8-b71e-5873250cb41b","resolution":{"observed_at":"2026-08-11T19:42:11.342318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:42:11.311867Z","title":"In: International Conference on Learning Representations (2020)","venue":null,"work_id":"754ad5e7-6205-4045-8d1d-c85796c37fb2","year":2020},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.230979Z"},"links":{"citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:00748602cd9e31ed792f8c9cfb748716293be6aae89b259f5fea5a597014a72d","observation_id":"3ba53e6a-36a8-43b3-bbd8-688010ec5272","resolution":{"observed_at":"2026-08-11T19:42:11.318325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-08-11T19:42:10.236664Z","title":"arXiv preprint arXiv:2301.04104 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.236664Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:485c86fd1526e831d37f401aeb80ea619dbf29ba73017bee3476375e87426666","observation_id":"a225117c-de33-4553-9202-24b7cee3fc69","resolution":{"observed_at":"2026-08-11T19:42:10.236664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02193","last_updated":"2022-02-12T20:01:53Z","snapshot_observed_at":"2026-08-02T12:02:13.904371Z","submitted_at":"2020-10-05T17:52:14Z","title":"Mastering Atari with Discrete World Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02193","snapshot_observed_at":"2026-08-11T19:42:10.242391Z","title":"arXiv preprint arXiv:2010.02193 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.242391Z"},"links":{"cited_paper":"/paper/2010.02193","citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:8284d494b66585405eb978f9e7dd36366446ec3dd4fc2c7892a7032c197372d3","observation_id":"51f4aa3f-ce4c-4de6-82f2-cd726a5ea663","resolution":{"observed_at":"2026-08-11T19:42:10.242391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:42:11.294091Z","title":"In: Proceedings of the 34th International Conference on Machine Learning (ICML 2017)","venue":null,"work_id":"7edbbf74-0a5b-48db-85b0-85a7ae7effdb","year":2017},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.248617Z"},"links":{"citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:f6ce0a494832fade8bc34f69acefdf96aaca5b732ae8201f9599d984c5280481","observation_id":"cf7c2ae0-6e26-430f-9ad0-98d6376a4ef2","resolution":{"observed_at":"2026-08-11T19:42:11.299303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04363","last_updated":"2026-04-03T20:09:46Z","snapshot_observed_at":"2026-07-06T09:26:52.676528Z","submitted_at":"2020-06-08T05:30:09Z","title":"Mitigating Value Hallucination in Dyna Planning via Multistep Predecessor Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04363","snapshot_observed_at":"2026-08-11T19:42:10.253605Z","title":"arXiv preprint arXiv:2006.04363 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.253605Z"},"links":{"cited_paper":"/paper/2006.04363","citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:e191c1c2028d567a176cd116004f7a72ba01e267ba9df25c1b4253117205b852","observation_id":"ed5f68a8-abac-43ba-b957-1c64af657cba","resolution":{"observed_at":"2026-08-11T19:42:10.253605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08253","last_updated":"2021-11-29T00:49:49Z","snapshot_observed_at":"2026-08-09T12:18:09.376526Z","submitted_at":"2019-06-19T17:54:53Z","title":"When to Trust Your Model: Model-Based Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08253","snapshot_observed_at":"2026-08-11T19:42:10.258756Z","title":"arXiv preprint arXiv:1906.08253 (2019), https://arxiv.org/ abs/1906.08253","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.258756Z"},"links":{"cited_paper":"/paper/1906.08253","citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:e94b8c02ee2a8ef1c6d3d26dc721500c25d20bbf5ae0af1a1dd905cd1980169b","observation_id":"d4782f62-e473-4094-b20c-53db1a6892db","resolution":{"observed_at":"2026-08-11T19:42:10.258756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.00456","last_updated":"2019-07-08T17:21:46Z","snapshot_observed_at":"2026-08-13T01:03:17.197258Z","submitted_at":"2019-06-30T20:53:19Z","title":"Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.00456","snapshot_observed_at":"2026-08-11T19:42:10.264231Z","title":"arXiv preprint arXiv:1907.00456 (2019), https://arxiv.org/abs/1907.00456","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.264231Z"},"links":{"cited_paper":"/paper/1907.00456","citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:3d14469d6770dfb3b751d4de71db0131c49f52b48de9e1c11fc35c58b9462527","observation_id":"89f30253-fab4-4fdf-8a4f-47572aec66c7","resolution":{"observed_at":"2026-08-11T19:42:10.264231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:42:11.273941Z","title":"In: Advances in Neural Information Processing Sys- tems (2020)","venue":null,"work_id":"ac3ff250-8ebe-4fc5-9a25-3d9fcaf1c58b","year":2020},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.269370Z"},"links":{"citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:9ce976d8458865df51a20a3b0b87347c2968c34833d2081c19d24f176b7fc444","observation_id":"eaae9a28-e4b3-4c35-97e8-7f335715b546","resolution":{"observed_at":"2026-08-11T19:42:11.279370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-12T15:26:40.352724Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-11T19:42:10.274241Z","title":"arXiv preprint arXiv:2110.06169 (2021) 16 C.E","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.274241Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:c8a4058bed583af36933d02df397fdee8d5758b9295be80e12e13e419113c80f","observation_id":"494cc83e-6a33-4642-91a6-3bd7bfcf1a35","resolution":{"observed_at":"2026-08-11T19:42:10.274241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:42:11.255675Z","title":"In: Wallach, H., Larochelle, H., Beygelzimer, A., d’Alché Buc, F., Fox, E., Garnett, R","venue":null,"work_id":"245c006d-0eb2-422c-8fc9-b61dcf35e912","year":2019},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.279461Z"},"links":{"citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:24b9ecc56eb2cf8472617410c85a29310cb5982d3b403ea163948f6a76653c4b","observation_id":"bec1f690-7e6b-4a96-9787-b99b1990e7c5","resolution":{"observed_at":"2026-08-11T19:42:11.261397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:42:11.236327Z","title":"In: Advances in Neural Information Processing Systems","venue":null,"work_id":"03f6e260-205b-4c4c-b332-11b4b38ff466","year":2019},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.284609Z"},"links":{"citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:f7c29641910c9ee4e1604d0e548b20036d587d1d517e6d139ec867178223b19b","observation_id":"9fa1fdb6-41ef-424f-916b-e2d5dbe35155","resolution":{"observed_at":"2026-08-11T19:42:11.242411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.10592","last_updated":"2018-10-05T05:08:37Z","snapshot_observed_at":"2026-07-06T06:25:54.451916Z","submitted_at":"2018-02-28T18:58:22Z","title":"Model-Ensemble Trust-Region Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.10592","snapshot_observed_at":"2026-08-11T19:42:10.289841Z","title":"In: International Conference on Learning Representa- tions (2018), https://arxiv.org/abs/1802.10592","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.289841Z"},"links":{"cited_paper":"/paper/1802.10592","citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:4044d46d4568577afff144287cbfdf0ff7bae72bc4b60966be4d194f319c4eb0","observation_id":"fe4f6e9f-1fa6-47f2-95b8-5fe7820a86a0","resolution":{"observed_at":"2026-08-11T19:42:10.289841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.04523","last_updated":"2021-04-19T03:02:59Z","snapshot_observed_at":"2026-08-12T23:15:37.684751Z","submitted_at":"2020-02-11T16:26:07Z","title":"Objective Mismatch in Model-based Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.04523","snapshot_observed_at":"2026-08-11T19:42:10.295272Z","title":"arXiv preprint arXiv:2002.04523 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.295272Z"},"links":{"cited_paper":"/paper/2002.04523","citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:c7d0836d828b8c988c26cbb7f59c50e6de81163ece896f3ff8f23c9ef0eb2529","observation_id":"ca2da1fb-b1eb-40b7-8637-eaca30cb2d68","resolution":{"observed_at":"2026-08-11T19:42:10.295272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:42:10.300617Z","title":"In: Wiering, M., van Otterlo, M","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.300617Z"},"links":{"citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:c4116d2e68541e13843084915225d11d5fe9720a2bf16a3a75971a45adb4ae45","observation_id":"9d147b65-0ff4-4a7a-acfb-6baa4265167e","resolution":{"observed_at":"2026-08-11T19:42:10.300617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-11T19:42:10.309676Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.309676Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:01e9bbc0c1bf65820486dfdaab0f5b519f75e6b9b4b9656833fb393cf662c5a6","observation_id":"5b82b523-a9ca-4c87-b3fe-900a634d6cb1","resolution":{"observed_at":"2026-08-11T19:42:10.309676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:42:11.216923Z","title":"In: Advances in Neural Information Processing Systems 31 (NeurIPS 2018)","venue":null,"work_id":"832cff9a-c8c0-4994-9252-4d5030f385a6","year":2018},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.314105Z"},"links":{"citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:f05a30c0cc1d5b4cee965a1f3cbb39f2899c19e55f465b8cc116649a887e016f","observation_id":"0f14a637-6785-4a94-9ae0-1334d7a4db8a","resolution":{"observed_at":"2026-08-11T19:42:11.223196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:42:10.318529Z","title":"Nature518(7540), 529–533 (2015)","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.318529Z"},"links":{"citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:798a3a3ae77920410eb288a7699b79f9efe3ee565759965f58866b3e337b3a7a","observation_id":"1bc2afc4-8fe8-44c6-a8a1-50e1494aa701","resolution":{"observed_at":"2026-08-11T19:42:10.318529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:42:11.181783Z","title":"Journal of the American Statistical Associa- tion 96(456), 1410–1423 (2001)","venue":null,"work_id":"939b1024-0c32-4a47-b802-40b5e4f0f978","year":2001},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.323042Z"},"links":{"citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:2019a2798c56542191b0d4d62e5cbff9b0554d1a524ff570e26dd1a61df058e3","observation_id":"2d80d6ee-80af-4a74-a6b8-4ac62cbd84ea","resolution":{"observed_at":"2026-08-11T19:42:11.191433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:42:11.150028Z","title":"In: Advances in Neural Information Processing Systems","venue":null,"work_id":"0866893c-c455-4505-9fe7-500bc8a8f504","year":2019},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.327798Z"},"links":{"citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:5f8f851be71d4ab86f3d5d62e7082dadc05b60b4d8861527dbea5ffbe540f969","observation_id":"dece943e-5bdf-4777-9766-e31ebce96df4","resolution":{"observed_at":"2026-08-11T19:42:11.163423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:42:11.123896Z","title":"In: Brodley, C.E., Danyluk, A.P","venue":null,"work_id":"5408c669-2d96-4b2a-b046-9398f6c8ee48","year":2001},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.332224Z"},"links":{"citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:2404c7588556092dfae49a33c20a442b361cbc49be5e59f57f52be0c965a9602","observation_id":"8045e4a9-162c-4281-88c2-b0279028fe4e","resolution":{"observed_at":"2026-08-11T19:42:11.131171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:42:11.103354Z","title":"John Wiley & Sons, New York (1994)","venue":null,"work_id":"899e42ef-81d0-4143-918d-f02c27a1ec71","year":1994},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.337015Z"},"links":{"citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:41439b0c5f5b737c0cb11f0ad2d3de5a2fb85142d025021fee0b7b7bde8efd7c","observation_id":"49c848be-0d01-41b0-b351-7f9cb40f802d","resolution":{"observed_at":"2026-08-11T19:42:11.108584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:42:10.341398Z","title":"Nature529(7587), 484–489 (2016)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.341398Z"},"links":{"citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:e01f5392696589d17ebadf2a7edd930b17b51007520aa90614dd6228566a850e","observation_id":"b20933d8-25c2-4a78-bff2-2ee9c8db376e","resolution":{"observed_at":"2026-08-11T19:42:10.341398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:42:11.086791Z","title":"Proceedings of the Seventh International Conference on Machine Learning pp","venue":null,"work_id":"f355a55a-bd09-475b-91cf-53dd762232d3","year":1990},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.345684Z"},"links":{"citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:c72c6ecb457d4ffca2e3c2f8fbc95cffdfaccc1f7a4c5102ca9b6c701a3ec231","observation_id":"5d99fa4f-0f58-4a0b-8ddd-b3f4e6739738","resolution":{"observed_at":"2026-08-11T19:42:11.091953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:42:10.349895Z","title":"ACM SIGART Bulletin2(4), 160–163 (1991)","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.349895Z"},"links":{"citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:9d99cf64c1d8b24296a86064aeaddc5d1c8d54e3099d5f37102dd9517f493a4a","observation_id":"4d29e233-c948-4478-b0a0-6c88b739b8b2","resolution":{"observed_at":"2026-08-11T19:42:10.349895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:42:11.058148Z","title":"MIT Press, Cambridge, MA, 2 edn","venue":null,"work_id":"da46ef99-65b8-4410-8f84-fda87af0cbd4","year":2018},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.353994Z"},"links":{"citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:7dd6cb2bcc6139144c64e6998ba733cca8cf4f06960eb96a0e9c0eb9a3d52874","observation_id":"97a056d3-d514-4b22-8583-21591a2ee65d","resolution":{"observed_at":"2026-08-11T19:42:11.063501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:42:10.358222Z","title":"https://doi.org/10.1016/j.engappai.2021.104366","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.358222Z"},"links":{"citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:b8d4a55eb6220ec668afadff47126fd9e6afa86bb410fea86d77a6c87cb244e6","observation_id":"78e12b8a-c814-4161-a79f-f307329c26cb","resolution":{"observed_at":"2026-08-11T19:42:10.358222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:42:11.039429Z","title":"In: Proceedings of the 2017 IEEE/RSJ International Conference on Intelli- gent Robots and Systems (IROS)","venue":null,"work_id":"7e7cd785-49ac-4f5e-beae-3f1fdc3d52de","year":2017},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.363370Z"},"links":{"citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:31f8de401d0c47921eee013150ae75e30dd56e8e5a06ee25d53549b7f627b7b2","observation_id":"7eaea192-8683-4ad0-9380-6c531e3cabe7","resolution":{"observed_at":"2026-08-11T19:42:11.045050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:42:10.367616Z","title":"https://doi.org/ 10.5281/zenodo.8127026, https://zenodo.org/record/8127025","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.367616Z"},"links":{"citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:b0870e59de31281f6e4ddf5720c3e82b7af4dcc7a1d6000f9e98fe575cc7e909","observation_id":"3ea4fe2d-c176-4a87-828c-ff3aeffe5add","resolution":{"observed_at":"2026-08-11T19:42:10.367616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:42:11.021511Z","title":"In: Advances in Neural Information Processing Systems 9 (NIPS 1996)","venue":null,"work_id":"d7487467-0d7f-45ec-a12f-813896551d4f","year":1996},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.371897Z"},"links":{"citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:02d3833cceda3f91cf698127872a7302591d746463d981d89d91e3c8a3fb39cf","observation_id":"b00eb42e-0127-43bc-8ce0-adcf8f8b8bed","resolution":{"observed_at":"2026-08-11T19:42:11.027373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-08-12T13:17:36.653110Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-11T19:42:10.376766Z","title":"CoRR abs/1911.11361 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.376766Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:fceb1b2a1e5f142f3e935ce0c5738e8bd5c73d015bba9490ad1f9ce5d63d3183","observation_id":"f3a6a0fc-0ae1-46ce-b921-60853679256a","resolution":{"observed_at":"2026-08-11T19:42:10.376766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:42:11.003995Z","title":"In: International Conference on Learning Representa- tions","venue":null,"work_id":"8c8a9cb4-d607-4e05-9187-c4822a4530a5","year":2020},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.381760Z"},"links":{"citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:710ba8b09fc084f099e5c3c4404bb4f9e6baf9b8c8968e127f61d90e5953abbc","observation_id":"4a7f0cf4-38a0-4530-a354-58ecc3a5a6f7","resolution":{"observed_at":"2026-08-11T19:42:11.008882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:42:10.984477Z","title":"In: Advances in Neural Information Processing Systems (2020)","venue":null,"work_id":"a873431c-4c13-4274-ae6b-723557a1e088","year":2020},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.386961Z"},"links":{"citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:ec831487d5aa10a404983330e6fc10f0b6945c24b799a71dd1cbfea4548853c5","observation_id":"b032284e-ccd6-42e4-8147-f27bcac58350","resolution":{"observed_at":"2026-08-11T19:42:10.990650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:42:10.963450Z","title":"In: International Conference on Learning Representations (2020)","venue":null,"work_id":"571073ec-a9de-4505-b3e9-42c7f788caef","year":2020},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.393194Z"},"links":{"citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:4712e958cd81d23b6aeb806142f821c958a34c7b025eca19bea46e8c5f8d00e3","observation_id":"2bed0e1e-8349-4bf5-a6d8-8face270847d","resolution":{"observed_at":"2026-08-11T19:42:10.971097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.11113","last_updated":"2020-11-26T17:49:45Z","snapshot_observed_at":"2026-07-06T08:53:39.723525Z","submitted_at":"2020-01-29T22:10:11Z","title":"GradientDICE: Rethinking Generalized Offline Estimation of Stationary Values","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.11113","snapshot_observed_at":"2026-08-11T19:42:10.399295Z","title":"arXiv preprint arXiv:2001.11113 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:10.399295Z"},"links":{"cited_paper":"/paper/2001.11113","citing_paper":"/paper/2412.06486"},"observation_digest":"sha256:cfc4bf58fe1999796a98af5e3e2ebed8dfb50bfe57b78a18af4c91e4417f9e4e","observation_id":"34fb847f-b4dc-4ae1-b526-63dd1c14575e","resolution":{"observed_at":"2026-08-11T19:42:10.399295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.06486","last_updated":"2024-12-09T13:35:46Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T01:44:20.130077Z","submitted_at":"2024-12-09T13:35:46Z","title":"SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2412.06486."}