{"as_of":"2026-08-20T13:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c777dde30fe3d166599e42cee39fa8b16689550ab781cc442df05ad63ac6773f","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T20:47:41.308466Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.09722/citation-record","integrity":"/paper/2411.09722/integrity","json":"/paper/2411.09722/citation-record.json","paper":"/paper/2411.09722"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.959624Z","title":"Swazinna, S","venue":null,"work_id":"aa27a0c6-6879-4528-ad0a-fbbd4560228e","year":2021},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.133523Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:52d87a97fa9eb85d24b6984a7c3dfe364e44ea9e22d785d4cb52548372ccf5e4","observation_id":"baea27a8-b8a8-4b29-a92b-0d9ed4d63090","resolution":{"observed_at":"2026-08-12T20:47:41.962900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.950003Z","title":null,"venue":null,"work_id":"1809a2ac-87b3-4c04-891a-4b72ff9996e0","year":2021},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.138522Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:b4a7c9befec4923072c99ce2a8b8f5fc9631ccb3f8eb31041d8372b6fe029988","observation_id":"c0b5c7d2-f0bb-4677-8a32-6d99c98dd0a8","resolution":{"observed_at":"2026-08-12T20:47:41.953391Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.939753Z","title":null,"venue":null,"work_id":"a389f3ea-45c8-4b0a-ae0a-1399592a947d","year":2017},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.142320Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:46bc5ee8752f773b771ecd35ba835d92bf33d26f469e43199009ad9cce039dbe","observation_id":"38a072be-3f9d-4f8c-b0f0-14065cc9b6d7","resolution":{"observed_at":"2026-08-12T20:47:41.943477Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03647","last_updated":"2020-06-23T16:54:09Z","snapshot_observed_at":"2026-08-15T09:46:30.948536Z","submitted_at":"2020-06-05T19:33:19Z","title":"Deployment-Efficient Reinforcement Learning via Model-Based Offline Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03647","snapshot_observed_at":"2026-08-12T20:47:41.146371Z","title":"Matsushima, H","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.146371Z"},"links":{"cited_paper":"/paper/2006.03647","citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:cca5e2988791295df6d6e8407cd08543cd9654afc0a64d1854d95d471097f146","observation_id":"2c2c3844-7be9-45cc-b185-156081afaa58","resolution":{"observed_at":"2026-08-12T20:47:41.146371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05726","last_updated":"2023-10-17T16:25:25Z","snapshot_observed_at":"2026-08-20T09:48:10.243413Z","submitted_at":"2023-06-09T07:46:24Z","title":"Iteratively Refined Behavior Regularization for Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2306.05726","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.05726","snapshot_observed_at":"2026-08-12T20:47:41.610040Z","title":"Iteratively Refined Behavior Regularization for Offline Reinforcement Learning","venue":"cs.LG","work_id":"8048295b-7f68-4c14-a0a4-bb66b569ce22","year":2023},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.150335Z"},"links":{"cited_paper":"/paper/2306.05726","citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:58cf17908a5caf1ef7058873cf469f1d694c85f426716a16a5a16d99d896c6eb","observation_id":"f4dcf8f0-80de-487b-92f0-17e0e961f924","resolution":{"observed_at":"2026-08-12T20:47:41.614831Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.930140Z","title":"Zhang, L","venue":null,"work_id":"ca464694-a320-45d0-96e9-b617184b731d","year":2023},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.154072Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:a24b3024d58fe85c3adb8d82a135d04c3cd65edd24b352dafff9edd6e50e01de","observation_id":"55695fe5-8b1b-4a25-b3d0-7feede4eeede","resolution":{"observed_at":"2026-08-12T20:47:41.933634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.920316Z","title":"Ernst, M","venue":null,"work_id":"af91311d-af8f-4977-8a8b-652d150d3f0f","year":2005},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.157701Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:a3cf3c8ae67e6c31c8960752e79ff5abd88af5ff31522e1bc6336edae9334e96","observation_id":"88ed4f6e-9224-4677-adea-e8c74999192a","resolution":{"observed_at":"2026-08-12T20:47:41.923767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.909696Z","title":"Riedmiller","venue":null,"work_id":"9da4f4b2-26f9-4937-a88d-d165cd3b2035","year":2005},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.160746Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:f2bc6e9711058cf971f025496c9e3373c05bd8913d97489d0c09e1bbc410e63b","observation_id":"68c30bc7-28cd-44fa-b7ff-bbc6d7211145","resolution":{"observed_at":"2026-08-12T20:47:41.913203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.899426Z","title":"Riedmiller, T","venue":null,"work_id":"b93963f4-627a-4ce9-97e2-280be81882a0","year":2009},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.164027Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:e2b8a4dba939a748aec3362c16500cf22fed8cac83f7792cb918010ca648291d","observation_id":"d42e0400-740e-4db2-b6bd-78b866b1a99a","resolution":{"observed_at":"2026-08-12T20:47:41.903072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.889640Z","title":"Lange, T","venue":null,"work_id":"70f95735-e04b-4af2-8eac-a2d937044426","year":2012},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.167320Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:5b1884cb203609bbfa40d53299824b0e0e34c4d9f18935cccbe05546ad731751","observation_id":"ebb67969-2615-4c9d-9222-1b6d86edbf8b","resolution":{"observed_at":"2026-08-12T20:47:41.893147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.879420Z","title":null,"venue":null,"work_id":"46998eb9-66aa-47c2-9c14-340f3fa946ca","year":2016},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.170526Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:6a10c1309922f303e40f9b506367aabd28a4e32edcda784b5d8d6732a830564d","observation_id":"e1c42eff-c223-4ec1-a0f2-a158b5f0e0b3","resolution":{"observed_at":"2026-08-12T20:47:41.883029Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.868831Z","title":"Depeweg, J","venue":null,"work_id":"89a1bd84-baee-4fb7-8942-0f4a19027170","year":2017},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.173724Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:027eb30b2dc4bfb32b0a657a1a73c97066782c3b2c8187fc56f1bac7496d0c68","observation_id":"19d16d6d-bcae-4f81-b986-7ca422082b74","resolution":{"observed_at":"2026-08-12T20:47:41.872665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.858103Z","title":null,"venue":null,"work_id":"12b7fa04-0d6e-4e16-9cae-ad77c55acb00","year":2018},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.176985Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:79fbed64de17d09b7bd9a4eaa22507e57344e5c5222dca6c8bf3623c5f51935a","observation_id":"f159b5a8-a407-464a-bbe5-2aa31e6b6c08","resolution":{"observed_at":"2026-08-12T20:47:41.861819Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.847875Z","title":"Depeweg, J.-M","venue":null,"work_id":"efc2fbfa-4c6b-4384-98fd-48d2bb87867b","year":2018},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.180214Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:1f5fe5f5caa3edb7b514fb681d7da54f315047c18d9172205910670bd0060101","observation_id":"9a7c2ee1-7283-4da4-87a1-57d60ab473c9","resolution":{"observed_at":"2026-08-12T20:47:41.851540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.837752Z","title":"Silver, G","venue":null,"work_id":"c81d3f4c-d958-48e5-af47-33918ca8eb61","year":2014},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.183234Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:38c145e3503054242a54af27eed745369fee17496ca2fba5fcafd93134cd80fe","observation_id":"ac807bce-3985-4452-8c62-ab56b54f2464","resolution":{"observed_at":"2026-08-12T20:47:41.841236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-12T20:47:41.186542Z","title":"Schulman, F","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.186542Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:46596ea822493754c957676fa14ef11067d69e7995b4d4b52437dadfeba03f04","observation_id":"df67475a-3344-44f8-bb1d-40db5796320c","resolution":{"observed_at":"2026-08-12T20:47:41.186542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01290","last_updated":"2018-08-08T21:27:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-01-04T09:50:50Z","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.01290","snapshot_observed_at":"2026-08-12T20:47:41.189937Z","title":"Haarnoja, A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.189937Z"},"links":{"cited_paper":"/paper/1801.01290","citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:ac4463ec528fde194835f017689397bc4506752f1b86a597d2f5514cb37a03d9","observation_id":"5e24cdee-19a5-4c68-a66a-bd9fb7088066","resolution":{"observed_at":"2026-08-12T20:47:41.189937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.827191Z","title":"Fujimoto, D","venue":null,"work_id":"c32551f7-6016-4285-a78d-2964745a9d41","year":2019},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.193715Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:b6fb9baee55fbd0e87fecfe4a63afeb6a6d2a112dbfe9c940137133436cdcac4","observation_id":"98e7c06a-8ff2-4ccf-9992-e794d5e71ce5","resolution":{"observed_at":"2026-08-12T20:47:41.830814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.816837Z","title":"Kumar, J","venue":null,"work_id":"a2f0e487-7be2-4619-9b51-cccd1c400c7e","year":2019},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.197040Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:c2c08dd1dc2a5e6fcf96f5087065975753b884fdc774b9d68c720eeb4ae0950f","observation_id":"fa126106-783f-4b04-8ee2-8e275d229e31","resolution":{"observed_at":"2026-08-12T20:47:41.820463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-08-12T13:17:36.653110Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-12T20:47:41.200672Z","title":null,"venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.200672Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:e03f8d3033bfa45eca87afc9089fc6cef5e069015fd2cb2e2d4683573e6693ad","observation_id":"364732df-c85a-4534-ac11-1b0ccae7f325","resolution":{"observed_at":"2026-08-12T20:47:41.200672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-08-17T05:44:04.325551Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-12T20:47:41.204241Z","title":"Kumar, A","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.204241Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:1197ac4cf2836dd420859ef9d21ca13d101addd9eaa3cacba6354eb7d5f581ed","observation_id":"039eed4f-f7a5-4231-9493-cdfcac462ff4","resolution":{"observed_at":"2026-08-12T20:47:41.204241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.207800Z","title":"Fujimoto and S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.207800Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:ffc336573ddb2c88277fceba414ba4ed3ed6f5baadebdb41d97f5bfb2a81ff0c","observation_id":"0d2d64fa-fb64-4cd5-ba0d-8c216076e20b","resolution":{"observed_at":"2026-08-12T20:47:41.207800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-13T07:57:56.087944Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-12T20:47:41.211016Z","title":"Kostrikov, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.211016Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:64fafed4b5bd7ebd4766cdda3d8877180bc9eeb35fb021865bdc598a4580be52","observation_id":"042baa0b-1afe-4387-9824-21d356c7369a","resolution":{"observed_at":"2026-08-12T20:47:41.211016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08396","last_updated":"2020-06-17T10:12:44Z","snapshot_observed_at":"2026-08-17T23:13:02.773256Z","submitted_at":"2020-02-19T19:21:08Z","title":"Keep Doing What Worked: Behavioral Modelling Priors for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08396","snapshot_observed_at":"2026-08-12T20:47:41.214592Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.214592Z"},"links":{"cited_paper":"/paper/2002.08396","citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:0083633e9067a88b37c0b82a17a65a6b2e50f1b0f003ebb4f994be2de7dc43a7","observation_id":"5771f901-66f9-4bac-864d-adc6b2ddc2ad","resolution":{"observed_at":"2026-08-12T20:47:41.214592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.218162Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.218162Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:aa136afd87b92fe11eb04472fa3bffb4a741a615a01ebbd7c434b885e787fe17","observation_id":"f6a2221a-b96b-4b53-9505-2baa3e205f28","resolution":{"observed_at":"2026-08-12T20:47:41.218162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.794734Z","title":"Yin and Y .-X","venue":null,"work_id":"2063dc6f-ad9e-4aff-a90d-f1b7d67ab566","year":2021},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.221550Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:69ea5132e1691f5b0019546ce7a4ef935f2022cd14b41be9401c282be688b367","observation_id":"4a8331ce-b95e-4dd6-a96a-fa4c1c42d2a6","resolution":{"observed_at":"2026-08-12T20:47:41.798082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.785246Z","title":"Deisenroth and C","venue":null,"work_id":"764b0198-7afa-4da6-81cd-babfbf30daa6","year":2011},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.224944Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:f9bb4ad7676d7494470b7de2dfe44f860b95c14d05ab803778336b8e85d1a98e","observation_id":"bfadec26-7551-47a4-b56d-9cee690cb75e","resolution":{"observed_at":"2026-08-12T20:47:41.788739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.775064Z","title":"Nagabandi, G","venue":null,"work_id":"301f6528-1c7b-41b0-853f-cbafa2504a54","year":2018},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.228412Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:fcc50a9511290585f750a9444eab0d9952c050c62ba82408b8a4f24c0a4ed4ba","observation_id":"ca2c9651-c485-4bb7-b59d-ed1bbf24406e","resolution":{"observed_at":"2026-08-12T20:47:41.778647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.764177Z","title":null,"venue":null,"work_id":"4e6f4e73-9d98-470f-938e-9c25eabf7360","year":2020},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.231693Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:699db47291cc6701a7f03e3275a4e3d8dff0c34b1cb999dbd20c5b47221fb6c5","observation_id":"24ea62be-82cc-460a-98fc-b8bc5685ccb1","resolution":{"observed_at":"2026-08-12T20:47:41.767780Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.05951","last_updated":"2021-03-02T04:35:04Z","snapshot_observed_at":"2026-08-13T22:44:31.375832Z","submitted_at":"2020-05-12T17:52:43Z","title":"MOReL : Model-Based Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.05951","snapshot_observed_at":"2026-08-12T20:47:41.235096Z","title":"Kidambi, A","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.235096Z"},"links":{"cited_paper":"/paper/2005.05951","citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:31c381339a842f0883d69c29379088dd2648d0f5f75105ad64cfc109f321325d","observation_id":"1ec8c519-2b1b-4a92-89dd-9ece8c9411a9","resolution":{"observed_at":"2026-08-12T20:47:41.235096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15669","last_updated":"2023-05-25T02:40:32Z","snapshot_observed_at":"2026-08-19T01:13:02.356644Z","submitted_at":"2023-05-25T02:40:32Z","title":"PROTO: Iterative Policy Regularized Offline-to-Online Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15669","snapshot_observed_at":"2026-08-12T20:47:41.238691Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.238691Z"},"links":{"cited_paper":"/paper/2305.15669","citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:53fa00e47ec9bd60624dc056a708908faeb593da220865c83deb44fa777fc564","observation_id":"61afbba5-b495-49d4-ab58-6a28a0c5b91c","resolution":{"observed_at":"2026-08-12T20:47:41.238691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.753876Z","title":null,"venue":null,"work_id":"1f458d47-f0d5-4404-be1e-a89b9e63e81e","year":2022},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.242496Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:ae6158d457b406c1c15f314b8a875445e1f8151790ab93968c7787bebd8e8704","observation_id":"b7c4a1c7-8a86-4c82-8f5c-e94faa267464","resolution":{"observed_at":"2026-08-12T20:47:41.757313Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-08-15T03:52:49.245753Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-12T20:47:41.245856Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.245856Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:c1a9734e53ba90baa4f526800fba3b23613755e3018b5a214fbe49c51eba96e6","observation_id":"3ef4b400-00fb-4583-ba7b-7558d63419c0","resolution":{"observed_at":"2026-08-12T20:47:41.245856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.743816Z","title":null,"venue":null,"work_id":"12997fbe-5719-4230-b670-ded28e21e730","year":2022},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.249654Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:fc64012a2a325668882af892c084e321a57d8ea62c946905ba10a47968f3dc76","observation_id":"607d61f2-ee67-43c5-aa03-574e60dfe407","resolution":{"observed_at":"2026-08-12T20:47:41.747290Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.733291Z","title":null,"venue":null,"work_id":"3c5d7a43-3ab5-40e9-846f-05786da4cdb2","year":2023},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.253191Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:d97fdf2e46222e8194a89c80ba428ae6179813a883571ec8fefebcbf9892a881","observation_id":"17c4a470-7c82-4479-884e-366bd2d933d2","resolution":{"observed_at":"2026-08-12T20:47:41.737246Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.722517Z","title":"Schmidhuber","venue":null,"work_id":"64c6bd1a-d38a-42ba-a879-6d7acc517f64","year":1991},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.256829Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:9c85bae1f6ba5d2f31ab3412778317015552fc746e66f43c746c1cd7ecc04514","observation_id":"429f1084-f6d0-4519-abd0-6d9203216441","resolution":{"observed_at":"2026-08-12T20:47:41.726194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.260418Z","title":"Pathak, P","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.260418Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:10a7a0de41eac550597545f265cb2bc0f069751eb9cae164485e47649c3b0d65","observation_id":"1f5571e3-f1a5-4290-abeb-fbca27311ff6","resolution":{"observed_at":"2026-08-12T20:47:41.260418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.06070","last_updated":"2018-10-09T23:19:52Z","snapshot_observed_at":"2026-08-14T19:45:07.867570Z","submitted_at":"2018-02-16T18:57:57Z","title":"Diversity is All You Need: Learning Skills without a Reward Function","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.06070","snapshot_observed_at":"2026-08-12T20:47:41.263831Z","title":"Eysenbach, A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.263831Z"},"links":{"cited_paper":"/paper/1802.06070","citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:fc8c5dfbe007652241457ea658d94935a8d1942aa714972b6a154e4bb97a0199","observation_id":"ad307b53-ffff-48a2-8182-c1c2c22d6a4d","resolution":{"observed_at":"2026-08-12T20:47:41.263831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.13425","last_updated":"2022-04-05T19:24:13Z","snapshot_observed_at":"2026-08-18T17:00:30.806909Z","submitted_at":"2022-01-31T18:39:27Z","title":"Don't Change the Algorithm, Change the Data: Exploratory Data for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.13425","snapshot_observed_at":"2026-08-12T20:47:41.270823Z","title":"Yarats, D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.270823Z"},"links":{"cited_paper":"/paper/2201.13425","citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:7b5589a1a46505fe8f039c9a6ef618355247b586c9e2f6e0897bc55a8a1cbb84","observation_id":"d1a872b2-57c7-42f5-acb2-4a179194ab68","resolution":{"observed_at":"2026-08-12T20:47:41.270823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11861","last_updated":"2022-02-19T01:12:25Z","snapshot_observed_at":"2026-08-19T14:58:29.143957Z","submitted_at":"2022-01-27T23:59:56Z","title":"The Challenges of Exploration for Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11861","snapshot_observed_at":"2026-08-12T20:47:41.274317Z","title":"Lambert, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.274317Z"},"links":{"cited_paper":"/paper/2201.11861","citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:4a45dd09afa476a73381f1f0e8736d2cc5b162efd98c389b792483016d383b2f","observation_id":"eb952f6b-4f00-45dd-85b8-f8fecc5cd21a","resolution":{"observed_at":"2026-08-12T20:47:41.274317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.705888Z","title":"Hong, T.-Y","venue":null,"work_id":"b84985cb-6709-4af3-9c38-9a209c4ce460","year":2018},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.277661Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:53d3ea7b61f0d2517888b6b16e487085830596cd02a30b9cea7d130a5770f910","observation_id":"3e257135-f4fd-4299-85df-0b174d38135d","resolution":{"observed_at":"2026-08-12T20:47:41.709563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.695764Z","title":"Parker-Holder, A","venue":null,"work_id":"3d612a50-c7be-4f4f-83a4-6cd4357a210f","year":2020},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.281308Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:9315e05eb06f41efa5a3aae9541e240abcd0d23f0b48c18d015d4a310adf38e9","observation_id":"996d6b90-2aa1-494a-bba9-af38ebd027cd","resolution":{"observed_at":"2026-08-12T20:47:41.699525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.685751Z","title":"Kumar, A","venue":null,"work_id":"a2e8d884-be99-43d2-abcf-a8e8bc59a2a9","year":2020},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.284743Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:6041d6f9977066bd941ff7e0c92e4427e110dde0502b022a9fa34cd91d32640d","observation_id":"c6ed421f-d888-4541-a690-cd02157dab5a","resolution":{"observed_at":"2026-08-12T20:47:41.689161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.675473Z","title":"Swazinna, S","venue":null,"work_id":"e406ba89-957d-46e7-a4a5-a372fddbf1ee","year":2023},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.287861Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:ea09f26ac1a1bb9355d6779e13e2f5e5a4417d73f5a810052c39da1d8115f0ed","observation_id":"3aa3e3c5-fd6d-4501-ada2-2695ee97c41d","resolution":{"observed_at":"2026-08-12T20:47:41.678975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.665450Z","title":"Brandfonbrener, W","venue":null,"work_id":"af65dc7f-389e-4d2b-b750-a8b0adca796e","year":2021},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.291369Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:bde64c85761a41d46ad9d25d513dc51c994fd03b29bb16e37c02f602897b59b5","observation_id":"df50044b-3177-4034-8ed4-9913996b9000","resolution":{"observed_at":"2026-08-12T20:47:41.668919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1971.43083","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.477116Z","title":null,"venue":null,"work_id":"a92932b5-d07b-4c3d-b703-fcfd7c2990c5","year":1971},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.294798Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:67e7c38e9550510c08300484e4348684d0cfc86b8a262890fa51c26a42e71d9c","observation_id":"27bf7d8d-8dfa-419c-aa5a-bf48bc422376","resolution":{"observed_at":"2026-08-12T20:47:41.483929Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.298099Z","title":"Bottou, F","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.298099Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:58e4da4d838dfddae5fcbf2173f92d7bfbc63ee7b34dc01efa140e1ab9824700","observation_id":"9a460be0-c110-4cb4-88e8-79c250c16adc","resolution":{"observed_at":"2026-08-12T20:47:41.298099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.648926Z","title":"Mangalam, H","venue":null,"work_id":"ab9dbcb4-1ada-4fe1-9927-89a3fecce501","year":2020},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.301303Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:9df1af2e14e810a85e095268f7b5ca9dc6e2e1084afbfab319bd5ed25295cfdb","observation_id":"9f9efc1d-5f92-49d8-b88d-b272e3fc6313","resolution":{"observed_at":"2026-08-12T20:47:41.652288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.304665Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.304665Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:0eb6fa1af3a0fb268a21e84bfd1ae18a58b38ba5ab29bb3ed3a096021b71f9bc","observation_id":"d07ac0d6-aba3-4fc5-a912-3b887fd19766","resolution":{"observed_at":"2026-08-12T20:47:41.304665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.631765Z","title":null,"venue":null,"work_id":"69a51669-0743-4356-a084-99ed62b32326","year":2021},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.308466Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:f808e65fbee6bbd4099e7659d86422032e5f5c055b9892da65b72afbf04ac302","observation_id":"0c68d80d-ed0a-4f0a-aa97-a6ec2709cb0f","resolution":{"observed_at":"2026-08-12T20:47:41.636060Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T20:41:04.813564Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":27,"verified_exact":1,"verified_fuzzy":21},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2411.09722."}