{"as_of":"2026-08-20T13:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8817dd2673d7614272ec5e4f5f46889683d60ceaf05395a55e1ed9a94c76cd40","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T14:42:38.148642Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.24405/citation-record","integrity":"/paper/2605.24405/integrity","json":"/paper/2605.24405/citation-record.json","paper":"/paper/2605.24405"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2211.11096","last_updated":"2023-01-30T11:28:55Z","snapshot_observed_at":"2026-08-19T20:16:38.732043Z","submitted_at":"2022-11-20T21:57:10Z","title":"Let Offline RL Flow: Training Conservative Agents in the Latent Space of Normalizing Flows","version":2},"cited_work":{"arxiv_id":"2211.11096","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.11096","snapshot_observed_at":"2026-07-02T23:47:28.409712Z","title":"Let offline rl flow: Training conservative agents in the latent space of normalizing flows","venue":null,"work_id":"491b1bc8-eb4d-4311-bf96-1ac2dcefca25","year":2023},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"cited_paper":"/paper/2211.11096","citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:76654cafbd9825342efae1f1adc8d25d0a9869d64a235843f23792ab8a453d31","observation_id":"5da9fbb1-23a1-4d1c-9df8-67cd4e55fdf5","resolution":{"observed_at":"2026-06-30T14:44:45.097653Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.471796Z","title":"Uncertainty-based offline reinforcement learning with diversified q-ensemble","venue":null,"work_id":"1f05e2f9-e168-4341-90a5-13c3501d761b","year":2021},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:0d2297066e279665edb98d8c3a3ddd68e379d90afd1bfcec15f7b6a853ef7104","observation_id":"815bfa80-503a-4d90-b418-f8c8140a4d57","resolution":{"observed_at":"2026-07-08T22:05:43.473542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.478824Z","title":null,"venue":null,"work_id":"fc410430-d64c-4ec9-a1c4-88d2719d13ca","year":2019},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:95c2271722c25a50bfba341788034a720a5c99d2fd90179f8a8441b5ccab8604","observation_id":"1ae7f9f9-2fec-4e66-a50a-ab00a8ea0a59","resolution":{"observed_at":"2026-07-08T22:05:43.480246Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.450614Z","title":"Offline RL without off-policy evaluation","venue":null,"work_id":"ce6f5229-11dd-45cb-8c99-db4496923c6f","year":2021},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:1de0a44e52f191aa34f9eaef859167a4a6ab7d7855cc85e837e707f411701204","observation_id":"409da6ff-7cb4-4d19-b73b-a914f7ad825d","resolution":{"observed_at":"2026-07-08T22:05:43.452180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.443555Z","title":"Schoellig","venue":null,"work_id":"5b137103-7ad6-4e32-af23-184224f90ea0","year":2022},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:5d34998359f6f6881c67d106be50ca272ddb585d3af622dda428366bb7637b55","observation_id":"110cdc87-56f5-4778-8bb2-e376dc65e117","resolution":{"observed_at":"2026-07-08T22:05:43.444945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.445420Z","title":null,"venue":null,"work_id":"5ccf3623-8bb3-4537-bba0-71d194b57474","year":2019},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:48f1f27a6919a165f1d0e3a6126503c8075f8c2086262cb7592e91cccb99a972","observation_id":"36bda10e-673c-45d9-8f79-c5a040e5eb4e","resolution":{"observed_at":"2026-07-08T22:05:43.446894Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.447214Z","title":"Importance weighted autoencoders","venue":null,"work_id":"4b9c4549-8994-4a02-9349-60473f47e114","year":2016},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:581e52920300209806942b033cc1b1d9c2e957894ec9104d0bf2ba65d1eb497c","observation_id":"8480ee01-8411-4721-bfdf-227ad0f7c446","resolution":{"observed_at":"2026-07-08T22:05:43.448541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.476906Z","title":null,"venue":null,"work_id":"b9b33d1a-9a09-4096-9718-cc73981e7479","year":2018},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:5425d3672bf6aaffc21bc91d51a99070abdf1dfc26958c62c8208ff14060f074","observation_id":"87b23479-b65d-424f-9e2a-99d2e938b07a","resolution":{"observed_at":"2026-07-08T22:05:43.478512Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.401714Z","title":"Mag- netic control of tokamak plasmas through deep reinforcement learning.Nature, 602(7897):414– 419, 2022","venue":null,"work_id":"3dabd199-ff6d-4468-a71f-8775c9389f60","year":2022},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:b14114aef4c54b16a6f368005d265434dd91532f92a2cdc0b984d93d119d63e6","observation_id":"a1463f6a-0ca5-4bd2-bfc1-c1dde5bb7794","resolution":{"observed_at":"2026-07-08T22:05:43.403179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.396971Z","title":"Density estimation using real nvp","venue":null,"work_id":"73ae0213-309c-4942-af95-b1727b0db443","year":2017},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:94fad80b23a8784d57e83541de4ae0fd8b01f66736076649cfcf0b2d354a994f","observation_id":"24d483c9-3e2f-470c-8e1b-b7d5c0efe65b","resolution":{"observed_at":"2026-07-08T22:05:43.398420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.875269Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"b2cc82a1-974a-4867-8a88-379d15de9985","year":2021},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:c5e7b6fc876a79c577a5bc1ebfa49d3195a5b3b21a56e1e29b8122406da8ce21","observation_id":"af786078-ac63-4022-af98-4786245712e4","resolution":{"observed_at":"2026-07-08T22:05:43.392577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.393339Z","title":"Reinforce- ment learning for precision oncology.Cancers, 13(18):4624, 2021","venue":null,"work_id":"a665f4eb-25d4-4293-9902-cb7ac2557efb","year":2021},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:78f7f5d380fa7b9be277d550a0e8d44db35bd20b9094fb113d28c050d73287c0","observation_id":"78686516-463e-48b4-a6d9-67d11bd44adf","resolution":{"observed_at":"2026-07-08T22:05:43.394525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.395082Z","title":"D4RL: Datasets for deep data-driven reinforcement learning","venue":null,"work_id":"fab09d7d-bad7-4c79-8972-08f00ad0bd96","year":2021},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:85ec2a114f905d601d7db9c223a600d64d11659d16f085b09a53128227fe7126","observation_id":"39d684e0-5431-4793-a4a7-9971d538a42d","resolution":{"observed_at":"2026-07-08T22:05:43.396450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:14fb4fd387008c7a1cb21ebb4f1e6bade73ac5776c550df709c1c08b81880c83","observation_id":"b980eb7d-833c-46b2-bd15-e9963f6a5b42","resolution":{"observed_at":"2026-06-30T14:44:45.094477Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.439760Z","title":"Mean flows for one-step generative modeling","venue":null,"work_id":"228b9134-7dc9-4b06-9d06-fa3ba4bc108b","year":2026},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:da2452a79804c871088538481e41d185e327aeeb64054a511ad82b0f5d3efc0d","observation_id":"f649f1c9-e03e-426e-a981-2f38c120a5da","resolution":{"observed_at":"2026-07-08T22:05:43.441162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.459400Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"9d9df20b-826e-4c74-b568-7796f1235c48","year":2020},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:7c3848b70176c10ef9a03f9cf385aed82c3b5d583b79dd282e2e99d1719496f0","observation_id":"5625a248-8d3e-493e-b7af-c87c40eac2ac","resolution":{"observed_at":"2026-07-08T22:05:43.461258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.467987Z","title":"Planning with diffusion for flexible behavior synthesis","venue":null,"work_id":"3af816be-b462-4ab8-809b-ff19aa970e54","year":2022},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:a8c59df1a55f681b7b57fcad6360bc06dc4374a7d4f19e4bd097331780b3569d","observation_id":"fbd8e80c-1fd8-4bc3-bb6b-72085d9702d9","resolution":{"observed_at":"2026-07-08T22:05:43.469656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.469897Z","title":"When to trust your model: Model- based policy optimization","venue":null,"work_id":"3e776e44-1fe3-4894-b7d7-20af5ff82599","year":2019},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:29efd4935416849a6119242952700d1716a47714fa92b88bfe148f8f0686f617","observation_id":"732dfd34-08c6-44bc-bf88-33d46d64abad","resolution":{"observed_at":"2026-07-08T22:05:43.471440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.474349Z","title":"Billion-scale similarity search with gpus.IEEE Transactions on Big Data, 7(3):535–547","venue":null,"work_id":"d27338b3-405c-4daf-b545-68d864475c15","year":2021},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:7b58af2b5e5ea63a1b7351f89ec062b58b0a23e198c5d3d6b6bb1016bdfedc21","observation_id":"aaf15b7c-15b5-4e62-9ac6-55f255c4574f","resolution":{"observed_at":"2026-07-08T22:05:43.476215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.482846Z","title":"Elucidating the design space of diffusion-based generative models","venue":null,"work_id":"2f6b41e5-17eb-40ff-b3ac-23555079bc17","year":2022},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:2c147f9af3fcfd0cafa3dff45847128a1c06d932cac1944fc3ed65275c096070","observation_id":"e23226c3-83a3-4261-b7f0-c109214678f1","resolution":{"observed_at":"2026-07-08T22:05:43.484594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.463441Z","title":"Kingma and Max Welling","venue":null,"work_id":"4b6ebfdb-23b2-4249-aee1-5f39dc037844","year":2014},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:2124efd657bc56b8d34828a1e4fd40e88cfe14425643dfbd7e81a5a831b585dc","observation_id":"485d9e79-6ca2-472c-8fbd-b2133e0efdc9","resolution":{"observed_at":"2026-07-08T22:05:43.464840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.455309Z","title":"Celi, Omar Badawi, Anthony C","venue":null,"work_id":"12d52fa3-f066-43e0-b686-c1e193a5952e","year":2018},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:b1019e2cb8da88d159bf070f66a98bd47cc6dd3e923dcff0e5760c122730a32d","observation_id":"031648cf-0cc8-42f7-b7ae-4295c46a05e6","resolution":{"observed_at":"2026-07-08T22:05:43.456771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.456975Z","title":"Stabilizing off-policy q-learning via bootstrapping error reduction","venue":null,"work_id":"6cc2a9e3-7079-4b81-bb16-13221d29171f","year":2019},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:b8b7cbfd1cb9bea6ee672fe6b3446ef0b87c64305ef074619ea734a798da0a26","observation_id":"415afcb8-c957-426d-89dc-0aee7ba50b2a","resolution":{"observed_at":"2026-07-08T22:05:43.458472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.465635Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":"19e24896-50b1-4d31-bd86-83301fdf1f9a","year":2020},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:c6e4daa45799b62d6cb97c76d2395671f6a0c172dcbca30873996466c9b9eea1","observation_id":"6e63e8b0-fa8d-42e9-ad6f-f610a13b490d","resolution":{"observed_at":"2026-07-08T22:05:43.467787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.448822Z","title":"Showing your offline reinforcement learning work: Online evaluation budget matters","venue":null,"work_id":"1b1d1069-2f5b-4bc2-a8d4-552d5cbee3b5","year":2022},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:3e2f7669412cf6acea15f66ca8227f8756c63a9130adee6a1572be5098ee815c","observation_id":"9e9c12a0-3b45-43a9-b4ed-33279d2f0698","resolution":{"observed_at":"2026-07-08T22:05:43.450402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.453010Z","title":null,"venue":null,"work_id":"c364286a-4be8-4dd9-a91c-bde2dcea06a8","year":2023},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:613639f35ffa0a7ceb9ebee21d53dc633492c07b6431c1a0c6f349ec802de921","observation_id":"d89c11cb-c5f3-4f10-93a1-63a1a7538f8e","resolution":{"observed_at":"2026-07-08T22:05:43.454974Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.435258Z","title":"Mitigating distribution shift in model-based offline RL via shifts-aware reward learning, 2024","venue":null,"work_id":"12983146-d18f-48e6-9109-5bb774206843","year":2024},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:8a79c44d3c582c643a5f35c92d0b1a95f879b26b9009ad12aaf39644a474da87","observation_id":"b9d4efb0-dea8-4f77-b433-90cf08fa6671","resolution":{"observed_at":"2026-07-08T22:05:43.436942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.431243Z","title":"Supported value regular- ization for offline reinforcement learning","venue":null,"work_id":"ea3bd0b3-32c1-4605-b32c-8cd830104b9a","year":2023},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:7b9e2931b1eb8a892825b1a2659d3b723ffae0eef9e72af5dceeb85d1839cef4","observation_id":"d8b49539-b33a-4b06-ad1e-650a06a351cb","resolution":{"observed_at":"2026-07-08T22:05:43.432925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.433138Z","title":"Normalizing flows for inter- ventional density estimation","venue":null,"work_id":"02a1d29e-0ad8-474d-98f9-4d893793fbe2","year":2023},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:1e8214384778d045b3f2f6bf7de86f456a2d4b09bec25fcc8b6776c124e3c997","observation_id":"278b5253-d003-4191-ad0f-1e872e034493","resolution":{"observed_at":"2026-07-08T22:05:43.434732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.425895Z","title":"Model-based offline reinforcement learning with lower expectile q-learning","venue":null,"work_id":"79e486b8-fbc3-463e-a97b-576d61f837c9","year":2025},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:6e267f8d34a43150bd88af55ed673080ab3c37c26fb665b101166636723aeb5a","observation_id":"dc2076db-7f1a-44f6-a670-a27b753b92ac","resolution":{"observed_at":"2026-07-08T22:05:43.427151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:27:53.186413Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"0c67bec8-6388-449f-9600-64c8ea9bc79f","year":2023},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:fe8da5e7b7427b2d76ab6c630f7114078c286daa31d9dab3b9d2f264a44d1741","observation_id":"1838f28c-ecc1-4ec2-b313-2b9ab54d917e","resolution":{"observed_at":"2026-07-08T22:05:43.425844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.418507Z","title":"Continuous state-space models for optimal sepsis treatment: A deep reinforcement learning approach","venue":null,"work_id":"15654891-f009-4a27-b487-c007ac2fc6a7","year":2017},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:5e891344d75b5c58bbff8d6322ac97d58ea02188c8cd33c8d1c2029316a2f518","observation_id":"b0eb3366-c4a0-4426-8eed-e6f0d08e6f09","resolution":{"observed_at":"2026-07-08T22:05:43.419696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.412851Z","title":"Variational inference with normalizing flows","venue":null,"work_id":"53937655-9797-4de6-b415-51c56d37d822","year":2015},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:ffe81c892ee35577ff3f444b8f9a9d8b636bb05c53871ddb0e2f51db451ea434","observation_id":"01996bc2-7e99-43ad-91f5-baade0ce607b","resolution":{"observed_at":"2026-07-08T22:05:43.414161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:27:52.409989Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":"5427867b-47ba-4d43-a415-2912684a2d41","year":2022},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:f9f6924d059854f4f6a186edccb2aa33eb3031a835a1a11f2c17a86d1928fa80","observation_id":"f8c537de-953a-4ad5-9b81-7cf661a90b40","resolution":{"observed_at":"2026-07-08T22:05:43.416060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.416803Z","title":"Kauffmann, Robert A","venue":null,"work_id":"7cca39ba-d99d-41bb-94f7-ed293ee21f80","year":2021},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:ce6345b7146376bdff89a08b147c9f5998b926743282c5b2b45b9a01e204a560","observation_id":"a0edb121-1f3f-4cfe-b5c4-6b04e730150b","resolution":{"observed_at":"2026-07-08T22:05:43.417902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:53.576082Z","title":"Denoising diffusion implicit models","venue":null,"work_id":"a3f728cc-aa45-4f9e-af30-e6c317faf40b","year":2021},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:194472711ecda91bf3cb12c7fe19929cccf45ce4a40ec1cb3dea537fddf9519a","observation_id":"c9558b8b-3788-4163-ae5c-510a90d68115","resolution":{"observed_at":"2026-07-08T22:05:43.421560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.409281Z","title":"Model-Bellman inconsistency for model-based offline reinforcement learning","venue":null,"work_id":"18db23bf-43b2-4de7-9402-8737e1f38960","year":2023},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:e880558b0744e95ad7f204baab9bf622e85fd3b10f74c872536436b401bc0bbe","observation_id":"79ee89e0-5f82-4ed6-bf67-f95fce87043e","resolution":{"observed_at":"2026-07-08T22:05:43.410460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.407473Z","title":"Machine learning and imaging informatics in oncology.Oncology, 98(6):344–362, 2020","venue":null,"work_id":"1e6ef737-2cba-454a-9e63-533339455e70","year":2020},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:51da532e5372e477443ad6b767fd42afc52365ddc0379f964a4f4481ae439f2f","observation_id":"db7f256e-795c-47f0-9337-c553b3206a24","resolution":{"observed_at":"2026-07-08T22:05:43.408728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.411018Z","title":"Guardian-regularized safe offline reinforcement learning for smart weaning of mechanical circulatory devices, 2025","venue":null,"work_id":"ac435260-cb91-4fca-b78b-2e38cce3aa7a","year":2025},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:6fe051987db5d1a8a4cde0bcd703ede267392df640cce322888033b5342faf99","observation_id":"30f492f5-f168-425f-98c9-20c7bda894ca","resolution":{"observed_at":"2026-07-08T22:05:43.412241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.421144Z","title":"Cardiogenic shock.Journal of the American Heart Association, 8(8):e011991, 2019","venue":null,"work_id":"f08525f9-20ca-4c8f-b8b2-f5c976f872bc","year":2019},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:9568fa5fc67a89733d7eb27e80976e4bf18ec052e9ad094b4036d815fc6c2232","observation_id":"3e14cfd4-70a9-452f-bc51-638be52211bd","resolution":{"observed_at":"2026-07-08T22:05:43.422528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.437766Z","title":"Diffusion policies as an expressive policy class for offline reinforcement learning","venue":null,"work_id":"7a853671-6f71-417c-89e6-2512a0010da3","year":2023},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:5954c862fbabc4570329c039b4a3c07094090374a816ed60b64d0136948c8a35","observation_id":"862ca1ce-18b3-47ad-8dd7-b1ccb990482e","resolution":{"observed_at":"2026-07-08T22:05:43.439568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.461525Z","title":"Supported policy optimization for offline reinforcement learning","venue":null,"work_id":"dfccec32-8711-40c5-964a-c190cb7bf848","year":2022},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:1a8ce679aa5378e1e15d4ec396d6b7c0a718bbbcc83d98e93a561203c95a5c79","observation_id":"63ae57bb-51c3-4a55-9b85-2078c624801c","resolution":{"observed_at":"2026-07-08T22:05:43.463214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.480550Z","title":"Behavior regularized offline reinforcement learning","venue":null,"work_id":"77fa2d2a-ee84-460f-9d35-e3bab2a6d103","year":2019},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:e2ccd9eccce83f6f5c9299561de52c8a6928aa29fadd911aeb71ef9527470b10","observation_id":"9cb0c757-26ed-42f2-8b43-f52cf478019d","resolution":{"observed_at":"2026-07-08T22:05:43.482074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.403733Z","title":null,"venue":null,"work_id":"f214cbc2-b161-4066-8e47-cb39b0727584","year":2025},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:2c0f1858046f566a89853d76c5d9db7e2d83a354f4492dc3f577b26fe16833c2","observation_id":"370656b6-dd92-43e4-b3af-3251b060d561","resolution":{"observed_at":"2026-07-08T22:05:43.405105Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.399190Z","title":"Offline guarded safe reinforcement learning for medical treatment optimization strategies","venue":null,"work_id":"46842074-de9e-4864-ade9-6b98415e10d4","year":2025},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:73ca6b85d189cbbeabfb3c0b4c1fbdf639d861bb1f52af962b90fc1b4be2fc49","observation_id":"55939b37-5cc0-4ea5-babb-00f5eedb4fdd","resolution":{"observed_at":"2026-07-08T22:05:43.400971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.405672Z","title":"Zou, Sergey Levine, Chelsea Finn, and Tengyu Ma","venue":null,"work_id":"ab1c3cd5-6e0b-4e36-9dca-51d94006d59b","year":2020},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:2a0b24bc060abcde5e85b0509be20c654faf52b9ada2b7fe2c7dc286b3e3e1d5","observation_id":"1719358a-f680-4cff-a2dc-f916963b39a2","resolution":{"observed_at":"2026-07-08T22:05:43.406902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.387498Z","title":"Deep structured energy based models for anomaly detection","venue":null,"work_id":"bfa39ce0-e24e-4a74-904f-0156ced8aa8c","year":2016},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:c6603b111838fa47f220ddc1b4c5cc94deab854cd9934a33985e093060f76f92","observation_id":"e7dd0404-017f-4725-b0b3-0ed8cbc57aea","resolution":{"observed_at":"2026-07-08T22:05:43.388823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.428271Z","title":"Constrained policy optimization with explicit behavior density for offline reinforcement learning","venue":null,"work_id":"eb3f2cd1-5e7b-4afb-8f33-3362f33a15d7","year":2023},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:dd9a6041449080898414cade6ab249376af6195ae37c9ea30db9d916afc3b365","observation_id":"9f27471e-6c22-443b-9015-3e998df676bf","resolution":{"observed_at":"2026-07-08T22:05:43.430939Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.441853Z","title":"OOD datasets","venue":null,"work_id":"1c664d74-a078-4c99-92ca-603c8d9955be","year":null},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:f8913e95c38fef8735dc2fb3d32ec63a789177d69d87b29ab97e77c07e4d79ad","observation_id":"524f01bc-e6fe-4e20-afa5-c28fba37b466","resolution":{"observed_at":"2026-07-08T22:05:43.443307Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.389380Z","title":"Guidelines: • The answer [N/A] means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"c299a1c4-bce5-427e-a55f-8752c29e91e1","year":null},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:d53eff173eb214c4b252f315219e8b5b0f9d3cd6659fbe11536f4433d4595d44","observation_id":"9230c225-c12b-4c11-9565-d51d1a1fb477","resolution":{"observed_at":"2026-07-08T22:05:43.390670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":2,"verified_fuzzy":41},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2605.24405."}