{"as_of":"2026-08-18T07:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:df7a369806b9386c41b68f588e6febba566b254e8059a15c77b7b1db843760ec","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:46:08.077256Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.00503/citation-record","integrity":"/paper/2505.00503/integrity","json":"/paper/2505.00503/citation-record.json","paper":"/paper/2505.00503"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T04:46:07.965220Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-18T07:19:51.916859Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:07.965220Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:9a0f602173694498741cb359dfe0eac571af7292d38359e873f571e6561b0e00","observation_id":"9ef48b7a-14cd-479f-ab2e-d0d3145028b2","resolution":{"observed_at":"2026-08-16T04:46:07.965220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.397196Z","title":"Learning markov state abstractions for deep reinforcement learning","venue":null,"work_id":"0e3af4f4-7084-42e3-bdd6-0c7a81ea9ef1","year":2021},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-18T07:19:51.916859Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:07.969768Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:5f2b6f14868c7d4d1f0e5ffced51ac046d1ba61f16cb42983bc27bd533e2bfb6","observation_id":"99096310-b63b-46a7-a373-48b63db62b94","resolution":{"observed_at":"2026-08-16T04:46:08.400482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.388180Z","title":"Uncertainty-based offline reinforcement learning with diversified q-ensemble","venue":null,"work_id":"18d57bd7-555c-4153-868d-735a7b38aef2","year":2021},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-18T07:19:51.916859Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:07.973100Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:b42789ac25267bfcfc446fdd2ef67b9221f293d6bf9f638c7dc00130ce1e81de","observation_id":"31367436-eaa5-4c53-b449-1d95c54811b9","resolution":{"observed_at":"2026-08-16T04:46:08.391492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.378303Z","title":"Pessimistic bootstrapping for uncertainty-driven offline reinforcement learning","venue":null,"work_id":"519c5102-3f47-4abc-a8bf-bf0b191e531f","year":2022},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-18T07:19:51.916859Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:07.976836Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:e8f9b1055645d4a8faa27d9c8ad00a4f51befd9a9f246a6a3e6774dacb07439b","observation_id":"dd567200-1253-42c1-9a0c-313ef739d610","resolution":{"observed_at":"2026-08-16T04:46:08.382105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.369099Z","title":"Label-noise robust logistic regression and its applications","venue":null,"work_id":"87344611-daf6-4866-924c-68ecdbbf262d","year":2012},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-18T07:19:51.916859Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:07.980276Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:6fbd5e65c839157a46fa6008c67c261d41538a9356fa27c7a989a7aa425651f4","observation_id":"bc4da37b-efec-4f24-8847-de23489ccacf","resolution":{"observed_at":"2026-08-16T04:46:08.372433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.00519","last_updated":"2016-11-07T17:29:24Z","snapshot_observed_at":"2026-08-15T19:45:13.495404Z","submitted_at":"2015-09-01T22:33:13Z","title":"Importance Weighted Autoencoders","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.00519","snapshot_observed_at":"2026-08-16T04:46:07.983646Z","title":"Importance weighted autoencoders","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-18T07:19:51.916859Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:07.983646Z"},"links":{"cited_paper":"/paper/1509.00519","citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:3089c1b7a1638b89631480c48a897a0161a0fefc113e246b0753bb823ff922bb","observation_id":"644e8d65-2e9b-424a-9f37-13d8059d9c18","resolution":{"observed_at":"2026-08-16T04:46:07.983646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.05908","last_updated":"2021-01-03T16:56:46Z","snapshot_observed_at":"2026-08-18T07:14:08.407712Z","submitted_at":"2016-06-19T21:02:30Z","title":"Tutorial on Variational Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.05908","snapshot_observed_at":"2026-08-16T04:46:07.987957Z","title":"Tutorial on variational autoencoders","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-18T07:19:51.916859Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:07.987957Z"},"links":{"cited_paper":"/paper/1606.05908","citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:2c382596f659f3c4deeec4c9db1f82c949f04fddbbb89f87a01f36076122d8e3","observation_id":"c74fccd9-e3bd-4b09-a8ff-dffe82f11d8f","resolution":{"observed_at":"2026-08-16T04:46:07.987957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-08-16T08:32:46.407746Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-16T04:46:07.991451Z","title":"D4RL: datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-18T07:19:51.916859Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:07.991451Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:347af89817ffe8c1f83531ff68089452de896b1782f0888b62cd72973b57e54f","observation_id":"77265d7d-19f6-4a15-a776-b59715b6960a","resolution":{"observed_at":"2026-08-16T04:46:07.991451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.359089Z","title":"Off-policy deep reinforcement learning without exploration","venue":null,"work_id":"e50d1c34-b7e5-45e1-ab1d-01952d78e4c0","year":2019},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-18T07:19:51.916859Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:07.994764Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:0ae3d908e9a7f275d80feb86da4e99247c013e7ade18bb7dd41c8265ffc0a858","observation_id":"e17f339a-c7d0-449b-8255-1e612dc0fda8","resolution":{"observed_at":"2026-08-16T04:46:08.362697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:07.998083Z","title":"A comprehensive survey on safe reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-18T07:19:51.916859Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:07.998083Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:6a80be857f4d957d43c8aaa599dbc42d70c05fd38972f84106a7562e8713ec55","observation_id":"aee7d1f4-b677-4eb2-892e-53ce6e4efd57","resolution":{"observed_at":"2026-08-16T04:46:07.998083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.001245Z","title":"Estimation of non-normalized statistical models by score matching","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-18T07:19:51.916859Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.001245Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:3261835fa1ac4b4bc7323b519c1e5043b493f21963b2c55509be4c1e5707705f","observation_id":"05514fed-c6af-47bf-bfc3-e0f6155478a2","resolution":{"observed_at":"2026-08-16T04:46:08.001245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09991","last_updated":"2022-12-21T01:06:18Z","snapshot_observed_at":"2026-08-17T05:09:53.121073Z","submitted_at":"2022-05-20T07:02:03Z","title":"Planning with Diffusion for Flexible Behavior Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.09991","snapshot_observed_at":"2026-08-16T04:46:08.008559Z","title":"Planning with diffusion for flexible behavior synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-18T07:19:51.916859Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.008559Z"},"links":{"cited_paper":"/paper/2205.09991","citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:73b1320c54980e488d8c099e2fc561ba533909ec01d9c5e0e9a8ae04c4e8917e","observation_id":"fc48874b-b5b7-4575-aec1-3c9f4866fadb","resolution":{"observed_at":"2026-08-16T04:46:08.008559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.339044Z","title":"Recovering from out-of-sample states via inverse dynamics in offline reinforcement learning","venue":null,"work_id":"0a27e1aa-c105-4866-9e58-e424a843ddef","year":2023},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-18T07:19:51.916859Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.012362Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:83b084d4b88233c28bd3a0f9496369a22ba72d44c4c4e814802ace87783247ef","observation_id":"d3e7bd93-c663-4fc8-8a28-9a4b8ed1cabb","resolution":{"observed_at":"2026-08-16T04:46:08.342922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.329400Z","title":null,"venue":null,"work_id":"b14027d3-e64a-4772-9513-0b337888b877","year":2021},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-18T07:19:51.916859Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.015471Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:3a38943363d4dd2f9067f783238f2405577f39f43802937e0462a137e4d294c0","observation_id":"7a0d9678-f707-4c44-ba55-1a10b9a9fca4","resolution":{"observed_at":"2026-08-16T04:46:08.332759Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.319784Z","title":"Scalable deep reinforcement learning for vision-based robotic manipulation","venue":null,"work_id":"db975ed6-a703-47a8-99a2-77283474a326","year":2018},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-18T07:19:51.916859Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.018719Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:a242ec69f5a0214a10e1e46e4e4a8dced790f755bbea7006cb4e18566789fb10","observation_id":"cc2807a4-8eb1-4fe9-9019-3ca614338c95","resolution":{"observed_at":"2026-08-16T04:46:08.323263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.309240Z","title":"Lyapunov density models: Constraining distribution shift in learning-based control","venue":null,"work_id":"78d8589a-ed5e-4e80-bce3-934929c40469","year":2022},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-18T07:19:51.916859Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.021758Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:d89d26da82e9b3d602183eecb7b7040343e1a715985f76c95e026210c2550682","observation_id":"8fd905cf-c544-4936-8ada-8068da5e5e3c","resolution":{"observed_at":"2026-08-16T04:46:08.313028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.024790Z","title":"Kingma and Max Welling","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-18T07:19:51.916859Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.024790Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:905ed67a6d8ad0ff9f9451cde30512183ac52962eeab1a8d826f5332ef679d82","observation_id":"23404f0f-5c81-45da-8c2f-ba52a23a7863","resolution":{"observed_at":"2026-08-16T04:46:08.024790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.293706Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":"5f6e59d3-4e2c-4159-b12d-33188ba87a6d","year":2020},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-18T07:19:51.916859Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.027953Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:23a49bc86ff644abbaf00056ad5e74e69382bd28c88c58854dbed14ca756e523","observation_id":"85b7faeb-8dbe-47b5-8987-fdfc68a02a9c","resolution":{"observed_at":"2026-08-16T04:46:08.297346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.030931Z","title":"Batch reinforcement learning","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-18T07:19:51.916859Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.030931Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:96afe79f72b602c47c0e5d552b45a81af3eaa49e2f40fb83ed377296a673e255","observation_id":"397c65bb-9786-48bd-899d-038cbc8dda7c","resolution":{"observed_at":"2026-08-16T04:46:08.030931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.277277Z","title":"Supported value regularization for offline reinforcement learning","venue":null,"work_id":"6fbdcad6-0dbb-4a0b-a967-140ee51282b6","year":2023},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-18T07:19:51.916859Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.034368Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:b67201125992111382e00837ae8a40438217d5e8738e5538a2d1601ebc262d33","observation_id":"c9ada6e4-f5ef-48db-9be9-6964eee85dc7","resolution":{"observed_at":"2026-08-16T04:46:08.280727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19400","last_updated":"2024-11-01T07:20:10Z","snapshot_observed_at":"2026-08-17T15:19:17.052487Z","submitted_at":"2024-10-25T09:01:37Z","title":"Offline Reinforcement Learning with OOD State Correction and OOD Action Suppression","version":4},"cited_work":{"arxiv_id":"2410.19400","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.19400","snapshot_observed_at":"2026-08-16T04:46:08.140064Z","title":"Offline Reinforcement Learning with OOD State Correction and OOD Action Suppression","venue":"cs.LG","work_id":"8b91fa75-8231-403a-bab6-dad43cbe5669","year":2024},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-18T07:19:51.916859Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.037469Z"},"links":{"cited_paper":"/paper/2410.19400","citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:90ca7d4d8508e0daea9d2f1e7c55491b9d8bfd8ed6fbeb4f5d3ca3e784c87030","observation_id":"0aae39b5-9e6a-454d-94cf-706f7adb7df4","resolution":{"observed_at":"2026-08-16T04:46:08.144011Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.040956Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-18T07:19:51.916859Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.040956Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:7465ba60e7081971fa258e342c102a4049876b2d15cca60f42fa087b57232cd3","observation_id":"2e559b6e-9885-4097-9294-ffad781c7a30","resolution":{"observed_at":"2026-08-16T04:46:08.040956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.261797Z","title":"Deeploco: Dynamic locomotion skills using hierarchical deep reinforcement learning","venue":null,"work_id":"b9a8fcca-437f-4a34-a522-84305a738aa0","year":2017},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-18T07:19:51.916859Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.043948Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:3e01a12b9931fc9f62f8f864a52e105133168773e51d86f504ef4ab5d77c1c9f","observation_id":"092274a0-d39b-42ab-a467-a2bc360b27fc","resolution":{"observed_at":"2026-08-16T04:46:08.265226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.046845Z","title":"Mastering the game of go without human knowledge","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-18T07:19:51.916859Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.046845Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:114216f2a536e1e356ec536bca05029f18a138d1a3beba48ec142c27a0418c2b","observation_id":"e98c70ba-ad82-4ed3-b7b0-01ac023280e3","resolution":{"observed_at":"2026-08-16T04:46:08.046845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-16T04:46:08.049612Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-18T07:19:51.916859Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.049612Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:92be2bde14cff8f015cae0796342266ef269ab25c81cc8a9c39d19e44cd6ef58","observation_id":"34534397-3fd8-466f-b144-d77d96c76e07","resolution":{"observed_at":"2026-08-16T04:46:08.049612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.245881Z","title":"Robust distance metric learning in the presence of label noise","venue":null,"work_id":"fabbe078-a1e7-4166-a7ad-e0bffa1dbb87","year":2014},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-18T07:19:51.916859Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.052689Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:d2cd940361521dee2893cabe18900e0f175559113c288197c3c6b00cfec75058","observation_id":"0d1d9d1b-7911-43d5-bc75-7ddcca1d3607","resolution":{"observed_at":"2026-08-16T04:46:08.249511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.235802Z","title":null,"venue":null,"work_id":"fcfef02a-dd0a-45fa-8c26-2fe12ec7e1a2","year":1992},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-18T07:19:51.916859Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.055612Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:6a43dac98b007a98386d2d4ca76cf72efd8185c6bd139a11bc2d5dc050d729fc","observation_id":"83c57b72-b982-4f67-bfa2-35f8d884eb2f","resolution":{"observed_at":"2026-08-16T04:46:08.238963Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-08-12T13:17:36.653110Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-16T04:46:08.058685Z","title":"Behavior regularized offline reinforcement learning","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-18T07:19:51.916859Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.058685Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:bc6da0ddf0588b7f14298567b679d4ea5b025511482dc19f97dc28ca2dda278e","observation_id":"43b9d0b8-28e4-46c7-aa6e-fba8f1034228","resolution":{"observed_at":"2026-08-16T04:46:08.058685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.224935Z","title":"Supported policy optimization for offline reinforcement learning","venue":null,"work_id":"462784a6-1838-442e-8d6f-4a09c0f9c6c6","year":2022},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-18T07:19:51.916859Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.061838Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:d2438f7291ff75786e7993fa2ec1ddcd01b720a8df2859f2aaef6767da9bda27","observation_id":"13475ed8-4071-40a5-bbb8-dbfd4fe2687d","resolution":{"observed_at":"2026-08-16T04:46:08.229077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.02829","last_updated":"2022-10-22T10:09:17Z","snapshot_observed_at":"2026-08-16T16:54:57.434304Z","submitted_at":"2022-06-06T18:07:41Z","title":"RORL: Robust Offline Reinforcement Learning via Conservative Smoothing","version":3},"cited_work":{"arxiv_id":"2206.02829","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.02829","snapshot_observed_at":"2026-08-16T04:46:08.107085Z","title":"RORL: Robust Offline Reinforcement Learning via Conservative Smoothing","venue":"cs.LG","work_id":"1ad74a5b-82e2-4bc3-a2a9-9f27a92bc746","year":2022},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-18T07:19:51.916859Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.064871Z"},"links":{"cited_paper":"/paper/2206.02829","citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:d72918337c9ba54f5031ba74b9e0a28139f63a79cbe1bb6d09c212c4134ce6f6","observation_id":"1999d70c-3f12-4a5c-b282-7d01cecce048","resolution":{"observed_at":"2026-08-16T04:46:08.113098Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.214951Z","title":"An implicit trust region approach to behavior regularized offline reinforcement learning","venue":null,"work_id":"574607fd-95ae-4524-a9d7-2ea9ee3e2110","year":2024},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-18T07:19:51.916859Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.068085Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:0ba2575ab1be9fd40d6e11c908ed5c0bd9fd5db59a8e971a923a5083327b622a","observation_id":"a879cd6a-38f7-4ccf-a223-a454c0989d89","resolution":{"observed_at":"2026-08-16T04:46:08.218677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.205528Z","title":"State deviation correction for offline reinforcement learning","venue":null,"work_id":"665bca39-3903-4d5d-895a-f339650611ae","year":2022},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-18T07:19:51.916859Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.071301Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:75d7295bb1ec9527058df6a37792197011be65cf7fc1b7747f27240b92c1ace0","observation_id":"4ea89976-a352-4dfa-b40c-aba3d976a6fe","resolution":{"observed_at":"2026-08-16T04:46:08.208816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.195938Z","title":"Constrained policy optimization with explicit behavior density for offline reinforcement learning","venue":null,"work_id":"4c86c634-3e35-4450-82d4-49b5e163fb46","year":2023},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-18T07:19:51.916859Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.074192Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:19db41d1d7cc1c4308d5f58091f69c3a2e47c9d41d89be19dc4f9b05d255c4ec","observation_id":"9840f7b5-c279-4ecf-aa8d-79d284f69b90","resolution":{"observed_at":"2026-08-16T04:46:08.199344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.077256Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-18T07:19:51.916859Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.077256Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:fb7bf001f18e83efe011e3c37197e3d57325f8bd534fcaca8f58354382a60fb9","observation_id":"85c0bc90-d052-4f8d-b25f-85ed27f8bca7","resolution":{"observed_at":"2026-08-16T04:46:08.077256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T07:19:51.916859Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":2,"verified_fuzzy":16},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2505.00503."}