{"as_of":"2026-08-10T08:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:89683ecc16c8af5dcec502c5c9947700da4df9e5816886494dc2b4c3064294e3","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:55:54.416203Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:01:15.443445Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T05:01:17.482077Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.23871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23871","snapshot_observed_at":"2026-08-07T05:01:17.482077Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","venue":"cs.LG","work_id":"4ce78cd7-6afd-40bd-b4d2-4d6a118e5a08","year":2025},"citing_paper":{"arxiv_id":"2506.10038","last_updated":"2025-06-10T22:37:39Z","snapshot_observed_at":"2026-08-09T04:36:51.228004Z","submitted_at":"2025-06-10T22:37:39Z","title":"Ambient Diffusion Omni: Training Good Models with Bad Data","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:15.443445Z"},"links":{"cited_paper":"/paper/2505.23871","citing_paper":"/paper/2506.10038"},"observation_digest":"sha256:972813580416257aaa6accff6558fb882b60286b338ff6566250c28f2e43f911","observation_id":"a4d3b03d-0631-4e30-a768-51c4b3a89431","resolution":{"observed_at":"2026-08-07T05:01:17.604728Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23871/citation-record","integrity":"/paper/2505.23871/integrity","json":"/paper/2505.23871/citation-record.json","paper":"/paper/2505.23871"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.08728","last_updated":"2025-04-21T23:33:05Z","snapshot_observed_at":"2026-07-06T17:44:04.908253Z","submitted_at":"2024-03-13T17:28:20Z","title":"Ambient Diffusion Posterior Sampling: Solving Inverse Problems with Diffusion Models Trained on Corrupted Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08728","snapshot_observed_at":"2026-08-07T12:55:49.402174Z","title":"Ambient diffusion posterior sampling: Solving inverse problems with diffusion models trained on corrupted data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:49.402174Z"},"links":{"cited_paper":"/paper/2403.08728","citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:893956acbc5687d1c7231ddae9ee3b6067e8f03b04878c9d9a810504bcd612f3","observation_id":"f07df930-7dab-4be3-9ff6-a941c0221bf2","resolution":{"observed_at":"2026-08-07T12:55:49.402174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14114","last_updated":"2024-05-28T03:11:52Z","snapshot_observed_at":"2026-08-09T10:58:47.990343Z","submitted_at":"2024-05-23T02:41:36Z","title":"Offline Reinforcement Learning from Datasets with Structured Non-Stationarity","version":2},"cited_work":{"arxiv_id":"2405.14114","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.14114","snapshot_observed_at":"2026-08-07T12:55:54.806488Z","title":"Offline Reinforcement Learning from Datasets with Structured Non-Stationarity","venue":"cs.LG","work_id":"6ec4b832-d114-4c49-a280-4cea7129c487","year":2024},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:49.514880Z"},"links":{"cited_paper":"/paper/2405.14114","citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:6cac8c4bc28d11e952303053d8e3bad7fc02fb25cdf9a3a9434b5a4a2a7339b1","observation_id":"6806c56b-80d0-4f93-bbda-f07b6239954e","resolution":{"observed_at":"2026-08-07T12:55:54.927932Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:58.404883Z","title":"Is conditional generative modeling all you need for decision making? In The Eleventh International Conference on Learning Representations, 2023","venue":null,"work_id":"61073bb9-ade5-4858-bc44-671d0cdf933b","year":2023},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:49.626930Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:3adb9c060f2e09d46eb5e99b418ace6bf3b69629df892a917162260ff51b5e30","observation_id":"ae3d6006-5349-4ead-8aad-7106da10dd1f","resolution":{"observed_at":"2026-08-07T12:55:58.447137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:58.278042Z","title":"Uncertainty-based offline reinforcement learning with diversified q-ensemble","venue":null,"work_id":"943d328f-ce96-4e9a-bee8-4f071bfd40fc","year":2021},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:49.772302Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:9ca3184246a1dc2e802a2c5829f29080954268f4ea0d2bc81442ebe1f3688380","observation_id":"4193ddd7-63bf-4de2-b501-5cff4344046b","resolution":{"observed_at":"2026-08-07T12:55:58.320673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.11566","last_updated":"2022-02-23T15:27:16Z","snapshot_observed_at":"2026-08-09T10:57:51.283770Z","submitted_at":"2022-02-23T15:27:16Z","title":"Pessimistic Bootstrapping for Uncertainty-Driven Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.11566","snapshot_observed_at":"2026-08-07T12:55:49.886568Z","title":"Pessimistic bootstrapping for uncertainty-driven offline reinforcement learn- ing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:49.886568Z"},"links":{"cited_paper":"/paper/2202.11566","citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:ae4436373cbc85b9f22d74584f48b1eb8a84a237c1c897d9defe9bc0978f750e","observation_id":"8fc1e53c-519f-4b0e-996e-c04cbfd6fe86","resolution":{"observed_at":"2026-08-07T12:55:49.886568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:50.011227Z","title":"Decision transformer: Reinforcement learning via sequence modeling","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:50.011227Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:38cd45cc23fa2c172db148af5ea3ec7cb73afca2bea709f8a11c0a448a41dace","observation_id":"0419cc4f-e479-4089-883d-e7c0c1657164","resolution":{"observed_at":"2026-08-07T12:55:50.011227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:58.127012Z","title":"Exact policy recovery in offline rl with both heavy-tailed rewards and data corruption","venue":null,"work_id":"1a703881-500a-4429-ba08-b78499552681","year":2024},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:50.170867Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:5eda54bff5bbf538e4f695c97826b263cccff5d2c30a26c07a50da92999675f8","observation_id":"8b641ced-b476-4710-bf8c-e9cf78a61c58","resolution":{"observed_at":"2026-08-07T12:55:58.188635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:57.980730Z","title":"Consistent diffusion meets tweedie: Training exact ambient diffusion models with noisy data","venue":null,"work_id":"95f6897a-83d5-42c6-b09d-22874b84e6b9","year":2024},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:50.323136Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:0ed83f58476b4790402b93569a611bc4fcc564fcc707c4236f1248522f9ebae7","observation_id":"901b35f6-a897-4991-b54a-fedcaa433656","resolution":{"observed_at":"2026-08-07T12:55:58.059697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-07T12:55:50.472027Z","title":"D4rl: Datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:50.472027Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:a503b01cb07ef61035e0cf5b6ea247097edf3c04645e525ea4e1459607c5b8f0","observation_id":"bf4502ff-5025-487b-8de7-5dd4ed9c70ca","resolution":{"observed_at":"2026-08-07T12:55:50.472027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:50.601518Z","title":"A minimalist approach to offline reinforcement learn- ing","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:50.601518Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:b7b4fec03d79202de570dafc3e3f2218d6c2b8b83a887a5ecce8ab94845c97ef","observation_id":"c858ef78-624f-42f4-acee-de67074b791c","resolution":{"observed_at":"2026-08-07T12:55:50.601518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:57.912274Z","title":"Off-policy deep reinforcement learning with- out exploration","venue":null,"work_id":"7e97719b-a210-47e5-9437-822e772e6983","year":2019},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:50.751884Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:bf312f24d77d5c8c27fb3c7168efd851c8507ed7b1acf14efff27cae25b31f4c","observation_id":"70525bd3-df61-4f38-8570-38c8e52a4f78","resolution":{"observed_at":"2026-08-07T12:55:57.948906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:57.760561Z","title":"Why so pessimistic? estimating uncertainties for offline rl through ensembles, and why their independence matters","venue":null,"work_id":"66332db5-41e7-4545-bf34-5a6277ae2d54","year":2022},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:50.996427Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:b431af423696194896d74849f7351aa63a7288889e571d36b3a82081b5629808","observation_id":"ce47875b-e531-4665-b6ec-30fae9c7a8db","resolution":{"observed_at":"2026-08-07T12:55:57.837287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-07-06T15:18:07.416392Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10573","snapshot_observed_at":"2026-08-07T12:55:51.086548Z","title":"IDQL: Implicit Q-learning as an actor-critic method with diffusion policies","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:51.086548Z"},"links":{"cited_paper":"/paper/2304.10573","citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:6cc05225a445bb76f25ae9c93da11809d2d3841c57363c3d0c1f06dec1499768","observation_id":"7bb711e0-81f2-4b51-8742-16ae564a9b2c","resolution":{"observed_at":"2026-08-07T12:55:51.086548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:57.603645Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"1e6a3c01-0030-4591-a9d0-0810373648d8","year":2020},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:51.167694Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:a69ddd9c14d5849ed52d08cf6b2a400faae920371626cda63d5f5bd1adb22ae4","observation_id":"044294f5-e2f2-4677-a284-ce6e4a52f95d","resolution":{"observed_at":"2026-08-07T12:55:57.670545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:57.427295Z","title":"Planning with diffusion for flexible behavior synthesis","venue":null,"work_id":"dbfd86ab-e1e4-4a5a-9cce-5ba4f9481ada","year":null},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:51.268766Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:018ce8919d367078cd831a7c4e014bb7cdb70882cf562fd274adf97b9c0c9d19","observation_id":"71b1811b-c4c7-46d2-ad04-06838da71daf","resolution":{"observed_at":"2026-08-07T12:55:57.509450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:51.378863Z","title":"Offline reinforcement learning as one big sequence modeling problem","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:51.378863Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:422b5fb9b11eb9e0f2a3e87eec94cad3c934564f1aa96c06804a45ee7297d535","observation_id":"9dedea89-7914-4726-8c53-7e240630a2fd","resolution":{"observed_at":"2026-08-07T12:55:51.378863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:57.235478Z","title":"Neural stochastic differential equations for uncertainty-aware offline rl","venue":null,"work_id":"d9e28517-f268-451f-805d-f907bad6705c","year":null},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:51.479404Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:1ec6a76e6d8ba874b38205d921ba36661c84ac00c05679660652123a1ac24430","observation_id":"e84a4cd2-cafa-47e9-bfc4-3cb71585a727","resolution":{"observed_at":"2026-08-07T12:55:57.302674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-06T15:42:21.967989Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-07T12:55:51.589000Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:51.589000Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:8cb85ed1c8112387a1498439522faacdf27795f90b309c7c991d341efdaf6371","observation_id":"c4d21d72-cb97-4cb4-8a73-bdef2ef490e0","resolution":{"observed_at":"2026-08-07T12:55:51.589000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:57.120191Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":"493ba833-d490-4262-a366-f88384cb935b","year":2020},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:51.696488Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:feeb3cd6bdde34806f67498589a726b5a404407f8ed984b7577d88de88700cf6","observation_id":"51bdfcb9-5299-48f8-92cf-56ca80169906","resolution":{"observed_at":"2026-08-07T12:55:57.162259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:51.841469Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:51.841469Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:9154989c4bdf0727b96de882704703080bdd1ab91c30038e24940b16553743f7","observation_id":"506ed5af-a7b9-447f-ab85-59acdc70cfa7","resolution":{"observed_at":"2026-08-07T12:55:51.841469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:56.979135Z","title":"Survival instinct in offline reinforcement learning","venue":null,"work_id":"c2c94085-51e8-45fc-9251-3c8a30da082a","year":2024},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:51.953347Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:5b2e177866964907b0983dbb510b7913430858d838cf139494911f46b4ad6796","observation_id":"20eb3195-e3be-45c8-8419-0ff7be9c8d52","resolution":{"observed_at":"2026-08-07T12:55:57.021913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04102","last_updated":"2024-05-28T17:11:53Z","snapshot_observed_at":"2026-07-06T17:56:06.438303Z","submitted_at":"2024-04-05T13:58:51Z","title":"ROPO: Robust Preference Optimization for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04102","snapshot_observed_at":"2026-08-07T12:55:52.060026Z","title":"Robust preference optimization with provable noise tolerance for llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:52.060026Z"},"links":{"cited_paper":"/paper/2404.04102","citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:c90c4f3ec9609b0d203d8a0ab09984300972746bc1cb18059bde05ed6150786a","observation_id":"e1eb5478-0d2b-4072-9b61-e5f6d10d193a","resolution":{"observed_at":"2026-08-07T12:55:52.060026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:56.899825Z","title":"Adapt- diffuser: Diffusion models as adaptive self-evolving planners","venue":null,"work_id":"52a9416d-84c9-47b1-bf45-2bfeae23c080","year":2023},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:52.171683Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:bb1059e33ce26f2b7fd2e821e6665580443d9895900044e63f2c872e8ccffbe4","observation_id":"0d4f3c54-dde8-45f3-bd3a-d8f6fc392673","resolution":{"observed_at":"2026-08-07T12:55:56.910769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19909","last_updated":"2024-07-15T10:55:57Z","snapshot_observed_at":"2026-08-01T17:37:51.295130Z","submitted_at":"2024-05-30T10:20:55Z","title":"Adaptive Advantage-Guided Policy Regularization for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19909","snapshot_observed_at":"2026-08-07T12:55:52.250621Z","title":"Adaptive advantage-guided policy regularization for offline reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:52.250621Z"},"links":{"cited_paper":"/paper/2405.19909","citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:e19a521d3bcda2876fd31f1084db39ed6cbe70cc900ee514418f43019dc9d668","observation_id":"81d71945-2dc4-486e-8ea6-8491f145900c","resolution":{"observed_at":"2026-08-07T12:55:52.250621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.06083","last_updated":"2019-09-04T18:53:10Z","snapshot_observed_at":"2026-08-07T14:27:46.872660Z","submitted_at":"2017-06-19T17:53:11Z","title":"Towards Deep Learning Models Resistant to Adversarial Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.06083","snapshot_observed_at":"2026-08-07T12:55:52.349876Z","title":"Towards deep learning models resistant to adversarial attacks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:52.349876Z"},"links":{"cited_paper":"/paper/1706.06083","citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:386cc912dc7f84ec93e8e73fbbc50e94fbc3e5a9715cb3bd69dde68319bffd2e","observation_id":"f2c5b186-0fa7-42c0-9625-32b4df67b044","resolution":{"observed_at":"2026-08-07T12:55:52.349876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:56.724057Z","title":"Robust re- inforcement learning using offline data","venue":null,"work_id":"c7d9ac83-8c7d-4566-92b3-043aba5fdc67","year":2022},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:52.492092Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:5837f5cd490452942827a4c35e2593a2dbfc173cfda28bed5a5ff286e8d0cdeb","observation_id":"edc02cc5-db76-450b-8169-b5808703197b","resolution":{"observed_at":"2026-08-07T12:55:56.832793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:52.603920Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:52.603920Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:a2f4e1b1b154e9567dd6343bad6a09298f704762ed1361b77c71653ef2895a1a","observation_id":"a4fc0fb9-2b0a-4640-86f5-4b5c9827f731","resolution":{"observed_at":"2026-08-07T12:55:52.603920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:56.559109Z","title":"Distributionally robust model-based offline reinforcement learning with near-optimal sample complexity","venue":null,"work_id":"02889fff-3944-4086-951a-5c1b3b64542d","year":2024},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:52.715087Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:2f0b06559bf48c98e650dbf0e308bf3fe7c2332da87330a1fb0950b7de1b4ea1","observation_id":"1d7ba50d-9111-434f-bda0-5b5d009993a2","resolution":{"observed_at":"2026-08-07T12:55:56.620400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20587","last_updated":"2024-12-17T15:59:44Z","snapshot_observed_at":"2026-08-08T22:50:10.273917Z","submitted_at":"2023-10-31T16:24:17Z","title":"Unleashing the Power of Pre-trained Language Models for Offline Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20587","snapshot_observed_at":"2026-08-07T12:55:52.772925Z","title":"Unleashing the power of pre- trained language models for offline reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:52.772925Z"},"links":{"cited_paper":"/paper/2310.20587","citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:e1bd4c1082be172745123c6b1b958dc086915a74c41b5fddbfbd913336fa096a","observation_id":"fa6ae2c6-7739-44b5-a371-55c774d36064","resolution":{"observed_at":"2026-08-07T12:55:52.772925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:56.418369Z","title":"Deep un- supervised learning using nonequilibrium thermodynamics","venue":null,"work_id":"ecdf1b0b-2c46-4a3d-a11f-395a4e1b13f5","year":2015},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:52.882565Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:137031aff536ccba04ebbacb2bcc7e542762cebb8087c4a430d749efdc9c58f2","observation_id":"03cb4af2-56f5-4eba-9fd3-1e8bf8881c8c","resolution":{"observed_at":"2026-08-07T12:55:56.475138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:53.023971Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:53.023971Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:eb3e55fc81de70e7815760da113fcb43f48e6cb91af05d59985f8dbe5fb79ce9","observation_id":"d95c7342-e74a-4a3f-9126-2545d5b18d35","resolution":{"observed_at":"2026-08-07T12:55:53.023971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:56.369889Z","title":"Diffusion policies as an expressive policy class for offline reinforcement learning","venue":null,"work_id":"41ec4a70-b7b2-414d-adbe-b63c340cb381","year":2022},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:53.157210Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:2c36959d9a0bf5bdad337f22be1607fb62395aa2ca00666f49be768ddc06addb","observation_id":"e72e98e9-8ea3-4648-9020-99c453556ca2","resolution":{"observed_at":"2026-08-07T12:55:56.382385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08398","last_updated":"2022-03-16T05:02:47Z","snapshot_observed_at":"2026-07-06T12:48:23.739370Z","submitted_at":"2022-03-16T05:02:47Z","title":"COPA: Certifying Robust Policies for Offline Reinforcement Learning against Poisoning Attacks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.08398","snapshot_observed_at":"2026-08-07T12:55:53.257474Z","title":"Copa: Certifying robust policies for offline reinforcement learning against poisoning attacks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:53.257474Z"},"links":{"cited_paper":"/paper/2203.08398","citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:ea85c3cdb5c416289bcf62c2f3cea0f09c8d5244f468d984fd2ab0a58629c81b","observation_id":"397d09de-2df4-4cfc-b15f-04cefe7ba833","resolution":{"observed_at":"2026-08-07T12:55:53.257474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:56.223817Z","title":"Tackling data corruption in offline reinforcement learning via sequence modeling","venue":null,"work_id":"fa754750-cd35-427f-b0de-4798b08fd720","year":2025},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:53.375177Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:414a213acee6cfef239a19a71a10fa60a27bcb64d004bebb667196bb95cfd380","observation_id":"ae603eeb-7d7a-43b2-86bc-6f252b7d7d6a","resolution":{"observed_at":"2026-08-07T12:55:56.317012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:56.045082Z","title":"Rorl: Robust offline reinforcement learning via conservative smoothing","venue":null,"work_id":"4ac05d0b-fabc-48ea-9639-4bd983e72149","year":2022},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:53.461873Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:db3e90e9d403004feefc319413dd7d595ac972aa4ad9e8c87dd11e6fd1c06c7e","observation_id":"bec7e5bc-db01-4841-ab8d-ae899f31e0dc","resolution":{"observed_at":"2026-08-07T12:55:56.126296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10216","last_updated":"2024-10-23T08:22:44Z","snapshot_observed_at":"2026-08-09T23:38:31.978735Z","submitted_at":"2024-06-14T17:49:59Z","title":"Regularizing Hidden States Enables Learning Generalizable Reward Model for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10216","snapshot_observed_at":"2026-08-07T12:55:53.556785Z","title":"Regularizing hidden states enables learning generalizable reward model for llms.arXiv preprint arXiv:2406.10216, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:53.556785Z"},"links":{"cited_paper":"/paper/2406.10216","citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:ee2de720b3ffffb59b1ffcc152985ccd431cbbaa4725bfeef1749cb5c72262fa","observation_id":"c2be624d-9675-487d-92de-65d134ad6429","resolution":{"observed_at":"2026-08-07T12:55:53.556785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:55.901864Z","title":"Towards robust offline reinforcement learning under diverse data corruption","venue":null,"work_id":"4b17ba38-a363-42c6-bcae-c98ac123084e","year":2024},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:53.638459Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:c7f75edbfbe900b8f512585d867faf9e0faa82f57877f045b928160b27745236","observation_id":"dc6e40a4-8c22-499d-916f-38b0606a70ab","resolution":{"observed_at":"2026-08-07T12:55:55.958959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:55.695650Z","title":"Dmbp: Diffusion model-based predictor for robust offline rein- forcement learning against state observation perturbations","venue":null,"work_id":"d3d7151b-b3ea-45b2-9c52-f304e5be3ba4","year":2024},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:53.766842Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:7c4a32036a435e07303ab2a99a3f46e3443bebea4b9ad5ad21f5ebc87f9718e3","observation_id":"c23335ab-2839-49a6-ba43-d10898ab60cb","resolution":{"observed_at":"2026-08-07T12:55:55.796509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08991","last_updated":"2024-07-20T15:23:25Z","snapshot_observed_at":"2026-08-07T00:44:56.876662Z","submitted_at":"2024-02-14T07:27:30Z","title":"Towards Robust Model-Based Reinforcement Learning Against Adversarial Corruption","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08991","snapshot_observed_at":"2026-08-07T12:55:53.920438Z","title":"Towards robust model-based reinforce- ment learning against adversarial corruption","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:53.920438Z"},"links":{"cited_paper":"/paper/2402.08991","citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:afbefe0e08fce2672c7ed55ce6ff0ec0455f67480c55328c6794eccb03db5c41","observation_id":"942f13a5-48d8-4637-8b4e-3dcb9e0b5a7a","resolution":{"observed_at":"2026-08-07T12:55:53.920438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:55.535476Z","title":"Corruption-robust offline reinforcement learning with general function approximation","venue":null,"work_id":"5082c3dd-fd8a-430e-9bec-f74ce6c360ac","year":2024},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:54.057000Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:d4f70138472c1fbe9b59ff4b12a4323594b95901dbfc073b6b5311b5371cf51b","observation_id":"02a95ecd-77eb-4bc1-9265-743cc4e120cc","resolution":{"observed_at":"2026-08-07T12:55:55.607965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.08452","last_updated":"2021-01-21T05:38:52Z","snapshot_observed_at":"2026-07-06T10:34:16.058281Z","submitted_at":"2021-01-21T05:38:52Z","title":"Robust Reinforcement Learning on State Observations with Learned Optimal Adversary","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.08452","snapshot_observed_at":"2026-08-07T12:55:54.213230Z","title":"Robust reinforcement learning on state observations with learned optimal adversary","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:54.213230Z"},"links":{"cited_paper":"/paper/2101.08452","citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:114b96426d05a0945ccc34424ab834085c78b78d44dfe1bba2c6aeff942cb4e5","observation_id":"b9ecdb87-ee50-4795-8257-fb15e3942fd9","resolution":{"observed_at":"2026-08-07T12:55:54.213230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:55.326218Z","title":"Robust deep reinforcement learning against adversarial perturbations on state observa- tions","venue":null,"work_id":"0bcc201e-018f-4f47-b38b-9369abb0e0bb","year":2020},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:54.309588Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:35763f28bd228e3f8d750a0b26c4b3e4090e3a979454d5dea045a0a5cdb12d7b","observation_id":"5871579f-6a8d-4d36-901e-99fe7a7e3c0c","resolution":{"observed_at":"2026-08-07T12:55:55.473965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:55.101762Z","title":"medium-replay- v2","venue":null,"work_id":"b8850552-48b7-415a-a746-0e84307be060","year":2022},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:54.416203Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:6dd66cf31ee0cd9e8b2e6052713cb632848ad211bedb402878c95f810f4b2a37","observation_id":"3eac0b00-c5a7-4c4f-bb3a-438918897dbf","resolution":{"observed_at":"2026-08-07T12:55:55.236937Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T10:58:34.700826Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":1,"verified_fuzzy":22},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 1 inbound Pith citation observation for arXiv:2505.23871."}