{"as_of":"2026-08-11T01:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:529a43101f0be17a3a7a1ec5e775b207540613a71bda516173404b73e70528ce","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:38:35.725134Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.02356/citation-record","integrity":"/paper/2507.02356/integrity","json":"/paper/2507.02356/citation-record.json","paper":"/paper/2507.02356"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:38.388315Z","title":"Uncertainty-based offline reinforcement learning with diversified q-ensemble","venue":null,"work_id":"a9822e4d-0890-4f6b-8e94-e2c0f4e443dc","year":2021},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:31.737091Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:b4371cec7efec9132181ce8edcf138057bbdbce5511667fe58e625a065dbcf55","observation_id":"1da2545c-de84-4043-9793-2d18e1ffe030","resolution":{"observed_at":"2026-08-06T20:38:38.434048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-06T20:38:31.842375Z","title":"Layer normalization","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:31.842375Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:75828a1cc07e000b629af0518bfe5a6a1e7fef3d68801c10a35c33de11f80dc5","observation_id":"3e5d8264-1aa1-4027-9faf-c087bdbf7e9a","resolution":{"observed_at":"2026-08-06T20:38:31.842375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14548","last_updated":"2023-02-28T04:19:48Z","snapshot_observed_at":"2026-08-08T12:55:11.002893Z","submitted_at":"2022-09-29T04:36:23Z","title":"Offline Reinforcement Learning via High-Fidelity Generative Behavior Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14548","snapshot_observed_at":"2026-08-06T20:38:31.961205Z","title":"Offline reinforcement learning via high-fidelity generative behavior modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:31.961205Z"},"links":{"cited_paper":"/paper/2209.14548","citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:a3b7c475f0cec6673cbd21bcfe8e60baf91bbb05d27607d00b28f1eddac55d85","observation_id":"dede0fb2-7726-4036-bc49-c3a9da87a142","resolution":{"observed_at":"2026-08-06T20:38:31.961205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07297","last_updated":"2024-03-15T03:42:03Z","snapshot_observed_at":"2026-07-06T16:31:03.559653Z","submitted_at":"2023-10-11T08:31:26Z","title":"Score Regularized Policy Optimization through Diffusion Behavior","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07297","snapshot_observed_at":"2026-08-06T20:38:32.067287Z","title":"Score regularized policy optimization through diffusion behavior","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:32.067287Z"},"links":{"cited_paper":"/paper/2310.07297","citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:06d9a24e565b77e763187c55b7aa5de09bb80dafc40a11be2af39df8c554cc0f","observation_id":"f7d77ab3-7008-4262-a7e8-eb0341d5621b","resolution":{"observed_at":"2026-08-06T20:38:32.067287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19690","last_updated":"2024-10-31T18:09:38Z","snapshot_observed_at":"2026-08-02T14:04:10.719542Z","submitted_at":"2024-05-30T05:04:33Z","title":"Diffusion Policies creating a Trust Region for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19690","snapshot_observed_at":"2026-08-06T20:38:32.141102Z","title":"Diffusion policies creating a trust region for offline reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:32.141102Z"},"links":{"cited_paper":"/paper/2405.19690","citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:d5cdf9cc0fb61f4b19f305b930d6b0037288c2659fc563bbe26a8b7647e92f29","observation_id":"30bc8fe0-d178-4f77-ac42-81ce3fe4e4d5","resolution":{"observed_at":"2026-08-06T20:38:32.141102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09788","last_updated":"2022-04-12T10:54:53Z","snapshot_observed_at":"2026-08-05T09:25:47.669710Z","submitted_at":"2021-12-17T22:04:55Z","title":"Heavy-tailed denoising score matching","version":2},"cited_work":{"arxiv_id":"2112.09788","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.09788","snapshot_observed_at":"2026-08-06T20:38:35.958263Z","title":"Heavy-tailed denoising score matching","venue":"cs.LG","work_id":"32ba7ac9-352e-454f-8ba4-a5edec96ff3b","year":2021},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:32.216742Z"},"links":{"cited_paper":"/paper/2112.09788","citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:2edd58ee889505c13bea04cd2b9ddc84a57833a80b7ff660e946d29bbee21a00","observation_id":"270e3281-3349-405a-be63-20c824aff9ab","resolution":{"observed_at":"2026-08-06T20:38:36.017010Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-06T20:38:32.343671Z","title":"D4rl: Datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:32.343671Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:27b6307b924fe0244061016409165cbdd338e6cc6ade5be2a8c3b7a05779bb15","observation_id":"cfd8ec7d-c3f3-4b95-a8e1-9eed79c10ea8","resolution":{"observed_at":"2026-08-06T20:38:32.343671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:32.427027Z","title":"A minimalist approach to offline reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:32.427027Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:58e9790ad08622ec52c3c0832ba9549e3722ef49691a4348c89a3df35c694d0f","observation_id":"2458abd8-0a18-49dc-8f1e-74484648aefc","resolution":{"observed_at":"2026-08-06T20:38:32.427027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:32.494366Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:32.494366Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:e6147139010adc1b7909dbdbdab61e2f495163a5685914560b4dcec843492e3f","observation_id":"fe4cf0f3-adb7-45c5-9de0-b0f5b52e3330","resolution":{"observed_at":"2026-08-06T20:38:32.494366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:32.621106Z","title":"Off-policy deep reinforcement learning without exploration","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:32.621106Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:c6c0c182a72db996ef01a500ce5b7d5a88ec5490d4b11560654b284d4056a538","observation_id":"3b8f0a35-73b2-4bb6-91b2-d81f6d6e16cc","resolution":{"observed_at":"2026-08-06T20:38:32.621106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:32.743577Z","title":"Calculus of variations","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:32.743577Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:749c2c646b19e80fde59f1b235004548da4ea1854597c1b37c0eb9363460a704","observation_id":"0bdfee5c-e361-4565-82e3-156ebaf484f5","resolution":{"observed_at":"2026-08-06T20:38:32.743577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-07-06T15:18:07.416392Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10573","snapshot_observed_at":"2026-08-06T20:38:32.861799Z","title":"Idql: Implicit q-learning as an actor-critic method with diffusion policies","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:32.861799Z"},"links":{"cited_paper":"/paper/2304.10573","citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:8b70ffa19e106b63fd7871e06eb2a8eeb49a4a6811affacf6af4bc034cd2f408","observation_id":"44a5caa0-2ef4-435c-bf9d-d4675b8f5884","resolution":{"observed_at":"2026-08-06T20:38:32.861799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:32.978532Z","title":"Estimation of non-normalized statistical models by score matching","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:32.978532Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:70355411acab22734969e1a4a2daefa72852a903ad860f8a38c47198d1354621","observation_id":"3fd83fcf-0547-4a0b-9dc1-ecabbe7bc4a1","resolution":{"observed_at":"2026-08-06T20:38:32.978532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:38.130569Z","title":"Understanding diffusion objectives as the elbo with simple data augmentation","venue":null,"work_id":"9cdff22a-e327-4dfb-ba09-7cba9ab9f019","year":2024},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:33.074290Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:2c924b340d30d8312f15f123b0e3f568299b6bf2f685ad9445325e6e3cd6bffb","observation_id":"23d6c552-6feb-46af-97a5-0fbb323cb07f","resolution":{"observed_at":"2026-08-06T20:38:38.232042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-06T20:38:33.201984Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:33.201984Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:36a4755cff6b1053c4ee14831b19c0ff3b8ca91815239907fb6b8637c35bf082","observation_id":"0601121a-7f5e-46fb-ab8b-600e70a417b3","resolution":{"observed_at":"2026-08-06T20:38:33.201984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-06T15:42:21.967989Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-06T20:38:33.288918Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:33.288918Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:d240d935c8973f8f2a4649da5c45dfc46db64bcd427ab976fa210efb9a74f2dc","observation_id":"8dcf4a96-1f10-4f7d-8c6b-853a671b92f4","resolution":{"observed_at":"2026-08-06T20:38:33.288918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:33.405392Z","title":"Stabilizing off-policy q-learning via bootstrapping error reduction","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:33.405392Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:34c79fd2cab67ca9580ef1b6a4381fb21494cd4b3e30c589e3d98958a11e0762","observation_id":"09e7a1eb-a7a6-4c39-b6e4-c53cf57c1574","resolution":{"observed_at":"2026-08-06T20:38:33.405392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:37.980405Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":"61cff2e7-58d6-4134-9fc5-1fb7b8f35549","year":2020},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:33.524554Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:af7ba1dd61a3ec4498f712239601ec615e03224d8177f706e67220621e020c74","observation_id":"bcf8ceda-bcaa-428f-bb39-bc5937405986","resolution":{"observed_at":"2026-08-06T20:38:38.059986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:37.786529Z","title":"Reinforcement learning with augmented data","venue":null,"work_id":"c1410aac-2df8-4dbf-ae58-4a4a4382deaf","year":2020},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:33.627961Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:0b0cc5f6392cf620e2e795ba1a574c9799cd354f775b85c595bfb067ffa8b515","observation_id":"41b9557a-32c3-4a56-ba75-368c9b45e136","resolution":{"observed_at":"2026-08-06T20:38:37.879872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:37.629124Z","title":"Batch reinforcement learning with hyperparameter gradients","venue":null,"work_id":"82bff7e2-f044-4ae0-b24c-cc2e0b3da907","year":2020},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:33.739155Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:9d3d2ea77d1a8a3a673db3ab5f09b64e64e2e774e5113b1946a1a75ac7311e0a","observation_id":"55ec212d-70ea-418b-a4dd-af6133addaaa","resolution":{"observed_at":"2026-08-06T20:38:37.675965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:37.389012Z","title":"Learning energy-based models in high-dimensional spaces with multiscale denoising-score matching","venue":null,"work_id":"d18aaf50-7538-453d-9979-4f697fb45f21","year":2023},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:33.848855Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:fcbd50038466fc163e65d5ec810511c015dff87758d6156b8d53af37bcd15d90","observation_id":"ec0ef95b-8d50-4a57-abaf-d3cabbd5cc84","resolution":{"observed_at":"2026-08-06T20:38:37.521833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:37.145981Z","title":"Contrastive energy prediction for exact energy-guided diffusion sampling in offline reinforcement learning","venue":null,"work_id":"554f8292-d161-498c-8709-4ea3745e5800","year":2023},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:33.985104Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:663b19697209078579163ebc44d01b4a51ed6ed0a7d4eafa87fc1ca549e6b95c","observation_id":"d3ce1b0b-1a87-4a90-96ad-568a994fe870","resolution":{"observed_at":"2026-08-06T20:38:37.258953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-07-06T09:29:45.475911Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-06T20:38:34.078884Z","title":"Awac: Accelerating online reinforcement learning with offline datasets","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:34.078884Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:7d944c863b08cb966d02e2ce2495865bfa363a781b65114c89513dd32b7030d6","observation_id":"51d92faf-a390-4ba8-9e6e-a0c6d0d6d8af","resolution":{"observed_at":"2026-08-06T20:38:34.078884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:36.999984Z","title":"Anti-exploration by random network distillation","venue":null,"work_id":"60ec76c5-b946-481a-8a8f-dec687c3728f","year":2023},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:34.197168Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:3d6ccc4df4641a6f5705259ef36e66b9e0d80996444c18f4b07ea4e03310a389","observation_id":"baf425d1-58da-4a6f-bb21-d574dbcd88a6","resolution":{"observed_at":"2026-08-06T20:38:37.079058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14171","last_updated":"2024-10-29T09:59:22Z","snapshot_observed_at":"2026-07-06T19:35:44.200337Z","submitted_at":"2024-10-18T04:29:46Z","title":"Heavy-Tailed Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14171","snapshot_observed_at":"2026-08-06T20:38:34.311608Z","title":"Heavy-tailed diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:34.311608Z"},"links":{"cited_paper":"/paper/2410.14171","citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:cbcd9ef157f5f7c6f931a6763f5bff6b1a6b15aa6d0317f4320fa0b4d754a004","observation_id":"b65795e4-72c4-4282-bfeb-70a1979aaa5b","resolution":{"observed_at":"2026-08-06T20:38:34.311608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14988","last_updated":"2022-09-29T17:50:40Z","snapshot_observed_at":"2026-07-06T13:57:54.539656Z","submitted_at":"2022-09-29T17:50:40Z","title":"DreamFusion: Text-to-3D using 2D Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14988","snapshot_observed_at":"2026-08-06T20:38:34.429681Z","title":"Dreamfusion: Text-to-3d using 2d diffusion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:34.429681Z"},"links":{"cited_paper":"/paper/2209.14988","citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:61b187a49307bac5c1391ab9625c67bb6ef977fc15bb804137cc6291a9536f4f","observation_id":"78e68a9c-3574-42a0-8af4-e66fd739dad3","resolution":{"observed_at":"2026-08-06T20:38:34.429681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:36.852200Z","title":"Efficient differentiable simulation of articulated bodies","venue":null,"work_id":"fae755c7-5137-44af-b349-77ab751e3dca","year":2021},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:34.550267Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:532bf37a7c955479f6c35e6a0e9a68c138cee54048bfd510c8c590f348363c73","observation_id":"c922708f-0235-4672-9a6f-680c9919918d","resolution":{"observed_at":"2026-08-06T20:38:36.915029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:36.665040Z","title":"Offline reinforcement learning as anti-exploration","venue":null,"work_id":"973efc45-461e-4a27-b6d2-ee39cc07da43","year":2022},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:34.671019Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:26d44bd3072c249cdebe9cd375a0b17666597c6002062aae50ceb066a9fcc05d","observation_id":"995cbc0a-a10c-42ba-8e3e-cbb70fa0c5ac","resolution":{"observed_at":"2026-08-06T20:38:36.743353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:36.489331Z","title":"S4rl: Surprisingly simple self-supervision for offline reinforcement learning in robotics","venue":null,"work_id":"f3d05c68-4b04-4cdd-99fb-c7d3d518c165","year":2022},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:34.772132Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:47ce81bac96ee869f84457873b7846120a0440a2b57aaa34f34e57915c66e630","observation_id":"de5bffb6-547d-4f2c-a9f5-e3254fbdfef1","resolution":{"observed_at":"2026-08-06T20:38:36.568452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:34.862757Z","title":"Generative modeling by estimating gradients of the data distribution","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:34.862757Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:ee80cc3e95e2ca1402c7444b753faea19c972ae66963f623af374227723db2ed","observation_id":"bb38a4bf-2c58-4375-80ea-5a4aa65b7b1e","resolution":{"observed_at":"2026-08-06T20:38:34.862757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-06T20:38:34.981272Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:34.981272Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:4eb932158881dc51993f8cba1522dbb96ee850afdb995a003e9b5767954d54f6","observation_id":"8a2cce95-1e29-4969-ab39-8b4baee2e0c2","resolution":{"observed_at":"2026-08-06T20:38:34.981272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:35.087356Z","title":"Revisiting the minimalist approach to offline reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:35.087356Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:b7813614c10b79e22d6ac68e1a39931e259b7d82edc3e1fb5a22c74dd6127d17","observation_id":"af1d8a34-686b-4d5f-8006-e3459a95c306","resolution":{"observed_at":"2026-08-06T20:38:35.087356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:35.208587Z","title":"A connection between score matching and denoising autoencoders","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:35.208587Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:70afcc60316290a22ba853108b358075ec68a1df283239c2fd2b628d6194e969","observation_id":"78e6b11b-7441-4184-b72d-1864ae3d9c6f","resolution":{"observed_at":"2026-08-06T20:38:35.208587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-08-06T20:38:35.366704Z","title":"Diffusion policies as an expressive policy class for offline reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:35.366704Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:ca723806dece6447633676e2f85d757f09633759c18db33a040dcb46eba34566","observation_id":"95dc4f19-86d8-4674-8e21-89a853191561","resolution":{"observed_at":"2026-08-06T20:38:35.366704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:36.283703Z","title":"On scale mixtures of normal distributions","venue":null,"work_id":"501ccfc0-493c-4a15-8a92-20d1aefb798c","year":1987},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:35.479265Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:9e65c62b9c20df4d4015e2d32fcaa3fe7e38e204536610467e1c03c0b181c890","observation_id":"0cfadee7-393b-42d9-8e70-a045f47d28c7","resolution":{"observed_at":"2026-08-06T20:38:36.366574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09750","last_updated":"2024-05-20T02:12:21Z","snapshot_observed_at":"2026-07-06T17:17:11.535092Z","submitted_at":"2024-01-18T06:32:53Z","title":"Exploration and Anti-Exploration with Distributional Random Network Distillation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09750","snapshot_observed_at":"2026-08-06T20:38:35.625180Z","title":"Exploration and anti-exploration with distributional random network distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:35.625180Z"},"links":{"cited_paper":"/paper/2401.09750","citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:5ed6cbf24d0632828d1f3023d95afbd9a156ec6727f5af37714b346c5f40dc65","observation_id":"993d3e30-6b2c-4ac3-b75d-ea23486c921c","resolution":{"observed_at":"2026-08-06T20:38:35.625180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:36.106433Z","title":"Rorl: Robust offline reinforcement learning via conservative smoothing","venue":null,"work_id":"2d03ac04-4a27-4890-a228-841b28824769","year":2022},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:35.725134Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:3951ffe8726dc5598b416e252b1b48457d4e6a346a679b95a57f2577cdc4a8bf","observation_id":"bea9b73e-a826-4506-ab75-db014269a869","resolution":{"observed_at":"2026-08-06T20:38:36.183894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":1,"verified_fuzzy":13},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2507.02356."}