Pith. sign in

Paper Citation Record · LEDGER

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning

As of 9 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 4 inbound Pith citation observations for arXiv:2502.04778.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2502.04778 v2

Coverage vector

measured 56 of 56 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-08T21:39:25.695375Z

measured 60 of 60 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 4 of 4 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T14:20:37.619351Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-25T07:35:29.370333Z

Reference resolution

56 of 56 outbound references displayed

  • verified exact1
  • verified fuzzy35
  • unresolved20
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation bc0f9384-b69d-47e5-8df9-e3e8431593a4 · outbound

This paper cites write newline.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning write newline

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-08T21:39:25.474805Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T21:39:25.474805Z digest=sha256:db5d5a757308a028b8b19f2d1efccf649eabf8c531e81e44cb840f9f3e59d52a

Observation b84becd1-6a52-45f9-9b6b-daf926ec93b4 · outbound

This paper cites B., Jaakkola, T.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning B., Jaakkola, T

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.344765Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.480286Z digest=sha256:a6216394853206181badb1a96b321e170977340052ee3e98aad25658b230086e

Observation dfa42f6d-da44-4b8a-bfdd-2a3b22071f04 · outbound

This paper cites J., Mittal, S., Lemos, P., Liu, C., Sendera, M., Ravanbakhsh, S., Gidel, G., Bengio, Y., Malkin, N., and Tong, A.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning J., Mittal, S., Lemos, P., Liu, C., Sendera, M., Ravanbakhsh, S., Gidel, G., Bengio, Y., Malkin, N., and Tong, A

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.334319Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.486379Z digest=sha256:efa380d1d52d121e74365e06760bfe25d26e4cafd42c1eb9d61caf15b9c9337f

Observation 6c35250c-f24c-4a6b-861f-18c5d50c6d09 · outbound

This paper cites Diffusion for World Modeling: Visual Details Matter in Atari.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Diffusion for World Modeling: Visual Details Matter in Atari

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-08T21:39:25.490636Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T21:39:25.490636Z digest=sha256:612ff109aded9ca53028b0827e2ed831b5df014a9fd698e2d20f6e091c5cec2e

Observation 1072c14c-59e1-4a7b-aae5-296ffb35572e · outbound

This paper cites an unresolved cited work.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Unresolved cited work

Reference 5

Resolution
unresolved
raw_fallback, observed 2026-08-08T21:39:26.323208Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.495286Z digest=sha256:332d9e16d6ac2796dc48b5de9d14075286184150b417ced287f81e3fa811142f

Observation 1d150672-ea73-487e-b447-673d493ea98c · outbound

This paper cites Pessimistic bootstrapping for uncertainty-driven offline reinforcement learning.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Pessimistic bootstrapping for uncertainty-driven offline reinforcement learning

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.311997Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.500394Z digest=sha256:c4a168af51a759f4f43a193b726401f74a9cfa7be43a91ebb5f27089300542e3

Observation fc0daf05-356a-41eb-bb0a-c85c74093eef · outbound

This paper cites OpenAI Gym.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning OpenAI Gym

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-08T21:39:25.504501Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T21:39:25.504501Z digest=sha256:77e7f8d5a9e1e860abc79483e572ab82d7fb699143bb5058ba00590bc1bd9de0

Observation ea94de36-52cd-4a73-bfc4-c66da9fa4931 · outbound

This paper cites Offline reinforcement learning via high-fidelity generative behavior modeling.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Offline reinforcement learning via high-fidelity generative behavior modeling

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.300746Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.509341Z digest=sha256:2012eb3b642f0198b29fd1d31278eadc6d96ad1de1ec7230ba7e04a42fd62f0d

Observation a6a68adb-37a2-41b2-9119-71d28b172b20 · outbound

This paper cites Score regularized policy optimization through diffusion behavior.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Score regularized policy optimization through diffusion behavior

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.289147Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.513147Z digest=sha256:8afea2dac0be867cac72b1d7972e584e644b0371e7b0fac2d6589ded976d588a

Observation 57e40425-0256-4553-a9b5-24acb4847201 · outbound

This paper cites Decision transformer: Reinforcement learning via sequence modeling.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Decision transformer: Reinforcement learning via sequence modeling

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.277563Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.517080Z digest=sha256:e7137caaa468e573bcdb6ee5281cae73a6be165a2ea0463544fb807ae1427f16

Observation 8cfc379a-7beb-4dde-b478-966e54f3f4e9 · outbound

This paper cites Diffusion Policies creating a Trust Region for Offline Reinforcement Learning.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Diffusion Policies creating a Trust Region for Offline Reinforcement Learning

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-08T21:39:25.521307Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T21:39:25.521307Z digest=sha256:f96d4d9be9fe0a1d472fdd05661a3985a132e21c2c199858ce805cf880ea552e

Observation 297a5d88-0833-4fa6-9b98-c16ed13bda4e · outbound

This paper cites Soft Actor-Critic for Discrete Action Settings.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Soft Actor-Critic for Discrete Action Settings

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-08T21:39:25.525912Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T21:39:25.525912Z digest=sha256:830d500d2f1da4b45a843064f104dbfd993b11dc6d3195e664883178c2b17f65

Observation c8cfc308-5b73-4999-aa3f-40b86b9361f0 · outbound

This paper cites Diffusion Actor-Critic: Formulating Constrained Policy Iteration as Diffusion Noise Regression for Offline Reinforcement Learning.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Diffusion Actor-Critic: Formulating Constrained Policy Iteration as Diffusion Noise Regression for Offline Reinforcement Learning

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-08T21:39:25.530151Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T21:39:25.530151Z digest=sha256:77d607ef6feb36f203732f4799f4a12a489be0771c4358764d20ca23315d9ac4

Observation a9fcfcbd-3dc5-46d7-b40b-d39d6be4305c · outbound

This paper cites MINDE : Mutual information neural diffusion estimation.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning MINDE : Mutual information neural diffusion estimation

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.266493Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.534070Z digest=sha256:013e500dd28547880612aafd9182b721d2efc37788c9ac7b603a80fc59df02ff

Observation 3b526906-b1df-4430-b892-c4c171b50159 · outbound

This paper cites D4RL: Datasets for Deep Data-Driven Reinforcement Learning.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-08T21:39:25.537582Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T21:39:25.537582Z digest=sha256:a21166d35f4093f75038226b84894dfc64d097cd7a99d23506d80f74ff009b65

Observation 3ea32e31-4370-48a4-ad60-17dc9e5f4b71 · outbound

This paper cites and Gu, S.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning and Gu, S

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.255012Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.542267Z digest=sha256:00609997af94d487e8911754ffccff1a0b49a4e3624e6ba5f76c5c5f429e680c

Observation 893e10de-8379-4a77-932b-41609f15d7ff · outbound

This paper cites Off-policy deep reinforcement learning without exploration.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Off-policy deep reinforcement learning without exploration

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.243172Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.545894Z digest=sha256:da209da5f0459299ded7daacfb91ab88c189277964a72eac51f18a05325732f6

Observation a131e68b-d2ef-4822-a1c2-b4092ef812dd · outbound

This paper cites ACT: E mpowering decision transformer with dynamic programming via advantage conditioning.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning ACT: E mpowering decision transformer with dynamic programming via advantage conditioning

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.232056Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.549400Z digest=sha256:152b07be6077bc790bc7414155a810e1570772693b5c302c95c979bdffb019fc

Observation 8933c0cb-1265-4429-b3d7-9d991727cf07 · outbound

This paper cites Extreme Q -learning: Maxent RL without entropy.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Extreme Q -learning: Maxent RL without entropy

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.220737Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.553170Z digest=sha256:4d8e6f40c3e534e243faf511aea33428c657bdd4d02d87bea53b5745b5f095b8

Observation 87d3c4e6-a48c-449e-b1d5-e2e91eac6880 · outbound

This paper cites Reinforcement learning with deep energy-based policies.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Reinforcement learning with deep energy-based policies

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.208420Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.556765Z digest=sha256:37cc6b7b7edefd13c65417ddf732fbfc68f678f6bfce12d09afe773eb3f67924

Observation 9b6aa253-7da0-41f9-9064-cd530f39284c · outbound

This paper cites Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.196891Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.560459Z digest=sha256:c6dea9ddd49626f880e485a1b029d0e24a5c2e05b7d6183b67f155a27bf4a4ea

Observation 0476a32b-af66-463f-af83-439ae49335d6 · outbound

This paper cites IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-08T21:39:25.563951Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T21:39:25.563951Z digest=sha256:a0719ebe19e10b28e95437aa0797fcaaa255dd45164c921f05cfcbcf7b193ac2

Observation 6f0af461-0752-476d-bdfa-b509f9389e1e · outbound

This paper cites Denoising diffusion probabilistic models.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Denoising diffusion probabilistic models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-08T21:39:25.567961Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T21:39:25.567961Z digest=sha256:bee153bfa31ced194169be6dd7c8c3efff85544a7eac5d7b371f4a6b058563f4

Observation d1f7e17c-4996-46bc-9512-482ef435367c · outbound

This paper cites B., and Levine, S.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning B., and Levine, S

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.177193Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.571512Z digest=sha256:c3fd8645aa64156bec5e5d59911b2b1b5719f9f4c33b36ce8a0f8660d60b079a

Observation 4d1e9c04-eff5-42b4-a217-0cf0ab6ceb2f · outbound

This paper cites Policy rehearsing: Training generalizable policies for reinforcement learning.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Policy rehearsing: Training generalizable policies for reinforcement learning

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.165466Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.574956Z digest=sha256:5b51d42105d037505928235eb40880644017d32b22d460276e065921ef54f742

Observation 781b595f-004c-4a9d-bc45-b95e4325d212 · outbound

This paper cites Efficient diffusion policies for offline reinforcement learning.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Efficient diffusion policies for offline reinforcement learning

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.153787Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.578415Z digest=sha256:d6121ce032406c55a1240aed19ec551703b62b8ef666ce551a4ccd1148c214c4

Observation 71e36e3d-fac0-4ae3-9b70-1028d8767e87 · outbound

This paper cites an unresolved cited work.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Unresolved cited work

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-08T21:39:25.582232Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T21:39:25.582232Z digest=sha256:8e0fd2142302da7675a6c926aafbb3fb8aa2a99e80dfb3d9a116e1de9b56b8a5

Observation 53b6fac2-9a12-4da2-84f8-57e5944d8ce5 · outbound

This paper cites Offline reinforcement learning with implicit Q -learning.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Offline reinforcement learning with implicit Q -learning

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.136104Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.585841Z digest=sha256:12f6e7a7c3763cff1d14e5891c08a371b739aca3e53cb54eee77a8e100fa65f4

Observation e1cc3d49-6392-4708-a46f-affeae9f22d7 · outbound

This paper cites Stabilizing off-policy Q -learning via bootstrapping error reduction.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Stabilizing off-policy Q -learning via bootstrapping error reduction

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.124689Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.589399Z digest=sha256:07de7db9686d8ce465e16f77d9af8367e765bbed3d409ccc54ee4d8947445ee8

Observation c641b95e-c5ad-4fd7-9544-3517bf70f663 · outbound

This paper cites Discor: Corrective feedback in reinforcement learning via distribution correction.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Discor: Corrective feedback in reinforcement learning via distribution correction

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.113331Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.593156Z digest=sha256:7cb328ab2c746b43f443a1bcf2c26d680f887db78e46d08a5890286fc83ee2fa

Observation 51ce740c-7409-4a4b-8255-9c6e1161580a · outbound

This paper cites Conservative Q -learning for offline reinforcement learning.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Conservative Q -learning for offline reinforcement learning

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.101697Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.596808Z digest=sha256:af33ed6fb1b4587a7ff25fea4215a9415fa4db3a8d12424911a47734fd6e471f

Observation c7815ea6-a682-41b0-b5c0-036d49b26259 · outbound

This paper cites A workflow for offline model-free robotic reinforcement learning.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning A workflow for offline model-free robotic reinforcement learning

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.091194Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.600674Z digest=sha256:a0fd2d235852678a9d3c3a114f4e777baa7aba88e9e559d5c9cc0532afa07e58

Observation 1cde2db5-16d8-4f35-a57f-9e96c3e2716b · outbound

This paper cites Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-08T21:39:25.604336Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T21:39:25.604336Z digest=sha256:d8031fd753563cea68e3a9d0f4c7dcb0ec6687135a721bf2b1921784601d3097

Observation 4b886aef-d99a-4b01-a54b-7142a95dcdad · outbound

This paper cites Contrastive energy prediction for exact energy-guided diffusion sampling in offline reinforcement learning.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Contrastive energy prediction for exact energy-guided diffusion sampling in offline reinforcement learning

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.080529Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.608204Z digest=sha256:a86bc8f88d06ceb2539f1276391f33d40c590d3f96f30a78482b67d655253f38

Observation caacb572-96ff-4a65-8596-8579cef6728e · outbound

This paper cites Reward-consistent dynamics models are strongly generalizable for offline reinforcement learning.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Reward-consistent dynamics models are strongly generalizable for offline reinforcement learning

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.068770Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.612219Z digest=sha256:60fe4976968e28ed4c6a17e10b9ca68c68f5e687c63305c1377883fe384962b8

Observation 8e866662-5be8-4814-b177-7f8278e0133f · outbound

This paper cites Diffusion-dice: In-sample diffusion guidance for offline reinforcement learning.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Diffusion-dice: In-sample diffusion guidance for offline reinforcement learning

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.056675Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.616963Z digest=sha256:addbe75860abb6c50da0c66a84f8fbfa7076fa7d4293554eae7da8c0b505ec78

Observation 624a65ae-f6a5-4d00-8c00-0d3b0a80d40c · outbound

This paper cites Transformers are sample-efficient world models.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Transformers are sample-efficient world models

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.045165Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.620524Z digest=sha256:3a88fb63cf9db9668a0757a0e26b0d5757e909c2ca9748a00ff37ff6d8021dbf

Observation bae1b81e-f0e5-4c4f-bcd4-adb9db0a3eed · outbound

This paper cites AWAC: Accelerating Online Reinforcement Learning with Offline Datasets.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning AWAC: Accelerating Online Reinforcement Learning with Offline Datasets

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-08T21:39:25.624076Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T21:39:25.624076Z digest=sha256:a9f433ed3dccbf26feaced41a6a7df81bf1ab88bae03df06a4a3b166f9402ce1

Observation 63eb818a-630c-4515-9603-25909c71aa45 · outbound

This paper cites Stochastic differential equations: A n introduction with applications.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Stochastic differential equations: A n introduction with applications

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.033192Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.627908Z digest=sha256:8196fd1d5448039546d952c929db6b776940a5112ccf109b5df3b7cb5819c59c

Observation 54f3f038-5cba-43ad-a08e-7609e51a2ef6 · outbound

This paper cites L., Mishkin, P., Zhang, C., Agarwal, S., Slama, K., Ray, A., Schulman, J., Hilton, J., Kelton, F., Miller, L., Simens, M., Askell, A., Welinder, P., Christiano, P.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning L., Mishkin, P., Zhang, C., Agarwal, S., Slama, K., Ray, A., Schulman, J., Hilton, J., Kelton, F., Miller, L., Simens, M., Askell, A., Welinder, P., Christiano, P

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.021798Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.631693Z digest=sha256:0525538b827c77ae633aa57761334a75bc3a44c9a1897033d4b2d5d24933c777

Observation db07950d-e13d-4d47-ac38-983814958828 · outbound

This paper cites Policy regularization with dataset constraint for offline reinforcement learning.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Policy regularization with dataset constraint for offline reinforcement learning

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.009687Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.635262Z digest=sha256:c5b1c373e4107005187e3d9d5162569f66c0beb3047bb2d9df65d7bffb301e89

Observation 93daa91e-f9c6-478f-8296-ae05603a3a57 · outbound

This paper cites Diffusion Policy Policy Optimization.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Diffusion Policy Policy Optimization

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-08T21:39:25.638952Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T21:39:25.638952Z digest=sha256:930ffb781becd9e41724e69a730ea120485f3f4c7c3e01fd31b5060261516d25

Observation 0513c8f8-3910-405b-ac1f-b1a42b461c70 · outbound

This paper cites Proximal Policy Optimization Algorithms.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Proximal Policy Optimization Algorithms

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-08T21:39:25.643121Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T21:39:25.643121Z digest=sha256:1b721a80fe428de227b10f228459ebf46527a0ad2a5c53a80c9e55be9e315455

Observation 6a4482d1-8038-4005-b420-c447c92c1d75 · outbound

This paper cites Diffusion Spectral Representation for Reinforcement Learning.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Diffusion Spectral Representation for Reinforcement Learning

Reference 44

Resolution
verified exact
local_arxiv, observed 2026-08-08T21:39:25.781735Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.648035Z digest=sha256:9ad5b42ccaaeccc3c976e1d54cc605488c7d61291a42b290ed05212f9dd6ab50

Observation e12cb928-d601-47a0-8011-eef6aedd7644 · outbound

This paper cites Denoising Diffusion Implicit Models.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Denoising Diffusion Implicit Models

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-08T21:39:25.651910Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T21:39:25.651910Z digest=sha256:0aaa04e2a369397fe42a0dcbd19948f239f61ccb56c93aa1eca4dff9d09c128d

Observation 12923003-e385-4b6f-bb55-d39e222c8c7f · outbound

This paper cites P., Kumar, A., Ermon, S., and Poole, B.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning P., Kumar, A., Ermon, S., and Poole, B

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:25.997912Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.655700Z digest=sha256:eca122006438838eca7b909b72a1ca68fe1ece2e97c100b026ab2be285b35763

Observation fc90ed53-9798-4f62-a359-115ab0b45735 · outbound

This paper cites Model-bellman inconsistency for model-based offline reinforcement learning.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Model-bellman inconsistency for model-based offline reinforcement learning

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:25.985090Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.659464Z digest=sha256:39dbebe9a45badc15a49d3a7eb6ee818b5df1cde497eaa962a208b4ca9bac14f

Observation 0deb3fa4-a765-45e7-879c-5bb656c1ee06 · outbound

This paper cites Revisiting the minimalist approach to offline reinforcement learning.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Revisiting the minimalist approach to offline reinforcement learning

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:25.972769Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.663380Z digest=sha256:ef7f2d3d75babd0a4f08ed2629d323a9080703df922f8e2deca65d644e2ff8db

Observation 6a7b312c-2136-4f96-ac9f-92c5a6fa183b · outbound

This paper cites u l c ehre, C ., Wang, Z., Pfaff, T., Wu, Y., Ring, R., Yogatama, D., W \.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning u l c ehre, C ., Wang, Z., Pfaff, T., Wu, Y., Ring, R., Yogatama, D., W \

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:25.960325Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.668118Z digest=sha256:f388521d030d1037af38c313f015f031f641a18c529dd10704be181110483965

Observation f74a3fc4-8742-46bf-a6c5-5fb2c9610789 · outbound

This paper cites Diffusion Actor-Critic with Entropy Regulator.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Diffusion Actor-Critic with Entropy Regulator

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-08T21:39:25.671887Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T21:39:25.671887Z digest=sha256:983c92384295fffa7e094f47b65aa25e2426f8981524ac428534d2944f8fa958

Observation 21811e2c-1b44-417b-964e-aabb3a8bcf9d · outbound

This paper cites J., and Zhou, M.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning J., and Zhou, M

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:25.948582Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.675981Z digest=sha256:2eaec19c6f89f08b656931054820e44ca4762a146bedc49cba218df4344db406

Observation be9d06cb-4648-4afd-a9cc-bb7631d24d96 · outbound

This paper cites Behavior Regularized Offline Reinforcement Learning.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Behavior Regularized Offline Reinforcement Learning

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-08T21:39:25.679507Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T21:39:25.679507Z digest=sha256:d06af560f7623d2d946845ee1955e9c7206d029a6769bb8098cafd03e3dbd8e8

Observation b116c067-0d33-46ad-9624-7f6e1931f385 · outbound

This paper cites an unresolved cited work.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Unresolved cited work

Reference 53

Resolution
unresolved
raw_fallback, observed 2026-08-08T21:39:25.936656Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.684538Z digest=sha256:c517ac169e2135927e3d3fa423f97c7e295c58ba1f9de72c1ca771f3de34f843

Observation e7368061-06e8-4275-b81a-ebababd2b474 · outbound

This paper cites Y., Levine, S., Finn, C., and Ma, T.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Y., Levine, S., Finn, C., and Ma, T

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:25.925852Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.688330Z digest=sha256:296cb098def7ff7a86d68e81ea32f0129c38a619b139c91012589910eb863f1f

Observation ac17730c-5f5d-4ade-a23c-c3ba71707d40 · outbound

This paper cites o lund, J., Sch \.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning o lund, J., Sch \

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:25.914315Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.691914Z digest=sha256:5eaaa49bed50a4ddb03f629033248127ccd2bc632367909391d1ebebde48f9e7

Observation ca9867f4-94c7-4d95-ac1a-887376a72d61 · outbound

This paper cites Entropy-regularized Diffusion Policy with Q-Ensembles for Offline Reinforcement Learning.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Entropy-regularized Diffusion Policy with Q-Ensembles for Offline Reinforcement Learning

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-08T21:39:25.695375Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T21:39:25.695375Z digest=sha256:3d55639946eab6e587eecb80ed99f3d8b3330f7900b3bef3f9091553888ab930

Pith citing papers

Observation 2dff5418-ebe0-492d-be11-b3819b4cd23c · inbound

Decision Flow Policy Optimization cites this paper.

Decision Flow Policy Optimization Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T14:20:37.619351Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:20:37.619351Z digest=sha256:56ac72c727a83e0118453ef18ddfacfdae3007f2aa74b931b819c89368de6383

Observation 64bb61ce-4e78-461e-abf5-ab87c39ae074 · inbound

D2 Actor Critic: Diffusion Actor Meets Distributional Critic cites this paper.

D2 Actor Critic: Diffusion Actor Meets Distributional Critic Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning

Reference 10

Resolution
verified exact
arxiv_id, observed 2026-05-25T07:35:29.373696Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-25T07:31:27.330951Z digest=sha256:93ab6263e7689dbe9b758d9767da84eaaa20c1a0fe48e421d204c835316ad577

Observation 0223a517-9a63-446c-864c-802982f50c09 · inbound

Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning cites this paper.

Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning

Reference 68

Resolution
verified exact
arxiv_id, observed 2026-05-11T08:56:00.695725Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-05-10T16:25:25.739019Z digest=sha256:6afded3e274717e5d426d35e9d01ec9c087860692a7fe61bdadbf76504f4c2c3

Observation aeb489c3-3cea-402c-9aba-b3e92b38eb51 · inbound

ReBRAC-v2: The Return of the King cites this paper.

ReBRAC-v2: The Return of the King Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-06T00:32:46.502554Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T00:32:46.502554Z digest=sha256:3e83a249690654be2c8021cedd066a392fafb02c5e3eca2162d28190cf206783