Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-08T21:39:25.695375Z
Paper Citation Record · LEDGER
As of 9 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 4 inbound Pith citation observations for arXiv:2502.04778.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-08T21:39:25.695375Z
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links, observed 2026-08-07T14:20:37.619351Z
A source-named dated measurement, never combined with another source.
Source: arxiv_reference, observed 2026-05-25T07:35:29.370333Z
56 of 56 outbound references displayed
External citation measurements
No source-named external measurement is stored.
Observation bc0f9384-b69d-47e5-8df9-e3e8431593a4 · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning write newline
Reference 1
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b84becd1-6a52-45f9-9b6b-daf926ec93b4 · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning B., Jaakkola, T
Reference 2
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation dfa42f6d-da44-4b8a-bfdd-2a3b22071f04 · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning J., Mittal, S., Lemos, P., Liu, C., Sendera, M., Ravanbakhsh, S., Gidel, G., Bengio, Y., Malkin, N., and Tong, A
Reference 3
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation 6c35250c-f24c-4a6b-861f-18c5d50c6d09 · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Diffusion for World Modeling: Visual Details Matter in Atari
Reference 4
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1072c14c-59e1-4a7b-aae5-296ffb35572e · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Unresolved cited work
Reference 5
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation 1d150672-ea73-487e-b447-673d493ea98c · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Pessimistic bootstrapping for uncertainty-driven offline reinforcement learning
Reference 6
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation fc0daf05-356a-41eb-bb0a-c85c74093eef · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning OpenAI Gym
Reference 7
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ea94de36-52cd-4a73-bfc4-c66da9fa4931 · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Offline reinforcement learning via high-fidelity generative behavior modeling
Reference 8
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation a6a68adb-37a2-41b2-9119-71d28b172b20 · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Score regularized policy optimization through diffusion behavior
Reference 9
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation 57e40425-0256-4553-a9b5-24acb4847201 · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Decision transformer: Reinforcement learning via sequence modeling
Reference 10
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation 8cfc379a-7beb-4dde-b478-966e54f3f4e9 · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Diffusion Policies creating a Trust Region for Offline Reinforcement Learning
Reference 11
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 297a5d88-0833-4fa6-9b98-c16ed13bda4e · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Soft Actor-Critic for Discrete Action Settings
Reference 12
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c8cfc308-5b73-4999-aa3f-40b86b9361f0 · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Diffusion Actor-Critic: Formulating Constrained Policy Iteration as Diffusion Noise Regression for Offline Reinforcement Learning
Reference 13
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a9fcfcbd-3dc5-46d7-b40b-d39d6be4305c · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning MINDE : Mutual information neural diffusion estimation
Reference 14
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation 3b526906-b1df-4430-b892-c4c171b50159 · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning D4RL: Datasets for Deep Data-Driven Reinforcement Learning
Reference 15
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3ea32e31-4370-48a4-ad60-17dc9e5f4b71 · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning and Gu, S
Reference 16
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation 893e10de-8379-4a77-932b-41609f15d7ff · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Off-policy deep reinforcement learning without exploration
Reference 17
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation a131e68b-d2ef-4822-a1c2-b4092ef812dd · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning ACT: E mpowering decision transformer with dynamic programming via advantage conditioning
Reference 18
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation 8933c0cb-1265-4429-b3d7-9d991727cf07 · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Extreme Q -learning: Maxent RL without entropy
Reference 19
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation 87d3c4e6-a48c-449e-b1d5-e2e91eac6880 · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Reinforcement learning with deep energy-based policies
Reference 20
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation 9b6aa253-7da0-41f9-9064-cd530f39284c · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor
Reference 21
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation 0476a32b-af66-463f-af83-439ae49335d6 · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies
Reference 22
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 6f0af461-0752-476d-bdfa-b509f9389e1e · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Denoising diffusion probabilistic models
Reference 23
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d1f7e17c-4996-46bc-9512-482ef435367c · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning B., and Levine, S
Reference 24
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation 4d1e9c04-eff5-42b4-a217-0cf0ab6ceb2f · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Policy rehearsing: Training generalizable policies for reinforcement learning
Reference 25
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation 781b595f-004c-4a9d-bc45-b95e4325d212 · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Efficient diffusion policies for offline reinforcement learning
Reference 26
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation 71e36e3d-fac0-4ae3-9b70-1028d8767e87 · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Unresolved cited work
Reference 27
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 53b6fac2-9a12-4da2-84f8-57e5944d8ce5 · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Offline reinforcement learning with implicit Q -learning
Reference 28
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation e1cc3d49-6392-4708-a46f-affeae9f22d7 · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Stabilizing off-policy Q -learning via bootstrapping error reduction
Reference 29
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation c641b95e-c5ad-4fd7-9544-3517bf70f663 · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Discor: Corrective feedback in reinforcement learning via distribution correction
Reference 30
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation 51ce740c-7409-4a4b-8255-9c6e1161580a · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Conservative Q -learning for offline reinforcement learning
Reference 31
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation c7815ea6-a682-41b0-b5c0-036d49b26259 · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning A workflow for offline model-free robotic reinforcement learning
Reference 32
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation 1cde2db5-16d8-4f35-a57f-9e96c3e2716b · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems
Reference 33
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4b886aef-d99a-4b01-a54b-7142a95dcdad · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Contrastive energy prediction for exact energy-guided diffusion sampling in offline reinforcement learning
Reference 34
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation caacb572-96ff-4a65-8596-8579cef6728e · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Reward-consistent dynamics models are strongly generalizable for offline reinforcement learning
Reference 35
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation 8e866662-5be8-4814-b177-7f8278e0133f · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Diffusion-dice: In-sample diffusion guidance for offline reinforcement learning
Reference 36
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation 624a65ae-f6a5-4d00-8c00-0d3b0a80d40c · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Transformers are sample-efficient world models
Reference 37
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation bae1b81e-f0e5-4c4f-bcd4-adb9db0a3eed · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning AWAC: Accelerating Online Reinforcement Learning with Offline Datasets
Reference 38
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 63eb818a-630c-4515-9603-25909c71aa45 · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Stochastic differential equations: A n introduction with applications
Reference 39
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation 54f3f038-5cba-43ad-a08e-7609e51a2ef6 · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning L., Mishkin, P., Zhang, C., Agarwal, S., Slama, K., Ray, A., Schulman, J., Hilton, J., Kelton, F., Miller, L., Simens, M., Askell, A., Welinder, P., Christiano, P
Reference 40
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation db07950d-e13d-4d47-ac38-983814958828 · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Policy regularization with dataset constraint for offline reinforcement learning
Reference 41
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation 93daa91e-f9c6-478f-8296-ae05603a3a57 · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Diffusion Policy Policy Optimization
Reference 42
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0513c8f8-3910-405b-ac1f-b1a42b461c70 · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Proximal Policy Optimization Algorithms
Reference 43
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 6a4482d1-8038-4005-b420-c447c92c1d75 · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Diffusion Spectral Representation for Reinforcement Learning
Reference 44
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation e12cb928-d601-47a0-8011-eef6aedd7644 · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Denoising Diffusion Implicit Models
Reference 45
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 12923003-e385-4b6f-bb55-d39e222c8c7f · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning P., Kumar, A., Ermon, S., and Poole, B
Reference 46
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation fc90ed53-9798-4f62-a359-115ab0b45735 · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Model-bellman inconsistency for model-based offline reinforcement learning
Reference 47
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation 0deb3fa4-a765-45e7-879c-5bb656c1ee06 · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Revisiting the minimalist approach to offline reinforcement learning
Reference 48
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation 6a7b312c-2136-4f96-ac9f-92c5a6fa183b · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning u l c ehre, C ., Wang, Z., Pfaff, T., Wu, Y., Ring, R., Yogatama, D., W \
Reference 49
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation f74a3fc4-8742-46bf-a6c5-5fb2c9610789 · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Diffusion Actor-Critic with Entropy Regulator
Reference 50
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 21811e2c-1b44-417b-964e-aabb3a8bcf9d · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning J., and Zhou, M
Reference 51
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation be9d06cb-4648-4afd-a9cc-bb7631d24d96 · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Behavior Regularized Offline Reinforcement Learning
Reference 52
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b116c067-0d33-46ad-9624-7f6e1931f385 · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Unresolved cited work
Reference 53
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation e7368061-06e8-4275-b81a-ebababd2b474 · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Y., Levine, S., Finn, C., and Ma, T
Reference 54
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation ac17730c-5f5d-4ade-a23c-c3ba71707d40 · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning o lund, J., Sch \
Reference 55
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation ca9867f4-94c7-4d95-ac1a-887376a72d61 · outbound
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Entropy-regularized Diffusion Policy with Q-Ensembles for Offline Reinforcement Learning
Reference 56
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 2dff5418-ebe0-492d-be11-b3819b4cd23c · inbound
Decision Flow Policy Optimization Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning
Reference 28
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 64bb61ce-4e78-461e-abf5-ab87c39ae074 · inbound
D2 Actor Critic: Diffusion Actor Meets Distributional Critic Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning
Reference 10
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation 0223a517-9a63-446c-864c-802982f50c09 · inbound
Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning
Reference 68
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation aeb489c3-3cea-402c-9aba-b3e92b38eb51 · inbound
ReBRAC-v2: The Return of the King Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning
Reference 78
Source-reported events for the cited work
Unavailable: canonical work link unavailable.