Pith. sign in

Paper Citation Record · LEDGER

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning

As of 9 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 4 inbound Pith citation observations for arXiv:2502.04778.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2502.04778 v2

Coverage vector

measured 56 of 56 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-08T21:39:25.695375Z

measured 60 of 60 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 4 of 4 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T14:20:37.619351Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-25T07:35:29.370333Z

Reference resolution

56 of 56 outbound references displayed

  • verified exact1
  • verified fuzzy35
  • unresolved20
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation bc0f9384-b69d-47e5-8df9-e3e8431593a4 · outbound

This paper cites write newline.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning write newline

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-08T21:39:25.474805Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T21:39:25.474805Z digest=sha256:db5d5a757308a028b8b19f2d1efccf649eabf8c531e81e44cb840f9f3e59d52a

Observation b84becd1-6a52-45f9-9b6b-daf926ec93b4 · outbound

This paper cites B., Jaakkola, T.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning B., Jaakkola, T

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.344765Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.480286Z digest=sha256:2bce5458ba1cf3443065ee86050d9d1bb7c38727a1315c86008c7d4c5abac3c1

Observation dfa42f6d-da44-4b8a-bfdd-2a3b22071f04 · outbound

This paper cites J., Mittal, S., Lemos, P., Liu, C., Sendera, M., Ravanbakhsh, S., Gidel, G., Bengio, Y., Malkin, N., and Tong, A.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning J., Mittal, S., Lemos, P., Liu, C., Sendera, M., Ravanbakhsh, S., Gidel, G., Bengio, Y., Malkin, N., and Tong, A

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.334319Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.486379Z digest=sha256:28b3ddf37ce0203b8d9e68c6888383690e1cf8b7e01424bbefac2d114469d7ee

Observation 6c35250c-f24c-4a6b-861f-18c5d50c6d09 · outbound

This paper cites Diffusion for World Modeling: Visual Details Matter in Atari.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Diffusion for World Modeling: Visual Details Matter in Atari

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-08T21:39:25.490636Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T21:39:25.490636Z digest=sha256:612ff109aded9ca53028b0827e2ed831b5df014a9fd698e2d20f6e091c5cec2e

Observation 1072c14c-59e1-4a7b-aae5-296ffb35572e · outbound

This paper cites an unresolved cited work.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Unresolved cited work

Reference 5

Resolution
unresolved
raw_fallback, observed 2026-08-08T21:39:26.323208Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.495286Z digest=sha256:40744386e1848c68e88379d29faa959307f884f7f33e7e2cdaa81db03cbb8c70

Observation 1d150672-ea73-487e-b447-673d493ea98c · outbound

This paper cites Pessimistic bootstrapping for uncertainty-driven offline reinforcement learning.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Pessimistic bootstrapping for uncertainty-driven offline reinforcement learning

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.311997Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.500394Z digest=sha256:e767ae45033822e71931b3b2edd992adb0fee385fdbc8e420231d51e8d968c62

Observation fc0daf05-356a-41eb-bb0a-c85c74093eef · outbound

This paper cites OpenAI Gym.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning OpenAI Gym

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-08T21:39:25.504501Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T21:39:25.504501Z digest=sha256:77e7f8d5a9e1e860abc79483e572ab82d7fb699143bb5058ba00590bc1bd9de0

Observation ea94de36-52cd-4a73-bfc4-c66da9fa4931 · outbound

This paper cites Offline reinforcement learning via high-fidelity generative behavior modeling.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Offline reinforcement learning via high-fidelity generative behavior modeling

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.300746Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.509341Z digest=sha256:395569f6d47efd642a10af4e696624a86924c3cbf56e51aed78e885caf4ee101

Observation a6a68adb-37a2-41b2-9119-71d28b172b20 · outbound

This paper cites Score regularized policy optimization through diffusion behavior.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Score regularized policy optimization through diffusion behavior

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.289147Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.513147Z digest=sha256:ad59973eeeaef8920a6841ea40928cd1b12d4ac3ebd1f20c36920084379a59cf

Observation 57e40425-0256-4553-a9b5-24acb4847201 · outbound

This paper cites Decision transformer: Reinforcement learning via sequence modeling.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Decision transformer: Reinforcement learning via sequence modeling

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.277563Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.517080Z digest=sha256:08989de8884c5dfb0e4f23cadb115802441dcb31ad0f2aa5d62d3e42c4081b2b

Observation 8cfc379a-7beb-4dde-b478-966e54f3f4e9 · outbound

This paper cites Diffusion Policies creating a Trust Region for Offline Reinforcement Learning.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Diffusion Policies creating a Trust Region for Offline Reinforcement Learning

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-08T21:39:25.521307Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T21:39:25.521307Z digest=sha256:f96d4d9be9fe0a1d472fdd05661a3985a132e21c2c199858ce805cf880ea552e

Observation 297a5d88-0833-4fa6-9b98-c16ed13bda4e · outbound

This paper cites Soft Actor-Critic for Discrete Action Settings.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Soft Actor-Critic for Discrete Action Settings

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-08T21:39:25.525912Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T21:39:25.525912Z digest=sha256:830d500d2f1da4b45a843064f104dbfd993b11dc6d3195e664883178c2b17f65

Observation c8cfc308-5b73-4999-aa3f-40b86b9361f0 · outbound

This paper cites Diffusion Actor-Critic: Formulating Constrained Policy Iteration as Diffusion Noise Regression for Offline Reinforcement Learning.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Diffusion Actor-Critic: Formulating Constrained Policy Iteration as Diffusion Noise Regression for Offline Reinforcement Learning

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-08T21:39:25.530151Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T21:39:25.530151Z digest=sha256:77d607ef6feb36f203732f4799f4a12a489be0771c4358764d20ca23315d9ac4

Observation a9fcfcbd-3dc5-46d7-b40b-d39d6be4305c · outbound

This paper cites MINDE : Mutual information neural diffusion estimation.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning MINDE : Mutual information neural diffusion estimation

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.266493Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.534070Z digest=sha256:05f6a2d91bf217806f123dddd3633beacaa1a84aa4811ebff50040084ee93168

Observation 3b526906-b1df-4430-b892-c4c171b50159 · outbound

This paper cites D4RL: Datasets for Deep Data-Driven Reinforcement Learning.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-08T21:39:25.537582Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T21:39:25.537582Z digest=sha256:a21166d35f4093f75038226b84894dfc64d097cd7a99d23506d80f74ff009b65

Observation 3ea32e31-4370-48a4-ad60-17dc9e5f4b71 · outbound

This paper cites and Gu, S.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning and Gu, S

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.255012Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.542267Z digest=sha256:ae5c8bc67d914b2fb492d046aa7d3beccc68d1c216be1b96ab45981c9dbf40de

Observation 893e10de-8379-4a77-932b-41609f15d7ff · outbound

This paper cites Off-policy deep reinforcement learning without exploration.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Off-policy deep reinforcement learning without exploration

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.243172Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.545894Z digest=sha256:14ac4bcceddac0327e42250e7e3d2e4ebd873a73e8002f9a06b1816a054df37c

Observation a131e68b-d2ef-4822-a1c2-b4092ef812dd · outbound

This paper cites ACT: E mpowering decision transformer with dynamic programming via advantage conditioning.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning ACT: E mpowering decision transformer with dynamic programming via advantage conditioning

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.232056Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.549400Z digest=sha256:9ec204c721f80a9ba1d137ccdc2839b420abc5f04daf70d02efd36d1f92b7255

Observation 8933c0cb-1265-4429-b3d7-9d991727cf07 · outbound

This paper cites Extreme Q -learning: Maxent RL without entropy.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Extreme Q -learning: Maxent RL without entropy

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.220737Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.553170Z digest=sha256:ab7328025ec1b47e1f3738c57d08203b1d2d47879b49bd68da22d2fddb486906

Observation 87d3c4e6-a48c-449e-b1d5-e2e91eac6880 · outbound

This paper cites Reinforcement learning with deep energy-based policies.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Reinforcement learning with deep energy-based policies

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.208420Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.556765Z digest=sha256:2276efd022dc1c43759a5984abdd49e41c72eadc2caeb39010a19936a0527f5c

Observation 9b6aa253-7da0-41f9-9064-cd530f39284c · outbound

This paper cites Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.196891Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.560459Z digest=sha256:9d855c604d531e21072267fb31f4e2ed8989805376ba3e1ebae152635dbc7b17

Observation 0476a32b-af66-463f-af83-439ae49335d6 · outbound

This paper cites IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-08T21:39:25.563951Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T21:39:25.563951Z digest=sha256:a0719ebe19e10b28e95437aa0797fcaaa255dd45164c921f05cfcbcf7b193ac2

Observation 6f0af461-0752-476d-bdfa-b509f9389e1e · outbound

This paper cites Denoising diffusion probabilistic models.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Denoising diffusion probabilistic models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-08T21:39:25.567961Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T21:39:25.567961Z digest=sha256:bee153bfa31ced194169be6dd7c8c3efff85544a7eac5d7b371f4a6b058563f4

Observation d1f7e17c-4996-46bc-9512-482ef435367c · outbound

This paper cites B., and Levine, S.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning B., and Levine, S

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.177193Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.571512Z digest=sha256:6a2dcd014b3af744f67430cee382da19d4dd7fa432359b2ef5cdc9280c1ebcbb

Observation 4d1e9c04-eff5-42b4-a217-0cf0ab6ceb2f · outbound

This paper cites Policy rehearsing: Training generalizable policies for reinforcement learning.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Policy rehearsing: Training generalizable policies for reinforcement learning

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.165466Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.574956Z digest=sha256:1814f5bdd47752cb55fa595e57032f7219e984a003e19d30be6ad7b19f9c6cd9

Observation 781b595f-004c-4a9d-bc45-b95e4325d212 · outbound

This paper cites Efficient diffusion policies for offline reinforcement learning.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Efficient diffusion policies for offline reinforcement learning

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.153787Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.578415Z digest=sha256:03afd314dc45af992f79b73f1c336bfe0384c73275f94a5393bb957f7510e252

Observation 71e36e3d-fac0-4ae3-9b70-1028d8767e87 · outbound

This paper cites an unresolved cited work.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Unresolved cited work

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-08T21:39:25.582232Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T21:39:25.582232Z digest=sha256:8e0fd2142302da7675a6c926aafbb3fb8aa2a99e80dfb3d9a116e1de9b56b8a5

Observation 53b6fac2-9a12-4da2-84f8-57e5944d8ce5 · outbound

This paper cites Offline reinforcement learning with implicit Q -learning.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Offline reinforcement learning with implicit Q -learning

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.136104Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.585841Z digest=sha256:79ac716930f1567d73365bd64dc7f8ac706a0ff499b69ecd27d240286b810565

Observation e1cc3d49-6392-4708-a46f-affeae9f22d7 · outbound

This paper cites Stabilizing off-policy Q -learning via bootstrapping error reduction.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Stabilizing off-policy Q -learning via bootstrapping error reduction

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.124689Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.589399Z digest=sha256:6616670c30f81880b42f6cc94500b31eaf639bae3f6fca6f0076a2aad8848aee

Observation c641b95e-c5ad-4fd7-9544-3517bf70f663 · outbound

This paper cites Discor: Corrective feedback in reinforcement learning via distribution correction.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Discor: Corrective feedback in reinforcement learning via distribution correction

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.113331Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.593156Z digest=sha256:8dd8bab87cdccd0bfc59891b3a46ca05857e15c1683d1653f34f021c5c5fb0cd

Observation 51ce740c-7409-4a4b-8255-9c6e1161580a · outbound

This paper cites Conservative Q -learning for offline reinforcement learning.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Conservative Q -learning for offline reinforcement learning

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.101697Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.596808Z digest=sha256:394a85e2bfb31b33636f5ec2f04b90af00635ac4379243a31cc9d7d425b9dd3a

Observation c7815ea6-a682-41b0-b5c0-036d49b26259 · outbound

This paper cites A workflow for offline model-free robotic reinforcement learning.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning A workflow for offline model-free robotic reinforcement learning

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.091194Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.600674Z digest=sha256:2dec6b604da3bd5e3ad6f8c5c4820161270772448d580ea3d20655ad26001a39

Observation 1cde2db5-16d8-4f35-a57f-9e96c3e2716b · outbound

This paper cites Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-08T21:39:25.604336Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T21:39:25.604336Z digest=sha256:d8031fd753563cea68e3a9d0f4c7dcb0ec6687135a721bf2b1921784601d3097

Observation 4b886aef-d99a-4b01-a54b-7142a95dcdad · outbound

This paper cites Contrastive energy prediction for exact energy-guided diffusion sampling in offline reinforcement learning.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Contrastive energy prediction for exact energy-guided diffusion sampling in offline reinforcement learning

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.080529Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.608204Z digest=sha256:c682fd9ae1ce7beab1229f64cd603535282be329341e7a48530b3edf92aa2696

Observation caacb572-96ff-4a65-8596-8579cef6728e · outbound

This paper cites Reward-consistent dynamics models are strongly generalizable for offline reinforcement learning.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Reward-consistent dynamics models are strongly generalizable for offline reinforcement learning

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.068770Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.612219Z digest=sha256:7e3c9a9025390270fa3883cd11628bc04d5e3e6de0a8a988fcd317c829e39b8d

Observation 8e866662-5be8-4814-b177-7f8278e0133f · outbound

This paper cites Diffusion-dice: In-sample diffusion guidance for offline reinforcement learning.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Diffusion-dice: In-sample diffusion guidance for offline reinforcement learning

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.056675Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.616963Z digest=sha256:3c29d305c61dbb79bc5e083cf60b27bd59ca43de7a55b3b0c4c35edbf7d02b6c

Observation 624a65ae-f6a5-4d00-8c00-0d3b0a80d40c · outbound

This paper cites Transformers are sample-efficient world models.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Transformers are sample-efficient world models

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.045165Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.620524Z digest=sha256:1da229384f18ff5a2d03b39bcf469a21d9a643498ba08515e801786bfb11c96a

Observation bae1b81e-f0e5-4c4f-bcd4-adb9db0a3eed · outbound

This paper cites AWAC: Accelerating Online Reinforcement Learning with Offline Datasets.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning AWAC: Accelerating Online Reinforcement Learning with Offline Datasets

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-08T21:39:25.624076Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T21:39:25.624076Z digest=sha256:a9f433ed3dccbf26feaced41a6a7df81bf1ab88bae03df06a4a3b166f9402ce1

Observation 63eb818a-630c-4515-9603-25909c71aa45 · outbound

This paper cites Stochastic differential equations: A n introduction with applications.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Stochastic differential equations: A n introduction with applications

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.033192Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.627908Z digest=sha256:92f2ca4185346de5b8135891e089e39af6a09594c9c8294cd21019d1e00f8d93

Observation 54f3f038-5cba-43ad-a08e-7609e51a2ef6 · outbound

This paper cites L., Mishkin, P., Zhang, C., Agarwal, S., Slama, K., Ray, A., Schulman, J., Hilton, J., Kelton, F., Miller, L., Simens, M., Askell, A., Welinder, P., Christiano, P.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning L., Mishkin, P., Zhang, C., Agarwal, S., Slama, K., Ray, A., Schulman, J., Hilton, J., Kelton, F., Miller, L., Simens, M., Askell, A., Welinder, P., Christiano, P

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.021798Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.631693Z digest=sha256:f6704875bfcb6d19acd7941139df96a572957c3d2f31cb86142b5fb8bb6209a2

Observation db07950d-e13d-4d47-ac38-983814958828 · outbound

This paper cites Policy regularization with dataset constraint for offline reinforcement learning.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Policy regularization with dataset constraint for offline reinforcement learning

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:26.009687Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.635262Z digest=sha256:6be9ecf6298d45342dff61bef8f2567970d675d2b972c48b4a8c01a0e6bf1975

Observation 93daa91e-f9c6-478f-8296-ae05603a3a57 · outbound

This paper cites Diffusion Policy Policy Optimization.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Diffusion Policy Policy Optimization

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-08T21:39:25.638952Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T21:39:25.638952Z digest=sha256:930ffb781becd9e41724e69a730ea120485f3f4c7c3e01fd31b5060261516d25

Observation 0513c8f8-3910-405b-ac1f-b1a42b461c70 · outbound

This paper cites Proximal Policy Optimization Algorithms.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Proximal Policy Optimization Algorithms

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-08T21:39:25.643121Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T21:39:25.643121Z digest=sha256:1b721a80fe428de227b10f228459ebf46527a0ad2a5c53a80c9e55be9e315455

Observation 6a4482d1-8038-4005-b420-c447c92c1d75 · outbound

This paper cites Diffusion Spectral Representation for Reinforcement Learning.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Diffusion Spectral Representation for Reinforcement Learning

Reference 44

Resolution
verified exact
local_arxiv, observed 2026-08-08T21:39:25.781735Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.648035Z digest=sha256:0c0547672f8f6fb8465f82f760f6764ad701f5d74476875a688c2b79bfbfe7a1

Observation e12cb928-d601-47a0-8011-eef6aedd7644 · outbound

This paper cites Denoising Diffusion Implicit Models.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Denoising Diffusion Implicit Models

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-08T21:39:25.651910Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T21:39:25.651910Z digest=sha256:0aaa04e2a369397fe42a0dcbd19948f239f61ccb56c93aa1eca4dff9d09c128d

Observation 12923003-e385-4b6f-bb55-d39e222c8c7f · outbound

This paper cites P., Kumar, A., Ermon, S., and Poole, B.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning P., Kumar, A., Ermon, S., and Poole, B

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:25.997912Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.655700Z digest=sha256:6a562ed8972684a2fdce573b001bf75416ae15644116c40b59abf653a4dfc1bb

Observation fc90ed53-9798-4f62-a359-115ab0b45735 · outbound

This paper cites Model-bellman inconsistency for model-based offline reinforcement learning.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Model-bellman inconsistency for model-based offline reinforcement learning

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:25.985090Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.659464Z digest=sha256:33048efc6d933d1a278780e18acda8bde0faa0d18d92667d7f9eb525c3b0b95f

Observation 0deb3fa4-a765-45e7-879c-5bb656c1ee06 · outbound

This paper cites Revisiting the minimalist approach to offline reinforcement learning.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Revisiting the minimalist approach to offline reinforcement learning

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:25.972769Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.663380Z digest=sha256:5c1f3dc747dc53ac7b561c9d5c282ebc7250b4ce4d733c89494655b3df565dfa

Observation 6a7b312c-2136-4f96-ac9f-92c5a6fa183b · outbound

This paper cites u l c ehre, C ., Wang, Z., Pfaff, T., Wu, Y., Ring, R., Yogatama, D., W \.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning u l c ehre, C ., Wang, Z., Pfaff, T., Wu, Y., Ring, R., Yogatama, D., W \

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:25.960325Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.668118Z digest=sha256:c5135c60a02c2f0fe51b408833dd0b81d319b38dfb4dbd9c1254576c630b936d

Observation f74a3fc4-8742-46bf-a6c5-5fb2c9610789 · outbound

This paper cites Diffusion Actor-Critic with Entropy Regulator.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Diffusion Actor-Critic with Entropy Regulator

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-08T21:39:25.671887Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T21:39:25.671887Z digest=sha256:983c92384295fffa7e094f47b65aa25e2426f8981524ac428534d2944f8fa958

Observation 21811e2c-1b44-417b-964e-aabb3a8bcf9d · outbound

This paper cites J., and Zhou, M.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning J., and Zhou, M

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:25.948582Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.675981Z digest=sha256:c7575b443879c1d8d0a6f856853aca7320b89f54895f2cdf1c6bbc7f12da8c9f

Observation be9d06cb-4648-4afd-a9cc-bb7631d24d96 · outbound

This paper cites Behavior Regularized Offline Reinforcement Learning.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Behavior Regularized Offline Reinforcement Learning

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-08T21:39:25.679507Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T21:39:25.679507Z digest=sha256:d06af560f7623d2d946845ee1955e9c7206d029a6769bb8098cafd03e3dbd8e8

Observation b116c067-0d33-46ad-9624-7f6e1931f385 · outbound

This paper cites an unresolved cited work.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Unresolved cited work

Reference 53

Resolution
unresolved
raw_fallback, observed 2026-08-08T21:39:25.936656Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.684538Z digest=sha256:db32ebc0a54bc59e1b695004cfee4580b16b0752119e74240cee8b36b2776b53

Observation e7368061-06e8-4275-b81a-ebababd2b474 · outbound

This paper cites Y., Levine, S., Finn, C., and Ma, T.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Y., Levine, S., Finn, C., and Ma, T

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:25.925852Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.688330Z digest=sha256:448075ab5a658b59cfde7d3c791adb627f1bb050a91eec1e03a3029fa29ffc55

Observation ac17730c-5f5d-4ade-a23c-c3ba71707d40 · outbound

This paper cites o lund, J., Sch \.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning o lund, J., Sch \

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T21:39:25.914315Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-08T21:39:25.691914Z digest=sha256:927e565df218491b47fd719319ee682111c189f08e2d9b5e057f7277ddc5150c

Observation ca9867f4-94c7-4d95-ac1a-887376a72d61 · outbound

This paper cites Entropy-regularized Diffusion Policy with Q-Ensembles for Offline Reinforcement Learning.

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning Entropy-regularized Diffusion Policy with Q-Ensembles for Offline Reinforcement Learning

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-08T21:39:25.695375Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T21:39:25.695375Z digest=sha256:3d55639946eab6e587eecb80ed99f3d8b3330f7900b3bef3f9091553888ab930

Pith citing papers

Observation 2dff5418-ebe0-492d-be11-b3819b4cd23c · inbound

Decision Flow Policy Optimization cites this paper.

Decision Flow Policy Optimization Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T14:20:37.619351Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:20:37.619351Z digest=sha256:56ac72c727a83e0118453ef18ddfacfdae3007f2aa74b931b819c89368de6383

Observation 64bb61ce-4e78-461e-abf5-ab87c39ae074 · inbound

D2 Actor Critic: Diffusion Actor Meets Distributional Critic cites this paper.

D2 Actor Critic: Diffusion Actor Meets Distributional Critic Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning

Reference 10

Resolution
verified exact
arxiv_id, observed 2026-05-25T07:35:29.373696Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-25T07:31:27.330951Z digest=sha256:dca766e6c0ed0d18b8a4e001303cfc2c3f48f7decfa154a544689079222eae75

Observation 0223a517-9a63-446c-864c-802982f50c09 · inbound

Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning cites this paper.

Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning

Reference 68

Resolution
verified exact
arxiv_id, observed 2026-05-11T08:56:00.695725Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-05-10T16:25:25.739019Z digest=sha256:e4ea6897adff38caa5afca5e070b5f11f5b1b63bc5b7fb811fb279b8d4efd938

Observation aeb489c3-3cea-402c-9aba-b3e92b38eb51 · inbound

ReBRAC-v2: The Return of the King cites this paper.

ReBRAC-v2: The Return of the King Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-06T00:32:46.502554Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T00:32:46.502554Z digest=sha256:3e83a249690654be2c8021cedd066a392fafb02c5e3eca2162d28190cf206783