{"as_of":"2026-08-10T17:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:273eb68627961b506e298b16ac50b9f7e872773df60bd6133bbc687efb137728","coverage":[{"denominator":79,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T12:38:14.369887Z","state":"measured"},{"denominator":88,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":88,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T19:28:41.716079Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T08:59:43.293825Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02316","snapshot_observed_at":"2026-08-09T19:28:41.716079Z","title":"Dime: Diffusion-based maximum entropy reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.00361","last_updated":"2025-06-30T03:48:44Z","snapshot_observed_at":"2026-08-10T07:59:12.895663Z","submitted_at":"2025-02-01T07:55:06Z","title":"Efficient Online Reinforcement Learning for Diffusion Policy","version":4},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T19:28:41.716079Z"},"links":{"cited_paper":"/paper/2502.02316","citing_paper":"/paper/2502.00361"},"observation_digest":"sha256:81e6f5affaf66ff6b9d58ae45b46331da5ce308236fc89883aa423afbe6cd690","observation_id":"716b42f4-aae2-4756-8cff-99c54aa377b6","resolution":{"observed_at":"2026-08-09T19:28:41.716079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02316","snapshot_observed_at":"2026-08-08T13:21:18.155791Z","title":"Dime: Diffusion-based maximum entropy reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-10T00:30:36.402261Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.155791Z"},"links":{"cited_paper":"/paper/2502.02316","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:6d13fef8f980b93c77da71a22992735aa933c66c23e9843f0b36250ce9fb10dc","observation_id":"4f41f3bf-524c-4d7d-b5ec-4ce13f26c927","resolution":{"observed_at":"2026-08-08T13:21:18.155791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02316","snapshot_observed_at":"2026-08-05T19:28:32.623166Z","title":"Celik, Z","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12518","last_updated":"2025-08-17T22:51:27Z","snapshot_observed_at":"2026-08-09T11:34:43.360867Z","submitted_at":"2025-08-17T22:51:27Z","title":"Towards Adaptive External Communication in Autonomous Vehicles: A Conceptual Design Framework","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T19:28:32.623166Z"},"links":{"cited_paper":"/paper/2502.02316","citing_paper":"/paper/2508.12518"},"observation_digest":"sha256:8c81599697bffb43c40e08cacae2de2ded5b509293337eff7d80518c4481e9fe","observation_id":"196e2f66-e015-4103-afdd-e02e0063ebff","resolution":{"observed_at":"2026-08-05T19:28:32.623166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2502.02316","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02316","snapshot_observed_at":"2026-07-04T08:59:43.293825Z","title":"Dime: Diffusion-based maximum entropy reinforcement learning","venue":null,"work_id":"360df73d-5d61-44db-8b55-60cfb34e08c3","year":2025},"citing_paper":{"arxiv_id":"2509.22963","last_updated":"2026-05-19T22:38:20Z","snapshot_observed_at":"2026-08-02T17:56:37.590404Z","submitted_at":"2025-09-26T21:53:36Z","title":"Reinforcement Learning with Discrete Diffusion Policies for Combinatorial Action Spaces","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-21T21:14:54.053177Z"},"links":{"cited_paper":"/paper/2502.02316","citing_paper":"/paper/2509.22963"},"observation_digest":"sha256:2879d96d695c4b81331fd88c871b4b40e5d3acca166b38f6c1f51a4f1b28c23f","observation_id":"8d1c6be2-7ef3-4375-abe0-0e9490bfdf28","resolution":{"observed_at":"2026-05-21T21:15:38.660604Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02316","snapshot_observed_at":"2026-08-03T19:12:08.549060Z","title":"Dime: Diffusion-based maximum entropy reinforcement learning.arXiv preprint arXiv:2502.02316,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.02019","last_updated":"2026-05-27T14:04:49Z","snapshot_observed_at":"2026-08-06T05:52:47.440878Z","submitted_at":"2025-12-01T18:59:58Z","title":"Diffusion-Augmented Markov Decision Processes for Maximum Entropy Reinforcement Learning","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-03T19:12:08.549060Z"},"links":{"cited_paper":"/paper/2502.02316","citing_paper":"/paper/2512.02019"},"observation_digest":"sha256:9a79bf69b40ff4173c059ecea71ceaaa21a6df4c563097b9f027da8983a124f3","observation_id":"05f10b2f-7194-469d-bc18-beb18aa47576","resolution":{"observed_at":"2026-08-03T19:12:08.549060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2502.02316","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02316","snapshot_observed_at":"2026-07-04T08:59:43.293825Z","title":"Dime: Diffusion-based maximum entropy reinforcement learning","venue":null,"work_id":"360df73d-5d61-44db-8b55-60cfb34e08c3","year":2025},"citing_paper":{"arxiv_id":"2603.04333","last_updated":"2026-05-08T20:08:31Z","snapshot_observed_at":"2026-07-31T16:31:42.095039Z","submitted_at":"2026-03-04T17:51:30Z","title":"What Does Flow Matching Bring To TD Learning?","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T16:32:29.432272Z"},"links":{"cited_paper":"/paper/2502.02316","citing_paper":"/paper/2603.04333"},"observation_digest":"sha256:dd6f39b5fddc138c8968195bf6262670c5a6fda7f87c56c9152bbf2d33ec7bd6","observation_id":"381c37d3-3f20-4a73-ad9e-f78ea0c83536","resolution":{"observed_at":"2026-05-15T16:36:17.860115Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02316","snapshot_observed_at":"2026-07-14T23:47:45.866615Z","title":"Dime: Diffusion-based maximum entropy reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.10250","last_updated":"2026-05-24T03:43:13Z","snapshot_observed_at":"2026-08-10T03:59:08.325902Z","submitted_at":"2026-03-10T22:01:13Z","title":"GeMPO: Generalized Measure Matching for Online Diffusion Reinforcement Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T23:47:45.866615Z"},"links":{"cited_paper":"/paper/2502.02316","citing_paper":"/paper/2603.10250"},"observation_digest":"sha256:2f6085fb68864f3cc5e4456f9ece7bc851c04385e08e821828db29a5a7b0381b","observation_id":"7cac92bc-43fa-43a4-be54-8d13bcb37acb","resolution":{"observed_at":"2026-07-14T23:47:45.866615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2502.02316","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02316","snapshot_observed_at":"2026-07-04T08:59:43.293825Z","title":"Dime: Diffusion-based maximum entropy reinforcement learning","venue":null,"work_id":"360df73d-5d61-44db-8b55-60cfb34e08c3","year":2025},"citing_paper":{"arxiv_id":"2606.06967","last_updated":"2026-06-05T06:54:09Z","snapshot_observed_at":"2026-07-06T23:46:42.693840Z","submitted_at":"2026-06-05T06:54:09Z","title":"GenPO++: Generative Policy Optimization with Jacobian-free Likelihood Ratios","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T22:47:10.062975Z"},"links":{"cited_paper":"/paper/2502.02316","citing_paper":"/paper/2606.06967"},"observation_digest":"sha256:3bcc0f09a0dcc05202c627c524dc80e79d36c2eba1b5005c6c442da0a9474161","observation_id":"ced346c7-6915-4d10-92b2-1a7f1e1466dc","resolution":{"observed_at":"2026-07-02T16:27:08.518956Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2502.02316","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02316","snapshot_observed_at":"2026-07-04T08:59:43.293825Z","title":"Dime: Diffusion-based maximum entropy reinforcement learning","venue":null,"work_id":"360df73d-5d61-44db-8b55-60cfb34e08c3","year":2025},"citing_paper":{"arxiv_id":"2606.22630","last_updated":"2026-06-21T18:32:25Z","snapshot_observed_at":"2026-08-01T19:14:01.648100Z","submitted_at":"2026-06-21T18:32:25Z","title":"Scalable Maximum Entropy Reinforcement Learning for Diffusion Policies via Adjoint Matching","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T10:38:05.185415Z"},"links":{"cited_paper":"/paper/2502.02316","citing_paper":"/paper/2606.22630"},"observation_digest":"sha256:feaa0c2a453cfd417f9643e404cc4ee7e55a7f9bc5139dd607e64f7c5c255dc3","observation_id":"7de4cdf8-7b7b-45db-a400-1f8dc992d368","resolution":{"observed_at":"2026-07-04T08:59:43.295757Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.02316/citation-record","integrity":"/paper/2502.02316/integrity","json":"/paper/2502.02316/citation-record.json","paper":"/paper/2502.02316"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.087464Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.087464Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:677c8e43233682f733082413544269a8a3a205cb5f94a01c72e546867cbc6fe4","observation_id":"203afd33-f713-4722-bd17-58eab248641f","resolution":{"observed_at":"2026-08-09T12:38:14.087464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:15.178978Z","title":null,"venue":null,"work_id":"d14b21ac-1d74-45a2-845a-4250e1ce3b92","year":2004},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.093314Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:a76436db1a1028b9109d57fcc29fe8395acceee05053be993f1fa00b32408fa6","observation_id":"0b88acfd-b643-49d0-81f6-9cd71d0fb879","resolution":{"observed_at":"2026-08-09T12:38:15.182823Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.097793Z","title":"S., Courville, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.097793Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:2cb37e2248b7f991597da2ac44bf57256683ea6df13c136a29f82a3a3f0722eb","observation_id":"ee4f3bbf-ae68-44f5-bb53-dff5915592a1","resolution":{"observed_at":"2026-08-09T12:38:14.097793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06121","last_updated":"2024-06-26T04:14:13Z","snapshot_observed_at":"2026-08-08T00:56:43.048886Z","submitted_at":"2024-02-09T01:11:23Z","title":"Iterated Denoising Energy Matching for Sampling from Boltzmann Densities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06121","snapshot_observed_at":"2026-08-09T12:38:14.101529Z","title":"J., Mittal, S., Lemos, P., Liu, C.-H., Sendera, M., Ravanbakhsh, S., Gidel, G., Bengio, Y., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.101529Z"},"links":{"cited_paper":"/paper/2402.06121","citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:eff2a07e214d4acb779591aa71701a629289ce8ce72a3dc89396a80576fcf3f5","observation_id":"3a48d042-edd4-4ae0-9f7f-5076055408ed","resolution":{"observed_at":"2026-08-09T12:38:14.101529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.105807Z","title":null,"venue":null,"work_id":null,"year":1982},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.105807Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:104078eefb1454cf976fd83dc825b32bc9b4cba3e3d42c97de258435e28c585e","observation_id":"1ec41a2f-6a9f-44b1-9967-682e6019bcb6","resolution":{"observed_at":"2026-08-09T12:38:14.105807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:15.150324Z","title":"Efficient gradient-free variational inference using policy search","venue":null,"work_id":"d2ba2b91-7e59-4a41-b5ef-4a3745bb5fe6","year":2018},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.109558Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:41c6722989e2ab45dbc63dc83bfa1323f95317332efdde5c33f6fd7527a27200","observation_id":"acf952e3-931d-467a-b8c5-3b34a8ce8f42","resolution":{"observed_at":"2026-08-09T12:38:15.154632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.113362Z","title":"G., Dabney, W., and Munos, R","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.113362Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:2bf16de3ecc79a4f4aad449fa3bbda8e0f933f00123bfe6e07f03fb2245c3c96","observation_id":"0a0eb642-e926-44f4-b258-70818517bb84","resolution":{"observed_at":"2026-08-09T12:38:14.113362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:15.131086Z","title":"An optimal control perspective on diffusion-based generative modeling","venue":null,"work_id":"c8a8c5a8-3d98-46fe-ae30-b6533e2f5ea8","year":null},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.117266Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:c37299e3b936575b070bd4a4cd62cfbf0760a683306e854d3fdbbb2bd2fb6b0b","observation_id":"1e46971f-fe93-4dee-908a-e3e3943f2acc","resolution":{"observed_at":"2026-08-09T12:38:15.134988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:15.119581Z","title":"Crossq: Batch normalization in deep reinforcement learning for greater sample efficiency and simplicity","venue":null,"work_id":"1e2d3e2d-ec32-470f-b054-7ba09ded8907","year":2024},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.120792Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:dd1f4b65374202904da1d0a1e6d8e4533148ccca51eb20f7dd3144bc07de3dcc","observation_id":"c8944175-5d6f-43dd-9944-97d74e1ce9ff","resolution":{"observed_at":"2026-08-09T12:38:15.123699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:15.107708Z","title":"Underdamped diffusion bridges with applications to sampling","venue":null,"work_id":"b9f21c8b-8a61-4496-bb4e-87441212bf4f","year":2025},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.124244Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:2cd52ebd54eb68d69507201218e5f8d2f002b9448e40080d70fb2b1296229029","observation_id":"24adc66f-f8fd-4d60-9a19-b4e0607a3011","resolution":{"observed_at":"2026-08-09T12:38:15.111698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:15.096141Z","title":"End-to-end learning of gaussian mixture priors for diffusion sampler","venue":null,"work_id":"8c6bf445-d1f5-4bdf-95d1-f82dade3ee6b","year":2025},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.128205Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:d160a0257391c8d4108d6f038cb64d9fd5fcbce74babc804e18482b99a621e3f","observation_id":"33f623d8-5a90-49f1-b532-dcf9af660a1f","resolution":{"observed_at":"2026-08-09T12:38:15.100057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:15.083825Z","title":"Openai gym, 2016","venue":null,"work_id":"b29f49ba-dbdc-4946-84d5-c0aaaddaa515","year":2016},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.131657Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:0045eece5973ff36b3285e962b20d9d364fb84d9856a40211f00984ef27add72","observation_id":"6df01a18-2c97-49ef-bbbd-a2ed5019a634","resolution":{"observed_at":"2026-08-09T12:38:15.088157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.00588","last_updated":"2025-03-13T03:41:00Z","snapshot_observed_at":"2026-07-06T13:05:37.025588Z","submitted_at":"2022-05-02T00:28:01Z","title":"Tightness without Counterexamples: A New Approach and New Results for Prophet Inequalities","version":5},"cited_work":{"arxiv_id":"2205.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.00588","snapshot_observed_at":"2026-08-09T12:38:14.562021Z","title":"Tightness without Counterexamples: A New Approach and New Results for Prophet Inequalities","venue":"cs.GT","work_id":"0280238e-f61b-40ec-a8b9-002a983e0b3b","year":2022},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.135117Z"},"links":{"cited_paper":"/paper/2205.00588","citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:15efcccf2b7b9b3e2f6362e909ed3790b51e1673ec0ddf445aff6934b2133cca","observation_id":"ce76b231-caf9-4a2b-8ba3-cd28ad1c8ff1","resolution":{"observed_at":"2026-08-09T12:38:14.567153Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:15.071967Z","title":"Offline reinforcement learning via high-fidelity generative behavior modeling","venue":null,"work_id":"0b773303-ec16-48a8-8e26-d4b5fec88d57","year":2023},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.139164Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:cf5d0859ab8c459d5d8da79515c12af426e57bc084015df1c487621ce8b4c2d5","observation_id":"af2db694-a77b-4c8a-be46-091df0cbb3a6","resolution":{"observed_at":"2026-08-09T12:38:15.075686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07081","last_updated":"2025-09-08T12:53:38Z","snapshot_observed_at":"2026-08-10T02:25:38.058754Z","submitted_at":"2024-12-10T00:47:10Z","title":"Sequential Controlled Langevin Diffusions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07081","snapshot_observed_at":"2026-08-09T12:38:14.142543Z","title":"Sequential controlled langevin diffusions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.142543Z"},"links":{"cited_paper":"/paper/2412.07081","citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:9a4b58c9b089270a250288ac2a46042e6e18913ac2176031801622961b905cdb","observation_id":"463b306f-e696-4d5d-a00e-8141d85cd41a","resolution":{"observed_at":"2026-08-09T12:38:14.142543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:15.061068Z","title":"Sequential controlled langevin diffusions","venue":null,"work_id":"04db3ec3-c75f-4649-a7e9-5080e1ceffbf","year":2025},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.145887Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:95ab42b7d1f42e32c8e04ee0cb7a1cc2023dcd2fed58b548783e899b21bd6377","observation_id":"656a7fcb-641d-49db-a591-b4ae7eeadf75","resolution":{"observed_at":"2026-08-09T12:38:15.064866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.148959Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.148959Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:4992d4c42480ee3f168cd3a38471093ba38b6f1bda2a7ff84da5f935ca48166a","observation_id":"af58e749-21bc-44d5-9cb4-7d66cd8c2d97","resolution":{"observed_at":"2026-08-09T12:38:14.148959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.151776Z","title":null,"venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.151776Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:7d3c3194713bc735c631ea377f737c5f51f3885e23381cc46215b34a51d8301f","observation_id":"8be1a765-d9d0-4d70-8b05-ad06f40602ae","resolution":{"observed_at":"2026-08-09T12:38:14.151776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:15.034913Z","title":"A stochastic control approach to reciprocal diffusion processes","venue":null,"work_id":"75a73a52-2985-4aba-ae6d-4bbc1369e16d","year":1991},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.154882Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:b6d68b3fe0d0409546814d1f7d6ea73d3192087e4b06c9d68a4d501a044cb54b","observation_id":"a7279a3d-3df2-4438-bbbe-ad2886b1b3e9","resolution":{"observed_at":"2026-08-09T12:38:15.038657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.157903Z","title":"Sequential monte carlo samplers","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.157903Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:caa3c7f0ecde3a9b0fdce339f5251a64349bd8fa04b85c2f0f278cde3e71ef56","observation_id":"e5e22f54-b8a5-40ec-8f10-5b7533763a68","resolution":{"observed_at":"2026-08-09T12:38:14.157903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:15.014407Z","title":"Diffusion-based reinforcement learning via q-weighted variational policy optimization","venue":null,"work_id":"f97d82e7-a483-4cb9-9d0a-e34b45b925f9","year":2024},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.160824Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:071f5cdb7455873631324cb297b280c230286b64dae682d9f342a43fe255822b","observation_id":"44b83fed-ed29-42bb-9776-08a3c386a602","resolution":{"observed_at":"2026-08-09T12:38:15.019019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.995999Z","title":"and Jin, C","venue":null,"work_id":"e9a1c7bf-85ea-4e47-987e-2a61c05b5d7e","year":2024},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.163769Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:a4a32519beedd1f5fc5a874f5c8f1a88d35e7d50f12adb6ee81715959f7c3858","observation_id":"38113b63-1b87-44a1-9ff4-3a91fb5f4048","resolution":{"observed_at":"2026-08-09T12:38:15.000021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.984773Z","title":"G., and Strathmann, H","venue":null,"work_id":"e412e10e-a4f0-48b8-8928-665fec3465bc","year":2022},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.167254Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:2bece0e38e24ba6e490ad2f805d7c05fbd8a98864e51aac9ebd351c978f96ff2","observation_id":"4e73b97f-d16e-44bc-8199-27bacc96820a","resolution":{"observed_at":"2026-08-09T12:38:14.988685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.973779Z","title":"Diffusion actor-critic: Formulating constrained policy iteration as diffusion noise regression for offline reinforcement learning","venue":null,"work_id":"5367b9b7-c239-4f25-8916-e0053510faf0","year":2025},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.170851Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:ce939213b22b250b2ed1abde4474a6ec09b5bad27cfef6d242d0467e4a3d4faa","observation_id":"7c606447-b7d7-4c41-a6fb-043a47e367a8","resolution":{"observed_at":"2026-08-09T12:38:14.977582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.174440Z","title":"and Domke, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.174440Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:fda4fd4dec2b436992ff76ff462b1a94beded02c3a1580e4bebe98fc1f771f6f","observation_id":"9513d163-9d7d-4f26-9adf-765f629775ab","resolution":{"observed_at":"2026-08-09T12:38:14.174440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.178080Z","title":"Reinforcement learning with deep energy-based policies","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.178080Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:45bcbeb0a103bb62f45ef218ed2a1805c958c63aeda836f3b99645acf841c9f3","observation_id":"f0559be9-0003-4eec-ac08-c22b2a65e4e7","resolution":{"observed_at":"2026-08-09T12:38:14.178080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.949292Z","title":"Latent space policies for hierarchical reinforcement learning","venue":null,"work_id":"3eea1d70-59f2-43e2-ae64-a22331080e35","year":2018},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.182904Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:efc41387bacbf741ce870369c38ba6d3315335f379bb4b13f695f62a109715d0","observation_id":"27bf4433-5563-4170-8138-df713dab2298","resolution":{"observed_at":"2026-08-09T12:38:14.953089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.938239Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"9c6954a2-4264-44a4-b998-96399bd0db1d","year":2018},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.186408Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:85d24bc9562548cb317ab04492de6eee24bf8265763a064303f5d392bf25b6c4","observation_id":"9d579252-3905-44b2-9baa-656604c177a0","resolution":{"observed_at":"2026-08-09T12:38:14.942335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-09T12:38:14.189969Z","title":"Soft actor-critic algorithms and applications","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.189969Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:088b2e0a7496f49315657f3d493a5f068670d204a733fb928439518ee3779b85","observation_id":"e8e530f3-f95b-423b-9935-697a180111ae","resolution":{"observed_at":"2026-08-09T12:38:14.189969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-07-06T15:18:07.416392Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10573","snapshot_observed_at":"2026-08-09T12:38:14.193834Z","title":"G., and Levine, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.193834Z"},"links":{"cited_paper":"/paper/2304.10573","citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:671a9e3f3bd88da24003da8536c68ddeb36f9b17177a803933f434733eff90e9","observation_id":"99b2ad79-7c1e-41aa-bb7f-361477653df9","resolution":{"observed_at":"2026-08-09T12:38:14.193834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.926804Z","title":null,"venue":null,"work_id":"ac047f90-d934-4285-a4a7-027ff52b3753","year":1986},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.197642Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:cd12773a60ff97e6b6ab79071a54069f035166147fa78fdf2f9bbf18795167b2","observation_id":"c395e1eb-532b-4fd5-b9a9-98c9649bfa0b","resolution":{"observed_at":"2026-08-09T12:38:14.930480Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.201237Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.201237Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:3603cfbbe9a378e2443363785207a19461451b5f91ed84ed1893da67191e8421","observation_id":"b813972e-5a86-417c-8a3a-17c3f56d04a9","resolution":{"observed_at":"2026-08-09T12:38:14.201237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.10880","last_updated":"2021-09-04T03:38:49Z","snapshot_observed_at":"2026-08-09T06:51:42.562341Z","submitted_at":"2021-06-21T06:39:49Z","title":"Schr{\\\"o}dinger-F{\\\"o}llmer Sampler: Sampling without Ergodicity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.10880","snapshot_observed_at":"2026-08-09T12:38:14.204618Z","title":"o dinger-f \\","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.204618Z"},"links":{"cited_paper":"/paper/2106.10880","citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:2626ce1949669b56d2f3ad99e13cd1b6976aa09bff953e17ffc21009d9647de5","observation_id":"c4cd67f8-4626-4693-9bec-ce5961d57d34","resolution":{"observed_at":"2026-08-09T12:38:14.204618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.208548Z","title":"and Dayan, P","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.208548Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:9090bbebd3e7786c4ef34b49e01e0d7397613022b89a3672e0de93403a012ebe","observation_id":"cc8de289-3168-40d6-87da-1bbb62609350","resolution":{"observed_at":"2026-08-09T12:38:14.208548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.902728Z","title":"N., and Precup, D","venue":null,"work_id":"9461bcba-2274-44b6-b5d2-a583757e081d","year":2025},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.212244Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:45e708414e20da6ea546b0a78cc7111974b6cbc617dc12da038a38ea5aabd417","observation_id":"b30079e6-bd0e-4bdc-b0fd-08b46ee2c299","resolution":{"observed_at":"2026-08-09T12:38:14.906381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.215741Z","title":"Planning with diffusion for flexible behavior synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.215741Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:f6c227b4c5bc13aacc5241da61e2fa21df9930d4d278c3f04d57769f2cb4c981","observation_id":"e7811df2-12a0-49fb-85f8-da4e426314a7","resolution":{"observed_at":"2026-08-09T12:38:14.215741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.884362Z","title":"Efficient diffusion policies for offline reinforcement learning","venue":null,"work_id":"1be32829-428d-4a20-b80d-b1d298254a79","year":2023},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.219173Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:c98114294d6e867bb89c6f75136cb6af8180818fed82629a1fc89211ccaefe8b","observation_id":"0db103f9-73cf-4dbe-b5a4-f6b31590b611","resolution":{"observed_at":"2026-08-09T12:38:14.888260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.222831Z","title":"Elucidating the design space of diffusion-based generative models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.222831Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:8cc8b505e58d835a17f2bfd65f38aaa804a691ba77e737aa1508660dba4ee02c","observation_id":"4a3676ed-ea1c-434d-bd8f-eb1b1a52240f","resolution":{"observed_at":"2026-08-09T12:38:14.222831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-09T12:38:14.226467Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.226467Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:bc9692c462494acff5b8ed39cfb6b480f6deadc123bfa80dc212a865a18c9779","observation_id":"619b962a-90db-43ce-af48-88db610c544a","resolution":{"observed_at":"2026-08-09T12:38:14.226467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.866366Z","title":"Batch reinforcement learning","venue":null,"work_id":"a1fb7e76-de45-4255-8699-fef6c84764c1","year":2012},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.230327Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:5a76c8c8e969a9007bfae93419adfb9ba76fcd4cfcf9a9838ce1421275a94bc6","observation_id":"7d12ff7c-cc09-4caf-9e15-e7eae1c7b510","resolution":{"observed_at":"2026-08-09T12:38:14.870021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-09T12:38:14.234145Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.234145Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:008b4a9c7f7968581c74353bc6da1d0113e881c3b6665d9741c0729c2e55bd12","observation_id":"a4f75e3d-f77f-496d-b070-bb2927c87969","resolution":{"observed_at":"2026-08-09T12:38:14.234145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.854744Z","title":"TOP - ERL : Transformer-based off-policy episodic reinforcement learning","venue":null,"work_id":"83c0203b-5e34-4963-88a4-091302bf402f","year":2025},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.238193Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:6ab0308de1ad563adf2396c4c63f961fd4956847232172a5c7e4c877f4d11cd2","observation_id":"f2638d14-02d0-4a9c-a77e-617b1d26d5a7","resolution":{"observed_at":"2026-08-09T12:38:14.858848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00681","last_updated":"2024-06-02T09:32:28Z","snapshot_observed_at":"2026-08-09T15:05:31.614999Z","submitted_at":"2024-06-02T09:32:28Z","title":"Learning Multimodal Behaviors from Scratch with Diffusion Policy Gradient","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00681","snapshot_observed_at":"2026-08-09T12:38:14.242058Z","title":"Learning multimodal behaviors from scratch with diffusion policy gradient","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.242058Z"},"links":{"cited_paper":"/paper/2406.00681","citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:63133dace9d4b442809e378f60c58c79ba6d67cc9d0be5181117689288be88e2","observation_id":"4809b0cd-c429-4c4f-b974-d3063e183d79","resolution":{"observed_at":"2026-08-09T12:38:14.242058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.245151Z","title":"Contrastive energy prediction for exact energy-guided diffusion sampling in offline reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.245151Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:4ee44ec555783bde28dc3d31d28798402b7a183e26d9c0a6751bf08455c043cb","observation_id":"87c1541d-f4e7-4906-affb-894f06ebfd19","resolution":{"observed_at":"2026-08-09T12:38:14.245151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.834853Z","title":"K., S nderby, S","venue":null,"work_id":"c266dd34-afc7-42e4-bb4a-97b747365ff4","year":2016},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.248289Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:7c277c9501d9690297755a754c29594dc3ebe8feac2f2cba81e2920c01a2e8d2","observation_id":"dadef05a-23ca-40c2-a96b-e75e2feae13f","resolution":{"observed_at":"2026-08-09T12:38:14.839088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.824289Z","title":"Diffusion-dice: In-sample diffusion guidance for offline reinforcement learning","venue":null,"work_id":"6c1ef3a8-9a92-40e7-9ed8-63dfb36312ac","year":2024},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.251712Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:150bfc4baa5f59a362f66cb0f3711939ec99d4b9f78738991cee28eb48cc9817","observation_id":"3e71aaa3-867c-479a-87cb-e80a15e5436f","resolution":{"observed_at":"2026-08-09T12:38:14.827504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.813654Z","title":"S 2 ac: Energy-based reinforcement learning with stein soft actor critic","venue":null,"work_id":"9e72373c-56cb-4251-b48d-478a780c5033","year":null},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.254946Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:652506ffcff920446aaae435602f9c0b016e748c8095be5c7596114a2cb2cf1d","observation_id":"ee81219c-e089-40aa-86c3-9eda621f0f89","resolution":{"observed_at":"2026-08-09T12:38:14.817002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.258104Z","title":"and Cygan, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.258104Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:3234e6f708e5895d30f66455448c68bdab032bd1407a2f08b9981c3f9d24032f","observation_id":"ec591d77-e5aa-410d-9103-9717ef832ab5","resolution":{"observed_at":"2026-08-09T12:38:14.258104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.795869Z","title":"Bigger, regularized, optimistic: scaling for compute and sample efficient continuous control","venue":null,"work_id":"5447d943-80bf-42d6-a0dc-3450c290eca7","year":2024},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.261037Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:649444dd294df766283b93718bdeb75ddc5b9b95c8ec6b0f1e7719e2d1cba75a","observation_id":"21ce8d20-963b-4570-b0b2-b1edcab3dbad","resolution":{"observed_at":"2026-08-09T12:38:14.799394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.783944Z","title":"Dynamical theories of Brownian motion, volume 101","venue":null,"work_id":"da8b7327-f89e-4c1a-a539-2ed136ff83f7","year":2020},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.264042Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:47f4a4a45450e1a897d30646622c9210586e9e929d3e49eff7a976441866cd88","observation_id":"0d0cf4b9-2ca5-4469-9217-ad12a71951db","resolution":{"observed_at":"2026-08-09T12:38:14.788288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.07798","last_updated":"2017-05-22T15:06:25Z","snapshot_observed_at":"2026-07-06T05:43:40.624942Z","submitted_at":"2017-05-22T15:06:25Z","title":"A unified view of entropy-regularized Markov decision processes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.07798","snapshot_observed_at":"2026-08-09T12:38:14.267814Z","title":"A unified view of entropy-regularized markov decision processes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.267814Z"},"links":{"cited_paper":"/paper/1705.07798","citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:cb8f9928835a3078742c06e3fc0f7ec372695d4707717bcdabe6c34faf4220f3","observation_id":"3e64df8a-1914-47a3-ae76-c34cd0f92849","resolution":{"observed_at":"2026-08-09T12:38:14.267814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.271660Z","title":"The primacy bias in deep reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.271660Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:3dadd7b74e2ebd7fbb83e568c25eaea721e9c8dd825e1406be189e118fe072f0","observation_id":"faf27320-67d3-4d0b-9d64-e93315eb1116","resolution":{"observed_at":"2026-08-09T12:38:14.271660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19449","last_updated":"2025-04-12T08:04:13Z","snapshot_observed_at":"2026-08-05T23:24:44.107280Z","submitted_at":"2024-10-25T10:23:34Z","title":"Learned Reference-based Diffusion Sampling for multi-modal distributions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19449","snapshot_observed_at":"2026-08-09T12:38:14.275215Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.275215Z"},"links":{"cited_paper":"/paper/2410.19449","citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:fa85100cda19309cf8a314a6a15fe3050737259ee06ad9a7712d8f101923e591","observation_id":"36c8d1e6-630b-49e8-904c-4fd4f53c5b79","resolution":{"observed_at":"2026-08-09T12:38:14.275215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.278880Z","title":"Transport meets variational inference: Controlled monte carlo diffusions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.278880Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:35ead7b950e7af127106e15b28147315e1697367a53f5b8c5c56171609f03b7f","observation_id":"79dc8dc3-bef3-450e-8809-6ebb33be4dd1","resolution":{"observed_at":"2026-08-09T12:38:14.278880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.757270Z","title":"Learning a diffusion model policy from rewards via q-score matching","venue":null,"work_id":"415e09bf-7230-4536-85ad-68b9f1be9859","year":2024},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.282288Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:62663a6ac09872e2799a19bba28d73184b725fccc6339605bdf6ffe94c6616c4","observation_id":"65b5d15c-9889-4cad-a67d-59fb089fc7c4","resolution":{"observed_at":"2026-08-09T12:38:14.761370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.744483Z","title":"Hierarchical variational models","venue":null,"work_id":"7e8cd13c-d9cf-42ea-a016-18d936ace457","year":2016},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.286001Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:7439de827e1bff5405662e26ec94c33186870553970040806d93b2fed0c36ee5","observation_id":"a09c9356-1294-41c0-aced-32c735fcf081","resolution":{"observed_at":"2026-08-09T12:38:14.748420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.733042Z","title":"Goal conditioned imitation learning using score-based diffusion policies","venue":null,"work_id":"de0d7fde-1d03-4f2b-bd63-70274c7a364c","year":2023},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.289502Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:6377000d600fd1b498294b6c4e5e350876318540983d6bf1b5c7c2ef5870695c","observation_id":"48824140-2a73-4abc-8ac3-5b49f513846a","resolution":{"observed_at":"2026-08-09T12:38:14.736983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.721839Z","title":"and Berner, J","venue":null,"work_id":"ec7c6876-bd4a-42fd-b468-1471bb183d96","year":null},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.293053Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:ca0e8854ea072c2c7035595e3d8d36cfa3fe874833af1b49f50ff561cbd579a2","observation_id":"bf533dbe-5035-4d60-95d8-7fc5f0b1272a","resolution":{"observed_at":"2026-08-09T12:38:14.725710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.296976Z","title":"and Solin, A","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.296976Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:1188b35145255b1200659098a68c48fe4bb08dd4d1bf4bdd1d64c0afdc150ac2","observation_id":"8066ba5f-6ffb-4f13-aae4-5d5bfa5373fd","resolution":{"observed_at":"2026-08-09T12:38:14.296976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.301800Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.301800Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:8bb7fa07c1fd6d3fbed27d567c45573afdb3ddebbfb05b7455a5dff1a293278d","observation_id":"49810f60-65f7-42f6-be15-4089eae599a3","resolution":{"observed_at":"2026-08-09T12:38:14.301800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.305552Z","title":"P., Kumar, A., Ermon, S., and Poole, B","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.305552Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:954d7bde8a2277aaeecf01638d72f5b77f3534fa2b541116e641e50f439a0899","observation_id":"4a897596-edc0-4c6f-a83a-80b65c8d7af8","resolution":{"observed_at":"2026-08-09T12:38:14.305552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.309171Z","title":null,"venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.309171Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:1ee3c37412920307ac7ca77e5d5b724e8ee859d24eca890518c5f4bc7fb08c5a","observation_id":"8a635f3c-89eb-4d7e-8911-58e4c8084279","resolution":{"observed_at":"2026-08-09T12:38:14.309171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.312599Z","title":"Robot trajectory optimization using approximate inference","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.312599Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:25e9061039af05ac5763a933b09131a2a3934cbdf81ac6206e25406045117ac9","observation_id":"185596b5-8064-407d-b48a-2920076db62b","resolution":{"observed_at":"2026-08-09T12:38:14.312599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06499","last_updated":"2016-04-17T22:14:13Z","snapshot_observed_at":"2026-08-03T17:59:13.493336Z","submitted_at":"2015-11-20T06:01:23Z","title":"The Variational Gaussian Process","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06499","snapshot_observed_at":"2026-08-09T12:38:14.316160Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.316160Z"},"links":{"cited_paper":"/paper/1511.06499","citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:11d3fc35e6d8b8459f6207581577de8db66fcac681781856da0de4bef1e87d88","observation_id":"9763709c-6b80-4d9c-8840-3b43a1535995","resolution":{"observed_at":"2026-08-09T12:38:14.316160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.320118Z","title":"dm\\_control: Software and tasks for continuous control","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.320118Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:6656ca23311f5a4bbcb78a56a35b6ef86aac3a4bf469c87bf34a5131f49f6b38","observation_id":"ff43e272-9320-469a-8ee0-6c9e1396a6f4","resolution":{"observed_at":"2026-08-09T12:38:14.320118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.323715Z","title":"and Raginsky, M","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.323715Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:a5c810d97762aad8d86da438d5e1cb166707132f3b9e7b1100363047cd91492c","observation_id":"69b67f08-7650-40ed-a1b9-5f1687fedf9b","resolution":{"observed_at":"2026-08-09T12:38:14.323715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.661437Z","title":"S., and Doucet, A","venue":null,"work_id":"0cb9d2e4-4e2b-4ad0-8d6c-864953aa2b07","year":null},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.327292Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:c2119c8a4f94ee5bfc94c23bca7e57206b945d4af6afb4dc7c24f55662364662","observation_id":"e46bd896-c502-4a9e-abb2-6eaf23ffb790","resolution":{"observed_at":"2026-08-09T12:38:14.665066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.649982Z","title":"u sken, N. Bayesian learning via neural schr \\","venue":null,"work_id":"0878bef9-4177-410c-b0df-ce7f206f9bc2","year":2023},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.331007Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:5ea7de0e9b27c34af44a1fd346b86d76ef6029d5b7289fbed9b60c9ba6410b3f","observation_id":"1c194d97-1288-425b-aac3-d239516cb03e","resolution":{"observed_at":"2026-08-09T12:38:14.653971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.334714Z","title":"A connection between score matching and denoising autoencoders","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.334714Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:d18f1a9e19a9579aa18b7ba43f706ff8add48693870b75473c43f9b2978a2ad8","observation_id":"3f4c3ba9-d9a9-40e2-a540-ad9028288e9b","resolution":{"observed_at":"2026-08-09T12:38:14.334714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01722","last_updated":"2016-11-26T01:08:47Z","snapshot_observed_at":"2026-07-06T05:17:31.345937Z","submitted_at":"2016-11-06T02:40:41Z","title":"Learning to Draw Samples: With Application to Amortized MLE for Generative Adversarial Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01722","snapshot_observed_at":"2026-08-09T12:38:14.338402Z","title":"and Liu, Q","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.338402Z"},"links":{"cited_paper":"/paper/1611.01722","citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:00ccbca2e10eb1de7010458f9d97ed1d8911aa170cdbd80c379116abd275f07a","observation_id":"a017ff77-6f1f-454f-b3f9-96bd28d87566","resolution":{"observed_at":"2026-08-09T12:38:14.338402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.630796Z","title":null,"venue":null,"work_id":"2d1cc83b-da5a-465e-9b18-3c52ae2dd7b9","year":2024},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.342096Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:6da361d230eed49a9f3e2a7f0ec35168bb8690e47403bc3c1c78bb24ece562cb","observation_id":"d88d61d6-91e0-4f62-bfc3-e70fa9569d23","resolution":{"observed_at":"2026-08-09T12:38:14.634493Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.619427Z","title":"J., and Zhou, M","venue":null,"work_id":"c090be2b-8edd-4937-9776-91ed84bf436d","year":2023},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.345551Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:aff8db3c4ae24597fd0e1861042e06a989d3c4c50c8f81bcfd4fd80e76b7c5d0","observation_id":"9a98b497-f72f-4c08-a67e-62799cf7fc74","resolution":{"observed_at":"2026-08-09T12:38:14.623216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.349023Z","title":"and Teh, Y","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.349023Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:f2d1b975483cb50209c9aa61ccca67a4942a3b96a91e8d3235b66ae50f1c90bf","observation_id":"27df332f-43c7-4b99-b0d4-4a8734bb82af","resolution":{"observed_at":"2026-08-09T12:38:14.349023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13122","last_updated":"2023-05-22T15:23:41Z","snapshot_observed_at":"2026-08-08T14:32:15.565933Z","submitted_at":"2023-05-22T15:23:41Z","title":"Policy Representation via Diffusion Probability Model for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13122","snapshot_observed_at":"2026-08-09T12:38:14.352435Z","title":"h., Zhong, Y., Yang, Y., Fang, C., Wen, S., Zhou, B., and Lin, Z","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.352435Z"},"links":{"cited_paper":"/paper/2305.13122","citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:a80527c50a6b1347bd5d95adcb08a52f3d4bfdeea5c04c4bd180f074709019af","observation_id":"7c3a774b-37f9-490d-853f-abe83da17fb7","resolution":{"observed_at":"2026-08-09T12:38:14.352435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02679","last_updated":"2024-03-09T21:05:43Z","snapshot_observed_at":"2026-08-06T11:59:35.672992Z","submitted_at":"2023-10-04T09:39:05Z","title":"Diffusion Generative Flow Samplers: Improving learning signals through partial trajectory optimization","version":3},"cited_work":{"arxiv_id":"2310.02679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.02679","snapshot_observed_at":"2026-08-09T12:38:14.413674Z","title":"Diffusion Generative Flow Samplers: Improving learning signals through partial trajectory optimization","venue":"cs.LG","work_id":"48d9c741-faf3-4d53-86ed-c34d51ad4aad","year":2023},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.356711Z"},"links":{"cited_paper":"/paper/2310.02679","citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:84992c5dfeea990e3a951b001a9046e0029d61449092abd3d67ef0900bd77f69","observation_id":"c586b889-f9f7-41f2-bae9-420dbd3113fb","resolution":{"observed_at":"2026-08-09T12:38:14.419170Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.15141","last_updated":"2022-03-10T01:42:08Z","snapshot_observed_at":"2026-08-09T22:07:58.055581Z","submitted_at":"2021-11-30T05:50:12Z","title":"Path Integral Sampler: a stochastic control approach for sampling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.15141","snapshot_observed_at":"2026-08-09T12:38:14.360227Z","title":"and Chen, Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.360227Z"},"links":{"cited_paper":"/paper/2111.15141","citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:f3927291a1ee51e1a8a8cd479428747b9561c687d6d7f2f8687217fd11b790f6","observation_id":"d08cbb27-c32e-473a-908d-8bf8a07390c5","resolution":{"observed_at":"2026-08-09T12:38:14.360227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.600804Z","title":"Variational distillation of diffusion policies into mixture of experts","venue":null,"work_id":"cc2f8cc9-d215-46cd-b0cf-07867fbd1624","year":2024},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.363751Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:2693cbc78d4b38f46ae939db2ac4460a0944308d8672ac0bdfbd0d1e24d22933","observation_id":"b879a459-e67a-4782-b1f2-ca061de9297b","resolution":{"observed_at":"2026-08-09T12:38:14.604750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.366824Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.366824Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:44eeda56c608a5d1338847d1d51a0b880e064313f770e5cda36cd10fb803151d","observation_id":"1f801739-e362-4d39-832d-213bf9037dcb","resolution":{"observed_at":"2026-08-09T12:38:14.366824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:38:14.369887Z","title":"D., Maas, A","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-09T12:38:14.369887Z"},"links":{"citing_paper":"/paper/2502.02316"},"observation_digest":"sha256:ad4d89c0af3a7c9882781dd1b1a9c0442e3a070d88f45d05dbecd8df47a23517","observation_id":"fb8be11c-3caf-4f86-8891-52385aa1d29e","resolution":{"observed_at":"2026-08-09T12:38:14.369887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T15:06:49.171104Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning"},"reference_resolution":{"displayed":79,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":32},"total_outbound_references":79},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 79 of 79 outbound references and 9 inbound Pith citation observations for arXiv:2502.02316."}