{"as_of":"2026-08-17T21:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fcc4332dd9c6af489fae1a44aeb2c0e331dc0783b8c461ef93a52e7dd9cbdfb3","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:00:44.657662Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T16:42:30.970472Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T10:48:02.238598Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":"2505.08376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.08376","snapshot_observed_at":"2026-07-03T10:48:02.238598Z","title":"Jiang and Z","venue":null,"work_id":"260ff250-7ff9-4b3e-80f6-5b88290c30fc","year":2025},"citing_paper":{"arxiv_id":"2606.09630","last_updated":"2026-06-08T15:29:09Z","snapshot_observed_at":"2026-07-06T23:48:58.206424Z","submitted_at":"2026-06-08T15:29:09Z","title":"ReCoVLA: VLM-Guided Reward Compilation for Failure Recovery in Vision-Language-Action Policies","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T16:42:30.970472Z"},"links":{"cited_paper":"/paper/2505.08376","citing_paper":"/paper/2606.09630"},"observation_digest":"sha256:d3c64f22c4b0f1417ced83e2b2d4457d7b392f66c872d7e1db3a0243903b42f9","observation_id":"9e4c6a5b-3d4f-45f9-8c39-8f954773941f","resolution":{"observed_at":"2026-07-03T01:17:30.808895Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":"2505.08376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.08376","snapshot_observed_at":"2026-07-03T10:48:02.238598Z","title":"Jiang and Z","venue":null,"work_id":"260ff250-7ff9-4b3e-80f6-5b88290c30fc","year":2025},"citing_paper":{"arxiv_id":"2606.11743","last_updated":"2026-06-10T07:20:36Z","snapshot_observed_at":"2026-08-04T03:57:45.233984Z","submitted_at":"2026-06-10T07:20:36Z","title":"TacCoRL: Integrating Tactile Feedback into VLA via Simulation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-27T09:51:56.563479Z"},"links":{"cited_paper":"/paper/2505.08376","citing_paper":"/paper/2606.11743"},"observation_digest":"sha256:de2c3d941a6755fae4b4bcb3f6b2ba038d3ee2515d7853e5354d0506cc5f6414","observation_id":"532b350e-13eb-433b-b5ac-d7463591f0d0","resolution":{"observed_at":"2026-07-03T10:48:02.239947Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.08376/citation-record","integrity":"/paper/2505.08376/integrity","json":"/paper/2505.08376/citation-record.json","paper":"/paper/2505.08376"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:45.128956Z","title":"Diffusion policies for out-of-distribution generalization in offline reinforcement learning","venue":null,"work_id":"d0ad87d3-4c51-4c7f-813d-43ab1ced8ad9","year":2024},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.499552Z"},"links":{"citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:300085402b53c2231b2e0ddf8df2626431c8a14fb4685490f11d344838fd2a2b","observation_id":"ea1021e8-af35-478d-b3a7-50fb379b9401","resolution":{"observed_at":"2026-08-15T22:00:45.133433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15657","last_updated":"2023-07-10T07:25:26Z","snapshot_observed_at":"2026-08-14T18:28:45.696263Z","submitted_at":"2022-11-28T18:59:02Z","title":"Is Conditional Generative Modeling all you need for Decision-Making?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15657","snapshot_observed_at":"2026-08-15T22:00:44.504498Z","title":"Is conditional generative modeling all you need for decision-making? arXiv preprint arXiv:2211.15657 , 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.504498Z"},"links":{"cited_paper":"/paper/2211.15657","citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:542d0681b242c0b0b027bc24227708ce6acc77bc2da467af9c09d0d62df86dd8","observation_id":"3106a177-b012-45ac-8676-8d60e763f7ef","resolution":{"observed_at":"2026-08-15T22:00:44.504498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:45.115349Z","title":"Katyusha: The first direct acceleration of stochastic gradient methods","venue":null,"work_id":"941758bd-9a0e-403a-902b-20bdcbf41ddb","year":2018},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.509160Z"},"links":{"citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:422205c53017ff44a11fc35391d0a1de8e5386f4452375bf54da55af1173c4dd","observation_id":"5617a867-a658-45e2-8160-aa02eec0ef3d","resolution":{"observed_at":"2026-08-15T22:00:45.119937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:44.513607Z","title":"Pattern recognition and machine learning , volume 4","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.513607Z"},"links":{"citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:f0bf5c76ecda20121acd72ee2294f799a86e5d08389e2a96400cba14cce1bcda","observation_id":"5f520f84-8618-4c53-8162-c07f4216ef2b","resolution":{"observed_at":"2026-08-15T22:00:44.513607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-13T12:26:05.192883Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-15T22:00:44.517856Z","title":"Openai gym","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.517856Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:1b65aa94e975918264fafac407576a70ab3675f0b4e2b243626eff4f6ebf65c2","observation_id":"999e2972-7ecf-4f82-8031-ae127cf70262","resolution":{"observed_at":"2026-08-15T22:00:44.517856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:44.522435Z","title":"A survey on generative diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.522435Z"},"links":{"citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:661cf64796933190566765f3f3f7eef53f2c6e23ed4a2e33e9fc27b4ddbacd94","observation_id":"ac4e4f52-827b-43b2-b7f6-fd54f084c29a","resolution":{"observed_at":"2026-08-15T22:00:44.522435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14548","last_updated":"2023-02-28T04:19:48Z","snapshot_observed_at":"2026-08-16T16:28:17.155889Z","submitted_at":"2022-09-29T04:36:23Z","title":"Offline Reinforcement Learning via High-Fidelity Generative Behavior Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14548","snapshot_observed_at":"2026-08-15T22:00:44.527797Z","title":"Offline reinforcement learning via high-fidelity generative behavior modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.527797Z"},"links":{"cited_paper":"/paper/2209.14548","citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:d28cd1cf87b66c508000e7e6f7b3ce674f457ca5d05d3ec9c0e0c9ebd91a10ab","observation_id":"c8460d05-3fde-4ccd-8dee-247fe9c7f952","resolution":{"observed_at":"2026-08-15T22:00:44.527797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:45.083871Z","title":"Diffusiondet: Diffusion model for object detection","venue":null,"work_id":"04849171-4d5f-4bf7-9feb-1370d8d42801","year":2023},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.532143Z"},"links":{"citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:4a0d020d0e534990de44c07359895a38be691a722c98f67b6fe080d359e4e33d","observation_id":"218cf40d-4db1-415a-b90e-cb75cf727147","resolution":{"observed_at":"2026-08-15T22:00:45.088582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:44.535922Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.535922Z"},"links":{"citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:a8529d0254f043719830884c835e202602a6d6bca99dfe17b754d198456cdf4b","observation_id":"c428089a-237b-4e87-b2e0-0e9cf8d9bf9f","resolution":{"observed_at":"2026-08-15T22:00:44.535922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:45.062003Z","title":"A reinforcement learning based artificial bee colony algorithm with application in robot path planning","venue":null,"work_id":"fdb6c997-6198-4e10-8c79-ef9c7bc99b78","year":2022},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.539900Z"},"links":{"citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:af0b5922794bf13cb00c1e692d616709c9d196e4da0c8fec19f904bce0a70ce8","observation_id":"baf88e0f-a07d-40a1-8e0e-c7a19255d159","resolution":{"observed_at":"2026-08-15T22:00:45.066294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16173","last_updated":"2024-12-16T15:42:46Z","snapshot_observed_at":"2026-08-17T15:15:30.926649Z","submitted_at":"2024-05-25T10:45:46Z","title":"Diffusion-based Reinforcement Learning via Q-weighted Variational Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16173","snapshot_observed_at":"2026-08-15T22:00:44.543716Z","title":"Diffusion-based reinforcement learning via q-weighted variational policy optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.543716Z"},"links":{"cited_paper":"/paper/2405.16173","citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:25bcc0cf0d8c6e4dca44045fa1090011d5012487814d37d3e6fc4adc9a0494d5","observation_id":"dc68a6cb-733f-4447-af26-e33906430f12","resolution":{"observed_at":"2026-08-15T22:00:44.543716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-15T14:28:08.719865Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04778","snapshot_observed_at":"2026-08-15T22:00:44.548269Z","title":"Behavior-regularized diffusion policy optimiza- tion for offline reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.548269Z"},"links":{"cited_paper":"/paper/2502.04778","citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:99700678634d67f9c98fe7d94aaa5945e30ec0a7745aea35af93d73087a94ff4","observation_id":"6ea66d42-f45b-4399-a75a-0d6e00048425","resolution":{"observed_at":"2026-08-15T22:00:44.548269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:44.552406Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.552406Z"},"links":{"citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:a179b5464283e03535eb187f5ec1ded204d847f27a065aec9f3c2a3627f624a7","observation_id":"912706e3-8a3e-44b2-ae2f-3e6db0546be3","resolution":{"observed_at":"2026-08-15T22:00:44.552406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-08-14T17:40:51.391072Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10573","snapshot_observed_at":"2026-08-15T22:00:44.556304Z","title":"Idql: Implicit q-learning as an actor-critic method with diffusion policies","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.556304Z"},"links":{"cited_paper":"/paper/2304.10573","citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:ac0cf804003f3a75012a2f419c09da592c087705448fa04c9c9a7cc150f88431","observation_id":"70698a9e-e6f7-46b2-beb9-ac447c3145b4","resolution":{"observed_at":"2026-08-15T22:00:44.556304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:44.560480Z","title":"Denoising diffusion prob- abilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.560480Z"},"links":{"citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:86e11112597f449a9210ee9307e001fe4b82689064a70ac0d22f842658b57658","observation_id":"78fdb124-d570-4e82-a81f-68b75a737085","resolution":{"observed_at":"2026-08-15T22:00:44.560480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:45.032341Z","title":"Efficient diffusion policies for offline reinforcement learning","venue":null,"work_id":"63305d51-2431-4d49-b2dc-545052ee8c22","year":2023},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.564266Z"},"links":{"citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:ebbf15ee4c6c7938cd50bad612129dd7194a84fa8dbd9a6fa77c63e592be5571","observation_id":"5bed6647-8771-408f-ae65-992d416b10cb","resolution":{"observed_at":"2026-08-15T22:00:45.036936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-15T22:00:44.567988Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.567988Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:82922e2b6b8f0844072215688772cdb3a0fb7dfb03157c91ea8a3eba70cc2110","observation_id":"58837f81-1697-472b-91c8-943789c25382","resolution":{"observed_at":"2026-08-15T22:00:44.567988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:44.572019Z","title":"Hierarchical diffusion for offline decision making","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.572019Z"},"links":{"citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:7ab0407bf390f1e9ccf65f84dc70d6134fd692982fbf3c7088d50312c1dbed50","observation_id":"abad262d-cae1-4816-bb13-d4a7bd7747a6","resolution":{"observed_at":"2026-08-15T22:00:44.572019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.03298","last_updated":"2021-09-25T00:37:01Z","snapshot_observed_at":"2026-08-14T11:25:08.505775Z","submitted_at":"2021-08-06T20:48:30Z","title":"What Matters in Learning from Offline Human Demonstrations for Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.03298","snapshot_observed_at":"2026-08-15T22:00:44.576090Z","title":"What matters in learning from of- fline human demonstrations for robot manipulation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.576090Z"},"links":{"cited_paper":"/paper/2108.03298","citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:07481949f9c7931ee734b0f132c56f933dfebb8989744f6a878598383b7f4f54","observation_id":"999afc8e-2c95-46d2-acbe-8171fc1efc14","resolution":{"observed_at":"2026-08-15T22:00:44.576090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-08-13T13:59:34.315271Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-15T22:00:44.580282Z","title":"Advantage-weighted regression: Simple and scalable off-policy rein- forcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.580282Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:5a7b47cff8a18a7c6018e78c1fd2aa4521019ab46e08c2ba14072129b7007796","observation_id":"416346de-4f54-460e-adcc-fac2ee1800af","resolution":{"observed_at":"2026-08-15T22:00:44.580282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:45.010345Z","title":"Reinforcement learning by reward- weighted regression for operational space control","venue":null,"work_id":"697f8ab4-17dc-44a3-9436-12988b48e4cb","year":2007},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.584303Z"},"links":{"citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:ebb1c4331ce105e8d44e97635505542340fc6bef8febfc66595055cb1c8d12f5","observation_id":"8b72aed5-2bc3-49b6-afa0-505b021f488e","resolution":{"observed_at":"2026-08-15T22:00:45.014612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:44.996980Z","title":"Deep reinforcement learning for autonomous driving in amazon web services deepracer","venue":null,"work_id":"d8bcebb4-1525-49a6-9d91-cefea29fa71b","year":2024},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.588234Z"},"links":{"citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:d9f52ac84428f917eac478bc7239d479d7928222646084a2bdc3e228b21d87b8","observation_id":"d349cdb1-7a26-4308-8e4e-d28ac010aa0e","resolution":{"observed_at":"2026-08-15T22:00:45.001401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11752","last_updated":"2025-02-13T23:18:56Z","snapshot_observed_at":"2026-08-17T19:17:24.656164Z","submitted_at":"2023-12-18T23:31:01Z","title":"Learning a Diffusion Model Policy from Rewards via Q-Score Matching","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11752","snapshot_observed_at":"2026-08-15T22:00:44.592129Z","title":"Learning a diffusion model policy from rewards via q-score matching","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.592129Z"},"links":{"cited_paper":"/paper/2312.11752","citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:a1a1daa2bd47181f75ee86f48e02c50dd01e87526497bd078adb5a734fbcd40e","observation_id":"2821fadf-5e2e-48bb-86da-83d8fda249a7","resolution":{"observed_at":"2026-08-15T22:00:44.592129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:44.983812Z","title":"An adaptive reinforcement learning-based multimodal data fusion framework for human–robot confrontation gaming","venue":null,"work_id":"b91c28b0-1519-4dad-be51-e5bed4922267","year":2023},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.596241Z"},"links":{"citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:8710697ed1fc0c358b1f2703005abd98d24b2ec55e0bfe6076d466046129abe8","observation_id":"88da7b7d-86e8-46db-9467-acbaf0a5204f","resolution":{"observed_at":"2026-08-15T22:00:44.988040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-08-15T22:00:44.603262Z","title":"Diffusion policy policy optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.603262Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:440bf9b6b75575909c329ceaa194205f2886996cf5f67364b6abcf455048cd65","observation_id":"539275fd-7f61-4332-8894-1017f301ed3e","resolution":{"observed_at":"2026-08-15T22:00:44.603262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:44.609242Z","title":"Trust region policy optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.609242Z"},"links":{"citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:8b5e17116dd4b9c9eeaf5b58aeb3749c64616840957689f8d50b36cc717cdff5","observation_id":"f396fa63-3300-47a5-9b6c-1a442b14989c","resolution":{"observed_at":"2026-08-15T22:00:44.609242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T22:00:44.612881Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.612881Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:bbc77525b9f5cf44deceaf136b671d4701a863ac584372623e4a53a2bd3b393c","observation_id":"db1cd7d9-8ec7-45b9-94b4-19e50f71ad6e","resolution":{"observed_at":"2026-08-15T22:00:44.612881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:44.616646Z","title":"Deep unsupervised learning using nonequilibrium thermody- namics","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.616646Z"},"links":{"citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:a8a89fed28d0455d31a0639a743704dc1dcba86c24264d6c73033188165029db","observation_id":"94b1de96-9aa5-4a86-a4d7-b9c6a60eaf74","resolution":{"observed_at":"2026-08-15T22:00:44.616646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-15T22:00:44.620422Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.620422Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:d9168e02e5a9fd3dca41f2ce53aaa3dd1cedf6287dd55d137341e4d0c8fe8da6","observation_id":"d4eaabe0-7687-4c3c-b139-ab05986d0879","resolution":{"observed_at":"2026-08-15T22:00:44.620422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:44.954596Z","title":"Policy gradient methods for reinforcement learning with function approximation","venue":null,"work_id":"7fd3ee68-6f32-40b7-bf0b-30b0fd67cb43","year":1999},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.624566Z"},"links":{"citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:f031cb6fd47fff56e3903ef555ecad5b003c37ec02e1777a8bede6ab2df1aac5","observation_id":"538e47bc-c081-4dae-bb0f-83b30a3375b1","resolution":{"observed_at":"2026-08-15T22:00:44.958786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:44.941864Z","title":"Reinforcement learning: An introduction","venue":null,"work_id":"b921cf62-088a-45b7-9c65-f2a4afe59288","year":2000},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.628356Z"},"links":{"citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:0470e8172f67e64ca4e094e6d63e8573770137e2e17f30bf005d66a4a31b3e29","observation_id":"94d213ec-5994-431a-bcd8-1920810ce63e","resolution":{"observed_at":"2026-08-15T22:00:44.946042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:44.632073Z","title":"Lecture 6.5-rmsprop: Divide the gradient by a running average of its recent magnitude","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.632073Z"},"links":{"citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:4e38c36dc1199764cf9388424eac754c534bd74f1fac688593f4a55374f80689","observation_id":"32b8d7a6-b403-460d-978e-f594dab64756","resolution":{"observed_at":"2026-08-15T22:00:44.632073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:44.920933Z","title":"Diffusion actor-critic with entropy regulator","venue":null,"work_id":"04205528-b8d0-4340-bde8-965be506efc6","year":2024},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.635884Z"},"links":{"citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:5ddb33b47fec0154e4c34c5b4548a837fd6222bee21c6543e7a16c69adb09cf3","observation_id":"aea580a3-da06-40b3-b1ea-011da4aaf94e","resolution":{"observed_at":"2026-08-15T22:00:44.924990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-08-12T13:12:28.417467Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-08-15T22:00:44.639812Z","title":"Diffusion policies as an expressive policy class for offline reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.639812Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:6bf729af0f638bcbdd6461cfaaf16c0043e09e4c49c5c7dad00d100d9a284ec7","observation_id":"0e7ea865-e7f0-41db-9239-097a4b24eef5","resolution":{"observed_at":"2026-08-15T22:00:44.639812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:44.907454Z","title":"Versatile diffusion: Text, images and variations all in one diffusion model","venue":null,"work_id":"3e537aec-63e1-4d98-abf9-31e6b10ec790","year":2023},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.644327Z"},"links":{"citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:b47dde3303be0ac8353f983ded424a138749da131b0d1184e8ed447236dd1dcb","observation_id":"eb3b5b29-30f8-4673-bb4b-d01a430244b5","resolution":{"observed_at":"2026-08-15T22:00:44.911686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:44.648554Z","title":"Diffusion models: A comprehensive survey of methods and applications","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.648554Z"},"links":{"citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:c28c80c8dab269b7991aeb7153b88cbb0e4ce1c7c8aa51eff65c617d6fab9ac2","observation_id":"8d1cde92-41b9-41b5-b1f6-6d6531ffacd2","resolution":{"observed_at":"2026-08-15T22:00:44.648554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13122","last_updated":"2023-05-22T15:23:41Z","snapshot_observed_at":"2026-08-16T15:31:03.272444Z","submitted_at":"2023-05-22T15:23:41Z","title":"Policy Representation via Diffusion Probability Model for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13122","snapshot_observed_at":"2026-08-15T22:00:44.653389Z","title":"Policy representation via diffusion probability model for reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.653389Z"},"links":{"cited_paper":"/paper/2305.13122","citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:46c8031dbfffebee0c27099c5836d44fb4b93b26e1b53373401661e5e25baa48","observation_id":"6ddcdba1-0e16-444f-8174-d179812d7d65","resolution":{"observed_at":"2026-08-15T22:00:44.653389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:44.884676Z","title":"Madiff: Offline multi- agent learning with diffusion models","venue":null,"work_id":"7a16ac08-dfbe-491e-a3a2-e0b274b1f6d5","year":2024},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.657662Z"},"links":{"citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:cafbd31755de91ad459d8c2b3d5470c2015925df1a1594dbc6122440de270532","observation_id":"6ea350ce-a79e-474e-8e8d-b8eeeb0ea7b2","resolution":{"observed_at":"2026-08-15T22:00:44.890390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 2 inbound Pith citation observations for arXiv:2505.08376."}