{"as_of":"2026-08-16T07:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c9be4c77089f9ddfa44774ccdd6ddba4a4d80ffaf074108ed39d9c5671697170","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:48:31.145133Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.14913/citation-record","integrity":"/paper/2411.14913/integrity","json":"/paper/2411.14913/citation-record.json","paper":"/paper/2411.14913"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:32.645777Z","title":"More than a million ways to be pushed. a high-fidelity experimental dataset of planar pushing,","venue":null,"work_id":"4435d674-2a0a-4f06-b694-720e32e033fb","year":2016},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.208011Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:5db487fb8954567356f6d44d73b65245cc106eef53ca52382e62734209dde0e9","observation_id":"febaaf23-7bc2-4db0-aaa7-4f39263a23d6","resolution":{"observed_at":"2026-08-12T14:48:32.650628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:30.253015Z","title":"Universal manipulation policy network for articulated objects,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.253015Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:eac862f6b94a9356c08e7dfc4eebcae1eabaabeb4bd0e42f5230fcabdd78cbb7","observation_id":"2e987559-d8d3-42c6-977b-3681fb0bbda7","resolution":{"observed_at":"2026-08-12T14:48:30.253015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:32.624699Z","title":"Contact mode guided motion planning for quasidynamic dexterous manipulation in 3d,","venue":null,"work_id":"f3bb24b6-1b4d-4910-a339-c652a9485312","year":2022},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.290187Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:ffd791cc87ddbf72ec8306c1e50888b1a28f8e4a953e51854d150d0ffa1cd3de","observation_id":"1a75905d-b5ac-42fa-ba83-0edffe4ea4c6","resolution":{"observed_at":"2026-08-12T14:48:32.630088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:32.597077Z","title":"Robust execution of contact-rich motion plans by hybrid force-velocity control,","venue":null,"work_id":"ae2829e7-9ae0-4bfa-b040-80e004513919","year":2019},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.297194Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:b9a36da885230c0189d5293bd082ed085c76f045f2b645033731b35aecb3aa32","observation_id":"479c545a-6014-4ddd-b08b-c9646d8193fd","resolution":{"observed_at":"2026-08-12T14:48:32.614794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:30.301732Z","title":"Where2act: From pixels to actions for articulated 3d objects,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.301732Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:28298d5433467633c6364fef07618bc832235091cf0f14b7afdbcbebd979b225","observation_id":"c53d2d1a-604b-47a9-ace7-ebac2fa809b9","resolution":{"observed_at":"2026-08-12T14:48:30.301732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:32.435798Z","title":"A hybrid ap- proach for learning to shift and grasp with elaborate motion primitives,","venue":null,"work_id":"8c912b03-fd4b-4dc5-b39e-b464efd511ff","year":2022},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.307584Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:0adeeadcbf668f30d68f294e448d8279d32e69f2585c213a703c95dc8f57320c","observation_id":"cbeb2135-84d4-49b1-a847-2fa387cd788a","resolution":{"observed_at":"2026-08-12T14:48:32.514804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:32.422510Z","title":"HACMan: Learning hybrid actor-critic maps for 6d non-prehensile manipulation,","venue":null,"work_id":"9d7b9b9e-a4a8-4fe5-9933-506149d4a295","year":2023},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.312679Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:b29ece84c570591ca4d186abcdabe759dcb10687397c76b7fee3c89ccb46ab6d","observation_id":"1d942933-55b9-4e51-961b-083d0e64ef95","resolution":{"observed_at":"2026-08-12T14:48:32.427188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:32.401924Z","title":"Neural probabilistic motor primitives for humanoid control,","venue":null,"work_id":"347738fc-ab5d-473c-87f2-d919c5b8e42e","year":2018},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.317265Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:024c342ef69ab81fe523f230faf189ce81495d6bd1805f38ee8e38b5b6059b42","observation_id":"3338448e-d685-4d7c-b588-a4e3a8586a9a","resolution":{"observed_at":"2026-08-12T14:48:32.411626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:32.319945Z","title":"One solution is not all you need: Few-shot extrapolation via structured maxent rl,","venue":null,"work_id":"12b1d848-80b2-478c-8f89-88114a8b2f84","year":2020},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.327409Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:b3e47e42e1ba786ec9e0de0e987650ae7d744ba0f7d5e88e8880e4b8497a4f02","observation_id":"cfc29a3f-d8d7-4374-ae24-1fca99e592b4","resolution":{"observed_at":"2026-08-12T14:48:32.391541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:32.212832Z","title":"Towards diverse behaviors: A benchmark for imitation learning with human demonstrations,","venue":null,"work_id":"4446a5e0-5817-4ece-8010-8cb91d1cf43b","year":2024},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.331673Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:57938bbda68037ba7bc22534ac7489fb360a6135adec64d586ea4c3b2ce64d61","observation_id":"979267e3-f894-4fce-ae47-5855016d8858","resolution":{"observed_at":"2026-08-12T14:48:32.217674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:30.336068Z","title":"Generative modeling by estimating gradients of the data distribution,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.336068Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:77b5356128f1b3ba02c56d44fadc82913e5cc2cae979d181281f1a70492444d8","observation_id":"8bd8e382-fd56-4845-9821-0cf9cf098f34","resolution":{"observed_at":"2026-08-12T14:48:30.336068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:32.186681Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":"3a1a6d3a-a9ee-4008-b515-6942e254f760","year":2020},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.407421Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:57341d127551d01c349232ffaf255d89846df8af4815405c60577d4b367f0584","observation_id":"82698cde-04d1-4b2e-9295-6ab8f6afda8f","resolution":{"observed_at":"2026-08-12T14:48:32.192466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:32.172923Z","title":"Consistency models as a rich and efficient policy class for reinforcement learning,","venue":null,"work_id":"834e5aeb-2a7d-437e-be1f-f791738dcbe0","year":2023},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.441302Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:5791d5f56c10234c5fbc0cf359bcde9ec7798e94af0876b77685aeb0bbd71609","observation_id":"c804a0d1-1ca5-4d03-b7c1-24eca2324a76","resolution":{"observed_at":"2026-08-12T14:48:32.178538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04137","last_updated":"2024-03-14T04:36:31Z","snapshot_observed_at":"2026-08-08T17:26:38.829859Z","submitted_at":"2023-03-07T18:50:03Z","title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04137","snapshot_observed_at":"2026-08-12T14:48:30.445107Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.445107Z"},"links":{"cited_paper":"/paper/2303.04137","citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:951816c3b656550c19b1bf59429368a4c341457762a69a368a71376ac0a2b647","observation_id":"4132dd47-ce97-4ada-ae68-ec39528e956c","resolution":{"observed_at":"2026-08-12T14:48:30.445107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:30.449264Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.449264Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:cf8356ce4e0e698ddc210bd18bb0e9b9e4f40f39a295c1146c54bf03de44d558","observation_id":"3cb50867-76c9-4a8d-9b78-b660fce80f5a","resolution":{"observed_at":"2026-08-12T14:48:30.449264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:32.032691Z","title":"Diffusion policies as an expres- sive policy class for offline reinforcement learning,","venue":null,"work_id":"faee1587-c17d-4826-8ca2-03583cdfe2a6","year":2023},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.453629Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:e6c0db4402539421f893afa5e6baca3eda687222f20f2034e248ec948b5017dc","observation_id":"f3e76ecb-0486-48e8-a388-876af8021b81","resolution":{"observed_at":"2026-08-12T14:48:32.086460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-08-14T17:40:51.391072Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10573","snapshot_observed_at":"2026-08-12T14:48:30.456981Z","title":"Idql: Implicit q-learning as an actor-critic method with diffusion policies,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.456981Z"},"links":{"cited_paper":"/paper/2304.10573","citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:87fb2b3fcb0cf613d002b758958171e9e98ca638411fdbed08ebfc108fac7b6f","observation_id":"7db96815-8116-4981-a547-b4c5667593c6","resolution":{"observed_at":"2026-08-12T14:48:30.456981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:32.015962Z","title":"Contrastive energy prediction for exact energy-guided diffusion sampling in offline rein- forcement learning,","venue":null,"work_id":"0f84f7fc-3371-4569-822f-4a96f2531f0b","year":2023},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.461079Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:e7ea381e8d35264642b1ac5cd7f46215ebcc70729761bd9265a9671d1e445a84","observation_id":"fb1e5365-808a-4aed-80b5-93622854b0aa","resolution":{"observed_at":"2026-08-12T14:48:32.022523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:31.997412Z","title":"Reasoning with latent diffusion in offline reinforcement learning,","venue":null,"work_id":"0a161283-6ab4-41e4-8657-b406d724c96a","year":2024},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.466056Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:988ac9f66c5d5b3920a5ccb5d4da5ac13660ecd8d82be1abb32b806ac8ae2cbe","observation_id":"c1d14f4e-e628-450f-9fdf-8f22efdf5685","resolution":{"observed_at":"2026-08-12T14:48:32.003866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:31.936069Z","title":"Learning multimodal behaviors from scratch with diffusion policy gra- dient,","venue":null,"work_id":"12cdc745-7c80-43e7-b4da-885b860d41be","year":2024},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.471054Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:ecca76e1008f925c60c4def86af3ae5d25fc8d16c5ca36be3493bbd41ba1ec69","observation_id":"3f20cc24-feda-4eaa-8275-0f7a0a07c414","resolution":{"observed_at":"2026-08-12T14:48:31.986176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:30.535443Z","title":"Goal conditioned imitation learning using score-based diffusion policies,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.535443Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:e9b20037df3bae7c16823eaf2dee78cbde20a3ddf2f1c2ef8d09a9211aa9d4e9","observation_id":"7c4b0b4d-dc00-4779-8421-0aa0d2e0f4bf","resolution":{"observed_at":"2026-08-12T14:48:30.535443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.10677","last_updated":"2023-03-03T14:18:34Z","snapshot_observed_at":"2026-08-16T05:30:48.381214Z","submitted_at":"2023-01-25T16:31:05Z","title":"Imitating Human Behaviour with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.10677","snapshot_observed_at":"2026-08-12T14:48:30.554087Z","title":"Imitating human behaviour with diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.554087Z"},"links":{"cited_paper":"/paper/2301.10677","citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:475327ba86cad0b245eadd3b9b8dd161b34f7aac8a891a62bd5f0dd4ee65dfc5","observation_id":"04668f23-4699-45d8-a425-c681d4c0efea","resolution":{"observed_at":"2026-08-12T14:48:30.554087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:31.827272Z","title":"Offline reinforcement learning via high-fidelity generative behavior modeling,","venue":null,"work_id":"8d6832fb-49f7-4c7e-9410-6e31436055f7","year":2022},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.558475Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:d0de270227ad2fcb3a575d17e339ff22bfdc790eaab35ff17f885c1f4935f5eb","observation_id":"97b68a1f-13a8-4b39-a9c3-22b4e0ef2ba1","resolution":{"observed_at":"2026-08-12T14:48:31.831815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05333","last_updated":"2024-02-28T13:48:09Z","snapshot_observed_at":"2026-08-14T19:16:27.834636Z","submitted_at":"2023-10-09T01:29:17Z","title":"DiffCPS: Diffusion Model based Constrained Policy Search for Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05333","snapshot_observed_at":"2026-08-12T14:48:30.566974Z","title":"Diffcps: Diffusion model based constrained policy search for offline reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.566974Z"},"links":{"cited_paper":"/paper/2310.05333","citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:178743f6a6a9fa02fd0793cc28adaf611a81e65a895b6e0b88b562a861b8e7f9","observation_id":"2a066b47-4a55-4a5d-a829-8387ae8fe6ab","resolution":{"observed_at":"2026-08-12T14:48:30.566974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:31.809923Z","title":"Reinforcement learning by reward-weighted regression for operational space control,","venue":null,"work_id":"f9e023ae-7813-45da-a399-c0fd4eabeba5","year":2007},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.571741Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:917efda1662b570d3dc8ed7eb1807362fd9fbc43c71ccde7ec8fe4331f5aa94c","observation_id":"12d4195b-1f5e-4283-afa2-0f415ee5c68d","resolution":{"observed_at":"2026-08-12T14:48:31.817442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12192","last_updated":"2023-02-23T17:34:53Z","snapshot_observed_at":"2026-07-06T14:55:12.100148Z","submitted_at":"2023-02-23T17:34:53Z","title":"Aligning Text-to-Image Models using Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12192","snapshot_observed_at":"2026-08-12T14:48:30.576870Z","title":"Aligning text-to-image models using human feedback,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.576870Z"},"links":{"cited_paper":"/paper/2302.12192","citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:324f41e7c9540f09cb71653d70a229d8e2707b5357a52f1a28f86e3a2f0c8e7b","observation_id":"b5c01eb9-1942-46df-99ad-84bad7c3c82d","resolution":{"observed_at":"2026-08-12T14:48:30.576870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:31.749739Z","title":"Training diffu- sion models with reinforcement learning,","venue":null,"work_id":"42e51b78-d42e-4e69-85b4-c13bcf880e87","year":2024},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.582788Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:b3accfc781dd0765ab3efa5a3184e895a00b65ea8b701acaa31c116d7aadfd50","observation_id":"8b7bf6a0-807f-4f07-9b2a-c3f141ad4e3d","resolution":{"observed_at":"2026-08-12T14:48:31.775250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:31.644104Z","title":"Feedback efficient online fine-tuning of diffusion models,","venue":null,"work_id":"7c4b9e63-9427-4afd-bbcf-f1ca8d5de83e","year":2024},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.636935Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:60f34bc85e4be658cca60cef3b6013290b5cdaebe4742cf621ddc1c3020e2a4e","observation_id":"6a3811f4-1d56-419b-852a-e2158a0ea7e2","resolution":{"observed_at":"2026-08-12T14:48:31.680380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15194","last_updated":"2024-02-28T09:21:46Z","snapshot_observed_at":"2026-08-16T02:11:54.433929Z","submitted_at":"2024-02-23T08:54:42Z","title":"Fine-Tuning of Continuous-Time Diffusion Models as Entropy-Regularized Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15194","snapshot_observed_at":"2026-08-12T14:48:30.702335Z","title":"Fine-tuning of continuous-time diffusion models as entropy-regularized control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.702335Z"},"links":{"cited_paper":"/paper/2402.15194","citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:c246aba820a782dd334c04dfeceae8d9f14a094493ef3b664d3af37235e43add","observation_id":"5d8a776e-3d03-4c7d-98f3-7f5eed0ee754","resolution":{"observed_at":"2026-08-12T14:48:30.702335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11752","last_updated":"2025-02-13T23:18:56Z","snapshot_observed_at":"2026-08-13T04:59:02.679984Z","submitted_at":"2023-12-18T23:31:01Z","title":"Learning a Diffusion Model Policy from Rewards via Q-Score Matching","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11752","snapshot_observed_at":"2026-08-12T14:48:30.730504Z","title":"Learning a diffu- sion model policy from rewards via q-score matching,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.730504Z"},"links":{"cited_paper":"/paper/2312.11752","citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:511050e1893f32977460ebbf4dd245dacae7aaef68836cab64adf991c08ad773","observation_id":"07e6a49b-df04-46df-a177-0ec39454bb38","resolution":{"observed_at":"2026-08-12T14:48:30.730504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:31.629152Z","title":"Learning to grasp the ungraspable with emergent extrinsic dexterity,","venue":null,"work_id":"bb05fa47-b401-4fc2-91e3-a84d62d2e28f","year":2023},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.763856Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:6a6835d284b279d987ae459f9c01283a635967f7891f7246083c03c03a5e97e6","observation_id":"d133409f-5e61-4eb1-b9c7-7cbc44aa5dc9","resolution":{"observed_at":"2026-08-12T14:48:31.633781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:31.613659Z","title":"HACMan++: Spatially-Grounded Motion Primitives for Manipulation,","venue":null,"work_id":"424ff1c2-051c-4649-9e16-227a7f84ab7e","year":2024},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.768341Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:5b5d79b147cbc7594604db95d9b7bcc057ce88ce5d85ae6ade7fefa4d755d5ac","observation_id":"ef4e8979-893b-4e21-9e65-cac4c88f15ad","resolution":{"observed_at":"2026-08-12T14:48:31.618674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10008","last_updated":"2024-06-10T08:11:00Z","snapshot_observed_at":"2026-08-13T05:00:44.600728Z","submitted_at":"2023-12-15T18:24:28Z","title":"Movement Primitive Diffusion: Learning Gentle Robotic Manipulation of Deformable Objects","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10008","snapshot_observed_at":"2026-08-12T14:48:30.773327Z","title":"Movement primitive diffusion: Learning gentle robotic manipulation of deformable objects,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.773327Z"},"links":{"cited_paper":"/paper/2312.10008","citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:f8ceafaeb8309340352aa75ee8d29eae6379964f90e208ef458a708045a09197","observation_id":"029051f9-eaa8-4283-bd00-b022b9f11dd1","resolution":{"observed_at":"2026-08-12T14:48:30.773327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:31.599961Z","title":"Prodmp: A unified perspective on dynamic and probabilistic movement primitives,","venue":null,"work_id":"b68f514d-d93f-4a53-85af-6daaabe32ba2","year":2023},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.813419Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:540558ffa0ffefc07c2f70e7ceb1a5694eb37d913f6183db5d90123591b434f8","observation_id":"97c47ffc-57ad-41e6-a856-8b8872294587","resolution":{"observed_at":"2026-08-12T14:48:31.603752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:30.884271Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.884271Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:940acc07a9d3424d57feec997914bb944a416f51c5fc37f2b435d18cb0f9614b","observation_id":"a5800fa0-bde8-4854-82da-8d05ba552610","resolution":{"observed_at":"2026-08-12T14:48:30.884271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:30.900665Z","title":"Addressing function approxi- mation error in actor-critic methods,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.900665Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:66f727142382b4fb331727d314ea5d899b80953eb9c4c37c6e8de539e841bf16","observation_id":"27e20965-b422-4714-a147-4d42b4dfab8b","resolution":{"observed_at":"2026-08-12T14:48:30.900665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:30.907379Z","title":"Consistency models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.907379Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:33750eacf17ad0361f6a911475309d650a698ec67c26aa04192dcabd20452f9f","observation_id":"087c788b-56b8-4e55-aefc-36b0c2131136","resolution":{"observed_at":"2026-08-12T14:48:30.907379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:31.408429Z","title":"Efficient diffusion policies for offline reinforcement learning,","venue":null,"work_id":"dd210820-1ced-4a84-9299-0ce2105e0553","year":2024},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.911471Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:042cb30ad812494c15467e4b8a03c504098601f2b088fb0b4b43234fbb16ad7a","observation_id":"ad867a0e-e135-418b-a7f4-ef48bca2e324","resolution":{"observed_at":"2026-08-12T14:48:31.468490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:30.916306Z","title":"A minimalist approach to offline reinforce- ment learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.916306Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:02f142e5db609fb521f7a5af78d1f810dfe0942a7327f16baf8d3a705e733155","observation_id":"bec46b24-0ecb-46ad-afc0-e6dd48881143","resolution":{"observed_at":"2026-08-12T14:48:30.916306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.00909","last_updated":"2018-05-20T20:03:59Z","snapshot_observed_at":"2026-08-08T20:31:18.897748Z","submitted_at":"2018-05-02T17:11:20Z","title":"Reinforcement Learning and Control as Probabilistic Inference: Tutorial and Review","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.00909","snapshot_observed_at":"2026-08-12T14:48:30.997318Z","title":"Reinforcement learning and control as probabilistic infer- ence: Tutorial and review,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.997318Z"},"links":{"cited_paper":"/paper/1805.00909","citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:9b9eb11b1882049caf2fb5b8f7119694ba0e8bd23d5c7eabd54d05b33cd3b988","observation_id":"56f2f064-2e36-4252-ba89-aead5995fa7c","resolution":{"observed_at":"2026-08-12T14:48:30.997318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.12293","last_updated":"2025-01-18T02:57:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-25T15:32:31Z","title":"robosuite: A Modular Simulation Framework and Benchmark for Robot Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.12293","snapshot_observed_at":"2026-08-12T14:48:31.095992Z","title":"robosuite: A modular simulation framework and benchmark for robot learning,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:31.095992Z"},"links":{"cited_paper":"/paper/2009.12293","citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:a77d73dbaaff64d527549bfec3949bca0f0346ae20b07ba3d7c5345baa08df0c","observation_id":"85d899b7-b03c-40dd-b295-b59a4411a9ba","resolution":{"observed_at":"2026-08-12T14:48:31.095992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:31.127842Z","title":"Mujoco: A physics engine for model- based control,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:31.127842Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:129254903f154e02810b23d062047d7427812b68afe4da13ee7f94fbeb6368f2","observation_id":"73e5f864-71e1-40bd-a30f-532ab89c1b59","resolution":{"observed_at":"2026-08-12T14:48:31.127842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:31.376649Z","title":"Deep reinforcement learning at the edge of the statistical precipice,","venue":null,"work_id":"aba126e7-742f-4f9d-a6f7-3a4108a81aab","year":2021},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:31.140165Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:7fa3130ff6976b974196f80e28875a925ca7cb69dc9246cac8cb0539f2238cd0","observation_id":"d671c6fe-2f47-4ef7-b420-2b808b940341","resolution":{"observed_at":"2026-08-12T14:48:31.382002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:31.314195Z","title":"CORN: Contact-based Object Representation for Nonprehensile Manipulation of General Unseen Ob- jects,","venue":null,"work_id":"b55dae82-8c0c-4451-8552-1e992aa89ee8","year":2024},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:31.145133Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:ecda68dd9ece9b6ed79cc905a0e876df46fab369f76e2a26f12885dd4ec017d0","observation_id":"17f99b32-432b-42a4-95d7-2c3c60adb074","resolution":{"observed_at":"2026-08-12T14:48:31.343831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2411.14913."}