{"as_of":"2026-08-10T08:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:13687f6e32589a39742b6b67b16f5a6e52ccd352ff6ce28e2db77e2abafde355","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T18:15:50.566587Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T09:27:43.453005Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T19:40:06.781891Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2603.13707","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.13707","snapshot_observed_at":"2026-07-31T02:03:17.213017Z","title":"REFINE-DP: Diffusion policy fine-tuning for hu- manoid loco-manipulation via reinforcement learning,","venue":null,"work_id":"8ecf4a19-2e9e-4c6c-84e9-c13ea589b6d5","year":2026},"citing_paper":{"arxiv_id":"2606.12604","last_updated":"2026-06-10T19:01:40Z","snapshot_observed_at":"2026-08-05T03:29:41.720044Z","submitted_at":"2026-06-10T19:01:40Z","title":"EgoEngine: From Egocentric Human Videos to High-Fidelity Dexterous Robot Demonstrations","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T09:27:43.453005Z"},"links":{"cited_paper":"/paper/2603.13707","citing_paper":"/paper/2606.12604"},"observation_digest":"sha256:07bd4a868d3026c63e6faadd885c4cf440d9f4f2d603b21b7a5b5d5ea026166b","observation_id":"f2339b25-7a1a-432e-bffe-48e6c843d5f8","resolution":{"observed_at":"2026-07-31T02:03:17.213017Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2603.13707","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.13707","snapshot_observed_at":"2026-07-31T02:03:17.213017Z","title":"REFINE-DP: Diffusion policy fine-tuning for hu- manoid loco-manipulation via reinforcement learning,","venue":null,"work_id":"8ecf4a19-2e9e-4c6c-84e9-c13ea589b6d5","year":2026},"citing_paper":{"arxiv_id":"2606.25706","last_updated":"2026-06-24T11:19:38Z","snapshot_observed_at":"2026-08-09T12:05:06.071705Z","submitted_at":"2026-06-24T11:19:38Z","title":"Learning Asynchronous Upper-body Task-space Trajectory Tracking Policy for Humanoid Robots","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-25T21:08:43.127148Z"},"links":{"cited_paper":"/paper/2603.13707","citing_paper":"/paper/2606.25706"},"observation_digest":"sha256:29466dae1cbabf227aa8cc4570878f9c1b7e52f38cbfd378eae2cec23911948a","observation_id":"a50faa90-7ed9-4a1f-bec1-50924d3641f0","resolution":{"observed_at":"2026-07-31T02:03:17.213017Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2603.13707/citation-record","integrity":"/paper/2603.13707/integrity","json":"/paper/2603.13707/citation-record.json","paper":"/paper/2603.13707"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:46.683331Z","title":"Tai- loring solution accuracy for fast whole-body model predictive control of legged robots,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:46.683331Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:432cedbb12d2a72265b1af5ad8373fd0f97a9a91fcd93cecfd14fb6ede0c6c9f","observation_id":"e6b7662f-cde7-401e-9e3a-835639d176c8","resolution":{"observed_at":"2026-08-02T18:15:46.683331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:46.732651Z","title":"Seec: Stable end- effector control with model-enhanced residual learning for humanoid loco-manipulation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:46.732651Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:def95b1116ebacb3ddf09b17a3750350753cdb0ad56ee905aaab663f6d247bdd","observation_id":"cb16dc8d-5e96-4cbc-976b-0b522170c050","resolution":{"observed_at":"2026-08-02T18:15:46.732651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:46.790300Z","title":"Omnih2o: Universal and dexterous human-to-humanoid whole-body teleoperation and learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:46.790300Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:7b578b277aa7622f5dcbb9ae608955f702c79284b59fd3d9df7d65167287d89e","observation_id":"2295d57f-360b-4992-a9d3-82cd7fa09cb2","resolution":{"observed_at":"2026-08-02T18:15:46.790300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:46.842412Z","title":"Humanplus: Hu- manoid shadowing and imitation from humans,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:46.842412Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:0956240b118ff23559e1735cacb93cbf9e50bca4f472a628849df3693b962dd0","observation_id":"84b3c53a-dbff-4d45-9410-8d34a65a5fb3","resolution":{"observed_at":"2026-08-02T18:15:46.842412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:46.914916Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:46.914916Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:e7f8f9b8ead4e3e975fed329dcd54269662e058faa3920b55de8adfacb08d79b","observation_id":"edd77b51-2099-48ca-a89d-46c35361b14d","resolution":{"observed_at":"2026-08-02T18:15:46.914916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:46.991325Z","title":"Diffusion policy policy optimization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:46.991325Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:6ae8e5c03ae390ee1b3febe6728f7506db48ee6f41c3aed98c12952ad650ad6a","observation_id":"7d07d19c-11c7-4a8e-a39e-c1fab143f97c","resolution":{"observed_at":"2026-08-02T18:15:46.991325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:47.147433Z","title":"Ppf: Pre-training and preservative fine-tuning of humanoid locomotion via model-assumption- based regularization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:47.147433Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:4e385c3126ba4118809bca611c37aaffc5c956efb3214b02834fef8e07000c00","observation_id":"07be161b-a45e-434d-99a7-ae6c5e9fdf43","resolution":{"observed_at":"2026-08-02T18:15:47.147433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:47.274577Z","title":"Humanoid locomotion and manipulation: Current progress and challenges in control, planning, and learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:47.274577Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:9c03905b64d84f2d231f10a58441af04c3e241fe7602027ba8174ed63add1bdb","observation_id":"47997f94-1242-468f-a641-6d34497aa582","resolution":{"observed_at":"2026-08-02T18:15:47.274577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:47.413631Z","title":"Twist2: Scalable, portable, and holistic humanoid data collection system,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:47.413631Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:8e9fdee31db0589b600d5dc91a9838179099150de96709098209555f76a00015","observation_id":"a9a935df-5963-4bfc-951e-ffd88bd011e3","resolution":{"observed_at":"2026-08-02T18:15:47.413631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:47.556653Z","title":"Falcon: Learning force-adaptive humanoid loco- manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:47.556653Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:676e7b9192def54131e8e8324c48714b6b329106c18d86ded5a713eb4c292894","observation_id":"7ca0f4b8-9443-4b8f-8845-4eded4a28ad2","resolution":{"observed_at":"2026-08-02T18:15:47.556653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07773","last_updated":"2025-03-09T08:41:46Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:59:50Z","title":"Mobile-TeleVision: Predictive Motion Priors for Humanoid Whole-Body Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07773","snapshot_observed_at":"2026-08-02T18:15:47.698722Z","title":"Mobile-television: Predictive motion priors for humanoid whole-body control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:47.698722Z"},"links":{"cited_paper":"/paper/2412.07773","citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:afc06a50d3c9664374092ee9e231a33c5a10312bb78ec05c9a28371716274069","observation_id":"32751e62-7876-4883-b9af-9eee0fad104d","resolution":{"observed_at":"2026-08-02T18:15:47.698722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:47.782052Z","title":"HOMIE: Humanoid Loco-Manipulation with Isomorphic Exoskeleton Cockpit,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:47.782052Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:fcbf58491d1bc53803ff453c73051f91618c892b8230b1b26deb9c6f8f79607b","observation_id":"dca8669d-b1e6-4fca-9040-c7b2c8ed063b","resolution":{"observed_at":"2026-08-02T18:15:47.782052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:47.894940Z","title":"Wococo: Learning whole-body humanoid control with sequential contacts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:47.894940Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:41d06948dac1c1de3efbe1a2b9adf1f34754863e291181fb710b85f270cfa842","observation_id":"5f0f052b-fb0e-4015-b6f2-5ba8b3f8715f","resolution":{"observed_at":"2026-08-02T18:15:47.894940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:47.969528Z","title":"Curiosity-driven learning of joint locomotion and manipulation tasks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:47.969528Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:ef22297cc9b07eac3ef862ed96cc289f8159e8a7ca4711593bb2be3f998c2710","observation_id":"65a300ab-954f-470b-a9bf-cfa9e50c9245","resolution":{"observed_at":"2026-08-02T18:15:47.969528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:48.052472Z","title":"Learning agile soccer skills for a bipedal robot with deep reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:48.052472Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:b03cfa51f866cc853ac5066a1a85670235bf36d722519878d5abfe1cf1754e9e","observation_id":"9670c6cc-c8b7-4d52-840a-2308ebb17a2d","resolution":{"observed_at":"2026-08-02T18:15:48.052472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:48.158430Z","title":"Opening the sim-to-real door for humanoid pixel-to- action policy transfer,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:48.158430Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:30de9eef34ee2c749fecb148fb4d2f220c8184fb9101889209df188e27ce4000","observation_id":"4ede54d1-788d-4f23-ae2f-730e90754b08","resolution":{"observed_at":"2026-08-02T18:15:48.158430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:48.240523Z","title":"Sim-to-real learning for humanoid box loco-manipulation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:48.240523Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:e2981c591f597a8ca41070998698e331a941178e23a174ce1ff903e1a0d52629","observation_id":"ad6f6515-edfb-4643-b4e8-bb7021c761e3","resolution":{"observed_at":"2026-08-02T18:15:48.240523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:48.351210Z","title":"Opt2skill: Imitating dynamically-feasible whole-body trajectories for versatile humanoid loco-manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:48.351210Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:eb07832bdb94bc109dd6c667571bc487dc2071aa3ea4b7a074204ff59b1efb0e","observation_id":"cda389a6-1076-4912-a836-ce51652aa1ef","resolution":{"observed_at":"2026-08-02T18:15:48.351210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:48.460920Z","title":"Hier- archical planning and control for box loco-manipulation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:48.460920Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:4d53398e5d8465299f2ca0e1522aadd081cc310198e099584a55574e7b03c191","observation_id":"5d206791-09fb-47d7-b75b-c5e671578c54","resolution":{"observed_at":"2026-08-02T18:15:48.460920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:48.602126Z","title":"Learning fine-grained bimanual manipulation with low-cost hardware,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:48.602126Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:08e40187391e36483eae2e01109f136433f1d7319c3c21501d6821ebd0ba1f07","observation_id":"5673059d-8830-4ad6-9cf8-3cadadb9e32b","resolution":{"observed_at":"2026-08-02T18:15:48.602126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:48.703596Z","title":"Visualmimic: Visual humanoid loco-manipulation via motion tracking and generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:48.703596Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:093ae9d25688425ac6125df89b284a7a5b025ad08d85882caa2beb6eefddf2db","observation_id":"f72cddf3-1bdd-4d01-a9ab-da6283afaff1","resolution":{"observed_at":"2026-08-02T18:15:48.703596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:48.879849Z","title":"Hdmi: Learning interactive humanoid whole-body control from human videos,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:48.879849Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:845e8eb00fb0a1455fa86d1c30a01aeaf153635583432a0866eec9778f396777","observation_id":"b0343bb9-65fe-4e55-b041-d126507fe94e","resolution":{"observed_at":"2026-08-02T18:15:48.879849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:48.992696Z","title":"From imitation to refinement – residual rl for precise assembly,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:48.992696Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:9e5591032517b0b2ee3d116bcfcd5d4bad668f045d2d9318e5757e6f8fef72dc","observation_id":"305bb488-6dba-4fc5-b99a-b45adbe7e23e","resolution":{"observed_at":"2026-08-02T18:15:48.992696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:49.131081Z","title":"Rfs: Reinforce- ment learning with residual flow steering for dexterous manipulation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:49.131081Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:96d6950a834245ff846097744b407f4a71c89dd5fe6aff0e5711c18f5241b4db","observation_id":"db184c3c-63c1-4d1c-a119-5f2ecc1f6247","resolution":{"observed_at":"2026-08-02T18:15:49.131081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:49.220783Z","title":"Residual off-policy rl for finetuning behavior cloning policies,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:49.220783Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:a2cbda4516a3b3d26f960cdb950413f76faade34eed15a32b8bdef1d25a938f3","observation_id":"2b63d6d6-8220-4e3e-b889-07204454c797","resolution":{"observed_at":"2026-08-02T18:15:49.220783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-02T18:15:49.360402Z","title":"Prox- imal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:49.360402Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:89e328e654ef4705a728539797dbab20d8e2bf964f04fa262759ec7f72cd9d5f","observation_id":"ba798607-ea78-49cd-8cab-0fc7deef9f1d","resolution":{"observed_at":"2026-08-02T18:15:49.360402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:49.499122Z","title":"Efficient online reinforcement learning for diffusion policy,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:49.499122Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:d36939f7ea4a053a8cddeff200f97eefdcacb9e6c07cbe436d7bb0e3f97ab8f5","observation_id":"a74d813b-ea64-4e86-8bcb-913bf209e99a","resolution":{"observed_at":"2026-08-02T18:15:49.499122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:49.582649Z","title":"π RL: Online rl fine-tuning for flow-based vision- language-action models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:49.582649Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:87116356e3b42a3ca5d527d972ea587b92d8ba1076ad427614d5f1dc6657d5b5","observation_id":"2d72b892-502b-4cf9-859d-f9f25451a1e1","resolution":{"observed_at":"2026-08-02T18:15:49.582649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.04831","last_updated":"2025-11-06T21:43:02Z","snapshot_observed_at":"2026-08-07T13:59:26.312342Z","submitted_at":"2025-11-06T21:43:02Z","title":"Isaac Lab: A GPU-Accelerated Simulation Framework for Multi-Modal Robot Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.04831","snapshot_observed_at":"2026-08-02T18:15:49.694818Z","title":"Isaac lab: A gpu-accelerated simulation framework for multi-modal robot learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:49.694818Z"},"links":{"cited_paper":"/paper/2511.04831","citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:27ba76be6827ff0f583db6ff62edfef04887673604433c51ffa65a7d42d9b262","observation_id":"71651857-4908-47c2-b5e4-35b53fd4ce40","resolution":{"observed_at":"2026-08-02T18:15:49.694818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10363","last_updated":"2025-04-27T13:49:42Z","snapshot_observed_at":"2026-08-07T18:16:59.585516Z","submitted_at":"2025-02-14T18:42:42Z","title":"BeamDojo: Learning Agile Humanoid Locomotion on Sparse Footholds","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10363","snapshot_observed_at":"2026-08-02T18:15:49.743659Z","title":"Beamdojo: Learning agile humanoid locomotion on sparse footholds,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:49.743659Z"},"links":{"cited_paper":"/paper/2502.10363","citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:51689530d631f19b2d10423e811b38e5e582b1813a53af3ec71e1addf5d15f4a","observation_id":"c50a1bac-1116-4886-b20a-53a708757a20","resolution":{"observed_at":"2026-08-02T18:15:49.743659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:49.850902Z","title":"Re- inforcement learning-based footstep control for humanoid robots on complex terrain,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:49.850902Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:c96815c40d41ca81b0f052d54138b6ebd17ebd6540b847e79d98a5a2f04af706","observation_id":"6331e3f7-12eb-42d1-bd60-c692afb82ef9","resolution":{"observed_at":"2026-08-02T18:15:49.850902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:49.972201Z","title":"Deepmimic: example-guided deep reinforcement learning of physics-based character skills,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:49.972201Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:d1294efe6f1b132ef60d8db22d37b1785700f181fb66920f45958c7ea0ccce7d","observation_id":"9a56f533-4561-4441-948a-38df0a363957","resolution":{"observed_at":"2026-08-02T18:15:49.972201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:50.018839Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:50.018839Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:9d1de2c32e1fbb6348557e7f7a8f227c3879c86b27168fa9c154dcdeed3f9906","observation_id":"9b0f6f8a-4800-4fe7-bcaf-7c045b10541a","resolution":{"observed_at":"2026-08-02T18:15:50.018839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:50.103256Z","title":"High- dimensional continuous control using generalized advantage estimation,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:50.103256Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:f92c32e722a1818b211eb471daaebc22ff59a8064c6ed32be82339976e2e076b","observation_id":"e83cbd15-2b66-4150-b438-78460c0ee39d","resolution":{"observed_at":"2026-08-02T18:15:50.103256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:50.196798Z","title":"Improved Denoising Diffusion Proba- bilistic Models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:50.196798Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:cc5ec3c0b3dee4022c0bf0f85833152c6ba7de2b0a2d5534bdd3421934d2ef27","observation_id":"8284605d-37e2-41f7-ad39-7cd5e70c5cb0","resolution":{"observed_at":"2026-08-02T18:15:50.196798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:50.306809Z","title":"Stageact: Stage-conditioned imitation for robust humanoid door opening,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:50.306809Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:422dd10091b5569b2e6cccc80266f491d9d773c404718e6c054a01fea4a3cb23","observation_id":"00433e31-41fc-4383-aaae-c9853f160f01","resolution":{"observed_at":"2026-08-02T18:15:50.306809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:50.566587Z","title":"A behavior architecture for fast humanoid robot door traversals,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:50.566587Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:5c4c6b33c550d513a27a0b9c261a820238f41a58ffd446e90a95edeb2d29389e","observation_id":"1d79d6f4-75fa-4a49-bd1e-2b3d38e2fc76","resolution":{"observed_at":"2026-08-02T18:15:50.566587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","latest_version":3,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-08T07:32:59.369638Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 2 inbound Pith citation observations for arXiv:2603.13707."}