{"as_of":"2026-08-18T21:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2dc56b80b92e114ce3b8589e79491081fd09cb16d01baaabb2fb73fb0e07bfc7","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T23:08:40.265657Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.03903/citation-record","integrity":"/paper/2607.03903/integrity","json":"/paper/2607.03903/citation-record.json","paper":"/paper/2607.03903"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Multi-task reinforcement learning in humans,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:71cab6b9b5c164d9b35cb27dd73e60b29679596f26abb800ea01db5a0b08e289","observation_id":"04215f3e-cbd5-4350-87d1-73ea8106ee6a","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Curriculum-based asymmetric multi-task reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:c49c1254328470e45ea57fc79007f70977d909a979bf1feb9c4e1e330188387c","observation_id":"78568ca2-ebcf-4eb2-b629-442bf8354ade","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Multi-task reinforcement learning with soft modularization,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:697a6015d57d3284d4140165cc275bfcfb51fc08fa88effa78a488d7f0a77d1d","observation_id":"e8401553-28ba-4030-a384-fdecf499a8e6","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:55bed116d79e17cb371d3cbfca4d678f2cdc6518542ab640b90289f1c2b8478d","observation_id":"85014611-7711-4779-a668-2f8ded09b135","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Lifelong robotic reinforcement learning by retain- ing experiences,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:46c8a141809b4274d621b67c03a0d1a18a3d1229f6a24faa65f8e8c0142ec494","observation_id":"eca7f036-0ecf-486d-8e84-da5a1b94307d","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Multi-task batch reinforcement learning with metric learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:df6ab669740661eeefd3d3c28a342f5e435512130baca776af77e01a46f36812","observation_id":"f0cde9cc-16e7-4061-a377-db73341ac6e4","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"A discrete soft actor-critic decision-making strategy with sample filter for freeway autonomous driving,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:3fd5c26256017fbe5f725759fc31cd1d692bbb6453ca933f7ae2f8454eeb53b0","observation_id":"7011936b-dbaf-4b89-9134-67177c8cf823","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Longitudinal speed control of autonomous vehicle based on a self-adaptive pid of radial basis function neural network,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:0e744ebc9cc63ce68fccc2424108631042f8dfbfa5959adee2697a4c6c16c63b","observation_id":"535df503-54ef-418a-a2e0-e8df750a437b","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Skills regularized task decomposition for multi-task offline reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:adc7b035f8bf8679ff6e1327dc171c9a177ec99ffc18d5626e1687a70f62f614","observation_id":"d36a1702-7b0e-46cc-8e83-b534d062bb31","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Gnfactor: Multi-task real robot learning with generalizable neural feature fields,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:b23d6a8f33e685e7cdfb8ea8a45e21ca9d708f047333d8030036ae85684402b5","observation_id":"a3bb215a-fff6-4d4e-a7b4-40d26ce5967a","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Multi-task learning with attention for end-to-end autonomous driving,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:3dc3a4a7d92ce817f81103fda556417c43b9f70bfcf2105b1619c8f09eabd27a","observation_id":"37bb97f4-f969-4205-a369-03a9161b1150","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Aoi-aware resource allocation for platoon-based c-v2x networks via multi-agent multi-task reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:ce4ddb851d17ff938d9ff5cc10b2627e0ac049cfaf770d59a4015ea8dd9c23d0","observation_id":"e8db3227-1a37-4aaf-be21-081a44d449a1","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"A multi-task-learning- based transfer deep reinforcement learning design for autonomic optical networks,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:ddda094c775e65040ef0558868e897c66e67d7abe75e05d9fc4a6c4bbba7b2ba","observation_id":"ad6befa9-10eb-4c8f-adfb-a5eeb7f5d7fe","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Multi-task deep reinforcement learning with popart,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:b545de97dcf9a57326b37fa311c40576a6856fb9bcd32eb9148051989ad3d57a","observation_id":"f357e30b-a7f7-4a1e-bec8-0906be7d7d0e","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"A survey of multi-task deep reinforcement learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:3001984bff3a5781ab2453e9906843d5d5de47a99d441073460ccdea05be6828","observation_id":"e2dd1870-e2a1-4184-b4e8-62efd9255ec0","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Provably efficient multi-task reinforcement learning with model transfer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:3ba957fe59b8d8a45938fba0d5ee5d4219f204d23d48ae5e8a1d425747b2c84a","observation_id":"a9a12da8-f332-4892-afb0-91690f5e9322","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Toward trustworthy decision-making for autonomous vehicles: A robust reinforcement learning approach with safety guarantees,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:6382f1f4f7c9578cb996dace7336b152e1b08896ebb34a53cbcd77974cb30854","observation_id":"432fc9e5-ea89-46eb-9e2f-71f78d66c57a","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Residual policy learning facilitates efficient model-free autonomous racing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:f1e34bc0aa6187aaf54aab0c8aeb26e8cd3bc56fc4547169f7f2f68ef0a45997","observation_id":"ec10fa17-d8fc-4038-8c3a-2f4508b5ad15","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Metadrive: Composing diverse driving scenarios for generalizable reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:809d623c464f7b7626600f59acca8a777d99451dcedeb06cec4606690c539ccd","observation_id":"ed90efe3-db99-47b7-80bd-bc7de3155f43","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Safe reinforce- ment learning for arm manipulation with constrained markov decision process,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:a204301fc1ea7c7ed323c4d56bab4b3de897432ed3b21b06906fc4a17ff07ddd","observation_id":"410eba7c-13b2-46d5-8036-3c62bb6d0dda","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Safe exploration in reinforcement learning: A generalized formulation and algorithms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:a854e8b3ba9ea036ff325f4718ef0a6e5b091be6ba8396a3ec6f55c00cda23e2","observation_id":"a262a2f5-2a6d-4917-af90-3a0dc6bb5548","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Constraints penalized q-learning for safe offline reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:f3cdbe708d59f6047e54ca67ade7680b3b5e36f4a1ca1c06ecef19baf93ed0dc","observation_id":"63bce3eb-9a31-4a2b-aa39-349ec3226858","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Poce: Primal policy optimization with conservative estimation for multi-constraint offline reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:bd5bbd1699206815068f42d528caf7c4533f8b93ad156170d2243421186676a3","observation_id":"50f5dd15-e308-499a-904a-30b27a8c02de","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.08957","last_updated":"2022-04-19T15:55:47Z","snapshot_observed_at":"2026-08-18T14:03:18.344581Z","submitted_at":"2022-04-19T15:55:47Z","title":"COptiDICE: Offline Constrained Reinforcement Learning via Stationary Distribution Correction Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.08957","snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Coptidice: Offline constrained reinforcement learning via stationary distribution correction estimation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"cited_paper":"/paper/2204.08957","citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:e483682d15feda67f1087d15e176a6a4c9f1cef5400262ccc6db4ea1bf24f97f","observation_id":"a707e98a-f7d7-4455-9fec-02180bf40a8b","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Constrained offline policy optimization,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:abbfddeaa8e9c179053f99097dd5cb187b2e0f0d45e058815d0dde71a9df74ea","observation_id":"22bffaf7-f2e7-45fc-bb6e-8303d334c4da","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"VOCE: Variational optimization with conservative estimation for offline safe reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:eab5ee1f57ccc18482d885982eb53d218a28e0c754e384b241e54e936cfbdffe","observation_id":"d8c62032-9432-4079-9e18-cfd32453242f","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Sharing knowledge in multi-task deep reinforcement learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:6819e2d16386e0dff2e62f3192ffa8c378a07110cfea1d443dd89c1584f79671","observation_id":"8ba410fd-1e3b-4a29-970b-ee61f7dceb71","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Optimization of deep rein- forcement learning with hybrid multi-task learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:b8d421c782bc0675e98c8893049916fb8b90ffb99abf250c91420b9d48116343","observation_id":"bd2a67a6-bb02-442c-a4d2-910be17c46db","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Conservative data sharing for multi-task offline reinforcement learn- ing,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:dd44fb1eb1d3e52954a6522889dbbee636f49287cfc14beb4d12e15acbd52aa4","observation_id":"f6a90f3c-1ff9-4842-be12-236436203226","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Multi-task reinforcement learning with context-based representations,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:44f48ac49c34b530ea0fe49217fa371c6ef9e3c580d92f238c47bfa147d9ae3f","observation_id":"041c4b91-1984-4753-8405-209afc81834a","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Just pick a sign: Optimizing deep multitask models 13 with gradient sign dropout,","venue":null,"work_id":null,"year":2039},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:b00541d6bb457015c596a70e0ea48e3e64e48f8c0ed91d3733d07d9fbd7efcae","observation_id":"1f08d56f-cf93-419b-bf43-2cd9065ce8a4","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Conflict-averse gradi- ent descent for multi-task learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:cdf7852b6c39aec9c3a92d8f4abd00a459e145601e6b46b26d784e91d3937d36","observation_id":"3e90d6ca-8eaa-4595-a6b8-93c9793c159f","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Multi-task reinforcement learning with soft modularization,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:a4471332de8807ff3b66919a0f1a9000d51b4b75ca9f4d9ef31bbe2a3ade7053","observation_id":"72639a85-8282-4e0f-b770-af0412fdcfd0","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Paco: Parameter- compositional multi-task reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:f69e2c125b65e959420fb540a912e47cc85af8a7b1944cc2e0eef2e9666f9285","observation_id":"07039ef1-2186-463f-8601-900f8bd706cb","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Recomposing the reinforcement learning building blocks with hypernetworks,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:dd546be6a8167fbfc921ebf4bd3f2dbd3770ccb58ed27cb37b2cd18126bb5001","observation_id":"cba640cc-e760-4ed9-ae9a-8d03c92ca955","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Batch policy learning under con- straints,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:989439a1fe02bb9c2bfb81639977c32130a4805292d291db49a306df1ce04f9b","observation_id":"9d6386d1-c764-4e8a-ac9a-e88b7048e76c","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Gendice: Generalized offline estimation of stationary values,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:8780245d6756852b5a477f58013b58854e0aaaf3292b677631d0e8364a83e8a6","observation_id":"01b17824-fda4-4304-ba42-1011f98c43d8","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Coindice: Off-policy confidence interval estimation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:e242e348647c0464d7dba65ae0f173da39202b5bc5b6593c4ab468323e00dbde","observation_id":"1d467ab3-19b5-418c-9c3b-9c3f119e17a8","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Optidice: Offline policy optimization via stationary distribution correction estimation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:3198cf13a67584f303949b231a0ea204e8526b8cf202fc66768a3d356d553e16","observation_id":"63db115a-f3ff-4da7-86cd-0a051b679802","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Coptidice: Offline constrained reinforcement learning via stationary distribution correction estimation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:020accc2f058ffa3de0aec8fdbc096c1e9843568e34b0f344fba5386e95a118b","observation_id":"88b23f5a-8ef6-4337-bbd7-3ca1270b5bb3","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Con- strained decision transformer for offline safe reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:665dc28c00f3373b01c1e8e84e4248a4142afde68b9cd922bcc7554076a500c8","observation_id":"408dd544-0752-4cee-86e3-fcea984b2612","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12203","last_updated":"2023-01-28T13:57:01Z","snapshot_observed_at":"2026-08-16T15:59:30.749082Z","submitted_at":"2023-01-28T13:57:01Z","title":"SaFormer: A Conditional Sequence Modeling Approach to Offline Safe Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12203","snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Saformer: A conditional sequence model- ing approach to offline safe reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"cited_paper":"/paper/2301.12203","citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:bde0ec439bcaeadefd2df71a098ec6ed64d77c84ad8c8bcbe17ffadaa6508d17","observation_id":"261e6b07-d454-4bdc-b184-dd007f6f6389","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Scaling up multi-task robotic reinforcement learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:4f2115a087cf62fcd609d704a1816ba87e0ca09e0a922046313264006488d061","observation_id":"359ceb8b-ec38-48b3-b69e-99e2da34c471","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Perceiver-actor: A multi-task transformer for robotic manipulation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:d2735555f1e63477ad9de523ae5804e4867d8a53235d5d036027a1170f004ede","observation_id":"6c55a0ba-910f-4450-a2c6-f6142620ac55","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Effective adapta- tion in multi-task co-training for unified autonomous driving,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:fa746a5b499eb78a82a7466467816fc9c2548c92962812cfb37886d7c21b73c4","observation_id":"51b76292-c5c2-4e61-8e2d-da4d55fae113","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1603.02041","last_updated":"2016-03-07T13:03:30Z","snapshot_observed_at":"2026-08-17T03:01:39.144946Z","submitted_at":"2016-03-07T13:03:30Z","title":"Learning Shared Representations in Multi-task Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1603.02041","snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Learning shared rep- resentations in multi-task reinforcement learning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"cited_paper":"/paper/1603.02041","citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:d5d32aeb6d440507beaefb5f9326766d6734a6dd6670059ded6332cd161fd574","observation_id":"e85b19b2-0c02-4001-a53a-16d4e8c33ebe","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Multi-task reinforcement learning with attention-based mixture of experts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:7f8456d0dfd5cadfc7a70e1c367faad47e6e8aba3cd5ae7577f1e8cb7cba082b","observation_id":"fca99087-09fa-4cdc-be77-6356f9c207a9","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Shar- ing knowledge in multi-task deep reinforcement learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:0fd8d3fff3e6c72ef1b4623018f6f482259d3e3acd77d5518d4b1c62c26a344a","observation_id":"dcb0bde3-8120-4158-8291-d522ed1947e4","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Impala: Scalable dis- tributed deep-rl with importance weighted actor-learner architectures,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:cc88d2111f5eb47da0f5ec1a8a7923c1805a77d51c669e1d5ea20c76b2b891ee","observation_id":"a23cecb9-da15-4f56-bcd0-1f997388c2d1","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.09464","last_updated":"2018-03-10T18:11:25Z","snapshot_observed_at":"2026-08-14T19:42:01.790871Z","submitted_at":"2018-02-26T17:20:14Z","title":"Multi-Goal Reinforcement Learning: Challenging Robotics Environments and Request for Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.09464","snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Multi-goal reinforcement learning: Challenging robotics environments and request for research,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"cited_paper":"/paper/1802.09464","citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:3fb307d212bbcfe1ff3ee04ec84ef38a8f9bd3bedbbc4b183151b0396d81ba51","observation_id":"71e56d1a-4a0f-4976-9896-25059432d99c","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Asynchronous methods for deep rein- forcement learning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:b57b30c5172ab627bd0bdec366a0d45f0c949f82e550153e0114fcdf2e864786","observation_id":"0906c6cc-10fc-4c38-8215-bbc8217065aa","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Deterministic policy gradient algorithms,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:d5f048fb25301b543ed42c72e0c31709d90bb371e3734922e1bf1838aef8f7c5","observation_id":"dd044dfc-433f-4600-92a0-71c95af95851","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Sharing knowledge in multi-task deep reinforcement learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:a6c2e9997b06a6c78ff6fa665960ef71fba13f39cffd9be7c1ed0abcc4910759","observation_id":"0117f10b-a10a-4084-af08-890c7a2919cf","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Multi-game decision transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:7e406e5f79c974cd2723051434a055781fd55018642eed5318867a3b0ea309ba","observation_id":"172b9bf1-720f-45e8-b4ac-7a499fa9a65c","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Diffusion model is an effective planner and data synthesizer for multi-task reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:06f8a59cf702836882ed1bc0800b95013e8f7feb3a4dfd600aaa69624816588f","observation_id":"874cb008-cd0a-4220-a280-7ee59b1d64a9","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Altman,Constrained Markov decision processes: stochastic modeling","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:7697f69d4859e2689190bd59ed3abd7b2b74528dd808687bfd45b68d695a73d8","observation_id":"7f5ff869-a440-4920-9332-faa881bf7fb0","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Conservative q-learning for offline reinforcement learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:b787ded5a520ddcf1c6d7767af5432207537c8664d14fd97f02530755031a043","observation_id":"54aabce8-3c12-40d9-8c2f-22b2c1b44b20","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Uac: Offline reinforcement learning with uncertain action constraint,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:90180e5553293590e5feebd92cd3b143492c33beb89b79979476ec04d49e110a","observation_id":"55e9c038-06c9-4532-b8e1-3b36e574fd41","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Generative modeling by estimating gradients of the data distribution,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:9cd40c2d8e73a9cc1b3b979e9fe5ef3e9ef3c1fa02f881750f14fbf4df1f1041","observation_id":"438511c9-900e-43b2-9145-0fbcb758174d","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:65cb3e669b0facc6e58ecc28dc79e078fe2dc8c4b35997524f4c25a604e2e0c9","observation_id":"b34c99d7-b0b7-4a2a-b573-88ead452794b","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Variational inference: A review for statisticians,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:c8405a141d2ad0fe0a7ae86db04100c1d3025274af3c929a832686898ff18487","observation_id":"c88020b8-d7b2-497d-8191-89017e501692","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Efficient diffusion policies for offline reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:e45008b248e3c984d5cc685001e32dd48599989ee4e677a0612c7e16862ee25b","observation_id":"b2aa7cf6-2102-4bca-9ddc-b2afb73c66d1","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Is conditional generative modeling all you need for decision-making?","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:b8998950f4fad84c1be28fd64886ed10e068efb87fc7b25360f60583ff3ee6c2","observation_id":"2088c7e4-4445-47ea-90d5-6f4693828239","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Efficient learning of safe driving policy via human-ai copilot optimization,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:ddc478e369139f01223066fc14e6158fdc789f292f225da5eff2e2902ae82daa","observation_id":"09d3b324-2deb-46b5-917f-bc4b34bc58a7","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Safe driving via expert guided policy optimization,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:3a92951241a43f5040b7019438ec230753898f7f80cda29efcbf5df22f4345f4","observation_id":"8c49a55d-b920-49b0-8f79-caf907222248","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:3bac89f08c0c7fbe3549d135758a941c66c7969f037783858c6a9126fb89e4d1","observation_id":"f53a6df2-0e63-48bd-96f6-af342ceb79b9","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Gradnorm: Gradient normalization for adaptive loss balancing in deep multitask networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:62163c7e41b1e1415893f77917bb1ed21686a2a0a77c2260323ded874a4cea40","observation_id":"0c43d1b9-4e05-453a-a078-1e62b90a8aa4","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09303","last_updated":"2023-06-16T17:54:06Z","snapshot_observed_at":"2026-08-16T15:23:34.841529Z","submitted_at":"2023-06-15T17:31:26Z","title":"Datasets and Benchmarks for Offline Safe Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09303","snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Datasets and benchmarks for offline safe reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"cited_paper":"/paper/2306.09303","citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:b5de1aadee460fff159d9d64674bbdc66ec01741e3f41e1055e97b58eef5b737","observation_id":"3c08cf8e-55d0-414e-b187-1e2135b5b822","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Learning to simulate self-driven particles system with coordinated policy optimization,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:f49e8a6822e91af7ef4afdabc91bbc471b1711bc2b6c9b36c3b9407bb4ead200","observation_id":"bdd159d0-4bfc-44fc-9bdd-cae2bc960446","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.11970","last_updated":"2022-08-25T09:55:25Z","snapshot_observed_at":"2026-08-16T16:36:58.573650Z","submitted_at":"2022-08-25T09:55:25Z","title":"Understanding Diffusion Models: A Unified Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.11970","snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Understanding diffusion models: A unified perspective,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"cited_paper":"/paper/2208.11970","citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:3e4422c842a45eb5936bf95508968ace9ebdee8b587d8a9fc4d4701d12d11846","observation_id":"46128661-48c8-405d-a494-c4536aa2b14b","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Denoising diffusion implicit models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:c69914709deb6c49151b784f4778216ef37d7c431f3f15865851564701dff3c5","observation_id":"b1dfffcf-03fc-4dbc-93b4-ae055fee408a","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"Table 2 outlines the primary network parameters of the model implemented by our CDCP algorithm","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:3651754914977876b7f904610caf7f067923fd543edb4e202ca684748c3a50ef","observation_id":"0c153df2-0c33-49fe-b757-f5384b2ed6f4","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:08:40.265657Z","title":"These scenarios include environments such as curves, intersections, T-junctions, and roundabouts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-11T23:08:40.265657Z"},"links":{"citing_paper":"/paper/2607.03903"},"observation_digest":"sha256:1d127cbf86d68a1f7153525eabbe72e90fff70efe6cc9f1b187726e19e8a66c3","observation_id":"0e01d0a9-bb72-4baf-a8da-d7ba5a9ae430","resolution":{"observed_at":"2026-07-11T23:08:40.265657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.03903","last_updated":"2026-07-04T14:57:35Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T04:18:16.544875Z","submitted_at":"2026-07-04T14:57:35Z","title":"CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":73,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 0 inbound Pith citation observations for arXiv:2607.03903."}