{"as_of":"2026-08-16T05:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4331cfc66f7f2cee7a124606db9db63c8ec5db092c057d9084e537dfd51b1fd7","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T03:33:04.223413Z","state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2602.07764/citation-record","integrity":"/paper/2602.07764/integrity","json":"/paper/2602.07764/citation-record.json","paper":"/paper/2602.07764"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:33:04.187857Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07764","last_updated":"2026-07-10T14:03:51Z","snapshot_observed_at":"2026-08-15T12:07:39.942602Z","submitted_at":"2026-02-08T01:45:01Z","title":"Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T03:33:04.187857Z"},"links":{"citing_paper":"/paper/2602.07764"},"observation_digest":"sha256:a5eaf736165f913d8fe2ab4a57d680b56d2f19b43130409eda4085fb7d98dda8","observation_id":"367208e2-3346-453d-b789-ce28b1603cea","resolution":{"observed_at":"2026-08-03T03:33:04.187857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.08342","snapshot_observed_at":"2026-08-03T03:33:04.179060Z","title":"org/CorpusId:271404860","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2602.07764","last_updated":"2026-07-10T14:03:51Z","snapshot_observed_at":"2026-08-15T12:07:39.942602Z","submitted_at":"2026-02-08T01:45:01Z","title":"Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T03:33:04.179060Z"},"links":{"cited_paper":"/paper/1908.08342","citing_paper":"/paper/2602.07764"},"observation_digest":"sha256:e7c8505053817e65c5fdb2bc54a3c8b1782b8c472e2453d9ab02d8ebff34b08d","observation_id":"77951548-8b8f-4916-baf2-c4370b614546","resolution":{"observed_at":"2026-08-03T03:33:04.179060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:33:04.194989Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07764","last_updated":"2026-07-10T14:03:51Z","snapshot_observed_at":"2026-08-15T12:07:39.942602Z","submitted_at":"2026-02-08T01:45:01Z","title":"Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T03:33:04.194989Z"},"links":{"citing_paper":"/paper/2602.07764"},"observation_digest":"sha256:6c12c60064da07d835739c58bffe2db7dca19a784b1031ecd5e3069780602cb5","observation_id":"1102797b-f85c-4156-b26c-aaf30457b684","resolution":{"observed_at":"2026-08-03T03:33:04.194989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:33:04.198801Z","title":"16 Decomposed, Diversity-Driven Policy Optimization Then gradient ascent converges to the set of stationary points ofJ(π)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07764","last_updated":"2026-07-10T14:03:51Z","snapshot_observed_at":"2026-08-15T12:07:39.942602Z","submitted_at":"2026-02-08T01:45:01Z","title":"Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T03:33:04.198801Z"},"links":{"citing_paper":"/paper/2602.07764"},"observation_digest":"sha256:b74e0994487bbf00e5e66b8a2dfafe68728e36e7378939692764eb24886e7155","observation_id":"7944cded-417b-4130-93cf-2a99628f429d","resolution":{"observed_at":"2026-08-03T03:33:04.198801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:33:04.191639Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07764","last_updated":"2026-07-10T14:03:51Z","snapshot_observed_at":"2026-08-15T12:07:39.942602Z","submitted_at":"2026-02-08T01:45:01Z","title":"Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T03:33:04.191639Z"},"links":{"citing_paper":"/paper/2602.07764"},"observation_digest":"sha256:cad83b2f97d2ff50bfcb5852257fcbc66ba7337b83db0a9106c777a9db582f1c","observation_id":"37102d1d-272a-45dd-9e15-0eaa11fbe060","resolution":{"observed_at":"2026-08-03T03:33:04.191639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:33:04.202501Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07764","last_updated":"2026-07-10T14:03:51Z","snapshot_observed_at":"2026-08-15T12:07:39.942602Z","submitted_at":"2026-02-08T01:45:01Z","title":"Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T03:33:04.202501Z"},"links":{"citing_paper":"/paper/2602.07764"},"observation_digest":"sha256:46ca2d2215f7c13359aab646aae1f9f576827f30a93045ed0cc379c7e7f2d0a1","observation_id":"589e2b91-2307-430d-98ee-d1fce62815c7","resolution":{"observed_at":"2026-08-03T03:33:04.202501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:33:04.205697Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07764","last_updated":"2026-07-10T14:03:51Z","snapshot_observed_at":"2026-08-15T12:07:39.942602Z","submitted_at":"2026-02-08T01:45:01Z","title":"Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T03:33:04.205697Z"},"links":{"citing_paper":"/paper/2602.07764"},"observation_digest":"sha256:4c2fd204f908aa778605e94f9d29dcf364eef1b1146eaa9a0f29fa00fd33d067","observation_id":"788c2421-dd9f-468f-9697-e0c7dfa12f2e","resolution":{"observed_at":"2026-08-03T03:33:04.205697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:33:04.209291Z","title":"Then lim t→∞ ∥∇J(θ t)∥= 0almost surely","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07764","last_updated":"2026-07-10T14:03:51Z","snapshot_observed_at":"2026-08-15T12:07:39.942602Z","submitted_at":"2026-02-08T01:45:01Z","title":"Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T03:33:04.209291Z"},"links":{"citing_paper":"/paper/2602.07764"},"observation_digest":"sha256:5295e3af3678f9c0402faa153f1ae30b80b1752da09b009422bca79dab58099b","observation_id":"e06cd141-afc1-441e-b972-60b8ec1386f9","resolution":{"observed_at":"2026-08-03T03:33:04.209291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:33:04.213020Z","title":"This environment showcases D3PO’s ability to reliably improve both reward quality and the structure of Pareto-optimal solutions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07764","last_updated":"2026-07-10T14:03:51Z","snapshot_observed_at":"2026-08-15T12:07:39.942602Z","submitted_at":"2026-02-08T01:45:01Z","title":"Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T03:33:04.213020Z"},"links":{"citing_paper":"/paper/2602.07764"},"observation_digest":"sha256:ffc8da82164f8638666eb6f3c537d2b4fea2d2a0e48af8669b447f65bb75d63f","observation_id":"d4e88ab7-453b-47b8-94d0-02fa5f27cc80","resolution":{"observed_at":"2026-08-03T03:33:04.213020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:33:04.216280Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07764","last_updated":"2026-07-10T14:03:51Z","snapshot_observed_at":"2026-08-15T12:07:39.942602Z","submitted_at":"2026-02-08T01:45:01Z","title":"Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T03:33:04.216280Z"},"links":{"citing_paper":"/paper/2602.07764"},"observation_digest":"sha256:da34b436b29815ba795ffe2154ed394ccd5b47f14b316628702d7af0d55055d4","observation_id":"3ee189ac-1bb1-40cc-9b7f-d738107d7a79","resolution":{"observed_at":"2026-08-03T03:33:04.216280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:33:04.219958Z","title":"These results highlight D 3PO’s robustness in high-dimensional, unstable regimes where conventional MORL baselines often struggle","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07764","last_updated":"2026-07-10T14:03:51Z","snapshot_observed_at":"2026-08-15T12:07:39.942602Z","submitted_at":"2026-02-08T01:45:01Z","title":"Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T03:33:04.219958Z"},"links":{"citing_paper":"/paper/2602.07764"},"observation_digest":"sha256:9c1667faea13c3aba8934d43713542d79100e5f628fd133bb8479d301a369214","observation_id":"ad509f00-5405-418c-bcc5-b4a4c19d15a3","resolution":{"observed_at":"2026-08-03T03:33:04.219958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:33:04.223413Z","title":"Importantly, in nearly all such cases, D 3PO still attains better mean performance, but the tests are dominated by large variance, typically from C-MORL","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2602.07764","last_updated":"2026-07-10T14:03:51Z","snapshot_observed_at":"2026-08-15T12:07:39.942602Z","submitted_at":"2026-02-08T01:45:01Z","title":"Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T03:33:04.223413Z"},"links":{"citing_paper":"/paper/2602.07764"},"observation_digest":"sha256:d769dee29f1887e053b3482fdcdfda302ff5dbbdda4d11ddd8b6b90fd2fc22c1","observation_id":"0b854ae7-ad8b-4bd3-9997-df649c7a83ab","resolution":{"observed_at":"2026-08-03T03:33:04.223413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06773","last_updated":"2025-01-14T16:08:28Z","snapshot_observed_at":"2026-08-14T04:50:24.502830Z","submitted_at":"2025-01-12T10:43:05Z","title":"Pareto Set Learning for Multi-Objective Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06773","snapshot_observed_at":"2026-08-03T03:33:04.174258Z","title":"URL https: //doi.org/10.1609/aaai.v38i11.29148","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.07764","last_updated":"2026-07-10T14:03:51Z","snapshot_observed_at":"2026-08-15T12:07:39.942602Z","submitted_at":"2026-02-08T01:45:01Z","title":"Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T03:33:04.174258Z"},"links":{"cited_paper":"/paper/2501.06773","citing_paper":"/paper/2602.07764"},"observation_digest":"sha256:f6ec96fb9df14347e710601383444f0e1f3ff79f79147ba2ebd28b0fd76a640a","observation_id":"d017fcf7-0138-492d-9d84-c2e46d78296a","resolution":{"observed_at":"2026-08-03T03:33:04.174258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:33:04.183177Z","title":"10 Decomposed, Diversity-Driven Policy Optimization A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.07764","last_updated":"2026-07-10T14:03:51Z","snapshot_observed_at":"2026-08-15T12:07:39.942602Z","submitted_at":"2026-02-08T01:45:01Z","title":"Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T03:33:04.183177Z"},"links":{"citing_paper":"/paper/2602.07764"},"observation_digest":"sha256:b26fc71271605c132c08fd0c6c6c27f03be8bafafcbc306b242e245658eebe54","observation_id":"5d761e5c-c4fe-4972-a8b5-e03497ac9220","resolution":{"observed_at":"2026-08-03T03:33:04.183177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.07764","last_updated":"2026-07-10T14:03:51Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T12:07:39.942602Z","submitted_at":"2026-02-08T01:45:01Z","title":"Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 0 inbound Pith citation observations for arXiv:2602.07764."}