{"as_of":"2026-08-11T08:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1145f458dc62457f3084c7120341b1ce201ce8696eb3deb5413aef16b194ce8b","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T05:38:58.035337Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.11432/citation-record","integrity":"/paper/2607.11432/integrity","json":"/paper/2607.11432/citation-record.json","paper":"/paper/2607.11432"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-07-14T05:38:58.035337Z","title":"Concrete problems in AI safety.arXiv preprint arXiv:1606.06565,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11432","last_updated":"2026-07-13T11:37:27Z","snapshot_observed_at":"2026-07-16T23:19:47.238990Z","submitted_at":"2026-07-13T11:37:27Z","title":"Generalizing Preference-based Reinforcement Learning: a Rationality Model for Incomparability","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T05:38:58.035337Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2607.11432"},"observation_digest":"sha256:11b9daaac6fce11346aa1c11a0cc9922aad8e3f0edb4625a4e42c081cac73dee","observation_id":"554e12db-c1dc-4230-9f60-07df4766662e","resolution":{"observed_at":"2026-07-14T05:38:58.035337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.02575","last_updated":"2020-06-03T23:08:00Z","snapshot_observed_at":"2026-07-06T09:17:58.886592Z","submitted_at":"2020-05-06T03:29:27Z","title":"Active Preference-Based Gaussian Process Regression for Reward Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.02575","snapshot_observed_at":"2026-07-14T05:38:58.035337Z","title":"Active preference-based gaussian process regression for reward learning.arXiv preprint arXiv:2005.02575,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.11432","last_updated":"2026-07-13T11:37:27Z","snapshot_observed_at":"2026-07-16T23:19:47.238990Z","submitted_at":"2026-07-13T11:37:27Z","title":"Generalizing Preference-based Reinforcement Learning: a Rationality Model for Incomparability","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T05:38:58.035337Z"},"links":{"cited_paper":"/paper/2005.02575","citing_paper":"/paper/2607.11432"},"observation_digest":"sha256:955eaf613b566e9d4f42e883f4bfe909ce78c529bbb6f855c954b8f59694dd07","observation_id":"f0f231be-1acc-4612-8e83-f3a3a9ba6fef","resolution":{"observed_at":"2026-07-14T05:38:58.035337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:38:58.035337Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.11432","last_updated":"2026-07-13T11:37:27Z","snapshot_observed_at":"2026-07-16T23:19:47.238990Z","submitted_at":"2026-07-13T11:37:27Z","title":"Generalizing Preference-based Reinforcement Learning: a Rationality Model for Incomparability","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T05:38:58.035337Z"},"links":{"citing_paper":"/paper/2607.11432"},"observation_digest":"sha256:19a214cba09742be352b9c6d87f56b9c47f4f3e806d420beb24cbbf68b524342","observation_id":"4c80310a-3406-43f2-b43a-25b1b79ce8e8","resolution":{"observed_at":"2026-07-14T05:38:58.035337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17466","last_updated":"2024-07-24T17:58:49Z","snapshot_observed_at":"2026-07-06T18:51:28.182977Z","submitted_at":"2024-07-24T17:58:49Z","title":"Traversing Pareto Optimal Policies: Provably Efficient Multi-Objective Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17466","snapshot_observed_at":"2026-07-14T05:38:58.035337Z","title":"Traversing pareto optimal poli- cies: Provably efficient multi-objective reinforcement learning.arXiv preprint arXiv:2407.17466,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11432","last_updated":"2026-07-13T11:37:27Z","snapshot_observed_at":"2026-07-16T23:19:47.238990Z","submitted_at":"2026-07-13T11:37:27Z","title":"Generalizing Preference-based Reinforcement Learning: a Rationality Model for Incomparability","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T05:38:58.035337Z"},"links":{"cited_paper":"/paper/2407.17466","citing_paper":"/paper/2607.11432"},"observation_digest":"sha256:5aa731c4d1a7ba4cf08b07397e3d5c70ce0c96690f26fa0a970f94b49dbd4e83","observation_id":"573a5b80-221b-4ab5-b35d-a7b27625e9ea","resolution":{"observed_at":"2026-07-14T05:38:58.035337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-14T05:38:58.035337Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11432","last_updated":"2026-07-13T11:37:27Z","snapshot_observed_at":"2026-07-16T23:19:47.238990Z","submitted_at":"2026-07-13T11:37:27Z","title":"Generalizing Preference-based Reinforcement Learning: a Rationality Model for Incomparability","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T05:38:58.035337Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.11432"},"observation_digest":"sha256:0a666941dbf6e206c574edc731fcd3adc85d8aa0cdc95a7cdb11b655a30f31e2","observation_id":"9f42a0cd-1d04-476e-80ce-b0d5d087b732","resolution":{"observed_at":"2026-07-14T05:38:58.035337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:38:58.035337Z","title":"Multi-Objective Reinforcement Learning.MORL addresses the challenge of optimizing multiple, often conflicting, criteria to discover a set of Pareto-optimal policies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11432","last_updated":"2026-07-13T11:37:27Z","snapshot_observed_at":"2026-07-16T23:19:47.238990Z","submitted_at":"2026-07-13T11:37:27Z","title":"Generalizing Preference-based Reinforcement Learning: a Rationality Model for Incomparability","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T05:38:58.035337Z"},"links":{"citing_paper":"/paper/2607.11432"},"observation_digest":"sha256:cc20029418b9eb4f9f6c152a311d0ed839608c885116e9494d3c35aba929e8cb","observation_id":"641d77a2-c8d0-49a0-9ccf-8864d3194904","resolution":{"observed_at":"2026-07-14T05:38:58.035337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:38:58.035337Z","title":"The CbRL setting has the same learning goal, i.e., recovering the Pareto frontier","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.11432","last_updated":"2026-07-13T11:37:27Z","snapshot_observed_at":"2026-07-16T23:19:47.238990Z","submitted_at":"2026-07-13T11:37:27Z","title":"Generalizing Preference-based Reinforcement Learning: a Rationality Model for Incomparability","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T05:38:58.035337Z"},"links":{"citing_paper":"/paper/2607.11432"},"observation_digest":"sha256:689cf2509047d392800cd6aebe59dbd07d3bb027c81609efc2ab8e3422a71409","observation_id":"77ecc75e-c5a9-4ce1-92cb-e8c05c63fd82","resolution":{"observed_at":"2026-07-14T05:38:58.035337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:38:58.035337Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11432","last_updated":"2026-07-13T11:37:27Z","snapshot_observed_at":"2026-07-16T23:19:47.238990Z","submitted_at":"2026-07-13T11:37:27Z","title":"Generalizing Preference-based Reinforcement Learning: a Rationality Model for Incomparability","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T05:38:58.035337Z"},"links":{"citing_paper":"/paper/2607.11432"},"observation_digest":"sha256:10ffa1edf081f1d21cbd208a4f81747fc13e2bba3d3663df66d7b9ebcda3ab01","observation_id":"9038cc68-5e3c-4179-aa88-30ed3e1f79d5","resolution":{"observed_at":"2026-07-14T05:38:58.035337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:38:58.035337Z","title":"weight” to refer to the scalarization weight of the multiple objectives rather than the term “preference","venue":null,"work_id":null,"year":1975},"citing_paper":{"arxiv_id":"2607.11432","last_updated":"2026-07-13T11:37:27Z","snapshot_observed_at":"2026-07-16T23:19:47.238990Z","submitted_at":"2026-07-13T11:37:27Z","title":"Generalizing Preference-based Reinforcement Learning: a Rationality Model for Incomparability","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T05:38:58.035337Z"},"links":{"citing_paper":"/paper/2607.11432"},"observation_digest":"sha256:73af76b7970d243747875f343fc95733e43e77985188cd0267534d08ac85c48d","observation_id":"f577a497-ff57-44a1-a624-95479a8935e1","resolution":{"observed_at":"2026-07-14T05:38:58.035337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:38:58.035337Z","title":"In recent years, novel rationality models have been proposed to tackle specific limitations of BT","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.11432","last_updated":"2026-07-13T11:37:27Z","snapshot_observed_at":"2026-07-16T23:19:47.238990Z","submitted_at":"2026-07-13T11:37:27Z","title":"Generalizing Preference-based Reinforcement Learning: a Rationality Model for Incomparability","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T05:38:58.035337Z"},"links":{"citing_paper":"/paper/2607.11432"},"observation_digest":"sha256:b28d6d44048c2e70a53cd5db45702ffe725bcc17252687536f1ab47e9052a5fe","observation_id":"14d1e812-55a5-4c12-979f-51514a55e527","resolution":{"observed_at":"2026-07-14T05:38:58.035337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:38:58.035337Z","title":"Finally, thegeneral preference optimization (Zhang et al.,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11432","last_updated":"2026-07-13T11:37:27Z","snapshot_observed_at":"2026-07-16T23:19:47.238990Z","submitted_at":"2026-07-13T11:37:27Z","title":"Generalizing Preference-based Reinforcement Learning: a Rationality Model for Incomparability","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T05:38:58.035337Z"},"links":{"citing_paper":"/paper/2607.11432"},"observation_digest":"sha256:c86b58d4b405bd87ea65ebb3ef21bc6fb0948805882240e44824bd8338d5778e","observation_id":"dd800939-999e-49a1-8751-35540713434e","resolution":{"observed_at":"2026-07-14T05:38:58.035337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:38:58.035337Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.11432","last_updated":"2026-07-13T11:37:27Z","snapshot_observed_at":"2026-07-16T23:19:47.238990Z","submitted_at":"2026-07-13T11:37:27Z","title":"Generalizing Preference-based Reinforcement Learning: a Rationality Model for Incomparability","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T05:38:58.035337Z"},"links":{"citing_paper":"/paper/2607.11432"},"observation_digest":"sha256:4876fc0cc0716077740d7ef95e718347c10ac8540049298d15516d8361622262","observation_id":"d12fb97f-66ef-41bf-b6db-5624aba5c736","resolution":{"observed_at":"2026-07-14T05:38:58.035337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:38:58.035337Z","title":"threshold of the sensory perception of the judge","venue":null,"work_id":null,"year":1970},"citing_paper":{"arxiv_id":"2607.11432","last_updated":"2026-07-13T11:37:27Z","snapshot_observed_at":"2026-07-16T23:19:47.238990Z","submitted_at":"2026-07-13T11:37:27Z","title":"Generalizing Preference-based Reinforcement Learning: a Rationality Model for Incomparability","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T05:38:58.035337Z"},"links":{"citing_paper":"/paper/2607.11432"},"observation_digest":"sha256:5e09c61bbd977fa07bfd7c784c2cc41b645f5251e7e42d35bc25f3af6563c530","observation_id":"c0526321-cdfe-4ba5-bd8a-30c18673c5b2","resolution":{"observed_at":"2026-07-14T05:38:58.035337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:38:58.035337Z","title":"The standard approach in the presence of incomparability in PbRL is to discard the query and consider the sample as erroneous (Christiano et al., 2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.11432","last_updated":"2026-07-13T11:37:27Z","snapshot_observed_at":"2026-07-16T23:19:47.238990Z","submitted_at":"2026-07-13T11:37:27Z","title":"Generalizing Preference-based Reinforcement Learning: a Rationality Model for Incomparability","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T05:38:58.035337Z"},"links":{"citing_paper":"/paper/2607.11432"},"observation_digest":"sha256:d31191134c23308a12f442599e5e4ca39403b87c04b90bb9aee3b48320612ffd","observation_id":"39fd50f1-3fbe-4eb1-9687-85274b0d49ed","resolution":{"observed_at":"2026-07-14T05:38:58.035337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:38:58.035337Z","title":"With respect toα, we have: ››∇αhąpτ, τ 1|θq ›› 2 “0, ››∇αhăpτ, τ 1|θq ›› 2 “0,››∇αh—pτ, τ 1|θq ›› 2 “1, ››∇αh∥pτ, τ 1|θq ›› 2 “0","venue":null,"work_id":null,"year":1985},"citing_paper":{"arxiv_id":"2607.11432","last_updated":"2026-07-13T11:37:27Z","snapshot_observed_at":"2026-07-16T23:19:47.238990Z","submitted_at":"2026-07-13T11:37:27Z","title":"Generalizing Preference-based Reinforcement Learning: a Rationality Model for Incomparability","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T05:38:58.035337Z"},"links":{"citing_paper":"/paper/2607.11432"},"observation_digest":"sha256:3e0038132383d94ae85435af0253a6817e590be6edce822946bc8eb11c0e4579","observation_id":"7746d8fb-8d28-41de-9673-0c30bb03e7a6","resolution":{"observed_at":"2026-07-14T05:38:58.035337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:38:58.035337Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.11432","last_updated":"2026-07-13T11:37:27Z","snapshot_observed_at":"2026-07-16T23:19:47.238990Z","submitted_at":"2026-07-13T11:37:27Z","title":"Generalizing Preference-based Reinforcement Learning: a Rationality Model for Incomparability","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T05:38:58.035337Z"},"links":{"citing_paper":"/paper/2607.11432"},"observation_digest":"sha256:9f2584dc5c1cd9570f4980edb3919102771bc4fc013cc12cdfe2e086defe0601","observation_id":"8db5559e-cbee-458d-9dc1-aff1040a8a0e","resolution":{"observed_at":"2026-07-14T05:38:58.035337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:38:58.035337Z","title":"First, we discuss the methodology of our experiments in Appendix D.1, covering the procedures for generating trajectories and comparison labels","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.11432","last_updated":"2026-07-13T11:37:27Z","snapshot_observed_at":"2026-07-16T23:19:47.238990Z","submitted_at":"2026-07-13T11:37:27Z","title":"Generalizing Preference-based Reinforcement Learning: a Rationality Model for Incomparability","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T05:38:58.035337Z"},"links":{"citing_paper":"/paper/2607.11432"},"observation_digest":"sha256:35bc130a48afdcef8ac28e8ab108b3db47cf951a98b9dfba2302b15877d6de06","observation_id":"b6d90144-a987-4d32-b713-d28d1f8cfcb2","resolution":{"observed_at":"2026-07-14T05:38:58.035337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:38:58.035337Z","title":"MO-Hopper.We use the mo-hopper-2obj-v5 environment from the MO-Gymnasium suite (Fel- ten et al., 2023), the multi-objective extension of Hopper-v5 (Towers et al., 2025)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11432","last_updated":"2026-07-13T11:37:27Z","snapshot_observed_at":"2026-07-16T23:19:47.238990Z","submitted_at":"2026-07-13T11:37:27Z","title":"Generalizing Preference-based Reinforcement Learning: a Rationality Model for Incomparability","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T05:38:58.035337Z"},"links":{"citing_paper":"/paper/2607.11432"},"observation_digest":"sha256:18c35b451569b48602ac7c857373bea649bfdf1e78c56ca6da3d288a47f42620","observation_id":"0f6386e3-b5ae-4c7c-95bb-acde4d51fd6c","resolution":{"observed_at":"2026-07-14T05:38:58.035337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:38:58.035337Z","title":"The Pareto frontier admits a closed-form solution under the LQR formalism, providing an exact reference for policy-level evaluation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.11432","last_updated":"2026-07-13T11:37:27Z","snapshot_observed_at":"2026-07-16T23:19:47.238990Z","submitted_at":"2026-07-13T11:37:27Z","title":"Generalizing Preference-based Reinforcement Learning: a Rationality Model for Incomparability","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T05:38:58.035337Z"},"links":{"citing_paper":"/paper/2607.11432"},"observation_digest":"sha256:224c8c81e98b4f0b191289e1b87001519ec31695cf31816da9ada6fd0c434563","observation_id":"7c06ebbf-2c68-4d63-9ceb-e050687b2a5d","resolution":{"observed_at":"2026-07-14T05:38:58.035337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:38:58.035337Z","title":"One common practical refinement to improve the overall performance is to employ an ensemble of predictors trained from randomized initializations","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.11432","last_updated":"2026-07-13T11:37:27Z","snapshot_observed_at":"2026-07-16T23:19:47.238990Z","submitted_at":"2026-07-13T11:37:27Z","title":"Generalizing Preference-based Reinforcement Learning: a Rationality Model for Incomparability","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T05:38:58.035337Z"},"links":{"citing_paper":"/paper/2607.11432"},"observation_digest":"sha256:135e0774285c443fb7285f1381adfc4a99a80a9df6777447153158c725b4b354","observation_id":"dd652548-bd16-4374-b0b2-2d7c0d388737","resolution":{"observed_at":"2026-07-14T05:38:58.035337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:38:58.035337Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.11432","last_updated":"2026-07-13T11:37:27Z","snapshot_observed_at":"2026-07-16T23:19:47.238990Z","submitted_at":"2026-07-13T11:37:27Z","title":"Generalizing Preference-based Reinforcement Learning: a Rationality Model for Incomparability","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T05:38:58.035337Z"},"links":{"citing_paper":"/paper/2607.11432"},"observation_digest":"sha256:62d6d0c02d4b4f35aab780608cc09fd8866231ade95703adedf8e96728741230","observation_id":"714c95c1-523b-485a-b87e-0a979c81b9e3","resolution":{"observed_at":"2026-07-14T05:38:58.035337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.11432","last_updated":"2026-07-13T11:37:27Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-16T23:19:47.238990Z","submitted_at":"2026-07-13T11:37:27Z","title":"Generalizing Preference-based Reinforcement Learning: a Rationality Model for Incomparability"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2607.11432."}