{"as_of":"2026-08-09T20:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:faa7bd2055dea6e97c1eea369d0f84bce3bc364a0a48830912743c16f59c484f","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T07:16:24.447043Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T05:06:14.783929Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T05:41:23.798033Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"cited_work":{"arxiv_id":"2601.20753","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.20753","snapshot_observed_at":"2026-07-08T02:18:10.794709Z","title":"Jiang, Y","venue":null,"work_id":"fcb767d8-14e0-4a1f-929b-e6c5935ffe82","year":2026},"citing_paper":{"arxiv_id":"2605.10585","last_updated":"2026-05-11T13:58:49Z","snapshot_observed_at":"2026-08-02T21:44:59.660077Z","submitted_at":"2026-05-11T13:58:49Z","title":"Controllability in preference-conditioned multi-objective reinforcement learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-12T05:06:14.783929Z"},"links":{"cited_paper":"/paper/2601.20753","citing_paper":"/paper/2605.10585"},"observation_digest":"sha256:78f1dd46de7de2ad6dd5980deecd2a947406f3026cc97803163353ca516b9f08","observation_id":"94b06b96-8c3d-4907-a7d9-3e646fccc147","resolution":{"observed_at":"2026-07-08T02:18:10.794709Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2601.20753/citation-record","integrity":"/paper/2601.20753/integrity","json":"/paper/2601.20753/citation-record.json","paper":"/paper/2601.20753"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T07:16:22.907938Z","title":"Deep re- inforcement learning algorithm based on graph weight multi-pointer network for solving multiobjective travel- ing salesman problem.IEEE Access, 12:179091–179103,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:22.907938Z"},"links":{"citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:a0d0593c15cf6564e1cb8fe49cceddd4cd55c6e311c98295f1cd13b7aafccb97","observation_id":"a876add4-94d9-46f1-b677-9c80b268a4b3","resolution":{"observed_at":"2026-08-03T07:16:22.907938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T07:16:23.187630Z","title":"[Guet al., 2022 ] Qinghua Gu, Qingsong Xu, and Xuexian Li","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:23.187630Z"},"links":{"citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:4157202a4854f1b59979a6bca5b0c811c691f8a2850465090fc6073b883e6f14","observation_id":"522a511b-3764-4a57-a93d-39de75f3e344","resolution":{"observed_at":"2026-08-03T07:16:23.187630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T07:16:23.469485Z","title":"Huband, P","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:23.469485Z"},"links":{"citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:14809a17374b9e31f5c1061bb7da3d3e91b002d37e2da87b1358a08a53031991","observation_id":"4a2afd35-bffe-4935-9107-6d9481b131de","resolution":{"observed_at":"2026-08-03T07:16:23.469485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T07:16:23.674101Z","title":"Performance comparison of nsga-ii and nsga-iii on various many-objective test prob- lems.2016 IEEE Congress on Evolutionary Computation (CEC), pages 3045–3052,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:23.674101Z"},"links":{"citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:464ac11cd6780cd858e3b999e8413ba20b34403f5b682d07cf95f41036fb61cb","observation_id":"73c6d813-0606-429d-8c1e-e7688e240984","resolution":{"observed_at":"2026-08-03T07:16:23.674101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T07:16:23.830004Z","title":"Pareto set learning for neural multi-objective combinato- rial optimization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:23.830004Z"},"links":{"citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:e901e1fedda96dcd1b75e3772f55c121a9e338ef85b66ddf57ff5b5fae16ceb1","observation_id":"cf143e8f-187d-4d0c-afa1-3db3df6b4ebd","resolution":{"observed_at":"2026-08-03T07:16:23.830004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T07:16:23.912103Z","title":"Smooth tchebycheff scalarization for multi-objective optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:23.912103Z"},"links":{"citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:ccafb18f379b8d79f30f44eb1e2f470635c774fb094d64b77553902b78a66744","observation_id":"55a1d266-76b3-411b-93a1-c6a19ca03870","resolution":{"observed_at":"2026-08-03T07:16:23.912103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T07:16:23.997909Z","title":"Profiling pareto front with multi-objective stein varia- tional gradient descent","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:23.997909Z"},"links":{"citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:5f04e5c82f4edf9ad9e4bd4ccf078f61ba4396ad163b4e15c4305d01c11118f4","observation_id":"6e7b7fb6-3b1e-4f03-9983-12d02184dd44","resolution":{"observed_at":"2026-08-03T07:16:23.997909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T07:16:24.062446Z","title":"Pareto set learning for multi-objective reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:24.062446Z"},"links":{"citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:7674746eb4b4ac4eb38d1d1dd414e09ea3f3502cf62b8ca44c737538764f28ca","observation_id":"0e3d3234-a05d-400e-8b21-f8efa6085d6b","resolution":{"observed_at":"2026-08-03T07:16:24.062446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T07:16:24.157846Z","title":"Role play: Learning adaptive role-specific strategies in multi-agent interactions.Know.-Based Syst., 324(C), January","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:24.157846Z"},"links":{"citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:a1341d7562a63b42970bd8b277aec452750483e96eed9c01044d7307dd44a04d","observation_id":"3cd51d8e-f59b-40cd-8d7b-93947de9583a","resolution":{"observed_at":"2026-08-03T07:16:24.157846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T07:16:24.319294Z","title":"Multi-agent reinforcement learning for creating intelligent agents in social networks- oriented role playing games.Entertainment Computing, 54:100941,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:24.319294Z"},"links":{"citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:f8b16b5ab1595e2d700668e610369bb26b129b650bb2a95237c8ca5f1f43454e","observation_id":"d10365f2-990e-44c0-a213-75df90e6c6ee","resolution":{"observed_at":"2026-08-03T07:16:24.319294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T07:16:24.358863Z","title":"Training language models to follow instructions with human feed- back","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:24.358863Z"},"links":{"citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:6e1e7b19e286752b274140de6155a96dc5b0ea526177673e5c11ab7ea52523a2","observation_id":"2e707774-5b6f-48f4-89e0-82306fbde7e8","resolution":{"observed_at":"2026-08-03T07:16:24.358863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T07:16:24.404946Z","title":"Stable-baselines3: Reliable reinforcement learning implementations.Journal of Machine Learning Research, 22(268):1–8,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:24.404946Z"},"links":{"citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:187dbdbe66ef65b0071fd6914f1512a5c374682af8b49b0e13929ad797d79183","observation_id":"427d4606-ac11-4f9b-8f9a-640d348a24de","resolution":{"observed_at":"2026-08-03T07:16:24.404946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T07:16:24.410629Z","title":"Constructing complex npc behavior via multi-objective neuroevolution","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:24.410629Z"},"links":{"citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:0c5dccb3158a5496126b73e8ef4075c7ce27e21fb948f67557d42e6b6bc63a20","observation_id":"370b677d-2f12-41ba-8676-2592901e7bd1","resolution":{"observed_at":"2026-08-03T07:16:24.410629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T07:16:24.422912Z","title":"Dynamic defender-attacker blotto game","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:24.422912Z"},"links":{"citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:cacb29b3f348016326577e594b4d2d8c09ca8d01a6ee999f8c8f82253d197150","observation_id":"8a7ea8dd-7966-4677-9603-7bc40fcba3e2","resolution":{"observed_at":"2026-08-03T07:16:24.422912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T07:16:24.424900Z","title":"Steuer and Eng-Ung Choo","venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:24.424900Z"},"links":{"citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:86da5e4c084e5acf5f6f30c8cfb5c4c5e16fb4345e267f4ea1236c2f7ec48c89","observation_id":"106aa7f9-d9f1-480c-a3ad-0d7fe62f85fd","resolution":{"observed_at":"2026-08-03T07:16:24.424900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T07:16:24.429369Z","title":"Empir- ical evaluation methods for multiobjective reinforcement learning algorithms.Mach","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:24.429369Z"},"links":{"citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:471467b01e3e672c1d26efbbd48022f479b8162736463199254403f59631671d","observation_id":"3521586c-ef20-4aba-b0c5-62bf284e6018","resolution":{"observed_at":"2026-08-03T07:16:24.429369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T07:16:24.437927Z","title":"Prediction-guided multi-objective reinforcement learning for continuous robot control","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:24.437927Z"},"links":{"citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:b3efb1c2b238f0941c0e09e70453dbb6acea5706666e87da46cf229912779287","observation_id":"ed4d876f-02f2-4486-a223-b541713a0e99","resolution":{"observed_at":"2026-08-03T07:16:24.437927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T07:16:24.440095Z","title":"A generalized algorithm for multi- objective reinforcement learning and policy adaptation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:24.440095Z"},"links":{"citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:6666575f4f8aaf7e43fb810eed2d2b7dbb7ee48b6b5ba775870f53b81af98139","observation_id":"17cfcb28-3879-42b3-8af3-55e6bb55f5f6","resolution":{"observed_at":"2026-08-03T07:16:24.440095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T07:16:24.442401Z","title":"Federated reinforcement learning for robot mo- tion planning with zero-shot generalization.Automatica, 166:111709,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:24.442401Z"},"links":{"citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:d1237066f34aac1308df886086538f1113674839b6b6448e42a09ae88bf66ced","observation_id":"98ce69e5-b8c1-4158-b86f-e22784fd22e5","resolution":{"observed_at":"2026-08-03T07:16:24.442401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T07:16:24.444513Z","title":"Maximum entropy population-based training for zero-shot human-ai coordination.Proceedings of the AAAI Conference on Artificial Intelligence, 37(5):6145–6153, Jun","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:24.444513Z"},"links":{"citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:3eacba2d3ee5afd2edc9265ab9c1bdc376c45f95948e0dcd35644f135144415d","observation_id":"f0bb0d2c-1229-4c20-939f-5c0b480e02bd","resolution":{"observed_at":"2026-08-03T07:16:24.444513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T07:16:24.447043Z","title":"Scaling pareto-efficient decision making via of- fline multi-objective rl","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:24.447043Z"},"links":{"citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:7c4885cf978168725741631f2d31ca8eefe9e06cafa25d57091378ec2184c1ae","observation_id":"faded5de-da6b-4e1f-9af4-0d1626b8f1f8","resolution":{"observed_at":"2026-08-03T07:16:24.447043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-03T07:16:24.426964Z","title":"Gymnasium: A standard interface for reinforcement learning environments.arXiv preprint arXiv:2407.17032,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":1983,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:24.426964Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:98a768f06c0af6cda536b7cc2fb3b6123adc22da2c7dfaafd06dcaea79f1b594","observation_id":"a6654283-b7bc-4612-bdc2-65b07539f193","resolution":{"observed_at":"2026-08-03T07:16:24.426964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T07:16:22.345248Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":1998,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:22.345248Z"},"links":{"citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:a875f7fd821f121632373d3747f0fceda4a0f833ed99bae75cdf50c436a2379d","observation_id":"c7db0a1b-3f6e-40ed-ad97-67b635f50714","resolution":{"observed_at":"2026-08-03T07:16:22.345248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T07:16:22.600953Z","title":"Multiple-gradient descent algorithm (mgda) for multiobjective optimization","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":2005,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:22.600953Z"},"links":{"citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:13221bb46cdb5436b3f8cc28978fcee6d98ec1b0ac1d641b11714b695c3b84e1","observation_id":"54966e1c-fb4a-4840-8e2a-e3c3379d4d99","resolution":{"observed_at":"2026-08-03T07:16:22.600953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T07:16:23.565504Z","title":"A novel pareto-optimal ranking method for comparing multi- objective optimization algorithms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:23.565504Z"},"links":{"citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:a71324f55041a1117d4fd5af5efc2753171517d963d0f2ea5e8d1c96f4b24a08","observation_id":"f555d3b8-de8c-4ad7-aeeb-e94564fb5a7d","resolution":{"observed_at":"2026-08-03T07:16:23.565504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T07:16:24.413170Z","title":"Evolving multi-modal behavior in npcs","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:24.413170Z"},"links":{"citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:ad360035d0f727f4c7332401d97f377bb1553e8395d4b12143fa5f89125dbf1f","observation_id":"ffcea085-5d3d-4de8-a9ea-fcecd52c7989","resolution":{"observed_at":"2026-08-03T07:16:24.413170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-03T07:16:24.415292Z","title":"[Schulmanet al., 2017 ] John Schulman, Filip Wolski, Pra- fulla Dhariwal, Alec Radford, and Oleg Klimov","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:24.415292Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:67fccf52086124fc1e88f9b43353a80b1f79c25806000d47661d7708bec9c4f3","observation_id":"83202b15-cb91-41e3-a64a-cd16d84ae533","resolution":{"observed_at":"2026-08-03T07:16:24.415292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T07:16:24.431491Z","title":"Drugan, and Ann Now ´e","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:24.431491Z"},"links":{"citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:05d3c38a65d4bfe2e59b73af0e6af3238164789314286c4bd46b2103d7712414","observation_id":"e91e370e-5cdf-4613-b214-8be72439ce59","resolution":{"observed_at":"2026-08-03T07:16:24.431491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T07:16:22.735421Z","title":"Alegre, Ann Now´e, Ana L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:22.735421Z"},"links":{"citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:46740c49e2dd1535ecea7016b40df9b34953c2fc3c20f717acb33329dd266d38","observation_id":"db1c65e2-b45d-4e74-be0b-1e808f4bee35","resolution":{"observed_at":"2026-08-03T07:16:22.735421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T07:16:24.433879Z","title":"Graph attention networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:24.433879Z"},"links":{"citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:6c528f763bda055dde8b34bcb393322f729cb2c87c7b3cec503bdc8beabb1a5a","observation_id":"cd838726-386f-4764-a5d9-a9c39039bbad","resolution":{"observed_at":"2026-08-03T07:16:24.433879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T07:16:22.511330Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:22.511330Z"},"links":{"citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:e8736cc25d3f839e8035c04b4acd631d452aa8bf1663585684edc1a0920bc6fd","observation_id":"355bea24-fb58-4113-bb88-8da7872e5f28","resolution":{"observed_at":"2026-08-03T07:16:22.511330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T07:16:23.761715Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:23.761715Z"},"links":{"citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:69474b623578bc50514262d5763333da9eac91d85d5aad4c98715ed7bb013f14","observation_id":"7efd88dd-e4cf-4a39-b0df-6fd6254aced9","resolution":{"observed_at":"2026-08-03T07:16:23.761715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.10944","last_updated":"2019-12-26T14:47:34Z","snapshot_observed_at":"2026-07-06T08:46:35.151523Z","submitted_at":"2019-12-23T16:04:40Z","title":"A Survey of Deep Reinforcement Learning in Video Games","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.10944","snapshot_observed_at":"2026-08-03T07:16:24.418148Z","title":"A survey of deep reinforcement learning in video games.CoRR, abs/1912.10944,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:24.418148Z"},"links":{"cited_paper":"/paper/1912.10944","citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:1fac53b89539bc9191a2c0666c203f6a9d1c39e2de8e0978a0de4ceefabc52ea","observation_id":"fff135a3-cf34-430b-afae-58726948b4ca","resolution":{"observed_at":"2026-08-03T07:16:24.418148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T07:16:24.435952Z","title":"Rlhgnn: Reinforce- ment learning-driven heterogeneous graph neural network for next activity prediction in business processes,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:24.435952Z"},"links":{"citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:29be11ec6bb0c3ce27061b8e6c130b06775fb3e7bbe44412fb1927d8a5d54d5b","observation_id":"86c61b52-c919-448a-a0f6-59157451e6d2","resolution":{"observed_at":"2026-08-03T07:16:24.435952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T07:16:24.420754Z","title":"Grapheon rl: A graph neural network and reinforcement learning framework for constraint and data- aware workflow mapping and scheduling in heterogeneous hpc systems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:24.420754Z"},"links":{"citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:8b074efd9a6baa637c2139aeb892ccbc8191324923ab766c5a4dc5cfcaa98e7c","observation_id":"05be720a-d8bf-4321-9e13-327c70b77976","resolution":{"observed_at":"2026-08-03T07:16:24.420754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06742","last_updated":"2024-05-21T11:30:00Z","snapshot_observed_at":"2026-07-06T11:57:28.465843Z","submitted_at":"2021-10-13T14:21:21Z","title":"A Review of the Deep Sea Treasure problem as a Multi-Objective Reinforcement Learning Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06742","snapshot_observed_at":"2026-08-03T07:16:22.109036Z","title":"A review of the deep sea treasure problem as a multi-objective reinforcement learning benchmark.CoRR, abs/2110.06742,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:22.109036Z"},"links":{"cited_paper":"/paper/2110.06742","citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:a076d0a3066cf918818ea1f7e1739ca63ab13a911f7bf0868b6f65ef298238d8","observation_id":"720b7142-af1f-4a50-adcd-bb78ae5c0d07","resolution":{"observed_at":"2026-08-03T07:16:22.109036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T07:16:22.251222Z","title":null,"venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:22.251222Z"},"links":{"citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:fc14e3cf1117c3c9d0466823dd0fca2b5229325a4ac46f9e28ece2f801f99bb7","observation_id":"e6f16302-d6a0-403e-93cb-cadd603a9be8","resolution":{"observed_at":"2026-08-03T07:16:22.251222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.01332","last_updated":"2020-03-03T04:49:21Z","snapshot_observed_at":"2026-08-09T00:12:39.478411Z","submitted_at":"2020-03-03T04:49:21Z","title":"Heterogeneous Graph Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.01332","snapshot_observed_at":"2026-08-03T07:16:23.344548Z","title":"Heterogeneous graph transformer.CoRR, abs/2003.01332,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:23.344548Z"},"links":{"cited_paper":"/paper/2003.01332","citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:6a0a0e9cb56deb2ce7352f7cc2783fb3eae9ed3ae77727c74e525ad892a595b3","observation_id":"d24440a7-dc84-4103-b41d-6116f2f800de","resolution":{"observed_at":"2026-08-03T07:16:23.344548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T07:16:22.041021Z","title":"Blank and K","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:22.041021Z"},"links":{"citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:546b278b0c028100db068aac6d9f70b26b4aff26b00a74c569b3729ef9791dad","observation_id":"1a066fcf-9907-49f4-bf57-15dc4b2667af","resolution":{"observed_at":"2026-08-03T07:16:22.041021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T07:16:23.085699Z","title":"Pick your battles: Interaction graphs as population-level objec- tives for strategic diversity","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:23.085699Z"},"links":{"citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:af702eafe02e40d14f11ebf8a36f9530526b0020b5d33e871a31741987a4c0de","observation_id":"2541a930-ad9b-4bea-b14b-0111582469ea","resolution":{"observed_at":"2026-08-03T07:16:23.085699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T07:16:21.890537Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:21.890537Z"},"links":{"citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:ba1c4e834389387113ede4f391a9090419b05dbcd42ce028d280c3b73156ba5a","observation_id":"4fea5578-9688-4f6b-9a03-f225d8aa9c27","resolution":{"observed_at":"2026-08-03T07:16:21.890537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T07:16:24.213104Z","title":"Precise and dexterous robotic manipula- tion via human-in-the-loop reinforcement learning.Sci- ence Robotics, 10(105):eads5033,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:24.213104Z"},"links":{"citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:29ca34e62be569e40f5dc87a02d13833f243f34b91872b6abf4667115335c105","observation_id":"6b83132a-13bb-4797-9f2e-69291e465f50","resolution":{"observed_at":"2026-08-03T07:16:24.213104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T00:13:02.404401Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 1 inbound Pith citation observation for arXiv:2601.20753."}