{"as_of":"2026-08-16T01:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5b26bb2088d2262b55caa70081a9719638ce5a63728af4a9a17bdeec02be01c3","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T12:56:58.146019Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.21397/citation-record","integrity":"/paper/2507.21397/integrity","json":"/paper/2507.21397/citation-record.json","paper":"/paper/2507.21397"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:56:58.581927Z","title":"A practical guide to multi-objective reinforcement learning and planning,","venue":null,"work_id":"b2b89dda-5f9b-4438-a98f-2ec1c93d8dcd","year":2022},"citing_paper":{"arxiv_id":"2507.21397","last_updated":"2025-07-29T00:11:59Z","snapshot_observed_at":"2026-08-13T17:02:02.890350Z","submitted_at":"2025-07-29T00:11:59Z","title":"Enabling Pareto-Stationarity Exploration in Multi-Objective Reinforcement Learning: A Multi-Objective Weighted-Chebyshev Actor-Critic Approach","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T12:56:58.046061Z"},"links":{"citing_paper":"/paper/2507.21397"},"observation_digest":"sha256:d33ad3ffccf59503332e931a6bc2cab2b103c8fe46726bd6a1110b4354a0daf9","observation_id":"aa43ecb4-40c0-46fe-9e3d-6329c4a2057b","resolution":{"observed_at":"2026-08-06T12:56:58.585229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:56:58.571183Z","title":"Two-stage constrained actor-critic for short video recommendation,","venue":null,"work_id":"56761c1e-c13c-4672-bf2f-f2be3450d9d2","year":2023},"citing_paper":{"arxiv_id":"2507.21397","last_updated":"2025-07-29T00:11:59Z","snapshot_observed_at":"2026-08-13T17:02:02.890350Z","submitted_at":"2025-07-29T00:11:59Z","title":"Enabling Pareto-Stationarity Exploration in Multi-Objective Reinforcement Learning: A Multi-Objective Weighted-Chebyshev Actor-Critic Approach","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T12:56:58.049639Z"},"links":{"citing_paper":"/paper/2507.21397"},"observation_digest":"sha256:1542d1846a25fdf65f5f052540c7235092eca9f7fad7f087e4b320c35cf1c11c","observation_id":"2335be4c-0557-482b-9424-18431d3b1e57","resolution":{"observed_at":"2026-08-06T12:56:58.574748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:56:58.052710Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.21397","last_updated":"2025-07-29T00:11:59Z","snapshot_observed_at":"2026-08-13T17:02:02.890350Z","submitted_at":"2025-07-29T00:11:59Z","title":"Enabling Pareto-Stationarity Exploration in Multi-Objective Reinforcement Learning: A Multi-Objective Weighted-Chebyshev Actor-Critic Approach","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T12:56:58.052710Z"},"links":{"citing_paper":"/paper/2507.21397"},"observation_digest":"sha256:4a4ad1254dce4bc4ba3c4082d66f265776ccdd43e2f0722139e4528147c45a1d","observation_id":"c54ef003-d5c1-40be-94fd-620c0c7df2b1","resolution":{"observed_at":"2026-08-06T12:56:58.052710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03082","last_updated":"2024-05-09T04:33:22Z","snapshot_observed_at":"2026-08-13T17:02:14.179137Z","submitted_at":"2024-05-05T23:52:57Z","title":"Finite-Time Convergence and Sample Complexity of Actor-Critic Multi-Objective Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2405.03082","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.03082","snapshot_observed_at":"2026-08-06T12:56:58.329880Z","title":"Finite-Time Convergence and Sample Complexity of Actor-Critic Multi-Objective Reinforcement Learning","venue":"cs.LG","work_id":"0194d53a-1cfb-49ce-9f21-b4d25d1053ea","year":2024},"citing_paper":{"arxiv_id":"2507.21397","last_updated":"2025-07-29T00:11:59Z","snapshot_observed_at":"2026-08-13T17:02:02.890350Z","submitted_at":"2025-07-29T00:11:59Z","title":"Enabling Pareto-Stationarity Exploration in Multi-Objective Reinforcement Learning: A Multi-Objective Weighted-Chebyshev Actor-Critic Approach","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T12:56:58.055956Z"},"links":{"cited_paper":"/paper/2405.03082","citing_paper":"/paper/2507.21397"},"observation_digest":"sha256:2dad79e3e0b0b8110ed619da75ce7dfae0dc3072ffee95436bfbed3e1675cdcb","observation_id":"a0ba49b2-07a2-4011-a9f2-01ce76611306","resolution":{"observed_at":"2026-08-06T12:56:58.333724Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:56:58.554065Z","title":"Recent theoretical advances in non-convex optimization,","venue":null,"work_id":"7d714db5-d2a2-4f13-a291-3d72b20364ca","year":2022},"citing_paper":{"arxiv_id":"2507.21397","last_updated":"2025-07-29T00:11:59Z","snapshot_observed_at":"2026-08-13T17:02:02.890350Z","submitted_at":"2025-07-29T00:11:59Z","title":"Enabling Pareto-Stationarity Exploration in Multi-Objective Reinforcement Learning: A Multi-Objective Weighted-Chebyshev Actor-Critic Approach","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T12:56:58.059423Z"},"links":{"citing_paper":"/paper/2507.21397"},"observation_digest":"sha256:057a4cf8165d32a62c5c3c83c03d62d030b2eb77d24b5abe4028d931c86c509c","observation_id":"8960fc44-6ba0-4421-8ed1-de03e4fee705","resolution":{"observed_at":"2026-08-06T12:56:58.557239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:56:58.544933Z","title":"Federated multi- objective learning,","venue":null,"work_id":"7fbd7997-ee58-4933-b16d-e2414d9c9048","year":2024},"citing_paper":{"arxiv_id":"2507.21397","last_updated":"2025-07-29T00:11:59Z","snapshot_observed_at":"2026-08-13T17:02:02.890350Z","submitted_at":"2025-07-29T00:11:59Z","title":"Enabling Pareto-Stationarity Exploration in Multi-Objective Reinforcement Learning: A Multi-Objective Weighted-Chebyshev Actor-Critic Approach","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T12:56:58.062732Z"},"links":{"citing_paper":"/paper/2507.21397"},"observation_digest":"sha256:b8002842e27c0f2753af5ed97b727fc9b071a0c9f50f8f68edbcc9a13c31b572","observation_id":"5dde7745-e0af-4e66-85ac-9f1b645295c2","resolution":{"observed_at":"2026-08-06T12:56:58.548089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:56:58.535012Z","title":"Adaptive weighted sum method for multiobjective optimization: a new method for pareto front generation,","venue":null,"work_id":"84aebf3d-6ef5-4064-ae01-c538e060efee","year":2006},"citing_paper":{"arxiv_id":"2507.21397","last_updated":"2025-07-29T00:11:59Z","snapshot_observed_at":"2026-08-13T17:02:02.890350Z","submitted_at":"2025-07-29T00:11:59Z","title":"Enabling Pareto-Stationarity Exploration in Multi-Objective Reinforcement Learning: A Multi-Objective Weighted-Chebyshev Actor-Critic Approach","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T12:56:58.066212Z"},"links":{"citing_paper":"/paper/2507.21397"},"observation_digest":"sha256:8906208bddd48fab690dac131a73b9ca70096b990a8988c6241668b1be92b3d0","observation_id":"e20c2744-26a7-4b51-a809-cc4b285a74e6","resolution":{"observed_at":"2026-08-06T12:56:58.538401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04488","last_updated":"2026-08-10T17:33:44Z","snapshot_observed_at":"2026-08-15T12:15:07.204987Z","submitted_at":"2024-08-08T14:35:55Z","title":"Multi-Objective LQR with Linear Scalarization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04488","snapshot_observed_at":"2026-08-06T12:56:58.069078Z","title":"Multi-objective lqr with linear scalarization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21397","last_updated":"2025-07-29T00:11:59Z","snapshot_observed_at":"2026-08-13T17:02:02.890350Z","submitted_at":"2025-07-29T00:11:59Z","title":"Enabling Pareto-Stationarity Exploration in Multi-Objective Reinforcement Learning: A Multi-Objective Weighted-Chebyshev Actor-Critic Approach","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T12:56:58.069078Z"},"links":{"cited_paper":"/paper/2408.04488","citing_paper":"/paper/2507.21397"},"observation_digest":"sha256:af62625016a34b1b611fef0bd6cbf4233358a8bb3466a02c12ee5066aa8914cb","observation_id":"77e9520b-053d-4597-9606-ee38f4a52d3a","resolution":{"observed_at":"2026-08-06T12:56:58.069078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:56:58.525389Z","title":"Random hypervolume scalarizations for provable multi-objective black box optimization,","venue":null,"work_id":"8348db34-d51e-4495-80c5-23ea8b5b298b","year":2020},"citing_paper":{"arxiv_id":"2507.21397","last_updated":"2025-07-29T00:11:59Z","snapshot_observed_at":"2026-08-13T17:02:02.890350Z","submitted_at":"2025-07-29T00:11:59Z","title":"Enabling Pareto-Stationarity Exploration in Multi-Objective Reinforcement Learning: A Multi-Objective Weighted-Chebyshev Actor-Critic Approach","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T12:56:58.072291Z"},"links":{"citing_paper":"/paper/2507.21397"},"observation_digest":"sha256:b93ae24b9dff2ab42f59c321c4470d8d6bec1112dd7551e45e764a3aa14c92f7","observation_id":"d4c1cdcf-84a8-444d-851a-890cb9400575","resolution":{"observed_at":"2026-08-06T12:56:58.528494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:56:58.516022Z","title":"Multiple-gradient descent algorithm (mgda) for multi- objective optimization,","venue":null,"work_id":"077b1f77-a86c-4651-b9c6-b0dcccbf420d","year":2012},"citing_paper":{"arxiv_id":"2507.21397","last_updated":"2025-07-29T00:11:59Z","snapshot_observed_at":"2026-08-13T17:02:02.890350Z","submitted_at":"2025-07-29T00:11:59Z","title":"Enabling Pareto-Stationarity Exploration in Multi-Objective Reinforcement Learning: A Multi-Objective Weighted-Chebyshev Actor-Critic Approach","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T12:56:58.075044Z"},"links":{"citing_paper":"/paper/2507.21397"},"observation_digest":"sha256:f22914c03c4f21ed483766f936de9a6ca3f0d2999c68bce13b6ec59eb691c406","observation_id":"d9031b6b-fd45-4be1-902a-25375671bd78","resolution":{"observed_at":"2026-08-06T12:56:58.519273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:56:58.506447Z","title":"Miettinen, Nonlinear multiobjective optimization","venue":null,"work_id":"39a7559d-532d-46bb-a29e-46dc4907359b","year":1999},"citing_paper":{"arxiv_id":"2507.21397","last_updated":"2025-07-29T00:11:59Z","snapshot_observed_at":"2026-08-13T17:02:02.890350Z","submitted_at":"2025-07-29T00:11:59Z","title":"Enabling Pareto-Stationarity Exploration in Multi-Objective Reinforcement Learning: A Multi-Objective Weighted-Chebyshev Actor-Critic Approach","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T12:56:58.078152Z"},"links":{"citing_paper":"/paper/2507.21397"},"observation_digest":"sha256:d25f5749114b9aad1fa0ebb13aaade3ab149b2e91bdbfe85ffe1221283557cf2","observation_id":"85f6ac14-0a1f-471b-9c63-cb4199f74da3","resolution":{"observed_at":"2026-08-06T12:56:58.509473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:56:58.496494Z","title":"Complexity of gradient descent for multiobjective optimization,","venue":null,"work_id":"e35e5fcf-27f4-42af-824a-a00b97b873d1","year":2019},"citing_paper":{"arxiv_id":"2507.21397","last_updated":"2025-07-29T00:11:59Z","snapshot_observed_at":"2026-08-13T17:02:02.890350Z","submitted_at":"2025-07-29T00:11:59Z","title":"Enabling Pareto-Stationarity Exploration in Multi-Objective Reinforcement Learning: A Multi-Objective Weighted-Chebyshev Actor-Critic Approach","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T12:56:58.081670Z"},"links":{"citing_paper":"/paper/2507.21397"},"observation_digest":"sha256:c9601898a4a88c78ca76f0b0a0aa869933e69bd7c4cc9103b48329ab4532104d","observation_id":"1e8e0052-7dc9-4624-bca4-c37aae547588","resolution":{"observed_at":"2026-08-06T12:56:58.499944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:56:58.486545Z","title":"The stochastic multi-gradient algorithm for multi-objective optimization and its application to supervised machine learning,","venue":null,"work_id":"7f5f8777-19e9-4b88-ba5e-f10974a53540","year":2021},"citing_paper":{"arxiv_id":"2507.21397","last_updated":"2025-07-29T00:11:59Z","snapshot_observed_at":"2026-08-13T17:02:02.890350Z","submitted_at":"2025-07-29T00:11:59Z","title":"Enabling Pareto-Stationarity Exploration in Multi-Objective Reinforcement Learning: A Multi-Objective Weighted-Chebyshev Actor-Critic Approach","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T12:56:58.084871Z"},"links":{"citing_paper":"/paper/2507.21397"},"observation_digest":"sha256:19ea1a9f2db39e12f00a9edde86d0e17c4616b17a5f8f5efecd6750d2fbee2a9","observation_id":"e4f5d7f3-b0af-46d0-b4d9-7da84f84cfb1","resolution":{"observed_at":"2026-08-06T12:56:58.490024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:56:58.477049Z","title":"Mitigating gradient bias in multi-objective learning: A provably convergent approach,","venue":null,"work_id":"3444366d-6f41-4399-90c0-28f3884c7f7b","year":2022},"citing_paper":{"arxiv_id":"2507.21397","last_updated":"2025-07-29T00:11:59Z","snapshot_observed_at":"2026-08-13T17:02:02.890350Z","submitted_at":"2025-07-29T00:11:59Z","title":"Enabling Pareto-Stationarity Exploration in Multi-Objective Reinforcement Learning: A Multi-Objective Weighted-Chebyshev Actor-Critic Approach","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T12:56:58.088050Z"},"links":{"citing_paper":"/paper/2507.21397"},"observation_digest":"sha256:8bd41924c25cbfa65d95c0773849a48b5e6cca0fc462018eb2c08c7b64d65464","observation_id":"c6ea9553-2fe2-459b-a7f3-998ef65bb746","resolution":{"observed_at":"2026-08-06T12:56:58.480273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18409","last_updated":"2023-11-29T02:19:00Z","snapshot_observed_at":"2026-08-13T11:30:46.893382Z","submitted_at":"2023-05-28T16:13:59Z","title":"Direction-oriented Multi-objective Learning: Simple and Provable Stochastic Algorithms","version":3},"cited_work":{"arxiv_id":"2305.18409","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.18409","snapshot_observed_at":"2026-08-06T12:56:58.303774Z","title":"Direction-oriented Multi-objective Learning: Simple and Provable Stochastic Algorithms","venue":"cs.LG","work_id":"00bcdb75-05d6-4a33-9d28-ff566cc23ee3","year":2023},"citing_paper":{"arxiv_id":"2507.21397","last_updated":"2025-07-29T00:11:59Z","snapshot_observed_at":"2026-08-13T17:02:02.890350Z","submitted_at":"2025-07-29T00:11:59Z","title":"Enabling Pareto-Stationarity Exploration in Multi-Objective Reinforcement Learning: A Multi-Objective Weighted-Chebyshev Actor-Critic Approach","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T12:56:58.091135Z"},"links":{"cited_paper":"/paper/2305.18409","citing_paper":"/paper/2507.21397"},"observation_digest":"sha256:1761727c40ea7e40f1abcded448bcd015ce1ea03cef2eef7042c5b5528b6aa20","observation_id":"d2a9d917-b656-46a7-8c0b-7a2790349017","resolution":{"observed_at":"2026-08-06T12:56:58.307541Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:56:58.466931Z","title":"Multi-criteria reinforcement learning","venue":null,"work_id":"22e853ed-552c-42ee-9c4f-ba7e8d5de7f7","year":1998},"citing_paper":{"arxiv_id":"2507.21397","last_updated":"2025-07-29T00:11:59Z","snapshot_observed_at":"2026-08-13T17:02:02.890350Z","submitted_at":"2025-07-29T00:11:59Z","title":"Enabling Pareto-Stationarity Exploration in Multi-Objective Reinforcement Learning: A Multi-Objective Weighted-Chebyshev Actor-Critic Approach","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T12:56:58.094657Z"},"links":{"citing_paper":"/paper/2507.21397"},"observation_digest":"sha256:af9f64360a871fd6268c58bd3bc1114bffc9d3a26a767d6bd82f05cc05f8364b","observation_id":"dfaec3d1-35ca-4f9e-95cf-ab1a9993cf88","resolution":{"observed_at":"2026-08-06T12:56:58.470294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:56:58.456435Z","title":"Reinforcement recommenda- tion with user multi-aspect preference,","venue":null,"work_id":"fe765901-64a6-437a-a1a1-1371a03da4da","year":2021},"citing_paper":{"arxiv_id":"2507.21397","last_updated":"2025-07-29T00:11:59Z","snapshot_observed_at":"2026-08-13T17:02:02.890350Z","submitted_at":"2025-07-29T00:11:59Z","title":"Enabling Pareto-Stationarity Exploration in Multi-Objective Reinforcement Learning: A Multi-Objective Weighted-Chebyshev Actor-Critic Approach","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T12:56:58.097465Z"},"links":{"citing_paper":"/paper/2507.21397"},"observation_digest":"sha256:fedd96f0dcc3e089a603f92d10beee92d588412a5ae00ee5d589b7b61de04f68","observation_id":"3deef8f7-69ec-4d7c-9c80-26ccb39754aa","resolution":{"observed_at":"2026-08-06T12:56:58.459747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2405.19650","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:56:58.285461Z","title":"Few for many: Tchebycheff set scalarization for many-objective optimization,","venue":null,"work_id":"eca2e914-f982-4525-bd10-8615a80f5d14","year":2024},"citing_paper":{"arxiv_id":"2507.21397","last_updated":"2025-07-29T00:11:59Z","snapshot_observed_at":"2026-08-13T17:02:02.890350Z","submitted_at":"2025-07-29T00:11:59Z","title":"Enabling Pareto-Stationarity Exploration in Multi-Objective Reinforcement Learning: A Multi-Objective Weighted-Chebyshev Actor-Critic Approach","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T12:56:58.100320Z"},"links":{"citing_paper":"/paper/2507.21397"},"observation_digest":"sha256:b1e5e1d14885505b5daa41ad8e85c71f5055982eb1b569af4a4e553664223549","observation_id":"dffab944-2702-4da5-8c0d-0a00c4363fd9","resolution":{"observed_at":"2026-08-06T12:56:58.292300Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:56:58.446498Z","title":"A multi-objective/multi-task learning framework induced by pareto stationarity,","venue":null,"work_id":"0bfa6ca0-53b8-45c7-be1d-24b3d776508e","year":2022},"citing_paper":{"arxiv_id":"2507.21397","last_updated":"2025-07-29T00:11:59Z","snapshot_observed_at":"2026-08-13T17:02:02.890350Z","submitted_at":"2025-07-29T00:11:59Z","title":"Enabling Pareto-Stationarity Exploration in Multi-Objective Reinforcement Learning: A Multi-Objective Weighted-Chebyshev Actor-Critic Approach","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T12:56:58.103231Z"},"links":{"citing_paper":"/paper/2507.21397"},"observation_digest":"sha256:9493be5b23bd013f9ede58e42d8ffa824504bffe3a6d432fb5f53bd1b111235b","observation_id":"c4c42fb9-8abf-4deb-8ea3-69f7e795ce73","resolution":{"observed_at":"2026-08-06T12:56:58.449710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17466","last_updated":"2024-07-24T17:58:49Z","snapshot_observed_at":"2026-08-13T17:01:59.958759Z","submitted_at":"2024-07-24T17:58:49Z","title":"Traversing Pareto Optimal Policies: Provably Efficient Multi-Objective Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17466","snapshot_observed_at":"2026-08-06T12:56:58.106357Z","title":"Traversing pareto optimal policies: Provably efficient multi-objective reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21397","last_updated":"2025-07-29T00:11:59Z","snapshot_observed_at":"2026-08-13T17:02:02.890350Z","submitted_at":"2025-07-29T00:11:59Z","title":"Enabling Pareto-Stationarity Exploration in Multi-Objective Reinforcement Learning: A Multi-Objective Weighted-Chebyshev Actor-Critic Approach","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T12:56:58.106357Z"},"links":{"cited_paper":"/paper/2407.17466","citing_paper":"/paper/2507.21397"},"observation_digest":"sha256:cf8372ae1f69d3cfba3a478327c4430436aef14722e255e29a7df2fbb5d04d68","observation_id":"51ab15c2-aa1a-4d51-9507-df65c499ee88","resolution":{"observed_at":"2026-08-06T12:56:58.106357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:56:58.436627Z","title":"Pareto multi- task learning,","venue":null,"work_id":"dc389472-a170-43e6-a4fa-740febc7718b","year":2019},"citing_paper":{"arxiv_id":"2507.21397","last_updated":"2025-07-29T00:11:59Z","snapshot_observed_at":"2026-08-13T17:02:02.890350Z","submitted_at":"2025-07-29T00:11:59Z","title":"Enabling Pareto-Stationarity Exploration in Multi-Objective Reinforcement Learning: A Multi-Objective Weighted-Chebyshev Actor-Critic Approach","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T12:56:58.109784Z"},"links":{"citing_paper":"/paper/2507.21397"},"observation_digest":"sha256:56288521397d6710ede3f5dbddf67d273431a73aeb958ecab54963920c1595ce","observation_id":"f9472c23-5145-4005-a299-b0372f00b82d","resolution":{"observed_at":"2026-08-06T12:56:58.440002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:56:58.426687Z","title":"Multi-objective reinforcement learning for the expected utility of the return,","venue":null,"work_id":"2ab34360-f7d2-4ddd-ad67-b4f3d2080480","year":2018},"citing_paper":{"arxiv_id":"2507.21397","last_updated":"2025-07-29T00:11:59Z","snapshot_observed_at":"2026-08-13T17:02:02.890350Z","submitted_at":"2025-07-29T00:11:59Z","title":"Enabling Pareto-Stationarity Exploration in Multi-Objective Reinforcement Learning: A Multi-Objective Weighted-Chebyshev Actor-Critic Approach","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T12:56:58.112710Z"},"links":{"citing_paper":"/paper/2507.21397"},"observation_digest":"sha256:c481cf86dbf8ac75bc78c7ecf7b1a95e847c1bbb8a3c572bf7ba657347667a58","observation_id":"7fc45cfa-8481-4d88-b110-8b46b2dfa19c","resolution":{"observed_at":"2026-08-06T12:56:58.430265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:56:58.416947Z","title":"On finite-time convergence of actor-critic algorithm,","venue":null,"work_id":"ee2877cd-1b7a-4672-a3e0-9ede6b8b1e2b","year":2021},"citing_paper":{"arxiv_id":"2507.21397","last_updated":"2025-07-29T00:11:59Z","snapshot_observed_at":"2026-08-13T17:02:02.890350Z","submitted_at":"2025-07-29T00:11:59Z","title":"Enabling Pareto-Stationarity Exploration in Multi-Objective Reinforcement Learning: A Multi-Objective Weighted-Chebyshev Actor-Critic Approach","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T12:56:58.115733Z"},"links":{"citing_paper":"/paper/2507.21397"},"observation_digest":"sha256:e8fb073e87efd408cbb71155dae9af23b19e66f8cb8d10c898af901c1a95e569","observation_id":"d335029c-a979-4165-993c-6a91a6e97367","resolution":{"observed_at":"2026-08-06T12:56:58.420122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.12956","last_updated":"2021-02-12T01:00:43Z","snapshot_observed_at":"2026-08-07T22:54:51.088285Z","submitted_at":"2020-04-27T17:11:06Z","title":"Improving Sample Complexity Bounds for (Natural) Actor-Critic Algorithms","version":4},"cited_work":{"arxiv_id":"2004.12956","doi":null,"metadata_source":"pith","pith_arxiv_id":"2004.12956","snapshot_observed_at":"2026-08-06T12:56:58.208259Z","title":"Improving Sample Complexity Bounds for (Natural) Actor-Critic Algorithms","venue":"cs.LG","work_id":"c5577ad3-6233-4d04-8daf-6344e7a0015f","year":2020},"citing_paper":{"arxiv_id":"2507.21397","last_updated":"2025-07-29T00:11:59Z","snapshot_observed_at":"2026-08-13T17:02:02.890350Z","submitted_at":"2025-07-29T00:11:59Z","title":"Enabling Pareto-Stationarity Exploration in Multi-Objective Reinforcement Learning: A Multi-Objective Weighted-Chebyshev Actor-Critic Approach","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T12:56:58.118651Z"},"links":{"cited_paper":"/paper/2004.12956","citing_paper":"/paper/2507.21397"},"observation_digest":"sha256:ce1d709a5c0e9f14645a34b44da83bacba3daf9bddcd103d5fd1258fa7fd1c6e","observation_id":"0f909eb7-c329-4fd6-ada5-b76e92e88cd3","resolution":{"observed_at":"2026-08-06T12:56:58.212083Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:56:58.406223Z","title":"Finite-time convergence and sample complexity of multi-agent actor-critic reinforcement learning with aver- age reward,","venue":null,"work_id":"e2355411-afbf-4ff6-9e0f-096fb16f2731","year":2022},"citing_paper":{"arxiv_id":"2507.21397","last_updated":"2025-07-29T00:11:59Z","snapshot_observed_at":"2026-08-13T17:02:02.890350Z","submitted_at":"2025-07-29T00:11:59Z","title":"Enabling Pareto-Stationarity Exploration in Multi-Objective Reinforcement Learning: A Multi-Objective Weighted-Chebyshev Actor-Critic Approach","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T12:56:58.121863Z"},"links":{"citing_paper":"/paper/2507.21397"},"observation_digest":"sha256:547788439a14796ac872c35593fc8372c1355c3e03bde114ecc6cdf406b8049d","observation_id":"1ac70b17-5ff8-4113-8eab-f5d8b5e15629","resolution":{"observed_at":"2026-08-06T12:56:58.409718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:56:58.395664Z","title":"Fully decen- tralized multi-agent reinforcement learning with networked agents,","venue":null,"work_id":"6b826736-e8b1-4063-992a-1232c246f6db","year":2018},"citing_paper":{"arxiv_id":"2507.21397","last_updated":"2025-07-29T00:11:59Z","snapshot_observed_at":"2026-08-13T17:02:02.890350Z","submitted_at":"2025-07-29T00:11:59Z","title":"Enabling Pareto-Stationarity Exploration in Multi-Objective Reinforcement Learning: A Multi-Objective Weighted-Chebyshev Actor-Critic Approach","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T12:56:58.124692Z"},"links":{"citing_paper":"/paper/2507.21397"},"observation_digest":"sha256:8859ceac5f2ca27369cad47c1530d7967baf28e124b359f0b7dbf5500636726d","observation_id":"2d01debc-671d-4c8b-adc3-7035f0a2cc65","resolution":{"observed_at":"2026-08-06T12:56:58.399169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04655","last_updated":"2020-06-09T18:29:23Z","snapshot_observed_at":"2026-07-06T09:27:00.982430Z","submitted_at":"2020-06-08T15:00:30Z","title":"Random Hypervolume Scalarizations for Provable Multi-Objective Black Box Optimization","version":2},"cited_work":{"arxiv_id":"2006.04655","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.04655","snapshot_observed_at":"2026-08-06T12:56:58.194243Z","title":"Random Hypervolume Scalarizations for Provable Multi-Objective Black Box Optimization","venue":"cs.LG","work_id":"a037453c-4f65-4077-b7e3-506586c76edc","year":2020},"citing_paper":{"arxiv_id":"2507.21397","last_updated":"2025-07-29T00:11:59Z","snapshot_observed_at":"2026-08-13T17:02:02.890350Z","submitted_at":"2025-07-29T00:11:59Z","title":"Enabling Pareto-Stationarity Exploration in Multi-Objective Reinforcement Learning: A Multi-Objective Weighted-Chebyshev Actor-Critic Approach","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T12:56:58.127643Z"},"links":{"cited_paper":"/paper/2006.04655","citing_paper":"/paper/2507.21397"},"observation_digest":"sha256:9e3fe94dc76299c4eceefa7160b3adf0b4cfca99a0ccecf318c079c0665ede83","observation_id":"3ec279f6-9ff0-4d5c-bf80-c36f6d37e54f","resolution":{"observed_at":"2026-08-06T12:56:58.197875Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:56:58.383892Z","title":"Average cost temporal-difference learning,","venue":null,"work_id":"82dfc6c8-f8f2-4e61-b648-efc165f9ab9c","year":1999},"citing_paper":{"arxiv_id":"2507.21397","last_updated":"2025-07-29T00:11:59Z","snapshot_observed_at":"2026-08-13T17:02:02.890350Z","submitted_at":"2025-07-29T00:11:59Z","title":"Enabling Pareto-Stationarity Exploration in Multi-Objective Reinforcement Learning: A Multi-Objective Weighted-Chebyshev Actor-Critic Approach","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T12:56:58.131124Z"},"links":{"citing_paper":"/paper/2507.21397"},"observation_digest":"sha256:4f7d3f368267e4c30dbc012aa9e24d786bf49cc3767d57636adbd3a5972fd775","observation_id":"bdca3921-7f6b-48be-b0b5-867a00e93398","resolution":{"observed_at":"2026-08-06T12:56:58.387720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:56:58.373057Z","title":"On the convergence of stochastic multi-objective gradient manipulation and beyond,","venue":null,"work_id":"33d7dc61-72ce-4a6d-ab1d-0af7a9266b67","year":2022},"citing_paper":{"arxiv_id":"2507.21397","last_updated":"2025-07-29T00:11:59Z","snapshot_observed_at":"2026-08-13T17:02:02.890350Z","submitted_at":"2025-07-29T00:11:59Z","title":"Enabling Pareto-Stationarity Exploration in Multi-Objective Reinforcement Learning: A Multi-Objective Weighted-Chebyshev Actor-Critic Approach","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T12:56:58.133887Z"},"links":{"citing_paper":"/paper/2507.21397"},"observation_digest":"sha256:7b665d363a1185d08b196a64c9bc0c70c3d47642aafaa3ff38417536ea7953ab","observation_id":"df7b27c1-a7c3-459e-9dd3-593f8d39e4d8","resolution":{"observed_at":"2026-08-06T12:56:58.376462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:56:58.362674Z","title":"Multi-task learning as multi-objective optimization,","venue":null,"work_id":"1661d82f-a425-41f0-bf03-de64d4ea4097","year":2018},"citing_paper":{"arxiv_id":"2507.21397","last_updated":"2025-07-29T00:11:59Z","snapshot_observed_at":"2026-08-13T17:02:02.890350Z","submitted_at":"2025-07-29T00:11:59Z","title":"Enabling Pareto-Stationarity Exploration in Multi-Objective Reinforcement Learning: A Multi-Objective Weighted-Chebyshev Actor-Critic Approach","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T12:56:58.136606Z"},"links":{"citing_paper":"/paper/2507.21397"},"observation_digest":"sha256:7f801227cc2c04d4386633acda34512b3a2beeb682f9ac689eee5d10db0e32a8","observation_id":"02f480a6-5ef9-436a-9739-53e2dc8d19b5","resolution":{"observed_at":"2026-08-06T12:56:58.366148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.06362","last_updated":"2021-09-13T23:36:38Z","snapshot_observed_at":"2026-08-14T09:16:00.274375Z","submitted_at":"2021-09-13T23:36:38Z","title":"Theoretical Guarantees of Fictitious Discount Algorithms for Episodic Reinforcement Learning and Global Convergence of Policy Gradient Methods","version":1},"cited_work":{"arxiv_id":"2109.06362","doi":null,"metadata_source":"pith","pith_arxiv_id":"2109.06362","snapshot_observed_at":"2026-08-06T12:56:58.176894Z","title":"Theoretical Guarantees of Fictitious Discount Algorithms for Episodic Reinforcement Learning and Global Convergence of Policy Gradient Methods","venue":"cs.LG","work_id":"886d880b-bd21-488f-bb4a-1c42357e2649","year":2021},"citing_paper":{"arxiv_id":"2507.21397","last_updated":"2025-07-29T00:11:59Z","snapshot_observed_at":"2026-08-13T17:02:02.890350Z","submitted_at":"2025-07-29T00:11:59Z","title":"Enabling Pareto-Stationarity Exploration in Multi-Objective Reinforcement Learning: A Multi-Objective Weighted-Chebyshev Actor-Critic Approach","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T12:56:58.139665Z"},"links":{"cited_paper":"/paper/2109.06362","citing_paper":"/paper/2507.21397"},"observation_digest":"sha256:d24bdfd6a45c57c02c2f64d45e588ecfffb7d42c8e4613c8c4cab372467b5a04","observation_id":"41561cf4-884c-435d-8fe8-edd5dfbe512f","resolution":{"observed_at":"2026-08-06T12:56:58.182805Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:56:58.351733Z","title":"Direction-oriented multi-objective learning: Simple and provable stochastic algorithms,","venue":null,"work_id":"64d36184-dbd1-462f-8283-f0be74c8bad1","year":2024},"citing_paper":{"arxiv_id":"2507.21397","last_updated":"2025-07-29T00:11:59Z","snapshot_observed_at":"2026-08-13T17:02:02.890350Z","submitted_at":"2025-07-29T00:11:59Z","title":"Enabling Pareto-Stationarity Exploration in Multi-Objective Reinforcement Learning: A Multi-Objective Weighted-Chebyshev Actor-Critic Approach","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T12:56:58.142832Z"},"links":{"citing_paper":"/paper/2507.21397"},"observation_digest":"sha256:5ea6524ac71ea11f16725163c3cf7ca2bcd43bdb5c5cb55e12c8a53982cd6607","observation_id":"95be232f-11ec-4b4a-957f-f401898d6fe8","resolution":{"observed_at":"2026-08-06T12:56:58.355531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:56:58.341356Z","title":"Reinforcement learning to optimize long-term user engagement in recommender systems,","venue":null,"work_id":"2e19663a-3cdc-48be-8532-0f2d38643bff","year":2019},"citing_paper":{"arxiv_id":"2507.21397","last_updated":"2025-07-29T00:11:59Z","snapshot_observed_at":"2026-08-13T17:02:02.890350Z","submitted_at":"2025-07-29T00:11:59Z","title":"Enabling Pareto-Stationarity Exploration in Multi-Objective Reinforcement Learning: A Multi-Objective Weighted-Chebyshev Actor-Critic Approach","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T12:56:58.146019Z"},"links":{"citing_paper":"/paper/2507.21397"},"observation_digest":"sha256:6a77976258ef56c04aa1623f02992f71b9c483d0ad563200c780b521391844fe","observation_id":"60d6eb6f-060b-41fe-9663-5e76d6358fff","resolution":{"observed_at":"2026-08-06T12:56:58.344937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.21397","last_updated":"2025-07-29T00:11:59Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T17:02:02.890350Z","submitted_at":"2025-07-29T00:11:59Z","title":"Enabling Pareto-Stationarity Exploration in Multi-Objective Reinforcement Learning: A Multi-Objective Weighted-Chebyshev Actor-Critic Approach"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":6,"verified_fuzzy":24},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 0 inbound Pith citation observations for arXiv:2507.21397."}