{"as_of":"2026-08-15T12:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f4aa0a18d27ff08678c35d3466a427ba8fcb2ed25fa2514acb80e66a142be7db","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T11:56:53.066373Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T12:02:40.822995Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-10T05:30:23.456663Z","state":"measured"}],"external_citation_measurements":[{"count":108,"observed_at":"2026-08-10T05:30:23.456663Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.08342","snapshot_observed_at":"2026-08-12T12:02:40.822995Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.17585","last_updated":"2025-05-15T18:07:42Z","snapshot_observed_at":"2026-08-15T11:12:03.309917Z","submitted_at":"2024-11-26T16:51:52Z","title":"Multi-Objective Reinforcement Learning for Automated Resilient Cyber Defence","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T12:02:40.822995Z"},"links":{"cited_paper":"/paper/1908.08342","citing_paper":"/paper/2411.17585"},"observation_digest":"sha256:93116afb0b406953b55da60f109a01cf62700d7f261ce11f877ca7ade7a2e1c2","observation_id":"63bef60f-fe8e-48a0-a249-9dda6b632686","resolution":{"observed_at":"2026-08-12T12:02:40.822995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"cited_work":{"arxiv_id":"1908.08342","doi":"10.48550/arxiv.1908.08342","metadata_source":"pith","pith_arxiv_id":"1908.08342","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","venue":"cs.LG","work_id":"374b3960-7758-4f07-a8c5-f8bd484086a5","year":2019},"citing_paper":{"arxiv_id":"2507.19788","last_updated":"2025-07-26T04:30:11Z","snapshot_observed_at":"2026-08-14T05:03:08.089389Z","submitted_at":"2025-07-26T04:30:11Z","title":"Reinforcement Learning for Multi-Objective Multi-Echelon Supply Chain Optimisation","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-06T14:07:57.803195Z"},"links":{"cited_paper":"/paper/1908.08342","citing_paper":"/paper/2507.19788"},"observation_digest":"sha256:bdb9b9b02cd9b5cf2a4485ccee12bb61d84b32288df374b24e5d9d9e71281b3b","observation_id":"1c03d6e4-220e-41eb-b9ad-f2e3900461cb","resolution":{"observed_at":"2026-08-06T14:07:57.858962Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.08342","snapshot_observed_at":"2026-08-03T03:33:04.179060Z","title":"org/CorpusId:271404860","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2602.07764","last_updated":"2026-07-10T14:03:51Z","snapshot_observed_at":"2026-08-12T18:17:49.897496Z","submitted_at":"2026-02-08T01:45:01Z","title":"Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T03:33:04.179060Z"},"links":{"cited_paper":"/paper/1908.08342","citing_paper":"/paper/2602.07764"},"observation_digest":"sha256:d0ffa9ed40f2c36d0c6bf9330251b8f96ce50abeff01eae5370a4819abcfce67","observation_id":"77951548-8b8f-4916-baf2-c4370b614546","resolution":{"observed_at":"2026-08-03T03:33:04.179060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1908.08342/citation-record","integrity":"/paper/1908.08342/integrity","json":"/paper/1908.08342/citation-record.json","paper":"/paper/1908.08342"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-14T11:56:52.813828Z","title":"Concrete problems in ai safety","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.813828Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:cc41a94cf7f59ca8b577dec03f6ae4e0b5424a588275907275fe424fca628f92","observation_id":"97ef9603-8df4-4bbc-801c-230e41a264fb","resolution":{"observed_at":"2026-08-14T11:56:52.813828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.936394Z","title":"Roijers, Peter Vamplew, Shimon Whiteson, and Richard Dazeley","venue":null,"work_id":"e13b4996-bc23-4978-a83e-8c8c6d831deb","year":2013},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.820258Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:54730fba3fbfa038d99a403c4dc6b02e03a725d3cad567d3e995cce524bb63ad","observation_id":"fca53784-e075-4603-95eb-3bc58eb17670","resolution":{"observed_at":"2026-08-14T11:56:53.942019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.919161Z","title":"Adaptive weighted sum method for multiobjective optimization: a new method for pareto front generation","venue":null,"work_id":"f97615ec-03aa-4aca-94b6-23034c44a80f","year":2006},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.825573Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:9af19763c823f35b8884092ff15e4d21d7df907dfda2ab6eadc3d8f9d40fecc0","observation_id":"e29e6484-9007-4478-9c02-51aee9c00e77","resolution":{"observed_at":"2026-08-14T11:56:53.924658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.901385Z","title":"Multi-objective optimization using genetic algorithms: A tutorial","venue":null,"work_id":"b9bec3bd-ca63-4124-bb47-bf382be04f21","year":2006},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.830839Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:393e6fb290817836939d2db851a1489f72cf51afd5cdbce2fac71f655da73fec","observation_id":"61f67dff-e0c2-4159-9024-e604e16842b8","resolution":{"observed_at":"2026-08-14T11:56:53.906878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.883336Z","title":"Sequential approximate multiobjective optimization using computational intelligence","venue":null,"work_id":"4e670ba9-acfb-40e7-abd6-78d7f6dc6495","year":2009},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.835921Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:9c4b639a528a1532ad91c8a1942998d14f6fe5ebf0f5bed2a095549445839edf","observation_id":"43cac4b4-c847-47c1-b8d9-450d5a4d664a","resolution":{"observed_at":"2026-08-14T11:56:53.889514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.864949Z","title":"On min-norm and min-max methods of multi-objective optimization","venue":null,"work_id":"bd6a5e23-e3fa-4c8f-b00c-05fa033a60dd","year":2005},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.841004Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:81df451127c55b0d30af8a3368b7550c0b442a9b0ef57776d5452c0c49365894","observation_id":"036cb003-056d-4a84-9cf8-0063c8caa124","resolution":{"observed_at":"2026-08-14T11:56:53.870039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.847450Z","title":"Dynamic preferences in multi-criteria reinforcement learning","venue":null,"work_id":"b55d75c9-1a8f-4dc6-9737-2e814fc327f5","year":2005},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.847083Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:22b7f89376fc9946b34c51f4ab5e26dfeb7642c3877276674b8b5f73d1472e91","observation_id":"540d8384-3721-4d13-8ccd-3df0cc2c28e7","resolution":{"observed_at":"2026-08-14T11:56:53.853382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.828217Z","title":"Learning all optimal policies with multiple criteria","venue":null,"work_id":"c1343515-d1b0-4006-8383-61950c6091f9","year":2008},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.852167Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:df912d231589dd100ddc85f67c29182d2bdbc2d508114731aa124eb2221d0ae8","observation_id":"4d5784b7-209b-4953-8a97-e3a9a4783d67","resolution":{"observed_at":"2026-08-14T11:56:53.834142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1610.02707","last_updated":"2016-10-09T19:08:36Z","snapshot_observed_at":"2026-08-14T21:36:02.227068Z","submitted_at":"2016-10-09T19:08:36Z","title":"Multi-Objective Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.02707","snapshot_observed_at":"2026-08-14T11:56:52.856988Z","title":"Assael, Diederik M","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.856988Z"},"links":{"cited_paper":"/paper/1610.02707","citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:f4a3b30d67e59be013f7c751632b99df068440a1696f1fb90ad43c731605c7fa","observation_id":"bb2a0f21-afc2-4288-92fb-e3ad7b0d4f41","resolution":{"observed_at":"2026-08-14T11:56:52.856988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.810877Z","title":"Dynamic Programming","venue":null,"work_id":"976d81e8-1330-45c2-9645-690b5eeaf875","year":1957},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.862064Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:ba9226346034b6aa13c64593f24bf740a0860ebc1350474bc6b9c51195ff94bd","observation_id":"9b589f4e-4b71-472d-b4bf-63a82c09bc04","resolution":{"observed_at":"2026-08-14T11:56:53.816157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.795911Z","title":"Hindsight experience replay","venue":null,"work_id":"999765e3-6e02-48f2-9826-892f4a396b4c","year":2017},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.866600Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:07a619280a01b2bf0812b510a3d1150b97f57810579945259cbfd3007aa45e74","observation_id":"ec5d1b04-e29e-4e39-88d0-08d17b04ba24","resolution":{"observed_at":"2026-08-14T11:56:53.800632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:52.871512Z","title":"Modern homotopy methods in optimization","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.871512Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:4d5c5cf1362c50008e601b3abc2f9be61062cf4bf7ca9b529a3c7089c4448963","observation_id":"4febe6f2-c1bf-47a5-81a8-5aa9ba6c6ee9","resolution":{"observed_at":"2026-08-14T11:56:52.871512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.770381Z","title":"Roijers, Tom Lenaerts, Ann Nowé, and Denis Steckelmacher","venue":null,"work_id":"c0b0bcb3-aced-477c-834a-08e47b15fa41","year":2019},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.876371Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:840305fbb28a5c56c5838ba4dd45becbacb86530bdb204f54ebcf805b9f8f6f1","observation_id":"b14b194a-4c3d-4535-81df-66472e260cfa","resolution":{"observed_at":"2026-08-14T11:56:53.775229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.752958Z","title":"Empirical evaluation methods for multiobjective reinforcement learning algorithms","venue":null,"work_id":"3763f597-857e-4795-b686-4900492ead80","year":2011},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.881183Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:e706a65399a78dd78096a989c35ca08d71ce791ee1c011d108988c26a0657825","observation_id":"04e44619-49c7-43d2-8ed4-6274fe94e091","resolution":{"observed_at":"2026-08-14T11:56:53.758719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.736861Z","title":"Multiobjective reinforcement learning: A comprehensive overview","venue":null,"work_id":"a4a6b55c-1e02-4a19-833d-66d6668f872b","year":2015},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.886387Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:eec661dcfbfc81e38df921a66b938019d6294be6997c6069eea94844538aa43b","observation_id":"13798454-20f3-40d4-a6e7-214c9c52134c","resolution":{"observed_at":"2026-08-14T11:56:53.741889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.720823Z","title":"The steering approach for multi-criteria reinforcement learning","venue":null,"work_id":"5d2f3c30-307a-4348-8079-6c331a70c546","year":2001},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.891159Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:a30058d17069cff1efd879aff02bdb31c4f4cdc7a9e7ed098bf36a77e9d97089","observation_id":"44155fb4-dc3c-4237-aa59-60f21f1f21c3","resolution":{"observed_at":"2026-08-14T11:56:53.725928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.706140Z","title":"Kephart, David Levine, Freeman L","venue":null,"work_id":"0280255e-5aa6-4e29-b2e5-69c351681e65","year":2007},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.896019Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:6631c73a392b11b7c245235f46465f36b843ba0b55229bbd9583a9434271d70b","observation_id":"f96fc766-e30b-4f3b-9b1e-fda761680b35","resolution":{"observed_at":"2026-08-14T11:56:53.710904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.690783Z","title":"Drugan, and Ann Nowé","venue":null,"work_id":"a543ad86-ce82-4800-b739-e693dea60e35","year":2013},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.900892Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:6af093325b7fda9c08f48a2b4f2ea64afb4c985b39b25416533ea51cbf375224","observation_id":"08a171c2-236f-4eef-8574-cf608612f3e9","resolution":{"observed_at":"2026-08-14T11:56:53.695493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.676221Z","title":"Multi-objective reinforcement learning with continu- ous pareto frontier approximation","venue":null,"work_id":"36dc7d60-ac0b-450b-8166-89bfd6c816c6","year":2015},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.905378Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:10c5b8fe237d51a536cdad0e7791a2d13f4e124844d90da3a15ce93245c53e33","observation_id":"b9a95802-83bd-4d67-9ccb-5e896214377f","resolution":{"observed_at":"2026-08-14T11:56:53.681144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.661733Z","title":"Manifold-based multi-objective policy search with sample reuse","venue":null,"work_id":"29a02ca6-2ff8-4aba-aed3-81ba4e5e92ef","year":2017},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.910004Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:6316026368ef3a2ca0c934255f69738d4aec79cabeb30c57cae3966bee547747","observation_id":"6eb876e7-22a6-4ea5-83b9-aa6182406405","resolution":{"observed_at":"2026-08-14T11:56:53.666604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.647078Z","title":"Parallel reinforcement learning for weighted multi-criteria model with adaptive margin","venue":null,"work_id":"def70805-f461-4722-9bcf-b58e445f1e47","year":2007},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.914976Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:c757c7ecca5d4f2e3ebf81e24da2be26e688ec142cb9ef865046c814d6a0c29a","observation_id":"0fb281ef-9971-4042-8fd3-494e061c276f","resolution":{"observed_at":"2026-08-14T11:56:53.651871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.630944Z","title":"Multi-objective reinforcement learning for acquiring all pareto optimal policies simultaneously - method of determining scalarization weights","venue":null,"work_id":"642e4919-998b-48f4-8b3d-e4e9cd42b2a4","year":2014},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.919854Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:d4c759def15a1f0acfe86ab994aa94f6944884a76f6e3a91fc8c146e893ed6fa","observation_id":"b8e525ba-1402-4a51-ad84-3124b557be9c","resolution":{"observed_at":"2026-08-14T11:56:53.636295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.614386Z","title":"Multi-objective ﬁtted q-iteration: Pareto frontier approximation in one single run","venue":null,"work_id":"37a7a530-e375-46c5-93d4-936873c648c6","year":2011},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.924752Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:7c9a1673dee9fcd9a8324ef2b11c20f66d321c41178a76377ad71f8608f4ce88","observation_id":"2cc3fb91-b85c-4cf9-aa8e-8b917cc3bdc9","resolution":{"observed_at":"2026-08-14T11:56:53.619958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.596079Z","title":"Tree-based ﬁtted q-iteration for multi- objective markov decision problems","venue":null,"work_id":"a1ba4ef4-01cc-44e8-b511-2228d92f8047","year":2012},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.929409Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:e505c51365c4f3f9d0a8388afaf53d9e141e6cfce68f3ece37d1fb0b860ecafc","observation_id":"864a7839-e25b-455c-9153-e016bf5a9993","resolution":{"observed_at":"2026-08-14T11:56:53.601821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.578345Z","title":"Preference elicitation in combinatorial auctions","venue":null,"work_id":"199f839b-5af3-4b2b-a0a5-3e51ac00a620","year":2001},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.934071Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:c8bdac87378c412e12d9ac722c44247a23de1f4af5364bbea95d922123c184ae","observation_id":"771284cd-6819-4f77-917d-1e48b20d2779","resolution":{"observed_at":"2026-08-14T11:56:53.583464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.562148Z","title":"A POMDP formulation of preference elicitation problems","venue":null,"work_id":"23fb6467-abc0-4b49-bd7d-eb61aed3e41b","year":2002},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.938393Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:f116b4c1d81d459a528cdd4cead436994f540779b7b7a91b63b9e1fde821c657","observation_id":"2cbcf60e-c1ad-434b-959c-abd0c90cb950","resolution":{"observed_at":"2026-08-14T11:56:53.567318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.540776Z","title":"Survey of preference elicitation methods","venue":null,"work_id":"a9291512-aa5d-4da1-8420-9e46fcc2644e","year":2004},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.943072Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:92f1c20fe10f8e52ba8e0038512eed1033de4c412a43656d163df2e71f1e0664","observation_id":"c9b3baff-61b3-46b7-a1b5-a7fdb790f07d","resolution":{"observed_at":"2026-08-14T11:56:53.550755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.523609Z","title":"Ng and Stuart J","venue":null,"work_id":"b5fbc9c1-923f-477b-9d60-a3ef4fc1ee7d","year":2000},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.947895Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:9ad8163b2b05a475154ec15cc78e1364eed44ce74878e0a495cc5e6a5b572049","observation_id":"6fede5a3-f0ff-45cb-978c-c6e5ddde259c","resolution":{"observed_at":"2026-08-14T11:56:53.529736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.506773Z","title":null,"venue":null,"work_id":"2af5926e-11f6-4c30-826d-a4c20cea004a","year":2004},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.952544Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:612e91ce8d4ffa51bd5d916d6217f91f4f8e0a6599cf62b2550ce608576c8e63","observation_id":"21513b33-8442-4274-b6a9-613df94bfd04","resolution":{"observed_at":"2026-08-14T11:56:53.512350Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:52.957457Z","title":"Generative adversarial imitation learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.957457Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:91f306dc1c7ad83436ef159ebae58d0ff1260fa30d5fd182baded694a775f4ac","observation_id":"57e6c74e-639e-403b-8c52-d96f417ff1e0","resolution":{"observed_at":"2026-08-14T11:56:52.957457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.481231Z","title":"Learning an agent’s utility function by observing behavior","venue":null,"work_id":"f99f98ee-2503-4acc-b0d0-37b07b6b6642","year":2001},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.962385Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:0d69d40f3caf59d72b6b12cfe54664d8c293e527c9b169b4e5e5946f8b1b6b1d","observation_id":"ece7dc7d-7b41-45dc-8893-9e7480650ac0","resolution":{"observed_at":"2026-08-14T11:56:53.486060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.466133Z","title":null,"venue":null,"work_id":"3a20ccaa-44be-4d46-a02c-9e27e16b79fb","year":1992},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.967348Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:20c811b69721998d1f571f5c68213ca21810f331e298d767846043e9a83ccd3c","observation_id":"da78da7b-030d-47d3-ad0e-9ad67d475697","resolution":{"observed_at":"2026-08-14T11:56:53.470860Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.451254Z","title":"Linear operator theory in engineering and science","venue":null,"work_id":"2305cdf3-f271-446c-8e70-2c6d310dd989","year":2000},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.972335Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:aca52a7f496bfbc52f7137bb9a8c1414ae6de3fbd300d503bc0d12891eb7593a","observation_id":"2300fa20-8c1d-4fcc-99ee-2f20caac3983","resolution":{"observed_at":"2026-08-14T11:56:53.456526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.435860Z","title":"Rusu, Joel Veness, Marc G","venue":null,"work_id":"91e96cb8-5e1a-41c1-a6ff-57e875ca243e","year":2015},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.977191Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:1d7760829629bc63a1ec0edf73d7d13da05dcf18a43f27b4d1fd8c2c305ef8dc","observation_id":"44e7c2b4-06b6-49e6-bbc4-2401d8240d7b","resolution":{"observed_at":"2026-08-14T11:56:53.440711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.420753Z","title":"Williams","venue":null,"work_id":"be1c7282-7861-4c4e-9ed4-ee9534f423f8","year":1992},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.982168Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:302f45567c1abe12dfbe6de92f0df48825d3ff43a2b4ad6532a62e0df23b22c6","observation_id":"b4642eb0-effd-478e-a960-f3d7e38de072","resolution":{"observed_at":"2026-08-14T11:56:53.425579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.405764Z","title":null,"venue":null,"work_id":"f4329997-1d08-44ce-9e75-4420aa8e4fdb","year":2017},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.987432Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:a688d8f4069d28d6cd6ee682211c2683fa1b928d21a3fec83693ac42e8df21c0","observation_id":"fcd0fe89-6a1e-40f7-89bc-39484dbb44e5","resolution":{"observed_at":"2026-08-14T11:56:53.410789Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.390758Z","title":"Super Mario Bros for OpenAI Gym","venue":null,"work_id":"80efcc44-774d-430c-8c96-3d6239c2f47a","year":2018},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.992400Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:c426d46f795ae0a476c0c285d8e8e5192f6fe2aeafb427ac01dae2bcdb24f760","observation_id":"d90ebf58-5692-4913-a2fb-54b6e1e2fb07","resolution":{"observed_at":"2026-08-14T11:56:53.395851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.375773Z","title":"Lillicrap, Tim Harley, David Silver, and Koray Kavukcuoglu","venue":null,"work_id":"d270afc3-f633-4190-bdc0-d2d92392fada","year":2016},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.997070Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:62853c4eb0d7c187364e8984b6c9b693f450f3d6c6fd7434ad026f22d37a3310","observation_id":"6c051386-6c0e-423d-8262-32f29e3ab58a","resolution":{"observed_at":"2026-08-14T11:56:53.380875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.360850Z","title":"An introduction to metric spaces and ﬁxed point theory , volume 53","venue":null,"work_id":"c4b61fac-57fc-4202-8f5e-9b318bf48354","year":2011},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:53.001549Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:1a1bb777b319e1ce8ac987ac5a49211627eddb68c1559f3926e6d97e71446808","observation_id":"55ec15d9-1de6-4ba3-824d-74e674ebeb64","resolution":{"observed_at":"2026-08-14T11:56:53.365683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.345739Z","title":"Bertsekas","venue":null,"work_id":"df72386a-1c58-4353-9576-4bac40b78262","year":2017},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:53.006206Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:c921fdd263fd368e7cba9f3517f0a930d274d07c76adf46945f1afc292af29a8","observation_id":"8b692673-271d-4975-b4ca-314fe904f370","resolution":{"observed_at":"2026-08-14T11:56:53.350469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.330459Z","title":"Abstract dynamic programming","venue":null,"work_id":"87775480-02a7-4112-b428-5173e177bea4","year":2018},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:53.011645Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:fb51b92de5cab5760fd0eb9faf0ad16f1471833132c9ed22ad08876b5cbd2d00","observation_id":"09e96095-5683-4f31-869a-6b6fd7bfc207","resolution":{"observed_at":"2026-08-14T11:56:53.335525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.312971Z","title":"Bellemare, Will Dabney, and Rémi Munos","venue":null,"work_id":"df4c70dd-a941-4990-8375-42bfccbec1a5","year":2017},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:53.016268Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:0877f9dbaff0ebc897c52ef9c5b16c2915730769a3b13724cd0088a34c9bb49a","observation_id":"ae4ed655-411f-4a5f-b5a4-2ddab26ad216","resolution":{"observed_at":"2026-08-14T11:56:53.318359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.296613Z","title":null,"venue":null,"work_id":"1ff1fc3a-0da2-4216-a714-9d33d4633cc5","year":2009},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:53.020970Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:adc50e2f74ec7bcbd96927a34202c83f49b56ce616d1af7f9728434095bb826c","observation_id":"53faeaeb-8ad9-41f2-9e1a-5c9ffb3c2dbd","resolution":{"observed_at":"2026-08-14T11:56:53.301369Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.280185Z","title":null,"venue":null,"work_id":"2a2f6deb-b96d-4053-879e-06552f6b50a2","year":2017},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:53.025666Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:4c575372ec636a283adcfe850d2329edd43fb0c22a85466c2fb3d3612ac4603d","observation_id":"abc54813-b7b9-4f31-a20c-61254d0d0439","resolution":{"observed_at":"2026-08-14T11:56:53.285223Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-14T11:56:53.030338Z","title":"Lillicrap, Jonathan J","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:53.030338Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:2452ac4204cbd0c74e6e9693efe98802d167e2491041d5b82797275228f5b8fd","observation_id":"9685e182-42af-4feb-aadb-17ca3c16f4de","resolution":{"observed_at":"2026-08-14T11:56:53.030338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.263158Z","title":"Lillicrap, Ilya Sutskever, and Sergey Levine","venue":null,"work_id":"050f5569-4966-42de-8714-df5ffe81fc28","year":2016},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:53.035324Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:108844c148a3fe3cb12c1642997fd4018ba86d15c9f2a64b22db24af2bf74b50","observation_id":"44b7b07d-b4bb-44df-a302-5c30148d8cb7","resolution":{"observed_at":"2026-08-14T11:56:53.268052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.05035","last_updated":"2019-06-08T00:56:16Z","snapshot_observed_at":"2026-08-14T21:00:48.813378Z","submitted_at":"2017-05-14T22:53:13Z","title":"Discrete Sequential Prediction of Continuous Actions for Deep RL","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.05035","snapshot_observed_at":"2026-08-14T11:56:53.040237Z","title":"Discrete sequential prediction of continuous actions for deep RL","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:53.040237Z"},"links":{"cited_paper":"/paper/1705.05035","citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:f81cf056042426b78a3c94f41e5b3f7b63a2ab068d076b16cd2cdbea804961a7","observation_id":"96f47eb8-f3d4-48f7-9303-ceffb0850709","resolution":{"observed_at":"2026-08-14T11:56:53.040237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.246549Z","title":"Deep reinforcement learning with double q-learning","venue":null,"work_id":"aeb11300-b395-44d7-913e-50d051571d88","year":2016},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:53.046149Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:37f40f0bbb14a90fa61683fd2f2c06f92dc9998f45549983a4af4cafa2e5dd3a","observation_id":"2fb1e13f-327b-4261-be39-20ab4bf3c5d1","resolution":{"observed_at":"2026-08-14T11:56:53.252418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05952","last_updated":"2016-02-25T17:55:31Z","snapshot_observed_at":"2026-08-14T22:22:20.346852Z","submitted_at":"2015-11-18T20:54:44Z","title":"Prioritized Experience Replay","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05952","snapshot_observed_at":"2026-08-14T11:56:53.050880Z","title":"Prioritized experience replay","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:53.050880Z"},"links":{"cited_paper":"/paper/1511.05952","citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:eb95fa838f08931a58ebc1c49658b02a12e31439d2b4478e1d09b63fac808c66","observation_id":"6af8a5c1-7d74-4831-bcee-da4373d59237","resolution":{"observed_at":"2026-08-14T11:56:53.050880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.230230Z","title":null,"venue":null,"work_id":"4651385b-9f79-44d0-8f49-a1935a5e2312","year":2008},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:53.055989Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:11e5319f133ee1e4dd39922dd997bc94d258fddf8a4d699894a539259fd57eb0","observation_id":"09fe7a03-3e45-4254-98c2-4a39f857887c","resolution":{"observed_at":"2026-08-14T11:56:53.235078Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.214585Z","title":null,"venue":null,"work_id":"23edf2de-43f7-4c87-b79b-b01638359602","year":null},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:53.061320Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:d9d4117409301625e3618d882f0a0ba040e82b2f4705d1a892108cfcd32515f2","observation_id":"2472494a-0850-477a-9351-a95d7de76bca","resolution":{"observed_at":"2026-08-14T11:56:53.219524Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.197556Z","title":"distance","venue":null,"work_id":"5f338cec-6552-4f64-b42c-d674f431e6b5","year":null},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:53.066373Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:a017cf909204a427e3bf841615ea77f0dc2c63da942373d7f0ab16ea23e16c49","observation_id":"b9507c95-d276-4b46-82c7-954cd185ffc5","resolution":{"observed_at":"2026-08-14T11:56:53.203911Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T11:49:08.586236Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":37},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 3 inbound Pith citation observations for arXiv:1908.08342."}