{"as_of":"2026-08-12T21:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4f729c81b44c074495309bafaf1ea6f0b9cd3eb10654c4bc4e1b7def6385efb9","coverage":[{"denominator":300,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T19:09:54.006504Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.07177/citation-record","integrity":"/paper/2412.07177/integrity","json":"/paper/2412.07177/citation-record.json","paper":"/paper/2412.07177"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.173661Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.173661Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:30f6b4c1a4324d3d3a46846ec5ffe302e283b45a24627613d6558ad087236edd","observation_id":"f670229a-7884-4a60-a7c8-b7924ffe79e2","resolution":{"observed_at":"2026-08-11T19:09:53.173661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.182649Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.182649Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:1338dbe2f525e3e70f7eac3cb37c296b7f3b39266d2d03409f652bfb9a5fa0cc","observation_id":"5ce6d39f-ebc7-4668-9d47-185b987f835d","resolution":{"observed_at":"2026-08-11T19:09:53.182649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.189309Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.189309Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:ac95d71fb90908cf317a657f051b04bee33991c0dfb0d8b097870899876d9a28","observation_id":"bf6479eb-f08c-4c86-8f4c-3976865bd0b1","resolution":{"observed_at":"2026-08-11T19:09:53.189309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.196826Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.196826Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:0622281901d80d5a513f28ff23b3c7fb7f71d868b28ea44b20106e4e0b9f713c","observation_id":"d9582fd8-9708-4b24-893a-6f74f4a45b4f","resolution":{"observed_at":"2026-08-11T19:09:53.196826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.206559Z","title":"and Ng, A","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.206559Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:850ae2781dd5690de0e3850d1debb9d390d4c5a8ead1e9cd59a9b2ef23c9339d","observation_id":"e41861d2-2621-4006-a9d9-57e5d91e27e3","resolution":{"observed_at":"2026-08-11T19:09:53.206559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.214761Z","title":"and Ng, A","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.214761Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:f1be7039ed9c5ccafc5babba8a94711062cfc3d55a8d5a59ed0ef9781cbfb09c","observation_id":"089b4a0c-6696-494f-853d-b41283a0127d","resolution":{"observed_at":"2026-08-11T19:09:53.214761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.221622Z","title":"K., Littman, M., Precup, D., and Singh, S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.221622Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:39867626efd8efbba7f56794077e8693b9e4d1b004258ff747df86118665e87a","observation_id":"d9720b40-68cf-48ee-a7c9-0ee8239e1cf2","resolution":{"observed_at":"2026-08-11T19:09:53.221622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.229386Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.229386Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:7592c794bcb92105bc17c3db8c7f1bdcdecdf1651dcb6732c7b005eed753b8da","observation_id":"adfd7db3-5749-44a6-8eba-ed931304f984","resolution":{"observed_at":"2026-08-11T19:09:53.229386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.235299Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.235299Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:927a04b36f3007bc65bb95c95bc87eca59c2124d998243bf153e9f5d58c5d416","observation_id":"be446dbb-fbc9-4be0-b634-f49cbfb80154","resolution":{"observed_at":"2026-08-11T19:09:53.235299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.242527Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.242527Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:eb9193f19c20df9940dab4e5e45267fbc2e07be73a4a515cbefba5fecbb6a930","observation_id":"a8a3d86c-0c6a-499e-8b9d-b6123b1aacb4","resolution":{"observed_at":"2026-08-11T19:09:53.242527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.08492","last_updated":"2019-01-24T16:44:16Z","snapshot_observed_at":"2026-07-06T07:28:48.758265Z","submitted_at":"2019-01-24T16:44:16Z","title":"Feudal Multi-Agent Hierarchies for Cooperative Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.08492","snapshot_observed_at":"2026-08-11T19:09:53.250041Z","title":"and Dayan, P","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.250041Z"},"links":{"cited_paper":"/paper/1901.08492","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:b0c58d293543c2307241131048e93c4c69a5d89e312482c936934dd58851c6b9","observation_id":"6e22357e-ddb0-4685-bbcf-7166c49ae5ea","resolution":{"observed_at":"2026-08-11T19:09:53.250041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-11T19:09:53.255834Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.255834Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:8a6955805690a42e31e16e86b56748270c9eac48874526e4a3f79a0338469693","observation_id":"4b3ede61-5ab0-4aaf-a747-cec72cf31152","resolution":{"observed_at":"2026-08-11T19:09:53.255834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.266861Z","title":null,"venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.266861Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:2550df3600c675c255389dae3da1ba0448bc05b3f461c67d8b3dfd4013112640","observation_id":"e7324c04-d8f0-4e08-b7ba-719ab1f929be","resolution":{"observed_at":"2026-08-11T19:09:53.266861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07113","last_updated":"2019-10-16T00:59:05Z","snapshot_observed_at":"2026-08-02T15:37:37.200292Z","submitted_at":"2019-10-16T00:59:05Z","title":"Solving Rubik's Cube with a Robot Hand","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07113","snapshot_observed_at":"2026-08-11T19:09:53.274117Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.274117Z"},"links":{"cited_paper":"/paper/1910.07113","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:9c622692af2a82da16b6e003e474b073d99f5ade51b370c9928c53111a65d82d","observation_id":"4da7c10a-aab0-40f4-896d-aaaea15babd1","resolution":{"observed_at":"2026-08-11T19:09:53.274117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.283558Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.283558Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:6ff34d25bfcead8d0f9e539cb81578aa05445958920b48275b2340fcfd15bcb7","observation_id":"add28bfa-6651-4b5e-a342-db45149cb1a9","resolution":{"observed_at":"2026-08-11T19:09:53.283558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.04764","last_updated":"2020-11-17T19:09:57Z","snapshot_observed_at":"2026-07-06T10:13:06.905381Z","submitted_at":"2020-11-09T21:07:56Z","title":"Deep Reinforcement Learning for Navigation in AAA Video Games","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.04764","snapshot_observed_at":"2026-08-11T19:09:53.289927Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.289927Z"},"links":{"cited_paper":"/paper/2011.04764","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:f90fe4583e82e937a2472feed4efcd3404708241ce1b2d5d0daea6793252e0b9","observation_id":"91c3085d-16f1-4244-97b7-213c21c114fe","resolution":{"observed_at":"2026-08-11T19:09:53.289927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.300139Z","title":null,"venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.300139Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:c8d216683fe98348d34d1e01daebd681b1c9ef4d46d7a0bc826ce54f9141316a","observation_id":"a974e33a-8fd6-4da6-96d7-8583e287f451","resolution":{"observed_at":"2026-08-11T19:09:53.300139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","snapshot_observed_at":"2026-08-07T00:59:44.889602Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00157","snapshot_observed_at":"2026-08-11T19:09:53.307309Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.307309Z"},"links":{"cited_paper":"/paper/2109.00157","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:b98afde816a4812e7604a90b6803194039daeac81061b276d4e34e50286515af","observation_id":"595fc39b-f931-4b4d-abbb-d9a20d1d694f","resolution":{"observed_at":"2026-08-11T19:09:53.307309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-11T19:09:53.314188Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.314188Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:3c7b2b178761ad893a81b223ff41a0612ee8ac7c929e715c8548c1f7d0bebf73","observation_id":"dd3de39f-95d6-46ae-8a40-2e46c3625b5b","resolution":{"observed_at":"2026-08-11T19:09:53.314188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.09708","last_updated":"2019-06-18T19:47:07Z","snapshot_observed_at":"2026-07-06T07:41:06.398227Z","submitted_at":"2019-03-22T20:56:55Z","title":"Explaining Reinforcement Learning to Mere Mortals: An Empirical Study","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.09708","snapshot_observed_at":"2026-08-11T19:09:53.322858Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.322858Z"},"links":{"cited_paper":"/paper/1903.09708","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:62d27af4df155088dfbd6c20da9745be2e101575b624aceec576d129e031ab6a","observation_id":"7d1d635b-38b9-48a4-aaa5-f5256f9fa57f","resolution":{"observed_at":"2026-08-11T19:09:53.322858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.331142Z","title":"P., and Zaremba, W","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.331142Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:a25cb0742ea797dc5311948bda0f4bd164e924d8bd29ff9b8a6c5aae882adb9c","observation_id":"e341f36f-1766-48f1-9580-b6bfd63d85c2","resolution":{"observed_at":"2026-08-11T19:09:53.331142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.339566Z","title":"M., Baker, B., Chociej, M., Jozefowicz, R., McGrew, B., Pachocki, J., Petron, A., Plappert, M., Powell, G., Ray, A., et al","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.339566Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:b900a0e40dadeb2307af740971125850e8b702e96d759fcaf565f75f193fa4ec","observation_id":"5d7f753a-6bbe-4747-acbc-fe25c17ebb63","resolution":{"observed_at":"2026-08-11T19:09:53.339566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.355859Z","title":"and Doshi, P","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.355859Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:011015b7ab4e4d26341a2e6fb896d40bb8a610645f8b0cc708a37a848f9f23da","observation_id":"d0a6d152-ee32-46e6-aa7b-c3f586a92ed5","resolution":{"observed_at":"2026-08-11T19:09:53.355859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.06616","last_updated":"2018-06-19T17:19:29Z","snapshot_observed_at":"2026-08-07T12:09:31.557752Z","submitted_at":"2017-04-21T16:15:19Z","title":"Accurately and Efficiently Interpreting Human-Robot Instructions of Varying Granularities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.06616","snapshot_observed_at":"2026-08-11T19:09:53.364279Z","title":"L., and Tellex, S","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.364279Z"},"links":{"cited_paper":"/paper/1704.06616","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:214bee6ec56068517886556f9adc3cdcd28aa2a15d9fc6b1279e7cda2dc80333","observation_id":"628072b7-53e6-49e4-a569-91408f889bcb","resolution":{"observed_at":"2026-08-11T19:09:53.364279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-08-10T12:03:10.373653Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00861","snapshot_observed_at":"2026-08-11T19:09:53.371592Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.371592Z"},"links":{"cited_paper":"/paper/2112.00861","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:30e7978c69c3d14acc449daff0f04c99a655e7f657344c8f21f977802bb1f1a8","observation_id":"53131749-ec93-4df1-bf40-04dda5322d80","resolution":{"observed_at":"2026-08-11T19:09:53.371592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04178","last_updated":"2023-12-22T20:58:14Z","snapshot_observed_at":"2026-07-06T14:49:45.081117Z","submitted_at":"2023-02-08T16:36:40Z","title":"DynGFN: Towards Bayesian Inference of Gene Regulatory Networks with GFlowNets","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04178","snapshot_observed_at":"2026-08-11T19:09:53.389663Z","title":"J., Wang, B., and Bengio, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.389663Z"},"links":{"cited_paper":"/paper/2302.04178","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:0104e1b9346d95ed557807e909f3a41668e2743416d7c246eda6184d5096735f","observation_id":"13785aa4-9151-4ed9-91d5-cfab30392e51","resolution":{"observed_at":"2026-08-11T19:09:53.389663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.398571Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.398571Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:6dce65f6bb10444ed1895c29d86db1a828c85dc7057a707b29e66b3897763861","observation_id":"bbb50bcb-4d33-4ddd-8651-a3f00a12f6de","resolution":{"observed_at":"2026-08-11T19:09:53.398571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-12T08:59:05.030983Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-11T19:09:53.405296Z","title":"L., Kiros, J","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.405296Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:25ae558cd135ed083ea9c6ed87d1fb205c8b84500e6f80ef9816e1f7b7006d76","observation_id":"5fd203ce-372e-46af-ab1d-4e7b8a4e940e","resolution":{"observed_at":"2026-08-11T19:09:53.405296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.412042Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.412042Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:516178aba5d70352d2ccb0011c47ef29ecf428d88c0606f0cdcf8c9c960fd730","observation_id":"de6390a0-20a3-407b-91f7-316ce7f5691b","resolution":{"observed_at":"2026-08-11T19:09:53.412042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.01946","last_updated":"2019-12-23T16:41:02Z","snapshot_observed_at":"2026-08-11T19:26:35.653372Z","submitted_at":"2018-06-05T22:01:51Z","title":"Learning to Understand Goal Specifications by Modelling Reward","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.01946","snapshot_observed_at":"2026-08-11T19:09:53.418720Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.418720Z"},"links":{"cited_paper":"/paper/1806.01946","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:616137edafd47668adca380d80d4d2f3aaaa70ae30bcc7aee1a265a259a7d937","observation_id":"8b51f118-118b-4bce-9f9c-9d0bd1048d01","resolution":{"observed_at":"2026-08-11T19:09:53.418720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-11T19:09:53.425217Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.425217Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:e7c74b61f7bcfd8c5271367b0de5e9de0ff9a2438aca231a3d25087842071a66","observation_id":"1972b0e1-6630-4a0f-bd70-08c3b8ddf945","resolution":{"observed_at":"2026-08-11T19:09:53.425217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.436472Z","title":"P., O’malley, M","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.436472Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:bd3d3bc636983617c3b10ef07d02ff8ecd05b5eef2cb8d820b61d0f08ae777f4","observation_id":"f65dbb71-f6f0-4ef5-91f6-5a2a5fc7896c","resolution":{"observed_at":"2026-08-11T19:09:53.436472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.443398Z","title":"and Narayanan, S","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.443398Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:4184eea6d25bba05b542e74ee20262b62aefec030aba7f83040df04191c45b01","observation_id":"5b4979f7-dcff-4dff-9d1f-43fb575db73d","resolution":{"observed_at":"2026-08-11T19:09:53.443398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.449852Z","title":"L., Waytowich, N","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.449852Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:452accddeca81676fb741ff4b1b72e970e41f708636cca8b7546d106dd9e8351","observation_id":"aa328edd-1c67-4763-b170-851b136f5d51","resolution":{"observed_at":"2026-08-11T19:09:53.449852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11731","last_updated":"2021-12-22T08:48:00Z","snapshot_observed_at":"2026-08-03T20:57:18.983852Z","submitted_at":"2021-12-22T08:48:00Z","title":"Graph augmented Deep Reinforcement Learning in the GameRLand3D environment","version":1},"cited_work":{"arxiv_id":"2112.11731","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.11731","snapshot_observed_at":"2026-08-11T19:09:58.008125Z","title":"Graph augmented Deep Reinforcement Learning in the GameRLand3D environment","venue":"cs.LG","work_id":"9fc65f3f-7703-4ca7-a056-a33669ea5054","year":2021},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.455937Z"},"links":{"cited_paper":"/paper/2112.11731","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:277f0d81f7a64a79189ce5fbf26f9c33c091e47ecc70204f857b83b6f780d442","observation_id":"c9f9c7dc-196f-4ed8-bad2-3f9bb884c6e4","resolution":{"observed_at":"2026-08-11T19:09:58.013775Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.463071Z","title":"G., Candido, S., Castro, P","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.463071Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:a18d735872b29dc289eaf4e4a1a1faf3e8886a4017b0e799b7847da6cb16d7f3","observation_id":"6c883da5-c171-4883-aee1-8d3402a55021","resolution":{"observed_at":"2026-08-11T19:09:53.463071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06887","last_updated":"2017-07-21T13:21:54Z","snapshot_observed_at":"2026-08-10T05:04:46.941947Z","submitted_at":"2017-07-21T13:21:54Z","title":"A Distributional Perspective on Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06887","snapshot_observed_at":"2026-08-11T19:09:53.481057Z","title":"G., Dabney, W., and Munos, R","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.481057Z"},"links":{"cited_paper":"/paper/1707.06887","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:61a59e641990273c0df0191c695372cef85ffc82f9137ff95a917e9f6782ffb4","observation_id":"889c3a95-3e21-460b-834e-2bfb943f18c6","resolution":{"observed_at":"2026-08-11T19:09:53.481057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.490833Z","title":"G., Naddaf, Y., Veness, J., and Bowling, M","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.490833Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:92808e804e87fe89074ee4638969a47b58424225ee63a92589555d4f98eb2789","observation_id":"2ccca836-b239-4653-986a-01eb009f15c3","resolution":{"observed_at":"2026-08-11T19:09:53.490833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.496335Z","title":null,"venue":null,"work_id":null,"year":1966},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.496335Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:8af15ed213cabcad49befab7068a2a0cb97d5f8b02dc18243610e2de4f095715","observation_id":"1ee61b4a-6e58-4f43-953c-c0b5a7c81cbf","resolution":{"observed_at":"2026-08-11T19:09:53.496335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.502689Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.502689Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:ef5bc2d60ab4c4f196b39a53b16289d5bfca72fdf40e55994ad32559950a6b2c","observation_id":"d72c8e5e-efd3-4fef-82ba-911ded7c3725","resolution":{"observed_at":"2026-08-11T19:09:53.502689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.508816Z","title":"J., Tiwari, M., and Bengio, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.508816Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:fab5bc3efdd920f09ec973b70b0cddd4a32a451bfcb9494be8140b5e284835e6","observation_id":"0c2d210c-b3ce-4eec-b8d6-079a4182122d","resolution":{"observed_at":"2026-08-11T19:09:53.508816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.515914Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.515914Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:999250ba8e9ff92a948a3276650a57f1e2e1a9025e652316947bd47b33e3ffc1","observation_id":"04f0d674-0eb1-49b8-9c6b-a0e03efa5b1b","resolution":{"observed_at":"2026-08-11T19:09:53.515914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06680","last_updated":"2019-12-13T19:56:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-12-13T19:56:40Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06680","snapshot_observed_at":"2026-08-11T19:09:53.525635Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.525635Z"},"links":{"cited_paper":"/paper/1912.06680","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:051f6a0a1885934475a8c982ef0e1fc1e9b1bd7ecc37f3be66c98e5942561541","observation_id":"0c08540c-3345-488b-8f3e-b0a45aeda7af","resolution":{"observed_at":"2026-08-11T19:09:53.525635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.533327Z","title":null,"venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.533327Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:b67bb093485b6ab4d0018a33f6af157b1cd56f81b663a1c4e2747c1680be11a3","observation_id":"ddfd02f1-1dd0-47ed-8614-3cccdf70e470","resolution":{"observed_at":"2026-08-11T19:09:53.533327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.540326Z","title":"R., Paolini, G","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.540326Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:4205c9b62a14b2cafec989961176aaccf2c4568a9c093087752a8e6b362fdd0f","observation_id":"46888275-f4a3-4d5b-aac9-e4832d064882","resolution":{"observed_at":"2026-08-11T19:09:53.540326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.04623","last_updated":"2019-02-12T20:31:43Z","snapshot_observed_at":"2026-08-10T11:47:48.941696Z","submitted_at":"2019-02-12T20:31:43Z","title":"Value constrained model-free continuous control","version":1},"cited_work":{"arxiv_id":"1902.04623","doi":null,"metadata_source":"pith","pith_arxiv_id":"1902.04623","snapshot_observed_at":"2026-08-11T19:09:57.917836Z","title":"Value constrained model-free continuous control","venue":"cs.RO","work_id":"376d96f2-764c-4b09-8397-2149422e8de0","year":2019},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.547799Z"},"links":{"cited_paper":"/paper/1902.04623","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:4424dac2c8ba1db253228f8a57c7043953e043167cf75245de4ce7c4ff8a3af7","observation_id":"81cc074e-07d3-4d19-a596-10041e5454f3","resolution":{"observed_at":"2026-08-11T19:09:57.928298Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.557042Z","title":"B., Shah, J., Niekum, S., Stone, P., and Allievi, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.557042Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:72b92e5542211754116de01fb0b8aa1f34cf17f957d9ea974798a1a87af8b30d","observation_id":"9eca8b83-2bda-490f-884b-869f29da442b","resolution":{"observed_at":"2026-08-11T19:09:53.557042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.564946Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.564946Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:0e9ec2b35153c63e46213d857a88f0d0dde37815aaca5373b9bc7a96389d937e","observation_id":"d16b75b8-bc84-4b85-853c-c0933d4b2282","resolution":{"observed_at":"2026-08-11T19:09:53.564946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.574458Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.574458Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:30862d5458323ab7d69022cc5deeb1b3d0edc2730f26316c0f772c01ad8096a6","observation_id":"4eb1e295-03c8-4341-8886-743a9bd84f65","resolution":{"observed_at":"2026-08-11T19:09:53.574458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.581171Z","title":"D., Abel, D., and Dabney, W","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.581171Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:d73e1ad326a21f4a7eb33b823fb99f5eefe21440be05e23ad3f80d2cfa25f4fb","observation_id":"992bda25-33e8-4904-a021-b0c9ff3f0139","resolution":{"observed_at":"2026-08-11T19:09:53.581171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-12T05:40:07.199512Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-11T19:09:53.593141Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.593141Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:b083c4fc9e89f6f7faeccfbe9cf66cf19a2c0712761eba5fb6beb45ff9d08e55","observation_id":"7de053a7-3e23-4bf6-9bf8-26736579e514","resolution":{"observed_at":"2026-08-11T19:09:53.593141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.06387","last_updated":"2019-07-09T03:51:47Z","snapshot_observed_at":"2026-08-11T06:17:40.521534Z","submitted_at":"2019-04-12T19:34:43Z","title":"Extrapolating Beyond Suboptimal Demonstrations via Inverse Reinforcement Learning from Observations","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.06387","snapshot_observed_at":"2026-08-11T19:09:53.600198Z","title":"S., Goo, W., Nagarajan, P., and Niekum, S","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.600198Z"},"links":{"cited_paper":"/paper/1904.06387","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:e82f86422113ed8e028b5e1e22ec4469e87549bad5dc0f7281ab93b2e05c9013","observation_id":"14aa8807-f81d-43a9-be22-00705510bf67","resolution":{"observed_at":"2026-08-11T19:09:53.600198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.613259Z","title":"H., and Vaucher, A","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.613259Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:47df87a97cbc3ccdac0b2e624c92c9c70e9c6ef44719ec49673c4b7de180da20","observation_id":"239d6426-e858-4a33-b371-605d06227559","resolution":{"observed_at":"2026-08-11T19:09:53.613259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.620653Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.620653Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:b46abb1151d33e13e16f91210e5c4157a1896cc925c7fc8a7a2141bc15de0c51","observation_id":"19bf22df-ddb1-4b32-8e56-758bfff2917a","resolution":{"observed_at":"2026-08-11T19:09:53.620653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.06324","last_updated":"2020-11-27T17:27:30Z","snapshot_observed_at":"2026-07-06T10:03:59.250468Z","submitted_at":"2020-10-13T12:15:23Z","title":"Balancing Constraints and Rewards with Meta-Gradient D4PG","version":2},"cited_work":{"arxiv_id":"2010.06324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.06324","snapshot_observed_at":"2026-08-11T19:09:57.827366Z","title":"Balancing Constraints and Rewards with Meta-Gradient D4PG","venue":"cs.LG","work_id":"299d4fd9-865e-472c-abc4-840266f7b53e","year":2020},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.627582Z"},"links":{"cited_paper":"/paper/2010.06324","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:0c9cf4543f6e2cb392ca8aaf29f42db602765a94d963cc784a0a10f2c2839da2","observation_id":"5b02448d-cd8d-4a4a-a6f3-040bad8b795c","resolution":{"observed_at":"2026-08-11T19:09:57.833406Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.635035Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.635035Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:7631103ae8bb4b8d7e02d04c95cb73dc57428d16db5734d61fa15d67632ca59a","observation_id":"02ff1b52-1fc7-4ddb-8da8-65787e12fc85","resolution":{"observed_at":"2026-08-11T19:09:53.635035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.642271Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.642271Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:85f1d79ca8f7143c0c4c33c368c02a20c42d24ef07166d4d3ce0ad96ea7e6fdf","observation_id":"7ee31b36-4e34-46c4-8b35-7772d11a96eb","resolution":{"observed_at":"2026-08-11T19:09:53.642271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.653902Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.653902Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:5379bc5f3515e7c85b160fcb6442505c48a507226fdae631155757adcf626319","observation_id":"26c6f9e7-cf8c-48d0-825a-abac7f9c29f7","resolution":{"observed_at":"2026-08-11T19:09:53.653902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.661473Z","title":"u rnkranz, J., H \\","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.661473Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:69a44b0308b143efbe89cad7c73dc84a68991e512758f634737e1f41e2a45f73","observation_id":"c0a9aee7-44c5-43f6-b7f5-5097d89ab056","resolution":{"observed_at":"2026-08-11T19:09:53.661473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.667235Z","title":"G., and Singh, S","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.667235Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:5839446bf3deef64769b91e9dc9f05f2356daa9958c59111903412bbb576754e","observation_id":"3b879b8c-1080-45df-8598-7506052ce900","resolution":{"observed_at":"2026-08-11T19:09:53.667235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.08272","last_updated":"2019-12-19T15:44:33Z","snapshot_observed_at":"2026-08-08T23:50:48.318949Z","submitted_at":"2018-10-18T20:48:08Z","title":"BabyAI: A Platform to Study the Sample Efficiency of Grounded Language Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.08272","snapshot_observed_at":"2026-08-11T19:09:53.674314Z","title":"H., and Bengio, Y","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.674314Z"},"links":{"cited_paper":"/paper/1810.08272","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:6d7863d9a0787ec2f1db1ce994db792c30298d0117bce910f4825e1aaee94a1f","observation_id":"ea2188bb-ae4b-4ce4-ad80-d572e4f02603","resolution":{"observed_at":"2026-08-11T19:09:53.674314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.681347Z","title":"and Kim, K.-E","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.681347Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:f03602e3014b0e970de7e3c03bdda41163b010d336940d462b812e2aff2c87b2","observation_id":"94e48b24-8898-4d09-8247-f5de408aea82","resolution":{"observed_at":"2026-08-11T19:09:53.681347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.687973Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.687973Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:483858ecf16bde24ee0b412ba837553c862d1b598b47e615c0d36d38eea8fb75","observation_id":"7edc8b98-99dc-4e0f-af39-9b949900490a","resolution":{"observed_at":"2026-08-11T19:09:53.687973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.696255Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.696255Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:3dfbe5c8e9a82045b7c86ac823cb5409f88aeca8feb77d08446cb33f069449ed","observation_id":"a65f529c-6fd3-4e2f-9358-2d9686dcad04","resolution":{"observed_at":"2026-08-11T19:09:53.696255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.10031","last_updated":"2019-02-11T20:52:42Z","snapshot_observed_at":"2026-08-04T06:42:19.463125Z","submitted_at":"2019-01-28T23:14:58Z","title":"Lyapunov-based Safe Policy Optimization for Continuous Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.10031","snapshot_observed_at":"2026-08-11T19:09:53.703918Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.703918Z"},"links":{"cited_paper":"/paper/1901.10031","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:b32e5e2823230add0931de6bc5dd1e3d6df4cfae97fa5f694f53d617ac90c715","observation_id":"caead2f4-d565-4a16-b601-04a375a763eb","resolution":{"observed_at":"2026-08-11T19:09:53.703918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.712753Z","title":"F., Leike, J., Brown, T., Martic, M., Legg, S., and Amodei, D","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.712753Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:b186ce850b4d6fd8fcf6c608599e0c18ab93a355e0e2452f858152c003b0cb85","observation_id":"44b13125-9c77-41dd-8aa1-5684c4b07b6a","resolution":{"observed_at":"2026-08-11T19:09:53.712753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.724470Z","title":"and Amodei, D","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.724470Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:e027e10ef71d485e9f4bb2eec401c2152a633af2fd248eab79579ab084cd02ce","observation_id":"2758b84a-e19c-47c0-ba0c-8d85921589f9","resolution":{"observed_at":"2026-08-11T19:09:53.724470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.733769Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.733769Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:25db31a16c8ed932af6d8ea06b83e02da3421c7791391e1605ea3a4a75ab5ac5","observation_id":"2d750245-79b7-4c5b-83e7-4fb08c060cd9","resolution":{"observed_at":"2026-08-11T19:09:53.733769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.743079Z","title":"and Niekum, S","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.743079Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:166a562bf7241471c31d0bccb445154af2f894ddf0179568fbdc8e99a6f5605d","observation_id":"d5d4711a-99d6-4167-a660-35c939c1dfed","resolution":{"observed_at":"2026-08-11T19:09:53.743079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.752217Z","title":null,"venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.752217Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:c8b0cf55c80bc4a3e586171b7517e25e111b8a7f771ea6d2df32b3e83ba09480","observation_id":"85619297-2c24-467d-9076-c0fadba86258","resolution":{"observed_at":"2026-08-11T19:09:53.752217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.759937Z","title":"G., and Silver, D","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.759937Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:a08f281b2a1b67906e65032043e9f1eebebc6171d38b9267bb5e82c0da32d1d7","observation_id":"3780a273-9c48-4032-a1fb-c49de9d14ff4","resolution":{"observed_at":"2026-08-11T19:09:53.759937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.767064Z","title":"G., and Munos, R","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.767064Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:f517559248402b3791c7f8545d2441a1ee6272a9e73bf949bfdaea841fb6b7bc","observation_id":"16dcd7c3-7925-4efb-9112-b146b1a77c9f","resolution":{"observed_at":"2026-08-11T19:09:53.767064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.08757","last_updated":"2018-01-26T11:11:18Z","snapshot_observed_at":"2026-08-09T14:33:35.632300Z","submitted_at":"2018-01-26T11:11:18Z","title":"Safe Exploration in Continuous Action Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.08757","snapshot_observed_at":"2026-08-11T19:09:53.774090Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.774090Z"},"links":{"cited_paper":"/paper/1801.08757","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:555d10e80f51f6ab5a1cb527d29b0ece1029be0ce3caeb526fcc087f542b8833","observation_id":"f9562dfe-e4ee-4a2e-8b28-cb5b2815f8c0","resolution":{"observed_at":"2026-08-11T19:09:53.774090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03315","last_updated":"2025-02-19T18:52:54Z","snapshot_observed_at":"2026-08-12T14:11:42.481208Z","submitted_at":"2023-09-06T18:56:20Z","title":"Robotic Table Tennis: A Case Study into a High Speed Learning System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03315","snapshot_observed_at":"2026-08-11T19:09:53.789787Z","title":"B., Abelian, J., Abeyruwan, S., Ahn, M., Bewley, A., Boyd, J., Choromanski, K., Cortes, O., Coumans, E., Ding, T., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.789787Z"},"links":{"cited_paper":"/paper/2309.03315","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:430f56455fe43bccec1af0456fa8d5a7b35aafbc54e3e0536df39b5975f1ac6c","observation_id":"fac7ee7e-2ea4-4aea-85ff-8e0a3cfa6ad1","resolution":{"observed_at":"2026-08-11T19:09:53.789787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.799929Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.799929Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:88139cb2057c2871b3f476a8997e8b7a209cb5ed4ac12379dde35f6acccff4cb","observation_id":"15297a9f-e93b-4ee4-9b89-b5847006731b","resolution":{"observed_at":"2026-08-11T19:09:53.799929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.810292Z","title":"and Dennis, J","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.810292Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:fecddba1e4ab8b9a0df4ece183d2737538d604754a06058c55a97d02349760f0","observation_id":"001f70bd-cbd3-49e0-916e-f6f2aeda4092","resolution":{"observed_at":"2026-08-11T19:09:53.810292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.818319Z","title":null,"venue":null,"work_id":null,"year":1963},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.818319Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:516dff4db4e4d006d1d3d1f7521fd04944f7f2f1c1943ab06555300350db0073","observation_id":"27da0fd3-5053-4011-a8fc-d1c524a851e9","resolution":{"observed_at":"2026-08-11T19:09:53.818319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.823332Z","title":"and Hinton, G","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.823332Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:a06354ab9c26dd314023fbb6f0076b4d37695ca5d93b9c89dcb3ecec8c68a782","observation_id":"f3e78f71-fb45-4da2-8549-60d605283617","resolution":{"observed_at":"2026-08-11T19:09:53.823332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.829780Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.829780Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:33eb8377a47085864e4afc110c300150d4edd09c257c8024081556779ae7772e","observation_id":"6481a611-15a4-4696-8bf7-50a41fd79e94","resolution":{"observed_at":"2026-08-11T19:09:53.829780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.838358Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.838358Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:1219ad42c5615ff4ef222bfc9deff2a0f17241bdba8ba000a860d848e90234d2","observation_id":"a2c90d26-5996-498a-b768-75edae709482","resolution":{"observed_at":"2026-08-11T19:09:53.838358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1205.4839","last_updated":"2013-06-20T10:53:42Z","snapshot_observed_at":"2026-08-09T21:46:44.280239Z","submitted_at":"2012-05-22T08:36:41Z","title":"Off-Policy Actor-Critic","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1205.4839","snapshot_observed_at":"2026-08-11T19:09:53.847628Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.847628Z"},"links":{"cited_paper":"/paper/1205.4839","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:c5036a6d609525fcfef20de14964f5fa09c84d051510cf56c850959e9f4090cf","observation_id":"840cd487-d96a-4fdf-b43f-492de65b5755","resolution":{"observed_at":"2026-08-11T19:09:53.847628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.859480Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.859480Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:15d07a5269e2156cbe51200f0f5359dd296a8a63ed810ee20d9dfd557cde2f34","observation_id":"b7d33566-2f04-4e2a-bc4b-e8f91f0f4e92","resolution":{"observed_at":"2026-08-11T19:09:53.859480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.09637","last_updated":"2021-07-28T12:49:43Z","snapshot_observed_at":"2026-07-06T11:11:12.398524Z","submitted_at":"2021-05-20T10:14:23Z","title":"Navigation Turing Test (NTT): Learning to Evaluate Human-Like Navigation","version":2},"cited_work":{"arxiv_id":"2105.09637","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.09637","snapshot_observed_at":"2026-08-11T19:09:57.676819Z","title":"Navigation Turing Test (NTT): Learning to Evaluate Human-Like Navigation","venue":"cs.AI","work_id":"f16998fc-abe9-4de8-a0e1-eceadca50ae3","year":2021},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.867372Z"},"links":{"cited_paper":"/paper/2105.09637","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:15e19cc4795a1fe75353bcdb8c21e04267d0f76f7ad133356821cb901212e489","observation_id":"f24761a7-93a9-4391-bcbd-ec185d154813","resolution":{"observed_at":"2026-08-11T19:09:57.685950Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.874206Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.874206Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:df7c88154f7689ef12ce5c036088375a0ae42d73589895a976a5054fd6f417f5","observation_id":"9ef83963-391c-4eb3-9626-493e391a1fad","resolution":{"observed_at":"2026-08-11T19:09:53.874206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.884208Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.884208Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:5db5e2605ef86a8d9868f1fc3d08d1af5e72adb43d351d3683064e493b1a6113","observation_id":"119dc798-9155-4d1a-bdd8-c78ebf838a5c","resolution":{"observed_at":"2026-08-11T19:09:53.884208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.893045Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.893045Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:515008a9da95fe30e724e4141d1e956997fd1f402082fd2a1da1d3d12796bf0c","observation_id":"da1f14d4-daf7-49d3-8e4f-5fa224e7e0f5","resolution":{"observed_at":"2026-08-11T19:09:53.893045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.901334Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.901334Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:0d649876da0315d91d08ed42ce5b7113758e1ddd9d3c0b0dd2788546f297f51f","observation_id":"d48b8830-6454-4c79-a88c-9a5f82028692","resolution":{"observed_at":"2026-08-11T19:09:53.901334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02224","last_updated":"2020-11-25T19:33:00Z","snapshot_observed_at":"2026-07-06T07:19:25.218264Z","submitted_at":"2018-12-05T21:00:44Z","title":"Adapting Auxiliary Losses Using Gradient Similarity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02224","snapshot_observed_at":"2026-08-11T19:09:53.907440Z","title":"M., Jayakumar, S","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.907440Z"},"links":{"cited_paper":"/paper/1812.02224","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:5b0396b8c321f089480e7314458af60b9489b7b78acd0a13b267404ab39f209b","observation_id":"4b3be87f-bb72-460c-a6e4-7105fdf137d7","resolution":{"observed_at":"2026-08-11T19:09:53.907440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.914874Z","title":"J., Li, J., Paduraru, C., Gowal, S., and Hester, T","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.914874Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:3eca12e8b6f52551fdbdbeb2912c3ac2ec3f17a6ccab52232d5057e7ccef9b9d","observation_id":"0c18a82c-181b-4524-abf1-92d04fec2c01","resolution":{"observed_at":"2026-08-11T19:09:53.914874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.12901","last_updated":"2019-04-29T18:40:15Z","snapshot_observed_at":"2026-07-06T07:49:17.886466Z","submitted_at":"2019-04-29T18:40:15Z","title":"Challenges of Real-World Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.12901","snapshot_observed_at":"2026-08-11T19:09:53.923218Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.923218Z"},"links":{"cited_paper":"/paper/1904.12901","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:e47660dbc9ce4c52f1102619483f762e8930ce665f443be0065e4b808c6cb05a","observation_id":"f2f5c98f-554d-4115-8e66-ef28c1c9709f","resolution":{"observed_at":"2026-08-11T19:09:53.923218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.932442Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.932442Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:4bf825f358fa574f2874b4da60823c00cf6e05a303fb251ad56412da0e9d01cd","observation_id":"c92bf16c-a7b9-4c30-b04e-397ca3f3ed6f","resolution":{"observed_at":"2026-08-11T19:09:53.932442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.938774Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.938774Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:9c19ca5751bac8b7a377477a9830d3998f9abdd8e2646b014a20d782aef29d5d","observation_id":"99be24b8-21b7-4ab8-ad38-9033571aafd8","resolution":{"observed_at":"2026-08-11T19:09:53.938774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.944887Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.944887Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:e01950b4c138a2325c2658c61756e7782a8975d931e07916bc6bdea41a7f9247","observation_id":"f9c15b42-3b19-488e-b03c-07cbbd1e7e9c","resolution":{"observed_at":"2026-08-11T19:09:53.944887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.951291Z","title":"and Schuffenhauer, A","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.951291Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:f7b65c80e50eeb86e3b74dd91c7190b52a65e6167c3700c3b85c9f70f2701e98","observation_id":"faab6a52-19b8-4e91-bb55-212383f004b9","resolution":{"observed_at":"2026-08-11T19:09:53.951291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.958861Z","title":"and Gao, J","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.958861Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:e91ca78d1134197b8c9b44e3c1bc90266c87dc6e9a512f63a2833843e7c1d72b","observation_id":"8c2c311c-7bfd-4269-bdc8-f213738306d2","resolution":{"observed_at":"2026-08-11T19:09:53.958861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.06865","last_updated":"2019-02-28T18:32:24Z","snapshot_observed_at":"2026-07-06T07:33:58.446265Z","submitted_at":"2019-02-19T02:36:14Z","title":"Hyperbolic Discounting and Learning over Multiple Horizons","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.06865","snapshot_observed_at":"2026-08-11T19:09:53.965045Z","title":"G., and Larochelle, H","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.965045Z"},"links":{"cited_paper":"/paper/1902.06865","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:6a145def80b1a0f85f8cf3b791b926bf70da33c13fc521e99f1e4b3cd39f2899","observation_id":"9bb42d6f-36d9-44ee-80e2-991f392c92c2","resolution":{"observed_at":"2026-08-11T19:09:53.965045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.00955","last_updated":"2023-06-01T01:24:53Z","snapshot_observed_at":"2026-08-11T05:19:23.228742Z","submitted_at":"2023-05-01T17:36:06Z","title":"Bridging the Gap: A Survey on Integrating (Human) Feedback for Natural Language Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.00955","snapshot_observed_at":"2026-08-11T19:09:53.971554Z","title":"H., Bertsch, A., de Souza, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.971554Z"},"links":{"cited_paper":"/paper/2305.00955","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:4d941227962b955b8d3498ac0f57214467b075121e013315e77b0cfb824833e1","observation_id":"2e84dc15-c216-4e34-9b02-16f2c88580e5","resolution":{"observed_at":"2026-08-11T19:09:53.971554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.03852","last_updated":"2016-11-25T08:09:55Z","snapshot_observed_at":"2026-07-06T05:18:19.763133Z","submitted_at":"2016-11-11T20:53:45Z","title":"A Connection between Generative Adversarial Networks, Inverse Reinforcement Learning, and Energy-Based Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.03852","snapshot_observed_at":"2026-08-11T19:09:53.984622Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.984622Z"},"links":{"cited_paper":"/paper/1611.03852","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:68c4f0fb881d7da553361fd64fe393872c4843c27b714cacfdb4654e5a4c2edd","observation_id":"c3164b18-2f78-43eb-bf76-2278eabe7854","resolution":{"observed_at":"2026-08-11T19:09:53.984622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.995214Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.995214Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:1fef6c655fcc4c856ad541b1b077e1491659aa3f30173138e0b12e3c7123c6f6","observation_id":"d6382932-a9f2-460d-b85a-2396b92285ca","resolution":{"observed_at":"2026-08-11T19:09:53.995214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:54.006504Z","title":"A., de Freitas, N., and Whiteson, S","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:54.006504Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:768d15303976916b1a94bb9989880ab1afd81a3815a257f716b9ac6358c518ab","observation_id":"5ecfacdc-344f-4fdf-b7a1-031a4d44fca1","resolution":{"observed_at":"2026-08-11T19:09:54.006504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":96,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":300},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 100 of 300 outbound references and 0 inbound Pith citation observations for arXiv:2412.07177."}