{"as_of":"2026-08-20T06:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:406a5afd2cf1444ed4196f2113ffdedd51c1a6bdead6f6653a4f515b750d61f9","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:37:31.607767Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:30:33.390291Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-12T00:30:33.977487Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-20T03:13:43.266822Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2412.10917","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.10917","snapshot_observed_at":"2026-08-12T00:30:33.977487Z","title":"Adaptive Reward Design for Reinforcement Learning","venue":"cs.RO","work_id":"1fccfd03-6c8c-4005-afd8-0b4626e89868","year":2024},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-14T20:47:59.935303Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.390291Z"},"links":{"cited_paper":"/paper/2412.10917","citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:8d00d5d7ed68b579eb1faafb056682b21c2aa9672f6f41564518d97076a3988b","observation_id":"7def0c9b-206f-4f04-bbc5-6b2628a79826","resolution":{"observed_at":"2026-08-12T00:30:33.983121Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.10917/citation-record","integrity":"/paper/2412.10917/integrity","json":"/paper/2412.10917/citation-record.json","paper":"/paper/2412.10917"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:32.051880Z","title":"Control synthesis from linear temporal logic specifications using model-free reinforcement learning","venue":null,"work_id":"a214ab82-fdc6-4be4-8b31-2a31326c2ee8","year":2020},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-20T03:13:43.266822Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.416772Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:9a44ff72a8fc6fc3ea7c6d49889ada417aa900a1d4b866561f0fd62212471ddd","observation_id":"e8b4a402-f74d-4c99-b096-e5f8f7c13658","resolution":{"observed_at":"2026-08-11T15:37:32.056244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-13T12:26:05.192883Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-11T15:37:31.422543Z","title":"Openai gym","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-20T03:13:43.266822Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.422543Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:50180dc62598f73a207cf8e0955ded53b8d7b9b5bc7213ffbfeb8c26de949de1","observation_id":"5005d4f1-7527-460b-a175-e0e51bcb431c","resolution":{"observed_at":"2026-08-11T15:37:31.422543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:32.038134Z","title":"Overcoming exploration: Deep reinforcement learning for continuous control in cluttered environments from temporal logic specifications","venue":null,"work_id":"68da4c19-3151-4ab8-8d25-444b9e6e55ed","year":2023},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-20T03:13:43.266822Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.427324Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:9c91837f0d4379b971bee7d645267da6713ad1878ae5155687fc30d4129c84e1","observation_id":"50838048-cec8-4079-b4fe-6631b96abc7d","resolution":{"observed_at":"2026-08-11T15:37:32.042967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:32.024455Z","title":"Learning minimally-violating continuous control for infeasible linear temporal logic specifications","venue":null,"work_id":"586ed12b-2ea1-4a6a-86a3-c225824a9884","year":2023},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-20T03:13:43.266822Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.433079Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:d459e46cd006337d77258be185dfad27ecf69f12c8e69c7e91e7baeac3812efa","observation_id":"6028a52c-44e4-4ea1-9500-054d80fe0e5a","resolution":{"observed_at":"2026-08-11T15:37:32.029062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:32.012223Z","title":"Ltl and beyond: Formal languages for reward function specification in reinforcement learning","venue":null,"work_id":"1716c8b4-bbf5-436b-9e37-7092a2fc340f","year":2019},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-20T03:13:43.266822Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.440473Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:a1c557a2cdb2982b344b06f2cd9b7161bb18d27bd36baec688999a1b890240e6","observation_id":"a6937f62-cfca-4933-a5f8-f260ab2aaa7d","resolution":{"observed_at":"2026-08-11T15:37:32.016510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.996830Z","title":"Foundations for restraining bolts: Reinforcement learning with ltlf/ldlf restraining specifications","venue":null,"work_id":"dca6e4bb-cb54-4439-b7b5-ff379e172aeb","year":2019},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-20T03:13:43.266822Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.446769Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:fd67c870cd012bb01045f79355d2367da25c29a58112da534e8e73d184faebd2","observation_id":"ccd9e90b-0801-42ff-9ef7-04b9a0d11362","resolution":{"observed_at":"2026-08-11T15:37:32.003421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.983149Z","title":"From language to goals: Inverse reinforcement learning for vision-based instruction following","venue":null,"work_id":"266f6e07-5c7b-4aa3-862c-2a358699e53f","year":2018},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-20T03:13:43.266822Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.452848Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:6fdda9b7331daa439e844a294735893be2a6ed5f82c9daed3bed350ee63d5d16","observation_id":"3560acac-53cd-4c1e-93b4-015dc9c65932","resolution":{"observed_at":"2026-08-11T15:37:31.987526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.965985Z","title":"Reinforcement learning for temporal logic control synthesis with probabilistic satisfaction guarantees","venue":null,"work_id":"80e5b20c-42ae-4a2a-966a-55fa5713e7cf","year":2019},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-20T03:13:43.266822Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.458473Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:97f2be18efe8b37ba381d50987b9a23a1f75ce1230006e507b8ae45b03979875","observation_id":"4c33d730-ac7d-4357-8f29-f7408f49d443","resolution":{"observed_at":"2026-08-11T15:37:31.971633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.947614Z","title":"Deep reinforcement learning with temporal logics","venue":null,"work_id":"b68005fc-a643-43ad-81f9-7ac9549dc014","year":2020},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-20T03:13:43.266822Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.464583Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:24e779a0ab140a3f820de035f0d57168d6c0d84c200ee34df6561dd2d814457d","observation_id":"28d912a4-17f9-4163-96ae-cfc3421f9ada","resolution":{"observed_at":"2026-08-11T15:37:31.953462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.924301Z","title":"Reward machines: Exploiting reward function structure in reinforcement learning","venue":null,"work_id":"98bbda66-fd71-4308-a563-4b952e44f116","year":2022},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-20T03:13:43.266822Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.472017Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:053da11c41cfb449cdc7af5cbae6d38b1677a23d0c999418f281f0f058f86823","observation_id":"6c8af446-f2ec-41a3-947d-e3028e860199","resolution":{"observed_at":"2026-08-11T15:37:31.931948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.905520Z","title":"Temporal-logic-based reward shaping for continuing reinforcement learning tasks","venue":null,"work_id":"c05cc669-df2a-4106-a41a-49c95e598cc3","year":2021},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-20T03:13:43.266822Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.481730Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:deb21569b8c855be698ae5757de87721b9c179b77f3082304c86cacc47747d49","observation_id":"6a025cf4-3809-4f04-952d-b6f39dbbf243","resolution":{"observed_at":"2026-08-11T15:37:31.913149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.889356Z","title":"A composable specification language for reinforcement learning tasks","venue":null,"work_id":"9990b89c-4e99-4099-8dae-85df024eeb60","year":2019},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-20T03:13:43.266822Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.493989Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:f5f829b2b5f826a2ab4554926cfdf88fe3e8d831d31a399550217a98b74eece9","observation_id":"55ee23ac-cc8d-4ced-833f-b07335c6ef3b","resolution":{"observed_at":"2026-08-11T15:37:31.893885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.872084Z","title":"Compositional reinforcement learning from logical specifications","venue":null,"work_id":"5344cd8d-42f5-467b-b75f-2e706f785229","year":2021},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-20T03:13:43.266822Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.509070Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:7343c8280979a269a9721587fc70d23f8e82245a676d766b3bccdb8484301056","observation_id":"2e1da156-c139-4568-972f-3140e4b28b46","resolution":{"observed_at":"2026-08-11T15:37:31.879116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.857734Z","title":"Model checking of safety properties","venue":null,"work_id":"266b80a5-47ac-4c86-8c5c-ffd2cc78dbb4","year":2001},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-20T03:13:43.266822Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.531591Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:b5d0a7059e1ed1f5cff46ab1dcee5b47e8eb653ffdca3eb37468120ec2110780","observation_id":"990b3a30-54ab-490c-8476-c80992c7bf68","resolution":{"observed_at":"2026-08-11T15:37:31.862535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.843093Z","title":"Probabilistic planning with formal performance guarantees for mobile service robots","venue":null,"work_id":"e9d10ff8-b9c0-44af-aa7f-5a76054d9c23","year":2019},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-20T03:13:43.266822Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.537253Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:15381a079d62d6253d349de920b303d989032ed830fdc15d2b0c1850dc1ec17c","observation_id":"c8d86e92-4313-4978-9209-df85a676621b","resolution":{"observed_at":"2026-08-11T15:37:31.847530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.829399Z","title":"Reinforcement learning with temporal logic rewards","venue":null,"work_id":"1fe60098-14e5-474d-b65c-51725e11b8cf","year":2017},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-20T03:13:43.266822Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.547114Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:d0d05012f59713392cb68957f789cc802e1422569551ee4aff734aaf57ed7cac","observation_id":"e8bef7a2-3962-4188-bddf-15a9f20ee938","resolution":{"observed_at":"2026-08-11T15:37:31.833861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.552290Z","title":"Continuous control with deep reinforcement learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-20T03:13:43.266822Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.552290Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:6bc451bbd350a2f6020d9a22a46b661b4ba957cabf287faa8042ae99b8f6fc9d","observation_id":"4c2b5c61-fb91-46b8-9fda-e4254a406a0f","resolution":{"observed_at":"2026-08-11T15:37:31.552290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.556926Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-20T03:13:43.266822Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.556926Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:da7308836f0addacfbaa3c8f7ca0e6582d88850ae958656f892f2b504fdee310","observation_id":"d8fad458-da6e-45ce-b701-5681eb729509","resolution":{"observed_at":"2026-08-11T15:37:31.556926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.792185Z","title":"Asynchronous methods for deep reinforcement learning","venue":null,"work_id":"7192063e-8ad5-4c5e-a82a-995eded9f95a","year":1928},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-20T03:13:43.266822Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.561606Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:d7fc29294d594fca696a84ebdb7dae408c3f25642c3b2fde7c5f731fab09cefc","observation_id":"1a8b3ba6-fda5-4c02-a686-379596ee1bf7","resolution":{"observed_at":"2026-08-11T15:37:31.797080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.773289Z","title":"Algorithms for inverse reinforcement learning","venue":null,"work_id":"8adf3ac3-0e83-4fca-8647-639c46fcff7f","year":2000},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-20T03:13:43.266822Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.570702Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:34249235ba5bc1917f2b0b9d6ad89cdd91801628b7cdc5ce4a47c72fb214a3f1","observation_id":"c0e50507-434f-4da3-b512-3c9c80236a2b","resolution":{"observed_at":"2026-08-11T15:37:31.778765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.750268Z","title":"Policy invariance under reward transformations: Theory and application to reward shaping","venue":null,"work_id":"32c15bc6-ddb2-417e-9acf-f62272eac701","year":1999},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-20T03:13:43.266822Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.584332Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:dc52753b67fd8c00772b47acc86383af9517e64d10eae477494a25bb8d8bffe2","observation_id":"08ec08ef-dc8d-42a8-80d9-42aabc55c140","resolution":{"observed_at":"2026-08-11T15:37:31.757627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.728544Z","title":"The temporal semantics of concurrent programs","venue":null,"work_id":"012b45ee-811d-4d23-824e-2d97a5b3b8a6","year":1981},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-20T03:13:43.266822Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.588728Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:5e3637776d8b420db722ea735c4432301298db215e72b57583cf0dc9575cd9dd","observation_id":"38404a0c-da5b-459f-87bb-38bf87f9a166","resolution":{"observed_at":"2026-08-11T15:37:31.733684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.712729Z","title":"Stable-baselines3: Reliable reinforcement learning implementations","venue":null,"work_id":"367386d5-8fa7-4fd6-9e5f-926c82894e0a","year":2021},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-20T03:13:43.266822Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.593564Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:fb94f481a5aabd1a1baa74f08f43176b575f44ceb9aceb943f335aa609192c97","observation_id":"b79e5b12-0680-40e0-9c64-691dae414074","resolution":{"observed_at":"2026-08-11T15:37:31.717040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-11T15:37:31.597864Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-20T03:13:43.266822Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.597864Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:f93e61958e0b24eaad15e8845fa7894c3427be9bc8e8df3435463110c894645b","observation_id":"74e00a7c-6247-4e1e-9cee-cc5afc606738","resolution":{"observed_at":"2026-08-11T15:37:31.597864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.694202Z","title":"Deep reinforcement learning with double q-learning","venue":null,"work_id":"749c448b-629a-455d-8a00-4bef9f54d7a0","year":2016},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-20T03:13:43.266822Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.602369Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:32d59302327229df266f57ac886ad6dd8275557ac7dcaeb4d11ba6d07bdbb590","observation_id":"699c7cc4-085b-4d80-aa89-8ded6c4ed214","resolution":{"observed_at":"2026-08-11T15:37:31.701426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.607767Z","title":"A survey of preference-based reinforcement learning methods","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-20T03:13:43.266822Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.607767Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:a72d014efe14566ce866b03eb25f09761dfcff716e803e3588119514c9be4f4b","observation_id":"f1af1b0f-3017-46e2-9fee-6bf33ef907e7","resolution":{"observed_at":"2026-08-11T15:37:31.607767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-20T03:13:43.266822Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":21},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 1 inbound Pith citation observation for arXiv:2412.10917."}