{"as_of":"2026-08-16T03:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d59b7fd8655dd2564c792f9a27855707533b9d3cf24ca438cf2b361314fab538","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:30:33.438380Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.08158/citation-record","integrity":"/paper/2608.08158/integrity","json":"/paper/2608.08158/citation-record.json","paper":"/paper/2608.08158"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8477.2023","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:30:34.186463Z","title":"Yuntao Bai, Saurav Kadavath, Sandipan Kundu, Amanda Askell, Jackson Kernion, Andy Jones, Anna Chen, Anna Goldie, Azalia Mirhoseini, Cameron McKinnon, et al","venue":null,"work_id":"4f869fbf-3da6-42dc-8baf-d78d88292b03","year":2023},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-14T20:47:59.935303Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.348443Z"},"links":{"citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:7301cd8748644e049a49c6e3fc982edcd778e2a9b2a47c5c849f951017a002fd","observation_id":"784c819c-c7f1-450e-ab28-661003ee0b00","resolution":{"observed_at":"2026-08-12T00:30:34.194365Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:30:33.380419Z","title":"Yujing Hu, Weixun Wang, Hangtian Jia, Yixiang Wang, Yingfeng Chen, Jianye Hao, Feng Wu, and Changjie Fan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-14T20:47:59.935303Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.380419Z"},"links":{"citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:5ccfcf1496f8a91d0f1e2bcb724f88e57554b502563b0b394267ed851b62b237","observation_id":"621c1931-3a5a-4522-b387-072f2ac0beea","resolution":{"observed_at":"2026-08-12T00:30:33.380419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-14T05:05:37.793055Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2412.10917","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.10917","snapshot_observed_at":"2026-08-12T00:30:33.977487Z","title":"Adaptive Reward Design for Reinforcement Learning","venue":"cs.RO","work_id":"1fccfd03-6c8c-4005-afd8-0b4626e89868","year":2024},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-14T20:47:59.935303Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.390291Z"},"links":{"cited_paper":"/paper/2412.10917","citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:f639dbcb1d6a6398ae7c711872d6691653e2f81dcb7f9b51ce932599c37ef583","observation_id":"7def0c9b-206f-4f04-bbc5-6b2628a79826","resolution":{"observed_at":"2026-08-12T00:30:33.983121Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01307","last_updated":"2025-02-03T12:32:50Z","snapshot_observed_at":"2026-08-13T00:47:18.407870Z","submitted_at":"2025-02-03T12:32:50Z","title":"Improving the Effectiveness of Potential-Based Reward Shaping in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2502.01307","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.01307","snapshot_observed_at":"2026-08-12T00:30:33.915193Z","title":"Improving the Effectiveness of Potential-Based Reward Shaping in Reinforcement Learning","venue":"cs.LG","work_id":"3517f1cb-5072-422b-b727-b1c3f8562f0b","year":2025},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-14T20:47:59.935303Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.405381Z"},"links":{"cited_paper":"/paper/2502.01307","citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:78d1c84bb1ed8e09a61dfdf7674d7a4e6ff1605515d836180f04017b66dc2d63","observation_id":"b7ba16a5-905d-445e-8ee6-73f009a8f600","resolution":{"observed_at":"2026-08-12T00:30:33.920720Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-14T03:17:46.495575Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"cited_work":{"arxiv_id":"2606.27180","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.27180","snapshot_observed_at":"2026-08-12T00:30:33.891880Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","venue":"cs.LG","work_id":"c35a86cf-c8d7-4363-a288-74fab7fe8d0c","year":2026},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-14T20:47:59.935303Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.412241Z"},"links":{"cited_paper":"/paper/2606.27180","citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:f040c3bf937e64d17bdf3f76e2d7effb4aa1ad1d9522bcf7fee1af3405bfbc2a","observation_id":"0959321e-ffc7-4aa6-a979-88646145f898","resolution":{"observed_at":"2026-08-12T00:30:33.897433Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10839","last_updated":"2024-07-15T15:53:13Z","snapshot_observed_at":"2026-08-14T03:21:37.148728Z","submitted_at":"2024-07-15T15:53:13Z","title":"Offline Reinforcement Learning with Imputed Rewards","version":1},"cited_work":{"arxiv_id":"2407.10839","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.10839","snapshot_observed_at":"2026-08-12T00:30:33.799618Z","title":"Offline Reinforcement Learning with Imputed Rewards","venue":"cs.LG","work_id":"8fba5e96-f5b1-4c37-b39e-6422a7456fb0","year":2024},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-14T20:47:59.935303Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.423517Z"},"links":{"cited_paper":"/paper/2407.10839","citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:519b68e26065609f35af5d9e5ef73dc54548e1d5d167adbdf965af30112a46cb","observation_id":"579c68f3-b3bb-4799-9081-306ad7477257","resolution":{"observed_at":"2026-08-12T00:30:33.805757Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14146","last_updated":"2022-11-17T14:12:14Z","snapshot_observed_at":"2026-08-14T12:28:31.069777Z","submitted_at":"2022-04-29T15:06:58Z","title":"Training Language Models with Language Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14146","snapshot_observed_at":"2026-08-12T00:30:33.428381Z","title":"Training language models with language feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-14T20:47:59.935303Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.428381Z"},"links":{"cited_paper":"/paper/2204.14146","citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:07d4ea2b92a55b33ec5d1c62d7e3d537773fbc633fe72249490df5856f48d131","observation_id":"d28876a2-e138-4536-9f91-996396d4226d","resolution":{"observed_at":"2026-08-12T00:30:33.428381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.11406","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:30:33.757561Z","title":"Richard S","venue":null,"work_id":"d5c7c1ad-a0e4-43d6-97c8-a7d63ff60c65","year":2025},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-14T20:47:59.935303Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.433432Z"},"links":{"citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:f1ca8156a14e0c021d03b3a865e88149bbe8850cc9c2e818cfdcf4b04835211b","observation_id":"e543a49e-7729-41aa-b6ff-7b9baa04723d","resolution":{"observed_at":"2026-08-12T00:30:33.765031Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:30:33.438380Z","title":"Preprint: arXiv:2503.15724","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-14T20:47:59.935303Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.438380Z"},"links":{"citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:2adce24ce1752f248daf10384edad9a6e26f997295b4fbf03cf2ae5ccecbe756","observation_id":"e4585cba-288c-442f-b3ed-abab54946091","resolution":{"observed_at":"2026-08-12T00:30:33.438380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.03201","last_updated":"2026-05-08T05:37:03Z","snapshot_observed_at":"2026-08-11T09:40:03.975638Z","submitted_at":"2026-02-03T07:13:26Z","title":"SLOPE: Optimistic Potential Landscape Shaping for Model-based Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2602.03201","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.03201","snapshot_observed_at":"2026-08-12T00:30:33.954310Z","title":"SLOPE: Optimistic Potential Landscape Shaping for Model-based Reinforcement Learning","venue":"cs.LG","work_id":"3bc194ff-ed9d-483a-84bd-afa4d4a5da9a","year":2026},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-14T20:47:59.935303Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":2003,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.395422Z"},"links":{"cited_paper":"/paper/2602.03201","citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:27893fb08396d591adad27fe6a272ceb41403fe7e0e40700649380d129199a35","observation_id":"0ac6bbba-f328-4760-b7dc-0a49d7ae0571","resolution":{"observed_at":"2026-08-12T00:30:33.959833Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-12T00:30:33.337729Z","title":"Concrete problems in AI safety","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-14T20:47:59.935303Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":2004,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.337729Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:7851eb8926c970fddd7fd88684f9b15af56ef28d485c91fa870645d3e7374660","observation_id":"12c4f907-4d91-4413-a2da-1075344c9f3c","resolution":{"observed_at":"2026-08-12T00:30:33.337729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09579","last_updated":"2022-10-18T04:21:25Z","snapshot_observed_at":"2026-08-13T14:03:09.412073Z","submitted_at":"2022-10-18T04:21:25Z","title":"Unpacking Reward Shaping: Understanding the Benefits of Reward Engineering on Sample Complexity","version":1},"cited_work":{"arxiv_id":"2210.09579","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.09579","snapshot_observed_at":"2026-08-12T00:30:34.017899Z","title":"Unpacking Reward Shaping: Understanding the Benefits of Reward Engineering on Sample Complexity","venue":"cs.LG","work_id":"d7cfa1dc-ea39-46bb-9460-355cdb6ebc87","year":2022},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-14T20:47:59.935303Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.374603Z"},"links":{"cited_paper":"/paper/2210.09579","citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:57eb16bc722a83435239411801a14f830feca6d7634753b8e426ddef4d88a43f","observation_id":"06a4be0d-ce7c-44bc-8c1e-b0e5d628c28c","resolution":{"observed_at":"2026-08-12T00:30:34.023186Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15194","last_updated":"2024-10-07T19:33:34Z","snapshot_observed_at":"2026-08-12T23:59:12.258145Z","submitted_at":"2024-05-24T03:53:57Z","title":"Extracting Heuristics from Large Language Models for Reward Shaping in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2405.15194","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.15194","snapshot_observed_at":"2026-08-12T00:30:34.056170Z","title":"Extracting Heuristics from Large Language Models for Reward Shaping in Reinforcement Learning","venue":"cs.LG","work_id":"374598a4-45c9-46de-8731-cfc9265593f6","year":2024},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-14T20:47:59.935303Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.364295Z"},"links":{"cited_paper":"/paper/2405.15194","citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:424d79d726f1782059b1d4b90c116c11dc7991aef89884d7b96eb4d7b7dbada0","observation_id":"4e5647f9-ed4c-4576-a22c-724cd380c882","resolution":{"observed_at":"2026-08-12T00:30:34.061337Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09187","last_updated":"2024-07-12T21:14:32Z","snapshot_observed_at":"2026-08-13T14:21:04.495579Z","submitted_at":"2023-12-14T18:06:17Z","title":"Vision-Language Models as a Source of Rewards","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09187","snapshot_observed_at":"2026-08-12T00:30:33.353399Z","title":"Vision-language models as a source of rewards","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-14T20:47:59.935303Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.353399Z"},"links":{"cited_paper":"/paper/2312.09187","citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:e5f8a8277f61bb780a0a30ea7e1af9e21b7c2dcd1c6fc27306a4dec6b135a56b","observation_id":"fccf0884-caea-4685-8570-debabaf3e1fa","resolution":{"observed_at":"2026-08-12T00:30:33.353399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12197","last_updated":"2024-10-16T03:39:26Z","snapshot_observed_at":"2026-08-13T21:04:00.068274Z","submitted_at":"2024-10-16T03:39:26Z","title":"Potential-Based Intrinsic Motivation: Preserving Optimality With Complex, Non-Markovian Shaping Rewards","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12197","snapshot_observed_at":"2026-08-12T00:30:33.369554Z","title":"Forbes, Nitish Gupta, Leonardo Villalobos-Arias, Colin M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-14T20:47:59.935303Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.369554Z"},"links":{"cited_paper":"/paper/2410.12197","citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:a2d2713fac668233a859e6db4c3703651fd0767c43766b43a2e402a8b88eab02","observation_id":"a9156aeb-e0e3-4b49-9afb-f427b7132c33","resolution":{"observed_at":"2026-08-12T00:30:33.369554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10215","last_updated":"2024-12-27T19:25:58Z","snapshot_observed_at":"2026-08-14T23:38:26.942895Z","submitted_at":"2024-07-22T09:28:12Z","title":"Comprehensive Overview of Reward Engineering and Shaping in Advancing Reinforcement Learning Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10215","snapshot_observed_at":"2026-08-12T00:30:33.385098Z","title":"Comprehensive overview of reward engineering and shaping in advancing reinforcement learning applications","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-14T20:47:59.935303Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.385098Z"},"links":{"cited_paper":"/paper/2408.10215","citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:2d0ff635528f4dc06833e3486df131f963bde5eb2ab0f28719df8f74f523e33f","observation_id":"7cd305ff-1310-4359-90b9-744a94f37100","resolution":{"observed_at":"2026-08-12T00:30:33.385098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:30:33.418659Z","title":"Preprint: arXiv:2104.06411","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-14T20:47:59.935303Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.418659Z"},"links":{"citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:941a4466f5f3b70f725d07fe96dc4f55e7101db98348d2f895fdbdc3dee5d1ba","observation_id":"53f5622c-5e08-43f4-855e-6d73c66e15bc","resolution":{"observed_at":"2026-08-12T00:30:33.418659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:30:33.343177Z","title":"2022.1027340","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-14T20:47:59.935303Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.343177Z"},"links":{"citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:3673a0c91054f27b1844b1c7d569084fa96816c2574bee1be63d3a00f33085b7","observation_id":"8d706fa9-bb33-4e1c-881f-420315478d9e","resolution":{"observed_at":"2026-08-12T00:30:33.343177Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09345","last_updated":"2024-11-01T06:30:11Z","snapshot_observed_at":"2026-08-13T04:18:55.108251Z","submitted_at":"2024-02-14T17:49:07Z","title":"InfoRM: Mitigating Reward Hacking in RLHF via Information-Theoretic Reward Modeling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09345","snapshot_observed_at":"2026-08-12T00:30:33.400576Z","title":"InfoRM: Mit- igating reward hacking in RLHF via information-theoretic reward modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-14T20:47:59.935303Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.400576Z"},"links":{"cited_paper":"/paper/2402.09345","citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:2002a49def11bbc651d1b10cc81a53c77da91f5f20fc8387f386d08b0f0c9566","observation_id":"dfafb29f-ee29-4220-a9a3-2eca840c1fcf","resolution":{"observed_at":"2026-08-12T00:30:33.400576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01297","last_updated":"2020-11-02T20:29:09Z","snapshot_observed_at":"2026-08-13T21:09:08.984825Z","submitted_at":"2020-11-02T20:29:09Z","title":"Useful Policy Invariant Shaping from Arbitrary Advice","version":1},"cited_work":{"arxiv_id":"2011.01297","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01297","snapshot_observed_at":"2026-08-12T00:30:34.078197Z","title":"Useful Policy Invariant Shaping from Arbitrary Advice","venue":"cs.LG","work_id":"52cc399a-be27-45dd-a41f-be1e3ec3c615","year":2020},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-14T20:47:59.935303Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.358818Z"},"links":{"cited_paper":"/paper/2011.01297","citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:74bebf8c7fa0f83d01f3184c360aa19fa025832522833d40f51a89dbe44e0e34","observation_id":"eb2dda5a-b769-4883-9785-8232e37977b4","resolution":{"observed_at":"2026-08-12T00:30:34.083387Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v39i15.33679","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:30:33.481344Z","title":"AdrianK.AgoginoandKaganTumer","venue":null,"work_id":"d73c484b-640f-4db1-ac30-b2134d14d6a8","year":null},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-14T20:47:59.935303Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.332256Z"},"links":{"citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:625885931157c5c148ae39024dd77d59c2b00b242d36809cea926387b0787d15","observation_id":"59c866d2-a085-43a9-be54-9e9d869c7020","resolution":{"observed_at":"2026-08-12T00:30:33.487245Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-13T20:08:06.563082+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-13T20:08:06.563082+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-14T20:47:59.935303Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":1,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":9,"verified_exact":8,"verified_fuzzy":0},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2608.08158."}