Pith. sign in

Paper Citation Record · LEDGER

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning

As of 16 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2608.08158.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2608.08158 v1

Coverage vector

measured 21 of 21 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-12T00:30:33.438380Z

measured 21 of 21 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-15T06:32:42.880941+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

21 of 21 outbound references displayed

  • verified exact8
  • verified fuzzy0
  • unresolved9
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch3

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 784c819c-c7f1-450e-ab28-661003ee0b00 · outbound

This paper cites Yuntao Bai, Saurav Kadavath, Sandipan Kundu, Amanda Askell, Jackson Kernion, Andy Jones, Anna Chen, Anna Goldie, Azalia Mirhoseini, Cameron McKinnon, et al.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Yuntao Bai, Saurav Kadavath, Sandipan Kundu, Amanda Askell, Jackson Kernion, Andy Jones, Anna Chen, Anna Goldie, Azalia Mirhoseini, Cameron McKinnon, et al

Reference 10

Resolution
verified exact
raw_fallback, observed 2026-08-12T00:30:34.194365Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-12T00:30:33.348443Z digest=sha256:7301cd8748644e049a49c6e3fc982edcd778e2a9b2a47c5c849f951017a002fd

Observation 621c1931-3a5a-4522-b387-072f2ac0beea · outbound

This paper cites Yujing Hu, Weixun Wang, Hangtian Jia, Yixiang Wang, Yingfeng Chen, Jianye Hao, Feng Wu, and Changjie Fan.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Yujing Hu, Weixun Wang, Hangtian Jia, Yixiang Wang, Yingfeng Chen, Jianye Hao, Feng Wu, and Changjie Fan

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-12T00:30:33.380419Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T00:30:33.380419Z digest=sha256:5ccfcf1496f8a91d0f1e2bcb724f88e57554b502563b0b394267ed851b62b237

Observation 7def0c9b-206f-4f04-bbc5-6b2628a79826 · outbound

This paper cites Adaptive Reward Design for Reinforcement Learning.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Adaptive Reward Design for Reinforcement Learning

Reference 12

Resolution
verified exact
local_arxiv, observed 2026-08-12T00:30:33.983121Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-12T00:30:33.390291Z digest=sha256:f639dbcb1d6a6398ae7c711872d6691653e2f81dcb7f9b51ce932599c37ef583

Observation b7ba16a5-905d-445e-8ee6-73f009a8f600 · outbound

This paper cites Improving the Effectiveness of Potential-Based Reward Shaping in Reinforcement Learning.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Improving the Effectiveness of Potential-Based Reward Shaping in Reinforcement Learning

Reference 15

Resolution
verified exact
local_arxiv, observed 2026-08-12T00:30:33.920720Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-12T00:30:33.405381Z digest=sha256:78d1c84bb1ed8e09a61dfdf7674d7a4e6ff1605515d836180f04017b66dc2d63

Observation 0959321e-ffc7-4aa6-a979-88646145f898 · outbound

This paper cites Automating Potential-based Reward Shaping with Vision Language Model Guidance.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Automating Potential-based Reward Shaping with Vision Language Model Guidance

Reference 16

Resolution
verified exact
local_arxiv, observed 2026-08-12T00:30:33.897433Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-12T00:30:33.412241Z digest=sha256:f040c3bf937e64d17bdf3f76e2d7effb4aa1ad1d9522bcf7fee1af3405bfbc2a

Observation 579c68f3-b3bb-4799-9081-306ad7477257 · outbound

This paper cites Offline Reinforcement Learning with Imputed Rewards.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Offline Reinforcement Learning with Imputed Rewards

Reference 18

Resolution
verified exact
local_arxiv, observed 2026-08-12T00:30:33.805757Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-12T00:30:33.423517Z digest=sha256:519b68e26065609f35af5d9e5ef73dc54548e1d5d167adbdf965af30112a46cb

Observation d28876a2-e138-4536-9f91-996396d4226d · outbound

This paper cites Training Language Models with Language Feedback.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Training Language Models with Language Feedback

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-12T00:30:33.428381Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T00:30:33.428381Z digest=sha256:07d4ea2b92a55b33ec5d1c62d7e3d537773fbc633fe72249490df5856f48d131

Observation e543a49e-7729-41aa-b6ff-7b9baa04723d · outbound

This paper cites Richard S.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Richard S

Reference 20

Resolution
metadata mismatch
raw_fallback, observed 2026-08-12T00:30:33.765031Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-12T00:30:33.433432Z digest=sha256:f1ca8156a14e0c021d03b3a865e88149bbe8850cc9c2e818cfdcf4b04835211b

Observation e4585cba-288c-442f-b3ed-abab54946091 · outbound

This paper cites Preprint: arXiv:2503.15724.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Preprint: arXiv:2503.15724

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-12T00:30:33.438380Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T00:30:33.438380Z digest=sha256:2adce24ce1752f248daf10384edad9a6e26f997295b4fbf03cf2ae5ccecbe756

Observation 0ac6bbba-f328-4760-b7dc-0a49d7ae0571 · outbound

This paper cites SLOPE: Optimistic Potential Landscape Shaping for Model-based Reinforcement Learning.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning SLOPE: Optimistic Potential Landscape Shaping for Model-based Reinforcement Learning

Reference 2003

Resolution
verified exact
local_arxiv, observed 2026-08-12T00:30:33.959833Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-12T00:30:33.395422Z digest=sha256:27893fb08396d591adad27fe6a272ceb41403fe7e0e40700649380d129199a35

Observation 12c4f907-4d91-4413-a2da-1075344c9f3c · outbound

This paper cites Concrete Problems in AI Safety.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Concrete Problems in AI Safety

Reference 2004

Resolution
unresolved
no resolver link, observed 2026-08-12T00:30:33.337729Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T00:30:33.337729Z digest=sha256:7851eb8926c970fddd7fd88684f9b15af56ef28d485c91fa870645d3e7374660

Observation 06a4be0d-ce7c-44bc-8c1e-b0e5d628c28c · outbound

This paper cites Unpacking Reward Shaping: Understanding the Benefits of Reward Engineering on Sample Complexity.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Unpacking Reward Shaping: Understanding the Benefits of Reward Engineering on Sample Complexity

Reference 2010

Resolution
metadata mismatch
local_arxiv, observed 2026-08-12T00:30:34.023186Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-12T00:30:33.374603Z digest=sha256:57eb16bc722a83435239411801a14f830feca6d7634753b8e426ddef4d88a43f

Observation 4e5647f9-ed4c-4576-a22c-724cd380c882 · outbound

This paper cites Extracting Heuristics from Large Language Models for Reward Shaping in Reinforcement Learning.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Extracting Heuristics from Large Language Models for Reward Shaping in Reinforcement Learning

Reference 2016

Resolution
verified exact
local_arxiv, observed 2026-08-12T00:30:34.061337Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-12T00:30:33.364295Z digest=sha256:424d79d726f1782059b1d4b90c116c11dc7991aef89884d7b96eb4d7b7dbada0

Observation fccf0884-caea-4685-8570-debabaf3e1fa · outbound

This paper cites Vision-Language Models as a Source of Rewards.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Vision-Language Models as a Source of Rewards

Reference 2017

Resolution
unresolved
no resolver link, observed 2026-08-12T00:30:33.353399Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T00:30:33.353399Z digest=sha256:e5f8a8277f61bb780a0a30ea7e1af9e21b7c2dcd1c6fc27306a4dec6b135a56b

Observation a9156aeb-e0e3-4b49-9afb-f427b7132c33 · outbound

This paper cites Potential-Based Intrinsic Motivation: Preserving Optimality With Complex, Non-Markovian Shaping Rewards.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Potential-Based Intrinsic Motivation: Preserving Optimality With Complex, Non-Markovian Shaping Rewards

Reference 2018

Resolution
unresolved
no resolver link, observed 2026-08-12T00:30:33.369554Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T00:30:33.369554Z digest=sha256:a2d2713fac668233a859e6db4c3703651fd0767c43766b43a2e402a8b88eab02

Observation 7cd305ff-1310-4359-90b9-744a94f37100 · outbound

This paper cites Comprehensive Overview of Reward Engineering and Shaping in Advancing Reinforcement Learning Applications.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Comprehensive Overview of Reward Engineering and Shaping in Advancing Reinforcement Learning Applications

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-12T00:30:33.385098Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T00:30:33.385098Z digest=sha256:2d0ff635528f4dc06833e3486df131f963bde5eb2ab0f28719df8f74f523e33f

Observation 53f5622c-5e08-43f4-855e-6d73c66e15bc · outbound

This paper cites Preprint: arXiv:2104.06411.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Preprint: arXiv:2104.06411

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-12T00:30:33.418659Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T00:30:33.418659Z digest=sha256:941a4466f5f3b70f725d07fe96dc4f55e7101db98348d2f895fdbdc3dee5d1ba

Observation 8d706fa9-bb33-4e1c-881f-420315478d9e · outbound

This paper cites 2022.1027340.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning 2022.1027340

Reference 2022

Resolution
malformed identifier
no resolver link, observed 2026-08-12T00:30:33.343177Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T00:30:33.343177Z digest=sha256:3673a0c91054f27b1844b1c7d569084fa96816c2574bee1be63d3a00f33085b7

Observation dfafb29f-ee29-4220-a9a3-2eca840c1fcf · outbound

This paper cites InfoRM: Mitigating Reward Hacking in RLHF via Information-Theoretic Reward Modeling.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning InfoRM: Mitigating Reward Hacking in RLHF via Information-Theoretic Reward Modeling

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-12T00:30:33.400576Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T00:30:33.400576Z digest=sha256:2002a49def11bbc651d1b10cc81a53c77da91f5f20fc8387f386d08b0f0c9566

Observation eb2dda5a-b769-4883-9785-8232e37977b4 · outbound

This paper cites Useful Policy Invariant Shaping from Arbitrary Advice.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Useful Policy Invariant Shaping from Arbitrary Advice

Reference 2024

Resolution
metadata mismatch
local_arxiv, observed 2026-08-12T00:30:34.083387Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-12T00:30:33.358818Z digest=sha256:74bebf8c7fa0f83d01f3184c360aa19fa025832522833d40f51a89dbe44e0e34

Observation 59c866d2-a085-43a9-be54-9e9d869c7020 · outbound

This paper cites AdrianK.AgoginoandKaganTumer.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning AdrianK.AgoginoandKaganTumer

Reference 2025

Resolution
verified exact
doi, observed 2026-08-12T00:30:33.487245Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-12T00:30:33.332256Z digest=sha256:625885931157c5c148ae39024dd77d59c2b00b242d36809cea926387b0787d15

Pith citing papers

No inbound Pith citation observations are available.