Pith. sign in

Paper Citation Record · LEDGER

A Survey of Temporal Credit Assignment in Deep Reinforcement Learning

As of 20 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 20 inbound Pith citation observations for arXiv:2312.01072.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2312.01072 v2

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 20 of 20 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-19T06:32:44.657259+00:00

measured 20 of 20 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-15T21:52:33.490521Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T17:40:00.280883Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation 1cf9356d-aaa7-414f-90fb-033112d371c6 · inbound

Humans Coexist, So Must Embodied Artificial Agents cites this paper.

Humans Coexist, So Must Embodied Artificial Agents A Survey of Temporal Credit Assignment in Deep Reinforcement Learning

Reference 112

Resolution
unresolved
no resolver link, observed 2026-08-08T21:27:27.758510Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T21:27:27.758510Z digest=sha256:df1981cd108563826f7faa91294062b13faa58272f59d4413986a73a75abd3fa

Observation b4199dbf-a63e-43ac-abaf-b87a4627bfe1 · inbound

Credit Assignment and Efficient Exploration based on Influence Scope in Multi-agent Reinforcement Learning cites this paper.

Credit Assignment and Efficient Exploration based on Influence Scope in Multi-agent Reinforcement Learning A Survey of Temporal Credit Assignment in Deep Reinforcement Learning

Reference 2011

Resolution
unresolved
no resolver link, observed 2026-08-15T21:52:33.490521Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T21:52:33.490521Z digest=sha256:86d34678aa25e8028ebb3ddd59e5d4511917e3873e528a375c7b19e5f884cb53

Observation 8b1898ce-bb72-4cd4-a68f-97cae96ce57d · inbound

TextAtari: 100K Frames Game Playing with Language Agents cites this paper.

TextAtari: 100K Frames Game Playing with Language Agents A Survey of Temporal Credit Assignment in Deep Reinforcement Learning

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T10:51:57.877206Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:51:57.877206Z digest=sha256:44ca87617744a71c73526eab86825a1bcd2900547972bca0146ed3a23a1b74d4

Observation 3d113656-ccc7-4533-8eef-555599ea29de · inbound

First Return, Entropy-Eliciting Explore cites this paper.

First Return, Entropy-Eliciting Explore A Survey of Temporal Credit Assignment in Deep Reinforcement Learning

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-06T18:53:13.287355Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:53:13.287355Z digest=sha256:58b896381d085629d3109568df3325922294d0cfa42742def2c157784fbe9796

Observation 649d76d9-202b-4770-bca8-c573cdc4b89d · inbound

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities cites this paper.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities A Survey of Temporal Credit Assignment in Deep Reinforcement Learning

Reference 2007

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.130032Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.130032Z digest=sha256:3c5d63e26d93b94fc919dd27fd0c003e48282ef45cf01106d105430d7e8ca1c9

Observation 5718411b-dbfe-4b54-a177-6b9c5b198636 · inbound

Deep Reinforcement Learning for Dynamic Origin-Destination Matrix Estimation in Microscopic Traffic Simulations Considering Credit Assignment cites this paper.

Deep Reinforcement Learning for Dynamic Origin-Destination Matrix Estimation in Microscopic Traffic Simulations Considering Credit Assignment A Survey of Temporal Credit Assignment in Deep Reinforcement Learning

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-03T23:23:34.899054Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T23:23:34.899054Z digest=sha256:9db56d68af593ea77e8f9ff1090770947997120393a1d9f65aa6a23db72ce841

Observation b211e744-065c-4019-a2ea-774e7c3d15be · inbound

Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity cites this paper.

Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity A Survey of Temporal Credit Assignment in Deep Reinforcement Learning

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-03T05:00:42.882135Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T05:00:42.882135Z digest=sha256:65b417bd5a18ea932dea6869a103db3e9f674b7cf16a282df83da3c8a9a9a854

Observation 61e63b3e-dccd-4650-9cca-922aa3884b32 · inbound

Behavior-Constrained Reinforcement Learning with Receding-Horizon Credit Assignment for High-Performance Control cites this paper.

Behavior-Constrained Reinforcement Learning with Receding-Horizon Credit Assignment for High-Performance Control A Survey of Temporal Credit Assignment in Deep Reinforcement Learning

Reference 32

Resolution
verified exact
arxiv_id, observed 2026-05-13T19:33:10.216517Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-13T19:30:23.447901Z digest=sha256:5c03d0819b588a30e759eb60913761afb22b1b6d0b7a85030ad7ab4ec6c82f9c

Observation dc88ae64-b444-48d1-a77b-4748766ddacb · inbound

From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models cites this paper.

From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models A Survey of Temporal Credit Assignment in Deep Reinforcement Learning

Reference 18

Resolution
verified exact
arxiv_id, observed 2026-05-11T07:30:58.444505Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-10T17:09:36.341574Z digest=sha256:f754910f4877f221b3df8021aff2357609b1b957f272019608c45f7167769985

Observation 082c771b-189a-4aaa-8a2b-f1d86300bc87 · inbound

Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading cites this paper.

Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading A Survey of Temporal Credit Assignment in Deep Reinforcement Learning

Reference 37

Resolution
verified exact
arxiv_id, observed 2026-05-11T16:26:05.978064Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-09T17:08:46.405278Z digest=sha256:72bd9d9e892b9c65301b7a815d6e1e09ce51cef49ccb29bcc76309085fea7301

Observation e9c8f779-438d-48d6-9b79-b95053d0e646 · inbound

Resolving Action Bottleneck: Agentic Reinforcement Learning Informed by Token-Level Energy cites this paper.

Resolving Action Bottleneck: Agentic Reinforcement Learning Informed by Token-Level Energy A Survey of Temporal Credit Assignment in Deep Reinforcement Learning

Reference 18

Resolution
verified exact
arxiv_id, observed 2026-05-15T01:48:28.556820Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-15T01:46:24.724553Z digest=sha256:2ee96ed567ccdbd658505d93735706fbb3c838d8b8fb7790deb50a4ccf73dc98

Observation 53a38aa9-158d-46e4-abea-047a8bc05ff3 · inbound

LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition cites this paper.

LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition A Survey of Temporal Credit Assignment in Deep Reinforcement Learning

Reference 29

Resolution
verified exact
arxiv_id, observed 2026-06-30T18:44:59.998799Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-06-30T18:44:14.878564Z digest=sha256:bdbcb4a7e42d80fee3d4973aafaa797e6745c3a57618f8f8fcf8506072dcf5b2

Observation d757079b-5053-4254-a5e2-deba08a82383 · inbound

SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training cites this paper.

SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training A Survey of Temporal Credit Assignment in Deep Reinforcement Learning

Reference 44

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T23:16:23.930228Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-06-28T14:33:00.408984Z digest=sha256:146774db17eb9fa37bffb9631ed6f5041f0158aa2fe9ab304fde2696f22e775d

Observation 8001aa6d-80f9-444b-8b78-e69cf61bdc08 · inbound

GRAIL: Gradient-Reweighted Advantages for Reinforcement Learning with Verifiable Rewards cites this paper.

GRAIL: Gradient-Reweighted Advantages for Reinforcement Learning with Verifiable Rewards A Survey of Temporal Credit Assignment in Deep Reinforcement Learning

Reference 13

Resolution
verified exact
arxiv_id, observed 2026-07-02T08:36:47.623029Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-06-28T05:59:00.005336Z digest=sha256:e34eacad819802040b2ef3409edbfec21b5be307f32497f56f31f6ec15343bc9

Observation 0f2e0b28-0088-4b84-b85e-54dba3336231 · inbound

When Denser Credit Is Not Enough: Evidence-Calibrated Policy Optimization for Long-Horizon LLM Agent Training cites this paper.

When Denser Credit Is Not Enough: Evidence-Calibrated Policy Optimization for Long-Horizon LLM Agent Training A Survey of Temporal Credit Assignment in Deep Reinforcement Learning

Reference 9

Resolution
metadata mismatch
arxiv_id, observed 2026-07-02T12:16:56.818092Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-06-28T02:17:32.324432Z digest=sha256:edc9c19cdec3c1689de26fa4d35b7b1b85af046e99ffedddef680ff888313843

Observation 48565c02-186a-4af8-aa6b-116c7c86ddfb · inbound

Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning cites this paper.

Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning A Survey of Temporal Credit Assignment in Deep Reinforcement Learning

Reference 150

Resolution
verified exact
arxiv_id, observed 2026-07-04T07:59:40.737964Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-06-26T12:15:08.304150Z digest=sha256:c1f727830195e559def71ddd1ebc6401172e67127e040fb7b53ab7b859b9cb56

Observation 90b1c0b3-c1bb-41ba-b5ed-2b4552bfd87e · inbound

World Value Models for Robotic Manipulation cites this paper.

World Value Models for Robotic Manipulation A Survey of Temporal Credit Assignment in Deep Reinforcement Learning

Reference 55

Resolution
verified exact
arxiv_id, observed 2026-07-04T17:40:00.282436Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-06-25T23:33:50.854261Z digest=sha256:d52b45f367d3c6cb93648ea637241f32ac51a88981fe225991ac13e233f0773a

Observation 71116b30-7350-4d8d-9dca-5b46c4569bae · inbound

Attribution Markets: A Fisher-Market Formulation for Fractional Credit Assignment Between Planned Tasks and Performed Actions cites this paper.

Attribution Markets: A Fisher-Market Formulation for Fractional Credit Assignment Between Planned Tasks and Performed Actions A Survey of Temporal Credit Assignment in Deep Reinforcement Learning

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-01T09:44:29.171372Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:44:29.171372Z digest=sha256:7beb94ece5a6bf1a4ece16dd320c81d3b77e2afbcb5f7989de99cff0bf2c0dd0

Observation 876c39cb-1e01-4873-8117-0980b79e7276 · inbound

Learning to Prepare Molecular Ground States with Transformer Models cites this paper.

Learning to Prepare Molecular Ground States with Transformer Models A Survey of Temporal Credit Assignment in Deep Reinforcement Learning

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-01T04:45:24.486605Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T04:45:24.486605Z digest=sha256:2389b722c4e3f1c4bd570efc558ac36ccf431ec72ffab862aafe566acbb3ec3a

Observation 0a1e9ed0-3451-4c16-857d-22bd399370dc · inbound

Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning cites this paper.

Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning A Survey of Temporal Credit Assignment in Deep Reinforcement Learning

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-12T00:20:30.941220Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T00:20:30.941220Z digest=sha256:3902ee92dbe99de64ef4c43dbbdbf652fa68a65eac0e548563a18dae8e5d9921