{"as_of":"2026-08-20T06:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4bb0c23e0b6349ed6a1d33df8fc0bac2e623fde48b7c6bddbc52621b0ca4245e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":20,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:52:33.490521Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T17:40:00.280883Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.01072","last_updated":"2024-07-04T09:32:18Z","snapshot_observed_at":"2026-08-20T01:15:04.998523Z","submitted_at":"2023-12-02T08:49:51Z","title":"A Survey of Temporal Credit Assignment in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01072","snapshot_observed_at":"2026-08-08T21:27:27.758510Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04809","last_updated":"2025-06-02T14:32:56Z","snapshot_observed_at":"2026-08-16T05:16:48.934985Z","submitted_at":"2025-02-07T10:28:39Z","title":"Humans Coexist, So Must Embodied Artificial Agents","version":3},"reference_index":112,"source":"pdf_text","source_observed_at":"2026-08-08T21:27:27.758510Z"},"links":{"cited_paper":"/paper/2312.01072","citing_paper":"/paper/2502.04809"},"observation_digest":"sha256:df1981cd108563826f7faa91294062b13faa58272f59d4413986a73a75abd3fa","observation_id":"1cf9356d-aaa7-414f-90fb-033112d371c6","resolution":{"observed_at":"2026-08-08T21:27:27.758510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01072","last_updated":"2024-07-04T09:32:18Z","snapshot_observed_at":"2026-08-20T01:15:04.998523Z","submitted_at":"2023-12-02T08:49:51Z","title":"A Survey of Temporal Credit Assignment in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01072","snapshot_observed_at":"2026-08-15T21:52:33.490521Z","title":"A survey of temporal credit assignment in deep reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08630","last_updated":"2026-08-01T09:57:23Z","snapshot_observed_at":"2026-08-18T16:27:39.505215Z","submitted_at":"2025-05-13T14:49:26Z","title":"Credit Assignment and Efficient Exploration based on Influence Scope in Multi-agent Reinforcement Learning","version":2},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-15T21:52:33.490521Z"},"links":{"cited_paper":"/paper/2312.01072","citing_paper":"/paper/2505.08630"},"observation_digest":"sha256:86d34678aa25e8028ebb3ddd59e5d4511917e3873e528a375c7b19e5f884cb53","observation_id":"b4199dbf-a63e-43ac-abaf-b87a4627bfe1","resolution":{"observed_at":"2026-08-15T21:52:33.490521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01072","last_updated":"2024-07-04T09:32:18Z","snapshot_observed_at":"2026-08-20T01:15:04.998523Z","submitted_at":"2023-12-02T08:49:51Z","title":"A Survey of Temporal Credit Assignment in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01072","snapshot_observed_at":"2026-08-07T10:51:57.877206Z","title":"A survey of temporal credit assignment in deep reinforcement learning.arXiv preprint arXiv:2312.01072,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04098","last_updated":"2025-06-10T13:14:14Z","snapshot_observed_at":"2026-08-15T10:08:43.288385Z","submitted_at":"2025-06-04T15:55:27Z","title":"TextAtari: 100K Frames Game Playing with Language Agents","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:51:57.877206Z"},"links":{"cited_paper":"/paper/2312.01072","citing_paper":"/paper/2506.04098"},"observation_digest":"sha256:44ca87617744a71c73526eab86825a1bcd2900547972bca0146ed3a23a1b74d4","observation_id":"8b1898ce-bb72-4cd4-a68f-97cae96ce57d","resolution":{"observed_at":"2026-08-07T10:51:57.877206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01072","last_updated":"2024-07-04T09:32:18Z","snapshot_observed_at":"2026-08-20T01:15:04.998523Z","submitted_at":"2023-12-02T08:49:51Z","title":"A Survey of Temporal Credit Assignment in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01072","snapshot_observed_at":"2026-08-06T18:53:13.287355Z","title":"A survey of temporal credit assignment in deep reinforcement learning.arXiv preprint arXiv:2312.01072, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-18T16:49:41.929152Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:13.287355Z"},"links":{"cited_paper":"/paper/2312.01072","citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:58b896381d085629d3109568df3325922294d0cfa42742def2c157784fbe9796","observation_id":"3d113656-ccc7-4533-8eef-555599ea29de","resolution":{"observed_at":"2026-08-06T18:53:13.287355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01072","last_updated":"2024-07-04T09:32:18Z","snapshot_observed_at":"2026-08-20T01:15:04.998523Z","submitted_at":"2023-12-02T08:49:51Z","title":"A Survey of Temporal Credit Assignment in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01072","snapshot_observed_at":"2026-08-06T16:34:25.130032Z","title":"A survey of temporal credit assignment in deep reinforcement learning.arXiv preprint arXiv:2312.01072,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-15T15:23:09.345799Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":2007,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.130032Z"},"links":{"cited_paper":"/paper/2312.01072","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:3c5d63e26d93b94fc919dd27fd0c003e48282ef45cf01106d105430d7e8ca1c9","observation_id":"649d76d9-202b-4770-bca8-c573cdc4b89d","resolution":{"observed_at":"2026-08-06T16:34:25.130032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01072","last_updated":"2024-07-04T09:32:18Z","snapshot_observed_at":"2026-08-20T01:15:04.998523Z","submitted_at":"2023-12-02T08:49:51Z","title":"A Survey of Temporal Credit Assignment in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01072","snapshot_observed_at":"2026-08-03T23:23:34.899054Z","title":"Ferret, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.06229","last_updated":"2026-07-07T17:38:23Z","snapshot_observed_at":"2026-08-20T01:15:18.511915Z","submitted_at":"2025-11-09T05:07:42Z","title":"Deep Reinforcement Learning for Dynamic Origin-Destination Matrix Estimation in Microscopic Traffic Simulations Considering Credit Assignment","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T23:23:34.899054Z"},"links":{"cited_paper":"/paper/2312.01072","citing_paper":"/paper/2511.06229"},"observation_digest":"sha256:9db56d68af593ea77e8f9ff1090770947997120393a1d9f65aa6a23db72ce841","observation_id":"5718411b-dbfe-4b54-a177-6b9c5b198636","resolution":{"observed_at":"2026-08-03T23:23:34.899054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01072","last_updated":"2024-07-04T09:32:18Z","snapshot_observed_at":"2026-08-20T01:15:04.998523Z","submitted_at":"2023-12-02T08:49:51Z","title":"A Survey of Temporal Credit Assignment in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01072","snapshot_observed_at":"2026-08-03T05:00:42.882135Z","title":"Pignatelli, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.03778","last_updated":"2026-06-30T15:15:04Z","snapshot_observed_at":"2026-08-13T12:25:58.286571Z","submitted_at":"2026-02-03T17:39:45Z","title":"Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:42.882135Z"},"links":{"cited_paper":"/paper/2312.01072","citing_paper":"/paper/2602.03778"},"observation_digest":"sha256:65b417bd5a18ea932dea6869a103db3e9f674b7cf16a282df83da3c8a9a9a854","observation_id":"b211e744-065c-4019-a2ea-774e7c3d15be","resolution":{"observed_at":"2026-08-03T05:00:42.882135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01072","last_updated":"2024-07-04T09:32:18Z","snapshot_observed_at":"2026-08-20T01:15:04.998523Z","submitted_at":"2023-12-02T08:49:51Z","title":"A Survey of Temporal Credit Assignment in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2312.01072","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.01072","snapshot_observed_at":"2026-07-04T17:40:00.280883Z","title":"A survey of temporal credit assignment in deep reinforcement learning","venue":null,"work_id":"974bd811-fce0-4e67-ae9d-697f5f35a1e8","year":2023},"citing_paper":{"arxiv_id":"2604.03023","last_updated":"2026-04-03T13:13:47Z","snapshot_observed_at":"2026-08-13T07:24:15.296106Z","submitted_at":"2026-04-03T13:13:47Z","title":"Behavior-Constrained Reinforcement Learning with Receding-Horizon Credit Assignment for High-Performance Control","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T19:30:23.447901Z"},"links":{"cited_paper":"/paper/2312.01072","citing_paper":"/paper/2604.03023"},"observation_digest":"sha256:a028908e3ca2e9253d06d9c15ad5361e301449ae25740d39e4346645c4fa829a","observation_id":"61e63b3e-dccd-4650-9cca-922aa3884b32","resolution":{"observed_at":"2026-05-13T19:33:10.216517Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01072","last_updated":"2024-07-04T09:32:18Z","snapshot_observed_at":"2026-08-20T01:15:04.998523Z","submitted_at":"2023-12-02T08:49:51Z","title":"A Survey of Temporal Credit Assignment in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2312.01072","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.01072","snapshot_observed_at":"2026-07-04T17:40:00.280883Z","title":"A survey of temporal credit assignment in deep reinforcement learning","venue":null,"work_id":"974bd811-fce0-4e67-ae9d-697f5f35a1e8","year":2023},"citing_paper":{"arxiv_id":"2604.09459","last_updated":"2026-08-09T14:06:24Z","snapshot_observed_at":"2026-08-15T05:17:57.940786Z","submitted_at":"2026-04-10T16:17:44Z","title":"From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T17:09:36.341574Z"},"links":{"cited_paper":"/paper/2312.01072","citing_paper":"/paper/2604.09459"},"observation_digest":"sha256:e86421a2494662bbbc2a6720216f065ca75e8aed6ebd7d7ecc714a496465cc41","observation_id":"dc88ae64-b444-48d1-a77b-4748766ddacb","resolution":{"observed_at":"2026-05-11T07:30:58.444505Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01072","last_updated":"2024-07-04T09:32:18Z","snapshot_observed_at":"2026-08-20T01:15:04.998523Z","submitted_at":"2023-12-02T08:49:51Z","title":"A Survey of Temporal Credit Assignment in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2312.01072","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.01072","snapshot_observed_at":"2026-07-04T17:40:00.280883Z","title":"A survey of temporal credit assignment in deep reinforcement learning","venue":null,"work_id":"974bd811-fce0-4e67-ae9d-697f5f35a1e8","year":2023},"citing_paper":{"arxiv_id":"2605.01954","last_updated":"2026-05-03T16:37:52Z","snapshot_observed_at":"2026-08-11T17:52:37.719010Z","submitted_at":"2026-05-03T16:37:52Z","title":"Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-09T17:08:46.405278Z"},"links":{"cited_paper":"/paper/2312.01072","citing_paper":"/paper/2605.01954"},"observation_digest":"sha256:319b936d826c1da097f141b7ef98276cf8aa4d98efdf8f003732b5747aa51f9f","observation_id":"082c771b-189a-4aaa-8a2b-f1d86300bc87","resolution":{"observed_at":"2026-05-11T16:26:05.978064Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01072","last_updated":"2024-07-04T09:32:18Z","snapshot_observed_at":"2026-08-20T01:15:04.998523Z","submitted_at":"2023-12-02T08:49:51Z","title":"A Survey of Temporal Credit Assignment in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2312.01072","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.01072","snapshot_observed_at":"2026-07-04T17:40:00.280883Z","title":"A survey of temporal credit assignment in deep reinforcement learning","venue":null,"work_id":"974bd811-fce0-4e67-ae9d-697f5f35a1e8","year":2023},"citing_paper":{"arxiv_id":"2605.14558","last_updated":"2026-05-14T08:33:02Z","snapshot_observed_at":"2026-07-06T23:25:58.895612Z","submitted_at":"2026-05-14T08:33:02Z","title":"Resolving Action Bottleneck: Agentic Reinforcement Learning Informed by Token-Level Energy","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T01:46:24.724553Z"},"links":{"cited_paper":"/paper/2312.01072","citing_paper":"/paper/2605.14558"},"observation_digest":"sha256:0e4f41a5e71572a6babf2ff25327f210d2c567f7b87d283f91bcac26370b15d6","observation_id":"e9c8f779-438d-48d6-9b79-b95053d0e646","resolution":{"observed_at":"2026-05-15T01:48:28.556820Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01072","last_updated":"2024-07-04T09:32:18Z","snapshot_observed_at":"2026-08-20T01:15:04.998523Z","submitted_at":"2023-12-02T08:49:51Z","title":"A Survey of Temporal Credit Assignment in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2312.01072","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.01072","snapshot_observed_at":"2026-07-04T17:40:00.280883Z","title":"A survey of temporal credit assignment in deep reinforcement learning","venue":null,"work_id":"974bd811-fce0-4e67-ae9d-697f5f35a1e8","year":2023},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-08-16T20:52:52.505318Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"cited_paper":"/paper/2312.01072","citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:72daf9b2ba69030eff8164e7253a7e73cda44d5c952b5a00c30385642a6a7046","observation_id":"53a38aa9-158d-46e4-abea-047a8bc05ff3","resolution":{"observed_at":"2026-06-30T18:44:59.998799Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01072","last_updated":"2024-07-04T09:32:18Z","snapshot_observed_at":"2026-08-20T01:15:04.998523Z","submitted_at":"2023-12-02T08:49:51Z","title":"A Survey of Temporal Credit Assignment in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2312.01072","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.01072","snapshot_observed_at":"2026-07-04T17:40:00.280883Z","title":"A survey of temporal credit assignment in deep reinforcement learning","venue":null,"work_id":"974bd811-fce0-4e67-ae9d-697f5f35a1e8","year":2023},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-08-18T12:35:03.342640Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"cited_paper":"/paper/2312.01072","citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:c2e04155813ebc8a157231d5252094e001352eee10dd9996cddfd8de31772640","observation_id":"d757079b-5053-4254-a5e2-deba08a82383","resolution":{"observed_at":"2026-07-01T23:16:23.930228Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01072","last_updated":"2024-07-04T09:32:18Z","snapshot_observed_at":"2026-08-20T01:15:04.998523Z","submitted_at":"2023-12-02T08:49:51Z","title":"A Survey of Temporal Credit Assignment in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2312.01072","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.01072","snapshot_observed_at":"2026-07-04T17:40:00.280883Z","title":"A survey of temporal credit assignment in deep reinforcement learning","venue":null,"work_id":"974bd811-fce0-4e67-ae9d-697f5f35a1e8","year":2023},"citing_paper":{"arxiv_id":"2606.04889","last_updated":"2026-06-03T13:51:27Z","snapshot_observed_at":"2026-08-17T17:14:59.103519Z","submitted_at":"2026-06-03T13:51:27Z","title":"GRAIL: Gradient-Reweighted Advantages for Reinforcement Learning with Verifiable Rewards","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T05:59:00.005336Z"},"links":{"cited_paper":"/paper/2312.01072","citing_paper":"/paper/2606.04889"},"observation_digest":"sha256:e9d7a17cc8132666d33b9f43c9915e2730c35bb536e833ad2f78d9dbbd9cf5aa","observation_id":"8001aa6d-80f9-444b-8b78-e69cf61bdc08","resolution":{"observed_at":"2026-07-02T08:36:47.623029Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01072","last_updated":"2024-07-04T09:32:18Z","snapshot_observed_at":"2026-08-20T01:15:04.998523Z","submitted_at":"2023-12-02T08:49:51Z","title":"A Survey of Temporal Credit Assignment in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2312.01072","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.01072","snapshot_observed_at":"2026-07-04T17:40:00.280883Z","title":"A survey of temporal credit assignment in deep reinforcement learning","venue":null,"work_id":"974bd811-fce0-4e67-ae9d-697f5f35a1e8","year":2023},"citing_paper":{"arxiv_id":"2606.05885","last_updated":"2026-06-04T08:54:09Z","snapshot_observed_at":"2026-08-08T00:56:45.958148Z","submitted_at":"2026-06-04T08:54:09Z","title":"When Denser Credit Is Not Enough: Evidence-Calibrated Policy Optimization for Long-Horizon LLM Agent Training","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-28T02:17:32.324432Z"},"links":{"cited_paper":"/paper/2312.01072","citing_paper":"/paper/2606.05885"},"observation_digest":"sha256:088d89639d592e77a8a8c87237aad5ad8495576ce68513d92e102c9894b379fc","observation_id":"0f2e0b28-0088-4b84-b85e-54dba3336231","resolution":{"observed_at":"2026-07-02T12:16:56.818092Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01072","last_updated":"2024-07-04T09:32:18Z","snapshot_observed_at":"2026-08-20T01:15:04.998523Z","submitted_at":"2023-12-02T08:49:51Z","title":"A Survey of Temporal Credit Assignment in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2312.01072","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.01072","snapshot_observed_at":"2026-07-04T17:40:00.280883Z","title":"A survey of temporal credit assignment in deep reinforcement learning","venue":null,"work_id":"974bd811-fce0-4e67-ae9d-697f5f35a1e8","year":2023},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-08-15T21:55:25.625601Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":150,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2312.01072","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:1664c458622d32681ce9ca435813e56ecb5e1a84975877efb06dbd85461450e7","observation_id":"48565c02-186a-4af8-aa6b-116c7c86ddfb","resolution":{"observed_at":"2026-07-04T07:59:40.737964Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01072","last_updated":"2024-07-04T09:32:18Z","snapshot_observed_at":"2026-08-20T01:15:04.998523Z","submitted_at":"2023-12-02T08:49:51Z","title":"A Survey of Temporal Credit Assignment in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2312.01072","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.01072","snapshot_observed_at":"2026-07-04T17:40:00.280883Z","title":"A survey of temporal credit assignment in deep reinforcement learning","venue":null,"work_id":"974bd811-fce0-4e67-ae9d-697f5f35a1e8","year":2023},"citing_paper":{"arxiv_id":"2606.24742","last_updated":"2026-06-23T16:07:48Z","snapshot_observed_at":"2026-08-13T10:06:32.930920Z","submitted_at":"2026-06-23T16:07:48Z","title":"World Value Models for Robotic Manipulation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-25T23:33:50.854261Z"},"links":{"cited_paper":"/paper/2312.01072","citing_paper":"/paper/2606.24742"},"observation_digest":"sha256:f3f5a0abfaf8d6ff0884d89a5636e662f726c71069c6787b7598154b03f648d3","observation_id":"90b1c0b3-c1bb-41ba-b5ed-2b4552bfd87e","resolution":{"observed_at":"2026-07-04T17:40:00.282436Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01072","last_updated":"2024-07-04T09:32:18Z","snapshot_observed_at":"2026-08-20T01:15:04.998523Z","submitted_at":"2023-12-02T08:49:51Z","title":"A Survey of Temporal Credit Assignment in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01072","snapshot_observed_at":"2026-08-01T09:44:29.171372Z","title":"Pignatelli, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20694","last_updated":"2026-07-22T19:49:38Z","snapshot_observed_at":"2026-08-20T01:15:19.045793Z","submitted_at":"2026-07-22T19:49:38Z","title":"Attribution Markets: A Fisher-Market Formulation for Fractional Credit Assignment Between Planned Tasks and Performed Actions","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T09:44:29.171372Z"},"links":{"cited_paper":"/paper/2312.01072","citing_paper":"/paper/2607.20694"},"observation_digest":"sha256:7beb94ece5a6bf1a4ece16dd320c81d3b77e2afbcb5f7989de99cff0bf2c0dd0","observation_id":"71116b30-7350-4d8d-9dca-5b46c4569bae","resolution":{"observed_at":"2026-08-01T09:44:29.171372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01072","last_updated":"2024-07-04T09:32:18Z","snapshot_observed_at":"2026-08-20T01:15:04.998523Z","submitted_at":"2023-12-02T08:49:51Z","title":"A Survey of Temporal Credit Assignment in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01072","snapshot_observed_at":"2026-08-01T04:45:24.486605Z","title":"arXiv preprint arXiv:2312.01072 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22468","last_updated":"2026-07-24T16:32:40Z","snapshot_observed_at":"2026-08-19T21:39:05.159968Z","submitted_at":"2026-07-24T16:32:40Z","title":"Learning to Prepare Molecular Ground States with Transformer Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T04:45:24.486605Z"},"links":{"cited_paper":"/paper/2312.01072","citing_paper":"/paper/2607.22468"},"observation_digest":"sha256:2389b722c4e3f1c4bd570efc558ac36ccf431ec72ffab862aafe566acbb3ec3a","observation_id":"876c39cb-1e01-4873-8117-0980b79e7276","resolution":{"observed_at":"2026-08-01T04:45:24.486605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01072","last_updated":"2024-07-04T09:32:18Z","snapshot_observed_at":"2026-08-20T01:15:04.998523Z","submitted_at":"2023-12-02T08:49:51Z","title":"A Survey of Temporal Credit Assignment in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01072","snapshot_observed_at":"2026-08-12T00:20:30.941220Z","title":"Eduardo Pignatelli, Johan Ferret, Matthieu Geist, Thomas Mesnard, Hado van Hasselt, and Laura Toni","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-18T07:47:13.007916Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.941220Z"},"links":{"cited_paper":"/paper/2312.01072","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:3902ee92dbe99de64ef4c43dbbdbf652fa68a65eac0e548563a18dae8e5d9921","observation_id":"0a1e9ed0-3451-4c16-857d-22bd399370dc","resolution":{"observed_at":"2026-08-12T00:20:30.941220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2312.01072/citation-record","integrity":"/paper/2312.01072/integrity","json":"/paper/2312.01072/citation-record.json","paper":"/paper/2312.01072"},"outbound":[],"paper":{"arxiv_id":"2312.01072","last_updated":"2024-07-04T09:32:18Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-20T01:15:04.998523Z","submitted_at":"2023-12-02T08:49:51Z","title":"A Survey of Temporal Credit Assignment in Deep Reinforcement Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 20 inbound Pith citation observations for arXiv:2312.01072."}