{"as_of":"2026-08-16T02:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:db3ffcc538e13b9f84058b8b40fd11ba993f4185bac499e97a215e1e96b2027a","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:40:50.611860Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:10:34.080907Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T14:10:34.228624Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.12611","last_updated":"2025-05-19T01:50:48Z","snapshot_observed_at":"2026-08-15T20:28:03.872629Z","submitted_at":"2025-05-19T01:50:48Z","title":"Action-Dependent Optimality-Preserving Reward Shaping","version":1},"cited_work":{"arxiv_id":"2505.12611","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.12611","snapshot_observed_at":"2026-08-06T14:10:34.228624Z","title":"Action-Dependent Optimality-Preserving Reward Shaping","venue":"cs.LG","work_id":"79c5237d-572c-4923-8327-823d28038b11","year":2025},"citing_paper":{"arxiv_id":"2507.19725","last_updated":"2025-07-26T00:49:25Z","snapshot_observed_at":"2026-08-15T21:31:12.864605Z","submitted_at":"2025-07-26T00:49:25Z","title":"Minding Motivation: The Effect of Intrinsic Motivation on Agent Behaviors","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T14:10:34.080907Z"},"links":{"cited_paper":"/paper/2505.12611","citing_paper":"/paper/2507.19725"},"observation_digest":"sha256:c0f3f95459ed939aa14591273612edb7d77cf702a6f0f188c849504143f3573d","observation_id":"02fe87b0-9663-4e20-8075-9adda41ed7ad","resolution":{"observed_at":"2026-08-06T14:10:34.234283Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.12611/citation-record","integrity":"/paper/2505.12611/integrity","json":"/paper/2505.12611/citation-record.json","paper":"/paper/2505.12611"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:50.523066Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12611","last_updated":"2025-05-19T01:50:48Z","snapshot_observed_at":"2026-08-15T20:28:03.872629Z","submitted_at":"2025-05-19T01:50:48Z","title":"Action-Dependent Optimality-Preserving Reward Shaping","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.523066Z"},"links":{"citing_paper":"/paper/2505.12611"},"observation_digest":"sha256:eb6b7f46e28e0c024a951304cd8ceebb38cce985d58e92aff75a7cc9a4333959","observation_id":"ddf5ae27-cae6-459e-841f-70fc763c6c82","resolution":{"observed_at":"2026-08-15T20:40:50.523066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:50.875490Z","title":"M., and Sun, W","venue":null,"work_id":"0ab332cc-5d62-4136-be49-50dfc67f760a","year":2019},"citing_paper":{"arxiv_id":"2505.12611","last_updated":"2025-05-19T01:50:48Z","snapshot_observed_at":"2026-08-15T20:28:03.872629Z","submitted_at":"2025-05-19T01:50:48Z","title":"Action-Dependent Optimality-Preserving Reward Shaping","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.527688Z"},"links":{"citing_paper":"/paper/2505.12611"},"observation_digest":"sha256:423813f55a1993b0f42a0c6fbe6768b50ab8e01ee9b7f676dec80700f9b5526e","observation_id":"8b55c4b9-a2d0-44c2-a7c4-013f73a3350a","resolution":{"observed_at":"2026-08-15T20:40:50.878481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06038","last_updated":"2020-02-14T13:57:22Z","snapshot_observed_at":"2026-08-16T00:01:17.496734Z","submitted_at":"2020-02-14T13:57:22Z","title":"Never Give Up: Learning Directed Exploration Strategies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06038","snapshot_observed_at":"2026-08-15T20:40:50.531331Z","title":"P., Sprechmann, P., Vitvitskyi, A., Guo, D., Piot, B., Kapturowski, S., Tieleman, O., Arjovsky, M., Pritzel, A., Bolt, A., et al","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.12611","last_updated":"2025-05-19T01:50:48Z","snapshot_observed_at":"2026-08-15T20:28:03.872629Z","submitted_at":"2025-05-19T01:50:48Z","title":"Action-Dependent Optimality-Preserving Reward Shaping","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.531331Z"},"links":{"cited_paper":"/paper/2002.06038","citing_paper":"/paper/2505.12611"},"observation_digest":"sha256:6f4986a5f8903d80156132b79c7e36bde1fbe84c7e84d1bb5ebf6f21ee45024a","observation_id":"6b15fafb-5b05-4b37-81d1-8e482873f1a3","resolution":{"observed_at":"2026-08-15T20:40:50.531331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:50.866436Z","title":"E., Harutyunyan, A., and Bowling, M","venue":null,"work_id":"e705abaa-6451-47cb-a7bd-9f9c078f82f7","year":2022},"citing_paper":{"arxiv_id":"2505.12611","last_updated":"2025-05-19T01:50:48Z","snapshot_observed_at":"2026-08-15T20:28:03.872629Z","submitted_at":"2025-05-19T01:50:48Z","title":"Action-Dependent Optimality-Preserving Reward Shaping","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.535027Z"},"links":{"citing_paper":"/paper/2505.12611"},"observation_digest":"sha256:154fbe7b7ef013730951cbdc5511b947381e3628a52119c08fb22dcc10d02c5b","observation_id":"6b331bd9-9092-4ae6-8d2c-c755b77c1b72","resolution":{"observed_at":"2026-08-15T20:40:50.869496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:50.856381Z","title":"Unifying count-based exploration and intrinsic motivation","venue":null,"work_id":"c040cf40-5cf2-4fe3-99e9-7ef74692efe2","year":2016},"citing_paper":{"arxiv_id":"2505.12611","last_updated":"2025-05-19T01:50:48Z","snapshot_observed_at":"2026-08-15T20:28:03.872629Z","submitted_at":"2025-05-19T01:50:48Z","title":"Action-Dependent Optimality-Preserving Reward Shaping","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.538576Z"},"links":{"citing_paper":"/paper/2505.12611"},"observation_digest":"sha256:c912143cda186c9cb6a538cee8e35f687140d790688614b911651c86c9d598e7","observation_id":"7c905b99-d911-426d-bfd3-65d10de7b0da","resolution":{"observed_at":"2026-08-15T20:40:50.860414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:50.541853Z","title":"G., Naddaf, Y., Veness, J., and Bowling, M","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.12611","last_updated":"2025-05-19T01:50:48Z","snapshot_observed_at":"2026-08-15T20:28:03.872629Z","submitted_at":"2025-05-19T01:50:48Z","title":"Action-Dependent Optimality-Preserving Reward Shaping","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.541853Z"},"links":{"citing_paper":"/paper/2505.12611"},"observation_digest":"sha256:408f9e0e1b8e315f710ff9069f955df71e1c2436c91a5a51c9655d68de2cbec1","observation_id":"3e0ac42e-1ac1-47ef-97bd-ff0fa586086b","resolution":{"observed_at":"2026-08-15T20:40:50.541853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.04355","last_updated":"2018-08-13T17:58:01Z","snapshot_observed_at":"2026-08-14T18:41:41.282322Z","submitted_at":"2018-08-13T17:58:01Z","title":"Large-Scale Study of Curiosity-Driven Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.04355","snapshot_observed_at":"2026-08-15T20:40:50.545127Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.12611","last_updated":"2025-05-19T01:50:48Z","snapshot_observed_at":"2026-08-15T20:28:03.872629Z","submitted_at":"2025-05-19T01:50:48Z","title":"Action-Dependent Optimality-Preserving Reward Shaping","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.545127Z"},"links":{"cited_paper":"/paper/1808.04355","citing_paper":"/paper/2505.12611"},"observation_digest":"sha256:1e280cf09feaf7ff30e97f21e252e5826bbe64c4c1b70e0bab3262227a30403d","observation_id":"cf407efd-e69f-410b-bb47-91a37e68a718","resolution":{"observed_at":"2026-08-15T20:40:50.545127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12894","last_updated":"2018-10-30T17:44:42Z","snapshot_observed_at":"2026-08-14T18:06:54.993797Z","submitted_at":"2018-10-30T17:44:42Z","title":"Exploration by Random Network Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12894","snapshot_observed_at":"2026-08-15T20:40:50.548845Z","title":"Exploration by random network distillation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.12611","last_updated":"2025-05-19T01:50:48Z","snapshot_observed_at":"2026-08-15T20:28:03.872629Z","submitted_at":"2025-05-19T01:50:48Z","title":"Action-Dependent Optimality-Preserving Reward Shaping","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.548845Z"},"links":{"cited_paper":"/paper/1810.12894","citing_paper":"/paper/2505.12611"},"observation_digest":"sha256:793c5b440844d43cf4a4f6a3d7ebbcdd4973c9267acbba4e42430eb0089a5cc8","observation_id":"1a6a0034-6e01-457c-9678-0f0114402c43","resolution":{"observed_at":"2026-08-15T20:40:50.548845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:50.841119Z","title":"Exploration by random network distillation","venue":null,"work_id":"d8962793-7b59-4cd1-beb3-bfaf172f65c6","year":2019},"citing_paper":{"arxiv_id":"2505.12611","last_updated":"2025-05-19T01:50:48Z","snapshot_observed_at":"2026-08-15T20:28:03.872629Z","submitted_at":"2025-05-19T01:50:48Z","title":"Action-Dependent Optimality-Preserving Reward Shaping","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.552559Z"},"links":{"citing_paper":"/paper/2505.12611"},"observation_digest":"sha256:7ee556d18fe40258ca7aa83744819a4bb3e27d0075b97bc5b5ea0b639c6970e9","observation_id":"614c7343-e290-4abd-aa96-3f6e1c3c24ce","resolution":{"observed_at":"2026-08-15T20:40:50.844480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.07627","last_updated":"2022-11-18T16:28:06Z","snapshot_observed_at":"2026-08-13T16:00:21.301626Z","submitted_at":"2022-11-14T18:49:26Z","title":"Redeeming Intrinsic Rewards via Constrained Optimization","version":2},"cited_work":{"arxiv_id":"2211.07627","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.07627","snapshot_observed_at":"2026-08-15T20:40:50.648300Z","title":"Redeeming Intrinsic Rewards via Constrained Optimization","venue":"cs.LG","work_id":"1fef9d44-3d40-4ee8-9a11-ce05980aac19","year":2022},"citing_paper":{"arxiv_id":"2505.12611","last_updated":"2025-05-19T01:50:48Z","snapshot_observed_at":"2026-08-15T20:28:03.872629Z","submitted_at":"2025-05-19T01:50:48Z","title":"Action-Dependent Optimality-Preserving Reward Shaping","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.555494Z"},"links":{"cited_paper":"/paper/2211.07627","citing_paper":"/paper/2505.12611"},"observation_digest":"sha256:bb79ef3694e12d29e0bb00496fe0cab1433c64e851ac91c87edc5d77f4a94d76","observation_id":"fb88c7e8-eb47-48c8-995f-7874f20e4dcf","resolution":{"observed_at":"2026-08-15T20:40:50.653534Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:50.831781Z","title":null,"venue":null,"work_id":"471dbab9-a4aa-4cad-9101-2a128551e1fc","year":2012},"citing_paper":{"arxiv_id":"2505.12611","last_updated":"2025-05-19T01:50:48Z","snapshot_observed_at":"2026-08-15T20:28:03.872629Z","submitted_at":"2025-05-19T01:50:48Z","title":"Action-Dependent Optimality-Preserving Reward Shaping","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.559072Z"},"links":{"citing_paper":"/paper/2505.12611"},"observation_digest":"sha256:35a9ab0429d2f4b82ab24f49219911ab3b6cb7bf81fa833865f44a94e347a680","observation_id":"d3c1b780-762a-4e8f-9bc1-6e9e59620960","resolution":{"observed_at":"2026-08-15T20:40:50.835012Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:50.821546Z","title":null,"venue":null,"work_id":"d0bb640a-4f01-4e02-984d-a80eec842186","year":2024},"citing_paper":{"arxiv_id":"2505.12611","last_updated":"2025-05-19T01:50:48Z","snapshot_observed_at":"2026-08-15T20:28:03.872629Z","submitted_at":"2025-05-19T01:50:48Z","title":"Action-Dependent Optimality-Preserving Reward Shaping","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.562316Z"},"links":{"citing_paper":"/paper/2505.12611"},"observation_digest":"sha256:d2356d009f5951423492d5a6bc8fd8558bdefee236abb08faa318aba5d13cc4d","observation_id":"97586bd5-9a50-497c-8f83-6a27b2eee651","resolution":{"observed_at":"2026-08-15T20:40:50.825588Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:50.812097Z","title":"C., Gupta, N., Villalobos-Arias, L., Potts, C","venue":null,"work_id":"e8f8cfd7-238d-4102-9ed4-dc5c01ef7fa6","year":2024},"citing_paper":{"arxiv_id":"2505.12611","last_updated":"2025-05-19T01:50:48Z","snapshot_observed_at":"2026-08-15T20:28:03.872629Z","submitted_at":"2025-05-19T01:50:48Z","title":"Action-Dependent Optimality-Preserving Reward Shaping","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.565273Z"},"links":{"citing_paper":"/paper/2505.12611"},"observation_digest":"sha256:1e6192159dea38dc5da453f648b2387e46ba82ec2ce02d894eacc668aaa9946c","observation_id":"6966b1ed-462c-4234-b13b-1d0a63efdee5","resolution":{"observed_at":"2026-08-15T20:40:50.815185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:50.802150Z","title":"C., Villalobos-Arias, L., Wang, J., Jhala, A., and Roberts, D","venue":null,"work_id":"7729ae88-2142-428e-b2de-97eb927c7d5f","year":2024},"citing_paper":{"arxiv_id":"2505.12611","last_updated":"2025-05-19T01:50:48Z","snapshot_observed_at":"2026-08-15T20:28:03.872629Z","submitted_at":"2025-05-19T01:50:48Z","title":"Action-Dependent Optimality-Preserving Reward Shaping","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.568247Z"},"links":{"citing_paper":"/paper/2505.12611"},"observation_digest":"sha256:0cbae14e5b91be531b28742bcda0abca9c6fdb427737453906b28955f3aade95","observation_id":"a3b3e1e7-56ae-49f8-900b-39f27c32fb3c","resolution":{"observed_at":"2026-08-15T20:40:50.805896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:50.791965Z","title":"Reward shaping in episodic reinforcement learning","venue":null,"work_id":"2ef213ba-4983-498d-b669-e6ef02d66bfd","year":2017},"citing_paper":{"arxiv_id":"2505.12611","last_updated":"2025-05-19T01:50:48Z","snapshot_observed_at":"2026-08-15T20:28:03.872629Z","submitted_at":"2025-05-19T01:50:48Z","title":"Action-Dependent Optimality-Preserving Reward Shaping","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.571195Z"},"links":{"citing_paper":"/paper/2505.12611"},"observation_digest":"sha256:6ce9fa96f2d1247bcd21d174b889adeb77860e2eaa024649be88147d81bd7e9f","observation_id":"f1094e15-1266-42f5-bd67-f61342225bbd","resolution":{"observed_at":"2026-08-15T20:40:50.795831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:50.781956Z","title":"Expressing arbitrary reward functions as potential-based advice","venue":null,"work_id":"316101e0-cca2-4d89-b661-3ae4bca0225d","year":2015},"citing_paper":{"arxiv_id":"2505.12611","last_updated":"2025-05-19T01:50:48Z","snapshot_observed_at":"2026-08-15T20:28:03.872629Z","submitted_at":"2025-05-19T01:50:48Z","title":"Action-Dependent Optimality-Preserving Reward Shaping","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.573997Z"},"links":{"citing_paper":"/paper/2505.12611"},"observation_digest":"sha256:09aae40f49724c56c1ea5898c74328867bf1878be29c9673403947f95230df54","observation_id":"d25cfc5b-aaa1-476c-a831-6a966b3ed76d","resolution":{"observed_at":"2026-08-15T20:40:50.785619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:50.772790Z","title":"On stationary point convergence of ppo-clip","venue":null,"work_id":"16eea663-ba32-4dec-b54e-9d5a2f01e037","year":2023},"citing_paper":{"arxiv_id":"2505.12611","last_updated":"2025-05-19T01:50:48Z","snapshot_observed_at":"2026-08-15T20:28:03.872629Z","submitted_at":"2025-05-19T01:50:48Z","title":"Action-Dependent Optimality-Preserving Reward Shaping","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.577203Z"},"links":{"citing_paper":"/paper/2505.12611"},"observation_digest":"sha256:46280cfe3f19c421fd1288cf9c3b50225dd5e9f536f9c8c5dea6e7bb3da50e57","observation_id":"e7f1cac0-c55f-4638-91ff-6f89bcc20d57","resolution":{"observed_at":"2026-08-15T20:40:50.776059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:50.763824Z","title":"Ppo-rnd, 2022","venue":null,"work_id":"0e967b90-a16a-4769-b438-e9e38a1237ba","year":2022},"citing_paper":{"arxiv_id":"2505.12611","last_updated":"2025-05-19T01:50:48Z","snapshot_observed_at":"2026-08-15T20:28:03.872629Z","submitted_at":"2025-05-19T01:50:48Z","title":"Action-Dependent Optimality-Preserving Reward Shaping","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.580076Z"},"links":{"citing_paper":"/paper/2505.12611"},"observation_digest":"sha256:69734d234d09d2c5e860cf73ae93ad60f0cf919dbc2619307bbfed75556fa8a8","observation_id":"aaddb901-bcf8-4fd1-b9dd-56faae739cb2","resolution":{"observed_at":"2026-08-15T20:40:50.766887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:50.754345Z","title":"Beyond surprise: Improving exploration through surprise novelty","venue":null,"work_id":"15549825-9008-453a-a4ca-8520ea6830be","year":2024},"citing_paper":{"arxiv_id":"2505.12611","last_updated":"2025-05-19T01:50:48Z","snapshot_observed_at":"2026-08-15T20:28:03.872629Z","submitted_at":"2025-05-19T01:50:48Z","title":"Action-Dependent Optimality-Preserving Reward Shaping","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.583277Z"},"links":{"citing_paper":"/paper/2505.12611"},"observation_digest":"sha256:0c92307c44e9b9df2fae1884a5e900a4c391a6f45c2d904acaec30be74b59a31","observation_id":"6fa5b1fa-2e1a-4fef-9a16-73fc9deac4c4","resolution":{"observed_at":"2026-08-15T20:40:50.757619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:50.745026Z","title":null,"venue":null,"work_id":"ff711739-b532-4432-9536-a39c7b60f0f2","year":1994},"citing_paper":{"arxiv_id":"2505.12611","last_updated":"2025-05-19T01:50:48Z","snapshot_observed_at":"2026-08-15T20:28:03.872629Z","submitted_at":"2025-05-19T01:50:48Z","title":"Action-Dependent Optimality-Preserving Reward Shaping","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.587330Z"},"links":{"citing_paper":"/paper/2505.12611"},"observation_digest":"sha256:c7f383e077863ad15c897319617559606eab6902bda4a13f218c91e3465ddcb9","observation_id":"fc12e4b1-c349-4748-8bf5-e203bb443b40","resolution":{"observed_at":"2026-08-15T20:40:50.748317Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:50.590500Z","title":"A., Veness, J., Bellemare, M","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.12611","last_updated":"2025-05-19T01:50:48Z","snapshot_observed_at":"2026-08-15T20:28:03.872629Z","submitted_at":"2025-05-19T01:50:48Z","title":"Action-Dependent Optimality-Preserving Reward Shaping","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.590500Z"},"links":{"citing_paper":"/paper/2505.12611"},"observation_digest":"sha256:7a8bebe1e50f47afae7f1ab027bb8216e876bd12a1047274069aaf896737aa54","observation_id":"afedd25e-13a0-46e6-9c19-5908e9586e39","resolution":{"observed_at":"2026-08-15T20:40:50.590500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:50.729758Z","title":"Y., Harada, D., and Russell, S","venue":null,"work_id":"e693e5c5-2286-4d2b-a2fb-fd2a7743d987","year":1999},"citing_paper":{"arxiv_id":"2505.12611","last_updated":"2025-05-19T01:50:48Z","snapshot_observed_at":"2026-08-15T20:28:03.872629Z","submitted_at":"2025-05-19T01:50:48Z","title":"Action-Dependent Optimality-Preserving Reward Shaping","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.593381Z"},"links":{"citing_paper":"/paper/2505.12611"},"observation_digest":"sha256:3c521c27cfdcc7038a99a7e45ddaaa0a9fda472fc783e3d6aa9551c12f12bdf4","observation_id":"3b3c308f-984b-4341-8d9e-207d743da03f","resolution":{"observed_at":"2026-08-15T20:40:50.733116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:50.596486Z","title":"A., and Darrell, T","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.12611","last_updated":"2025-05-19T01:50:48Z","snapshot_observed_at":"2026-08-15T20:28:03.872629Z","submitted_at":"2025-05-19T01:50:48Z","title":"Action-Dependent Optimality-Preserving Reward Shaping","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.596486Z"},"links":{"citing_paper":"/paper/2505.12611"},"observation_digest":"sha256:8366894d56c223d3f0d928ec904586f5a7ae76a7a37f07b061ca78c151f26aa1","observation_id":"19c6aab4-1a57-4b81-a9fc-6959b5a2a1e5","resolution":{"observed_at":"2026-08-15T20:40:50.596486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:50.714896Z","title":"and Williams, R","venue":null,"work_id":"7189457f-cf2f-4ab3-a497-1bb5e6ca56bd","year":1993},"citing_paper":{"arxiv_id":"2505.12611","last_updated":"2025-05-19T01:50:48Z","snapshot_observed_at":"2026-08-15T20:28:03.872629Z","submitted_at":"2025-05-19T01:50:48Z","title":"Action-Dependent Optimality-Preserving Reward Shaping","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.599690Z"},"links":{"citing_paper":"/paper/2505.12611"},"observation_digest":"sha256:8a5b009ebc04a847ded49bf751466e109436d8f6b438ee740882a67304913ccf","observation_id":"8069108d-907d-413b-9d89-3854b37ec643","resolution":{"observed_at":"2026-08-15T20:40:50.718099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:50.705719Z","title":"and Alstr m, P","venue":null,"work_id":"373e16e8-d9da-48d6-a271-20c73a33412a","year":1998},"citing_paper":{"arxiv_id":"2505.12611","last_updated":"2025-05-19T01:50:48Z","snapshot_observed_at":"2026-08-15T20:28:03.872629Z","submitted_at":"2025-05-19T01:50:48Z","title":"Action-Dependent Optimality-Preserving Reward Shaping","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.602648Z"},"links":{"citing_paper":"/paper/2505.12611"},"observation_digest":"sha256:49314275cccd7991f4f47c7e8aa4cf169f68d651a0db9039e8ade0d16c3dc30d","observation_id":"9a69146f-af2a-4e22-a416-66ac72f24ef4","resolution":{"observed_at":"2026-08-15T20:40:50.708827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T20:40:50.605584Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.12611","last_updated":"2025-05-19T01:50:48Z","snapshot_observed_at":"2026-08-15T20:28:03.872629Z","submitted_at":"2025-05-19T01:50:48Z","title":"Action-Dependent Optimality-Preserving Reward Shaping","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.605584Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.12611"},"observation_digest":"sha256:b6f49ca0bcdba670f8a17e089ffc3a2c68b6825a4ef630fec165b50b141dba07","observation_id":"09fc3cab-872e-4a18-bee7-bbdef8c8a9da","resolution":{"observed_at":"2026-08-15T20:40:50.605584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:50.696214Z","title":"Potential-based shaping and q-value initialization are equivalent","venue":null,"work_id":"45fea355-13c1-428a-a25c-7864aaa28dcc","year":2003},"citing_paper":{"arxiv_id":"2505.12611","last_updated":"2025-05-19T01:50:48Z","snapshot_observed_at":"2026-08-15T20:28:03.872629Z","submitted_at":"2025-05-19T01:50:48Z","title":"Action-Dependent Optimality-Preserving Reward Shaping","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.608682Z"},"links":{"citing_paper":"/paper/2505.12611"},"observation_digest":"sha256:f23f7b94634cebe9c22acd7b14a4cb20d29c7c4ac65ea7a6b0a2cd6843d96f29","observation_id":"deb75815-c322-44b3-85aa-7a84b315e637","resolution":{"observed_at":"2026-08-15T20:40:50.699687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:50.686311Z","title":"Automatic intrinsic reward shaping for exploration in deep reinforcement learning","venue":null,"work_id":"44edf4fc-837e-4c67-a915-9b08d1e42b56","year":2023},"citing_paper":{"arxiv_id":"2505.12611","last_updated":"2025-05-19T01:50:48Z","snapshot_observed_at":"2026-08-15T20:28:03.872629Z","submitted_at":"2025-05-19T01:50:48Z","title":"Action-Dependent Optimality-Preserving Reward Shaping","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.611860Z"},"links":{"citing_paper":"/paper/2505.12611"},"observation_digest":"sha256:d39834f80ed58fcb56f055701bc5a191de6fa8cb565c583a41e726710979a99f","observation_id":"9906cebb-dc28-46c7-b4c8-231b4a42f07b","resolution":{"observed_at":"2026-08-15T20:40:50.689800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.12611","last_updated":"2025-05-19T01:50:48Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T20:28:03.872629Z","submitted_at":"2025-05-19T01:50:48Z","title":"Action-Dependent Optimality-Preserving Reward Shaping"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":1,"verified_fuzzy":16},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 1 inbound Pith citation observation for arXiv:2505.12611."}