{"as_of":"2026-08-10T09:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b04478e764300d35c946574aa9584c72eb155ed06bce6f1847e6ae4f326c937c","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:41:13.953628Z","state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.23626/citation-record","integrity":"/paper/2506.23626/integrity","json":"/paper/2506.23626/citation-record.json","paper":"/paper/2506.23626"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:16.492940Z","title":null,"venue":null,"work_id":"73e89001-e4eb-4e09-a730-16a76b667b33","year":null},"citing_paper":{"arxiv_id":"2506.23626","last_updated":"2025-06-30T08:45:04Z","snapshot_observed_at":"2026-08-06T21:33:50.444719Z","submitted_at":"2025-06-30T08:45:04Z","title":"Self-correcting Reward Shaping via Language Models for Reinforcement Learning Agents in Games","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:10.179049Z"},"links":{"citing_paper":"/paper/2506.23626"},"observation_digest":"sha256:c929ae76d3f7741d0ce578fc19d4bd4a0686065778c2b6f454721ac30c435b6f","observation_id":"f13b1593-9979-4bf9-af18-bb1a1b7a84c6","resolution":{"observed_at":"2026-08-06T21:41:16.571140Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:16.292956Z","title":"Instructions","venue":null,"work_id":"dab03f64-dace-4e5f-89e2-54bd855b1366","year":null},"citing_paper":{"arxiv_id":"2506.23626","last_updated":"2025-06-30T08:45:04Z","snapshot_observed_at":"2026-08-06T21:33:50.444719Z","submitted_at":"2025-06-30T08:45:04Z","title":"Self-correcting Reward Shaping via Language Models for Reinforcement Learning Agents in Games","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:10.299088Z"},"links":{"citing_paper":"/paper/2506.23626"},"observation_digest":"sha256:aa3a69aa6c2f540806f7ec58cbea3167879d3d5ccff63f369ba71c4885366e38","observation_id":"b3449306-4e61-4056-9538-1e58989b0715","resolution":{"observed_at":"2026-08-06T21:41:16.378885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:15.657207Z","title":"• Adjust values to encourage the agent to complete the goal properly rather than remaining close to it","venue":null,"work_id":"48935ecb-ecb4-4a60-bde9-c4423ad2e4c1","year":null},"citing_paper":{"arxiv_id":"2506.23626","last_updated":"2025-06-30T08:45:04Z","snapshot_observed_at":"2026-08-06T21:33:50.444719Z","submitted_at":"2025-06-30T08:45:04Z","title":"Self-correcting Reward Shaping via Language Models for Reinforcement Learning Agents in Games","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:10.519280Z"},"links":{"citing_paper":"/paper/2506.23626"},"observation_digest":"sha256:64f55e3440da7259d9ee83f729afd39ed969567dcb3acbfcb09f5168cded74db","observation_id":"3a6e5395-af65-4535-bcb8-925621b60483","resolution":{"observed_at":"2026-08-06T21:41:15.765168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:15.432042Z","title":null,"venue":null,"work_id":"2bc51fa5-0210-4bf0-8094-28517dd25e30","year":null},"citing_paper":{"arxiv_id":"2506.23626","last_updated":"2025-06-30T08:45:04Z","snapshot_observed_at":"2026-08-06T21:33:50.444719Z","submitted_at":"2025-06-30T08:45:04Z","title":"Self-correcting Reward Shaping via Language Models for Reinforcement Learning Agents in Games","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:10.606616Z"},"links":{"citing_paper":"/paper/2506.23626"},"observation_digest":"sha256:027b9ef6eae57022cb4a21a180063bb4f954fa2ca60783bba0e136be4272958f","observation_id":"02429b1e-248e-4587-8aeb-b749060398cd","resolution":{"observed_at":"2026-08-06T21:41:15.533487Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:16.095473Z","title":null,"venue":null,"work_id":"88d21bc6-4456-4094-9116-63e4d9aa4c39","year":null},"citing_paper":{"arxiv_id":"2506.23626","last_updated":"2025-06-30T08:45:04Z","snapshot_observed_at":"2026-08-06T21:33:50.444719Z","submitted_at":"2025-06-30T08:45:04Z","title":"Self-correcting Reward Shaping via Language Models for Reinforcement Learning Agents in Games","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:10.394406Z"},"links":{"citing_paper":"/paper/2506.23626"},"observation_digest":"sha256:56757e354175a50f8f03a57ce153d2b1a65889886648916ae88a94c8b99799c0","observation_id":"8cd012bf-5014-47db-a29b-7e198e3d1ee5","resolution":{"observed_at":"2026-08-06T21:41:16.179890Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:15.876038Z","title":"• These parameters control the agent’s learning and behavior","venue":null,"work_id":"dd79a44b-fc4f-4d4d-8ec0-a8aae47dbb5b","year":null},"citing_paper":{"arxiv_id":"2506.23626","last_updated":"2025-06-30T08:45:04Z","snapshot_observed_at":"2026-08-06T21:33:50.444719Z","submitted_at":"2025-06-30T08:45:04Z","title":"Self-correcting Reward Shaping via Language Models for Reinforcement Learning Agents in Games","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:10.462055Z"},"links":{"citing_paper":"/paper/2506.23626"},"observation_digest":"sha256:ac4b82a6efa63b33c7c0eaaab2951f37413c5d567883beaa6f4e3093c9b24ba0","observation_id":"ea1367b6-e3a6-4383-8564-c12a9ee351f8","resolution":{"observed_at":"2026-08-06T21:41:15.991458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:15.251308Z","title":"For instance, if theProblem description is talking about making the agents collide less, but does not refer hitting the fence,do not change the fence collision penalty","venue":null,"work_id":"48e32a3c-2cb3-4b77-9745-fbbccb5a23c2","year":2025},"citing_paper":{"arxiv_id":"2506.23626","last_updated":"2025-06-30T08:45:04Z","snapshot_observed_at":"2026-08-06T21:33:50.444719Z","submitted_at":"2025-06-30T08:45:04Z","title":"Self-correcting Reward Shaping via Language Models for Reinforcement Learning Agents in Games","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:10.718492Z"},"links":{"citing_paper":"/paper/2506.23626"},"observation_digest":"sha256:fb86434bbe0c1f3329925def9d12d8abe85dbbd210f42eb4214e4cb73fedffac","observation_id":"3f643437-5a2b-43bd-8a36-28e141c0720b","resolution":{"observed_at":"2026-08-06T21:41:15.336253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:15.099200Z","title":"• The format of the outputmust be identicalto the .txt file","venue":null,"work_id":"505f21db-706c-4d49-a027-1add2a6adba2","year":2025},"citing_paper":{"arxiv_id":"2506.23626","last_updated":"2025-06-30T08:45:04Z","snapshot_observed_at":"2026-08-06T21:33:50.444719Z","submitted_at":"2025-06-30T08:45:04Z","title":"Self-correcting Reward Shaping via Language Models for Reinforcement Learning Agents in Games","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:10.993083Z"},"links":{"citing_paper":"/paper/2506.23626"},"observation_digest":"sha256:94d3c45ad4ad0a8698d3434f9ab8eab04a249d792d66512c6b98a8cde35bbb24","observation_id":"d9417170-972f-4942-b930-3069e9e49353","resolution":{"observed_at":"2026-08-06T21:41:15.161476Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:14.880615Z","title":"in the least amount of time steps","venue":null,"work_id":"90d7a716-6151-4d53-a944-15e926c7bdda","year":null},"citing_paper":{"arxiv_id":"2506.23626","last_updated":"2025-06-30T08:45:04Z","snapshot_observed_at":"2026-08-06T21:33:50.444719Z","submitted_at":"2025-06-30T08:45:04Z","title":"Self-correcting Reward Shaping via Language Models for Reinforcement Learning Agents in Games","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:12.040776Z"},"links":{"citing_paper":"/paper/2506.23626"},"observation_digest":"sha256:d87674c07aeb79ae02ce7413d2f4dcbc0dc818244f5072a87ee3e6dfb80cb579","observation_id":"950e8afd-d779-430d-98f7-bdd64b67600c","resolution":{"observed_at":"2026-08-06T21:41:14.974683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:14.673991Z","title":null,"venue":null,"work_id":"0db835a3-70b9-4d5b-9fdb-df67aa48bc32","year":null},"citing_paper":{"arxiv_id":"2506.23626","last_updated":"2025-06-30T08:45:04Z","snapshot_observed_at":"2026-08-06T21:33:50.444719Z","submitted_at":"2025-06-30T08:45:04Z","title":"Self-correcting Reward Shaping via Language Models for Reinforcement Learning Agents in Games","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:13.661770Z"},"links":{"citing_paper":"/paper/2506.23626"},"observation_digest":"sha256:115693a403ff2fdd7249908a77a274973386d0ac2542340c1378bcb427083177","observation_id":"9e02ff12-8e3c-4c01-a2f2-edbacc489886","resolution":{"observed_at":"2026-08-06T21:41:14.763880Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:14.520926Z","title":"Try to be creative with the solution, ie","venue":null,"work_id":"e4144b70-811a-4967-97a1-860a44891cf3","year":null},"citing_paper":{"arxiv_id":"2506.23626","last_updated":"2025-06-30T08:45:04Z","snapshot_observed_at":"2026-08-06T21:33:50.444719Z","submitted_at":"2025-06-30T08:45:04Z","title":"Self-correcting Reward Shaping via Language Models for Reinforcement Learning Agents in Games","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:13.861797Z"},"links":{"citing_paper":"/paper/2506.23626"},"observation_digest":"sha256:5960bdbc778826489c77dcb084ba9f450617323f62cd9bb4b2d49872aa14f7e3","observation_id":"59b48f51-89e1-4354-b052-6931d15109b6","resolution":{"observed_at":"2026-08-06T21:41:14.577985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:14.352033Z","title":"Your output should be the updated reward function file only","venue":null,"work_id":"df4f07a5-c9b0-4583-8277-9e8d9c67b685","year":2018},"citing_paper":{"arxiv_id":"2506.23626","last_updated":"2025-06-30T08:45:04Z","snapshot_observed_at":"2026-08-06T21:33:50.444719Z","submitted_at":"2025-06-30T08:45:04Z","title":"Self-correcting Reward Shaping via Language Models for Reinforcement Learning Agents in Games","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:13.953628Z"},"links":{"citing_paper":"/paper/2506.23626"},"observation_digest":"sha256:28c13c840028c9da55f3d10332f6f5a53e265051acfbe15650d099ff5e570048","observation_id":"2f60979a-0dca-4fcd-9b60-c098dc3bde44","resolution":{"observed_at":"2026-08-06T21:41:14.422955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2022.31757","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:14.154947Z","title":"Yan Zheng, Xiaofei Xie, Ting Su, Lei Ma, Jianye Hao, Zhaopeng Meng, Yang Liu, Ruimin Shen, Yingfeng Chen, and Changjie Fan","venue":null,"work_id":"d0456f43-a29b-430d-bc30-f401c498911a","year":2022},"citing_paper":{"arxiv_id":"2506.23626","last_updated":"2025-06-30T08:45:04Z","snapshot_observed_at":"2026-08-06T21:33:50.444719Z","submitted_at":"2025-06-30T08:45:04Z","title":"Self-correcting Reward Shaping via Language Models for Reinforcement Learning Agents in Games","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:10.113675Z"},"links":{"citing_paper":"/paper/2506.23626"},"observation_digest":"sha256:65ea2fe632ae69edad73cd91608aff06b531afef870448cc23429d26d02dc517","observation_id":"c3808800-ed00-446a-8938-fb0675132a38","resolution":{"observed_at":"2026-08-06T21:41:14.245278Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15568","last_updated":"2025-02-14T14:24:59Z","snapshot_observed_at":"2026-07-06T18:19:21.735356Z","submitted_at":"2024-05-24T13:57:32Z","title":"OMNI-EPIC: Open-endedness via Models of human Notions of Interestingness with Environments Programmed in Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15568","snapshot_observed_at":"2026-08-06T21:41:10.068318Z","title":"it’s unwieldy and it takes a lot of time","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23626","last_updated":"2025-06-30T08:45:04Z","snapshot_observed_at":"2026-08-06T21:33:50.444719Z","submitted_at":"2025-06-30T08:45:04Z","title":"Self-correcting Reward Shaping via Language Models for Reinforcement Learning Agents in Games","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:10.068318Z"},"links":{"cited_paper":"/paper/2405.15568","citing_paper":"/paper/2506.23626"},"observation_digest":"sha256:df36e8b29a0bed663d1ab31d0c9e033aa812caf47bf78974a948ff756515c69f","observation_id":"1bd7b80f-7613-4173-ba96-9553b70eddc3","resolution":{"observed_at":"2026-08-06T21:41:10.068318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.23626","last_updated":"2025-06-30T08:45:04Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T21:33:50.444719Z","submitted_at":"2025-06-30T08:45:04Z","title":"Self-correcting Reward Shaping via Language Models for Reinforcement Learning Agents in Games"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 0 inbound Pith citation observations for arXiv:2506.23626."}