{"as_of":"2026-08-18T19:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:25afffc32d597ceb92136d94585a8a1e26aa5c79020cdefa7becb82c41f1e764","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:07:49.561638Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T21:03:31.606674Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T21:06:50.921756Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.10802","last_updated":"2025-05-16T02:43:05Z","snapshot_observed_at":"2026-08-16T18:03:59.728039Z","submitted_at":"2025-05-16T02:43:05Z","title":"Attention-Based Reward Shaping for Sparse and Delayed Rewards","version":1},"cited_work":{"arxiv_id":"2505.10802","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.10802","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wenxuan Huang, Bohan Jia, Zijie Zhai, Shaosheng Cao, Zheyu Ye, Fei Zhao, Zhe Xu, Yao Hu, and Shaohui Lin","venue":null,"work_id":"ded3a8e7-35fa-47e3-b3f5-ea1f4d324826","year":null},"citing_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-08-15T16:01:07.680571Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T21:03:31.606674Z"},"links":{"cited_paper":"/paper/2505.10802","citing_paper":"/paper/2508.19652"},"observation_digest":"sha256:7334285214c3fbead2fb8dd995e5c126807697514df9f7f3860fdfffa59add19","observation_id":"ef2dc4f0-e265-4679-b6d4-e2dd59127887","resolution":{"observed_at":"2026-05-18T21:06:50.924903Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.10802/citation-record","integrity":"/paper/2505.10802/integrity","json":"/paper/2505.10802/citation-record.json","paper":"/paper/2505.10802"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:49.855554Z","title":"Andrychowicz, B","venue":null,"work_id":"0b7b0cf9-24c5-47aa-a981-ba75455631b9","year":2019},"citing_paper":{"arxiv_id":"2505.10802","last_updated":"2025-05-16T02:43:05Z","snapshot_observed_at":"2026-08-16T18:03:59.728039Z","submitted_at":"2025-05-16T02:43:05Z","title":"Attention-Based Reward Shaping for Sparse and Delayed Rewards","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:49.467734Z"},"links":{"citing_paper":"/paper/2505.10802"},"observation_digest":"sha256:bb6a348a5c425f9e29f5ce3c8ce9a5da21996cba96dc343b6b7e504d58ec651c","observation_id":"764622b9-e97d-4db6-bac2-86e38c46b843","resolution":{"observed_at":"2026-08-15T21:07:49.858961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06680","last_updated":"2019-12-13T19:56:40Z","snapshot_observed_at":"2026-08-13T14:13:07.807518Z","submitted_at":"2019-12-13T19:56:40Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06680","snapshot_observed_at":"2026-08-15T21:07:49.472890Z","title":"Berner, G","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.10802","last_updated":"2025-05-16T02:43:05Z","snapshot_observed_at":"2026-08-16T18:03:59.728039Z","submitted_at":"2025-05-16T02:43:05Z","title":"Attention-Based Reward Shaping for Sparse and Delayed Rewards","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:49.472890Z"},"links":{"cited_paper":"/paper/1912.06680","citing_paper":"/paper/2505.10802"},"observation_digest":"sha256:5aacb2efe78e7c8a8506b23641a60583d5c22f3f6447ce000848f501dad2466e","observation_id":"b0c25601-95f4-4377-aa4d-86f27a64df0d","resolution":{"observed_at":"2026-08-15T21:07:49.472890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:49.845459Z","title":"Ouyang, J","venue":null,"work_id":"169f5d59-b3bd-41d8-a150-aa89383160cb","year":2022},"citing_paper":{"arxiv_id":"2505.10802","last_updated":"2025-05-16T02:43:05Z","snapshot_observed_at":"2026-08-16T18:03:59.728039Z","submitted_at":"2025-05-16T02:43:05Z","title":"Attention-Based Reward Shaping for Sparse and Delayed Rewards","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:49.476988Z"},"links":{"citing_paper":"/paper/2505.10802"},"observation_digest":"sha256:d997589a2c6730dc0423d5ebfdbe644d366b827ccb21cb8a5b1003c917df0fd7","observation_id":"29b36910-b40f-4bd8-b397-4b2e19c69922","resolution":{"observed_at":"2026-08-15T21:07:49.848804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:49.835168Z","title":"Skalse, N","venue":null,"work_id":"a3be10b8-e02b-4106-a6b1-67c75c03d591","year":2022},"citing_paper":{"arxiv_id":"2505.10802","last_updated":"2025-05-16T02:43:05Z","snapshot_observed_at":"2026-08-16T18:03:59.728039Z","submitted_at":"2025-05-16T02:43:05Z","title":"Attention-Based Reward Shaping for Sparse and Delayed Rewards","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:49.481260Z"},"links":{"citing_paper":"/paper/2505.10802"},"observation_digest":"sha256:794bb32b8f52841ebe9b1289d2b4f43c2cbf9c4d5554e506a2688fb19b2b34a2","observation_id":"1eb2f166-d550-4028-8523-3e7871febce6","resolution":{"observed_at":"2026-08-15T21:07:49.838750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:49.824894Z","title":null,"venue":null,"work_id":"8929a42d-b835-40ef-893c-6957b15bb3cd","year":2018},"citing_paper":{"arxiv_id":"2505.10802","last_updated":"2025-05-16T02:43:05Z","snapshot_observed_at":"2026-08-16T18:03:59.728039Z","submitted_at":"2025-05-16T02:43:05Z","title":"Attention-Based Reward Shaping for Sparse and Delayed Rewards","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:49.485271Z"},"links":{"citing_paper":"/paper/2505.10802"},"observation_digest":"sha256:113f66b33fcda7941fda890e13f89cb1fedddf26c6ba732481b384d6e2f7ea6e","observation_id":"5b578494-908a-488d-b1af-54cd695081f6","resolution":{"observed_at":"2026-08-15T21:07:49.828409Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:49.814792Z","title":"Gangwani, Y","venue":null,"work_id":"5034006b-96f6-4404-b3e5-a6047ffda5b2","year":2020},"citing_paper":{"arxiv_id":"2505.10802","last_updated":"2025-05-16T02:43:05Z","snapshot_observed_at":"2026-08-16T18:03:59.728039Z","submitted_at":"2025-05-16T02:43:05Z","title":"Attention-Based Reward Shaping for Sparse and Delayed Rewards","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:49.489518Z"},"links":{"citing_paper":"/paper/2505.10802"},"observation_digest":"sha256:4cf33038dd9d099165009b0d54408a97c307cc65494d60a066a2c53c048f8778","observation_id":"f0194287-1f52-4bc3-91c4-eaeaa7d35704","resolution":{"observed_at":"2026-08-15T21:07:49.818499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:49.806031Z","title":null,"venue":null,"work_id":"5ee97730-ce3e-4f60-a416-676709b9f16b","year":2022},"citing_paper":{"arxiv_id":"2505.10802","last_updated":"2025-05-16T02:43:05Z","snapshot_observed_at":"2026-08-16T18:03:59.728039Z","submitted_at":"2025-05-16T02:43:05Z","title":"Attention-Based Reward Shaping for Sparse and Delayed Rewards","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:49.493408Z"},"links":{"citing_paper":"/paper/2505.10802"},"observation_digest":"sha256:9794f86bc7af7878dcc0c06092ad64ee8c303d7c47419c43844754b01e8deeaf","observation_id":"0c744274-2329-475e-8fa0-ec2fe7713282","resolution":{"observed_at":"2026-08-15T21:07:49.808910Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:49.796663Z","title":"Rengarajan, G","venue":null,"work_id":"06a65a9d-b315-4879-ad01-041f011b17f6","year":2022},"citing_paper":{"arxiv_id":"2505.10802","last_updated":"2025-05-16T02:43:05Z","snapshot_observed_at":"2026-08-16T18:03:59.728039Z","submitted_at":"2025-05-16T02:43:05Z","title":"Attention-Based Reward Shaping for Sparse and Delayed Rewards","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:49.497666Z"},"links":{"citing_paper":"/paper/2505.10802"},"observation_digest":"sha256:fbbe2bda687ef04e0538f4e80eb0258ed95f181a00f489b11b9789966ac99beb","observation_id":"9d94de1f-cb68-46a0-b062-23acf8b68bbc","resolution":{"observed_at":"2026-08-15T21:07:49.799873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:49.787286Z","title":null,"venue":null,"work_id":"f56b0c2d-edc3-43ae-893f-4a0ae87c598f","year":2024},"citing_paper":{"arxiv_id":"2505.10802","last_updated":"2025-05-16T02:43:05Z","snapshot_observed_at":"2026-08-16T18:03:59.728039Z","submitted_at":"2025-05-16T02:43:05Z","title":"Attention-Based Reward Shaping for Sparse and Delayed Rewards","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:49.501293Z"},"links":{"citing_paper":"/paper/2505.10802"},"observation_digest":"sha256:e2d2625c8c7ab5bb82191ab340266991a7e151db444d4a3098b20fd48a2d54ea","observation_id":"8a82cf5b-f6da-49ff-bbda-2210ba53c2c3","resolution":{"observed_at":"2026-08-15T21:07:49.790538Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:49.777663Z","title":"Mguni, T","venue":null,"work_id":"3cd5f293-5152-454a-950d-1cf32fbcdfff","year":2023},"citing_paper":{"arxiv_id":"2505.10802","last_updated":"2025-05-16T02:43:05Z","snapshot_observed_at":"2026-08-16T18:03:59.728039Z","submitted_at":"2025-05-16T02:43:05Z","title":"Attention-Based Reward Shaping for Sparse and Delayed Rewards","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:49.505284Z"},"links":{"citing_paper":"/paper/2505.10802"},"observation_digest":"sha256:96953e75b28b53b5e0116ff3713d71e3935178d834ef02f3205c4e2643826e5d","observation_id":"4a093b0e-14bb-4379-a2ab-150504df19be","resolution":{"observed_at":"2026-08-15T21:07:49.781163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:49.767591Z","title":"Patil, M","venue":null,"work_id":"acf3c62d-cf57-4d4a-9cfc-c9d15a5102e4","year":2022},"citing_paper":{"arxiv_id":"2505.10802","last_updated":"2025-05-16T02:43:05Z","snapshot_observed_at":"2026-08-16T18:03:59.728039Z","submitted_at":"2025-05-16T02:43:05Z","title":"Attention-Based Reward Shaping for Sparse and Delayed Rewards","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:49.508594Z"},"links":{"citing_paper":"/paper/2505.10802"},"observation_digest":"sha256:82c2c405803f2065f1a52dbbde91894865fae6010d6dd4a9f389244527e94af1","observation_id":"a2e3e1f0-3eaf-402b-b6eb-802746316899","resolution":{"observed_at":"2026-08-15T21:07:49.771024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:49.756810Z","title":null,"venue":null,"work_id":"5246a98a-c67e-448f-b4ad-f80251150ecb","year":2024},"citing_paper":{"arxiv_id":"2505.10802","last_updated":"2025-05-16T02:43:05Z","snapshot_observed_at":"2026-08-16T18:03:59.728039Z","submitted_at":"2025-05-16T02:43:05Z","title":"Attention-Based Reward Shaping for Sparse and Delayed Rewards","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:49.512465Z"},"links":{"citing_paper":"/paper/2505.10802"},"observation_digest":"sha256:7be16d5833f5f19a59b029426f0f174a10516ed6cebbe779fad96f61e106300d","observation_id":"e9e8984c-8b64-4ac1-a96a-b88835ce1a9e","resolution":{"observed_at":"2026-08-15T21:07:49.760580Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:49.744747Z","title":"Chen and M","venue":null,"work_id":"4899f54d-cf5f-49e7-bcfa-5eee81ac507d","year":2021},"citing_paper":{"arxiv_id":"2505.10802","last_updated":"2025-05-16T02:43:05Z","snapshot_observed_at":"2026-08-16T18:03:59.728039Z","submitted_at":"2025-05-16T02:43:05Z","title":"Attention-Based Reward Shaping for Sparse and Delayed Rewards","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:49.515687Z"},"links":{"citing_paper":"/paper/2505.10802"},"observation_digest":"sha256:8e631accd92de6d9908331000e51fda8a66d5b931a97c7a9cbb42913353abf1a","observation_id":"ca220ee4-c95e-4101-9621-cb26e6afb2fa","resolution":{"observed_at":"2026-08-15T21:07:49.749578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:49.735181Z","title":"Vaswani, N","venue":null,"work_id":"c5bc39a1-d3ad-485f-ba39-24bba60a2804","year":2017},"citing_paper":{"arxiv_id":"2505.10802","last_updated":"2025-05-16T02:43:05Z","snapshot_observed_at":"2026-08-16T18:03:59.728039Z","submitted_at":"2025-05-16T02:43:05Z","title":"Attention-Based Reward Shaping for Sparse and Delayed Rewards","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:49.519110Z"},"links":{"citing_paper":"/paper/2505.10802"},"observation_digest":"sha256:82cb8643bd566e501b0a774b997ff0d50dcf334a6c0dc406c02db2d379d2b2d0","observation_id":"9de192a6-6ab1-4c76-94ac-54c84e53d8d2","resolution":{"observed_at":"2026-08-15T21:07:49.738301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:49.724865Z","title":"Trott, S","venue":null,"work_id":"61474b1a-5b88-412c-9c84-aaaca21a7629","year":2019},"citing_paper":{"arxiv_id":"2505.10802","last_updated":"2025-05-16T02:43:05Z","snapshot_observed_at":"2026-08-16T18:03:59.728039Z","submitted_at":"2025-05-16T02:43:05Z","title":"Attention-Based Reward Shaping for Sparse and Delayed Rewards","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:49.522387Z"},"links":{"citing_paper":"/paper/2505.10802"},"observation_digest":"sha256:4c5618e38a6953476279da0bdd5f6c5faa77c3c8bee55b720b3f1ae9faa4fb9b","observation_id":"02a0d492-1e2b-4126-88cb-734bef311141","resolution":{"observed_at":"2026-08-15T21:07:49.728198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13414","last_updated":"2020-08-03T01:28:14Z","snapshot_observed_at":"2026-08-18T17:15:04.245562Z","submitted_at":"2019-12-21T03:32:00Z","title":"Predictive Coding for Boosting Deep Reinforcement Learning with Sparse Rewards","version":2},"cited_work":{"arxiv_id":"1912.13414","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.13414","snapshot_observed_at":"2026-08-15T21:07:49.609595Z","title":"Predictive Coding for Boosting Deep Reinforcement Learning with Sparse Rewards","venue":"cs.LG","work_id":"dc2829ce-1f65-4331-9bc1-2e76bd0bcb44","year":2019},"citing_paper":{"arxiv_id":"2505.10802","last_updated":"2025-05-16T02:43:05Z","snapshot_observed_at":"2026-08-16T18:03:59.728039Z","submitted_at":"2025-05-16T02:43:05Z","title":"Attention-Based Reward Shaping for Sparse and Delayed Rewards","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:49.525807Z"},"links":{"cited_paper":"/paper/1912.13414","citing_paper":"/paper/2505.10802"},"observation_digest":"sha256:55f88933a73be8162314890f77a40ab1975865081116844cf83475784a8c056d","observation_id":"742046b1-b99b-46c0-8c8f-4f92deca9b86","resolution":{"observed_at":"2026-08-15T21:07:49.615296Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.13420","last_updated":"2019-05-31T05:20:12Z","snapshot_observed_at":"2026-08-14T16:23:16.822339Z","submitted_at":"2019-05-31T05:20:12Z","title":"Sequence Modeling of Temporal Credit Assignment for Episodic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.13420","snapshot_observed_at":"2026-08-15T21:07:49.529271Z","title":null,"venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2505.10802","last_updated":"2025-05-16T02:43:05Z","snapshot_observed_at":"2026-08-16T18:03:59.728039Z","submitted_at":"2025-05-16T02:43:05Z","title":"Attention-Based Reward Shaping for Sparse and Delayed Rewards","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:49.529271Z"},"links":{"cited_paper":"/paper/1905.13420","citing_paper":"/paper/2505.10802"},"observation_digest":"sha256:8ba9b8ea4e4c3929c14a468cde9a1068360db5e3ebeb3db137ff03da67c4ff66","observation_id":"1168634d-5c17-4e47-82df-556e8ddf606a","resolution":{"observed_at":"2026-08-15T21:07:49.529271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:49.714461Z","title":"Ferret, R","venue":null,"work_id":"7c1407ee-ac99-4185-8a32-7f7018ab811f","year":2020},"citing_paper":{"arxiv_id":"2505.10802","last_updated":"2025-05-16T02:43:05Z","snapshot_observed_at":"2026-08-16T18:03:59.728039Z","submitted_at":"2025-05-16T02:43:05Z","title":"Attention-Based Reward Shaping for Sparse and Delayed Rewards","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:49.532632Z"},"links":{"citing_paper":"/paper/2505.10802"},"observation_digest":"sha256:9ed8297b1484b24da7fa89a481f8d33121d6c4262aafd789ad01726a0dec8b2e","observation_id":"6f95cc32-2bc1-4df4-a00e-88f8b902d4fc","resolution":{"observed_at":"2026-08-15T21:07:49.718102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12425","last_updated":"2021-02-24T17:43:02Z","snapshot_observed_at":"2026-08-18T01:30:55.753958Z","submitted_at":"2021-02-24T17:43:02Z","title":"Synthetic Returns for Long-Term Credit Assignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12425","snapshot_observed_at":"2026-08-15T21:07:49.535756Z","title":"Raposo, S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10802","last_updated":"2025-05-16T02:43:05Z","snapshot_observed_at":"2026-08-16T18:03:59.728039Z","submitted_at":"2025-05-16T02:43:05Z","title":"Attention-Based Reward Shaping for Sparse and Delayed Rewards","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:49.535756Z"},"links":{"cited_paper":"/paper/2102.12425","citing_paper":"/paper/2505.10802"},"observation_digest":"sha256:e0b41ff30797f192edb8774f89926ae83e721f13627357b17776633825934a20","observation_id":"4d4579af-c832-4ff3-8403-009fc4370724","resolution":{"observed_at":"2026-08-15T21:07:49.535756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:49.704493Z","title":null,"venue":null,"work_id":"8c27b093-5f81-4292-bcb8-d26a99daca82","year":2010},"citing_paper":{"arxiv_id":"2505.10802","last_updated":"2025-05-16T02:43:05Z","snapshot_observed_at":"2026-08-16T18:03:59.728039Z","submitted_at":"2025-05-16T02:43:05Z","title":"Attention-Based Reward Shaping for Sparse and Delayed Rewards","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:49.538995Z"},"links":{"citing_paper":"/paper/2505.10802"},"observation_digest":"sha256:c9bc225dd72cdeef2b744dc10ec68867d59f1277595443eb131443feaa824fc2","observation_id":"eeda52da-a079-4d9a-8046-0b7158ff16d5","resolution":{"observed_at":"2026-08-15T21:07:49.707771Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:49.694677Z","title":null,"venue":null,"work_id":"e15f5d49-287d-46a5-8ca4-f57a8f74a1fa","year":2019},"citing_paper":{"arxiv_id":"2505.10802","last_updated":"2025-05-16T02:43:05Z","snapshot_observed_at":"2026-08-16T18:03:59.728039Z","submitted_at":"2025-05-16T02:43:05Z","title":"Attention-Based Reward Shaping for Sparse and Delayed Rewards","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:49.542571Z"},"links":{"citing_paper":"/paper/2505.10802"},"observation_digest":"sha256:302a4c29c27d5200ad950b6ee7a21c29f37a3c2cdef9109ef2b103287118f792","observation_id":"27e45727-920a-47c6-96f2-98ca1c35c7f9","resolution":{"observed_at":"2026-08-15T21:07:49.697818Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:49.684117Z","title":"Memarian, W","venue":null,"work_id":"35ef88c8-bcf7-4bc6-997e-58c2e817bc09","year":2021},"citing_paper":{"arxiv_id":"2505.10802","last_updated":"2025-05-16T02:43:05Z","snapshot_observed_at":"2026-08-16T18:03:59.728039Z","submitted_at":"2025-05-16T02:43:05Z","title":"Attention-Based Reward Shaping for Sparse and Delayed Rewards","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:49.546009Z"},"links":{"citing_paper":"/paper/2505.10802"},"observation_digest":"sha256:53c8637eeaf698d7acf4a6713f924108727a2c4cb224bdcafae6aa0f806b112d","observation_id":"6d67743d-42ab-46b5-afa3-40ff362349ae","resolution":{"observed_at":"2026-08-15T21:07:49.687477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:49.673827Z","title":null,"venue":null,"work_id":"0f609f84-a29f-4440-a4a5-9228910f027a","year":2022},"citing_paper":{"arxiv_id":"2505.10802","last_updated":"2025-05-16T02:43:05Z","snapshot_observed_at":"2026-08-16T18:03:59.728039Z","submitted_at":"2025-05-16T02:43:05Z","title":"Attention-Based Reward Shaping for Sparse and Delayed Rewards","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:49.549174Z"},"links":{"citing_paper":"/paper/2505.10802"},"observation_digest":"sha256:a0606b2220ab466d5ac4e95b2a402bbd991e2c0e004957bda67c4b2d4d316e94","observation_id":"9fa8b6f7-1832-4d34-aee9-12c0864f741d","resolution":{"observed_at":"2026-08-15T21:07:49.677250Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:49.663196Z","title":"Andrychowicz, F","venue":null,"work_id":"d9f86579-656d-4836-8e3c-03d16bd59a1a","year":2017},"citing_paper":{"arxiv_id":"2505.10802","last_updated":"2025-05-16T02:43:05Z","snapshot_observed_at":"2026-08-16T18:03:59.728039Z","submitted_at":"2025-05-16T02:43:05Z","title":"Attention-Based Reward Shaping for Sparse and Delayed Rewards","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:49.552293Z"},"links":{"citing_paper":"/paper/2505.10802"},"observation_digest":"sha256:9701baddcf15acbd0a0ec1a24c131745383588f9678ae10f0f36bd1e7c945956","observation_id":"5524c3b6-67ba-4243-8f66-4d103a6aa05c","resolution":{"observed_at":"2026-08-15T21:07:49.666932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:49.653096Z","title":null,"venue":null,"work_id":"76b757f0-3f3a-4202-84d5-35556d1f905c","year":1999},"citing_paper":{"arxiv_id":"2505.10802","last_updated":"2025-05-16T02:43:05Z","snapshot_observed_at":"2026-08-16T18:03:59.728039Z","submitted_at":"2025-05-16T02:43:05Z","title":"Attention-Based Reward Shaping for Sparse and Delayed Rewards","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:49.555498Z"},"links":{"citing_paper":"/paper/2505.10802"},"observation_digest":"sha256:fe4eb77802cdf84cb2815ba851c5279bd976b9db59671e775ced58e274c5c7ba","observation_id":"06472bee-3fd0-4099-b961-ea3e146ed9d5","resolution":{"observed_at":"2026-08-15T21:07:49.656694Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:49.641879Z","title":"Todorov, T","venue":null,"work_id":"11a7bb76-6f2c-4e4d-813b-381c78ff4fa4","year":2012},"citing_paper":{"arxiv_id":"2505.10802","last_updated":"2025-05-16T02:43:05Z","snapshot_observed_at":"2026-08-16T18:03:59.728039Z","submitted_at":"2025-05-16T02:43:05Z","title":"Attention-Based Reward Shaping for Sparse and Delayed Rewards","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:49.558655Z"},"links":{"citing_paper":"/paper/2505.10802"},"observation_digest":"sha256:4769c98a03db97aba2921dccd580104a5e6f657f7c436a942fa61c0d7ecef34e","observation_id":"3bbf1987-a75b-4d83-acb1-f941441d2e94","resolution":{"observed_at":"2026-08-15T21:07:49.645456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:49.631934Z","title":"MuJoCo: Multi-Joint dynamics with Contact","venue":null,"work_id":"9ea46a2c-ee75-4689-ae1c-c0ccf829781f","year":2021},"citing_paper":{"arxiv_id":"2505.10802","last_updated":"2025-05-16T02:43:05Z","snapshot_observed_at":"2026-08-16T18:03:59.728039Z","submitted_at":"2025-05-16T02:43:05Z","title":"Attention-Based Reward Shaping for Sparse and Delayed Rewards","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:49.561638Z"},"links":{"citing_paper":"/paper/2505.10802"},"observation_digest":"sha256:bf0b52ad81ea3b2fb00dabbe0557ed005540fed490bf22f70e5ef9982a7d629b","observation_id":"ddb7f141-67c5-4a26-abc1-f965f3de74f0","resolution":{"observed_at":"2026-08-15T21:07:49.635373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.10802","last_updated":"2025-05-16T02:43:05Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T18:03:59.728039Z","submitted_at":"2025-05-16T02:43:05Z","title":"Attention-Based Reward Shaping for Sparse and Delayed Rewards"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":1,"verified_fuzzy":15},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 1 inbound Pith citation observation for arXiv:2505.10802."}