{"as_of":"2026-08-19T09:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a6618a4735fe2ddb4b9ddab2b50c9d0fc727a95980e198055ea12e25a92deb45","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:40:11.565215Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:59:50.092283Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T04:59:51.529424Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.07755","last_updated":"2025-01-13T23:56:24Z","snapshot_observed_at":"2026-08-13T06:02:04.619695Z","submitted_at":"2025-01-13T23:56:24Z","title":"Performance Optimization of Ratings-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2501.07755","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.07755","snapshot_observed_at":"2026-08-07T04:59:51.529424Z","title":"Performance Optimization of Ratings-Based Reinforcement Learning","venue":"cs.LG","work_id":"bccf6c6f-fa1b-4948-a64d-2ce11f060b94","year":2025},"citing_paper":{"arxiv_id":"2506.09183","last_updated":"2025-06-17T19:12:50Z","snapshot_observed_at":"2026-08-18T21:55:25.604355Z","submitted_at":"2025-06-10T19:00:19Z","title":"Multi-Task Reward Learning from Human Ratings","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:50.092283Z"},"links":{"cited_paper":"/paper/2501.07755","citing_paper":"/paper/2506.09183"},"observation_digest":"sha256:1019c9da5293bf44c6ada7f5449388e9023e9f34dc1d281f755f6c8b1133438b","observation_id":"198b248d-6de3-42a4-93d3-e0d195550c7f","resolution":{"observed_at":"2026-08-07T04:59:51.596559Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.07755/citation-record","integrity":"/paper/2501.07755/integrity","json":"/paper/2501.07755/citation-record.json","paper":"/paper/2501.07755"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2003.13350","last_updated":"2020-03-30T11:33:16Z","snapshot_observed_at":"2026-08-10T08:09:15.088271Z","submitted_at":"2020-03-30T11:33:16Z","title":"Agent57: Outperforming the Atari Human Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.13350","snapshot_observed_at":"2026-08-10T20:40:11.481193Z","title":"P.; Piot, B.; Kapturowski, S.; Sprechmann, P.; Vitvitskyi, A.; Guo, D.; and Blundell, C","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.07755","last_updated":"2025-01-13T23:56:24Z","snapshot_observed_at":"2026-08-13T06:02:04.619695Z","submitted_at":"2025-01-13T23:56:24Z","title":"Performance Optimization of Ratings-Based Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T20:40:11.481193Z"},"links":{"cited_paper":"/paper/2003.13350","citing_paper":"/paper/2501.07755"},"observation_digest":"sha256:05601a914d43e5872c68a7600c462ba5bfa15dca2cee61f96cbff4b27598d86e","observation_id":"2e14325e-0f9e-4519-b762-d45702d5e5fa","resolution":{"observed_at":"2026-08-10T20:40:11.481193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:40:11.837144Z","title":null,"venue":null,"work_id":"ece1da00-7e5b-472b-b52e-81ae45dea47e","year":2011},"citing_paper":{"arxiv_id":"2501.07755","last_updated":"2025-01-13T23:56:24Z","snapshot_observed_at":"2026-08-13T06:02:04.619695Z","submitted_at":"2025-01-13T23:56:24Z","title":"Performance Optimization of Ratings-Based Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T20:40:11.486158Z"},"links":{"citing_paper":"/paper/2501.07755"},"observation_digest":"sha256:938e9ca4ed53b42696e45a6d425be8e737c103078e570f9bccdcd1634bc92f32","observation_id":"744c028b-0a69-4661-b68e-880abb38bbe7","resolution":{"observed_at":"2026-08-10T20:40:11.841478Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:40:11.490169Z","title":"F.; Leike, J.; Brown, T.; Martic, M.; Legg, S.; and Amodei, D","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.07755","last_updated":"2025-01-13T23:56:24Z","snapshot_observed_at":"2026-08-13T06:02:04.619695Z","submitted_at":"2025-01-13T23:56:24Z","title":"Performance Optimization of Ratings-Based Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T20:40:11.490169Z"},"links":{"citing_paper":"/paper/2501.07755"},"observation_digest":"sha256:24a3243f52e78672c3c37949a330d37e6a1cd61b85282d241c952a69cd1f9875","observation_id":"52b88e9c-9b94-451d-b4e2-f47a3ca5b1c4","resolution":{"observed_at":"2026-08-10T20:40:11.490169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.14545","last_updated":"2022-06-28T04:13:53Z","snapshot_observed_at":"2026-08-18T05:50:54.233206Z","submitted_at":"2021-09-29T16:41:19Z","title":"Activation Functions in Deep Learning: A Comprehensive Survey and Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.14545","snapshot_observed_at":"2026-08-10T20:40:11.494329Z","title":"R.; Singh, S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07755","last_updated":"2025-01-13T23:56:24Z","snapshot_observed_at":"2026-08-13T06:02:04.619695Z","submitted_at":"2025-01-13T23:56:24Z","title":"Performance Optimization of Ratings-Based Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T20:40:11.494329Z"},"links":{"cited_paper":"/paper/2109.14545","citing_paper":"/paper/2501.07755"},"observation_digest":"sha256:1edeebb0e90f955d89fb1d4452e241c2559c08a471c36fb40c45fb2a53dafaf9","observation_id":"48c8d32f-7867-4ca9-9e95-242ec330554d","resolution":{"observed_at":"2026-08-10T20:40:11.494329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:40:11.814833Z","title":null,"venue":null,"work_id":"1f997398-45c3-4333-a8d5-1575f1e74bfa","year":2016},"citing_paper":{"arxiv_id":"2501.07755","last_updated":"2025-01-13T23:56:24Z","snapshot_observed_at":"2026-08-13T06:02:04.619695Z","submitted_at":"2025-01-13T23:56:24Z","title":"Performance Optimization of Ratings-Based Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T20:40:11.498866Z"},"links":{"citing_paper":"/paper/2501.07755"},"observation_digest":"sha256:15c91d40251842c104a73a9ef20f21347db363ac27b93e9c9d04a493ff326938","observation_id":"30fcdbf7-88b1-4d0c-89d3-cb7d82514cfc","resolution":{"observed_at":"2026-08-10T20:40:11.819176Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.03026","last_updated":"2021-11-04T17:32:06Z","snapshot_observed_at":"2026-08-16T17:43:58.206905Z","submitted_at":"2021-11-04T17:32:06Z","title":"B-Pref: Benchmarking Preference-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.03026","snapshot_observed_at":"2026-08-10T20:40:11.503146Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.07755","last_updated":"2025-01-13T23:56:24Z","snapshot_observed_at":"2026-08-13T06:02:04.619695Z","submitted_at":"2025-01-13T23:56:24Z","title":"Performance Optimization of Ratings-Based Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T20:40:11.503146Z"},"links":{"cited_paper":"/paper/2111.03026","citing_paper":"/paper/2501.07755"},"observation_digest":"sha256:d1c67fa8a095c39f828ff70e003abd719f694a4d34372873f1877844e3e03272","observation_id":"2d161150-d572-4476-80d5-73a31a3f35e3","resolution":{"observed_at":"2026-08-10T20:40:11.503146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:40:11.800869Z","title":null,"venue":null,"work_id":"1ad69c19-8351-4879-a6bc-4f04c8d072e0","year":2011},"citing_paper":{"arxiv_id":"2501.07755","last_updated":"2025-01-13T23:56:24Z","snapshot_observed_at":"2026-08-13T06:02:04.619695Z","submitted_at":"2025-01-13T23:56:24Z","title":"Performance Optimization of Ratings-Based Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T20:40:11.508840Z"},"links":{"citing_paper":"/paper/2501.07755"},"observation_digest":"sha256:0e7a15e93fbf5cfe5f3d81dc8a038351f85435747c459c3e28e076c0ee6bffe0","observation_id":"3a26f077-8a32-4279-8be7-74a0068d1892","resolution":{"observed_at":"2026-08-10T20:40:11.805269Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-10T20:40:11.513684Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.07755","last_updated":"2025-01-13T23:56:24Z","snapshot_observed_at":"2026-08-13T06:02:04.619695Z","submitted_at":"2025-01-13T23:56:24Z","title":"Performance Optimization of Ratings-Based Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T20:40:11.513684Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2501.07755"},"observation_digest":"sha256:8108eb4a0411b2a0708ee68c5555b7ec02d8951fbeade6bb63c73183d0b77f0f","observation_id":"c61b0677-ef68-4e40-9d4e-8968334407c1","resolution":{"observed_at":"2026-08-10T20:40:11.513684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:40:11.786609Z","title":"Y.; Russell, S","venue":null,"work_id":"9c59d41d-dfd5-4d56-bd6b-43ed4164f102","year":2000},"citing_paper":{"arxiv_id":"2501.07755","last_updated":"2025-01-13T23:56:24Z","snapshot_observed_at":"2026-08-13T06:02:04.619695Z","submitted_at":"2025-01-13T23:56:24Z","title":"Performance Optimization of Ratings-Based Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T20:40:11.518411Z"},"links":{"citing_paper":"/paper/2501.07755"},"observation_digest":"sha256:1a9a99eec607c08900a74a22652fd91937a2ebb7872713c3e39e2255989e33fe","observation_id":"14a7a304-0416-48c5-83c7-b67e613e19a2","resolution":{"observed_at":"2026-08-10T20:40:11.791462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-10T20:40:11.523222Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.07755","last_updated":"2025-01-13T23:56:24Z","snapshot_observed_at":"2026-08-13T06:02:04.619695Z","submitted_at":"2025-01-13T23:56:24Z","title":"Performance Optimization of Ratings-Based Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T20:40:11.523222Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2501.07755"},"observation_digest":"sha256:1735f845b868c4b46841fc365b6cbd968cc72ac17255d06b77c55577f17f4367","observation_id":"a5c42e4e-cdb1-4573-a1f1-6f1cdbdf04b1","resolution":{"observed_at":"2026-08-10T20:40:11.523222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:40:11.773228Z","title":"I.; and Kashif, F","venue":null,"work_id":"85468652-a74e-477a-b111-b93a4ebb3709","year":2006},"citing_paper":{"arxiv_id":"2501.07755","last_updated":"2025-01-13T23:56:24Z","snapshot_observed_at":"2026-08-13T06:02:04.619695Z","submitted_at":"2025-01-13T23:56:24Z","title":"Performance Optimization of Ratings-Based Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T20:40:11.528309Z"},"links":{"citing_paper":"/paper/2501.07755"},"observation_digest":"sha256:8626f5949c28fb866ab16c19b76f89bf2ff481d11bfd16b414824a1a031085f0","observation_id":"0affd4da-57dc-466e-b54c-2732e2957c3c","resolution":{"observed_at":"2026-08-10T20:40:11.777195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:40:11.759265Z","title":null,"venue":null,"work_id":"02d8fe31-b095-44f6-b7e3-58c6f88c5f9c","year":2014},"citing_paper":{"arxiv_id":"2501.07755","last_updated":"2025-01-13T23:56:24Z","snapshot_observed_at":"2026-08-13T06:02:04.619695Z","submitted_at":"2025-01-13T23:56:24Z","title":"Performance Optimization of Ratings-Based Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T20:40:11.533234Z"},"links":{"citing_paper":"/paper/2501.07755"},"observation_digest":"sha256:73213e757006c73cd6c427961b23f7128e3a0d76e2dc17fd9a0af99982bd6130","observation_id":"471b4842-f474-4ab4-b0ae-fe774862b4ac","resolution":{"observed_at":"2026-08-10T20:40:11.763689Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:40:11.744868Z","title":null,"venue":null,"work_id":"19ffc563-b72a-46ad-8621-0b083aea0482","year":2022},"citing_paper":{"arxiv_id":"2501.07755","last_updated":"2025-01-13T23:56:24Z","snapshot_observed_at":"2026-08-13T06:02:04.619695Z","submitted_at":"2025-01-13T23:56:24Z","title":"Performance Optimization of Ratings-Based Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T20:40:11.537826Z"},"links":{"citing_paper":"/paper/2501.07755"},"observation_digest":"sha256:1ec6c117e5eb78bee8cf6186fbf4ebe8f62a3ebfb557e9acbf95e0ef688c19aa","observation_id":"b3e105d3-6fe1-49d4-b27a-5fee52ea17c3","resolution":{"observed_at":"2026-08-10T20:40:11.749548Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03539","last_updated":"2024-09-16T15:41:05Z","snapshot_observed_at":"2026-08-16T13:28:04.211521Z","submitted_at":"2024-08-07T04:35:38Z","title":"Deep Reinforcement Learning for Robotics: A Survey of Real-World Successes","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03539","snapshot_observed_at":"2026-08-10T20:40:11.542400Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07755","last_updated":"2025-01-13T23:56:24Z","snapshot_observed_at":"2026-08-13T06:02:04.619695Z","submitted_at":"2025-01-13T23:56:24Z","title":"Performance Optimization of Ratings-Based Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T20:40:11.542400Z"},"links":{"cited_paper":"/paper/2408.03539","citing_paper":"/paper/2501.07755"},"observation_digest":"sha256:d1949be9586e7f27a2820184a740865f9a3daa478cb37adae6dd1e0f13714f06","observation_id":"8f3f9179-5345-44d3-a094-fe598652c8c0","resolution":{"observed_at":"2026-08-10T20:40:11.542400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:40:11.730138Z","title":"J.; Waytowich, N.; and Cao, Y","venue":null,"work_id":"37f1c93f-23f8-4ce0-89cf-d7cfb39afead","year":2024},"citing_paper":{"arxiv_id":"2501.07755","last_updated":"2025-01-13T23:56:24Z","snapshot_observed_at":"2026-08-13T06:02:04.619695Z","submitted_at":"2025-01-13T23:56:24Z","title":"Performance Optimization of Ratings-Based Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T20:40:11.547057Z"},"links":{"citing_paper":"/paper/2501.07755"},"observation_digest":"sha256:09d2e325c61d69f66d196c69e2203831b6696ab53f9c62810a8ba0adb3cb4062","observation_id":"c19ae490-dde3-42ff-b0ee-6cc1f0142991","resolution":{"observed_at":"2026-08-10T20:40:11.735069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.06477","last_updated":"2019-10-26T20:45:08Z","snapshot_observed_at":"2026-08-18T19:00:01.178842Z","submitted_at":"2019-08-18T16:58:52Z","title":"Demystifying Learning Rate Policies for High Accuracy Training of Deep Neural Networks","version":2},"cited_work":{"arxiv_id":"1908.06477","doi":null,"metadata_source":"pith","pith_arxiv_id":"1908.06477","snapshot_observed_at":"2026-08-10T20:40:11.599214Z","title":"Demystifying Learning Rate Policies for High Accuracy Training of Deep Neural Networks","venue":"cs.LG","work_id":"e8307b4a-490b-4bad-ae24-5dbb246ed64e","year":2019},"citing_paper":{"arxiv_id":"2501.07755","last_updated":"2025-01-13T23:56:24Z","snapshot_observed_at":"2026-08-13T06:02:04.619695Z","submitted_at":"2025-01-13T23:56:24Z","title":"Performance Optimization of Ratings-Based Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T20:40:11.551559Z"},"links":{"cited_paper":"/paper/1908.06477","citing_paper":"/paper/2501.07755"},"observation_digest":"sha256:5422846649f4a350718f868b9a36f2238d24d3c25d5bba40aec5c7240c3d700d","observation_id":"c5d34811-a011-4313-ace6-0c3bd96c73e0","resolution":{"observed_at":"2026-08-10T20:40:11.606335Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:40:11.711368Z","title":"D.; Maas, A.; Bagnell, J","venue":null,"work_id":"1b3aa2cf-6f9b-4d89-9277-d9b7b7fa6647","year":2008},"citing_paper":{"arxiv_id":"2501.07755","last_updated":"2025-01-13T23:56:24Z","snapshot_observed_at":"2026-08-13T06:02:04.619695Z","submitted_at":"2025-01-13T23:56:24Z","title":"Performance Optimization of Ratings-Based Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T20:40:11.556096Z"},"links":{"citing_paper":"/paper/2501.07755"},"observation_digest":"sha256:26ad03a52d1e861e32fffc95e2536cb70fd7759776084266eac611d8f103e0e3","observation_id":"ce75a339-4f0a-456e-b447-15176c87fa94","resolution":{"observed_at":"2026-08-10T20:40:11.719690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:40:11.560318Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.07755","last_updated":"2025-01-13T23:56:24Z","snapshot_observed_at":"2026-08-13T06:02:04.619695Z","submitted_at":"2025-01-13T23:56:24Z","title":"Performance Optimization of Ratings-Based Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T20:40:11.560318Z"},"links":{"citing_paper":"/paper/2501.07755"},"observation_digest":"sha256:e7ebf63fc8b22ba03d5fe340bdbe5e0538559db0772c302d805a1947a33defc5","observation_id":"097a20d8-e4f7-4942-87a4-8fae3024bb0b","resolution":{"observed_at":"2026-08-10T20:40:11.560318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:40:11.565215Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.07755","last_updated":"2025-01-13T23:56:24Z","snapshot_observed_at":"2026-08-13T06:02:04.619695Z","submitted_at":"2025-01-13T23:56:24Z","title":"Performance Optimization of Ratings-Based Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T20:40:11.565215Z"},"links":{"citing_paper":"/paper/2501.07755"},"observation_digest":"sha256:cb0dd8b761ef971e59d02674f07e0238e016175b83e05d329184914d83e4db2d","observation_id":"8008686b-5ef9-42d7-b7e9-f41124a21d3f","resolution":{"observed_at":"2026-08-10T20:40:11.565215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.07755","last_updated":"2025-01-13T23:56:24Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T06:02:04.619695Z","submitted_at":"2025-01-13T23:56:24Z","title":"Performance Optimization of Ratings-Based Reinforcement Learning"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 1 inbound Pith citation observation for arXiv:2501.07755."}