{"as_of":"2026-08-22T14:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e31b121cd7d0a49e93ffda04ce49349c77885a43e9b3218f68d39f6f9f8657c1","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T09:01:03.618498Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.30201/citation-record","integrity":"/paper/2605.30201/integrity","json":"/paper/2605.30201/citation-record.json","paper":"/paper/2605.30201"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":"Enhancing reinforcement learning with dense rewards from language model critic","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-18T22:00:46.464534Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:1dcf63443ed2af4ad4d7e3f1e1171fa286969084f60a3d19b7dc95f417848740","observation_id":"e39a9985-dd35-4723-b520-3d5480392985","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-18T22:00:46.464534Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:1124ee50361819884be235948935dc7184c12a137826ff2856ee6cd79e0dc3df","observation_id":"69caea79-9fe4-46ea-9d42-fd4eff773694","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":"Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-18T22:00:46.464534Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:a32d21f878f8578ddff263c7f64ed45353deb4a82c5acb1b370183b7df4aeeb5","observation_id":"611dcfd6-8825-4c0b-97a5-d13de040fd84","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":"DenseGRPO: From sparse to dense reward for flow matching model alignment","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-18T22:00:46.464534Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:125e4b354dc8f75bf3b08dfc0367fda12adff6bd240d009b49ad574e8547f99e","observation_id":"7d5d61ed-08a6-4266-9fb1-27a59694138a","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":"RAFT: Reward ranked finetuning for generative foundation model alignment.Transactions on Machine Learning Research, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-18T22:00:46.464534Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:fb7f7005956badd9d92661f51066ba2f443b07207da3ea85a5ce99e1bf9e2eed","observation_id":"39fc10bb-581c-4451-91b6-d2f5bce7668c","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":"Re- wardmap: Tackling sparse rewards in fine-grained visual reasoning via multi-stage reinforce- ment learning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-18T22:00:46.464534Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:9fdd01033678569d86a6e7c6c1a991dda07be547d03b2f7351fa2d837da21646","observation_id":"bab408fa-a595-4120-b294-c0ef882a71b7","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-18T22:00:46.464534Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:5504e4b042871be20b549cf94d02d4cd7daecf2b66fe035c5eb56182df27c3c3","observation_id":"aacf218f-d7d6-47a5-929d-39514e07cbd5","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":"Soft adaptive policy optimization, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-18T22:00:46.464534Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:e18ba2f01cc0e36ed335f9a5e04d96431dff7de0556740720d4a9100e07af49d","observation_id":"09a5a2da-c1e2-455c-84b2-a5f5cd768f49","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":"Rewarding the unlikely: Lifting grpo beyond distribution sharpening, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-18T22:00:46.464534Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:9e3b66d6d92490f3e36152b91ff54e6193b1833dc2bb945431b4acb400d7468f","observation_id":"bdf835ff-720b-4f43-ac3d-6abf490b13b4","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-08-13T15:28:29.238641Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":"2601.20802","doi":"10.48550/arxiv.2601.20802","metadata_source":"pith","pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning via Self-Distillation","venue":"cs.LG","work_id":"b193541d-5853-4ea4-8e4b-8e4c08617eb6","year":2026},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-18T22:00:46.464534Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:b091847a98e48abbfb7edb776b400878ea19b7691ce3597238a0d64894c097d5","observation_id":"1f0f7608-ec8c-4634-959c-e421be09efc5","resolution":{"observed_at":"2026-06-29T09:03:15.687060Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-05-21T06:23:12.649775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T06:23:12.649775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":"Understanding r1-zero-like training: A critical perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-18T22:00:46.464534Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:a5e422b1d0f932a64bcd93fc6f292296c8a3f7316f7c10c8a162b8a7fb79dc4b","observation_id":"a82861da-32fc-4f52-9bb3-d870baa9158a","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":"Hysteretic Q-Learning: An Algorithm for Decentralized Reinforcement Learning in Cooperative Multi-agent Teams","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-18T22:00:46.464534Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:35fb258eca7eb0c9d9929c05d5a07093f0104cd12639d0ecdfcec3a4ead6f307","observation_id":"90001c7c-6a19-4a2c-9d22-7af35690bd14","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-18T22:00:46.464534Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:032cf84a22e819565a55c1703cbfc9450903bf9c9c725851cbfb1a3dc574a2de","observation_id":"ee0fb757-c0d5-4099-b7ea-692ddbb5cc69","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":"Tinyzero","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-18T22:00:46.464534Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:68cee398836790dad58d95652b7ee5c69f90737e8f36b11b4c4a4bfb836d279e","observation_id":"f9c2ff86-5807-4dd2-867f-535ac000ceef","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-18T22:00:46.464534Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:10622e7d4ca4ff5ca020749738ac1988ef9b09a983ded5236950b9ea0137448f","observation_id":"79636ff0-2e79-4f0f-a5f1-4bf6fb3644df","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21974","last_updated":"2025-07-29T16:21:42Z","snapshot_observed_at":"2026-08-18T08:31:06.275152Z","submitted_at":"2025-07-29T16:21:42Z","title":"Reasoning Language Models for Root Cause Analysis in 5G Wireless Networks","version":1},"cited_work":{"arxiv_id":"2507.21974","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21974","snapshot_observed_at":"2026-06-29T09:03:15.685485Z","title":"Reasoning Language Models for Root Cause Analysis in 5G Wireless Networks.arXiv preprint arXiv:2507.21974, 2025","venue":null,"work_id":"f89c2bba-1e6a-4aff-b3f8-3f15e85c4b35","year":2025},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-18T22:00:46.464534Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"cited_paper":"/paper/2507.21974","citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:64f62d716a8d6aa6e529e8c76c84f3af33c87badd051af7663a65ae44e29e168","observation_id":"17f6492f-5404-4f03-9f86-2988ac74c19c","resolution":{"observed_at":"2026-06-29T09:03:15.687531Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-18T22:00:46.464534Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:ae0c4f27679b807b5f77df40e6232c758836d346cc701dfaf2bb0cd30bbc9d90","observation_id":"88713596-c662-4a69-bfc0-466991631b9e","resolution":{"observed_at":"2026-06-29T09:03:15.690088Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-18T22:00:46.464534Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:622fa8305174fd3138560d799cda9c33687ddfdba2a5284b50cba8a29aaee321","observation_id":"b576e0ec-3515-4803-9bf4-6852d2adfd61","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-18T22:00:46.464534Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:afaec6b7e0615a86e60975cca65c5870eb01a92b5e5a5d4f1e3e7d4b7eb3c798","observation_id":"4839da91-6396-4c61-a9ed-26222be91207","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-18T22:00:46.464534Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:6d7a53562153d515dc2023df82d2f051757aac93e4910686941fa287af1dccc7","observation_id":"f3b0af17-308b-461f-88e6-68848bae52c0","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":"Qwen3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-18T22:00:46.464534Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:2151c211632b186e48dcdd825d62663a86553bae7ee740ba1bef3beab88c6d44","observation_id":"3ad9e361-91c0-4369-aa80-4692c14bd898","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-18T22:00:46.464534Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:579486131693458e60f46675e82793024675fa35cf8f893e1a0a326ff4a988ff","observation_id":"29e2724e-02d8-4372-9a41-891c4beb1d01","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":"Group sequence policy optimization, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-18T22:00:46.464534Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:00ebae495f6b5ab4b82849edd4b84927af4fd7343040a88b6ca88ea137f566ef","observation_id":"ff42b07c-5c05-402d-a176-6895a276780d","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T22:00:46.464534Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2605.30201."}