{"as_of":"2026-08-12T14:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:abb1f62d52503d9a3075d9139a44ade658cc85a488b5deefb9439155ea49db87","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T07:34:57.251159Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.24833/citation-record","integrity":"/paper/2607.24833/integrity","json":"/paper/2607.24833/citation-record.json","paper":"/paper/2607.24833"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:52.667421Z","title":"2026 , note =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:52.667421Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:f29ad50b1453f44be3bf81ec39d36d16347ab0c2a4b2b92f2ecc927ba4e455ec","observation_id":"81b18e99-c7e4-4435-892c-76782d9ce4ee","resolution":{"observed_at":"2026-08-01T07:34:52.667421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:52.720900Z","title":"2025 , note =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:52.720900Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:c878109b24a23626c94bfe801ed7be0c9c7a4b3880c763f1a97559dd6c16dd6a","observation_id":"244961c9-8f48-4f6b-8f4c-cce26612c28c","resolution":{"observed_at":"2026-08-01T07:34:52.720900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:52.808847Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:52.808847Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:d02963cc666351911a4ec549ae5d74e0df98ef804f4b927ce790e5d6b8763b33","observation_id":"04b29a83-3f63-4861-b4e5-29a1d2c9d395","resolution":{"observed_at":"2026-08-01T07:34:52.808847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-01T07:34:52.905598Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:52.905598Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:31f8e919dcd46028c6241b3556d9fb268a1e5d2f205b026017220e935a2ffefa","observation_id":"ef391fe9-6136-4169-a24a-8f0556461d0b","resolution":{"observed_at":"2026-08-01T07:34:52.905598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:53.022906Z","title":"2024 , note =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:53.022906Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:4fd74b5595603f9d177dbc18b82863056a3a1fd78699c753b5e79958121f6472","observation_id":"6bacec8d-f120-4ce3-a2b7-db03af9e9a12","resolution":{"observed_at":"2026-08-01T07:34:53.022906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-01T07:34:53.089892Z","title":"arXiv preprint arXiv:1707.06347 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:53.089892Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:2f6f52b5688d435d6cba276c2ed8ff7c076a8c9702bcfdfc4b54fd8d9cbb4bbd","observation_id":"87a9d1a3-6d2d-4968-946a-4afa7233e0eb","resolution":{"observed_at":"2026-08-01T07:34:53.089892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:53.172408Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:53.172408Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:a9ea461beb413e3004e9c9aa4371911b653fc9f7e533dfa0ad3afa91b130d74b","observation_id":"4cd58a9d-cc36-4cf6-98aa-2e3635c3c67f","resolution":{"observed_at":"2026-08-01T07:34:53.172408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:53.287453Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:53.287453Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:321f6cfe549b9cbba7a23d0b55d56ca0db39436d720d184c02b2dcff77cf9a52","observation_id":"35971f69-dcd6-420b-b6df-2ec85b50d6cf","resolution":{"observed_at":"2026-08-01T07:34:53.287453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:53.352958Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:53.352958Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:a2e6918c658594a0d0f36878815129ece4c54afe58312baf5ac13b86fe6092c0","observation_id":"56b98f94-39ec-4418-b207-d4eaaeecbfb5","resolution":{"observed_at":"2026-08-01T07:34:53.352958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:53.462245Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:53.462245Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:2c6b5facf1beafd4d97bca56e73ce27bcdfa4b8b5c0dfe7b5d5a1b8a8d5c519c","observation_id":"03fce6f1-890c-438b-91ae-5704d09df196","resolution":{"observed_at":"2026-08-01T07:34:53.462245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:53.578840Z","title":", booktitle =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:53.578840Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:71bb5da9541cfe965212a80e88184575f7da403f3cfd2a74dd4b82f78c96948f","observation_id":"6a91bba5-0c5d-40b4-823a-56c3226fb3c6","resolution":{"observed_at":"2026-08-01T07:34:53.578840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:53.652970Z","title":", journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:53.652970Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:c1479b2d1f9b4cc160068573cd72c59e72ce059a0d03fa8eb1b0940747178acf","observation_id":"501596e3-1294-47b5-ae47-ff65e4dff05b","resolution":{"observed_at":"2026-08-01T07:34:53.652970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:53.721806Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:53.721806Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:5f9262e9168d412005282a92cccc95814b979e1a6e801d7426a76f16e16cd17a","observation_id":"ebb1ed94-b1b7-42a9-8472-a027ac6eb1e8","resolution":{"observed_at":"2026-08-01T07:34:53.721806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:53.842119Z","title":"and Zhang, Hao and Stoica, Ion , booktitle =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:53.842119Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:b96ca287d4da4d1ca23c29b53ff7941ec7d728ee793c2f489ee8a7b0183c7509","observation_id":"caa7f80d-8fa4-40ef-9fb1-2d1aef61493f","resolution":{"observed_at":"2026-08-01T07:34:53.842119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:53.929243Z","title":"2025 , note =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:53.929243Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:63973a37b184fd49a96062a6802f0f46c2b3c6126ba886ef4b42a845a4d9e0c3","observation_id":"1df552fc-4245-4de6-ab8b-e5cb5d41a851","resolution":{"observed_at":"2026-08-01T07:34:53.929243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:54.016895Z","title":"2023 , note =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:54.016895Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:be5930e1015fde5bca5da3fcab1ec7524c7f88c50b2c22f8d3a3df825b4bd984","observation_id":"ecadc99e-6b6c-40d1-b1cd-007ea25f2f97","resolution":{"observed_at":"2026-08-01T07:34:54.016895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:54.072903Z","title":"2024 , note =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:54.072903Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:f1bc6808b326cb703a67c7eee69a620b7883c7250c5679b605f6882d236b8c91","observation_id":"27bc778d-a9ab-4877-a035-5bc786942a90","resolution":{"observed_at":"2026-08-01T07:34:54.072903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:54.177432Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:54.177432Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:842a51a76565db84bfe74d292dd26d69cd9c2f050a00d31cf0f00da04424f543","observation_id":"5b691810-3838-4793-961b-6550e5a5eb06","resolution":{"observed_at":"2026-08-01T07:34:54.177432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:54.255689Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:54.255689Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:dfa7c2550f4485369f5a5a35f425baa773eff8a63f6109403aff7eb96abd3a8c","observation_id":"e7a4c51a-2945-45bc-a7bd-2a6e11a2109a","resolution":{"observed_at":"2026-08-01T07:34:54.255689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:54.337048Z","title":"International Conference on Machine Learning (ICML) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:54.337048Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:f59077e3dedfcd713347398b494fd45711fe453295d12efa73c01c403aa49546","observation_id":"8569224e-5a1b-4503-bc37-8c8a8ad3c12c","resolution":{"observed_at":"2026-08-01T07:34:54.337048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:54.455969Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:54.455969Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:da25112fa5ff603641eddc275c1851818add2562302781135520a594d661e3d6","observation_id":"a0fd8522-fee6-4c9a-b44e-29d9c7ae87e5","resolution":{"observed_at":"2026-08-01T07:34:54.455969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:54.537997Z","title":"Don't Tell the Answer, Truly Guide the Reasoning During","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:54.537997Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:d0b633be446606b41b94ee0004a54c7de9894f142e1a326756e5ce860b110a4a","observation_id":"7d5b5313-5282-441e-9b9e-0622dcf199e2","resolution":{"observed_at":"2026-08-01T07:34:54.537997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:54.601137Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:54.601137Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:7578d49f30173ae2eb03c9ad26cb91c4ce7cabdd798e75487880a16f43b0a5ee","observation_id":"8c9d8cfe-5ecc-4540-9d30-8741ced11c91","resolution":{"observed_at":"2026-08-01T07:34:54.601137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:54.701839Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:54.701839Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:083f46e033b96702d917c9e17670b9260e0ed63880136a0630a68230067f216d","observation_id":"45429833-a9ff-4208-938f-93cba4343624","resolution":{"observed_at":"2026-08-01T07:34:54.701839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-06T22:01:12.035442Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06923","snapshot_observed_at":"2026-08-01T07:34:54.765756Z","title":"arXiv preprint arXiv:2509.06923 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:54.765756Z"},"links":{"cited_paper":"/paper/2509.06923","citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:e27910b0fbd0fe29bc8cf3cacf078cbca9d63f8d6c7a7e0a769cf63d8cd07d71","observation_id":"26c06b32-36c7-43d3-ba09-8a252be4e03a","resolution":{"observed_at":"2026-08-01T07:34:54.765756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:54.942938Z","title":"Boosting","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:54.942938Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:6529bc06252020cf91473ad2cce44aa0806512d63ca85880006e791911730da5","observation_id":"b6635fc8-6287-485f-9f4f-f0b72cdaf244","resolution":{"observed_at":"2026-08-01T07:34:54.942938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:55.055430Z","title":"Train at Moving Edge: Online-Verified Prompt Selection for Efficient","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:55.055430Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:633d093887633a20af253378e916b6336d0b038bebe62fa4cb0109443f2d0011","observation_id":"3dfea157-c72a-4a0e-aaac-d803c40e3597","resolution":{"observed_at":"2026-08-01T07:34:55.055430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:55.112071Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:55.112071Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:576c06ddd2f8920da2bd375d0a555c7e1e36e4c58360060e262cfc862d2f724f","observation_id":"19fca2ce-0a71-4027-b71a-d83b82273fa7","resolution":{"observed_at":"2026-08-01T07:34:55.112071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:55.220532Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:55.220532Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:89262d58671f6a97da5e4facfbc9436b9190ec7f7b43e8e2a39212b9966acdcc","observation_id":"0733587a-51d5-43fe-bd4f-8fb3e44c8c28","resolution":{"observed_at":"2026-08-01T07:34:55.220532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:55.301544Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:55.301544Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:0c17500a1386e9cc0d28bb0837dacc8fddd9ed8f54e3e8bcd4b1b9dcbf5ebb52","observation_id":"6156148b-691e-451a-9ee1-c8ad2f6d81d7","resolution":{"observed_at":"2026-08-01T07:34:55.301544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:55.388018Z","title":"Measuring Mathematical Problem Solving With the","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:55.388018Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:9237b3fbe5bd6ef373a7ebae2a94045b8e174f0aa347b0a982d1aa93bb126b7a","observation_id":"c30af885-3f78-4ee6-8acf-9c45f11113fd","resolution":{"observed_at":"2026-08-01T07:34:55.388018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-01T07:34:55.532748Z","title":"arXiv preprint arXiv:2110.14168 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:55.532748Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:5fe5163de75c27753c4534080214f58a0728febda5cddd6976c776dcdea604d3","observation_id":"2172d4fc-2eaa-4f1a-bd87-a8cd7a30081e","resolution":{"observed_at":"2026-08-01T07:34:55.532748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:55.602336Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:55.602336Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:b009486b63052237fb8ace2feea33914b02ab37ce3def847107bfc3e87f619da","observation_id":"30538229-4d0d-43fc-8c6b-b9800ed7363b","resolution":{"observed_at":"2026-08-01T07:34:55.602336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:55.683543Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:55.683543Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:a7e89ed276fd7a302292bf8b01a95f4be6f03b6732412cc9f7a2249409fc8a2b","observation_id":"02d054e1-546e-4910-b105-ac5b7fbd7c13","resolution":{"observed_at":"2026-08-01T07:34:55.683543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:55.763796Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:55.763796Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:133ee15a2d0e48205a811b82f49a7dd25881cf21a777fa3ea79d4b77e594a388","observation_id":"036d2c91-1866-401b-bfe9-3eb6cbb782ba","resolution":{"observed_at":"2026-08-01T07:34:55.763796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:55.870328Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:55.870328Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:6de4ec7fb1ae31d494166faf9644bfdee0847e9d02f0ae70b864dc254fcaee99","observation_id":"d372dc61-e76c-4364-9a82-5502f9bf78b9","resolution":{"observed_at":"2026-08-01T07:34:55.870328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:55.960507Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:55.960507Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:f4999b9caa12122654404f5f1c1551760e7f03cc51bccb4fc8d185e0201095e8","observation_id":"72e1f0de-0a34-46c2-a54b-8f58af08b9a5","resolution":{"observed_at":"2026-08-01T07:34:55.960507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:56.046520Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:56.046520Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:0df50e02a735da6dccdb9b8a6cc97542b4108a30325e5add2d79ddf4300cf71a","observation_id":"0b6b5067-8c38-4037-b5e7-595390f58244","resolution":{"observed_at":"2026-08-01T07:34:56.046520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:56.122271Z","title":"Back to Basics: Revisiting","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:56.122271Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:bfa96fafb889f36ef2013607d833f0fb4b1179bdba09406ac5c08af23d119d9b","observation_id":"c956bc34-fda9-4db0-b9a6-724bbd67aa86","resolution":{"observed_at":"2026-08-01T07:34:56.122271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:56.231813Z","title":"2024 , note =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:56.231813Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:76bec40b094ab53bfb7053b921c5ebd7adc0b66b92d076cb553f3a6771bef291","observation_id":"53302985-149c-4556-896b-0afd4b18c722","resolution":{"observed_at":"2026-08-01T07:34:56.231813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:56.376887Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:56.376887Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:e0d38662272732f721ec68d60a67d8488ac16cfe913e85449fd393ec62085851","observation_id":"897bbd8e-ef9a-4d1b-a8bc-958357b59bb2","resolution":{"observed_at":"2026-08-01T07:34:56.376887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:56.525374Z","title":"Reinforced Self-Training (","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:56.525374Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:9cfaf70844b6d814c06978483b19eef2a2cdc99de3b9cd3e50d6d291d642c55d","observation_id":"1535bde9-33fa-4139-9187-8d966b499f80","resolution":{"observed_at":"2026-08-01T07:34:56.525374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:56.646520Z","title":"Transactions on Machine Learning Research (TMLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:56.646520Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:0a8c943233fd64cd0a98b18b51f7b0c9b6031e8b04bda73cbac6eecc7498794f","observation_id":"2a60d578-c1c2-4792-8300-0387304d60ce","resolution":{"observed_at":"2026-08-01T07:34:56.646520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-10T12:58:47.242770Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-01T07:34:56.790463Z","title":"arXiv preprint arXiv:2403.04642 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:56.790463Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:a8fe3d384d8bc63deece30874faa6888e46510c15672d18aaece1c600d0a492a","observation_id":"46f0c937-c1c1-42b7-b42e-7b9169cd431c","resolution":{"observed_at":"2026-08-01T07:34:56.790463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:56.971940Z","title":"2016 , note =","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:56.971940Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:a5e48400b11a29ff9300be53564b5475ee1c3d5e4944aa91ad2d65bbaf32638e","observation_id":"389b8b2e-45e0-4354-bbc4-4edca3600dab","resolution":{"observed_at":"2026-08-01T07:34:56.971940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:57.087681Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:57.087681Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:967ade75e79b51a2086c5ca6441b448d15399c243c453d3892a5dc6809976ccf","observation_id":"b79782fc-1867-4cda-847b-521e8cb4e170","resolution":{"observed_at":"2026-08-01T07:34:57.087681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-01T07:34:57.162319Z","title":"arXiv preprint arXiv:2107.03374 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:57.162319Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:a77c2b94e87f4d2329cd7f7ed134edfb2f8333c230cd3e84d0e8c30f7bcf40cf","observation_id":"294c8b0e-9dfd-4cb3-8a34-8b5fa2165ff2","resolution":{"observed_at":"2026-08-01T07:34:57.162319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:57.251159Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:57.251159Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:1261e8ced7ca35447c2fc5dd7d3c3b48f957b0ae8f159544db407c62379447a2","observation_id":"f533e7ed-2f38-4c6f-8b49-9056c522fab1","resolution":{"observed_at":"2026-08-01T07:34:57.251159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-11T22:56:39.123446Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2607.24833."}