{"as_of":"2026-08-16T08:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d21c3c2dc3632d1faf2f1c7d51cd463836e2c1f153f7e1162bf638baec922719","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:56:41.084268Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T12:19:34.840954Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-15T17:46:27.278738Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20150","snapshot_observed_at":"2026-08-03T12:19:34.840954Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.03525","last_updated":"2026-05-26T16:39:06Z","snapshot_observed_at":"2026-08-15T07:29:36.779987Z","submitted_at":"2026-01-07T02:29:49Z","title":"Beyond Binary: Turning Partial Success into Dense Verifiable Rewards for Reinforcement Learning in Code Generation","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-03T12:19:34.840954Z"},"links":{"cited_paper":"/paper/2507.20150","citing_paper":"/paper/2601.03525"},"observation_digest":"sha256:0f8c2f849d1ad5eb3e39f3a07caf72ce771bdf67cceec5f6fc6a3c3babed65c7","observation_id":"b86ffbcb-f091-4df2-8a86-c7aa1ba77b3b","resolution":{"observed_at":"2026-08-03T12:19:34.840954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.20150/citation-record","integrity":"/paper/2507.20150/integrity","json":"/paper/2507.20150/citation-record.json","paper":"/paper/2507.20150"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-15T06:09:25.789897Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-15T17:56:40.998568Z","title":"L1: Controlling how long a reasoning model thinks with reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-15T17:46:27.278738Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:40.998568Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:ba0ab99ce8e3faecba3f373fe3ef1cf1aa81930f4e972ff52d3e432398ed03e4","observation_id":"5a7b6546-5f47-4b35-ac84-a2438a216ce7","resolution":{"observed_at":"2026-08-15T17:56:40.998568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-15T17:56:41.008415Z","title":"Constitutional ai: Harmlessness from ai feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-15T17:46:27.278738Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.008415Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:d2841ca2267875f630096ea7d4e99255f55c8b42b71fb194435d96f91b814936","observation_id":"b1e01e78-4e71-473c-94a6-2deb1c3f5060","resolution":{"observed_at":"2026-08-15T17:56:41.008415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05776","last_updated":"2021-06-20T22:23:24Z","snapshot_observed_at":"2026-08-14T13:37:36.446325Z","submitted_at":"2021-02-10T23:31:53Z","title":"Defense Against Reward Poisoning Attacks in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05776","snapshot_observed_at":"2026-08-15T17:56:41.018945Z","title":"Defense against reward poisoning attacks in reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-15T17:46:27.278738Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.018945Z"},"links":{"cited_paper":"/paper/2102.05776","citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:59dc43affabef8f88b3292592a49bb057a2d3c7622d74bbff3f6b812c81e673a","observation_id":"ef49e7f3-9dab-4f2f-8752-72992aa824ae","resolution":{"observed_at":"2026-08-15T17:56:41.018945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-15T11:48:26.826304Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14810","snapshot_observed_at":"2026-08-15T17:56:41.028809Z","title":"Scaling reasoning, losing control: Evaluating instruction following in large reasoning models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-15T17:46:27.278738Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.028809Z"},"links":{"cited_paper":"/paper/2505.14810","citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:f54ce41e0ddb78e0b11369fd9f567e121ab0b82dc8dd103c19e74cc9961c5749","observation_id":"08201b88-4bc2-466f-99b0-7405c37ae0b0","resolution":{"observed_at":"2026-08-15T17:56:41.028809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-14T04:22:20.981738Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-15T17:56:41.033080Z","title":"Deliberative alignment: Reasoning enables safer language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-15T17:46:27.278738Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.033080Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:9d63f2b8d2772c70ab919d5f45ae8ac2e3e94a47726803877d8bc39011044e68","observation_id":"0fc187ff-f529-490d-ac32-1ed0bab4e3bd","resolution":{"observed_at":"2026-08-15T17:56:41.033080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-10T14:48:37.196526Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-15T17:56:41.062832Z","title":"Crossing the reward bridge: Expanding rl with verifiable rewards across diverse domains","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-15T17:46:27.278738Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.062832Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:0a58d03ab0cc6b1c8db287928830b5f92f9db5dbb352508644052c9274a97984","observation_id":"0ae26018-5913-4345-bf2f-319ccf727136","resolution":{"observed_at":"2026-08-15T17:56:41.062832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16419","last_updated":"2025-08-21T19:14:40Z","snapshot_observed_at":"2026-08-11T13:10:23.709172Z","submitted_at":"2025-03-20T17:59:38Z","title":"Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16419","snapshot_observed_at":"2026-08-15T17:56:41.067681Z","title":"Stop overthinking: A survey on efficient reasoning for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-15T17:46:27.278738Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.067681Z"},"links":{"cited_paper":"/paper/2503.16419","citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:af7110dde29a2274e2afacf0bdfb2cc11b30d7b606e48e230cebb47c257e48e2","observation_id":"00fe4cc6-6b70-4895-b35d-e92c2d86bd2c","resolution":{"observed_at":"2026-08-15T17:56:41.067681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-15T17:56:41.075895Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-15T17:46:27.278738Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.075895Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:2fb065a52218ac1ed10b891ef78021b4f90373dcbeb372c4c1ac8dc83581a257","observation_id":"803f4fed-0a88-4288-a3d0-ba591b2e511d","resolution":{"observed_at":"2026-08-15T17:56:41.075895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:56:41.487172Z","title":null,"venue":null,"work_id":"fcd07cae-ed39-4748-adc7-80ce2386347f","year":1998},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-15T17:46:27.278738Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.079766Z"},"links":{"citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:3c98720c767f5c77dcf9f005670cf20b153f5ff8865792ba1ea422ad1fd42e3d","observation_id":"5d513ce0-0a9e-4640-9569-6636b90a197a","resolution":{"observed_at":"2026-08-15T17:56:41.491657Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:56:41.471745Z","title":"spurious reasoning","venue":null,"work_id":"fada3032-da8d-4cf4-8498-1150a8b647c1","year":2025},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-15T17:46:27.278738Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.084268Z"},"links":{"citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:c2654b0562b51f4024ad1f22536f02437cdfcad63dd552ffc1495a3e501613cc","observation_id":"15b88e43-d525-4a12-8c13-5251498e696f","resolution":{"observed_at":"2026-08-15T17:56:41.477462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-08-08T22:33:20.124926Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09567","snapshot_observed_at":"2026-08-15T17:56:41.023330Z","title":"Towards reasoning era: A survey of long chain-of-thought for reasoning large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-15T17:46:27.278738Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":1963,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.023330Z"},"links":{"cited_paper":"/paper/2503.09567","citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:d39f95910d6ea781700752cf1fa7f0bb114ab65d3eacc2d97bad24485387e711","observation_id":"78913d69-3cbb-4bef-9023-1c2d92327ffc","resolution":{"observed_at":"2026-08-15T17:56:41.023330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:56:41.050554Z","title":"A survey of efficient reasoning for large reasoning models: Language, multimodality, and beyond","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-15T17:46:27.278738Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":2005,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.050554Z"},"links":{"citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:9d423d64cb073fe880f2596439529f803b8df57a216e881bfdaf2364ca73a7cc","observation_id":"d70c39aa-a11a-4a9d-816c-329a2cd21bb1","resolution":{"observed_at":"2026-08-15T17:56:41.050554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T17:56:41.054541Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-15T17:46:27.278738Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.054541Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:36d5911c7b990bfdc73cc95c64a0549188078cd550dc2651f99f8a53c5f06792","observation_id":"f50b2653-10c6-49bf-975f-081d70d6f876","resolution":{"observed_at":"2026-08-15T17:56:41.054541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-15T17:56:41.058636Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-15T17:46:27.278738Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.058636Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:039f20ba014de887bfafb6207276ea3606c41b31b14666cb92a8d200309843c8","observation_id":"4eb82b6c-d6ae-483f-bd21-7cc8eca0f49b","resolution":{"observed_at":"2026-08-15T17:56:41.058636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-08-12T12:08:23.520312Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11143","snapshot_observed_at":"2026-08-15T17:56:41.041784Z","title":"Openrlhf: An easy-to-use, scalable and high-performance rlhf framework","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-15T17:46:27.278738Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.041784Z"},"links":{"cited_paper":"/paper/2405.11143","citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:cafccdd0d4d7b94dcb4313f944b18918ed4e462d761d255bcd09877fdea716d5","observation_id":"6183f9fc-4be1-4bdf-953a-7cd4438515d7","resolution":{"observed_at":"2026-08-15T17:56:41.041784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20571","last_updated":"2025-10-24T10:02:36Z","snapshot_observed_at":"2026-08-15T17:20:54.840134Z","submitted_at":"2025-04-29T09:24:30Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20571","snapshot_observed_at":"2026-08-15T17:56:41.071930Z","title":"Chi, Samuel Miserendino, Johannes Heidecke, Tejal Patwardhan, and Dan Mossing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-15T17:46:27.278738Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.071930Z"},"links":{"cited_paper":"/paper/2504.20571","citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:91f22ed11da524f406cb5fbc9c4fd9d749ab86232f4377a6e1910d04c007c270","observation_id":"fd17ebcf-4b39-4eac-af62-47d1c12e5df4","resolution":{"observed_at":"2026-08-15T17:56:41.071930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11926","last_updated":"2025-03-14T23:50:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-14T23:50:34Z","title":"Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11926","snapshot_observed_at":"2026-08-15T17:56:41.014266Z","title":"Monitoring reasoning models for misbehavior and the risks of promoting obfuscation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-15T17:46:27.278738Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.014266Z"},"links":{"cited_paper":"/paper/2503.11926","citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:aa28291b7038ad76bc5f750c423149184b57fd31dd9612f4bb363c39803a2790","observation_id":"4c93f222-a987-42fb-b239-849d117f537f","resolution":{"observed_at":"2026-08-15T17:56:41.014266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-14T12:50:25.203482Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24871","snapshot_observed_at":"2026-08-15T17:56:41.046033Z","title":"Modomodo: Multi-domain data mixtures for multimodal llm reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-15T17:46:27.278738Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.046033Z"},"links":{"cited_paper":"/paper/2505.24871","citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:145ed9b4511d3e47ac6bd14a8015864bccb1b5fb8efdc33ff54ae5e0cfbfd652","observation_id":"0c63d43f-c85a-4e12-882d-bfe71776b201","resolution":{"observed_at":"2026-08-15T17:56:41.046033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T17:56:41.037293Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-15T17:46:27.278738Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.037293Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:fe31d886f2a405c453f1be57184247e2cb780d943c25d3f5a69a1ac9fd2605e7","observation_id":"3826fd40-049f-4b4b-bdde-f91ab48284b9","resolution":{"observed_at":"2026-08-15T17:56:41.037293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-15T17:56:41.003583Z","title":"Shuai Bai, Keqin Chen, Xuejing Liu, Jialin Wang, Wenbin Ge, Sibo Song, Kai Dang, Peng Wang, Shijie Wang, Jun Tang, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-15T17:46:27.278738Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.003583Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:a9bc552ec943641aec572f81059a49fbad39d57063b25a97299d29da018af037","observation_id":"fc062070-efd6-41d5-ba8a-75fbb2cef70e","resolution":{"observed_at":"2026-08-15T17:56:41.003583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-15T17:46:27.278738Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 1 inbound Pith citation observation for arXiv:2507.20150."}