{"as_of":"2026-08-09T22:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ff61e0999a446cb3420bffe9952f974ef92dc17eb6c83f6efc1fbc98b81a3f9b","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:31:28.767651Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.15844/citation-record","integrity":"/paper/2507.15844/integrity","json":"/paper/2507.15844/citation-record.json","paper":"/paper/2507.15844"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-06T08:53:09.095000Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-06T15:31:26.600626Z","title":"L1: controlling how long A reasoning model thinks with reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-08T23:54:30.672141Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:26.600626Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:c00ece7c3655eb77e9e6b61aa4c464b2f370e96d6df6477ab8a33d23401fc531","observation_id":"282d0983-76a0-4e7d-9269-597ef0fabc77","resolution":{"observed_at":"2026-08-06T15:31:26.600626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:31:26.692180Z","title":"URL https://doi.org/10","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-08T23:54:30.672141Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:26.692180Z"},"links":{"citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:234697fc2cfa1033d2e462e2527294c5bbb21de863e436e0f913799140e21ace","observation_id":"bc1f98b9-2226-48e4-a27a-b217e678a2d8","resolution":{"observed_at":"2026-08-06T15:31:26.692180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-08-08T22:33:20.124926Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09567","snapshot_observed_at":"2026-08-06T15:31:26.868293Z","title":"URLhttps://doi.org/10.48550/arXiv.2503.09567","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-08T23:54:30.672141Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:26.868293Z"},"links":{"cited_paper":"/paper/2503.09567","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:c4225695f58f43129187b104960f87d899aa292217164c08bba8e76e5f8b531a","observation_id":"2a4f7ba3-08d8-4a34-9586-a2519ef98720","resolution":{"observed_at":"2026-08-06T15:31:26.868293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T15:31:27.319209Z","title":"URL https://doi.org/ 10.48550/arXiv.2501.12948","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-08T23:54:30.672141Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:27.319209Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:2e9a7fd80a05421785249a097402e1cf9fa55b2b8b7aa7f0f9ea18fb22a97942","observation_id":"4fc7dd44-8184-4f22-b1a9-b918be534d1f","resolution":{"observed_at":"2026-08-06T15:31:27.319209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13379","last_updated":"2025-06-26T14:06:49Z","snapshot_observed_at":"2026-08-08T22:27:57.440955Z","submitted_at":"2025-05-19T17:24:16Z","title":"Thinkless: LLM Learns When to Think","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13379","snapshot_observed_at":"2026-08-06T15:31:27.442287Z","title":"URL https://doi.org/10","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-08T23:54:30.672141Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:27.442287Z"},"links":{"cited_paper":"/paper/2505.13379","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:bc53e8499fde40bf7a3eb76d8fa91b842fc1ddbf5c1100a3a3edd7d2bc018031","observation_id":"6c0aaae6-8018-48ee-8579-0d863a965da8","resolution":{"observed_at":"2026-08-06T15:31:27.442287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01296","last_updated":"2025-04-02T01:59:26Z","snapshot_observed_at":"2026-07-30T08:40:23.849282Z","submitted_at":"2025-04-02T01:59:26Z","title":"ThinkPrune: Pruning Long Chain-of-Thought of LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01296","snapshot_observed_at":"2026-08-06T15:31:27.609818Z","title":"Thinkprune: Pruning long chain-of-thought of llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-08T23:54:30.672141Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:27.609818Z"},"links":{"cited_paper":"/paper/2504.01296","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:f6219a35ea172c8bf26097a9a55bf8347e81c23a6677c42ce32a2cfc657d0ee9","observation_id":"87229f48-e3d9-4439-b38f-18c0427e85b8","resolution":{"observed_at":"2026-08-06T15:31:27.609818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01296","last_updated":"2025-04-02T01:59:26Z","snapshot_observed_at":"2026-07-30T08:40:23.849282Z","submitted_at":"2025-04-02T01:59:26Z","title":"ThinkPrune: Pruning Long Chain-of-Thought of LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01296","snapshot_observed_at":"2026-08-06T15:31:27.748148Z","title":"URL https://doi.org/10","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-08T23:54:30.672141Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:27.748148Z"},"links":{"cited_paper":"/paper/2504.01296","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:f9baf1b32d2cdbfe3b51f005bb379531899f050e4c64568f66de660c60203f0d","observation_id":"d8c3f112-3400-466c-8a33-b1f78825ba81","resolution":{"observed_at":"2026-08-06T15:31:27.748148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:31:27.958656Z","title":"URLhttps://doi.org/10.48550/arXiv.2505.11225","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-08T23:54:30.672141Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:27.958656Z"},"links":{"citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:f0f5f9b5597816ee7b4d250064190120c187552ca33c6c3c902102cacc25b9ef","observation_id":"c534d5d1-4d77-4b2e-b298-c0cf235de80c","resolution":{"observed_at":"2026-08-06T15:31:27.958656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14631","last_updated":"2025-05-21T05:17:34Z","snapshot_observed_at":"2026-08-07T15:28:58.246731Z","submitted_at":"2025-05-20T17:23:25Z","title":"Think Only When You Need with Large Hybrid-Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14631","snapshot_observed_at":"2026-08-06T15:31:28.102020Z","title":"URL https:// doi.org/10.48550/arXiv.2505.14631","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-08T23:54:30.672141Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:28.102020Z"},"links":{"cited_paper":"/paper/2505.14631","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:771fce67f886813ffc508dfa983a2fd0b85a394dcb9298cd364c9f275e99a766","observation_id":"e0714b9d-f4a4-46c2-9aee-ba6de4f8bcca","resolution":{"observed_at":"2026-08-06T15:31:28.102020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11274","last_updated":"2026-04-17T08:29:27Z","snapshot_observed_at":"2026-07-06T21:25:03.247284Z","submitted_at":"2025-05-16T14:08:04Z","title":"SelfBudgeter: Adaptive Token Allocation for Efficient LLM Reasoning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11274","snapshot_observed_at":"2026-08-06T15:31:28.228889Z","title":"2505.11274","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-08T23:54:30.672141Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:28.228889Z"},"links":{"cited_paper":"/paper/2505.11274","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:7823898b7fafe22c64c2979deacee92cfd022e5aacd63388ffacb96d7a5a3f1c","observation_id":"02bf1114-67cd-4d06-8c9d-f67a7d202e2f","resolution":{"observed_at":"2026-08-06T15:31:28.228889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14183","last_updated":"2025-05-20T10:40:41Z","snapshot_observed_at":"2026-08-08T22:58:06.185935Z","submitted_at":"2025-05-20T10:40:41Z","title":"ThinkSwitcher: When to Think Hard, When to Think Fast","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14183","snapshot_observed_at":"2026-08-06T15:31:28.312222Z","title":"URL https://doi.org/10.48550/arXiv.2505.14183","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-08T23:54:30.672141Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:28.312222Z"},"links":{"cited_paper":"/paper/2505.14183","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:64a688dc0c3bdcbb7278c0fb0a9f9fbaafe81c4b5a7d8be5315551bc1ec418c0","observation_id":"3754db1e-dab9-47d9-9389-9b7d56f7f4d3","resolution":{"observed_at":"2026-08-06T15:31:28.312222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11896","last_updated":"2025-05-25T13:39:29Z","snapshot_observed_at":"2026-08-07T15:44:24.427443Z","submitted_at":"2025-05-17T08:27:00Z","title":"AdaCoT: Pareto-Optimal Adaptive Chain-of-Thought Triggering via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11896","snapshot_observed_at":"2026-08-06T15:31:28.441783Z","title":"URL https://doi.org/10.48550/arXiv.2505.11896","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-08T23:54:30.672141Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:28.441783Z"},"links":{"cited_paper":"/paper/2505.11896","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:dbfe7f23ea2a30099e34c72e23ba4e95ab90f58ebc810b64cc2ae6bf861cb568","observation_id":"06e9ff18-fa4c-457d-ab68-213df15f9805","resolution":{"observed_at":"2026-08-06T15:31:28.441783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09858","last_updated":"2025-04-14T04:08:16Z","snapshot_observed_at":"2026-08-08T01:06:59.135762Z","submitted_at":"2025-04-14T04:08:16Z","title":"Reasoning Models Can Be Effective Without Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09858","snapshot_observed_at":"2026-08-06T15:31:28.526529Z","title":"Wenjie Ma, Jingxuan He, Charlie Snell, Tyler Griggs, Sewon Min, and Matei Zaharia","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-08T23:54:30.672141Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:28.526529Z"},"links":{"cited_paper":"/paper/2504.09858","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:3f356f75f169f17b2e6bdb74499c0488f000dd7614c23c5aa5d39c80f26708ec","observation_id":"8c52a92a-bdbe-41f5-8298-c7fb10f3f786","resolution":{"observed_at":"2026-08-06T15:31:28.526529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09858","last_updated":"2025-04-14T04:08:16Z","snapshot_observed_at":"2026-08-08T01:06:59.135762Z","submitted_at":"2025-04-14T04:08:16Z","title":"Reasoning Models Can Be Effective Without Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09858","snapshot_observed_at":"2026-08-06T15:31:28.578878Z","title":"2504.09858","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-08T23:54:30.672141Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:28.578878Z"},"links":{"cited_paper":"/paper/2504.09858","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:09e27ce87951f4f1128e1875858ca9c286af4c444c20f8d376a9018c9d8ab186","observation_id":"040d2d23-8868-452a-8f41-466916fccb9b","resolution":{"observed_at":"2026-08-06T15:31:28.578878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09413","last_updated":"2024-12-22T10:44:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-12T16:20:36Z","title":"Imitate, Explore, and Self-Improve: A Reproduction Report on Slow-thinking Reasoning Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09413","snapshot_observed_at":"2026-08-06T15:31:28.703711Z","title":"URL https: //doi.org/10.48550/arXiv.2412.09413","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-08T23:54:30.672141Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:28.703711Z"},"links":{"cited_paper":"/paper/2412.09413","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:e45c293ece7f6b2c87f1e664f9a62f443bd8544cd13722bd6a13b9e976b40498","observation_id":"35312d21-cb31-4f3e-8bda-dc2b7aae9586","resolution":{"observed_at":"2026-08-06T15:31:28.703711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-06T15:31:28.722892Z","title":"URL https: //doi.org/10.48550/arXiv.2501.19393","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-08T23:54:30.672141Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:28.722892Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:c746d8f2b8dd58cf24d73bbbed3999d8fa0563241b7c8566c8402012c0a06d11","observation_id":"5968c0c8-97cd-47c5-a1f7-f0cf736660e6","resolution":{"observed_at":"2026-08-06T15:31:28.722892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:31:28.728133Z","title":"Accessed: 2025-07-22","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-08T23:54:30.672141Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:28.728133Z"},"links":{"citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:47717dceb2eeefab382b8833cbf9890cc53587dc5c76eef8c4e4a4c2497b27e6","observation_id":"08e6a92c-a9df-4c47-970e-d32541be5277","resolution":{"observed_at":"2026-08-06T15:31:28.728133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2505.04881","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:31:29.177053Z","title":"URL https://doi.org/ 10.48550/arXiv.2505.04881","venue":null,"work_id":"ee5da4b4-0978-42f8-8ef3-b341356e0ff0","year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-08T23:54:30.672141Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:28.733587Z"},"links":{"citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:fc2b946d381c7f24b2770b39de5e5dd8ae7b91cab139f595aeeef4f632729d03","observation_id":"b823124c-5b7f-4289-abb1-10c120f67e88","resolution":{"observed_at":"2026-08-06T15:31:29.181641Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:31:28.738590Z","title":"Learning when to think: Shaping adaptive reasoning in r1-style models via multi-stage RL","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-08T23:54:30.672141Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:28.738590Z"},"links":{"citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:0dffd7b778e4de8065b7e297b263412f13eebba289ee3d59fc71c48ecef698f5","observation_id":"a077caf7-ac67-47b6-8c0f-5df45d927f99","resolution":{"observed_at":"2026-08-06T15:31:28.738590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2505.10832","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:31:29.104930Z","title":"URL https://doi.org/ 10.48550/arXiv.2505.10832","venue":null,"work_id":"5c19466c-a4f1-45cd-93b0-b52ab66426e7","year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-08T23:54:30.672141Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:28.743999Z"},"links":{"citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:e99a801d67f388b0df38ac2b29a6f51adc69cf3152cc33f61bf6f5653e306e52","observation_id":"5c5a568d-8990-4f95-a77f-857af800e004","resolution":{"observed_at":"2026-08-06T15:31:29.109749Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19250","last_updated":"2025-05-25T17:58:50Z","snapshot_observed_at":"2026-08-08T11:21:53.639135Z","submitted_at":"2025-05-25T17:58:50Z","title":"PATS: Process-Level Adaptive Thinking Mode Switching","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19250","snapshot_observed_at":"2026-08-06T15:31:28.748477Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-08T23:54:30.672141Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:28.748477Z"},"links":{"cited_paper":"/paper/2505.19250","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:50734f3e54517ac68130a78a2a6b7ce75ba3402a2b83d5089e06ae6debbeb0f6","observation_id":"3a5e8ee1-c570-490f-991a-e77582d4a762","resolution":{"observed_at":"2026-08-06T15:31:28.748477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2505.20258","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:31:28.999622Z","title":"URL https://doi.org/10.48550/arXiv.2505.20258","venue":null,"work_id":"2955954d-5267-4012-bd0a-37b796c40b0b","year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-08T23:54:30.672141Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:28.753494Z"},"links":{"citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:24640510d7be62b69ec71cb5fd4de928947b8fd830e695e859c4794edfeec08f","observation_id":"44edbed9-a921-4666-a661-fa77e446d855","resolution":{"observed_at":"2026-08-06T15:31:29.005466Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05315","last_updated":"2025-05-21T05:40:27Z","snapshot_observed_at":"2026-08-07T15:48:46.300308Z","submitted_at":"2025-05-08T15:01:06Z","title":"Scalable Chain of Thoughts via Elastic Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05315","snapshot_observed_at":"2026-08-06T15:31:28.757943Z","title":"URL https://doi.org/10.48550/arXiv.2505.05315","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-08T23:54:30.672141Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:28.757943Z"},"links":{"cited_paper":"/paper/2505.05315","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:66cfbe9a46925b466a3d8bdb5e097d5eded43f394a9eeb211394462fc090cf27","observation_id":"d4571c65-7566-4e78-958d-fde3db65fa6b","resolution":{"observed_at":"2026-08-06T15:31:28.757943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:31:28.763066Z","title":"URLhttps://doi.org/10.48550/arXiv.2504.15895","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-08T23:54:30.672141Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:28.763066Z"},"links":{"citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:663abe4de801df5f1d582b5b6589dc8a61383891a3786a796d43f4c3914ecd14","observation_id":"092df8c9-b248-4eca-91ce-1631970e42fb","resolution":{"observed_at":"2026-08-06T15:31:28.763066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-06T15:31:28.767651Z","title":"URLhttps://doi.org/10.48550/arXiv.2503.14476","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-08T23:54:30.672141Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:28.767651Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:ff1ae226dda00ea95e900e0c83a867cc610f39887a8cdfd8ef099f5950726434","observation_id":"a884b321-ad3e-4dd1-8214-a6eead52d5c3","resolution":{"observed_at":"2026-08-06T15:31:28.767651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T15:31:27.109371Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-08T23:54:30.672141Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:27.109371Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:e2696a8886f77fe6577894796e2cd43884777bd7beecac88f3191e7637c40e77","observation_id":"68b378fb-239c-496d-a120-d98241007ce4","resolution":{"observed_at":"2026-08-06T15:31:27.109371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11896","last_updated":"2025-05-25T13:39:29Z","snapshot_observed_at":"2026-08-07T15:44:24.427443Z","submitted_at":"2025-05-17T08:27:00Z","title":"AdaCoT: Pareto-Optimal Adaptive Chain-of-Thought Triggering via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11896","snapshot_observed_at":"2026-08-06T15:31:28.425196Z","title":"Adacot: Pareto-optimal adaptive chain-of-thought triggering via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-08T23:54:30.672141Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:28.425196Z"},"links":{"cited_paper":"/paper/2505.11896","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:17a1046ca148f7f087ef9c519d69c6802e57b9ff614699f70889ffb67fb9c38b","observation_id":"4b63b925-88cd-4732-a3ce-000e546a4658","resolution":{"observed_at":"2026-08-06T15:31:28.425196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21187","last_updated":"2025-02-01T07:57:37Z","snapshot_observed_at":"2026-08-01T16:43:44.704797Z","submitted_at":"2024-12-30T18:55:12Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21187","snapshot_observed_at":"2026-08-06T15:31:26.956879Z","title":"URL https://doi.org/10.48550/arXiv.2412","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-08T23:54:30.672141Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:26.956879Z"},"links":{"cited_paper":"/paper/2412.21187","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:321debc0271e7e2722be724cd4f9f6b74a03e81779e8673436a52553ef31f8ba","observation_id":"c7fbf56c-13cb-4258-ac3f-e4ae51ea39cc","resolution":{"observed_at":"2026-08-06T15:31:26.956879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-06T08:53:09.095000Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-06T15:31:26.625005Z","title":"URL https://doi.org/10.48550/arXiv.2503.04697","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-08T23:54:30.672141Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:26.625005Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:72bf91b070eff576d4b781ed56d37a96f5c521d0bcf9bdd1e351a6549bfbea85","observation_id":"4af2d2de-57bc-4c3d-b51b-d6bed7cff138","resolution":{"observed_at":"2026-08-06T15:31:26.625005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T23:54:30.672141Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2507.15844."}